你可能会说:
- “谷歌是怎么知道我网站里写了什么的?”
- “为什么我把链接发到微信里,卡片上只有网址没有摘要?”
它是什么
爬虫顺着链接一页页访问网站,把拿到的内容交给搜索引擎建索引,或者用来生成链接预览卡片、喂给 AI 模型。
关键是它读到了什么。谷歌的爬虫会运行 JavaScript 再看页面,但渲染要排队,也只对它愿意花资源的页面做;社交平台生成分享卡片、不少其他搜索引擎和 AI 爬虫,通常只读第一次返回的 HTML。
所以最稳妥的做法是:让第一次返回的 HTML 里就有正文、标题和描述。
打个比方
像一个只拆包看一眼、不开火的美食评论家:你寄去半成品,他只会记下"一包原料"。
在这个网站里
想知道爬虫从本站拿到了什么,最简单的办法是在终端运行 curl -s https://space.felixwithai.com/vibecoding——返回的内容,就是它读到的第一张 HTML。
容易搞混的地方
常见误解
谷歌会执行 JavaScript,所以单页应用没问题
正确理解
谷歌会,但要排队、不保证;分享卡片和很多其他爬虫不会。别把"被收录"押在对方愿意帮你渲染上。
常见误解
robots.txt 能挡住所有爬虫
正确理解
它只是一份约定,守规矩的爬虫才会遵守。真正不想公开的内容,要靠登录和权限来保护。
你可以这样告诉 AI
复制下面这段,贴给你的 AI
请告诉我:一个不执行 JavaScript 的爬虫请求这个页面时,拿到的 HTML 里有哪些正文?用 curl 演示给我看。
接下来去哪
接着看
在这些课里出现
相关的真实事故