← 术语图鉴

术语 · 网页与浏览器

爬虫

Web Crawler · 也叫 搜索引擎蜘蛛 / Bot / 网络爬虫

自动访问网页、读取内容的程序;搜索引擎、社交平台的链接预览、AI 模型都靠它了解你的网站。

你可能会说:

  • “谷歌是怎么知道我网站里写了什么的?”
  • “为什么我把链接发到微信里,卡片上只有网址没有摘要?”

它是什么

爬虫顺着链接一页页访问网站,把拿到的内容交给搜索引擎建索引,或者用来生成链接预览卡片、喂给 AI 模型。

关键是它读到了什么。谷歌的爬虫会运行 JavaScript 再看页面,但渲染要排队,也只对它愿意花资源的页面做;社交平台生成分享卡片、不少其他搜索引擎和 AI 爬虫,通常只读第一次返回的 HTML。

所以最稳妥的做法是:让第一次返回的 HTML 里就有正文、标题和描述。

打个比方

像一个只拆包看一眼、不开火的美食评论家:你寄去半成品,他只会记下"一包原料"。

在这个网站里

想知道爬虫从本站拿到了什么,最简单的办法是在终端运行 curl -s https://space.felixwithai.com/vibecoding——返回的内容,就是它读到的第一张 HTML。

容易搞混的地方

常见误解

谷歌会执行 JavaScript,所以单页应用没问题

正确理解

谷歌会,但要排队、不保证;分享卡片和很多其他爬虫不会。别把"被收录"押在对方愿意帮你渲染上。

常见误解

robots.txt 能挡住所有爬虫

正确理解

它只是一份约定,守规矩的爬虫才会遵守。真正不想公开的内容,要靠登录和权限来保护。

你可以这样告诉 AI

复制下面这段,贴给你的 AI

请告诉我:一个不执行 JavaScript 的爬虫请求这个页面时,拿到的 HTML 里有哪些正文?用 curl 演示给我看。

接着看

  • 页面元信息——写在 HTML 头部、给程序看的页面说明:标题、描述、分享图,决定搜索结果和分享卡片长什么样。
  • 站点地图——一份列出网站所有页面地址的清单文件,交给搜索引擎当作抓取目录。

在这些课里出现

相关的真实事故