第二课 · 完全新手向

搜索引擎搜的不是互联网,
是它的「藏书库」

按下回车的那零点几秒里,Google 并没有当场翻遍全网——它查的是自己提前抓取、整理好的索引。理解「抓取 → 索引 → 排名」这条流水线,后面所有 SEO 知识都有了挂靠点。

1 三步流水线

从网页到搜索结果,要过三关

1抓取 Crawl
发现 + 下载

爬虫(如 Googlebot)沿着链接在网上「爬行」,发现新页面并下载内容。

2索引 Index
解析 + 入库

解析页面内容,判断值不值得收录,存进一个巨大的数据库——索引。

3排名 Rank
检索 + 排序

用户搜索时,从索引里挑出相关页面,按大量信号排序后展示。

三关是串联的:没被抓取就谈不上收录,没被收录就永远不会出现在结果里。以后你的页面「搜不到」,也按这个顺序排查。

2 爬虫与链接

链接,是爬虫唯一的路

爬虫从已知页面出发,把页面里的链接加入「待抓取队列」,再一个个访问。下面是一个 7 页的小网站——亲手当一回爬虫:

注意右上角那个孤岛页:没有任何链接指向它,爬虫永远走不到。给页面「修路」(内部链接,第 12 课)和「递地图」(sitemap,第 14 课),都是为了解决这个问题。

3 索引

抓到了 ≠ 收录了

抓取回来的页面还要过一道质量关。这几类页面即使被抓取,也可能进不了索引:

想知道自己的页面有没有被收录?两个办法:在 Google 直接搜 site:你的域名,或用官方工具 Google Search Console(第 24 课专讲)。

新站没被收录,最常见的原因
通常不是「被惩罚了」,而是:没有任何外部链接指向你 + 没提交 sitemap——爬虫压根不知道你存在。先修路、再递地图,然后给它一点时间。
4 排名

排序的依据:相关性、质量、体验、权威

同一个搜索,索引里可能有几百万个候选页面。排序时会综合大量信号(业内常说有几百个),大方向包括:

没有人知道完整的权重清单
Google 不公开算法细节,从业者只能靠官方文档和实验推断——所以对「保证第一名」的承诺要保持警惕。好消息是:大方向是公开的,就是这门课接下来五个阶段要讲的全部内容。
5 随堂自测

点一点、填一填,检查你会了没