第二课 · 完全新手向
搜索引擎搜的不是互联网,
是它的「藏书库」
按下回车的那零点几秒里,Google 并没有当场翻遍全网——它查的是自己提前抓取、整理好的索引。理解「抓取 → 索引 → 排名」这条流水线,后面所有 SEO 知识都有了挂靠点。
1 三步流水线
从网页到搜索结果,要过三关
1抓取 Crawl
发现 + 下载爬虫(如 Googlebot)沿着链接在网上「爬行」,发现新页面并下载内容。
2索引 Index
解析 + 入库解析页面内容,判断值不值得收录,存进一个巨大的数据库——索引。
3排名 Rank
检索 + 排序用户搜索时,从索引里挑出相关页面,按大量信号排序后展示。
三关是串联的:没被抓取就谈不上收录,没被收录就永远不会出现在结果里。以后你的页面「搜不到」,也按这个顺序排查。
2 爬虫与链接
链接,是爬虫唯一的路
爬虫从已知页面出发,把页面里的链接加入「待抓取队列」,再一个个访问。下面是一个 7 页的小网站——亲手当一回爬虫:
注意右上角那个孤岛页:没有任何链接指向它,爬虫永远走不到。给页面「修路」(内部链接,第 12 课)和「递地图」(sitemap,第 14 课),都是为了解决这个问题。
3 索引
抓到了 ≠ 收录了
抓取回来的页面还要过一道质量关。这几类页面即使被抓取,也可能进不了索引:
- 内容太薄:没几句话、没有独立价值的页面;
- 大面积重复:和站内或站外其他页面高度雷同;
- 被主动排除:页面标了 noindex(「请不要收录我」,第 13 课细讲)。
想知道自己的页面有没有被收录?两个办法:在 Google 直接搜 site:你的域名,或用官方工具 Google Search Console(第 24 课专讲)。
新站没被收录,最常见的原因
通常不是「被惩罚了」,而是:没有任何外部链接指向你 + 没提交 sitemap——爬虫压根不知道你存在。先修路、再递地图,然后给它一点时间。
4 排名
排序的依据:相关性、质量、体验、权威
同一个搜索,索引里可能有几百万个候选页面。排序时会综合大量信号(业内常说有几百个),大方向包括:
- 相关性:内容和这次搜索对得上吗?(关键词、意图——阶段二)
- 质量:内容可靠、完整、有独立价值吗?(内容、E-E-A-T——阶段三)
- 体验:打开快不快、移动端好不好用?(技术——阶段四)
- 权威:有多少可信的地方提到你?(链接、品牌——阶段五)
没有人知道完整的权重清单
Google 不公开算法细节,从业者只能靠官方文档和实验推断——所以对「保证第一名」的承诺要保持警惕。好消息是:大方向是公开的,就是这门课接下来五个阶段要讲的全部内容。
5 随堂自测