Google 内部工程师爆料:Googlebot 抓取限制大揭秘,15MB 只是个传说?
大家好,我是 Neo。
做独立站 SEO 的朋友们,估计对 Googlebot(Google 的爬虫)都不陌生。我们每天都在想方设法让 Googlebot 多爬一点、爬深一点,好让我们的页面更快被收录,排名更高。
最近,Google 搜索团队的两位大咖 Gary Ilyes 和 Martin Splitt 在他们的播客节目《Search Off The Record》里,聊了一些非常硬核的内容,直接颠覆了外界对 Googlebot 抓取限制的很多认知。
特别是关于那个传说中的 “15MB 抓取限制”,真相可能和你想象的完全不一样。今天我就来给大家深度解读一下,这些信息对我们做独立站运营到底有什么启示。
1. Googlebot 根本不是一个“程序”
首先,Martin 和 Gary 抛出了一个重磅炸弹:Googlebot 其实并不是一个独立的程序。
在 Google 内部,他们有一套巨大的、基于云的抓取基础设施(SaaS 平台),内部代号叫 “Jack”(虽然他们说名字不重要,但我们姑且这么叫)。
我们熟知的 Googlebot,其实只是这个“Jack”平台的一个 客户(Client)。
什么意思呢? 就好比你用打车软件,你是乘客(Google Search),你发单给平台(Jack),平台派车去接人(抓取网页)。 除了 Google Search,Google 的其他产品比如 Google Ads(广告)、Google Shopping(购物)、Google News(新闻),甚至最新的 Gemini AI,都是这个平台的客户。它们都共用这一套抓取基础设施。
Neo 的解读: 这意味着 Google 的抓取能力是非常强大的,而且是高度标准化的。无论你是做 SEO 还是投广告,你的网站面对的底层抓取机制其实是一样的。这也解释了为什么有时候你的广告落地页体验会影响 SEO,因为底层数据可能是通用的。
2. 15MB 限制:是默认值,但不是铁律
之前 SEO 圈子里一直流传着一个说法:Googlebot 最多只抓取网页的前 15MB 内容。如果你的网页 HTML 代码超过 15MB,后面的内容就会被截断,Google 就看不到了。
Gary Ilyes 证实了这一点:是的,基础设施层面确实有一个 15MB 的默认限制。 这是为了保护 Google 的服务器不被撑爆。
但是! 重点来了:
这个限制是可以被覆盖(Override)的,而且经常被覆盖。
Gary 透露了一个惊人的细节: 对于 Google Search(谷歌搜索) 来说,为了追求效率和速度,他们实际上把这个限制 下调到了 2MB!
没错,你没看错。对于普通的 HTML 网页,Google Search 可能只抓取前 2MB 的内容。如果你的网页代码臃肿到超过 2MB,重要的内容(比如正文、核心关键词)放在了最后,那可能真的就“白写了”。
3. 为什么会有不同的限制?
既然默认是 15MB,为什么搜索只用 2MB?而其他情况又允许更大呢?
这就好比去自助餐厅。
- Google Search(搜索) 像是去吃快餐,追求的是“快”和“准”。它需要在几毫秒内处理完页面,提取出标题、正文、链接。如果每个网页都下载 15MB,互联网都要被它堵塞了,Google 的服务器也受不了。
- PDF 文件:Gary 提到,如果是抓取 PDF 文件,限制可能会放宽到 64MB 甚至更多。因为 PDF 本身就很大,而且 PDF 通常包含了丰富的信息,值得花时间去下载。
- 图片:同理,高清图片很容易超过 2MB,所以图片搜索的爬虫配置肯定会允许更大的文件大小。
Gary 举了个例子:HTML 的官方标准文档有一个版本是单页的,高达 14MB。Google 根本不会去抓取那个单页版本,因为处理起来太耗费资源了。他们会选择去抓取拆分好的、单独的小章节页面。
Neo 的解读: 这对我们独立站卖家的启示非常直接:给网页“减肥”至关重要! 很多 Shopify 主题或者 WordPress 插件会塞入大量的内联 CSS 和 JS 代码,甚至把图片转成 Base64 编码塞在 HTML 里,导致 HTML 文件体积暴增。 请务必检查你的网页源代码大小(View Source),确保核心内容(产品描述、价格、评论)尽可能靠前,并且 HTML 整体大小最好控制在 2MB 以内。
4. Google 的爬虫是“SaaS”服务
Martin Splitt 总结说,Google 的抓取系统不是一块“铁板(Monolithic)”,而是一种灵活的服务(Service)。
这意味着,抓取配置是可以动态调整的。 比如,如果 Google 发现你的网站更新频率很高,或者内容质量极高,它可能会在内部调整对你网站的抓取参数。反之,如果你的网站全是垃圾代码,它可能就会用最节省资源的配置(比如更严格的大小限制)来对待你。
总结:独立站卖家该怎么做?
听完 Google 工程师的爆料,Neo 给大家总结几条实操建议:
- 关注 HTML 体积:虽然“硬限制”是 15MB,但为了 SEO 效果,请把你的网页 HTML 大小控制在 2MB 以内。
- 重要内容前置:把 SEO 标题、H1 标签、产品核心描述尽量放在 HTML 代码的前面。不要让大量的 CSS/JS 代码把核心内容挤到几千行之后。
- 优化资源加载:不要在 HTML 里直接嵌入大段的 Base64 图片代码,这会极大地浪费抓取配额。
- 理解差异:Googlebot 抓取 HTML、图片和 PDF 的标准是不一样的。你的产品手册(PDF)大一点没关系,但产品页面(HTML)一定要轻量。
Google 的技术在不断进化,但核心逻辑永远没变:高效地获取最有价值的信息。我们要做的,就是帮 Google 省事,Google 才会给我们流量。
希望这篇文章对大家优化独立站有帮助!
参考资料:
- Google Shares More Information On Googlebot Crawl Limits
- Search Off The Record Podcast