Common Crawl发布AI可见性手册:你的网站真的进了AI的训练数据吗?


大家好,我是Neo。

今天这个话题,可能比“AI 搜索引用”更底层、更致命,但 99% 的独立站老板压根没听说过它。

你的网站,可能根本没有进入 AI 的训练数据。 也就是说,ChatGPT、Claude、Gemini 这些模型在“出厂前”就不知道你的品牌存在,无论你在搜索端优化得多好。

这件事的源头,是一个叫 Common Crawl 的非营利组织。它每个月抓取 20 多亿个网页,然后免费送给任何人。几乎所有主流大模型(GPT、Claude、Llama、Mistral……)的训练数据都从这里来。Mozilla 审计了 2019-2023 年间发布的 47 个大模型,64% 都以某种形式使用了 Common Crawl 的数据;GPT-3 的训练权重里,大约 60% 是过滤后的 Common Crawl 数据。

换句话说:如果 AI 不用联网搜索就知道你的品牌,大概率就是因为你在 Common Crawl 里。

而上周发生了一件大事:Common Crawl 官方发布了一份《AI 可见性审计》(The AI Visibility Audit)手册,手把手教站长怎么确认自己是否存在于训练数据里。Search Engine Journal 的作者 Suganthan Mohanadasan 读完直呼“这全是手工活,太累了”,干脆把它自动化成了一个免费工具。

今天我就把这件事拆开揉碎,讲讲:CCBot 是什么、你的网站在不在里面、为什么 2025 年 7 月之后建的站几乎必然被屏蔽,以及 5 步自查清单。

一、先搞清楚:AI 模型是怎么“认识”你的网站的?

传统 SEO 的逻辑是:收录(Index)→ 排名(Rank)。Googlebot 抓你的页面,进索引,然后按相关性排名。

AI 时代变成:训练(Train)→ 检索(Retrieve)。AI 模型不是实时搜索你的网站,它“出厂前”就把整个互联网(的很大一部分)读进脑子里了。

而这个“互联网快照”,主要就是 Common Crawl 提供的。

它的工作流程是这样的:

  1. CCBot(Common Crawl 的爬虫)每月抓取约 20 亿网页,2026 年 7 月的这一次抓了 21.4 亿页
  2. 抓下来的原始快照免费公开
  3. 各大实验室不直接用原始数据,而是加工成过滤版本:C4、RefinedWeb、RedPajama、Dolma、FineWeb 等等——市面上你能叫出名字的训练集,几乎全是从 Common Crawl 派生出来的
  4. 大模型在这批数据上训练

所以你的内容进入模型的路径是:CCBot 抓取 → Common Crawl 存档 → 过滤训练集 → 模型训练。每一步都会过滤掉一批网站。你的页面只要在第一步就被拦下,后面全白搭。

一个关键细节: 每一步都有容量门槛。2025 年 3 月起,Common Crawl 把单页存储上限从 1 MiB 提到了 5 MiB。以前超过 1 MiB 的页面会被截断或丢弃,现在宽容多了,但依然不是无限。

二、CCBot 到底能不能读你的网站?现实很残酷

手册里最扎心的一句话是:

“你的 CDN 可能正在悄悄屏蔽 CCBot,而你自己根本不知道,导致你的页面永远进不了训练大多数模型的那个档案库。”

这不是危言耸听,数据摆在这里:

  • BBC 的 robots.txt 屏蔽了 14 个主流 AI 爬虫中的 13 个。CCBot 去请求许可,读到拒绝,转身就走。地球上最大的新闻网站之一,在训练数据管道里“不存在”。
  • BuzzStream 的统计显示,75% 的英美顶级出版商在主动屏蔽训练爬虫。
  • Chris Green 在 LinkedIn 上贴出的 HTTP Archive 数据:大约 49.2 万个网站在 robots.txt 里提到了 CCBot,其中约 95% 是为了屏蔽它。
  • 最狠的是:自 2025 年 7 月 1 日起,Cloudflare 默认屏蔽所有新域名的 AI 爬虫——你不用做任何事,只要域名是在 Cloudflare 上建的,AI 爬虫默认进不来。Cloudflare 的托管 robots.txt 又覆盖了 380 万个从来没自己写过 robots.txt 的域名。
  • 各种广告插件也在往 robots.txt 里加屏蔽列表。

2026 年,一个 CCBot 屏蔽,大概率不是你的决定,而是平台默认值。

这对独立站卖家意味着什么?你花了几万块做内容、做外链、做页面优化,结果 AI 模型“出厂前”根本没见过你。 等用户去问 ChatGPT“哪个品牌的某某产品好”,模型只能从它训练数据里那些(往往是竞争对手的)信息作答——因为你压根不在里面。

三、Common Crawl 官方手册 + 免费的自动化工具

Common Crawl 自己也知道这个问题。他们的团队在过去一年跑遍全球 SEO 大会,发现所有人都在问同一个问题:

“为什么一个在 Google 排名很好的页面,ChatGPT、Gemini、Claude、Perplexity 却完全看不见它?”

于是他们写了《AI 可见性审计》——一份 18 页的免费指南,告诉你 AI 系统到底怎么发现内容、为什么“训练数据收录”现在就像一个排名因素,以及如何用免费工具在 90 分钟内跑完一套可重复的 5 项检查。

手册的思路很清晰,5 项检查从“最决定性”到“最战略性”:

  1. CDN/防火墙检查:用 CCBot 的 user-agent 请求你的首页,对比浏览器请求的响应。如果你的 CDN 或 WAF 在边缘层就挑战了 CCBot(而不是按 robots.txt 放行),那 robots.txt 改什么都没用。手册原话:先检查 CDN 面板,再碰服务器。
  2. 索引 API 检查:用 Common Crawl 的索引服务器搜你的域名,看每个月被抓了多少页面。
  3. Web Graph 排名:Common Crawl 每个月发布全网链接图,里面有 Harmonic Centrality(谐波中心性) 和 PageRank 两个指标——这直接决定 CCBot 的抓取优先级。你的域名排名越低,被抓得越少。
  4. Sitemap 对照:把你的 sitemap 和实际被抓取的 URL 做 diff,找出“应该被收录但没收录”的页面,形成工作清单。
  5. 存档副本检查:拉出 CCBot 实际存档的字节,提取文本,和你线上 HTML 对比。注意两边都是在 JavaScript 执行之前读取的——因为 CCBot 从不执行 JS。

听起来很专业?对,全是手工活,需要会写脚本、会查 API、会看数据。SEJ 的作者 Suganthan 就是被这份手册“折磨”之后,把它自动化了——做出了 Common Crawl Visibility Checker(免费、免注册、一个域名一个域名地查,数据直接来自 Common Crawl 官方存档)。

这个工具有几个亮点:

  • robots.txt 历史回溯:Common Crawl 会存每次抓取前读到的 robots.txt。工具按月对比历史副本,diff AI 爬虫规则——一个屏蔽是从哪天开始的,一目了然。而且它能识别屏蔽模板:Cloudflare 托管 robots.txt 有独特的版权注释,Squarespace 默认值有专属签名,一下就能认出“这是平台干的,不是你自己干的”。
  • 实时探测:除了历史,它还以 CCBot/2.0 身份实时请求你的首页,跟普通浏览器和对照组爬虫并排对比,能抓住“robots.txt 看着干净、但防火墙在边缘挑战爬虫”的隐蔽情况。如果真是边缘挑战,卡片上会显示防火墙厂商,并给出 CCBot 的官方 IP 段。
  • 下次抓取时间提示:告诉你下一次 crawl 的日期——因为今天做的修复,要下个月的数据里才能看到。
  • Sitemap 对照:抓你的 sitemap 和实际被抓 URL 对比。作者的站:7 月 crawl 里 97 个页面只被抓了 42 个,剩下的 55 个直接导出成 CSV 变成工作队列。
  • 单页历史:可以粘贴具体页面 URL,看它在过去一年里的被抓记录。

作者自己说,他的站从去年 8 月被抓 2 个页面,涨到今年 7 月被抓 55 个页面——“这是有人给我画过的最捧场的图”。

四、一个必须警惕的细节:CCBot 不执行 JavaScript

这一点我要单独拎出来强调,因为太多独立站栽在这上面。

CCBot 抓取时不执行任何 JavaScript。你的页面如果是纯前端渲染(SPA、React/Vue 水合后才有内容),CCBot 看到的可能只是一具空壳。而前端“空壳”是会被训练集过滤掉的。

手册里给的建议非常直接:内容必须在服务端渲染(SSR)。这也是为什么我一直劝独立站老板:别整那些花里胡哨的前端框架,SEO 友好优先。Googlebot 现在能执行 JS 了,但 CCBot 不会,训练数据的“标准”比搜索索引更保守。

另外还有两个反直觉的点:

  1. CCBot 不按你想象的方式浏览网站。它不“逛”你的站,它沿着互联网上实际存在的链接走。作者发现自己的一个页面是被一条 newsletter 链接带进去的,还带着早已弃用的 ConvertKit 追踪参数被存了档。所以别只在站内搞链接,外部世界指向你的链接,才是 CCBot 的入口。
  2. 抓取优先级取决于“谐波中心性”。Common Crawl 不是均匀抓取每个网站,而是按域名在全网链接图中的中心度决定抓取频率。被“深度嵌入网络核心”的站点链到,比几十个孤立站点的外链有用得多。外链拓扑比外链数量更重要——这个话题我之前的文章讲过,这里又验证了一次。

五、5 步自查:90 分钟确认你的网站在不在 AI 训练数据里

把手册 + 工具整理成一份可执行的清单,老板们可以直接照着做:

步骤 做什么 怎么判断
1 打开 Common Crawl 索引服务器,搜你的域名 看每月被抓页面数;0 页 = 问题严重
2 用 CCBot/2.0 的 user-agent curl 你的首页 对比浏览器响应;被 403/挑战 = CDN 在屏蔽
3 查你的 robots.txt 是否明确允许 CCBot 没有规则 = 默认允许;有 Disallow = 拦截
4 拉一份存档里的页面副本,看文本是否完整 空壳 = 前端渲染问题,必须 SSR
5 用免费检查工具查 robots 历史 找出屏蔽开始的月份,对照是否换了 CDN/装了插件

Neo的解读:

第一,“屏蔽 AI 爬虫”这件事,很多独立站是被动背锅的。 2025 年 7 月 1 日之后在 Cloudflare 上新建的域名,默认就屏蔽 AI 爬虫。你什么都没做,模型就“不认识你”。我去年写过一篇关于 AI 爬虫屏蔽的文章(《警惕!你可能正在失去 55% 的 AI 搜索流量》),当时很多老板还在纠结“要不要屏蔽 OpenAI 爬虫”,现在剧情反转了:不是你主动屏蔽,是平台替你屏蔽了,而你还蒙在鼓里。 赶紧去查,尤其是用 Cloudflare 的站。

第二,训练数据可见性,正在变成一种“出厂设置”级别的排名因素。 传统 SEO 的公式是“收录 + 排名”,AI 时代是“训练 + 检索”。如果模型训练时没有你,你连被检索的资格都没有。这不是 GEO 玄学,是物理规律。而且注意:这不是“AI 搜索引用”那种可以靠 prompt 面板监测的东西,它更底层、更难在短期内逆转——今天修复,要下个月 crawl 才有数据,再等模型重训。所以越早动手越好。

第三,关于“要不要让 AI 爬虫进来”,我的立场一直很明确:让你的内容被训练数据收录,本身不损失什么。 内容就是你的“简历”,AI 爬虫读了你的页面,你只是把信息“给出去”,但换来的是品牌在 AI 心智中的存在感。真正该防的是抄袭和滥用,那是版权问题,不是 robots.txt 问题。BBC 屏蔽训练爬虫是它的内容战略选择——你有 BBC 的护城河吗?没有的话,别学它。

第四,这个免费工具本身,就是 2026 年 SEO 行业的缩影。 官方出方法论,社区出自动化工具,数据全部开放。谁先跑通“检查 → 修复 → 验证”的闭环,谁就抢占了 AI 可见性的先手。信息差正在消失,执行差正在拉大。

最后提醒一句:这个工具检查的是 CCBot 一个爬虫,AI 可见性还有 GPTBot、ClaudeBot 等一票爬虫。作者的网站还配了一个 AI Crawler Access Checker 可以一并查。但 Common Crawl 的特殊之处在于——GPTBot 抓你的页面,只服务于 OpenAI 一家;CCBot 抓一次,服务于所有拿开放互联网训练的人。 这才是它值得优先处理的原因。