同一个数字,7种答案:AI爬虫的「抓取-回馈比」到底能不能信?


大家好,我是Neo。

先说一个有点黑色幽默的事实:过去13个月里,同一家公司的同一个指标,被引用出了7个不同的版本,最高和最低差了差不多30倍。而每一个版本,都被郑重地写进了会议PPT、报价单,以及“要不要屏蔽AI爬虫”的决策里。

这个指标叫抓取-回馈比(crawl-to-refer ratio):AI平台从你网站抓走多少页,换回多少个访客。关于Anthropic,被公开引用过的数字有:70,900:1、38,000:1、23,951:1、11,122:1、10,300:1、4,580:1、2,237:1——全部标注来自Cloudflare。其中有两个数字声称统计的是同一个月,彼此差了17倍。

有意思的地方不在于“有人在撒谎”。恰恰相反,Cloudflare把这个指标的算法完整公开了,还主动写了自己方法的局限。问题出在:一个指标从发布者手里传到决策者手里,中间会掉东西。 今天这篇,我把这个指标拆开给你看:它怎么算、为什么会散成这样、以及独立站到底该怎么用它——而不是被它用。

一、先把公式说清楚

Cloudflare在2025年7月上线这个指标(在Radar里展示),算法简单到可以背下来:

分子:某个平台相关User Agent发起的、返回 Content-type: text/html 的请求总数。 分母:返回HTML、且请求头 Referer 里带有该平台域名的请求总数。 最后归一化成“1个回馈”。

翻译成人话:它抓了你7万页,只给你送回1个访客,比值就是70,900:1。

它当年发布的表格里,2025年6月19–26日那一周,Anthropic是70,900:1,而Mistral是0.1:1——意思是Mistral每抓1页,反而送回来10个访客。同一张表,两个极端差了70万倍。

这个指标之所以能火,是因为它击中了所有人的痛感:传统搜索爬虫是“吃你一次,给你送回访客”,这套交换支撑了整个开放网络的商业模式。AI直接在原地把答案吃掉,吃不减、送回来的基本没了。比起“我们又亏了”这种情绪,一个能写进报表的比值显然更有战斗力。

二、四个分母,穿同一件外套

下面这段是核心。比值 = 分子 ÷ 分母,而这个分母里套着四个不同的东西,几乎没人在转述时带走它们。

1. 统计窗口

首发用的是2025年6月19–26日,一周。另一篇同月的文章里,Anthropic是73,000:1,OpenAI 1,700:1,Google大约14:1。同一家公司,同一个月,换一个窗口,数字就换了。

Cloudflare自己还披露过:Google的比值一周之内波动了19.4%,原因只是6月24日前后Googlebot抓取量下降。换句话说——一次爬虫排期决策,就能让“公开数据”变动五分之一。

今天你在网上能同时搜到季度值、月度值、滚动28天值、单周值,它们被并排引用,看起来是同一个东西。

2. 数了谁(口径)

Cloudflare说明过:同一个平台旗下,负责“训练语料”的爬虫和负责“响应用户提问”的爬虫是不同的User Agent,但在分析里被归到同一个名字下。

这两件事性质完全相反:一个只吃不吐,一个随时可能给你带来被引用的机会。混在一起算,得到的既不是前者也不是后者。更麻烦的是:有的公司把爬虫按用途拆开跑,有的把用途合并,所以“用这个比值对比Google”这个动作,本身在结构上就不成立——你算的两边根本不是同一类东西。

Cloudflare自己的分用途数据也能说明这个口径有多不稳:2025年7月1–28日,AI爬虫里约80%的抓取来自训练用途;到了2026年6月,训练降到52%,而“混用途”类别反而占了36%以上。

3. 分母不是“回馈”,是“主动报备过的回馈”

这是最要命的一条,而且Cloudflare在首发文章里就自己写清楚了:Claude的原生App(也包括其他平台的App)送来的流量不带 Referer 头,而分母只统计带Referer的请求。所以这个比值“可能高估了失衡程度,但高估多少不清楚”。

“不清楚”,是原话。

有第三方分析估计,可能高达70.6%的AI流量不带referrer(Link Building Journal 2026年的整理),而更值得玩味的是:这部分“看不见的流量”转化率约为10.21%,远高于可见AI流量的1.66%和自然搜索的0.15%。也就是说——最值钱的那部分访客,恰好是这个指标看不见的。

更糟的是误差的方向性:每一个没被记录的回馈都会让比值变大,没有任何因素会让它变小。 一个只有单向偏差的指标,适合看极端值,不适合做细微判断。

4. 收集边界(算不算)

Cloudflare明确把来自Google自家ASN的推荐流量排除了,理由是Chrome的预测性预取(speculation rules)不算“人在消费内容”。这个判断站得住脚,但它是一个人为决定:换一个分析师,用不同口径处理预取流量,会得到一个完全不同的Google数值——而且两边都没错。

三、为什么这事值得较真:它已经在改你的生意

如果这只是一个“数据不够严谨”的行业八卦,不值得写一篇。问题是,这个比值正在被用来做不可逆的决定:

  • 出版商用它决定放行哪些AI爬虫、屏蔽哪些;
  • 市场团队用它论证“AI推荐流量根本不值得做”;
  • 更麻烦的是,它已经产品化了:Cloudflare Radar里有,2026年8月微软也给Clarity的Bot Analytics加上了“AI Scrape-to-Referral Ratio”卡片。当一个数字出现在仪表盘上、紧挨着爬虫名字,团队很容易把它当成对某个爬虫的判决——可它不是。

两个必须知道的后果:

后果一:排名会翻转。 在截至2026年7月21日的滚动28天窗口里,Mistral以3,389:1“超过”了Anthropic的2,237:1;而换用Cloudflare Radar另一段切法(6月数据),Anthropic又是第一。同一张网络、不同的切片,“最贪的平台”就换人了。

后果二:它测的是场地,不是比赛。 有一份分析总结得很精彩:在同一个引擎、同一个窗口下,两个品牌即使AI引用量差4倍,抓取-回馈比也会报出几乎相同的数字。因为它主要由引擎侧的架构和缓存策略决定,跟你的内容质量关系不大。那你能拿它做行业对标吗?不能——没有哪家机构发布过“同引擎下不同网站的比值差异”,因为那个差异基本不存在。

反过来也成立:2026年Anthropic的比值从70,900:1掉到2,000:1以下,主要不是“网站主更会赚回馈了”,而是这些公司自己加了缓存、上了会外链的消费级产品。同样的数字在变,原因却不在你身上。

四、它真正有用的三个场景

我不是说这指标一文不值。对正确的用途,它其实很好用:

场景 用法 注意
成本核算 服务器、带宽、缓存穿透是真金白银。有出版商公开说,屏蔽未授权爬虫后CDN带宽账单每月省了约42,000欧元 这类计算该由财务/技术负责人看,不是营销KPI
授权议价 内容授权谈判里,抓取量是双方都认的、能拿上桌的数 它的本质是个“定价数字”,不是“管理数字”
异常监控 某个爬虫半夜爬全站、把动态页刷爆,日志里一眼看得出 用自己日志,别用网络平均值

但要记住一句话:它回答的是“这个爬虫拿了多少”,而不是“这个爬虫值不值得放行”。 后者才是生意问题。

五、独立站卖家的操作清单:把三个问题分开问

“要不要屏蔽这个爬虫”其实藏着三个完全不同的问题,一个比值一个都答不了:

1. 成本问题 → 看自己的服务器日志。 按实际负载限速、限频,这是可逆、可度量的动作。别用网络平均值替你做决定。

2. 可见性问题 → 跑你自己的prompt集。 看你在ChatGPT/Gemini/Perplexity里被引用的份额,而不是referral。AI原地答完不点链接,本来就是稳态,不是失败。一个把“没被引用的抓取”和“被引用了但没点击”算成同等损失的分母,分不出“没名气的品牌”和“被AI当答案的领导者”。

3. 权限问题 → 用robots.txt的“用途层”。 训练和检索分开授权,这是唯一能既保住被引用机会、又拒绝纯训练的路径。想用一把锁同时锁住两个用途,代价通常是两个都丢。

再送你一个零成本的过滤动作。以后谁甩给你一个数字,先问三句话:这个周期是多长?口径把什么合并在一起了?收集的边界在哪里? 三个答案如果当场拿不出来,那他也不算给了你一个数字——只是给了你一个长得像数字的东西。

Neo的解读

每次有新的中间商插进你和你的用户之间,第一个出现的指标,永远是中间商算起来最便宜的那个——而那个指标描述的,往往是中间商的生意,不是你的。

我们回顾一下历史:服务器日志、referrer、impressions、平均排名……每一个当年都是“别人的会计口径”,被我们当成了自己的记分卡。抓取-回馈比是这一长串里的最新一个,而且不会是最后一个。

对独立站,我自己的做法是三条:

  • 别把“没有可信的行业比值”当成不作为的借口。 你自己的日志就是最好的数据源,带宽和服务器负载是实打实能优化的。
  • 也别把“某个比值很大”当成封锁一切的理由。 你封掉的可能正是那条会引用你的检索通道。抓取是成本,缺席是账单——而且是不通知、无法对账的那种。
  • 真正该盯的指标只有一组: 在你的目标提问里,AI引用你、提到你、把你当答案来源的次数。这个数字难看但真实,而且它是唯一会因为你把内容做好而变化的数字。

最后一句给做内容的人:这个行业正在把“数值焦虑”做成产品卖给你。当有人递给你一个数,你要能说出它的窗口、口径和边界;说不出,你买的不是洞察,是一个形状像数字的东西。