机器流量将超人类1000倍?Cloudflare的"惊悚预测"背后,藏着一群伪装成AI爬虫的扫描器


大家好,我是Neo。

最近 SEO 圈被一个数字刷屏了:五年后,互联网上的非人类流量将是人类流量的 1000 倍。这话不是哪个网红博主说的,是 Cloudflare 的 CFO Thomas Seifert 在 2026 年第二季度财报电话会上亲口讲的,原话还有后半句——“人类将成为互联网上的四舍五入误差”(humans will be a rounding error on the internet)。

听起来很惊悚对吧?但紧接着,另一位 SEO 圈的老炮用自己网站的真实日志,给这个数字泼了一盆冷水:他那台小网站 24 小时内最大的“AI 爬虫”,根本不是来读他文章的——那是个伪装成 Common Crawl 的凭证扫描器,专门来偷 SSH 密钥的。

今天这篇文章,我就把这两件事放在一起给你捋清楚:机器流量暴增是真的,但数字背后藏着的真相,比“1000 倍”这个标题刺激多了。对咱们做独立站的人来说,这直接关系到你的服务器安全、带宽成本和 AI 时代的流量策略。

一、先看这个“1000 倍”是怎么来的

先交代背景。Cloudflare 2026 年 Q2 财报(8 月 6 日发布)确实亮眼:营收 6.961 亿美元,同比增长 36%。CEO Matthew Prince 在财报里大谈“Agentic Internet”(智能体互联网),说网络正在为机器对机器的流量做根本性重写。

但真正引爆话题的是 CFO 在电话会上那段话:

“如果当前趋势继续下去,我们认为五年内,非人类流量将达到人类流量的 1000 倍。人类会成为互联网上的四舍五入误差——不是因为人类流量下降了,而是非人类流量增长得太快。”

有意思的是,Seifert 自己都补了一句:“我过去每次都预测错,而且都是往低估的方向错。“Cloudflare 原本预测机器流量 2027 年超过人类流量,结果 2026 年 5 月就提前发生了。

二、机器流量占大头,这个事实是真的

在嘲笑“1000 倍”之前,得先说清楚:机器流量超过人类,这已经不是预测,是既成事实。

Cloudflare 官方博客《Content Independence Day, one year on》(2026 年 7 月)给出的数据很硬:

  • 2026 年,互联网流量首次跨过历史门槛:超过 50% 的流量已经是非人类的
  • 爬虫流量中,52% 用于 AI 训练(2026 年 6 月数据),而 2025 年春天这个数字还只有 22%
  • 混合用途爬虫(搜索+智能体+训练混着来)占了 36% 以上
  • 纯搜索爬虫的占比反而在持续萎缩

同一周,Cloudflare 的另一篇博客《The Agentic Internet》还抛出一个扎心的观察:大量行为良好的机器人,正在反复抓取根本没变过的页面,请求量以十亿计。用他们的话说:“海量的机器努力,却没有任何产出”——域名主为这些流量付了带宽费,机器人也花了力气,双方都是白忙。

所以“机器流量是主流”这件事,没有争议。有争议的是这些机器流量到底是什么、从哪来、想干什么。

三、Neo的实测拆解:最大的“AI爬虫”是个小偷

这才是这篇文章最值钱的部分。SEO 顾问 Slobodan Manic(No Hacks 创始人)看了 Cloudflare 的预测后,没有跟着喊口号,而是把自己网站 nohacks.co 的 AI 爬虫日志拉了出来,逐条看路径。

24 小时的数据:约 3000 次请求,其中三分之一是失败的,请求量比上一周期暴涨了 1000% 以上。

按爬虫分类看:CCBot(Common Crawl)1510 次、ChatGPT-User 375 次、ClaudeBot 296 次、Googlebot 245 次、PetalBot 107 次……

乍一看很正常,CCBot 是老牌非营利爬虫,它最多好像没毛病。但当他导出具体请求路径时,画风变了:

  • /id_rsa、/id_ecdsa、/private-key —— SSH 私钥
  • /ssl/localhost.key —— SSL 私钥
  • /.aws/config —— AWS 凭证
  • /key.json、/serviceAccountKey.json —— Firebase/Google 服务账号密钥
  • /actuator/configprops —— Spring Boot 配置泄露
  • /api/v1/env —— 环境变量
  • /.env —— 环境配置
  • /@fs/proc/self/environ —— 已知的路径穿越漏洞探测
  • 还有 /blog/wp-login.php —— WordPress 后台登录爆破(讽刺的是这网站从来没跑过 WordPress)

一百个路径、1028 次请求、传输了 6.7MB 数据,零跳转来源。最扎心的是:请求他真实文章的次数约等于零。

这根本不是爬虫,这是凭证扫描器——它在照着暗网上流传的“敏感文件清单”挨个扫,你的网站只是它循环列表里的一行。

Manic 还发现一个更值得警惕的细节:这个扫描器自称 CCBot,但真正的 Common Crawl 有公开的验证方法——真实 CCBot 流量来自官方公布的 IP 段,且反向解析的域名都以 crawl.commoncrawl.org 结尾。他因为套餐权限拿不到单请求 IP,没法实锤是谁在冒充,但他看到的流量在 Cloudflare 的 AI 爬虫面板里,就是记在 Common Crawl 名下的。

换句话说:一个盗号贼,穿着研究机构的马甲,在你网站的“AI 爬虫”统计里躺得明明白白,而安全日志里却查无此人。

四、更细思极恐的:扫描清单里多了两个新面孔

Manic 的日志里还藏着一个 2026 年才出现的新趋势:

  • /.mcp.json —— 被请求了 30 次
  • /.continue/config.json —— 被请求了 24 次

这两个是什么?/.mcp.json 是 MCP(Model Context Protocol,智能体工具调用协议)的服务器定义文件,/.continue/config.json 是编程助手 Continue 的配置文件。这两类文件里,通常就躺着 API Key 和访问令牌——因为你要让智能体帮你干活,就得把凭证写进去。

翻译成人话:**有人已经把“智能体配置文件”加进了暗网的标准密码扫描清单。**以前全网扫描器都在找 /.env,现在它们开始找你的 MCP 配置文件了。而这件事没人公告、发生得极快——很多人可能还没写完第一个 MCP 服务,扫描器清单就已经更新到位了。

这给我们独立站卖家提了个醒:**你在服务器上为 AI 工具准备的每一个配置文件,都是新的攻击面。**别以为装了 Cloudflare 就万事大吉——Cloudflare 挡的是流量攻击,挡不住有人拿着你泄露的凭证直接登进你的服务器。

五、Cloudflare 的“阳谋”:既当裁判,又当运动员

Manic 在文章里还点了一个很微妙的事,我觉得值得单独拎出来说:Cloudflare 的这套操作,商业上堪称教科书。

光 8 月第一周,Cloudflare 就干了这些事:

  1. 财报电话会上发布“机器流量 1000 倍”的预测(制造焦虑)
  2. 发博客量化“网络还有多少流量是人类的”(放大焦虑)
  3. 推出智能体就绪度扫描器,告诉你“你还没准备好”(售卖焦虑)
  4. 上线 AI 可见性产品,给你的 AI 流量打分(售卖解决方案)
  5. 推出让网站向智能体暴露工具的“桥”(新的收费点)
  6. 默认从 9 月开始屏蔽部分智能体,除非你主动改设置(制造新的二选一)

**每个产品单看都是合理的,但合在一起看:测量问题的是它,定义问题的是它,卖解决方案的还是它。**它既握着计量表,又握着阀门。

我不是说 Cloudflare 是坏人——Pay-per-crawl 是对的方向,“内容独立日”(让站长自主决定哪些机器能进)也是对的。但咱们作为使用者,得学会把它的“数字”和“叙事”分开看:流量数字可以信,商业叙事要打折扣。

六、独立站卖家该怎么做?五个实操建议

聊完现象,上干货。结合这次的事件,给咱们独立站卖家五个能立刻落地的动作:

1. 看路径,别看总量

Cloudflare 的 AI 爬虫面板、服务器访问日志里,别只盯“有多少 AI 流量”,要导出来看具体请求了哪些路径。Manic 就是这么发现问题的——如果只看总量,他的最大 AI 爬虫就是一个“尽职尽责的 Common Crawl”,完美的错觉。

2. 给爬虫日志加一层安全视角

这次事件最讽刺的一点:凭证扫描器在 AI 爬虫面板里看得清清楚楚,在安全日志里却完全隐形。因为安全日志只记录触发规则的事件,而你没拦它,它就“顺利通过、不留痕迹”。

所以建议:把 AI 爬虫流量和 WAF/安全日志对照着看。如果某个“AI 爬虫”在访问敏感路径(/.env、/.ssh、/wp-login.php 这类),不管它自称是谁,都该触发你的警觉。

3. 验证知名爬虫的真实身份

Common Crawl 官方公布了验证方法:真实 CCBot 来自官方 IP 段,反向解析域名以 crawl.commoncrawl.org 结尾。Googlebot 也有官方验证工具。在 Cloudflare 或服务器层面做一层“身份验证”,让冒名者无处遁形——这比单纯按 UA 字符串屏蔽靠谱得多,因为 UA 字符串谁都能伪造。

4. 清查你的敏感文件暴露面

把服务器上这些路径挨个 curl 一遍,看能不能从公网访问到:

  • /.env
  • /.ssh/id_rsa
  • /.aws/config
  • /.mcp.json
  • /.continue/config.json
  • /key.json、/serviceAccountKey.json
  • /actuator/configprops、/api/v1/env

凡是能被公网访问到的敏感文件,都是定时炸弹。 尤其是 MCP 配置文件——2026 年新加入扫描清单的“明星选手”,里面通常躺着 API Key。

5. 别被“1000 倍”吓到,也别被“50% 非人类”麻痹

这两个数字要组合着理解:机器流量确实是主流,这是现实;但机器流量里鱼龙混杂,有训练的、有检索的、有捣乱的、有偷东西的。对独立站来说,真正有价值的机器流量(AI 搜索引用你、智能体读到你的内容)只是其中一小部分。 优化策略应该围绕“有价值的机器流量”展开,而不是为所有机器流量服务。

Neo的解读

最后说点我的看法。

“机器流量 1000 倍”这个预测,大概率会成真——但它的含义跟 Cloudflare 想让你以为的不一样。Cloudflare 的叙事是“Agentic Internet 来了,你需要我们的全套工具”;而 Manic 的日志告诉我们,机器流量暴增里混着大量无价值的、甚至恶意的流量。

对独立站卖家,我的判断是:

  1. 机器流量是 AI 时代的“通货膨胀”。就像货币超发稀释购买力一样,机器流量暴增会稀释“流量”这个词的价值。以后看报表,不能只看流量数字,要看有效机器流量——有多少 AI 真的读懂并引用了你的内容。

  2. 安全已经成了 SEO 的一部分。以前我们讲网站安全,更多是“别被黑了影响排名”;现在安全直接关系到你的 AI 可见性——如果你的服务器被扫描器拖走了凭证、被人挂了马,别说 AI 引用,Google 都可能把你从索引里拿掉。安全日志 + 爬虫日志对照看,应该写进每个独立站卖家的月度巡检清单。

  3. 别把“马甲”当“身份”。UA 字符串、自称的爬虫名,都只是马甲。真正确认一个爬虫是谁,要看 IP、看反向解析、看行为模式。这件事上多花十分钟,可能省下的是服务器被入侵的代价。

  4. Cloudflare 的问题,恰恰是它的机会。它一边卖焦虑一边卖解药,但换个角度想:当机器流量真到 1000 倍的时候,能让站长对机器流量有选择权的平台,确实只有它。所以结论不是“别用 Cloudflare”,而是“用,但带着脑子用”。

机器流量的大潮已经来了,挡不住。但咱们可以做到:让有价值的机器进来,让偷东西的机器滚蛋,让 Cloudflare 的数字为我所用而不是被它贩卖焦虑。 这才是 2026 年独立站卖家的生存姿势。

好了,今天就聊到这。如果你在日志里发现了什么奇怪的东西,欢迎来跟我聊聊——说不定下一篇就写你的案例。