警惕!你可能正在失去 55% 的 AI 搜索流量:Neo 深度解读 AI 爬虫新变局


大家好,我是 Neo。

最近在独立站圈子里,大家都在讨论一个问题:“AI 爬虫太疯狂了,把我的服务器都爬崩了,要不要一刀切全部屏蔽?”

我的建议通常是:冷静,别把“财神爷”和“小偷”一起拒之门外。

最新的数据正在印证我的观点。Hostinger 最近发布了一份重磅研究报告,揭示了一个惊人的趋势:网站站长们正在大规模“拉黑” OpenAI 的训练机器人,但却在悄悄向 AI 搜索机器人敞开大门。

这背后的逻辑是什么?作为中国出海卖家,我们该如何在这场“AI 数据保卫战”中,既保护自己的知识产权,又不错过 AI 时代的流量红利?

今天,Neo 就带大家深入解读这份报告,并给出实操建议。


一、 数据的真相:从 84% 暴跌至 12%

Hostinger 分析了超过 500 万个网站的 660 亿次请求,发现了一个极具戏剧性的分化现象。

1. 训练机器人(The Takers)遭到大规模封杀

OpenAI 的 GPTBot(主要用于抓取数据来训练 ChatGPT 模型)的覆盖率,从之前的 84% 断崖式下跌到了 12%

这意味着,绝大多数网站站长已经意识到:把数据免费送给 AI 公司训练模型,对我没有任何好处,甚至还要贴上服务器带宽费。 于是,大家纷纷在 robots.txt 里写下了拒绝指令。

2. 搜索机器人(The Givers)正在崛起

与此同时,OpenAI 的 OAI-SearchBot(主要用于 ChatGPT 的实时搜索功能)的覆盖率却攀升到了 55.67%

Neo 的解读: 这个数据反差非常有意思。它说明全球的网站管理员们变得越来越“精明”了。大家不再盲目恐惧 AI,而是开始通过价值交换来做决定:

  • 你拿我的数据去练模型(GPTBot)? 不行,那是“白嫖”。
  • 你拿我的数据去回答用户提问并给我带链接(OAI-SearchBot)? 可以,这是“合作”。

二、 为什么你必须区分这两类机器人?

很多卖家朋友在设置 robots.txt 时,习惯性地用一句 User-agent: * Disallow: / 或者把所有带 “GPT” 字眼的 User-Agent 全部屏蔽。

在大模型时代,这可能是一个昂贵的错误。

1. 训练机器人 (Training Bots)

  • 代表角色:GPTBot, ClaudeBot, CCBot (Common Crawl)。
  • 行为模式:大口吞噬你的网站内容,存入它们的数据库。
  • 后果:你的内容变成了它们模型的一部分。用户在 ChatGPT 里问问题,AI 用你的知识回答,但通常不会给用户链接点击你的网站。
  • Neo 建议坚决屏蔽。除非你是维基百科做公益,否则没必要免费贡献你的独家内容。

2. 助手机器人 (Assistant/Search Bots)

  • 代表角色:OAI-SearchBot, Applebot, Bingbot。
  • 行为模式:当用户在 SearchGPT 或 ChatGPT 搜索相关话题时,实时抓取你的网页。
  • 后果:AI 会总结你的内容,并在答案中引用你的链接(Citations)。
  • Neo 建议适度放行。这是未来的 SEO(我们称之为 AEO,AI 引擎优化)。如果你屏蔽了它们,你在 AI 搜索的世界里就是“隐形”的。

三、 独立站卖家的“智能守门”策略

Hostinger 的数据告诉我们,“中间路线”是目前的最佳策略。即:屏蔽训练,放行搜索。

既然我们知道了原理,那么具体该怎么做?Neo 给大家准备了一份 robots.txt 的作业,大家可以根据自己的情况抄录。

推荐的 robots.txt 配置:

# 1. 屏蔽 OpenAI 的模型训练爬虫 (拒绝白嫖)
User-agent: GPTBot
Disallow: /

# 2. 屏蔽 Anthropic (Claude) 的爬虫
User-agent: ClaudeBot
Disallow: /

# 3. 屏蔽 Common Crawl (很多 AI 模型都用它的数据)
User-agent: CCBot
Disallow: /

# 4. 放行 OpenAI 的搜索爬虫 (获取 SearchGPT 流量)
User-agent: OAI-SearchBot
Allow: /

# 5. 放行 Google 的爬虫 (保证传统 SEO)
User-agent: Googlebot
Allow: /

Neo 的解读: 这个配置的核心逻辑是 Block Training, Allow Search

  • 对于 OAI-SearchBot,OpenAI 官方文档明确表示,它负责控制内容是否出现在 ChatGPT 的搜索结果中。
  • 对于 GPTBot,它只负责训练。屏蔽它不会影响你在搜索结果中的排名。

四、 总结:拥抱变化,但要守住底线

AI 时代,流量的入口正在从 Google 搜索框向 ChatGPT 的对话框迁移。

Hostinger 的报告不仅仅是一组冷冰冰的数据,它代表了互联网的一种新契约:内容创作者不再无偿供血,而是要求公平的流量回报。

作为独立站运营者,我们不需要恐慌,也不需要对抗。我们需要做的是:

  1. 保护资产:屏蔽 GPTBot 等训练爬虫,保护你的原创图片、描述和博客内容。
  2. 拥抱流量:开放 OAI-SearchBot,优化你的网站结构(Structured Data),让 AI 更容易读懂你,从而在未来的 AI 搜索中占据一席之地。

未来已来,不要让你的独立站成为 AI 时代的“信息孤岛”。


参考资料: