AI正在"读"你的网站,但它"读懂"了吗?50个头部网站审计,暴露独立站最该补的技术课


大家好,我是Neo。

最近两年,AI可见性成了SEO圈最热的话题。很多团队忙活了一年多:清理代码、给内容分块、让AI爬虫更容易抓取。如果你的品牌开始定期出现在AI生成的回答里,或者上了AI Overviews,你可能觉得AI可见性的仗已经赢了一大半。

但SALT.agency联合创始人Reza Moaiandin最近公布的一项审计,给这种乐观情绪泼了一盆冷水。他带着团队审计了50个全球头部网站(横跨零售、SaaS、旅游、媒体、金融),结论是:大部分网站让AI“找到”了自己,但几乎没有一个让AI真正“读懂”了自己。而且有近三分之二的网站,把“哪些AI爬虫能访问哪些内容”这个问题,完全交给了运气。

这篇文章,我把这份审计的核心框架和数据拆给你:AI就绪度的三层模型、27个审计元素、那些大牌网站的真实得分,以及我们独立站卖家能从中抄到什么作业。

一、先纠正一个认知:AI可见性 ≠ 被引用

大多数市场团队对“AI可见性”的定义,就是“提及和引用”——用户问AI一个跟你品类相关的问题,你的品牌有没有机会出现在回答里。

Reza说,这种定义是旧SEO思维的延续:“被排名、被找到、被点击”,只是搬到了一个全新的搜索形态里。但AI时代的可见性不只是让品牌和链接出现在正确答案面前,还包括AI如何理解你的信息、以及如何与你的网站互动。

他打了个比方:教一个六岁孩子“读”书,和教他“理解”书,是两码事。孩子能流利地读出课文,不等于他读懂了;读懂了,也不等于他能把知识用起来——照着食谱做菜、自己写故事、顺着问题继续查资料。

阅读只是理解的第一步,理解只是行动的第一步。 AI对你的网站,也是一样。

二、AI就绪度三层框架

基于这个思路,SALT.agency开发了一套AI就绪度审计框架,分三个层次:

第一层:可检索性(Retrievability)——AI能顺利抓取和解析你的内容吗?

这是“阅读”层,也是最基础的一层,跟传统技术SEO重合度最高。比如ARIA标签、robots.txt里的AI爬虫指令。大多数团队已经在优化这一层了,因为它直接关系到引用和品牌提及。

第二层:归因与含义(Attribution & Meaning)——AI能确定你的页面在讲什么、归谁所有吗?

这是“理解”层。AI怎么知道页面上的哪个数字是产品价格、哪个是只有会员才能享受的折扣价?它怎么判断品牌和作者到底是谁、是不是这个领域值得信任的权威?它怎么区分文章讲的是“捷豹汽车”还是“某个叫捷豹的足球俱乐部”?

如果AI对你的内容有更高的理解置信度,有两件事会同时发生:被相关AI回答引用的概率上升,同时被错误解读、错误展示品牌和产品的风险下降。

第三层:代理能力(Agency)——AI代理能访问你网站的能力、替你完成任务吗?

这是“行动”层,也是区分“AI复述你的信息”和“AI代表用户跟你的业务交互”的分水岭。比如完成一笔交易。

整个框架一共包含27个审计元素:第一层11个、第二层3个、第三层13个。每个元素按“行业标准成熟度”分级——Established(已成熟)、Emerging(新兴)、Frontier(前沿)。

三、50个网站的审计结果:差距比想象中大

SALT.agency用仪器化浏览器,在同一天(2026年6月12日)抓取了所有50个网站的实时HTTP响应、渲染后的DOM、原始服务器HTML和机器发现端点,然后对12个Established信号按0/1/2打分。

第一层(可检索性):大家做得还行,但没到及格线。 只有3个网站低于50%。听起来不错?但这个层次跟传统技术SEO重叠最多,很多元素本来就是现成的。

关键发现一:70%的网站首页有JSON-LD结构化数据。 35/50,其中32个拿到了满分2分。但反过来说——仍有近三分之一的大牌网站,首页连一条JSON-LD都没有。 要知道,Schema是AI理解“这是产品、这是价格、这是卖它的品牌”的关键。缺了它,AI只能靠猜,猜错了就是错误的回答,甚至是幻觉。

关键发现二:只有5/50的网站实施了Cloudflare的Content Signals Policy。 这是robots.txt里的一组指令,精确说明爬虫在搜索索引、实时AI查询、模型训练这些场景下,分别可以用你的内容做什么。有了它,你的AI策略就不再是“全屏蔽”或“全放行”的二选一,而是可以精细化控制。

第二层(归因与含义):分数断崖式下跌。 层与层之间的分差非常明显,这是审计里最扎心的部分——大多数网站在“让AI读懂自己”这件事上,几乎没做任何事。

第三层(代理能力):基本全军覆没。 Agentic浏览器和Agentic商务2025年底才出现,13个相关协议里只有2个被归类为Established。在48个可测试的站点中,46个得了零分。 就连做得最好的airbnb.com和vercel.com,也只实现了OAuth授权服务器元数据(各得50%),OAuth受保护资源元数据都没做——而这两样配合起来,AI才能跟你的网站安全地交互。

四、最值得玩味的三个反例

反例一:Expedia——“贴了营业招牌,却忘了开门”。

Expedia发布了一份堪称“写给AI的情书”的llms.txt文件,用漂亮的排版、精炼的文案,把品牌的权威身份和核心能力写得明明白白。结果呢?它的整体AI就绪度得分只有33.3%,是全队列最低分之一——没有JSON-LD结构化数据、没有声明站点地图、只有四分之一的内容是服务端渲染。

这就像在橱窗上贴了“营业中”的招牌,却忘了开门。Reza的点评很到位:llms.txt写得再好,也只是意图信号,替代不了其余的技术功课。

反例二:亚马逊——29.2分,但这是故意的。

amazon.com的整体得分只有29.2%,第一层甚至低于50%。但Reza明确说:我不认为亚马逊是忽略了AI搜索。 跟BBC一样,亚马逊在robots.txt里明确屏蔽了几乎所有AI爬虫——这是设计,不是疏漏。BBC、CNN、The Guardian这些媒体,商业模式依赖用户访问网站,屏蔽AI爬虫完全可以理解。

反例三:eBay、Tripadvisor——最“挑剔”的一批。 它们对AI爬虫做了选择性处理:想让哪些AI爬虫访问就放行,不想让哪些就屏蔽。airbnb和cloudflare没有正式屏蔽,但给大部分主流AI爬虫写了具体访问规则。

而50个网站里有29个(近三分之二),对AI代理访问既没屏蔽也没放行,robots.txt里没有任何AI相关指令——AI爬虫能访问什么、怎么解读、怎么用,全凭运气。

五、必须说清楚:robots.txt指令不是“法律”

在你去改robots.txt或加llms.txt之前,Reza提醒了几个残酷的事实:

robots.txt里的AI指令只是“偏好声明”,不是硬性规则,遵守是自愿的。 GPTBot、ClaudeBot、Google-Extended、Applebot-Extended这些主流爬虫大体上会尊重你的指令,但出了这个圈子,情况就不那么乐观了——有些爬虫可能照样抓你的内容。

Content Signals的强制力更弱。 守规矩的爬虫可以选择遵守,但没有技术机制能强迫它们执行。

llms.txt目前依然只是“意图信号”。 它还是个没有被规范机构认可的标准,SALT的框架把它归为Frontier元素,不参与评分——但50个网站里已经有11个发布了llms.txt,说明行业对“给AI一份内容导览图”的热情是真实的。

一句话总结:这些手段都不是万能的,但SEO什么时候有过“保证有效”的东西? 优化从来都是尽可能多强化几个信号,而不是指望一招制胜。

六、Neo的解读:独立站卖家能抄到什么作业?

这份审计对普通独立站卖家,最值钱的是它把“AI技术优化”从玄学变成了清单。我帮你提炼成可执行的动作:

第一,先给自己做一次“三层体检”。

  • 第一层:你的robots.txt有没有针对主流AI爬虫(GPTBot、ClaudeBot、Google-Extended、Applebot-Extended、PerplexityBot)的明确指令?是“全屏蔽”还是“全放行”?有没有中间态?
  • 第二层:首页和核心页面有没有JSON-LD?实体、价格、品牌这些关键信息是不是机器可读?有没有entity map?
  • 第三层:这一步对大多数卖家还很远,但可以先知道它的存在——UCP、ACP这些协议正在路上,现在关注就是先机。

第二,哪怕决定屏蔽,也要“有意识地屏蔽”。 审计里得分最低的几个网站(亚马逊、BBC),恰恰是做出了明确选择的那批。最危险的姿势不是屏蔽AI,而是既没屏蔽也没放行、对AI爬虫毫无策略。你至少要知道:你的内容正在被哪些爬虫读取,你希不希望它们读取。

第三,别迷信llms.txt。 去年llms.txt刚火的时候我就写过文章提醒过:它有价值,但它是锦上添花,替代不了结构化数据和站点地图。Expedia这个案例是最好的反面教材——先补齐基础功课,再考虑加分项。

第四,Content Signals Policy值得研究。 如果你用Cloudflare,这个机制能让你对“索引、实时AI回答、模型训练”分别设权限,比“全屏蔽/全放行”精细得多。目前只有5/50的头部网站用上了——这是少有的、独立站可以领先大站的领域。

第五,心态上接受一个现实:AI读你的网站这件事,不由你决定。 你可能已经在被读了——通过默认设置、遗留的robots.txt、为另一个时代写的安全策略。但内容终归是你的,你仍然可以控制AI如何访问、如何解读、如何与你的品牌交互。

最后说句实在的:Reza这篇审计最扎心的一句话是——“提及和引用从来就不是全部,它们只是真正AI可见性的第一层。“你的品牌可能经常被引用,但依然会因为信息不准确、或者AI对你的信息不够自信而流失客户。

AI搜索的竞争,已经从“被看见”卷到了“被理解”。你的网站准备好被AI读懂了吗?

我是Neo,一个专注独立站SEO的博主。拿这份清单给你的网站做个体检,有结果了欢迎回来交流。