DOJ文件首次揭秘:刷点击到底能不能上排名?真相和你想的不一样。


大家好,我是Neo。

做SEO的兄弟姐妹们,应该都听过这个老问题:点击量到底是不是Google的排名因子?

这事儿在SEO圈已经吵了二十多年。有人坚信“刷点击就能上排名”,所以满世界找点击农场;有人觉得“点击影响排名”是江湖传说,纯粹瞎搞;还有人付费给那些卖“CTR优化”的工具,每个月烧着钱也不知道有没有用。

最近有个大新闻让这个问题终于有了官方答案——美国司法部(DOJ)2025年9月的反垄断案备忘录意见书把Google搜索的内部机制扒了一层皮。结合一份2006年Google就申请了的点击专利,我们今天可以非常清晰地告诉你:

点击不是直接排名因子。但点击影响排名。这两句话不矛盾。

听起来绕口?没关系,今天我把这事儿一次说清楚。

二十年的争论,DOJ用一个词就解决了

先看DOJ这份9月文件里最关键的一段话。Google请的专家证人,马萨诸塞大学阿默斯特分校的James Allan教授作证时,用了一个核心概念:

“信号有不同复杂度。有’原始信号’(raw signals),比如点击次数、网页内容、查询中的词汇。”

这里的关键词就是 raw signal(原始信号)

所谓“原始信号”,就是搜索系统能直接观测到、但还没有经过解读、还没用于训练数据的最底层数据点。

DOJ文件把以下几样东西都归类为“原始信号”:

  • 点击数据(Clicks)
  • 网页内容(Content)
  • 人工评分员打分(Human Rater Scores)
  • 搜索查询词(Search Queries)

注意这个分类——你可能没意识到,Google的“质量评估员”打的分用户的点击,在Google系统里是一个层级的东西。两者都是原始数据,需要进一步处理后才能影响排名。

文件里还有一句更狠的:

“在光谱的另一端,是创新的深度学习模型。深度模型在海量数据集中发现并利用规律。它们以高昂代价提供独特能力。”

也就是说,点击是一头(最底层的原始数据),深度学习模型是另一头(高度复杂的最终系统)。中间隔着无数个数据处理环节。

Neo的解读:很多做独立站的朋友被各种SEO工具洗脑,觉得点击就是排名信号。这个理解错在哪?错在忽略了中间的处理流程。点击就像石油,最终决定汽车性能的不是石油本身,而是炼油厂、发动机和无数个工程系统。直接看石油,看不出汽车跑多快。

“原始信号”具体是怎么被处理的?

DOJ这份文件里多次提到一个名字:Navboost

很多自媒体讲到Navboost时都喜欢说“Google用Navboost根据用户点击给网站排名”。但DOJ文件里,Navboost被描述为衡量受欢迎度(popularity)的系统

“通过用户意图和反馈系统(包括Navboost/Glue)测量的受欢迎度…”

注意,这里用词是 “measure popularity”(衡量受欢迎度),不是“直接排名”。这是两个完全不同的概念。

整个数据处理链路大概是这样的(DOJ文件描述的简化版):

原始点击数据
  ↓ 去除噪声(垃圾流量、机器人)
  ↓ 聚合(按query-URL对累加)
  ↓ 训练AI模型(RankEmbed、RankEmbedBERT等)
  ↓ 生成质量/相关性信号
  ↓ 与其他信号(链接、新鲜度、用户位置等)融合
  ↓ 最终排名

也就是说,从你点一下鼠标,到这个动作真正影响某个网站的排名,中间要走至少5-6个数据处理阶段。每一阶段都有对垃圾、操纵的过滤。

Neo的解读:这个流程对独立站运营特别重要。它意味着——

  1. 你刷100次点击,根本到不了影响排名的那个层级,因为前面就被去噪了
  2. 但是真实用户长期、稳定地点击你的网站,就会成为AI训练数据的一部分,让AI更“看好”你的内容
  3. 所以“做点击”和“做品牌”是两件事。前者无效,后者有效。

“70天搜索日志”被各种自媒体误读

DOJ文件里还有一句被疯狂引用的话:

“70天搜索日志加上人工评分员生成的分数”

很多SEO博主拿着这句话大做文章,“哇Google用70天点击数据排名!”

但你把上下文完整看完,就发现根本不是那么回事:

“RankEmbed和它的后续版本RankEmbedBERT是排名模型,依赖两个主要数据来源:[已涂黑]%的70天搜索日志,加上人工评分员生成的、Google用来衡量自然搜索结果质量的分数。”

看到了吗?这70天数据是用来训练RankEmbedBERT这个AI模型的,不是直接喂给排名引擎的。

更关键的是,这70天数据:

  • 聚合数据(不是个人单次点击)
  • 训练数据(不是直接排名输入)
  • 经过RankEmbedBERT处理后,模型再基于自然语言分析对网页排名

这就好像:你给厨师送了70天的食材,厨师做成菜单,菜单决定餐厅卖什么。食材不直接等于餐厅生意,菜单才是

RankEmbed到底是什么?

DOJ文件给了RankEmbed一个清晰定义:

“RankEmbed模型本身是一个基于AI的深度学习系统,具有强大的自然语言理解能力。这使得模型即使在查询缺少某些词汇时,也能更高效地识别要检索的最佳文档。”

更让人惊讶的是这个:

“RankEmbed使用的训练数据是早期排名模型的1/100,但提供了更高质量的搜索结果。”

1/100的数据,更好的结果

这个数据点告诉我们什么?它告诉我们Google已经从“靠数据量赢”切换到“靠模型架构赢”了。RankEmbedBERT用的是BERT这种Transformer架构(和ChatGPT背后的技术同源),它能从少量优质数据中提取丰富的语义关系。

也就是说,未来Google对你内容的判断,越来越接近“读懂你说的是什么”,而不是“统计你被点了几次”

Neo的解读:这对独立站内容策略有巨大启示。如果Google在用越来越少的数据训练越来越聪明的模型,那么你的内容要在“语义质量”上赢,而不是在“关键词密度”或“点击数据”上赢。一篇真正解决用户问题的深度文章,可能比10篇关键词堆砌的水文有效得多。

2006年的老专利:点击早就不是直接排名因子

很多人不知道,Google在2006年就申请了一个点击相关的专利,叫做:

《Modifying search result ranking based on implicit user feedback》(基于隐式用户反馈修改搜索结果排名)

这个专利的发明者们做了一件特别巧妙的事情:他们严格区分了“信号的产生”和“排名行为”本身

专利里是这么说的:

“排名子系统可以包含一个排名修饰引擎,它使用隐式用户反馈来导致搜索结果的重新排名。用户对搜索结果的选择(点击数据)可以被追踪,并转换为一个’点击分数’(click fraction),用于重新排名未来的搜索结果。”

注意这个**“click fraction”(点击分数)——它不是单次点击,而是一个聚合的统计量**。

技术上叫LCIC(Long Click divided by Clicks,长点击除以总点击)分数。“Clicks”是复数,因为决策依据是多次点击的总和(聚合),不是任何单次点击。

这个分数是怎么算出来的?三步:

1. 求和(Summation) 对一个特定的“查询-文档对”(query-document pair),把所有加权点击加起来。

2. 归一化(Normalization) 用上面这个总和除以总点击数。

3. 统计平滑(Statistical Smoothing) 对结果应用“平滑因子”,确保对稀有查询的单次点击不会扭曲结果——这就是反作弊机制

专利里给的公式:

LCC_BASE = #WC(Q,D) / [#C(Q,D) + S0]

其中:
WC(Q,D) = 该query-URL对的加权点击总和
C(Q,D) = 该query-URL对的总点击数
S0 = 平滑因子

这个公式的关键含义:

如果有人故意刷点击(“稀有查询”+“单次点击”模式),平滑因子S0会把这些操纵性点击的影响压到几乎为零

也就是说,早在2006年,Google就在专利层面把“刷点击”防住了。今天那些卖“CTR优化”的工具,做的就是2006年Google就已经知道怎么防的事情。

Neo的解读:花钱买刷点击工具的兄弟,醒醒吧。这个生意20年前就在专利层面被否决了。如果你的SEO预算还在这上面烧,立刻停。把钱花在能产生真实长点击(用户来到你网站后停留、阅读、转化)的方向上,比如:内容深度、页面体验、品牌信任度。

那“长点击”是什么?为什么重要?

专利里把点击分了几类:

  • Short Click(短点击):用户点进去,几秒钟就跳出
  • Medium Click(中等点击):用户停留一段时间
  • Long Click(长点击):用户深度阅读、互动
  • Last Click(最后点击):用户结束搜索任务的那次点击

Google对这些点击的“加权”是不一样的。

简单理解:用户点你的网站,又快速回到搜索结果换别人的——这是负面信号;用户点你的网站,长时间停留甚至完成搜索任务——这是正面信号

但再次强调:这都是聚合后的统计量,不是单次点击。你需要持续、稳定的真实用户长点击才有意义。

这对独立站运营有什么实际指导?

讲了这么多技术细节,回到最实际的问题:这些机制对我做独立站到底有什么用?

我总结5条非常具体的执行建议:

1. 立刻停止任何“刷点击”操作 不管是Google搜索的人工刷点击,还是用机器人模拟点击。2006年的专利就告诉你Google会把这些操纵性数据用平滑因子压到接近零。这是纯粹的浪费钱。

2. 把SEO预算转移到“长点击”驱动 你的目标不是让用户“点进来”,而是让用户点进来后不想走。这意味着:

  • 加载速度(3秒内首屏完成)
  • 内容结构(有标题、目录、清晰段落)
  • 视觉舒适度(合适的字号、行距、配色)
  • 内容深度(解决用户实际问题,而不是凑字数)

3. 重视“语义匹配”而不是“关键词匹配” RankEmbedBERT是BERT架构的深度学习模型,它读得懂语义。你写“how to choose waterproof shoes for hiking”和“hiking waterproof shoes selection guide”,对它来说基本是一个意思。与其堆关键词,不如把一个主题真正讲透

4. 警惕付费“AI可见度”和“CTR优化”工具 如果某个工具承诺给你“提升CTR推动排名”,记住:Google把点击当原始信号处理,要经过去噪、聚合、训练、信号生成、融合排名等多层处理。任何声称能“直接调控CTR影响排名”的工具,要么没理解原理,要么在卖你幻觉

5. 建立长期品牌流量,不只盯关键词 品牌词搜索→直接点击你的网站→深度浏览→转化,这条路径产生的所有信号(包括点击)质量都是最高的。这是为什么大品牌的SEO总是更稳——他们的品牌词流量在持续给Google系统“高质量训练数据”。

Neo的解读:每一次SEO圈“内幕揭秘”出来,最大的赢家其实是那些一直在做正确事情的人——做高质量内容、追求真实用户体验、建设品牌信任。每一次“机制揭秘”,都只是再次证明捷径不存在。

总结一下

这篇内容信息量比较密集,我帮大家梳理一下要点:

  1. DOJ 2025年9月的反垄断文件,把Google的内部机制扒开了——明确说点击、人工评分、内容、查询词都是“原始信号”,不是直接排名因子。

  2. 原始信号要经过多层处理才影响排名:去噪→聚合→训练AI模型→生成质量信号→融合排名。中间至少5-6个环节。

  3. Navboost不是“用点击排名”系统,而是“衡量受欢迎度”的系统。这两件事不一样。

  4. “70天搜索日志”被严重误读——它是用来训练RankEmbedBERT这个AI模型的,不是直接喂给排名引擎的。

  5. RankEmbed用1/100的数据,做出更好的结果——Google已经在转向“语义理解”而不是“统计计数”。

  6. 2006年的老专利就证明刷点击没用——平滑因子S0机制20年前就把操纵性点击防住了。

  7. 真正有用的是“长点击”和“聚合信号”——只能通过真实的用户体验和内容质量来获得,没有捷径。

希望这篇分析能帮你节省那些花在“刷点击工具”上的钱,把SEO预算花到真正有用的地方。如果你还在为独立站SEO策略迷茫,欢迎关注我,我们一起把这个赛道做明白。

下篇见。