LEARN

AI 凭什么选中这一篇

不同类型的储液器以不同速率流出,各自通过细孔漏斗后汇聚成被选中的流束,象征来源类型决定基础引用概率,写法决定同类中的选择
来源类型决定被引用的基础概率,写法决定同类来源里谁被选中 —— 两件事要分开投入

一句话说明

来源类型决定被引用的基础概率,写法决定同类来源里谁被选中 —— 两件事要分开投入。

公开统计给出的是来源类型的分布,实证研究给出的是写法的影响。两者合起来能解释大部分「为什么是它不是我」:来源类型决定了基础概率,写法决定了同类来源里谁被选中。

我们的判断

别把「常被引用的域名清单」当成待办事项。那些平台的高份额来自长期的社区与内容积累,直接去发帖不会复制它;能复制的是写法,以及在这些平台上真实参与。

01

来源类型的分布(会变,要标日期)

Semrush 2025 年 6 月对 150,000+ 条引用、5,000 个关键词的统计:Reddit 40.1%、Wikipedia 26.3%、YouTube 23.5%。

2026 年初的报道指出 YouTube 反超 Reddit 成第一社交引用源,且平台之间高度分化 —— 同一个来源在不同平台的权重可以差很远。所以任何「最常被引来源」清单都有时效性。

中文生态的结构完全不同:字节系内容、公众号、知乎、CSDN、百家号各占一块。英文那套清单在这里不成立。

02

写法的影响(有实证)

Princeton 论文(KDD 2024,GEO-bench 10,000 条查询)实测三种写法的效果:加统计数据、加引用来源、加引述,在可见度指标上带来 30–40% 的相对提升。

共同点是「可核对」:有具体数字、有出处、有可以直接摘走的句子。反过来,形容词堆砌与无出处的断言对被引用没有帮助。

03

流传广但证据不足的说法

「放一个 llms.txt 就能被收录」:Ahrefs 对 137,000 个域名的研究显示 2026 年 5 月 97% 的 llms.txt 零请求,Google 明确表示不使用。

「为 AI 专门改写内容 / 做内容分块」:Google 的官方指南把这两项列为不必要。

「结构化数据能提升 AI 可见度」:同一份指南称它对 AI 搜索非必需 —— 它是地板不是杠杆。

本页用到的数据

Reddit 40.1% · Wikipedia 26.3% · YouTube 23.5%

被引用最多的三类来源

出处Semrush,150,000+ 条引用 / 5,000 个关键词,2025-06

不足 5%

单一平台上最常被引域名的引用占比上限

出处Evertune,2 亿条 prompt,2026

30–40%

加统计数据 / 引用来源 / 引述后的可见度相对提升

出处Princeton GEO 论文,KDD 2024,GEO-bench 10,000 条查询,2024

资料出处

  1. [1]GEO: Generative Engine Optimization.Aggarwal 等,KDD 2024.2024

更新于 2026-08-10