LEARN
AI 凭什么选中这一篇

一句话说明
来源类型决定被引用的基础概率,写法决定同类来源里谁被选中 —— 两件事要分开投入。
公开统计给出的是来源类型的分布,实证研究给出的是写法的影响。两者合起来能解释大部分「为什么是它不是我」:来源类型决定了基础概率,写法决定了同类来源里谁被选中。
我们的判断
别把「常被引用的域名清单」当成待办事项。那些平台的高份额来自长期的社区与内容积累,直接去发帖不会复制它;能复制的是写法,以及在这些平台上真实参与。
来源类型的分布(会变,要标日期)
Semrush 2025 年 6 月对 150,000+ 条引用、5,000 个关键词的统计:Reddit 40.1%、Wikipedia 26.3%、YouTube 23.5%。
2026 年初的报道指出 YouTube 反超 Reddit 成第一社交引用源,且平台之间高度分化 —— 同一个来源在不同平台的权重可以差很远。所以任何「最常被引来源」清单都有时效性。
中文生态的结构完全不同:字节系内容、公众号、知乎、CSDN、百家号各占一块。英文那套清单在这里不成立。
写法的影响(有实证)
Princeton 论文(KDD 2024,GEO-bench 10,000 条查询)实测三种写法的效果:加统计数据、加引用来源、加引述,在可见度指标上带来 30–40% 的相对提升。
共同点是「可核对」:有具体数字、有出处、有可以直接摘走的句子。反过来,形容词堆砌与无出处的断言对被引用没有帮助。
流传广但证据不足的说法
「放一个 llms.txt 就能被收录」:Ahrefs 对 137,000 个域名的研究显示 2026 年 5 月 97% 的 llms.txt 零请求,Google 明确表示不使用。
「为 AI 专门改写内容 / 做内容分块」:Google 的官方指南把这两项列为不必要。
「结构化数据能提升 AI 可见度」:同一份指南称它对 AI 搜索非必需 —— 它是地板不是杠杆。
本页用到的数据
Reddit 40.1% · Wikipedia 26.3% · YouTube 23.5%
被引用最多的三类来源
出处:Semrush,150,000+ 条引用 / 5,000 个关键词,2025-06
不足 5%
单一平台上最常被引域名的引用占比上限
出处:Evertune,2 亿条 prompt,2026
30–40%
加统计数据 / 引用来源 / 引述后的可见度相对提升
出处:Princeton GEO 论文,KDD 2024,GEO-bench 10,000 条查询,2024
资料出处
- [1]GEO: Generative Engine Optimization.Aggarwal 等,KDD 2024.2024
更新于 2026-08-10