PLATFORMS

DeepSeek 的引用机制

一句话说明

在 DeepSeek 上被引用的前提是内容进入它的可检索范围,并在同一问题下比其他来源更值得引用。

要在 DeepSeek 里被提到,前提是内容进得了它的可检索范围,并且在同一个问题下比别的来源更值得引用。从业者的引用源占比研究普遍指出 DeepSeek 偏重新闻媒体加知乎这类 UGC。它没有公开专用的检索爬虫标识,也不逐条展示来源,所以可见度只能靠固定问题集的答案抽样来测。

我们的判断

没有官方爬虫标识不等于不抓取 —— 抓取行为要从服务端日志里找,不要因为 robots 里没有对应 UA 就当它不存在。

01

机制里哪些是公开的

从业者的引用源占比研究普遍指出 DeepSeek 偏重新闻媒体加知乎这类 UGC。它没有公开专用的检索爬虫标识,也不逐条展示来源,所以可见度只能靠固定问题集的答案抽样来测。

平台侧的份额与规模:DeepSeek 在国内 AI 原生应用里月活位居前列,做中国市场时与豆包同属必做。

除 Google 之外,各家平台都没有公开过「引用算法」。所有可执行的打法都来自相关性研究与从业者实测,读到任何「平台确认」的说法都要先看出处。

02

引用是长尾分布,不是赢家通吃

实测显示即便最常被引的域名,在单一平台上的份额也很少超过 5%。这意味着目标应该是稳定进入来源列表。试图垄断它并非目标。

同一个问题在不同时间、不同地区拿到的来源列表会变,所以单次观察不能作为判断依据,要多次采样看分布。

本页用到的数据

不足 5%

单一平台上最常被引域名的引用占比上限

出处Evertune,2 亿条 prompt,2026

40.1%

Reddit 占 AI 答案引用来源的份额

出处Semrush,150,000+ 条引用 / 5,000 个关键词,2025-06

资料出处

  1. [1]GEO: Generative Engine Optimization.Aggarwal 等,KDD 2024.2024

更新于 2026-08-06