LEARN

检索型爬虫与训练型爬虫要分开决定

两个可独立启动的多孔板,将粒子分别导向发光的展示区或密集的核心,象征检索与训练型爬虫的独立决策。
检索型爬虫决定能否被引用,训练型爬虫决定内容是否进入模型训练,二者需分开决策。

一句话说明

检索型爬虫决定能不能被引用,训练型爬虫决定内容是否进入模型训练 —— 两件事分开决定,别用一条规则一刀切。

检索型爬虫为回答用户当下的问题而抓取,决定能不能被引用;训练型爬虫抓取内容用于模型训练,与能否被引用没有直接关系。两者要分开决定。

我们的判断

「不训练我、但要引用我」在原则上说得通,但要看清代价:屏蔽训练型对被引用没有帮助,只是放弃了长期语料位置。对以曝光为目标的品牌,两类都放行通常更划算。反过来,**屏蔽检索型而放行训练型是最亏的组合** —— 贡献了语料却关掉了曝光面。

01

两类标识分别是哪些

检索型(要被引用必须放行):OpenAI 的 OAI-SearchBot 与 ChatGPT-User、Anthropic 的 Claude-SearchBot 与 Claude-User、Perplexity 的 PerplexityBot 与 Perplexity-User,以及 Google 侧的 Googlebot。

训练型(可按策略选择):GPTBot、ClaudeBot、Google-Extended、Applebot-Extended、Bytespider、CCBot 等。

⚠️ 部分平台没有公开专用标识(如 DeepSeek),没有标识不等于不抓取 —— 要从服务端日志里找,别因为 robots 里没有对应 UA 就当它不存在。

02

各家官方说过的话

OpenAI:阻断 OAI-SearchBot 会把页面移出被引候选。

Anthropic:阻断 Claude-User 可能降低站点在用户主动发起的网页检索中的可见度。

Perplexity:PerplexityBot 索引方式类同其他搜索引擎,内容不用于模型预训练。

Google:Google-Extended 只控制训练与 grounding,且明确不是排名信号;屏蔽 Googlebot 则等于同时退出搜索与 Gemini 的可检索范围。

03

决定之后还要做一件事

改完 robots.txt 只是第一步。CDN 或边缘层可能在站点配置之外拦截,Cloudflare 自 2025 年 7 月 1 日起对新域名默认屏蔽 AI 爬虫,且它的规则不区分检索与训练。

所以放行之后必须验证:看服务端日志里有没有对应请求、返回码是不是 200、返回体里有没有正文。没验证过的放行不算放行。

本页用到的数据

97%

已发布 llms.txt 的域名中 2026 年 5 月零请求的比例

出处Ahrefs,137,000 个域名,2026

资料出处

  1. [1]Optimizing your website for generative AI features on Google Search.Google 搜索中心.2026-05-15

更新于 2026-08-10