PLATFORMS
Gemini 的抓取与放行
一句话说明
Gemini 的检索型爬虫是 Googlebot,训练型是 Google-Extended;要被引用必须放行检索型,训练型可按品牌策略单独决定。
检索型爬虫决定能不能被引用,训练型爬虫决定内容是否进入模型训练 —— 两件事要分开决定。Gemini:检索型 Googlebot;训练型 Google-Extended。
我们的判断
屏蔽 Googlebot 等于同时退出 Google 搜索和 Gemini 的可检索范围,代价远大于收益。
01
放行策略怎么定
要被引用,检索型爬虫必须放行 —— 这是开关级的前提,内容做得再好也绕不过去。
训练型爬虫可以按品牌策略选择。业内有「不训练我、但要引用我」的主张;对以曝光为目标的品牌,通常两类都放行更划算。
⚠️ 放行不只是改 robots.txt。CDN 或防护层可能在站点配置之外拦截,Cloudflare 自 2025 年 7 月 1 日起对新域名默认屏蔽 AI 爬虫,且它的「Block AI bots」规则不区分检索与训练。
02
怎么验证真的被抓了
服务端日志是主源。不执行 JavaScript 的抓取请求不会进入前端分析工具,所以在网页分析里基本看不到 AI 侧的抓取行为。
验证清单:日志里有没有对应 UA 的请求、返回码是不是 200、返回的 HTML 里有没有正文、抓取频率有没有骤降。
⚠️ 特别要查「给爬虫返回空壳、给普通搜索引擎返回全文」这种情况 —— 这类问题不查抓取层永远发现不了,而它会让所有内容工作归零。
本页用到的数据
97%
已发布 llms.txt 的域名中,2026 年 5 月零请求的比例
出处:Ahrefs,137,000 个域名,2026
资料出处
- [1]Optimizing your website for generative AI features on Google Search.Google 搜索中心.2026-05-15
更新于 2026-08-06