PLATFORMS
Microsoft Copilot 的抓取与放行
一句话说明
Microsoft Copilot 的检索型爬虫是 Bingbot,训练型是 未单独区分;要被引用必须放行检索型,训练型可按品牌策略单独决定。
检索型爬虫决定能不能被引用,训练型爬虫决定内容是否进入模型训练 —— 两件事要分开决定。Microsoft Copilot:检索型 Bingbot;训练型 未单独区分。
我们的判断
别把 Copilot 当成「小号 ChatGPT」——它底下换的是 Bing 的索引与排序,同一批内容在两边的表现可以差很远。
01
放行策略怎么定
要被引用,检索型爬虫必须放行 —— 这是开关级的前提,内容做得再好也绕不过去。
训练型爬虫可以按品牌策略选择。业内有「不训练我、但要引用我」的主张;对以曝光为目标的品牌,通常两类都放行更划算。
⚠️ 放行不只是改 robots.txt。CDN 或防护层可能在站点配置之外拦截,Cloudflare 自 2025 年 7 月 1 日起对新域名默认屏蔽 AI 爬虫,且它的「Block AI bots」规则不区分检索与训练。
02
怎么验证真的被抓了
服务端日志是主源。不执行 JavaScript 的抓取请求不会进入前端分析工具,所以在网页分析里基本看不到 AI 侧的抓取行为。
验证清单:日志里有没有对应 UA 的请求、返回码是不是 200、返回的 HTML 里有没有正文、抓取频率有没有骤降。
⚠️ 特别要查「给爬虫返回空壳、给普通搜索引擎返回全文」这种情况 —— 这类问题不查抓取层永远发现不了,而它会让所有内容工作归零。
本页用到的数据
97%
已发布 llms.txt 的域名中,2026 年 5 月零请求的比例
出处:Ahrefs,137,000 个域名,2026
资料出处
- [1]Optimizing your website for generative AI features on Google Search.Google 搜索中心.2026-05-15
更新于 2026-08-06