PLATFORMS

Microsoft Copilot 的抓取与放行

一句话说明

Microsoft Copilot 的检索型爬虫是 Bingbot,训练型是 未单独区分;要被引用必须放行检索型,训练型可按品牌策略单独决定。

检索型爬虫决定能不能被引用,训练型爬虫决定内容是否进入模型训练 —— 两件事要分开决定。Microsoft Copilot:检索型 Bingbot;训练型 未单独区分。

我们的判断

别把 Copilot 当成「小号 ChatGPT」——它底下换的是 Bing 的索引与排序,同一批内容在两边的表现可以差很远。

01

放行策略怎么定

要被引用,检索型爬虫必须放行 —— 这是开关级的前提,内容做得再好也绕不过去。

训练型爬虫可以按品牌策略选择。业内有「不训练我、但要引用我」的主张;对以曝光为目标的品牌,通常两类都放行更划算。

⚠️ 放行不只是改 robots.txt。CDN 或防护层可能在站点配置之外拦截,Cloudflare 自 2025 年 7 月 1 日起对新域名默认屏蔽 AI 爬虫,且它的「Block AI bots」规则不区分检索与训练。

02

怎么验证真的被抓了

服务端日志是主源。不执行 JavaScript 的抓取请求不会进入前端分析工具,所以在网页分析里基本看不到 AI 侧的抓取行为。

验证清单:日志里有没有对应 UA 的请求、返回码是不是 200、返回的 HTML 里有没有正文、抓取频率有没有骤降。

⚠️ 特别要查「给爬虫返回空壳、给普通搜索引擎返回全文」这种情况 —— 这类问题不查抓取层永远发现不了,而它会让所有内容工作归零。

本页用到的数据

97%

已发布 llms.txt 的域名中,2026 年 5 月零请求的比例

出处Ahrefs,137,000 个域名,2026

资料出处

  1. [1]Optimizing your website for generative AI features on Google Search.Google 搜索中心.2026-05-15

更新于 2026-08-06