LEARN

CDN 层的拦截不在你的 robots.txt 里

一个带有大间隙的开放格子结构,前方有一张更致密的薄片,上面有更小的错位孔洞控制着粒子流动,象征CDN与边缘层如何覆盖robots.txt声明
robots.txt是声明,CDN与边缘层是网络级开关;两者不一致时生效的是后者

一句话说明

robots.txt 是声明,CDN 与边缘层是网络级开关;两者不一致时生效的是后者。

robots.txt 是给守规矩的抓取方看的声明,CDN 与边缘层是真正的网络级开关。两者不一致时,生效的是后者 —— 你在 robots 里放行了,边缘层照样可以拦掉。

我们的判断

任何「已放行 AI 爬虫」的结论都必须有日志证据支撑。只改了 robots.txt 就宣布放行完成,是这条链路上最常见的假验证。

01

已知的默认策略

Cloudflare 自 2025 年 7 月 1 日起对新域名默认屏蔽 AI 爬虫,其「Block AI bots」规则不区分检索型与训练型 —— 也就是说它会连同产生可见度的那一类一起挡掉。

此外还存在网络级的信誉屏蔽:2025 年 8 月 Cloudflare 与 Perplexity 之间关于隐身爬虫的争议之后,部分区域即使站点放行了 PerplexityBot,请求仍可能在 CDN 层被拦。

02

怎么确认自己有没有踩上

看服务端日志:如果某类 UA 的请求根本没到源站,说明被前面拦了。

看 CDN 侧的规则与日志:安全规则、机器人管理、速率限制都可能是原因。

两边都查过、都放行、且日志里能看到 200 与完整返回体,才算确认。

03

处理时的分寸

放行 AI 爬虫与防刷、防爬价格之类的需求可能冲突。可行的折中是按路径区分:内容页放行,接口与后台照常拦。

别为了放行把整个机器人防护关掉 —— 那是用一个更大的问题换一个小问题。

资料出处

  1. [1]Optimizing your website for generative AI features on Google Search.Google 搜索中心.2026-05-15

更新于 2026-08-10