先说结论
Cloudflare 在 2026 年 7 月 1 日推出的新 AI traffic options,最重要的变化不是“多了一个封锁 AI 爬虫的按钮”,而是把 AI 流量按用途拆成了 Search、Agent、Training。对内容站来说,这比一刀切更接近真实问题:你可能希望搜索引擎和 AI 搜索能发现你,但不希望原创内容被无限制拿去训练;你也可能愿意让用户主动触发的 agent 读取页面,但需要知道它有没有带来引用、访问或转化。
所以更稳的策略不是“全放”或“全封”,而是按页面类型、爬虫用途和实际数据分层管理。Search 关系到可见性,Agent 关系到新入口,Training 关系到内容资产边界。三件事混在一起讨论,内容站很容易做错决定。
发生了什么
Cloudflare 官方博客和文档在 2026 年 7 月 1 日说明,所有客户,包括 Free plan 用户,都可以按 AI crawler 的行为类型管理流量。Cloudflare 把主要用途分成三类:Search、Agent、Training。
| 类别 | 大致含义 | 内容站应该问的问题 |
|---|---|---|
| Search | 用于搜索发现、索引或 AI 搜索结果的爬虫 | 它是否会带来可见性、引用、自然搜索或 AI 搜索流量? |
| Agent | 用户或应用触发的 agent 访问,例如为任务读取页面 | 它是否代表真实用户意图?是否能留下来源、引用和转化路径? |
| Training | 为模型训练、改进或构建数据集抓取内容 | 这是否符合你的原创内容、广告页面和商业资产边界? |
Cloudflare 的 AI Crawl Control 文档还说明,站点可以在 dashboard 中对具体 AI crawler 采取动作;managed robots.txt 文档则描述了由 Cloudflare 生成和维护 robots.txt 指令的方式。
这件事的行业背景也很清楚。OpenAI 的 crawler 文档把 OAI-SearchBot、GPTBot 等用途分开;Google Search Central 也单独解释了 AI features 和网站内容之间的关系。换句话说,AI 爬虫正在从“一个模糊的 AI bot”变成“多个目的不同、价值不同、风险不同的访问者”。
为什么不能一刀切
对一个依赖搜索和内容分发的独立站来说,直接封掉所有 AI bot 听起来干脆,但代价可能很高。Search crawler 可能影响发现和引用;agent crawler 可能是用户通过 ChatGPT、浏览器助手、企业工具或未来搜索 agent 触发的访问;training crawler 则更接近“内容被拿去训练模型,但不一定带回流量”。
这些用途的商业含义完全不同。
如果把 Search 和 Training 混在一起,你可能为了保护内容训练权利,顺手伤到搜索可见性。如果把 Agent 和恶意 scraping 混在一起,你可能挡掉了未来真实用户的任务入口。如果完全不管,你又可能让原创内容、付费内容或广告变现页面被低成本复制。
GEO 的核心也是这个问题:内容要能被 AI 系统正确理解和引用,但站点也需要边界。让 agent 能读懂你,不等于允许所有训练抓取。
独立内容站的默认策略
如果你运营的是技术博客、开发者文档站、工具类网站或广告支持的内容站,比较合理的初始策略可以是:
| 流量类型 | 初始建议 | 观察指标 |
|---|---|---|
| 传统搜索和 AI Search 相关 crawler | 默认开放,除非出现异常消耗或错误抓取 | Search Console 展示、点击、Cloudflare referrer、日志中的 user agent |
| 用户触发的 agent crawler | 选择性开放,优先允许能带来源或引用的 crawler | AI referrer、被引用页面、访问深度、是否命中高价值文章 |
| Training crawler | 对原创分析、广告变现页和长期资产更谨慎 | 抓取量、带宽消耗、是否有明确 opt-out 或商业交换 |
| 未知或伪装 crawler | 默认保守,用 WAF / rate limit / bot score 观察 | 请求频率、路径模式、是否绕过 robots.txt、错误率 |
这不是最终答案,而是一个可复盘的起点。真正的决定应该等 Cloudflare Analytics、Google Search Console、AdSense 和服务器日志一起看。比如某个 agent crawler 如果频繁访问但没有 referrer、引用或后续访问,就不应该因为名字里有 AI 就自动放行。反过来,如果某个 AI search crawler 能带来可见的点击和引用,就不应该和训练抓取一起封掉。
已确认事实、推断和不确定性
已确认的是:Cloudflare 已经发布按 Search、Agent、Training 管理 AI traffic 的选项;Cloudflare 文档说这些能力面向所有客户;OpenAI 和 Google 的公开文档也显示,搜索、用户请求和训练用途正在被分开描述。
我的推断是:内容站接下来会需要一份“crawler policy”,就像过去需要 SEO checklist、robots.txt 和 sitemap 一样。它不只是技术配置,也关系到内容商业模式:哪些页面要被发现,哪些页面允许 agent 读取,哪些页面不希望进入训练数据。
现在不能确定的是:各家 AI 公司是否都会长期严格区分 crawler;AI search 是否会给独立站带来足够引用和访问;Cloudflare 的分类对所有边缘案例是否都准确;以及未来搜索平台是否会给站长更细的 opt-out 选择。
现在可以做的清单
第一,先盘点页面类型。新闻快评、原创教程、工具页面、隐私政策、广告变现页面、下载页面,不应该使用同一套规则。
第二,检查 robots.txt 和 Cloudflare AI Crawl Control,但不要只看设置页。配置之后要实际打开线上 robots.txt,并从日志里看爬虫行为有没有变化。
第三,给文章补结构。AI crawler 管理只是访问层,GEO 还要求内容本身有清晰结论、定义、来源、更新时间、不确定性和 FAQ。否则即使被抓取,也可能被错误总结。
第四,建立复盘周期。每周看一次 Search Console 查询、Cloudflare top paths/referrers、异常 bot 流量和 AdSense 页面表现,再决定是否收紧或放宽。
下一步看什么
接下来最值得观察的不是某个按钮,而是三个变化:
- 主流 AI 公司是否更明确地区分 search、agent、training crawler。
- Cloudflare 是否能把 crawler 控制和 publisher payment、AI search 引用、广告页面保护连接起来。
- Google、OpenAI、Anthropic、Perplexity 等入口是否给站长更透明的引用、流量和 opt-out 数据。
对内容站来说,AI 时代的开放不是无条件开放,保护也不是无条件封锁。真正有用的是把“被发现”“被引用”“被训练”“被滥抓”拆开,然后用数据决定边界。
FAQ
Cloudflare 的新 AI traffic options 适合小站用吗?
适合关注,但不要急着做极端配置。小站最需要的是搜索可见性和可持续的内容边界。先记录现状,再按页面类型和 crawler 用途逐步调整。
Training crawler 和 Search crawler 最大区别是什么?
Search crawler 的目标通常是发现、索引或回答用户查询,理论上可能带来曝光和访问。Training crawler 的目标更偏向收集内容用于模型训练或改进,不一定会给原站带来流量。
Agent crawler 应该放行吗?
可以选择性放行。关键是看它是否代表用户主动请求、是否带来源、是否能产生引用或后续访问。如果只有抓取成本,没有任何可见回报,就应该重新评估。
这会影响 GEO 吗?
会。GEO 不只是内容写法,也包括访问策略。你需要让合适的 AI 搜索和 agent 能读到结构清楚的内容,同时限制不符合你内容边界的训练或滥抓。
这篇文章用到哪些来源?
主要来源是 Cloudflare 官方发布和文档、OpenAI crawler 文档、Google Search Central 的 AI features 页面,以及 TechCrunch 对 Cloudflare 新政策的报道。