01 触发事件

2025 年 6 月 Cloudflare 披露, AI bot 已经占全球互联网流量过半; 同月公司宣布裁员 20%, 约 1000+ 人, CEO Matthew Prince 在 WSJ 发文谈如何用 AI 替换被裁岗位; 最近 Prince 接受 The Verge Decoder 播客采访, 把 Cloudflare 的新定位讲清楚 — 在网站主和 AI 爬虫之间提供付费放行、按请求计费、按域名白名单的控制面板。

How I choose which Cloudflare employees to replace with AI

(这是 Prince 那篇 WSJ op-ed 的标题, 我当作引文 callout 独立列出)

需要 hedge 一下: 这个 51% 数字是 Cloudflare 自己披露的, 我没在第三方流量监测 (Similarweb、Cisco 互联网报告) 那里 cross-check 过。但 Cloudflare 视角覆盖了全球相当比例的 CDN 请求, 自报数据的可信度比一般 SaaS 公司高, 数量级应该没问题。

02 这事的真正含义

这件事表面是 Cloudflare 又发了条产品新闻, 实际是 Prince 在押一个结构性判断 — 未来 5 年, AI 公司要持续从公开 web 抓训练数据、要让 agent 去操作 web 表单和页面, 这条通道必须有人结算和清算, 而 Cloudflare 自认已经坐在了这条通道上, 不需要再新建任何东西。

这是 Stratechery aggregation theory 的二次上演: Google 在 2000 年代聚合了全网链接, 成为流量分发的中枢并从中变现; 现在 Prince 想让 Cloudflare 聚合 AI 对 web 的访问权, 让网站主变成可拒绝、可定价的内容供给方, 让 AI lab 变成付费方, Cloudflare 抽成。这才是 Prince 在 Decoder 里反复强调 "owners can block, allow, or pay" 这三层选项时真正想说的话 — 他在卖的不是反爬工具, 是定价权。

我没把握的是这个类比的关键差异: Google 当年聚合时, 网站主默认是欢迎被索引的 (因为带来流量), 而 AI 时代网站主对爬虫普遍敌意更强, 觉得被白嫖。这个敌意看似是 Cloudflare 的障碍, 实际是它议价权的来源 — 网站主越想拒绝 AI, 越需要 Cloudflare 当中间人。

03 历史类比

最贴的对照是 2010 年前后的音乐产业 vs Apple iTunes / Spotify。音乐人原本把歌免费放在 MySpace 和 LimeWire 任人扒, 苹果和 Spotify 把听众付月费、按播放分成这条管道建起来之前, 创作者收不到一分钱。Cloudflare 现在做的事情本质上是 web 内容的 Spotify for AI — 让每一次爬取变成可计量、可计费、可拒绝的事件。

第二个对照是 2013-2017 年 Google 与欧洲出版商的 snippet tax 争议。德国、西班牙率先立法要求搜索引擎为 snippet 付费, Google 一度关闭谷歌新闻西班牙版, 最终妥协。区别是当时的结算方是政府立法, 这次换成了 Cloudflare 这种私营基础设施, 把政治问题 (强制付费是否违反 net neutrality) 商业化了。

类比是否过度, 我没把握 — 音乐产业是 C 端消费者付费, AI 数据采购是 B2B, 议价模型可能完全不同; snippet tax 是政府推动, Cloudflare 是私营抽成, 法律基础也不一样。但结构上确实是同一件事: 内容的批发价格从零被强行重定。

04 对 AI builder 意味着什么

这个月值得调整三件事。

第一, 训练数据的 TCO 要重新算。如果 Cloudflare 的 pay-per-crawl 跑通, 任何依赖大规模 web scrape 的模型 (包括第三方 fine-tuning 数据集、retrieval pipeline 的 refresh) 单位成本都会上去。AI builder 在选数据源时, 要把可能被 Cloudflare 这类平台收费纳入 12 个月内的 TCO 估算, 而不是按当前 "免费抓" 的成本结构做决策。

第二, Agent 产品的 distribution 模型要改。现在 Cursor、Anthropic Computer Use 这类 agent 访问网站是 "悄悄 GET 一下" 的默认行为, 未来大概率要走 "带 token 鉴权 + 计量预算 + 域名白名单" 的流程。这意味着 agent framework 要尽快支持 "网站身份 + 计量预算" 这两个 primitive, 不然上生产时会被反爬机制直接卡死。OpenAI 已经在推 A2A 和 Apps SDK, 部分原因就是这个压力。

第三, 自托管爬虫管道 (自建 proxy pool + headless browser farm) 的合规风险上升。Cloudflare 本身就在做反爬, AI lab 反过来做反反爬, 这是个无止境的军备竞赛, 小团队玩不起。我不在大型 AI lab, 不确定他们内部是不是已经在为这件事留预算, 但我猜 OpenAI 和 Anthropic 已经有专门 team 在管这个。

05 反方观点 / 风险

我可能错在低估了 AI lab 绕过中间商的能力。

OpenAI 已经签了 News Corp、Axel Springer、Reddit、Associated Press 等多家直接授权; Anthropic 走的是类似路线。一旦头部 AI lab 用 "签独家 + 直接抓自家授权内容" 的组合绕开 Cloudflare, Cloudflare 真正能抽成的就是中长尾网站 — 而中长尾数据的模型训练价值, 可能远低于 Cloudflare 想要的定价。这是 Spotify 模式的根本缺陷: 头部 1% 的内容贡献了 90% 的价值, 长尾抽成养不活平台。

第二个风险是 Cloudflare 自身的组织能力。它能不能同时跑好卖 CDN、卖 Zero Trust、卖 Workers、卖 AI bot 结算四条业务线, 我有疑问。从技术层跨到内容版权中介, 是从工程问题跨到法律和商业问题, 后者 Cloudflare 历史上没有强项证据 — 看看它跟 Verizon、跟终端用户的几场法律纠纷, 处理得并不漂亮。

第三个是政治风险远高于技术风险。一旦 Cloudflare 变成 AI 数据高速公路收费站, 反垄断 (Cloudflare 已经够大了) 和 net neutrality 两条战线都会找上门。Nilay 在播客里直接问 Prince "这是好事吗", Prince 没有正面回答。我听到的是他在回避, 不是没想到。我可能低估了 Prince 的政治手腕 — 能在 FCC、网络中立辩论、SOPA/PIPA 这些战场存活十年的人, 不太可能没想过这一步, 但风险不会因此消失。