上周我发现,我的内容正被偷去喂 AI
上周做客户案例集,发现朋友的博客被某 AI 公司爬走,免费拿去训练大模型。我自己查了下 — 三年前写的文章,也出现在某个 AI 训练数据集里。
我之前完全没意识到这事。
这事有个简单解法:给网页挂个'禁止'牌
叫 NoAI,本质是一行 HTML 代码(HTML 是网页骨架语言,不懂代码没关系):
<meta name="robots" content="noai">
放在网页 区域,跟"网页描述"那几行在一起。
等于对所有爬虫(爬虫就是自动抓网页的程序)喊:"不许拿去训练 AI。"
谁在用?纽约公共图书馆那批人(librarian.net)在用;独立博客老炮 Cory Doctorow 早就在用;最近 Hacker News 上 200 多人讨论。
老实话:这不是法律,只是个"声明"。OpenAI、Anthropic 部分会听,小公司不一定。
今天就能做:0 元、5 分钟、复制粘贴
钱:0。一行代码,免费。
时间:5 分钟。
技术门槛:复制粘贴一行字。
第一步:打开网站后台,找"自定义代码"或"head 标签"那选项(Wordpress 在"主题编辑器";Notion 用户暂时没法直接加,可以请懂技术的朋友帮一下)。把那行贴进去。
三类人的建议
刚起步(粉丝不到 100):现在不急。被爬概率低,等有稳定产出再挂也行。
如果你已经有 1-2 客户:我会建议你立刻挂。你的客户案例是你最值钱的内容,被 AI 学走等于别人免费用你的成功经验。
在扩规模:除了 NoAI,我会建议你找懂 SEO 的朋友,在 robots.txt 里也加限制(robots.txt 是网站根目录的文件,告诉搜索引擎哪些不要抓)。半小时搞定。
最后说一句:挂这行字不一定 100% 挡住,但至少你表态了 — 就像门口贴"禁止吸烟",有人会听,有人不会。但没贴,被爬走你连说"我没同意"的底气都没有。