HeadlinesBriefing favicon HeadlinesBriefing.com

Cloudflare 推出禁止 AI 训练设置

Hacker News •
×

Cloudflare 宣布推出新的 Disallow AI Training 设置,允许网站所有者在保持被搜索引擎索引的同时阻止 AI 训练其内容。AppleGoogleMicrosoft 尊重或已承诺尊重此控制。该功能解决了混用爬虫的问题 — — 单个机器人同时服务于搜索和训练 — — 此前这迫使网站所有者在可发现性和数据保护之间做出二选一的选择。

Cloudflare 推出了 Accountable 称号,授予符合要求的机器人运营商:提供训练和 AI 摘要的退出机制、对爬取页面的 URL 级可见性,以及保证退出不会影响搜索排名。AppleGoogleMicrosoft 符合资格。公司报告称,17% 的网站启用了训练阻止,而不到 1% 的网站阻止搜索爬虫。

新的安全控制根据行为将机器人分类为:搜索训练代理。混用爬虫结合了搜索和训练。Cloudflare 能识别、分类并阻止不合规的爬虫,并在 Radar 上报告运营商行为。目标是在明年年初实现对 AI 摘要包含的集中控制 — — 在 Cloudflare 上一次性设置,而非逐个运营商设置。

关键实体:公司:Cloudflare、Apple、Google、Microsoft

常见问题:Cloudflare 的 Disallow AI Training 设置与 robots.txt 有何不同?

与 robots.txt 不同,Cloudflare 的网络级控制能识别谁在爬取,将其用途分类(搜索 vs. 训练),阻止不合规的爬虫,并在 Radar 上报告运营商合规情况 — — 提供了文本文件无法实现的执行力。