HeadlinesBriefing favicon HeadlinesBriefing.com

AI爬虫淹没 git.kernel.org 资源

Hacker News •
×

AI爬虫正在消耗 git.kernel.org 的大量资源,其中 14 个 CPU 核心 分布在 5 个地理分布式节点 专门用于将 git 提交渲染为 HTML 供爬家使用。这超过了所有合法访问的 CPU 使用量总和,包括 git clone 操作。kernel.org 基础设施托管了 148 万个提交 在 linux.git 中,以及 922 个分支,产生了数十亿个重复 URL,爬虫系统性地抓取这些 URL 而不是有效地克隆仓库。

爬虫目标锁定 kernel.org,因为其开放的开发历史提供了保证的预 AI、LLM-free 训练数据——“价值连城”,因为在 LLM 生成的内容上训练会导致“数字慢性病。”尽管有效的克隆选项存在,但爬虫选择了“最愚蠢的方式”,通过逐个提交渲染 HTML 并对其进行解析,利用 cgit 生成差异、补丁和任意提交视图。

通过检测 user-agent 和 fail2ban 进行初始阻止,直到机器人伪装了浏览器的 user-agent。IP 封禁升级到 ASN 封禁,但爬虫现在从数百万 residential 和移动 IP 操作,使得识别几乎不可能。这种“背景辐射”式的系统负载永久占用了单一目的模型训练的容量。