FEATUREDHacker News 首页· rssEN17:49 · 08·29
AI 爬虫用最蠢的方式狂刷 git.kernel.org,每天 600 万次请求,98% 是废料
Konstantin Ryabitsev 给了硬数据:git.kernel.org 每天收到 600 万次请求,98% 来自 AI 爬虫。这些爬虫不直接克隆仓库,而是把每个提交渲染成 HTML 再抓取,光 linux.git 的 922 个分支就能生成几十亿个有效网址,抓回来的却是 148 万次提交的重复内容。封 IP、封整个 ASN 都失败了,因为爬...
#Konstantin Ryabitsev#git.kernel.org#Anubis#Open source
精选理由
精选 · 重要度 78 · 吸引力 + 知识量 + 共鸣
一句话点评
Linux 内核仓库每天 600 万次请求里 98% 是 AI 爬虫,它们用最蠢的方式把每个提交渲染成网页再抓,白白烧掉 14-16 个 CPU 核。
锐评
Konstantin Ryabitsev 这次给了硬数据,不是抱怨。git.kernel.org 每天 600 万次请求,98% 来自 AI 爬虫。最离谱的是爬取方式:不直接克隆仓库,而是把 linux.git 的 148 万次提交逐个渲染成 HTML 再解析。加上 922 个分支,能生成几十亿个有效网址,抓回来的却是大量重复内容。
后果很直接。在 5 个地理分布节点、总共 90 个核的服务器上,常年有 14 到 16 个核在专门给爬虫渲染提交页面,比所有合法访问(包括 git clone)消耗的 CPU 还多。封 IP、封整个 ASN 都失败了,因为爬虫已经用上了电视和手机里的住宅代理 SDK,每次只发 4-5 个请求就换 IP,封不过来。
他们试过用 Anubis 工作量证明挡了一阵,难度设到 5 之后爬虫又回来了。正文没提现在难度调到多少、成本增加了多少,也没说是否考虑过直接限制 cgit 的 URL 生成能力。这点先别太激动,因为作者自己也承认,当初把一切开放给人类和守规矩的爬虫的设计,现在成了负担。
HKR 分解
hook ✓knowledge ✓resonance ✓