● P1AI HOT 精选· aihot-apiZH19:57 · 05·22
Anthropic 公布 Glasswing 项目首月战报:用 Claude Mythos Preview 挖出上万个高危漏洞
Anthropic 说,他们和大约 50 家合作伙伴用 Claude Mythos Preview 模型,在全球最关键的基础软件里找到了超过一万个高危或严重级别的漏洞。现在瓶颈已经不是找漏洞的速度,而是验证、通报和打补丁的速度。在开源软件扫描这块,模型自己估算发现了 6,202 个高危或严重漏洞,其中 1,752 个已经过独立安全公司或 Anthrop...
#Code#Agent#Benchmarking#Anthropic
精选理由
精选 · 重要度 88 · 吸引力 + 知识量 + 共鸣
一句话点评
Anthropic 用新模型扫出上万高危漏洞,验证准确率 90.6%,但正文没披露误报率和漏报率,这点先别太激动。
锐评
Anthropic 公布了 Project Glasswing 的初步结果:他们和约 50 家合作伙伴用 Claude Mythos Preview 模型,在全球关键基础软件里找到了超过一万个高危或严重漏洞,独立验证的准确率是 90.6%。Cloudflare 一家就扫出 2,000 个 bug,其中 400 个是高危或严重级别,团队认为误报率比人类测试员还低。Mozilla 在 Firefox 150 里发现并修了 271 个漏洞,是上一版用 Claude Opus 4.6 时的十倍多。
现在瓶颈已经不是找漏洞的速度,而是验证、通报和打补丁的速度。Palo Alto Networks 最新一次发布补丁量是平时的五倍多,微软也说补丁数量会持续变大。这个变化说明 AI 找漏洞的能力确实在快速提升,但文章也坦承,因为要等补丁部署完才能详细披露,目前给的都是汇总数字和例子,具体漏洞细节还没公开。
还缺什么:一是没给误报率和漏报率,90.6% 的准确率只说了已验证的那部分,没验证的有多少、漏了多少不知道;二是没说明模型在不同类型软件上的表现差异,比如开源项目和企业闭源系统是不是一样强;三是没提这种扫描对算力和成本的要求,大规模部署到底划不划算还不清楚。
HKR 分解
hook ✓knowledge ✓resonance ✓