FEATUREDHacker News 首页· rssEN00:04 · 09·05
Artificial Analysis 发布 v4.2 智能指数,用隐藏题库防刷分,并加入模拟知识工作的新测试
Artificial Analysis 更新了模型评测榜单到 v4.2 版,主要做了两件事:一是新增了 AA-Briefcase 和 GDP.pdf 两个更贴近真实场景的测试;二是把不公开的隐藏题库权重翻倍到 40%,专门防止模型厂商针对公开题刷分。AA-Briefcase 是它们自己出的隐藏题,模拟需要好几周才能完成的知识工作项目,让模型处理几千个源...
#Benchmarking#Artificial Analysis#Anthropic#OpenAI
精选理由
精选 · 重要度 72 · 吸引力 + 知识量
一句话点评
榜单把隐藏题库权重翻倍到40%,专门防刷分,这个动作比新增测试本身更值得关注。
锐评
Artificial Analysis 把评测榜单升到 v4.2,核心就干了两件事:让考试题更贴近真实工作,以及把防作弊的力度拉满。新增的 AA-Briefcase 是个隐藏题库,模拟需要几周才能完成的知识工作项目,让模型处理几千个源文件,考察的不是单题对错,而是整个项目能不能跑通、分析质量和呈现水平怎么样。另一个 GDP.pdf 测试更极端,要求模型啃完 4592 页专业文档,对照 1275 条细粒度标准打分,只要有一条没满足,整道题就算失败。
榜单头部还是 Anthropic 和 OpenAI 在争。Claude Fable 5.1 排第一,GPT-6 Astra 比上一代 GPT-5.6 Sol 高出约 85 个 Elo 分,进步幅度不小。但更值得留意的是,隐藏题库权重从 v4.1 的 20% 直接翻倍到 40%,而且官方明说 v5 还会继续加。这说明公开题刷分已经严重到需要靠隐藏题来维持榜单可信度了。
正文没披露 AA-Briefcase 的具体题目数量和领域分布,也没说 GDP.pdf 的评分一致性校验怎么做。另外,成本效率那条曲线只给了定性描述,缺少具体每百万 token 的价格对比,想算性价比的人还得自己去翻原始数据。
HKR 分解
hook ✓knowledge ✓resonance —