FEATUREDAI HOT 精选· aihot-apiZH11:58 · 06·25
美团 LongCat 开源 VitaBench 2.0:一个测 AI 能不能长期记住你、主动问你的基准
这个基准模拟了 56 个虚拟用户,每人平均有 1580 天的交互记录、2093 个事件,任务有 819 个,偏好会动态变化超过 2000 次,还给模型配了 66 个可调用的工具。目前最强的 Claude-Opus-4.6 在开卷考试下平均分刚过 0.5,说明整体还不太行。开了思考模式对个性化任务不一定加分,一到需要主动提问的场景,所有模型分数都断崖式下...
#Meituan LongCat#Anthropic Claude Opus 4.6#Open source
精选理由
精选 · 重要度 78 · 吸引力 + 知识量 + 共鸣
一句话点评
这个基准模拟了56个虚拟用户长达4年多的生活记录,最强模型开卷考试平均分刚过0.5,一到需要主动提问的任务所有模型分数断崖式下跌。
锐评
VitaBench 2.0 把评测拉到了接近真实生活的尺度:56个虚拟用户,每人平均1580天的交互记录、2093个事件,任务有819个,偏好还会动态变化超过2000次。这不是让模型答几道题,而是看它能不能在长达数年的时间跨度里,记住一个人的习惯变化、在合适的时候主动问问题、调用66个工具去完成具体的事。
目前最强的 Claude-Opus-4.6 在开卷模式下平均分刚过0.5,说明整体水平还很低。两个值得注意的发现:一是开了思考模式对个性化任务不一定加分,有时候反而帮倒忙;二是所有模型一到需要主动提问的场景,分数就断崖式下跌——模型还是更擅长被动回答,不太会主动搞清楚用户到底要什么。
正文没披露这56个虚拟用户是怎么生成的、偏好变化的规律是否贴近真人分布,也没说819个任务的难度分级和具体类型占比。这些信息缺口会影响我们对基准本身质量的判断。另外,评测只跑了 Claude-Opus-4.6 一个最强模型的数据,其他模型的横向对比没给全,这点先别太激动。
HKR 分解
hook ✓knowledge ✓resonance ✓