FEATUREDX · @dotey(宝玉)· x-apiZH15:46 · 04·07
Milla Jovovich 和开发者发布开源记忆系统 MemPalace,声称 LongMemEval 满分,但被指只测了检索、没测端到端问答
MemPalace 想解决 AI 对话一结束就失忆的问题:不靠 AI 自己挑重点,而是把全部对话按“宫殿—翼—房间—走廊”的结构存下来,全部本地运行,不依赖云服务。它配套了一个叫 AAAK 的压缩语法,号称能把上下文压到 30 倍,但实测压缩后检索准确率从 96.6% 掉到 84.2%,差了 12 个百分点,无损压缩不会这样。项目宣称的 LongMem...
#Memory#RAG#Benchmarking#Milla Jovovich
精选理由
精选 · 重要度 75 · 吸引力 + 知识量 + 共鸣
一句话点评
明星光环把工程成绩放大了好几倍。项目实测基线 96.6% 检索准确率确实不错,但宣传的“满分”只测了检索这一步,没做端到端问答,压缩后准确率还掉了 12 个百分点。想法有料,数字得打折看。
锐评
MemPalace 想解决一个真实痛点:AI 聊完就忘,现有记忆方案又只记标签不记原文。它反其道行之,把全部对话按“宫殿—翼—房间—走廊”的结构存下来,全部本地跑,不碰云。这个思路本身不差,仅靠结构分层检索就让准确率提升了 34%,纯本地基线 96.6% R@5 也是同类里最高的。
问题出在宣传上。LongMemEval 的“满分”只做了检索这一步,没生成答案也没经过评判,标准排行榜比的是端到端问答准确率,难度差了一个量级。LoCoMo 的 100% 更离谱,检索参数设成 top_k=50,等于把所有内容全丢给模型做阅读理解,检索层被绕过了,项目自己的文档也承认了这一点。AAAK 压缩号称 30 倍无损,实测检索准确率从 96.6% 掉到 84.2%,差了 12 个百分点,无损压缩不该这样。
项目内部文档其实比较老实,大部分缺陷在 BENCHMARKS.md 里都写了。但发布推文把所有限定条件去掉,只留最炸裂的数字。现在还缺的是:压缩算法到底牺牲了什么信息、矛盾检测功能为什么代码里找不到、以及脱离特定测试集后真实场景的表现。
HKR 分解
hook ✓knowledge ✓resonance ✓