FEATURED量子位 · 公众号· rssZH13:36 · 05·07
浙大与阿里提出 MetaCompress:只看图片就能学会压缩 Token,多轮视觉问答压缩率 90% 且精度不掉
这篇 CVPR 2026 论文介绍了一个叫 MetaCompress 的框架,专门解决多轮视觉问答里图片 Token 太多、推理太贵的问题。它的做法是让模型只看输入图片,自己生成一张“压缩映射图”,直接决定哪些视觉 Token 该留、哪些该扔,不需要额外训练一个压缩网络。文章给出的核心数据是:能砍掉 90% 的视觉 Token,同时保持回答精度不降。还...
#Multimodal#Vision#Inference-opt#Zhejiang University
精选理由
精选 · 重要度 80 · 吸引力 + 知识量 + 共鸣
一句话点评
砍掉90%图片Token还不掉精度,但正文没披露具体测试集和模型,这点先别太激动。
锐评
这篇 CVPR 2026 论文的思路挺直接:多轮视觉问答里图片 Token 太多,推理又贵又慢。浙大和阿里的 MetaCompress 框架不额外训练压缩网络,而是让模型自己看图片生成一张“压缩映射图”,直接决定哪些视觉 Token 该留、哪些该扔。给出的数字是能砍掉 90% 的视觉 Token,精度不降,而且最优保留的 Token 和高注意力 Token 之间只有 1.71% 的重叠,说明模型不是简单按注意力高低来挑重点。
不过文章本身因为环境异常没抓到完整正文,具体在哪个数据集上测的、用了哪个基础模型、多轮对话轮次多少、延迟和显存实际省了多少,这些关键信息都没披露。1.71% 这个数字看起来漂亮,但如果只在单一场景下验证,换模型或换任务可能就没这么稳。另外“精度不掉”是跟什么基线比、误差范围多大,也需要看原文才能判断。
整体看,思路有价值,尤其对需要反复读图的长对话场景。但没看到完整实验设置前,我会先打个折,等论文公开后再看泛化性。
HKR 分解
hook ✓knowledge ✓resonance ✓