FEATUREDAI HOT 精选· aihot-apiZH00:00 · 08·15
MOSS-VL:把实时互动当核心能力来做的开源视觉模型,边看边说
复旦团队开源了一个叫 MOSS-VL 的视觉语言模型家族,最大的不同是它把“实时互动”——也就是模型一边接收画面一边说话——当作一等能力来设计。它用了一种叫门控交叉注意力的机制,把视觉信息放在解码序列外面处理,所以生成第一个字的延迟比同底座的 Qwen3-VL-8B 低了 2.8 到 5.1 倍,画面信息越多优势越明显。实时版 MOSS-VL-Real...
#Vision#Reasoning#MOSS-VL#OpenMOSS
精选理由
精选 · 重要度 74 · 吸引力 + 知识量
一句话点评
MOSS-VL把“边看边说”做成了模型的原生能力,生成第一个字的延迟比同底座模型快2.8到5.1倍,画面越多优势越明显。
锐评
复旦团队开源的MOSS-VL,核心卖点是把实时交互——也就是模型一边接收画面一边说话——当作一等能力来设计,而不是事后打补丁。它用了一种叫门控交叉注意力的机制,把视觉信息放在解码序列外面处理,所以生成第一个字的延迟比同底座的Qwen3-VL-8B低了2.8到5.1倍,视觉上下文越长优势越明显。实时版在四个流式基准里拿了三个第一,尤其在OmniMMI主动预警任务上,66.0分对最好基线的37.5分,差距拉得很开。
不过要注意,这篇是技术报告,不是经过同行评审的论文,所有数字都来自团队自报。正文没披露实时推理时的显存占用和吞吐量,也没说这套门控交叉注意力在长视频场景下会不会有注意力衰减的问题。11.3B的参数规模不算小,但视觉token不塞进解码序列,这个设计思路确实省了计算。
五个检查点、训练流程和推理代码全开源了,这点值得肯定。但实际部署效果还得等社区复现和第三方评测,现在看到的都是最优条件下的数据,先打个八折看。
HKR 分解
hook ✓knowledge ✓resonance —