FEATUREDAI HOT 精选· aihot-apiZH11:51 · 08·10
SGLang 第一时间适配 Meta 的本地智能体模型 Muse Glimmer,单卡 RTX 5090 跑到每秒 1452 个 token
Meta 发布了 Muse Glimmer,一个 300 亿参数的多模态模型,专门为在本地硬件上跑智能体工作流设计。SGLang 推理框架在发布当天就提供了支持,并做了针对性优化。在单张 RTX 5090 显卡上,用 NVFP4 量化格式搭配 DFlash 投机解码技术,每个用户的解码速度能达到每秒 236 个 token,总吞吐量冲到每秒 1452 ...
#Agent#Multimodal#Reasoning#Meta
精选理由
精选 · 重要度 72 · 吸引力 + 知识量
一句话点评
Meta 发了个 300 亿参数的多模态模型 Muse Glimmer,主打在本地显卡上跑智能体任务,SGLang 当天就适配好了。
锐评
这条消息的核心是:Meta 把能跑智能体工作流的多模态模型压到了单张消费级显卡上,SGLang 推理框架第一时间做了深度适配。在 RTX 5090 上,用 NVFP4 量化加 DFlash 投机解码,单用户解码速度能到每秒 236 个 token,总吞吐冲到每秒 1452 个 token。这个数字说明在本地跑复杂智能体任务,延迟和并发都到了一个可用的水平。
模型结构上,它用滑动窗口注意力混搭全序列注意力,上下文窗口拉到 128k 以上,这是为了在长链条智能体任务里不丢上下文。不过文章没给出任何基准测试分数,只说“有竞争力的表现”,这点先别太激动。另外,Apple Silicon 那边虽然支持 MLX 后端,但投机解码还没跟上,意味着 Mac 上的速度会打折扣。
还缺什么:没有披露智能体任务的具体评测集和对比对象,也没说量化后模型能力掉多少。这些缺口让“本地跑智能体”的实际效果还悬着。
HKR 分解
hook ✓knowledge ✓resonance —