FEATUREDAI HOT 精选· aihot-apiZH15:02 · 08·14
通义千问开源 Qwen3.8 系列:27B 稠密模型参数更少但跑分反超,2.4T 混合专家模型权重也放出来了
Qwen3.8-27B 是一个原生就能看图、读文档的多模态稠密模型,参数量只有 27B,但基准测试全面超过了上一代 Qwen3.7-Plus。它原生支持 262K 上下文窗口,用 YaRN 技术可以拉到 1M tokens,等于一次能塞进三体三部曲的量。许可证是 Apache 2.0,商用友好。同时放出的还有 Max 版本 Qwen3.8-2.4T-A...
#Multimodal#Alibaba Qwen#Open source
精选理由
精选 · 重要度 88 · 吸引力 + 知识量 + 共鸣
一句话点评
27B 参数就干掉了上一代 Plus 版,还支持一次塞进三体三部曲的上下文,Apache 2.0 商用友好,这点挺实在。
锐评
Qwen3.8-27B 用 27B 参数在基准测试上全面超过 Qwen3.7-Plus,说明模型效率有明显提升,不是靠堆参数硬拉分数。原生多模态意味着看图、读文档不用外挂插件,部署链路更短。262K 原生上下文窗口已经很大,用 YaRN 技术能拉到 1M tokens,相当于一次能处理三体三部曲的量,对长文档分析、代码库理解这类场景很实用。许可证是 Apache 2.0,商用没有太多顾虑。
不过正文没披露训练数据构成、推理成本和延迟,也没说什么时候正式放出权重。27B 模型虽然比千亿级模型轻,但本地部署对显存要求还是不低,实际跑起来成本多少得自己测。Max 版 Qwen3.8-2.4T-A95B 也开放了权重,但 MoE 架构的推理优化和部署复杂度比稠密模型高,这点先别太激动。
还缺的是多模态能力的细粒度评测,比如复杂图表理解、多图推理这些实际业务中容易翻车的场景,光看基准总分不够。另外 1M 上下文在实际使用中的注意力质量如何,正文也没给数据。
HKR 分解
hook ✓knowledge ✓resonance ✓