AI HOT 精选· aihot-apiZH16:00 · 06·24
NVIDIA 开源 NeMo AutoModel,改一行 import 让 MoE 模型微调吞吐量提升 3.4 倍
NVIDIA 把 NeMo AutoModel 开源了,它基于 Transformers v5,专门解决 MoE(混合专家)模型微调时显存爆掉和训练太慢的问题。做法是把专家并行、DeepEP 的 all-to-all 通信调度和 TransformerEngine 的高效计算内核打包在一起。实测下来,训练吞吐量比原生 v5 高了 3.4 到 3.7 倍...
#Fine-tuning#NVIDIA#NeMo AutoModel#Transformers v5
一句话点评
NVIDIA 把 MoE 微调从“跑不动”变成了“跑得动”。在 128 张 H100 上全量微调 550B 模型,原生 Transformers v5 直接爆显存,AutoModel 靠专家并行(EP=64)让它能跑起来,吞吐量还翻了 3.4-3.7 倍,显存省了约三成。改动成本极低,只换一行 import。这点先别太激动——正文没披露精度是否有损失,也没说支持哪些模型架构之外的兼容限制。如...
HKR 分解
hook ✓knowledge ✓resonance —