FEATUREDAI HOT 精选· aihot-apiZH17:51 · 08·07
腾讯混元把自家线上推理用的高性能算子开源了,并合进了 SGLang 主干
腾讯混元 AI Infra 团队把他们在生产环境里打磨的 Attention、Router GEMM 和 MoE 算子打包成 HPC-Ops 开源,并直接合入了 SGLang 的主分支。这些算子专门针对混合专家模型(MoE)推理里的三个性能瓶颈:解码时不同请求的上下文长度差异巨大,静态分配计算任务会导致 GPU 空等;路由计算对精度敏感,算得不准会选错...
#Tencent Hunyuan#SGLang#HPC-Ops#Open source
精选理由
精选 · 重要度 78 · 吸引力 + 知识量 + 共鸣
一句话点评
腾讯混元把自家线上打磨的算子开源并合入SGLang,Hy3模型推理延迟最高降了48.8%,Attention平均比FlashInfer/FlashAttention快2.25倍。
锐评
腾讯混元AI Infra团队把他们在生产环境里用的Attention、Router GEMM和MoE算子打包成HPC-Ops开源,直接合进了SGLang主分支。这件事的价值在于,这些优化不是实验室跑分,而是已经在混元线上推理里验证过,Hy3模型的TPOT最高降了48.8%。
具体看三个算子:Attention算子用动态调度解决了解码时不同请求上下文长度差异大导致GPU空等的问题,在H20上平均比FlashInfer和FlashAttention里表现最好的那个还快2.25倍。Router GEMM用BF16精度做路由计算,比FP32 cuBLAS快1.30到3.22倍,同时最大误差只有0.00177,远低于TF32 cuBLAS的0.06464,说明它算得快还不容易选错专家。MoE算子把专家计算的小矩阵乘法开销压下来,在H200上用Qwen3跑,比Triton快4.21倍。
不过要注意,这些数据主要来自H20和H200的Hopper架构GPU,正文没提在其他卡上的表现。端到端测试用的是Hy3-FP8和LongCat-Flash-Lite-FP8,不同模型和精度下的收益会有差异。另外,Router GEMM的精度对比只给了最大绝对误差,没给分布情况,实际路由质量的影响还需要更多验证。
HKR 分解
hook ✓knowledge ✓resonance ✓