FEATUREDAI HOT 精选· aihot-apiZH17:11 · 07·06
SGLang 接入 DSpark 推测解码:让草稿模型自己决定每次验证几个 token
LMSYS 把 DSpark 推测解码做进了 SGLang 推理引擎。和以前固定验证一整块 token 不同,DSpark 的草稿模型自带一个“信心打分器”,能算出每个 token 被主模型接受的概率,调度器再根据这个分数动态决定每轮实际验证几个 token——分数低的请求就少验几个,省下算力。在 H200 上跑 DeepSeek-V4-Flash,这...
#Inference-opt#LMSYS#SGLang#DeepSeek-V4-Flash
精选理由
精选 · 重要度 78 · 吸引力 + 知识量
一句话点评
SGLang 把 DSpark 推测解码做进了引擎,让草稿模型自己判断每个 token 的靠谱程度,再动态决定验几个,省算力。
锐评
LMSYS 把 DSpark 推测解码集成进了 SGLang,核心变化是验证长度不再固定。草稿模型多了一个“信心打分器”,能算出每个 token 被主模型接受的概率,调度器再根据这个分数动态决定每轮实际验证几个 token——分数低的请求就少验几个,把算力省下来。在 H200 上跑 DeepSeek-V4-Flash,这套方案在吞吐和每位用户解码速度上都超过了 MTP 和不做推测的基线。
工程上最值得看的是他们怎么在完整的 CUDA 图里跑可变长度验证:当调度器砍掉验证预算时,引擎会重放一个真正更小的图,而不是用填充来假装变小,这避免了无效计算。另外,调度器靠一个成本表在线决定每个请求的验证预算,还有一个“上限接受模式”用来暴露被裁剪隐藏的真实接受率天花板。
正文没披露具体的延迟数字和成本表细节,也没说这套方案在非 H200 硬件或更混合的流量下的表现。动态调度比固定调度的提升幅度也只给了初步观察,缺少严格的消融实验。
HKR 分解
hook ✓knowledge ✓resonance —