FEATUREDComputing Life · Share · 鸭哥调研· rssZH00:00 · 09·13
DeepSeek Engram:把静态知识搬出 GPU 显存,用查表给推理腾出算力
DeepSeek 在 V4.1 Flash 模型里塞了一个叫 Engram 的模块,有 196B 参数,但它不做计算,只躺在主机内存的查找表里等模型来取。它的查找键直接用前几个 token 拼出来,地址提前就能算准,所以可以靠 RDMA 预取把传输延迟藏进计算过程里,不用占 GPU 显存。论文自报的数据里,推理能力涨得比知识问答更猛:BBH 涨了 5....
#Reasoning#DeepSeek#DeepSeek V4.1 Flash#Engram
精选理由
精选 · 重要度 82 · 吸引力 + 知识量 + 共鸣
一句话点评
DeepSeek 把 196B 参数做成查表模块搬出 GPU 显存,省下的算力反而让推理涨得比知识问答更猛,BBH 涨了 5.0。但所有数据都是论文自报,还没第三方复现,这点先别太激动。
锐评
这篇论文最反直觉的地方是:一个专门用来背知识的查表模块,最大的收益却出在多步推理上。BBH 涨了 5.0,长上下文检索从 84.2 跳到 97.0,而知识问答 MMLU 只涨了 3.0。背后的逻辑其实很直接——浅层网络不用再反复拼凑局部词序搭配,省下的注意力和计算深度就能转向全局推理。
工程上,这套方案能跑通靠的是三个前提:查找键由前几个 token 直接拼出来,地址提前就能算准;真实语言访问呈长尾分布,高频向量可以常驻显存;RDMA 预取把传输延迟藏进计算过程里。论文建议把约 20% 到 25% 的稀疏容量分给 Engram,但这个比例只在作者自选的基线上验证过,跨规模、跨领域的普适性还没人复现。
Qwen3.8 Flash-Next 也跟进了类似设计,说明外置静态记忆正在进入主流。但正文没披露这套方案在真实动态生产环境下的延迟波动数据,也没给出主机内存带宽吃紧时的退化曲线。在独立复现出来之前,把它当成一次巧妙的内存分层优化来看,比当成新架构更稳妥。
HKR 分解
hook ✓knowledge ✓resonance ✓