FEATUREDAI HOT 精选· aihot-apiZH01:00 · 07·08
蚂蚁周俊:万亿模型跑15分钟烧掉一辆特斯拉,他们用“Token密度”把长文本成本从指数压到线性
蚂蚁集团副总裁周俊在AICon上算了一笔账:万亿参数模型每跑15分钟,算力成本就抵得上一辆特斯拉。团队不再拼Token数量,转而提高“Token密度”。他们用7份Lightning Attention加1份MLA搭了一套混合线性注意力架构,把256K长上下文的计算开销从指数级拉回到线性级,省下的算力可以留给推理环节。Kpop算法会把工具调用和自然语言的...
#Agent#Reasoning#Ant Group#Zhou Jun
精选理由
精选 · 重要度 72 · 吸引力 + 知识量
一句话点评
蚂蚁用混合注意力把长文本成本从指数压到线性,Token 输出砍掉 3/4 能力没掉,五轮对话成本降了 10 倍以上。但这是演讲 PPT 数据,没看到第三方复现。
锐评
周俊在 AICon 上给了一个很直观的比喻:万亿参数模型跑 15 分钟,算力成本抵一辆特斯拉。这个说法把大模型烧钱的程度讲清楚了。他们没去继续堆 Token 数量,而是提了一个“Token 密度”的概念,核心是让模型少说废话、多干正事。
技术实现上,他们用 7 份 Lightning Attention 加 1 份 MLA 搭了一套混合线性注意力架构,把 256K 长上下文的计算开销从指数级拉回到线性级。省下来的算力可以留给推理环节。Kpop 算法把工具调用的 Token 和自然语言 Token 分开处理,再配合思维链剪枝和自蒸馏,Token 输出量减少约 4 倍,但能力没降。千亿参数模型在 BFCL 等 Agent 基准上跑赢了部分更大的模型,小模型 flash 吞吐提到 2.4 倍,五轮对话成本降了 10 倍以上。
这些数字如果属实,对做 Agent 落地的人挺有吸引力,尤其是长上下文和工具调用频繁的场景。但正文没披露具体测试环境、对比基线的细节,也没看到开源权重或第三方验证。演讲里的数据先打个折看,等有公开复现报告再下结论。
HKR 分解
hook ✓knowledge ✓resonance —