今天 AI 圈在拼省钱,不是拼参数
今天 AI 圈最有意思的不在某个模型又刷榜了,是几件事同时指向同一个方向:怎么把成本打下来。SGLang 把引擎重启从 8 分钟压到 0.63 秒,DeepSeek 静悄悄上线了看图干活的实验版,面壁开源了一套自动做数学证明的工具。先来看 SGLang 这一手。
SGLang 把引擎重启压到 0.63 秒,省的不是时间,是 GPU 租金
这条我先不打折,数字太具体了。SGLang 团队搞了个叫 Weight Cache Daemon 的组件,思路很直接:把模型量化、切分好的权重直接焊在 GPU 显存里,由一个常驻进程看着。引擎需要重启时,新进程通过 CUDA IPC 直接"零拷贝"映射这些现成的权重,省掉了从硬盘读数据、反序列化、再量化的全套流程。
在 Ling-2.6-1T FP8 模型上实测,权重加载从约 495 秒缩到约 0.63 秒,加速约 785 倍,端到端启动时间减少 93.9%。这个守护进程还支持多实例共享和亚秒级主备切换,是 Fast Engine Recovery Framework 的第一阶段。
说真的,这个优化的价值不在"重启快"本身,在于它改变了推理服务的成本结构。以前引擎崩了或者要更新版本,那几分钟的 GPU 空转都是钱。现在亚秒级恢复,意味着可以做更激进的弹性伸缩,或者更频繁地更新模型版本而不心疼。对跑大规模推理服务的团队来说,这比模型精度涨一两个点更实在。
DeepSeek 上线视觉版 V4-Flash,看图做 Agent 的分直接拉上去了
DeepSeek 在 API 平台放了个实验版视觉模型,叫 DeepSeek-V4-Flash-Vision-Exp。纯文本能力和正式版 V4-Flash 持平,但在需要看图干活的 Agent 任务上分数涨了一大截。Terminal Bench 2.1 跑到 83.9,Chartography 精确匹配下是 64.3。
有意思的是,DeepSeek 自己说这个模型"在需要视觉输入的 Agent 任务上表现显著提升",但没提价格、没提什么时候转正、也没说上下文窗口多大。现在只能通过设置 model='deepseek-v4-flash-vision-exp' 在 API 平台访问。
我会先打个折。实验版意味着随时可能下架或者改行为,不适合上生产。但信号很明确:DeepSeek 在补视觉 Agent 这块的短板。V4-Flash 本身定位就是便宜快跑,加视觉能力后如果能保持低价,对需要批量处理截图、图表、UI 界面的自动化场景会很香。价格和速率限制出来之前,先当玩具玩。
面壁开源 MathForm,自动把数学题写成 Lean 4 证明
面壁智能 OpenBMB 放出了一个叫 MathForm 的流水线,专门把数学题自动转成 Lean 4 能验证的证明。核心是一个叫 FormalVerse 的数据集,里面有 36.7 万条已经验证过的例子。
在同样用 10 万条样本训练的前提下,他们的模型在一致性检查上跑到 60.32%,比 FineLeanCorpus 的 46.53% 和 NuminaMath-LEAN 的 41.49% 高出一截。
这条对数学定理自动验证方向挺省钱。Lean 4 社区一直缺高质量的形式化数据,36.7 万条已验证样本是个不小的贡献。但正文没提模型参数量和推理速度,实际部署成本未知。如果是小模型跑出来的,那性价比很高;如果是大模型硬堆的,就得重新算了。
Anthropic 公开内部 AI 开发手册,但没给任何数字
Anthropic 把自家用 Claude 开发软件的内部手册开源了,覆盖了从需求、设计到写代码、测试、运维的全流程。手册提出把传统六阶段软件开发生命周期重构为 AI 嵌入各环节的闭环流程,比如用 Claude 把需求压缩成 intent.md、用持续评测替代阶段门禁、保留人工对关键代码的审查。
坦率地讲,这份手册读起来更像方法论指南,不是独立评测。全文没给任何量化指标——效率提升了多少、bug 率降了多少、团队省了多少时间,一概没提。
"当代码不再是瓶颈时,规划、审查、部署等人速环节成为新约束。"
这句话本身没错,但没有数据支撑就只是一句漂亮的洞察。如果你想知道 Anthropic 内部到底省了多少时间,这篇帮不上忙。不过作为流程参考,里面的一些具体做法——比如让模型参与需求评审、自动生成测试用例——还是有借鉴价值的。
Claude Mythos 5 开放给更多防御方,但细节太少
Anthropic 宣布 Claude Mythos 5 的网络安全功能已集成至 Claude Security,并即将登陆合作伙伴的网络安全防御工具。公司同时推出 3500 万美元的 Defender Advantage Fund,用于资助开源软件漏洞修复与安全自动化。
这条我会先打个折。正文只说"扩大覆盖",没说是 API 可用、企业版还是新工具,也没提定价或技术细节。3500 万美元的基金听起来不少,但也没说怎么申请、谁能申请、分几年花。
如果是真的,对安全团队来说多了一个能直接分析威胁的模型选项。但信息缺口太大,没法判断实际效果。等具体开放形式和定价出来再说。
今日小信号
-
Dan Luu 用 AI 几分钟给 ripgrep 加了即时编译:长查询快 2-4 倍,但在他自己真实的混合查询里只快了约 7%。他还顺手用 GPT-5.1/5.2 时期的模型做了个世界最强的 Azul 游戏 AI。这人用 AI 的效率值得单独写一篇。
-
Nari Labs 开源 Qwen3-TTS 部署方案,首音延迟压到 50 毫秒以内:在一张 H100 上做到 10 并发请求时,95% 的用户听到第一个字的时间不超过 50 毫秒。核心优化是动态切掉模型开头几十毫秒的静音段。对比默认设置下最快的引擎也要 277 毫秒,这个提升很实在。
-
AI 帮学生写作业,成绩涨 18%,闭卷考试反而跌 20%:斯德哥尔摩大学和港大学者跟踪了 2.7 万名中国学生,用豆包、DeepSeek 等工具做作业的组作业分涨了,但闭卷考试反而比没用 AI 的同学低了 20%。这个剪刀差说明 AI 可能替学生把活干了,不等于真学会。
-
AI 公司买书扫描后销毁,Anna's Archive 呼吁抢救稀有书籍:Anthropic 的"巴拿马计划"被曝花几千万美元买下数百万本纸质书,扫描完喂给 Claude 训练后就把实体书全销毁了。这么干有三个原因:不让竞争对手扫到同一批数据、降低版权法律风险,以及销毁比做无损扫描更省钱。结果就是这些书的数字版只存在公司自己的私有服务器上,公众再也碰不到。
-
DHH 成立 Omacom 基金会,8 位大佬各掏 100 万美元:Shopify CEO Tobi Lütke、Stripe CEO Patrick Collison、戴尔老板 Michael Dell、Twitter 创始人 Jack Dorsey 等 8 人各出 100 万,想靠这笔钱把"Linux 桌面年"的梗变成现实。钱不算少,但缺少具体怎么花、花多久,先别太激动。