FEATUREDComputing Life · Share · 鸭哥调研· rssZH00:00 · 05·22
DS4 引擎让 DeepSeek V4 Flash 在 Mac 上跑起来了,还解决了 agent 对话的“失忆”问题
DeepSeek V4 Flash 是个 284B 总参数、13B 激活的 MoE 模型,性能接近前沿水平,但主流推理引擎在 Mac 上都跑不了。antirez 专门为它写了 DS4 引擎,纯 C、Metal 优先,一个编译命令就能用。它最特别的地方是解决了 agent 工作流里的上下文断裂:模型生成工具调用时,DS4 会记住原话,下次 agent 返...
#Agent#Inference-opt#DeepSeek#antirez
精选理由
精选 · 重要度 72 · 吸引力 + 知识量 + 共鸣
一句话点评
antirez 用纯 C 写了个 Mac 专用引擎,让 284B 的 DeepSeek V4 Flash 能在本地跑,还解决了 agent 对话里上下文断裂的老毛病。
锐评
这条消息对想在 Mac 上跑大模型的开发者来说是个实打实的好消息。DeepSeek V4 Flash 本身性能很强,但之前主流引擎在 Mac 上都跑不了,等于空有屠龙刀没处用。antirez 的 DS4 引擎直接填了这个坑,一个 make 命令就能编译,还兼容 OpenAI、Anthropic 的 API,你手头的 Claude Code 或 Codex 可以直接接上去用。
它最值得关注的设计是解决了 agent 工作流里的上下文断裂问题。简单说,模型调用工具时,DS4 会记住它说的原话,等 agent 返回结果时把原话塞回去,这样模型就不用因为格式翻译的细微差异而重新理解整段对话。在 100K token 的长上下文里,这能省下几十秒的重新计算时间。另外,它把 KV cache 存到磁盘上,重启 server 后能直接加载,不用再从头处理那几万 token 的系统提示。
不过文章没给出具体的硬件门槛和价格,只提了 96GB 内存的 Mac 能跑。性能数据倒是给了:M4 Max 上生成速度稳定在 23-27 t/s,M3 Ultra 上能到 27-37 t/s,峰值功耗才 50W。这个速度日常 coding 够用,但别指望能飙到云端 GPU 的水平。另外,ds4-agent 还是 alpha 阶段,正文也说了质量不稳定,这点先别太激动。
HKR 分解
hook ✓knowledge ✓resonance ✓