ax@ax-radar:~/daily/2026-07-19 $ cat newsletter/daily/2026-07-19.md
40 srcsignal 72%cycle 04:32
AX 的 AI 日报 · 2026-07-19开源模型端侧落地

今天 AI 圈在拼开源和落地,不是参数

今天 AI 圈最有意思的不是某个模型又刷榜了,是几件事同时指向同一个方向:开源模型在往端侧和具体场景里钻。面壁智能扔了个 2B 小模型,跑分压过 Qwen3.5-2B,还一次适配 9 款芯片;阿里把 2.4T 参数的 Qwen3.8 开源了,但跑分和成本都没说;Ollama 拿了 8800 万美元,想把跑开源模型做得跟装个软件一样简单。先来看面壁这个 2B 小模型,它可能是今天最实在的一个发布。

面壁扔了个 2B 小模型,跑分压过 Qwen3.5-2B,还一次适配 9 款芯片

这条我今天最想聊,因为它实在。面壁智能和 OpenBMB 发布了 MiniCPM5-2B,一个 2B 参数的小模型,在 AA-Index 榜单上拿了 17 分,平均分 54.26,是目前 4B 参数以下模型里最高的,压过了 Qwen3.5-2B。

有意思的地方不在跑分本身,在它原生支持混合思考——模型可以自己判断要不要多想几步,不是每次都把算力拉满。还支持 512K 上下文窗口,相当于一次能塞进一本很厚的书。发布当天就完成了华为昇腾、英伟达等 9 款芯片的适配,端侧部署的门槛被拉低了。

但我会先打个折。面壁没给推理延迟和内存占用,这两个数字对端侧模型来说比跑分更重要——手机上跑 2B 模型,如果延迟超过 500 毫秒或者占 4GB 内存,体验会很差。AA-Index 的评分标准也没公开,17 分到底会带来什么,得等第三方实测。

不过方向是对的。2B 参数、混合思考、多芯片适配,这三件事放在一起,说明面壁在认真做端侧,不是拿个大模型压缩一下就完事。至于实际体验怎么样,等开源权重放出来跑一下才知道。

阿里把 2.4T 参数的 Qwen3.8 开源了,但跑分和成本都没说

阿里 Qwen 团队发了 Qwen3.82.4T 参数,权重很快会放出来。他们自己说这是目前最强的模型之一,只排在 Fable 5 后面。现在可以在 Token Plan、Qoder 和 QoderWork 上试到预览版 Qwen3.8-Max-Preview。

说真的,2.4T 参数开源这件事本身挺大方的,但“最强之一”这个说法我先打个折。没贴任何跑分,没给训练数据规模,也没说推理成本——2.4T 参数跑一次推理要多少张卡、延迟多少、花多少钱,全不知道。

有意思的是 QwenCloud 同时推出了订阅套餐。个人 Lite 每月 6 美元,Pro 每月 68 美元,号称比按量付费便宜约 40%。一个套餐能调 Qwen3.8-Max-Preview、DeepSeek V4 Pro 等多个模型,还接入了 Cursor、Claude Code 等工具。

如果是重度用户,确实能省钱。但页面没披露 Qwen3.8-Max-Preview 的具体能力参数和上下文长度,模型到底多强得打个问号。

这有点像先开门再装修——模型开源了,套餐上线了,但关键的性能数据还锁着。等权重放出来、第三方跑完分,才能判断 2.4T 参数是真有料还是数字好看。

Ollama 拿了 8800 万美元,想把跑开源模型做得跟装软件一样简单

Ollama 宣布完成 8800 万美元融资,由 Benchmark、Theory Ventures 等机构领投,Docker 创始人 Solomon Hykes 也参与了跟投。目前 Ollama 已经有 890 万开发者用户,财富 500 强里 85% 的公司都在用。

Ollama 的两位创始人十年前做过 Docker Desktop,现在他们想让开发者用一条命令就能在本地跑开源模型。这个定位很准——开源模型越来越多,但部署门槛还是高,Ollama 做的事就是把这件事降到最低。

但我会先打个折。新闻稿没给估值,也没说赚钱时间表。890 万用户和 85% 的 500 强覆盖率听起来很猛,但 Ollama 本身是免费工具,云服务的 token 用量虽然在涨,离盈利还有多远不知道。

这笔融资更像一张路线图:Benchmark 赌的是开源模型会继续碎片化,部署工具会变成必需品。如果这个判断对,Ollama 的位置确实好。但 8800 万美元能烧多久、能不能跑通商业模式,得看他们接下来怎么把免费用户转成付费客户。

黄仁勋去东京签了三份框架协议,把 Nvidia 嵌进日本工业链条

黄仁勋 7 月 15 到 16 号在东京见了一圈日本产业界的人,带走了三份框架协议。最核心的是 Noetra 项目:政府拉上软银、索尼、NEC、本田等 44 家本土公司,五年内砸 1 万亿日元(约 62 亿美元),要自己搞一套给机器人、汽车和工厂产线用的 AI,不想把命脉交给美国或中国的模型。

同时,Nvidia 跟发那科、安川电机等机器人厂商组了个 Cosmos 机器人联盟,还跟信越化学、SUMCO 签了芯片材料供应协议。TechCrunch 报道提到,Nvidia 宣布为日本建设 Vera Rubin AI 工厂,配备 13,750 颗 Vera CPU27,500 颗 Rubin GPU,预计 2028 年投运。

坦率地讲,这三份协议都是框架,离落地还远。62 亿美元分五年花,44 家公司协调,日本政府项目的执行效率一向不快。但方向很清楚:日本不想在工业 AI 上依赖别人,Nvidia 想把自己的芯片和软件栈嵌进日本整个制造业。

这一笔不便宜,但很 Nvidia——不是卖显卡,是卖生态位。

昆仑万维把 2026 年叫“世界模型元年”,但最实在的是一个 5B 视频生成模型

昆仑万维董事长方汉在 WAIC 上给 2026 年贴了个标签叫**“世界模型元年”**,同时放出 Matrix-Game 3.5、Mureka v9.5 和 O3 三个模型。

“世界模型元年”这个说法我不太买账——每年都有人贴类似标签,但真正能用的世界模型还没出现。不过 Matrix-Game 3.5 有个实在的数字:50 亿参数的版本在 720p 分辨率下,单张显卡就能跑到每秒 20 帧的实时生成,核心架构还开源了。

技术亮点是**“Patch 级记忆注入”**——把画面切成小块分别记住再拼回来,相当于给模型加了个局部记忆缓存。如果这个性能属实,小团队用单卡就能跑实时视频生成,挺省钱。

但缺少训练数据规模、生成质量对比(比如 FID 分数)和实际部署案例。5B 参数、20 帧/秒、单卡跑,这三个数字如果都能兑现,确实能省钱。至于“世界模型元年”这个帽子,先别太当真。

面壁还开源了具身模型,1.5B 参数想让机器人看懂画面再动手

面壁智能同时放出了 MiniCPM-Robot 系列,核心是一个 15 亿参数的视觉-语言-动作模型 MiniCPM-RobotManip,用来做机械臂操作,另外还有一个 MiniCPM-RobotTrack 负责目标跟踪。同时发布的 PhyAI 推理框架想把理解、记忆和动作串起来。

15 亿参数在具身模型里算轻量,理论上部署成本低、响应快。但缺少任何基准测试成绩和硬件要求——跑在什么芯片上、延迟多少、成功率如何,全没披露。

具身智能这个方向本身值得关注,面壁把模型开源出来也是好事。但跟 MiniCPM5-2B 比起来,这条信息密度低很多。如果是真的挺省钱——轻量 VLA 模型如果能跑在端侧芯片上,机器人厂商不用再依赖云端推理。但没跑分、没硬件要求,现在只能看个方向。

今日小信号

  • AI 项目成功率 0%? 一位经手公司所有销售和技术项目、跟全球约三百位从业者聊过的作者说,他观察到的所有 AI 项目成功率是 0%。内部聊天机器人没人用,因为公司文档太差,大模型没东西可读;三菱的语音客服六个月前承诺回电,至今没消息。管理层不敢问项目进展。这个数据来自个人经验,不是系统调查,但指向一个真问题:企业软件项目本来就容易失败,AI 项目叠加了额外风险。

  • AI 给错答案,人就不敢说“不知道”了。 法国和意大利三所大学的研究人员故意用一个经常答错的模型来给人出主意。没 AI 帮忙时,44% 的人会老实说“不知道”,准确率 27%;AI 一上场,“不知道”的比例直接掉到 3%,准确率降到 9%,但自信度却从 30% 飙到 76%。给钱也没救回来多少。这个实验设计挺聪明,结论也扎心:AI 不一定让人变聪明,但一定让人变自信。

  • Simon Willison 从 Claude Code 二进制里挖出 Rust 版 Bun。 他从自己电脑上的 Claude 二进制文件里翻出了 'Bun v1.4.0' 的版本号,而 Bun 官方公开的最新版才 v1.3.14,说明这是个还没正式发布的预览版。还找到了 563 个 .rs 文件名。实锤了 Rust 版 Bun 已在数百万设备上跑着。

  • 月之暗面暂停新订阅,Kimi K3 需求爆了? 只有一条推文和 4 条 HN 评论,信息极有限。缺少这是临时还是永久暂停,也没说 K3 的能力或定价。如果是真的,说明 K3 可能很受欢迎,但信息太少,没法判断是营销策略还是真爆单。

  • OpenAI 把 Codex 上下文从 37.2 万 token 砍到 27.2 万。 PR 描述只写了“减少上下文大小”,没解释原因。我猜是为了省延迟或省钱,但代码生成质量可能打折,尤其长上下文场景。等官方说明。

更多

频道

后台