ax@ax-radar:~/daily/2026-08-10 $ cat newsletter/daily/2026-08-10.md
33 srcsignal 72%cycle 04:32
AX 的 AI 日报 · 2026-08-10落地翻车与能力溢出

今天 AI 圈在拼落地,不是拼参数

今天 AI 圈最有意思的不在某个模型又刷榜了,是几件事同时指向同一个方向:模型能力开始溢出,真正的战场挪到了怎么用、怎么管、怎么不翻车。Meta 发了个 300 亿参数的本地智能体模型,a16z 的数据显示电脑操作能力已经超过人类基线,但另一边,一家连锁药店的 AI 电话助手因为报错剂量被紧急叫停,一个会议记录平台 18 万条录音裸奔了半年没人修。先来看 Meta 这一手。

Meta 发了个 300 亿参数的本地模型,说能在 Mac 上跑智能体

这条我会先打个折——Meta 发了 Muse Glimmer,一个 300 亿参数的多模态模型,用 Apache 2.0 协议开源,专门为在本地硬件上跑智能体工作流设计。Meta 的说法是,它能在 Mac 或配好显卡的 PC 上直接运行,不用联网,在关键智能体测试上比同尺寸模型强。

但有意思的地方不在参数,在定位。Muse Glimmer 不是又一个聊天模型,它从设计上就瞄准了“常驻运行的智能体”——那种一直在后台等着帮你调工具、读屏幕、操作软件的东西。128k+ token 的上下文窗口也印证了这一点,智能体干活需要记住的东西比聊天多得多。

SGLang 推理框架在发布当天就给了 Day-0 支持,做了针对性优化。在单张 RTX 5090 上,用 NVFP4 量化DFlash 投机解码,总吞吐量冲到每秒 1452 个 token,单用户解码速度每秒 236 个 token。这个速度在本地跑智能体任务够用了。

但 Meta 没放任何跑分,也没说跟谁比,只说“比同尺寸强”。没对比对象和具体数字,实际能力得等社区实测。另外还缺内存占用、推理延迟这些本地部署最关键的指标。模型用 Apache 2.0 协议,商用友好,这点对做本地 agent 产品的团队是加分项。

扎克伯格在同一天发了篇长文,喊“超级智能应该人人可用”,内部会议上直接点名 OpenAIGoogle,赌开源模型长期会赢。他确认下一代 Llama 继续完全开源,但发布时间和参数都没给。全文是价值观表态,没技术路线图,没成本估算。愿景没问题,但先别太激动。

a16z 的数据说电脑操作能力超过人类了,但别急着喊 AGI

a16z 追踪了 OSWorld-Verified 基准测试的成绩,这个测试专门评估 AI 能不能像人一样操作电脑——打开软件、填表单、拖文件那种。一年前最好的模型只能完成约 30% 的任务,现在 Claude Fable 5 做到了 85%,超过了人类 72% 的基线。

这个数字确实值得看,但 a16z 自己的判断更关键:模型本身不再是主要瓶颈。竞争焦点正从“智能体能不能操作电脑”转向“它能不能在真实公司里可靠地干活”。这包括权限管理、流程知识、错误处理、缓存策略这些工程问题,不是模型能力问题。

85% 是在标准流程里拿到的。任务一跑偏、环境一变化,就容易崩。这跟自动驾驶有点像——高速上跑得挺好,进小区就懵了。

OpenAI 把安全模型拆成蓝队和红队,红队版对高危请求几乎不拒绝

OpenAI 发布了 GPT-5.6-Cyber,一个专门给网络安全研究用的模型。它把 Daybreak 项目拆成两档:Blue 档给防守方用 GPT-5.6 Sol 做漏洞发现和应急响应;Red 档解锁 GPT-5.6-Cyber,这个模型专门训练来减少对高危、双用途提示的拒绝回答,提升漏洞利用链的开发能力。

内部测试里,GPT-5.6-Cyber 在高级网络安全场景下的请求完成率从 GPT-5.6 Sol 的 1.5% 拉到了 95%。这个数字挺吓人的——意味着红队版几乎不拒绝任何高危请求。但报告有时会变短,可能是模型在效率和完整性之间做了权衡。

OpenAI 把这个模型定位给“授权的漏洞研究、漏洞验证和安全测试”,强调应对网络防御窗口不断收窄的挑战。直接看,攻击者已经在用 AI 了,防守方不能还卡在安全审查的拒绝机制上。

英伟达拉上六家金融机构,要撬 5000 亿美元建 AI 工厂

英伟达和 Apollo、BlackRock、Blackstone、Brookfield、Goldman Sachs、KKR 签了备忘录,打算撬动最多 5000 亿美元(约 3.38 万亿人民币)的第三方资金,专门给 AI 基础设施项目放贷。

黄仁勋把这叫“AI 工厂”模式:算力本身就能直接产生收入,而英伟达的 GPU 因为可以在不同客户间流转、还能通过 CUDA 软件持续提升性能,被包装成了一种适合投资的资产。在这个平台里,英伟达主要做供需撮合,但在部分项目里也会自己投钱。

这个逻辑跟 Google 给 Anthropic 备 400 亿有点像——不是直接给钱,是用算力合同绑定。英伟达这步棋更狠,它不自己出大头,而是把 GPU 包装成资产类别,让金融机构来买单。如果跑通了,AI 基础设施的融资门槛会大幅降低,但风险也会更分散——或者说,更隐蔽。

一家药店叫停了 AI 电话助手,因为报错剂量、漏掉处方提醒

连锁药店 Kinney Drugs 上线三个月的 AI 电话助手 Burt 被紧急撤回。顾客投诉电话内容混乱、报错剂量、漏掉处方提醒。总裁 John Marraffa 承认,合规不等于体验好,他们搞砸了。

现在患者来电恢复传统的按键式系统,Burt 只保留在用户主动订阅的续方短信通知里。报道没提底层用的是哪家模型或语音供应商。

这条跟 a16z 的数据放在一起看很有意思——模型在基准测试上拿了 85%,但真实场景里一个药店电话助手就能翻车。差距不在模型能力,在工程落地。报错剂量不是模型不够聪明,是它没接上药房的处方系统、没做足够的边界检查和人工兜底。

一个会议记录平台 18 万条录音裸奔了半年,还能实时闯入别人通话

安全研究员 BobDaHacker 发现,AI 会议记录平台 tl;dvFirestore 数据库没有做租户隔离——任何已登录用户都能查到全平台所有会议记录。他扫到了 181,874 条记录,涉及 84,312 个用户35,003 个域名,包括 23 国政府及多所高校的会议。

更严重的是,大约有 1,000 场会议状态是“正在录制”,会议 ID 直接暴露,可以实时加入别人的通话。他演示了一把:直接进了马来西亚教育部及美国某大学创业团队的实时通话。

这个漏洞自 2026 年 1 月报告后 6 个月仍未修复。另外还有超过 1,000 段会议内容被设为公开状态。

这事跟 AI 能力没关系,是 AI 产品的基础设施安全没跟上。会议记录工具的核心卖点是“AI 帮你总结会议”,但如果你连租户隔离都没做,用户凭什么信任你把会议内容交给 AI 处理?

今日小信号

  • Docker 推出 Sandboxes,给 Claude Code、Gemini CLI 这类 AI 编程助手用的本地隔离环境。每个助手放进独立微型虚拟机,只挂载项目文件夹,一条命令就能销毁。目前支持 macOS 和 Windows,但没提正式上线时间和具体收费。

  • Redis 作者 antirez 开源了 h3.c,一个纯 C 写的 MiniMax H3 推理引擎,代码量很小,几乎不依赖外部库,专门给 Mac 用。README 提到原生支持一次生成 256 个 token 的预览,但没给任何跑分数据,速度得自己编译跑一下才知道。

  • Cactus 开源 Needle 2,一个只有 4500 万参数的微型模型,压缩后仅 14MB,跑一次最多占 28MB 内存。不聊天,只做三件事:调用工具、控制设备、按格式提取信息。在树莓派 5 上解码速度超过每秒 500 个 token,在 200 美元以下的手机上也能跑到 300 到 700。但缺少训练数据,基准测试只说“互有胜负”,实际能力得自己测。

  • 哈佛学生用 Meta 智能眼镜+人脸识别当街“开盒”路人,直接拉出姓名、住址和电话号码。两名被“开盒”的哈佛同学公开抗议,其中一人已经起诉 Meta。Meta 的回应是眼镜上有 LED 指示灯提醒拍摄,但学生说日常光线下根本看不见。核心争议不是技术能不能做,而是 Meta 把一件能隐蔽偷拍的设备当成消费电子产品卖。

  • 微信内测 AI 帮写朋友圈和 AI 点评,但原文链接因为环境异常被屏蔽了,看不到具体怎么用、覆盖多少用户、什么时候上线。标题说“朋友圈最后一点人味正在消失”,但缺少任何实测截图或数据支撑,这个判断目前只能当观点看。

更多

频道

后台