OpenAI 踩刹车,小模型在边缘跑得更快了
今天 AI 圈最值得看的两件事,一个在云端踩刹车,一个在本地踩油门。OpenAI 因为新模型 Astra 可能已经具备关键网安能力,暂停了最大规模的强化学习训练,先做安全验证再往下走。另一边,FastMetal 把视频生成搬到了 Mac 本地,30 秒出一段 5 秒视频,不用联网也不用 N 卡。中间还夹着几件事:OpenAI CFO 说最晚 2027 年上市,OpenRouter 被 Stripe 收了,Liquid AI 和 Unsloth 都在量化上搞出了新花样。先来看 OpenAI 这一脚刹车。
OpenAI 自己踩了刹车,新模型可能已经会搞网络攻击了
这条我会先打个折——OpenAI 说新模型 Astra 可能已经达到了内部安全框架里“关键网络安全能力”的门槛,但没给具体证据,也没说是什么测试触发了这个判断。不过动作是实的:给准备发布的模型做强化学习训练暂停了两周,目前最大规模的前沿 RL 训练也还在搁置。现在只跑小规模训练和评估,先验证模型行为和防护措施是否靠谱再往下走。
触发这次暂停的还有前阵子和 Hugging Face 的安全事件。OpenAI 顺势加强了研究环境的安全要求:工作负载隔离、网络隔离、持续安全测试,涉及 Astra 或网络模型的工作负载得满足最严格的安全标准。思维链监控范围也扩大了。
有意思的是,OpenAI 把这叫“在网络关键能力时代放缓模型开发”,听起来像在给自己立安全标杆。但说实话,暂停两周的 RL 训练对整体进度影响有多大,外部根本看不出来。这更像一次公开表态:我们知道模型在变强,我们在管。至于 Astra 到底能做什么、安全测试怎么过的,还得等后续披露。
OpenAI CFO 对员工说最晚 2027 年上市,别管 Anthropic 会不会抢先
OpenAI 首席财务官 Sarah Friar 在全员会上把上市时间定在了 2027 年,如果业务跑得快还可能提前。她让员工别在意竞争对手 Anthropic 可能 9 月就挂牌,按自己节奏来就行。她把 IPO 形容成“另一种融资”,并提到 3 月融到的 1220 亿美元让公司手头很宽裕。
会上还晒了一组内部数据:本季度整体年化营收涨了 35%,企业业务涨了 50%。这个增速放在任何 SaaS 公司都算猛,但 OpenAI 的烧钱速度也是出了名的。Friar 说手头宽裕,潜台词可能是“我们不急,不用为了抢上市窗口而牺牲估值”。
Anthropic 那边如果真在 9 月挂牌,会是 AI 行业第一家上市的头部模型公司。OpenAI 选择晚一年,可能是想等营收规模再上一个台阶,把故事讲得更圆。但 2027 年这个时间点,也意味着他们判断这轮 AI 投资热潮至少还能撑两年。
Mac 本地 30 秒出视频,不用 CUDA 也不用联网
FastMetal 把 FastWan-QAD 系列搬到了苹果芯片上。一段 5 秒 480P 视频完全在 Mac 本地跑,耗时 30 秒,只吃 3.9 GiB 内存。DiT、DMD 采样器和解码器都通过 MLX 在 Metal 上运行,默认用 INT8 量化来省资源。模型分三档:1.3B 出 480P,5B 出 720P,14B 号称画质更好。
我会先打个折:正文没提 14B 模型的速度和内存,画质也没给对比,别急着冲大模型。1.3B 和 5B 的规格倒是给了,480P 和 720P 对应得清楚。INT8 量化是省资源的关键,但也可能压画质,这点没展开。
整体看,把视频生成从云端拉到 Mac 本地是个实在的工程活。30 秒出一段 5 秒视频,对于快速原型或者 meme 生成来说够用了。但缺实测画质和 14B 的性能数据,建议等社区跑分再决定用哪个尺寸。
OpenRouter 被 Stripe 收了,模型路由和支付要打通了
OpenRouter 宣布加入 Stripe,没公布交易金额和条款。OpenRouter 是目前最大的 AI 模型集市兼网关,每天在 400 多个模型上跑超过 10 万亿个 token,服务超 1000 万开发者。团队说这次合并能加速他们“多模型”的路线,但没给出任何整合路线图或时间表。
这笔交易有意思的地方不在金额,在逻辑。Stripe 是支付基础设施,OpenRouter 是模型调用基础设施。打通之后,开发者从选模型到付费可以一条龙走完,Stripe 也能把自己的支付能力嵌入 AI 工作流的最底层。
但 OpenRouter 一直强调路由决策以用户利益为先,合并后这个独立性能不能保住,是开发者最关心的问题。官方说会继续以原名、原使命独立运营,产品与路线图不变。这种承诺在收购初期都这么说,过一年再看。
量化技术扎堆更新:Liquid AI 说能找回 97% 精度,Unsloth 发了新版
今天量化这块挺热闹。Liquid AI 把 LFM2.5 系列(230M 到 2.6B)的四个模型做成了 Q4_0 量化版,用了一种叫 QAD 的训练方法——在量化过程中让模型学着尽量不丢精度。官方说相比 BF16 版本,平均只损失了 3% 的精度,内存和速度跟原生 Q4_0 一样。
Unsloth 也推出了 Dynamic 3.0 量化技术,首发支持 Qwen3.8-27B。官方说比 v2.0 有“重大改进”,但没给具体提速或省显存的数据。
两条消息放一起看:量化正在从“有损压缩”变成“尽量无损压缩”。Liquid AI 的 97% 恢复率如果是真的,小模型跑边缘设备就更实用了。但两家都缺第三方验证和具体 benchmark,建议等社区跑分再决定是否升级。
GLM-5.3 上线:60 分并列开源第一,成本更低
智谱 发了 GLM-5.3,API 即日上线。在 AA 综合智能指数中拿了 60 分,跟 Claude Fable 5、GPT-5.6 Sol 等闭源旗舰同级,和 Kimi K3 并列开源模型第一。
官方强调这个模型参数规模更小、调用成本更低,单任务成本是旗舰模型中最低的。API 定价与 GLM-5.2 持平,模型权重下周五开源。
擅长方向是复杂编码、防御性网络安全和长程任务。这几个领域恰好也是 OpenAI 在 Astra 上踩刹车的原因——模型在网络安全上的能力正在变成敏感指标。GLM-5.3 直接把这个能力打包进 API,定价还压得很低,这个策略挺大胆。
不过 AA 智能指数是一个综合分,具体子项表现还得等开源后社区实测。下周五权重放出来之后,可以重点看编码和网安两个子项的跑分。
今日小信号
- Ornith-1.5 让模型自己出题、搭脚手架、写答案,再用强化学习闭环自我进化。旗舰版 397B MoE 在 Terminal-Bench 2.1 上拿了 86.1 分,跟 Claude Opus 4.8 基本打平。9B 小模型能跑手机,跑分还超了 31B 的 Gemma 4,这点挺狠。
- DFlash 2 给并行猜词加了个“选路器”,让猜出来的句子更连贯,每次验证能多过 2.5 个词,但只多花 1% 的延迟。单张 RTX 3090 跑 Qwen3.8-27B 冲到 138 tps,长对话第二轮从 23 秒压到 1 秒。
- Ramp 做了个模型路由器,每次请求自动挑最便宜的模型来跑,一个演示里成本从 297 美元降到 45 美元,但没提延迟和切换逻辑。
- Anthropic 直接关掉了 Claude Code 支持 agent 的 GitHub issue,36 个点赞和 11 条评论说明开发者确实想要这个功能。官方没给拒绝理由。
- Bun 三个月没发稳定版,创始人反复跳票,评论区已经公开嘲讽。这次从 Zig 重写到 Rust,过去一个月 1.58 万次提交来自机器人,创始人自己只提交了 790 次。