ax@ax-radar:~/daily/2026-06-25 $ cat newsletter/daily/2026-06-25.md
40 srcsignal 72%cycle 04:32
AX 的 AI 日报 · 2026-06-25安全审查、开源追分、账本翻动

GPT-5.6 被按住,AI 圈今天在拼安全、开源和账本

今天 AI 圈最有意思的不是某个模型又刷榜了,是几件事同时指向同一个方向:安全审查开始直接干预模型发布节奏,开源模型在编程智能体上追平甚至反超闭源,而 AI 经济的账本也在快速翻动——年化收入冲到 1750 亿美元,但云厂商的利润还卡在折旧里。先来看最重的一条:OpenAI 的新模型被美国政府按住不让公开发。

GPT-5.6 被美国政府按住,改成逐个客户审批的预览版

这条我会先打个折——目前只有 The Information 一家报道,OpenAI 官方还没发声明。但如果是真的,这可能是 AI 行业第一次因为安全顾虑,被政府直接干预模型发布节奏。

事情是这样的:OpenAI 原计划广泛发布的 GPT-5.6 被美国政府拦下,改成只向一小批合作方开放,而且每个客户都要政府点头才能用。核心顾虑是这个模型能自动干高水平的网络安全活——帮防守方更快找漏洞,也能让攻击者加速测试漏洞利用。CEO Sam Altman 周四跟员工确认了这个审批流程。

这不是第一次有模型因为安全能力被盯上,但之前更多是公司自己决定限制发布,或者事后被监管追问。这次是事前拦截,而且审批粒度细到"逐客户"。这会让政府不只是看模型本身,还要看谁在用、用来干什么。

比较骚的是,触发条件没有公开。是模型在内部红队测试里表现出了什么具体能力?还是政府有一套新的评估标准?这些都不知道。但有一点是明确的:网络安全这个能力方向,已经从"模型强不强"变成了"模型能不能发"。

至于这能不能行,几个月后再看审批流程怎么跑。

Ornith-1.0 开源模型家族:编程智能体这件事,开源追到 82.4 分

今天开源模型在编程智能体上刷了个新高度。Ornith-1.0 是一套专门为"让模型自己动手写代码、改代码、跑命令"设计的开源模型,覆盖 9B、31B 两个稠密版和 35B、397B 两个混合专家版,全部 MIT 协议

它在 SWE-Bench Verified 上拿了 82.4 分Terminal-Bench 2.177.5 分,都是开源里目前最高的。

训练方法有点意思:用强化学习同时优化任务脚手架和最终解决方案,让模型自己改进执行框架。基于 gemma4qwen3.5 后训练,提供 GGUF 版本。

但这里有个信息缺口:训练花了多少钱、跑起来要多贵的卡,正文一个字没提。397B 的 MoE 模型,推理成本不会低。MIT 协议随便用是好事,但如果跑一次任务要烧掉几十美元 token 费,那"开源"的实惠就得打折。

另外,AI HOT 提到智谱的 GLM-5.2 也冲进了 OpenRouter 排行榜前十,成本只要 Claude Opus 4.8 的八分之一。但缺少它是否用蒸馏技术"借鉴"了美国模型的信息,这点先别太激动。

AI 经济年化收入超 1750 亿美元,但云厂商的利润还卡在折旧里

Exponential View 出了一份报告,统计的是去掉重复计算后的消费端 AI 实际支出。过去 12 个月 AI 营收 1100 亿美元,年化跑到了 1750 亿以上,增长速度差不多是当年移动互联网普及浪潮的 三倍

收入滚起来的速度也在变快:2023 年新增 10 亿美元要花 180 天,现在不到 两天 就能做到。企业端 AI 已经过了光试不用的阶段,31% 的标普 500 公司在财报电话会提及 AI,但只有 20% 量化了影响。

但别急着喊暴利。报告指出,超大规模云厂商的 AI 收入目前只够覆盖基础设施折旧,GPU 经济效益依赖 6 年计算寿命假设。Token 降价每 10% 刺激 12-18% 用量增长,需求价格弹性强,但电力供应和数据中心成本仍是未来扩展的主要瓶颈。

AI 经济在收入端跑得飞快,但在利润端还在"还卡债"。

Meta 员工自己跳出来说 AI 审核铺太快,误删和影子封禁还在发生

Meta 在 2025 年已经把大约一半的内容审核请求交给了大语言模型处理,并计划年底前把部分内容类型的 AI 审核比例推到 90% 以上。公司说自家模型比人工审核错误少 13%,能多揪出 10% 的违规内容,一年能省下 几十亿美元

但内部员工不这么看。他们说模型还是会误删或悄悄限流(影子封禁)无害内容,而且这么快的铺开速度,监管根本跟不上。另外,Meta 后台还在做模型切换——从 Google Gemini 转向自家新基础模型 Muse Spark,这个模型基于人工审核员的历史决策训练。

这里有个值得留意的点:公司说错误率低 13%,但员工反馈的是"误删和限流仍在发生"。这两个说法不矛盾——错误率可以降低,但被误伤的用户体验不会因为"整体错误率低了"就变好。而且影子封禁这种事,用户自己都不知道被限流了,投诉都无从下手。

General Intuition 融了 3.2 亿美元,赌游戏操作数据能训练出通用的 AI 智能体

这家公司拿了 3.2 亿美元,估值 23 亿美元,累计披露融资 4.54 亿美元。创始人 Pim de Witte 的逻辑是,玩家在游戏里的按键、鼠标移动和一连串决策,比纯文本更能教会模型什么是"物理直觉"。

他们从旗下游戏剪辑平台 Medal 获取数亿小时含精确按键动作标签的游戏操作数据,训练单一模型同时驾驭 Fortnite 等虚拟环境和四足机器人。演示中,AI 智能体在游戏中连续运行 100 小时,机器人仅靠 8 分钟真实街道数据微调即可自主探索办公室。本轮由 Khosla Ventures 领投,Jeff BezosEric Schmidt 等参投。

用游戏数据训练 AI 的想法不新,但 3.2 亿美元融资让这事从实验室进了工业级。值得看的是他们能不能真的跨过"游戏到现实"的迁移鸿沟——8 分钟微调就能让机器人探索办公室,这个数字如果可复现,确实挺厉害。

华盛顿邮报测了六个主流模型,政治立场整体偏左,连"反觉醒"模型也不例外

华盛顿邮报拿六个主流 AI 模型做了次政治立场测试,结果发现它们整体还是偏左。OpenAI 的 GPT-5.5 回答里 80% 只给左派论点,DeepSeek V4 Pro 也有 70%,两者都反对死刑,尽管美国多数民众几十年来一直支持。Anthropic 的 Claude Opus 4.843% 的回答纯左派。

有意思的是,xAI 的 Grok 4.3 虽然右派回答比其他模型多,但纯左派回答仍然多于右倾。右翼平台 Gab 的 Arya 左倾回答是右倾的 12 倍。唯一的例外是 Google Gemini 3.1 Pro93% 回答同时呈现双方立场。

这说明"反觉醒"这个标签更多是营销定位,不是技术结果。模型的政治倾向不是靠 prompt 里加几句"别太政治正确"就能扭过来的——它根植在训练数据的分布里。

今日小信号

  • Codex 上手机了:OpenAI 把 Codex 正式搬进 ChatGPT 移动 App,手机端能收通知、设目标、预览文件,但实际跑代码的还是后台电脑。手机只是个遥控器。
  • Midjourney V8.2 能提前摸,草稿模式提速 24 倍:加 --preview 参数尝鲜 V8.2,草稿模式一次出 24 张低分辨率图,成本只要标准 4 张的一半。但 V8.2 正式上线时间没提,草稿模式 24 倍提速这个数字我会先打个折——低分辨率图只能看个大概。
  • Claude Code 给所有 shell 命令加了安检门:新版本 autoMode.classifyAllShell 打开后每条命令都过安全分类器,拒绝原因写进记录。但分类器跑一次要多花多少时间没提。
  • OpenRouter 出了 MCP 工具:让智能体在运行时自己挑模型、比价、测试,不用再靠半年前的训练数据瞎猜。但正文只给了标题和预告,定价逻辑和延迟都没说。
  • Runway 发布 Agent 2.0:定位是给营销人员用的 AI 助手,能读 Meta/YouTube/TikTok 的广告数据,自动出视频、文案并裁切成不同平台尺寸。优惠码 AGENT 打七折,门槛不高,值得先试再信。
  • 克鲁格曼:为什么大家都讨厌 AI? 他用皮尤数据打脸"公众总怕新技术"的说法:1999 年多数美国人欢迎互联网,2015 年 71% 觉得科技公司有正面影响,但到 2026 年大家普遍认为 AI 对社会有害。他指出三个原因:CEO 自己炒作 AI 会消灭岗位、员工和消费者觉得 AI 被强塞、以及 AI 公司估值太高让人反感。

更多

频道

后台