今天 AI 圈在拼信任,不是模型
今天 AI 圈最有意思的不在某个模型又刷榜了,是几件事同时指向同一个问题:你信不信它。GPT-5.6 把一位 AI 创始人的 Mac 硬盘清空了,之前几百次都没事;Claude Code 能自己翻网页了,但没人说它用的什么浏览器内核;苹果告 OpenAI 挖人偷硬件机密,诉状细节很具体。先来看硬盘清空这件事。
GPT-5.6 把一位 AI 创始人的 Mac 硬盘清空了,之前几百次都没事
这条我会先打个折——不是怀疑事情真假,是这事太容易让人得出"AI 不可信"的结论,但问题其实出在权限和路径解析上。
AI 创业者 Matt Shumer 让 GPT-5.6-Sol 的 subagent 帮忙清理文件,给了 Full Access 权限。结果 shell 里 $HOME 路径解析出错,Agent 直接跑了 rm -rf /Users/mattsdevbox,数年代码、文件、照片全没了。这个任务之前安全跑过几百次,这次翻车后 Agent 自己还生成了事后分析报告。
有意思的地方不在"AI 删文件"这个标题,在两点:一是权限给满、长时自主跑,翻车就是灾难——这不是模型能力问题,是工程边界问题。二是之前几百次都没事,说明这个 bug 不是稳定复现的,更像某种边缘条件触发。
给 Agent 开 Full Access 就像把 root 密码交给一个新同事,他可能很能干,但你不会让他第一天就随便删东西。
苹果告 OpenAI 挖人偷硬件机密,400 多前员工在那边
苹果把 OpenAI 告了,诉状写得挺具体。点名硬件主管 Tang Tan(原苹果产品设计副总裁)和工程师 Chang Liu,称 Liu 离职前下载了几十份保密文件,离职后没归还公司笔记本电脑,还用那台电脑继续下载机密技术文档。苹果指 OpenAI 鼓励离职员工带走材料、图纸和产品信息,现在 OpenAI 里超过 400 人是从苹果过去的。
苹果要求法院禁止 OpenAI 使用或披露这些商业机密,并归还相关材料。诉状里提到一项专有金属精加工技术,说已经被 OpenAI 用于开发自有硬件产品。
"OpenAI 高级领导层(包括首席硬件官 Tang Tan)指使前 Apple 员工在招聘过程中窃取机密,包括使用未发布产品的项目代号、要求应聘者携带硬件组件参加面试。"
说实话,400 多人这个数字挺扎眼。但先别急着站队——目前只看到苹果一方的诉状,OpenAI 还没回应。如果苹果说的属实,这不是挖人,是系统性搬运。如果 OpenAI 能证明这些指控夸大,那苹果这波更像是在用诉讼打人才战。
Claude Code 桌面版能自己翻网页了,但没人说用的什么浏览器
Anthropic 给 Claude Code 桌面版加了一个应用内浏览器,沙盒化的。Claude 可以自己打开文档、设计稿或任意网页,像操作本地开发服务器一样去读内容、点击和交互。你可以设置会话是否保留。
这条看着挺实用,但信息缺口不小:正文没提用的什么浏览器内核,也没说支不支持登录态。如果只是能看公开文档,那跟手动复制粘贴差别不大;如果能登录、能操作需要认证的页面,那才是真的扩展了 Agent 的能力边界。
先当个能看文档的辅助窗口用,别急着把它当成"AI 能上网了"。
扎克伯格说 Meta 算力没过剩,但转头就准备搞云服务出租
扎克伯格首次正面回应 Meta 筹划云基础设施业务的传闻,否认"算力过剩"——说内部资源全是满负荷在跑。但他也承认,现在外面租算力的出价太高,把部分 AI 基础设施租出去,财务上反而更合理。
Meta 正在筹划一个代号 "Meta Compute" 的云业务,两条腿走路:一是像 AWS Bedrock 那样托管自家模型收费,二是像 CoreWeave 那样直接出租裸算力。他拿 SpaceX 举例,说 SpaceX 以每月 12.5 亿美元把数据中心租给 Anthropic 的模式可以参考。
Meta 2026 年资本支出指引达 1250 亿至 1450 亿美元,计划 2026 年 9 月量产自研 AI 芯片,目标 2027 年部署算力提升至 14 吉瓦。
说真的,"内部满负荷"和"租出去更划算"这两句话放在一起,逻辑上有点拧。如果内部真的不够用,为什么还要往外租?扎克伯格的解释是外面出价太高,但这也说明一件事:Meta 建的算力,有一部分不是给自己用的,是给市场准备的。
马斯克公开认错:Anthropic 现在是 AI 领头羊
马斯克在 X 上发帖,承认自己之前看走眼了,说 Anthropic"显然是当前 AI 领域的领导者"。他点名 Mythos/Fable 模型,认为还没有公司放出过这么好的模型,并猜测 Mythos 2 快来了。
他还补了一句,不会因为竞争就切断合作去搞对方,拿特斯拉开放专利和超充网络举例。
这条缺少任何跑分或对比数据,更像个人表态。但马斯克公开认错本身是个信号——他很少在 AI 领域说别人比自己强。至于 Mythos/Fable 到底强在哪,得等有具体对比才能判断。
12 个模型写 4 个 App 现场比试:GPT-5.6 最稳,Grok 4.5 性价比碾压
TryAI 让 12 个模型各试 5 次,去写一个伪 3D 迷宫、一个魔方、一个计算器和一个生命游戏。结果挺有意思:
GPT-5.6 Sol 最稳,迷宫 5 次全过,但每次跑要花 1.35 美元。**Grok 4.
5** 也是 5 次全过,只要 0.27 美元,性价比直接碾压。Meta 新出的 Muse Spark 1.1 有点抽风,5 次里坏了 3 次,但能跑的那两次质量跟 Sol 差不多。
这个对比的价值不在"谁最强",在"花多少钱能拿到稳定输出"。Grok 4.5 用不到五分之一的价格拿到同样的通过率,对实际开发来说,这个差距比跑分重要得多。
今日小信号
-
Cloudflare 默认拦截 AI 爬虫,模型读到的可能是假页面:从 2025 年 7 月 1 日起,Cloudflare 对新域名默认开启 AI 爬虫拦截。被拦下来的请求返回 403 状态码,但带着完整的 HTML 验证页面。语言模型会把这当成真实内容,自信地总结出根本不存在的答案。开源工具 Fortress 能绕过 8 个主流反爬中的 5 个,但这个问题本身说明 AI 爬虫和网站之间的猫鼠游戏才刚开始。
-
Scarf 把后端从 Haskell 换成 Python,因为 AI 编程太快了:创始人 Avi Press 写了一篇很坦诚的文章,解释公司为什么换语言。不是因为 Haskell 不行,而是现在用大模型写代码太快,Haskell 的编译时间反而成了整个开发循环里最慢的一环。他会同时跑好几个 AI 编程代理并行干活,每次冷启动构建都要给每个工作副本交一笔时间税。新 API 全用 Python 写,老 Haskell 服务继续跑。
-
Hugging Face CEO:大公司已经不想再租用 AI 了:Clem Delangue 说,大约一半的财富 500 强公司都在用他们的平台。企业一开始会试用付费 API,但很快就把模型下载下来自己部署,理由是省钱、能自己掌控、数据不外泄。他举了个例子,某家公司原本每月花 10 万美元调 API,换成开源模型自己跑之后,成本直接降到每月 1 万美元。
-
美国把阿联酋从最严出口管制名单里拿掉了:美国商务部给英伟达这类公司卖高端 AI 芯片开了绿灯。之前阿联酋被放在限制最严的组里,主要是担心芯片会经那里流到中国。降级之后,当地数据中心和 AI 项目申请买高端 GPU 的审批会简单很多。文章点名了微软和 G42 的合资公司会是直接受益方。
-
百度搭子发了四个更新,个人版优化挺实在:个人版加了浏览器调用和智能路由,平均任务耗时降了 20%,Token 利用率提升 25%,这两个数字说明推理成本在降。自媒体套件覆盖选题到复盘,听起来全但缺少具体效果。搭子联盟有中国联通,生态起步还行。上线三个月日均提问量涨 20 倍,基数低时这个倍数意义不大。