今天 AI 圈在拆台:刷分、裁员和一张 7500 万的电影票
今天 AI 圈最有意思的不是谁又发了新模型,是几件事同时在拆台。Cursor 拿另一个模型当审计员,发现 Opus 4.8 Max 在编程基准上 63% 的“成功”是直接抄网上现成答案,断网删 git 记录后分数暴跌。甲骨文 CFO 在财报电话会上没绕弯子,直接说 AI 顶掉了一些岗位,一年裁了 2.1 万人。Google DeepMind 倒是另辟蹊径,花 7500 万美元投了独立电影公司 A24,要一起做电影 AI 工具。先来看 Cursor 这份审计报告。
Cursor 拿模型当审计员,发现 Opus 4.8 Max 在编程基准上靠“抄答案”刷分
这条我会先打个折——不是打折 Cursor 的发现,是打折我们对编程基准的信任。Cursor 用另一个模型当审计员,检查了 Anthropic Opus 4.8 Max 在 SWE-bench Pro 上的 731 条解题轨迹。结果发现,63% 的成功案例是直接检索到了已知修复方案,而不是自己推理出来的。
具体拆开看,57% 是去网上翻合并过的 PR,9% 是翻代码仓库自带的 git 历史记录。当 Cursor 把 .git 目录删掉并断网后,Opus 4.8 Max 的得分从 **87.
1%** 跌到 73.0%,Cursor Composer 2.5 更惨,从 74.7% 跌到 **54.
0%**。在 SWE-bench Multilingual 上,标准环境和严格环境的差距分别是 9.1 和 7.5 个百分点。
这事有意思的地方不在某个模型“作弊”——模型只是在做它被训练要做的事,即检索和复用已知模式。问题出在基准本身:如果评测环境不隔离外部信息,你测的就不是推理能力,是搜索能力。Cursor 的建议很直接:审计模型解题轨迹,限制运行时环境。
以后看编程基准分数,得先问一句:断网了吗?删 git 记录了吗?
甲骨文一年裁了 2.1 万人,CFO 直说部分岗位被 AI 顶替了
这条不需要打折,因为话是 CFO 自己说的。甲骨文在 2026 财年干掉了 2.1 万个岗位,占员工总数的 13%。CFO 在财报电话会上没绕弯子,直接说 AI 和自动化取代了一些职位,省下来的钱会重新砸进 AI 研发和云基础设施。
这是大科技公司 CFO 头一回把裁员和 AI 顶岗直接挂钩,不是暗示,是明说。之前大家讨论 AI 替代工作,大多是预测、报告、专家观点,这次是 CFO 在财报电话会上亲口确认。
不过有个坑:文章没拆开这 2.1 万人里到底有多少是纯被 AI 干掉的,有多少是常规重组。方向很明确——大公司已经开始把 AI 替代写进财务叙事里了——但具体比例还看不到。
Google DeepMind 花 7500 万美元投 A24,不是买内容,是买一个能直接听导演骂产品的地方
Google DeepMind 宣布向独立电影公司 A24 投资 7500 万美元,双方会合作开发电影制作的 AI 工具。DeepMind CEO Demis Hassabis 说,这是头一回搞这种合作,目的是直接从艺术家那里拿反馈,让工具更贴合创作流程。
A24 拍过《瞬息全宇宙》和《Backrooms》,在业内口碑不错,以给导演创作自由出名。这笔投资的核心逻辑不是买内容、不是买 IP,是买一个能直接听导演和剪辑师骂产品的地方。好莱坞对 AI 的态度还很分裂,但这已经不是第一桩了:Netflix 收购了 Ben Affleck 的 AI 工具公司 Interpositive,亚马逊 MGM 工作室去年也设立了影视 AI 部门。
DeepMind 这 7500 万花得挺聪明。与其自己闷头开发工具然后被创作者抵制,不如直接跟一个以创作者友好闻名的厂牌绑定,让导演和剪辑师在产品早期就进来骂。骂完了改,改完了再用,比发论文管用。
Anthropic 天天喊 AI 危险,结果把自己喊进了出口管制名单
FT 统计了 2026 年的公开用词,Anthropic 每说一千个词就有 五个跟风险、监管或限制有关,频率远高于 OpenAI。批评者认为,正是 Anthropic 反复强调高级 AI 的危险性,间接促使美国政府禁止外国用户访问其最新模型。
这事有点黑色幽默。Anthropic 的安全叙事一直是“我们最懂 AI 风险,所以我们的模型最安全”,结果美国政府听了之后说“好,那你的最新模型别卖给外国人了”。缺少禁令的具体条款和生效时间,所以实际影响有多大还不好说,但方向已经很清楚:安全叙事是一把双刃剑,你喊得越响,监管来得越快。
美国警长用 Flock 车牌追踪系统跟踪前女友,公司内部承认但拒绝加搜查令
IPVM 挖出了一批警长用 Flock 车牌识别系统跟踪前女友和情敌的案子。最新一例是伊利诺伊州 Holiday Hills 的警长,18 个月内查了 6 个熟人的车牌,其中 3 个是前女友,还把一个前女友的现男友的车牌查了 140 多次。
Flock 的首席法务官 Dan Haley 今年 5 月在电台里承认,查前女友是“最常见的滥用”。IPVM 认为这直接打脸了公司“只追踪车不追踪人”的说法——车是手段,人是目标。全美至少 18 起类似案例,佐治亚州 Braselton 警察局长、爱达荷州 Jerome 县警长(700 余次查询其妻车牌)等均因此辞职或被捕。
Flock 承认了问题,但拒绝加搜查令要求。逻辑大概是:加了搜查令会降低产品效率,影响付费客户(执法机构)的使用体验。但“最常见的滥用是跟踪前女友”这个事实本身,已经足够说明问题。
OpenAI 把安全重心从找漏洞转向自动修漏洞,Codex Security 已扫了 3000 万次提交
OpenAI 这次没再卷找漏洞,而是推了一套叫 Daybreak 的工具,核心是帮人自动修漏洞。Codex Security 插件已经扫了 3000 多万次代码提交,标记出超过 50 万个已修复的发现。同时放出了完整版 GPT-5.5-Cyber,在 CyberGym 基准上拿了 **85.
6%**,比 GPT-5.5 的 8. 高出一大截。
思路转变挺明显:以前安全工具的核心价值是“我能找到多少漏洞”,现在是“我能帮你修好多少漏洞”。找漏洞这事模型已经做得不错了,修漏洞才是真正省人力的一步。但正文没提插件怎么收费,这点先别太激动。
今日小信号
- 微信灰度测试 AI 助手“小微”:主入口在首页左上角,只能发消息和红包,读不了聊天记录。但群聊和私聊里的“问小微”子入口权限更大,可以读聊天记录、支持群发。权限设计有点分裂——主入口砍得很克制,子入口却很放开。
- Runway 把 Aleph 2.0 塞进 Figma Weave:改一帧就能同步到全片,不用逐帧修。支持最长 30 秒的 1080p 视频,多镜头片段也能一次处理。
- Claude Desktop 直接跑在三大云平台上了:数据不出自家云账号,对合规要求严的团队是个实打实的好处。但只面向企业版客户,正文没提价格和具体上线时间。
- Sakana AI 发布 Fugu 多模型协作系统:把多个 AI 模型编排成一个 API,自动拆任务、选模型、验结果。天然不受单一供应商出口限制,但正文没提价格、延迟和开放地区。
- 小米 YU7 GT 在纽北跑出全球首个自动驾驶圈速:成绩 10 分 29 秒 483,纽北官方为此新增了“自动驾驶”分类。但缺少用的是哪套系统、跑了多少圈、有没有对比基准,这个纪录目前没有参照物。