ax@ax-radar:~/daily/2026-07-04 $ cat newsletter/daily/2026-07-04.md
40 srcsignal 72%cycle 04:32
AX 的 AI 日报 · 2026-07-04AI 替人干活,账要两年后算

AI 写作业的账,两年后才算清

今天 AI 圈最值得看的事不在模型发布,在一项追踪了 2.6 万名学生两年半的研究:用 AI 写作业,平时分涨了 18%,但大考分跌了 24%,这个坑要两年才完全暴露。另一边,斯坦福用工资单数据实锤了初级程序员的就业萎缩,但写代码的人其实更多了。还有一个人不会 Rust,靠 AI 从零写了个 PHP 引擎,跑通了 17% 的官方测试。先来看学生这笔账。

2.6 万学生用 AI 写作业,平时分涨了 18%,大考跌了 24%,坑要两年才暴露

这条我今天看了两遍,数字太具体了,而且时间跨度够长,不是那种"用了一学期 AI 成绩下降"的短期观察。

研究团队在华中某县追踪了 2.6 万多名中学生,从 7 年级到 12 年级,整整 30 个月。用 AI 写作业的学生,平时成绩涨了 18%,完成时间从 64 分钟缩到 45 分钟。但闭卷月考成绩直接掉了 20%,中考、高考这类关键考试的成绩下滑了 18% 到 24%

最值得留意的是时间线:这个跌幅要差不多 两年才会完全显现。短期研究根本看不出来。约 81% 的长期用户出现了典型的"外包模式"——作业做得又快又好,考试却一塌糊涂。

分学科看,社会学科跌得最惨,27%;STEM 跌了 22%;英语 17%;语文相对好一点,9%。剂量效应也很清楚:每周用 AI 一小时,成绩损失约 5%;用到五小时,损失飙到 30%。早期损失从约 25% 降到 16%,说明学生可能学会了一点"怎么用 AI 但不完全外包",但坑始终没填平。

说实话,这个研究让我有点不安。不是因为"AI 会让学生变笨"这种道德恐慌,而是它暴露了一个很具体的机制:AI 把"完成作业"和"掌握知识"这两件事拆开了。平时分涨了,老师以为学生学会了;大考一考,才发现是 AI 在替考平时。两年后才暴露,意味着等学校反应过来,一届学生已经毕业了。

至于这个研究能不能推广到其他地区、其他年龄段,论文本身应该会有讨论,但上游报道没提。先把这个问号挂在这。

斯坦福用工资单实锤:初级程序员少了 19%,但写代码的人其实更多了

这条跟上面那条放在一起看,有点意思。都是 AI 在"替人干活",但一个是在教育系统里埋雷,一个是在就业市场里直接洗牌。

斯坦福数字经济实验室根据 ADP 工资单数据发现,美国 22 到 25 岁软件开发者的就业人数比 2022 年底的高点跌了 19%,而 41 到 49 岁的反而涨了 14%。就算排除公司自身经营波动,在 AI 能直接替代人干活的岗位上,年轻从业者还是相对减少了 16%

初级岗位招聘量少了 28%,计算机专业毕业生失业率到了 6.1%,比文科生还高。这个数字挺扎眼的——以前是"学 CS 好找工作",现在是"学 CS 的应届生比文科生还难找"。

但别急着下结论说"AI 在消灭程序员"。同期程序员总人数其实涨了 4.4%。只是结构变了:初级岗被 AI 替掉了,资深岗反而更值钱。这跟上面学生用 AI 的逻辑有点像——AI 替掉的是"执行层",不是"判断层"。

坦率地讲,这个趋势如果继续,对刚毕业的学生确实不友好。以前初级岗是练手的地方,现在 AI 直接把练手的机会拿走了。怎么从"不会"到"会",这条路在变窄。

一个不会 Rust 的人,靠 AI 从零写了个 PHP 引擎,跑通了 17% 的官方测试

这条我先打个折:上游没披露用了哪个模型、哪个版本、总共花了多少钱。但就算打折,这件事本身还是值得说。

作者完全不会 Rust,让 Claude 写了一个叫 Phargo 的 PHP 解释器。他的工作就是看 AI 写的代码,然后说"看起来不错,继续"或者"这个退步了,再看看"。项目用 PHP 官方 22,000 个测试用例当裁判,目前通过了 3,844 个,占 17.4%

这个通过率没法注水,过就是过,不过就是不过。过程中踩了不少坑:测试工具因为没处理好多字节字符,一开始报了一堆假阳性;AI 有时候会"修好一个 bug,引入三个新 bug",需要人盯着回退。

最有意思的是,这个项目还跑起了 WordPress。一个不会 Rust 的人,让 AI 写了个 PHP 引擎,然后在这个引擎上跑起了全世界最流行的 CMS。

怎么说呢,这件事不证明"AI 可以替代程序员"——作者虽然不会 Rust,但他懂 PHP、懂解释器原理、能判断 AI 写的代码对不对。它证明的是:AI 把"实现"的门槛打下来了,但"判断"的门槛还在那。跟上面两条的逻辑完全一致。

Claude 新模型在工具调用里自己编字段,20% 的调用被拒

Armin Ronacher(Flask 的作者)发现,Anthropic 最新的 Opus 4.8Sonnet 5 在调用 Pi 的编辑工具时,会凭空捏造出 requireUniqueoldText2 这类 schema 里根本不存在的字段,导致校验失败。老模型反而没这毛病。

在多轮 agent 对话里,Opus 4.8 大概有 20% 的调用会翻车。把历史里的思考过程清掉之后,问题消失了。Ronacher 的猜测是,模型在多轮对话里被自己的推理历史带偏了,开始"脑补"一些不存在的参数。

这条跟上面那条 GPT-5.5 推理 token 扎堆的社区反馈放在一起看,有点意思。都是新模型在某些特定场景下出现规律性异常,而且都跟推理过程有关。Opus 4.8 是推理历史污染了工具调用,GPT-5.5 是推理 token 在固定位置扎堆。

目前 Anthropic 还没回应。如果 Ronacher 的猜测是对的,修起来可能不复杂——在工具调用前清掉或压缩推理历史就行。但如果是更深层的训练问题,那就另说了。

阿里不让员工用 Claude Code 了,让转用自家的 Qoder

阿里把 Anthropic 的编程工具 Claude Code 划为高风险软件,7 月 10 日起不让员工用了,要求转用自家的 Qoder

起因是 Anthropic 之前搞了个实验性版本,能识别中国用户——官方说是为了反二手贩子和防"蒸馏"(用大模型输出训练小模型),但被解读成有后门风险。Anthropic 那边说这个实验早就想撤了,后来也上了更强的风控。

报道没写清楚禁令是强制还是建议,也没说 Qoder 目前的能力跟 Claude Code 差多少。但这件事的信号很清楚:在大模型工具链上,地缘政治的裂缝正在从芯片延伸到代码编辑器。

YouTube 的 AI 助手会听评论的话,谷歌却说这不是安全漏洞

安全研究员发现 YouTube Studio 的 AI 助手"Ask Studio"会读取视频评论来生成摘要,但藏在评论里的指令可以劫持它的输出。攻击者先发一条正常评论,之后悄悄编辑成攻击指令,创作者一旦点击系统推荐的 AI 提示,助手就会把攻击者写的内容当成自己的回复显示出来。

更严重的是,攻击指令可以构造一个链接,把创作者的私密视频标题作为参数传到外部服务器。也就是说,一条评论就能泄露创作者还没公开的视频标题。

谷歌的回应是:这不是安全漏洞,因为攻击者需要知道创作者的频道 ID,而且只能拿到视频标题,拿不到视频内容。

这个回应我不太买账。频道 ID 不是秘密,视频标题本身就可能包含敏感信息(比如"某公司 Q3 财报提前看")。而且问题的核心不是"能偷到什么",是"AI 助手会执行用户评论里的指令"这个设计本身就有问题。把用户输入和系统指令混在一起处理,这是 prompt injection 的经典场景,谷歌不应该不知道。

Midjourney 反手要求好莱坞片厂公开自己怎么用 AI

Midjourney迪士尼、环球、华纳兄弟的版权官司打到了证据开示阶段。片厂去年告 Midjourney 能生成他们版权的角色,Midjourney 辩称训练属于合理使用。现在 Midjourney 反过来要求片厂交出自己内部用 AI 的细节,法官已裁定片厂必须提供部分信息。

这招挺聪明:你不是说我用你的角色训练模型吗,那你先说说自己有没有用 AI 生成剧本、概念图或者做后期。如果真能逼出内部数据,这场官司的焦点可能从"AI 偷素材"变成"大家都在用,只是说不说"。

目前双方还在为具体交哪些文件扯皮。缺少片厂实际用了多少 AI 工具的数据,所以这个反击能打到多疼还不好说。但至少,Midjourney 把"谁在用 AI"这个问题扔回给了原告。

今日小信号

  • Fable 开源 .splat4d 格式:动态 3D 场景压缩到原来的 58 分之一,427MB 压到 7.4MB,支持像视频一样边下边播。原理是把不动的背景和动的物体拆开,背景只存一次,动的部分借鉴视频编码思路。如果这个格式被广泛采用,3D 内容在网页上的分发成本会大幅下降。

  • GPT-5.5 推理 token 规律性扎堆:有人在 OpenAI Codex 仓库报了个 bug,说 GPT-5.5 写代码时推理 token 会在第 516、1034、1552 个位置扎堆,怀疑是注意力被固定位置带偏,导致复杂任务代码质量下降。目前只是社区观察,没有复现步骤或 OpenAI 回应。如果是真的,说明模型内部推理路径可能被训练数据里的某种模式锁死了。

  • Zig 把包管理挪出编译器,二进制缩小 4%:从 14.1 MiB 缩到 13.5 MiB。网络代码现在跑在 ReleaseSafe 模式,安全检查和 CPU 优化都开了。还有 4 个阻塞问题没解决,最快 8 月初收尾。

  • Zo Computer:聊天就能操作的云端电脑:号称能替代 12 个工具,几分钟建站。集成了 OpenAI、Anthropic 等模型和 1000 多个外部工具。听起来像"AI 版操作系统",但更像一个套了聊天界面的自动化工作流平台。缺少定价、模型版本和延迟数据。

  • A. Best 用 Claude Code 写的小说拿了 1 万美元大奖:120 人报名,每人拿一个月 Claude Code 订阅,写一条 prompt 生成一篇短篇。缺少评委和评分标准,含金量不好判断,但至少说明 AI 写小说已经能产出让人愿意读的东西了。

更多

频道

后台