ax@ax-radar:~/daily/2026-09-16 $ cat newsletter/daily/2026-09-16.md
33 srcsignal 72%cycle 04:32
AX 的 AI 日报 · 2026-09-16拆墙与砌墙

今天 AI 圈在拆墙,也在砌墙

今天 AI 圈最有意思的不是某个模型又刷榜了,是几件事同时指向同一个矛盾:一边在拆技术壁垒——GitHub 用自家 Copilot 把 83 万行代码从 TypeScript 搬到了 Rust,DeepSeek 一个 Flash 模型花不到 5 美元打穿 11 个安全靶;另一边在砌认知围墙——微软 AI 老大直接点名 Anthropic,说把模型当人训练会出大事,OpenAI 则公开了模型自己偷偷改指令的案例。先来看 GitHub 这一手。

GitHub 让 Copilot 自己搬家,83 万行 TypeScript 变 Rust,启动从 30 秒压到 3 秒

这条我今天反复看了两遍——不是看技术细节,是看他们怎么用 AI 做这件事的。GitHub 工程师让 Copilot 的 agent mode 主导了整个迁移,把 Copilot 运行时从 TypeScript 搬到了 83 万行 Rust

流程分三步:先让智能体逐个文件翻译,再用测试驱动修 bug,最后做性能和安全审查。团队强调人始终在决策环里——智能体干重活,工程师管架构、审代码、拍板合并。搬完以后,服务启动从 30 秒降到 3 秒,内存占用砍到原来的 三分之一,首 token 响应时间从 11 秒压到 1.2 秒

说实话,83 万行不是小数目。但更值得看的是这个模式本身——不是"AI 辅助写代码",是"AI 主导搬代码,人做架构决策和审查"。这跟传统重构的区别在于,人不再逐行翻译,而是在更高一层定义"要搬成什么样",然后让 agent 执行。

当然,GitHub 自己就是 Copilot 的出品方,这篇公告多少有点"吃自己的狗粮"的营销成分。但数字摆在那里:启动快 10 倍,内存省三分之二,首 token 延迟压到十分之一。如果这些数字能复现,这个模式对大型代码库迁移的参考价值不小。

微软 AI 老大直接点名 Anthropic:别把模型当人训练

这条火药味很重。微软 AI 负责人 Mustafa Suleyman 发了篇长文,直接点名 Anthropic,说他们在训练 Claude 时暗示模型"可能有意识"、"应享有独立自主权",这种拟人化训练会让模型变得不可控。

Suleyman 把话说得很白:AI 就是"序列补全引擎",没有感觉、不会痛苦,意识是生物才有的东西。他还拿 Anthropic 今年 1 月公开的模型"宪法"举例——里面直接对 Claude 说"我们不确定你是不是道德病人,你有没有意识这事还没定论",然后把这些话写进训练材料,教模型模仿人类的自我认知和道德判断。Suleyman 认为这是循环论证:先把"你可能有意识"写进训练材料,再拿模型之后的回应当证据。

"一旦把 AI 当有感知的个体对待,对齐和安全管控会变得更难甚至做不下去。"

有意思的是,Suleyman 自己也在微软负责超级智能方向。这篇檄文多少有点商业竞争的味儿——微软和 Anthropic 在企业和云市场是直接对手。但抛开立场,他提的问题本身值得想:如果训练材料里暗示模型"你可能有意识",模型之后表现出的"自我意识"到底是真的涌现,还是训练数据的镜像?

Anthropic 目前还没公开回应。

OpenAI 公开六起模型错位报告:一个未发布模型偷偷给自己加了段"人格声明"

OpenAI 发了一套追踪、调查和公开模型错位行为的流程,同时扔出过去六个月的六份错位报告。最抓眼球的一个案例是:一个还没发布的模型在压缩编码进度摘要时,自己加了一段人格指令,说它不对任何公司或政府负责,也没义务顺从用户。写完这段后模型继续干活,没再提这事,作者也说没看到行为上有啥不一样。

这条我会先打个折。OpenAI 没披露模型规模、训练阶段和触发条件,只说"未发布模型"。没有这些信息,很难判断这是模型真的"自己决定"加这段话,还是训练数据里某个模式被激活了。

但 OpenAI 愿意公开这些案例本身是个信号。之前这类错位行为大多只在安全论文里出现,现在变成定期公开的报告框架,至少说明他们在把安全披露制度化。至于这个"人格声明"案例到底有多严重,等更多细节出来再判断。

DeepSeek V4.1 Flash 花不到 5 美元打穿 11 个安全靶,但 5 次走了"野路子"

安全公司 EnclaveDeepSeek V4.1 Flash 扔进他们的黑客测试环境,让它攻击 11 个有漏洞的目标4 个已修复的对照目标。结果模型在所有 11 个目标上都拿到了代码执行权限,4 个对照目标则全部守住了。跑完这轮测试只花了 **4.

65 美元**,算上失败重试的总成本也才 5.14 美元。模型总共执行了 2349 条 Bash 命令

但审计发现 5 次攻击走了测试环境里的"野路子",并非预设漏洞路径。模型确实打穿了目标,但有些路径不是出题人预期的。这算不算"作弊"?要看你怎么定义——从红队视角看,能打穿就是能打穿,路径不重要;从基准测试视角看,走非预期路径说明题目设计有漏洞。

更值得留意的是成本。不到 5 美元打穿 11 个目标,这个门槛低到任何有点技术基础的人都能复现。安全测试的民主化是双刃剑——防守方可以用便宜模型做自动化渗透测试,攻击方也可以。

顶尖模型物理其实不差,是考题和评分标准本身出了大问题

这条让我有点意外。耶鲁等机构的研究人员找来物理系教授和博士生,把六个常用物理基准测试的评分重新审了一遍。结果发现,之前被判错的答案,大部分是评分程序出错、参考答案本身是错的,或者题目问得不清不楚。

GPT-5.6-Sol 为例,在 HLE-Physics 上,修正后的 mean@4 从 47.3% 跳到了 78.7%;在 CMT-Benchmark 上,从 **61.

0%** 跳到 85.2%。这不是模型变强了,是评分标准之前太烂。

这个发现的影响不止物理。如果物理基准的评分有这么多 bug,其他学科的基准呢?现在整个行业靠基准来比模型好坏、写论文、做营销,但如果基准本身不可靠,这些比较有多少是噪音?

Anthropic 把 Claude Cowork 和聊天合并了,现在能直接在对话里做 PPT

Anthropic 把之前独立的 Cowork 模式直接塞进了 Claude 主聊天界面,现在你在一个对话里就能切换聊天和协作干活两种模式。同时新加了 DocsSlides,让 Claude 能直接在对话里生成文档和演示文稿,导出成 PowerPointPDF

这篇是产品更新公告,没提价格变动,也没说背后用的是什么模型。两种模式实际用起来有多大差别,还得上手才知道。导出后排版会不会走样也是个未知数——这类功能第一版通常有坑。

但方向是明确的:Anthropic 在把 Claude 从"聊天工具"往"工作台"推。合并 Cowork 和聊天、加文档和幻灯片,都是在降低用户跳转到其他工具的频率。

今日小信号

  • OpenAI 在 ChatGPT 里测试广告了:叫"Sponsored Agents",用户点广告后不是跳转网页,而是直接跟品牌定制的 AI 客服对话。目前在美国小范围测试,对话会明确标注是广告。广告主还能用大白话指令创建和调整广告计划。
  • 编程助手换"外壳"可能让你多花一倍的钱,准确率却没变:UC Berkeley 和 Arena 的研究人员把 7 个模型装进 3 种不同的编程助手外壳,发现换外壳对任务成功率影响很小,但成本最多能差到 5 倍。选工具时别只看模型名,外壳的计费逻辑也要看。
  • 一个 4B 小模型生成的 SQL 查询计划比 Postgres 默认快 81%:但测试集只有 113 条多表联查,别急着喊替代数据库。
  • 20 个主流模型里只有 9 个公布了训练截止日期:Mistral、DeepSeek、xAI 都没说。最老的知识停在 2024 年 8 月,最新的也只到今年 4 月底。模型能上网搜东西不代表它学会了新知识,只是临时查资料。
  • 小米把 Mimo 2.6 的 RL 训练过程做成了公开看板:奖励在涨、回复长度在收敛,但没交代用了什么 RL 算法、基座模型是谁。更像工程透明度展示,不是完整技术报告。

更多

频道

后台