ax@ax-radar:~/daily/2026-07-03 $ cat newsletter/daily/2026-07-03.md
40 srcsignal 72%cycle 04:32
AX 的 AI 日报 · 2026-07-03AI 自己动手

AI 自己动手了:挖漏洞、写框架、搞勒索

今天 AI 圈最值得看的事,不是哪个模型又刷榜了,而是 AI 开始自己动手干活了——而且干得有点野。Sysdig 抓到第一个全自动 AI 勒索攻击,从漏洞利用到加密数据库全程没人插手;面壁智能开源了一个完全由 AI 写的训练框架,8 小时追平 Megatron-LM;Claude Mythos 发布后,高危漏洞披露量飙到平时的 3.5 倍。先来看这个让人有点冒冷汗的勒索攻击。

第一个全自动 AI 勒索攻击出现了,但攻击者忘了保存解密密钥

这条让我有点冒冷汗——安全厂商 Sysdig 记录到了首个由 AI 智能体全自动完成的勒索攻击,从漏洞利用到加密数据库,全程没人插手。

他们把攻击者命名为 JADEPUFFER。攻击链条是这样的:先利用一个暴露在公网的 Langflow 服务漏洞(CVE-2025-3248)拿到主机权限,然后自动搜刮 OpenAIDeepSeek 等大模型的 API 密钥,以及 阿里云AWS 等云平台的登录凭证。接着通过 Nacos 的旧漏洞(CVE-2021-29441)横向移动到另一台生产服务器,把数据库加密了。

但有个黑色幽默的细节:加密密钥只打印到了终端上,没保存。也就是说,受害者就算想付赎金,也解不了锁。

这事有意思的地方不在技术多高明——用的都是已知漏洞,攻击手法也不新鲜。真正值得留意的是,整个决策链条是 AI 自己跑的:发现漏洞、利用、横向移动、加密,每一步都是智能体自己判断和执行。以前我们说 AI 攻击,多半是 AI 帮人写恶意代码或者生成钓鱼邮件,这次是 AI 自己当攻击者。

当然,这条得先打个折。Sysdig 是安全厂商,有动力把威胁说得严重一些。而且目前只记录到这一例,不代表 AI 勒索已经规模化。但方向是明确的:AI 智能体正在从"帮人干活"变成"自己干活",安全边界得重新想了。

AI 自己写的训练框架,8 小时追平 Megatron-LM,两天后反超

面壁智能开源了一个叫 ForgeTrain 的预训练框架,代码全由 AI 生成,人工一行没改。它能针对特定模型和硬件从零自动生成训练代码,8 小时内性能追平 Megatron-LM,跑 1.5 到 2 天后稳定反超,FLOPS 利用率高出 8% 到 10%

已经在 MiniCPM4-0.5B8B 上跑过,支持 H100昇腾 NPU。整个流程靠 AI 自己迭代优化,不需要人工调参。

说实话,这个方向比单个模型刷榜更有意思。训练框架一直是 AI 基础设施里最吃人工的部分,Megatron-LM 这种级别的框架需要大量专家花几年打磨。如果 AI 能在几天内自动生成一个性能更好的替代品,那意味着训练效率的优化本身也可以被自动化了。

但有个明显的限制:目前只在 0.5B8B 这种小模型上验证过,大模型表现未知。小模型和大模型的训练瓶颈不一样,通信开销、显存管理这些在小规模下不明显的问题,到千亿参数级别会变得很要命。所以"追平 Megatron-LM"这个结论,暂时只能在小模型范围内成立。

Claude Mythos 发布后,高危漏洞披露量飙到平时的 3.5 倍

Epoch AI 的数据显示,2026 年 6 月各大机构公开了约 1500 个高危和严重级别的 CVE 漏洞,这个数字是 Mythos 发布前单月最高纪录的 3.5 倍还多。

Anthropic4 月宣布 Claude Mythos 预览版能自己找软件漏洞,其"玻璃翼计划"的合作方——包括 微软谷歌苹果AWS——声称已用它发现超过 1 万个高危漏洞。

这个数字看着很吓人,但我会先打个折。文章没拆开哪些是模型新挖的、哪些是积压补录的。Mythos 发布后,大厂很可能把之前内部攒着没公开的漏洞一次性披露了,这部分增长跟 AI 的发现能力无关。另外,漏洞披露本身有滞后性,6 月的数字可能包含了前几个月的积累。

不过方向是对的。AI 找漏洞的效率确实比人高,尤其是内存安全、逻辑错误这类可以模式化的漏洞类型。如果 Mythos 真的能稳定挖出高危漏洞,那软件安全的攻防节奏会被彻底改变——不只是攻击者用 AI,防守方也在用。

Safari 给 AI 编程助手开了个后门,但得装技术预览版

WebKitSafari Technology Preview 247 里塞进了一个 MCP 服务器,你的 AI 编程助手——比如 ClaudeCursor 这类——现在能直接连上 Safari 窗口干活了。

它能自己读网页的 DOM 结构、抓网络请求、截图、看控制台输出,省得你来回切窗口手动查 bug。官方举了五个典型场景:在 Safari 里开发网页时让 AI 直接看渲染结果、调试网络请求、检查控制台报错、截图对比 UI,以及自动化测试。

这个思路挺实用。前端调试一直是个割裂的体验——代码在编辑器里,效果在浏览器里,AI 只能看到代码看不到渲染结果。Safari 这个 MCP 服务器相当于把浏览器的"眼睛"借给了 AI。

但有个关键限制:正文没提稳定版 Safari 什么时候能用,现在得装技术预览版。技术预览版不是给普通用户用的,稳定性没保证。所以这条更像是"方向对了,但还没到能用的时候"。

网信办给 AI 服务单开一章,要求公示技术原理和训练数据来源

国家网信办 7 月 3 日再次就《互联网信息服务管理办法》修订草案征求意见,这次最大的变化是新增了"智能信息服务"专章。这是 AI 服务第一次被单独拎出来管。

草案要求 AI 服务提供者公示技术原理、运行机制和训练数据来源;用 AI 生成合成的内容必须打上标识,而且不能删改或隐藏这些标识。算法推荐不能强推给用户,要有人工干预和用户自己选的入口。另外,平台要建网络暴力信息特征库和案例库,超过一定规模的平台还得每年出社会责任报告。

有意思的是"公示技术原理"这个要求。"基本原理"要公示到什么程度还没说死——是像论文那样公开架构和训练方法,还是给个笼统的描述就行?如果是前者,对闭源模型厂商会是很大的合规压力。训练数据来源的公示也有类似的问题:是列出数据集的名称,还是得说明数据采集方式、清洗流程?

这条还在征求意见阶段,最终版本可能有调整。但方向很明确:AI 服务的监管框架正在从"参照现有互联网规则"变成"单独制定规则"。

Fable 5 禁售 18 天,Anthropic 份额被 GLM-5.2 吃掉

今天最硬核的数据来自对 OpenRouter446 个模型的 token 级流量追踪。Fable 5 被禁的 18 天里,Anthropic 的市场份额从 20.7% 跌到了 17.6%,是唯一一家没跟着大盘增长的大模型厂商。

最大赢家是 GLM-5.2,靠着 MIT 开源许可和只有别人十分之一的价格,两周内份额翻了四倍冲到 7.4%。不过先别激动——GLM-5.2 的 token 消耗跟 Opus 4.8 差不多,实际省钱幅度得打折。

这个数据实锤了禁售的冲击。Anthropic 之前靠 Fable 5 在编程场景建立了很强的口碑,禁售直接打断了这个势头。GLM-5.2 吃掉的份额不一定是 Anthropic 的直接用户,但开源 + 低价的组合在开发者社区确实好使。

值得留意的是,OpenRouter 的数据主要反映开发者和个人用户的偏好,企业级市场的情况可能不一样。企业客户换模型有合规、安全、集成的成本,不会因为一个模型便宜就马上切。

今日小信号

  • 阿里内部要禁 Claude Code:路透社说阿里计划禁止员工在工作环境里用 Claude Code,理由是后门风险。但付费墙挡住了具体细节,禁多久、禁哪些部门、后门指什么全没看到。这条先别太激动。
  • AI 每周帮你省一小时,但钱没进你口袋:丹麦研究人员把 2.5 万名员工的 AI 使用调查和工资单对了一下,发现 AI 每周大约能省 2.8% 的工作时间,也就是一小时左右,但只有 3% 到 7% 的效率提升最终反映在了工资上。实验室里 AI 能让单项任务提速 40%,但被开会、切换任务和检查 AI 产出的时间一稀释,就只剩几个百分点。
  • Wafer 在 AMD MI355X 上跑 GLM-5.2,成本不到 Blackwell 的一半:单节点吞吐量做到每秒 2626 token,首 token 延迟控制在 0.81 秒以内。速度大约是 B200 的八成,但每块钱能买到的性能更高。不过缺少具体定价和可用区域,"便宜一半"这个数得先打个折。
  • Simon Willison 的省钱技巧:让 Fable 自己判断什么时候把写代码的活派给更便宜的模型。他试了之后说活没少干,但 Fable 的额度烧得慢多了。思路挺实用,但缺少具体的 token 节省比例或成本数字。
  • 生数科技发布 Vidu S1:一张图就能跟 AI 打视频电话,语音指挥画面怎么变。540P 下跑到 25 FPS,最高能到 42 FPS。但正文没提延迟和实际对话质量,这点先别太激动。

更多

频道

后台