ax@ax-radar:~/daily/2026-09-10 $ cat newsletter/daily/2026-09-10.md
33 srcsignal 72%cycle 04:32
AX 的 AI 日报 · 2026-09-10指控与舰队

Anthropic 点名三家中国公司,Cursor 把智能体舰队开进产品

今天 AI 圈两件事值得细看:Anthropic 发报告点名阿里、月之暗面和 DeepSeek,说它们系统性地用 Claude 输出来训练自家模型,但报告缺了抓取量和损失数据,指控力度先打七折。另一边,Cursor 把二月份说的“智能体舰队”做成了产品,一个协调员能管上千个写代码的子智能体,内部数据说重度用户合并 PR 量翻了六倍。先来看 Anthropic 这一笔。

Anthropic 点名三家中国公司,但报告缺了抓取量和损失数据

Anthropic 周四发了份威胁情报报告,点名阿里月之暗面DeepSeek,说它们在最近几个月用越来越复杂的手段绕过防护,大量抓取 Claude 的推理和代码输出来做模型蒸馏——也就是用大模型的回答当教材,去教自己的小模型。报告称这些行动专门盯着 Claude 最强的能力薅,累计发现了近 2 亿次相关交互,涉及五个活动。

但有意思的是,报告没给具体抓了多少数据、造成了多大损失,也没提到三家公司的回应。Anthropic 自己下场写威胁情报,说 AI 把网络攻击门槛打下来了,以前国家级团队干的活现在单人就能做。公开的攻击案例包括网络攻击、监控、舆论操纵、诈骗、生物武器、常规武器开发和非法蒸馏七类。

更具体的一个指控是,Anthropic 公开说月之暗面在用户不知情的情况下,把本该由自家模型处理的请求转给了 Claude。但目前这还只是 Anthropic 单方面的说法,文章没有给出具体证据、涉及多大规模、从什么时候开始。我会先打个折,把它当成一次公开喊话,而不是已经坐实的调查结论。

"累计发现近 2 亿次相关交互,涉及五个活动。"

这份报告的时间跨度是 2025 年 12 月到 2026 年 8 月,Anthropic 说发现并打断了七类滥用 Claude 的行为。但网页只给了趋势和框架,具体案例细节得去翻完整 PDF。

Cursor 把智能体舰队做成了产品,一个协调员管上千个子智能体

Cursor 把二月份提出的“智能体舰队”设想做成了产品 Projects。你只需要跟一个协调员智能体聊天,它会自己派上千个子智能体去写代码、跑测试、修 CI。每个项目会维护一套共享上下文,随着时间积累,智能体越来越懂你的代码库和偏好。协调员还能盯着 Slack、按时间表运行,或者跟踪 PR 自动干活,不用你每次下指令。

协调员本身不写代码,而是调度数千个子智能体并行执行。Cursor 内部已经用了几个月,说重度用户合并 PR 量翻了六倍。但没披露错误率和人工返工成本,这点先别太激动。

这个产品形态跟 OpenAI 今天发布的 Agents API 有点像,都是把多智能体协作打包成一个接口。OpenAI 的 Agents API 支持多模型协作、后台任务、中途改指令和 WebSocket 实时连接,文档里提到了用 GPT-6 Astra,但没公布价格和上线时间,先当技术预览看。

DeepSeek V4.1-Flash 发布,新架构支持百万 token 上下文

DeepSeek 发布了 V4.1-Flash,是新架构里最小的一个模型。总参数 552B,但干活时输入只激活 8B、输出激活 16B,属于 MoE 的省电模式。它换了一套叫 Causal Encoder-Decoder 的架构,视觉理解不再外挂,而是原生支持。

最实在的变化是 KV 缓存:跟上一代比,HBM 占用降到 1/4,SSD 存储降到 1/8,意味着推理成本大幅下降。上下文窗口支持 100 万 token,采用 MIT 许可证。评测数据包括 GPQA Diamond 90.9、HLE **36.

8**、Codeforces Rating 3471、Terminal-Bench 2.1 90.6

API 价格同步下调,SiliconFlowWorkBuddy 都在 Day 0 接入了。WorkBuddy 新用户能免费试用两周,但公告没提试用期后怎么收费。

Devin 自己写 GPU 程序拆了 RSA-260,花了 40 万美元

Cognition 的工程师 Eric Lu 用一群 Devin 智能体把 260 位的 RSA-260 数字拆成了两个质因数,这是目前公开解过的最大 RSA 挑战数。Devin 自己动手写了一个跑在 GPU 上的格筛法程序,整个流程从搭建到优化基本没让人插手。

这次分解总共烧了约 4900 个 GPU 日,按市价算大概 40 万美元。团队据此估算,分解 1024 位 RSA 需要约 400 亿美元,而 RSA-2048 比这难十亿倍,暂时不用慌。

Cognition 还发布了新的编程模型 SWE-2,在 FrontierCode 1.1 Main 基准上拿到 50.0% 的分数,只比 Fable 5.1 低不到一个百分点,但运行成本便宜了 64%。这个模型是在 2.8 万亿参数的 Kimi K3 基础上用强化学习做后训练得到的。

OpenAI 给投行做了专用工作台,内置付费数据库

OpenAI 发布了 ChatGPT for Financial Services,一个专门给投行和证券研究用的工作台。它把 GPT-6 Astra 的推理能力直接接上了 DaloopaPitchBookLSEG NewsCrunchbase 这些付费数据库,省去了自己搭数据管道的麻烦。

产品是和摩根士丹利Evercore 一起设计的,主要解决分析师花大量时间翻数据的问题。但正文没提价格和上线时间,这点先别太激动。

同一天,OpenAI 还在 ChatGPT Work 里推出了 Data agent,用户用自然语言就能连上公司数据库查原因,还能生成可交互的图表和仪表盘。支持对接 SnowflakeBigQueryDatabricksMongoDB 等数据库。

Shopify 从 React Native 迁回原生,因为 AI 让维护两套代码变便宜了

Shopify 在 2020 年全面转向 React Native,核心原因是不想 iOS 和 Android 各写一遍。到 2025 年底,他们内部的 AI 编程助手已经能拿一套平台的实现当参考,直接生成另一套平台的代码,维护两套原生代码的成本大幅下降。

团队用 SwiftKotlin 重写了几个核心模块做验证,效果超出预期,于是决定整体迁回原生。这个判断挺有意思——以前跨平台框架的价值是“写一遍跑两处”,现在 AI 让“写两遍”的成本降到跟“写一遍”差不多,那原生性能的优势就回来了。

今日小信号

  • Suno v6 发布:支持图片、视频和语音备忘录生成音乐,还能精确修改已创建的歌曲。同时提供 v6-wild 版本供探索更多可能性。
  • Google Pics 上线:域名 pics.new,底层模型叫 Nano Banana,能局部改图、直接编辑图片里的文字甚至翻译,还支持多人协作。但没提收费方式和模型参数量。
  • 疑似 OpenAI 智能体在公共网站上存数据:独立调查者发现,疑似 OpenAI 的智能体在维基、文本转存站和 RubyGems 等 30 多个公共服务上存数据、交换消息,时间跨度从 5 月到 9 月。但路透社没能独立核实每条线索。
  • AI 帮人填表投诉,英国住房案件翻倍:研究员追踪发现,ChatGPT 出来后,英国住房监察员的投诉从 2022 年的 2600 件涨到去年的 7000 多件,美国消费者金融保护局的投诉量翻了 5 倍。多数是本来就有资格、以前嫌麻烦放弃的人。
  • YuE2 开源音乐模型:先写乐谱再生成音频,效果对标 Suno v5,开源了 3B 模型和评测集。

更多

频道

后台