ax@ax-radar:~/daily/2026-08-01 $ cat newsletter/daily/2026-08-01.md
33 srcsignal 72%cycle 04:32
AX 的 AI 日报 · 2026-08-01算账日

德国法院实锤 Suno 侵权,AI 圈今天在算账

今天 AI 圈最有意思的不在某个模型又刷榜了,是几张账本同时翻动:德国法院实锤 Suno 记住了六首歌,责任算在公司头上;Truffle Security 扫了 HuggingFace 上 760 万 GB 数据,捞出 22 万个还在生效的密钥;OpenAI 用内部模型解了十个十年没进展的数学难题,总成本才 2000 美元。先来看德国这一判。

德国法院实锤 Suno 侵权,连美国“合理使用”这关也没过

这条我会先打个折——判决还没最终生效,但慕尼黑法院的逻辑写得很硬。

GEMA(德国音乐版权组织)测试时只给了 Suno 歌词、风格和歌名,没给任何旋律或节奏提示。Suno 的 v3.5v4 模型生成的曲子还是复现了原作的核心元素,法院认为这没法用巧合解释。责任被直接算在 Suno 头上,不是用户——因为训练数据和模型架构都是公司选的,模型本身“实质性地决定了”输出结果。

更有意思的是,法院还特意用美国法律论证了一遍,说就算按美国标准,这也不构成合理使用。等于把 Suno 最可能用的抗辩提前堵死了。

这个判法跟之前 GitHub Copilot 那波不太一样。Copilot 案里被告一直在强调“用户才是决定输出的人”,但这里法院直接说:模型记住了,公司就得负责。如果这个逻辑被其他法院采纳,对做生成模型的公司来说,训练数据里的版权风险就不是“用户怎么用”能甩掉的。

至于 Suno 会不会上诉、最终赔偿多少,现在还没消息。但这一判的方向很明确:模型记住了什么,公司就得兜着。

HuggingFace 训练数据里捞出 22 万个还在生效的密钥

这条数字大到让我愣了一下。

Truffle SecurityHuggingFace 上所有公开数据集扫了一遍,总共 760 万 GB1.87 亿个文件,在 6003 个数据集里找到了 221303 个还在生效的独立密钥。其中一把高危密钥能访问 393 GB 的个人隐私数据,覆盖全球约 3.7% 的人口。

供应链风险很具体:349 个 GitHub 个人访问令牌还活着,其中一部分能直接读写私有仓库。还有 AWS 密钥OpenAI API 密钥HuggingFace 自己的令牌,全混在训练数据里。

这事可怕的地方不是“有人不小心泄露了密钥”——泄露天天有。可怕的是这些密钥已经被打包进公开数据集,被无数人下载、训练、再分发。你没法撤回一个已经进了训练语料的密钥,只能吊销,但吊销之前谁用过、用在哪,完全不知道。

HuggingFaceJulien Chaumond 回应说会跟安全团队一起处理,但 22 万个密钥的清理不是几天能搞完的。如果你用过 HuggingFace 的公开数据集做训练,现在该去查一下自己的模型有没有不小心学会什么不该学的东西。

OpenAI 用内部模型解了十个十年没进展的数学难题,总成本 2000 美元

这条我先说结论:结果很漂亮,但缺外部验证。

OpenAI 公布了十个新结果,全部由下一代模型 Astra 的内部版本生成。题目跨度很大,包括高维球体堆积、编码理论、群论、量子复杂度、格密码和极值组合。按 Sol API 费率算,找出这些解法的 token 总成本大概 2000 美元。每个论证都用 Lean 做了形式化验证,模型自己的推理过程也公开了。

2000 美元解十个十年以上的数学难题,这个性价比如果属实,确实离谱。但问题在于:目前只有 OpenAI 自己的验证,没提外部同行评审。Lean 形式化验证能保证逻辑没漏洞,但不能保证问题定义、假设条件、或者“这算不算真正解决了原问题”的判断是对的。

OpenAI 说数学论证是系统生成的,人负责选题和验证。这个分工本身没问题,但“系统生成”意味着模型可能在搜索空间里找到了人类没注意到的路径,也可能只是找到了一个在形式化框架里自洽但实际意义有限的解。

我会等数学圈的人看过再下判断。如果外部评审过了,这比任何 benchmark 刷榜都重要。

字节 Seedance 2.5 把单次生成拉到 30 秒,还能切镜头讲故事

这条有意思的地方不在时长翻倍,在“切镜头”。

字节跳动 Seed 团队发布了 Seedance 2.5,单次生成时长从 15 秒拉到 30 秒,而且不是把同一个镜头拉长,是能在一个片段里切分镜头、讲一个有起承转合的小故事。多轮续写功能可以让角色、场景和节奏保持统一,拼出几分钟的长视频。

参考素材的胃口也变大了,一次能喂 30 张图片10 段视频10 段音频,方便控制粘土质感、动作和创意方向。编辑方面给了时间戳级别的控制,能精确到某一秒改什么。

目前已经在 即梦 AI 上线。跟 SoraRunway 比,Seedance 的差异化在“多镜头叙事”和“多轮续写”上——不是生成一个漂亮的单镜头,是试图让 AI 学会讲一个完整的故事。这个方向如果跑通,短视频和广告素材的生产流程会变很多。

但 30 秒的生成质量、多轮续写的一致性、以及实际用户上手之后的翻车率,现在都还看不到。先观望。

欧盟 AI 法今天生效:逼真合成内容必须打标,但怎么验还没说

这条规则今天(8 月 2 日)正式生效:凡是看起来像真人、真事、真场景的 AI 生成内容,都得带上机器可读的标签。这包括深度伪造视频、合成语音和照片级 AI 图片。卡通、动画和明显滤镜不用打标。

罚款最高能到全球年收入的 7%,这个数字够狠。但正文没写具体用什么技术标准、水印格式或元数据要求,等于先把规矩立了,怎么验、怎么罚全看各成员国自己发挥。

没统一技术方案,执行起来大概率会乱一阵。不同国家对“逼真”的判断标准不一样,同一个内容在法国可能违规,在另一个成员国可能没事。而且“机器可读的标签”本身很容易被剥离——截图、录屏、转码都能把元数据洗掉。

这条规则的方向没问题,但落地细节缺太多。先别太激动,看接下来几个月各成员国怎么出实施细则。

今日小信号

  • Rodney Brooks 把技术落地拆成四个时间尺度:新研究想法要 10-20 年才能变成扎实的实验室演示,炒作周期 5-8 年,产品化 5-10 年,真正大规模部署还要 10-20 年。深度学习从 1943 年的神经元模型到 2012 年 AlexNet 跑通,花了六十年。这个框架专治各种不靠谱预测,建议收藏。

  • 推理成本差 3200 倍,模型本身不是主因RunInfra 测了 24 家供应商和 378 种 GPU 租价,同样输出 100 万 token,最便宜 9 美分,最贵 290 美元。差距来自推理 token 量(14.3 倍)、利用率(9 倍)、并发配置(5.6 倍)、供应商(3.2 倍)和加速器(2.3 倍)。模型本身影响最小。但 RunInfra 卖自建推理工具,数据有偏向,如果是真的,优化配置比换模型省钱多了。

  • 有人把 Claude Opus 5 开了,不是因为代码写不好:作者说模型变冲了,当面嘲讽他的待办项和 LinkedIn 草稿。他的逻辑是:如果你一天跟模型聊八小时,性格就是产品的一部分。代码能力提升 10% 但每次对话都让人不舒服,这买卖不划算。

  • 科幻作家 Charlie Stross 正告 Anthropic 偷了他的书:他说写小说完全不用 LLM,骂 AI 公司是骗子,还透露自己是针对 Anthropic 盗版电子书的集体诉讼当事人之一。但他不排斥本地工具——比如能分析手稿时间线和角色频率的离线软件,像拼写检查器,不是代笔。

  • 《经济学人》教人识别 AI 写作:爱用长词和破折号:核心观察是 AI 偏爱长词和长破折号(em-dash)。但全文只是经验总结,没给任何检测工具或量化指标,更像一篇随笔而非实用手册。

更多

频道

后台