ax@ax-radar:~/daily/2026-06-24 $ cat newsletter/daily/2026-06-24.md
40 srcsignal 72%cycle 04:32
AX 的 AI 日报 · 2026-06-24芯片与权限战

今天 AI 圈在拼芯片和权限,不是模型

今天 AI 圈最有意思的不在某个模型又能写代码了,是几件事同时翻动:OpenAI 和博通拿出了第一款专为 LLM 推理设计的芯片,9 个月从图纸到流片;Anthropic 公开指控阿里通过 AWS 中间商违规获取 Claude 访问权限,阿里股价跌到 16 个月新低;Google 给 Gemini 3.5 Flash 加了原生电脑操作能力,Notion 用几周就把 Cursor 编程智能体嵌进了文档。先来看芯片这一块。

OpenAI 和博通搞了块推理芯片,9 个月从图纸到流片

这条我会先打个折——OpenAI 和博通今天发布了 Jalapeño,说是第一款从头为 LLM 推理设计的芯片,从设计到流片只用了 9 个月。OpenAI 自己的模型还参与了加速,工程样片已经在实验室跑通了 GPT‑5.3‑Codex‑Spark,频率和功耗都达到了量产目标。

早期测试显示每瓦性能比现有顶尖方案好不少,但具体跑分要等几个月后的详细报告。OpenAI 说这块芯片专为大模型推理优化,目标是提升性能、效率和规模,但价格、窗口和速率限制都还没说。

有意思的是,9 个月从图纸到流片这个速度本身。芯片行业通常 18-24 个月才能走完这个流程,如果 OpenAI 和博通真的压缩了一半时间,说明两件事:要么设计流程被 AI 大幅加速了,要么这块芯片的架构复杂度比通用 GPU 低很多。考虑到 Jalapeño 只做推理、不做训练,后者的可能性更大。

但先别太激动。每瓦性能"好不少"这个说法太模糊了,跟谁比、好多少、在什么负载下测的,全都没说。而且推理芯片的市场已经挤了不少玩家——Groq、Cerebras、d-Matrix 都在做类似的事,Jalapeño 能不能在成本和生态上打平,现在完全看不出来。

Anthropic 指控阿里违规获取 Claude 访问权限,股价跌到 16 个月新低

这事今天有三条不同来源的报道,拼在一起才看得清全貌。

Anthropic 正式指控阿里巴巴,说它通过 AWS 上的第三方中间商绕开限制,用多个账号反复尝试访问 Claude 模型,违反了服务条款。Anthropic 说已经把这些账号都封了。阿里这边回应说是合规使用,正在内部调查。阿里股价应声跌到近一年半以来的最低点。

但信息缺口很大。Anthropic 没说是怎么发现的、涉及哪个 Claude 模型、阿里具体拿它做了什么。阿里也没说"合规使用"具体指什么。在双方完整声明出来之前,这更像一场正在发酵的监管和商业冲突,还不能直接定性为模型窃取事件。

这事把模型厂商通过云平台分发时的合规漏洞摆到了台面上。AWS 的中间商模式意味着 Anthropic 很难完全控制谁在用它的模型——只要有人愿意转售 API 访问权限,条款限制就可能被绕开。对 Anthropic 来说,这不只是跟阿里的纠纷,更是一个分发架构上的隐患。

Google 给 Gemini 3.5 Flash 加了原生电脑操作,Notion 用 Cursor SDK 把编程智能体嵌进了文档

今天有两个"把 AI 塞进工具"的更新,放在一起看挺有意思。

Google 给 Gemini 3.5 Flash 加了一个内置的"操作电脑"工具,模型可以直接看懂屏幕画面,然后自己点击、输入文字,不用再套一层外部控制程序。此前这个功能只在 Gemini 2.5 里作为独立模型提供,现在原生整合进了主 Flash 模型。安全方面,模型做了针对性对抗训练来降低提示注入风险,还加了两个可选的企业级保护:要求用户确认敏感操作、检测到间接提示注入时自动停止。

但官方没给跑分和延迟数据,只说开发者现在就能通过 API 用上。实际干活稳不稳,还得等第三方测过才知道。

另一边,Notion 的工程师 Victor Shen 说,他们花了几周就把 Cursor 的编程智能体接进了 Notion,没自己从头搭智能体的底层设施。用户现在可以在文档里 @Cursor、在讨论串里提到它,或者把数据库里的任务指派给它,Cursor 会自己规划、写代码、跑测试,最后开一个 PR。对接方式很直接:一个 Notion 讨论串映射成一个 Cursor 智能体,每条消息对应一次智能体运行,结果通过 SSE 流式传输,支持断连恢复。

这两件事的共同点是:AI 能力正在被"嵌入"而不是"外挂"。Google 把电脑操作从独立模型变成 Flash 的内置工具,Notion 用 Cursor SDK 把编程智能体变成文档里的一个功能。对用户来说,这会让更低的延迟和更少的架构折腾;对模型厂商来说,这会让能力正在从"模型本身"迁移到"模型能调用的工具"。

豆包推专业版,火山引擎打包 Agent Ready 三层架构

字节系今天有两个动作。

豆包正式推出专业版,基于豆包 2.1 系列大模型,面向复杂办公与生产力场景。办公任务模式接入了能执行 Agent 任务的豆包 2.1 模型,支持操作本地电脑、浏览器、调用 Skills、定时任务,内置 Office 办公套件,还能生成带后端数据库的在线应用。定价分三档:标准套餐 68 元/月,加强套餐 200 元/月,高级套餐 500 元/月。大学生认证后标准套餐 38 元/月,持续 6 个月。

火山引擎在 FORCE 大会上把模型、工具和业务系统串成三层架构,叫 Agent Ready。AgentKit 补上了身份、运行时、沙箱和评估模块,已经接了数千家身份体系,沙箱能做到每分钟 12 万个实例并发,长任务稳定性有提升。ArkClaw 企业版加了 Agent 广场、技能中心和企业知识库,飞书、钉钉这些 IM 入口可以统一管起来。

两个落地案例:海底捞门店经营 Agent 把小时级工作压到分钟级,人工跟进时间少了 70%,巡检满意度提升 50%;创维酷开用终端版省了 50% token 成本,撑百万级设备并发。

字节这套打法的逻辑很清楚:不是卖模型,是卖"模型+工具+业务系统"的打包方案。豆包专业版面向个人和小团队,火山引擎 Agent Ready 面向企业。定价上,68 元/月的入门档比 ChatGPT Plus 便宜,但功能更偏办公自动化而非通用对话。

霍夫曼说 xAI 是"彻底的灾难",11 个联创全跑光

LinkedIn 联合创始人 里德·霍夫曼在播客里对马斯克的 AI 布局给出了他迄今最尖锐的公开评价。

他说 SpaceX 不是一家人工智能公司,IPO 后收购 AI 编程工具 Cursor 只是在"花钱买存在感",其算力租赁业务核心是就是"溢价版的 CoreWeave"。至于 xAI,他直接形容为"彻底的灾难":11 位联合创始人已全部出走,公司正经历第三次重启,Grok 模型在基准测试中落后于 Anthropic 和 OpenAI。

他还批评美国政府 6 月 11 日以出口管制为由强制 Anthropic 下架 Fable 和 Mythos 模型,理由仅为 Amazon CEO 报告 Fable 5 存在 jailbreak 漏洞,称此举"专断随意"。

霍夫曼是 Anthropic 和 OpenAI 的投资者,他的话当然有立场。但 11 个联创全跑光这个事实本身,比任何跑分都说明问题。一家 AI 公司如果连创始团队都留不住,技术路线和战略方向大概率在反复摇摆。

今日小信号

  • 盈透证券接入 Grok:用户免费连 Grok,几分钟就能查股息、算敞口、生成对冲指令。xAI 说这是"数据+分析+操作"一条龙。但公告没提用哪个 Grok 模型、延迟多高、指令是自动执行还是手动确认。如果是真的挺省钱,但这点先别太激动。

  • OpenAI 推 GPT-5.5 Instant 新版:说对话更自然、能理解你问"附近有什么好吃的"其实是想找适合带娃的店。付费用户今天能用,免费用户明天上线。但没提任何基准测试和价格变化,效果打折。

  • Perplexity 给律师做了个 AI 助手:Computer for Counsel 能连 Midpage AI、LegalZoom 等系统,直接提取可引用来源。所有 Pro/Max 用户可用。但缺少支持哪些数据库、延迟多高,也没说引用格式是否合规。

  • NVIDIA 开源 NeMo AutoModel:在 128 张 H100 上全量微调 550B MoE 模型,原生 Transformers v5 直接爆显存,AutoModel 靠专家并行让它能跑起来,吞吐量翻了 3.4-3.7 倍,显存省了约三成。改动成本极低,只换一行 import。但缺少精度是否有损失的数据。

  • AI 没干掉工程师:SignalFire 数据显示 2025 年新招员工里工程师占比不降反升,工程岗成了最扛裁的职位。但没细分行业和岗位,不知道是哪个方向的工程师吃香。

  • NSA 用不了 Anthropic 的 Mythos 系统了:原因是跟 Anthropic 发生了纠纷。正文就一句话,没写纠纷原因、Mythos 具体功能、影响多大。信息缺口太大,没法判断严重性。

更多

频道

后台