苹果三连发,算力账本和记忆面板同时翻页
今天 AI 圈最忙的是苹果,一口气发了 M6 Mac mini、M5 Ultra Mac Studio 和 M6 芯片,把 2 纳米和四芯片封装同时端上桌。但更值得看的是两张账本:Dylan Patel 算了笔账,说 Anthropic 和 OpenAI 到 2028 年会吃掉全球大部分算力;Claude 的记忆功能打通了聊天和 Cowork,你能逐条看它记了什么。先来看苹果这一波。
苹果三连发:M6 上 2 纳米,M5 Ultra 堆四芯片,Mac mini 和 Studio 一起换芯
苹果今天一口气发了三款硬件,核心是两颗新芯片和两台新机器。
先说芯片。M6 是苹果第一颗 2 纳米桌面芯片,12 核 CPU 加 12 核 GPU,神经网络引擎翻倍成两个 16 核模块,统一内存带宽提到 170 GB/s。官方说单核性能全球最快,多核比 M5 强 1.2 倍,GPU 的 AI 峰值算力比 M5 高了近 30%。
M5 Ultra 走另一条路,用四芯片封装堆出最高 36 核 CPU 和 80 核 GPU,内存带宽拉到 1.2TB/s,比 M3 Ultra 高了 50%。这个带宽意味着本地跑大模型时,模型权重在内存和计算单元之间搬运的瓶颈会小很多。最高支持 512GB 统一内存,四台 Mac Studio 集群可以带来最高 3 倍的分布式 AI 推理速度提升。
机器这边,Mac mini 可选 M6 或 M5 Pro。M6 版相比 M4 的 AI 性能最高提升 4 倍,官方称在 LM Studio 里跑大模型提示词比 M1 快 13.5 倍,图形和存储速度翻倍,CPU 快 40%。苹果把它定位为"始终在线的智能体计算桌面",意思是这台小机器可以一直开着跑本地 agent。两款都支持 Wi-Fi 7、蓝牙 6 和 2.5Gb 以太网(可选 10Gb)。
Mac Studio 搭载 M5 Max 或 M5 Ultra,AI 性能最高提升 4.3 倍,图形性能提升 1.8 倍,存储速度提升 2 倍。今天起预购,9 月 22 日开售。
有意思的是,苹果这次没提 Mac mini 的价格和上市日期。M6 这颗 2 纳米芯片先塞进 Mac mini 而不是 MacBook Pro,说明苹果可能在用相对小批量的桌面机型来磨合新制程的良率。M5 Ultra 的四芯片封装也是个信号:苹果在认真考虑让桌面机成为本地大模型推理的算力节点,而不只是创意工作者的工具。
Dylan Patel 算了笔账:到 2028 年,Anthropic 和 OpenAI 会吃掉全球大部分算力
SemiAnalysis 创始人 Dylan Patel 在播客里算了笔账,结论挺直接:今年全球新增算力里,Anthropic 和 OpenAI 两家就拿走了约 30%,明年这个比例会涨到 40% 到 50%,按这个趋势到 2028 年,全球大部分可用的算力都会集中在这两家手里。
背后的驱动力是单位经济模型。Anthropic 现在每兆瓦推理算力能产生最高 5000 万美元收入,这个变现效率让它们能在算力采购上出价比其他玩家高。Dylan Patel 的逻辑是,谁能把算力变成更多钱,谁就能在算力市场里抢到更多份额,这个飞轮转起来以后,集中度只会越来越高。
这个判断如果成立,意味着几件事。第一,云厂商和芯片厂商的客户集中度会急剧上升,定价权和产能分配会越来越向这两家倾斜。第二,开源模型和中小玩家的算力成本可能会被推高,因为产能被大客户锁死了。第三,监管机构迟早会盯上这种集中度——不是要不要管的问题,是已经在路上了。
当然,这个推算是基于当前趋势外推的。如果未来两年出现新的变现模式、或者有第三家玩家跑出类似的单位经济,格局可能会变。但至少从现在看,算力正在变成两家公司的军备竞赛。
Claude 的记忆功能打通了,你能逐条看它记了什么
Anthropic 把 Claude 的记忆功能从聊天扩展到了 Claude Cowork 和 Claude Code,跨产品共享记忆。用户可以在一个统一面板里逐条查看、编辑或删除 Claude 记住的内容,也能一键关掉整个记忆功能。
这个更新的实际意义是,你在聊天里告诉 Claude 的事,它在 Cowork 里帮你干活时也能想起来,不用重复解释。记忆会在对话过程中实时更新,健康、信仰等敏感话题默认不存储,但可以在设置里开启。敏感识别号、犯罪记录等始终不会被保存。
但官方没提两个关键点:记忆容量上限是多少,跨会话读取记忆会不会增加延迟。这两点直接影响实际体验——如果记忆条数有限制,或者每次调用记忆都要多等几秒,这个功能的实用价值会打折。
从产品方向看,Anthropic 在把 Claude 从一个"每次对话都像初次见面"的聊天工具,变成一个"记得你上次说了什么"的工作伙伴。这个方向是对的,但执行细节决定了它到底是真有用还是只是个噱头。
安全研究者用行为指纹确认 Ox Alpha 就是智谱 GLM-5.x
Ox Alpha 是 8 月 20 日突然出现在 OpenRouter 上的一个匿名模型,没人知道它从哪来。安全公司 CTGT 用 11 项分词器测试全部命中,加上参数上限、推理模式等特征,独立确认它来自智谱的 GLM-5.x 系列。
更有意思的是这个模型在敏感话题上的表现。对新疆、台湾等问题,它回答得和美国模型一样详细,甚至会引用在中国有争议的信源;但碰到习近平个人和另外几个国内敏感话题,它立刻切换成标准的安全拒绝模式。这种"分裂"行为说明模型的安全对齐是分层做的——某些话题放得很开,某些话题卡得很死。
CTGT 的方法本身也值得留意。他们不是靠模型自报家门或者官方声明,而是通过分词器的行为指纹来识别模型来源。不同模型的分词器在处理特定文本时会有独特的 token 切分模式,就像笔迹一样可以追溯。这种方法不依赖模型诚实度,比直接问"你是谁"可靠得多。
斯坦福用真实工资单数据发现:AI 对 22-25 岁年轻人冲击最大
斯坦福经济学家更新了他们的"煤矿里的金丝雀"报告,用 ADP 的真实工资单数据和 Anthropic 经济指数做了分析。整体就业市场还没被 AI 明显撼动,但 22 到 25 岁的年轻人已经感受到压力:在受 AI 影响大的岗位里,他们的就业水平比受影响小的岗位低了 19%,去年这个数字是 13%。
从 2022 年算起,AI 冲击最大的前 40% 岗位中,初级职位的招聘需求下降最明显。这个趋势和麦肯锡今年的调查能对上——大公司用 AI 智能体的比例在涨,但企业整体利润影响卡在 37% 没动。个人提效和企业赚钱之间还有条沟没跨过去,而初级岗位的年轻人正好卡在这条沟里。
这个数据的价值在于它用的是真实工资单,不是问卷调查或者专家预测。ADP 覆盖了美国大量企业的实际雇佣数据,Anthropic 的经济指数则从模型使用日志里提取了不同职业的 AI 暴露度。两个数据源拼在一起,比单纯的"AI 会取代 X% 的工作"这类预测要扎实。
麦肯锡 2026 调查:编程智能体铺开了,但企业利润还没跟上
麦肯锡今年的全球调查有几个挺矛盾的数字。先说进展:年收入超 10 亿美元的大公司里,40% 已经在规模化用 AI 智能体(让模型进业务流程干活),比去年的 27% 涨了不少。其中 31% 的大公司在规模化用编程智能体,32% 的受访公司干脆不买现成软件了,因为用这些工具自己就能搭。
但回到钱上,情况就没那么乐观。企业层面的息税前利润影响卡在 37%,跟去年一样;能说清 AI 投资回报率的公司比例也没涨。翻译成人话就是:工具用起来了,但账算不平。
这个 gap 可能来自几个方向。一是 AI 智能体提效的主要是个人生产力,但个人省下来的时间不一定能直接转化成公司层面的利润增长。二是部署和运维成本可能被低估了——模型调用、安全审计、流程改造这些隐性成本加起来,可能把省下来的人力成本吃掉一大块。三是组织惯性,工具有了但流程没改,效率卡在中间。
今日小信号
-
Google WeatherNext 提前五天锁定五级飓风登陆点:这个模型把风暴的路径、强度和个头一起算,比现有系统多抢出一整天的预警时间。2025 年飓风季它提前五天判断 Melissa 会以五级强度撞上牙买加,美国国家飓风中心第一次在实时业务里跑 AI 模型。代码和权重都开源了,但缺少误报率和验证集规模,这点先别太激动。
-
吴恩达的 OpenWorker 内置了三个网络安全智能体:扫代码漏洞、查依赖包投毒、检查云配置。harness 全开源,安全团队能自己审计有没有后门,还支持本地跑开源权重模型。方向很实用,但正文没提具体模型名和跑分。
-
Perplexity 把 AI 助手塞进了 NVIDIA 桌面小主机:本地跑 Qwen 3.8 27B 或 PPLX 27B,数据不上传也不花云端积分。需要联网或更强推理时会先问你。对隐私敏感的用户有吸引力,但本地模型的推理质量能不能赶上云端版,还得实测。
-
Hacker News 首页一半热门帖子是 AI 写的或跟 AI 有关:lcamtuf 自己动手数了数,用 Pangram 工具检测 AI 文本,发现比例从 2 月的 40% 涨到了 6 月的 50%-60%。他自己复核过,认为结果偏保守。
-
OpenAI 自研推理芯片 Jalapeño 首秀:官方说推理速度和能效达到行业领先水平,但没给具体数字。自研芯片是 OpenAI 降低推理成本的关键一步,但第一代芯片的实际表现还得等第三方测试。