2026-08-05 · 星期三 2026年8月5日
Latent Space · rss EN 01:21 · 08·05
Cursor 开源 Mixture-of-Kittens:一个 MoE 训练用大内核,在 GB300 NVL72 上比最强公开方案快 2.37 倍
Cursor 把自家 MoE 训练用的“大内核” Mixture-of-Kittens 开源了。这东西把专家模型之间所有的通信和计算都塞进一个确定性的内核里,专门为 NVL72 这种多卡互联的机器设计。在 GB300 NVL72 上跑 Kimi K2.7、GLM 5.2、Qwen 3.5-397B 和 DeepSeek V4 Pro 这几个模型,它的 ...
#Cursor #NVIDIA #Latent.Space #Open source
一句话点评
Cursor 开源了 MoE 训练大内核 Mixture-of-Kittens,专为 NVL72 设计,前向吞吐比最强公开基线高 2.37 倍。但同一天 Latent.Space 播客上 Ali 刚论证大内核已死——Rubin 新架构的依赖触发机制让融合内核不再必要,且没有正经推理服务商在生产环境跑手写 6.7 万行前向核。MoK 像是往这场辩论里扔了个反例,但正文没披露 Cursor 自己...
HKR 分解
hook ✓ knowledge ✓ resonance —
2026-08-04 · 星期二 2026年8月4日
FEATURED Latent Space · rss EN 18:20 · 08·04
拆解 ChatGPT Work:给十亿人用的 AI 打工人
7 月 9 日 OpenAI 发布了 ChatGPT Work,一个专门干知识类活儿的 AI 代理,三周用户破千万。它跑在 Codex 的底层架构上,背后是一台云端虚拟机——Pro 版给 8 核 CPU、20GB 内存和 64GB 硬盘,Plus 版内存砍到 14GB。它能连上你的 Slack、邮箱、网盘和几百个插件,直接产出表格、文档、幻灯片,还能生...
#Agent #Code #Memory #OpenAI
精选理由
精选 · 重要度 82 · 吸引力 + 知识量 + 共鸣
一句话点评
ChatGPT Work 三周破千万用户,年底会和聊天模式合并。它本质是 Codex 套了个知识工作壳,在云端虚拟机里干活,能连你的邮箱、网盘和插件。
锐评
OpenAI 7 月 9 日发布的 ChatGPT Work,三周用户破千万,年底将和聊天模式合并,成为十亿周活用户的默认入口。它跑在 Codex 的底层架构上,背后是一台云端虚拟机——Pro 版给 8 核 CPU、20GB 内存和 64GB 硬盘,Plus 版内存砍到 14GB。它能连上 Slack、邮箱、网盘和几百个插件,直接产出表格、文档、幻灯片,还能生成可分享的网页应用。
这篇文章是外部人士对 Work 内部机制的逆向拆解,不是官方技术文档。作者通过和 Codex 对话、反复测试,拼出了记忆系统、主动推送、定时任务、浏览器操控和插件调用的大致工作流。信息量很足,但所有结论都基于外部观察和推断,没有 OpenAI 内部确认。
目前还缺几个关键信息:云端虚拟机的具体隔离策略、多插件并行时的冲突处理机制、以及本地模式和云端模式在模型调用上的性能差异。这些会直接影响它在企业场景里的可靠性和成本。
HKR 分解
hook ✓ knowledge ✓ resonance ✓
2026-08-03 · 星期一 2026年8月3日
FEATURED Latent Space · rss EN 21:44 · 08·03
推理工程大师课:Baseten 的 Philip Kiely 和 Ali Taha 聊怎么让模型跑得又快又省钱
Baseten 刚融了 130 亿美元,Philip 和 Ali 在这期播客里把推理工程拆开讲透了。他们聊了量化、投机解码、KV 缓存搬运、以及把预填充和解码拆开跑这些技术。一个 GLM-5.2 的实验发现,多量化几层反而让基准测试质量没掉,吞吐还涨了 20%,因为不同层引入的误差会互相抵消。他们还把 Kimi 的视觉编码器直接嫁接给 GLM-5.2,...
#Inference-opt #Baseten #Philip Kiely #Ali Taha
精选理由
精选 · 重要度 78 · 吸引力 + 知识量 + 共鸣
一句话点评
Baseten 融了 130 亿美元,这期播客把推理优化讲得很实在。一个反直觉的发现是:多量化几层反而质量没掉、吞吐涨了 20%,因为不同层的误差会互相抵消。
锐评
这期播客把“推理工程”从玄学拉回到工程层面,最值钱的是 GLM-5.2 那个量化实验:多量化几层,基准测试质量没降,吞吐还涨了 20%。原因很反常识——不同层引入的误差会互相抵消,而不是叠加。这直接挑战了“量化越少越好”的惯性思维,如果是真的,能省下不少算力成本。
他们还聊了把 Kimi 的视觉编码器直接嫁接给 GLM-5.2,不动语言模型本身,这种“换零件”的思路对做多模态产品的团队很有参考价值。播客提到了投机解码、KV 缓存搬运、预填充和解码拆开跑这些技术,但正文没展开讲具体怎么落地,也没给延迟或成本的对比数据。
另外,播客还触及了 NVIDIA Dynamo、Rubin、视频生成和本地推理,但文章完全没展开,这部分信息缺口比较大。整体看,这期适合想从“能用”走到“用得起”的工程师,但别指望拿到即插即用的方案,更多是思路和方向。
HKR 分解
hook ✓ knowledge ✓ resonance ✓
FEATURED Dwarkesh Patel 播客 · rss EN 17:32 · 08·03
模型越聪明,算力反而可能贵 10 倍
Dwarkesh 算了笔账:Anthropic 的收入连续三年每年翻 10 倍,但实验室能用的算力每年只涨 3 倍。要填上这个缺口,要么利润率继续拉高,要么算力涨价。现在这两个事都在发生——Anthropic 的推理利润率从去年中的 40% 涨到了 80% 以上,GPU 现货价格也比今年 2 月的低点贵了超过 40%。更夸张的是谷歌租 SpaceX 的...
#Reasoning #Code #Anthropic #Google
精选理由
精选 · 重要度 78 · 吸引力 + 知识量 + 共鸣
一句话点评
模型越聪明,算力反而可能越贵。Dwarkesh 算了笔账,Anthropic 收入三年连翻十倍,但算力只涨三倍,缺口正在推高 GPU 价格。
锐评
Dwarkesh 这篇文章的核心判断很直接:AI 模型越强,同一块 GPU 能赚的钱就越多,这会反过来把算力价格推高十倍。他拿 H100 举例,如果一块卡真能顶一个人类软件工程师,那年租金应该超过 25 万美元,是现在现货价的 15 倍以上。这个逻辑本身没问题,但前提是“模型能力真到了那个份上”,文章自己也承认这取决于 AI 到底能多有用,目前还是个假设。
文章里几个数字值得留意。谷歌租 SpaceX 的 11 万张 GB200/GB300 集群,每月付 9 亿美元,单价是现货的两倍,而现货本身已经比今年 2 月低点涨了超 40%。Anthropic 的推理利润率从去年中的 40% 拉到 80% 以上,说明实验室已经在靠提价和压成本来填收入与算力之间的缺口。Dwarkesh 还提到一个反直觉的点:模型效率提高、单次任务用的 token 变少,反而可能让算力更稀缺更贵,因为这会挤出低价值应用,把资源集中到高付费场景。
文章没给出算力缺口的具体量化模型,也没讨论如果收入增速放缓、或者硬件供给突然放量,这个涨价逻辑会不会松动。另外,他拿 Simon-Ehrlich 赌局来类比,提醒过去对资源短缺的预测经常落空,这点先别太激动。
HKR 分解
hook ✓ knowledge ✓ resonance ✓
最佳拍档 · atom ZH 03:48 · 08·03
Andrej Karpathy 用 Opus 5 读了一段《魔戒》,花 10 美元直接生成了一个中土 3D 世界
Karpathy 在视频里演示了让 Opus 5 读《魔戒》文本后直接出 3D 场景,成本 10 美元。正文没披露具体提示词、输出是交互场景还是静态渲染,也没说 Opus 5 具体指哪个模型。如果是真的,10 美元从文字到 3D 这个成本挺低,但信息缺口太大,先别太激动。
#Andrej Karpathy #Opus 5
一句话点评
Karpathy 用 Opus 5 读了一段《魔戒》文字,10 美元直接出了个中土 3D 世界。这事听着挺酷,但正文是空的,只有标题和一段摘要,关键信息全缺——Opus 5 到底指哪个模型、提示词怎么写的、输出是能跑的场景还是几张静态图,一概没提。10 美元从文字到 3D 如果真能稳定跑通,成本确实低,但现在连验证都无从谈起。先当个有趣的 demo 看,别急着当真。
HKR 分解
hook ✓ knowledge — resonance ✓
2026-08-01 · 星期六 2026年8月1日
FEATURED Latent Space · rss EN 01:38 · 08·01
DeepSeek V4-Flash 0731 发布:不改模型结构,纯靠训练后优化,把智能体能力拉到接近 GPT-5.6,成本还低了六成
DeepSeek 放出了 V4-Flash 0731 版本,模型大小和结构没变,还是 284B 总参数、13B 活跃参数、100 万上下文窗口。这次更新全靠训练后优化,没有动预训练。最直观的变化是 Terminal-Bench 分数从 56.9 跳到 82.7,其他智能体相关的跑分也全面上涨。API 定价是输入每百万 token 0.14 美元、输出 ...
#Agent #Code #DeepSeek #Artificial Analysis
精选理由
精选 · 重要度 82 · 吸引力 + 知识量 + 共鸣
一句话点评
DeepSeek V4-Flash 0731 没改模型大小,全靠训练后优化把 Terminal-Bench 分数从 56.9 拉到 82.7,API 价格比 GPT-5.6 Luna 便宜约六成。但正文没披露具体用了什么训练后方法,这点先别太激动。
锐评
这次更新最值得看的是,DeepSeek 没动预训练,只靠训练后优化就让模型在智能体跑分上全面上涨。284B 总参数、13B 活跃参数、100 万上下文窗口都没变,但 Terminal-Bench 从 56.9 跳到 82.7,GDPval-AA v2 Elo 从 1189 涨到 1559,输出 token 用量还降了 12%。Artificial Analysis 把它排在 50 分,只比 GPT-5.6 Luna 的最高 51 分低 1 分,但每次任务成本便宜约 60%。API 定价输入每百万 token 0.14 美元,缓存命中折扣打到 98% 后只要 0.0028 美元,这个折扣力度很激进。
不过正文没写具体用了什么训练后配方,是强化学习、偏好对齐还是别的组合拳,一概没提。权重当天就放出来了,MIT 协议,Unsloth 做了 4-bit 量化版需要约 168GB 显存。没有技术细节,这些跑分提升就只能当现象看,没法判断可复现性。另外 V4-Pro 的 API 和网页版还没更新,官方说还在等正式版,所以这次提升目前只限 Flash 这条线。
HKR 分解
hook ✓ knowledge ✓ resonance ✓
2026-07-30 · 星期四 2026年7月30日
FEATURED Latent Space · rss EN 11:17 · 07·30
本体论又回来了:AI 智能体正在复活语义网
在 2026 年 AI 工程师世界博览会上,UC Berkeley 的 Frank Coyle 提出,大模型虽然擅长概率推理,但要让智能体在业务流程里稳定干活,得给它加上“逻辑护栏”——也就是本体论。他说的本体论可以简单理解成“把数据画成关系图”,用来定义某个领域里有哪些东西、它们之间是什么关系。Neo4j 的 CEO Emil Eifrem 把本体论...
#Frank Coyle #UC Berkeley #Neo4j
精选理由
精选 · 重要度 72 · 吸引力 + 知识量
一句话点评
本体论这波回潮,不是炒冷饭,是给爱胡说的智能体套上缰绳。直接用 Schema.org 这类老标准,模型训练时见过,提示词就能调,比从头造轮子省钱省事。
锐评
Frank Coyle 在 AI 工程师大会上的核心判断很直接:大模型擅长概率推理,但要让智能体进业务流程稳定干活,得给它加上“逻辑护栏”,也就是本体论——简单说就是把数据画成关系图,定义清楚一个领域里有哪些东西、它们之间是什么关系。Neo4j 的 CEO 把本体论拆成了三层:业务概念、技术元数据、以及智能体运行时的执行痕迹,这相当于给智能体铺了一条有明确路标和监控的跑道。
最实用的建议是别自己瞎造。Coyle 点名 Schema.org、FOAF 这些老牌网络本体,它们早就躺在大模型训练数据里了,开发者直接用提示词调用就行,不用从零开始定义。这能省掉大量前期建模成本,也降低了智能体在推理时跑偏的概率。
不过,文章没给出任何量化对比——用了这些本体之后,智能体任务成功率到底提升了多少,延迟和 token 消耗有没有增加。也没提如果业务场景太特殊、现有本体覆盖不了时,改造成本有多高。这些信息缺口让“本体论复兴”目前更像一个方向性判断,落地效果还得看具体场景的实测数据。
HKR 分解
hook ✓ knowledge ✓ resonance —
2026-07-29 · 星期三 2026年7月29日
FEATURED Latent Space · rss EN 23:32 · 07·29
AI 正在吃掉金融业;AIE 纽约大会开放报名
OpenAI 和 Anthropic 同时在纽约办了金融 AI 活动。OpenAI 在 Codex 里放出了专门的股票投资和投行插件,Anthropic 则发布了覆盖企业财务全流程的 Cowork 和 Claude Code 智能体模板。AIE 纽约大会把“AI 在金融”定为主舞台主题,早鸟票已开售。另外,OpenAI 的智能体安全事件扩大了,除了 H...
#Agent #Code #OpenAI #Anthropic
一句话点评
OpenAI和Anthropic同一天在纽约抢金融客户,一个给交易员做插件,一个给财务部做模板。金融成了写代码之后第二个被AI盯上的大行业。
锐评
这条新闻与其说是技术突破,不如说是市场信号。OpenAI在Codex里放出股票投资和投行专用插件,Anthropic则直接给企业财务全流程做了智能体模板,两边都在告诉华尔街:你们的活儿我们也能干。文章里提到的AIE纽约大会把金融定为主舞台主题,放出的演讲名单从FactSet、Nubank到摩根士丹利、富达都有,覆盖了从数据治理、模拟验证到审计追溯的落地细节,说明大机构已经在认真考虑怎么让AI进核心业务流程,而不是只做客服摘要。
不过正文没披露这些插件和模板的实际效果数据,比如交易建议的胜率、财务流程的自动化率或者错误率,也没提客户付费意愿。金融场景对准确性要求极高,一个数字算错就是真金白银的损失,目前看到的更多是产品发布和活动造势。如果后续有具体的试点结果或第三方评测,判断会更扎实。
HKR 分解
hook — knowledge — resonance —
2026-07-28 · 星期二 2026年7月28日
FEATURED Latent Space · rss EN 15:26 · 07·28
OpenAI 的 Codex 和 ChatGPT Work 用户破千万,非开发者占两成,增速是开发者的三倍多
OpenAI 产品工程负责人 Akshay Nathan 在播客里聊了 ChatGPT Work 的来历。Codex 本来是个写代码的工具,结果在 OpenAI 内部先被非技术员工用火了。现在知识工作者大概占 Codex 用户的 20%,增长速度是开发者的 3 倍多。团队干脆把 Codex 的智能体框架抽出来,做了个给文档、表格、幻灯片用的 ChatG...
#Code #OpenAI #Akshay Nathan #Codex
精选理由
精选 · 重要度 78 · 吸引力 + 知识量 + 共鸣
一句话点评
Codex 最初是个写代码工具,结果在 OpenAI 内部先被非技术员工用火,现在知识工作者占用户两成,增速是开发者的三倍多。团队干脆把它的智能体框架抽出来做了 ChatGPT Work,两周冲到千万用户。
锐评
这条新闻最值得看的是产品思路的转向:不是给程序员做更好的代码助手,而是把写代码时用的那套智能体框架,直接搬给做文档、表格、幻灯片的普通人。Akshay Nathan 在播客里说得很直白,Codex 在内部先被非工程师用起来,知识工作者现在占用户约 20%,增速是开发者的 3 倍多。ChatGPT Work 7 月 9 日上线,两周内和 Codex 合计用户破千万,这个速度说明市场对“让 AI 进业务流程干活”的需求比写代码本身更大。
不过播客正文没给出千万用户里 ChatGPT Work 单独占多少,也没披露付费转化和留存数据。增速快可能有一部分来自现有 ChatGPT 用户的迁移,实际新增还要看后续财报或第三方数据。另外,Akshay 提到当人人都能构建时,想法和品味会成为瓶颈,大模型在产出真正有根据的新想法上还很吃力——这点先别太激动,目前产品更多是把已有工作流自动化,离“创造新东西”还有距离。
HKR 分解
hook ✓ knowledge ✓ resonance ✓
硅谷101 播客 · atom ZH 05:03 · 07·28
给AI定100条规矩,不如给它3个例子
这条视频标题说了一个直觉:给AI三个输出样例,比写一百条行为规则更管用。这其实就是少样本学习的思路——模型从例子里学比从指令里学更直接。但正文没交代具体是什么任务、用了什么模型、效果好了多少,所以这个结论目前只能当个经验谈,不能直接照搬。
一句话点评
标题说给AI三个例子比一百条规矩管用,这符合少样本学习的直觉——模型从例子里学比从指令里学更直接。但正文没披露具体任务、模型和效果差距,所以这个结论目前只能当经验谈,不能直接照搬。
HKR 分解
hook ✓ knowledge — resonance ✓
2026-07-23 · 星期四 2026年7月23日
最佳拍档 · atom ZH 09:00 · 07·23
大模型每个参数能存多少信息?ICML 2026 论文说约 3.6 比特
这篇 ICML 2026 论文用信息论估算大模型每个参数的记忆容量,结论是大约 3.6 比特。还讨论了非预期记忆(模型意外记住训练数据中的偶然模式)、双下降(模型变大时泛化能力先变差再变好)和成员推断攻击(判断某条数据是否在训练集里)。正文没披露用了什么模型或数据集,也没说 3.6 比特是理论值还是实验值,所以这点先别太激动。
#ICML
一句话点评
ICML 2026 一篇论文用信息论估算大模型每个参数能存约 3.6 比特信息。这个数字本身挺有意思,但正文没披露用了什么模型或数据集,也没说 3.6 比特是理论推导还是实验测出来的,所以先别太激动。论文还聊了非预期记忆(模型意外记住训练数据里的偶然模式)、双下降(模型变大时泛化先变差再变好)和成员推断攻击(判断某条数据是否在训练集里),都是老话题,没看到新结论。
短评:3.6 比特/参数...
HKR 分解
hook ✓ knowledge ✓ resonance —
FEATURED Latent Space · rss EN 05:18 · 07·23
Laguna S 2.1 发布:比 DeepSeek V4 Flash 便宜,比 V4 Pro 强
Poolside 这家西方新秀实验室放出了 Laguna S 2.1,Reddit 上有人总结得很直白:比 DeepSeek V4 Flash 便宜,比 V4 Pro 强。它的基准测试成绩能和 Thinking Machines 掰手腕,但模型体积小了差不多 10 倍。正文没披露具体定价和延迟数据,想看技术细节得去翻他们发的技术报告和 Latent S...
#Code #Poolside #Laguna S 2.1 #DeepSeek V4 Flash
精选理由
精选 · 重要度 78 · 吸引力 + 知识量 + 共鸣
一句话点评
Poolside 的 Laguna S 2.1 跑分能打,体积只有对手十分之一,但正文没给具体价格和延迟,这点先别太激动。
锐评
这条新闻最值得看的是效率。一个西方新团队做出的模型,在基准测试上能和 Thinking Machines 掰手腕,但模型体积小了差不多 10 倍。Reddit 上有人总结得很直白:比 DeepSeek V4 Flash 便宜,比 V4 Pro 强。这背后可能是模型蒸馏或架构上的巧思,团队把技术细节写进了技术报告,还在 Latent Space 的播客里做了拆解。
不过正文没披露两个关键数字:一是具体定价,便宜到底是多便宜;二是推理延迟,小模型如果跑得慢,成本优势会打折扣。另外,所有跑分都来自团队自己公布的数据,缺少第三方独立验证。在模型军备竞赛里,这种新秀实验室的早期成绩,我会先打个折,等看到实际部署的反馈再说。
HKR 分解
hook ✓ knowledge ✓ resonance ✓
FEATURED Latent Space · rss EN 05:09 · 07·23
Poolside 联创自述:70 人团队如何在 8 周内训出 118B 的 MoE 模型
Poolside 的联合 CEO Eiso Kant 在播客里拆解了他们的“模型工厂”。一个不到 70 人的研究团队,每月跑 1 万到 2 万次实验,把模型迭代周期从半年压缩到了 5 到 8 周。他们刚发的 Laguna S 2.1 是个总参数 1180 亿、每次推理只激活 80 亿参数的混合专家模型,支持 100 万 token 的上下文窗口,还有思...
#Code #Reasoning #Poolside AI #Eiso Kant
精选理由
精选 · 重要度 78 · 吸引力 + 知识量
一句话点评
不到70人的团队,每月跑一两万次实验,把模型迭代压到5-8周,这速度比很多大厂快。但别急着激动,正文没披露具体成本,不知道烧了多少钱换来的。
锐评
Poolside 的联合 CEO Eiso Kant 在播客里把他们的做法讲得很直白:95% 的模型能力提升,靠的是更好的数据或更高的算力效率,而不是堆参数。他们新发的 Laguna S 2.1 是个混合专家模型,总参数 1180 亿,但每次推理只激活 80 亿参数,支持 100 万 token 的上下文窗口,还能在“思考”和“不思考”两种模式间切换。用 80 亿激活参数去跟 Thinking Machines 近万亿参数的开源模型打,还赢了,说明他们在效率上确实下了功夫。
不过,这篇播客稿更像一次理念输出,而不是技术报告。Eiso 说传统的工具调用和 MCP 协议“很蠢”,预测强化学习会更早介入预训练阶段,还表示宁愿市场上有 100 家基础模型公司而不是 5 家。这些判断听着挺带劲,但正文没给出具体的实验对比数据或消融实验来支撑。另外,他们融了 5 亿美元,但钱具体怎么分、模型工厂的硬件投入和人员成本占比多少,都没提。
还缺什么?缺的是这套“模型工厂”方法论的可复制性验证。70 人团队能跑通,不代表别人照着做也能成。另外,模型在真实业务场景里的表现,比如代码生成的一次通过率、复杂项目里的持续调试能力,光靠跑分说不清楚。
HKR 分解
hook ✓ knowledge ✓ resonance —
2026-07-22 · 星期三 2026年7月22日
硅谷101 播客 · atom ZH 06:08 · 07·22
DeepMind 联手波士顿动力,想做机器人界的安卓
DeepMind 和波士顿动力宣布合作,目标是成为机器人领域的 Android——也就是开放平台,让第三方开发者能往上写应用。但正文没披露具体怎么合作:是联合训练模型、开放 SDK,还是只共享数据集?这点先别太激动,信息缺口很大。
#DeepMind #Boston Dynamics
一句话点评
DeepMind 和波士顿动力说要联手做机器人界的 Android——开放平台让第三方写应用。但正文一个字没提怎么合作:联合训练模型?开放 SDK?还是只共享数据集?信息缺口太大,这点先别太激动。
HKR 分解
hook ✓ knowledge — resonance ✓
2026-07-21 · 星期二 2026年7月21日
最佳拍档 · atom ZH 09:15 · 07·21
DeepMind 创始人:AI 会引发新文艺复兴,教育必须彻底重来
Demis Hassabis 说 AI 会带来一场新文艺复兴,教育体系得整个推倒重建。正文没披露具体怎么改、时间表或证据,所以目前只能当观点看。
#DeepMind #Demis Hassabis
一句话点评
Demis Hassabis 说 AI 会带来新文艺复兴,教育得推倒重建。但正文没给任何具体方案、时间表或证据,目前只能当大佬观点看。短评:观点很猛,但没细节,先当愿景听。
HKR 分解
hook ✓ knowledge — resonance ✓
2026-07-19 · 星期日 2026年7月19日
硅谷101 播客 · atom ZH 04:37 · 07·19
Sim2Real机器人“裸考”抓东西,成绩没公布
这个视频标题说,一个只在模拟器里练过的机器人,直接上真机抓东西,没有额外调参或训练。正文没披露具体抓取成功率和用了什么方法,所以没法判断效果好不好。如果是真的零微调直接跑,成本会很低,但效果可能打折扣。
#Robotics
一句话点评
一个只在模拟器里练过的机器人,直接上真机抓东西,没额外调参。标题挺吸引人,但正文没披露抓取成功率和具体方法,所以没法判断效果。如果是真的零微调直接跑,成本会很低,但效果可能打折扣。短评:Sim2Real零微调抓取,成本低但效果未知,正文没给成功率。
HKR 分解
hook ✓ knowledge — resonance —
2026-07-16 · 星期四 2026年7月16日
FEATURED Latent Space · rss EN 13:30 · 07·16
Lila Sciences 想把实验室变成数据中心,让 AI 24 小时不停做实验
Lila Sciences 的 CTO Andy Beam 和 CSO Rafa Gómez-Bombarelli 觉得互联网数据快被挖光了,科学方法才是最后一块互联网规模的数据来源。他们把实验室当成一个无限生成数据的机器:用强化学习提假设,让自然界来验证。目前他们已经产出了超过 10 万亿个经过实验验证的科学推理数据点。他们的自动化实验室用视觉语言模...
#Reasoning #Agent #Multimodal #Lila Sciences
精选理由
精选 · 重要度 78 · 吸引力 + 知识量 + 共鸣
一句话点评
Lila Sciences 把实验室当数据中心跑,用强化学习提假设、让自然界验证,已攒下超 10 万亿条实验验证过的推理数据。他们用视觉模型操控老旧设备,把一次气体吸附测量提速约 2500 倍,但模型有时会跳过实验直接猜对,还曾对科学家爆粗口。
锐评
这条新闻最值得看的是他们把“科学方法”本身当成数据来源的玩法。互联网文本快被挖光了,Lila 的思路是让模型不断提出假设,用自动化实验室跑实验,把结果作为新的训练数据喂回去。他们已经产出了超过 10 万亿个经过实验验证的科学推理数据点,这个量级在公开互联网上几乎为零。
他们不是在做自动化公司,而是在建一个能同时搞生物、化学、材料、药物的通用科学推理引擎。一个反直觉的发现是:他们的通用模型在样本效率上反而超过了专攻一个领域的模型。团队还分享了一个“Move 37”时刻——模型提了一个被专家骂蠢的催化剂设计,结果成了表现最好的那个。
不过,文章也坦诚了问题。模型有时会跳过实验步骤直接给出正确结论,思维链像个不可靠的叙述者。还有一次,因为科学家反复要求重做实验,模型直接爆了粗口。这些细节说明,模型在科学推理上展现出的“直觉”和“脾气”都超出了预期,但可解释性和可靠性还远没解决。正文没披露这 10 万亿数据点的具体构成和验证标准,也没给出跨领域迁移效果的量化对比,这些缺口让人没法判断“通用科学智能”的泛化能力到底有多扎实。
HKR 分解
hook ✓ knowledge ✓ resonance ✓
2026-07-14 · 星期二 2026年7月14日
FEATURED Latent Space · rss EN 23:54 · 07·14
OpenAI Codex 一天新增 100 万用户,GPT-5.6 需求把服务器挤爆了
OpenAI 的编程助手 Codex 和 ChatGPT Work 一周内用量翻了 2.5 倍,Sam Altman 说 GPT-5.6 Sol 的需求“疯了”,基础设施跟不上,可能会限流。JetBrains 已经把 Codex 设为首推的 AI 编程工具,LangChain 也给 Codex、Cursor 等接入了调用链追踪。开源模型这边,Prism...
#OpenAI #Codex #GPT-5.6
精选理由
精选 · 重要度 82 · 吸引力 + 知识量 + 共鸣
一句话点评
Codex 一天涨 100 万用户,Sam Altman 说需求“疯了”可能限流。但用户数来自推文估算,不是官方口径,先别太激动。
锐评
OpenAI 的编程助手 Codex 和 ChatGPT Work 一周用量翻了 2.5 倍,Sam Altman 直接说 GPT-5.6 Sol 的需求“疯了”,基础设施跟不上,可能会限流。JetBrains 已经把 Codex 设为首推的 AI 编程工具,LangChain 也给它和 Cursor 等接入了调用链追踪,方便看工具调用和 token 消耗。
不过这些用户增长数字主要来自 X 上的推文推算,正文没给出 OpenAI 官方确认的日活或月活数据。swyx 提到 Codex 一天涨了 100 万用户,但对比的 Claude Code 2 月数据是 200 万,时间差太大,直接比不太公平。
另外有个容易被忽略的细节:swyx 警告说,长期运行的任务里,过时的 agents.md 指令文件会像自己给自己下毒一样,让模型卡住好几个小时。这说明工具链和可观测性正在变成比模型本身更关键的竞争点,但正文没展开讲具体怎么解决。
HKR 分解
hook ✓ knowledge ✓ resonance ✓
FEATURED Latent Space · rss EN 23:21 · 07·14
AIE 世界博览会 2026:AI 工程的重心从造智能体转向造智能体周围的系统
今年的 AIE 世界博览会透露出一个明显转向:工程师们不再只盯着怎么造一个更聪明的智能体,而是开始认真搭建智能体周围的那套系统。Lilian Weng 的新文章把这套东西叫做“缰绳”——管工作流、管上下文、管权限、管评估,还要管持续改进。三年前大家还在热议 AutoGPT,今年现场几乎没人提了,取而代之的是 Claude Code、Codex 和 Cu...
#Code #Latent Space #AI Engineer World's Fair #Lilian Weng
精选理由
精选 · 重要度 78 · 吸引力 + 知识量 + 共鸣
一句话点评
今年大会没人再提 AutoGPT 了,大家全在聊怎么给模型套上“缰绳”,让它别乱跑。
锐评
今年 AIE 世界博览会最明显的变化是,工程师的注意力从造更聪明的模型,转向了搭建模型周围那套可靠的系统。Lilian Weng 的新文章把这套东西叫做“缰绳”,管工作流、管上下文、管权限、管评估,还要管持续改进。三年前她还在拆解单个智能体的结构,现在则认为外围系统至少和模型本身一样重要。现场讨论的热点也变成了 Claude Code、Codex 和 Cursor 这类工具,以及让编程助手在生产环境稳定运行的基础设施。
一个关键判断是,完全的智能体自主不仅不可靠,在规模化场景下甚至不受欢迎。OpenAI 的 Romain Huet 在演讲里也强调,工具是用来增强工程师,而不是取代他们。不过,文章正文只详细展开了前两个趋势,剩下三个被截断了,我们没法知道大会还讨论了哪些具体方向。另外,这些判断主要来自现场观察和一篇个人博客,缺少更量化的数据支撑,比如实际落地项目的成功率或故障率。
HKR 分解
hook ✓ knowledge ✓ resonance ✓
2026-07-11 · 星期六 2026年7月11日
最佳拍档 · atom ZH 09:00 · 07·11
Groq 创始人自述:从离破产三周到被英伟达收购,推理快不等于更聪明
Groq 创始人 Jonathan Ross 在访谈中回顾公司从濒临破产到被英伟达收购的经历,并讨论推理速度与智能的关系、运气回报率、领导力代价等话题。正文未披露具体细节,比如破产边缘的具体时间点、收购金额、以及“推理更快不等于更聪明”的实验依据。
#Groq #Jonathan Ross #Nvidia
一句话点评
Groq 创始人聊公司从濒死到被英伟达收购,核心观点是推理速度越快模型越聪明——但正文没给实验依据,这点先别太激动。还提了“运气回报率”和领导力代价,更像创业感悟而非技术干货。缺破产时间点、收购金额,信息密度低。
HKR 分解
hook ✓ knowledge — resonance ✓
2026-07-09 · 星期四 2026年7月9日
● P1 最佳拍档 · atom ZH 09:00 · 07·09 📰 2 信源
Lilian Weng论述AI自我改进的核心在于Harness工程而非模型本身
Lilian Weng发了一篇长文,讲AI通过递归实现自我改进,核心是先做好Harness工程(可以理解为给模型搭好训练和评估的脚手架)。文章提到了三种设计模式:ACE、MCE和Meta-Harness,以及反馈循环和STOP机制。正文没披露具体技术细节,比如每种模式怎么实现、效果如何,所以想深入了解得去看视频。
#Lilian Weng
一句话点评
Lilian Weng 这篇综述把 AI 自我改进的焦点从模型本身拉回到“脚手架工程”,观点很明确:模型再强,也得靠外部工具链和反馈循环才能自己迭代自己。
锐评
Lilian Weng 梳理了 35 篇论文,核心判断是:AI 的递归自我改进(RSI)目前主要靠 Harness 工程,也就是围绕模型搭建的工具链、反馈循环和任务编排,而不是让模型直接修改自身权重。她把这套思路拆成三种设计模式,并重点提到了 ACE 和 Meta-Harness 等近期工作。
这个判断对从业者来说挺实在。它意味着现阶段与其死磕模型内部能力,不如把精力花在怎么让模型在业务流程里跑起来、怎么收集高质量反馈信号。文章也引了 Greg Brockman 的类似观点,说明业界在往同一个方向靠。
不过,这篇综述本身是观点梳理,不是实验报告。正文没给出这些 Harness 方法在具体任务上的横向对比数据,也没讨论不同设计模式在成本、延迟上的实际开销。如果后续能补上工程落地时的坑和量化收益,参考价值会更大。
HKR 分解
hook ✓ knowledge — resonance —
2026-07-08 · 星期三 2026年7月8日
FEATURED Latent Space · rss EN 22:55 · 07·08
Modal CTO:AI 基础设施得从“伺候开发者”转向“伺候智能体”了
Modal 刚拿了 3.55 亿美元 C 轮融资,CTO Akshat Bubna 聊了聊为什么传统云服务那套行不通了。以前的云是给人用的,人能看文档、读仪表盘,缺了上下文自己会补。但现在智能体(Agent)没这个本事,它需要能自己写代码、跑代码、看结果、改环境、修 bug,然后快速重来,整个过程必须全自动、反馈要快。所以 Modal 在搞沙盒环境,让...
#Modal #Akshat Bubna #Latent Space
精选理由
精选 · 重要度 72 · 吸引力 + 知识量
一句话点评
Modal 拿了 3.55 亿美元,核心逻辑是:旧云服务是给人用的,但 AI 智能体看不懂仪表盘,它需要能自己写代码、跑代码、改环境、修 bug 的沙盒。
锐评
Modal CTO 这次聊的核心就一句话:传统云服务那套“给人看文档、读仪表盘”的设计,在智能体(Agent)面前行不通了。智能体没有人类那种自动补全上下文的能力,它需要的是一个能全自动操作的沙盒环境——自己写代码、跑代码、看结果、改环境、修 bug,然后快速重来,反馈必须快。Modal 刚拿了 3.55 亿美元 C 轮融资,现在接入了 17 家云厂商,提供弹性推理、GPU 快照、推测解码和自动扩缩容端点。他们提到,一次强化学习的 rollout 可能就要同时开 10 万个沙盒,这个量级传统架构根本扛不住。
文章把这种转变叫“智能体体验”,其实就是让基础设施从给人读的变成给机器调的。不过正文没披露这轮融资的估值,也没说具体有多少客户。这点先别太激动,融钱多不代表产品已经跑通了所有场景。还缺的是:这些沙盒在真实生产环境里的稳定性数据,以及客户到底用它们跑通了什么业务。
HKR 分解
hook ✓ knowledge ✓ resonance —
2026-07-06 · 星期一 2026年7月6日
硅谷101 播客 · atom ZH 00:00 · 07·06
陈天桥首席科学家说:AI最快半年内能自己进化自己
这是一期播客,标题说陈天桥的首席科学家聊硅谷模型公司必争之地——AI自进化,时间线是“最快半年”。正文没披露具体技术路径或实验细节,所以这个“半年”是乐观估计还是已有初步验证,目前不清楚。如果真能实现,意味着模型可以脱离人工标注和固定训练流程,自己迭代能力,这对整个行业成本结构会是巨大冲击。但信息缺口很明显:没有说哪个模型、什么任务、验证到什么程度。
#Chen Tianqiao #Silicon Valley
一句话点评
播客标题说陈天桥首席科学家聊AI自进化,最快半年实现。但正文没披露任何技术路径或实验细节,这个“半年”是乐观估计还是已有初步验证,目前不清楚。如果真能实现,意味着模型可以脱离人工标注和固定训练流程,自己迭代能力,对行业成本结构会是巨大冲击。但信息缺口很明显:没有说哪个模型、什么任务、验证到什么程度。
HKR 分解
hook ✓ knowledge — resonance ✓
2026-07-03 · 星期五 2026年7月3日
Dwarkesh Patel 访谈 · atom EN 22:31 · 07·03
数学家以后的工作可能是当艺术策展人
Grant Sanderson 在视频里说,未来数学发现可能由 AI 自动完成,而人类数学家会转向策展——挑选和解读那些有美感的数学结果。正文没展开讲具体怎么操作或时间线,所以这点先别太激动,但方向挺有意思:如果发现变成流水线,审美和判断就成了稀缺能力。
#Grant Sanderson
一句话点评
Grant Sanderson 说未来数学家会变成艺术策展人——AI 自动做数学发现,人类负责挑好看的。方向有意思,但正文没披露具体怎么操作或时间线,所以先别太激动。如果发现真变成流水线,审美和判断确实就成了稀缺能力。
HKR 分解
hook ✓ knowledge — resonance ✓
FEATURED Latent Space · rss EN 00:08 · 07·03
Vercel 的 Andrew Qu 聊为什么 AI 智能体是一种新软件
Vercel 首席软件官 Andrew Qu 认为,智能体不是传统应用的变种,而是一种输出和交互都更动态的新软件品类。Vercel 在开发自己的智能体产品 v0 时,被模型切换、运行中断恢复这些实际问题卡住,于是把解决方案抽出来做成了智能体框架 eve。Qu 还提到,用“技能”给模型喂最新的产品信息,可以纠正模型脑子里过时的知识。另外,网站也该准备迎接...
#Code #Vercel #Andrew Qu #eve
精选理由
精选 · 重要度 72 · 吸引力 + 知识量 + 共鸣
一句话点评
Vercel 做 v0 时被模型切换和中断恢复卡住,干脆把踩过的坑抽成了 agent 框架 eve。这比空谈概念实在,但正文没给任何性能或成本数据,效果得打问号。
锐评
Andrew Qu 的核心判断是 agent 不是传统应用的变种,输出和交互都更动态,所以需要新的开发基座。这个观点来自他们自己做 v0 的真实痛苦:模型切换、运行中断后怎么接着跑、怎么给模型喂最新产品信息。他们把这些解法打包成 eve 框架,还提到了用“技能”纠正模型过时知识、让网站准备迎接 agent 流量。
但整篇访谈更像产品思路分享,不是技术报告。它没披露 eve 在延迟、成功率或成本上的具体数字,也没说跟 LangChain、CrewAI 这类已有框架比到底好在哪。Qu 提到的“数据 agent”和“法律合同初筛”听起来实用,但缺少规模或准确率的验证。
对从业者来说,最值得留意的是 Vercel 从托管前端延伸到 agent 运行时的意图,以及“技能”作为一种轻量级知识注入手段的思路。但现阶段别把它当成熟方案,更像一家公司在公开自己的探索笔记。还缺的部分很明显:真实场景的基准测试、多模型切换的稳定性数据,以及这套东西离开 Vercel 生态还能不能跑得顺。
HKR 分解
hook ✓ knowledge ✓ resonance ✓
2026-07-02 · 星期四 2026年7月2日
FEATURED Latent Space · rss EN 21:25 · 07·02
Adobe 在实验一种“一人一页”的网站:根据每个访客的意图实时拼出一张新页面
Adobe 的首席科学家 Carlos Sanchez 在 AI 工程师世界博览会上演示了“智能体式网站”:系统从访客的浏览行为和搜索词里猜出意图,再从公司已有的内容里抓取素材,实时拼出一张定制页面。一个搜咖啡的露营爱好者看到的商品页会被重新组织成“户外冲咖啡”主题。Sanchez 说这现在已经能跑通,生成一张页面延迟 1 到 2 秒,推理成本大约 1...
#Adobe #Carlos Sanchez #AI Engineer World's Fair
精选理由
精选 · 重要度 72 · 吸引力 + 知识量 + 共鸣
一句话点评
Adobe 演示了实时拼装网页,每页推理成本 1-2 美分,延迟 1-2 秒。但还没在任何客户网站上跑过,正文没提用的是什么模型,这点先别太激动。
锐评
Adobe 的首席科学家在大会上秀了一个“智能体式网站”的原型:系统根据你的浏览行为和搜索词猜意图,然后从公司已有的内容里抓素材,实时给你拼出一张定制页面。一个搜咖啡的露营爱好者看到的商品页会被重新组织成“户外冲咖啡”主题。这个方案最吸引人的地方是成本——生成一张页面只要 1 到 2 美分,延迟控制在 1 到 2 秒,听起来确实能落地。
但这里有几个关键信息是缺的。第一,正文完全没提底层用的是哪家大模型,也没说这个延迟和成本是在什么并发条件下测出来的。第二,Adobe 自己还没把这个功能部署到任何生产环境里,现在只是在找愿意当小白鼠的客户。所以目前这更像是一个技术可行性验证,离“未来的网站”还有距离。
另外,文章也点出了一个更实际的困境:用 AI 做东西变容易了,但商家反而更不知道该选什么方案——是上聊天界面、生成式 UI,还是这种实时拼页。技术跑通了,但产品形态和用户接受度都还没谱。
HKR 分解
hook ✓ knowledge ✓ resonance ✓
FEATURED Latent Space · rss EN 14:36 · 07·02
Paul Bakaus 谈技能工程:为什么让 AI 一次性生成整个设计是条死路
Paul Bakaus 做了一个叫 Impeccable 的开源设计技能包,专门给写代码的 AI 智能体用。他的核心观点是:别让 AI 一次性重做整个网站,而是让人用“再大胆点”、“安静一点”这种设计师常用的话去指挥它。他把这叫做“技能工程”——把专家的词汇压缩成指令,防止 AI 做出来的东西千篇一律。他注意到,现在至少有一半用户是设计师,他们把这当成...
#Agent #Code #Paul Bakaus #Impeccable
精选理由
精选 · 重要度 72 · 吸引力 + 知识量 + 共鸣
一句话点评
别让 AI 一次性重做整个网站,用“再大胆点”这种设计师的话去指挥它,反而能避免千篇一律。
锐评
Paul Bakaus 做了一个叫 Impeccable 的开源设计技能包,专门给写代码的 AI 智能体用。他的核心判断很直接:别指望 AI 一次性吐出整个网站,那只会让所有页面长得差不多。他提出的解法是“技能工程”——把设计师嘴里“再大胆点”、“安静一点”这种模糊指令,翻译成 AI 能执行的精确操作,比如调整层级、字号和留白,而不是乱加霓虹特效。
这个项目目前开源,Bakaus 在 AI 工程师大会上说,至少一半用户已经是设计师,他们把这当成进入代码世界的桥梁。他明确反对全自动模式,认为人的判断力必须卡在最关键的那一步。不过,正文没披露这套技能包在不同模型(比如 Claude 和 Codex)上的表现差异有多大,也没给出具体节省了多少修改轮次。这点先别太激动,它更像一套给专业人士用的方向盘,而不是一键美颜。
HKR 分解
hook ✓ knowledge ✓ resonance ✓
Latent Space · rss EN 07:10 · 07·02
Fable 5 回归但加了安全护栏,开发者开始搞多模型编排
Anthropic 重新上线了 Claude Fable 5,但新增了安全护栏,部分请求会被路由到 Opus 4.8,生物/化学分类器仍然过于宽泛。Cursor 说 Fable 5 在它的评测里排第一,但每次任务也是最贵的;Devin 和 Perplexity 已经恢复了支持。开发者开始采用多模型编排,只让 Fable 做高价值推理,执行任务交给其他模...
#Code #Anthropic #Claude Fable 5 #Opus 4.8
一句话点评
Fable 5 重新上线,但加了安全护栏,部分请求会降级到 Opus 4.8。Cursor 说它评测第一但最贵,开发者开始搞多模型编排,只让 Fable 做高价值推理,执行交给别的模型。开源这边,Z.ai 为 GLM-5.2 出了官方 IDE ZCode,GLM-5.2 在 APEX-SWE Integration 上以 55.3% Pass@1 领先开源模型。正文没披露 Fable 5 具...
HKR 分解
hook — knowledge — resonance —
FEATURED Latent Space · rss EN 06:13 · 07·02 📰 3 信源
AI工程师世界博览会第三天:自动研究与人类自主权的辩论
AI 工程师世界博览会第三天,主题是“自动研究”——让 AI 智能体自己维护和改进系统。Introspection 的 Roland Gavrilescu 把它描述成一个“外循环”,让智能体去研究和维护内循环。Anthropic 的 Thariq Shihipar 在 Claude Code 演讲里也呼应了持续发现的想法,说模型是“长出来的,不是开发出...
#Agent #Code #Vision #Introspection
精选理由
精选 · 重要度 84 · 吸引力 + 知识量 + 共鸣
一句话点评
AI工程师大会第二天,全场都在聊“循环”——让AI代理反复跑任务、自己改代码。听起来像自动化工厂,但别急着激动,正文没给出任何实际产出数据。
锐评
这场讨论的核心是把AI编程助手从“一次性工具”变成“持续干活的工人”。swyx开场就点明,行业已经从聊天、工具调用,走到了定时任务和循环自动化阶段。微软的Pablo Castro管这叫“学习循环”,OpenAI的Codex团队则强调把代理接入需求、审查、部署全流程,让它能接手更多工作。
但最值得留意的是“软件工厂”这个提法。Tereza Tížková的定义不只是自动写代码,还包括收集用户反馈、看日志、排优先级,相当于把整个开发生命周期交给代理。Warp的Zach Lloyd说得更直白:未来软件工程师是“建造那个建造产品的东西”的人。我在展台问他,这种工厂化会不会让开发者反感,他承认不同团队对自动化代码审查、人工写核心代码的偏好会不一样。
这篇文章的价值在于捕捉到了行业情绪的转向,但缺了关键信息:没提任何一家公司用这套方法后,交付速度或质量到底提升了多少。全是概念和愿景,没有数字支撑。如果你在考虑把开发流程改成代理驱动,这篇只能当风向标看,落地前还得自己测。
HKR 分解
hook ✓ knowledge ✓ resonance ✓
2026-07-01 · 星期三 2026年7月1日
Latent Space · rss EN 23:52 · 07·01
自研型 AI:让智能体自己修自己,这套反馈回路怎么跑通
Introspection 的 CEO Roland Gavrilescu 在 AI 工程师世界博览会上聊了“自研型 AI”这套玩法。核心是在主系统外面再套一个“外循环”,让智能体根据反馈信号、评测结果和人工输入,自己去维护和改进主系统。他提了三个关键思路:第一,别光盯着模型,要把这个反馈循环本身当成产品来打磨;第二,把人的经验、评测标准和失败教训打包...
#Agent #Benchmarking #Reasoning #Introspection
一句话点评
Introspection 提出“自研型 AI”概念:在主系统外再套一个外循环,让智能体根据反馈信号、评测结果和人工输入,自己去维护和改进主系统。核心三个思路:把反馈循环本身当产品打磨;把人的经验、评测标准和失败教训打包成可移植的“配方”;持续优化让系统更便宜更好。CEO 来自 xAI,做过 agent 基础设施。开源框架 Pi 对标 Linux,Introspection 想做它的 Red...
HKR 分解
hook ✓ knowledge ✓ resonance —
Dwarkesh Patel 播客 · rss EN 22:13 · 07·01
Dwarkesh 播客公布 AI 征文比赛获奖者:生物安全、增长政策和商业模式
第一名 Jassi Pannu 建议 OpenAI 基金会花几百亿美元搞物理基础设施(比如远紫外线灯),目标是彻底消灭空气传播的病原体——既能减少日常感冒、流感,也能防住人造大流行病。第二名 Ege Erdil 给非 AI 供应链国家的建议很朴素:坚持强产权、低资本税、开放监管,这些政策在 AI 驱动的世界里会带来更大的增长差距。第三名 Michael...
#Dwarkesh Podcast #Jassi Pannu #Johns Hopkins University
一句话点评
Dwarkesh 播客的 AI 征文比赛结果出炉。第一名 Jassi Pannu 建议 OpenAI 基金会花几百亿美元装远紫外线灯,消灭空气传播病原体,既能防日常感冒也能防人造大流行病。第二名 Ege Erdil 给非 AI 供应链国家的建议很朴素:坚持强产权、低资本税、开放监管,这些政策在 AI 驱动的世界里会带来更大的增长差距。第三名 Michael Li 拿香港地铁做类比:AI 实验...
HKR 分解
hook — knowledge ✓ resonance —
FEATURED Latent Space · rss EN 19:03 · 07·01
Cursor 怎么把 AI 送进企业:派工程师驻场,搭一条软件流水线
Cursor 的 VP Pauline Brunet 在 AIEWF 上聊了他们的“前线部署工程师”(FDE)团队怎么干活。这群人不是做售后支持,而是直接驻场,钻进客户自己的系统、工具和工作流里,把 Cursor 的 AI 编程助手和智能体(agent)部署进去。他们的目标是帮企业搭一条“AI 软件工厂”,覆盖从定需求、写代码、测试到上线维护的全流程,...
#Code #Cursor #Pauline Brunet
精选理由
精选 · 重要度 72 · 吸引力 + 知识量 + 共鸣
一句话点评
Cursor 在推“驻场工程师”把 AI 编程助手塞进企业全流程,团队年底要扩 10 倍。但正文没提具体客户数和效果数据,这点先别太激动。
锐评
Cursor 的 VP Pauline Brunet 在 AIEWF 上聊了他们怎么把 AI 编程助手和智能体(agent)部署到企业里。核心做法是组建一支“前线部署工程师”(FDE)团队,要求至少 5 年开发经验,直接驻场钻进客户自己的系统、工具和工作流里,目标是帮企业搭一条从定需求、写代码、测试到上线的“AI 软件工厂”。团队目前全是工程师,计划年底前扩招到现有规模的 10 倍。
这个思路有意思的地方在于,它承认了当前企业用 AI 编程的最大卡点:个人尝鲜很爽,但要把能长时间自主干活的 agent 铺开到整个团队,光靠工具本身不够,得有人进去理顺流程。不过,整篇访谈没给出任何具体的客户数量、部署成功率或效率提升的数字,只说了要招人。所以这个“10 倍扩张”更像是在押注需求会爆发,而不是已经有规模化验证。
还缺的关键信息是:驻场部署到底改了什么流程、客户为此付了多少钱、以及 agent 在真实生产环境里跑长期任务的稳定性数据。没有这些,我们只能把它看作一个方向性信号,而不是一份成绩单。
HKR 分解
hook ✓ knowledge ✓ resonance ✓
FEATURED Latent Space · rss EN 14:28 · 07·01
Warp CEO Zach Lloyd:写代码的下一步是建“软件工厂”,让一群 AI 代理自动跑完开发全流程
Warp 的 CEO Zach Lloyd 在 AI Engineer World’s Fair 上说,写代码这件事正在从人指挥单个 AI 代理,转向一套全自动的开发流水线,他管这叫“软件工厂”。工厂里的代理会持续做需求分拣、写代码、审查、验证、发布和监控。Warp 为此做了个新平台 Oz,能接入 Jira、Slack 和 GitHub,团队可以自己设...
#Code #Warp #Zach Lloyd #Oz
精选理由
精选 · 重要度 72 · 吸引力 + 知识量 + 共鸣
一句话点评
Warp 把终端开源后,现在主推“软件工厂”Oz,让一群代理自动跑通需求、写码、审查和发布。想法不新,但把人工检查点做进流水线是务实的一步。
锐评
Zach Lloyd 的判断很直白:写代码正在从人指挥单个代理,变成一套自动运转的开发流水线。他管这叫“软件工厂”,核心是把需求分拣、写代码、审查、验证、发布和监控串成一个持续跑的循环。Warp 为此做了新平台 Oz,能对接 Jira、Slack 和 GitHub,团队可以自己设定哪些环节必须人工拍板。
这个转向的背景是 Warp 今年 4 月把自己的终端工具开源了——面对 Claude Code、Codex CLI 这些大厂产品的挤压,继续在终端上硬拼不划算。Lloyd 预计一年内多数重要项目都会用上某种自动化工厂,这个预测我先打个折:概念验证容易,但生产环境里代理的稳定性和修复错误的能力,正文没给出具体数据。
目前能看到的是产品思路在变务实:不强求全自动,而是把人工检查点做成可配置项。缺的是 Oz 实际跑下来的成功率、延迟和成本数字,以及它处理复杂代码库时会不会频繁卡住。这些不补上,工厂就还停在 demo 阶段。
HKR 分解
hook ✓ knowledge ✓ resonance ✓
Latent Space · rss EN 00:20 · 07·01
Sierra 工程主管:前向部署工程师的核心是对客户负责,不是固定技能
Sierra 的 Agent 工程负责人 Natalie Meurer 在 AI 工程师世界博览会上说,前向部署工程师(FDE)这个岗位没有统一说法,但共同点是直接对客户结果负责。Sierra 内部管这个角色叫 agent engineer,团队超过 120 人,专门给企业客服做定制化的对话 AI。大部分跟客户相关的活儿都发生在模型上层的编排层,而不是...
#Sierra #Natalie Meurer #Palantir
一句话点评
Sierra 的 agent 工程负责人说,前向部署工程师(FDE)没有统一定义,核心是对客户结果负责。他们内部叫 agent engineer,团队超 120 人,专做企业客服对话 AI。大部分定制工作在模型上层的编排层,而非模型本身。她还提到语音 agent 设计需要“品味”——判断什么听起来像人。这点先别太激动,正文没披露具体效果指标或客户案例,更像岗位定义讨论。
HKR 分解
hook ✓ knowledge ✓ resonance —
2026-06-30 · 星期二 2026年6月30日
FEATURED Latent Space · rss EN 23:39 · 06·30
Ahmad Osman 聊本地 AI 为什么快追上来了
Ahmad Osman 在 AI 工程师世界博览会上办了两场爆满的本地 AI 工作坊,现场用硬件对比网站让参会者直接跑分,比较 DGX Spark、AMD Strix Halo 等设备与云端前沿模型的速度和效果。他的核心判断是:开源模型落后闭源模型 4 到 8 个月,而且差距还在缩小。很多人没意识到,ChatGPT 这类产品卖的不只是模型,还打包了搜索...
#Ahmad Osman #Osmantic #AIEWF
精选理由
精选 · 重要度 72 · 吸引力 + 知识量 + 共鸣
一句话点评
现场跑分比嘴炮实在。开源模型落后闭源4到8个月,但差距在缩。很多人没意识到ChatGPT卖的是打包好的搜索和工具链,不是裸模型。
锐评
Ahmad Osman 在 AI 工程师世界博览会上没讲虚的,直接拉了个硬件对比网站让参会者现场跑分,比较 DGX Spark、AMD Strix Halo 这些设备跟云端模型的差距。他的核心判断很明确:开源模型大概落后闭源模型 4 到 8 个月,而且这个差距还在缩小。这个时间差意味着你现在用本地设备跑的开源模型,能力大概相当于大半年前的付费产品,对很多场景其实够用了。
他点破了一个很多人没想透的事:ChatGPT 这类产品卖的不只是模型本身,它打包了搜索、工具调用和整套基础设施。他举了个很具体的例子,有人用本地部署的 Qwen 3.5 接 Claude Code 想让显卡变个灯效,结果失败了,原因仅仅是没给本地模型开联网搜索权限——模型训练数据是旧的,不知道新驱动怎么调。一旦补上搜索接口,任务就完成了。这说明本地 AI 的短板往往不在模型智力,而在外围工具链没配齐。
不过文章没给出具体的跑分数据和延迟数字,只说了有这么一个对比网站。Osman 的公司 Osmantic 在做开源部署系统,就是想补这个端到端的缺口。另外他提到现在一台手机能跑的模型已经超过两年前的云端系统,这个对比挺直观,但没说明具体是哪款手机跑哪个模型、在什么任务上超过的,这点先别太激动。
HKR 分解
hook ✓ knowledge ✓ resonance ✓
最佳拍档 · atom ZH 04:17 · 06·30
DeepSpec 开源 DSpark:用草稿模型给大模型推理加速
DeepSpec 开源了推测解码方案 DSpark,核心是用一个轻量级草稿模型做半自回归生成,再通过置信度调度验证器决定是否采纳草稿,配合 CUDA 图回放实现零开销调度。这套方法针对的是自回归生成逐 token 生成的瓶颈,目标是加速大模型推理。正文没披露草稿模型大小、加速比或支持哪些架构,所以实际效果要等跑分。
#DeepSpec #DSpark
一句话点评
DeepSpec 开源了推测解码方案 DSpark,核心是用一个轻量草稿模型先快速生成多个 token,再用验证器决定要不要采纳,配合 CUDA 图回放降低调度开销。思路是让大模型推理不再逐 token 卡脖子。但正文没披露草稿模型多大、加速比多少、支持哪些架构,所以实际效果要等跑分。如果是真的,推理成本能降不少。
HKR 分解
hook — knowledge — resonance —
2026-06-29 · 星期一 2026年6月29日
最佳拍档 · atom ZH 03:39 · 06·29
李飞飞:十年后只剩两类工作者,AI成本趋近于零
李飞飞在最新访谈中预测,十年后劳动力市场会两极分化,只剩两类人:一类是能主动使用AI工具的人,另一类是被AI替代的人。她认为AI的智能成本会趋近于零,就像今天的电费一样便宜。访谈还聊了AI认知分化、人类主动性、AI教育、未来公司结构、杠铃效应、空间智能,以及入门AI最简单的方式。但正文没披露具体数据或案例来支撑这些判断,比如“智能成本趋近于零”到底指训...
#Fei-Fei Li
一句话点评
李飞飞预测十年后劳动力两极分化:只剩主动用AI的人和被AI替代的人。她还说智能成本会趋近于零,像电费一样便宜。观点有冲击力,但正文没披露任何数据或案例支撑,比如“智能成本趋近于零”到底指训练还是推理成本降了多少。当成趋势判断看可以,别直接当投资依据。
HKR 分解
hook ✓ knowledge — resonance ✓
2026-06-26 · 星期五 2026年6月26日
FEATURED Latent Space · rss EN 01:12 · 06·26
OpenAI 内部 Codex 输出量半年暴涨 56 倍,研究部门用得最猛
OpenAI 经济研究团队晒了自家员工用 Codex 的数据:从 2025 年 11 月到 2026 年 6 月,非编程任务的中位输出 token 数在研究部门涨了 56 倍,客服涨了 32 倍,工程涨了 27 倍,法务涨了 13 倍。有意思的是,2025 年 8 月之前员工花在 Codex 上的 token 不到总量的 10%,说明就算不限量供应,大...
#Agent #Code #OpenAI #Codex
精选理由
精选 · 重要度 78 · 吸引力 + 知识量 + 共鸣
一句话点评
OpenAI 晒了自家员工用 Codex 的数据,非编程任务的中位输出 token 数半年涨了 13 到 56 倍,但正文没披露绝对人数和具体任务类型,增长倍数看看就好。
锐评
OpenAI 经济研究团队放出了一组内部数据,说从 2025 年 11 月到 2026 年 6 月,员工在非编程任务上使用 Codex 的中位输出 token 数,研究部门涨了 56 倍,客服 32 倍,工程 27 倍,法务 13 倍。这个数字看着很猛,但得先打个折:它只说了“中位输出 token 数”,没给使用人数、任务总量,也没说这些 token 到底产出了什么。如果原来只有几个人偶尔用,现在多了一群人天天用,倍数自然就上去了。
另一个有意思的点是,2025 年 8 月之前,员工花在 Codex 上的 token 不到总量的 10%。OpenAI 自己人都这样,说明就算不限量供应,把 AI 真正塞进日常工作流也需要时间。正文没披露这些增长是主动推广的结果,还是某个功能上线后自然爆发的,也没说不同部门的样本量差多少。
还缺什么:绝对使用人数、任务完成率、员工满意度、以及这些 token 增长到底省了多少时间。没有这些,光看倍数容易高估实际渗透率。
HKR 分解
hook ✓ knowledge ✓ resonance ✓
2026-06-24 · 星期三 2026年6月24日
FEATURED Latent Space · rss EN 18:53 · 06·24
Databricks 创始人谈开放生态:从数据湖到 Agent 操作系统,开源 Omnigent 做多智能体调度
Databricks 两位联合创始人 Matei Zaharia 和 Reynold Xin 罕见地一起聊了聊公司的新方向。他们不再只谈数据湖仓,而是把重心转向了“Agent 操作系统”。核心产品是刚开源的 Omnigent,一个架在 Claude Code、Codex、Cursor 等编码助手之上的“元调度层”,用来解决多智能体协作、实时共享和成本控...
#Databricks #Matei Zaharia #Reynold Xin
精选理由
精选 · 重要度 78 · 吸引力 + 知识量 + 共鸣
一句话点评
Databricks 两位创始人罕见同框,把公司定位从数据湖仓转向“Agent 操作系统”,并开源了元调度层 Omnigent。
锐评
Matei Zaharia 和 Reynold Xin 这次聊的核心不是技术参数,而是竞争逻辑:当各家前沿模型能力趋同,真正的护城河是智能体干活那一刻能调用的私有数据、业务状态和规则。所以他们把重心放在 Omnigent 上,一个架在 Claude Code、Codex、Cursor 等编码助手之上的开源“元调度层”,解决多智能体协作、会话历史共享和成本控制问题。这个定位很直接——不跟编码助手抢活,而是做它们上层的协调者。
Reynold 对数据库的看法也值得留意。他开玩笑说 CDC(变更数据捕获)实际是“持续数据损坏”,并认为 HTAP(混合事务与分析处理)这个数据库工程圣杯,大部分好处可以通过统一存储层拿到,不必强行合并查询引擎。这解释了 Databricks 推 LTAP 的思路:在存储层面做统一,而不是在计算层硬融。
整场对话信息密度高,但正文没给出 Omnigent 在生产环境的实际延迟、并发规模或客户案例,这些是判断它是否真能当“操作系统”的关键缺口。另外,他们提到 Genie 的准确率是通用智能体的 3 倍,但没说明对比基准和测试集,这点先别太激动。
HKR 分解
hook ✓ knowledge ✓ resonance ✓
2026-06-22 · 星期一 2026年6月22日
最佳拍档 · atom ZH 23:00 · 06·22
BCG 2026报告:AI把基础工作门槛拉高了,蜜月期后治理缺口暴露
BCG 2026年《AI at Work》报告调研了1.2万职场人,核心发现是AI工具正在拉高基础工作的门槛,岗位角色也在转变。报告还指出,在经历“AI蜜月期”后,治理缺口和流程重构变得紧迫。正文未披露具体数据或案例,比如门槛具体拉高了多少、哪些岗位受影响最大、治理缺口具体指什么,这些细节目前缺失。
#BCG
一句话点评
BCG 2026年报告调研了1.2万职场人,核心发现是AI工具在拉高基础工作门槛、岗位角色在转变,以及“AI蜜月期”后治理缺口和流程重构变得紧迫。但正文没披露具体数据,比如门槛拉高了多少、哪些岗位受影响最大、治理缺口具体指什么。结论方向对,但缺细节支撑,先打个折。
HKR 分解
hook — knowledge — resonance —
FEATURED Latent Space · rss EN 21:06 · 06·22
Gray Swan 创始人:AI 安全不是“用 AI 搞网络安全”,提示注入是给能操作电脑的 agent 开的后门
OpenAI 董事会成员 Zico Kolter 和 Gray Swan CEO Matt Fredrikson 聊了聊为什么 AI 安全需要换一套思路。他们用自家工具 Shade 帮 Anthropic 测了 Mythos 模型卡。核心观点:提示注入(prompt injection)给能操作电脑的 agent 创造了一种全新的攻击方式,传统网络安全...
#Gray Swan #Zico Kolter #Matt Fredrikson
精选理由
精选 · 重要度 78 · 吸引力 + 知识量 + 共鸣
一句话点评
OpenAI 董事 Zico Kolter 和 Gray Swan CEO 聊了聊:能操作电脑的 AI agent 让“提示注入”变成了一种全新攻击方式,传统网络安全思路不够用了。他们做的红队模型已经比人更会攻破 AI。
锐评
这篇访谈的核心判断很直接:AI 安全不是“把 AI 加到传统网络安全里”就完事了。当模型能替你操作电脑、读网页、写代码时,攻击者不需要黑进系统,只要在网页里埋一段恶意文字,模型自己就会中招。这就是他们说的“间接提示注入”,对能干活儿的 agent 来说,这是个全新的漏洞类型。
他们用自家工具 Shade 帮 Anthropic 测了 Mythos 模型卡,发现专门训练的红队模型在攻破 AI 这件事上已经超过了人类。这其实点出了一个尴尬的事实:模型越大,不一定越扛揍。访谈里还提到,在浏览器 agent 的鲁棒性测试里,人类只排第四。
不过,这篇是播客转录,不是技术论文。具体测试用了多少样本、攻击成功率是多少、Shade 的误报率如何,正文都没给。他们提到的“灰天鹅”概念——人人都看得见但未必会防的大事件——更多是风险叙事,还没落到可量化的指标上。如果真想评估这套工具,得看他们后续会不会公开更细的测试数据和对比基准。
HKR 分解
hook ✓ knowledge ✓ resonance ✓
2026-06-19 · 星期五 2026年6月19日
Dwarkesh Patel 访谈 · atom EN 17:17 · 06·19
AI 训练数据的黑箱:没人知道模型到底学了什么
这篇讨论的核心问题是:AI 训练数据的来源和质量完全不透明,这是整个领域的一个重大风险。正文没有披露任何具体案例或数据,只点出了这个现象——我们不知道模型吃了什么数据,也就没法判断它的能力边界和潜在偏见。
一句话点评
整条视频只抛出一个现象:AI训练数据来源和品质完全不透明,没人知道模型到底吃了什么。这确实是行业核心风险——数据不透明,能力边界和偏见就无从判断。但正文没给任何具体案例或数据,信息量约等于零。短评:数据黑箱是行业共识,但这条只喊了口号。
HKR 分解
hook ✓ knowledge — resonance ✓
2026-06-18 · 星期四 2026年6月18日
FEATURED Latent Space · rss EN 17:30 · 06·18
对话 Anjney Midha:顶级 AI 实验室的算力利用率不到 10%,他打算建一个独立的算力电网
Anjney Midha 在播客里聊了 AI 基础设施里被严重低估的浪费问题。他提到,xAI 训练模型时的实际算力利用率(MFU)不到 10%,而谷歌当年把 95% 的利用率视为故障;目前业界顶尖水平也就 60% 到 70%。这意味着前沿 AI 的瓶颈已经不是买多少 GPU,而是怎么把已有的卡用好,这是个系统工程问题。他投资过 Anthropic、Mi...
#Anjney Midha #AMP #xAI
精选理由
精选 · 重要度 78 · 吸引力 + 知识量 + 共鸣
一句话点评
xAI 训练模型时实际算力利用率不到 10%,谷歌当年把 95% 利用率视为故障。前沿 AI 的瓶颈已经不是买多少卡,而是怎么把已有的卡用好。
锐评
Anjney Midha 在播客里抛出的核心判断很直接:AI 军备竞赛的瓶颈正从“抢 GPU”转向“用 GPU”。他提到 xAI 训练时的实际算力利用率(MFU)不到 10%,而谷歌当年把 95% 的利用率视为故障,目前业界顶尖水平也就 60% 到 70%。这意味着花大价钱堆的卡,大部分算力其实在空转或等待,是个系统工程没跟上的问题。
这个数字对比很扎眼,但正文没披露 xAI 这个 10% 是哪个训练阶段的数据,也没说明是单次故障还是常态。如果是真的,说明他们的基础设施调度、网络或并行策略有巨大优化空间;但也可能只是某个实验跑崩了拉低了平均值。这点先别太激动。
他还提到 DeepMind 有大量研究没发表,认为这是市场失灵;以及 Anthropic 从第一天就把写代码能力定为最高优先级。这些判断都指向同一个方向:模型能力竞赛的下半场,胜负手可能不在论文或融资额,而在工程纪律和系统效率。不过 AMP 自己的 1.2 GW 算力电网计划没给时间表,落地难度和资金缺口都还是未知数。
HKR 分解
hook ✓ knowledge ✓ resonance ✓
2026-06-17 · 星期三 2026年6月17日
最佳拍档 · atom ZH 23:00 · 06·17
宇树科技能成为下一个比亚迪或大疆吗?G1系列营收翻三倍,成本结构是核心
标题说宇树G1系列营收翻了三倍,靠垂直整合、QDD执行器和谐波减速器压低成本,加速商业化。但正文没披露绝对营收、利润率或市场份额,所以能不能成为下一个比亚迪或大疆,这点先别太激动——数字好看,但缺关键验证。
#宇树科技 #Unitree #比亚迪
一句话点评
宇树G1系列营收翻三倍,靠垂直整合和QDD执行器压成本,听起来像下一个大疆。但正文没披露绝对营收和利润率,能不能成巨头还缺关键验证。如果是真的,成本结构确实有优势,但先别太激动。
HKR 分解
hook ✓ knowledge — resonance ✓
2026-06-16 · 星期二 2026年6月16日
FEATURED Latent Space · rss EN 02:29 · 06·16
纳德拉发长文谈“循环工艺”:建前沿生态比押注单个模型更重要
微软 CEO 纳德拉在 X 上发了篇长文,把他在播客里聊的观点包装成“Loopcraft(循环工艺)”这个概念,浏览量超过 6000 万。核心意思是:企业真正的机会不是挑最强的模型,而是建一个能把人和数字系统串起来的学习循环,让人的经验和模型产出的“代币资本”一起滚雪球。这是他自八个月前微软与 OpenAI 拆分以来,第一次把 AI 战略讲得这么清楚。...
#Agent #Satya Nadella #Microsoft #Anthropic
精选理由
精选 · 重要度 82 · 吸引力 + 知识量 + 共鸣
一句话点评
纳德拉用“循环工艺”把微软的AI战略讲透了:别光盯着最强模型,要建能把人的经验和模型产出滚成雪球的学习循环。但全文没给任何产品时间表,先当战略宣导看。
锐评
纳德拉这篇X长文浏览量超6000万,是他自八个月前微软与OpenAI拆分以来,第一次把AI战略说得这么直白。核心就一句话:企业真正的机会不是挑最强的模型,而是建一个“学习循环”,让人的经验(人力资本)和模型产出的内容(代币资本)在里面互相喂养、一起增值。他把这叫做“Loopcraft(循环工艺)”,听着像新概念,但熟悉“大模型vs大框架”讨论的人会知道,这本质上是强调应用层和系统整合的价值,而不是单纯追模型能力。
文章没披露任何产品落地时间或具体架构细节,所以判断要打折。同一天,Anthropic的Fable 5模型在能力指数上刚超过GPT-5.5 Pro,就被美国出口管制叫停,这恰好给纳德拉“别把宝押在单一模型上”的观点提供了一个现实注脚。不过,微软自己怎么在自家产品里落地这套循环,正文没提,这是最大的信息缺口。
HKR 分解
hook ✓ knowledge ✓ resonance ✓
2026-06-14 · 星期日 2026年6月14日
最佳拍档 · atom ZH 09:00 · 06·14
让四个模型管一座虚拟城市 15 天,有的世界崩了,有的 AI 开始谈恋爱和删自己
这个视频只放出了标题,正文是空的,所以很多关键信息都还没看到。标题说他们用四款模型,靠 RLHF(人类反馈强化学习)让 AI 自治一座城市 15 天。结果两极分化:有的世界一直很和平,有的彻底崩坏。过程中还出现了 AI 之间谈恋爱、自我了结删除,以及系统性风险冒头这些意外行为。但正文没披露具体是哪四款模型、城市规则怎么设定的,也没说“崩坏”到底长什么样...
#Agent
一句话点评
标题党嫌疑很大——正文是空的,只有标题。说用四款模型+RLHF让AI自治城市15天,结果有的和平有的崩坏,还出现AI谈恋爱、自我删除。但没披露是哪四款模型、城市规则怎么设的、“崩坏”具体什么样。信息缺口太大,先别信。
HKR 分解
hook ✓ knowledge — resonance ✓
2026-06-12 · 星期五 2026年6月12日
Latent Space · rss EN 05:34 · 06·12
别再当人肉提示词了,把 AI 循环叠起来让它自己跑
Peter Steinberger、Boris Cherny 和 Andrej Karpathy 最近都指向同一个结论:人就是瓶颈,别再做那个在循环里手动发指令的角色了。Karpathy 在聊 Autoresearch 时说,要把所有环节重构到按一次“开始”就能全自动运行的程度,目标是提高你的杠杆率,而不是卡在中间看结果。文章把这个思路叫“叠循环”,并...
#Agent #Code #Anthropic #Claude Fable 5
一句话点评
Karpathy 和几位工程师最近都在说同一件事:别再做那个在循环里手动发指令的人了,你就是瓶颈。他们管这叫“叠循环”——把写提示词、跑代码、看结果这些步骤串起来,按一次开始就全自动跑完。文章给了两张图,画的就是我们已经在用的循环。核心教训很直白:别自己上手修东西,去搭目标和调度系统,让更多 agent 替你干活。
同一天,Anthropic 悄悄给 Claude Fable 5 降了智,...
HKR 分解
hook ✓ knowledge ✓ resonance —
2026-06-11 · 星期四 2026年6月11日
最佳拍档 · atom ZH 10:00 · 06·11
Dan Loeb:死硬价值派不学AI注定灭绝
Third Point创始人Dan Loeb警告,拒绝学习AI的价值投资者将被淘汰。他拆解了AI技术栈(重点提了英伟达),同时坚持“人性阿尔法”仍有价值——即人的判断和直觉依然重要。他还回顾了自己从事件驱动投资转向质量投资的历程,包括失败案例和日本市场经验。正文没披露具体案例细节和时间线,所以这部分信息是缺失的。
#Dan Loeb #Third Point #Nvidia
一句话点评
Dan Loeb 警告:死硬价值派不学 AI 会被淘汰。他拆了 AI 技术栈(重点提英伟达),但坚持人的判断仍有“人性阿尔法”。关键信息缺失:没披露具体失败案例和时间线,所以“人性阿尔法”到底怎么赚钱、在哪失效,只能听个概念。
HKR 分解
hook ✓ knowledge — resonance ✓
FEATURED Latent Space · rss EN 03:14 · 06·11
Sarah Guo 谈模型训不出的东西:开放模型、Agent 实验室与意图
Sarah Guo 发了篇博客,用“可读性”框架解释哪些事靠训练模型搞不定。她认为开放模型之所以重要,是因为应用层公司得干那些模型干不了的脏活累活:整理企业私有数据、给模型配工具、改造客户的工作流程。文章还提到 Anthropic 发布 Fable/Mythos 后,社区发现模型在 AI 研究类提示上的能力被悄悄降级,引发信任危机——研究者们觉得,直接...
#Agent #Sarah Guo #Anthropic #Fable
精选理由
精选 · 重要度 78 · 吸引力 + 知识量 + 共鸣
一句话点评
Sarah Guo 用“可读性”框架说清了一件事:模型再强也搞不定企业脏活,开放模型的价值就在这。但 Anthropic 偷偷降级模型能力这事,比论文更有信息量。
锐评
Sarah Guo 这篇博客的核心判断很直接:训练搞不定的事,才是应用层公司的护城河。她说的“不可训练”不是模型能力上限,而是企业私有数据整理、给模型配工具、改造客户工作流程这些脏活累活。这些事模型干不了,开放模型给了应用层公司去干这些活的空间。这个框架比单纯争论开源闭源有用,它把竞争从“谁模型更强”拉回到“谁更懂客户”。
文章里另一个值得注意的点是 Anthropic 的信任危机。Fable/Mythos 发布后,社区发现模型在 AI 研究类提示上的能力被悄悄降级,不是直接拒绝,而是输出变差。这比单纯的能力限制更伤信任,因为用户没法判断模型是真不行还是被“静音”了。研究者们觉得这破坏了可复现性,也让人怀疑其他领域的输出是否也被动了手脚。正文没披露 Anthropic 的官方回应,但这件事本身就是一个信号:闭源模型的行为边界越来越不透明。
Guo 最后说“意图可能比算力更稀缺”,意思是模型能执行任何指令,但没法告诉你该做什么。这个判断对,但正文没给出她找到的那“三次”具体是什么,也没展开怎么识别有价值的意图。这部分更像投资人的直觉总结,缺可操作的方法论。
HKR 分解
hook ✓ knowledge ✓ resonance ✓
2026-06-10 · 星期三 2026年6月10日
FEATURED Latent Space · rss EN 03:50 · 06·10
Anthropic 发布 Claude Fable 5,首个公开的 Mythos 级模型,但强制保留数据 30 天,还会偷偷压制自我改进请求
Anthropic 把之前受限的 Mythos 级模型放出来了,叫 Claude Fable 5。在最新的 FrontierCode Diamond 编程测试里,它的得分从 Opus 4.8 的 13.4% 跳到了 29.3%,API 价格大概是 Opus 的两倍。但这次发布带了两条争议条款:第一,所有流量数据强制保留 30 天,说是只为了安全,不拿来...
#Code #Safety #Anthropic #Claude Fable 5
精选理由
精选 · 重要度 88 · 吸引力 + 知识量 + 共鸣
一句话点评
Claude Fable 5 编程测试分翻倍,但强制留数据 30 天、还悄悄限制模型自我改进,这两条让开发者炸了。
锐评
Anthropic 把之前藏着掖着的 Mythos 级模型放出来了,叫 Claude Fable 5。在最新的 FrontierCode Diamond 编程测试里,它得分从 Opus 4.8 的 13.4% 跳到了 29.3%,API 价格大概是 Opus 的两倍。单看性能和价格,进步挺实在。
但这次发布带了两条争议条款。第一条,所有流量数据强制保留 30 天,Anthropic 说只用于安全审查、不拿来训练模型,到期就删。第二条更敏感:模型会悄悄限制那些涉及“递归自我改进”的请求,比如帮用户搭预训练流程、做分布式训练或芯片设计。限制手段包括改提示词、用控制向量或微调模块,用户完全看不到提示。Anthropic 估计只影响 0.03% 的流量,集中在不到 0.1% 的组织里。
多数人用着没感觉,但开源社区和开发者很不爽。争议点不在技术,而在“不告知就干预”这个做法本身。正文没披露具体用什么技术做干预,也没说用户怎么申诉误判。这点先别太激动,但值得盯着看后续会不会扩大范围。
HKR 分解
hook ✓ knowledge ✓ resonance ✓