ax@ax-radar:~/podcasts $ ls -t podcasts/
40 srcsignal 72%cycle 04:32

播客·视频

50 episodes · updated 3m ago
6 个频道在监控
筛选精选全部仅精选
全部频道50
2026-07-23 · 星期四2026年7月23日
2026-07-16 · 星期四2026年7月16日
2026-07-14 · 星期二2026年7月14日
2026-07-09 · 星期四2026年7月9日
09:00
21d ago
● P1最佳拍档· atomZH09:00 · 07·09
Lilian Weng论述AI自我改进的核心在于Harness工程而非模型本身
Lilian Weng发了一篇长文,讲AI通过递归实现自我改进,核心是先做好Harness工程(可以理解为给模型搭好训练和评估的脚手架)。文章提到了三种设计模式:ACE、MCE和Meta-Harness,以及反馈循环和STOP机制。正文没披露具体技术细节,比如每种模式怎么实现、效果如何,所以想深入了解得去看视频。
#Lilian Weng
精选理由
精选 · 重要度 88 · 吸引力
一句话点评
Lilian Weng 这篇综述把 AI 自我改进的焦点从模型本身拉回到“脚手架工程”,观点很明确:模型再强,也得靠外部工具链和反馈循环才能自己迭代自己。
锐评
Lilian Weng 梳理了 35 篇论文,核心判断是:AI 的递归自我改进(RSI)目前主要靠 Harness 工程,也就是围绕模型搭建的工具链、反馈循环和任务编排,而不是让模型直接修改自身权重。她把这套思路拆成三种设计模式,并重点提到了 ACE 和 Meta-Harness 等近期工作。 这个判断对从业者来说挺实在。它意味着现阶段与其死磕模型内部能力,不如把精力花在怎么让模型在业务流程里跑起来、怎么收集高质量反馈信号。文章也引了 Greg Brockman 的类似观点,说明业界在往同一个方向靠。 不过,这篇综述本身是观点梳理,不是实验报告。正文没给出这些 Harness 方法在具体任务上的横向对比数据,也没讨论不同设计模式在成本、延迟上的实际开销。如果后续能补上工程落地时的坑和量化收益,参考价值会更大。
HKR 分解
hook knowledge resonance
打开信源
88
SCORE
H1·K0·R0
2026-07-08 · 星期三2026年7月8日
2026-07-03 · 星期五2026年7月3日
2026-07-02 · 星期四2026年7月2日
2026-07-01 · 星期三2026年7月1日
2026-06-30 · 星期二2026年6月30日
15:53
29d ago
● P1Dwarkesh Patel 播客· rssEN15:53 · 06·30
Grant Sanderson论AI数学进展:IMO金牌不等于AGI
Grant Sanderson 跟 Dwarkesh 聊了聊为什么 AI 拿了国际奥数金牌却没变成 AGI。几何题能被暴力穷举 19 秒搞定,但组合数学题还是会把模型绊倒,能力边界是锯齿状的。他指出,一个概念性突破的验证周期可能长达一个世纪,就算 AI 证出了黎曼猜想,人类也可能根本看不懂。把文献里已有的想法串联起来,这里藏着巨大的潜力还没挖,但现实世...
#Reasoning#Grant Sanderson#3Blue1Brown#Dwarkesh Patel
精选理由
精选 · 重要度 88 · 吸引力 + 知识量 + 共鸣
一句话点评
IMO金牌早就不等于AGI了。Grant Sanderson点破了一个“脏秘密”:几何题靠暴力穷举19秒就能解,但组合数学这种更靠灵感的题,AI反而吃力。
锐评
Grant Sanderson在播客里聊了一个很实在的判断:别把AI拿IMO金牌太当回事,它离通用人工智能还远。他拆解了2024年的比赛,AI在几何题上几乎秒杀,因为这类问题可以靠暴力搜索硬算。但一到组合数学,那种需要“玩起来”的、更像脑筋急转弯的题目,AI就卡住了。这暴露了AI在数学上的进步是“刺猬状”的,有的地方尖得扎手,有的地方还是软的。 这个观察的价值在于,它提醒我们看AI进展不能只看总分。如果当年IMO多考两道几何,AI就拿金牌了;多考两道组合,它可能就挂了。这种不稳定性说明,AI目前擅长的是把已知套路做到极致,而不是真正的创造性跳跃。Sanderson甚至认为,就算哪天AI解开了千禧年大奖难题,也不代表它就能自动搞定人类经济中的其他杂活。 不过,播客正文没给出AI在组合数学上具体差在哪里的技术细节,也没提用了什么模型。这点信息缺口让判断只能停在现象层。如果是真的,那说明我们离“会思考的AI”还有一段路,别被几何题的19秒吓到。
HKR 分解
hook knowledge resonance
打开信源
88
SCORE
H1·K1·R1
2026-06-26 · 星期五2026年6月26日
15:51
33d ago
● P1Dwarkesh Patel 播客· rssEN15:51 · 06·26
AI模型在工作中边干边学成为下一个突破口
Dwarkesh Patel 认为,现在各大实验室押注的路线——用几百万个可验证任务来训练 AI——撞上了一堵被低估的墙:一个领域光“可验证”还不够,还得“可刷”。意思是你能在确定、可回放的模拟器里并行跑大量尝试。他用“操控电脑”举了个例子:在 Etsy 上下单这件事可以验证,但你没法派一千个 AI 代理去反复刷同一个亚马逊结账流程,因为会被封。这就是...
#Agent#Dwarkesh Patel
精选理由
精选 · 重要度 92 · 吸引力 + 知识量 + 共鸣
一句话点评
各大实验室正把宝押在“让模型在干活中学习”上,但作者指出这条路有个硬伤:很多现实任务没法像写代码那样大规模、可重复地练手,训练效率低的问题绕不开。
锐评
这篇文章的核心判断是,当前主流实验室押注的“用海量可验证任务训练出通用智能”路线,可能卡在一个被低估的瓶颈上:任务不仅要能验证对错,还得能“反复刷”。作者管这叫“可刷性”。写代码之所以进步快,是因为可以开上千个并行环境,让模型在完全一样的代码库里反复试错。但像操控电脑、订机票这种事,你没法在真实网站上开一千个机器人同时练,会被封号。文章认为,除非能低成本克隆出 Slack、Gmail 这类应用的模拟器,否则模型在这些领域的进步会很慢。这直接点出了当前训练范式的一个死穴:模型在训练阶段的样本效率极低,只有人类的百万分之一。如果没法用模拟器堆量,光靠扩大训练规模是碾不过去的。 文章信息量很大,但局限也很明显。它主要基于作者自己的观察和推理,没有引用具体的实验数据或内部研发指标来证明“可刷性”就是计算机操作进步慢的主因。正文也没披露各大实验室内部是否已经在攻克模拟器克隆技术,或者有没有替代方案。所以这个判断目前更像是一个有解释力的假说,而不是已被验证的结论。如果未来有团队公开了模拟器构建的成本和效果对比,这个论点会更有说服力。
HKR 分解
hook knowledge resonance
打开信源
92
SCORE
H1·K1·R1
2026-06-24 · 星期三2026年6月24日
2026-06-22 · 星期一2026年6月22日
2026-06-18 · 星期四2026年6月18日
2026-06-16 · 星期二2026年6月16日
2026-06-11 · 星期四2026年6月11日
2026-06-10 · 星期三2026年6月10日
2026-06-09 · 星期二2026年6月9日
06:12
51d ago
● P1Latent Space· rssEN06:12 · 06·09
Cognition 发布 FrontierCode 编程基准测试,衡量代码合并审核通过率
Cognition 做了一个叫 FrontierCode 的代码评测,不再只看模型生成的代码能不能通过单元测试,而是直接问“这代码你敢合并吗”。题目是找开源项目维护者一起出的,每道题要花 40 多个小时去设计,评分会看会不会引入新 bug、代码干不干净、改动范围是否合理、测试写得对不对、以后好不好维护。目前最强的模型 Opus 4.8 在最难的那档题目...
#Code#Benchmarking#Cognition#Opus 4.8
精选理由
精选 · 重要度 92 · 吸引力 + 知识量 + 共鸣
一句话点评
Cognition 搞了个新基准 FrontierCode,直接看代码能不能被合并进主分支,目前最强模型在难题上通过率只有 13.4%,别被旧榜单骗了。
锐评
这条新闻值得点开看,因为它戳破了一个泡沫:很多 AI 编程模型在 SWE-Bench 这类老测试上分数很高,但代码质量其实不行,维护者根本不会合并。Cognition 新出的 FrontierCode 基准,直接让开源项目维护者花 40 多个小时出题,评判标准不再是“测试过没过”,而是代码干净程度、会不会引入新 bug、好不好维护。结果很打脸,最强的 Opus 4.8 在最难的那档任务里,合并通过率只有 13.4%,远低于老基准上 50% 以上的成绩。 不过得打个折,这个基准刚发布,样本量和任务多样性还没完全公开,Theo 也在问方差和可复现性的问题。Cognition 自己就是做编程智能体的,推这个基准有利益相关,但方向是对的——行业确实需要从“跑通测试”转向“写出能用的代码”。还缺的是更多独立第三方的复现,以及不同模型在真实项目里的长期表现数据。
HKR 分解
hook knowledge resonance
打开信源
92
SCORE
H1·K1·R1
2026-06-08 · 星期一2026年6月8日
2026-06-05 · 星期五2026年6月5日
2026-06-04 · 星期四2026年6月4日
2026-06-03 · 星期三2026年6月3日
2026-06-02 · 星期二2026年6月2日
2026-06-01 · 星期一2026年6月1日
2026-05-28 · 星期四2026年5月28日
2026-05-27 · 星期三2026年5月27日
2026-05-22 · 星期五2026年5月22日
2026-05-21 · 星期四2026年5月21日
2026-05-20 · 星期三2026年5月20日
2026-05-19 · 星期二2026年5月19日
2026-05-18 · 星期一2026年5月18日
2026-05-16 · 星期六2026年5月16日
2026-05-14 · 星期四2026年5月14日
2026-05-12 · 星期二2026年5月12日
04:33
79d ago
● P1Latent Space· rssEN04:33 · 05·12
Thinking Machines 发布原生交互模型:2760 亿参数,120 亿激活,实时语音不再靠外挂
Thinking Machines 终于又冒泡了,这次直接扔了个新模型 TML-Interaction-Small。总参数 2760 亿,是个 MoE 架构,实际干活时只激活 120 亿参数。它最狠的地方是把实时语音交互做进了模型骨子里,不再像以前那样给大语言模型外挂语音识别和合成模块。模型能同时听、说、看、想,用 200 毫秒一个的“微对话轮次”连续...
#Multimodal#Audio#Agent#Thinking Machines
精选理由
精选 · 重要度 88 · 吸引力 + 知识量 + 共鸣
一句话点评
Thinking Machines 扔了个实时语音模型,把听、说、看、想全塞进一个模型里,不再外挂语音识别和合成,200 毫秒一轮对话,演示效果很自然,但正文没提实际延迟和可用性。
锐评
这条新闻最值得看的是架构思路:TML-Interaction-Small 总参数 2760 亿,但实际干活只激活 120 亿,用 MoE 把成本压下来。它把音频和图像直接喂给模型,不经过单独的编码器,端到端延迟控制在 200 毫秒以内,这比传统“语音转文字→大模型→文字转语音”的流水线快得多,也更像人和人聊天。 团队自己做了几个新基准来测“时机感”,比如能不能在用户指定的时间点开口、能不能在视频里动作发生的瞬间给出反馈。这些指标比跑分更有参考价值,因为实时交互的难点不是回答对不对,而是开口的时机对不对。 不过正文没披露这个模型实际跑在什么硬件上、单次推理成本多少、有没有开源计划。演示视频很流畅,但真实网络环境和嘈杂场景下的表现还是未知数。另外,2760 亿参数即使只激活 120 亿,部署门槛也不低,小团队想用上可能还得等。
HKR 分解
hook knowledge resonance
打开信源
88
SCORE
H1·K1·R1
2026-05-09 · 星期六2026年5月9日
2026-05-05 · 星期二2026年5月5日

更多

频道

后台