FEATUREDLex Fridman 播客· atomEN16:24 · 03·23
黄仁勋对谈 Lex Fridman:英伟达如何从单卡竞争转向整机柜、整数据中心的极端协同设计
黄仁勋在播客里解释了英伟达现在为什么要搞“极端协同设计”——因为单颗 GPU 已经不够用了。你想让一万台计算机跑出百万倍的加速,就不能只堆硬件,得把算法拆开、把模型和数据切碎(分片),让网络、交换、存储、供电、散热全部配合起来。否则受制于阿姆达尔定律,计算部分再快,整体也只快一点点。他还提到自己直接管 60 多个人,几乎全是工程背景,分别盯着内存、CP...
#Inference-opt#Tools#NVIDIA#Jensen Huang
精选理由
精选 · 重要度 80 · 吸引力 + 知识量 + 共鸣
一句话点评
黄仁勋亲口解释英伟达为什么从卖单卡转向卖整柜:单颗GPU加速再快,只要网络、存储、供电拖后腿,整体提速就极其有限。
锐评
黄仁勋在播客里把英伟达现在的打法讲得很直白:不是他们想搞这么复杂,是单靠堆GPU数量已经撞墙了。他用阿姆达尔定律打了个比方——假设计算只占整个任务50%的时间,你把计算速度提到无限快,整体也只能快两倍。所以必须把算法拆开、把模型和数据切碎分到上万台机器上,同时把网络、交换、供电、散热全部拉齐,否则就是木桶效应。
这个逻辑解释了英伟达为什么从芯片公司变成数据中心级系统公司。他还透露自己直接管60多个人,几乎全是工程背景,分别盯着内存、CPU、光学这些细分方向,组织架构就是照着产品架构搭的。
不过整场对话没给出具体案例数据,比如这种极端协同设计在某个真实大模型训练任务上到底省了多少时间或功耗。他说的“一万台机器跑出百万倍加速”更像理想目标,实际能效比还得看落地。另外,这种全栈绑定对客户来说意味着更高的切换成本,这点他没展开聊。
HKR 分解
hook ✓knowledge ✓resonance ✓