超节点:被逼出的算力创新,中国厂商积极布局,大规模落地仍面临多重挑战

超节点:被逼出的算力创新,中国厂商积极布局,大规模落地仍面临多重挑战 超节点概念的提出与发展2024年3月英伟达创始人黄仁勋在GTC上率先提出了「超节点」概念展示了英伟达NVL72系列将36个Grace CPU和72个Blackwell GPU「装」进液冷机柜。与传统模式不同「超节点」通过高速互联技术将大量GPU、CPU整合为单个物理节点。但起初「超节点」未迅速成为风口NVL72系列还因「散热问题」推迟交付遭媒体质疑。后来巨头们用「千卡、万卡乃至百万卡AI集群」的行动表达了对「超节点」的追捧。马斯克为xAI找黄仁勋加价插队下单1600台GB200 NVL72服务器机柜还和甲骨文董事长拉里·埃里森请黄仁勋吃饭。两年后黄仁勋辟谣称他们只需正常下单如今巨头们求的是装着芯片的AI机柜。今年7月英伟达硬件工程高级副总裁Andrew Bell透露通过与十家制造伙伴合作每天最高能产出1000个Vera Rubin机柜。超节点在中国的发展距离黄仁勋提出「超节点」一年后华为推出自家超节点CloudMatrix 38414个机柜连接384张卡卡数是NVL72的5倍多占地面积是其16倍且以量取胜能弯道超车。据Semianalysis拆解单个CloudMatrix 384集群BF16性能总体是NVL72的1.7倍总内存容量是3.6倍总内存带宽为2.1倍。华为掀起的「超节点火」在随后一年多里被国产算力生态重视仅在WAIC上就有20多家企业发布相关方案。超节点是被逼出来的创新超节点是在摩尔定律逼近极限锁死单颗芯片性能上限大模型参数竞争推高算力需求的背景下产生的。在杨植麟和月之暗面用近3万亿参数的Kimi K3影响硅谷模型生态时阿里云宣称其灵骏真武M890超节点在Day0就适配了Kimi K3Kimi K3部署在64张平头哥真武M890组成的超节点上。Kimi在技术报告中表明大模型Scaling不仅未饱和部署前后都需投入算力。其总结了大模型Scaling的两条路部署前预训练阶段投入更多参数和数据模型更智能部署后在后训练和推理阶段持续投入算力模型深度思考能力更强。当前模型参数规模「军备竞赛」未停以每年10倍速度增长算力集群规模也迈向更高等级。传统算力集群用横向扩展方式构建千卡、万卡集群但存在通信、功耗、复杂度三堵墙。超节点采用纵向扩展策略将分散芯片整合为逻辑统一的「超级大芯片」实现协同高速计算其单节点由多台服务器和网络设备组成。超节点可缩短大模型训练周期降低部署和运维难度。对于国产厂商而言超节点是务实选择可弥补单卡差距有券商称其为中国AI的「韬定律」。超节点是诱人的蛋糕尽管黄仁勋最先提出概念硅谷大厂AI集群火热但英伟达下一代AI机柜量产交付时间受问题影响。如原计划2023年下半年推出的Kyber NVL144机架架构因制造工艺问题推迟至2028年。同时马斯克的xAI、扎克伯格的Meta出租算力引发市场对算力租赁商成长性的质疑和「算力是否建设过度」的讨论。相反中国各类超节点方案涌现有厂商称今年为「中国超节点元年」。中国厂商积极布局超节点有三股推动力量一是国产芯片厂商超节点提供跳出与英伟达「比单卡性能」的思路还为国产芯片提供练兵场可绑定上下游产业链二是国产大模型厂商不同厂商意图不同全栈厂商能实现芯片与模型的良性循环还可将超节点以云服务形式提供三是国产服务器厂商超节点让他们有翻身机会交付单元从单台到整柜工程复杂度和利润空间都增加部分厂商还转变商业模式。超节点大规模落地面临挑战黄仁勋在台北电脑展喊话后Vera Rubin被媒体报道延期交付这表明超节点技术和商业化落地难度大。第一道关是连接问题全球Scale Up协议生态开放但割裂、碎片化不同厂商有各自协议且物理介质存在电互连和光互连的技术路线分化英伟达押注CPO技术中国超节点也开始尝试光互连技术。第二道关是供电和冷却问题需要更先进的供电和冷却系统。还有一道关是国产芯片端晶圆厂产能能否满足客户大单和高预期有待考验。总之超节点虽因创新和务实而火但距离规模化落地、挑战英伟达还有很长路要走。