WAIC上演超节点混战:观众扎堆拍照,业内呼吁算力产业生态真正开放
原本冰冷的算力设备成为展会"打卡点"。
今年WAIC,“超节点”在现场火了。
走进世博展览馆,华为、阿里巴巴、百度、中兴通讯、中科曙光、天数智芯、沐曦股份、摩尔线程等国产算力厂商,几乎都把各自最新的超节点产品摆在展台最显眼的位置。
一排排没有屏幕的黑色机柜,成为最引人关注的展品之一。
真武M890×磐久AL128超节点 时代周报记者摄
时代周报记者注意到,中科曙光带来全国产十万卡AI超集群"曙光8000(登峰)",阿里巴巴展示"真武M890×磐久AL128超节点",中兴通讯推出OEX超节点,百度带来天池512超节点,沐曦股份展示曦景S600超节点,壁仞科技发布支持1024卡Scale-up扩展的下一代NPO光互连分布式解耦架构超节点,华为则首次线下展示1024卡昇腾950超节点真机。
这些外观并不起眼的黑色机柜前,许多观众举着手机排队拍照,不少厂商甚至安排机器人在机柜旁互动,让原本冰冷的算力设备成为展会"打卡点"。
这种变化并非偶然。过去几年,AI产业竞争更多集中在单颗芯片的算力、功耗和制程;而随着大模型训练和推理迈入万卡、十万卡时代,行业开始意识到,仅有高性能芯片已经不足以支撑模型持续扩张。如何将数百、数千甚至上万张AI卡高效连接,并通过网络、软件和调度系统充分释放集群性能,正成为新的竞争重点。
换句话说,AI产业竞争正逐渐从芯片本身,转向芯片之上的系统能力。
这一趋势同样体现在大会官方评选中。今年WAIC三项"镇馆之宝"均与超节点相关,分别为中科曙光AI超集群"曙光8000(登峰)"、阿里巴巴"真武M890×磐久AL128超节点"以及中兴通讯"OEX超节点"。
在业内人士看来,这不仅意味着几款产品获得认可,更意味着国产AI算力竞争正在进入新的阶段。
"随着大模型加快进入各类业务场景,算力需求正从训练进一步扩展至推理和边端计算。峰值性能仍是重要指标,但产品的实际表现,越来越取决于芯片、软件、集群和应用之间的协同效率。"天数智芯副总裁邹翾在WAIC期间表示。
“单卡时代”过去了?
如果说过去AI产业竞争比拼的是发动机,那么如今比拼的更像是一整套动力系统。
随着模型参数规模持续增长,先进大模型训练往往需要数万张GPU协同运行。此时,真正影响训练效率的,不再只是单颗GPU性能,而是整个系统如何组织这些GPU完成高效协同计算。
曦景S600超节点 时代周报记者摄
业内通常将通过高速互连,将数百甚至上千张AI卡组织成统一计算资源池的系统称为"超节点"。例如,摩尔线程MTT C256 超节点,就是用一层scale-up网络把256张GPU变成一台数据中心级计算机。
不过,超节点远非简单地将大量GPU堆叠在一起。一名摩尔线程现场工作人员向时代周报记者表示,“我们通过高效液冷散热、三盲插设计、完善的RAS机制和集群管理系统,来保障超节点在大规模部署下的稳定性和可维护性。这是基于真实万卡级训练经验沉淀下来的产品化能力,而非单纯的概念堆砌。”
不同厂商也在尝试不同的系统方案。天数智芯现场工作人员向时代周报记者称,天数超节点面向大模型训练与高并发推理场景,以国产通用GPU为核心,实现144芯高速全互联,通过高带宽互联、统一资源调度和软硬件协同优化,提供稳定、可靠、可扩展的高质量算力。
阿里云现场方面,一名工作人员则表示,磐久AL128超节点服务器是阿里云面向AI大模型时代打造的硬件基座,单柜集成128颗芯片,通过自研ALink互连架构,最大化GPU集群的协同计算效率。
在摩尔线程高级副总裁董龙飞看来,超节点要解决的是在一个大的系统里,如何把一个更大的模型,更大的上下文窗口放进来,还可以更快的推理出来。因为推理的速度慢了之后,调用工具就非常慢,超节点主要是为解决这个问题。
业内人士呼吁算力产业开放
相比单颗芯片,超节点竞争涉及的环节更多,也更加依赖产业链协同。
天数智芯副总裁宋煜认为,对通用GPU而言,实验室指标能够反映部分性能,但客户业务中的长期运行,更能检验产品在复杂负载和系统协同下的实际能力。算力能否转化为效率改善、成本下降和资源利用率提升,是衡量其产业价值的重要标准。
这意味着,行业评价标准也正在发生变化。
过去,人们关注TOPS、TFLOPS等芯片参数;如今,更关注训练吞吐率、网络时延、GPU利用率、集群稳定性以及整体拥有成本等系统指标。
由于一套成熟的超节点涉及芯片、交换网络、光互连、液冷、软件平台等多个环节,仅依靠一家企业已很难完成全部能力建设,开放生态因此成为国产算力发展的另一条主线。
中兴OEX超节点 时代周报记者摄
今年WAIC期间,中兴通讯联合壁仞科技、沐曦股份、燧原科技、天数智芯等合作伙伴,共同推出基于OEX+dOCS架构的国产高性能Matrix超节点,正是这一趋势的体现。
曦智科技创始人、董事长沈亦晨认为,当前最亟需补强的,是在庞大算力产业链中构建真正开放的产业生态,使计算、存储、交换、软件、应用等各环节的优秀企业最大化发挥各自优势,共同驱动中国算力基础设施的升级。
如果说芯片时代,比拼的是单点技术突破,那么系统时代,比拼的则是整个产业链的协同能力。
而超节点,也只是更大规模AI基础设施的起点。
“超节点更多是一个高密度的计算单元,把大量AI加速卡通过高速互连组织在一起,相当于把一台‘超级服务器’做得更强。”一名中科曙光技术工程师向时代周报记者解释,而超集群是在超节点基础上,通过高速网络把成百上千个超节点连接起来,实现十万卡级资源统一调度和协同运行,是一个完整的AI基础设施系统。
该技术工程师进一步指出,真正的挑战不在节点内部,而在节点之间。随着集群规模从千卡、万卡走向十万卡,跨节点通信会成为影响训练效率和系统稳定性的关键因素。
本网站上的内容(包括但不限于文字、图片及音视频),除转载外,均为时代在线版权所有,未经书面协议授权,禁止转载、链接、转贴或以其他 方式使用。违反上述声明者,本网将追究其相关法律责任。如其他媒体、网站或个人转载使用,请联系本网站丁先生:news@time-weekly.com