|
9 月 18 日消息,华为 9 月 17 日在上海发布 AI 时代的全新计算架构 Peerium,称该架构可实现百万级处理器作为一台计算机协同工作,以满足持续增长的 AI 算力需求。 华为介绍称,Peerium 计算架构基于嵌套并行、统一内存寻址和平等互联,实现百万级处理器的强扩展能力,彻底突破了冯 · 诺依曼单机架构的限制。 同时,该架构提出 Nested BSP(嵌套批量同步并行,一种将并行计算任务分层递归组织的计算范式),突破了传统图灵范式的限制。
华为表示,Peerium 架构颠覆了长久以来的主从架构。冯 · 诺依曼体系结构要求计算机按程序顺序执行,运算器、控制器、存储器、输入与输出系统各司其职,主从关系贯穿其中。 其中,灵衢是实现 Peerium 架构的关键互联技术。华为介绍称,灵衢基于一个开放协议,可无限扩展地联接 CPU、NPU、内存、SSD、网卡和交换机,实现计算、存储与网络的平等互联。 Atlas 950 超节点是 Peerium 计算架构的首代产品。华为称,25.6 万卡 Atlas 950 超节点集群已在部署中,基于 NPO 的 Atlas 960 系统正在测试中。
华为轮值董事长徐直军表示:“AI 时代,华为基于开创的 Peerium 计算架构,持续打造满足客户训练和推理需求的超节点和集群,让算力无处不在,让智能无所不及。” 附论文地址: 相关阅读:
AI 解读 百万处理器当一台用,难在哪
这套架构真正想解决的是规模上去以后效率掉下来的问题。传统单机架构里,处理器一多,内存访问和通信就成了瓶颈,堆到十万卡以上,算力很难线性增长。Peerium 把嵌套并行、统一内存寻址和平等互联放在一起,本质是让互联和内存管理不再拖后腿,而不是单纯堆芯片数量。 对普通人来说,这类架构短期内不会直接出现在消费产品里,它影响的是训练和推理大模型的成本与速度。集群规模越大,单位算力成本能不能降下来,才是关键。 需要留意的是,25.6 万卡集群已在部署、Atlas 960 还在测试,说明它离大规模稳定商用还有距离。原文没有给出价格和具体性能数据,实际效果要等部署规模跑起来才能判断。 判断:这一代的重点在互联和内存寻址,芯片数量只是结果,不是卖点。 以上内容由 AI 依据原文补充生成,不代表本站观点,仅供参考。 |

© 2013-2016 Discuz Team. Powered by Discuz! X3.5