Featured image of post 华为发布灵衢互联架构与昇腾960超节点,打造新一代AI Agent算力底座

华为发布灵衢互联架构与昇腾960超节点,打造新一代AI Agent算力底座

华为全联接大会推出统一互联协议与新一代AI基础设施,突破通信瓶颈。

事件速览:华为2026全联接大会发布全新AI算力底座

事件速览:华为2026全联接大会发布全新AI算力底座
事件速览:华为2026全联接大会发布全新AI算力底座|新闻截图

在2026年9月17日-19日举行的华为全联接大会上,华为正式发布基于灵衢(UnifiedBus)互联架构的系列AI基础设施新品,核心成果包括:

  • 昇腾960芯片及超节点(风冷版2027年Q2上市,液冷版2027年Q3上市)
  • OceanStor M900 AI记忆存储
  • 鲲鹏950超节点
  • 星河UBG交换机
  • Atlas 650E双机直连一体机(支持本地万亿参数模型推理)

关键技术参数:单集群支持100万颗AI处理器;10万卡集群模型浮点算力利用率(MFU)从20%提升至35%;灵衢协议实现TB级互联带宽、2微秒RTT时延;昇腾960超节点最高提供8 EFLOPS FP8算力。

通信墙成瓶颈,灵衢架构直击三大痛点

通信墙成瓶颈,灵衢架构直击三大痛点
通信墙成瓶颈,灵衢架构直击三大痛点|新闻截图

传统基于PCIe加RoCE的互联体系在AI Agent时代面临严峻挑战:模型参数向50万亿级演进、上下文长度达几十M级,导致通信量平方级增长。关键反差点在于——当前十万卡集群的实际算力利用率仅约20%,远低于实际需求,通信时间占比成为性能天花板。

灵衢架构通过一套协议打通芯片到集群,实现四大突破:

  • 协议归一:将CPU、NPU、DPU、DDR、SSD等十几种协议统一,消除协议转换开销;超节点内实现全局内存统一编址
  • 异构协同:计算、存储单元对等互联,支持CPU/NPU动态配比与PD分离部署
  • 分级存储池化:HBM/DDR/SSD多级缓存统一管理,单节点访问带宽达480GB/s
  • 光电互联组网:物理传输距离超200米,单4096卡超节点节省196公里铜缆,单端口速率1.6T,整机280T全光互联

产业链观察指出,此前行业多在旧协议上修补,而灵衢相当于重装底层通信逻辑,满足多样化算力协同需求。

产品矩阵:从百万卡集群到桌面级一体机全覆盖

产品矩阵:从百万卡集群到桌面级一体机全覆盖
产品矩阵:从百万卡集群到桌面级一体机全覆盖|新闻截图

基于灵衢的超节点集群形成完整产品谱系:

  • 大规模部署:鲲鹏950超节点单柜支持12288个CPU核、192TB内存;昇腾960超节点支持8颗NPU、32 PFLOPS FP4算力;星河UBG交换机单机支持1024 Radix扇出,单集群可拓展至百万卡规模
  • 中规模节点:4096卡超节点由56个计算柜与14个灵衢互联柜组成,系统可用度达99.8%
  • 轻量化落地:Atlas 650E双机直连支持16 NPU Full-Mesh组网,无需交换机;万亿参数模型推理吞吐提升40%以上,时延低至10毫秒;支持后续平滑扩容至小型超节点

算力产品关键参数对比

产品核心配置算力/容量灵衢互联特性
昇腾960超节点8颗昇腾960 NPU/刀片32 PFLOPS FP4 / 8 EFLOPS FP84096卡单元/ATP带宽17.9TB/s
鲲鹏950超节点384 CPU核/刀片 / 单柜12288核24000TB内存池化统一调度超150万核
OceanStor M900三芯合一存储控制器 + ASU模组单ASU 64TB / 单节点480GB/s与计算单元全局池化访问
Atlas 650E最高8卡一体机 / 双机直连16 NPU万亿模型本地推理时延10msFull-Mesh无交换机互联

落地建议:按场景选择演进路径

落地建议:按场景选择演进路径
落地建议:按场景选择演进路径|新闻截图

  • 适合优先采用:垂直场景(电力巡检、金融风控等)有本地部署需求的企业,可选用Atlas 650E双机方案快速验证;需千万卡级大模型推理的云服务商,可关注2027年Q3上市的液冷超节点
  • 建议再观望:单卡或小规模(≤4卡)场景当前仍有成熟PCIe方案性价比更高;对FP4精度敏感且需长期训练的任务,需等待社区算子库完善(当前已打造26个行业专属算子库)

写在最后

华为以"计算+通信"垂直整合能力切入算力基础设施深水区,验证了Agentic AI时代通信架构的决定性价值——当模型规模逼近物理极限,打破通信墙才能真正释放算力红利。