华为AI战略全面展开:从昇腾960超节点到全球AI集群服务

华为AI战略的核心是算力

9月17日至19日,华为全联接大会2026在上海举行。华为副董事长、轮值董事长汪涛与华为公司董事、华为云CEO周跃峰分别发表主题演讲,系统阐述了华为面向智能时代的AI基础设施战略。

汪涛明确提出,华为AI战略的核心是算力,坚持硬件变现,围绕“超节点+集群”通过系统架构创新构建竞争力。而周跃峰则从云服务层面,宣布了面向全球市场的AI集群服务商用计划与Agentic Infra新范式。

两位高管的演讲从硬件架构和云服务两个维度,勾勒出华为在AI基础设施领域的完整布局。

昇腾960超节点:从1024卡到4096卡

汪涛在演讲中给出了几个关键趋势判断:基础模型参数正快速逼近10万亿级,预计到2030年将突破100万亿;在中国,日均推理Token消耗量已激增至约500万亿,预计2030年将达到千万亿级;端侧模型参数从2024年的30亿增长至目前的300亿,未来将向数千亿演进。

华为对此的回应不是单纯追求单颗芯片的性能提升,而是将计算能力从芯片延伸到服务器、网络、存储和软件生态的完整系统。

汪涛将超节点定义为“具备跨物理节点统一内存编址能力、逻辑上具备一台计算机特征的计算系统”,特别强调“必须是超节点内的内存可以统一编址,意味着任何一个AI芯片可以访问超节点内的所有内存共享池”。

超节点规模在持续扩大:昇腾910C为384卡,昇腾950提升至1024卡,此次发布的昇腾960超节点实现了4096卡。通过二层CLOS四平面组网,最大集群规模可达51.2万卡;结合多轨道拓扑技术,最大可支持100万卡昇腾超节点集群。

华为马尔科夫实验室的仿真数据显示,在10万卡集群中,采用4096卡超节点相比采用8卡服务器,模型浮点算力利用率可提升2.75倍。

NPO光互联:用光换电

昇腾960超节点最核心的技术突破是首次采用NPO(近封装光学)技术。传统大规模算力系统内部主要依赖铜缆进行电互联,随着集群规模扩大,铜缆在传输距离和带宽上遇到物理极限。NPO将光引擎部署在计算芯片边缘几厘米处,在电信号劣化之前完成光电转换。

华为为此研发了Hi-ONE光引擎,单引擎传输容量达7.2T,是业界首个量产的NPO产品,也是唯一实现内置光源的NPO产品。昇腾960超节点采用5500个Hi-ONE模块,替代原本需要的4.8万个800G光模块,功耗降低超过550千瓦,系统无故障运行时间提升一倍,系统可用度达到99.8%。

在架构层面,华为发布了基于灵衢互联协议的Peerium计算架构,将CPU、NPU、DPU、DDR、SSD等多种计算与存储单元统一互联。

芯片路线图提速

昇腾960芯片的研发进度超出预期。昇腾960DT从原计划的2027年第四季度提前至2027年第一季度,960PR提前至第三季度。

此后昇腾系列将保持一年一代的节奏,昇腾970计划于2028年推出,昇腾980于2029年上市。汪涛将这一节奏归功于“韬定律”——以“时间缩缩”替代传统摩尔定律的“几何缩微”,通过逻辑折叠技术持续压缩信号传播时延。

截至目前,昇腾910C超节点已部署超过1000套,昇腾950超节点也已进入规模商用阶段。

华为云全球AI集群服务正式上线

在华为云专场,周跃峰宣布灵衢昇腾950智算集群服务全球上线。该服务基于昇腾950系统,通过灵衢UnifiedBus互联技术,将1024张加速卡组装为一个统一的算力单元,提供最高1 EFLOPS的FP8算力和2 EFLOPS的FP4算力,配备256TB的全局可寻址统一内存。

这一设计旨在支持大型模型的端到端训练,无需额外的集群级分区或适配,使千卡任务在单一内存地址空间下保持连贯。

该集群服务将于9月30日在中国市场商用,11月30日在海外市场商用。这标志着昇腾950算力从超级节点架构转化为可按日历预订的托管云服务。

AICS:五级恢复机制与20%吞吐提升

与集群服务同步推出的,是华为云最新版AI集群服务(AICS)。AICS集成了五级快速恢复机制与全链路可观测性,可支持云端超过40天的稳定训练,故障恢复时间在10分钟以内。结合调度、缓存和算法层面的协同优化,AICS的Token吞吐量相比上一代算力服务提升20%。

周跃峰在演讲中提出了Agentic Infra的新范式,围绕“高效Token、增强记忆、通智一体化调度、安全自治”四个维度定义智能体时代的基础设施。

他表示:“在智能体时代,基础设施不再只是提供算力,而是要让每一个Token更高效,协调通用与AI计算,让模型持续学习,更重要的是在生产环境中安全可靠地运行智能体。”截至目前,Agentic Infra已服务超过3500个客户。

CMS与Agentic MaaS:为智能体构建“记忆”

针对长程智能体任务对记忆容量和访问效率的需求,华为云推出了上下文记忆存储(CMS)解决方案。该方案提供PB级记忆空间,存储容量为同类产品的两倍,支持TB级高速记忆读取,性能优于业界50%。CMS通过盘级存储架构,依托灵衢互联总线实现NPU直通AI语义存储模组(ASU),使智能体具备持续学习和记忆的能力。

在模型服务层面,Agentic MaaS平台汇聚了来自多家领先提供商的前沿模型。开发者只需一键即可调用,无需自行部署。在全联接大会现场,MiniMax展示了其先进的多模态模型与华为云结合,提供开放的多模态能力。

AgentArts与产业AI铸造厂

华为云的企业级智能体平台AgentArts已服务超过100家客户,包括南方电网、广州实验室、金山办公和金域医学。AgentArts同时提供开源版本openJiuwen,开放超过5000个通用MCP资产和1000多个行业特定MCP资产,帮助企业开发、使用和管理智能体。

产业AI铸造厂已沉淀超过1000个行业资产,落地项目超过1000个。该平台构建了智慧医疗、具身智能、科学计算、智能制造、智慧金融五大行业专区,政务智能专区和AI硬件专区也已全新上线。

周跃峰表示,产业AI铸造厂的目标是推动行业技术诀窍从单个项目经验转化为可复用的行业能力。

生态建设:从可用到易用

在生态层面,华为公布了一系列进展。鲲鹏全球开发者超过416万名,全球生态合作伙伴超过7200家。昇腾已接入超过90个领先的第三方开源项目,并被正式支持为PyTorch加速器后端,CANN已进入常态化开源社区运作。

华为面向合作伙伴和开发者开放了万卡级算力资源,并提出面向“超节点+集群”的Agentic计算新开发范式,涵盖从单服务器到超节点、从进程到ThinkPro智能体、从SIMD到SIMD+SIMT异构编程、从HiF8到HiF4低精度、从手工算子编程到智能体编程与调优五个维度的演进方向。

汪涛透露,华为去年已将自研的灵衢互联协议全部开放,白皮书、使能参考设计、软件架构、测试规范等均可免费下载。

(素材来自:华为 智算芯能前沿网综合)

本文由智算芯能前沿网编辑整理,转载请注明出处。