浪潮信息刘军:Agent时代没有“万能芯片”,多元算力协同才能实现全局最优

https://assets.wanlianyida.com/industry-uniapp/web/static/image-default.BtYt8t8Z.png
产联社CLS
·阅读量:4,513
Agent时代,算力基础设施需要从“单一芯片包打天下”转向“多元芯片各司其职”。

产联社作者 | 郑青春

image.png

图片由AI生成

“多元算力计算的核心不是追求用一种算力解决所有问题,而是以开放为主多元,以协同实现全局最优。”9月21日,在AICC2026人工智能计算大会上,浪潮信息首席AI(人工智能)战略官刘军表示,Agent(智能体)时代,系统瓶颈可能在计算、显存容量、带宽、网络通信之间不断转移。简单增加更多服务器,不仅不能带来线性容量增长,还可能因为资源配比失衡、跨节点通信和任务排队,使一部分算力长期闲置,另一部分资源却持续运转。

刘军表示,使用同一种芯片和同一种服务器形态,不是最高效的算力组织方式,必须按照不同计算负载重新配置算力,让不同算力承担最适合的负载,再通过统一软件栈把多种芯片按推理阶段动态组织成高效协同的整体。

刘军指出,Agent任务给AI计算系统带来前所未有的动态性。以MTP(Multi-Token Prediction,多Token预测)引入独立草稿模型为例,不同模块和模型有独特计算特征,负载还会随上下文长度、输出长度和并发规模动态变化。首轮对话上下文较短,经过多轮对话后可能大幅扩展,计算量和计算特征随对话轮次变化,系统瓶颈可能在计算、显存容量、带宽和网络通信之间不断转移。单纯堆服务器会带来资源错配,因此算力基础设施需要从“单一芯片包打天下”转向“多元芯片各司其职”。

会上,浪潮信息发布了多元算力技术。刘军介绍,该技术采用融合架构2.0(Fusion Architecture 2.0),创新高密液冷AI整机柜和多元算力协同推理软件栈,可实现计算负载按需匹配、动态优化。其中,高密液冷AI整机柜采用全液冷设计和高通流风道,突破传统风冷机柜散热和供电瓶颈;同时支持成熟工业标准加速模组,适配多元本土算力芯片,以架构创新解决单芯片算力受限问题。

在互联层面,刘军表示,融合架构2.0让通信能力和算力密度同步提升,实现计算通信均衡配比,支持大规模多平面无损扩展。基于此,浪潮信息进一步把不同算力和计算负载精准匹配:在预填充阶段,可选择大算力芯片,搭载供应和成本更优的LPDDR(低功耗双倍数据率内存)、GDDR(图形双倍数据率内存)等颗粒;在解码阶段,可选择具备大容量HBM(高带宽内存)、兼顾显存容量和带宽的AI芯片;在FFN(Feed-Forward Network,前馈网络)计算环节,可选择3D DRAM(三维动态随机存取存储器)堆叠芯片,缩短数据搬运路径,契合计算特征。通过分工,多元芯片发挥各自优势,软件栈将其组织起来共同完成推理任务。

在KV Cache优化上,该软件栈通过打通不同类型算力间点对点数据直传,避免CPU(中央处理器)中断和重复拷贝,提升数据传输性能;根据数据冷热程度构建分级存储,结合KV Cache结构特点,提升节点内本机磁盘利用效率,突破KV Cache的存储和传输瓶颈,让数据更高效地流动,让多元算力的潜能充分转化成大模型推理的实际效率。

刘军总结,面向Agent时代,需要构建开放计算系统,兼容不同厂商、不同架构AI芯片,按负载特点让不同芯片承担最适合任务,再通过统一软件栈组织计算流程和数据通路,并根据业务变化持续动态优化。

“多元算力计算的核心不是追求用一种算力解决所有问题,而是以开放为主多元,以协同实现全局最优,让每一份算力都能转化成更多可交互的智能。”他说,要用贯穿式系统创新、全栈规划和跨层协同,持续提升计算系统效率,以开放协同产业生态推动多元算力高效协同,实现从提供算力到生产智能的产业目标。

商务合作,请联系侯经理 18801065284(微信同号)

报料及内容合作,请联系chanlianshe2026(微信号)

特别声明:本文仅供参考,不构成任何投资建议,未经允许不得转载。

72
28
分享