![]()
9月24日消息,近日,在杭州举行的2026云栖大会现场,联想中国基础设施业务群战略技术总监黄山与网易科技等围绕算力供需、超节点演进和企业AI投入产出等话题进行了深入交流。
从大模型问答到智能体执行任务,企业对算力的需求正在变化。黄山认为,计算系统的评价需要从芯片参数进一步转向实际产出,既要看生产Token的成本,也要看这些Token能够为业务带来什么价值。
面对算力空置与供给不足并存的现象,黄山的判断是,已有算力与新模型、新应用的需求未必匹配。“现在模型发展带来了落地的希望,市场需要继续投入,新增投入集中在高端算力,高端算力供不应求,市场出现明显分化:一部分早年超前建设的算力空置,新需求又抢不到优质算力。”他说。
至于存量资源能否盘活,黄山谈到,软硬协同可以帮助已有算力继续发挥作用。在成本优化上,黄山介绍,联想正从基础设施、设备和模型运营等多个层面推进。智算中心的电费、建设费用、场地租赁和相关金融成本,需要逐项核算;在设备层,则通过芯片、操作系统、推理框架等环节的协同优化,提高训练和推理效率。随着硬件从传统服务器向超节点演进,存储、交换机和软件也需要同步调整。
谈及超节点演进,黄山透露,联想正研发第二代超节点,重点涉及互连扩展、计算密度、供电散热和软件管理。随着集群规模增大,系统不仅要管理单个超节点,还要管理节点之间的互联网络。他表示:“面向下一代超节点,联想将继续推进产品研发,并推出支持更多卡的产品,进一步提升超节点的扩展能力和计算密度。”
对于哪些企业需要超节点,黄山提到,部署方式要根据模型规模和业务需求选择,普通服务器仍有市场。企业可以先调用公有云服务,在业务发展、数据积累之后,再考虑私有化部署。他判断:“所以大部分企业最终都会采用混合式的调度模式。”
当然,智能体也给市场带来了新需求。在黄山看来,最明显的变化是模型开始承担多步骤操作。随着任务执行、反馈和校验不断增加,Token消耗也会增长,推理优化的重要性随之上升。他表示:“推理的软硬协同优化方法与训练优化方法完全不同,肯定会有所侧重。”
黄山表示,其团队目前已将主要精力转向推理能力。在具体优化中,需要针对模型和芯片,处理算子、通信库、访存以及推理框架等环节的问题。“推理方面的核心优化,在于指定模型并给芯片,然后在模型与芯片之间进行优化。”
关于企业如何规划算力,黄山主张从业务工作流出发。业务方先确定使用哪些模型、需要完成什么任务,在实践中判断调用需求,再提出响应速度、延迟和并发量等要求,由IT部门据此规划资源。他强调:“算力建设要随着业务的增长节奏来进行。”
谈到算力的评价标准,黄山回顾,过去建设智算中心时,市场更多采用训练思维,采购和租赁显卡主要看浮点算力指标。但实际训练和推理性能还受通信能力、显存带宽影响,单看算力参数难以判断设备的实际效率。他说:“现在不应仅用显卡算力来计费,而应该关注实际购买显卡的成本与能产出的Token数量。这才是真正的衡量标准。”
在投资决策层面,黄山总结:“我们衡量的指标应综合考虑业务价值和Token的成本。”随着AI进入企业工作流,算力经营既需要算清资源账,也需要回答这些投入究竟改善了哪些业务。(定西)
