在开放计算大会OCP China 2026上,国产服务器厂商浪潮信息推出384颗CPU全液冷整机柜与多模型融合API,把数据中心推向CPU回潮与多模型协同。
算力配比正在从“GPU中心”位移:Agent时代的负载结构,把CPU、液冷与多模型协同推上了一线基础设施的位置。
过去三年,AI基础设施的任务被简化成一个等式:堆更多GPU,跑更大的模型,让单条推理更快。这个等式在Agent场景下开始失灵。一个Agent系统会把一次任务拆给几十个子Agent:调用工具、互相传话、汇总结果、长期在线。这种负载不是“问一句答一句”,而是大量整型与逻辑运算、跨节点协调、持续高占用的工程化运行。浪潮信息在2026开放计算大会(OCP China 2026)上披露的两个产品,正是这种位移的实物证据:原生全液冷CPU整机柜服务器,和元脑SD200超节点上跑的多模型融合API。
第一个证据是机柜。浪潮信息发布的整机柜基于开放计算模组(OCM)架构,单柜最多384颗CPU,兼容x86与ARM,被定位为支撑4万+个Agent协同运行的平台。比起2026年4月同一厂商“单台2U服务器部署1000个Agent”方案,单柜算力密度提升约40倍。2U超薄算力单元每节点16颗CPU,内存、网卡、光模块、SSD全部纳入液冷,整机柜无线缆设计,运维效率提升100%以上(厂商口径,见浪潮信息SD200产品页)。
把“全液冷”标到原生层级,是对一个两年前还不存在的约束的直接回应。浪潮信息副总经理赵帅在会场披露:国内机柜功率2026年内会冲到300千瓦,全球部分机柜已进入兆瓦级(科技日报同会报道)。传统风冷单柜40-50千瓦的散热上限已无法承载这种密度——内存、网卡、SSD这些过去靠风冷带走的部件,必须直接进液冷回路。“原生液冷”不是工艺升级,是约束重写。
第二个证据是模型协同。浪潮信息元脑SD200超节点可同时部署4个万亿参数大模型,token生成时间从去年的8.9毫秒压到4.77毫秒(厂商口径,国内首个跑进5毫秒的同类产品),首Token延迟降低35%,手段涉及多Token预测与W4A8(4位权重量化、8位激活)等低精度推理(界面新闻同会报道)。更值得注意的是多模融合API:一个任务被并行分给多个候选模型,由评审融合模型综合共识、分歧、遗漏、独特观点后产出统一输出;简单问答、工具调用、格式转换等短任务直接路由单模型。该机制在DRACO多任务基准评测取得53.9%,高于候选池任一单模型(厂商自报基准)。
为什么要走“多模型投票再融合”这条路?推理的边际成本正在改写:当单条回答的正确率收益变贵,让几个模型并行跑、由评审模型挑答案的总成本,反而可能低于把单个模型再训大一圈。这与CPU回潮是同一个逻辑的不同切面——Agent的拆解、工具调用、汇总更多是整型与逻辑推理,天然落在CPU侧;Agent需长期在线,又把CPU的负载强度与重要性推高。
市场量级在给这种位移做注脚。据量子位援引IDC数据,2025年中国AI Agent企业级市场规模约190亿元人民币(约合26.4亿美元,按7.2元/美元估算),2025-2028年CAGR预计超过110%;Gartner判断,2026年将有40%的企业应用集成任务型AI Agent。机柜的形状、CPU的密度、液冷的范围,是这串数字要落到的物理载体。
但仍有几笔账厂商还没拆开。多模型并行再融合,每多跑一个候选模型就多一笔token成本,DRACO 53.9%的分数要折算成每千次调用的美元花销才有意义;4.77毫秒的token生成时间是单轮最优还是稳态均值、是否含融合开销,浪潮信息目前没有公开拆解;液冷从冷板走向内存与SSD,故障率与维护周期还缺少独立第三方长跑数据。
把这些账放到一边,一个结构问题已经摆在桌面上:2027年的机柜长什么样,已经不是2023年那个“插满GPU、风冷顶上”的答案能解释的。浪潮信息交出的两件产品,是这轮重写里最早落地的中国厂商样本之一。