商汤在WAIC 2026自报"国产算力正毛利":日均Token从年初4000亿冲到2.42万亿,年底目标10万亿,但"正毛利"是1块高端芯片带30块国产芯片的堆栈层面(非单芯片)的口径,Decode阶段(推理解码)仍跑在非国产资源上。
商汤在WAIC 2026上给出了一组具体数字:其"大装置"业务的国产芯片推理线已做到正毛利率,日均Token处理量从年初约4000亿冲到了2.42万亿,年底目标10万亿,约为年初25倍。这是中国大装置第一次用可引用的数字对"买国产AI芯片=认亏"这一圈内常识画出一个反例。
但这组数字有一个结构性边界必须立刻点破:商汤说的"国产算力正毛利"是堆栈层面的口径,不是单芯片层面的口径。商汤的方案是异构混合推理:把一次推理切成两个阶段,Prefill(预填充,吃算力吞吐量)交给数量更多的国产芯片,Decode(解码,吃显存带宽)交给高端资源。商汤大装置负责人杨帆给出的配比是1块高端芯片带动约30块国产芯片。商汤把这种工作方式称为"端到端自营",覆盖自建机房、自采运营硬件、自研调度系统、直连客户。
所以故事讲的不是"国产单芯片已经能独立挣钱",而是"国产芯片把Prefill便宜化,高端芯片把Decode卡住,两件事合在一起让单位Token成本下降2.5倍"。Decode瓶颈没有破,那块高端资源并不是国产芯片。这条边界在读任何来自商汤的乐观数字时都不能省。
系统级的优化结果同样来自商汤自报:国产芯片MFU(Model FLOPs Utilization,模型算力利用率)提升85%到152%,单位电力成本Token产出(商汤称之为TPW,Tokens per Watt)提升约80%。商汤已适配20多款不同厂商国产芯片,其中6到7款已稳定商业化盈利,联合约20家生态伙伴,包括寒武纪、沐曦股份、中科海光、华为昇腾。在AI4S长序列蛋白质预测场景,融合算子优化后整体预测耗时减少75%;在AIGC视频生成场景,DiT模型在国产芯片多卡并行视频生成加速比达93%。
另一个被商汤包装成新产品的"算电协同Agent",本质是峰谷电价、储能与算力调度的运营做法,不是新硬件。用一个模型预测算力任务的耗电特征,再和电力调度系统打通,配合峰谷电价与储能设施调节用电节奏。TPW这个新指标就是围绕这套运营做法定义的。商汤还提到了一个新工具:用AI自动生成算子适配代码,跟上模型迭代速度。这部分同样是商汤自述,第三方尚未独立复现。
财务背景提供了一组锚点。商汤2025年全年营收超50亿元,同比增长32.9%,下半年EBITDA转正至约3.76亿元。这组数字来自商汤的IR稿与东财报道,给出"商汤大装置业务在母公司层面已经接近盈亏平衡"的环境证据。商汤称之为"国产AI基础设施规模化商用的元年"。这是商汤自己的营销标签,不是行业共识。
读这组数字需要的三类交叉源尚未补齐,包括核对"正毛利"口径与收入确认方式的财报或招股书数据,至少一家非商汤国产芯片厂(寒武纪、海光、沐曦任一)对异构堆栈的真实评价,至少一位商汤客户对"Token工厂"定价与稳定性的反馈。在这三类交叉源到位之前,"国产AI芯片能挣钱"这种标题的强度应该被压住。
下一步的观察点很具体:商汤在2026年下半年是否愿意披露大装置业务的客户名单,以及至少一家头部国产芯片厂是否在公开场合复述或反驳这套"1:30异构"方案。如果两件事都发生,"元年"这个词才会从商汤自述变成行业描述。