8月6日,黎曼动力、光轮智能、诺亦腾机器人组建"采集、仿真、训练"三方联盟,目标2026年底完成100万小时具身训练数据,即让AI学会控制机器人在真实物理环境里动作的训练样本,比全球现有估算的50万小时再多一倍,看Scaling这套"数据越多模型越聪明"的打法在物理世界还跑不跑得通。
8月6日,黎曼动力、光轮智能、诺亦腾机器人宣布三方战略合作,把Scaling假设从大模型直接搬到机器人训练上,设下一个公开截止日期:2026年底完成100万小时具身训练数据,比当前估算的全球高质量具身数据约50万小时再多一倍。三方分工:黎曼动力做模型,光轮智能做仿真与评测,诺亦腾机器人做人体动作捕捉与多模态数据。
具身智能(embodied AI)指让AI控制机器人在真实物理环境里动作的整套技术,从工厂机械臂到人形机器人。训练数据需要机器人在真实场景里"做一遍",而不是只读文本或图片。Scaling法则是文本大模型行业里反复验证过的经验:把训练数据从千亿token堆到万亿token,模型能力沿可预测的曲线上升。但这条曲线在机器人上还成立吗,行业里没有共识。
分工上:黎曼动力做模型,旗下Riemann-1.0具身世界动作模型,刚在RoboCasa-365基准上以62.6%成功率刷新SOTA,比此前最好成绩高8.4个百分点,LIBERO 99.0%,RoboTwin2.0 94.3%。光轮智能做仿真与评测,旗下EgoSuite人类数据平台、RoboFinals评测体系、RoboStack部署反馈,客户名单包括阿里、字节、智元、银河通用、比亚迪、理想。诺亦腾机器人做人体动作捕捉、力觉与多模态行为数据采集,前身诺亦腾在动捕领域全球市占率约70%(QbitAI表述,尚无第三方独立核验)。
Riemann-1.0训练用了23.2万小时数据,距离新目标100万小时还有约4倍缺口。横向对比:NVIDIA GR00T N1.7公开数据约4万小时(约3.2万小时真实示教加第一人称,加约8000小时仿真);Physical Intelligence π0用超过1万小时机器人数据;Google DeepMind联合20多家机构、22种本体形态,产出100万条以上轨迹(单位是轨迹不是小时,折算下来量级比100万小时低)。换算下来,如果按DeepMind的"轨迹"口径,这次三方目标需要再翻一个数量级。
更直接的参照系是自动驾驶。Waymo真实道路经验超过2亿英里(约3.2亿公里),仿真里程更达数十亿英里,用了十多年才把L4级自动驾驶推到有限地理范围的商用。具身智能的复杂度更高,本体多样(机械臂、人形、四足、双足等),任务多样(抓取、装配、家务、巡检),Scaling要复制LLM曲线,数据量只是其中一个变量,仿真到真实环境的迁移差距、跨本体泛化、控制架构都可能是更早撞上的瓶颈。
黎曼动力联合创始人李阳光在公告中表示,希望通过三方合作让模型能力需求更直接地参与数据体系建设。昆仑万维董事长方汉的判断更直接:百万小时不是终点,是起点;具身智能的能力分化,将取决于谁能率先把训练数据做到百万、千万、亿小时级别。(三方公告综合稿)
Scaling假设在物理世界会不会撞天花板,有三个值得盯的信号。第一,黎曼动力的下一代模型(预计2027年中)是否在Riemann-1.0基础上出现类似LLM的"涌现跳跃",还是平缓增益。第二,光轮智能的RoboFinals评测能否被业内普遍接受为标准化基准,目前不同厂商使用不同口径。第三,100万小时真机数据里有多少来自工厂可控场景、多少来自家庭非结构化场景,这决定了数据能不能迁移到最终商用场景。
黎曼动力7月才正式亮相,前身是昆仑万维Matrix世界模型团队,3年里从Matrix-Game 1.0做到3.5(720p长时序交互式世界模型)。"全球首个100万小时"是企业自定目标,公开信源尚未披露阶段性里程碑或资本投入细节,同类行业报告估算行业真正可用数据可能需要1000万小时级别,与100万小时差一个数量级。
到2026年底,这场公开实验就会交出第一份答卷。曲线若沿GPT方向走,具身智能的下一波投入会跟Scaling走;曲线若撞上物理世界独有的天花板,行业就得在数据堆量之外找新的变量。