这篇arXiv预印本把"动作"重新定义为机器人与被操作对象的彩色分割轮廓轨迹(由Meta的SAM分割工具提取的像素级掩膜),让视频生成器直接预测机器人运动;15小时微调与单臂到双臂的测试,仍只是概念验证。
李飞飞和Yilun Du上一次在论文上并列署名,大约是五年前——那时Du还在MIT读博士。两位如今分别代表机器人AI两条对立的路线:斯坦福的李飞飞团队主张"空间智能",让模型直接从像素里读出物理世界;Yilun Du所在的哈佛团队更倾向于在抽象的潜空间里规划动作,把像素当作渲染的副产品。这两条路在工业界通常意味着两套独立的模型、两套独立的算力预算。
本周,他们把名字一起署在了同一篇arXiv预印本上——Masked Visual Actions for Unified World Modeling,简称MVA。合作的消息由雷峰网AI科技评论首次整合报道,论文项目主页也已公开。
MVA的核心做法,是一个单位(account)的转换:把"动作"从关节角度或末端执行器坐标,改写成由Meta的SAM(Segment Anything Model)分割工具提取出的、机器人和被操作对象的彩色像素掩膜轨迹。这样一来,原本为视频预测训练的大模型,被要求预测的只是它最擅长的事——下一帧像素如何变化。
按论文与项目主页的描述,团队用15小时的微调,就把方法从单臂机器人泛化到未见过的双臂平台。同一套权重既可以正向模拟世界的演化,也可以反向生成动作。换句话说,他们赌的是:视频模型已经见过足够多的物理过程,只要把机器人的动作"翻译"成像素语言,就不必再为机器人单独训练一个基础模型。
这种做法并非凭空冒出来。过去几年里,把视频模型"硬塞"给机器人是一条主线路:UniPi用文本生成视频再做规划,Track2Act用稀疏轨迹做中间表示,Ctrl-world则在关节角度上做条件化。MVA的判断是,这些方法都是让视频模型去学一种"外语"——而MVA选择直接说视频模型的母语,像素。
需要标注的是,这份证据还很薄。一篇未经同行评审的arXiv预印本、一篇中文媒体单源报道、再加上作者列表的明星效应,并不等于结果可复现。15小时微调、单臂到双臂的测试,是论文里实际的实验范围;"工厂换机械臂不再崩溃"这种工业推论,是记者的延展,不是论文的声明。中文报道里"绝对马上就要爆了"与"这个共识有些可怕"的语气,更接近立场表达而非证据。
如果跨平台迁移真能以这个成本成立,那么"每个机器人栈都需要自己的基础模型"这一当前机器人AI的投入前提,正是被这篇论文所测试的对象。下一篇值得读的论文,应该是独立团队在公开数据集上复现这条15小时、单臂到双臂的路径——而不是又一个靠作者光环读出来的故事。