机器人把杯子放到桌上,通常可以由一个短时技能完成,主要考验局部感知与精细操控;而制作一杯奶茶,则需要连续完成摆杯、加入配料、倒入牛奶和茶、封盖、插入吸管等13个步骤;如果让机器人整理一个房间,它还需要在不同位置之间移动,并把数十个环节组织成一条连贯的任务链。当任务从几秒延长到数分钟,困难不再只是机器人“能不能抓准物品”,而是在执行过程中持续判断:已经完成了哪些步骤,下一步该做什么,发生局部失败后是否需要重试或回退。
当前多数分层视觉-语言-动作模型(Vision-Language-Action Model, VLA)在子任务边界仍采用一次前向推理:根据当前观测和执行历史,直接输出下一项子任务。模型既不显式地比较备选方案,也不评估这些方案会把环境带到怎样的状态。错误通常要等到真正执行后才被发现,而此时物理世界已经被改变,失败已经难以修正。为解决这一挑战,上海创智学院罗剑岚老师团队发布 τ₀-VLA:一个由高层决策系统和低层策略生成系统组成的机器人基础模型。其核心思路是在高层决策系统中引入测试时计算:在关键子任务上,模型先提出多个候选决策,再通过世界模型预测各候选子任务对应的视觉状态,由价值模型评估任务进展,并在多步搜索后反思、生成最终执行的子任务;低层策略VLA则负责把该子任务转化为可执行的机器人动作。

一、从做对当前步骤,到正确选择下一步
长程任务执行成功的关键,不只是完成单个步骤,而在于做出一系列正确的决策。τ₀-VLA将测试时推理用于子任务决策。动作级搜索虽然能够解决局部控制歧义,但时间跨度较短,难以体现任务级后果;纯语言推理能够覆盖更长时间尺度,却往往缺少对候选决策物理后果的显式建模。子任务位于两者之间:它足够稀疏,不必在每个控制周期都进行昂贵搜索;又足够长,能够产生可辨识的环境变化,适合通过世界模型进行后果比较。
据团队在论文中的调研,τ₀-VLA是首个在高层子任务决策层面显式扩展测试时计算的VLA系统。它把测试时算力从“多采样、选一个”进一步用于“推演候选决策会把世界带向哪里”。

二、世界模型引导测试时计算
τ₀-VLA的高层策略由四个相互配合的模块组成:(1)提议模型根据任务指令、当前多视角观测、上一子任务和执行记忆生成候选子任务;(2)世界模型预测执行每个候选子任务后可能出现的视觉终态;(3)价值模型根据全局任务指令、候选子任务和预测终态,对候选质量进行评分;(4)反思模型综合保留分支的候选路径、预测画面和累积评分,生成真正提交给低层策略的当前子任务。
这里的“世界模型”并不用于逐帧预测图像细节,而是聚焦高层决策所需的任务状态变化:例如杯子是否被放到正确位置、配料是否已经加入、书籍交换后是否更接近目标排序。系统通过波束搜索递归展开高分分支,并允许通过分支数、保留宽度和搜索深度调节计算预算。最终的反思结果既可以选择某个候选,也可以综合已有证据生成候选集合之外的新子任务。
真实环境中只执行系统最终提交的当前子任务,更深层的搜索分支仅用于推演,不会直接下发给机器人。机器人持续观察真实执行结果、更新执行记忆并滚动重规划;部署时,高层决策在后台异步刷新,低层控制则持续执行当前缓存的子任务,因此较慢的高层推理不会阻塞机器人控制回路。由此,模型预测的“想象后果”始终与真实执行结果形成闭环,而不是一次性生成完整计划后按顺序盲目执行。
三、可修正的执行记忆
仅依赖当前画面,往往无法判断一个长任务的真实进度。例如在“番茄炒蛋”任务中,加盐带来的视觉变化很小,机器人很难仅凭图像确认这一步是否已经完成,容易重复加盐或直接跳过。τ₀-VLA通过显式执行记忆记录已完成阶段、当前约束和局部失败,使后续决策能够区分“看起来相似、任务状态不同”的场景。更重要的是,这份记忆不是不可更改的日志。团队从已有示范中自动构造记忆滞后、记忆超前、失败未记录等扰动样本,训练高层策略根据视觉证据修正自身状态:进度落后时追赶,过度乐观时回退,抓取失败时重试,已完成步骤则及时切换。该过程无需为每个样本增加额外人工标注,使执行记忆具备部署时自校正能力。

四、4万小时异构真实世界机器人数据预训练
高层负责决定“做什么”,低层负责解决“怎么做”。τ₀-VLA的低层策略采用视觉语言骨干与Mixture-of-Transformers(MoT)动作专家,通过条件流匹配生成连续动作块。模型使用40,115小时异构真实世界机器人数据训练,覆盖多种机器人本体的摇操作数据和UMI数据。τ₀-VLA采用多模态协同训练,便于保留指令理解、视觉定位、空间与深度推理等能力;训练初期还通过知识隔离机制,避免动作损失过早扰动视觉语言骨干,随后再进行端到端优化。
为让一个模型具备跨本体适配能力,团队使用统一的40维状态与动作表示,将末端位姿、关节、夹爪、腰部和移动底盘映射到固定维度,并对不同本体未使用的维度进行掩码。论文在AGIBOT G1、ARX AC One和双臂Franka Research 3三类平台上进行了真实机器人评测。
五、长程任务真机评测
τ₀-VLA的长时程评测覆盖四项复杂真实任务:25步的房间清洁、14步的食材准备、22步的番茄炒蛋,以及13步的制作奶茶。任务持续时间从约3至12分钟不等。在四项长时程任务中,各方法-任务设置均进行10次独立真机试验。保持低层策略、观测和动作接口不变,仅加入高层分解与执行记忆后,τ₀-VLA的平均任务成功率从27.5%提升到45.0%,平均任务进度从80.10%提升到87.85%。在本文实验设置下,这一结果也高于GR00T N1.7、LingBot-VLA和π0.5。

在不使用高层策略的跨本体短任务中,τ₀-VLA在收集衣物上达到10/10成功,在整理化妆台的棉片、睫毛夹和粉扑任务上分别达到10/10、9/10和10/10,显示统一低层策略能够在不同机器人形态和控制接口下执行语言条件操作。

六、测试时计算收益评测
团队进一步比较了三种高层推理方式:Plan Once只进行一次预测;Best-of-N采样多个候选,并用同一世界模型和价值模型做一步筛选;τ₀-VLA的测试时计算则进行多步分支展开,并由反思模型综合后提交决策。在下一子任务预测中,τ₀-VLA在四项评测任务上均取得最高准确率:制作奶茶为87.3%,书籍整理(分布内测试集)的为88.0%,书籍整理(分布外测试集)为74.0%,房间清洁为87.0%。

更关键的是,开放环节的预测增益能够转化为真实机器人闭环成功率。在保持低层策略不变的条件下,引入测试时计算后,制作奶茶端到端成功次数从5/10提升到7/10,书籍整理从6/10提升到9/10,房间清洁从5/10提升到7/10;三项任务的任务进度也同步提高。

随着测试时计算预算增加,制作奶茶和书籍整理的子任务预测准确率快速上升,随后逐渐趋于饱和。这表明额外计算在低到中等预算区间具有较好的计算-精度权衡,但并非无限增加算力就能获得线性收益。τ₀-VLA的目标不是让机器人“永远慢思考”,而是在真正影响任务走向的节点投入更多计算。

七、让VLA学会思考
此前,团队在τ₀-WM中将动作生成、未来视频预测和动作后果评估统一起来,让机器人能够在精细操作中“先想象,再执行”。τ₀-VLA沿着同一条研究主线进一步向长时程扩展:如果说τ₀-WM回答的是“这个动作做下去会发生什么”,τ₀-VLA进一步回答“为了完成整个任务,接下来应该做哪件事”。通过将世界模型、执行记忆和可扩展测试时计算引入子任务边界,τ₀-VLA为机器人从反应式执行走向结果推演的长时程自主操作提供了一条可验证的技术路径。未来,具身基础模型的能力提升或许不仅来自更多参数和更多数据,也来自更合理的推理资源分配:简单决定快速完成,困难决定充分推演;不是只判断一个动作“像不像正确动作”,而是判断它是否真的让现实世界更接近任务目标。
●论文链接:https://tau0-vla.github.io/tau0-vla.pdf
●项目网站:https://tau0-vla.github.io/
●开源模型:https://github.com/sii-research/tau-0-vla
