创智邱锡鹏团队提出具身任务智能体新范式 ETA,开源 OpenETA

2026.08.07阅读量:10

科研进展

      近日,上海创智学院邱锡鹏老师团队提出具身任务智能体(Embodied Task Agent,ETA)范式,并发布开源实现 OpenETA。该工作讨论的核心问题是:当机器人面对一个由多步操作组成、持续改变环境的完整任务时,如何持续理解目标、选择能力、检查执行结果,并根据真实世界的新状态调整下一步决策。

      过去几年,视觉—语言—动作模型(VLA)和世界动作模型(WAM)显著推进了机器人的感知、动作生成与未来状态预测能力。ETA 与这些路线并非替代关系,而是把研究视角从单个模型扩展到完整任务系统:模型提供能力,任务级智能体负责组织、约束和验证这些能力。

      团队认为,机器人迈向更强通用性不仅需要更大的模型和更多数据,也需要一个可以维护长时程任务状态、显式暴露执行边界并利用动作后证据持续纠错的运行框架。具身系统的可控性与可复现性,取决于模型、工具、中间层、环境状态和验证机制如何共同工作。


为什么需要 ETA:从动作预测到任务执行

      现有具身智能通常从“观测—动作”映射出发:VLA 根据图像、语言和机器人状态生成动作,WAM 则进一步预测动作可能带来的未来观测。它们主要回答“下一段动作是什么”或“执行后可能看到什么”。这些能力是具身系统的重要基础,但并不自动形成完整任务闭环。当任务持续数分钟并包含多个物体、空间关系和中间目标时,系统还需要回答:哪些步骤已经完成?当前观测是否仍然有效?工具返回成功是否真的改变了世界?物体是否在移动中掉落?失败后应重试、回退、重新规划,还是安全停止?

      数字环境中的智能体已经能够围绕目标调用搜索、代码执行或数据库工具,读取结果后继续决策。把这一机制带入物理世界时,难点在于动作可能不可逆,环境并不完全可见,函数返回值也不等于任务完成。机器人因而需要一座由可信接口和环境证据构成的“桥”。

图 1 从数字智能体到具身智能体:可信物理世界接口是关键桥梁

      ETA 的新意在于把 Planner 提升到任务层:它以任务目标和当前观测为输入,每次只提出一个结构化指令,并在动作后重新读取世界。CaP传统控制和VLA 可以作为短程操作技能,WAM 可以提供未来状态预测;ETA 决定何时调用它们、如何验证结果,以及接下来是否继续。由此,系统的输出不再只是一段动作序列,而是一条持续展开的任务轨迹:观测、意图、执行许可、动作回执、新观测和任务证据均被记录。ETA 关注的是“一个任务如何被可信地完成”,而不仅是“一个动作看起来是否合理”。

图 2 VLA、WAM 与 ETA:从动作预测到任务级闭环


ETA 的核心新意:可信的任务级闭环

      ETA 将系统划分为三个角色。Agent Planner 理解任务、维护工作记忆并提出下一步意图;Interface 由宿主掌握执行权,检查工具名称、参数、权限、来源和前置证据;World 由仿真器或机器人构成,真正改变状态并返回结果。这种分工把智能能力与物理执行权明确分开。模型不能直接写入环境,也不能因为“确信某一步会成功”而跳过运行时门控。任何改变世界的指令都必须经过宿主拥有的接口,再由环境提供可核验的状态变化。

图 3 OpenETA 以 Planner 为中心的信息流与执行边界

        一次只执行一个会改变世界的动作;动作之后,必须取得新的观测,才能执行下一个依赖当前状态的动作。

      这条规则约束 ETA 的核心闭环,动作完成后,旧图像不再被视为当前状态。OpenETA 进一步区分工具调用完成、物理动作完成和任务条件满足。工具返回 success,只说明接口完成了调用;机器人到达目标位姿,说明动作层执行结束;只有环境检查器、传感器证据或人工审查确认目标关系成立,系统才记录任务成功。以抓取放置为例,证据链从资产参考、场景定位和显式目标选择开始,经过抓取提议、动作回执、新鲜观测、附着检查、携带与释放,最终落到官方奖励或任务检查器。任何中间信号都不能单独替代最终任务证据。

图 4 一次抓取放置任务的可审计证据链

OpenETA:把 ETA 范式落实为开放系统

图 5 OpenETA 框架图

      OpenETA 是 ETA 的开源实现,也是一个用于比较不同模型、工具和环境后端的实验底座。框架包含可替换的 Planner、由宿主注册的原子 Tool、可复用的 Skill、会话级工作记忆、仿真与机器人适配器,以及不可变、可回放的轨迹记录。Tool 不是普通函数包装。OpenETA 为每个 Tool 定义稳定的输入输出契约、数据来源和副作用等级,并区分只读、规划、记账和改变世界等调用。运行时据此决定调用能否并行、是否需要执行门禁,以及动作后是否必须重新观察。Skill 用于保存可复用的任务知识,例如目标确认、抓取检查或失败恢复流程;工作记忆则保存当前任务历史、可信回执和尚未解除的义务。二者都不直接获得执行权,仍需通过同一 Tool 契约作用于世界。Planner、工具和后端均可替换。研究者可以在相同运行协议下接入不同通用模型、VLA、WAM、视觉检查器、仿真器或机器人,并比较它们在同一任务接口中的行为。OpenETA 还提供面向 Codex 的轻量版本,仅以 observe、mark_point 和 move_to 三个工具完成观察、三维定位与末端运动。

      每次运行都会记录观测、结构化意图、工具参数、动作回执、环境证据、停止原因和资源消耗。成功轨迹可以被复盘,失败轨迹可以定位终止阶段;评测不依赖一段经过挑选的视频,而依赖可重新检查的系统记录。

图 6 OpenETA 在 LIBERO 中的一条本地成功轨迹

仿真评测:统一接口下比较任务执行能力

      完整 OpenETA 配置采用冻结任务目录、预注册种子、统一 Tool 契约、停止预算和结果哈希,对 LIBERO Spatial、Object、Goal 与 Long / LIBERO-10 四个 suite 的 40 个任务进行评测。每个任务使用 10 个种子,共形成 400 个 episode 的完整矩阵。任务成功仅以 LIBERO 原生检查器返回的官方正奖励为准。固定矩阵记录 56/400 个成功 episode,40 个任务中有 18 个至少在一个种子上成功。Object 和 Goal 的点估计高于 Spatial,Long / LIBERO-10 为 1/100。

图 7 完整 OpenETA 在固定 LIBERO 矩阵上的 episode 结果图 7 完整 OpenETA 在固定 LIBERO 矩阵上的 episode 结果

      通过对失败轨迹的系统分析,我们发现,系统性能的主要瓶颈并非模型对场景与任务的理解能力,也不在于工具调用策略本身,而是底层工具在执行过程中的稳定性不足。模型已经能够准确理解任务、合理规划流程并调用相应工具,但不稳定的工具执行仍会显著影响整体表现。基于这一观察,我们进一步设计了一套对工具性能依赖更低、更加侧重评估模型自身 Agentic 能力的轻量化方案——OpenETA for Codex。OpenETA for Codex 进一步把具身交互压缩为 observe、mark_point 和 move_to 三个工具,依赖通用 Planner 在小型物理接口下承担语义理解、空间推理和闭环恢复的能力。评测覆盖四个标准 suite 的 40 个任务和 LIBERO-90 的 90 个任务,共 130 个任务。

     Luna、Terra 和 Sol 的 Pass@5 分别完成了 62、83 和 117 个任务;Pass@1 分别完成了 21、58 和 92 个任务。随着 rollout 次数增加,三种 Planner 的任务覆盖率均呈现持续上升趋势,表明前沿 Agentic 模型在具身任务中同样具备显著的 test-time scaling 能力。此外,在 GPT-5.6 模型的三种配置上,我们观察到 ETA 任务随模型性能逐级提升,说明更高能力层级的模型配置能够更有效地完成具身任务规划与执行。实验结果说明,在工具接口保持不变时,更强的通用 Planner 能更有效地使用同一组具身能力。


图 8 OpenETA for Codex 在130个 LIBERO 任务上的 Pass@k 结果图 8 OpenETA for Codex 在130个 LIBERO 任务上的 Pass@k 结果


从仿真接口到真实机器人      

      OpenETA 通过标准化观测、结构化指令和后端适配器隔离任务层与设备层。仿真器和真实机器人只要对同一 Tool 保持一致的功能语义,任务拆解、工作记忆、恢复流程和证据链格式就可以继续复用,实现Sim2Real的无缝迁移,这是目前VLA和WAM等具身范式难以做到的。

图 9 UR5e—Robotiq 平台上的海绵抓取与放置关键帧图 9 UR5e—Robotiq 平台上的海绵抓取与放置关键帧

从可信轨迹到可验证经验

     ETA 的长期目标不仅是完成一次任务,还包括从成功与失败中积累可复用经验。OpenETA 因而设计了受约束的经验更新流程:候选 Skill 或策略必须经过契约检查、隔离审查、同任务复现、配对留出评测和无回归验证,才能进入共享能力库。后续研究将沿着可重复成功、安全协同和可恢复性逐步扩展到双臂、动态接触、移动操作以及更专门的高频策略;同时把可信轨迹、训练、留出回归和重新部署连接起来,只让经过验证的经验进入闭环。




图 10 OpenETA 从任务闭环走向可验证经验的研究路线

      ETA 将具身智能的研究对象从单个动作模型扩展为完整任务系统。其核心贡献不是要求一种模型承担所有能力,而是为 VLA、WAM、通用 Planner、感知工具和机器人控制器提供统一的任务级闭环:谁提出意图、谁拥有执行权、世界实际发生了什么,以及哪些证据足以支持下一步决策。OpenETA 以开放、可替换和可审计的方式实现这一范式,使不同能力模块能够在相同协议下被组合、比较和复盘。随着模型、工具和机器人能力继续发展,任务层的状态维护、执行门控与动作后验证仍将是系统走向长时程自主运行的重要基础。

      该工作由上海创智学院联合复旦大学、吉林大学、南京大学和浙江大学完成。


●论文:https://arxiv.org/abs/2608.03924

●项目主页:https://openmoss.ai/OpenETA/

●GitHub:https://github.com/OpenMOSS/OpenETA