(来源:创世伙伴创投)
推 荐 语
机器人要在真实环境中可靠工作,关键往往不在于“从不出错”,而在于出错后能否自主恢复。
近日,创世伙伴创投早期投资企业深朴智能技术团队 Simple World Lab 联合复旦大学可信具身智能研究院提出跨本体失败恢复联合训练框架 EgoRecovery:以第一人称人类恢复演示作为可扩展的监督来源,在统一采集协议下将有效恢复数据的获取效率提升至机器人遥操作的 10 倍以上,并通过带门控的“纠正意图”瓶颈,将人类恢复信号安全迁移到机器人策略。在四项真机操作任务上,于相同数据与主干的对照设置中,EgoRecovery 将平均恢复成功率由 53% 提升至 85%。相关论文已公开于 arXiv。

图 1|EgoRecovery 概览:第一人称人类恢复数据的采集效率达到机器人遥操作的10倍以上,并能覆盖更丰富的故障状态;框架通过带门控的“纠正意图”瓶颈,将人类恢复信号安全传递给机器人策略。
在真机部署中,模仿学习策略普遍存在一个共性问题:从规范的初始状态出发时往往表现良好,但具体执行时难免出现偏差,例如毛刷插偏、圆盘错位、方块倾倒。进入这些训练数据未覆盖的状态后,策略容易停滞,缺乏自主纠正的能力。当前机器人已经越来越擅长完成任务,失败后的恢复能力仍是走向可靠部署的关键短板。
针对这一能力缺口,深朴智能联合复旦大学可信具身智能研究院贾萧松团队提出 EgoRecovery 框架。相关论文《EgoRecovery: Acquiring Failure Recovery Ability Through Human Recovery Demonstration》已公开于 arXiv 预印本平台,完整方法与实验细节详见原文。
论文核心亮点
10倍高效采集恢复监督数据。提出以第一人称人类恢复演示作为可扩展的恢复监督源,统一采集流程下,操作员每小时产出的有效恢复数据量,达到机器人遥操作采集方案的10倍以上,低成本补齐长尾故障缺口。
构建跨本体适配“纠正意图”。不直接复刻人手动作,仅迁移“纠正时机、纠正幅度”等跨设备通用信息,机器人专属运动、接触方式和执行逻辑,由少量机器人数据完成落地适配。
引入恢复门控机制。模型自主判断当前是否需要介入,只在恢复状态下注入纠正意图,日常标准任务执行不受额外干扰,兼顾基础作业稳定性与故障修复能力。
完成真机闭环验证。在四项真机操作任务上,于相同数据与主干的对照设置中,EgoRecovery 将平均恢复成功率由 53% 提升至 85%;机器人标准任务完成率(Initial SR)同步达到 80%,为所有对比方案最优值。
01 机器人为何必须学会“自我修复”
机器人现有模仿学习策略普遍受到协变量偏移(covariate shift)的困扰:模型仅在标准成功样本上训练,闭环执行一旦偏离演示轨迹,便会进入缺乏训练监督的陌生故障状态,导致任务中断。已有研究表明,补充故障纠正数据能显著提升机器人长时序作业的鲁棒性,但在真机上采集此类恢复数据的成本极高。
单条故障纠正轨迹,需要人工制造故障、核验故障有效性、遥操作机器人完成修正、重置整套硬件场景四步流程。同时故障模式具备长尾特征,微小偏移都会衍生全新故障状态,想要全覆盖所需数据量远高于标准成功演示。
近两年,第一人称(Ego-centric)人类演示数据已广泛用于机器人预训练、常规任务学习,但极少落地稀缺的故障恢复场景。EgoRecovery 的核心思路,就是复用人类演示低成本、高产出优势,用人类纠错数据大幅降低机器人故障样本采集成本。
02 核心挑战:数据成本与跨本体迁移
EgoRecovery 需要同时解决两个互相耦合的难点,也是行业现有方案的共性瓶颈。
1. 机器人故障数据采集效率极低。研究团队做了完整人力吞吐审计,统一核算场景布置、设备复位、视频同步、无效废弃样本等全流程耗时:机器人遥操作平均每小时仅产出49条有效恢复样本;第一人称人类演示平均每小时可产出约517条有效恢复样本,整体采集效率是前者的10.5倍。
差距的来源很直观。人类采集只需要操作员摆出一个失败场景,戴着轻量采集设备直接示范一小段纠正动作,随即转入下一种故障配置,每条片段只需标注一个“纠正结束”的时间点。同样一小时,机器人还在复位,人已经翻过了几十种故障。10倍的效率差,为低成本扩充故障监督数据提供量化支撑。
2. 人手与机器人夹爪存在天然差异。人手与机器人夹爪在运动学、接触方式和控制频率上存在显著差异。若直接把人类手部动作当作机器人训练标签,会引入大量错误监督信号。对照实验显示,直接混合训练虽能带来增益,却无法充分释放人类数据的价值。由此衍生核心问题:人类故障演示里,哪些信息不受设备形态限制、能安全迁移给机器人?
03 共享“纠正意图”,按需触发恢复
EgoRecovery 框架的理念类似老师傅带徒弟救场:徒弟真正要学的不是师傅的手势,而是“什么时候该出手、还差多少火候”。框架采用 HPT 风格的异构联合训练架构:共享 Transformer 主干,人类与机器人分别使用具身专属的观测适配器和动作解码器。两类数据共同塑造共享表示,动作空间保持隔离。在这一架构上,框架通过三个关键组件完成恢复信息的提取、判断与注入。

图 2|EgoRecovery 方法框架:(a)恢复—意图策略学习:恢复标注提供状态标签与意图掩码,监督意图和门控预测;(b)门控意图调制:仅在门控判断需要恢复时,预测意图才通过门控 FiLM 调制解码器特征。
1. 纠正意图瓶颈——定义“共享什么”。人类救场过程中具备跨本体共性的并非手部具体动作,而是纠正发生的时机与剩余纠正量。框架将恢复片段中末端执行器的未来运动窗口归一化,投影到前4个低频离散余弦变换(DCT)基上,并仅保留幅度,形成4维“纠正意图”目标。该表示主动去除方向信息,只保留“剩余纠正量随时间收敛”的包络;方向、接触方式和可执行动作由50条机器人恢复演示确定。附录的分布诊断也支持这一选择:以 KS 距离衡量,在圆盘放置等任务上,恢复片段的低频 DCT 幅度特征在人机之间比完整轨迹具有明显更高的分布重叠度,表明该目标具备跨本体可迁移性。
2. 恢复门控模块——判断“何时生效”。若纠正意图持续干预动作解码,常规执行能力可能受到影响。框架依据机器人当前观测预测是否处于恢复状态,并用恢复阶段与常规阶段标签进行二元交叉熵监督。该模块相当于策略内置的运行时故障检测器。
3. 门控残差 FiLM 调制——连接意图与动作。预测意图通过带 stop-gradient 的门控残差 FiLM 注入动作解码器。门控接近0时,解码器沿恒等路径执行;门控升高后,纠正信号才参与动作预测。训练职责由此分开:人类恢复数据塑造意图与门控,机器人恢复数据将意图映射为可执行动作,机器人成功数据维持常规执行。部署时仅需机器人观测,人类视频和训练标注均不参与推理。
04 真机任务与双指标评测实验
评测覆盖四项真机桌面操作任务:杯刷插入、桌面清扫、圆盘放置与方块堆叠,分别对应“后撤—重新对齐”“纠正性清扫”“抬起—重新对齐—放置”和“堆叠稳定化”四类恢复模式。实验在 ALOHA/AgileX 双臂平台与 Franka Panda 平台上闭环执行。
图 3|实验平台与任务:四项真机操作任务中的失败、恢复与成功状态示例。主实验的数据配置包括50条机器人成功演示、50条机器人恢复演示和300条人类恢复演示。人类数据由头戴式与双腕 RGB-D 相机以25 Hz同步录制,手部轨迹经 HaWoR 重建为 MANO 位姿,形成14维双手状态流。每条恢复片段只需标注一个“纠正结束”时间边界。
评测采用双指标设计:Initial SR 衡量机器人从正常初始状态完成任务的比例,Recovery SR 衡量机器人从故障状态恢复并完成任务的比例。每种方法在每项任务、每种起始设定下均执行20次,并使用相同的固定初始状态与故障起点,并报告 Wilson 95% 置信区间,保证不同方法之间的比较具有一致、完整可复核的口径。
05 真机验证恢复能力
我们按上述框架策略,在四项真机任务上与多组对照方案进行了系统的闭环评测,得到以下发现:

图 4|四项任务的主要闭环结果:各方法的 Initial SR 与 Recovery SR(%)。EgoRecovery 在两项指标上均取得最高平均表现。
1. 成功演示无法替代恢复监督。仅使用机器人成功数据训练时,即使再加入300条人类成功数据,平均 Recovery SR 仍为0。恢复能力不会从常规数据中自发涌现,必须依赖显式的恢复监督。
2. 人类恢复有效,但需要机器人恢复的落地支撑。只加入人类恢复数据、不引入机器人恢复数据时,Recovery SR 仅为8.8%;以50条机器人成功演示和50条机器人恢复演示作为锚点,再加入人类恢复数据后,直接混合训练可达到71.2%。
3. 增益来自传递机制本身。直接混合训练与 EgoRecovery 使用完全相同的数据和共享主干,差别只在于后者通过“纠正意图+恢复门控”传递人类恢复信息。EgoRecovery 将平均 Recovery SR 从71.2%提升至85%,Initial SR 也以80%位居所有方法首位。13.8个百分点的提升来自机制设计,而非数据规模差异。

图 5|固定机器人锚点下的人类数据规模扩展:(左)平均 Initial SR;(右)平均 Recovery SR。人类数据预算从 200 条增至 800 条,所有配置均固定使用 50 条机器人成功演示与 50 条机器人恢复演示。EgoRecovery 以人类恢复数据替代人类成功数据、并经恢复专属通路传递,在每个预算点上均优于人类成功数据基线。
数据扩展实验进一步检验了人类恢复数据的规模效应。机器人数据固定不动,将人类恢复数据从200条增加到800条,EgoRecovery 的平均恢复成功率从75%升至90%,并在所有预算点上优于使用人类成功数据进行联合训练的对照组。只有来自故障状态、并通过恢复专属通路传递的人类数据,才能持续提高恢复表现。

图 6|恢复数据预算对比:(左)等效预算固定为80时的成本匹配替换,最优配置为50条机器人恢复数据与300条人类恢复数据;(右)机器人恢复数据固定为20条时,增加人类恢复数据仍可持续改善表现,但无法完全弥补机器人数据不足。
成本匹配实验明晰了人机数据配比的实用边界。在等效预算为80时,50条机器人恢复数据搭配300条人类恢复数据取得85%的最佳结果,明显高于仅使用80条机器人恢复数据的60%,但机器人恢复数据压缩至20条后,性能开始回落,替换曲线呈倒 U 形。可见,人类数据的作用是放大机器人数据的价值,而不是取代它。
消融实验逐项验证了各组件的作用。移除意图损失、恢复掩码或意图调制,以及测试时将意图置零,平均 Recovery SR 分别降至65%、55%、65%和65%;将门控固定为常开虽然能维持恢复表现,Initial SR 却从80%降至70%。这些结果表明,纠正意图负责传递恢复信号,门控机制负责保护常规执行。
06 加速机器人走向可靠部署
对真实部署而言,失败从来不是小概率事件,而堆再多成功演示也换不来恢复能力。EgoRecovery 的价值体现在三个层面:验证第一人称人类恢复演示作为可扩展监督源的可行性,并量化数据效率;以纠正意图与恢复门控分别解决“共享什么”和“何时生效”;通过严格的同数据对照,将性能提升明确归因于恢复信息传递机制。
当前验证集中在同一任务级恢复族内的桌面操作场景。开放世界中的任意失败、接触密集型操作和全新恢复技能仍需进一步研究。随着恢复类型与任务范围扩展,人类演示提供规模化监督、机器人数据负责动作落地的分工方式,有望应用于更复杂的具身场景。
可靠的机器人并非从不失败,而是能够察觉偏差、把任务重新拉回正轨。EgoRecovery 表明,这种恢复能力可以以更低的成本、更可扩展的方式被习得——这也是机器人走向真实世界稳定部署的重要一步。
论文信息
论文题目:
EgoRecovery: Acquiring Failure Recovery Ability Through Human Recovery Demonstration
论文地址:
https://arxiv.org/abs/2607.19745
Simple World Lab:
https://cloud.simple.tech/simple_world_lab/


