(来源:科技行者)

这项由南洋理工大学S-Lab实验室与ACE Robotics联合完成的研究,以预印本形式发布于2026年7月30日,论文编号为arXiv:2607.28625。有兴趣深入了解的读者可以通过该编号在arXiv平台查阅完整论文。
**人类从未"教"过机器人的事**
每天早晨,你起床后会去厨房烧水、找茶包、把茶倒进杯子、端着杯子走到桌子旁坐下。这整个过程对你来说轻而易举,甚至根本不需要思考。但对于一台机器人来说,这却是一座几乎无法翻越的山。原因不是机器人不够聪明,而是它从来没有机会看到一份完整的"家庭生活教程"——一份记录了眼睛在看什么、手在怎么用力、身体如何移动、桌上的杯子怎么滑动、倒水时发出什么声音的全方位教程。
这正是当前人工智能领域一个隐蔽却关键的瓶颈。语言模型的崛起靠的是人类几百年来积累的文字,图像识别靠的是海量照片,但"怎么用手拿东西"、"抓玻璃杯时该用多大力气"、"从沙发上起身走向冰箱时身体如何协调"——这些技能从未被人类系统性地记录下来。机器人想要学会在真实家庭环境中生活和工作,必须有人重新把这些日常智慧从零开始收集。
南洋理工大学和ACE Robotics的研究团队决定正面解决这个问题。他们构建了一套名为**ACE**(Ambient Capture Engine,环境捕捉引擎)的采集系统,并用它收集了一个前所未有的数据集,命名为**ACE-Data-0**。这个数据集记录了50位真实人类在真实家庭环境中进行各种日常活动的全过程,总计超过150小时、1700万帧画面、7.5万个交互片段,涵盖200种任务类别。更关键的是,这份记录是全方位、多感官、时间对齐的——摄像头、动作捕捉、触觉传感器、麦克风同时工作,所有数据都精准对准同一个时间轴。
**一、现有数据集的三大硬伤**
要理解这项工作的价值,先得明白问题出在哪里。
目前学术界已有不少相关数据集,但它们都像是盲人摸象——每个数据集只摸到了大象身体的一部分。以大规模第一人称视频数据集为例,Ego-Exo4D收录了1286小时的视频,EPIC-Kitchens有100小时厨房操作录像,这些数据集拍摄了大量真实人类行为,但没有身体动作的精确测量,不知道手在三维空间中究竟位于哪里,更没有触觉信息。反过来看,使用动作捕捉技术的数据集,比如ARCTIC、GRAB、BEHAVE等,确实提供了精确的身体和物体三维姿态,但这些数据几乎全部在实验室里拍摄,环境简单干净,没有家具遮挡,没有凌乱的桌面,完全不像真实家庭;而且这些数据集普遍只记录了几秒到几十秒的单一动作——抓一下杯子、打开一个盒子——根本不涉及"烧水、找茶、泡茶、端茶"这样需要几分钟甚至几十分钟完成的连续任务。触觉数据则更是稀缺中的稀缺,几乎所有数据集都没有采集手部接触压力信息。
研究团队将这三个缺陷概括为:模态碎片化、环境不自然、时间跨度过短。任何一个单独的问题都足以让数据集无法支撑真正有用的机器人学习,三个问题叠加在一起,使得现有数据集与实际需求之间存在一条巨大的鸿沟。
**二、ACE系统:把家变成录音棚**
ACE系统的核心理念是:在保留家庭环境真实感的同时,把它改造成一个专业级的数据采集中心。就像一些影视制作团队会在真实建筑里布置专业摄影设备,而不是把演员带进摄影棚——真实的凌乱感、真实的光线、真实的家具遮挡,全都保留下来,同时所有必要的传感器悄悄安装在角落里、天花板上、演员身上。
为了应对家庭活动在空间上的两种极端需求,ACE被设计成两种互补的配置。
第一种叫**桌面尺度配置**,专门针对精细手部操作。这套系统布置在一张工作桌周围,覆盖约30平方米的空间,桌上摆放了超过25种可交互物品,包括刀具、碗、食品容器等。8台近距离GoPro相机以0.3到0.5米的间距密集包围工作区,16台OptiTrack红外摄像机安装在共享支架上,负责追踪手部和物体的精确运动。这个配置的分辨率高到惊人,能捕捉手指与物体接触时毫米级别的细节。
第二种叫**房间尺度配置**,面向全身运动和跨房间活动。这套系统部署在一套约200平方米的全装修公寓里,包括厨房(带厨房岛台)、餐厅、客厅和卧室,同样摆放了超过25种物品。8台ZED One宽基线相机悬挂在贯穿公寓的天花板支架上,每台相机都有可调节的延伸杆来优化角度,确保公寓内任何一个位置都能被至少4台相机同时看到。12台OptiTrack摄像机分布在同一支架上,覆盖整个公寓的追踪体积。
每位参与者在两套配置中都会佩戴同一套装备:一顶由ACE Robotics研发的**ACE-Ego-Head-V02 Lite**头戴式摄像装置,内置四颗鱼眼摄像头(朝向前左、前右、后左、后右,分辨率1088×1280,每秒20帧),头盔上还附有5颗OptiTrack反光标记球,用于实时定位头盔在空间中的六自由度姿态;一件带有41个关节标记球的动作捕捉服,覆盖全身每个主要关节;两只Manus动作捕捉手套,以每秒60次的频率记录每根手指的精确弯曲角度;两只ACE-Sense-Glove Lite触觉手套,记录整个手掌和手指的接触压力分布;所有相机同时录音,包括头戴设备上的麦克风和外置GoPro的音频,构成多通道音频记录。
这套设备的组合,让每一个"拿起杯子倒水"的动作都同时被记录成:头盔看到的第一视角画面、8个外部视角的同步画面、身体41个关节的三维坐标轨迹、两只手42个手指关节的精确角度、每个物体在空间中的六自由度位姿轨迹、手掌接触物体时的压力分布图、以及周围环境的多通道音频。这就相当于给每一个家庭动作同时安上了十几双"眼睛",并且每双眼睛都有自己专门的感知能力。
**三、让时间轴对齐:一个精妙的"拍快板"系统**
拥有这么多传感器之后,最大的工程挑战不是采集数据,而是让所有传感器的数据精确地对准同一条时间轴。每台相机、每个动作捕捉摄像头、每个传感器都有自己的时钟,它们之间哪怕差几毫秒,在高速动作中就可能体现为手已经握住了杯子,但触觉数据还没显示接触——这样的数据用来训练机器人是有害的,不如没有。
研究团队采用了以OptiTrack动作捕捉系统的时钟为"主时钟"的方案,因为这套系统内部所有摄像头已经硬件同步,每秒60帧的精确脉冲是最可靠的时间基准。
对外部摄像机的同步,他们设计了一个极其巧妙的"光学时钟"方案:动作捕捉主机的显示器上持续显示以纳秒为单位的当前时间(以二维码形式呈现),这个时间就是OptiTrack的内部时钟时间。每次录制开始前,参与者会用头戴摄像机短暂扫一眼这个显示器约10秒;外部摄像机也会拍到这个显示器。通过从视频帧中读取二维码时间,再与每台摄像机自身的帧时间戳做对比,就能精确计算出每台摄像机的时钟偏差(一个固定偏移量加上一个缓慢漂移的线性项)。最终,所有摄像机的时间精度达到毫秒级别,在动作捕捉的60Hz帧率内完全对齐。对于触觉手套,则利用手套内置的IMU传感器与头戴设备IMU的运动相关性来做时间对齐——录制开始时,操作员做一个特定的手部加速动作,两个IMU都会感受到,通过匹配这个运动模式来确定时间偏差。
空间对齐同样需要精心设计。对于固定的外部摄像机,研究团队使用了一块特制的ArUco标定板——板的四个角上粘贴了红外反光标记球。这样一来,红外动作捕捉摄像机可以看到标记球(确定标定板在三维空间中的精确位置),RGB摄像机可以看到棋盘格图案(确定标定板相对于自身的位置),两者共享同一个物理参照物,从而建立起从动作捕捉坐标系到每台RGB摄像机坐标系的精确转换关系,最终实现所有传感器在同一个世界坐标系下的空间统一。对于会随头部移动的头戴摄像机,则通过"手眼标定"方法确定每颗鱼眼摄像头相对于头盔上标记球组成的刚体的固定空间关系,此后每帧图像的摄像机位姿都可以直接从动作捕捉系统读取,精度不依赖于视觉算法,不会随时间漂移。
**四、如何收集数据:目标导向的自然行为**
系统建好之后,如何让人类参与者自然地表现出真实行为,是另一个关键设计问题。
研究团队将任务设计成三种类型,以覆盖家庭活动的完整谱系。
第一种是**原子级手部物体交互任务**,每次录制包含一到三个简单家务动作,比如"倒水"、"喝水"、"给植物浇水"、"切蔬菜"、"烧水"、"整理桌面"等,每次录制约3分钟。这些任务提供了干净、独立的基础操作样本,就像烹饪教材里的单步骤练习。
第二种是**连锁式手部物体交互任务**,把多个短任务串联成一个持续20到30分钟的完整家务循环。参与者从整理厨房开始,到烹饪,到用餐,到清洗,到收拾房间,每个子任务之间自然衔接,最终把场景恢复到初始状态。这种设计让数据集捕捉到了真实家务活动中的长时间规划、跨任务状态记忆和子任务穿插现象。
第三种是**人场景交互任务**,记录几乎不涉及物品操作的全身运动,比如做深蹲、做扭腰运动、在房间里随意走动、坐在沙发上、躺在床上等,每次约5分钟。这些数据捕捉了人类身体与场景要素(椅子、桌子、沙发、床)之间的接触和协调,为机器人的全身运动规划提供了参考。
在指令设计上,研究团队刻意避免了逐步骤指导。参与者收到的是目标级别的指令,比如"准备一杯茶并把它端到桌上",而不是"先走到橱柜,打开左边的柜门,取出第三个杯子……"这种设计让每位参与者都能按照自己的习惯和节奏来完成任务,自然地产生行为差异——有人先找茶包再烧水,有人先烧水再找茶包;有人站在水槽旁倒水,有人端到桌边倒。50位参与者的这种自然差异性,正是数据集的价值所在。
**五、精密的标注体系**
原始传感器数据经过处理后,研究团队为每一个片段添加了五类标注,构成了一套完整的语义-物理描述系统。
物体标注涵盖了每个被跟踪物体的类别名称、每帧的六自由度姿态(位置和旋转)、在所有摄像机画面中的二维和三维边界框,以及整个录制过程中物体运动轨迹的完整历史记录。每个物体都事先通过3D扫描或二维高斯溅射重建获得了精确的三维网格模型,因此物体标注不仅有位姿,还有几何形状,可以精确推算出物体在任意时刻的空间占位。
人体姿态标注提供了全身41个关节的三维坐标序列,并同步转换为SMPL-X格式的参数化人体模型表示。这些姿态数据是通过动作捕捉系统直接测量的,而非由图像估计得到,因此在家具遮挡、极端姿势和快速运动时仍然准确可靠。同时,所有姿态数据都被反向投影到每台摄像机的每一帧图像上,生成了与图像像素对齐的二维骨架标注,为视觉模型的训练提供了即用型监督信号。
手部姿态标注单独列出,提供了两只手42个关节的精确角度序列,并同样投影到所有视角的图像中。在房间尺度配置中,手部数据来自Manus动作捕捉手套的直接测量;在桌面尺度配置中,则通过对8台外部相机的二维关键点进行RANSAC三角化后人工校正获得。
触觉标注将触觉手套采集的压力图标准化处理后,以每帧一张"手形压力热图"的形式存储,并与视频帧、物体标注共享同一时间轴,可以直接查询任意时刻手掌各区域的接触强度。
语言标注则由Gemini多模态大模型对头戴相机的第一视角视频逐段理解并生成自然语言描述,记录每个时间段内参与者正在做什么、场景中发生了什么。所有自动生成的标注最后经过人工审核校正,确保准确性。
这套标注体系的精妙之处在于:除语言描述外,所有标注都来自传感器的直接测量,而非通过算法估计得到。这意味着即使面对重度遮挡、快速运动或极端姿势,标注数据仍然是可靠的真值,而不是某个算法猜出来的结果。
**六、三级基准测试:从感知到理解再到互动**
收集数据只是第一步,让数据产生价值需要建立配套的评测体系。研究团队在ACE-Data-0的基础上设计了一套三级递进式基准测试,从底层感知信号到场景组件理解,再到交互行为理解,层层递进。
第一级测试关注**低层感知信号**,具体任务是"从视觉画面预测触觉信号"。给定一段手部操作的第一视角视频,算法需要预测每一帧手掌各区域的接触压力分布。这个任务的意义在于:如果机器人身上没有触觉传感器,是否能从摄像头看到的画面"猜出"手正在经历什么样的触感?研究团队评测了三种现有方法。PressureVision通过卷积编解码器直接从RGB图像回归压力图;EgoPressureDiff将这个问题建模为条件扩散过程;TouchAnything则通过跨视角融合学习通用的视觉-触觉映射。结果显示,TouchAnything表现最好,但三种方法的空间重叠精度(接触区域的IoU指标)都维持在相对较低的水平,说明从视觉"读取"触感仍然是一个极具挑战性的开放问题,尤其是当手和物体相互遮挡时,压力分布的精确估计远比判断"是否有接触"难得多。
第二级测试关注**场景组件恢复**,即从视频中重建人体在三维空间中的完整姿态。研究团队评测了22种方法,覆盖了单视角逐帧估计、单视角时序估计、场景感知估计和多视角联合估计四大类别,是迄今为止在真实家庭场景中规模最大的人体运动估计评测。结果揭示了一个重要规律:局部姿态估计(关节相对位置)和全局轨迹估计(人在房间里的移动路径)之间存在显著落差。很多方法在局部姿态指标上表现接近标准数据集上的水平,但一旦需要估计全局轨迹,误差就会大幅上升。场景感知方法(利用房间几何信息约束人体位置)在轨迹估计上确实优于纯视觉方法,但对局部关节估计帮助有限。第一视角方法(从头戴摄像机估计全身姿态)整体表现最差,因为身体大部分区域都在摄像机视野之外,只能从头部运动推断。
第三级测试关注**具身交互**,即从视频中精确重建手部在三维空间中的运动轨迹。这个任务对机器人学习尤其重要,因为手的轨迹可以相对直接地转化为机器人夹爪的操作轨迹。研究团队分别评测了第一视角和第三视角两种设置,并用同一套数据进行了直接对比。
在第一视角设置下,三种方法分别是逐帧回归的WildHands、时序视频处理的Dyn-HaMR和HaWoR。结果发现,逐帧方法在局部关节精度上反而优于时序方法,原因可能是时序方法需要同时估计摄像机运动(头部移动)和手部运动,摄像机运动估计的误差会直接污染手部位置估计。在全局轨迹估计方面,两种时序方法的误差都在98至102毫米左右,说明头部运动补偿是第一视角手部轨迹重建的主要瓶颈。
在第三视角设置下,评测了HaMeR、WiLoR、OmniHands(逐帧)和HaPTIC(时序)以及HORT(同时估计手和物体)五种方法。局部关节精度方面,五种方法相差不大,最佳的WiLoR达到9.1毫米PA-MPJPE,与逐帧第一视角方法(11.2毫米)接近。在全局轨迹方面,第三视角的时序方法HaPTIC只有63毫米误差,明显优于第一视角的两种方法,原因正是固定摄像机提供了稳定的空间参考系,无需估计摄像机自身的运动。
这次跨视角对比清晰地表明:第一视角提供了更近距离的手部细节,第三视角提供了更稳定的空间参考,两者的失效模式互补——第一视角害怕截断、畸变和运动模糊,第三视角害怕身体和物体遮挡手部。将两者融合使用很可能是未来更准确手部重建的方向。
**七、这个数据集能做什么**
ACE-Data-0的价值远不止于支撑这三项基准测试。由于它包含了时间对齐的第一视角观察、多视角第三视角视频、身体运动轨迹和接触级别的触觉监督,每一个训练信号都指向同一个物理时刻,这使它天然地适合支持一系列前沿机器人学习任务。
在模仿学习领域,机器人可以直接从数据集中提取人类操作手势的三维轨迹,用于训练抓取和操作策略。在世界模型领域,多模态同步数据可以用来学习家庭环境中动作的因果关系——按下开关后会发生什么声音,把杯子放在桌边可能会滑落。在视觉-语言-动作系统领域,语言标注和动作轨迹的对齐为直接训练"听懂指令就能执行操作"的端到端系统提供了素材。在触觉感知迁移领域,视觉与触觉的同步配对数据可用于训练机器人从摄像头读取接触信息,从而在没有触觉传感器的情况下也能估计抓取质量。
研究团队特别提到,ACE-Data-0还具备扩展潜力。当前版本覆盖2个采集地点,未来可以向更多家庭环境、更多物体种类、更多人口多样性扩展。系统本身的设计也预留了这种扩展性——采集流程标准化,每个新地点只需重新标定,不需要重新设计整套系统。
**说到底,这是一次认真的还债**
说到底,ACE-Data-0是在认真偿还一笔"数据债"。机器人研究者们早就知道,要让机器人真正融入家庭,就必须让它们从人类的日常智慧中学习。但这份智慧从来没有被系统地记录过,大家只是隐约知道这个缺口很重要,却没有人真正去填补它。
这项研究的意义在于,它把"全面、同步、真实家庭场景"这三个本来很难同时满足的条件凑在了一起。基准测试的结果同样重要:现有方法在接触估计、全身运动轨迹、第一视角手部重建等任务上都暴露出了明显的能力边界,这为未来研究指明了值得努力的方向。
当然,这个数据集并不完美。它只覆盖了两个采集场地,布局风格和光线条件都有限;被追踪的物体必须提前扫描和安装标记球,无法处理流动的液体、可变形物体或关节式设备的状态变化;参与者身上的动作捕捉服、手套和头盔在画面里清晰可见,可能让模型学到一些只在实验场景中才存在的视觉特征。这些局限是真实的,需要在未来工作中逐步克服。
对于关心家用机器人未来的读者,这项研究意味着一个具体的进展:帮助机器人学习家务的"教材"正在被认真编写,而且正变得越来越完整。有兴趣深入了解所有技术细节、查阅数据集使用协议或关注后续进展的读者,可以通过arXiv编号2607.28625找到完整论文,数据集本身也已在Hugging Face平台的ACERobotics账户下公开发布。
Q&A
Q1:ACE-Data-0数据集和现有的机器人训练数据集有什么区别?
A:ACE-Data-0最核心的区别是"多模态同步"——它同时记录了第一视角视频、8个外部摄像机视频、全身动作捕捉、手指关节角度、物体三维位姿、触觉压力和多通道音频,并且所有数据都精确对准同一条时间轴。现有大多数数据集只提供其中一两种模态,或者是在实验室里拍的,没有真实家庭的家具遮挡和环境复杂性。ACE-Data-0把这些条件同时满足,这是它的主要贡献。
Q2:触觉数据在机器人学习中为什么重要?
A:触觉告诉机器人"抓到了没有"以及"抓得多紧",这是视觉看不出来的信息——玻璃杯拿起来了但摄像头看不到手指受力多大。ACE-Data-0里每帧画面都配有对应的手掌压力分布图,让研究者可以训练模型从视频画面预测触感,相当于用摄像头模拟触觉传感器的功能,对没有触觉硬件的机器人平台很有实用价值。
Q3:ACE-Data-0数据集是否对外公开可用?
A:是的,数据集已在Hugging Face平台公开发布,账户名为ACERobotics,数据集名称为ACE-Data-0。相关代码和项目主页也可通过搜索"ACE-Data-Engine"找到。数据集收录了超过150小时、1700万帧的多模态同步数据,并附带完整标注,研究者可以直接下载使用。

