7月31日消息,近日,基于全球首创的具身模型信息密度定律与以人为中心的环境式数据采集方案2.0,并依托环境式采集引擎ACE,大晓机器人联合南洋理工大学 S-Lab 重磅开源 L5 级多模态具身物理智能数据集 ACE-Data-0。通过对真实物理交互、长程任务过程与多模态因果信号的高保真采集和高精度标注,ACE-Data-0 为全球具身模型提供面向泛化、反思与进化的高质量数据底座,推动通用物理智能加速跨越实验验证,走向规模化产业落地。
具身数据的价值不在于规模堆叠,而在于能否高密度记录那些真正改变行动结果的信息;在这一定律下,L1-L2 级数据仅能支撑基础预训练,L3-L4 级数据止步于已知任务的拟合;ACE-Data-0 数据集已迈入 L5 级,深度融入接触压力、自然出现的犹豫与恢复过程,以及真实家庭场景中的开放行为变量,通过桌面尺度与房间尺度两套互补采集系统,将真实家庭环境转化为可持续记录、统一标定和精准同步的具身数据采集场景,让日常生活中的真实交互直接成为机器人学习物理世界的数据来源。
具体而言,ACE-Data-0 包含 150 小时数据、1700 万帧视频、200 个任务类别、50 名参与者、2 个真实家庭场景和 7.5 万个交互片段,覆盖原子级人—物交互、长时序家庭场景活动链及人与场景交互。数据同步采集第一人称视频、多视角第三人称视频、全身与手部运动、物体六自由度轨迹、多通道音频与触觉信号,并将全部模态对齐至同一时间线和空间坐标系,完整保留人类感知、行动、接触与环境变化的连续过程。
基于 ACE-Data-0,大晓进一步构建了从底层信号、场景组成要素到具身交互理解的三级评测基准,系统检验模型在接触感知、人体与物体状态恢复、手—物交互理解等关键环节的真实能力。ACE-Data-0 因此不只是一批家庭场景活动视频,更是一套面向模仿学习、世界模型、视觉—语言—动作模型(VLA)、机器人策略学习及人类示范向机器人迁移的具身数据基础设施,为通用物理智能走进真实世界提供更完整、更可扩展的数据底座。
机器看见了动作,却没有看见完整的物理过程
过去几年,视觉语言模型、VLA 和世界模型快速发展,但机器人真正进入物理世界后,仍然面对一个基础问题:应该从什么数据中学习人类的行动能力?打开橱柜、倒水、叠衣服等日常行为,同时涉及视觉、全身运动、手部操作、物体状态、声音、触觉和任务规划。普通视频可以记录发生了什么,却难以准确呈现接触何时发生、力度如何变化、物体怎样运动,以及当前动作与前后任务之间的关系。
现有第一人称视频通常缺少精确的人体、手部和物体状态;动作捕捉数据又多来自理想化实验室,容易缺少自然遮挡、第一人称视角、音频和触觉。大量数据还停留在持续数秒的抓取、放置等单步动作,难以描述真实家庭场景任务中的长期依赖。因此,ACE-Data-0 不再把活动切割成孤立短片,而是连续记录感知、行动、接触和状态变化,让不同模态共同描述同一个物理过程。其重点可以概括为:完整感知、长时序任务、多模态同步。
从桌面到房间:两套系统覆盖精细操作与长程活动
精细手部操作与房间尺度活动,对采集系统提出了截然不同的要求。指尖接触、抓握变化和物体细微运动,需要近距离密集传感器;人在厨房、客厅和卧室之间移动,则需要大范围覆盖、全局视角和统一空间坐标。为兼顾两类需求,大晓将环境式采集引擎ACE设计为桌面尺度与房间尺度两套互补配置,并基于两套系统构建ACE-Data-0。
桌面尺度系统面向精细化手—物交互,在操作区域周围布置多视角摄像机、光学动作捕捉和触觉设备,重点记录抓取、倾倒、擦拭、切割、折叠等任务中的手部姿态、物体轨迹和接触变化。房间尺度系统覆盖厨房、餐厅、客厅、卧室等完整家居空间,通过广基线摄像机和全空间动作捕捉,持续记录参与者的全身运动、跨区域移动,以及发生在场景不同位置的连续交互。
两套配置共享统一的数据采集、同步、标定、质检和标注流程:桌面尺度回答“手与物体如何精细交互”,房间尺度回答“人如何在完整环境中移动、规划并完成任务”。采集过程中,参与者佩戴第一人称设备,系统同步记录四路鱼眼视频、IMU、头戴设备位姿、全身运动和手部关节状态;多视角外部摄像机则补足第一人称视角中容易被遮挡的身体和环境信息。
每个活动时刻均由多个视角同步观察,并与可度量的人体、手部和物体状态对应,使自然行为与高精度物理监督得以同时保留。此外,ACE-Data-0 还记录物体运动、全手掌触觉压力和多通道音频。视觉描述外部变化,运动数据还原人体与物体轨迹,音频记录碰撞和设备状态,触觉则提供接触、压力与滑动信息。不同模态共同构成对同一次真实交互的完整观察。
不是一堆数据流:把所有信号锁定在同一时空
多模态数据真正的难点,不是设备够不够多,而是不同设备产生的数据能否准确对应。摄像机、动作捕捉系统、触觉手套和音频设备通常拥有独立时钟与不同采样频率。即使只有几毫秒偏差,也可能出现画面中的手尚未接触杯子,触觉信号却已经产生的问题;如果不同摄像机、人体和物体没有统一空间基准,也无法准确建立几何关系。
通过时间同步与空间标定,ACE-Data-0 把视频帧、人体动作、物体状态、触觉读数和音频统一到同一条时间线,并将外部摄像机、持续运动的第一人称设备、人体、双手和物体配准至共享世界坐标系。因此,每次采集并不是一组互不相关的数据流,而是一份对同一物理过程的统一记录。研究者可以直接找到某个视频帧对应的人体姿态、物体位置、接触压力和声音变化,也可以比较第一人称与第三人称视角下的同一事件。
ACE-Data-0 进一步提供相机参数和同步时间线、人体及手部状态、物体网格与六自由度位姿、边界框、运动轨迹、手—物接触信息,以及与物理时间线对齐的自然语言描述;其中,大量标注直接来自经过标定的采集系统,而非完全依赖模型事后估计。这使数据在遮挡、快速运动和长期任务中拥有更稳定的一致性,也让模型能够真正学习发生在同一时刻的视觉、动作、声音和接触。
不给标准答案:目标级采集保留真实行为差异
ACE-Data-0 覆盖三类互补任务。第一类是原子级人—物交互,单次约3分钟,包括倒水、清洗、擦拭、切割、折叠和整理等单项操作,即使最短序列也以分钟计,而非传统HOI数据中常见的数秒片段;第二类是多个原子动作组成的长时序家庭场景活动链,可持续20—30分钟,例如从打开冰箱、取出食材,到清洗、切配、烹饪、装盘和收拾;第三类是人—场景交互约5分钟,包括移动、坐下、锻炼、开关家具、取放物品及姿态转换等。
与严格规定每一步动作的脚本式采集不同,ACE-Data-0 采用目标级指令。参与者只被告知最终任务,不被要求遵循固定流程,因此可以自由选择物品、操作顺序和移动路径,也可能在过程中犹豫、改变计划、返回上一步或处理意外情况。同样是整理房间,有人先收拾桌面,有人先整理沙发;同样是准备食物,不同参与者会选择不同工具和顺序。这些差异在标准化采集中可能被视为噪声,但对于真正进入家庭场景的机器人来说,正是必须理解的现实。
长时序任务的难点也不只是“视频更长”。此前的决定会改变后续可执行的动作,物体可能离开并重新进入视野,子任务可能中断、重排或在其他位置继续。模型必须持续记住任务目标、物体状态和已经完成的步骤,而不能将活动视为一串彼此独立的动作。ACE-Data-0 保留这些自然变化,使数据不再只提供理想化动作模板,而是记录人类真实完成任务时的规划、调整和恢复过程。
从采集数据到评估模型:ACE-Data-0的更大价值
基于 ACE-Data-0,大晓建立了由底向上的三级具身感知评估基准。第一级是底层信号推断,研究模型能否从视觉观测中预测接触与触觉信息;第二级是场景组成要素恢复,评估模型在遮挡、复杂姿态和持续运动下恢复人体与手部运动状态的能力;第三级是具身交互理解,要求模型从第一人称和第三人称视频中恢复接近、抓取、调整和释放等完整手—物交互过程。
研究团队进一步评测了30多种代表性方法。结果显示,现有模型在接触、严重遮挡、第一人称自运动、极端视角和长时间任务中仍存在明显能力缺口。
这套基准不只判断任务最终是否成功,更试图回答:模型究竟在哪一步失效?一次失败可能源于没有感知到接触,也可能来自物体状态估计错误、任务上下文丢失、动作顺序理解偏差,或手部运动恢复不准确。分层评测将这些问题拆解开来,帮助研究者判断模型已经理解了什么,又在哪一层发生能力断裂。
ACE-Data-0 的价值也不止于评测。由于第一人称视频、多视角第三人称视频、人体与物体轨迹、音频、触觉和语言标注处于统一时空框架,它可以进一步服务于模仿学习、机器人策略学习、世界模型、VLA,以及人类示范向不同机器人本体的迁移。
在大晓机器人看来,具身数据建设不能只追求小时数和轨迹数,更需要保留真实世界中的物理联系、任务结构、接触反馈与状态演化。“ACE-Data-0”中的“0”,代表这套具身数据体系的起点。未来,大晓机器人将继续围绕具身数据引擎、通用具身基础模型、世界模型和 VLA 推进研发,并与研究机构、开发者及产业伙伴共同探索从人类自然行为到机器人通用能力的可拓展路径。
从“看见动作”到“理解行动”,从孤立视频到连续物理过程,ACE-Data-0 正在为具身智能建立一条更接近真实世界的数据入口。让每一次真实生活中的感知、接触与行动,都成为机器人理解物理世界的训练信号。
转载请注明出处。

相关文章
精彩导读
热门资讯
关注我们