近日,大晓机器人联合香港中文大学多媒体实验室、南洋理工大学等机构,开源了面向第一视角视频的 3D 双手形状重建模型 ACE-Ego-Hand,并已产出约5000小时训练数据。
ACE-Ego-Hand 可用于从海量第一视角视频中高效提取结构化的双手三维操作轨迹,将人类真实的抓取、装配和双手协同经验转化为机器人可学习的大规模数据,成为具身大模型训练数据的重要组成基座;并首次将视频生成模型作为DreamHand编码器,实现端到端训练,只需对整段视频进行一次分析,就能直接输出双手的姿态、形状和 3D 位置。
与此前依赖逐帧检测、窗口式时序回归或多步骤扩散采样的手部模型相比,ACE-Ego-Hand 将视频扩散模型改造成几何编码器,单次前馈恢复连续的双手 3D 轨迹:降低了推理延迟和误差累积,使模型能够利用完整视频片段中的上下文信息恢复被遮挡或暂时离开视野的手形轨迹。

对于产业而言,ACE-Ego-Hand 的价值不只是提升单帧手部姿态识别精度,而是将第一视角视频转化为连续、稳定且具有度量尺度的双手 3D 轨迹。它可以服务于产线操作数据采集、机器人示教、人工装配过程分析、灵巧手动作重定向和模仿学习数据构建等场景。尤其是在手部经常被工件遮挡、暂时离开画面以及相机快速运动的真实环境中,模型能够减少轨迹中断和手部丢失,为机器人从人类操作视频中学习完整动作过程提供数据基础。
从公开评测结果看,ACE-Ego-Hand 在 ARCTIC、HOT3D、HOI4D、H2O 和 OakInk2 五个第一视角手部基准上取得领先表现,在论文报告的 48 项主要指标比较中赢得 45 项。在遮挡严重的 ARCTIC 数据集上,模型相较 ViDiHand 将 MPJPE-p 降低约 30%;在复杂第一视角和广角场景下的 HOT3D 数据集上,MPJPE-p 降低约 40%;当评测纳入完全离开视野的手部后,性能优势进一步达到 45.9%-61.1%。在速度方面,ACE-Ego-Hand 在单张 A100 GPU 上达到约 63.1 fps,约为 ViDiHand 高精度配置的 33 倍。
项目链接:https://ggxxii.github.io/ace-ego-hand/
Arxiv链接:https://arxiv.org/abs/2608.20308
不再反复去噪,手部 3D 恢复提速 33 倍

ACE-Ego-Hand 首先解决的是手部 3D 恢复过程中的效率问题。传统视频扩散模型通常需要经过多步去噪采样,逐步生成中间视频或像素结果,再从生成结果中估计手部姿态。这种流程不仅计算成本高,也会增加生成误差向后续姿态估计传播的风险。
ACE-Ego-Hand 去掉了这一多步骤去噪过程,不再将视频扩散模型作为像素空间的生成器使用,而是将其改造成确定性的几何编码器。输入视频经过 VAE 压缩后,模型直接在干净潜变量上进行一次前向传播,并从视频扩散 Transformer 的中间层读取时空特征。随后,这些特征被直接送入双向时空解码器,由模型端到端地输出双手姿态、形状、可见性和 3D 空间位置。
这种设计将原本“多步去噪生成视频,再进行手部估计”的流程,压缩为“单次前馈传播,直接恢复手部 3D 运动”。模型不需要反复生成 RGB 视频,也不依赖外部手部检测器和额外的逐帧裁剪,从而显著减少了推理环节和计算开销。
在单张 A100 GPU 上,ACE-Ego-Hand 达到约 63.1 fps,约为 ViDiHand 高精度配置下的 33 倍效率,为大规模处理产线第一视角操作视频提供了效率基础。
告别手形遮挡帧丢失,利用视频上下文补全离屏轨迹

ACE-Ego-Hand 另一核心创新是在手部被遮挡或离开视野后,推理恢复其运动轨迹。
这一能力来自模型的双向时空推理机制。传统因果模型主要根据过去帧预测当前结果,手部离开画面后只能进行单向外推,容易产生漂移。ACE-Ego-Hand 则对整段视频进行联合分析,不使用因果掩码,因此处理某个时刻时,可以同时利用手部消失前和重新出现后的信息。
手部消失前的画面能够提供运动起点、速度和方向,手部重新出现后的画面则提供运动终点和姿态约束。模型通过前后两侧的信息共同推断中间的不可见区间,从而保持手部身份和轨迹连续。
为了避免遮挡期间出现手部尺度变化,ACE-Ego-Hand 还引入片段级形状先验。同一只手在一个视频片段内只预测一次形状参数,而不是每帧单独估计。这样可以减少手部尺寸闪烁、形状漂移以及重新出现时的身份不一致。
这一设计对于产线操作尤其重要。实际操作中,手部被工件遮挡并不是偶发情况,而是装配、抓取和工具使用过程中的常见状态。对于机器人学习来说,完整的连续轨迹通常比若干张孤立的高质量单帧结果更有价值,因为机器人需要学习的是动作过程,而不是单个姿态。
在离屏手部评测中,ACE-Ego-Hand 在 ARCTIC 和 HOT3D 上相较 ViDiHand 的综合误差分别降低 45.9% 和 61.1%,说明其优势不仅体现在可见帧的姿态估计,也体现在对不可见运动过程的恢复能力上。
摆脱固定相机标定:利用头部第一视角恢复手部 3D 位置
ACE-Ego-Hand 的另一项关键能力,是在测试阶段无需显式输入相机内参,仅通过头戴式第一视角视频,即可恢复手部在相机坐标系下的度量 3D 位置。此外,ACE-Ego-Hand支持原生鱼眼超广角输入,面对鱼眼图像显著的径向畸变,模型无需提前标定相机、做图像去畸变,直接从畸变画面预测像素到三维空间的观测射线,完成手部度量 3D 位置恢复。模型不仅判断“手在画面中的哪里”,还进一步估计“手距离相机多远”,实现从二维定位到度量 3D 运动恢复的扩展。
ACE-Ego-Hand 根据视频特征,估计画面中不同位置对应的 3D 观察方向,相当于为图像中的每个区域建立一组“通往真实空间的射线”。随后,模型结合二维关节位置、手部自身的 3D 结构、深度信息以及多个关节之间的透视关系,通过基于射线的相机求解器和混合 PnP 几何计算,恢复手部在相机坐标系中的真实平移位置。
在此基础上,ACE-Ego-Hand 提供了 K-free 配置。在这一配置中,模型可以直接利用自身预测的视线场完成手部空间位置求解,从而降低对固定相机标定信息的依赖。这对于使用不同头戴式设备、不同镜头和不同采集工位的场景具有实际意义,也为跨设备部署提供了更大的灵活性。
这项能力意味着手部模型不必完全绑定在某一台固定相机或某一套标定参数上,可以更灵活地适应人员移动、头部转动和采集视角变化。模型输出的不只是手部在画面中的二维位置,而是可进一步用于机器人示教、轨迹重定向和模仿学习的 3D 手部运动数据。
五个基准测试SOTA,45项能力领先
DreamHand 在五个第一视角手部基准上进行了评测,覆盖双手遮挡、复杂相机运动、手物交互和长时序操作等场景。在的 48 项主要指标比较中,ACE-Ego-Hand 赢得 45 项,整体表现领先现有方法。其中,在 ARCTIC、HOT3D 和 HOI4D 上重点超过 ViDiHand;在 H2O 和 OakInk2 上,也在多数姿态、定位和轨迹稳定性指标上超过此前最佳方法。

在用于评估复杂双手操作和物体遮挡下的手部恢复能力的基准ARCTIC上,ACE-Ego-Hand 的 F1 达到 1.000,MPJPE-p(重建误差) 为 15.256 mm,并在主要姿态、空间位置和轨迹稳定性指标上超过其他基线。
在重点评估复杂第一视角和广角相机条件下的手部、物体 3D 跟踪能力的基准HOT3D上,ACE-Ego-Hand 的 MPJPE-p 为 12.888 mm,相比 ViDiHand 的 21.514 mm 降低约 40%。在包含离屏手部、二维定位、全局方向和相机平移的评测中,ACE-Ego-Hand 的指标全面领先。
在主要用于评估不同物体类别和操作行为下的人-物交互理解能力的基准HOI4D。ACE-Ego-Hand 在姿态精度、二维定位、空间平移和时间稳定性等核心 3D 恢复指标上明显领先。

主要研究第一视角下双手与物体交互时的姿态估计的基准H2O上,ACE-Ego-Hand 的 MPJPE-p 为 9.223 mm,明显优于此前表现最好的 Dyn-HaMR(17.213 mm)。在二维定位、全局方向和轨迹平滑性方面,DreamHand 同样超过多数基线。
主要关注复杂任务完成过程中的双手协同操作和长时域动作的基准OakInk 2,ACE-Ego-Hand 的 MPJPE-p 为 8.988 mm,明显优于此前最佳的 WiLoR(26.520 mm),误差降低约 66%;在二维定位、全局方向、相机平移和轨迹平滑性等指标上,ACE-Ego-Hand 同样取得领先。
ACE-Ego-Hand 打通产线数据到机器人执行链路
在产业落地上,ACE-Ego-Hand 实现了从第一视角视频到真实 Inspire 灵巧手动作迁移的完整流程。模型首先从头戴式相机拍摄的视频中恢复连续的双手 3D 关节轨迹,再将手指弯曲、关节运动和双手协同关系映射到机器人灵巧手,使机器人能够复现视频中的双手操作动作。通过这一流程,人的实际操作可以被转化为机器人能够理解和执行的动作数据。
ACE-Ego-Hand 最大的产业价值,是降低机器人操作数据的采集门槛。企业可以通过头戴式相机记录真实产线操作,再将视频批量转换为机器人可用的 3D 动作数据,用于机器人示教和灵巧手模仿学习。这为未来训练具身大模型提供了更具规模的数据来源:将大量真实的人类操作视频转化为连续、结构化的双手运动数据,让具身模型能够学习更多任务、工具使用方式和双手协同技能,加快从人类操作经验到机器人能力的转化。
##
关于大晓机器人(ACE ROBOTICS)——让机器人拥有聪明的“大脑”和有趣的“灵魂”
大晓机器人(ACE ROBOTICS)是加速具身智能智慧跃迁的机器人公司,由商汤科技联合创始人、执行董事王晓刚出任董事长,世界级AI科学家陶大程院士担任首席科学家,公司汇聚全球稀缺的青年AI科学家及来自产业界的卓越专家,共同深耕具身智能领域,旨在通过突破性技术创新,对具身智能场景的深刻洞察,推动机器人自主理解和探索物理世界,加速具身智能的商业化场景落地。
大晓机器人首创ACE研发范式,构建“环境式数据采集—开悟世界模型3.0—泛化具身模组”的全链路技术体系。大晓机器人以全时空多视角环境采集为引擎,国内首个开源且已实现商业应用的“开悟”世界模型3.0(Kairos 3.0)和具身基模型为技术基座,解决具身智能行业目前面临的数据荒、常识差、泛化难、通用性不足等核心挑战。大晓机器人同步重磅推出“具身超级大脑模组A1”,加速具身智能在安防、巡检、服务等多元场景的规模化、商业化落地。
大晓机器人不仅是技术的开拓者,更是生态的共建者。大晓机器人通过与顶尖的芯片厂商、硬件厂商、云服务商及垂直场景伙伴的战略合作,共同打通“模型—硬件—场景”的产业闭环,提供标准化与定制化结合的解决方案,共同成为具身智能领域极具潜力的中国创新力量。



