# 荣登ECCV！大晓发布全球首个可仿真人–场景交互重建框架HSImul3R，让人类视频变成机器人技能

> 一段人坐上椅子的视频，对人类而言再普通不过。我们不仅能看见“人坐了下来”，还天然理解椅子承受人体重量，人与椅面形成接触并最终稳定，这些重力、接触与作用关系共同构成真实世界中的物理交互。但对今天的三维重建系统而言，“看见动作”与“重建真实交互”仍是两回事。一个视觉上准确坐在椅子上的…

- 分类：24小时快讯
- 作者：奇点编辑部
- 发布时间：2026-09-08
- 原文链接：https://www.qidianyanjiushe.com/article/eccvhsimul3r
- 文章 ID：64

---

一段人坐上椅子的视频，对人类而言再普通不过。我们不仅能看见“人坐了下来”，还天然理解椅子承受人体重量，人与椅面形成接触并最终稳定，这些重力、接触与作用关系共同构成真实世界中的物理交互。但对今天的三维重建系统而言，“看见动作”与“重建真实交互”仍是两回事。一个视觉上准确坐在椅子上的人体，进入物理仿真后，椅子可能因结构缺失倒下，人体也可能与椅面严重穿模。视觉上成立，并不意味着物理交互上成立。

近日，大晓机器人联合南洋理工大学 S-Lab、上海人工智能实验室发布全新人–场景交互重建研究 HSImul3R，直指三维视觉长期存在的“感知—仿真鸿沟”，推动三维重建从“视觉正确”走向“物理可执行”。该成果已被全球计算机视觉顶级会议 ECCV 2026 正式接收。不同于传统方法主要关注人和场景是否重建得像、是否对齐，HSImul3R 将重力稳定性、真实接触与交互稳定性纳入核心评价标准。团队将其定义为首个面向非标定稀疏视角输入、实现稳定可仿真（Simulation-Ready）人–场景交互重建的框架，并进一步支持单目视频输入。与此同时，团队构建了面向人–场景交互的 HSIBench，直接检验重建结果能否在物理仿真中稳定交互。HSImul3R 在 Easy、Medium、Hard 三档任务中的交互稳定率分别达到 53.68%、30.56% 和 13.92%，显著高于 HSfM 的 10.52%、4.50% 和 2.66%，并将人–场景三维穿模率从 69.51% 降至 22.90%。

为实现这一目标，HSImul3R 提出物理闭环（Physics-in-the-Loop）双向优化框架，让物理仿真器从最终检验工具变成重建过程中的主动监督者。一方面，通过面向场景的强化学习（Scene-targeted Reinforcement Learning）优化人体运动，使其既物理可行，又能与当前场景稳定交互；另一方面，通过直接仿真奖励优化（Direct Simulation Reward Optimization，DSRO），利用交互后的仿真反馈反向优化三维场景。最终，团队将优化后的人体动作迁移至 Unitree G1 人形机器人，贯通日常图像/视频 → 三维人–场景交互重建 → 物理仿真优化 → 人形机器人动作迁移 → 真实机器人执行的完整链路，让人类视频中的交互经验从视觉信息进一步转化为可仿真、可学习、可执行的机器人技能资产。

Paper:《HSImul3R: Physics-in-the-Loop Reconstruction of Simulation-Ready Human–Scene Interactions》 ArXiv: https://arxiv.org/abs/2603.15612Project: https://yukangcao.github.io/HSImul3R/GitHub: [https://github.com/yukangcao/HSImul3R](https://github.com/yukangcao/HSImul3R)

**从“视觉正确”到“物理成立”：重新定义三维重建**

近几年，三维重建、人体运动估计与人–场景交互建模持续发展，机器从图像和视频中恢复三维世界、理解人类行为的能力不断提升。但传统方法大多仍以几何准确、姿态还原和视觉对齐为主要标准，回答的更多是“人和场景重建得像不像”。问题在于，机器人最终面对的是一个由重力、碰撞、摩擦与接触共同决定的物理世界。一个视觉上高度可信的场景，进入仿真器后可能立即失效：椅子可能因为结构缺失无法站稳，人体与物体也可能发生穿模，原本看似正确的交互因此无法真正成立。

HSImul3R 概览图

HSImul3R 因此将评价标准从“视觉正确”进一步推进到“物理成立”，把重力稳定性、真实接触和交互稳定性纳入重建过程。它不再只要求人和场景在画面中对齐，而是要求重建结果能够真正进入物理仿真，并保持原有的人–场景交互关系。更关键的是，HSImul3R 并非先完成重建、再用仿真器验证，而是提出物理闭环（Physics-in-the-Loop）双向优化机制，让仿真反馈直接参与重建。正向过程优化人体，反向过程修正场景，物理仿真器由最终的“裁判”转变为整个重建过程中的主动监督者。

**不只是动作可行，更要让交互真正成立**

物理闭环的第一步，是让恢复出来的人体运动真正适应当前场景。传统动作跟踪与强化学习通常更关注人体自身是否稳定、动作是否接近原始轨迹，但即使人体动作在物理上成立，也可能已经偏离原有的人–物交互关系。例如，一段“坐在椅子上”的动作经过普通运动优化后，人体可能为了保持平衡而偏离椅子。人虽然没有摔倒，但“坐椅子”这一原本的交互已经消失。对于具身智能而言，只做到“动作可行”显然还不够。

去除面向场景的强化学习，仿真中出现非预期的物体位移，且难以稳定交互

为此，HSImul3R 提出面向场景的强化学习（Scene-targeted Reinforcement Learning），在运动跟踪基础上进一步加入场景交互约束。系统通过人体关键接触点与物体表面的空间关系，使优化后的动作既忠实于原始观测，又能与当前场景保持正确、稳定的接触。也就是说，HSImul3R 优化的不是一条抽象意义上“符合动力学”的人体轨迹，而是一段能够在特定场景中真正成立的物理交互。“坐下”意味着人必须真实坐到这把椅子上，而不是只在空间中复现一个相似动作。

**用真实交互反过来优化三维世界**

但仿真失败并不一定意味着“人动错了”，也可能是场景本身没有重建正确。尤其在人类遮挡严重、桌腿或椅腿等结构较细的场景中，图像生成三维模型（Image-to-3D）容易产生结构缺失或几何畸变，即使人体动作合理，也无法支撑真实交互。针对这一问题，HSImul3R 在反向过程中提出直接仿真奖励优化（Direct Simulation Reward Optimization，DSRO），直接利用物理仿真的交互结果作为监督信号，反向优化三维物体生成模型。评价标准也由“物体自己能不能站稳”，进一步提升为“人与它交互之后还能不能稳定”。

图像到三维物体重建的定性对比

团队将仿真反馈划分为从“物体在重力下失稳”到“人与物体实现稳定交互”的四种状态。只有当物体自身稳定、交互后仍保持稳定，并且人与物体之间确实形成有效接触时，重建才被认为真正成立。因此，一把椅子即使单独放在地面上不会倒，如果人坐上去就倾覆，或者人与椅子最终完全分离，它仍然没有被真正“重建对”。HSImul3R 由此把评价标准从“物体自身是否物理合理”推进到“物体在人–场景交互中是否物理合理”，让人类交互本身成为优化三维世界的重要监督信号。

**HSIBench：不只看“像不像”，更要看“能不能交互”**

为了验证这一新的评价体系，团队进一步构建了面向人–场景交互的 HSIBench。数据集包含 19 个场景物体、超过 50 段人体动作序列和 300 个独立交互实例，由 3 名参与者完成，每个案例均从 16 个视角同步采集。与传统三维重建基准更多关注几何误差不同，HSIBench 将人–场景交互稳定性（Stability-HSI）作为核心指标之一，不仅判断物体在重力下能否稳定，还要求整个交互进入仿真后保持稳定，并保留有意义的人–物接触。换句话说，三维重建不仅要通过“视觉和几何考试”，还要真正通过“物理实操”。

HSIBench 示例及 HSImul3R 对应的仿真结果

实验结果显示，在 Easy、Medium 和 Hard 三档任务中，HSImul3R 的人—场景交互稳定率分别达到 53.68%、30.56% 和 13.92%，而 HSfM 分别为 10.52%、4.50% 和 2.66%；人—场景三维穿模率也从 HSfM 的 69.51% 降至 22.90%。这些结果意味着，当三维重建真正服务于具身智能时，“渲染得足够真实”已经不再是终点。重建出来的世界，还必须能够承受机器人真实的动作与交互。

**从人类视频到真实机器人，让交互经验真正被“学会”**

如果 HSImul3R 最终只停留在稳定的物理仿真，它仍然只是完成了从真实世界到仿真的迁移（Real-to-Sim）。这项工作的另一关键一步，是进一步将经过物理优化的人体动作迁移到真实人形机器人上，实现从仿真到真实世界（Sim-to-Real）。团队首先将优化后的人体运动重定向至 Unitree G1，再以这些动作作为先验，在仿真环境中训练全身控制策略，最终直接部署到真实 G1 上，使机器人能够在现实环境中复现相应的人—场景交互。

部署于 Unitree G1 人形机器人上的仿真到真实（Sim-to-Real）结果

至此，一段人类视频中的行为完成了完整转换：从图像或视频中恢复三维人—场景关系，通过物理仿真修正那些“视觉上合理、物理上无法成立”的部分，再将人体动作转化为机器人能够学习的动作先验，最终由真实机器人重新执行。这也打开了一条更具想象力的路径。互联网中已经存在规模巨大的人类行为视频，如果其中的人–场景交互能够被持续重建、物理验证并迁移到不同机器人本体，这些视频就不再只是供机器“观看”的视觉数据，而可能成为机器人学习真实物理技能的重要来源。

当然，这条路线仍处于早期阶段，复杂交互、多物体场景和动态环境依然存在大量挑战。但 HSImul3R 已经给出一个重要方向：机器人从人类视频中学习的，不应只是“人看起来怎么动”，更应该是这个动作为什么能够在真实物理世界中成立。从视觉重建到可仿真重建，从人体动作到人—场景交互，再从真实世界到仿真、最终回到真实机器人，HSImul3R 正在推动人类视频从视觉信息进一步转化为可仿真、可学习、可执行的机器人技能资产。

##

**关于大晓机器人（ACE ROBOTICS）——让机器人拥有聪明的“大脑”和有趣的“灵魂”**

大晓机器人（ACE ROBOTICS）是加速具身智能智慧跃迁的机器人公司，由商汤科技联合创始人、执行董事王晓刚出任董事长，世界级AI科学家陶大程院士担任首席科学家，公司汇聚全球稀缺的青年AI科学家及来自产业界的卓越专家，共同深耕具身智能领域，旨在通过突破性技术创新，对具身智能场景的深刻洞察，推动机器人自主理解和探索物理世界，加速具身智能的商业化场景落地。

大晓机器人首创ACE研发范式，构建“环境式数据采集—开悟世界模型3.0—泛化具身模组”的全链路技术体系。大晓机器人以全时空多视角环境采集为引擎，国内首个开源且已实现商业应用的“开悟”世界模型3.0（Kairos 3.0）和具身基模型为技术基座，解决具身智能行业目前面临的数据荒、常识差、泛化难、通用性不足等核心挑战。大晓机器人同步重磅推出“具身超级大脑模组A1”，加速具身智能在安防、巡检、服务等多元场景的规模化、商业化落地。

大晓机器人不仅是技术的开拓者，更是生态的共建者。大晓机器人通过与顶尖的芯片厂商、硬件厂商、云服务商及垂直场景伙伴的战略合作，共同打通“模型—硬件—场景”的产业闭环，提供标准化与定制化结合的解决方案，共同成为具身智能领域极具潜力的中国创新力量。

---

本文由奇点研究社发布，引用请注明出处：https://www.qidianyanjiushe.com/article/eccvhsimul3r
