拿起一枚鸡蛋,人几乎不需要思考,就能判断该用多大的力、何时松手。指尖感受到的阻力稍有变化,动作也会随之调整。这些经验来自无数次与真实世界的接触,人通常不会刻意记录,却能在下一次操作中自然调用。
可对机器人来说,这恰恰是难点。摄像头可以记录一只机械手如何拿起鸡蛋,却很难完整还原接触瞬间的受力变化,以及机器人为什么调整力度。动作可以被拍下来,藏在动作背后的“手感”却很难被转化为可供模型学习的数据。语言模型依托互联网几十年积累的文字、图像和代码,一路狂奔;而教机器人“动手”的数据,大多只存在于现场操作的那一瞬间,来不及被记录就消失了。它们产生于具体场景,采集成本高、标准不一,也难以直接迁移到其他任务和机器人本体上。厘清智能想解决的,正是这道数据难题:把现实世界里转瞬即逝的接触、受力和动作信息记录下来,经过加工后变成可以用于训练、评测,并持续积累的数据。10 月 8 日,厘清智能宣布完成天使轮及天使+轮数亿元融资,蚂蚁集团连续两轮加码,并领投天使+轮。半年时间,便已完成种子、天使、天使+三轮融资。资本为什么愿意为一家才成立半年的公司连续下注?它为何在三个多月里,从“世界模型公司”改口为“Physical AI Infra 平台”?想成为基础设施的公司那么多,厘清智能“修路”的底气又是什么?过去几年,大模型的能力进步,很大程度上建立在互联网数据的规模化积累之上。文本、图像、视频和代码为模型提供了丰富的学习材料,即便数据质量参差不齐,也可以通过大规模训练不断挖掘其中的规律。物理世界的数据却没有这么容易获得。机器人要学会拿取、旋拧、切割、插拔等精细操作,仅仅知道物体在哪里、机械手应该移动到哪里还不够。它还需要理解接触之后会发生什么:物体有多重,表面有多滑,力度多大才不会损坏物体,遇到阻力时应该继续施力还是调整角度。这些信息与具体的物体、环境和操作过程密切相关,很多只存在于动作发生的瞬间。视频能够记录人的动作,却无法完整呈现接触过程中的力学变化。即便拍摄了大量人类操作视频,机器人也未必能直接照着学习。人的手与机器人的机械结构不同,同样的动作映射到不同构型的机器人上,执行方式和最终效果都可能发生变化。这也是行业所说的“构型鸿沟”。围绕这道难题,行业已经探索出几种主要的数据获取路径。一类是真机遥操作,由人控制机器人完成任务,能够获得与真实机器人执行过程直接相关的数据,但设备投入、采集成本和操作人员要求都比较高。一类是便携式数采设备,让人类在自然操作过程中记录动作和环境信息。这种方式更接近日常操作,也更容易进入不同场景,但采集设备能够记录哪些信息、数据能否用于机器人训练,仍取决于具体的硬件和数据处理能力。还有一类是仿真合成,通过构建虚拟环境生成训练数据,具有成本和规模优势,但仿真结果需要与真实世界对齐;人类自然演示则可以提供更丰富的任务样本,却难以仅凭视频还原完整的接触与受力信息。几条路线各有优势,也各有边界。业内常将这种困境概括为数据采集的“不可能三角”:高质量、高效率和高性价比,很难同时实现。公司推出了 T1 系列数采手套和 Ego 第一视角数采设备,尝试在真实操作中同步记录画面、深度、手部姿态、空间运动,以及接触与受力信息。与单纯记录动作的视频相比,这类数据希望进一步保留操作过程中发生了什么,以及操作者如何根据接触反馈调整动作。这些设备只是数据链条的起点,采集到的信息还需要经过同步、质检、加工和结构化处理,才能形成可用于模型训练与能力评测的数据。厘清智能面向模型厂商和 AI 研发团队提供定制化多模态数据采集、数据加工与标注、专项数据集建设及持续数据生产服务,试图将原本分散在现场的操作经验,转化为可交付的数据产品。从这里也能看出,厘清智能为什么把数据业务作为切入口。对需要训练具身模型的团队来说,数据是研发过程中的基础投入;对厘清智能来说,数据采集与加工则是目前更容易形成具体交付的业务环节。先围绕真实任务建立采集能力和数据生产流程,再逐步延伸到模型训练、仿真、评测与部署,公司试图沿着这条路径向更完整的 Physical AI 基础设施推进。不过,采集到更多数据,并不自动意味着机器人就能学得更好。原始数据能否进入训练,能否帮助模型在不同环境和不同本体上稳定完成任务,才是下一步要回答的问题。数据采集只是入口,能否让一次次真实操作留下的经验,在下一次训练和交付中继续发挥作用,才是核心。在厘清智能的规划中,整套 Physical AI Infra 由数据管线和物理引擎两部分驱动。前者负责将真实世界的操作经验转化为规模化、可用于训练的数据,后者则尝试把有限的真实经验扩展到更多环境和任务条件中。数据管线首先要解决的是规模问题。公司提出,希望将数据采集规模从行业平均的几十万小时,提升至百万乃至千万小时。但采集时长只是一个起点。不同设备、不同任务产生的数据,在时间同步、空间尺度和信息完整性上可能存在差异;如果原始数据无法被模型有效利用,规模再大也难以直接转化为训练效果。因此,厘清智能希望把数采硬件、数据加工、质量检查和结构化处理连接起来,让采集到的数据能够进入后续训练流程。T1 系列数采手套采用 11 颗 IMU 的方案,配合 Ego 第一视角设备,同步记录画面、深度、手部姿态、空间运动与接触受力信息。硬件负责捕捉真实操作,数据管线则负责把这些信息整理成模型可以使用的训练材料。物理引擎承担的是如何让有限的真实经验发挥更大作用。厘清提出的方向是 Real-to-Sim-Real 闭环,即从真实世界采集数据,利用真实数据构建仿真环境,在仿真中开展强化学习,再将训练结果部署回真实世界。真实数据为系统提供现实参照,仿真则用于扩展训练条件,机器人回到真实场景执行任务后产生的新反馈,还可以继续进入下一轮训练。这套设计背后的判断是,单靠真实采集,很难以低成本覆盖物理世界中所有可能出现的情况;单靠仿真,又面临虚拟环境与真实世界之间的差距。将两者连接起来,才有机会在数据质量与训练规模之间找到更可持续的平衡。在这套系统中,世界模型是其中一个环节,参与预训练目标和后训练仿真环境的构建。厘清智能希望围绕真实数据、模型训练、物理仿真和能力评测建立完整链条,让机器人逐步掌握切割、旋拧、插拔、搅拌、按压、捏取、穿引等精细操作,并尝试将相关能力迁移到灵巧手、机械臂等不同本体上。但从技术架构走向基础设施,还有一个更现实的问题:谁会为这套能力付费?一端是模型厂商和 AI 研发团队。不同团队的训练目标并不相同:有的需要人类操作数据,有的关注视频生成或世界模型,有的则在训练能够执行实际任务的具身模型。对应的数据规格、任务设计和评测要求也各不相同。厘清希望提供从采集工具、任务设计、数据生产到质检和能力验证的全链路服务,帮助客户获得符合研发需求的数据。另一端是工厂、酒店、物业、商场和厨房等终端场景。相比模型研发团队,这类客户的需求更贴近具体业务:机器人需要完成什么任务,现场有哪些空间与设备限制,采用哪种本体,怎样部署和迭代,都需要结合实际情况确定。厘清将这类业务描述为“弹性解决方案”,从任务定义和现场采集出发,再推进选型、部署与后续迭代,而非预先限定一种固定的产品形态。两端业务的意义,在于它们有机会形成一条相互反馈的链路。模型研发团队提出的新需求,可以推动数据采集与评测体系升级;终端客户提供的真实任务,则能带来操作过程、失败案例和现场约束。这些经验如果能够被有效整理并沉淀下来,就有机会成为下一次模型训练与项目交付的输入。在他的设想中,上一项任务积累的数据、训练方法、评测标准和部署经验,可以进入下一项任务。随着经验不断累积,公司希望逐步降低后续交付所需的数据量和工程投入。数采设备、数据管线、模型架构和物理引擎的全栈自研,也服务于同一个目标:尽可能让数据在采集、训练、仿真和部署之间流动,而不是停留在一次性的项目交付中。这条路线的投入并不轻。软硬件跨度大、研发周期长,还需要同时面对模型研发和真实场景的交付要求。李一鸣选择将这些环节放在同一套体系中,是希望通过系统协同建立长期积累,而非仅靠某一种设备或某一类数据形成竞争力。当然,这套学习曲线目前首先是厘清智能希望建立的能力模型。它能否成立,还需要看后续项目中有多少数据真正进入训练,有多少经验能够跨任务复用,以及这种复用最终能否体现为更稳定的交付和更低的成本。从数据采集走向 Physical AI Infra,关键不在于业务覆盖了多少环节,而在于这些环节能否互相增强。 如果每完成一个任务,都能为下一次训练和部署留下可复用的经验,厘清智能才有机会把数据服务逐渐做成基础设施。2025 年起,具身智能的数据建设开始从研发环节走向产业基础设施。智元、帕西尼、优必选、乐聚重资产自建数采工厂,年产数据以百万条计;2026 年年中,鹿明、光轮、核数聚接连完成大额融资;英伟达推出人形机器人参考设计,推动"数据—仿真—部署"的技术链条走向标准化。数据正在成为具身智能产业新的竞争资源,不过不同玩家对这项资源的理解并不相同。本体厂商倾向于自采自用,将数据沉淀在自己的研发体系中;仿真路线试图通过合成数据扩大训练规模;人类第一视角采集希望以更低成本获取自然操作数据;以帕西尼为代表的触觉硬件厂商,则从传感器和数采工厂切入,捕捉传统视觉数据难以覆盖的接触与受力信息。几条路线各有优势,也对应着不同的成本结构与技术门槛。厘清智能选择的是一条跨度更大的路:从自研数采设备切入,把真实世界中的操作经验转化为训练数据,再向物理训练、模型与评测延伸。这一占位,光轮智能是个对照系。光轮智能从仿真出发,将生成式 AI 与仿真技术结合,生产可用于机器人训练的合成数据。其创始人谢晨曾在英伟达、Cruise 和蔚来负责自动驾驶仿真。今年 5 月,蚂蚁集团领投其新一轮融资;6 月,公司宣布完成 10 亿元融资,用于数据与评测基础设施研发。据光轮智能披露,其人类视频数据累计交付超过 150 万小时,2026 年一季度新增订单达 5.5 亿元,优质场景的数据复售率最高达到 10 倍。投资人对其模式的概括是“真实数据校准、仿真数据放大”。厘清智能的出发点有所不同。它希望先通过自研的带力触觉数采设备,获取真实操作中的接触、受力与动作变化,再借助物理训练,将有限的真实经验扩展到更多环境和任务中。一个从仿真走向真实,一个从真实走向仿真,两条路线“殊途同归”,最终都要落到在机器人训练中,真实数据与合成数据究竟应该如何配比?两家公司的发展阶段也有明显差异。光轮已经披露规模化交付和经营数据,厘清智能成立仅半年,仍处于基础设施建设的早期阶段,尚未披露营收等经营数据。两者可以作为技术路线的对照,却不宜直接比较商业规模。行业已逐渐意识到,采集量并不能直接代表数据价值。时间戳错位、坐标尺度漂移、遮挡情况下缺失的力信息,都可能让采集到的原始数据无法直接进入训练流程。数据能否经过同步、质检、结构化处理,最终转化为可训练、可验证的经验,将成为比原始数据规模更重要的指标。这恰好是厘清智能希望建立的能力:用数据管线解决信息质量问题,用物理引擎弥合仿真与现实之间的差距,再通过真实部署验证训练效果。如果这套闭环能够跑通,前一次任务留下的数据、失败记录和评测标准,就有机会降低下一次任务的训练与交付成本。第一道关,是商业化的时间窗口。李一鸣给出的计划是,2026 年底前发布面向跨 B 端场景的世界模型,2028 年推动解决方案规模化。从技术验证到跨场景复用,再到规模化交付,中间仍隔着工程化与商业化的双重验证。资本可以在早期为技术路线买单,长期能否获得回报,仍要看客户是否愿意持续付费。第二道关,是如何守住中立性。厘清智能的股东中,既有智元机器人这样的本体厂商,也有灵心巧手这样的灵巧手企业。产业资本能带来场景与协同,但随着具身智能竞争加剧,部分股东未来可能发展出自己的数据采集和训练体系。厘清既要借助产业伙伴获得真实场景,又要让不同本体厂商和模型团队相信,它提供的数据与基础设施不会偏向某一家企业。这也解释了为什么厘清智能会吸引多类资本进入。对早期投资人而言,下注的不只是一家数据采集公司,也包括具身智能产业未来可能形成的公共技术层。但融资阵容只能说明资本对这一方向有兴趣,不能替代商业验证。因为理解一个物体,与真正拿起它,是两回事。模型需要知道物体在哪里,也需要知道接触之后发生了什么;需要学会一次动作,也需要从失败中调整下一次动作。要让这些经验跨任务、跨设备、跨场景复用,单靠某一款机器人或某一个模型,很难独立完成。中国拥有庞大的制造业体系,也正在积累越来越多真实的机器人应用场景。如果 Physical AI 的进步需要持续从现实世界获取经验,那么如何将这些分散的操作经验转化为可学习、可验证、可复用的数据,将成为产业必须补上的一环。半年完成三轮融资,资本已经为厘清智能的技术路线和产业想象力投下了筹码。接下来,它需要证明的,是这些筹码能否变成可复用的数据、可迁移的能力,以及一门能够持续运转的生意。中国过去四十年把"世界工厂"做到了极致;如果 Physical AI 的下一轮竞赛真的以真实世界经验为燃料,那么从"世界工厂"到"世界训练场"之间的那段路,需要有人来修,厘清智能要做那个修路的人。