本文使用 AI 工具生成。

大模型的发展容易让人形成一种直觉:只要继续增加数据和参数,机器人也会自然获得通用能力。问题在于,互联网数据记录了人类“看见什么、说了什么”,却很少记录机器人在特定本体、控制频率和接触条件下“应该施加什么动作”。真实机器人 Rollout 又伴随硬件占用、场景重置、遥操作、磨损和安全风险,无法像文本那样近乎零成本地复制。

因此,具身智能面对的不是简单的样本数量不足,而是有效监督密度不足:大量可获得数据没有动作,大量动作只适用于一种机器人;成功示教覆盖狭窄,接触与失败信息又经常没有被记录。与此同时,已经采集的数据还可能因为格式、压缩、同步和训练读取成本而无法被有效使用。

本文使用的会议证据来自公开标题与摘要;具体实验设置、指标定义和失败案例仍需回查论文全文。在原有 CoRL 2025 Oral 与 RSS 2026 整理之上,本文加入 ICRA 与 IROS 2025 的摘要级系统整理,并补入 ICRA 2026。前两届收录 3,589 篇正式 proceedings 论文并筛选 63 篇数据扩展工作;ICRA 2026 则从官方 PaperCept 程序的 2,951 条行中排除 131 条 Late Breaking Results,保留 2,820 条 peer-reviewed conference presentations,其中 2,639 条有官方关键词与摘要,并从 110 篇高召回短名单人工审计出 25 篇。详细笔记见 联合速览。本文不再逐篇复述摘要,而是回答一个更实用的问题:研究者正在把哪些廉价信息,通过什么接口和验证器,转换成哪些可执行的机器人监督?

ICRA 2026 更新:数据荒正在变成数据生命周期问题

ICRA 2026 的增量不只是更多数据集,而是把采集、转换、生成、验证和筛选接成闭环。数据入口上,COBALT 将手机与云端遥操作结合,摘要报告五天、九国采得 7,500 多条示教;FreeTacMan 则以可穿戴夹爪同步采集视觉、触觉和位姿,发布超过 300 万组配对观测与 1 万条轨迹。两者共同说明,数据荒首先可由采集接口、同步和质量控制缓解,而非只靠事后扩充训练集。

人类数据的角色也更明确地从“替代机器人动作”转成“提供可转换的先验”。EMMA 将人类全身移动操作与静态机器人数据共同训练,避开移动遥操作;Masquerade 将自然第一视角视频编辑为带目标机器人外观和末端轨迹的示教;Real2Gen 从单段人类示教转入仿真再生成训练数据。共同的不变量不再是人类关节,而是对象、任务进程、末端几何或可在仿真中验证的任务条件。

物理约束生成与 Real-to-Sim 因而承担了扩大可信邻域的工作。UltraDexGrasp 以抓取合成和规划生成 2,000 万帧数据,并报告纯合成训练的双臂抓取 Policy 能零样本迁移;Re^3Sim 将真实场景重建为可采专家示教的模拟环境;NavDP 把模拟中的特权安全监督变成跨 3,000 个场景的导航经验。这些方法不是让生成模型替代物理,而是把生成限制在可规划、可碰撞检查或可由真实场景锚定的范围内。

接触模态继续暴露 RGB 数据的盲区。ManipForce 用高频力/力矩和 RGB 人类示教训练 Policy,并在六项真实任务报告平均 83% 成功率;FARM 则把触觉条件的力直接纳入动作空间。新增模态的价值不在传感器数量,而在观测、接触力和控制命令是否仍描述同一物理事件。

最后,扩展后的数据需要被选择和配方化。SCIZOR 在状态–动作粒度剔除无进展和重复片段,作者报告可让模仿 Policy 与 VLA 用更少数据取得更高表现;人类活动 VLA 预训练 把无标注第一视角手部视频转为 100 万 episode 的训练数据;CRAFT 先压制并调节视觉–语言嵌入以优先利用力信号,再恢复完整多模态输入。数据荒由此转化为一个配方问题:每类数据在何种训练阶段、以何种接口和质量条件进入 Policy。

1. “缺数据”实际缺什么

把问题统称为 Data Scarcity 会掩盖六种性质不同的缺口。

  • 动作标签缺失:人类视频数量巨大,但没有机器人关节、末端位姿或力控制命令。观察到“杯子被拿起”不等于知道某台机械臂应该如何拿起它。
  • 分布覆盖不足:有限示教很难同时覆盖物体形状、初始位姿、背景、相机、任务阶段和外界扰动。Policy 在训练点附近有效,不意味着能处理这些因素的组合变化。
  • 本体对应缺失:同一任务在人手、平行夹爪、灵巧手和人形机器人上具有不同的可达空间与动作维度。直接拼接数据,常常只会让模型记住本体差异。
  • 接触监督缺失:RGB 能描述外观,却难以确定摩擦、法向力、剪切、材料和接触位置。对插接、工具使用和软体操作而言,这些信息才决定动作是否可执行。
  • 失败与反馈缺失:示教数据偏向成功轨迹,部署中的边界状态、危险接触和恢复动作反而稀少。模型因而学会“如何做对”,却没有学会“偏离后如何回来”。
  • 数据可用性缺失:多路视频、数值轨迹和文本即使已经采到,也可能因为存储、解码、时间同步、格式转换和检索开销而无法进入训练循环。

这也解释了为什么一个拥有许多小时视频的数据集仍可能很“穷”:如果数据集中在相似场景,没有可迁移的动作或物理信息,或者读取成本高到无法快速迭代,那么增加容量只会更精确地拟合原有支持集。更合理的度量不是原始小时数,而是每单位采集、存储和训练成本能够提供多少目标任务相关监督。

2. 先提高每次真实交互的产出

数据扩展不一定从生成模型开始。对许多实验室而言,最先应该优化的是每次真实交互的有效轨迹率,以及轨迹从采集到训练的全链路成本。

ICRA 的 Robo-DM 把数据管理本身视为机器人学习问题:相较 RLDS,其有损压缩最高节省 70 倍空间,顺序解码相较 LeRobot 最快 50 倍;真实抓取实验采用 75 倍压缩而下游精度没有下降。这说明“已经采到但无法高效存取”也是一种数据荒。压缩率并非越高越好,仍需把视觉质量、随机读取和下游任务作为联合指标。

采集接口决定操作者时间能转化成多少有效监督。dARt Vinci 用增强现实手部跟踪和高保真仿真离线采集第一视角手术动作,无需部署实体手术机器人,摘要报告数据吞吐平均提高 41%,数据体积缩小超过 400 倍;Human-Agent Joint Learning 让人类与在线辅助 Agent 共享控制,并由 Agent 逐渐接管重复部分;HACTS 通过双向实时关节同步让操作者按需介入并采集动作纠正。三者分别处理离线采集、共享控制和按需纠正,其边界分别是手部跟踪与仿真精度、辅助策略的早期稳定性,以及双向实时同步精度。

数据质量最好在采集时约束,而不是训练后再猜测。ARCap 通过增强现实和触觉警告提示碰撞与运动学不可行;FABCO 用正、逆动力学模型评估示教可行性,在采集时提示示教者修正动作,并在训练时降低不可行片段的权重。它们把“可执行性验证器”前移到数据入口,但验证器本身的模型误差也会成为新的数据偏差。

因此,真实数据经济学至少包含四个量:操作者时间、有效轨迹率、数据吞吐,以及失效分布覆盖。只比较遥操作设备的购买价格,往往低估了标定、重置、清洗和训练读取的长期成本。

3. 人类数据:寻找跨本体的不变量

人类视频是最自然的规模来源,但关键不是把人体关节逐帧复制给机器人,而是选择在人与机器人之间更稳定的中间变量。可以把常见监督排列成一条阶梯:语义程序最容易跨本体,物体状态和图像轨迹保留更多几何,任务空间动作更接近执行,而关节与力命令最精确也最依赖硬件。

VideoMimic 从普通视频联合重建人体运动和环境,再在仿真中训练场景条件的全身控制器。X-Sim 放弃直接重定向人手动作,把物体运动作为跨本体目标。两者共同说明,环境几何和物体状态通常比人的关节角更接近任务本质。

ICRA 的 EgoMimic 把第一视角人手视频与机器人示教协同训练,摘要指出增加一小时手部数据的收益显著高于增加一小时机器人数据。Motion Tracks 用短时二维图像轨迹统一人手与机器人末端动作,仅用数分钟人类视频和少量机器人示教,在四个真实任务上达到 86.5% 平均成功率。几何中间层降低了本体依赖,但仍不能表达长时接触和隐含力。

另一条路线是直接生成目标本体数据。RSS 2026 的 DexImit 从单目双手视频重建交互并合成机器人轨迹;IROS 的 RwoR 用一套配对的人手与 UMI 夹爪示教训练生成模型,将人手观测转换为夹爪观测,并恢复对应的 SE(3) 动作。它不要求后续每次采集都部署实体机器人,但仍依赖配对示教质量、时间同步、视觉对齐和人手到夹爪的动作映射工程。

纯视觉的上限仍是不可见物理量。Chain-of-Modality 在单个人类视频上逐步加入肌电和声音,以恢复计划以及力等控制参数;AirExo-2DexUMI 则通过外骨骼或受约束手持设备换取更可信的机器人动作。表示越抽象,跨本体性越好;越接近控制,越需要额外传感、标定和硬件约束。

4. 从少量种子扩展可信邻域

另一类方法保留少量可信种子,再围绕它合成可控变化。数量本身并非无关,问题在于新增样本是否仍位于一个可验证的任务分布内。

BiDemoSyn 从一个真实双臂示例中分离协调结构与物体相关调整,再生成数千条接触丰富示教。ICRA 的 DexMimicGen 从 60 条源示教生成 21K 条双臂灵巧示教,并部署到真实人形机器人任务。二者为受约束生成能够扩大可用示教提供了案例证据,但扩展上限取决于源示教是否包含可复用的协调结构,以及仿真接触是否覆盖真实失败模式。

几何与反事实增强需要明确什么可以变化、什么必须保持。RoCoDA 一方面改变任务无关的环境状态并保持 Policy 输出不变,另一方面对物体位姿施加 SE(3) 变换并同步调整动作;RSS 的 R2RGen 在共享三维空间中增强真实点云观测–动作对。这些结果来自论文各自评测的操作任务,对非刚体接触能否保持相同不变量仍需另行验证。

视觉扩展在动力学固定时同样有价值。IROS 的 RoboEngine 从单一场景示教生成任务相关背景,摘要报告在六个新场景中相较无增强基线提升超过 200%,但未披露该提升对应的具体指标及计算口径;ReBot 则用真实轨迹约束仿真回放和视频合成,作者报告 Franka 真实测试中 Octo 与 OpenVLA 的成功率分别增加 17% 与 20%,但摘要未说明这是百分点还是相对增幅。前者主要扩大外观邻域,后者同时锚定动作时序;两者都不能证明生成器已经学会新的接触动力学。

作为本文的方法论建议,生成数据宜配套与扩展类型相符的验证:几何增强检查投影与等变性,轨迹生成检查碰撞和接触,视频合成检查动作–观测同步,世界模型 Rollout 则用任务进度或真实回放误差校验。这里列出的验证方式并非上述论文共同证明的必要条件,而是用于约束外推风险的工程原则。

5. 仿真、数字孪生与世界模型:明确你在模拟什么

把所有合成环境都称为“仿真”会混淆四种不同目标:复制真实外观、逼近动力学、购买廉价交互,以及学习可预测的状态表示。它们的成功指标和误差来源并不相同。

视觉数字孪生主要缩小观测域差异。ICRA 的 SplatSim 使用 Gaussian Splatting 训练 RGB 操作 Policy,零样本真实平均成功率为 86.25%,而真实数据训练的平均成功率为 97.5%。该结果依赖场景重建质量;至少在这一实验设置下,视觉保真度没有自动弥合真实部署差异。DISCOVERSE 进一步把 3DGS 与 MuJoCo、多传感器并行模拟和 ROS 接口结合,但视觉 Gaussian 与物理几何仍必须同步。

动力学孪生需要回答“辨识出的参数能否跨动作迁移”。IROS 的 织物 Real-to-Sim 研究 在五类织物、两种模拟器上发现,准静态场景中更好的参数估计并不保证折叠、甩动和抖动等动态任务可靠。面向足式机器人,LoopSR 将部署后的真实轨迹编码到潜空间,预测并检索对应的模拟参数,再在重建的动力学数字孪生中继续训练 Policy。

仿真还可以启动真实学习。ClutterDexGrasp 在仿真中利用完整场景和安全信息训练 Teacher,再蒸馏到局部观测 Policy;RSS 的 Self-Improving Robot Policy with Compositional World Model 在想象空间中生成轨迹并更新 Policy。它们购买的是现实中昂贵或危险的状态访问权,而不是单纯购买图片。

负面结果同样决定方法边界。ICRA 的 SuFIA-BC 表明,即使建立逼真的手术数字孪生,现有行为克隆方法仍难以解决所评估的接触丰富任务。据此可作本文的方法论判断,而非将其视为该论文的直接结论:世界模型和仿真不能被假定为会创造训练支持集之外的可靠物理规律,它们可能同时放大数据及其中的盲区。

因此,应分别检查状态覆盖、动作可执行性、传感输出与隐藏状态的因果一致性,以及真实目标域的边际增益。在 IROS 的 Sim-and-Real Cotraining 所评估的非抓取、接触丰富平面推动任务中,物理域差异可能比视觉保真度更关键;这一比较不应直接外推到抓取或其他接触任务。

6. 接触与多模态:扩展缺失的物理变量

接触数据比 RGB 更稀缺,也更容易被硬件锁定。它的成本至少包括真实采集时间、传感器寿命、跨模态配对以及跨硬件表示校准。

ICRA 的 ForceMimic 用无机器人设备同步记录运动与力;剥西葫芦任务中,采集约需 5 分钟,而力反馈遥操作超过 13 分钟且难以完成,相较纯视觉模仿的成功率相对提高 54.5%。PolyTouch 则把相机式触觉、声学和周边视觉集成到耐用手指中,摘要报告寿命至少是商用触觉传感器的 20 倍。前者降低了该任务的采集负担,后者针对触觉传感器的耐用性瓶颈,但摘要没有量化寿命提升如何影响采集或维护成本。

跨硬件共享通常需要物理中间层。RSS 的 TactAlign 将人类穿戴设备与机器人触觉映射到共享潜空间;Cross-Sensor Touch Generation 在端到端保真翻译和深度中间表示之间权衡。IROS 的 TwinTac 则联合设计实体传感器和数字孪生,用同步有限元与真实输出学习模拟到该传感器响应的映射;摘要报告其模拟数据能够增强真实物体分类数据并提高准确率。其结果依赖该传感器及同步标定设置,摘要没有报告跨传感器或跨材料泛化。

多模态增强不能分别处理每个通道。AugInsert 在视觉–力觉插接中发现,分别对各模态做朴素增强不足以解决联合分布偏移,抓取位姿变化仍是主要困难。在其评估的视觉–力觉插接任务中,正确的问题不是“是否加入触觉”,而是新增视觉、力和动作是否描述同一个物理事件;这一结论能否推广到其他接触任务仍需单独验证。

共享物理语言可以是深度、接触位置、压力、剪切、声学响应或物体状态。其目标是在保留任务相关物理量的同时降低跨硬件对齐成本;它是否能把重新采集转化为较小规模的对齐与标定问题,仍需在具体传感器和任务上验证。

7. 数据选择与配方:分工,而不是拼接

当数据扩展到多本体、人类视频、仿真和 Web 数据后,问题会从“没有数据”转成“每种数据应该承担什么监督,以及何时加入训练”。

Data Retrieval with Importance Weights for Few-Shot Imitation Learning 使用目标分布与先验数据分布的密度比检索样本,使能补足目标分布且较稀有的数据获得更高权重。RSS 的 大行为模型数据协同训练研究 对 4,000 小时机器人与人类操作数据、5,000 万视觉语言样本和 89 个 Policy 进行消融,表明不同模态只有承担可验证功能时才会形成累积收益。

IROS 的 Sim-and-Real Cotraining 给出更直接的混合比例证据:模拟数据在真实数据稀缺时收益最大,继续增加后会逐渐饱和,而更多真实数据能够抬高性能上限。其结论来自平面推动,不能直接外推到所有任务,但不支持模拟数据可以无限替代真实数据的判断。

不同质量的数据也可以分工。LDA-1B 将人类与机器人轨迹分别用于动力学、Policy 和视觉预测;ICRA 的 示教模态研究 发现动觉示教最干净、下游效果最好,却因身体负担难以独立扩展,因此建议以少量高质量动觉数据锚定更易扩展、采集负担较低的遥操作数据。FuSe 则用语言作为视觉、触觉和声音的共享高层接口;语言接口可能丢失低层物理细节是本文的警惕,并非摘要已经验证的结论。

数据质量因此不是从“差”到“好”的标量,而是一个监督职责向量。没有精确动作的视频可以学习视觉动力学,失败轨迹可以学习奖励和安全边界,模拟数据负责扩大可控覆盖,少量真实示教负责校准可执行动作。配方设计应同时决定来源、比例、训练阶段和停止扩展的边际收益阈值。

8. 把失败变成下一轮分布

只扩充成功示教会让 Policy 在训练分布内更熟练,却不会自动获得恢复能力。完整闭环应覆盖采集前预防、采集后抢救、部署中纠正和主动发现四个阶段。

采集时,FABCO 用可行性反馈提示示教者修正动作,并在训练时降低不可行片段的权重。采集后,ICRA 的 SSDF 不丢弃整条失败示教,而是自监督评分并保留其中高质量片段,无需奖励或在线探索。训练与执行交互中,HACTS 允许操作者按需介入并记录动作纠正;摘要报告恢复能力和数据效率得到改善,但未说明介入触发策略,也未证明记录的样本只来自失效状态。

恢复还可以在示教流形附近进行。RSS 的 SID 用两条示教学习物体中心运动场,在远离示教分布时先把系统拉回可执行区域;Latent Space Reinforcement Learning 在 Diffusion Policy 的潜噪声空间搜索,减少在线探索偏离已有技能的风险。

失败也可以被主动制造。Geometric Red-Teaming 搜索结构有效但能使 Policy 崩溃的物体形变;RSS 的 OopsieVerse 把机械、热和流体损伤纳入仿真;Robometer 则从超过百万条跨本体次优与失败轨迹中学习通用奖励。

评测是闭环的入口。RoboArena 用多机构真实任务的匿名成对比较暴露覆盖缺口,PolaRiS 用真实场景重建和超过九万次仿真 Rollout 估计真实风格环境中的 Policy 排序。评测本身不会补齐数据,但它决定下一批数据应该在哪里产生。

9. 一套更实际的数据闭环

综合这些工作,一个可落地的具身数据流程可以写成“缺口、来源、接口、验证器、回收”五个连续决策。

  1. 定位缺口:先判断瓶颈是动作、覆盖、本体、接触、失败,还是数据吞吐。不同缺口不能用同一个“增加小时数”指标处理。
  2. 获得可信种子:种子可以来自少量真实示教,也可以来自经过校准的简单仿真;无论来源如何,动作、时间同步、相机标定和任务结果必须可验证。
  3. 选择监督接口:人类视频优先抽取物体状态、图像轨迹或任务程序;跨本体数据使用任务空间动作或规范表示;接触任务保留力、触觉或可恢复的物理代理。
  4. 围绕不变量扩展:渲染扩大外观,三维变换扩大空间,仿真只在经过目标动作验证的参数与任务范围内扩大动力学和交互,世界模型扩大想象 Rollout。每种扩展都要声明保持了什么不变量,并记录尚未覆盖的状态。
  5. 配置验证器:视觉数据检查遮挡与动作同步,几何数据检查可达性和碰撞,接触数据检查力学一致性,世界模型检查进度、可逆性和真实回放误差。
  6. 设计数据配方:让人类视频提供语义与动力学先验,模拟数据扩大覆盖,机器人示教校准可执行动作,失败与在线纠正学习边界,并依据真实目标域的边际收益决定是否继续扩展各类数据。
  7. 部署并主动找错:记录分布外状态、操作者接管、恢复动作、损伤和任务结果,保留足够上下文以便后续检索或重放。
  8. 用真实评测验收:检查新增数据是否提高未见场景成功率、失败恢复率和跨本体迁移,而不是只提高固定基准平均值。

对资源有限的实验室,可以联合监控五个简单账本:每条有效轨迹的真实成本,新增数据带来的支持集覆盖,几何与物理验证通过率,目标域真实增益,以及失败回收后的恢复率。不同任务和阶段应在这些指标之间权衡,不要求五项同时改善;关键是明确当前瓶颈,并验证投入是否改善了与该瓶颈对应的目标指标。

这套流程的目标不是构造一个无限增长的静态仓库,而是形成持续发现缺口、选择来源、转换监督、验证可执行性并回收失败的数据引擎。

结语

CoRL 2025、ICRA 2025、IROS 2025、RSS 2026 与 ICRA 2026 的共同信号不是“规模已经不重要”,而是规模、采集系统和监督设计正在共同演化。ICRA 2026 特别表明:若采集接口、人类数据转换、物理约束生成、接触记录和样本筛选彼此脱节,任何单一数据源都难以形成可复用的训练支持;反之,数据生命周期可以成为可优化的系统。受约束的大规模生成仍然有效,低成本 VR、外骨骼和众包仍然重要;但几何与物理约束决定可执行性,数据配方决定目标相关性,真实评测决定模拟扩展何时饱和。

最有价值的进展往往在重新定义“什么可以算作监督”:物体运动可以替代人体关节,单次示教可以定义受约束的局部分布,真实轨迹可以锚定合成视频,数字孪生可以补足缺失传感器,失败可以成为奖励和安全边界。真正可扩展的机器人学习系统,需要的不是一份静态大数据集,而是一条能持续判断缺什么、为什么缺、下一条数据应从哪里来的闭环。

来源与范围

References