具身智能的数据荒:从示教扩展到闭环数据引擎

本文使用 AI 工具生成。 大模型的发展容易让人形成一种直觉:只要继续增加数据和参数,机器人也会自然获得通用能力。问题在于,互联网数据记录了人类“看见什么、说了什么”,却很少记录机器人在特定本体、控制频率和接触条件下“应该施加什么动作”。真实机器人 Rollout 又伴随硬件占用、场景重置、遥操作、磨损和安全风险,无法像文本那样近乎零成本地复制。 因此,具身智能面对的不是简单的样本数量不足,而是有效监督密度不足:大量可获得数据没有动作,大量动作只适用于一种机器人;成功示教覆盖狭窄,接触与失败信息又经常没有被记录。与此同时,已经采集的数据还可能因为格式、压缩、同步和训练读取成本而无法被有效使用。 本文使用的会议证据来自公开标题与摘要;具体实验设置、指标定义和失败案例仍需回查论文全文。在原有 CoRL 2025 Oral 与 RSS 2026 整理之上,本文加入 ICRA 与 IROS 2025 的摘要级系统整理,并补入 ICRA 2026。前两届收录 3,589 篇正式 proceedings 论文并筛选 63 篇数据扩展工作;ICRA 2026 则从官方 PaperCept 程序的 2,951 条行中排除 131 条 Late Breaking Results,保留 2,820 条 peer-reviewed conference presentations,其中 2,639 条有官方关键词与摘要,并从 110 篇高召回短名单人工审计出 25 篇。详细笔记见 联合速览。本文不再逐篇复述摘要,而是回答一个更实用的问题:研究者正在把哪些廉价信息,通过什么接口和验证器,转换成哪些可执行的机器人监督? ICRA 2026 更新:数据荒正在变成数据生命周期问题 ICRA 2026 的增量不只是更多数据集,而是把采集、转换、生成、验证和筛选接成闭环。数据入口上,COBALT 将手机与云端遥操作结合,摘要报告五天、九国采得 7,500 多条示教;FreeTacMan 则以可穿戴夹爪同步采集视觉、触觉和位姿,发布超过 300 万组配对观测与 1 万条轨迹。两者共同说明,数据荒首先可由采集接口、同步和质量控制缓解,而非只靠事后扩充训练集。 ...

August 5, 2026 · 3 min

ICRA、IROS 2025 与 ICRA 2026 数据扩展论文速览

本文联合整理 ICRA 2025、IROS 2025 与 ICRA 2026 的数据扩展工作。ICRA 2025 Proceedings 收录 1,604 篇论文并补全 1,602 篇摘要,自动召回 279 篇候选并初审 32 篇;IROS 2025 Proceedings 收录 1,985 篇论文并补全 1,983 篇摘要,从 309 篇候选初审 31 篇。ICRA 2026 则依据官方 PaperCept 程序的 ICRA 2026 peer-reviewed conference presentations:2,951 条程序行中排除 131 条非同行评议、非出版物的 Late Breaking Results,保留 2,820 条展示(2,604 个 interactive、216 个 oral);其中 2,639 条提供官方关键词与摘要。复审把官方摘要纳入生命周期匹配、将 5 分项纳入人工复核带,当前快照自动召回 451 篇候选并人工审计 35 篇。随后以同一“数据–下游 Policy/控制”门槛复核渲染与光照方向,额外补入 ICRA 2025 的 2 篇与 IROS 2025 的 3 篇;正文当前分别覆盖 34、34、35 篇。三部分合计审计 6,409 条正式论文或同行评议展示,在同一主题框架下比较机器人数据如何被采集、转换、合成、筛选和复用。 ...

August 4, 2026 · 18 min

RSS 2026 论文速览

本文使用 AI 工具整理 Robotics: Science and Systems 2026 的全部接收论文。官网在 2026 年 8 月 4 日实际列出 210 篇论文,分布在 21 个 Session;本文数量以官网实时页面为准。 Session 导读 RSS 2026 的 Session 划分比按单篇论文罗列更能反映研究热点: Manipulation 1–3:27 篇,覆盖双臂与灵巧操作、触觉闭环、接触丰富控制、数据合成和通用 Manipulation Policy。 Imitation Learning 1–3:28 篇,是论文数量最多的方向,集中讨论示教扩展、跨本体迁移、Diffusion 或 Flow Policy 与数据选择。 Navigation 1–2:18 篇,涵盖开放词汇导航、动态避障、长时序 VLA、地形可通行性与无人机导航。 Humanoids:13 篇,从高动态全身控制、跑酷和滑板扩展到通用人形 Foundation Model 与长时序 Loco-Manipulation。 Multi-robot Systems:13 篇,研究分布式优化、多智能体协作、时序逻辑、安全导航和多机器人规划。 Perception and Estimation:13 篇,关注机器人场景中的三维感知、状态估计、多模态融合与可部署感知系统。 Planning:13 篇,覆盖采样规划、最优控制、学习增强规划和带安全约束的决策。 Control & Dynamics:13 篇,重点是接触、柔顺性、复杂动力学与学习控制的稳定性。 World Models & Memory:9 篇,探索记忆检索、因果世界模型、仿真预训练和交互式世界模拟器。 Localization & Mapping:9 篇,包含神经地图、Radar 或 LiDAR 里程计、SLAM 不确定性与前馈三维重建。 Datasets and Benchmarks:9 篇,处理机器人数据集、评测协议和真实到仿真的基准构建。 HRI:9 篇,聚焦人机协作、意图理解、交互安全与社会性机器人。 Modeling and Optimization:9 篇,研究可微建模、系统辨识、几何优化与机器人设计中的数值方法。 RL:9 篇,关注真实机器人强化学习、离线到在线适应、奖励学习和样本效率。 Robot & Sensor Design:9 篇,覆盖新型机器人机构、软体系统、触觉与其他传感器设计。 VLA Models:9 篇,集中讨论视觉–语言–动作模型的预训练、推理、泛化与高效部署。 ...

August 4, 2026 · 34 min

CoRL 2025 Oral 论文速览

本文使用 AI 工具整理 CoRL 2025 Oral 的 42 篇论文。为了避免把列表写成摘要搬运,下面按研究问题重新分为六组,并分别概括方法、主要结果与值得留意的边界。 需要说明的是,这是一份基于 OpenReview 标题与摘要的“地图式速览”,适合用来筛选待读论文,不等价于逐篇精读或实验复现。文中的“提升”“达到”等结果均指作者报告的结果。 总览:Oral 在解决什么问题 这 42 篇论文呈现出一条很清楚的主线:机器人学习的瓶颈正在从“能否学会一个任务”转向“能否低成本地扩展到新任务、新环境和新本体”。对应地,工作重点也从单纯设计更大的 Policy,转向数据生产、跨本体迁移、推理效率、真实世界评测与失败恢复等完整系统问题。 其中有四个趋势尤其明显。第一,真实机器人示教不再是唯一的数据来源:人类视频、手机扫描、生成模型、仿真与低成本外骨骼都在被转化为训练数据。第二,Diffusion Policy 与 VLA 已成为基础组件,研究开始优化其执行速度、在线适应与推理机制。第三,触觉、音频、力与 LiDAR 等模态被纳入闭环控制,而不只是作为附加观测。第四,研究者开始正面处理评测偏差、分布外失败和开放世界泛化,说明领域正在从 Demo 走向可部署系统。 1. 通用策略、推理、评测与安全 这一组关注的不是某项具体技能,而是通用机器人策略如何获得开放世界泛化能力,以及我们如何可信地评价和保护这些策略。 1. : a Vision-Language-Action Model with Open-World Generalization [OpenReview] 在 的基础上联合训练多机器人数据、Web 数据、高层语义预测与低层动作。训练样本混合图像、语言、目标检测、子任务预测和动作,使语义知识能够迁移到控制中。作者展示了模型在全新住宅内完成清理厨房、卧室等长时序灵巧任务的能力。它的重要性不只在模型规模,而在于说明异构数据与中间语义任务可以共同支撑端到端 VLA 的开放世界泛化;代价则是系统对数据覆盖、模型规模和推理基础设施的依赖很强。 ...

August 3, 2026 · 7 min

图形已死,all in AI具身 I: RoboSplat 论文阅读与杂谈

图 1 玩音乐的最终归宿是转行具身智能。[1] 这周组会上导师提到现在做 Rendering 已经很难有价值和影响力了,也很难找到好的课题,应该 all in 具身智能。感觉自己从一个转型阵痛期的组跳进了另一个转型阵痛期的组。不过转型是正确的,具身方向的确好发有影响力的论文,就业前景也比传统图形学好。虽然私心比较喜欢简洁优雅但没用的图形学,但确实应该现实一点。我们该思考一下怎样把已有的图形学、渲染经验搬到具身智能的应用上。 组里同学分享的 RoboSplat [2] 一文确实相当契合 CG for embodied 的愿景,因此我们从这篇论文开始了解我们能够做什么。 论文概要 本文的目标是通过输入场景的多视角 RGB 图片和单次示教样本(Expert Demonstration,人工操作机械臂完成一次任务,得到每帧的机械臂状态数据和单监督视角 RGB 图像序列)训练 VLA 模型泛化完成不同干扰场景下的同一任务。本文试图解决的干扰场景分为物体位姿移动(Object Pose)、监督相机移动(Camera View)、光照条件改变(Lighting)、物体种类改变(Object Type)、周边环境改变(Appearance)、机械臂外观改变(Cross Embodiment)六种。 图 2 论文 teaser,展示了 RoboSplat 的训练过程。 本文做到泛化的具体方法则是做数据增强,从单次示教样本中根据这几种干扰情况生成上千条增强样本 (augmented demonstrations)。以往生成增强样本的思路是直接在 2D 图像空间做生成式编辑,而本文考虑将多视角图片训练成 3DGS 场景(并在语义上分离场景、物体、机械臂,给机械臂绑骨),去在 3DGS 场景中做编辑模拟这些干扰,再合成回样本图像序列。这样做的好处是保证了图像之间场景的一致性,且不会有抖动等情况出现,因此能准确指导 VLA 模型学习到正确的操作策略。 ...

June 4, 2026 · 2 min