<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>论文调研 on Umbrella Coffee</title><link>https://rubatotree.github.io/blog/tags/%E8%AE%BA%E6%96%87%E8%B0%83%E7%A0%94/</link><description>Recent content in 论文调研 on Umbrella Coffee</description><image><title>Umbrella Coffee</title><url>https://rubatotree.github.io/blog/images/og-default.png</url><link>https://rubatotree.github.io/blog/images/og-default.png</link></image><generator>Hugo</generator><language>en-us</language><lastBuildDate>Wed, 05 Aug 2026 00:00:00 +0800</lastBuildDate><atom:link href="https://rubatotree.github.io/blog/tags/%E8%AE%BA%E6%96%87%E8%B0%83%E7%A0%94/index.xml" rel="self" type="application/rss+xml"/><item><title>具身智能的数据荒：从示教扩展到闭环数据引擎</title><link>https://rubatotree.github.io/blog/posts/embodied-data-scarcity/</link><pubDate>Wed, 05 Aug 2026 00:00:00 +0800</pubDate><guid>https://rubatotree.github.io/blog/posts/embodied-data-scarcity/</guid><description>&lt;p&gt;本文使用 AI 工具生成。&lt;/p&gt;
&lt;p&gt;大模型的发展容易让人形成一种直觉：只要继续增加数据和参数，机器人也会自然获得通用能力。问题在于，互联网数据记录了人类“看见什么、说了什么”，却很少记录机器人在特定本体、控制频率和接触条件下“应该施加什么动作”。真实机器人 Rollout 又伴随硬件占用、场景重置、遥操作、磨损和安全风险，无法像文本那样近乎零成本地复制。&lt;/p&gt;
&lt;p&gt;因此，具身智能面对的不是简单的样本数量不足，而是&lt;strong&gt;有效监督密度不足&lt;/strong&gt;：大量可获得数据没有动作，大量动作只适用于一种机器人；成功示教覆盖狭窄，接触与失败信息又经常没有被记录。与此同时，已经采集的数据还可能因为格式、压缩、同步和训练读取成本而无法被有效使用。&lt;/p&gt;
&lt;p&gt;本文使用的会议证据来自公开标题与摘要；具体实验设置、指标定义和失败案例仍需回查论文全文。在原有 CoRL 2025 Oral 与 RSS 2026 整理之上，本文加入 ICRA 与 IROS 2025 的摘要级系统整理，并补入 ICRA 2026。前两届收录 3,589 篇正式 proceedings 论文并筛选 63 篇数据扩展工作；ICRA 2026 则从官方 PaperCept 程序的 2,951 条行中排除 131 条 Late Breaking Results，保留 2,820 条 &lt;strong&gt;peer-reviewed conference presentations&lt;/strong&gt;，其中 2,639 条有官方关键词与摘要，并从 110 篇高召回短名单人工审计出 25 篇。详细笔记见 &lt;a href="../icra2025-data-expansion-paper-notes/"&gt;&lt;span style="color: #c24bbc;"&gt;&lt;span style="text-decoration: underline"&gt;联合速览&lt;/span&gt;&lt;/span&gt;&lt;/a&gt;。本文不再逐篇复述摘要，而是回答一个更实用的问题：研究者正在把哪些廉价信息，通过什么接口和验证器，转换成哪些可执行的机器人监督？&lt;/p&gt;
&lt;h2 id="loc-1"&gt;ICRA 2026 更新：数据荒正在变成数据生命周期问题&lt;/h2&gt;
&lt;p&gt;ICRA 2026 的增量不只是更多数据集，而是把采集、转换、生成、验证和筛选接成闭环。数据入口上，&lt;a href="https://ras.papercept.net/conferences/conferences/ICRA26/program/ICRA26_ContentListWeb_5.html#Ab3809" target="_blank" rel="noopener noreferrer"&gt;&lt;span style="color: #59a4ff;"&gt;&lt;span style="text-decoration: underline"&gt;COBALT&lt;/span&gt;&lt;/span&gt;&lt;/a&gt; 将手机与云端遥操作结合，摘要报告五天、九国采得 7,500 多条示教；&lt;a href="https://ras.papercept.net/conferences/conferences/ICRA26/program/ICRA26_ContentListWeb_3.html#Ab2650" target="_blank" rel="noopener noreferrer"&gt;&lt;span style="color: #59a4ff;"&gt;&lt;span style="text-decoration: underline"&gt;FreeTacMan&lt;/span&gt;&lt;/span&gt;&lt;/a&gt; 则以可穿戴夹爪同步采集视觉、触觉和位姿，发布超过 300 万组配对观测与 1 万条轨迹。两者共同说明，数据荒首先可由采集接口、同步和质量控制缓解，而非只靠事后扩充训练集。&lt;/p&gt;</description></item></channel></rss>