Tech & Art & Kawaii blog, by @rubatotree
具身智能的数据荒:从示教扩展到闭环数据引擎
本文使用 AI 工具生成。 大模型的发展容易让人形成一种直觉:只要继续增加数据和参数,机器人也会自然获得通用能力。问题在于,互联网数据记录了人类“看见什么、说了什么”,却很少记录机器人在特定本体、控制频率和接触条件下“应该施加什么动作”。真实机器人 Rollout 又伴随硬件占用、场景重置、遥操作、磨损和安全风险,无法像文本那样近乎零成本地复制。 因此,具身智能面对的不是简单的样本数量不足,而是有效监督密度不足:大量可获得数据没有动作,大量动作只适用于一种机器人;成功示教覆盖狭窄,接触与失败信息又经常没有被记录。与此同时,已经采集的数据还可能因为格式、压缩、同步和训练读取成本而无法被有效使用。 本文使用的会议证据来自公开标题与摘要;具体实验设置、指标定义和失败案例仍需回查论文全文。在原有 CoRL 2025 Oral 与 RSS 2026 整理之上,本文加入 ICRA 与 IROS 2025 的摘要级系统整理,并补入 ICRA 2026。前两届收录 3,589 篇正式 proceedings 论文并筛选 63 篇数据扩展工作;ICRA 2026 则从官方 PaperCept 程序的 2,951 条行中排除 131 条 Late Breaking Results,保留 2,820 条 peer-reviewed conference presentations,其中 2,639 条有官方关键词与摘要,并从 110 篇高召回短名单人工审计出 25 篇。详细笔记见 联合速览。本文不再逐篇复述摘要,而是回答一个更实用的问题:研究者正在把哪些廉价信息,通过什么接口和验证器,转换成哪些可执行的机器人监督? ICRA 2026 更新:数据荒正在变成数据生命周期问题 ICRA 2026 的增量不只是更多数据集,而是把采集、转换、生成、验证和筛选接成闭环。数据入口上,COBALT 将手机与云端遥操作结合,摘要报告五天、九国采得 7,500 多条示教;FreeTacMan 则以可穿戴夹爪同步采集视觉、触觉和位姿,发布超过 300 万组配对观测与 1 万条轨迹。两者共同说明,数据荒首先可由采集接口、同步和质量控制缓解,而非只靠事后扩充训练集。 ...
ICRA、IROS 2025 与 ICRA 2026 数据扩展论文速览
本文联合整理 ICRA 2025、IROS 2025 与 ICRA 2026 的数据扩展工作。ICRA 2025 Proceedings 收录 1,604 篇论文并补全 1,602 篇摘要,自动召回 279 篇候选并初审 32 篇;IROS 2025 Proceedings 收录 1,985 篇论文并补全 1,983 篇摘要,从 309 篇候选初审 31 篇。ICRA 2026 则依据官方 PaperCept 程序的 ICRA 2026 peer-reviewed conference presentations:2,951 条程序行中排除 131 条非同行评议、非出版物的 Late Breaking Results,保留 2,820 条展示(2,604 个 interactive、216 个 oral);其中 2,639 条提供官方关键词与摘要。复审把官方摘要纳入生命周期匹配、将 5 分项纳入人工复核带,当前快照自动召回 451 篇候选并人工审计 35 篇。随后以同一“数据–下游 Policy/控制”门槛复核渲染与光照方向,额外补入 ICRA 2025 的 2 篇与 IROS 2025 的 3 篇;正文当前分别覆盖 34、34、35 篇。三部分合计审计 6,409 条正式论文或同行评议展示,在同一主题框架下比较机器人数据如何被采集、转换、合成、筛选和复用。 ...
RSS 2026 论文速览
本文使用 AI 工具整理 Robotics: Science and Systems 2026 的全部接收论文。官网在 2026 年 8 月 4 日实际列出 210 篇论文,分布在 21 个 Session;本文数量以官网实时页面为准。 Session 导读 RSS 2026 的 Session 划分比按单篇论文罗列更能反映研究热点: Manipulation 1–3:27 篇,覆盖双臂与灵巧操作、触觉闭环、接触丰富控制、数据合成和通用 Manipulation Policy。 Imitation Learning 1–3:28 篇,是论文数量最多的方向,集中讨论示教扩展、跨本体迁移、Diffusion 或 Flow Policy 与数据选择。 Navigation 1–2:18 篇,涵盖开放词汇导航、动态避障、长时序 VLA、地形可通行性与无人机导航。 Humanoids:13 篇,从高动态全身控制、跑酷和滑板扩展到通用人形 Foundation Model 与长时序 Loco-Manipulation。 Multi-robot Systems:13 篇,研究分布式优化、多智能体协作、时序逻辑、安全导航和多机器人规划。 Perception and Estimation:13 篇,关注机器人场景中的三维感知、状态估计、多模态融合与可部署感知系统。 Planning:13 篇,覆盖采样规划、最优控制、学习增强规划和带安全约束的决策。 Control & Dynamics:13 篇,重点是接触、柔顺性、复杂动力学与学习控制的稳定性。 World Models & Memory:9 篇,探索记忆检索、因果世界模型、仿真预训练和交互式世界模拟器。 Localization & Mapping:9 篇,包含神经地图、Radar 或 LiDAR 里程计、SLAM 不确定性与前馈三维重建。 Datasets and Benchmarks:9 篇,处理机器人数据集、评测协议和真实到仿真的基准构建。 HRI:9 篇,聚焦人机协作、意图理解、交互安全与社会性机器人。 Modeling and Optimization:9 篇,研究可微建模、系统辨识、几何优化与机器人设计中的数值方法。 RL:9 篇,关注真实机器人强化学习、离线到在线适应、奖励学习和样本效率。 Robot & Sensor Design:9 篇,覆盖新型机器人机构、软体系统、触觉与其他传感器设计。 VLA Models:9 篇,集中讨论视觉–语言–动作模型的预训练、推理、泛化与高效部署。 ...
CoRL 2025 Oral 论文速览
本文使用 AI 工具整理 CoRL 2025 Oral 的 42 篇论文。为了避免把列表写成摘要搬运,下面按研究问题重新分为六组,并分别概括方法、主要结果与值得留意的边界。 需要说明的是,这是一份基于 OpenReview 标题与摘要的“地图式速览”,适合用来筛选待读论文,不等价于逐篇精读或实验复现。文中的“提升”“达到”等结果均指作者报告的结果。 总览:Oral 在解决什么问题 这 42 篇论文呈现出一条很清楚的主线:机器人学习的瓶颈正在从“能否学会一个任务”转向“能否低成本地扩展到新任务、新环境和新本体”。对应地,工作重点也从单纯设计更大的 Policy,转向数据生产、跨本体迁移、推理效率、真实世界评测与失败恢复等完整系统问题。 其中有四个趋势尤其明显。第一,真实机器人示教不再是唯一的数据来源:人类视频、手机扫描、生成模型、仿真与低成本外骨骼都在被转化为训练数据。第二,Diffusion Policy 与 VLA 已成为基础组件,研究开始优化其执行速度、在线适应与推理机制。第三,触觉、音频、力与 LiDAR 等模态被纳入闭环控制,而不只是作为附加观测。第四,研究者开始正面处理评测偏差、分布外失败和开放世界泛化,说明领域正在从 Demo 走向可部署系统。 1. 通用策略、推理、评测与安全 这一组关注的不是某项具体技能,而是通用机器人策略如何获得开放世界泛化能力,以及我们如何可信地评价和保护这些策略。 1. : a Vision-Language-Action Model with Open-World Generalization [OpenReview] 在 的基础上联合训练多机器人数据、Web 数据、高层语义预测与低层动作。训练样本混合图像、语言、目标检测、子任务预测和动作,使语义知识能够迁移到控制中。作者展示了模型在全新住宅内完成清理厨房、卧室等长时序灵巧任务的能力。它的重要性不只在模型规模,而在于说明异构数据与中间语义任务可以共同支撑端到端 VLA 的开放世界泛化;代价则是系统对数据覆盖、模型规模和推理基础设施的依赖很强。 ...
北京大学 2023-2025 推免机试题笔记
北京大学计算机学院推免夏令营机考为 ACM 赛制,时长 2 小时,每场共 8 题,题目可能是中文或英文,部分题目(主要是英文题)选自 OJ 中已有的题目。题目不按难度排序,整体难度在 CF Div4(大部分题)到 Div2 D(1~2题) 之间,能切 Div2 D 的同学可以放心考试。据说实际不爆零就能通过。 有意向报考北大计算机学院研究生的同学可以提前准备刷题。 题源整理 2025 比赛(无数据) A. Lab 杯 B. All in All C. 表达式求值 (无数据) D. 忍者道具 (无数据) E. 神奇的数列 (无数据) F. 拼装模型 G. Genealogical Tree H. 怀表问题 (无数据) ...
大数据算法 课程总结笔记 II(作业及个人答案)
作业一 作业一 第1题 解答 这里的趋近符号似乎含义没有标识清楚,这里默认为是当 趋近于无穷大时的极限关系。 ...
大数据算法 课程总结笔记 I(章节笔记)
这是我在 2026 年春季于中科大学习丁虎老师的《大数据算法》课程时整理的期末考试复习笔记。非常喜欢的好课。只是可惜讲义编写得比较潦草。这里的笔记尽可能指出讲义中各种概念的几何意义与机器学习意义,并尝试找出各种定义、定理的动机。 0 近似算法 本课程中的算法大多是用近似算法解决精确求解较为困难的问题,因此要定义一些概念对算法的误差进行衡量。 一方面,算法的求解结果可能是有误差的。我们定义 近似算法,其中 为近似比: ...
图形已死,all in AI具身 I: RoboSplat 论文阅读与杂谈
图 1 玩音乐的最终归宿是转行具身智能。[1] 这周组会上导师提到现在做 Rendering 已经很难有价值和影响力了,也很难找到好的课题,应该 all in 具身智能。感觉自己从一个转型阵痛期的组跳进了另一个转型阵痛期的组。不过转型是正确的,具身方向的确好发有影响力的论文,就业前景也比传统图形学好。虽然私心比较喜欢简洁优雅但没用的图形学,但确实应该现实一点。我们该思考一下怎样把已有的图形学、渲染经验搬到具身智能的应用上。 组里同学分享的 RoboSplat [2] 一文确实相当契合 CG for embodied 的愿景,因此我们从这篇论文开始了解我们能够做什么。 论文概要 本文的目标是通过输入场景的多视角 RGB 图片和单次示教样本(Expert Demonstration,人工操作机械臂完成一次任务,得到每帧的机械臂状态数据和单监督视角 RGB 图像序列)训练 VLA 模型泛化完成不同干扰场景下的同一任务。本文试图解决的干扰场景分为物体位姿移动(Object Pose)、监督相机移动(Camera View)、光照条件改变(Lighting)、物体种类改变(Object Type)、周边环境改变(Appearance)、机械臂外观改变(Cross Embodiment)六种。 图 2 论文 teaser,展示了 RoboSplat 的训练过程。 本文做到泛化的具体方法则是做数据增强,从单次示教样本中根据这几种干扰情况生成上千条增强样本 (augmented demonstrations)。以往生成增强样本的思路是直接在 2D 图像空间做生成式编辑,而本文考虑将多视角图片训练成 3DGS 场景(并在语义上分离场景、物体、机械臂,给机械臂绑骨),去在 3DGS 场景中做编辑模拟这些干扰,再合成回样本图像序列。这样做的好处是保证了图像之间场景的一致性,且不会有抖动等情况出现,因此能准确指导 VLA 模型学习到正确的操作策略。 ...
SIGGRAPH 2026 论文笔记 III: Monte Carlo PDE & 几何
1. Monte Carlo PDE Probe-based Walk on Spheres for Efficient Path Reusing [Project] 我自己的文章。 利用路径信息重用高效优化 Walk on Spheres 系列算法。 考虑到 Walk on Spheres 的采样过程,每一步都要在球面上均匀采样一个点作为该点解值的一个无偏估计。由 Off-center 形式的平均值公式可以得到实际上在球内的偏心点按 Poisson Kernel 分布在球面上采样一个点得到的结果也是解值的无偏估计。因此 WoS 均匀采样得到的解值可以为球内每个点所重用,在算法上就是得到一条完整路径后将求解值 Splat 回路径上的每个球内。这个算法被我们称为 Naive Path Reuse,不清楚现在 sig 上那篇 Talking to Neighbors 有没有扩展成这样的形式。 图 1 我们的 Naive Path Reuse 算法 然后考虑到这样 Splat 的开销过于大(球内每个点都需要查询并访存一次),正好 25 年 11 月又出来了 Harmonic Caching 的文章,发现后者正好可以将 Splat 的任务转化为求解几个 Fourier 系数的任务。因此和 HC 类似地在求解域预放置一些探针球,游走时取一个探针球做 Poisson Kernel 采样找到边界,若不存在探针球就 Fallback 到传统的 WoSt 算法,可以验证这个行为仍然是满足布朗运动的。找到 Dirichlet 边界后就将求解到的结果送回探针球中贡献 Fourier 系数。然后就非常快了。 ...
SIGGRAPH 2026 论文笔记 II: Rendering
1. 材质,外观,可微渲染 Fiber-level Woven Fabric Capture from a Single Microscopic Image [1] 另一位助教 @JerryShen 的文章之一。这篇没有上 Sig26,只是录进了 ToG,但也放在这里。 从单张显微图像通过可微渲染重建织物的纤维级几何和材质。 对于几何建模了基本可微的五层结构: 编织模式 Pattern:平纹、斜纹等纹理模式,直接预设好,用预训练的 CNN 分类; 中心线层 Yarn Centerline:每根纤维从侧面看高度关于路径长度的函数,用抛物线和圆混合; 纤维截面层 Cross-sectional Fiber Distribution:在中心线周围生成 根纤维,纤维的螺旋扭转 、偏移 、周期性挤压变形等都是可微参数; 随机噪声层 Randomized Variation:用柏林噪声和白噪声让纤维的半径和纵向产生变化、噪声种子本身不可微但强度可微。 飘散纤维层 Flyaway Model:额外手动添加飘散出来的断线等纤维(定义有毛发 Hair 和环路 Loop 两种),模拟现实材质情况。这一层没法可微优化出来。 ...