欢迎来到雨伞咖啡店!☕☂️

Tech & Art & Kawaii blog, by @rubatotree

MiracleAug: 用 GPT-6 Astra 点燃具身数据增强的核弹吧

图 1 你要用 GPT-6 Astra 毁了我们整个行业吗。[1] 本周我尝试完成了一个名叫 MiracleAug [2] 的项目,用 GPT-6 Astra + Blender 代替过去我们具身数据增强管线中的几乎所有环节。 周一下班后,由于 GPT-Plus 在周一晚上就重置了,而我还有 70% 的 Plus 额度,看到社区上巨大的讨论,我计划试试 GPT-6 Astra 的 3D 建模能力。我首先给 GPT-5.6 Sol 发了一段我曾经尝试过的“请给我一段用于生成梦幻可爱风格粉色女生房间造景3D三渲二场景的提示词,我稍后会将提示词交给Astra模型进行Blender 3D建模。”提示词,让它扩写这段提示词,并将扩写后的提示词发给了 GPT-6 Astra。一个小时后,5小时额度见底了,这是它交付给我的结果: 图 2 场景完成度意外的非常高非常漂亮。三渲二的质感也很好。 于是我把我周日周报上画的 pipeline 图改了一下,本意是制作一张 meme 图。 ...

September 10, 2026 · 1 min

“结构感知的 Real2Sim 重建” 工作梳理

将现实物体扫描并整理成游戏引擎/具身引擎支持的、可参与交互及编辑的数字模型资产,一直以来是计算机图形学研究的重要方向。过去的工作已经在刚体层面的 Real2Sim 重建上取得了重大进展。但是仿真引擎中支持的交互物体不止有刚体。考虑到具身和游戏需求的 Real2Sim 输出的内容是渲染出的动画,我们重建出的资产也需要为这一点服务。 游戏引擎中的动画可以划分为这几类:刚体动画、骨骼动画、物理仿真动画(除此之外还有在游戏或现实中相对少见的顶点动画、2D帧动画、形变动画、粒子动画等,在此不做考虑)。现有的 4DGS 工作虽然用形变网络或升维的形式取得了较好的进展,但这种形式的资产可以类比顶点动画,并不太适用于编辑或交互,存储和在线计算成本也高于游戏的需求,因此将现在顶点动画级别的重建优化到骨骼动画/物理仿真动画是非常讲得通的工作。 我们这里主要关注骨骼动画级别的 4D 资产重建。从顶点动画到骨骼动画实际上是做了这样的假设:所有顶点的运动可以由少量的基函数线性表示,而这些基函数就对应现实中我们观察到的骨骼结构。因此这里将这类工作称为“结构感知的 Real2Sim 重建”。 我们希望的目标是用尽可能低的采集成本(仅一部手机或相机)和尽可能低的计算成本(仅一台普通 PC)重建出外观真实、结构清晰、且可编辑的骨骼动画资产,且人工需要的操作最好优化到只有采集部分,不需要后续人工参与处理。例如,玩家可以用自己的手机按指示“扫描”一遍自己,就可以上传至游戏中绑定动画预设作为自己的 avatar,理想情况下可以做到这样很酷的效果。 一般来说,这种采集成本意味着我们可以有某个状态的稠密观察(可以对场景扫描一圈),以补充我们对整个场景的信息认知,但对运动只有单视角的稀疏观察(只有单目视频可以用)。而对于具身应用来说,我们拥有的信息还有机械臂的 URDF、运动过程中的关节信息、以及大量良好标注的先验仿真数据集。从具身先验入手,这个问题可能会稍微好做一些。 并且我们希望我们的问题不是欠定的。例如稀疏 3DGS 重建类问题,大部分不可见视角依赖于生成模型的修补,这类方法虽然也有应用价值,但我们更希望能采集到足以恢复完整细节的信息,重建出高质量高保真的资产。 我们精读并梳理一些与这一目标相关的近期工作。 一. 骨骼动画级别的 Gaussian 重建与绑定 SC-GS: Sparse-Controlled Gaussian Splatting for Editable Dynamic Scenes (CVPR 2024) 本文算是 4DGS 结构化假设的起点论文,在这之前的 baseline 是 Deformable 3DGS。这篇论文的细节意外的相当数学相当有趣。SC-GS的输入是一个单(动态)视角视频,输出一组带权控制点及其运动和 Gaussians,可以由此合成为运动的 4DGS。 本论文的场景形态为一个 canonical 3DGS 场景和约 512 个控制点,每个 Gaussian 选取在 canonical 3DGS 空间中选取最近的 4 个控制点以 RBF 权重(作为蒙皮权重)插值它们的变换得到每个时间的位置。整体的训练思路仍然为 coarse-to-fine 的可微渲染。训练流程为: 准备初值:输入视频帧和对应的相机参数,生成一组 SfM 点云,再从这组点云中生成一组带有大小、颜色、透明度属性的、稀疏的控制点代理点云,作为粗训练阶段的代理物体;生成一组初始的 Gaussians,作为粗训练后加入 Gaussian 的外观优化阶段的初值。 粗训练 10k steps:训练一个点云随时间 deform MLP(输入为位置、时间,输出仅位移,无旋转),直接将点云 splat 到屏幕上的结果作为被监督信号,用可微渲染优化 deform MLP 并对点云做 prune & densify。这里还用了 ARAP 能量监督点云局部尽可能刚性变形,减少过拟合。优化合适的运动后(7.5k step)用最远点采样得到 512 个控制点,再继续优化控制点。 ...

September 3, 2026 · 2 min

具身智能的数据荒:从示教扩展到闭环数据引擎

本文使用 AI 工具生成。 大模型的发展容易让人形成一种直觉:只要继续增加数据和参数,机器人也会自然获得通用能力。问题在于,互联网数据记录了人类“看见什么、说了什么”,却很少记录机器人在特定本体、控制频率和接触条件下“应该施加什么动作”。真实机器人 Rollout 又伴随硬件占用、场景重置、遥操作、磨损和安全风险,无法像文本那样近乎零成本地复制。 因此,具身智能面对的不是简单的样本数量不足,而是有效监督密度不足:大量可获得数据没有动作,大量动作只适用于一种机器人;成功示教覆盖狭窄,接触与失败信息又经常没有被记录。与此同时,已经采集的数据还可能因为格式、压缩、同步和训练读取成本而无法被有效使用。 本文使用的会议证据来自公开标题与摘要;具体实验设置、指标定义和失败案例仍需回查论文全文。在原有 CoRL 2025 Oral 与 RSS 2026 整理之上,本文加入 ICRA 与 IROS 2025 的摘要级系统整理,并补入 ICRA 2026。前两届收录 3,589 篇正式 proceedings 论文并筛选 63 篇数据扩展工作;ICRA 2026 则从官方 PaperCept 程序的 2,951 条行中排除 131 条 Late Breaking Results,保留 2,820 条 peer-reviewed conference presentations,其中 2,639 条有官方关键词与摘要,并从 110 篇高召回短名单人工审计出 25 篇。详细笔记见 联合速览。本文不再逐篇复述摘要,而是回答一个更实用的问题:研究者正在把哪些廉价信息,通过什么接口和验证器,转换成哪些可执行的机器人监督? ICRA 2026 更新:数据荒正在变成数据生命周期问题 ICRA 2026 的增量不只是更多数据集,而是把采集、转换、生成、验证和筛选接成闭环。数据入口上,COBALT 将手机与云端遥操作结合,摘要报告五天、九国采得 7,500 多条示教;FreeTacMan 则以可穿戴夹爪同步采集视觉、触觉和位姿,发布超过 300 万组配对观测与 1 万条轨迹。两者共同说明,数据荒首先可由采集接口、同步和质量控制缓解,而非只靠事后扩充训练集。 ...

August 5, 2026 · 3 min

ICRA、IROS 2025 与 ICRA 2026 数据扩展论文速览

本文联合整理 ICRA 2025、IROS 2025 与 ICRA 2026 的数据扩展工作。ICRA 2025 Proceedings 收录 1,604 篇论文并补全 1,602 篇摘要,自动召回 279 篇候选并初审 32 篇;IROS 2025 Proceedings 收录 1,985 篇论文并补全 1,983 篇摘要,从 309 篇候选初审 31 篇。ICRA 2026 则依据官方 PaperCept 程序的 ICRA 2026 peer-reviewed conference presentations:2,951 条程序行中排除 131 条非同行评议、非出版物的 Late Breaking Results,保留 2,820 条展示(2,604 个 interactive、216 个 oral);其中 2,639 条提供官方关键词与摘要。复审把官方摘要纳入生命周期匹配、将 5 分项纳入人工复核带,当前快照自动召回 451 篇候选并人工审计 35 篇。随后以同一“数据–下游 Policy/控制”门槛复核渲染与光照方向,额外补入 ICRA 2025 的 2 篇与 IROS 2025 的 3 篇;正文当前分别覆盖 34、34、35 篇。三部分合计审计 6,409 条正式论文或同行评议展示,在同一主题框架下比较机器人数据如何被采集、转换、合成、筛选和复用。 ...

August 4, 2026 · 18 min

RSS 2026 论文速览

本文使用 AI 工具整理 Robotics: Science and Systems 2026 的全部接收论文。官网在 2026 年 8 月 4 日实际列出 210 篇论文,分布在 21 个 Session;本文数量以官网实时页面为准。 Session 导读 RSS 2026 的 Session 划分比按单篇论文罗列更能反映研究热点: Manipulation 1–3:27 篇,覆盖双臂与灵巧操作、触觉闭环、接触丰富控制、数据合成和通用 Manipulation Policy。 Imitation Learning 1–3:28 篇,是论文数量最多的方向,集中讨论示教扩展、跨本体迁移、Diffusion 或 Flow Policy 与数据选择。 Navigation 1–2:18 篇,涵盖开放词汇导航、动态避障、长时序 VLA、地形可通行性与无人机导航。 Humanoids:13 篇,从高动态全身控制、跑酷和滑板扩展到通用人形 Foundation Model 与长时序 Loco-Manipulation。 Multi-robot Systems:13 篇,研究分布式优化、多智能体协作、时序逻辑、安全导航和多机器人规划。 Perception and Estimation:13 篇,关注机器人场景中的三维感知、状态估计、多模态融合与可部署感知系统。 Planning:13 篇,覆盖采样规划、最优控制、学习增强规划和带安全约束的决策。 Control & Dynamics:13 篇,重点是接触、柔顺性、复杂动力学与学习控制的稳定性。 World Models & Memory:9 篇,探索记忆检索、因果世界模型、仿真预训练和交互式世界模拟器。 Localization & Mapping:9 篇,包含神经地图、Radar 或 LiDAR 里程计、SLAM 不确定性与前馈三维重建。 Datasets and Benchmarks:9 篇,处理机器人数据集、评测协议和真实到仿真的基准构建。 HRI:9 篇,聚焦人机协作、意图理解、交互安全与社会性机器人。 Modeling and Optimization:9 篇,研究可微建模、系统辨识、几何优化与机器人设计中的数值方法。 RL:9 篇,关注真实机器人强化学习、离线到在线适应、奖励学习和样本效率。 Robot & Sensor Design:9 篇,覆盖新型机器人机构、软体系统、触觉与其他传感器设计。 VLA Models:9 篇,集中讨论视觉–语言–动作模型的预训练、推理、泛化与高效部署。 ...

August 4, 2026 · 34 min

CoRL 2025 Oral 论文速览

本文使用 AI 工具整理 CoRL 2025 Oral 的 42 篇论文。为了避免把列表写成摘要搬运,下面按研究问题重新分为六组,并分别概括方法、主要结果与值得留意的边界。 需要说明的是,这是一份基于 OpenReview 标题与摘要的“地图式速览”,适合用来筛选待读论文,不等价于逐篇精读或实验复现。文中的“提升”“达到”等结果均指作者报告的结果。 总览:Oral 在解决什么问题 这 42 篇论文呈现出一条很清楚的主线:机器人学习的瓶颈正在从“能否学会一个任务”转向“能否低成本地扩展到新任务、新环境和新本体”。对应地,工作重点也从单纯设计更大的 Policy,转向数据生产、跨本体迁移、推理效率、真实世界评测与失败恢复等完整系统问题。 其中有四个趋势尤其明显。第一,真实机器人示教不再是唯一的数据来源:人类视频、手机扫描、生成模型、仿真与低成本外骨骼都在被转化为训练数据。第二,Diffusion Policy 与 VLA 已成为基础组件,研究开始优化其执行速度、在线适应与推理机制。第三,触觉、音频、力与 LiDAR 等模态被纳入闭环控制,而不只是作为附加观测。第四,研究者开始正面处理评测偏差、分布外失败和开放世界泛化,说明领域正在从 Demo 走向可部署系统。 1. 通用策略、推理、评测与安全 这一组关注的不是某项具体技能,而是通用机器人策略如何获得开放世界泛化能力,以及我们如何可信地评价和保护这些策略。 1. : a Vision-Language-Action Model with Open-World Generalization [OpenReview] 在 的基础上联合训练多机器人数据、Web 数据、高层语义预测与低层动作。训练样本混合图像、语言、目标检测、子任务预测和动作,使语义知识能够迁移到控制中。作者展示了模型在全新住宅内完成清理厨房、卧室等长时序灵巧任务的能力。它的重要性不只在模型规模,而在于说明异构数据与中间语义任务可以共同支撑端到端 VLA 的开放世界泛化;代价则是系统对数据覆盖、模型规模和推理基础设施的依赖很强。 ...

August 3, 2026 · 7 min

北京大学 2023-2025 推免机试题笔记

北京大学计算机学院推免夏令营机考为 ACM 赛制,时长 2 小时,每场共 8 题,题目可能是中文或英文,部分题目(主要是英文题)选自 OJ 中已有的题目。题目不按难度排序,整体难度在 CF Div4(大部分题)到 Div2 D(1~2题) 之间,能切 Div2 D 的同学可以放心考试。据说实际不爆零就能通过。 有意向报考北大计算机学院研究生的同学可以提前准备刷题。 题源整理 2025 比赛(无数据) A. Lab 杯 B. All in All C. 表达式求值 (无数据) D. 忍者道具 (无数据) E. 神奇的数列 (无数据) F. 拼装模型 G. Genealogical Tree H. 怀表问题 (无数据) ...

June 29, 2026 · 15 min

大数据算法 课程总结笔记 II(作业及个人答案)

作业一 作业一 第1题 解答 这里的趋近符号似乎含义没有标识清楚,这里默认为是当 趋近于无穷大时的极限关系。 ...

June 27, 2026 · 3 min

大数据算法 课程总结笔记 I(章节笔记)

这是我在 2026 年春季于中科大学习丁虎老师的《大数据算法》课程时整理的期末考试复习笔记。非常喜欢的好课。只是可惜讲义编写得比较潦草。这里的笔记尽可能指出讲义中各种概念的几何意义与机器学习意义,并尝试找出各种定义、定理的动机。 0 近似算法 本课程中的算法大多是用近似算法解决精确求解较为困难的问题,因此要定义一些概念对算法的误差进行衡量。 一方面,算法的求解结果可能是有误差的。我们定义 近似算法,其中 为近似比: ...

June 8, 2026 · 5 min

图形已死,all in AI具身 I: RoboSplat 论文阅读与杂谈

图 1 玩音乐的最终归宿是转行具身智能。[1] 这周组会上导师提到现在做 Rendering 已经很难有价值和影响力了,也很难找到好的课题,应该 all in 具身智能。感觉自己从一个转型阵痛期的组跳进了另一个转型阵痛期的组。不过转型是正确的,具身方向的确好发有影响力的论文,就业前景也比传统图形学好。虽然私心比较喜欢简洁优雅但没用的图形学,但确实应该现实一点。我们该思考一下怎样把已有的图形学、渲染经验搬到具身智能的应用上。 组里同学分享的 RoboSplat [2] 一文确实相当契合 CG for embodied 的愿景,因此我们从这篇论文开始了解我们能够做什么。 论文概要 本文的目标是通过输入场景的多视角 RGB 图片和单次示教样本(Expert Demonstration,人工操作机械臂完成一次任务,得到每帧的机械臂状态数据和单监督视角 RGB 图像序列)训练 VLA 模型泛化完成不同干扰场景下的同一任务。本文试图解决的干扰场景分为物体位姿移动(Object Pose)、监督相机移动(Camera View)、光照条件改变(Lighting)、物体种类改变(Object Type)、周边环境改变(Appearance)、机械臂外观改变(Cross Embodiment)六种。 图 2 论文 teaser,展示了 RoboSplat 的训练过程。 本文做到泛化的具体方法则是做数据增强,从单次示教样本中根据这几种干扰情况生成上千条增强样本 (augmented demonstrations)。以往生成增强样本的思路是直接在 2D 图像空间做生成式编辑,而本文考虑将多视角图片训练成 3DGS 场景(并在语义上分离场景、物体、机械臂,给机械臂绑骨),去在 3DGS 场景中做编辑模拟这些干扰,再合成回样本图像序列。这样做的好处是保证了图像之间场景的一致性,且不会有抖动等情况出现,因此能准确指导 VLA 模型学习到正确的操作策略。 ...

June 4, 2026 · 2 min