Tech & Art & Kawaii blog, by @rubatotree
MiracleAug: 用 GPT-6 Astra 点燃具身数据增强的核弹吧
图 1 你要用 GPT-6 Astra 毁了我们整个行业吗。[1] 本周我尝试完成了一个名叫 MiracleAug [2] 的项目,用 GPT-6 Astra + Blender 代替过去我们具身数据增强管线中的几乎所有环节。 周一下班后,由于 GPT-Plus 在周一晚上就重置了,而我还有 70% 的 Plus 额度,看到社区上巨大的讨论,我计划试试 GPT-6 Astra 的 3D 建模能力。我首先给 GPT-5.6 Sol 发了一段我曾经尝试过的“请给我一段用于生成梦幻可爱风格粉色女生房间造景3D三渲二场景的提示词,我稍后会将提示词交给Astra模型进行Blender 3D建模。”提示词,让它扩写这段提示词,并将扩写后的提示词发给了 GPT-6 Astra。一个小时后,5小时额度见底了,这是它交付给我的结果: 图 2 场景完成度意外的非常高非常漂亮。三渲二的质感也很好。 于是我把我周日周报上画的 pipeline 图改了一下,本意是制作一张 meme 图。 ...
“结构感知的 Real2Sim 重建” 工作梳理
将现实物体扫描并整理成游戏引擎/具身引擎支持的、可参与交互及编辑的数字模型资产,一直以来是计算机图形学研究的重要方向。过去的工作已经在刚体层面的 Real2Sim 重建上取得了重大进展。但是仿真引擎中支持的交互物体不止有刚体。考虑到具身和游戏需求的 Real2Sim 输出的内容是渲染出的动画,我们重建出的资产也需要为这一点服务。 游戏引擎中的动画可以划分为这几类:刚体动画、骨骼动画、物理仿真动画(除此之外还有在游戏或现实中相对少见的顶点动画、2D帧动画、形变动画、粒子动画等,在此不做考虑)。现有的 4DGS 工作虽然用形变网络或升维的形式取得了较好的进展,但这种形式的资产可以类比顶点动画,并不太适用于编辑或交互,存储和在线计算成本也高于游戏的需求,因此将现在顶点动画级别的重建优化到骨骼动画/物理仿真动画是非常讲得通的工作。 我们这里主要关注骨骼动画级别的 4D 资产重建。从顶点动画到骨骼动画实际上是做了这样的假设:所有顶点的运动可以由少量的基函数线性表示,而这些基函数就对应现实中我们观察到的骨骼结构。因此这里将这类工作称为“结构感知的 Real2Sim 重建”。 我们希望的目标是用尽可能低的采集成本(仅一部手机或相机)和尽可能低的计算成本(仅一台普通 PC)重建出外观真实、结构清晰、且可编辑的骨骼动画资产,且人工需要的操作最好优化到只有采集部分,不需要后续人工参与处理。例如,玩家可以用自己的手机按指示“扫描”一遍自己,就可以上传至游戏中绑定动画预设作为自己的 avatar,理想情况下可以做到这样很酷的效果。 一般来说,这种采集成本意味着我们可以有某个状态的稠密观察(可以对场景扫描一圈),以补充我们对整个场景的信息认知,但对运动只有单视角的稀疏观察(只有单目视频可以用)。而对于具身应用来说,我们拥有的信息还有机械臂的 URDF、运动过程中的关节信息、以及大量良好标注的先验仿真数据集。从具身先验入手,这个问题可能会稍微好做一些。 并且我们希望我们的问题不是欠定的。例如稀疏 3DGS 重建类问题,大部分不可见视角依赖于生成模型的修补,这类方法虽然也有应用价值,但我们更希望能采集到足以恢复完整细节的信息,重建出高质量高保真的资产。 我们精读并梳理一些与这一目标相关的近期工作。 一. 骨骼动画级别的 Gaussian 重建与绑定 SC-GS: Sparse-Controlled Gaussian Splatting for Editable Dynamic Scenes (CVPR 2024) 本文算是 4DGS 结构化假设的起点论文,在这之前的 baseline 是 Deformable 3DGS。这篇论文的细节意外的相当数学相当有趣。SC-GS的输入是一个单(动态)视角视频,输出一组带权控制点及其运动和 Gaussians,可以由此合成为运动的 4DGS。 本论文的场景形态为一个 canonical 3DGS 场景和约 512 个控制点,每个 Gaussian 选取在 canonical 3DGS 空间中选取最近的 4 个控制点以 RBF 权重(作为蒙皮权重)插值它们的变换得到每个时间的位置。整体的训练思路仍然为 coarse-to-fine 的可微渲染。训练流程为: 准备初值:输入视频帧和对应的相机参数,生成一组 SfM 点云,再从这组点云中生成一组带有大小、颜色、透明度属性的、稀疏的控制点代理点云,作为粗训练阶段的代理物体;生成一组初始的 Gaussians,作为粗训练后加入 Gaussian 的外观优化阶段的初值。 粗训练 10k steps:训练一个点云随时间 deform MLP(输入为位置、时间,输出仅位移,无旋转),直接将点云 splat 到屏幕上的结果作为被监督信号,用可微渲染优化 deform MLP 并对点云做 prune & densify。这里还用了 ARAP 能量监督点云局部尽可能刚性变形,减少过拟合。优化合适的运动后(7.5k step)用最远点采样得到 512 个控制点,再继续优化控制点。 ...
具身智能的数据荒:从示教扩展到闭环数据引擎
本文使用 AI 工具生成。 大模型的发展容易让人形成一种直觉:只要继续增加数据和参数,机器人也会自然获得通用能力。问题在于,互联网数据记录了人类“看见什么、说了什么”,却很少记录机器人在特定本体、控制频率和接触条件下“应该施加什么动作”。真实机器人 Rollout 又伴随硬件占用、场景重置、遥操作、磨损和安全风险,无法像文本那样近乎零成本地复制。 因此,具身智能面对的不是简单的样本数量不足,而是有效监督密度不足:大量可获得数据没有动作,大量动作只适用于一种机器人;成功示教覆盖狭窄,接触与失败信息又经常没有被记录。与此同时,已经采集的数据还可能因为格式、压缩、同步和训练读取成本而无法被有效使用。 本文使用的会议证据来自公开标题与摘要;具体实验设置、指标定义和失败案例仍需回查论文全文。在原有 CoRL 2025 Oral 与 RSS 2026 整理之上,本文加入 ICRA 与 IROS 2025 的摘要级系统整理,并补入 ICRA 2026。前两届收录 3,589 篇正式 proceedings 论文并筛选 63 篇数据扩展工作;ICRA 2026 则从官方 PaperCept 程序的 2,951 条行中排除 131 条 Late Breaking Results,保留 2,820 条 peer-reviewed conference presentations,其中 2,639 条有官方关键词与摘要,并从 110 篇高召回短名单人工审计出 25 篇。详细笔记见 联合速览。本文不再逐篇复述摘要,而是回答一个更实用的问题:研究者正在把哪些廉价信息,通过什么接口和验证器,转换成哪些可执行的机器人监督? ICRA 2026 更新:数据荒正在变成数据生命周期问题 ICRA 2026 的增量不只是更多数据集,而是把采集、转换、生成、验证和筛选接成闭环。数据入口上,COBALT 将手机与云端遥操作结合,摘要报告五天、九国采得 7,500 多条示教;FreeTacMan 则以可穿戴夹爪同步采集视觉、触觉和位姿,发布超过 300 万组配对观测与 1 万条轨迹。两者共同说明,数据荒首先可由采集接口、同步和质量控制缓解,而非只靠事后扩充训练集。 ...
ICRA、IROS 2025 与 ICRA 2026 数据扩展论文速览
本文联合整理 ICRA 2025、IROS 2025 与 ICRA 2026 的数据扩展工作。ICRA 2025 Proceedings 收录 1,604 篇论文并补全 1,602 篇摘要,自动召回 279 篇候选并初审 32 篇;IROS 2025 Proceedings 收录 1,985 篇论文并补全 1,983 篇摘要,从 309 篇候选初审 31 篇。ICRA 2026 则依据官方 PaperCept 程序的 ICRA 2026 peer-reviewed conference presentations:2,951 条程序行中排除 131 条非同行评议、非出版物的 Late Breaking Results,保留 2,820 条展示(2,604 个 interactive、216 个 oral);其中 2,639 条提供官方关键词与摘要。复审把官方摘要纳入生命周期匹配、将 5 分项纳入人工复核带,当前快照自动召回 451 篇候选并人工审计 35 篇。随后以同一“数据–下游 Policy/控制”门槛复核渲染与光照方向,额外补入 ICRA 2025 的 2 篇与 IROS 2025 的 3 篇;正文当前分别覆盖 34、34、35 篇。三部分合计审计 6,409 条正式论文或同行评议展示,在同一主题框架下比较机器人数据如何被采集、转换、合成、筛选和复用。 ...
RSS 2026 论文速览
本文使用 AI 工具整理 Robotics: Science and Systems 2026 的全部接收论文。官网在 2026 年 8 月 4 日实际列出 210 篇论文,分布在 21 个 Session;本文数量以官网实时页面为准。 Session 导读 RSS 2026 的 Session 划分比按单篇论文罗列更能反映研究热点: Manipulation 1–3:27 篇,覆盖双臂与灵巧操作、触觉闭环、接触丰富控制、数据合成和通用 Manipulation Policy。 Imitation Learning 1–3:28 篇,是论文数量最多的方向,集中讨论示教扩展、跨本体迁移、Diffusion 或 Flow Policy 与数据选择。 Navigation 1–2:18 篇,涵盖开放词汇导航、动态避障、长时序 VLA、地形可通行性与无人机导航。 Humanoids:13 篇,从高动态全身控制、跑酷和滑板扩展到通用人形 Foundation Model 与长时序 Loco-Manipulation。 Multi-robot Systems:13 篇,研究分布式优化、多智能体协作、时序逻辑、安全导航和多机器人规划。 Perception and Estimation:13 篇,关注机器人场景中的三维感知、状态估计、多模态融合与可部署感知系统。 Planning:13 篇,覆盖采样规划、最优控制、学习增强规划和带安全约束的决策。 Control & Dynamics:13 篇,重点是接触、柔顺性、复杂动力学与学习控制的稳定性。 World Models & Memory:9 篇,探索记忆检索、因果世界模型、仿真预训练和交互式世界模拟器。 Localization & Mapping:9 篇,包含神经地图、Radar 或 LiDAR 里程计、SLAM 不确定性与前馈三维重建。 Datasets and Benchmarks:9 篇,处理机器人数据集、评测协议和真实到仿真的基准构建。 HRI:9 篇,聚焦人机协作、意图理解、交互安全与社会性机器人。 Modeling and Optimization:9 篇,研究可微建模、系统辨识、几何优化与机器人设计中的数值方法。 RL:9 篇,关注真实机器人强化学习、离线到在线适应、奖励学习和样本效率。 Robot & Sensor Design:9 篇,覆盖新型机器人机构、软体系统、触觉与其他传感器设计。 VLA Models:9 篇,集中讨论视觉–语言–动作模型的预训练、推理、泛化与高效部署。 ...
CoRL 2025 Oral 论文速览
本文使用 AI 工具整理 CoRL 2025 Oral 的 42 篇论文。为了避免把列表写成摘要搬运,下面按研究问题重新分为六组,并分别概括方法、主要结果与值得留意的边界。 需要说明的是,这是一份基于 OpenReview 标题与摘要的“地图式速览”,适合用来筛选待读论文,不等价于逐篇精读或实验复现。文中的“提升”“达到”等结果均指作者报告的结果。 总览:Oral 在解决什么问题 这 42 篇论文呈现出一条很清楚的主线:机器人学习的瓶颈正在从“能否学会一个任务”转向“能否低成本地扩展到新任务、新环境和新本体”。对应地,工作重点也从单纯设计更大的 Policy,转向数据生产、跨本体迁移、推理效率、真实世界评测与失败恢复等完整系统问题。 其中有四个趋势尤其明显。第一,真实机器人示教不再是唯一的数据来源:人类视频、手机扫描、生成模型、仿真与低成本外骨骼都在被转化为训练数据。第二,Diffusion Policy 与 VLA 已成为基础组件,研究开始优化其执行速度、在线适应与推理机制。第三,触觉、音频、力与 LiDAR 等模态被纳入闭环控制,而不只是作为附加观测。第四,研究者开始正面处理评测偏差、分布外失败和开放世界泛化,说明领域正在从 Demo 走向可部署系统。 1. 通用策略、推理、评测与安全 这一组关注的不是某项具体技能,而是通用机器人策略如何获得开放世界泛化能力,以及我们如何可信地评价和保护这些策略。 1. : a Vision-Language-Action Model with Open-World Generalization [OpenReview] 在 的基础上联合训练多机器人数据、Web 数据、高层语义预测与低层动作。训练样本混合图像、语言、目标检测、子任务预测和动作,使语义知识能够迁移到控制中。作者展示了模型在全新住宅内完成清理厨房、卧室等长时序灵巧任务的能力。它的重要性不只在模型规模,而在于说明异构数据与中间语义任务可以共同支撑端到端 VLA 的开放世界泛化;代价则是系统对数据覆盖、模型规模和推理基础设施的依赖很强。 ...
北京大学 2023-2025 推免机试题笔记
北京大学计算机学院推免夏令营机考为 ACM 赛制,时长 2 小时,每场共 8 题,题目可能是中文或英文,部分题目(主要是英文题)选自 OJ 中已有的题目。题目不按难度排序,整体难度在 CF Div4(大部分题)到 Div2 D(1~2题) 之间,能切 Div2 D 的同学可以放心考试。据说实际不爆零就能通过。 有意向报考北大计算机学院研究生的同学可以提前准备刷题。 题源整理 2025 比赛(无数据) A. Lab 杯 B. All in All C. 表达式求值 (无数据) D. 忍者道具 (无数据) E. 神奇的数列 (无数据) F. 拼装模型 G. Genealogical Tree H. 怀表问题 (无数据) ...
大数据算法 课程总结笔记 II(作业及个人答案)
作业一 作业一 第1题 解答 这里的趋近符号似乎含义没有标识清楚,这里默认为是当 趋近于无穷大时的极限关系。 ...
大数据算法 课程总结笔记 I(章节笔记)
这是我在 2026 年春季于中科大学习丁虎老师的《大数据算法》课程时整理的期末考试复习笔记。非常喜欢的好课。只是可惜讲义编写得比较潦草。这里的笔记尽可能指出讲义中各种概念的几何意义与机器学习意义,并尝试找出各种定义、定理的动机。 0 近似算法 本课程中的算法大多是用近似算法解决精确求解较为困难的问题,因此要定义一些概念对算法的误差进行衡量。 一方面,算法的求解结果可能是有误差的。我们定义 近似算法,其中 为近似比: ...
图形已死,all in AI具身 I: RoboSplat 论文阅读与杂谈
图 1 玩音乐的最终归宿是转行具身智能。[1] 这周组会上导师提到现在做 Rendering 已经很难有价值和影响力了,也很难找到好的课题,应该 all in 具身智能。感觉自己从一个转型阵痛期的组跳进了另一个转型阵痛期的组。不过转型是正确的,具身方向的确好发有影响力的论文,就业前景也比传统图形学好。虽然私心比较喜欢简洁优雅但没用的图形学,但确实应该现实一点。我们该思考一下怎样把已有的图形学、渲染经验搬到具身智能的应用上。 组里同学分享的 RoboSplat [2] 一文确实相当契合 CG for embodied 的愿景,因此我们从这篇论文开始了解我们能够做什么。 论文概要 本文的目标是通过输入场景的多视角 RGB 图片和单次示教样本(Expert Demonstration,人工操作机械臂完成一次任务,得到每帧的机械臂状态数据和单监督视角 RGB 图像序列)训练 VLA 模型泛化完成不同干扰场景下的同一任务。本文试图解决的干扰场景分为物体位姿移动(Object Pose)、监督相机移动(Camera View)、光照条件改变(Lighting)、物体种类改变(Object Type)、周边环境改变(Appearance)、机械臂外观改变(Cross Embodiment)六种。 图 2 论文 teaser,展示了 RoboSplat 的训练过程。 本文做到泛化的具体方法则是做数据增强,从单次示教样本中根据这几种干扰情况生成上千条增强样本 (augmented demonstrations)。以往生成增强样本的思路是直接在 2D 图像空间做生成式编辑,而本文考虑将多视角图片训练成 3DGS 场景(并在语义上分离场景、物体、机械臂,给机械臂绑骨),去在 3DGS 场景中做编辑模拟这些干扰,再合成回样本图像序列。这样做的好处是保证了图像之间场景的一致性,且不会有抖动等情况出现,因此能准确指导 VLA 模型学习到正确的操作策略。 ...