MiracleAug: 用 GPT-6 Astra 点燃具身数据增强的核弹吧

图 1 你要用 GPT-6 Astra 毁了我们整个行业吗。[1] 本周我尝试完成了一个名叫 MiracleAug [2] 的项目,用 GPT-6 Astra + Blender 代替过去我们具身数据增强管线中的几乎所有环节。 周一下班后,由于 GPT-Plus 在周一晚上就重置了,而我还有 70% 的 Plus 额度,看到社区上巨大的讨论,我计划试试 GPT-6 Astra 的 3D 建模能力。我首先给 GPT-5.6 Sol 发了一段我曾经尝试过的“请给我一段用于生成梦幻可爱风格粉色女生房间造景3D三渲二场景的提示词,我稍后会将提示词交给Astra模型进行Blender 3D建模。”提示词,让它扩写这段提示词,并将扩写后的提示词发给了 GPT-6 Astra。一个小时后,5小时额度见底了,这是它交付给我的结果: 图 2 场景完成度意外的非常高非常漂亮。三渲二的质感也很好。 于是我把我周日周报上画的 pipeline 图改了一下,本意是制作一张 meme 图。 ...

September 10, 2026 · 1 min

“结构感知的 Real2Sim 重建” 工作梳理

将现实物体扫描并整理成游戏引擎/具身引擎支持的、可参与交互及编辑的数字模型资产,一直以来是计算机图形学研究的重要方向。过去的工作已经在刚体层面的 Real2Sim 重建上取得了重大进展。但是仿真引擎中支持的交互物体不止有刚体。考虑到具身和游戏需求的 Real2Sim 输出的内容是渲染出的动画,我们重建出的资产也需要为这一点服务。 游戏引擎中的动画可以划分为这几类:刚体动画、骨骼动画、物理仿真动画(除此之外还有在游戏或现实中相对少见的顶点动画、2D帧动画、形变动画、粒子动画等,在此不做考虑)。现有的 4DGS 工作虽然用形变网络或升维的形式取得了较好的进展,但这种形式的资产可以类比顶点动画,并不太适用于编辑或交互,存储和在线计算成本也高于游戏的需求,因此将现在顶点动画级别的重建优化到骨骼动画/物理仿真动画是非常讲得通的工作。 我们这里主要关注骨骼动画级别的 4D 资产重建。从顶点动画到骨骼动画实际上是做了这样的假设:所有顶点的运动可以由少量的基函数线性表示,而这些基函数就对应现实中我们观察到的骨骼结构。因此这里将这类工作称为“结构感知的 Real2Sim 重建”。 我们希望的目标是用尽可能低的采集成本(仅一部手机或相机)和尽可能低的计算成本(仅一台普通 PC)重建出外观真实、结构清晰、且可编辑的骨骼动画资产,且人工需要的操作最好优化到只有采集部分,不需要后续人工参与处理。例如,玩家可以用自己的手机按指示“扫描”一遍自己,就可以上传至游戏中绑定动画预设作为自己的 avatar,理想情况下可以做到这样很酷的效果。 一般来说,这种采集成本意味着我们可以有某个状态的稠密观察(可以对场景扫描一圈),以补充我们对整个场景的信息认知,但对运动只有单视角的稀疏观察(只有单目视频可以用)。而对于具身应用来说,我们拥有的信息还有机械臂的 URDF、运动过程中的关节信息、以及大量良好标注的先验仿真数据集。从具身先验入手,这个问题可能会稍微好做一些。 并且我们希望我们的问题不是欠定的。例如稀疏 3DGS 重建类问题,大部分不可见视角依赖于生成模型的修补,这类方法虽然也有应用价值,但我们更希望能采集到足以恢复完整细节的信息,重建出高质量高保真的资产。 我们精读并梳理一些与这一目标相关的近期工作。 一. 骨骼动画级别的 Gaussian 重建与绑定 SC-GS: Sparse-Controlled Gaussian Splatting for Editable Dynamic Scenes (CVPR 2024) 本文算是 4DGS 结构化假设的起点论文,在这之前的 baseline 是 Deformable 3DGS。这篇论文的细节意外的相当数学相当有趣。SC-GS的输入是一个单(动态)视角视频,输出一组带权控制点及其运动和 Gaussians,可以由此合成为运动的 4DGS。 本论文的场景形态为一个 canonical 3DGS 场景和约 512 个控制点,每个 Gaussian 选取在 canonical 3DGS 空间中选取最近的 4 个控制点以 RBF 权重(作为蒙皮权重)插值它们的变换得到每个时间的位置。整体的训练思路仍然为 coarse-to-fine 的可微渲染。训练流程为: 准备初值:输入视频帧和对应的相机参数,生成一组 SfM 点云,再从这组点云中生成一组带有大小、颜色、透明度属性的、稀疏的控制点代理点云,作为粗训练阶段的代理物体;生成一组初始的 Gaussians,作为粗训练后加入 Gaussian 的外观优化阶段的初值。 粗训练 10k steps:训练一个点云随时间 deform MLP(输入为位置、时间,输出仅位移,无旋转),直接将点云 splat 到屏幕上的结果作为被监督信号,用可微渲染优化 deform MLP 并对点云做 prune & densify。这里还用了 ARAP 能量监督点云局部尽可能刚性变形,减少过拟合。优化合适的运动后(7.5k step)用最远点采样得到 512 个控制点,再继续优化控制点。 ...

September 3, 2026 · 2 min

图形已死,all in AI具身 I: RoboSplat 论文阅读与杂谈

图 1 玩音乐的最终归宿是转行具身智能。[1] 这周组会上导师提到现在做 Rendering 已经很难有价值和影响力了,也很难找到好的课题,应该 all in 具身智能。感觉自己从一个转型阵痛期的组跳进了另一个转型阵痛期的组。不过转型是正确的,具身方向的确好发有影响力的论文,就业前景也比传统图形学好。虽然私心比较喜欢简洁优雅但没用的图形学,但确实应该现实一点。我们该思考一下怎样把已有的图形学、渲染经验搬到具身智能的应用上。 组里同学分享的 RoboSplat [2] 一文确实相当契合 CG for embodied 的愿景,因此我们从这篇论文开始了解我们能够做什么。 论文概要 本文的目标是通过输入场景的多视角 RGB 图片和单次示教样本(Expert Demonstration,人工操作机械臂完成一次任务,得到每帧的机械臂状态数据和单监督视角 RGB 图像序列)训练 VLA 模型泛化完成不同干扰场景下的同一任务。本文试图解决的干扰场景分为物体位姿移动(Object Pose)、监督相机移动(Camera View)、光照条件改变(Lighting)、物体种类改变(Object Type)、周边环境改变(Appearance)、机械臂外观改变(Cross Embodiment)六种。 图 2 论文 teaser,展示了 RoboSplat 的训练过程。 本文做到泛化的具体方法则是做数据增强,从单次示教样本中根据这几种干扰情况生成上千条增强样本 (augmented demonstrations)。以往生成增强样本的思路是直接在 2D 图像空间做生成式编辑,而本文考虑将多视角图片训练成 3DGS 场景(并在语义上分离场景、物体、机械臂,给机械臂绑骨),去在 3DGS 场景中做编辑模拟这些干扰,再合成回样本图像序列。这样做的好处是保证了图像之间场景的一致性,且不会有抖动等情况出现,因此能准确指导 VLA 模型学习到正确的操作策略。 ...

June 4, 2026 · 2 min

SIGGRAPH 2026 论文笔记 III: Monte Carlo PDE & 几何

1. Monte Carlo PDE Probe-based Walk on Spheres for Efficient Path Reusing [Project] 我自己的文章。 利用路径信息重用高效优化 Walk on Spheres 系列算法。 考虑到 Walk on Spheres 的采样过程,每一步都要在球面上均匀采样一个点作为该点解值的一个无偏估计。由 Off-center 形式的平均值公式可以得到实际上在球内的偏心点按 Poisson Kernel 分布在球面上采样一个点得到的结果也是解值的无偏估计。因此 WoS 均匀采样得到的解值可以为球内每个点所重用,在算法上就是得到一条完整路径后将求解值 Splat 回路径上的每个球内。这个算法被我们称为 Naive Path Reuse,不清楚现在 sig 上那篇 Talking to Neighbors 有没有扩展成这样的形式。 图 1 我们的 Naive Path Reuse 算法 然后考虑到这样 Splat 的开销过于大(球内每个点都需要查询并访存一次),正好 25 年 11 月又出来了 Harmonic Caching 的文章,发现后者正好可以将 Splat 的任务转化为求解几个 Fourier 系数的任务。因此和 HC 类似地在求解域预放置一些探针球,游走时取一个探针球做 Poisson Kernel 采样找到边界,若不存在探针球就 Fallback 到传统的 WoSt 算法,可以验证这个行为仍然是满足布朗运动的。找到 Dirichlet 边界后就将求解到的结果送回探针球中贡献 Fourier 系数。然后就非常快了。 ...

May 29, 2026 · 3 min

SIGGRAPH 2026 论文笔记 II: Rendering

1. 材质,外观,可微渲染 Fiber-level Woven Fabric Capture from a Single Microscopic Image [1] 另一位助教 @JerryShen 的文章之一。这篇没有上 Sig26,只是录进了 ToG,但也放在这里。 从单张显微图像通过可微渲染重建织物的纤维级几何和材质。 对于几何建模了基本可微的五层结构: 编织模式 Pattern:平纹、斜纹等纹理模式,直接预设好,用预训练的 CNN 分类; 中心线层 Yarn Centerline:每根纤维从侧面看高度关于路径长度的函数,用抛物线和圆混合; 纤维截面层 Cross-sectional Fiber Distribution:在中心线周围生成 根纤维,纤维的螺旋扭转 、偏移 、周期性挤压变形等都是可微参数; 随机噪声层 Randomized Variation:用柏林噪声和白噪声让纤维的半径和纵向产生变化、噪声种子本身不可微但强度可微。 飘散纤维层 Flyaway Model:额外手动添加飘散出来的断线等纤维(定义有毛发 Hair 和环路 Loop 两种),模拟现实材质情况。这一层没法可微优化出来。 ...

May 28, 2026 · 3 min

SIGGRAPH 2026 论文笔记 I: 3D Gaussians

写一些笔记记录一下领域的最新进展。会持续更新,主页的 blog 发表日期仅供参考~ 1. 正向渲染加速 Gaussian Point Splatting [1] [Project] 本文用蒙特卡洛方法代替深度排序,加速了超大 3DGS 场景在 GPU 上的正向渲染过程。目前仅支持正向渲染。 本文注意到单个 Gaussian Splat 到屏幕空间的行为可以等价于在屏幕空间上按一个 Gaussian 分布放回采样 个点的结果的期望( 和 Gaussian 的参数相关)。而一系列 Gaussians 做 Alpha Blending 的行为可以等价于,对每个 Gaussian 采样 个点,然后对每个像素取深度上最靠前的点 作为 Splat 结果的无偏估计值。 ...

May 27, 2026 · 5 min

ARAP 曲面参数化算法实现笔记

同步一下之前(2024春)写过的文章,这是我当时在 计算机图形学 课上完成的作业报告,作为最难的一次作业,当时写了非常长的报告。 本次作业要求实现 ARAP,ASAP 与 Hybrid 三种非固定边界的曲面参数化算法。我在理解并实现了这些参数化算法的基础上,对 ASAP 做了迭代方法和单一方程组方法的两种实现,并对这些算法做了进一步研究。 这次作业在数学方面的知识对我来说还有许多我个人不太能独立理解的部分。感谢 @suchiwz 助教的耐心解答,让我能够对论文的各种细节做出能让我满意的理解。在本次作业报告中,我也会试着用刚做完 Homework 4 的大一学生也能理解的语言讲解我对这篇论文的理解。 0. 准备工作 本次作业新增了四个模型。它们的共同特点都是有比较好的切割(没有像 Bunny Head 那样过细的瓶颈了),并且都有各自的难点,如下表所示: 模型 特点 Cow 面数较多;网格较复杂,难以避免重叠;切割后仍保留了较多模型本身的几何特征(头部、眼睛、肢体),易于观察展开算法对形状的处理,确认算法的保形效果。 Beetle 高亏格曲面(即存在多条边界的曲面) Isis 有较多“细长”的三角形 Gargoyle 网格顶点数、面数非常多 Beetle 模型打破了 “模型只有一个边界” 的假设,因此我们需要对 Homework4 的边界映射算法做出调整,对每个边界都进行一次遍历,并取长度最长的边界作为映射的边界。相应地,对 Tutte 参数化中用到边界相关的代码进行调整,不再视不为主要边界的点位边界。这样,Tutte 参数化的结果就能够较好地处理 Beetle 模型,并将其作为 ARAP 的 Initial Guess 了。下图是 Floater 参数化处理后的 Beetle 模型。 ...

May 20, 2024 · 3 min