一个基驱动所有:面向实时化身的高斯混合形状蒸馏
One Basis to Animate Them All: Gaussian Blendshape Distillation for Real-Time Avatars
论文信息
标题: One Basis to Animate Them All: Gaussian Blendshape Distillation for Real-Time Avatars
作者: Ramazan Fazylov, Stamatis Lefkimmiatis, Ivan Laptev
发布日期: 2026-10-01
arXiv ID: 2610.02207v1
PDF 链接: 下载 PDF
3 分钟速览
-
研究问题:这篇论文要解决什么 预训练 3D 高斯头像/人体模型渲染高效,但动画时每帧都要运行大型神经网络,CPU 和移动端难以实时运行。
-
核心方法:用什么办法解决 提出 GALA,从预训练模型的属性残差中提取身份无关的局部线性 blendshape 基,并用浅层 MLP 预测系数;运行时只做中性头像加线性混合。
-
关键结果:最重要的一个结论或数字 在 AGORA、FlexAvatar、DynaAvatar 三个宿主模型上,CPU 动画步骤最多下降约三个数量级:DynaAvatar 从 42.9 s 降至 6.1 ms,并可在手机浏览器达到 60 fps(表 5、第 4.2 节)。
-
主要局限:作者自己承认的、或方法本身固有的限制 系数预测仍是主要误差来源:在 48 MB 预算下,预测系数相对于宿主模型的 PSNR 在 AGORA 上低 5.7 dB、在 FlexAvatar 上低 12.3 dB,且增大预算主要改善投影系数而非预测系数(第 5 节、图 4)。
-
适合读者:什么背景的人值得读 从事神经渲染、3D 高斯头像/人体、数字人、模型蒸馏与移动端部署的研究者和工程师。
论文背景和研究动机
3D Gaussian Splatting 让显式高斯基元具备快速渲染能力,但许多可动画神经头像/人体模型在每帧仍要评估大型网络来更新高斯属性,论文称之为 “动画路径”。论文指出,高效渲染并不等于高效动画:例如 DynaAvatar 单帧动画步骤在 CPU 上耗时 42.9 s(表 5),难以部署到 CPU 和移动端。
线性 blendshape 在面部和身体建模中历史悠久,但近年 photorealistic 高斯 blendshape 方法大多为每个主体单独拟合基;固定 rig 方法如 LAM 虽然高效,但基是预定义的。论文的核心问题是:预训练多身份模型学习到的变形,是否也存在共享线性结构,能否被提取并复用到未见身份?这种设定不修改原模型训练,只做蒸馏,构成与已有 per-subject 拟合和固定 rig 不同的路径(表 1)。
核心方法和技术细节
论文将宿主模型写为 ,其中 是身份描述符, 是动画参数, 拼接了全部高斯的属性向量。GALA 要求高斯索引跨身份和动画参数保持一致对应(第 3.1 节),其近似形式为
其中 是中性姿态, 是共享线性基, 是系数。基础构造是对残差
做无中心 PCA。优化目标为
论文引用 Eckart–Young 定理指出最优解是截断 SVD(第 3.2.1 节)。其优点是零系数可精确恢复中性头像,但简单 PCA 有三个问题:属性组尺度不同;全局组件即使只覆盖局部运动也存储整个头像;欧氏属性误差不直接反映渲染质量。
改进后的基构造包括三点。第一,按属性组分别建立基,并用 k-means 将高斯按 3D 位置分成 个空间块,形成块对角基 。第二,使用 rendering-aware 度量:通过随机探针估计图像对属性的 Gauss–Newton Hessian 的对角块,得到 ,再与单位矩阵和可选的 landmark Hessian 组合为 。在 度量下做 PCA,等价于对 做普通 PCA;投影系数为 。第三,在固定内存预算 下,将每个奇异值换算为误差减少量 ,按单位存储的收益贪心分配组件,直到预算耗尽(第 3.2.2 节、附录 A)。
为避免运行时仍执行宿主网络,论文训练浅层系数网络 回归投影系数 ,损失为 (第 3.2.3 节)。身份条件 固定,因此同一表情或姿势在不同身份上可产生主体特定形变。
创新点和贡献
论文的主要贡献有三点:第一,实验表明复杂预训练高斯头像/人体网络的动画输出可被共享线性 blendshape 基近似,且该基对未见身份可复用;第二,提出 GALA 蒸馏方法,将 rendering-aware、块局部 PCA、内存预算分配与浅层系数预测组合起来;第三,在三个不同架构的宿主模型上完成验证,覆盖头部生成、单图头部重建和带衣物动态的全身动画(第 1 节)。
与已有工作相比,GEM、RGBAvatar 等 photorealistic 高斯 blendshape 方法通常需要为每个主体单独拟合基;LAM 使用预定义 rig。GALA 的不同之处在于,从多身份预训练模型中提取共享基,并复用给提取阶段未见过的身份(表 1)。这扩展了高斯 blendshape 蒸馏的使用范围。
实验结果分析
在各自宿主模型的基准上,三个蒸馏模型均接近宿主质量,并在大多数指标上优于对比方法。AGORA + GALA 的 FID 从宿主 3.17 变为 3.47,AED-jaw、ID、APD 仍是最佳或次优(表 2a);DynaAvatar + GALA 的 PSNR 比宿主低 0.64 dB,但仍比所有对比方法至少高 1.9 dB(表 2b);FlexAvatar + GALA 在 12 个质量指标中取得 8 个最佳或并列最佳(表 2c,第 4.2 节)。需要说明,这些结论限于论文选取的数据集与评测协议。
加速方面,CPU 动画步骤从 AGORA 的 154 ms 降至 5.5 ms,FlexAvatar 从 234 ms 降至 4.4 ms,DynaAvatar 从 42.9 s 降至 6.1 ms;对应提升约 ×28、×54 和 ×7000(表 5)。若 DynaAvatar 计入 10 ms 的 skinning,则为 16.1 ms,提升约 ×2700。三个模型在手机浏览器中均达到 60 fps(表 2、附录 C)。
消融实验进一步说明设计选择的重要性。与完整方法相比,简单 PCA 的 PSNR 在 AGORA、FlexAvatar、DynaAvatar 上分别低 9.7、11.5、13.2 dB(表 3a)。空间分块从 增至 时,三个模型的 PSNR 分别提升 8.2、6.9、8.6 dB(表 3b)。组件分配方式上,单个全局 rank 比完整分配低 6.2、1.2、8.5 dB;按属性组分配可以恢复大部分差距,再按组和块分配可进一步获得 3.4、0.1、0.7 dB 提升(表 4)。与标准知识蒸馏学生网络相比,图 4 中没有任何蒸馏网络在速度和精度上同时优于 GALA。
实践建议
如果已有高斯 avatar 模型,可先确认高斯索引跨身份一致,这是 GALA 适用的前提(第 3.1 节)。若一致,无需重新训练原模型,可按论文流程离线蒸馏。
在内存受限时,优先实现 rendering-aware 分配和按属性组分组。表 3a 显示,仅用欧氏方差分配在 DynaAvatar 上比完整方法低 13.3 dB,说明这两项收益最大。空间分块也值得配置,但不宜盲目增加块数:论文在 处取得良好结果,更大的 对投影系数有提升,但对预测系数没有一致改善(第 4.3 节)。
对于类似 FlexAvatar 的单图重建模型,可采用每主体 enrollment 微调系数网络,论文在评测中使用该步骤(第 4.1 节)。移动端部署时,中性头像和基只需加载一次,每帧仅执行系数网络和线性混合;论文在浏览器 shader 中实现了这一流程,三个模型达到 60 fps(附录 C)。
最后,当预算继续增大但端到端质量停滞时,应优先改进系数网络,而不是继续扩充基。图 4 显示较大预算下投影系数更接近宿主,但预测系数带来的误差在 FlexAvatar 上尤为明显。作者也将系数预测列为未来改进方向(第 5 节)。