一个基驱动所有:面向实时化身的高斯混合形状蒸馏

One Basis to Animate Them All: Gaussian Blendshape Distillation for Real-Time Avatars

arXiv: 2610.02207v1

论文信息

标题: One Basis to Animate Them All: Gaussian Blendshape Distillation for Real-Time Avatars

作者: Ramazan Fazylov, Stamatis Lefkimmiatis, Ivan Laptev

发布日期: 2026-10-01

arXiv ID: 2610.02207v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:这篇论文要解决什么 预训练 3D 高斯头像/人体模型渲染高效,但动画时每帧都要运行大型神经网络,CPU 和移动端难以实时运行。

  • 核心方法:用什么办法解决 提出 GALA,从预训练模型的属性残差中提取身份无关的局部线性 blendshape 基,并用浅层 MLP 预测系数;运行时只做中性头像加线性混合。

  • 关键结果:最重要的一个结论或数字 在 AGORA、FlexAvatar、DynaAvatar 三个宿主模型上,CPU 动画步骤最多下降约三个数量级:DynaAvatar 从 42.9 s 降至 6.1 ms,并可在手机浏览器达到 60 fps(表 5、第 4.2 节)。

  • 主要局限:作者自己承认的、或方法本身固有的限制 系数预测仍是主要误差来源:在 48 MB 预算下,预测系数相对于宿主模型的 PSNR 在 AGORA 上低 5.7 dB、在 FlexAvatar 上低 12.3 dB,且增大预算主要改善投影系数而非预测系数(第 5 节、图 4)。

  • 适合读者:什么背景的人值得读 从事神经渲染、3D 高斯头像/人体、数字人、模型蒸馏与移动端部署的研究者和工程师。

论文背景和研究动机

3D Gaussian Splatting 让显式高斯基元具备快速渲染能力,但许多可动画神经头像/人体模型在每帧仍要评估大型网络来更新高斯属性,论文称之为 “动画路径”。论文指出,高效渲染并不等于高效动画:例如 DynaAvatar 单帧动画步骤在 CPU 上耗时 42.9 s(表 5),难以部署到 CPU 和移动端。

线性 blendshape 在面部和身体建模中历史悠久,但近年 photorealistic 高斯 blendshape 方法大多为每个主体单独拟合基;固定 rig 方法如 LAM 虽然高效,但基是预定义的。论文的核心问题是:预训练多身份模型学习到的变形,是否也存在共享线性结构,能否被提取并复用到未见身份?这种设定不修改原模型训练,只做蒸馏,构成与已有 per-subject 拟合和固定 rig 不同的路径(表 1)。

核心方法和技术细节

论文将宿主模型写为 A(w,θ)→G∈RndA(w,\theta)\to G\in\mathbb{R}^{nd},其中 ww 是身份描述符,θ\theta 是动画参数,GG 拼接了全部高斯的属性向量。GALA 要求高斯索引跨身份和动画参数保持一致对应(第 3.1 节),其近似形式为

G^=A(w,θ0)+Uc(w,θ)\hat{G}=A(w,\theta_0)+Uc(w,\theta)

其中 θ0\theta_0 是中性姿态,UU 是共享线性基,cc 是系数。基础构造是对残差

ri=A(wi,θi)−A(wi,θ0)r_i=A(w_i,\theta_i)-A(w_i,\theta_0)

做无中心 PCA。优化目标为

min⁡U,{ci}∑i=1N∥ri−Uci∥22,U⊤U=I\min_{U,\{c_i\}} \sum_{i=1}^N \|r_i-Uc_i\|_2^2,\quad U^\top U=I

论文引用 Eckart–Young 定理指出最优解是截断 SVD(第 3.2.1 节)。其优点是零系数可精确恢复中性头像,但简单 PCA 有三个问题:属性组尺度不同;全局组件即使只覆盖局部运动也存储整个头像;欧氏属性误差不直接反映渲染质量。

改进后的基构造包括三点。第一,按属性组分别建立基,并用 k-means 将高斯按 3D 位置分成 B=32B=32 个空间块,形成块对角基 Ua,jU_{a,j}。第二,使用 rendering-aware 度量:通过随机探针估计图像对属性的 Gauss–Newton Hessian H=J⊤JH=J^\top J 的对角块,得到 H^a\hat{H}_a,再与单位矩阵和可选的 landmark Hessian 组合为 Ma=αI+βH^a+γH^almkM_a=\alpha I+\beta \hat{H}_a+\gamma \hat{H}_a^{\mathrm{lmk}}。在 MM 度量下做 PCA,等价于对 Ya,j=Ma,j1/2Ra,jY_{a,j}=M_{a,j}^{1/2}R_{a,j} 做普通 PCA;投影系数为 ca,j⋆=Ua,j⊤Ma,jra,jc^\star_{a,j}=U_{a,j}^\top M_{a,j}r_{a,j}。第三,在固定内存预算 B\mathcal{B} 下,将每个奇异值换算为误差减少量 va,j,kv_{a,j,k},按单位存储的收益贪心分配组件,直到预算耗尽(第 3.2.2 节、附录 A)。

为避免运行时仍执行宿主网络,论文训练浅层系数网络 fϕ(w,θ)f_\phi(w,\theta) 回归投影系数 c⋆c^\star,损失为 Ldist=∥c^−c⋆∥22\mathcal L_{\mathrm{dist}}=\|\hat c-c^\star\|_2^2(第 3.2.3 节)。身份条件 ww 固定,因此同一表情或姿势在不同身份上可产生主体特定形变。

创新点和贡献

论文的主要贡献有三点:第一,实验表明复杂预训练高斯头像/人体网络的动画输出可被共享线性 blendshape 基近似,且该基对未见身份可复用;第二,提出 GALA 蒸馏方法,将 rendering-aware、块局部 PCA、内存预算分配与浅层系数预测组合起来;第三,在三个不同架构的宿主模型上完成验证,覆盖头部生成、单图头部重建和带衣物动态的全身动画(第 1 节)。

与已有工作相比,GEM、RGBAvatar 等 photorealistic 高斯 blendshape 方法通常需要为每个主体单独拟合基;LAM 使用预定义 rig。GALA 的不同之处在于,从多身份预训练模型中提取共享基,并复用给提取阶段未见过的身份(表 1)。这扩展了高斯 blendshape 蒸馏的使用范围。

实验结果分析

在各自宿主模型的基准上,三个蒸馏模型均接近宿主质量,并在大多数指标上优于对比方法。AGORA + GALA 的 FID 从宿主 3.17 变为 3.47,AED-jaw、ID、APD 仍是最佳或次优(表 2a);DynaAvatar + GALA 的 PSNR 比宿主低 0.64 dB,但仍比所有对比方法至少高 1.9 dB(表 2b);FlexAvatar + GALA 在 12 个质量指标中取得 8 个最佳或并列最佳(表 2c,第 4.2 节)。需要说明,这些结论限于论文选取的数据集与评测协议。

加速方面,CPU 动画步骤从 AGORA 的 154 ms 降至 5.5 ms,FlexAvatar 从 234 ms 降至 4.4 ms,DynaAvatar 从 42.9 s 降至 6.1 ms;对应提升约 ×28、×54 和 ×7000(表 5)。若 DynaAvatar 计入 10 ms 的 skinning,则为 16.1 ms,提升约 ×2700。三个模型在手机浏览器中均达到 60 fps(表 2、附录 C)。

消融实验进一步说明设计选择的重要性。与完整方法相比,简单 PCA 的 PSNR 在 AGORA、FlexAvatar、DynaAvatar 上分别低 9.7、11.5、13.2 dB(表 3a)。空间分块从 B=1B=1 增至 B=32B=32 时,三个模型的 PSNR 分别提升 8.2、6.9、8.6 dB(表 3b)。组件分配方式上,单个全局 rank 比完整分配低 6.2、1.2、8.5 dB;按属性组分配可以恢复大部分差距,再按组和块分配可进一步获得 3.4、0.1、0.7 dB 提升(表 4)。与标准知识蒸馏学生网络相比,图 4 中没有任何蒸馏网络在速度和精度上同时优于 GALA。

实践建议

如果已有高斯 avatar 模型,可先确认高斯索引跨身份一致,这是 GALA 适用的前提(第 3.1 节)。若一致,无需重新训练原模型,可按论文流程离线蒸馏。

在内存受限时,优先实现 rendering-aware 分配和按属性组分组。表 3a 显示,仅用欧氏方差分配在 DynaAvatar 上比完整方法低 13.3 dB,说明这两项收益最大。空间分块也值得配置,但不宜盲目增加块数:论文在 B=32B=32 处取得良好结果,更大的 BB 对投影系数有提升,但对预测系数没有一致改善(第 4.3 节)。

对于类似 FlexAvatar 的单图重建模型,可采用每主体 enrollment 微调系数网络,论文在评测中使用该步骤(第 4.1 节)。移动端部署时,中性头像和基只需加载一次,每帧仅执行系数网络和线性混合;论文在浏览器 shader 中实现了这一流程,三个模型达到 60 fps(附录 C)。

最后,当预算继续增大但端到端质量停滞时,应优先改进系数网络,而不是继续扩充基。图 4 显示较大预算下投影系数更接近宿主,但预测系数带来的误差在 FlexAvatar 上尤为明显。作者也将系数预测列为未来改进方向(第 5 节)。