FID 隐藏了什么:生成式评估中偏差的检测、排序与诊断
What FID Hides: Detecting, Ranking, and Diagnosing Deviations in Generative Evaluation
论文信息
标题: What FID Hides: Detecting, Ranking, and Diagnosing Deviations in Generative Evaluation
作者: Hao Chen
发布日期: 2026-08-25
arXiv ID: 2608.24881v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:生成模型评估常用的 FID 和 KID 存在矩匹配盲区、缺少校准检验、无法指示过散与欠散方向;论文提出 ZID 综合解决这些缺陷。
- 核心方法:ZID 组合 RISE 和两种带宽的高斯核检验(GPK-med、GPK-small),保留各自的 与 共六个标准化臂,用 flat-Simes 聚合为分数,并用外层置换检验给出 p 值,再用 坐标符号诊断欠散/过散。
- 关键结果:在像素空间压力测试中,仅优化匹配 Inception 均值和协方差的噪声图像获得 FID 24.7,低于真实图像 58.6;但 ZID 分数为 17.2,远高于真实–真实基线 0.86(图 1)。
- 主要局限:ZID 分数比较依赖固定的样本量、嵌入、参考样本和预处理;若诊断门 未通过或成员符号冲突,则方向标签不分配。
- 适合读者:从事生成模型评估、需要可靠模型选择或离群诊断的研究者和工程师。
论文背景和研究动机
FID 和 KID 是生成图像评估中最常用的标量指标。FID 只用嵌入分布的前两阶矩拟合高斯并计算 Fréchet 距离;KID 则是基于三次多项式核的 MMD。论文指出两个关键限制:一是矩盲区,二是方向缺失。
矩盲区可以做形式化描述。论文给出命题 1(附录 A.2):对于任意具有非零协方差的分布 ,都存在一个不同的分布 具有相同均值和协方差,因此任何只依赖前两阶矩的差异度量都会给 和 赋零;特别地,FID 为零。在像素空间压力测试中,从噪声初始化并仅优化匹配 ImageNet 参考 Inception 均值和协方差,FID 从真实–真实基线 58.6 降到 24.7,而图像仍是不可识别的视觉噪声(图 1)。这说明 FID 的矩匹配盲区可以被直接利用。
方向缺失同样重要。FID 和 KID 在交换两个样本时不变,因此不能区分低引导过散(off-manifold)与高引导多样性崩溃(欠散)。作者在对 DiT-XL/2 和 SiT-XL/2 的 classifier-free guidance(CFG)扫描中展示了这种转变(图 7、表 14)。
核心方法和技术细节
ZID 的输入是两个样本的嵌入特征。它从三个候选检验族中保留 RISE、GPK-med 和 GPK-small。对于每个族,计算两组样本内相似度的加权和 、,并构造标准化的两个坐标 和 。在置换零分布下, 与 不相关,且 。
论文指出 与无偏经验平方 MMD 成正比(第 3.2 节),因此 主要编码无符号的联合位移;而 对比两个样本内相似度差异,符号可指示欠散或过散。例如纯尺度收缩会让两个样本内相似度朝相反方向偏离置换基准,此时信号集中在 ,而 中的贡献可能相互抵消。
ZID 取三个表示族的 、,共六个臂。每个臂先转换到双尾正态参考尾概率 ,排序后用 flat-Simes 聚合:
这一聚合单调、无上界,并允许单一臂驱动分数,也允许多个中等臂共同增强;论文称 flat-Simes 在检测和排序上位于领先组(附录 C,表 15)。
外层置换检验对所有标签置换重新计算六个臂和聚合分数,给出 Monte Carlo 置换 p 值:
诊断部分则分别对三个 和三个 做 flat-Simes,得到非负组件幅度 、。当 且参考活跃的 全为负时,诊断为欠散;全为正时诊断为过散;若符号冲突或没有活跃成员,则报告冲突或模糊;若 ,则方向不分配(第 3.4 节)。
创新点和贡献
论文的主要贡献有三点。
第一,矩匹配分析与校准检测。命题 1 把 FID 的非可辨识性推广到任意非零协方差参考分布;对 KID,若两个分布的三阶及以下混合矩匹配,则总体 KID 也为零。ZID 不被前两阶矩或三阶矩身份约束,其外层置换检验提供有限样本有效的 Monte Carlo p 值。
第二,检测覆盖与方向诊断。在八个受控偏离家族中,ZID 是唯一所有列功率都不低于 0.70 的方法;外部比较器中的最大行最小值仅为 Density 的 0.08(图 3)。这说明 ZID 在未知偏离类型下拥有较宽的检测覆盖。有符号 能在参考活跃成员符号一致时区分欠散和过散(图 4、图 7)。
第三,同类偏离内部排序一致性。在六个严重度级别上,ZID 的 Spearman 在所有八类偏离上为正,从 0.56 到 0.95;而 FID 在多样性崩塌扫描中 ,在非线性依赖、偏度、峰度与矩匹配多模态上 (图 5)。表 1 的小对大排序中,ZID 在崩塌与四个矩恢复类偏离上达到 83%–100% 正确率,而 FID 在此区间为 27%–55%。
实验结果分析
在受控特征空间实验中,论文使用真实 CIFAR-10 Inception 特征投影到 、每样本 、300 次重复、499 次置换。相比十二个外部比较器,ZID 在非线性依赖(0.97)、偏度(0.79)、峰度(0.83)、矩匹配多模态(0.71)上功率最高;但 KID 在位置偏移上领先(0.89),PERMDISP 在方差崩塌上领先(0.87),FID 在线性依赖上领先(0.87),Density 在离流形支撑上领先(0.93)(图 3)。因此论文没有主张 ZID 在每个偏离类型上都最强,而是强调其综合覆盖。
方向诊断在完整维度 Inception-2048 的对称收缩与扩张实验中得到验证。收缩和扩张会给出相反的 符号;在 基准处不分配方向。FID 无符号,且在 与 附近数值相近(图 4)。
在预训练生成器上,论文评估了 BigGAN、CIFAR DDPM、DiT-XL/2、SiT-XL/2 和 StyleGAN2-ADA。最值得注意的是 DiT 与 SiT 的 CFG 扫描:FID、KID 和 ZID 分数都在 CFG=2 附近取得各自的最小离群值,但只有 ZID 的有符号读数在低引导时报告过散、高引导时报告欠散,方向在所有六个类别中一致翻转(图 7、表 14、图 9)。在 BigGAN 截断扫描中,ZID 分数从 328 上升到 1150,且始终报告欠散(表 13)。在 StyleGAN2-ADA FFHQ 截断中,FID、KID、高斯核 MMD 和 ZID 都正确反映了收紧截断引起的恶化,但只有 ZID 提供有符号的欠散读数(表 8)。
像素空间压力测试是论文的强证据:优化图像仅匹配参考矩,FID 为 24.7,低于真实–真实 58.6;但 ZID 分数 17.2 超过所有 499 个随机置换分数(图 1)。论文明确指出,由于优化图像是针对评估参考自适应构造的,这个置换尾部是描述性的,不是校准的总体双样本 p 值(第 6 节)。
实践建议
在生成模型评估中,建议将 ZID 作为 FID/KID 的补充而非替代。FID 和 KID 在位置偏移、线性依赖或离流形支撑等场景仍有优势,但单独使用可能漏掉矩匹配攻击或方向性崩塌。
具体落地时需要注意:ZID 分数的数值只能在相同协议内比较,即相同样本量、嵌入网络、参考样本和预处理。跨实验比较分数没有意义,因为标准化偏离强度依赖于 和特征空间。报告时应同时给出 、置换 p 值,以及 (若诊断规则分配了方向)。对于高风险决策,不应只看分数,而应优先使用外层置换 p 值判断分布是否可区分。
在调参扫描(如 CFG、截断)中,可以将 视为方向指示器:正负符号分别暗示过散和欠散。这能帮助识别模型是在哪一侧失败,而无需同时解读 Precision 与 Recall 两个指标。但要注意,当 未通过或参考活跃成员符号冲突时,不要强行解读方向;此时应报告成员级符号,如论文在 CIFAR DDPM 的 15 步和 25 步中报告了 member-sign conflict(表 7)。