研究作者与发表信息
本研究由苏黎世联邦理工学院(ETH Zürich)的Seyedmorteza Sadat和Otmar Hilliges,以及迪士尼研究院(DisneyResearch|Studios)的Jakob Buhmann、Derek Bradley和Romann M. Weber共同完成。该论文已被机器学习领域的顶级学术会议ICLR 2024接收并发表,题为《CADS: Unleashing the Diversity of Diffusion Models through Condition-Annealed Sampling》。
学术背景与研究动机
本研究聚焦于生成式人工智能领域,特别是条件扩散模型(conditional diffusion models)的采样技术。扩散模型,如去噪扩散概率模型(Denoising Diffusion Probabilistic Models, DDPMs),因其训练稳定性高和图像生成质量好,已成为图像生成任务的最新技术。然而,该领域长期面临一个核心挑战:输出多样性与样本质量之间的权衡。为了获得最佳的图像质量,研究者通常采用较高的无分类器引导(Classifier-Free Guidance, CFG)尺度进行采样,但这会显著降低生成样本的多样性,导致无论初始随机种子如何变化,生成的图像在构图和内容上都趋于相似。此外,当训练数据集规模较小时,条件扩散模型的输出多样性不足问题更为突出。现有的解决方案,如降低引导尺度或扩大训练数据集,并不能完美地解决问题,因为前者会损害图像质量,后者在许多领域并不可行,且即使是在海量数据上训练的模型(如Stable Diffusion)在特定条件下仍可能出现多样性不足。因此,本研究旨在提出一种新的采样策略,在不牺牲图像质量的前提下,有效提升条件扩散模型生成结果的多样性,尤其是解决高引导尺度下的多样性崩塌问题。
核心方法与工作流程
本研究的核心创新是一种名为条件退火扩散采样器(Condition-Annealed Diffusion Sampler, CADS)的技术。该方法的根本思想是打破并逐步恢复推理过程中生成结果对条件信号的统计依赖。CADS的工作流程主要包含以下步骤:
条件信号扰动: 在推理的每一步,根据一个预定的策略向原始条件信号 $y$ 添加高斯噪声,生成扰动后的条件信号$ŷ$。其公式为 $ŷ = \gamma(t)y + s\sqrt{1 - \gamma(t)}n$,其中 $n$ 是从标准正态分布中采样的噪声,$s$ 控制初始噪声尺度,而 $\gamma(t)$ 是控制噪声退火进度的核心函数。
退火调度策略: 研究设计了一个分段线性函数 $\gamma(t)$ 来控制噪声的衰减。在推理过程的早期(时间步$t$较大,对应于扩散模型的逆向过程从纯噪声到清晰图像的早期阶段),$\gamma(t)$接近0,这意味着条件信号被极大地破坏,生成过程几乎忽略条件信息,转而依赖无条件数据分布进行全局探索。随着推理的进行,$\gamma(t)$逐渐线性增加至1,噪声影响随之减弱。当采样进入后期阶段(时间步$t$小于阈值$\tau_1$),$\gamma(t)$变为1,条件信号完全恢复,迫使生成过程精确对齐到给定的条件。这种由强到弱的噪声注入策略,实现了从“全局多样性探索”到“局部条件对齐”的平滑过渡。
条件信号重标定: 为了防止添加噪声改变条件向量的均值和标准差,可能导致采样过程发散,CADS引入了一个可选的重标定和混合步骤。它将扰动后的向量重新缩放至其原始统计特性,并通过一个混合因子$\psi$与未重标定的扰动向量进行混合,这增加了采样的稳定性。
该方法是即插即用的,无需对预训练模型进行任何重新训练或微调,可直接集成到任何扩散模型采样器(如DDPM、DDIM、DPM++等)中,且计算开销极小,仅需额外的加法运算。为了评估CADS的有效性,研究者在四个条件生成任务上进行了全面的实验:ImageNet数据库上的类别条件生成(使用DiT-XL/2模型,分辨率包括256×256和512×512)、姿态到图像的生成(在DeepFashion和SHHQ数据集上,使用自行训练的扩散模型)、身份条件人脸合成(使用ID3PM模型)以及文本到图像的生成(使用Stable Diffusion v2.1模型)。评估指标涵盖了图像质量(FID, IS, 精度Precision)、多样性(召回率Recall, MSS, Vendi评分)以及条件对齐度(类别准确率, MPJPE, CLIP-Score)。
主要实验结果与分析
CADS在多个任务上一致且显著地提升了生成样本的多样性,同时保持了高图像质量。在与标准DDPM采样的量化对比中,所有任务的关键指标均得到了大幅改善。例如,在DeepFashion姿态生成任务中,FID(Fréchet Inception Distance)分数从16.36降至7.73,召回率从0.02飙升至0.48;在256×256分辨率的ImageNet类别生成任务中,FID从20.83降至9.47,召回率从0.32提升至0.62。这些数据有力地证明了CADS在修复模式坍塌、提高分布覆盖率方面的能力。
最为瞩目的是,通过使用CADS,研究团队利用现有的DiT-XL/2模型,将ImageNet 256×256和512×512类别生成任务的FID分别推至1.70和2.31,在发表时均达到了最先进水平(state-of-the-art)。这一成就纯粹通过改进采样算法达成,凸显了CADS的巨大潜力。
通过研究引导尺度与CADS的关系发现,CADS能有效缓解CFG尺度增加带来的多样性衰减问题。随着引导尺度从低到高,使用CADS采样的FID和召回率指标恶化程度远小于标准采样,这证明CADS解锁了高引导尺度在提升质量方面的优势,而无须付出多样性下降的沉重代价。在条件对齐性测试中,CADS在姿态和文本对齐上与标准采样保持一致,仅在类别条件生成中有轻微准确率下降,这归因于输出多样性的大幅提升。
论文还通过消融实验深入分析了CADS的关键超参数:(1)噪声尺度$s$: 过小则多样性提升有限,过大则会损害图像质量。(2)截止阈值$\tau_1$: 决定了条件信号何时完全恢复,过早恢复限制多样性,过晚恢复则影响质量。(3)重标定因子$\psi$: 起到了正则化作用,较高$\psi$值提供更稳定的采样和更高质量,但会略微降低多样性。此外,研究还对比了“动态无分类器引导(Dynamic CFG)”的策略,即直接动态调整引导权重。结果表明,虽然动态CFG也能提升多样性,但其效果远不如CADS,从而证实了向条件信号注入噪声这一随机性操作的独特价值,而非常规的权重调节。
结论与研究价值
本研究成功地解决了扩散模型领域长期存在的质量-多样性权衡难题,通过精巧的条件退火机制,在不牺牲质量的情况下显著提升了生成多样性。其科学价值在于,它深刻地揭示了条件信号在推理阶段对生成多样性的主导作用,并从理论上将条件退火与朗之万动力学(Langevin Dynamics)以及分数平滑(Score Smoothing)联系起来,为理解和控制生成模型的多样性提供了新的视角。
在应用价值层面,CADS作为一个高度通用的、即插即用的插件,其无需重训练和极小计算开销的特性,使其具有极高的实用性和普惠性,可以被轻松集成到几乎所有的现有预训练扩散模型和工作流程中,极大提升内容创作的多样性和丰富度。
研究亮点
本研究的亮点可归纳为:问题发现上,精准定位了条件信号导致高引导尺度下多样性不足的机制;方法创新上,提出了高效且普适的CADS采样策略,通过向条件信号而非生成过程本身添加退火噪声来实现多样性增强;性能突破上,仅靠采样算法改进便刷新了ImageNet图像生成任务的FID世界纪录;理论洞见上,建立了条件退火与朗之万动力学、分数平滑之间的桥梁,为方法提供了坚实的理论基础。