是什么
扩散模型的机制分为前向过程与反向过程。前向过程按固定调度向训练数据逐步添加高斯噪声,直到接近纯噪声。反向过程使用神经网络(常用 U-Net 或 DiT)学习每步的去噪操作。生成阶段从随机噪声出发,迭代去噪几百步(或经蒸馏缩减至少数步)生成最终内容。
为降低计算量,潜空间扩散路线先利用 VAE 将数据压缩至低维潜空间,在该空间内完成扩散过程,这是消费级硬件可行的关键。对于文生图等条件生成任务,文本条件会通过交叉注意力机制注入去噪网络,以指导生成方向。
解决什么问题
扩散模型解决了以往生成模型在训练稳定性和模式覆盖上的缺陷。相比 GAN,扩散模型无需对抗训练,过程平稳且模式覆盖全面。它凭借高质量的生成效果,替代了传统的生成范式,成为当前图像和视频生成领域的默认选择,也是生成侧算法岗位的核心基础考点。
面试怎么考
面试常考加噪去噪流程,需熟练描述前向与反向过程的机制。潜空间扩散是高频考点,需回答为什么在潜空间操作以及 VAE 的具体作用。
文本条件的注入机制也是重点,需解释交叉注意力如何引入文本特征。此外,面试官常要求对比扩散模型与 GAN 及 Flow Matching 的优缺点,重点说明在训练稳定性、采样速度和生成多样性上的差异。
又称:扩散模型 · Diffusion · DDPM · Stable Diffusion
接着做点什么
—— 本条完 ——