【必看】Diffusion Transformer与Rectified Flow Transformer:图像生成新突破,你了解多少?
近年来,图像生成神经网络的质量和美学有了显著提升。本文重点介绍了扩散变换器(DiT),探讨其在高质量类别条件和文本到图像生成中的关键进展。DiT于2023年由William Peebles和Saining Xie提出,基于潜在扩散架构与视觉变换器相结合,通过条件信息提升模型表现。DiT在ImageNet上的表现达到了2.27 FID,展示了其在256 × 256生成基准上的先进性。文中还提供了在Google Colaboratory上运行DiT模型的代码示例。