HeadlinesBriefing favicon HeadlinesBriefing.com

训练文本到图像模型速度提升3.6倍

Hacker News •
×

TL;DR Linum v2 受限于其注意力上下文窗口:一个720p、5秒的片段耗费11万token。大多数生成系统是潜在扩散模型(LDMs),具有独立的VAE和DiT。像JiT这样的像素空间模型将它们结合,但在精细细节上表现不佳。我们提出JiT-DDT,一种新颖的编码器-解码器架构,能够恢复细节并高效训练。与Linum v2相比,JiT-DDT训练文本到图像模型所需的GPU小时数减少3.6倍,甚至能生成像素量4倍的图像。Linum v2(256×256,2.0B潜在空间DiT + VAE,256个潜在token)对比JiT-DDT(512×512,2.5B活跃像素空间DiT,320个像素token = 64个编码器 + 256个解码器)。代码和权重在Apache 2.0下可用。这是研究成果,并非完整模型发布。敬请期待Linum v3。

几乎所有生成式图像和视频模型都是LDM,使用VAE进行压缩,使用DiT进行生成。VAE单独训练并冻结,将FLUX、Ideogram和Z-Image等模型的token减少上限限制在16×16。去年秋天,Tianhong Li和Kaiming He发表了JiT,通过丢弃VAE实现了32×32的token减少。

关键实体:公司:Linum、FLUX、Ideogram、Z-Image | 人物:Tianhong Li、Kaiming He

FAQ:什么是JiT-DDT?

JiT-DDT是一种新颖的编码器-解码器架构,训练文本到图像模型的速度比Linum v2快3.6倍,同时生成的像素量是其4倍。

FAQ 问:什么是JiT-DDT?

FAQ 答:JiT-DDT是一种新颖的编码器-解码器架构,训练文本到图像模型的速度比Linum v2快3.6倍,同时生成的像素量是其4倍。