HeadlinesBriefing favicon HeadlinesBriefing.com

Обучение текст-в-изображение 3,6× быстрее

Hacker News •
×

TL;DR Linum v2 был ограничен окном контекста внимания: клип 720p длительностью 5 секунд стоил 110K токенов. Большинство генеративных систем — это модели латентной диффузии (LDMs) с отдельными VAE и DiT. Модели в пиксельном пространстве, такие как JiT, объединяют их, но испытывают трудности с мелкими деталями. Мы предлагаем JiT-DDT, новую архитектуру кодер-декодер, которая восстанавливает детали и эффективно обучается. По сравнению с Linum v2, JiT-DDT обучает модель текст-в-изображение с в 3,6× меньшим количеством GPU-часов, даже генерируя изображения с 4× пикселей. Linum v2 (256×256, DiT в латентном пространстве 2,0B + VAE, 256 латентных токенов) против JiT-DDT (512×512, DiT в активном пиксельном пространстве 2,5B, 320 пиксельных токенов = 64 кодер + 256 декодер). Код и веса доступны под Apache 2.0. Это исследовательский артефакт, а не полный релиз модели. Следите за Linum v3.

Почти все генеративные модели изображений и видео — это LDMs, использующие VAE для сжатия и DiT для генерации. VAE обучаются отдельно и замораживаются, ограничивая сокращение токенов до 16×16 для таких моделей, как FLUX, Ideogram и Z-Image. Прошлой осенью Tianhong Li и Kaiming He опубликовали JiT, достигнув сокращения токенов в 32×32 за счёт отказа от VAE.

Ключевые сущности: Компании: Linum, FLUX, Ideogram, Z-Image | Люди: Tianhong Li, Kaiming He