HeadlinesBriefing favicon HeadlinesBriefing.com

テキストから画像へのモデルを3.6倍高速にトレーニング

Hacker News •
×

TL;DR Linum v2はアテンションコンテキストウィンドウによってボトルネックになっていました:720p、5秒のクリップで110Kトークンを消費しました。ほとんどの生成システムは、別々のVAEとDiTを持つ潜在拡散モデル(LDM)です。JiTのようなピクセル空間モデルはそれらを統合しますが、細かいディテールに苦労します。私たちはJiT-DDTを提案します。これはディテールを回復し、効率的にトレーニングする新しいエンコーダ・デコーダアーキテクチャです。Linum v2に対して、JiT-DDTは3.6倍少ないGPU時間でテキストから画像へのモデルをトレーニングし、4倍のピクセルの画像を生成することさえできます。Linum v2(256×256、2.0B潜在空間DiT + VAE、256潜在トークン)対JiT-DDT(512×512、2.5Bアクティブピクセル空間DiT、320ピクセルトークン = 64エンコーダ + 256デコーダ)。コードと重みはApache 2.0の下で利用可能です。これは研究成果物であり、完全なモデルリリースではありません。Linum v3にご期待ください。

ほとんどすべての生成画像および動画モデルはLDMであり、圧縮にVAE、生成にDiTを使用します。VAEは別々にトレーニングされ凍結されるため、FLUX、Ideogram、Z-Imageなどのモデルのトークン削減は16×16に制限されます。昨秋、Tianhong LiとKaiming HeはJiTを発表し、VAEを捨てることで32×32のトークン削減を達成しました。

主要エンティティ:企業:Linum、FLUX、Ideogram、Z-Image | 人物:Tianhong Li、Kaiming He

FAQ:JiT-DDTとは何ですか?

JiT-DDTは、Linum v2よりも3.6倍高速にテキストから画像へのモデルをトレーニングし、4倍のピクセルを生成する新しいエンコーダ・デコーダアーキテクチャです。

FAQ Q:JiT-DDTとは何ですか?

FAQ A:JiT-DDTは、Linum v2よりも3.6倍高速にテキストから画像へのモデルをトレーニングし、4倍のピクセルを生成する新しいエンコーダ・デコーダアーキテクチャです。