HeadlinesBriefing favicon HeadlinesBriefing.com

生成動画事前学習のためのデータフィルタリング

Hacker News •
×

画像と動画モデルは過去数年で大きく向上しましたが、これらモデルの内部はStable Diffusion 3以来ほとんど変わっていません。もちろん、GPT-Imageが流行らせたオートリグレッシブ拡散のような小さな変種もあります。しかし高レベルでは、 basically すべて flow matching トランスフォーマーバックボーンとv-prediction目的です。

我々の経験上、大部分の利益は直接的に3つのデータ改善の味に帰属します:データフィルタリング&リバランス、データアノテーション、および合成データ生成。 RL は一部の改善をもたらしましたが、画像と動画で本当に効果を上げ始めたのはここ数ヶ月です。

数年前、すべての生成モデルで prevailing wisdom は、人為的に可能な限り多くのデータを事前学習に集約することでした。幸いなことに、分野はこの点についてかなり賢くなっています。 low品質のデータを事前学習に大量に投げ込むと、モデルは学習容量をそのデータの一部を模倣するのに浪費します。 データセットをうまくフィルタリングすれば、モデルは学習したいことを学習しやすくなります。

我々は2024年以降のデータフィルタリングのアプローチの進化について説明し、将来的に自ら生成モデルを訓練することになった場合のいくつかの頭痛の種からあなたを救えることを願っています。