Real-Time Video Generation with Pyramid Attention Broadcast

要約

私たちは、DiT ベースのビデオ生成のためのリアルタイム、高品質、トレーニング不要のアプローチである Pyramid Attendance Broadcast (PAB) を紹介します。
私たちの方法は、拡散プロセスにおける注意の差が U 字型のパターンを示し、顕著な冗長性を示すという観察に基づいています。
アテンション出力を後続のステップにピラミッド スタイルでブロードキャストすることで、これを軽減します。
最高の効率を得るために、分散に基づいて各アテンションに異なるブロードキャスト戦略を適用します。
さらに、より効率的な分散推論のためにブロードキャスト シーケンス並列を導入します。
PAB は、ベースラインと比較して 3 つのモデルにわたって優れた結果を示し、最大 720p ビデオのリアルタイム生成を実現します。
私たちのシンプルかつ効果的な方法が堅牢なベースラインとして機能し、ビデオ生成のための将来の研究と応用を促進すると期待しています。

要約(オリジナル)

We present Pyramid Attention Broadcast (PAB), a real-time, high quality and training-free approach for DiT-based video generation. Our method is founded on the observation that attention difference in the diffusion process exhibits a U-shaped pattern, indicating significant redundancy. We mitigate this by broadcasting attention outputs to subsequent steps in a pyramid style. It applies different broadcast strategies to each attention based on their variance for best efficiency. We further introduce broadcast sequence parallel for more efficient distributed inference. PAB demonstrates superior results across three models compared to baselines, achieving real-time generation for up to 720p videos. We anticipate that our simple yet effective method will serve as a robust baseline and facilitate future research and application for video generation.

arxiv情報

著者 Xuanlei Zhao,Xiaolong Jin,Kai Wang,Yang You
発行日 2024-08-22 17:54:21+00:00
arxivサイト arxiv_id(pdf)

提供元, 利用サービス

arxiv.jp, Google

カテゴリー: cs.CV, cs.DC パーマリンク