Dual-Stream Transformer for Generic Event Boundary Captioning


このホワイト ペーパーでは、CVPR2022 Generic Event Boundary Captioning (GEBC) コンペティションのチャンピオン ソリューションについて説明します。
GEBC では、キャプション モデルが特定のビデオ境界付近での瞬間的なステータス変化を理解する必要があるため、従来のビデオ キャプション タスクよりもはるかに困難になります。
このホワイト ペーパーでは、ビデオ コンテンツのエンコーディングとキャプション生成の両方を改善したデュアル ストリーム トランスフォーマーを提案します。
(2) 境界キャプションの識別表現を学習するために、Dual-Stream Transformer と呼ばれるモデルを特に設計します。
(3) 内容に即した人間らしいキャプションの生成に向けて、単語レベルのアンサンブル戦略を設計することにより、説明の品質を向上させます。
GEBC テスト分割の有望な結果は、提案されたモデルの有効性を示しています。


This paper describes our champion solution for the CVPR2022 Generic Event Boundary Captioning (GEBC) competition. GEBC requires the captioning model to have a comprehension of instantaneous status changes around the given video boundary, which makes it much more challenging than conventional video captioning task. In this paper, a Dual-Stream Transformer with improvements on both video content encoding and captions generation is proposed: (1) We utilize three pre-trained models to extract the video features from different granularities. Moreover, we exploit the types of boundary as hints to help the model generate captions. (2) We particularly design an model, termed as Dual-Stream Transformer, to learn discriminative representations for boundary captioning. (3) Towards generating content-relevant and human-like captions, we improve the description quality by designing a word-level ensemble strategy. The promising results on the GEBC test split demonstrate the efficacy of our proposed model.


著者 Xin Gu,Hanhua Ye,Guang Chen,Yufei Wang,Libo Zhang,Longyin Wen
発行日 2023-03-21 11:32:18+00:00
arxivサイト arxiv_id(pdf)

提供元, 利用サービス

arxiv.jp, Google

カテゴリー: cs.CL, cs.CV パーマリンク