Prototype-Guided Text-based Person Search based on Rich Chinese Descriptions

要約

テキストベースの人物検索は、切り取られていないシーン画像からのクエリテキストに基づいて、ターゲット人物の位置特定と識別を同時に行うことを目的としており、これは人物検出とテキストベースの人物検索タスクの統合タスクとみなすことができます。
この研究では、広く使用されている人物検索データセット PRW に基づいて、PRW-TPS-CN という名前の大規模ベンチマーク データセットを提案します。
私たちのデータセットには 47,102 文が含まれており、既存のデータセットよりもかなり多くの情報があることを意味します。
これらのテキストは、自然な記述順序に従って、人物のイメージを上から下に正確に記述しています。
より包括的な評価を行うために、データセットには中国語と英語の両方の説明も提供しています。
これらの特性により、データセットの適用性が高まります。
人物検出とテキストベースの人物検索の間の不一致を軽減するために、PRW-TPS-CN データセットのリッチ テキストを利用します。
私たちは、人の顕著なテキストの特徴を維持するために、複数のテキストをテキスト プロトタイプとして集約することを提案します。これにより、人の性格全体がよりよく反映されます。
全体的なプロトタイプは、テキストベースの人物検索の減少の原因となる検出のずれを排除するための画像アテンション マップの生成につながります。
したがって、人物検出とテキストベースの人物検索との間の不一致が大幅に軽減されます。
私たちは PRW-TPS-CN データセットに対して広範な実験を行っています。
実験結果は、PRW-TPS-CN データセットの有効性と私たちのアプローチの最先端のパフォーマンスを示しています。

要約(オリジナル)

Text-based person search aims to simultaneously localize and identify the target person based on query text from uncropped scene images, which can be regarded as the unified task of person detection and text-based person retrieval task. In this work, we propose a large-scale benchmark dataset named PRW-TPS-CN based on the widely used person search dataset PRW. Our dataset contains 47,102 sentences, which means there is quite more information than existing dataset. These texts precisely describe the person images from top to bottom, which in line with the natural description order. We also provide both Chinese and English descriptions in our dataset for more comprehensive evaluation. These characteristics make our dataset more applicable. To alleviate the inconsistency between person detection and text-based person retrieval, we take advantage of the rich texts in PRW-TPS-CN dataset. We propose to aggregate multiple texts as text prototypes to maintain the prominent text features of a person, which can better reflect the whole character of a person. The overall prototypes lead to generating the image attention map to eliminate the detection misalignment causing the decrease of text-based person retrieval. Thus, the inconsistency between person detection and text-based person retrieval is largely alleviated. We conduct extensive experiments on the PRW-TPS-CN dataset. The experimental results show the PRW-TPS-CN dataset’s effectiveness and the state-of-the-art performance of our approach.

arxiv情報

著者 Ziqiang Wu,Bingpeng Ma
発行日 2023-12-22 17:08:14+00:00
arxivサイト arxiv_id(pdf)

提供元, 利用サービス

arxiv.jp, Google

カテゴリー: cs.CV パーマリンク