Recognition-Guided Diffusion Model for Scene Text Image Super-Resolution


シーン テキスト画像超解像度 (STISR) は、低解像度 (LR) 画像内のテキストの解像度と可読性を向上させ、その結果、シーン テキスト認識 (STR) の認識精度を向上させることを目的としています。
これまでの方法では、主に、この問題に対処するために、さまざまな形式のテキスト ガイダンスを強化した識別畳み込みニューラル ネットワーク (CNN) が使用されていました。
したがって、シーン テキスト イメージ超解像度の認識誘導拡散モデルである RGDiffSR を紹介します。これは、困難なシナリオでも優れた生成多様性と忠実性を示します。
さらに、簡潔な意味論的ガイダンスを通じて LR に一貫した結果を生成する拡散モデルを誘導する、認識ガイド付きノイズ除去ネットワークを提案します。
TextZoom データセットの実験では、テキスト認識精度と画像忠実度の両方において、従来の最先端の方法よりも RGDiffSR が優れていることが実証されました。


Scene Text Image Super-Resolution (STISR) aims to enhance the resolution and legibility of text within low-resolution (LR) images, consequently elevating recognition accuracy in Scene Text Recognition (STR). Previous methods predominantly employ discriminative Convolutional Neural Networks (CNNs) augmented with diverse forms of text guidance to address this issue. Nevertheless, they remain deficient when confronted with severely blurred images, due to their insufficient generation capability when little structural or semantic information can be extracted from original images. Therefore, we introduce RGDiffSR, a Recognition-Guided Diffusion model for scene text image Super-Resolution, which exhibits great generative diversity and fidelity even in challenging scenarios. Moreover, we propose a Recognition-Guided Denoising Network, to guide the diffusion model generating LR-consistent results through succinct semantic guidance. Experiments on the TextZoom dataset demonstrate the superiority of RGDiffSR over prior state-of-the-art methods in both text recognition accuracy and image fidelity.


著者 Yuxuan Zhou,Liangcai Gao,Zhi Tang,Baole Wei
発行日 2023-11-22 11:10:45+00:00
arxivサイト arxiv_id(pdf)

提供元, 利用サービス, Google

カテゴリー: cs.CV パーマリンク