Food Image Classification and Segmentation with Attention-based Multiple Instance Learning


同時に、コンピューター ビジョンのアプローチは、食品分野でのタスクの自動化において大きな可能性を示しています。
従来、これらの問題に対する機械学習モデルの開発は、ピクセル レベルのクラス アノテーションを備えたトレーニング データ セットに依存していました。
ただし、このアプローチでは、データ収集とグラウンド トゥルースの生成から生じる課題が発生します。データ収集とグラウンド トゥルースの生成は、複数の設定で数千のクラスに対して実行する必要があるため、すぐにコストがかかり、エラーが発生しやすくなります。
テスト時には、モデルが分類に使用され、同時にアテンション メカニズムが食品クラスのセグメンテーションに使用されるセマンティック ヒート マップを生成します。
この論文では、提案されたアプローチの実現可能性を検証するために、FoodSeg103 データセット内の 2 つのメタクラスに対して実験を実施し、注意メカニズムの機能特性を調査します。


The demand for accurate food quantification has increased in the recent years, driven by the needs of applications in dietary monitoring. At the same time, computer vision approaches have exhibited great potential in automating tasks within the food domain. Traditionally, the development of machine learning models for these problems relies on training data sets with pixel-level class annotations. However, this approach introduces challenges arising from data collection and ground truth generation that quickly become costly and error-prone since they must be performed in multiple settings and for thousands of classes. To overcome these challenges, the paper presents a weakly supervised methodology for training food image classification and semantic segmentation models without relying on pixel-level annotations. The proposed methodology is based on a multiple instance learning approach in combination with an attention-based mechanism. At test time, the models are used for classification and, concurrently, the attention mechanism generates semantic heat maps which are used for food class segmentation. In the paper, we conduct experiments on two meta-classes within the FoodSeg103 data set to verify the feasibility of the proposed approach and we explore the functioning properties of the attention mechanism.


著者 Valasia Vlachopoulou,Ioannis Sarafis,Alexandros Papadopoulos
発行日 2023-08-22 13:59:47+00:00
arxivサイト arxiv_id(pdf)

提供元, 利用サービス, Google

カテゴリー: cs.CV パーマリンク