Five Years of COVID-19 Discourse on Instagram: A Labeled Instagram Dataset of Over Half a Million Posts for Multilingual Sentiment Analysis

要約

この論文で紹介されている研究は、Instagram 上の新型コロナウイルス感染症関連投稿のマイニングと分析に特に焦点を当てた 3 つの科学的貢献を行っています。
まず、2020 年 1 月から 2024 年 9 月までに公開された、新型コロナウイルス感染症 (COVID-19) に関する 500,153 件の Instagram 投稿の多言語データセットを示しています。このデータセットは https://dx.doi.org/10.21227/d46p-v480 で入手でき、161 の異なる形式の Instagram 投稿が含まれています。
言語と 535,021 の異なるハッシュタグ。
このデータセットの開発後、各投稿をポジティブ、ネガティブ、またはニュートラルに分類する多言語センチメント分析が実行されました。
センチメント分析の結果は、このデータセット内の別の属性として表示されます。
次に、2020 年から 2024 年までの年ごとのセンチメント分析の結果を示しています。その結果、パンデミックが始まって以来、Instagram 上での 新型コロナウイルス感染症 (COVID-19) に関連するセンチメントの傾向が明らかになりました。
たとえば、2020 年から 2024 年にかけてセンチメント傾向は顕著な変化を示し、ポジティブなセンチメントは 38.35% から 28.69% に減少し、一方、中立的なセンチメントは 44.19% から 58.34% に上昇しました。
最後に、この論文では言語固有の感情分析の結果も紹介しています。
この分析では、Instagram 上でさまざまな言語で公開された投稿間の感情の類似および対照的な傾向が浮き彫りになりました。
たとえば、英語の投稿全体のうち、49.68% が肯定的、14.84% が否定的、35.48% が中立的でした。
対照的に、ヒンディー語の投稿では、4.40% が肯定的、57.04% が否定的、38.56% が中立的であり、これら 2 つの言語間の感情分布の明確な違いを反映しています。

要約(オリジナル)

The work presented in this paper makes three scientific contributions with a specific focus on mining and analysis of COVID-19-related posts on Instagram. First, it presents a multilingual dataset of 500,153 Instagram posts about COVID-19 published between January 2020 and September 2024. This dataset, available at https://dx.doi.org/10.21227/d46p-v480, contains Instagram posts in 161 different languages as well as 535,021 distinct hashtags. After the development of this dataset, multilingual sentiment analysis was performed, which involved classifying each post as positive, negative, or neutral. The results of sentiment analysis are presented as a separate attribute in this dataset. Second, it presents the results of performing sentiment analysis per year from 2020 to 2024. The findings revealed the trends in sentiment related to COVID-19 on Instagram since the beginning of the pandemic. For instance, between 2020 and 2024, the sentiment trends show a notable shift, with positive sentiment decreasing from 38.35% to 28.69%, while neutral sentiment rising from 44.19% to 58.34%. Finally, the paper also presents findings of language-specific sentiment analysis. This analysis highlighted similar and contrasting trends of sentiment across posts published in different languages on Instagram. For instance, out of all English posts, 49.68% were positive, 14.84% were negative, and 35.48% were neutral. In contrast, among Hindi posts, 4.40% were positive, 57.04% were negative, and 38.56% were neutral, reflecting distinct differences in the sentiment distribution between these two languages.

arxiv情報

著者 Nirmalya Thakur
発行日 2024-10-16 14:11:21+00:00
arxivサイト arxiv_id(pdf)

提供元, 利用サービス

arxiv.jp, Google

カテゴリー: cs.AI, cs.CL, cs.CY, cs.LG, cs.SI, H.2.8 パーマリンク