The ‘Colonial Impulse’ of Natural Language Processing: An Audit of Bengali Sentiment Analysis Tools and Their Identity-based Biases

要約

植民地化は社会歴史的にさまざまな側面で人々のアイデンティティに影響を与えてきましたが、植民地時代の価値観と偏見は社会工学的システムによって永続し続けています。
社会技術システムのカテゴリーの 1 つである感情分析ツールも、植民地時代の価値観や偏見を永続させる可能性がありますが、こうしたツールはさまざまな慣行 (コンテンツなど) を導くためによく使用されているにもかかわらず、植民地主義の永続にどのように加担するかについてはあまり注目されていません。
節度)。
この論文では、植民地主義の影響を経験し、今も経験し続けているベンガル人コミュニティを対象に、感情分析ツールの潜在的なバイアスを調査します。
地元のベンガル人コミュニティの間で植民地主義の影響を最も受けたアイデンティティのカテゴリーを利用して、私たちは性別、宗教、国籍に分析の焦点を当てました。
私たちは、Python パッケージ インデックス (PyPI) と GitHub で利用可能なベンガル語用のすべてのセンチメント分析ツールのアルゴリズム監査を実施しました。
意味論的な内容と構造は類似しているにもかかわらず、私たちの分析では、さまざまなツールからの出力に一貫性がないことに加えて、ベンガル語感情分析ツールは異なるアイデンティティ カテゴリ間で偏りを示し、アイデンティティ表現の異なる方法に対して異なる反応を示していることがわかりました。
私たちの調査結果をベンガル人コミュニティの植民地時代に形成された社会文化構造と結び付けて、感情分析ツールの下流バイアスの影響について議論します。

要約(オリジナル)

While colonization has sociohistorically impacted people’s identities across various dimensions, those colonial values and biases continue to be perpetuated by sociotechnical systems. One category of sociotechnical systems–sentiment analysis tools–can also perpetuate colonial values and bias, yet less attention has been paid to how such tools may be complicit in perpetuating coloniality, although they are often used to guide various practices (e.g., content moderation). In this paper, we explore potential bias in sentiment analysis tools in the context of Bengali communities that have experienced and continue to experience the impacts of colonialism. Drawing on identity categories most impacted by colonialism amongst local Bengali communities, we focused our analytic attention on gender, religion, and nationality. We conducted an algorithmic audit of all sentiment analysis tools for Bengali, available on the Python package index (PyPI) and GitHub. Despite similar semantic content and structure, our analyses showed that in addition to inconsistencies in output from different tools, Bengali sentiment analysis tools exhibit bias between different identity categories and respond differently to different ways of identity expression. Connecting our findings with colonially shaped sociocultural structures of Bengali communities, we discuss the implications of downstream bias of sentiment analysis tools.

arxiv情報

著者 Dipto Das,Shion Guha,Jed Brubaker,Bryan Semaan
発行日 2024-01-19 07:21:45+00:00
arxivサイト arxiv_id(pdf)

提供元, 利用サービス

arxiv.jp, Google

カテゴリー: cs.CL, cs.CY, cs.HC, cs.LG パーマリンク