Text Intimacy Analysis using Ensembles of Multilingual Transformers


NLP システムと人間との直接的な対話の増加により、特定のテキストの親密さの推定が最近重要性を増しています。
このペーパーでは、指定されたテキストの親密さのレベルを予測するという SemEval 共有タスク 9 での作業を紹介します。
データセットは 10 言語のツイートで構成されており、そのうちトレーニング データセットで利用できるのは 6 言語のみです。


Intimacy estimation of a given text has recently gained importance due to the increase in direct interaction of NLP systems with humans. Intimacy is an important aspect of natural language and has a substantial impact on our everyday communication. Thus the level of intimacy can provide us with deeper insights and richer semantics of conversations. In this paper, we present our work on the SemEval shared task 9 on predicting the level of intimacy for the given text. The dataset consists of tweets in ten languages, out of which only six are available in the training dataset. We conduct several experiments and show that an ensemble of multilingual models along with a language-specific monolingual model has the best performance. We also evaluate other data augmentation methods such as translation and present the results. Lastly, we study the results thoroughly and present some noteworthy insights into this problem.


著者 Tanmay Chavan,Ved Patwardhan
発行日 2023-12-05 09:04:22+00:00
arxivサイト arxiv_id(pdf)

提供元, 利用サービス

arxiv.jp, Google

カテゴリー: cs.CL パーマリンク