Open Korean Corpora: A Practical Report

要約

研究コミュニティでは、韓国語はリソースが少ない言語と呼ばれることがよくあります。
この主張は部分的には真実ですが、リソースの利用可能性が適切に宣伝および管理されていないためでもあります。
この研究では、韓国のコーパスのリストを厳選してレビューし、最初に機関レベルのリソース開発について説明し、次にさまざまな種類のタスクについて現在オープンなデータセットのリストをさらに反復処理します。
次に、研究を促進するために、リソースの少ない言語に対してオープンソースのデータセットの構築とリリースをどのように行うべきかについての方向性を提案します。

要約(オリジナル)

Korean is often referred to as a low-resource language in the research community. While this claim is partially true, it is also because the availability of resources is inadequately advertised and curated. This work curates and reviews a list of Korean corpora, first describing institution-level resource development, then further iterate through a list of current open datasets for different types of tasks. We then propose a direction on how open-source dataset construction and releases should be done for less-resourced languages to promote research.

arxiv情報

著者 Won Ik Cho,Sangwhan Moon,Youngsook Song
発行日 2023-05-16 17:08:24+00:00
arxivサイト arxiv_id(pdf)

提供元, 利用サービス

arxiv.jp, Google

カテゴリー: cs.CL パーマリンク