MaiBaam: A Multi-Dialectal Bavarian Universal Dependency Treebank

要約

ユニバーサル依存関係 (UD) プロジェクトの成功にもかかわらず、その驚くべき言語の幅広さによって実証されていますが、依然として「言語内の幅広さ」が不足しています。ほとんどのツリーバンクは標準言語に焦点を当てています。
UD で最も注釈が多い言語であるドイツ語でさえ、これまでのところ、1,000 万人以上が話す言語の種類の 1 つであるバイエルン語に対応するツリーバンクは存在しません。
このギャップを埋めるのに貢献するために、UD で品詞と構文の依存関係情報を手動で注釈付けし、複数のテキスト ジャンル (Wiki、フィクション、文法例、ソーシャル、非言語) をカバーする初の多方言バイエルン ツリーバンク (MaiBaam) を提示します。
フィクション)。
私たちは、密接な関係にあるバイエルン語とドイツ語の形態構文上の違いを強調し、話者の正書法の豊かな多様性を示します。
私たちのコーパスには 15,000 のトークンが含まれており、3 か国にまたがるすべてのバイエルン語圏の方言をカバーしています。
ベースライン解析と POS タグ付けの結果が提供されますが、これはドイツ語で得られた結果よりも低く、異なるグラフベースのパーサー間では大幅に異なります。
バイエルン語構文に関するさらなる研究をサポートするために、私たちはデータセット、言語固有のガイドライン、コードを公開しています。

要約(オリジナル)

Despite the success of the Universal Dependencies (UD) project exemplified by its impressive language breadth, there is still a lack in `within-language breadth’: most treebanks focus on standard languages. Even for German, the language with the most annotations in UD, so far no treebank exists for one of its language varieties spoken by over 10M people: Bavarian. To contribute to closing this gap, we present the first multi-dialect Bavarian treebank (MaiBaam) manually annotated with part-of-speech and syntactic dependency information in UD, covering multiple text genres (wiki, fiction, grammar examples, social, non-fiction). We highlight the morphosyntactic differences between the closely-related Bavarian and German and showcase the rich variability of speakers’ orthographies. Our corpus includes 15k tokens, covering dialects from all Bavarian-speaking areas spanning three countries. We provide baseline parsing and POS tagging results, which are lower than results obtained on German and vary substantially between different graph-based parsers. To support further research on Bavarian syntax, we make our dataset, language-specific guidelines and code publicly available.

arxiv情報

著者 Verena Blaschke,Barbara Kovačić,Siyao Peng,Hinrich Schütze,Barbara Plank
発行日 2024-03-15 13:33:10+00:00
arxivサイト arxiv_id(pdf)

提供元, 利用サービス

arxiv.jp, Google

カテゴリー: cs.CL パーマリンク