Prak: An automatic phonetic alignment tool for Czech

要約

タイトル:チェコ語の自動音声音韻アライメントツールである「Prak」

要約:

– 音声のラベリングは、音素の特定を時間的に表現するために、音声研究の手間のかかる作業です。
– 従来の手法よりも効率的で、無料かつオープンソースのツール「Prak」を開発しました。
– 「Prak」は、チェコ語のテキストから音声を生成し、オーディオと時間的に整合させることができます。
– アコースティックモデルReLU NNを使用し、56kの重みを持つ、PyTorchで小規模なCommonVoiceデータをトレーニングしました。
– アライメントと変異選択のデコーダーは、Pythonと行列ライブラリで実装されています。
– チェコ語の発音生成器は、可能な限り言語のロジックを捉えたシンプルなルールベースのブロックで構成されており、転写アプローチの詳細を変更することができます。
– Prakは、データの準備効率が向上し、Praat GUIまたはコマンドラインでMac、Linux、Windowsで使用できます。
– アルゴリズム的に、チェコ語の大部分の同化ロジックを捉え、喉頭閉鎖音の検出など、ほとんど正しい発音変異を選択することができます。
– Prakは、音声学の学生にとって使いやすく、教育的で実用的です。

要約(オリジナル)

Labeling speech down to the identity and time boundaries of phones is a labor-intensive part of phonetic research. To simplify this work, we created a free open-source tool generating phone sequences from Czech text and time-aligning them with audio. Low architecture complexity makes the design approachable for students of phonetics. Acoustic model ReLU NN with 56k weights was trained using PyTorch on small CommonVoice data. Alignment and variant selection decoder is implemented in Python with matrix library. A Czech pronunciation generator is composed of simple rule-based blocks capturing the logic of the language where possible, allowing modification of transcription approach details. Compared to tools used until now, data preparation efficiency improved, the tool is usable on Mac, Linux and Windows in Praat GUI or command line, achieves mostly correct pronunciation variant choice including glottal stop detection, algorithmically captures most of Czech assimilation logic and is both didactic and practical.

arxiv情報

著者 Václav Hanžl,Adléta Hanžlová
発行日 2023-04-17 16:51:24+00:00
arxivサイト arxiv_id(pdf)

提供元, 利用サービス

arxiv.jp, OpenAI

カテゴリー: C.m, cs.CL, cs.SD, eess.AS パーマリンク