要約
Vibravoxは、5つの異なる体伝導オーディオセンサーを使用したオーディオ録音を含む一般データ保護規制(GDPR)に準拠したデータセットです。
データセットには、リファレンスとして使用される空中マイクからのオーディオデータも含まれています。
Vibravoxコーパスには、高次のAmbisonics 3D Spatializerによって課されるさまざまな音響条件下で188人の参加者が記録した45時間の音声サンプルと生理学的音が含まれています。
記録条件と言語転写に関する注釈もコーパスに含まれています。
音声認識、音声強化、スピーカーの検証など、さまざまな音声関連タスクに関する一連の実験を実施しました。
これらの実験は、最先端のモデルを使用して実行され、個々の特性をよりよく理解することを目的として、Vibravoxデータセットによって提供されるさまざまなオーディオセンサーによってキャプチャされた信号のパフォーマンスを評価および比較しました。
要約(オリジナル)
Vibravox is a dataset compliant with the General Data Protection Regulation (GDPR) containing audio recordings using five different body-conduction audio sensors : two in-ear microphones, two bone conduction vibration pickups and a laryngophone. The dataset also includes audio data from an airborne microphone used as a reference. The Vibravox corpus contains 45 hours of speech samples and physiological sounds recorded by 188 participants under different acoustic conditions imposed by an high order ambisonics 3D spatializer. Annotations about the recording conditions and linguistic transcriptions are also included in the corpus. We conducted a series of experiments on various speech-related tasks, including speech recognition, speech enhancement and speaker verification. These experiments were carried out using state-of-the-art models to evaluate and compare their performances on signals captured by the different audio sensors offered by the Vibravox dataset, with the aim of gaining a better grasp of their individual characteristics.
arxiv情報
著者 | Julien Hauret,Malo Olivier,Thomas Joubaud,Christophe Langrenne,Sarah Poirée,Véronique Zimpfer,Éric Bavu |
発行日 | 2025-02-21 17:42:56+00:00 |
arxivサイト | arxiv_id(pdf) |
提供元, 利用サービス
arxiv.jp, Google