cs.SD」カテゴリーアーカイブ

joint prediction and denoising for large-scale multilingual self-supervised learning

要約 多言語自己教師あり学習 (SSL) は、多くの言語を処理するために必要な費 … 続きを読む

カテゴリー: cs.AI, cs.CL, cs.SD, eess.AS | joint prediction and denoising for large-scale multilingual self-supervised learning はコメントを受け付けていません

Learning Speech Representation From Contrastive Token-Acoustic Pretraining

要約 最小教師あり音声合成 (TTS)、音声変換 (VC)、自動音声認識 (AS … 続きを読む

カテゴリー: cs.AI, cs.CL, cs.SD, eess.AS | Learning Speech Representation From Contrastive Token-Acoustic Pretraining はコメントを受け付けていません

Late Audio-Visual Fusion for In-The-Wild Speaker Diarization

要約 話者ダイアライゼーションは、制約された音声についてはよく研究されていますが … 続きを読む

カテゴリー: cs.CL, cs.SD, eess.AS | Late Audio-Visual Fusion for In-The-Wild Speaker Diarization はコメントを受け付けていません

Speech collage: code-switched audio generation by collaging monolingual corpora

要約 コードスイッチング (CS) 用の効果的な自動音声認識 (ASR) システ … 続きを読む

カテゴリー: cs.CL, cs.LG, cs.SD, eess.AS | Speech collage: code-switched audio generation by collaging monolingual corpora はコメントを受け付けていません

Enhancing End-to-End Conversational Speech Translation Through Target Language Context Utilization

要約 より長いコンテキストを組み込むことは機械翻訳に利点があることが示されていま … 続きを読む

カテゴリー: cs.CL, cs.SD, eess.AS | Enhancing End-to-End Conversational Speech Translation Through Target Language Context Utilization はコメントを受け付けていません

Single and Multi-Speaker Cloned Voice Detection: From Perceptual to Learned Features

要約 合成音声クローン技術は近年大幅な進歩を遂げており、さまざまな潜在的な危害を … 続きを読む

カテゴリー: cs.CL, cs.SD, eess.AS | Single and Multi-Speaker Cloned Voice Detection: From Perceptual to Learned Features はコメントを受け付けていません

Exploring Speech Recognition, Translation, and Understanding with Discrete Speech Units: A Comparative Study

要約 通常、1 秒あたり数万のレートでサンプリングされる音声信号には冗長性が含ま … 続きを読む

カテゴリー: cs.CL, cs.SD, eess.AS | Exploring Speech Recognition, Translation, and Understanding with Discrete Speech Units: A Comparative Study はコメントを受け付けていません

A Deep Learning System for Domain-specific Speech Recognition

要約 マンマシンの音声インターフェイスにより、ますますインテリジェントになるマシ … 続きを読む

カテゴリー: cs.CL, cs.LG, cs.SD, eess.AS | A Deep Learning System for Domain-specific Speech Recognition はコメントを受け付けていません

Cross-Modal Multi-Tasking for Speech-to-Text Translation via Hard Parameter Sharing

要約 エンドツーエンドの音声テキスト翻訳 (ST) における最近の研究では、テキ … 続きを読む

カテゴリー: cs.CL, cs.SD, eess.AS | Cross-Modal Multi-Tasking for Speech-to-Text Translation via Hard Parameter Sharing はコメントを受け付けていません

High-Fidelity Speech Synthesis with Minimal Supervision: All Using Diffusion Models

要約 テキスト読み上げ (TTS) 手法は、音声クローン作成において有望な結果を … 続きを読む

カテゴリー: cs.AI, cs.CL, cs.SD, eess.AS | High-Fidelity Speech Synthesis with Minimal Supervision: All Using Diffusion Models はコメントを受け付けていません