eess.AS」カテゴリーアーカイブ

SaMoye: Zero-shot Singing Voice Conversion Based on Feature Disentanglement and Synthesis

要約 歌声変換 (SVC) は、元の内容を維持したまま、特定の音楽作品内の歌手の … 続きを読む

カテゴリー: 68Txx(Primary)14F05, 91Fxx(Secondary), cs.AI, cs.MM, cs.SD, eess.AS, I.2.7 | SaMoye: Zero-shot Singing Voice Conversion Based on Feature Disentanglement and Synthesis はコメントを受け付けていません

HebDB: a Weakly Supervised Dataset for Hebrew Speech Processing

要約 ヘブライ語の音声言語処理用の弱教師データセットである HebDB を紹介し … 続きを読む

カテゴリー: cs.CL, cs.SD, eess.AS | HebDB: a Weakly Supervised Dataset for Hebrew Speech Processing はコメントを受け付けていません

Transforming LLMs into Cross-modal and Cross-lingual Retrieval Systems

要約 大規模言語モデル (LLM) は、音声データとテキスト データのペアを含む … 続きを読む

カテゴリー: cs.CL, cs.IR, cs.SD, eess.AS | Transforming LLMs into Cross-modal and Cross-lingual Retrieval Systems はコメントを受け付けていません

AVCap: Leveraging Audio-Visual Features as Text Tokens for Captioning

要約 近年、表現学習と言語モデルの進歩により、自動キャプション (AC) が新た … 続きを読む

カテゴリー: cs.CL, cs.LG, cs.SD, eess.AS | AVCap: Leveraging Audio-Visual Features as Text Tokens for Captioning はコメントを受け付けていません

SaMoye: Zero-shot Singing Voice Conversion Based on Feature Disentanglement and Synthesis

要約 歌声変換 (SVC) は、元の内容を維持したまま、特定の音楽作品内の歌手の … 続きを読む

カテゴリー: 68Txx(Primary)14F05, 91Fxx(Secondary), cs.AI, cs.MM, cs.SD, eess.AS, I.2.7 | SaMoye: Zero-shot Singing Voice Conversion Based on Feature Disentanglement and Synthesis はコメントを受け付けていません

RT-LA-VocE: Real-Time Low-SNR Audio-Visual Speech Enhancement

要約 このペーパーでは、今後の入力に依存せずに、ライブ ビデオ ストリームとノイ … 続きを読む

カテゴリー: cs.CV, cs.MM, cs.SD, eess.AS | RT-LA-VocE: Real-Time Low-SNR Audio-Visual Speech Enhancement はコメントを受け付けていません

Learn and Don’t Forget: Adding a New Language to ASR Foundation Models

要約 Foundation ASR モデルは多くの場合、多くの言語をサポートしま … 続きを読む

カテゴリー: cs.CL, cs.LG, cs.SD, eess.AS | Learn and Don’t Forget: Adding a New Language to ASR Foundation Models はコメントを受け付けていません

Performance Analysis of Speech Encoders for Low-Resource SLU and ASR in Tunisian Dialect

要約 自己教師あり学習 (SSL) を通じて事前トレーニングされた音声エンコーダ … 続きを読む

カテゴリー: cs.CL, cs.SD, eess.AS | Performance Analysis of Speech Encoders for Low-Resource SLU and ASR in Tunisian Dialect はコメントを受け付けていません

Listen and Speak Fairly: A Study on Semantic Gender Bias in Speech Integrated Large Language Models

要約 音声統合大規模言語モデル (SILLM) は、大規模言語モデルと音声認識を … 続きを読む

カテゴリー: cs.CL, cs.CY, eess.AS | Listen and Speak Fairly: A Study on Semantic Gender Bias in Speech Integrated Large Language Models はコメントを受け付けていません

Spontaneous Speech-Based Suicide Risk Detection Using Whisper and Large Language Models

要約 自殺リスクの早期発見は、自殺企図の可能性を防ぐための介入を可能にするため重 … 続きを読む

カテゴリー: cs.CL, cs.SD, eess.AS | Spontaneous Speech-Based Suicide Risk Detection Using Whisper and Large Language Models はコメントを受け付けていません