「eess.AS」カテゴリーアーカイブ

Are Paralinguistic Representations all that is needed for Speech Emotion Recognition?

投稿日: 2024年7月12日作成者: jarxiv

要約事前トレーニング済みモデル (PTM) からの表現が利用できるようになった … 続きを読む →

カテゴリー: cs.CL, cs.SD, eess.AS | コメントを受け付けていません

Autoregressive Speech Synthesis without Vector Quantization

投稿日: 2024年7月12日作成者: jarxiv

要約我々は、テキスト音声合成 (TTS) のための新しい連続値トークンベースの … 続きを読む →

カテゴリー: cs.CL, cs.SD, eess.AS | コメントを受け付けていません

ElasticAST: An Audio Spectrogram Transformer for All Length and Resolutions

投稿日: 2024年7月12日作成者: jarxiv

要約トランスフォーマーは、オーディオ分類の新しい標準として CNN ベースのア … 続きを読む →

カテゴリー: cs.AI, cs.SD, eess.AS | コメントを受け付けていません

AVCap: Leveraging Audio-Visual Features as Text Tokens for Captioning

投稿日: 2024年7月12日作成者: jarxiv

要約近年、表現学習と言語モデルの進歩により、自動キャプション (AC) が新た … 続きを読む →

カテゴリー: cs.CL, cs.LG, cs.SD, eess.AS | コメントを受け付けていません

SaMoye: Zero-shot Singing Voice Conversion Based on Feature Disentanglement and Synthesis

投稿日: 2024年7月12日作成者: jarxiv

要約歌声変換 (SVC) は、元の内容を維持したまま、特定の音楽作品内の歌手の … 続きを読む →

カテゴリー: 68Txx(Primary)14F05, 91Fxx(Secondary), cs.AI, cs.MM, cs.SD, eess.AS, I.2.7 | コメントを受け付けていません

HebDB: a Weakly Supervised Dataset for Hebrew Speech Processing

投稿日: 2024年7月11日作成者: jarxiv

要約ヘブライ語の音声言語処理用の弱教師データセットである HebDB を紹介し … 続きを読む →

カテゴリー: cs.CL, cs.SD, eess.AS | コメントを受け付けていません

Transforming LLMs into Cross-modal and Cross-lingual Retrieval Systems

投稿日: 2024年7月11日作成者: jarxiv

要約大規模言語モデル (LLM) は、音声データとテキストデータのペアを含む … 続きを読む →

カテゴリー: cs.CL, cs.IR, cs.SD, eess.AS | コメントを受け付けていません

AVCap: Leveraging Audio-Visual Features as Text Tokens for Captioning

投稿日: 2024年7月11日作成者: jarxiv

要約近年、表現学習と言語モデルの進歩により、自動キャプション (AC) が新た … 続きを読む →

カテゴリー: cs.CL, cs.LG, cs.SD, eess.AS | コメントを受け付けていません

SaMoye: Zero-shot Singing Voice Conversion Based on Feature Disentanglement and Synthesis

投稿日: 2024年7月11日作成者: jarxiv

要約歌声変換 (SVC) は、元の内容を維持したまま、特定の音楽作品内の歌手の … 続きを読む →

カテゴリー: 68Txx(Primary)14F05, 91Fxx(Secondary), cs.AI, cs.MM, cs.SD, eess.AS, I.2.7 | コメントを受け付けていません

RT-LA-VocE: Real-Time Low-SNR Audio-Visual Speech Enhancement

投稿日: 2024年7月11日作成者: jarxiv

要約このペーパーでは、今後の入力に依存せずに、ライブビデオストリームとノイ … 続きを読む →

カテゴリー: cs.CV, cs.MM, cs.SD, eess.AS | コメントを受け付けていません

「eess.AS」カテゴリーアーカイブ

Are Paralinguistic Representations all that is needed for Speech Emotion Recognition?

Autoregressive Speech Synthesis without Vector Quantization

ElasticAST: An Audio Spectrogram Transformer for All Length and Resolutions

AVCap: Leveraging Audio-Visual Features as Text Tokens for Captioning

SaMoye: Zero-shot Singing Voice Conversion Based on Feature Disentanglement and Synthesis

HebDB: a Weakly Supervised Dataset for Hebrew Speech Processing

Transforming LLMs into Cross-modal and Cross-lingual Retrieval Systems

AVCap: Leveraging Audio-Visual Features as Text Tokens for Captioning

SaMoye: Zero-shot Singing Voice Conversion Based on Feature Disentanglement and Synthesis

RT-LA-VocE: Real-Time Low-SNR Audio-Visual Speech Enhancement

最近の投稿

最近のコメント

アーカイブ

カテゴリー