eess.AS」カテゴリーアーカイブ

Open-Source Conversational AI with SpeechBrain 1.0

要約 SpeechBrain は、PyTorch に基づくオープンソースの会話 … 続きを読む

カテゴリー: cs.AI, cs.CL, cs.HC, cs.LG, eess.AS | Open-Source Conversational AI with SpeechBrain 1.0 はコメントを受け付けていません

Qwen2-Audio Technical Report

要約 Qwen-Audio の最新の進歩を紹介します。Qwen2-Audio と … 続きを読む

カテゴリー: cs.CL, cs.LG, eess.AS | Qwen2-Audio Technical Report はコメントを受け付けていません

Basic syntax from speech: Spontaneous concatenation in unsupervised deep neural networks

要約 構文の計算モデルは主にテキストベースです。 ここで、最も基本的な構文操作は … 続きを読む

カテゴリー: cs.AI, cs.CL, cs.SD, eess.AS | Basic syntax from speech: Spontaneous concatenation in unsupervised deep neural networks はコメントを受け付けていません

Pronunciation Assessment with Multi-modal Large Language Models

要約 大規模言語モデル (LLM) は、強力な会話能力で知られ、教育分野、特に言 … 続きを読む

カテゴリー: cs.CL, eess.AS | Pronunciation Assessment with Multi-modal Large Language Models はコメントを受け付けていません

From Real to Cloned Singer Identification

要約 人気歌手のクローン音声はますますリアルに聞こえ、ここ数年で人気が高まってい … 続きを読む

カテゴリー: cs.IR, cs.LG, cs.SD, eess.AS | From Real to Cloned Singer Identification はコメントを受け付けていません

SummaryMixing: A Linear-Complexity Alternative to Self-Attention for Speech Recognition and Understanding

要約 現代の音声処理システムは自己注意に依存しています。 残念ながら、自己注意を … 続きを読む

カテゴリー: cs.CL, cs.SD, eess.AS | SummaryMixing: A Linear-Complexity Alternative to Self-Attention for Speech Recognition and Understanding はコメントを受け付けていません

Are Paralinguistic Representations all that is needed for Speech Emotion Recognition?

要約 事前トレーニング済みモデル (PTM) からの表現が利用できるようになった … 続きを読む

カテゴリー: cs.CL, cs.SD, eess.AS | Are Paralinguistic Representations all that is needed for Speech Emotion Recognition? はコメントを受け付けていません

Autoregressive Speech Synthesis without Vector Quantization

要約 我々は、テキスト音声合成 (TTS) のための新しい連続値トークンベースの … 続きを読む

カテゴリー: cs.CL, cs.SD, eess.AS | Autoregressive Speech Synthesis without Vector Quantization はコメントを受け付けていません

ElasticAST: An Audio Spectrogram Transformer for All Length and Resolutions

要約 トランスフォーマーは、オーディオ分類の新しい標準として CNN ベースのア … 続きを読む

カテゴリー: cs.AI, cs.SD, eess.AS | ElasticAST: An Audio Spectrogram Transformer for All Length and Resolutions はコメントを受け付けていません

AVCap: Leveraging Audio-Visual Features as Text Tokens for Captioning

要約 近年、表現学習と言語モデルの進歩により、自動キャプション (AC) が新た … 続きを読む

カテゴリー: cs.CL, cs.LG, cs.SD, eess.AS | AVCap: Leveraging Audio-Visual Features as Text Tokens for Captioning はコメントを受け付けていません