eess.AS」カテゴリーアーカイブ

Do Prompts Really Prompt? Exploring the Prompt Understanding Capability of Whisper

要約 この研究では、プロンプトの情報が高性能音声認識モデル Whisper とど … 続きを読む

カテゴリー: cs.CL, cs.SD, eess.AS | Do Prompts Really Prompt? Exploring the Prompt Understanding Capability of Whisper はコメントを受け付けていません

Proceedings of The second international workshop on eXplainable AI for the Arts (XAIxArts)

要約 Explainable AI for the Arts (XAIxArts … 続きを読む

カテゴリー: cs.AI, cs.HC, cs.MM, cs.SD, eess.AS | Proceedings of The second international workshop on eXplainable AI for the Arts (XAIxArts) はコメントを受け付けていません

Frieren: Efficient Video-to-Audio Generation with Rectified Flow Matching

要約 ビデオ – オーディオ (V2A) 生成は、サイレント ビデオ … 続きを読む

カテゴリー: cs.CV, cs.MM, cs.SD, eess.AS | Frieren: Efficient Video-to-Audio Generation with Rectified Flow Matching はコメントを受け付けていません

Towards Multimodal Prediction of Spontaneous Humour: A Novel Dataset and First Results

要約 ユーモアは人間の社会的行動、感情、認知の重要な要素です。 その自動理解によ … 続きを読む

カテゴリー: cs.CL, cs.CV, cs.LG, cs.MM, cs.SD, eess.AS | Towards Multimodal Prediction of Spontaneous Humour: A Novel Dataset and First Results はコメントを受け付けていません

Multitaper mel-spectrograms for keyword spotting

要約 キーワードスポッティング(KWS)は、特徴表現の品質に最も敏感な音声認識タ … 続きを読む

カテゴリー: cs.LG, eess.AS | Multitaper mel-spectrograms for keyword spotting はコメントを受け付けていません

Romanization Encoding For Multilingual ASR

要約 多言語およびコードスイッチング自動音声認識(ASR)システムを最適化するた … 続きを読む

カテゴリー: cs.CL, cs.SD, eess.AS | Romanization Encoding For Multilingual ASR はコメントを受け付けていません

TokenVerse: Unifying Speech and NLP Tasks via Transducer-based ASR

要約 従来の音声からの会話インテリジェンスでは、カスケード・パイプラインが使用さ … 続きを読む

カテゴリー: cs.CL, cs.SD, eess.AS | TokenVerse: Unifying Speech and NLP Tasks via Transducer-based ASR はコメントを受け付けていません

Controlling Whisper: Universal Acoustic Adversarial Attacks to Control Speech Foundation Models

要約 音声認識ベースの柔軟なシステムや、音声プロンプト付きの大規模言語モデル(L … 続きを読む

カテゴリー: cs.CL, cs.SD, eess.AS | Controlling Whisper: Universal Acoustic Adversarial Attacks to Control Speech Foundation Models はコメントを受け付けていません

Performance Analysis of Speech Encoders for Low-Resource SLU and ASR in Tunisian Dialect

要約 自己教師あり学習(SSL)によって事前に学習された音声エンコーダは、音声言 … 続きを読む

カテゴリー: cs.CL, cs.SD, eess.AS | Performance Analysis of Speech Encoders for Low-Resource SLU and ASR in Tunisian Dialect はコメントを受け付けていません

Written Term Detection Improves Spoken Term Detection

要約 キーワード検索(KWS)に対するエンドツーエンド(E2E)アプローチは、自 … 続きを読む

カテゴリー: cs.CL, eess.AS | Written Term Detection Improves Spoken Term Detection はコメントを受け付けていません