-
最近の投稿
- FEAST: A Flexible Mealtime-Assistance System Towards In-the-Wild Personalization
- Time-Optimized Safe Navigation in Unstructured Environments through Learning Based Depth Completion
- Advances in Compliance Detection: Novel Models Using Vision-Based Tactile Sensors
- Mass-Adaptive Admittance Control for Robotic Manipulators
- DreamGen: Unlocking Generalization in Robot Learning through Video World Models
-
最近のコメント
表示できるコメントはありません。 cs.AI (39879) cs.CL (30187) cs.CV (45175) cs.HC (3051) cs.LG (44808) cs.RO (23879) cs.SY (3632) eess.IV (5170) eess.SY (3624) stat.ML (5830)
「cs.SD」カテゴリーアーカイブ
Do Prompts Really Prompt? Exploring the Prompt Understanding Capability of Whisper
要約 この研究では、プロンプトの情報が高性能音声認識モデル Whisper とど … 続きを読む
Proceedings of The second international workshop on eXplainable AI for the Arts (XAIxArts)
要約 Explainable AI for the Arts (XAIxArts … 続きを読む
Frieren: Efficient Video-to-Audio Generation with Rectified Flow Matching
要約 ビデオ – オーディオ (V2A) 生成は、サイレント ビデオ … 続きを読む
Towards Multimodal Prediction of Spontaneous Humour: A Novel Dataset and First Results
要約 ユーモアは人間の社会的行動、感情、認知の重要な要素です。 その自動理解によ … 続きを読む
MERGE — A Bimodal Dataset for Static Music Emotion Recognition
要約 音楽感情認識 (MER) 分野は、特徴エンジニアリング、機械学習、深層学習 … 続きを読む
Romanization Encoding For Multilingual ASR
要約 多言語およびコードスイッチング自動音声認識(ASR)システムを最適化するた … 続きを読む
TokenVerse: Unifying Speech and NLP Tasks via Transducer-based ASR
要約 従来の音声からの会話インテリジェンスでは、カスケード・パイプラインが使用さ … 続きを読む
Controlling Whisper: Universal Acoustic Adversarial Attacks to Control Speech Foundation Models
要約 音声認識ベースの柔軟なシステムや、音声プロンプト付きの大規模言語モデル(L … 続きを読む
Performance Analysis of Speech Encoders for Low-Resource SLU and ASR in Tunisian Dialect
要約 自己教師あり学習(SSL)によって事前に学習された音声エンコーダは、音声言 … 続きを読む