-
最近の投稿
- Scaling Policy Gradient Quality-Diversity with Massive Parallelization via Behavioral Variations
- Integrating LMM Planners and 3D Skill Policies for Generalizable Manipulation
- Clarke Transform and Encoder-Decoder Architecture for Arbitrary Joints Locations in Displacement-Actuated Continuum Robots
- One Stack, Diverse Vehicles: Checking Safe Portability of Automated Driving Software
- Designing Kresling Origami for Personalised Wrist Orthosis
-
最近のコメント
表示できるコメントはありません。 cs.AI (33060) cs.CL (24993) cs.CR (2556) cs.CV (39181) cs.LG (37978) cs.RO (19224) cs.SY (2943) eess.IV (4695) eess.SY (2937) stat.ML (4995)
「cs.SD」カテゴリーアーカイブ
Learn and Don’t Forget: Adding a New Language to ASR Foundation Models
要約 Foundation ASR モデルは多くの場合、多くの言語をサポートしま … 続きを読む
Performance Analysis of Speech Encoders for Low-Resource SLU and ASR in Tunisian Dialect
要約 自己教師あり学習 (SSL) を通じて事前トレーニングされた音声エンコーダ … 続きを読む
Spontaneous Speech-Based Suicide Risk Detection Using Whisper and Large Language Models
要約 自殺リスクの早期発見は、自殺企図の可能性を防ぐための介入を可能にするため重 … 続きを読む
Do Prompts Really Prompt? Exploring the Prompt Understanding Capability of Whisper
要約 この研究では、プロンプトの情報が高性能音声認識モデル Whisper とど … 続きを読む
Proceedings of The second international workshop on eXplainable AI for the Arts (XAIxArts)
要約 Explainable AI for the Arts (XAIxArts … 続きを読む
Frieren: Efficient Video-to-Audio Generation with Rectified Flow Matching
要約 ビデオ – オーディオ (V2A) 生成は、サイレント ビデオ … 続きを読む
Towards Multimodal Prediction of Spontaneous Humour: A Novel Dataset and First Results
要約 ユーモアは人間の社会的行動、感情、認知の重要な要素です。 その自動理解によ … 続きを読む
MERGE — A Bimodal Dataset for Static Music Emotion Recognition
要約 音楽感情認識 (MER) 分野は、特徴エンジニアリング、機械学習、深層学習 … 続きを読む
Romanization Encoding For Multilingual ASR
要約 多言語およびコードスイッチング自動音声認識(ASR)システムを最適化するた … 続きを読む
TokenVerse: Unifying Speech and NLP Tasks via Transducer-based ASR
要約 従来の音声からの会話インテリジェンスでは、カスケード・パイプラインが使用さ … 続きを読む