-
最近の投稿
- Transformer-based deep imitation learning for dual-arm robot manipulation
- Goal-conditioned dual-action imitation learning for dexterous dual-arm robot manipulation
- Motion Priors Reimagined: Adapting Flat-Terrain Skills for Complex Quadruped Mobility
- Event-based Reconfiguration Control for Time-varying Formation of Robot Swarms in Narrow Spaces
- Development of a magnetorheological hand exoskeleton featuring a high force-to-power ratio for enhanced grip endurance
-
最近のコメント
表示できるコメントはありません。 cs.AI (38544) cs.CL (29129) cs.CV (44032) cs.HC (2938) cs.LG (43457) cs.RO (22972) cs.SY (3516) eess.IV (5086) eess.SY (3508) stat.ML (5650)
「cs.SD」カテゴリーアーカイブ
Coarse-to-Fine Proposal Refinement Framework for Audio Temporal Forgery Detection and Localization
要約 最近、新しい形式の音声部分偽造がフォレンジックに課題をもたらしており、長時 … 続きを読む
Generating Sample-Based Musical Instruments Using Neural Audio Codec Language Models
要約 この論文では、テキストまたは参照音声プロンプトに基づいてサンプルベースの楽 … 続きを読む
TTSDS — Text-to-Speech Distribution Score
要約 最近公開された Text-to-Speech (TTS) システムの多くは … 続きを読む
Cross-Speaker Encoding Network for Multi-Talker Speech Recognition
要約 エンドツーエンドのマルチ話者音声認識は、複数の話者からの重複した音声を直接 … 続きを読む
J-CHAT: Japanese Large-scale Spoken Dialogue Corpus for Spoken Dialogue Language Modeling
要約 音声対話は人間と AI の対話において重要な役割を果たしており、対話指向の … 続きを読む
dMel: Speech Tokenization made Simple
要約 大規模な言語モデルは、膨大なテキスト データに対する自己教師あり事前トレー … 続きを読む
Braille-to-Speech Generator: Audio Generation Based on Joint Fine-Tuning of CLIP and Fastspeech2
要約 さまざまな程度の視覚障害に悩む中国人が増えているため、視野内の単一の画像ま … 続きを読む
Learn and Don’t Forget: Adding a New Language to ASR Foundation Models
要約 Foundation ASR モデルは多くの場合、多くの言語をサポートしま … 続きを読む
Speech-to-Speech Translation with Discrete-Unit-Based Style Transfer
要約 個別の自己教師あり表現による直接音声対音声翻訳 (S2ST) は、驚くべき … 続きを読む
Stable Audio Open
要約 オープン生成モデルはコミュニティにとって非常に重要であり、微調整が可能であ … 続きを読む