-
最近の投稿
- FEAST: A Flexible Mealtime-Assistance System Towards In-the-Wild Personalization
- Time-Optimized Safe Navigation in Unstructured Environments through Learning Based Depth Completion
- Advances in Compliance Detection: Novel Models Using Vision-Based Tactile Sensors
- Mass-Adaptive Admittance Control for Robotic Manipulators
- DreamGen: Unlocking Generalization in Robot Learning through Video World Models
-
最近のコメント
表示できるコメントはありません。 cs.AI (39879) cs.CL (30187) cs.CV (45175) cs.HC (3051) cs.LG (44808) cs.RO (23879) cs.SY (3632) eess.IV (5170) eess.SY (3624) stat.ML (5830)
「cs.SD」カテゴリーアーカイブ
MMTrail: A Multimodal Trailer Video Dataset with Language and Music Descriptions
要約 大規模なマルチモダリティ データセットは、大規模なビデオ言語モデルの成功を … 続きを読む
Stem-JEPA: A Joint-Embedding Predictive Architecture for Musical Stem Compatibility Estimation
要約 この論文では、特定の音楽コンテキストとよく調和する単一の楽器の音声録音を特 … 続きを読む
An approach to optimize inference of the DIART speaker diarization pipeline
要約 話者ダイアライゼーションは、音声ファイルについて「誰がいつ話したか」という … 続きを読む
Clustering and Mining Accented Speech for Inclusive and Fair Speech Recognition
要約 最新の自動音声認識 (ASR) システムは通常、数万時間以上の音声データに … 続きを読む
Language Model Can Listen While Speaking
要約 対話は、人間とコンピューターの対話 (HCI) の最も自然な方法として機能 … 続きを読む
MuChoMusic: Evaluating Music Understanding in Multimodal Audio-Language Models
要約 音声と言語を共同で処理するマルチモーダルモデルは、音声理解において大きな可 … 続きを読む
Out-Of-Distribution Detection for Audio-visual Generalized Zero-Shot Learning: A General Framework
要約 一般化ゼロショット学習(GZSL)は、見たクラスと見たことのないクラスの両 … 続きを読む
DiM-Gesture: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2 framework
要約 音声駆動型ジェスチャ生成は、バーチャルヒューマン創作における新たな領域であ … 続きを読む
ChordSync: Conformer-Based Alignment of Chord Annotations to Music Audio
要約 西洋音楽の伝統において、和音は和声の主要な構成要素であり、音楽の基本的な側 … 続きを読む
Bailing-TTS: Chinese Dialectal Speech Synthesis Towards Human-like Spontaneous Representation
要約 近年、大規模音声合成(TTS)モデルは大きな進歩を遂げているが、中国語の方 … 続きを読む