-
最近の投稿
- Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control
- VizFlyt: Perception-centric Pedagogical Framework For Autonomous Aerial Robots
- Emotion estimation from video footage with LSTM
- FUSION: Frequency-guided Underwater Spatial Image recOnstructioN
- Plan-and-Act using Large Language Models for Interactive Agreement
-
最近のコメント
表示できるコメントはありません。 cs.AI (36042) cs.CL (27267) cs.CR (2746) cs.CV (41886) cs.LG (41010) cs.RO (21266) cs.SY (3212) eess.IV (4914) eess.SY (3206) stat.ML (5374)
「cs.SD」カテゴリーアーカイブ
Score-informed Music Source Separation: Improving Synthetic-to-real Generalization in Classical Music
要約 音楽ソースの分離は、楽器の混合物を構成トラックに分離するタスクです。 音楽 … 続きを読む
Self-Supervised Models for Phoneme Recognition: Applications in Children’s Speech for Reading Learning
要約 子どもの音声認識は、データの不足(特に英語以外の言語)とこのタスクの具体的 … 続きを読む
Scaling Rich Style-Prompted Text-to-Speech Datasets
要約 豊かなスタイルのキャプションでスピーチの発話を注釈する大規模なデータセット … 続きを読む
Quantification of Tenseness in English and Japanese Tense-Lax Vowels: A Lagrangian Model with Indicator $θ_1$ and Force of Tenseness Ftense(t)
要約 母音の緊張性の概念は、伝統的に時制と緩き母音のバイナリ区別を通じて調べられ … 続きを読む
DeePen: Penetration Testing for Audio Deepfake Detection
要約 ディープフェイク – 操作または偽造オーディオおよびビデオメデ … 続きを読む
InSerter: Speech Instruction Following with Unsupervised Interleaved Pre-training
要約 スピーチの大規模な言語モデル(SpeechllMS)の最近の進歩は、かなり … 続きを読む
A Multimodal Symphony: Integrating Taste and Sound through Generative AI
要約 ここ数十年で、神経科学的および心理的研究は、味と聴覚認識の間の直接的な関係 … 続きを読む
Enabling Auditory Large Language Models for Automatic Speech Quality Evaluation
要約 音声品質評価では通常、平均オピニオンスコア(MOS)や話者類似度(SIM) … 続きを読む
Offload Rethinking by Cloud Assistance for Efficient Environmental Sound Recognition on LPWANs
要約 学習ベースの環境音認識は、生物学研究や都市規模のセンシングシステムにおける … 続きを読む