-
最近の投稿
- Lightning UQ Box: A Comprehensive Framework for Uncertainty Quantification in Deep Learning
- Fine-Grained Expressive Power of Weisfeiler-Leman: A Homomorphism Counting Perspective
- Hybrid Feedback for Three-dimensional Convex Obstacle Avoidance (Extended version)
- Self-Deployable, Adaptive Soft Robots Based on Contracting-Cord Particle Jamming
- DecTrain: Deciding When to Train a DNN Online
-
最近のコメント
表示できるコメントはありません。 cs.AI (27713) cs.CL (20937) cs.CR (2171) cs.CV (34430) cs.LG (32450) cs.RO (15866) cs.SY (2464) eess.IV (4226) eess.SY (2458) stat.ML (4346)
「cs.SD」カテゴリーアーカイブ
AVCap: Leveraging Audio-Visual Features as Text Tokens for Captioning
要約 近年、表現学習と言語モデルの進歩により、自動キャプション (AC) が新た … 続きを読む
SaMoye: Zero-shot Singing Voice Conversion Based on Feature Disentanglement and Synthesis
要約 歌声変換 (SVC) は、元の内容を維持したまま、特定の音楽作品内の歌手の … 続きを読む
カテゴリー: 68Txx(Primary)14F05, 91Fxx(Secondary), cs.AI, cs.MM, cs.SD, eess.AS, I.2.7
SaMoye: Zero-shot Singing Voice Conversion Based on Feature Disentanglement and Synthesis はコメントを受け付けていません
RT-LA-VocE: Real-Time Low-SNR Audio-Visual Speech Enhancement
要約 このペーパーでは、今後の入力に依存せずに、ライブ ビデオ ストリームとノイ … 続きを読む
Learn and Don’t Forget: Adding a New Language to ASR Foundation Models
要約 Foundation ASR モデルは多くの場合、多くの言語をサポートしま … 続きを読む
Performance Analysis of Speech Encoders for Low-Resource SLU and ASR in Tunisian Dialect
要約 自己教師あり学習 (SSL) を通じて事前トレーニングされた音声エンコーダ … 続きを読む
Spontaneous Speech-Based Suicide Risk Detection Using Whisper and Large Language Models
要約 自殺リスクの早期発見は、自殺企図の可能性を防ぐための介入を可能にするため重 … 続きを読む
Do Prompts Really Prompt? Exploring the Prompt Understanding Capability of Whisper
要約 この研究では、プロンプトの情報が高性能音声認識モデル Whisper とど … 続きを読む
Proceedings of The second international workshop on eXplainable AI for the Arts (XAIxArts)
要約 Explainable AI for the Arts (XAIxArts … 続きを読む
Frieren: Efficient Video-to-Audio Generation with Rectified Flow Matching
要約 ビデオ – オーディオ (V2A) 生成は、サイレント ビデオ … 続きを読む