eess.AS」カテゴリーアーカイブ

Exploration of Adapter for Noise Robust Automatic Speech Recognition

要約 目に見えない騒音シナリオに対処するには、堅牢な自動音声認識 (ASR) シ … 続きを読む

カテゴリー: cs.CL, cs.SD, eess.AS | Exploration of Adapter for Noise Robust Automatic Speech Recognition はコメントを受け付けていません

Diffusion-Based Speech Enhancement with Joint Generative and Predictive Decoders

要約 拡散ベースの生成音声強調 (SE) が最近注目を集めていますが、逆拡散には … 続きを読む

カテゴリー: cs.CL, cs.SD, eess.AS | Diffusion-Based Speech Enhancement with Joint Generative and Predictive Decoders はコメントを受け付けていません

Structure-informed Positional Encoding for Music Generation

要約 ディープラーニング手法によって生成された音楽は、多くの場合、一貫性や長期に … 続きを読む

カテゴリー: cs.AI, cs.SD, eess.AS | Structure-informed Positional Encoding for Music Generation はコメントを受け付けていません

EchoTrack: Auditory Referring Multi-Object Tracking for Autonomous Driving

要約 本稿では、音声表現に基づいてビデオシーケンス内の特定のオブジェクトを動的に … 続きを読む

カテゴリー: cs.CV, cs.RO, eess.AS, eess.IV | EchoTrack: Auditory Referring Multi-Object Tracking for Autonomous Driving はコメントを受け付けていません

Real-time Low-latency Music Source Separation using Hybrid Spectrogram-TasNet

要約 近年、音楽デミックスのための深層学習が大幅に進歩しました。 しかし、これら … 続きを読む

カテゴリー: cs.LG, cs.SD, eess.AS, I.5.1 | Real-time Low-latency Music Source Separation using Hybrid Spectrogram-TasNet はコメントを受け付けていません

Cross-lingual Text-To-Speech with Flow-based Voice Conversion for Improved Pronunciation

要約 この論文では、元の話者の言語に関係なくターゲット言語の発音を保持することを … 続きを読む

カテゴリー: cs.CL, cs.LG, cs.SD, eess.AS | Cross-lingual Text-To-Speech with Flow-based Voice Conversion for Improved Pronunciation はコメントを受け付けていません

Emotional Voice Messages (EMOVOME) database: emotion recognition in spontaneous voice messages

要約 Emotional Voice Messages (EMOVOME) は、 … 続きを読む

カテゴリー: cs.AI, cs.CL, cs.SD, eess.AS, I.2.7 | Emotional Voice Messages (EMOVOME) database: emotion recognition in spontaneous voice messages はコメントを受け付けていません

SongComposer: A Large Language Model for Lyric and Melody Composition in Song Generation

要約 私たちは、ソング作曲用に設計された革新的な LLM である SongCom … 続きを読む

カテゴリー: cs.AI, cs.CL, cs.SD, eess.AS | SongComposer: A Large Language Model for Lyric and Melody Composition in Song Generation はコメントを受け付けていません

Self-Supervised Speech Quality Estimation and Enhancement Using Only Clean Speech

要約 音声品質の推定は最近、人間の聴覚の専門家による設計から機械学習モデルへのパ … 続きを読む

カテゴリー: cs.AI, cs.LG, cs.SD, eess.AS | Self-Supervised Speech Quality Estimation and Enhancement Using Only Clean Speech はコメントを受け付けていません

An Automated End-to-End Open-Source Software for High-Quality Text-to-Speech Dataset Generation

要約 データの可用性は、音声ベースのテクノロジーを含む人工知能アプリケーションの … 続きを読む

カテゴリー: cs.AI, cs.CL, cs.LG, eess.AS | An Automated End-to-End Open-Source Software for High-Quality Text-to-Speech Dataset Generation はコメントを受け付けていません