「eess.AS」カテゴリーアーカイブ

The NPU-ASLP-LiAuto System Description for Visual Speech Recognition in CNVSRC 2023

投稿日: 2024年3月1日作成者: jarxiv

要約この論文は、2023 年の第 1 回中国語連続視覚音声認識チャレンジ (C … 続きを読む →

カテゴリー: cs.AI, cs.SD, eess.AS | コメントを受け付けていません

Probing the Information Encoded in Neural-based Acoustic Models of Automatic Speech Recognition Systems

投稿日: 2024年3月1日作成者: jarxiv

要約深層学習アーキテクチャは、多くの研究分野でパフォーマンスの面で大幅な進歩を … 続きを読む →

カテゴリー: cs.AI, cs.SD, eess.AS | コメントを受け付けていません

Investigation of Adapter for Automatic Speech Recognition in Noisy Environment

投稿日: 2024年3月1日作成者: jarxiv

要約自動音声認識 (ASR) システムを目に見えない騒音環境に適応させることが … 続きを読む →

カテゴリー: cs.CL, cs.SD, eess.AS | コメントを受け付けていません

Exploration of Adapter for Noise Robust Automatic Speech Recognition

投稿日: 2024年2月29日作成者: jarxiv

要約目に見えない騒音シナリオに対処するには、堅牢な自動音声認識 (ASR) シ … 続きを読む →

カテゴリー: cs.CL, cs.SD, eess.AS | コメントを受け付けていません

Diffusion-Based Speech Enhancement with Joint Generative and Predictive Decoders

投稿日: 2024年2月29日作成者: jarxiv

要約拡散ベースの生成音声強調 (SE) が最近注目を集めていますが、逆拡散には … 続きを読む →

カテゴリー: cs.CL, cs.SD, eess.AS | コメントを受け付けていません

Structure-informed Positional Encoding for Music Generation

投稿日: 2024年2月29日作成者: jarxiv

要約ディープラーニング手法によって生成された音楽は、多くの場合、一貫性や長期に … 続きを読む →

カテゴリー: cs.AI, cs.SD, eess.AS | コメントを受け付けていません

EchoTrack: Auditory Referring Multi-Object Tracking for Autonomous Driving

投稿日: 2024年2月29日作成者: jarxiv

要約本稿では、音声表現に基づいてビデオシーケンス内の特定のオブジェクトを動的に … 続きを読む →

カテゴリー: cs.CV, cs.RO, eess.AS, eess.IV | コメントを受け付けていません

Real-time Low-latency Music Source Separation using Hybrid Spectrogram-TasNet

投稿日: 2024年2月28日作成者: jarxiv

要約近年、音楽デミックスのための深層学習が大幅に進歩しました。しかし、これら … 続きを読む →

カテゴリー: cs.LG, cs.SD, eess.AS, I.5.1 | コメントを受け付けていません

Cross-lingual Text-To-Speech with Flow-based Voice Conversion for Improved Pronunciation

投稿日: 2024年2月28日作成者: jarxiv

要約この論文では、元の話者の言語に関係なくターゲット言語の発音を保持することを … 続きを読む →

カテゴリー: cs.CL, cs.LG, cs.SD, eess.AS | コメントを受け付けていません

Emotional Voice Messages (EMOVOME) database: emotion recognition in spontaneous voice messages

投稿日: 2024年2月28日作成者: jarxiv

要約 Emotional Voice Messages (EMOVOME) は、 … 続きを読む →

カテゴリー: cs.AI, cs.CL, cs.SD, eess.AS, I.2.7 | コメントを受け付けていません

「eess.AS」カテゴリーアーカイブ

The NPU-ASLP-LiAuto System Description for Visual Speech Recognition in CNVSRC 2023

Probing the Information Encoded in Neural-based Acoustic Models of Automatic Speech Recognition Systems

Investigation of Adapter for Automatic Speech Recognition in Noisy Environment

Exploration of Adapter for Noise Robust Automatic Speech Recognition

Diffusion-Based Speech Enhancement with Joint Generative and Predictive Decoders

Structure-informed Positional Encoding for Music Generation

EchoTrack: Auditory Referring Multi-Object Tracking for Autonomous Driving

Real-time Low-latency Music Source Separation using Hybrid Spectrogram-TasNet

Cross-lingual Text-To-Speech with Flow-based Voice Conversion for Improved Pronunciation

Emotional Voice Messages (EMOVOME) database: emotion recognition in spontaneous voice messages

最近の投稿

最近のコメント

アーカイブ

カテゴリー