-
最近の投稿
- FEAST: A Flexible Mealtime-Assistance System Towards In-the-Wild Personalization
- Time-Optimized Safe Navigation in Unstructured Environments through Learning Based Depth Completion
- Advances in Compliance Detection: Novel Models Using Vision-Based Tactile Sensors
- Mass-Adaptive Admittance Control for Robotic Manipulators
- DreamGen: Unlocking Generalization in Robot Learning through Video World Models
-
最近のコメント
表示できるコメントはありません。 cs.AI (39879) cs.CL (30187) cs.CV (45175) cs.HC (3051) cs.LG (44808) cs.RO (23879) cs.SY (3632) eess.IV (5170) eess.SY (3624) stat.ML (5830)
「eess.AS」カテゴリーアーカイブ
Parameter-Free Attentive Scoring for Speaker Verification
要約 本論文では、話者検証のためのパラメータフリーのアテンションスコアリングに関 … 続きを読む
Compose & Embellish: Well-Structured Piano Performance Generation via A Two-Stage Approach
要約 Transformerのような強力なシーケンスモデルを用いても、長距離の音 … 続きを読む
DWFormer: Dynamic Window transFormer for Speech Emotion Recognition
要約 音声の感情認識は、人間とコンピュータの相互作用に極めて重要である。異なる感 … 続きを読む
AutoMatch: A Large-scale Audio Beat Matching Benchmark for Boosting Deep Learning Assistant Video Editing
要約 短編映像の爆発的な普及は、人々の交流のあり方を大きく変え、日々の共有や最新 … 続きを読む
Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages
要約 本論文では、100以上の言語にわたる自動音声認識(ASR)を行う単一の大規 … 続きを読む
Audio-based AI classifiers show no evidence of improved COVID-19 screening over simple symptoms checkers
要約 最近の研究では、音声録音でトレーニングされた AI 分類子が、重症急性呼吸 … 続きを読む
Goodness of Pronunciation Pipelines for OOV Problem
要約 次のレポートでは、語彙/語彙拡張技術を使用して、テスト時に OOV 問題を … 続きを読む
Synthetic Cross-accent Data Augmentation for Automatic Speech Recognition
要約 偏った ASR データセットまたはモデルに対する認識は、近年著しく増加して … 続きを読む
Leveraging Large Text Corpora for End-to-End Speech Summarization
要約 End-to-end Speech Summarization (E2E … 続きを読む
Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages
要約 100 以上の言語で自動音声認識 (ASR) を実行する単一の大規模モデル … 続きを読む