-
最近の投稿
- SACA: A Scenario-Aware Collision Avoidance Framework for Autonomous Vehicles Integrating LLMs-Driven Reasoning
- Bipedal Balance Control with Whole-body Musculoskeletal Standing and Falling Simulations
- Analyzing Key Objectives in Human-to-Robot Retargeting for Dexterous Manipulation
- Scoop-and-Toss: Dynamic Object Collection for Quadrupedal Systems
- Sim-to-Real Causal Transfer: A Metric Learning Approach to Causally-Aware Interaction Representations
-
最近のコメント
表示できるコメントはありません。 cs.AI (39536) cs.CL (29928) cs.CV (44889) cs.HC (3008) cs.LG (44474) cs.RO (23645) cs.SY (3600) eess.IV (5142) eess.SY (3592) stat.ML (5779)
「eess.AS」カテゴリーアーカイブ
Performance evaluation of SLAM-ASR: The Good, the Bad, the Ugly, and the Way Forward
要約 最近の研究では、音声基盤エンコーダと大規模言語モデル (LLM) の間の線 … 続きを読む
Long-Form Text-to-Music Generation with Adaptive Prompts: A Case of Study in Tabletop Role-Playing Games Soundtracks
要約 この論文では、テーブルトップ ロール プレイング ゲーム (TRPG) の … 続きを読む
FlanEC: Exploring Flan-T5 for Post-ASR Error Correction
要約 この論文では、自動音声認識 (ASR) 後の生成音声誤り訂正 (GenSE … 続きを読む
Audio Array-Based 3D UAV Trajectory Estimation with LiDAR Pseudo-Labeling
要約 小型無人航空機 (UAV) の普及が進むにつれ、公共の安全とプライバシーへ … 続きを読む
Audio Texture Manipulation by Exemplar-Based Analogy
要約 オーディオ テクスチャの操作には、聴覚要素の追加、削除、置換などの特定の変 … 続きを読む
An End-to-End Approach for Korean Wakeword Systems with Speaker Authentication
要約 ウェイクワード検出は、AI アシスタントがユーザーの声を聞き、効果的に対話 … 続きを読む
VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction
要約 最近のマルチモーダル大規模言語モデル (MLLM) は通常、視覚的モダリテ … 続きを読む
How Redundant Is the Transformer Stack in Speech Representation Models?
要約 自己教師あり音声表現モデル、特にトランス アーキテクチャを活用したモデルは … 続きを読む
Improving Zero-Shot Chinese-English Code-Switching ASR with kNN-CTC and Gated Monolingual Datastores
要約 kNN-CTC モデルは、単言語自動音声認識 (ASR) に有効であること … 続きを読む
Joint Automatic Speech Recognition And Structure Learning For Better Speech Understanding
要約 音声言語理解 (SLU) は、音声の分野における構造予測タスクです。 最近 … 続きを読む