cs.MM」カテゴリーアーカイブ

Mitigating Hallucinations in Large Vision-Language Models with Instruction Contrastive Decoding

要約 大規模視覚言語モデル (LVLM) は、視覚入力から状況に応じて詳細で一貫 … 続きを読む

カテゴリー: cs.AI, cs.CL, cs.CV, cs.MM | Mitigating Hallucinations in Large Vision-Language Models with Instruction Contrastive Decoding はコメントを受け付けていません

Once-for-All: Controllable Generative Image Compression with Dynamic Granularity Adaption

要約 最近の生成画像圧縮方法は、レートと歪みと知覚のトレードオフの最適化において … 続きを読む

カテゴリー: cs.CV, cs.MM, eess.IV | Once-for-All: Controllable Generative Image Compression with Dynamic Granularity Adaption はコメントを受け付けていません

Progressive Confident Masking Attention Network for Audio-Visual Segmentation

要約 通常、オーディオ信号とビジュアル信号は同時に発生し、人間はこれら 2 つの … 続きを読む

カテゴリー: cs.AI, cs.CV, cs.LG, cs.MM | Progressive Confident Masking Attention Network for Audio-Visual Segmentation はコメントを受け付けていません

Edit As You Wish: Video Caption Editing with Multi-grained User Control

要約 ユーザの要求に応じて自然言語で自動的にナレーションを行うこと、すなわち、制 … 続きを読む

カテゴリー: cs.CV, cs.MM | Edit As You Wish: Video Caption Editing with Multi-grained User Control はコメントを受け付けていません

NU-Class Net: A Novel Approach for Video Quality Enhancement

要約 動画コンテンツの人気は急上昇し、インターネットトラフィックやモノのインター … 続きを読む

カテゴリー: cs.CV, cs.MM | NU-Class Net: A Novel Approach for Video Quality Enhancement はコメントを受け付けていません

VIEScore: Towards Explainable Metrics for Conditional Image Synthesis Evaluation

要約 急速に進展する条件付き画像生成の研究分野において、様々なモデルの性能や能力 … 続きを読む

カテゴリー: cs.AI, cs.CL, cs.CV, cs.MM | VIEScore: Towards Explainable Metrics for Conditional Image Synthesis Evaluation はコメントを受け付けていません

ContextBLIP: Doubly Contextual Alignment for Contrastive Image Retrieval from Linguistically Complex Descriptions

要約 文脈記述からの画像検索 (IRCD) は、言語的に複雑なテキストに基づいて … 続きを読む

カテゴリー: cs.CV, cs.MM | ContextBLIP: Doubly Contextual Alignment for Contrastive Image Retrieval from Linguistically Complex Descriptions はコメントを受け付けていません

Instruct-MusicGen: Unlocking Text-to-Music Editing for Music Language Models via Instruction Tuning

要約 テキストから音楽への編集における最近の進歩は、テキスト クエリを使用して音 … 続きを読む

カテゴリー: cs.AI, cs.LG, cs.MM, cs.SD, eess.AS | Instruct-MusicGen: Unlocking Text-to-Music Editing for Music Language Models via Instruction Tuning はコメントを受け付けていません

MF-AED-AEC: Speech Emotion Recognition by Leveraging Multimodal Fusion, Asr Error Detection, and Asr Error Correction

要約 音声感情認識 (SER) における一般的なアプローチには、音声情報とテキス … 続きを読む

カテゴリー: cs.CL, cs.MM, cs.SD, eess.AS | MF-AED-AEC: Speech Emotion Recognition by Leveraging Multimodal Fusion, Asr Error Detection, and Asr Error Correction はコメントを受け付けていません

MusicMagus: Zero-Shot Text-to-Music Editing via Diffusion Models

要約 テキストから音楽への生成モデルの最近の進歩により、音楽の創造性に新たな道が … 続きを読む

カテゴリー: cs.AI, cs.MM, cs.SD, eess.AS | MusicMagus: Zero-Shot Text-to-Music Editing via Diffusion Models はコメントを受け付けていません