cs.MM」カテゴリーアーカイブ

VideoAutoArena: An Automated Arena for Evaluating Large Multimodal Models in Video Analysis through User Simulation

要約 高度なビデオ分析機能を備えた大規模マルチモーダル モデル (LMM) が、 … 続きを読む

カテゴリー: cs.AI, cs.CL, cs.CV, cs.MM | コメントする

Identity Preserving 3D Head Stylization with Multiview Score Distillation

要約 3D 頭部の様式化により、リアルな顔の特徴が芸術的な表現に変換され、ゲーム … 続きを読む

カテゴリー: cs.AI, cs.CV, cs.GR, cs.LG, cs.MM | コメントする

Conceptwm: A Diffusion Model Watermark for Concept Protection

要約 拡散モデルのパーソナライゼーション技術は、特定の概念を生成することに成功し … 続きを読む

カテゴリー: cs.AI, cs.CR, cs.MM | コメントする

CMATH: Cross-Modality Augmented Transformer with Hierarchical Variational Distillation for Multimodal Emotion Recognition in Conversation

要約 会話中のマルチモーダル感情認識 (MER) は、マルチモーダル情報を統合す … 続きを読む

カテゴリー: cs.CL, cs.MM | コメントする

A Low-Resolution Image is Worth 1×1 Words: Enabling Fine Image Super-Resolution with Transformers and TaylorShift

要約 トランスベースの超解像度 (SR) モデルは、最近画像再構成の品質を向上さ … 続きを読む

カテゴリー: cs.AI, cs.CV, cs.LG, cs.MM | コメントする

Mitigating Hallucination in Multimodal Large Language Model via Hallucination-targeted Direct Preference Optimization

要約 マルチモーダル大規模言語モデル (MLLM) は幻覚を起こすことが知られて … 続きを読む

カテゴリー: cs.AI, cs.CL, cs.CV, cs.MM | コメントする

Automatic Album Sequencing

要約 アルバムの順序付けは、アルバム制作プロセスの重要な部分です。 最近、コレク … 続きを読む

カテゴリー: 68T07, cs.AI, cs.CL, cs.LG, cs.MM, cs.SD, I.2.6 | コメントする

SAV-SE: Scene-aware Audio-Visual Speech Enhancement with Selective State Space Model

要約 音声強調はさまざまなアプリケーションで重要な役割を果たしており、視覚情報の … 続きを読む

カテゴリー: cs.AI, cs.CV, cs.MM, cs.SD, eess.AS | コメントする

Pseudo-triplet Guided Few-shot Composed Image Retrieval

要約 合成画像検索 (CIR) は、マルチモーダル クエリを使用してターゲット画 … 続きを読む

カテゴリー: cs.CV, cs.MM | コメントする

Rendering-Oriented 3D Point Cloud Attribute Compression using Sparse Tensor-based Transformer

要約 3D ビジュアライゼーション技術の進化により、デジタル コンテンツとのやり … 続きを読む

カテゴリー: cs.CV, cs.MM | コメントする