arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-20 至 2026-04-20 共收录 76 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 10 篇

2505.11237 2026-04-20 cs.MM cs.LG 83%

Concept Drift Guided LayerNorm Tuning for Efficient Multimodal Metaphor Identification

概念漂移引导的层归一化调优用于高效的多模态隐喻识别

Wenhao Qian, Zhenzhen Hu, Zijie Song, Jia Li

机构 * Hefei University of Technology(合肥工业大学)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.MM

AI总结 本文提出CDGLT框架,通过概念漂移和提示构造策略提升多模态隐喻识别效率,实现MET-Meme基准的最先进性能并降低训练成本。

Comments ICMR'25, June 30-July 3, 2025, Chicago, IL, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11490 2026-04-20 cs.AI cs.CL cs.CV 82%

Anthropogenic Regional Adaptation in Multimodal Vision-Language Model

人为区域适应于多模态视觉-语言模型

Samuel Cahyawijaya, Peerat Limkonchotiwat, Tack Hwa Wong, Hitesh Laxmichand Patel, Amit Agarwal, Manuel Antonio Rufino, Carlos Rafael Catalan, Muhammad Reza Qorib, Vicky Feliren, Holy Lovenia, Aye Hninn Khine, Frederikus Hudi, David Anugraha, Alham Fikri Aji, Romrawin Chumpu, Viet-Thanh Pham, Minghan Wang, Mohamed Fazli Imam, Ruochen Zhang, Joseph Marvin Imperial, Khumaisa Nur'aini, Do Xuan Long, Musa Izzanardi Wijanarko, Joel Ruben Antony Moniz, Patrick Amadeus Irawan, Hanif Muhammad Zhafran, Isaiah Flores, Salsabila Zahirah Pranida, Jun Kevin, Jostin Jerico Rosal, Patricia Nicole Monderin, Kun Kerdthaisong, Ahmad Mustafid, My Chiffon Nguyen, Natchapon Jongwiriyanurak, Siva Worajitwannakul, Haochen Li, Adrian Xuan Wei Lim, Bin Wang, Muhammad Ravi Shulthan Habibi, Lynnette Hui Xian Ng, Mithil Bangera, Yeshil Bangera, Priyaranjan Pattnayak, Dun Li Chan, Sherissa Caren Djuniwar, Cho Chan Myei Oo, Hee Ming Shan

机构 * Cohere SEACrowd AI Singapore Universiti Teknologi PETRONAS Oracle Carnegie Mellon University(卡内基梅隆大学) Monash University, Indonesia(莫纳什大学(印尼)) King Mongkut’s University of Technology Thonburi(泰国孔敬大学) Nara Institute of Science and Technology(奈良科学技術大學) Stanford University(斯坦福大学) MBZUAI National University of Singapore(新加坡国立大学) Monash University, Australia(莫纳什大学(澳大利亚)) Brown University(布朗大学) University of Bath(巴斯大学) Mila - Quebec AI Institute(蒙特利尔AI研究所) Institut Teknologi Bandung(Bandung 工程技术大学) Ateneo de Manila University(马尼拉亚特内奥大学) Universitas Pelita Harapan(Pelita Harapan 大学) Seoul National University of Science and Technology(首尔科学技术大学) Thammasat University(泰国 Thammasat 大学) Independent(独立) University College London(伦敦大学学院) Nanyang Technological University(南洋理工大学) MiroMind AI University of Indonesia(印度尼西亚大学) University of New Haven(纽黑文大学) INTI International University and Colleges(INTI 国际大学和学院) Binus University(Binus 大学) National University Philippines(菲律宾国家大学) ThoughtFull

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出人为区域适应框架,通过地理通用化简化方法提升多模态模型在特定区域的文化相关性,实验显示在东南亚地区提升5-15%的同时保持全球性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.07420 2026-04-20 cs.CV cs.CL cs.DL cs.SI 81%

Automatic Modeling of Social Concepts Evoked by Art Images as Multimodal Frames

艺术图像中引发的社会概念的自动建模作为多模态框架

Delfina Sol Martinez Pandiani, Valentina Presutti

机构 * Department of Computer Science and Engineering (DISI), University of Bologna, Italy(博洛尼亚大学计算机科学与工程系(DISI)) Department of Modern Languages, Literatures and Cultures (LILEC), University of Bologna, Italy(博洛尼亚大学现代语言、文学与文化系(LILEC))

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出将社会概念表示为多模态框架的方法,通过整合多感官数据提取和分析视觉艺术材料的多模态特征,以解决社会概念自动检测中的语义鸿沟问题。

Comments First International Workshop on Multisensory Data and Knowledge at the 3rd Conference on Language, Data and Knowledge (2021)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15495 2026-04-20 cs.AI cs.CV cs.HC cs.RO 81%

GIST: Multimodal Knowledge Extraction and Spatial Grounding via Intelligent Semantic Topology

GIST:通过智能语义拓扑进行多模态知识提取与空间定位

Shivendra Agrawal, Bradley Hayes

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 GIST通过智能语义拓扑提取多模态知识,构建语义标注的导航拓扑,实现复杂环境中的空间定位与人类-AI交互任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16256 2026-04-20 cs.CV cs.CL 73%

Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap

视觉-语言模型真的能进行视觉推理吗?一种对模态差距的严格研究

Yige Xu, Yongjie Wang, Zizhuo Wu, Kaisong Song, Jun Lin, Zhiqi Shen

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院,新加坡) Alibaba-NTU Global e-Sustainability CorpLab (ANGEL)(阿里巴巴-国立大学全球可持续发展公司实验室(ANGEL)) Tongyi Lab, Alibaba Group, China(阿里云实验室,阿里巴巴集团,中国)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 本文通过CrossMath基准测试,发现视觉-语言模型在文本输入时表现优异,但加入图像信息后推理性能下降,表明其推理主要依赖文本空间,而非真实视觉证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14373 2026-04-20 cs.CV cs.AI 62%

SatBLIP: Context Understanding and Feature Identification from Satellite Imagery with Vision-Language Learning

SatBLIP:基于卫星影像的视觉-语言学习用于农村环境理解和特征识别

Xue Wu, Shengting Cao, Shenglin Li, Jiaqi Gong

机构 * The University of Alabama(阿拉巴马大学) Knox College(克诺克斯学院)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 SatBLIP通过结合对比图像-文本对齐与定制化卫星语义描述,提升农村风险环境的可解释性分析,预测县级社会脆弱性指数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05547 2026-04-20 cs.CV cs.AI 62%

VIB-Probe: Detecting and Mitigating Hallucinations in Vision-Language Models via Variational Information Bottleneck

VIB-Probe:通过变分信息瓶颈检测和缓解视觉-语言模型中的幻觉

Feiran Zhang, Yixin Wu, Zhenghua Wang, Xiaohua Wang, Changze Lv, Xuanjing Huang, Xiaoqing Zheng

机构 * College of Computer Science and Artificial Intelligence, Fudan University, Shanghai, China(复旦大学计算机科学与人工智能学院,上海,中国) Shanghai Key Laboratory of Intelligent Information Processing(上海智能信息处理重点实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VIB-Probe框架,通过变分信息瓶颈理论检测和缓解视觉-语言模型中的幻觉,利用注意力头提取判别模式并过滤语义噪声,实验表明其在多个基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16248 2026-04-20 cs.CV 57%

Where Do Vision-Language Models Fail? World Scale Analysis for Image Geolocalization

视觉-语言模型在何处失效?面向图像地理定位的世界尺度分析

Siddhant Bharadwaj, Ashish Vashist, Fahimul Aleem, Shruti Vyas

机构 * University of Central Florida(中央佛罗里达大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文评估了多种先进视觉-语言模型在国家层面图像地理定位中的表现,揭示了模型在粗粒度地理定位中的潜力及当前模型在细粒度地理线索捕捉上的局限。

Comments Accepted to the CVPR EarthVision 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16067 2026-04-20 cs.LG cs.CV 57%

AEGIS: Anchor-Enforced Gradient Isolation for Knowledge-Preserving Vision-Language-Action Fine-Tuning

AEGIS:锚定强化梯度隔离用于知识保留的视觉-语言-动作微调

Guransh Singh

机构 * Independent Researcher(独立研究者)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出AEGIS方法,通过层间梯度投影保留预训练的视觉问答能力,避免因梯度不对称导致的性能下降,无需额外数据或缓冲区。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27759 2026-04-20 cs.CV 57%

When Surfaces Lie: Exploiting Wrinkle-Induced Attention Shift to Attack Vision-Language Models

当表面欺骗:利用褶皱诱导的注意力转移攻击视觉-语言模型

Chengyin Hu, Xuemeng Sun, Jiaju Han, Qike Zhang, Xiang Chen, Xin Wang, Yiwei Wei, Jiahua Long

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种参数化结构扰动方法,通过构建多尺度褶皱场和整合位移场扭曲与表面一致的外观变化,以攻击视觉-语言模型的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 2 篇

2604.15322 2026-04-20 cs.HC cs.CL cs.LG 57%

Acoustic and Facial Markers of Perceived Conversational Success in Spontaneous Speech

语音与面部特征在自发言语中感知对话成功的标志

Thanushi Withanage, Elizabeth Redcay, Carol Espy-Wilson

机构 * Department of Electrical and Computer Engineering, University of Maryland College Park, MD, USA(电气与计算机工程系,马里兰大学学院市分校) Department of Psychology, University of Maryland College Park, MD, USA(心理学系,马里兰大学学院市分校)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 研究通过分析自发Zoom对话,探讨对话动态与感知互动质量的关系,发现同步现象能可靠检测并预测更高的对话成功感知。

Comments Accepted for presentation at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15301 2026-04-20 cs.CV 57%

Think in Latent Thoughts: A New Paradigm for Gloss-Free Sign Language Translation

在潜在思想中思考:一种无手势词的签语翻译新范式

Yiyang Jiang, Li Zhang, Xiao-Yong Wei, Li Qing

机构 * The Hong Kong Polytechnic University(香港理工大学) Sichuan University(四川大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种基于推理的签语翻译框架,通过潜在思想序列作为中间层提升翻译的连贯性和准确性,并构建了一个新的大规模无手势词数据集。

Comments Accepted to ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 8 篇

2604.16172 2026-04-20 cs.MM 83%

MOMENTA: Mixture-of-Experts Over Multimodal Embeddings with Neural Temporal Aggregation for Misinformation Detection

MOMENTA: 多模态嵌入的专家混合模型结合神经时间聚合用于虚假信息检测

Yeganeh Abdollahinejad, Ahmad Mousavi, Naeemul Hassan, Kai Shu, Nathalie Japkowicz, Shahriar Khosravi, Amir Karami

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.MM

AI总结 MOMENTA通过融合多模态嵌入、神经时间聚合和领域对抗学习,有效捕捉多模态不一致性和时间动态,提升虚假信息检测的鲁棒性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15377 2026-04-20 cs.LG cs.CV cs.MM 81%

M3R: Localized Rainfall Nowcasting with Meteorology-Informed MultiModal Attention

M3R:基于气象信息的多模态注意力的局部降雨现在预测

Sanjeev Panta, Rhett M Morvant, Xu Yuan, Li Chen, Nian-Feng Tzeng

机构 * University of Louisiana at Lafayette, Lafayette, LA, USA(路易斯安那州立大学拉斐特分校) University of Delaware, Newark, DE, USA(德克萨斯大学达勒姆分校)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.MM

AI总结 M3R结合NEXRAD雷达图像与气象站数据,通过多模态注意力机制提升降雨预测精度与效率,实现更准确的降雨现在预测。

Comments Accepted at IEEE International Conference on Multimedia and Expo (ICME) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15127 2026-04-20 cs.MM 79%

MCSC-Bench: Multimodal Context-to-Script Creation for Realistic Video Production

MCSC-Bench:多模态情境到脚本创建用于真实视频制作

Huanran Hu, Zihui Ren, Dingyi Yang, Liangyu Chen, Qixiang Gao, Tiezheng Ge, Qin Jin

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.MM

AI总结 本文提出MCSC任务,通过多模态输入和用户指令生成结构化视频脚本,并引入首个大规模MCSC数据集MCSC-Bench,包含11K+标注视频,支持全面评估材料选择、叙事规划和条件脚本生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08480 2026-04-20 cs.CV 70%

Video-STAR: Reinforcing Open-Vocabulary Action Recognition with Tools

Video-STAR: 通过工具强化开放词汇动作识别

Zhenlong Yuan, Xiangyan Qu, Chengxuan Qian, Rui Chen, Jing Tang, Lei Sun, Xiangxiang Chu, Dapeng Zhang, Yiwei Wang, Yujun Cai, Shuo Li

机构 * AMAP, Alibaba Group(阿里集团AMAP) University of California at Merced(加州大学默塞德分校) University of Queensland(昆士兰大学) Case Western Reserve University(凯斯西储大学)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 Video-STAR通过结合上下文子动作分解与工具增强强化学习,提升开放词汇动作识别的细粒度匹配与跨模态推理能力,有效减少跨模态幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15736 2026-04-20 cs.CV cs.CL 62%

RefereeBench: Are Video MLLMs Ready to be Multi-Sport Referees

RefereeBench: 视频多模态大语言模型是否准备好成为多项目裁判

Yichen Xu, Yuanhang Liu, Chuhan Wang, Zihan Zhao, jinghan luo, Jianzhe Ma, Wenxuan Wang, Qin Jin

机构 * Renmin University of China(中国人民大学) Sichuan University(四川大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出RefereeBench,首个评估多模态大语言模型作为自动体育裁判的基准,通过11项运动925个视频和6475对问答,评估犯规存在、分类、推理、实体感知和时间定位能力,发现当前模型在规则应用和时间定位上表现不足。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13091 2026-04-20 cs.CV 57%

Reasoning over Video: Evaluating How MLLMs Extract, Integrate, and Reconstruct Spatiotemporal Evidence

视频推理:评估大语言模型如何提取、整合和重构时空证据

Seunghwan Bang, Hwanjun Song

机构 * UNIST(全南大学) KAIST(韩国科学技术院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文评估大语言模型在视频中的时空推理能力,提出VAEX-BENCH基准,通过合成数据测试抽象推理任务,揭示模型在抽象任务中的局限性。

Comments Project page: https://disl-lab.github.io/VAEX-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20025 2026-04-20 cs.CV 57%

A Contextual Analysis of Driver-Facing and Dual-View Video Inputs for Distraction Detection in Naturalistic Driving Environments

面向驾驶员和双视角视频输入在自然驾驶环境中的干扰检测情境分析

Anthony Dontoh, Stephanie Ivey, Armstrong Aboah

机构 * Environmental Engineering The University of Memphis Memphis, TN, USA Email(环境工程 明尼苏达大学 内华达州法戈 邮箱) Environmental Engineering North Dakota State University Fargo, ND, USA Email(环境工程 内华达州立大学 内华达州法戈 邮箱)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文研究了在自然驾驶环境中,结合道路面向和驾驶员面向视频输入对干扰检测准确性的影响,通过对比三种时空动作识别模型,发现多视角融合需依赖特定架构设计以避免干扰。

Journal ref 2025 IEEE International Conference on Future Machine Learning and Data Science (FMLDS), 02-05 Nov. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01944 2026-04-20 cs.RO cs.CV 57%

AutoDrive-R$^2$: Incentivizing Reasoning and Self-Reflection Capacity for VLA Model in Autonomous Driving

AutoDrive-R$^2$: 促进自动驾驶VLA模型的推理与自反思能力

Zhenlong Yuan, Chengxuan Qian, Jing Tang, Rui Chen, Zijian Song, Lei Sun, Xiangxiang Chu, Yujun Cai, Dapeng Zhang, Shuo Li

机构 * AMAP, Alibaba Group(阿里集团AMAP) Sun Yat-sen University(中山大学) University of Queensland(昆士兰大学) Lanzhou University(兰州大学) Case Western Reserve University(凯斯西储大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出AutoDrive-R$^2$框架,通过链式推理和强化学习提升自动驾驶VLA系统的推理与自反思能力,使用nuScenesR$^2$-6K数据集和GRPO算法实现高鲁棒性轨迹规划。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 8 篇

2604.15628 2026-04-20 cs.CV cs.CL cs.IR cs.LG cs.MM 93%

SIMMER: Cross-Modal Food Image--Recipe Retrieval via MLLM-Based Embedding

SIMMER:通过基于MLLM的嵌入进行跨模态食物图像-食谱检索

Keisuke Gomi, Keiji Yanai

机构 * The University of Electro-Communications(电通大学)

专题命中 跨模态检索 :MLLM(title,title_cn);cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL、cs.MM

AI总结 本文提出SIMMER,利用基于MLLM的嵌入模型VLM2Vec,通过统一编码器处理食物图像和食谱文本,设计定制化提示模板和数据增强策略,实现跨模态检索的高精度。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15979 2026-04-20 cs.CV 89%

MMGait: Towards Multi-Modal Gait Recognition

MMGait:迈向多模态步态识别

Chenye Wang, Qingyuan Cai, Saihui Hou, Aoqi Li, Yongzhen Huang

机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院)

专题命中 跨模态检索 :multi-modal(title,summary_cn);cross-modal(abstract);分类 cs.CV

AI总结 本文提出MMGait多模态步态基准,整合五种异构传感器数据,评估单模态、跨模态和多模态步态识别方法,引入Omni Multi-Modal Gait Recognition任务和OmniGait基线模型。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16427 2026-04-20 cs.CV 85%

Cross-modal learning for plankton recognition

跨模态学习用于浮游生物识别

Joona Kareinen, Veikka Immonen, Tuomas Eerola, Lumi Haraguchi, Lasse Lensu, Kaisa Kraft, Sanna Suikkanen, Heikki Kälviäinen

机构 * Lappeenranta-Lahti University of Technology LUT(拉佩宁拉-拉赫蒂技术大学) Finnish Environment Institute(芬兰环境研究所) Faculty of Information Technology(信息科技学院) Brno University of Technology(布拉格技术大学)

专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出利用自监督跨模态协调策略,结合大量未标记浮游生物数据,构建多模态识别模型。通过图像与光学测量数据共同指导学习,无需人工标注,提升识别精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13660 2026-04-20 cs.CV 83%

VRAG-DFD: Verifiable Retrieval-Augmentation for MLLM-based Deepfake Detection

VRAG-DFD: 可验证检索增强的基于大语言模型的深度伪造检测

Hui Han, Shunli Wang, Yandan Zhao, Taiping Yao, Shouhong Ding

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 跨模态检索 :MLLM(title,abstract);分类 cs.CV

AI总结 本文提出VRAG-DFD框架,通过结合检索增强生成和强化学习,解决深度伪造检测中专业伪造知识不足的问题,提升大语言模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12193 2026-04-20 cs.CV 77%

VeRVE: Versatile Retrieval for Videos via Unified Embeddings

VeRVE:通过统一嵌入实现视频的多功能检索

Shaunak Halbe, Bhagyashree Puranik, Jayakrishnan Unnikrishnan, Kushan Thakkar, Vimal Bhat, Toufiq Parag

机构 * Georgia Institute of Technology(佐治亚理工学院) Amazon(亚马逊) Keystone AI

专题命中 跨模态检索 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 本文提出VeRVE框架,结合语义和时刻级检索能力,支持复杂多模态查询,通过对比对齐视觉和文本嵌入实现高效检索,优于其他多模态大语言模型方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16247 2026-04-20 cs.LG cs.AI 70%

Joint-Centric Dual Contrastive Alignment with Structure-Preserving and Information-Balanced Regularization

基于结构保持和信息平衡正则化的联合中心双对比对齐

Habibeh Naderi, Behrouz Haji Soleimani, Stan Matwin

机构 * Dalhousie University(达尔豪斯大学)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出HILBERT框架,通过跨模态注意力和自注意力池化学习文档级音频文本表示,采用双对比目标和辅助正则化提升跨模态对齐效果,实现长序列语义表示学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15735 2026-04-20 cs.CV cs.AI 66%

Sketch and Text Synergy: Fusing Structural Contours and Descriptive Attributes for Fine-Grained Image Retrieval

草图与文本协同:融合结构轮廓和描述属性用于细粒度图像检索

Siyuan Wang, Hanchen Gao, Guangming Zhu, Jiang Lu, Yiyue Ma, Tianci Wu, Jincai Huang, Liang Zhang

机构 * Xidian University First Aircraft Design Institute(西安电子科技大学第一飞机设计院)

专题命中 跨模态检索 :cross-modal(abstract,comments);分类 cs.CV、cs.AI

AI总结 本文提出STBIR框架,通过融合草图的结构轮廓与文本的色彩纹理信息,提升细粒度图像检索性能,采用课程学习、特征空间优化和多阶段跨模态对齐机制,实验验证其优于现有方法。

Comments Image Retrieval, Hand-drawn Sketch, Multi-stage Cross-modal Feature Alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15663 2026-04-20 cs.SE cs.AI 57%

CodeMMR: Bridging Natural Language, Code, and Image for Unified Retrieval

CodeMMR:连接自然语言、代码和图像以实现统一检索

Jiahui Geng, Qing Li, Fengyu Cai, Fakhri Karray

机构 * MBZUAI Linköping University(林雪平大学) University of Groningen(格罗宁根大学) TU Darmstadt(图宾根大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本文提出CodeMMR,通过指令式多模态对齐,将自然语言、代码和图像嵌入共享语义空间,实现跨模态和语言的强泛化,优于基线模型,并提升RAG中的代码生成精度与视觉 grounding。

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 13 篇

2604.11804 2026-04-20 cs.CV 83%

OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation

OmniShow:统一多模态条件以生成人-物体交互视频

Donghao Zhou, Guisheng Liu, Hao Yang, Jiatong Li, Jingyu Lin, Xiaohu Huang, Yichen Liu, Xin Gao, Cunjian Chen, Shilei Wen, Chi-Wing Fu, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态生成 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CV

AI总结 本文提出OmniShow框架,统一文本、图像、音频和姿态多模态条件,解决人-物体交互视频生成中的可控性与质量平衡问题,通过统一通道条件和门控局部上下文注意力实现高效生成,建立HOIVG-Bench基准测试平台,取得多模态条件下的最佳性能。

Comments Project page: https://correr-zhou.github.io/OmniShow/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07786 2026-04-20 cs.CV cs.LG 79%

Cross-Modal Emotion Transfer for Emotion Editing in Talking Face Video

跨模态情绪迁移用于谈话人脸视频中的情绪编辑

Chanhyuk Choi, Taesoo Kim, Donggyu Lee, Siyeol Jung, Taehwan Kim

机构 * Ulsan National Institute of Science and Technology (UNIST)(乌山国立科学技术研究院)

专题命中 多模态生成 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出跨模态情绪迁移(C-MET)方法,通过建模语音与视觉特征空间间的情绪语义向量,提升生成视频的情绪表达与真实感,实验表明其在MEAD和CREMA-D数据集上比现有方法提升14%的情绪准确性。

Comments Accepted to CVPR 2026. Project Page: https://chanhyeok-choi.github.io/C-MET/

详情

展开后加载摘要…

URL PDF HTML 收藏