arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-07 至 2026-04-07 共收录 110 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 17 篇

2604.03653 2026-04-07 cs.CV cs.IR cs.MM 62%

Imagine Before Concentration: Diffusion-Guided Registers Enhance Partially Relevant Video Retrieval

想象之前聚焦:扩散引导的寄存器增强部分相关视频检索

Jun Li, Xuhang Lou, Jinpeng Wang, Yuting Wang, Yaowei Wang, Shu-Tao Xia, Bin Chen

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Peng Cheng Laboratory(鹏城实验室)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出DreamPRVR,通过粗到细的表示学习范式,利用扩散模型生成全局语义寄存器,提升部分相关视频检索的准确性与鲁棒性。

Comments Accepted to CVPR 2026. 15 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03264 2026-04-07 cs.CV cs.AI cs.CR 62%

SafeScreen: A Safety-First Screening Framework for Personalized Video Retrieval for Vulnerable Users

SafeScreen: 一种以安全优先的个性化视频检索框架用于易受伤害用户的视频筛选

Wenzheng Zhao, Madhava Kalyan Gadiputi, Fengpei Yuan

机构 * Worcester Polytechnic Institute(伍斯特理工学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 SafeScreen通过安全优先机制,在确保个性化视频检索的同时满足个体安全约束,采用自动化流程进行视频的连续审批或拒绝,结合个性化安全标准提取、证据驱动评估和LLM决策,实现实时可解释的视频筛选。

Comments 11 pages, 3 figures, 7 tables. Under review for ACM ICMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04811 2026-04-07 cs.RO cs.CV cs.HC 57%

AnyUser: Translating Sketched User Intent into Domestic Robots

AnyUser: 将草图用户意图翻译成家用机器人

Songyuan Yang, Huibin Tan, Kailun Yang, Wenjing Yang, Shaowu Yang

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University(湖南大学国家机器人视觉感知与控制技术工程研究中心)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 AnyUser通过相机图像上的自由形式草图(可选语言)实现直观的家庭任务指令,利用多模态输入生成无需先验地图或模型的可执行机器人动作,通过大量评估验证其在不同模拟家庭场景中的高准确性和真实环境中的可靠性。

Comments Accepted to IEEE Transactions on Robotics (T-RO)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04379 2026-04-07 cs.CV 57%

Reinforce to Learn, Elect to Reason: A Dual Paradigm for Video Reasoning

强化以学习,选择以推理:视频推理的双范式

Songyuan Yang, Weijiang Yu, Jilin Ma, Ziyu Liu, Guijian Tang, Wenjing Yang, Huibin Tan, Nong Xiao

机构 * National University of Defense Technology(国防科技大学) Sun Yat-sen University(中山大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出RLER双范式,通过强化学习生成证据并验证推理一致性,提升视频推理的可靠性和可解释性,实验表明其在多个基准上均取得最佳性能。

Comments Accepted at CVPR 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04372 2026-04-07 cs.CV 57%

Graph-to-Frame RAG: Visual-Space Knowledge Fusion for Training-Free and Auditable Video Reasoning

图到帧RAG:面向无训练和可审计的视频推理的视觉空间知识融合

Songyuan Yang, Weijiang Yu, Ziyu Liu, Guijian Tang, Wenjing Yang, Huibin Tan, Nong Xiao

机构 * National University of Defense Technology(国防科技大学) Sun Yat-sen University(中山大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出G2F-RAG,通过视觉空间知识融合提升视频推理的可解释性和效率,减少认知负担并保留可追溯的证据轨迹。

Comments Accepted at CVPR 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03645 2026-04-07 eess.IV cs.CV 57%

UniSurgSAM: A Unified Promptable Model for Reliable Surgical Video Segmentation

UniSurgSAM: 一种用于可靠外科视频分割的统一提示模型

Haofeng Liu, Ziyue Wang, Alex Y. W. Kong, Guanyi Qin, Yunqiu Xu, Chang Han Low, Mingqi Gao, Lap Yan Lennon Chan, Yueming Jin

机构 * Department of Biomedical Engineering, National University of Singapore(新加坡国立大学生物医学工程系) Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电气与计算机工程系) School of Computer Science, The University of Sheffield(谢菲尔德大学计算机科学学院) Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出UniSurgSAM,通过视觉、文本或音频提示实现可靠的外科视频分割,采用解耦两阶段框架解决优化干扰问题,并引入三种关键设计提升可靠性。

Comments Extended version of MICCAI 2025 paper (ReSurgSAM2). 13 pages, 8 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20685 2026-04-07 cs.RO 50%

C-NAV: Towards Self-Evolving Continual Object Navigation in Open World

C-NAV:迈向开放世界中的自进化持续物体导航

Ming-Ming Yu, Fei Zhu, Wenzhuo Liu, Yirong Yang, Qunbo Wang, Wenjun Wu, Jing Liu

机构 * Beihang University(北京航空航天大学) Centre for Artificial Intelligence and Robotics, HKISI-CAS(香港智能科学与工业研究院人工智能与机器人中心) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) Beijing Jiaotong University(北京交通大学)

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文提出C-Nav框架,通过双路径抗遗忘机制和自适应采样策略,解决持续物体导航中的灾难性遗忘问题,实验表明其在多个模型架构上均优于现有方法,且内存需求显著降低。

Comments Accepted at NeurIPS 2025

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03451 2026-04-07 cs.RO cs.CY cs.HC 50%

Do Robots Need Body Language? Comparing Communication Modalities for Legible Motion Intent in Human-Shared Spaces

机器人需要肢体语言吗?比较不同沟通方式以实现人类共享空间中运动意图的可理解性

Jonathan Albert Cohen, Kye Shimizu, Allen Song, Vishnu Bharath, Kent Larson, Pattie Maes

机构 * MIT Media Lab(麻省理工学院媒体实验室) New England Innovation Academy(新英格兰创新学院)

专题命中 视频多模态 :multimodal(abstract)

AI总结 研究探讨不同沟通方式对理解四足机器人导航意图的影响,评估表达性动作、灯光、文本和音频等模态对预测准确性、信心和信任度的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 跨模态检索 6 篇

2505.22095 2026-04-07 cs.CL 83%

Mixture-of-Retrieval Experts for Reasoning-Guided Multimodal Knowledge Exploitation

基于推理引导的多模态知识利用的检索专家混合

Chunyi Peng, Zhipeng Xu, Zhenghao Liu, Yishan Li, Yukun Yan, Shuo Wang, Yu Gu, Minghe Yu, Ge Yu, Maosong Sun

机构 * Northeastern University(东北大学) Tsinghua University(清华大学)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract);分类 cs.CL

AI总结 本文提出MoRE框架,通过动态选择检索专家提升多模态大语言模型的知识利用效率,实验表明在开放领域问答基准上性能提升超过7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03666 2026-04-07 cs.IR 78%

MMP-Refer: Multimodal Path Retrieval-augmented LLMs For Explainable Recommendation

MMP-Refer: 多模态路径检索增强的可解释推荐LLM

Xiangchen Pan, Wei Wei

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 MMP-Refer通过多模态路径检索增强LLM,提升推荐系统的可解释性,采用联合残差编码获取多模态嵌入,并设计启发式搜索算法获取检索路径,通过轻量级协作适配器映射图编码至LLM语义空间,提升交互信息理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22783 2026-04-07 cs.IR cs.CV cs.LG cs.MM cs.SD 62%

Compact Hypercube Embeddings for Fast Text-based Wildlife Observation Retrieval

紧凑超立方体嵌入用于快速基于文本的野生动物观察检索

Ilyass Moummad, Marius Miron, David Robinson, Kawtar Zaher, Hervé Goëau, Olivier Pietquin, Pierre Bonnet, Emmanuel Chemla, Matthieu Geist, Alexis Joly

机构 * Inria, LIRMM, UM(法国国家信息与自动化研究所,蒙彼利埃计算机科学实验室,蒙彼利埃大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出紧凑超立方体嵌入框架,通过二进制表示实现高效文本检索,提升大规模野生动物图像和音频数据库的检索效率与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03039 2026-04-07 cs.CV 57%

GenSmoke-GS: A Multi-Stage Method for Novel View Synthesis from Smoke-Degraded Images Using a Generative Model

GenSmoke-GS:一种基于生成模型的多阶段方法,用于从烟雾退化图像中生成新视角

Qida Cao, Xinyuan Hu, Changyue Shi, Jiajun Ding, Zhou Yu, Jun Yu

机构 * School of Computer Science and Technology, Hangzhou Dianzi University(杭州电子科技大学计算机科学与技术学院) School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算机科学与技术学院)

专题命中 跨模态检索 :MLLM(abstract);分类 cs.CV

AI总结 本文提出GenSmoke-GS方法,通过多阶段流程提升烟雾退化图像的可视性,减少场景内容变化,实验表明其在定量和视觉质量上优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04175 2026-04-07 cs.LG 50%

Uncertainty-Aware Foundation Models for Clinical Data

具有不确定性的临床数据基础模型

Qian Zhou, Yuanyun Zhang, Shi Li

机构 * University of the Chinese Academy of Sciences(中国科学院大学) Columbia University(哥伦比亚大学)

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文提出一种考虑不确定性的临床数据基础模型框架,通过学习集合值表示并强制一致性,提升预测性能和数据缺失下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00681 2026-04-07 cs.SD cs.IR cs.LG 50%

Audio-to-Image Bird Species Retrieval without Audio-Image Pairs via Text Distillation

无需音频图像对的音频到图像鸟类物种检索:通过文本蒸馏

Ilyass Moummad, Marius Miron, Lukas Rauch, David Robinson, Alexis Joly, Olivier Pietquin, Emmanuel Chemla, Matthieu Geist

机构 * Inria, LIRMM, Université de Montpellier(法国国家信息与自动化研究所,蒙彼利埃计算机科学、机器人学与微电子学实验室,蒙彼利埃大学) University of Kassel(卡塞尔大学)

专题命中 跨模态检索 :image-text(abstract)

AI总结 本文提出无需音频图像配对的音频到图像检索方法,通过文本作为语义中介,利用预训练图像文本模型蒸馏出音频文本模型,实现音频与图像表示的对齐,从而在数据稀缺的生物声学场景中有效进行物种识别。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态生成 9 篇

2604.03635 2026-04-07 cs.CV cs.AI 84%

A Generative Foundation Model for Multimodal Histopathology

多模态病理生成模型基础框架

Jinxi Xiang, Mingjie Li, Siyu Hou, Yijiang Chen, Xiangde Luo, Yuanfeng Ji, Xiang Zhou, Ehsan Adeli, Akshay Chaudhari, Curtis P. Langlotz, Kilian M. Pohl, Ruijiang Li

机构 * Department of Radiation Oncology, Stanford University School of Medicine(斯坦福大学医学院放射肿瘤学系) Department of Psychiatry and Behavioral Sciences, Stanford University School of Medicine(斯坦福大学医学院精神病学与行为科学系) Department of Statistics and Data Science, Yale University(耶鲁大学统计与数据科学系) Department of Computer Science, Stanford University(斯坦福大学计算机科学系) Department of Electrical Engineering, Stanford University(斯坦福大学电气工程系) Department of Biomedical Data Science, Stanford University(斯坦福大学生物医学数据科学系) Department of Radiology, Stanford University(斯坦福大学放射学系) Center for Artificial Intelligence in Medicine and Imaging, Stanford University(斯坦福大学医学与影像人工智能中心)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MuPD模型,通过扩散变压器整合病理图像、分子数据和临床文本,实现跨模态生成任务,提升诊断准确性和数据扩展性。

Comments 33 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13130 2026-04-07 cs.CV cs.AI cs.CL 82%

ZINA: Multimodal Fine-grained Hallucination Detection and Editing

ZINA:多模态细粒度幻觉检测与编辑

Yuiga Wada, Kazuki Matsuda, Komei Sugiura, Graham Neubig

机构 * Keio AI Research Center(庆应义塾大学人工智能研究中心) Keio University(庆应义塾大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出ZINA方法,用于多模态大语言模型的细粒度幻觉检测与编辑,通过构建VisionHall数据集验证了其在检测和编辑任务中的优越性。

Comments CVPR 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04630 2026-04-07 cs.CV 79%

Multimodal Backdoor Attack on VLMs for Autonomous Driving via Graffiti and Cross-Lingual Triggers

通过涂鸦和跨语言触发器对自动驾驶VLMs进行多模态后门攻击

Jiancheng Wang, Lidan Liang, Yong Wang, Zengzhen Su, Haifeng Xia, Yuanting Yan, Wei Wang

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出GLA攻击方法,利用自然触发器在自动驾驶场景中实现隐蔽稳定的后门攻击,实验显示仅需10%污染率即可达到90%攻击成功率且无误报,同时提升模型性能指标,揭示了自动驾驶VLMs的安全威胁。

Comments This is a submission to the "Pattern Analysis and Applications". The manuscript includes 14 pages and 6 figures. All authors have approved the submission, and there is no conflict of interest to declare

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01554 2026-04-07 cs.LG cs.AI cs.CV 73%

InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs

InfoTok: 基于信息理论的容量受限共享视觉标记化在统一多模态大语言模型中的应用

Lv Tang, Tianyi Zheng, Bo Li, Xingyu Li

机构 * University of Alberta(阿尔伯塔大学) vivo Mobile Communication Co., Ltd(维沃移动通信有限公司)

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出InfoTok,一种基于信息瓶颈原理的信息正则化标记化机制,通过互信息约束平衡压缩与任务相关性,提升统一多模态大语言模型的图像理解和生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04421 2026-04-07 cond-mat.supr-con cond-mat.str-el 71%

Multimodal Terahertz Spectroscopy of the Pairing Symmetry and Normal-State Pseudogap in (La,Pr)$_3$Ni$_2$O$_7$ Films

多模态太赫兹光谱学研究(La,Pr)3Ni2O7薄膜中的配对对称性和正常态伪间隙

Shuxiang Xu, Guangdi Zhou, Hao Wang, Tianyi Wu, Wei Wang, Liyu Shi, Dong Wu, Haoliang Huang, Xinbo Wang, Jinfeng Jia, Qi-Kun Xue, Zhuoyu Chen, Tao Dong, Nanlin Wang

专题命中 多模态生成 :multimodal(title)

AI总结 通过结合体敏感太赫兹时域光谱与太赫兹三次谐波生成,研究(La,Pr)3Ni2O7薄膜的超导配对对称性和正常态伪间隙特性,发现有序态与伪间隙的共存与竞争。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04658 2026-04-07 cs.CV 70%

Synthesis4AD: Synthetic Anomalies are All You Need for 3D Anomaly Detection

Synthesis4AD:合成异常就是3D异常检测所需

Yihan Sun, Yuqi Cheng, Junjie Zu, Yuxiang Tan, Guoyang Xie, Yucheng Wang, Yunkang Cao, Weiming Shen

机构 * National Center of Technology Innovation for Intelligent Design and Numerical Control, Huazhong University of Science and Technology(华中科技大学国家智能设计与数控技术创新中心) School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) Department of Intelligent Manufacturing, Contemporary Amperex Technology Ltd.(宁德时代新能源科技股份有限公司智能制造部) Institute for Infocomm Research, A*STAR(新加坡科技研究局资讯通信研究院) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院)

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出Synthesis4AD方法,通过大规模高保真合成异常数据提升3D异常检测性能,利用3D-DefectStudio平台生成精确点云异常掩码,并结合多模态大语言模型实现知识驱动的数据生成,实验表明在多个数据集上达到领先水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04419 2026-04-07 cs.CV 57%

BoxComm: Benchmarking Category-Aware Commentary Generation and Narration Rhythm in Boxing

BoxComm:基于 boxing 的类别感知评论生成与叙述节奏基准测试

Kaiwen Wang, Kaili Zheng, Rongrong Deng, Yiming Shi, Chenyi Guo, Ji Wu

机构 * Tsinghua University(清华大学) Beijing Sport University(北京体育大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出 BoxComm 数据集,包含 445 场世界拳击锦标赛视频及 52000 多条专业评论,通过分类注解和两项新评估方法,解决拳击评论生成中的节奏与类别准确性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03151 2026-04-07 cs.AI 57%

Enhancing Foundation VLM Robustness to Missing Modality: Scalable Diffusion for Bi-directional Feature Restoration

增强基础视觉语言模型对缺失模态的鲁棒性:可扩展的扩散用于双向特征恢复

Wei Dai, Haoyu Wang, Honghao Chang, Lijun He, Fan Li, Jian Sun, Haixia Bi

机构 * Department of Electronics Information \ 'an Jiaotong University Xi'an China School of Information Communications Engineering \ 'an Jiaotong University Xi'an China School of Mathematics Statistics \ 'an Jiaotong University Xi'an China Information \ 'an Jiaotong University Communications Engineering \ 'an Jiaotong University Statistics \ 'an Jiaotong University

专题命中 多模态生成 :cross-modal(abstract);分类 cs.AI

AI总结 本文提出一种通用缺失模态恢复策略,通过增强扩散模型实现双向特征对齐,提升视觉语言模型在模态缺失情况下的鲁棒性和可扩展性。

Comments 10 pages, 8 figures, 6 tables. Experiments and some details have been updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03654 2026-04-07 cs.IR 50%

Joint Behavior-guided and Modality-coherence Conditional Graph Diffusion Denoising for Multi Modal Recommendation

多模态推荐的联合行为引导和模态一致性条件图扩散去噪

Xiangchen Pan, Wei Wei

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出JBM-Diff模型,通过多视图信息传播和特征融合去除多模态特征中的冗余信息,并从行为角度检测样本对的偏序一致性以提升推荐准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态评测 26 篇

2604.03650 2026-04-07 cs.CL 88%

CAGMamba: Context-Aware Gated Cross-Modal Mamba Network for Multimodal Sentiment Analysis

CAGMamba:基于上下文的门控跨模态Mamba网络用于多模态情感分析

Minghai Jiao, Jing Xiao, Peng Xiao, Ende Zhang, Shuang Kan, Wenyan Jiang, Jinyao Li, Yixian Liu, Haidong Xin

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Xingning Power Supply Bureau, Guangdong Power Grid Co., Ltd.(广东电网有限责任公司兴宁供电局)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.CL

AI总结 本文提出CAGMamba网络,通过门控机制实现跨模态信息融合,有效建模上下文依赖和情感演变,实验表明在多模态情感分析任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26064 2026-04-07 cs.CV cs.AI 84%

MuDD: A Multimodal Deception Detection Dataset and GSR-Guided Progressive Distillation for Non-Contact Deception Detection

MuDD:一种多模态欺骗检测数据集和GSR引导的渐进性知识蒸馏用于非接触欺骗检测

Peiyuan Jiang, Yao Liu, Yanglei Gan, Jiaye Yang, Lu Liu, Daibing Yao, Qiao Liu

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MuDD多模态欺骗检测数据集及GSR引导的渐进蒸馏方法,通过跨模态知识蒸馏提升非接触欺骗检测性能,实验表明其在欺骗检测和隐藏数字识别上达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15148 2026-04-07 cs.CV cs.AI 84%

XModBench: Benchmarking Cross-Modal Capabilities and Consistency in Omni-Language Models

XModBench:多模态能力与一致性在多语言模型中的基准测试

Xingrui Wang, Jiang Liu, Chao Huang, Xiaodong Yu, Ze Wang, Ximeng Sun, Jialian Wu, Alan Yuille, Emad Barsoum, Zicheng Liu

机构 * Advanced Micro Devices(超威半导体) Johns Hopkins University(约翰霍普金斯大学) University of Rochester(罗彻斯特大学)

专题命中 多模态评测 :cross-modal(title,abstract);omni-modal(abstract);分类 cs.CV、cs.AI

AI总结 XModBench通过大规模三模态基准测试,评估多语言模型在跨模态一致性中的能力,揭示模型在不同模态下的推理偏差和不平衡问题。

Journal ref Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04207 2026-04-07 cs.AI 79%

Don't Blink: Evidence Collapse during Multimodal Reasoning

不要眨眼:多模态推理中的证据崩溃

Suresh Raghu, Satwik Pandey

机构 * Independent Researcher, New Delhi, India(独立研究者,印度新德里)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 研究发现多模态推理过程中证据逐渐消失的现象,提出通过视觉-熵交互模型降低风险,提升模型在分布偏移下的安全性。

Comments 8 pages, 6 figures, 1 table, plus appendix. Submitted to UAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03505 2026-04-07 cs.CV 79%

Multimodal Urban Tree Detection from Satellite and Street-Level Imagery via Annotation-Efficient Deep Learning Strategies

通过高效深度学习策略实现多模态城市树木检测:结合卫星和街景图像

In Seon Kim, Ali Moghimi

机构 * Department of Computer Science, University of California, Davis(加州大学戴维斯分校计算机科学系) Department of Biological and Agricultural Engineering, University of California, Davis(加州大学戴维斯分校生物与农业工程系)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出多模态框架,结合高分辨率卫星图像与地面Google街景图像,实现低标注条件下城市树木的高效检测。通过领域自适应和三种学习策略(半监督、主动学习、混合策略),提升检测精度,混合策略F1-score达0.90,显著优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01586 2026-04-07 cs.CV 79%

HandMCM: Multi-modal Point Cloud-based Correspondence State Space Model for 3D Hand Pose Estimation

HandMCM:基于多模态点云的对应状态空间模型用于3D手姿态估计

Wencan Cheng, Gim Hee Lee

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出HandMCM,通过结合局部信息注入/过滤模块和对应建模,利用状态空间模型提升3D手姿态估计的鲁棒性和精度,实验表明其在严重遮挡场景中优于现有方法。

Comments AAAI accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03774 2026-04-07 cs.CV cs.AI 76%

When Does Multimodal AI Help? Diagnostic Complementarity of Vision-Language Models and CNNs for Spectrum Management in Satellite-Terrestrial Networks

何时多模态AI有所帮助?视觉-语言模型与CNN在卫星-地面网络中的频谱管理中的诊断互补性

Yuanhang Li

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.AI

AI总结 本文研究了视觉-语言模型与CNN在频谱管理中的互补性,提出SpectrumQA基准测试,并发现CNN在空间定位任务中表现优异,而VLM在语义推理任务中具有独特优势,通过任务类型路由器可提升整体性能。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏