arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-02 至 2026-03-02 共收录 12 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 12 篇

2602.23945 2026-03-02 cs.CV cs.AI cs.MM 85%

PointCoT: A Multi-modal Benchmark for Explicit 3D Geometric Reasoning

PointCoT: 一种用于显式3D几何推理的多模态基准

Dongxu Zhang, Yiding Sun, Pengcheng Li, Yumou Liu, Hongqiang Lin, Haoran Xu, Xiaoxuan Mu, Liang Lin, Wenbiao Yan, Ning Yang, Chaowei Fang, Juanjuan Zhao, Jihua Zhu, Conghui He, Cheng Tan

机构 * Xi'an Jiaotong University(西安交通大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Institute of Automation, CASIA(中国科学院自动化研究所) Taiyuan University of Technology(太原理工大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 PointCoT通过显式链式推理提升3D几何推理能力,提出多模态基准和双流架构,实现对3D点云的高精度理解与推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23299 2026-03-02 cs.CV cs.MM 84%

MMSD3.0: A Multi-Image Benchmark for Real-World Multimodal Sarcasm Detection

MMSD3.0:一个多图像基准用于现实世界多模态讽刺检测

Haochen Zhao, Yuyao Kong, Yongxiu Xu, Gaopeng Gou, Hongbo Xu, Yubin Wang, Haoliang Zhang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 MMSD3.0是一个多图像基准,用于现实世界多模态讽刺检测,引入了跨图像推理模型和相关引导的细粒度跨模态融合机制,验证了其在单图像和多图像场景中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23614 2026-03-02 cs.LG cs.AI 83%

When Does Multimodal Learning Help in Healthcare? A Benchmark on EHR and Chest X-Ray Fusion

多模态学习在医疗领域何时有助于提升性能?基于电子健康记录与胸部X光融合的基准测试

Kejing Yin, Haizhou Xu, Wenfang Yao, Chen Liu, Zijie Chen, Yui Haang Cheung, William K. Cheung, Jing Qin

机构 * Department of Computer Science(计算机科学系) Hong Kong Baptist University(香港 Baptist 大学) Division of Artificial Intelligence(人工智能 division) Lingnan University(Lingnan 大学) School of Nursing(护理学院) The Hong Kong Polytechnic University(香港理工大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文通过基准测试评估了电子健康记录与胸部X光融合在医疗中的有效性,揭示了多模态学习在不同模态缺失情况下的性能差异及公平性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19756 2026-03-02 cs.CV 83%

Multimodal Dataset Distillation Made Simple by Prototype-Guided Data Synthesis

通过原型引导的数据合成实现多模态数据集蒸馏

Junhyeok Choi, Sangwoo Mo, Minwoo Chae

机构 * Department of Industrial and Management Engineering(工业与管理工程系)

专题命中 多模态评测 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 通过原型引导的数据合成实现多模态数据集蒸馏,无需大规模训练和优化,提升跨架构泛化能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23898 2026-03-02 cs.CV cs.AI cs.CL 82%

Ref-Adv: Exploring MLLM Visual Reasoning in Referring Expression Tasks

Ref-Adv:探索提及表达任务中的多模态大语言模型视觉推理

Qihua Dong, Kuo Yang, Lin Ju, Handong Zhao, Yitian Zhang, Yizhou Wang, Huimin Zeng, Jianglin Lu, Yun Fu

机构 * Northeastern University(东北大学)

专题命中 多模态评测 :MLLM(title);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 Ref-Adv 是一个旨在评估多模态大语言模型视觉推理能力的基准,通过增加表达复杂性和减少干扰项,揭示模型在视觉推理和 grounding 方面的不足。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23980 2026-03-02 cs.CV 79%

Venus: Benchmarking and Empowering Multimodal Large Language Models for Aesthetic Guidance and Cropping

Venus: 多模态大语言模型在审美指导与裁剪中的基准测试与赋能

Tianxiang Du, Hulingxiao He, Yuxin Peng

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机技术研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 Venus通过两阶段框架提升多模态大语言模型的审美指导与裁剪能力,实现可解释的审美优化。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23777 2026-03-02 cs.AI 79%

Reasoning-Driven Multimodal LLM for Domain Generalization

基于推理的多模态大语言模型用于领域泛化

Zhipeng Xu, Zilong Wang, Xinyang Jiang, Dongsheng Li, De Cheng, Nannan Wang

机构 * Xidian University(西安电子科技大学) Microsoft Research Asia(微软亚洲研究院) National Engineering Laboratory for Integrated Aero-Space-Ground- Ocean Big Data Application(国家一体化空天地海大数据应用工程实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出RD-MLDG框架,利用多模态大语言模型的推理能力,通过引入多任务交叉训练和自我对齐的推理正则化,提升领域泛化性能。

Comments Accepted at ICLR 2026 (Poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23632 2026-03-02 cs.AI 79%

MMKG-RDS: Reasoning Data Synthesis via Deep Mining of Multimodal Knowledge Graphs

基于多模态知识图谱的推理数据合成:通过深度挖掘多模态知识图谱进行推理数据合成

Lun Zhan, Feng Xiong, Huanyong Liu, Feng Zhang, Yuhui Yin

机构 * AI Research Institute, Qihoo 360(人工智能研究院,奇虎360)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 MMKG-RDS通过深度挖掘多模态知识图谱,提出灵活的推理数据合成框架,提升模型推理能力并生成高质量数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21048 2026-03-02 cs.CV cs.AI 73%

Veritas: Generalizable Deepfake Detection via Pattern-Aware Reasoning

Veritas:通过模式感知推理实现通用的深度伪造检测

Hao Tan, Jun Lan, Zichang Tan, Ajian Liu, Chuanbiao Song, Senyuan Shi, Huijia Zhu, Weiqiang Wang, Jun Wan, Zhen Lei

机构 * School of Advanced Interdisciplinary Sciences (SAIS), University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) Ant Group(蚂蚁集团) Shenzhen Institute of Advanced Technology (SIAT), Chinese Academy of Sciences(中国科学院深圳先进技术研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 多模态评测 :multi-modal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 Veritas通过模式感知推理,基于多模态大语言模型实现通用深度伪造检测,提升对未知伪造技术和数据领域的检测能力。

Comments ICLR 2026 Oral. Project: https://github.com/EricTan7/Veritas

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24653 2026-03-02 cs.RO 71%

RoboMIND 2.0: A Multimodal, Bimanual Mobile Manipulation Dataset for Generalizable Embodied Intelligence

RoboMIND 2.0:一种多模态、双臂移动操作数据集,用于通用具身智能

Chengkai Hou, Kun Wu, Jiaming Liu, Zhengping Che, Di Wu, Fei Liao, Guangrun Li, Jingyang He, Qiuxuan Feng, Zhao Jin, Chenyang Gu, Zhuoyang Liu, Nuowei Han, Xiangju Mi, Yaoxu Lv, Yankai Fu, Gaole Dai, Langzhe Gu, Tao Li, Yuheng Zhang, Yixue Zhang, Xinhua Wang, Shichao Fan, Meng Li, Zhen Zhao, Ning Liu, Zhiyuan Xu, Pei Ren, Junjie Ji, Haonan Liu, Kuan Cheng, Shanghang Zhang, Jian Tang

专题命中 多模态评测 :multimodal(title)

AI总结 RoboMIND 2.0通过多模态双臂移动操作数据集和MIND-2系统,提升通用具身智能的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23730 2026-03-02 cs.AI 70%

Unlocking Cognitive Capabilities and Analyzing the Perception-Logic Trade-off

解锁认知能力并分析感知-逻辑权衡

Longyin Zhang, Shuo Sun, Yingxu He, Won Cheng Yi Lewis, Muhammad Huzaifah Bin Md Shahrin, Hardik Bhupendra Sailor, Heng Meng Jeremy Wong, Tarun Kumar Vangani, Yi Ma, Qiongqiong Wang, Minh Duc Pham, Ridong Jiang, Jingtao Li, Jingyi Liao, Zhuohan Liu, Yanfeng Lu, Manas Gupta, Ai Ti Aw

机构 * Institute for Infocomm Research (I 2 R), A*STAR, Singapore(信息与通信研究 institute(I 2 R),A*STAR,新加坡)

专题命中 多模态评测 :multimodal(abstract);audio-visual(abstract);分类 cs.AI

AI总结 MERaLiON2-Omni(Alpha)通过解耦感知与推理能力,针对东南亚地区提出多语言全方位感知模型,揭示感知与逻辑之间的效率-稳定性权衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23114 2026-03-02 cs.CV 57%

WARM-CAT: Warm-Started Test-Time Comprehensive Knowledge Accumulation for Compositional Zero-Shot Learning

WARM-CAT: 基于温启动的测试时综合知识积累用于组合零样本学习

Xudong Yan, Songhe Feng, Jiaxin Wang, Xin Su, Yi Jin

机构 * School of Computer Science and Technology, Beijing Jiaotong University(计算机科学与技术学院,北京交通大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 WARM-CAT通过温启动测试时综合知识积累,提升组合零样本学习的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏