arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-12 至 2026-03-12 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 7 篇

2509.23499 2026-03-12 cs.CV cs.CL cs.LG 82%

Multi-modal Data Spectrum: Multi-modal Datasets are Multi-dimensional

多模态数据光谱:多模态数据集是多维的

Divyam Madaan, Varshan Muhunthan, Kyunghyun Cho, Sumit Chopra

机构 * New York University(纽约大学) GenentechCIFAR(基因泰克CIFAR) New York University Grossman School of Medicine(纽约大学格罗斯曼医学院)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.CL;multimodal(comments)

AI总结 本文通过多模态大语言模型分析23个视觉问答基准,揭示了不同模态在目标任务中的依赖性差异,发现部分基准因设计缺陷放大了图像依赖性。

Comments Accepted to ICLR 2026. Code available at https://github.com/divyam3897/multimodal-spectrum

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05271 2026-03-12 cs.CV cs.AI 81%

DeepEyesV2: Toward Agentic Multimodal Model

DeepEyesV2:迈向代理多模态模型

Jack Hong, Chenxiao Zhao, ChengLin Zhu, Weiheng Lu, Guohai Xu, Xing Yu

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 DeepEyesV2通过两阶段训练方法实现代理多模态模型,结合数据构建、训练优化和评估,提升现实世界推理与工具调用能力。

Comments Accepted to ICLR2026. Homepage: https://visual-agent.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09689 2026-03-12 cs.CV cs.AI 62%

AutoViVQA: A Large-Scale Automatically Constructed Dataset for Vietnamese Visual Question Answering

AutoViVQA:一个大规模自动构建的数据集用于越南语视觉问答

Nguyen Anh Tuong, Phan Ba Duc, Nguyen Trung Quoc, Tran Dac Thinh, Dang Duy Lan, Nguyen Quoc Thinh, Tung Le

机构 * Faculty of Information Technology, University of Science, VNU-HCM(越南国家大学胡志明市分校信息科技学院) Vietnam National University, Ho Chi Minh City(越南国家大学胡志明市分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出AutoViVQA数据集,利用变压器架构进行越南语视觉问答,结合文本和视觉预训练,并在多语言环境下系统比较自动评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10990 2026-03-12 cs.CV 57%

Too Vivid to Be Real? Benchmarking and Calibrating Generative Color Fidelity

过于生动以至于不真实?生成式颜色真实性的基准测试与校准

Zhengyao Fang, Zexi Jia, Yijia Zhong, Pengcheng Luo, Jinchao Zhang, Guangming Lu, Jun Yu, Wenjie Pei

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出颜色真实性数据集和度量标准,通过多模态编码器和自适应指导尺度提升生成图像的颜色真实性,构建了评估与改进的渐进框架。

Comments accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10463 2026-03-12 cs.CV 57%

Learning to Wander: Improving the Global Image Geolocation Ability of LMMs via Actionable Reasoning

学习漫游:通过可操作推理提升LMMs的全球图像地理定位能力

Yushuo Zheng, Huiyu Duan, Zicheng Zhang, Xiaohong Liu, Xiongkuo Min

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 通过可操作推理提升LMMs的全球图像地理定位能力,提出GeoAoT框架和WanderBench基准,实现交互式地理定位探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11099 2026-03-12 cs.CV 57%

A Survey on Interpretability in Visual Recognition

视觉识别中可解释性的综述

Qiyang Wan, Chengzhi Gao, Ruiping Wang, Xilin Chen

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文综述了视觉识别中可解释性的发展,从意图、对象、呈现和方法学角度建立多维分类法,总结了关键评估指标,并探讨了多模态大语言模型的可解释性及实际应用。

Comments 20 pages, 8 figures, 7 tables. Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.04796 2026-03-12 cs.CV 57%

In Pursuit of Many: A Review of Modern Multiple Object Tracking Systems

追寻众多:现代多目标跟踪系统的综述

Mk Bashar, Samia Islam, Kashifa Kawaakib Hussain, Md. Bakhtiar Hasan, A. B. M. Ashikur Rahman, Md. Hasanul Kabir

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文综述了现代多目标跟踪系统的发展,涵盖从基于检测到端到端设计的演变,以及基于变压器、生成模型等架构的最新进展,并探讨了基准趋势和实际部署中的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏