arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-13 至 2026-08-13 共收录 18 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 18 篇

2608.11738 2026-08-13 cs.CV cs.AI 新提交 91%

Advancing MLLM-based UAV Image Understanding and Reasoning: A Benchmark and a Training-Free Multi-Agent System

推进基于多模态大语言模型(MLLM)的无人机(UAV)图像理解与推理:基准测试及无训练多智能体系统

Haoyu Zhang, Shuoxun Zhang, Peng Ye, Lin Zhang, Jiakang Yuan, Shenghong Yi, Yuening Wang, Tao Chen

机构 * Fudan University(复旦大学) College of Future Information Technology(未来信息技术学院) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态评测 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究构建UAVQA-Bench基准,识别MLLM用于无人机图像理解的三类失效模式,提出含DSPE、CAIR、DAAS的无训练多智能体系统UAV-MAS,其32B版本在基准上准确率超Gemini 3 Pro 4.0个百分点

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12262 2026-08-13 cs.CV cs.AI 新提交 84%

Diagram-MMU: A Multi-Modal Benchmark for Scientific Diagrams

Diagram-MMU:面向科学图表的多模态基准测试

Weihao Bo, Shan Zhang, Yanpeng Sun, Jie Liu, Yongke Yao, Jinhao Du, Wei He, Kai Zou, Zechao Li, Jingdong Wang

机构 * Nanjing University of Science and Technology(南京理工大学) Baidu Inc(百度公司) AIML, Adelaide University(阿德莱德大学AIML) SUTD(新加坡科技设计大学) Southeast University(东南大学) East China Normal University(华东师范大学) University of Oxford(牛津大学)

专题命中 多模态评测 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文构建了多模态基准测试Diagram-MMU,评估MLLMs的科学图表解析与理解能力,发现图表转代码任务更具挑战,Claude-4.6 Opus在智能体场景下表现最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09648 2026-08-13 cs.DB cs.AI 版本更新 83%

ArtiFact: A Large-Scale Multi-Modal Cultural Heritage Dataset

ArtiFact: 大规模多模态文化遗产数据集

Luciano Duarte, Olga Ovcharenko, Sebastian Schelter

机构 * BIFOLD & TU Berlin(BIFOLD与柏林技术大学)

专题命中 多模态评测 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 提出包含65万条博物馆记录的多模态文化遗产数据集ArtiFact,用于跨模态错误检测和语义查询处理,揭示现有系统在领域特定错误和文化语义查询上的挑战。

Comments NOVAS Workshop at VLDB 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11907 2026-08-13 cs.CV cs.AI 新提交 81%

Do You See What You Draw? A Semantic Closed-Loop Framework for Holistic Evaluation of Unified Multimodal Models

你能看到你所绘制的内容吗?面向统一多模态模型整体评估的语义闭环框架

Hao Zhang, Jiaxin Qi, Zhijiang Tang, Jianqiang Huang

机构 * Hangzhou Institute for Advanced Study(杭州高等研究院) University of Chinese Academy of Sciences(中国科学院大学) Computer Network Information Center(计算机网络信息中心) Chinese Academy of Sciences(中国科学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究针对统一多模态模型的系统级评估缺口,提出无标注的SGU语义闭环框架,通过感知-生成-推理流程评估模型综合能力,发现高性能模型存在自生成上下文推理局限,为下一代模型开发提供基准基础。

Comments 21 pages, 8 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00056 2026-08-13 cs.CY cs.AI cs.CL 版本更新 81%

How effective are VLMs in assisting humans in inferring the quality of mental models from Multimodal short answers?

VLMs在帮助人类推断从多模态简答中获得的思维模型质量的有效性如何?

Pritam Sil, Durgaprasad Karnam, Vinay Reddy Venumuddala, Pushpak Bhattacharyya

机构 * Department of Computer Science and Engineering, IIT Bombay(印度理工学院班加罗尔分校计算机科学与工程系) Center for Educational Technology, IIT Bombay(印度理工学院班加罗尔分校教育技术中心) School of Management, Mahindra University(马恒达大学管理学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出MMGrader方法,通过概念图框架从多模态回答推断学生思维模型质量,发现最佳模型在人类水平上表现不足,但能有效辅助教师改进教学。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17332 2026-08-13 cs.CV cs.AI 版本更新 81%

P2MFDS: A Privacy-Preserving Multimodal Fall Detection System for Elderly People in Bathroom Environments

P2MFDS:面向浴室环境老年人的隐私保护多模态跌倒检测系统

Haitian Wang, Yiren Wang, Xinyu Wang, Yumeng Miao, Yuliang Zhang, Yu Zhang, Atif Mansoor

机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院) Department of Computer Science and Software Engineering, The University of Western Australia(西澳大学计算机科学与软件工程系)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对浴室环境老年人跌倒检测的单模态系统准确率受限问题,本文提出P2MFDS多模态系统,融合毫米波雷达与3D振动传感,构建大规模隐私保护数据集,双流网络结合多尺度特征,提升了跌倒检测的准确率与召回率。

Comments Accepted to appear in the 2025 IEEE International Workshop on AIoT and Smart Systems (AIoTSys'25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23733 2026-08-13 cs.CL 版本更新 79%

Multimodal QUD: Inquisitive Questions from Scientific Figures

多模态QUD:来自科学图表的探究性问题

Yating Wu, William Rudman, Venkata S Govindarajan, Alexandros G. Dimakis, Junyi Jessy Li

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Ithaca College(伊萨卡学院) UC Berkeley, BespokeLabs.ai(伯克利大学,BespokeLabs.ai)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出多模态QUD数据集,通过结合图表与文本上下文生成探究性问题,提升多模态推理能力,实现更高质量的视觉 grounding。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05356 2026-08-13 cs.CV cs.RO 版本更新 74%

LoDA: A Level of Detection Aware Method and a Multimodal Sensing Benchmark for Object Level Change Detection

LoDA:一种面向目标级变化检测的检测级别感知方法及多模态感知基准

Haitian Wang, Xinyu Wang, Sheldon Fung, Xian Zhang, Zichen Geng

机构 * Western Australia Machine Intelligence Group Pty Ltd(西澳大利亚机器智能集团有限公司) The University of Western Australia(西澳大利亚大学) Curtin University(科廷大学)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 该研究针对自动驾驶等领域的目标级变化检测问题,提出LoDA检测级别感知方法,构建LoDA基准,在Subiaco和Urb3DCD-V2基准上均超越现有最佳基线,提升了变化检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12310 2026-08-13 cs.CL cs.AI 版本更新 73%

LakeQuest: A Three-Domain Benchmark for Grounded Question Answering across Data Lakes

LakeQuest:用于跨数据湖的有基础问答的三领域基准测试

Michael Solodko, Steven Gong, Guangwei Yu, Satya Krishna Gorti, Jesse C. Cresswell, Victor Zhong

机构 * University of Waterloo(滑铁卢大学)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 介绍LakeQuest基准测试,用于评估跨数据湖的有基础问答。它跨越三个领域,含9846个QA对及证据指针,能暴露系统故障模式。通过基线评估发现高质量检索不能保证正确推理,凸显未来智能QA系统需强大发现和跨文件组合机制。

Comments 24 pages, 4 figures, 18 tables. Accepted at the Conference on Language Modeling (COLM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16179 2026-08-13 cs.CV cs.AI 73%

360° Image Perception with MLLMs: A Comprehensive Benchmark and a Training-Free Method

360度图像感知与MLLMs:一个全面的基准和无需训练的方法

Huyen T. T. Tran, Van-Quang Nguyen, Farros Alferro, Kang-Jun Liu, Takayuki Okatani

机构 * GSIS, Tohoku University(东大GSIS研究所,东京东大大学) RIKEN AIP, Japan(日本RIKEN AIP)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出360Bench基准和Free360方法,评估MLLMs在360度图像感知中的能力,揭示其不足,并提出基于场景图的无需训练框架提升VQA性能。

Journal ref ECCV2026 (Link: https://tranhuyen1191.github.io/360Bench-Free360/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12158 2026-08-13 cs.CV 新提交 70%

Context Blindness in DPO: Mitigating Object Hallucination in MLLMs via Context-Calibrated Preference Optimization

DPO中的上下文盲区:通过上下文校准的偏好优化缓解多模态大语言模型(MLLMs)中的物体幻觉

Byungoh Ko, Jinyoung Park, Jongha Kim, Jeehye Na, Jaewon Cho, Hyunwoo J. Kim

机构 * Korea University(高丽大学) KAIST(韩国科学技术院)

专题命中 多模态评测 :multimodal(abstract,abstract_cn);分类 cs.CV

AI总结 本研究针对MLLMs的物体幻觉问题,提出C²-DPO方法,通过最大化上下文偏好增益降低幻觉率,使Qwen2-VL-Instruct-2B的幻觉率相对降低36%且不损害通用推理能力。

Comments Accepted at ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09996 2026-08-13 cs.CV 版本更新 70%

Omni-Persona: Systematic Benchmarking and Improving Omnimodal Personalization

Omni-Persona:系统性基准测试与改进多模态个性化

Yeongtak Oh, Dongwook Lee, Sangkwon Park, Heeseung Kim, Sungroh Yoon

机构 * Department of Electrical and Computer Engineering, Seoul National University(首尔国立大学电气与计算机工程系) Interdisciplinary Program in Artificial Intelligence, Seoul National University(首尔国立大学人工智能跨学科项目) Department of Artificial Intelligence, University of Seoul(首尔大学人工智能系)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 Omni-Persona提出首个多模态个性化基准,通过Persona Modality Graph任务组和细粒度任务,系统分析多模态个性化中的接地行为,提出Calibrated Accuracy评估方法,揭示开源模型在音频与视觉接地上的差距及SFT与RLVR的局限性。

Comments Project Page: https://github.com/oyt9306/Omni-Persona

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11741 2026-08-13 cs.CV cs.AI 新提交 62%

JieZi: A Large-Scale Expert-Audited Dataset and Benchmark for Ancient Chinese Character Exegesis

JieZi:用于古文字训诂的大规模专家审核数据集与基准

Ran Li, Huiguo He, Jiahuan Cao, Junle Liu, Hiuyi Cheng, Lianwen Jin

机构 * South China University of Technology(华南理工大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文针对古文字训诂研究缺乏结构化数据与基准的问题,提出ACCE任务,构建JieZi-Dataset与JieZi-Bench,实验发现多模态大模型在古文字训诂的高阶任务上表现不佳,微调后性能显著提升。

Comments 19 pages, 13 figures. Accepted to the Dataset Track of ACM Multimedia 2026 for oral presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11891 2026-08-13 cs.CY cs.AI cs.HC 新提交 57%

Benchmark-Based Comparative Assessment of Publicly Benchmarked Indian Foundation Models: A Capability and Evaluation-Maturity Framework

基于基准的公开基准印度基础模型对比评估:能力与评估成熟度框架

Avinash Agarwal, Vridhi Jain

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出能力与评估成熟度框架,对公开基准的印度基础模型与全球同类模型对比评估,发现其在传统基准表现尚可但参与新评估不足,还提出基准成熟度指数,指出能力差距或源于评估生态问题。

Comments 18 pages, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11883 2026-08-13 cs.CV 新提交 57%

Warping Earth Observations for better ice labeling in the Marginal Marginal Ice Zone

利用地球观测数据对齐优化边缘冰区的冰标记

Tom Kelly, Martin S. J. Rogers

机构 * British Antarctic Survey(英国南极调查局)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 该研究提出基于互信息对齐的架构,对齐Sentinel-1与MODIS的多模态卫星场景,构建稀疏专家标注数据集,提升海冰分类准确率,实现从稀疏监督的精确密集海冰分割。

Comments ECCV Workshop paper; BEAM 2

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11292 2026-08-13 cs.CV 新提交 57%

Self-Evolving Code-with-Image Reasoning

自演进的代码-图像推理

Tianze Yang, Liang Wu, Ruitong Sun, Yucheng Shi, Yanqiao Wang, Mayank Darbari, Ninghao Liu, Jin Sun, Liangjie Hong

机构 * Nokia(诺基亚) University of Georgia(佐治亚大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 该研究提出代码-图像推理范式,通过无训练反思循环让模型自我演进技能,在CwI-Bench上显著提升多模态模型视觉任务准确率,技能可跨规模与任务家族迁移。

Comments 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12037 2026-08-13 cs.LG cs.SY eess.SY 新提交 50%

Clustered Randomized Smoothing for Stochastic Prediction Functions

面向随机预测函数的聚类随机平滑方法

Eduardo Figueiredo, Frederik Mathiesen, Julian Schumann, Jens Kober, Arkady Zgonnikov, Luca Laurenti

机构 * Delft University of Technology(代尔夫特理工大学) University of Stuttgart(斯图加特大学) AI4I

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本文针对随机多模态回归中随机平滑的模式崩溃问题,提出聚类α-平滑框架,在两个基准实验中较现有方法显著降低了Wasserstein距离与碰撞率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11958 2026-08-13 cs.HC 新提交 50%

Synchronized AMG and EMG Dataset of Lower-limb Muscle Activities in Everyday Training

日常训练中下肢肌肉活动的同步AMG与EMG数据集

Dongxu Tang, Shih Ying-Lei, Zhuoyi Ren, Jianting Liao, Yitian Shao

专题命中 多模态评测 :multimodal(abstract)

AI总结 该研究构建了健康成人下肢活动的同步AMG与EMG多模态数据集,通过基准测试评估其用于关节角估计的性能,为下肢肌肉协调相关研究提供了可重复的资源。

详情

展开后加载摘要…

URL PDF HTML 收藏