arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-02 至 2026-07-02 共收录 19 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 19 篇

2607.00125 2026-07-02 cs.CV 新提交 89%

Decompose, Compare, and Decide: Multimodal LLMs are Implicit Few-Shot Learners

分解、比较与决策:多模态大语言模型是隐式少样本学习者

Yunhan Wang, Eshika Khandelwal, Edson Araujo, Walid Bousselham, Nina Shvetsova, Hilde Kuehne

机构 * Tuebingen AI Center, University of Tuebingen(图宾根大学图宾根人工智能中心)

专题命中 多模态评测 :MLLM(summary_cn,abstract);multimodal(title,abstract);分类 cs.CV

AI总结 提出DeCoDe方法,通过将少样本分类分解为成对图像比较,利用现有多模态大语言模型(MLLM)的logit作为相似度分数,无需额外训练即可实现强少样本分类,在多个基准上显著超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00461 2026-07-02 cs.CV 新提交 85%

Multimodal Continuous Reasoning via Asymmetric Mutual Variational Learning

非对称互变分学习实现多模态连续推理

Shijie Li, Yilin Gao, Siyuan Yang, Tieyuan Chen, Chaofan Gan, Zhihao He, Zicheng Zhao, Yuyu Guo, Weiyao Lin, Hang Yu

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 针对多模态大语言模型离散推理丢失感知细节及训练-推理不匹配问题,提出非对称互变分学习框架,通过双向KL散度校准先验与后验,缓解答案泄露,提升连续潜在推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25375 2026-07-02 cs.CV cs.AI 新提交 81%

Text Over Image: Auditing Multimodal Robustness in Synthetic Medical Image Detection

超越视觉取证:审计多模态鲁棒性用于合成医学图像检测

Ching-Hao Chiu, Hao-Wei Chung, Gelei Xu, Xueyang Li, Pin-Yu Chen, John Kheir, Meysam Ghaffari, Carlos Morato, Ahmed Abbasi, Yiyu Shi

机构 * University of Notre Dame(圣母大学) IBM Research(IBM研究院) Boston Children’s Hospital(波士顿儿童医院) Harvard Medical School(哈佛医学院) Optum AI, UnitedHealth Group(Optum AI, 联合健康集团)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对合成医学图像检测中多模态鲁棒性不足的问题,提出图像-记录配对基准,揭示视觉语言模型因过度依赖记录上下文而导致的预测偏差。

Comments Accepted at MICCAI 2026. Version 2 is a substantial journal extension of the MICCAI 2026 conference version, with additional provenance perturbations, paired statistical analysis, extended SAVC mitigation experiments, and broader deployment discussion. 19 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00606 2026-07-02 cs.CV 新提交 79%

Retrieved Images as Visual Thought: Training-Free Multimodal In-Context Learning for the Open-vs-Closed Gap

检索图像作为视觉思维:面向开放与封闭差距的无训练多模态上下文学习

Bingchen Huang, Zhiling Wang, Yifu Chen, Yuanchao Du

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 提出无训练框架ReVisIT,通过检索图像-标签对作为视觉思维单元,结合结构化类定义、多模态检索和交替注入示例,在多个基准上显著提升性能,弥合开放与封闭任务差距。

Comments 12 pages, 6 figures. Includes appendix. Introduces the MAAC-Bench benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00530 2026-07-02 cs.RO cs.AI 新提交 79%

From Technical Metrics to User Perception: A User Study of a Multimodal Human-Robot Interaction System for Object Detection and Grasping

从技术指标到用户感知:面向物体检测与抓取的多模态人机交互系统用户研究

Jian Song, Tian Zi, Shen Guanting

机构 * Dalian University of Technology(大连理工大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 通过24名用户的受试内实验,验证了端到端任务成功率从75%提升至90%的技术改进能显著提升用户对速度、可靠性和整体能力的感知,且70.83%的用户偏好改进系统。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19614 2026-07-02 cs.LG cs.CV 版本更新 79%

Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning

多重性是多模态学习中不可避免且固有的挑战

Sanghyuk Chun, Olga Russakovsky

机构 * Princeton University(普林斯顿大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文论证多模态数据固有的多对多映射关系(多重性)是影响数据构建、模型训练和评估的根本瓶颈,并呼吁发展多重性感知的学习框架与评估协议。

Comments ICML 2026 Position Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31597 2026-07-02 cs.CV 版本更新 70%

SOCO: Benchmarking Semantic Object Correspondence in Vision Foundation Models

SOCO: 视觉基础模型中语义对象对应关系的基准测试

Olaf Dünkel, Basavaraj Sunagad, Haoran Wang, David T. Hoffmann, Christian Theobalt, Adam Kortylewski

机构 * Max Planck Institute for Informatics(马克斯·普朗克研究所信息学研究所) Saarland Informatics Campus(萨尔州信息学校园) CISPA Helmholtz Center for Information Security(信息安全霍夫曼中心) University of Freiburg(弗赖堡大学)

专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV

AI总结 提出SOCO基准,通过引入对应类型分类法和100个类别上超过100万对功能上有意义的关键点注释,系统评估视觉基础模型中的语义对应能力,并揭示模型在跨类别迁移、语言引导定位与视觉对应之间的差距。

Comments Project page: https://genintel.github.io/SOCO/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17920 2026-07-02 cs.CV 版本更新 70%

SegFly: A Dataset and 2D-3D-2D Paradigm for Aerial RGB-Thermal Semantic Segmentation at Scale

SegFly:大规模航空RGB-热红外语义分割的数据集与2D-3D-2D范式

Markus Gross, Sai Bharadhwaj Matha, Rui Song, Viswanathan Muthuveerappan, Conrad Christoph, Julius Huber, Daniel Cremers

机构 * Fraunhofer Institute IVI(弗劳恩霍夫交通与基础设施系统研究所) TU Munich(慕尼黑工业大学) MCML(慕尼黑机器学习中心) UCLA(加州大学洛杉矶分校) Uni Cambridge(剑桥大学)

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对航空RGB-T数据集规模小、标注成本高和对齐困难的问题,提出几何驱动的2D-3D-2D范式,通过少量RGB标注自动生成密集伪标签并实现跨模态对齐,构建含2万+RGB图像和1.5万+RGB-T对的SegFly基准,实验表明该范式有效提升分割性能。

Journal ref ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31980 2026-07-02 cs.CL cs.AI cs.HC 新提交 62%

DigitalCoach: Communication and Grounding Gaps in Human and Agentic Computer Use Coaching

DigitalCoach:人类与智能体计算机使用辅导中的沟通与基础差距

Meng Chen, Anya Ji, Tsung-Han Wu, Tobias Maringgele, David M. Chan, Alane Suhr, Amy Pavel

机构 * University of California, Berkeley(加州大学伯克利分校) Technical University of Munich(慕尼黑工业大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 提出DigitalCoach数据集,包含72次人机辅导会话,评估模型在计算机使用教学中的表现,发现模型在解释、错误诊断和视觉基础方面存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11103 2026-07-02 cs.AI cs.CL cs.SE 版本更新 62%

GameDevBench: Evaluating Agentic Capabilities Through Game Development

GameDevBench: 通过游戏开发评估智能体能力

Wayne Chi, Yixiong Fang, Arnav Yayavaram, Siddharth Yayavaram, Seth Karten, Qiuhong Anna Wei, Runkun Chen, Alexander Wang, Valerie Chen, Ameet Talwalkar, Chris Donahue

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 提出GameDevBench基准,包含333个游戏开发任务,评估智能体在多模态软件开发中的能力,发现最佳智能体仅解决53.8%任务,并引入视觉反馈机制提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00416 2026-07-02 cs.CV 新提交 57%

DroneIQA-VLE: Multi-Task Drone Image Quality Assessment via Vision-Language Ensemble

DroneIQA-VLE:基于视觉-语言集成的多任务无人机图像质量评估

Wei Sun, Weixia Zhang, Hongjian Zhan, Mingkai Lu, Yixuan Gao, Guangtao Zhai

机构 * East China Normal University(华东师范大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出DroneIQA-VLE框架,通过集成SigLIP2视觉编码器与多任务回归头以及LoRA微调的Qwen3.5-9B多模态大模型,联合预测全局、目标和背景质量分数,在ICME 2026无人机图像质量评估挑战赛中获得第二名。

Comments The model achieves 2nd place in ICME 2026 Drone-IQA Grand Challenge on Target-aware Image Quality Assessment for Low-altitude UAV Images

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00115 2026-07-02 cs.CV 新提交 57%

PixelEyes: Decoupling Perception and Reasoning for Pinpoint Visual Evidence Seeking

PixelEyes: 解耦感知与推理以实现精准视觉证据查找

Dengxian Gong, Yuanzheng Wu, Haobo Yuan, Zhengdong Hu, Tao Zhang, Yikang Zhou, Shihao Chen, Quanzhu Niu, Kai Wang, Jason Li, Haochen Wang, Lu Qi, Shunping Ji, Ming-Hsuan Yang

机构 * Wuhan University(武汉大学) UC Merced(加州大学默塞德分校) UTS(UTS大学) NUS(新加坡国立大学) NTU(南洋理工大学) CASIA(中国科学院自动化所)

专题命中 多模态评测 :MLLM(abstract);分类 cs.CV

AI总结 针对多轮视觉推理中目标定位失败导致轨迹冗余的问题,提出PixelEyes,通过解耦推理与感知(推理器决定查找目标,专用感知工具定位),引入掩码引导视觉搜索和语义区域广度优先搜索,构建PixelEyes-6K数据集和Pinpoint-Bench基准,显著提升定位准确性。

Comments 22pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23365 2026-07-02 cs.CV 版本更新 57%

SpatialMosaic: A Multiview VLM Dataset for Partial Visibility

SpatialMosaic:一个多视角VLM数据集用于部分可见性

Kanghee Lee, Jungi Hong, Sion Lee, Injae Lee, Minseok Kwak, Kwonyoung Ryu, Jaesik Park

机构 * Seoul National University(首尔大学) University College London(伦敦大学学院) Kyung Hee University(庆熙大学) POSTECH(浦项科技大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出SpatialMosaic数据集,通过多视角图像生成2M问答对,引入SpatialMosaic-Bench基准测试,结合3D重建模型的混合框架提升空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19889 2026-07-02 cs.CV 版本更新 57%

OmniFall: From Staged Through Synthetic to Wild, A Unified Multi-Domain Dataset for Robust Fall Detection

OmniFall: 从舞台到合成再到真实场景,一个用于鲁棒跌倒检测的统一多域数据集

David Schneider, Zdravko Marinov, Moritz Mistol, Zeyun Zhong, Alexander Jaus, Rodi Düger, Rafael Baur, M. Saquib Sarfraz, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Mercedes-Benz Tech Innovation(梅赛德斯-奔驰技术创新)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出OmniFall统一基准,包含15k视频(80小时)的帧级标注,覆盖舞台、合成和真实三个域,评估微调模型和零样本多模态大模型,发现合成数据微调模型在跌倒状态检测上显著优于零样本模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18011 2026-07-02 cs.CV 版本更新 57%

RoadBench: Benchmarking MLLMs on Fine-Grained Spatial Understanding and Reasoning under Urban Road Scenarios

RoadBench: 在城市道路场景下对多模态大语言模型进行细粒度空间理解与推理的基准测试

Jun Zhang, Xin Zhang, Jie Feng, Long Chen, Junhui Wang, Zhicheng Liu, Depeng Jin, Yong Li

机构 * Department of Electronic Engineering, BNRist, Tsinghua University(清华大学电子工程系、北京信息科学与技术国家研究中心) Zhongguancun Academy(中关村学院) Amap, Alibaba Group(阿里巴巴集团高德地图)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 针对城市复杂场景中多模态大语言模型在细粒度空间理解与推理能力上的不足,提出RoadBench基准,包含8个任务、3040个测试用例,通过鸟瞰图和第一人称视角图像评估模型性能,揭示现有模型在此类任务上的显著缺陷。

Comments Accepted by ECCV 2026, the code and data are publicly available at: https://github.com/tsinghua-fib-lab/RoadBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17731 2026-07-02 cs.CV cs.LG 版本更新 57%

VisReason: A Large-Scale Dataset for Visual Chain-of-Thought Reasoning

VisReason: 面向视觉思维链推理的大规模数据集

Lingxiao Li, Yifan Wang, Xinyan Gao, Chen Tang, Xiangyu Yue, Chenyu You

机构 * Stony Brook University(石溪大学) Boston University(波士顿大学) MMLab, The Chinese University of Hong Kong(香港中文大学多媒体实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 为解决多模态大模型缺乏大规模视觉思维链数据的问题,构建包含48.9万样本的VisReason数据集及专家级子集VisReason-Pro,通过微调Qwen2.5-VL模型显著提升逐步视觉推理准确性与泛化能力。

Comments ECCV Camera Ready, project page: https://y-research-sbu.github.io/VisReason/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00234 2026-07-02 eess.SP 新提交 50%

Pinching Antennas-Assisted Sensing: A Ziv-Zakai Bound (ZZB) Perspective

夹捏天线辅助感知:Ziv-Zakai界(ZZB)视角

Hao Jiang, Chongjun Ouyang, Yuanwei Liu, Arumugam Nallanathan, Robert Schober

专题命中 多模态评测 :multimodal(abstract)

AI总结 针对夹捏天线系统(PASS)的多模态观测模型导致的感知模糊问题,从Ziv-Zakai界(ZZB)角度分析其感知能力,提出低复杂度替代目标函数以实现ZZB最小化。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00149 2026-07-02 math.PR stat.ML 新提交 50%

Uniform-in-time Propagation-of-Chaos for Stein Variational Gradient Descent

Stein变分梯度下降的一致时间混沌传播

Krishnakumar Balasubramanian, Sayan Banerjee, Anna Korba

专题命中 多模态评测 :multimodal(abstract)

AI总结 针对连续时间Stein变分梯度下降(SVGD),研究一致时间混沌传播,通过截断策略和有限维理论,在多种度量下获得对数或迭代对数率的界,并证明共轭原理将结果推广至非线性目标。

Comments 56 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00228 2026-07-02 astro-ph.IM astro-ph.HE cs.LG 新提交 50%

Leveraging Multimodality for Real-Time Classification of Transients and Variables found by the Zwicky Transient Facility

利用多模态对Zwicky瞬变设施发现的瞬变和变星进行实时分类

Ved G. Shah, Nabeel Rehemtulla, Adam A. Miller, Sushant Sharma Chaudhary, Michael W. Coughlin, Antoine Le Calloch, Matthew J. Graham, Joahan Castaneda Jaimes, Theophile Jegou du Laz, Ashish A. Mahabal, Frank J. Masci, Josiah Purdum, Reed Riddle, Jesper Sollerman, Anastasia Wei, Mansi M. Kasliwal

机构 * Department of Physics and Astronomy, Northwestern University(西北大学物理与天文学系) Center for Interdisciplinary Exploration and Research in Astrophysics (CIERA)(天体物理跨学科探索与研究中心) NSF-Simons AI Institute for the Sky (SkAI)(NSF-西蒙斯天空人工智能研究所) School of Physics and Astronomy, University of Minnesota(明尼苏达大学物理与天文学学院) Division of Physics, Mathematics, and Astronomy, California Institute of Technology(加州理工学院物理、数学与天文学部)

专题命中 多模态评测 :multimodal(abstract)

AI总结 针对时域巡天中实时分类的挑战,本文提出ORACLE-2模型,结合光变曲线、元数据和图像进行多模态层次分类,在ZTF数据上宏F1达0.73,较仅用光变曲线提升40%。

Comments 29 Pages, 15 Figures, 8 Tables. Comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏