arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-03 至 2026-06-03 共收录 26 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 26 篇

2606.03220 2026-06-03 cs.CL cs.AI 90%

WebRISE: Requirement-Induced State Evaluation for MLLM-Generated Web Artifacts

WebRISE: 面向MLLM生成Web工件的需求诱导状态评估

Yuxin Meng, Yuhan Suo, Junjie Wang, Yuhan Sun, Yiyao Yu, Ruixu Zhang, Ruining Hu, Yubin Wang, Shouwei Ruan, Bin Wang, Yuxiang Zhang, Yujiu Yang

机构 * Tsinghua University(清华大学) Huawei Noah’s Ark Lab(华为诺亚实验室) East China Normal University(华东师范大学) Tongji University(同济大学) Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院)

专题命中 多模态评测 :MLLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出WebRISE框架,通过交互契约图(ICG)将任务需求转化为可观察状态、用户意图转换和DOM/视觉断言,以评估MLLM生成的Web工件的功能正确性,实验表明ICG评分检测状态错误率是检查点评估的2-16倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03890 2026-06-03 cs.CV 87%

OVO-S-Bench: A Hierarchical Benchmark for Streaming Spatial Intelligence in Multimodal LLMs

OVO-S-Bench:多模态大语言模型中流式空间智能的分层基准

Yifei Li, Pengyiang Liu, Yuhang Zang, Zhongyue Shi, Qi Fu, Hongye Hao, Jiwen Lu

机构 * Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) Beihang University(北京航空航天大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(summary_cn,abstract_cn);分类 cs.CV

AI总结 提出OVO-S-Bench,一个完全人工标注的流式空间智能基准,包含1680个问题,涵盖四个抽象层次,评估38个MLLM,发现Gemini-3.1-Pro落后人类专家27分,流式空间微调MLLM表现不如其骨干模型。

Comments 48 pages, 12 figures, 15 tables. Project page: https://internlm.github.io/OVO-S-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03646 2026-06-03 cs.CV 83%

A Benchmark for Semi-supervised Multi-modal Crowd Counting

半监督多模态人群计数基准

Haoliang Meng, Xiaopeng Hong, Yabin Wang, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室)

专题命中 多模态评测 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文构建了首个半监督多模态人群计数基准,通过制定标准化协议和评估多种基线方法,为该任务奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02747 2026-06-03 cs.CV cs.AI 81%

Plan2Map: A Multimodal Benchmark for Document-Grounded Geospatial Boundary Reconstruction from Planning Records

Plan2Map: 基于规划记录的文档驱动地理空间边界重建的多模态基准

Fabian Degen, Oishi Deb, Jindong Gu, Junchi Yu, Samuele Marro, Philip Torr, Jialin Yu

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出Plan2Map基准和GeoPlanAgent系统,通过文档证据提取、定位、地图配准、边界分割等步骤,从英国规划记录中重建地理空间边界,显著优于直接VLM方法。

Comments Project page: https://odeb1.github.io/Plan2Map_Project_Page/. Fabian Degen and Oishi Deb Contributed Equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22018 2026-06-03 cs.CV cs.AI cs.RO 81%

FRED: A Multi-Modal Autonomous Driving Dataset for Flooded Road Environments

FRED:面向洪水道路环境的多模态自动驾驶数据集

Connor Malone, Sebastien Demmel, Sebastien Glaser

机构 * Queensland University of Technology(昆士兰理工大学) ARC Training Centre for Automated Vehicles in Rural and Remote Regions (AVR3)(农村和偏远地区自动化车辆培训中心(AVR3))

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出首个针对道路水险场景的多模态自动驾驶数据集FRED,包含相机、LiDAR和IMU数据,并提供语义标签以支持水险检测方法训练与评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18160 2026-06-03 cs.CV cs.AI 81%

Vision Inference Former: Sustaining Visual Consistency in Multimodal Large Language Models

Vision Inference Former:在多模态大语言模型中维持视觉一致性

Xinpeng Dong, Min Zhang, Kairong Han, Xu Tan, Fei Wu, Kun Kuang

机构 * Zhejiang University(浙江大学) East China Normal University(华东师范大学) Zhejiang University of Science and Technology(浙江理工大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对多模态大语言模型中视觉信息被弱化的问题,提出Vision Inference Former(VIF)轻量模块,在推理解码阶段持续注入视觉语义,提升生成内容与视觉的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18572 2026-06-03 cs.CV cs.AI cs.LG 81%

Back into Plato's Cave: Examining Cross-modal Representational Convergence at Scale

回到柏拉图的洞穴:大规模检验跨模态表示收敛性

A. Sophia Koepke, Daniil Zverev, Shiry Ginosar, Alexei A. Efros

机构 * UC Berkeley(伯克利大学) Technical University Munich, MCML(慕尼黑技术大学) University of Tübingen, Tübingen AI Center(图宾根大学) Toyota Technical Institute at Chicago(芝加哥丰田技术研究所)

专题命中 多模态评测 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文通过大规模数据集实验,质疑了柏拉图表示假说中跨模态表示收敛的证据,发现对齐度随数据规模增大而显著下降,且仅反映粗粒度语义重叠。

Comments Project page: http://akoepke.github.io/cave_umwelten/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03066 2026-06-03 cs.AI 79%

CORE: Conflict-Oriented Reasoning for General Multimodal Manipulation Detection

CORE: 面向冲突的通用多模态篡改检测推理

Jinjie Shen, Yaxiong Wang, Yujiao Wu, Lechao Cheng, Tianrui Hui, Nan Pu, Zhihui Li, Zhun Zhong

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 提出CORE框架,通过构建冲突归因语料库和面向冲突的推理,增强多模态大语言模型的冲突捕捉能力,实现鲁棒且泛化的多模态篡改检测。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02956 2026-06-03 cs.CV cs.LG cs.RO 79%

The Road Ahead in Autonomous Driving: The KITScenes Multimodal Dataset

自动驾驶的未来之路:KITScenes多模态数据集

Richard Schwarzkopf, Fabian Immel, Alexander Blumberg, Jonas Merkert, Nils Rack, Kaiwen Wang, Fabian Konstantinidis, Julian Truetsch, Carlos Fernandez, Annika Bätz, Kevin Rösch, Marlon Steiner, Willi Poh, Yinzhe Shen, Royden Wagner, Felix Hauser, Dominik Strutz, Jaime Villa, Gleb Stepanov, Holger Caesar, Ömer Şahin Taş, Frank Bieder, Jan-Hendrik Pauls, Christoph Stiller

机构 * FZI Research Center for Information Technology(弗劳恩霍夫信息技术研究中心) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) University Charles III of Madrid(马德里第三大学) Delft University of Technology(代尔夫特理工大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出KITScenes多模态数据集,通过高保真传感器和完整HD地图,解决现有数据集在传感器精度、地图完整性和地理多样性上的不足,并引入四个基准推动空间学习。

Comments 28 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03427 2026-06-03 cs.SE 78%

Multi-Modal Assessment of Road Roughness Using Smartphone Applications, Acceleration, and Passenger Ratings

使用智能手机应用、加速度和乘客评分的多模态道路平整度评估

Novel Certada, Amirhesam Aghanouri, Joseba Gorospe, Cristina Olaverri-Monreal

专题命中 多模态评测 :multi-modal(title,abstract)

AI总结 提出一种基于智能手机IRI估计、车载GNSS-IMU测量和乘客PSR评分的低成本多模态道路平整度评估框架,验证了数据间的相关性及感知与物理指标的关联。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02892 2026-06-03 cs.LG 78%

Multi-Modal Machine Learning for Breast Cancer Recurrence Prediction

多模态机器学习用于乳腺癌复发预测

Jiahao Shao, Xudong Wang, Anam Nawaz Khan, Christopher Brett, Xueping Li, Bing Yao

机构 * Department of Industrial & Systems Engineering, The University of Tennessee, Knoxville, TN 37996, USA(工业与系统工程系,田纳西大学,诺克斯维尔,TN 37996,美国) The University of Tennessee Medical Center, Knoxville, TN 37920, USA(田纳西大学医学中心,诺克斯维尔,TN 37920,美国)

专题命中 多模态评测 :multi-modal(title,abstract)

AI总结 本研究通过整合结构化与非结构化临床数据(治疗记录、病理报告和临床笔记),结合基于规则的正则表达式提取和优先级冲突解决策略,显著提升了乳腺癌复发预测的准确性。

Comments 33 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02774 2026-06-03 cs.CV 74%

GeoDrive-Bench: Benchmarking Region-Specific Multimodal Reasoning in Autonomous Driving

GeoDrive-Bench:自动驾驶中区域特定多模态推理的基准测试

Yingzi Ma, Chaowei Xiao, Ming Jiang

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Johns Hopkins University(约翰霍普金斯大学)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 提出GeoDrive-Bench基准,通过5053个跨六国人工验证的多选题,评估视觉语言模型在感知、预测、规划和区域推理四个驾驶任务中基于区域特定交通规则的推理能力,并设计蒸馏算法注入区域知识以提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03018 2026-06-03 stat.ME cs.LG math.ST stat.ML stat.TH 67%

A Fast Screening Approach for High-dimensional Outcomes and High-dimensional Predictors

高维结果与高维预测变量的快速筛选方法

Hongju Park, Zhenyao Ye, Shuo Chen

机构 * School of Pharmacy, University of North Carolina, Chapel Hill(北卡罗来纳大学药学院) Maryland Psychiatric Research Center, School of Medicine, University of Maryland(马里兰大学医学院精神病研究中心)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract)

AI总结 提出图独立双筛选(GIDS)框架,同时降低响应变量和预测变量的维度,以解决高维交叉模态分析中的计算负担和可解释性问题。

Comments 38 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03603 2026-06-03 cs.CV cs.CL 62%

World Models Meet Language Models: On the Complementarity of Concrete and Abstract Reasoning

世界模型遇见语言模型:论具体推理与抽象推理的互补性

Yucheng Zhou, Wei Tao, Yiwen Guo, Jianbing Shen

机构 * Nanyang Technological University(南洋理工大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出受控具体推理框架及PF-OPSD方法,通过结合世界模型的视觉模拟与多模态大语言模型的抽象推理,在空间前瞻和开放域物理预测任务上提升性能与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03566 2026-06-03 cs.CV cs.AI 62%

Efficient Transformer-Based Localized Patch Sampling for Choroid Plexus Segmentation in Multiple Sclerosis

基于高效Transformer的局部块采样用于多发性硬化脉络丛分割

Po-Jui Lu, Alessandro Cagol, Mario Ocampo-Pineda, Federico Spagnolo, Marina Mastantuono, Andreea-Alexandra Aldea, Jannis Müller, Özgür Yaldizli, Matthias Weigel, Lester Melie-Garcia, Roberta Magliozzi, Maria Pia Sormani, Ludwig Kappos, Jens Kuhle, Cristina Granziera

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出一种基于SwinUNETR和局部块采样的方法,实现多发性硬化侧脑室脉络丛的自动分割,在降低99%计算量的同时取得优于现有模型的Dice系数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03301 2026-06-03 cs.CL cs.CV 62%

SagaQA: A Multi-hop Reasoning Benchmark for Long-form Narrative Understanding in TV Series

SagaQA:面向电视剧长篇叙事理解的多跳推理基准

Galann Pennec, Zhengyuan Liu, Nicholas Asher, Philippe Muller, Nancy F. Chen

机构 * IRIT, University of Toulouse, France(法国图卢兹大学IRIT中心) Agency for Science, Technology and Research (A*STAR), Singapore(新加坡科技研究局) CNRS, IRIT, France(法国CNRS与IRIT)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 提出SagaQA基准,通过跨剧集的多跳推理任务评估模型对完整电视剧多模态叙事的高层次理解,并比较并行、顺序和混合三种规划策略的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03577 2026-06-03 cs.CV 57%

Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching

通过宽基线匹配激发多模态大语言模型中的复杂空间推理

Hao Zhong, Muzhi Zhu, Shenyan Zeng, Anzhou Li, Cong Chen, Hua Geng, Duochao Shi, Wentao Ye, Tao Lin, Hao Chen, Chunhua Shen

机构 * State Key Laboratory of CAD & CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) Ant Group(蚂蚁集团) Westlake University(西湖大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出ReasonMatch-Bench基准和动态对应强化学习(DCRL)方法,以系统评估和提升多模态大语言模型在宽基线匹配任务中的空间推理能力。

Comments CVPR 2026. Project page: https://aim-uofa.github.io/reasonmatch/ Code: https://github.com/aim-uofa/ReasonMatch

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03417 2026-06-03 cs.CV 57%

A unified multi-task framework enables interpretable chest radiograph analysis

统一多任务框架实现可解释的胸部X光片分析

Lijian Xu, Ziyu Ni, Xinglong Liu, Xiaosong Wang, Hongsheng Li, Shaoting Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出IMT-CXR框架,通过统一Transformer架构模拟放射科医生诊断流程,实现疾病识别、属性表征和可追溯报告生成,在十个基准上表现优异,且临床评估中66%的AI报告达到或超越原始报告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03401 2026-06-03 cs.CV 57%

Towards Characterizing Scientific Image Utility and Upgradability

面向科学图像效用与可升级性的表征

WenZhe Li, Qihang Yan, Liang Chen, Junying Wang, Farong Wen, Yijin Guo, Chunyi Li, Zicheng Zhang, Guangtao Zhai

机构 * TongJi University(同济大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 针对AI生成内容对科学图像完整性的威胁,提出SIU²A框架,通过效用(错误检测与修正可行性)和可升级性(修正质量)两个维度评估科学图像,并构建基准数据集揭示当前多模态系统在科学错误评估与忠实修正方面的显著局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02996 2026-06-03 cs.RO cs.CV cs.HC 57%

MARIO: Motion-Augmented Real-Time Multi-Sensor Inertial Odometry

MARIO: 运动增强的实时多传感器惯性里程计

Yiquan Li, Taeyoung Yeon, Chenfeng Gao, Vasco Xu, Xuanyou Liu, Karan Ahuja

机构 * Northwestern University(西北大学) University of Chicago(芝加哥大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出MARIO框架,通过学习IMU推断的人体姿态先验约束运动动力学,并结合多传感器融合(磁力计、气压计、辅助IMU),在Nymeria数据集上将位置漂移降低36%-42%,实现无相机人体跟踪的准确鲁棒惯性里程计。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02835 2026-06-03 cs.AI 57%

Thinking Past the Answer: Evaluating Harmful Overthinking in Large Reasoning Models

超越答案的思考:评估大型推理模型中的有害过度思考

Simone Caldarella, Davide Talon, Rahaf Aljundi, Elisa Ricci, Massimiliano Mancini

机构 * University of Trento(特伦托大学) Toyota Motor Europe(丰田欧洲公司) Fondazione Bruno Kessler(布鲁诺·凯塞林基金会)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出前缀级轨迹评估协议,通过定义推理充分性来区分冗余但无害的冗长过度思考和导致正确轨迹偏离的有害过度思考,发现当前模型不仅受限于推理能力,还受限于无法在适当时机停止。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00188 2026-06-03 cs.GR cs.CV cs.LG 57%

PaintBench: Deterministic Evaluation of Precise Visual Editing

PaintBench: 精确视觉编辑的确定性评估

Kai Xu, Ellis Brown, Shrikar Madhu, Rob Fergus, He He, Saining Xie

机构 * New York University(纽约大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出PaintBench基准,通过程序化生成20种基本视觉编辑操作,实现确定性像素级评估,发现当前模型性能低(最高mIoU 17.1%),并揭示任务分解和场景变化的影响。

Comments Project Page: https://paintbench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03184 2026-06-03 q-fin.CP cs.LG q-fin.ST 50%

FinStressTS: A Parametric Synthetic Benchmark for Time-Series Forecasting in Finance

FinStressTS: 金融时间序列预测的参数化合成基准

Jiaze Sun, Kelvin J. L. Koa, Ruiyang Ni, Yize Liu, Haonan Chen, Ke-Wei Huang

机构 * National University of Singapore(新加坡国立大学) Asian Institute of Digital Finance(亚洲数字金融研究所) Nanyang Technological University(南洋理工大学)

专题命中 多模态评测 :multimodal(abstract)

AI总结 针对金融预测中信号弱、机制复杂的问题,提出FinStressTS合成基准,通过30个诊断环境系统评估15种模型在点预测与概率预测上的表现,揭示模型性能对数据机制的依赖性。

Comments KDD 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02785 2026-06-03 cs.LG hep-ex physics.atom-ph quant-ph 50%

QUIVER: Quantum-Informed Views for Enhanced Representations in Large ML Models

QUIVER: 用于大型机器学习模型中增强表示的量子信息视角

Aritra Bal, Michael Binder, Markus Klute, Benedikt Maier, Michael Spannowsky

机构 * University of California, Berkeley(加州大学伯克利分校) ETH Zurich(苏黎世联邦理工学院) University of Cambridge(剑桥大学)

专题命中 多模态评测 :multimodal(abstract)

AI总结 提出QUIVER框架,通过变分量子电路提取量子Fisher信息矩阵作为几何特征,与经典特征融合以提升大型机器学习模型性能,并在QM9和JetClass数据集上验证了有效性。

Comments 9 pages, 1 figure and 2 tables. Accepted as a poster at the AI4Physics Workshop, ICML 2026 (Seoul, South Korea)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27938 2026-06-03 cs.HC 50%

Appraisal Dimensions Generalise Better than Emotion Labels for Cross-Age Affect Recognition in AI-Assisted Healthcare

评估维度在AI辅助医疗中跨年龄情感识别比情感标签更具泛化性

Hippolyte Fournier, Safaa Azzakhnini, Sina Alisamir, Isabella Zsoldos, Eléonore Trân, Gérard Bailly, Frédéric Elisei, Béatrice Bouchot, Brice Varini, Patrick Constant, Joan Fruitet, Franck Tarpin-Bernard, Solange Rossato, François Portet, Olivier Koenig, Hanna Chainay, Fabien Ringeval

专题命中 多模态评测 :multimodal(abstract)

AI总结 本研究通过比较基于评估维度和情感标签的多模态模型在老年和青年群体上的表现,发现评估维度在跨年龄情感识别中具有更好的泛化能力和预测稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09606 2026-06-03 cs.RO cs.SY eess.SY 50%

BEAVR: Bimanual, multi-Embodiment, Accessible, Virtual Reality Teleoperation System for Robots

BEAVR:用于机器人的双手、多形态、可访问的虚拟现实遥操作系统

Alejandro Posadas-Nava, Alejandro Carrasco, Richard Linares

机构 * Department of Aeronautics and Astronautics, Massachusetts Institute of Technology(航空与航天系,麻省理工学院)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 提出BEAVR,一个开源的双手多形态VR遥操作系统,通过零拷贝流式架构和异步“思考-行动”控制循环,实现低延迟、多机器人实时控制与数据记录,并兼容多种视觉运动策略。

Comments Accepted for presentation on ICCR Kyoto 2025

详情

展开后加载摘要…

URL PDF HTML 收藏