arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-27 至 2026-05-27 共收录 20 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 20 篇

2605.26320 2026-05-27 cs.LG cs.CL 86%

MULTISEISMO: A Multimodal Seismic Dataset and Model for Cross-Modal Seismic Understanding

MULTISEISMO: 面向跨模态地震理解的多模态地震数据集与模型

Sai Munikoti, Ian Stewart, Chengping Chai, Lisa Linville, Scott Vasquez, Sameera Horawalavithana, Karl Pazdernik

机构 * Pacific Northwest National Laboratory(太平洋西北国家实验室) Oak Ridge National Laboratory(橡树岭国家实验室) Sandia National Laboratory(桑迪亚国家实验室) North Carolina State University(北卡罗来纳州立大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(title);分类 cs.CL

AI总结 针对地震学中多模态数据整合的缺失,构建了包含超过1.6万次地震事件的结构化多模态数据集MultiSeismo,并开发了专用多模态模型SeisModal,在跨模态地震推理任务上取得了优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11799 2026-05-27 cs.AI cs.IR 83%

Hi-SAM: A Hierarchical Structure-Aware Multi-modal Framework for Large-Scale Recommendation

Hi-SAM: 一种面向大规模推荐的分层结构感知多模态框架

Pingjun Pan, Tingting Zhou, Peiyao Lu, Tingting Fei, Hongxiang Chen, Chuanjiang Luo

机构 * Netease Cloud Music(网易云音乐)

专题命中 多模态评测 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 针对多模态推荐中语义ID离散化存在的次优分词和架构-数据不匹配问题,提出Hi-SAM框架,通过解耦语义分词器和分层记忆-锚点Transformer,在冷启动场景下显著提升推荐性能。

Comments Accepted at ACM KDD 2026 ADS

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09532 2026-05-27 cs.LG cs.AI cs.CL cs.CV 82%

Athena: Enhancing Multimodal Reasoning with Data-efficient Process Reward Models

Athena: 利用数据高效的过程奖励模型增强多模态推理

Shuai Wang, Zhenhua Liu, Jiaheng Wei, Xuanwu Yin, Dong Li, Emad Barsoum

机构 * Advanced Micro Devices Inc.(先进微器件公司) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出 Athena-PRM,一种多模态过程奖励模型,通过利用弱和强完成者之间的预测一致性高效生成高质量过程标签,在仅5000样本下显著提升复杂推理问题的逐步评估性能。

Comments TMLR 2026, https://openreview.net/forum?id=unWmplHccF

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26781 2026-05-27 cs.AI cs.MM 81%

LiveK12Bench: Have Large Multimodal Models Truly Conquered High School-level Examinations?

LiveK12Bench: 大型多模态模型真的征服了高中水平的考试吗?

Xiaohan Wang, Mingze Yin, Yilin Zhao, Gang Liu, Dian Li

机构 * Tencent PCG(腾讯PCG) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI、cs.MM

AI总结 本文提出动态多学科基准LiveK12Bench,通过自动化流水线和新颖的模拟考试评估方案,揭示大型多模态模型在真实考试场景下性能显著下降,尤其对复杂视觉布局敏感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02035 2026-05-27 cs.CL cs.AI 81%

VIDA: A dataset for Visually Dependent Ambiguity in Multimodal Machine Translation

VIDA: 多模态机器翻译中视觉依赖歧义的数据集

Jingheng Pan, Xintong Wang, Longyue Wang, Liang Ding, Weihua Luo, Chris Biemann

机构 * Department of Informatics, Universität Hamburg(汉堡大学信息学院) Alibaba Group(阿里巴巴集团) Alibaba Cloud(阿里云)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 提出VIDA数据集,包含2500个精心策划的实例,用于评估多模态机器翻译中需要视觉证据才能解决的歧义,并引入以歧义消解为中心的指标,实验表明链式思维微调能提升跨分布歧义消解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08146 2026-05-27 cs.CV cs.AI 81%

VT-Bench: A Unified Benchmark for Visual-Tabular Multi-Modal Learning

VT-Bench:视觉-表格多模态学习的统一基准

Zi-Yi Jia, Zi-Jian Cheng, Xin-Yue Zhang, Kun-Yang Yu, Zhi Zhou, Yu-Feng Li, Lan-Zhe Guo

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学,中国) School of Intelligence Science and Technology, Nanjing University, China(智能科学与技术学院,南京大学,中国) School of Artificial Intelligence, Nanjing University, China(人工智能学院,南京大学,中国)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出首个视觉-表格多模态基准VT-Bench,涵盖9个领域14个数据集,评估23个模型,揭示视觉-表格学习的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27261 2026-05-27 cs.HC 78%

Atari Games Challenge: A Pilot Study on Multimodal Player Experience Assessment

Atari游戏挑战:多模态玩家体验评估的初步研究

Oleg Jarma Montoya, Erica Manca, Thomas Vase Schultz Volden, Paolo Burelli

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 通过收集游戏遥测、自我报告调查、生物特征和提示性回顾出声思维数据,研究多模态数据在玩家体验评估中的同步与分析方法,并探讨游戏难度对玩家体验的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26760 2026-05-27 eess.SP 78%

Multimodal Signal Restoration with Signed Twofold Graph Learning

带符号双图学习的多模态信号恢复

Haruki Yokota, Hiroshi Higashi, Yuichi Tanaka

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 提出一种联合信号恢复与双图学习的方法,通过矩阵正态先验和交替最小化求解非凸目标,并利用可展开网络实现参数学习,在合成与真实数据上优于现有方法。

Comments 34 pages, 10 figures, 2 tables. Submitted to APSIPA Transactions on Signal and Information Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26328 2026-05-27 cs.CV 74%

RadarSim: Simulating Single-Chip Radar via Multimodal Neural Fields

RadarSim: 通过多模态神经场模拟单芯片雷达

Chuhan Chen, Tianshu Huang, Akarsh Prabhakara, Chaithanya Kumar Mummadi, Zhongxiao Cong, Anthony Rowe, Matthew O'Toole, Deva Ramanan

机构 * Carnegie Mellon University(卡内基梅隆大学) Bosch Research(博世研究) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 提出RadarSim,一种利用RGB相机高角分辨率从相机初始化的神经场生成多普勒雷达距离图像的统一可微渲染器,以解决雷达空间分辨率低的问题,并产生比纯雷达重建更清晰的几何和多普勒距离帧。

Comments Accepted to 3DV 2026. Project website: https://sally-chen.github.io/radar-sim/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17163 2026-05-27 cs.LG cs.AI cs.CL cs.CV 67%

OCR-Reasoning Benchmark: Unveiling the True Capabilities of MLLMs in Complex Text-Rich Image Reasoning

OCR-Reasoning基准:揭示MLLMs在复杂文本丰富图像推理中的真实能力

Mingxin Huang, Yongxin Shi, Dezhi Peng, Songxuan Lai, Zecheng Xie, Lianwen Jin

机构 * South China University of Technology(华南理工大学) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出OCR-Reasoning基准,包含1069个人工标注样本,覆盖6种核心推理能力和18个实际推理任务,通过双标注(最终答案和逐步推理过程)评估多模态大语言模型在文本丰富图像推理中的能力,发现最先进模型准确率均低于50%。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26460 2026-05-27 cs.CV cs.AI 62%

AnchorDiff: Training-Free Concept Grounding for MM-DiTs via Anchor-Based Graph Propagation

AnchorDiff: 基于锚点图传播的无训练概念定位用于多模态扩散Transformer

Jian Zhang, Zhijun Zhang

机构 * School of Automation Science and Engineering(自动化科学与工程学院)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出AnchorDiff方法,通过锚点选择和混合图传播解耦语义定位与结构细化,解决多模态扩散Transformer中视觉混淆概念间的概念泄漏问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26380 2026-05-27 cs.CV cs.AI 62%

VisualNeedle: Benchmarking Active Visual Search in Information-Dense Scenes

VisualNeedle: 信息密集场景中的主动视觉搜索基准

Jingru Chen, Yiming Liu, Mingtao Chen, Sijie Chen, Richeng Xuan, Liang Yang, Zhichao Hu, Fanyang Lu

机构 * Hunyuan, Tencent(腾讯 Hunyuan) Peking University(北京大学) Zhejiang University(浙江大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对多模态大语言模型在细粒度感知基准中依赖捷径而非真实视觉证据的问题,提出VisualNeedle基准,通过反事实裁剪-黑化设置评估模型在信息密集场景中的主动视觉搜索能力,实验表明最佳模型准确率仅56.01%,落后人类63.00%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13428 2026-05-27 cs.CV cs.AI 62%

"PhyWorldBench": A Comprehensive Evaluation of Physical Realism in Text-to-Video Models

PhyWorldBench:文本到视频模型中物理真实性的全面评估

Jing Gu, Xian Liu, Yu Zeng, Ashwin Nagarajan, Fangrui Zhu, Daniel Hong, Yue Fan, Qianqi Yan, Kaiwen Zhou, Ming-Yu Liu, Xin Eric Wang

机构 * University of California, Santa Cruz(加州大学圣克ruz分校) NVIDIA Research(NVIDIA研究) Northeastern University(东北大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出PhyWorldBench基准,通过1050个提示评估12个视频生成模型在物理规律遵循上的表现,并引入反物理类别,利用多模态大语言模型进行零样本评估。

Comments 35 pages, 21 figures

Journal ref ICLR 2026 oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26158 2026-05-27 cs.CR cs.AI cs.LG 57%

Furina: Fragmented Uncertainty-Driven Refusal Instability Attack

Furina: 碎片化不确定性驱动的拒绝不稳定攻击

Tongxi Wu, Jian Zhang, Yang Gao

机构 * School of Intelligence Science and Technology(智能科学与技术学院) State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) Nanjing University(南京大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 通过揭示大语言模型安全行为存在不稳定区域,提出多指标诊断框架并开发Furina攻击方法,利用碎片化场景提示诱导不确定性放大,实现高效越狱。

Comments This work is accepted as a regular paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11867 2026-05-27 cs.CV 57%

When Brains Disagree: Biological Ambiguity Underlies the Challenge of Amyloid PET Synthesis from Structural MRI

当大脑存在分歧:生物模糊性是结构MRI合成淀粉样蛋白PET挑战的基础

Louise E. G. Baron, Ross Callaghan, David M. Cash, Philip S. J. Weston, Hojjat Azadbakht, Hui Zhang

机构 * Hawkes Institute, University College London, UK(霍克斯研究所,伦敦大学学院,英国) Department of Medical Physics and Biomedical Engineering, University College London, UK(医学物理与生物医学工程系,伦敦大学学院,英国) AINOSTICS Ltd, Manchester, UK(AINOSTICS有限公司,曼彻斯特,英国) Dementia Research Centre, UCL Queen Square Institute of Neurology, University College London, UK(痴呆研究中心,伦敦大学学院女王广场神经科学研究所,英国) UK Dementia Research Institute, London, UK(英国痴呆研究研究所,伦敦,英国) Department of Computer Science, University College London, UK(计算机科学系,伦敦大学学院,英国)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 通过控制实验证明,结构MRI到淀粉样蛋白PET合成性能受限的根本原因是生物模糊性(MRI与PET测量时间解耦的病理过程),而非模型架构能力,并表明引入血浆生物标志物等多模态信息可解决该问题。

Comments MICCAI 2026 accepted paper (no rebuttal)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27604 2026-05-27 cs.CV cs.CE 57%

Decoding Scientific Experimental Images: The SPUR Benchmark for Perception, Understanding, and Reasoning

解码科学实验图像:用于感知、理解和推理的SPUR基准

Junpeng Ding, Zichen Tang, Haihong E, Mengyuan Ji, Yang Liu, Haolin Tian, Haiyang Sun, Pengqi Sun, Yang Xu, Yichen Liu, Haocheng Gao, Zijie Xi, Ruomeng Jiang, Peizhi Zhao, Rongjin Li, Yuanze Li, Jiacheng Liu, Zhongjun Yang, Jintong Chen, Siying Lin

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出SPUR基准,通过4264个问答对评估多模态大模型在科学实验图像上的细粒度感知、跨面板关系理解和专家级推理能力,揭示当前模型与专家水平的差距。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18103 2026-05-27 cs.AI 57%

Stability Implies Redundancy: Delta Attention Selective Halting for Efficient Long-Context Prefilling

稳定性意味着冗余:Delta注意力选择性停止用于高效长上下文预填充

Yujie Chen, Tailai Chen, Yifeng Gao, Zoe Wanying He, Yijue Xu, Shaobo Wang, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) University of California, San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 针对长上下文场景中预填充计算成本高的问题,提出一种无需训练的Delta注意力选择性停止策略(DASH),通过监控自注意力层更新动态来停止稳定令牌的处理,从而在不牺牲模型准确性和硬件效率的前提下实现预填充加速。

Comments Accepted to ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05899 2026-05-27 cs.AI 57%

TowerMind: A Tower Defence Game Learning Environment and Benchmark for LLM as Agents

TowerMind: 一个用于LLM作为智能体的塔防游戏学习环境与基准

Dawei Wang, Chengming Zhou, Di Zhao, Xinyuan Liu, Marci Chi Ma, Gary Ushaw, Richard Davison

机构 * Newcastle University(新castle大学) University of Auckland(奥克兰大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出TowerMind,一个基于塔防子类型的轻量级、多模态游戏环境,用于评估大语言模型在长期规划和决策中的能力,并揭示其与人类专家的性能差距及关键局限性。

Comments AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01253 2026-05-27 cs.CV 57%

ODOV: Benchmark the Open-Domain Open-Vocabulary Object Detection

ODOV:开放域开放词汇目标检测基准

Yupeng Zhang, Ruize Han, Fangnan Zhou, Wei Feng, Liang Wan

机构 * College of Intelligence and Computing, Tianjin University(天津大学智能计算学院) Key Research Center for Surface Monitoring and Analysis of Relics, State Administration of Cultural Heritage(文物表面监测与分析国家重点研究中心) Faculty of Computer Science and Artificial Intelligence, Shenzhen University of Advanced Technology(深圳先进技术大学计算机科学与人工智能学院)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 针对真实场景中域偏移和类别偏移同时发生的问题,提出开放域开放词汇目标检测任务,构建OD-LVIS基准数据集,并设计基于VLM的基线方法,通过域无关类别提示和域投影嫁接模块提升检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14359 2026-05-27 cs.CV 57%

ImViD: Immersive Volumetric Videos for Enhanced VR Engagement

ImViD:用于增强VR沉浸感的沉浸式体积视频

Zhengxian Yang, Shi Pan, Shengqi Wang, Haoxiang Wang, Li Lin, Guanjun Li, Zhengqi Wen, Borong Lin, Jianhua Tao, Tao Yu

机构 * Tsinghua University(清华大学) Migu Beijing Research Institute(中国移动北京研究院) Institute of Automation, Chinese Academy of Science(中国科学院自动化研究所)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 提出ImViD多视角多模态数据集,支持移动中捕获完整场景,为6自由度多模态沉浸式VR体验提供基准和重建管线。

Comments CVPR 2025 Highlight; Fix NSFC ID

详情

展开后加载摘要…

URL PDF HTML 收藏