arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-28 至 2026-05-28 共收录 22 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 22 篇

2601.21666 2026-05-28 cs.AI cs.CV 86%

SONIC-O1: A Real-World Benchmark for Evaluating Multimodal Large Language Models on Audio-Video Understanding

SONIC-O1:用于评估多模态大语言模型在音视频理解上的真实世界基准

Ahmed Y. Radwan, Christos Emmanouilidis, Hina Tabassum, Deval Pandya, Shaina Raza

机构 * Vector Institute for Artificial Intelligence(向量人工智能研究所) University of Groningen(Groningen大学) York University(约克大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出SONIC-O1基准,包含60小时人工验证的音视频数据,评估多模态大语言模型在开放摘要、多项选择问答和时序定位上的能力,发现模型在时序定位上存在显著性能差距和人口统计偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28013 2026-05-28 cs.CL 85%

KSAFE-MM: A Multimodal Safety Benchmark via Localized Contextualization for Korean Cultural Risks

KSAFE-MM:通过本地化语境化实现韩国文化风险的多模态安全基准

Yongwoo Kim, Sojung An, Yunjin Park, Jungwon Yoon, Dujin Lee, HyunBeom Cho, Jaewon Lee, Wonhyuk Lee, Youngchol Kim, JeongYeop Kim, Donghyun Kim

机构 * Korea University(韩国大学) KT Corporation(KT公司)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CL

AI总结 针对多模态大语言模型在安全评估中缺乏文化特异性问题,提出KSAFE-MM基准,通过语言和视觉语境化构建通用与韩国文化特有的多模态安全测试集,揭示模型对文化攻击的脆弱性及安全性与过度拒绝之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27820 2026-05-28 cs.AI 85%

EgoBench: An Interactive Egocentric Multimodal Benchmark for Tool-Using Agents

EgoBench:面向工具使用智能体的交互式自我中心多模态基准

Yunqi Liu, Tong Niu, Zitong Wang, Zhenlong Dai, Yuqi Qing, Weiqiang Wang, Jian Liu

机构 * Ant Group(蚂蚁集团)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出EgoBench,首个交互式自我中心多模态基准,通过1045个自我中心视频任务和用户-智能体-工具交互环境,联合评估视觉感知、工具增强多跳推理和动态交互能力,揭示当前最先进模型性能上限(平均准确率19.43%)。

Comments 68 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28714 2026-05-28 cs.CL cs.AI 81%

IPO-Mine: A Toolkit and Dataset for Section-Structured Analysis of Long, Multimodal IPO Documents

IPO-Mine:用于长多模态IPO文档的章节结构化分析的工具包和数据集

Michael Galarnyk, Siddharth Lohani, Vidhyakshaya Kannan, Sagnik Nandi, Aman Patel, Liqin Ye, Arnav Hiray, Rutwik Routu, Prasun Banerjee, Siddhartha Somani, Sudheer Chava

机构 * Georgia Institute of Technology(佐治亚理工学院) Sai University(赛大学) Duke University(杜克大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出IPO-Mine工具包和数据集,通过标准化解析IPO文件为章节结构化文本和图像,构建大规模多模态数据集,并建立图表评估任务,揭示多模态模型在长文档分析中的对齐挑战。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28174 2026-05-28 cs.CV cs.AI 81%

FLORO: A Multimodal Geospatial Foundation Model for Ecological Remote Sensing Across Sensors and Scales

FLORO:面向跨传感器与尺度的生态遥感多模态地理空间基础模型

Jorge L. Rodriguez, Victor Angulo Morales, Areej Alwahas, Mariana Elias Lara, Fida Mohammad Thoker, Kasper Johansen, Bernard Ghanem, Fernando T. Maestre, Matthew F. McCabe

机构 * Biological and Environmental Science and Engineering Division, King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹科技大学生物与环境科学与工程 division) Computer, Electrical and Mathematical Science and Engineering Division, King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹科技大学计算机、电气与数学科学与工程 division)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出FLORO多模态地理空间基础模型,通过掩码自编码在异构遥感数据上预训练,利用可用性感知输入统一异构传感器配置,在PANGAEA基准上实现强迁移性能。

Comments 29 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17654 2026-05-28 cs.CL cs.AI 81%

EVADE-Bench: Multimodal Benchmark for Evaluating and Enhancing Evasive Content Detection

EVADE-Bench:用于评估和增强规避性内容检测的多模态基准

Ancheng Xu, Zhihao Yang, Jingpeng Li, Guanghu Yuan, Longze Chen, Liang Yan, Jiehui Zhou, Zhen Qin, Hengyu Chang, Yukun Chen, Hamid Alinejad-Rokny, Min Yang

机构 * SIAT, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) University of Chinese Academy of Sciences(中国科学院大学) Alibaba Group(阿里巴巴集团) University of New South Wales(新南威尔士大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 针对电商平台中LLM/VLM易受规避性内容攻击的问题,提出首个专家标注的中文多模态基准EVADE-Bench,评估26个模型并发现规则分类可提升检测一致性,多智能体分解策略能显著提高准确率。

Comments SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21771 2026-05-28 cs.CV cs.AI 81%

MMTABREAL: Real-World Benchmark for Multimodal Table Understanding

MMTABREAL:多模态表格理解的真实世界基准

Prasham Titiya, Jainil Trivedi, Chitta Baral, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对多模态表格理解,构建了包含500个真实表格和4021个问答对的人工筛选基准MMTABREAL,评估发现现有模型在视觉定位、空间对齐和多步推理上存在20-40%的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28161 2026-05-28 cs.CV 79%

MeniOmni: A Structured Multimodal Benchmark for Holistic Meniscus Injury Assessment

MeniOmni:用于整体半月板损伤评估的结构化多模态基准

Shurui Xu, Siqi Yang, Weiping Ding, Hui Wang, Mengzhen Fan, Yuyu Sun, Shuyan Li

机构 * 1School of Electronics, Electrical Engineering Computer Science, Queen's University Belfast, Belfast, UK 2Radiology Department, Affiliated Nantong Clinical College of Nantong University, Nantong First People's Hospital, School of Clinical Medicine, Nantong University, Nantong, Jiangsu, China 3School of Artificial Intelligence Computer Science, Nantong University, Nantong, China 4Faculty of Data Science, City University of Macau, Macau, China 5Department of Chemistry, University of Oxford, Oxford, UK 6Orthopedics Department, Nantong First People's Hospital, Southeast University, Nantong, Jiangsu, China

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 提出MeniOmni基准,包含多中心MRI、临床先验和专家标注文本,支持细粒度Stoller分级和诊断报告生成,并引入风险感知序数评估和语义一致性指标Meni-Score。

Comments Accepted by IEEE International Conference on Multimedia and Expo (ICME) 2026 (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12843 2026-05-28 cs.CV 79%

MMRad-22K: A Structured Multimodal Evidence Dataset for Chest X-ray Report Generation

MMRad-22K:用于胸部X光报告生成的结构化多模态证据数据集

Yichen Zhao, Zelin Peng, Fenghe Tang, Piao Yang, Yu Huang, Wei Shen

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science, Shanghai Jiao Tong University(人工智能MOE实验室、人工智能研究院、计算机科学学院、上海交通大学) School of Biomedical Engineering, Division of Life Sciences and Medicine, University of Science and Technology of China (USTC)(生物医学工程学院、生命科学与医学系、中国科学技术大学) Center for Medical Imaging, Robotics, Analytic Computing & Learning (MIRACLE), Suzhou Institute for Advanced Research, USTC(医学影像、机器人、分析计算与学习中心(MIRACLE)、苏州市先进研究院、中国科学技术大学) Department of Radiology, The First Affiliated Hospital, Zhejiang University School of Medicine(放射科、浙江大学医学院第一附属医院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 针对胸部X光报告生成中现有资源监督信号碎片化的问题,提出结构化多模态证据数据集MMRad-22K,并基于统一LVLM骨干进行适配,证明结构化多模态证据优于纯文本或边界框证据,在语言和临床指标上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02857 2026-05-28 cs.CV cs.AI cs.CY 76%

Deepfake-Eval-2024: A Multi-Modal In-the-Wild Benchmark of Deepfakes Circulated in 2024

Deepfake-Eval-2024:2024年传播的深度伪造多模态野外基准

Nuria Alina Chandra, Hannah Lee, Ryan Murtfeldt, Lin Qiu, Arnab Karmakar, Emmanuel Tanumihardja, Kevin Farhat, Ben Caffee, Changyeon Lee, Jongwook Choi, Sejin Paik, Aerin Kim, Oren Etzioni

机构 * University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能研究院) University of Maryland(马里兰大学) Chung-Ang University(Chung-Ang 大学) Georgetown University(乔治城大学) Miraflow AI

专题命中 多模态评测 :multi-modal(title);分类 cs.CV、cs.AI

AI总结 针对现有学术基准过时且不反映真实深度伪造的问题,提出包含2024年社交媒体和用户提交的多模态深度伪造基准Deepfake-Eval-2024,评估发现开源模型性能大幅下降,而商业模型和微调模型表现更优但未达到专家水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19358 2026-05-28 cs.CE 71%

RoofNet: A Global Multimodal Dataset for Roof Material Identification from Earth Observation

RoofNet: 用于地球观测屋顶材料识别的全球多模态数据集

Benjamin Tarver, Noelle Law, Sasha Getz, Yuki Miura

专题命中 多模态评测 :multimodal(title)

AI总结 针对建筑屋顶材料数据缺失问题,提出RoofNet数据集,包含101个国家49,662个建筑实例的14类屋顶材料标签,结合多模态标注流程和微调方法,将零样本分类准确率从4.9%提升至47.7%,并展示了材料感知数据对灾害风险评估的影响。

Comments v3: Restructured manuscript with updated framing, added hazard case study, clarified data release/licensing, and refined main text and appendix for clarity

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28806 2026-05-28 cs.CV cs.CL cs.IR 62%

Personal Visual Memory from Explicit and Implicit Evidence

来自显式和隐式证据的个人视觉记忆

Viet Nguyen, Thao Nguyen, Vishal M. Patel, Yuheng Li

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Adobe Research(Adobe研究)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出个人视觉记忆基准和VisualMem混合架构,通过显式与隐式视觉证据增强AI代理的长期记忆,显著提升个性化任务性能。

Comments Project Page: https://viettmab.github.io/visualmem-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28084 2026-05-28 cs.CL cs.AI 62%

SMILE-Next: Teaching Large Language Models to Detect, Classify, and Reason about Laughter

SMILE-Next: 教授大型语言模型检测、分类和推理笑声

Lee Jung-Mok, Kim Sung-Bin, Joohyun Chang, Lee Hyun, Tae-Hyun Oh

机构 * School of EE, KAIST(韩国科学技术院电子工程系) Dept. of EE, POSTECH(POSTECH电子工程系) School of Computing, KAIST(韩国科学技术院计算机科学系)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 提出SMILE-Next数据集和包含笑声特定Self-Instruct与混合笑声专家框架的方法,用于实现多模态笑声理解,显著优于基线模型。

Journal ref Annual Meetings of the Association for Computational Linguistics 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27767 2026-05-28 cs.CL cs.AI cs.LG 62%

UniMaia: Steering Chess Policies with Language for Human-like Play

UniMaia:用语言引导国际象棋策略以实现类人玩法

Sherman Siu, Lesley Istead

机构 * University of Waterloo(滑铁卢大学) Carleton University(卡尔顿大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 提出UniMaia框架,通过参数高效文本编码器和ControlNet风格调节机制,在冻结的Lc0国际象棋策略网络上实现提示条件策略调制,实现语义控制(如开局选择和玩家强度)并保持预训练策略表征,同时构建大规模元数据增强的Lichess数据集和半自动提示生成管道,在多个基准上取得最优或竞争性结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04540 2026-05-28 cs.CV cs.AI 62%

The Point, the Vision and the Text: Does Point Cloud Boost Spatial Reasoning of Large Language Models? A Bias-Controlled Study

点、视觉与文本:点云能否提升大语言模型的空间推理能力?一项偏差控制研究

Weichen Zhang, Ruiying Peng, Xin Zeng, Jianjie Fang, Ziyou Wang, Kaiyuan Li, Heng Dong, Wei Li, Chen Gao, Xin Wang, Xinlei Chen, Yong Li

机构 * Tsinghua University(清华大学) ByteDance Seed(字节跳动种子)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文通过引入包含文本、视觉和点云模态的3D空间推理基准ScanReQA,评估不同模态下大语言模型的空间推理能力,发现点云和视觉模态的模型表现优于纯文本模型,并揭示了3D大语言模型中的注意力下沉现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28277 2026-05-28 cs.AI 57%

Do LLMs Build World Models From Text? A Multilingual Diagnostic of Spatial Reasoning

LLMs 是否从文本构建世界模型?多语言空间推理诊断

Zhikai Pan, Chih-Ting Liao, Chunrui Liu, Xi Xiao, Yitong Qiao, Chunlei Meng, Zhangquan Chen, Xin Cao

机构 * University of New South Wales(新南威尔士大学) Essential Energy University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Zhejiang University(浙江大学) Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 通过多语言诊断基准 MentalMap 评估大语言模型的空间推理能力,发现所有模型在视角推理上存在普遍的性能瓶颈(L3 推理悬崖),表明该限制源于纯文本工作记忆约束而非特定架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28136 2026-05-28 cs.CV cs.RO 57%

SAM-Enhanced Segmentation on Road Datasets: Balancing Critical Classes in Autonomous Driving

SAM增强的道路数据集分割:自动驾驶中关键类别的平衡

Toomas Tahves, Mauro Bellone, Junyi Gu, Raivo Sell

机构 * Department of Mechanical and Industrial Engineering, Tallinn University of Technology(塔林技术大学机械与工业工程系) FinEst Centre for Smart Cities, Tallinn University of Technology(塔林技术大学智能城市研究中心) Department of Computer Science and Engineering, Universitas Mercatorum(默卡托姆大学计算机科学与工程系) Department of Computer Science and Engineering, Chalmers University of Technology(挑战者技术大学计算机科学与工程系) University of Gothenburg(哥德堡大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 提出基于SAM的标注流水线,将ZOD数据集的边界框转换为密集像素级语义掩码,并评估不同架构在类别不平衡下的性能,通过双向迁移学习实现跨传感器配置的有效迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19342 2026-05-28 cs.CV 57%

Semantic-Enriched Latent Visual Reasoning

语义增强的潜在视觉推理

Tianrun Xu, Yue Sun, Qixun Wang, Jingyi Lu, Yuan Wang, Tianren Zhang, Longteng Guo, Fengyun Rao, Jing Lyu, Feng Chen, Jing Liu

机构 * Department of Automation, Tsinghua University, Beijing, China(清华大学自动化系) Department of Electronic Engineering, Tsinghua University, Beijing, China(清华大学电子工程系) Zhongguancun Academy, Beijing, China(中关村学院) China Agricultural University, Beijing, China(中国农业大学) Peking University, Beijing, China(北京大学) Beijing Institute of Technology, Beijing, China(北京理工大学) Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学人工智能学院) WeChat Vision, Tencent Inc, Beijing, China(微信视觉,腾讯公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出两阶段学习框架SLVR,通过属性级语义监督和多查询组相对策略优化增强潜在表示的语义丰富性,提升潜在视觉推理的鲁棒性和语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16358 2026-05-28 cs.LG cs.CL 57%

SaFeR-Steer: Evolving Multi-Turn MLLMs via Synthetic Bootstrapping and Feedback Dynamics

SaFeR-Steer:通过合成引导和反馈动力学进化多轮多模态大语言模型

Haolong Hu, Hanyu Li, Tiancheng He, Huahui Yi, An Zhang, Qiankun Li, Kun Wang, Yang Liu, Zhigang Zeng

机构 * Huazhong University of Science and Technology(华中科技大学) Beijing University of Posts and Telecommunications(北京邮电大学) West China Biomedical Big Data Center, Sichuan University(四川大学西部生物医学大数据中心) School of Public Policy and Administration, Chongqing University(重庆大学公共政策与管理学院) Nanyang Technological University(南洋理工大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 提出SaFeR-Steer框架,通过分阶段合成引导和导师参与的GRPO训练单学生模型,并引入轨迹一致总结奖励(TCSR)以解决多轮安全对齐中的长上下文安全衰减问题,显著提升多轮安全性和有用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27886 2026-05-28 cs.RO 50%

Tabero: Learning Gentle Manipulation with Closed-Loop Force Feedback from Vision, Touch, and Language

Tabero: 通过视觉、触觉和语言闭环力反馈学习轻柔操作

Qiwei Wu, Rui Zhang, Xin Xiang, Tao Li, Weihua Zhang, Junjie Lai, Renjing Xu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Nvidia, Beijing, China(英伟达(北京,中国))

专题命中 多模态评测 :multimodal(abstract)

AI总结 针对现有视觉-语言-动作模型缺乏触觉反馈导致无法实现轻柔操作的问题,提出Tabero基准和模型套件,通过数据高效管道生成视觉-触觉-语言任务,并采用解耦力-位置命令接口的Tabero-VTLA架构,在保持高任务成功率的同时将轻柔指令下的平均夹持力降低70%以上。

Comments Code:https://github.com/NathanWu7/Tabero

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19174 2026-05-28 cs.SE 50%

Restructure This: Using AI to Restructure Onboarding Documents to Reduce Cognitive Overload

重组文档:使用AI重组入职文档以减少认知负荷

Zixuan Feng, Prashant Tandan, Igor Steinmacher, Marco Aurelio Gerosa, Anita Sarma

专题命中 多模态评测 :multimodal(abstract)

AI总结 本研究基于多媒体学习认知理论(CTML),利用生成式AI流水线通过原型VisDoc重组开源软件入职文档,实验证明该方法能降低认知负荷、提高可用性和任务成功率。

Comments 41 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13743 2026-05-28 cs.LG 50%

GHGbench: A Unified Multi-Entity, Multi-Task Benchmark for Carbon Emission Prediction

GHGbench:一个统一的多实体、多任务碳排放预测基准

Yifan Duan, Siyuan Zheng, Lihuan Li, Chao Xue, Flora Salim

机构 * School of Computer Science and Engineering(计算机科学与工程学院)

专题命中 多模态评测 :multimodal(abstract)

AI总结 提出GHGbench,一个包含公司和建筑层面温室气体排放预测的统一开放数据集与基准,通过多模态数据融合和标准化评估揭示结构化难度与分布外泛化差距。

详情

展开后加载摘要…

URL PDF HTML 收藏