arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-06 至 2026-04-06 共收录 16 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 16 篇

2604.03179 2026-04-06 cs.LG cs.AI cs.CV 84%

Understanding the Role of Hallucination in Reinforcement Post-Training of Multimodal Reasoning Models

理解强化学习在多模态推理模型后训练中幻觉的作用

Gengwei Zhang, Jie Peng, Zhen Tan, Mufan Qiu, Hossein Nourkhiz Mahjoub, Vaishnav Tadiparthi, Kwonjoon Lee, Yanyong Zhang, Tianlong Chen

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Science and Technology of China(中国科学技术大学) Arizona State University(亚利桑那州立大学) Honda Research Institute, USA(本田美国研究所)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Hallucination-as-Cue框架,通过引入模态特异性扰动分析强化学习对多模态推理模型的影响,揭示幻觉在训练中的关键作用,挑战现有假设。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03198 2026-04-06 cs.CV cs.AI 84%

FLEX: A Largescale Multimodal, Multiview Dataset for Learning Structured Representations for Fitness Action Quality Assessment

FLEX:一个大规模多模态、多视角数据集,用于学习结构化表示以评估健身动作质量

Hao Yin, Lijun Gu, Paritosh Parmar, Lin Xu, Tianxiao Guo, Xiujin Liu, Weiwei Fu, Yang Zhang, Tianyou Zheng

机构 * School of Biomedical Engineering (Suzhou), USTC(中国科学技术大学苏州生物医学工程学院) Suzhou Institute of Biomedical Engineering and Technology, CAS(中国科学院苏州生物医学工程技术研究所) Institute of High-Performance Computing, A*STAR, Singapore(新加坡科技研究局高性能计算研究所) School of Psychology, Beijing Sports University(北京体育大学心理学院) School of Competitive Sports, Beijing Sports University(北京体育大学竞技体育学院) Department of Robotics, University of Michigan(密歇根大学机器人系)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 FLEX数据集通过多模态融合和结构化知识图谱提升健身动作质量评估的准确性与解释性,支持跨模态预测和生物力学导向的表示学习。

Comments Dataset and code are available at https://github.com/HaoYin116/FLEX . Link to Project page https://haoyin116.github.io/FLEX_Dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02710 2026-04-06 cs.RO cs.AI cs.CV 81%

V2X-QA: A Comprehensive Reasoning Dataset and Benchmark for Multimodal Large Language Models in Autonomous Driving Across Ego, Infrastructure, and Cooperative Views

V2X-QA:面向自动驾驶多视角的多模态大语言模型综合数据集与基准测试

Junwei You, Pei Li, Zhuoyu Jiang, Weizhe Tang, Zilin Huang, Rui Gan, Jiaxi Liu, Yan Zhao, Sikai Chen, Bin Ran

机构 * Department of Civil and Environmental Engineering, University of Wisconsin–Madison(威斯康星大学麦迪逊分校土木与环境工程系) Department of Civil and Architectural Engineering and Construction Management, University of Wyoming(怀俄明大学土木与建筑工程及施工管理系) School of Transportation, Southeast University(东南大学交通学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出V2X-QA数据集和基准测试,用于评估多模态大语言模型在自动驾驶中的多视角推理能力,揭示视角对性能的影响,并提出V2X-MoE模型以提升多视角推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00799 2026-04-06 cs.CV cs.CL cs.LG 81%

Multimodal Language Models Cannot Spot Spatial Inconsistencies

多模态语言模型无法发现空间不一致性

Om Khangaonkar, Hadi J. Rad, Hamed Pirsiavash

机构 * University of California, Davis(加州大学戴维斯分校) Shell(壳牌) TU Delft(代尔夫特理工大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 研究探讨多模态大语言模型在识别3D几何空间不一致性方面的不足,提出生成空间不一致图像对的方法,发现先进模型在该任务上表现欠佳,揭示其对物理世界理解的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03050 2026-04-06 cs.HC cs.AI 79%

MECO: A Multimodal Dataset for Emotion and Cognitive Understanding in Older Adults

MECO:一种用于老年人情绪和认知理解的多模态数据集

Hongbin Chen, Jie Li, Wei Wang, Siyang Song, Xiao Gu, Jianqing Li, Wentao Xiang

机构 * Nanjing Medical University(南京医科大学) University of Exeter(埃克塞特大学) University of Oxford(牛津大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 MECO数据集通过收集42名老年人的多模态信号,提供30592个同步样本,旨在填补老龄化群体情绪和认知预测研究的空白,支持个性化情绪识别和早期轻度认知障碍检测。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03016 2026-04-06 cs.AI 79%

Agentic-MME: What Agentic Capability Really Brings to Multimodal Intelligence?

Agentic-MME:代理能力为多模态智能带来了什么?

Qianshan Wei, Yishan Yang, Siyi Wang, Jinglin Chen, Binyu Wang, Jiaming Wang, Shuang Chen, Zechen Li, Yang Shi, Yuqi Tang, Weining Wang, Yi Yu, Chaoyou Fu, Qi Li, Yi-Fan Zhang

机构 * CASIA(中国科学院自动化研究所) UCAS(中国科学院大学) SEU(东南大学) NJU(南京大学) PKU(北京大学) BUAA(北京航空航天大学) NTU(南洋理工大学) UCLA(加州大学洛杉矶分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 Agentic-MME通过418个真实任务评估多模态代理能力,采用过程验证方法,量化效率并验证工具调用准确性,实验显示模型在复杂任务中表现显著下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02798 2026-04-06 cs.MM 79%

Differential Mental Disorder Detection with Psychology-Inspired Multimodal Stimuli

基于心理学启发的多模态刺激的差异性精神障碍检测

Zhiyuan Zhou, Jingjing Wu, Zhibo Lei, Junyu Guo, Zhongcheng Yu, Yuqi Chu, Xiaowei Zhang, Qiqi Zhao, Qi Wang, Shijie Hao, Yanrong Guo, Richang Hong

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.MM

AI总结 本文提出基于心理学启发的多模态刺激方法,通过收集大规模多模态心理健康数据集,设计出能捕捉不同精神障碍特征的框架,实验表明该方法在差异性精神障碍检测中优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17069 2026-04-06 cs.CV 79%

Edge-Efficient Two-Stream Multimodal Architecture for Non-Intrusive Bathroom Fall Detection

边缘高效双流多模态架构用于非侵入式浴室跌倒检测

Haitian Wang, Yiren Wang, Xinyu Wang, Sheldon Fung, Atif Mansoor

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出双流架构以编码雷达信号和地面振动,通过低秩双线性交互和Switch-MoE头对齐动与冲击token,提升浴室跌倒检测的准确性和效率。

Comments This paper has been accepted for poster presenation at IEEE ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02804 2026-04-06 cs.CV cs.AI cs.MM 67%

PaveBench: A Versatile Benchmark for Pavement Distress Perception and Interactive Vision-Language Analysis

PaveBench: 一种多功能的路面病害感知及交互视觉-语言分析基准

Dexiang Li, Zhenning Che, Haijun Zhang, Dongliang Zhou, Zhao Zhang, Yahong Han

机构 * Harbin Institute of Technology(哈尔滨工业大学) Tianjin University(天津大学) Hefei University of Technology(合肥工业大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 PaveBench针对路面状况评估中的视觉识别与多模态交互需求,提供分类、检测、分割及视觉-语言问答等四项任务,支持多轮交互与事实推理,填补现有数据集在多模态分析与实际应用连接上的空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03121 2026-04-06 cs.CR cs.AI cs.CL 62%

An Independent Safety Evaluation of Kimi K2.5

Kimi K2.5 的独立安全性评估

Zheng-Xin Yong, Parv Mahajan, Andy Wang, Ida Caspary, Yernat Yestekov, Zora Che, Mosh Levy, Elle Najt, Dennis Murphy, Prashant Kulkarni, Lev McKinney, Kei Nishimura-Gasparian, Ram Potham, Aengus Lynch, Michael L. Chen

机构 * Constellation Anthropic Fellows Program(Anthropic研究员项目) Brown University(布朗大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Imperial College London(伦敦帝国学院) University of Maryland, College Park(马里兰大学帕克分校) Georgia Institute of Technology(佐治亚理工学院) Bar Ilan University(巴伊兰大学) University of Toronto(多伦多大学) University of Oxford(牛津大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 Kimi K2.5作为开源大模型,在安全评估中显示出潜在风险,包括CBRNE滥用、网络安全漏洞及政治偏见,但其在拒绝恶意请求方面表现较弱,凸显开源模型的安全挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03094 2026-04-06 cs.CV cs.AI 62%

A Data-Centric Vision Transformer Baseline for SAR Sea Ice Classification

一种面向数据的视觉Transformer基线用于SAR海冰分类

David Mike-Ewewie, Panhapiseth Lim, Priyanka Kumar

机构 * The University of Texas Permian Basin(德克萨斯大学二叠纪盆地分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种基于SAR的视觉Transformer基线,用于解决极地海冰分类中的类别不平衡问题,通过对比不同损失函数的性能,验证了聚焦损失在稀有冰类中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03172 2026-04-06 cs.CV 57%

EffiMiniVLM: A Compact Dual-Encoder Regression Framework

EffiMiniVLM:一种紧凑的双编码回归框架

Yin-Loon Khor, Yi-Jie Wong, Yan Chai Hum

机构 * Universiti Malaya(马来亚大学) Universiti Tunku Abdul Rahman(拉曼大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出EffiMiniVLM,一种紧凑的双编码回归框架,通过高效网络和轻量级回归头,在冷启动场景中实现高质量产品预测,具有低资源消耗和高效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02934 2026-04-06 cs.CV 57%

PolyReal: A Benchmark for Real-World Polymer Science Workflows

PolyReal:一个用于现实世界聚合物科学工作流程的基准

Wanhao Liu, Weida Wang, Jiaqing Xie, Suorong Yang, Jue Wang, Benteng Chen, Guangtao Mei, Zonglin Yang, Shufei Zhang, Yuchun Mo, Lang Cheng, Jin Zeng, Houqiang Li, Wanli Ouyang, Yuqiang Li

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Northwestern Polytechnical University(西北工业大学) Tongji University(同济大学) The University of Hong Kong(香港大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 PolyReal是一个新的多模态基准,用于评估大规模语言模型在聚合物实验全流程中的能力,揭示了模型在实践任务上的不足,填补了评估空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02545 2026-04-06 cs.AI 57%

Competency Questions as Executable Plans: a Controlled RAG Architecture for Cultural Heritage Storytelling

能力问题作为可执行计划:一种受控的RAG架构用于文化遗产叙事

Naga Sowjanya Barla, Jacopo de Berardinis

机构 * School of Computer Science and Informatics, University of Liverpool(利物浦大学计算机科学与信息学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出一种基于知识图谱的神经符号架构,通过将能力问题转化为可执行叙事计划,提升文化遗产叙事的准确性和可审计性,通过Live Aid KG进行验证,比较了三种RAG策略的优劣。

Comments Accepted at the 23rd European Semantic Web Conference (ESWC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17722 2026-04-06 cs.CV 57%

Can Vision-Language Models Count? A Synthetic Benchmark and Analysis of Attention-Based Interventions

视觉-语言模型能计数吗?一个合成基准和基于注意力的干预分析

Saurav Sengupta, Nazanin Moradinasab, Jiebei Liu, Donald E. Brown

机构 * School of Data Science, University of Virginia(弗吉尼亚大学数据科学学院)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 本文通过合成基准和注意力干预分析,探讨了视觉-语言模型在计数任务中的表现,揭示了视觉和语言复杂性对计数准确率的影响,并展示了针对性的注意力重加权对计数行为的改进。

Comments Accepted at COGVL Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03088 2026-04-06 cs.IR 50%

ADSeeker: A Knowledge-Grounded Reasoning Framework for Industry Anomaly Detection and Reasoning

ADSeeker: 一种基于知识的推理框架用于工业异常检测与推理

Kai Zhang, Zekai Zhang, Xihe Sun, Anpeng Wang, Jingmeng Nie, Qinghui Chen, Han Hao, Jianyuan Guo, Jinglin Zhang

专题命中 多模态评测 :multimodal(abstract)

AI总结 ADSeeker通过整合视觉文档知识库和查询图像-知识检索增强生成框架,提升工业异常检测性能,提出层次稀疏提示机制和类型级特征以提取异常模式,构建大规模AD数据集MulA,实现零样本状态下的最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏