arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-30 至 2026-04-30 共收录 11 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 11 篇

2604.16902 2026-04-30 cs.AI 85%

Beyond Text-Dominance: Understanding Modality Preference of Omni-modal Large Language Models

超越文本主导:理解多模态大语言模型的模态偏好

Xinru Yan, Boxi Cao, Yaojie Lu, Hongyu Lin, Weixiang Zhou, Le Sun, Xianpei Han

机构 * University of Chinese Academy of Sciences(中国科学院大学) Chinese Information Processing Laboratory(中文信息处理实验室) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 多模态评测 :omni-modal(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文研究多模态大语言模型的模态偏好现象,通过新基准和模态选择率指标量化发现,大多数模型表现出显著的视觉偏好,并通过层间探测揭示偏好在中后期层逐步出现,进而用于诊断跨模态幻觉,提升模型可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12249 2026-04-30 cs.CL cs.AI cs.CV 85%

SciMDR: Advancing Scientific Multimodal Document Reasoning

SciMDR:推动科学多模态文档推理

Ziyu Chen, Yilun Zhao, Chengye Wang, Rilyn Han, Manasi Patwardhan, Arman Cohan

机构 * Yale University(耶鲁大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出SciMDR数据集,通过合成与重嵌框架生成大规模多模态文档推理数据,提升科学问答任务的复杂度和真实性。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25235 2026-04-30 cs.LG cs.CL cs.CV stat.ML 81%

VLM Judges Can Rank but Cannot Score: Task-Dependent Uncertainty in Multimodal Evaluation

VLM评判者能排序但无法评分:多模态评估中的任务依赖性不确定性

Divake Kumar, Sina Tayebati, Devashri Naik, Ranganath Krishnan, Amit Ranjan Trivedi

机构 * University of Illinois at Chicago(伊利诺伊大学香槟分校) AI Labs at Capital One(Capital One人工智能实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文通过置信预测框架分析VLM作为评判者的可靠性,发现任务依赖性显著影响评估不确定性,提出排名-评分解耦问题,揭示任务难度和标注质量对区间宽度的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21828 2026-04-30 cs.CV cs.CL 81%

Structured and Abstractive Reasoning on Multi-modal Relational Knowledge Images

多模态关系知识图像上的结构化与抽象推理

Yichi Zhang, Zhuo Chen, Lingbing Guo, Wen Zhang, Huajun Chen

机构 * Zhejiang University(浙江大学) Zhejiang University - Ant Group Joint Laboratory of Knowledge Graph(浙江大学-蚂蚁集团知识图谱联合实验室)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出STAR-64K数据集及两阶段增强框架,通过合成多模态指令数据提升模型在抽象推理任务中的性能,实验表明小型模型在STAR任务中超越GPT-4o。

Comments Accepted by Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03583 2026-04-30 cs.MM cs.IR 79%

OpenLifelogQA: An Open-Ended Multi-Modal Lifelog Question-Answering Dataset

OpenLifelogQA:一个开放式多模态生活日志问答数据集

Quang-Linh Tran, Hoang-Bao Le, Tuong-Nghiem Diep, Binh Nguyen, Gareth J. F. Jones, Cathal Gurrin

专题命中 多模态评测 :multi-modal(title);multimodal(abstract);分类 cs.MM

AI总结 OpenLifelogQA数据集包含14187对问答对,用于支持真实场景下的鲁棒评估,相比现有资源更适用于实际应用,通过评估LLaVA-NeXT-Interleave 7B模型展示了其在生活日志问答中的性能。

Comments In the proceedings of the 14th International Symposium on Information and Communication Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26382 2026-04-30 cs.CL cs.AI cs.IR 76%

Benchmarking Complex Multimodal Document Processing Pipelines: A Unified Evaluation Framework for Enterprise AI

复杂多模态文档处理流水线评估:面向企业AI的统一评估框架

Saurabh K. Singh, Sachin Raj

机构 * Oracle(Oracle公司) Independent(独立)

专题命中 多模态评测 :multimodal(title);分类 cs.CL、cs.AI

AI总结 本文提出EnterpriseDocBench评估框架,评估企业文档AI流水线的各阶段性能,发现混合检索优于BM25,但生成质量不足,揭示了各阶段间弱相关性及实际部署中准确性与完整性之间的差距。

Comments 16 pages, 4 tables. Code, metrics, and pilot data to be released upon publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03558 2026-04-30 cs.CV cs.AI cs.MM 67%

ELIQ: A Label-Free Framework for Quality Assessment of Evolving AI-Generated Images

ELIQ:一种无需标签的进化AI生成图像质量评估框架

Xinyue Li, Zhiming Xu, Min Tang, Zhaolin Cai, Sijing Wu, Xiongkuo Min, Yitong Chen, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Xi'an Jiaotong University(西安交通大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 ELIQ通过自动构建正负样本对,利用预训练多模态模型提升质量评估,实现无需人工标注的高质量评估,优于现有无标签方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10924 2026-04-30 cs.CL cs.AI cs.CR cs.CV cs.SE 67%

A Survey on the Safety and Security Threats of Computer-Using Agents: JARVIS or Ultron?

对计算机使用代理的安全性和安全威胁的综述:贾维斯或乌tron?

Ada Chen, Yongjiang Wu, Junyuan Zhang, Jingyu Xiao, Shu Yang, Jen-tse Huang, Kun Wang, Wenxuan Wang, Shuai Wang

机构 * Carnegie Mellon University(卡内基梅隆大学) The Chinese University of Hong Kong(香港中文大学) KAUST(卡塔尔科技大学) Johns Hopkins University(约翰霍普金斯大学) Nanyang Technological University(南洋理工大学) Renmin University of China(中国人民大学) The Hong Kong University of Science and Technology(香港科学大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文综述了计算机使用代理的安全威胁,定义了安全分析适用的代理类型,分类了当前的安全威胁,提出了防御策略的分类,并总结了评估代理安全性和性能的基准、数据集和评估指标。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08049 2026-04-30 cs.CL cs.AI 62%

A Survey of Process Reward Models: From Outcome Signals to Process Supervisions for Large Language Models

对过程奖励模型的调查:从结果信号到大语言模型的过程监督

Congmin Zheng, Jiachen Zhu, Zhuoying Ou, Yuxiang Chen, Kangning Zhang, Rong Shan, Zeyu Zheng, Mengyue Yang, Jianghao Lin, Yong Yu, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) University College London(伦敦大学学院) Carnegie Mellon University(卡内基梅隆大学) University of Bristol(布里斯托大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了过程奖励模型,探讨了如何生成过程数据、构建PRMs及在测试时扩展和强化学习中的应用,涵盖数学、代码、文本、多模态推理、机器人和智能体等领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26893 2026-04-30 cs.CV 57%

Graph-based Semantic Calibration Network for Unaligned UAV RGBT Image Semantic Segmentation and A Large-scale Benchmark

基于图的语义校准网络用于不一致的无人机RGBT图像语义分割及一个大规模基准

Fangqiang Fan, Zhicheng Zhao, Xiaoliang Ma, Chenglong Li, Jin Tang

机构 * Key Laboratory of Intelligent Computing & Signal Processing (Anhui University), Ministry of Education(智能计算与信号处理重点实验室(安徽大学),教育部) Anhui Provincial Key Laboratory of Multimodal Cognitive Computation, School of Artificial Intelligence, Anhui University(安徽省多模态认知计算重点实验室,人工智能学院,安徽大学) School of Computer Science and Technology, Anhui University(计算机科学与技术学院,安徽大学) GEOVIS Earth Technology Co., Ltd.(GEOVIS地球科技有限公司)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出GSCNet网络,通过特征解耦对齐模块和语义图校准模块解决无人机RGBT图像语义分割中的跨模态空间不一致和细粒度地面物体语义混淆问题,并构建了大规模URTF基准。

Comments 13 pages,13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26614 2026-04-30 cs.CV 57%

State Beyond Appearance: Diagnosing and Improving State Consistency in Dial-Based Measurement Reading

超越外观:诊断并改进基于指针的测量读数中的状态一致性

Yuanze Hu, Gen Li, Yuqin Lan, Qingchen Yu, Zhichao Yang, Junwei Jing, Zhaoxin Fan, Xiaotie Deng

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(未来区块链与隐私计算北京先进创新中心) Beihang University(北航) Fudan University(复旦大学) Peking University(北京大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文研究了多模态大语言模型在指针式测量读数任务中的表现问题,发现现有模型在状态一致性上存在缺陷,提出TriSCA框架以提升状态一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏