arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-29 至 2026-04-29 共收录 17 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 17 篇

2604.25720 2026-04-29 cs.CV cs.CL 86%

Toward Multimodal Conversational AI for Age-Related Macular Degeneration

迈向年龄相关性黄斑变性的多模态对话式人工智能

Ran Gu, Benjamin Hou, Mélanie Hébert, Asmita Indurkar, Yifan Yang, Emily Y. Chew, Tiarnán D. L. Keenan, Zhiyong Lu

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.CL

AI总结 本文提出OcularChat,一种基于多模态大语言模型的系统,通过模拟患者与医生对话,利用视网膜彩色照相进行黄斑变性诊断,展现出优于现有模型的分类性能和临床解释能力。

Comments 38 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16198 2026-04-29 cs.CL 83%

OMHBench: Benchmarking Balanced and Grounded Omni-Modal Multi-Hop Reasoning

OMHBench: 多模态多跳推理的基准测试

Seunghee Kim, Ingyu Bang, Seokgyu Jang, Changhyeon Kim, Sanghwan Bae, Jihun Choi, Richeng Xuan, Taeuk Kim

机构 * Hanyang University(翰阳大学) NAVER Cloud(NAVER云) Knowledge Work Inc.(知识工作公司) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Sony AI(索尼人工智能)

专题命中 多模态评测 :omni-modal(title,abstract);multimodal(abstract);分类 cs.CL

AI总结 OMHBench通过平衡的多模态多跳推理评估框架,揭示了多模态大语言模型在多模态接地方面的不均衡性,发现专有模型与开源模型性能差距显著,且对推理路径变化敏感。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25122 2026-04-29 cs.CV cs.AI 81%

M$^3$-VQA: A Benchmark for Multimodal, Multi-Entity, Multi-Hop Visual Question Answering

M$^3$-VQA:多模态、多实体、多跳视觉问答的基准测试

Jiatong Ma, Longteng Guo, Yuchen Liu, Zijia Zhao, Dongze Hao, Xuanxu Lin, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 M$^3$-VQA引入了多实体问题,要求模型在多个文档间进行顺序和并行多跳推理,揭示了多模态大语言模型在知识获取和推理方面的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25618 2026-04-29 cs.MM 79%

Beyond Isolated Utterances: Cue-Guided Interaction for Context-Dependent Conversational Multimodal Understanding

超越孤立话语:基于提示的交互用于依赖上下文的对话多模态理解

Zhaoyan Pan, Hengyang Zhou, Xiangdong Li, Yuning Wang, Ye Lou, Jiatong Pan, Ji Zhou, Wei Zhang

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.MM

AI总结 本文提出CUCI-Net,通过结合局部模态证据与全局上下文证据,明确抽象上下文与话语之间的依赖关系,将其作为提示融入最终多模态交互阶段,实现上下文条件下的预测。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25072 2026-04-29 cs.CV 79%

Beyond Accuracy: Benchmarking Cross-Task Consistency in Unified Multimodal Models

超越准确率:统一多模态模型跨任务一致性的基准测试

Weixing Wang, Liudvikas Zekas, Anton Hackl, Constantin Alexander Auga, Parisa Shahabinejad, Jona Otholt, Antonio Rueda-Toicen, Gerard de Melo

机构 * Hasso Plattner Institute / University of Potsdam(霍普夫纳研究所 / 波茨坦大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出XT-C-Bench,用于评估统一多模态模型跨任务的语义一致性,发现高生成或理解性能不等于强跨任务对齐,揭示一致性由模态间学习目标耦合紧密度决定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21304 2026-04-29 cs.IR 78%

PaperMind: Benchmarking Agentic Reasoning and Critique over Scientific Papers in Multimodal LLMs

PaperMind:多模态大语言模型中科学论文代理推理与批判的基准测试

Yanjun Zhao, Tianxin Wei, Jiaru Zou, Xuying Ning, Yuanchen Bei, Lingjie Chen, Simmi Rana, Wendy H. Yang, Hanghang Tong, Jingrui He

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 PaperMind通过整合多模态信息和跨源推理,评估科学论文的综合推理能力,揭示多模态大语言模型在科学推理和批判中的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25914 2026-04-29 cs.CL 70%

DV-World: Benchmarking Data Visualization Agents in Real-World Scenarios

DV-World:在现实场景中评估数据可视化代理的基准测试

Jinxiang Meng, Shaoping Huang, Fangyu Lei, Jingyu Guo, Haoxiang Liu, Jiahao Su, Sihan Wang, Yao Wang, Enrui Wang, Ye Yang, Hongze Chai, Jinming Lv, Anbang Yu, Huangjing Zhang, Yitong Zhang, Yiming Huang, Zeyao Ma, Shizhu He, Jun Zhao, Kang Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) National University of Singapore(新加坡国立大学) Renmin University of China(中国人民大学)

专题命中 多模态评测 :MLLM(abstract,abstract_cn);分类 cs.CL

AI总结 DV-World通过260个任务评估数据可视化代理在现实专业生命周期中的能力,涵盖表格操作、视觉进化和意图对齐,采用混合评估框架揭示现有模型在复杂数据可视化挑战中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17492 2026-04-29 cs.CV 70%

MMLANDMARKS: a Cross-View Instance-Level Benchmark for Geo-Spatial Understanding

MMLANDMARKS: 一种用于地理空间理解的跨视图实例级基准

Oskar Kristoffersen, Alba Reinders Sánchez, Morten Rieger Hannemose, Anders Bjorholm Dahl, Dim P. Papadopoulos

机构 * Technical University of Denmark(丹麦技术大学) Pioneer Center for AI(先锋人工智能中心)

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

AI总结 本文提出MMLandmarks基准,包含四类数据:高分辨率航拍图、地面视图、文本信息和地理坐标,用于跨视图地物检索、定位及文本到图像等任务,揭示多模态数据对地理空间理解的重要性。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22102 2026-04-29 cs.CV cs.AI cs.CL 67%

Mitigating Coordinate Prediction Bias from Positional Encoding Failures

缓解位置编码失效导致的坐标预测偏差

Xingjian Tao, Yiwei Wang, Yujun Cai, Yihong Luo, Kai Han, Jing Tang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) University of California, Los Angeles(加州大学洛杉矶分校) The University of Queensland(昆士兰大学) Shanghai University of Finance and Economics(上海财经大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出VPSG方法,通过shuffle位置编码纠正坐标偏移,提升定位精度,无需重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20191 2026-04-29 cs.CV cs.AI cs.RO 62%

From Scene to Object: Text-Guided Dual-Gaze Prediction

从场景到物体:文本引导的双目预测

Zehong Ke, Yanbo Jiang, Jinhao Li, Zhiyuan Liu, Yiqian Tu, Qingwen Meng, Heye Huang, Jianqiang Wang

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动系统学院) Cho Chun Shik Graduate School of Mobility, Korea Advanced Institute of Science and Technology(Cho Chun Shik 移动研究生院,韩国科学技术院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出双分支 gaze 预测框架,通过构建物体级数据集和改进模型架构,实现精准物体级注意力预测,提升语义推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05425 2026-04-29 cs.CV cs.AI 62%

SIV-Bench: A Video Benchmark for Social Interaction Understanding and Reasoning

SIV-Bench:一种用于社会互动理解和推理的视频基准测试

Fanqi Kong, Weiqin Zu, Xinyu Chen, Yaodong Yang, Song-Chun Zhu, Xue Feng

机构 * Peking University(北京大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) Tsinghua University(清华大学) ShanghaiTech University(上海科技大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SIV-Bench,一个用于评估多模态大语言模型在社会场景理解、社会状态推理和社会动态预测能力的视频基准测试,揭示了现有模型在社会推理方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25757 2026-04-29 cs.CR cs.AI cs.RO cs.SY eess.SY 57%

Threat-Oriented Digital Twinning for Security Evaluation of Autonomous Platforms

面向威胁的数字孪生用于自主平台安全评估

Thomas J. Neubert, Laxima Niure Kandel, Berker Peköz

机构 * Department of Electrical Engineering and Computer Science(电气工程与计算机科学系) Embry-Riddle Aeronautical University(埃姆布里-瑞德航空大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出一种面向威胁的数字孪生方法,用于评估具备学习能力的自主平台的网络安全。该方法通过模块化孪生技术,实现了对感知、自主和监督控制功能的分离,并引入了多模式感知、信任边界和运行时安全行为,提供可重复的测试模式以评估欺骗、重放、恶意输入注入等威胁。

Comments Camera ready accepted for presentation at and publication in the proceedings of 2026 56st Annual IEEE/IFIP International Conference on Dependable Systems and Networks Workshops (DSN-W): Dependable and Secure Autonomous Systems (DSAS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25614 2026-04-29 cs.AI 57%

HotComment: A Benchmark for Evaluating Popularity of Online Comments

HotComment: 一个评估在线评论流行度的基准

Yafeng Wu, Yunyao Zhang, Liliang Ye, Guiyi Zeng, Junqing Yu, Chen Xu, Zikai Song

机构 * Huazhong University of Science and Technology(华中科技大学) Beijing Institute of Computer Technology and Applications(北京计算机技术与应用研究所)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出HotComment基准,通过内容质量、流行度预测和用户行为模拟三个维度评估在线评论的流行度,同时引入StyleCmt提升社交共振效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25612 2026-04-29 cs.AI 57%

The Nonverbal Syntax Framework: An Evidence-Based Tiered System for Inferring Learner States from Observable Behavioral Cues

非语言语法框架:一种基于证据的分层系统,用于从可观察行为提示中推断学习者状态

Sherzod Turaev, Mary John, Jaloliddin Rustamov, Zahiriddin Rustamov, Saja Aldabet, Nazar Zaki, Khaled Shuaib

机构 * Department of Computer Science & Software Engineering, College of Information Technology, United Arab Emirates University(计算机科学与软件工程系,信息科技学院,阿拉伯联合酋长国大学) Academic Support Department, Abu Dhabi Polytechnic(阿布扎赫尔理工学院学术支持部) Department of Information Systems and Security, College of Information Technology, College of Information Technology, United Arab Emirates University(信息系统与安全系,信息科技学院,信息科技学院,阿拉伯联合酋长国大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出非语言语法框架,通过系统综述908项研究和17,043个提示-状态映射,解决术语碎片化、证据异质性和状态模糊性问题,提供分层结构用于推断学习者状态。

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25388 2026-04-29 cs.CV cs.RO 57%

COMPASS: COmpact Multi-channel Prior-map And Scene Signature for Floor-Plan-Based Visual Localization

COMPASS:基于平面图的多通道先验图与场景签名用于基于平面图的视觉定位

Muhammad Shaheer, Miguel Fernandez-Cortizas, Asier Bikandi-Noya, Holger Voos, Jose Luis Sanchez-Lopez

机构 * Automation and Robotics Research Group, Interdisciplinary Centre for Security, Reliability and Trust (SnT), University of Luxembourg (UL)(自动化与机器人研究组,安全、可靠性与信任跨学科中心(SnT),卢森堡大学(UL))

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出COMPASS算法,利用平面图中的几何和语义先验信息,通过多通道径向描述符估计配备双鱼眼相机的机器人姿态,验证了跨模态结构匹配的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25352 2026-04-29 cs.LG cs.AI 57%

GraphPL: Leveraging GNN for Efficient and Robust Modalities Imputation in Patchwork Learning

GraphPL: 利用GNN实现Patchwork学习中高效且鲁棒的模态补全

Xingjian Hu, Zuoyu Yan, Jianhua Zhu, Liangcai Gao, Fei Wang, Tengfei Ma

机构 * LumionHXJ

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出GraphPL,结合图神经网络与Patchwork学习,有效整合所有观测模态并保持噪声输入下的鲁棒性,在基准数据集和真实世界电子健康记录数据集上均取得SOTA性能。

Comments Accepted at ICASSP 2026. This is a preprint of the work

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24906 2026-04-29 cs.RO cs.LG cs.SY eess.SY 50%

An analysis of sensor selection for fruit picking with suction-based grippers

基于吸盘夹具的水果采摘传感器选择分析

Eva Krueger, Marcus Rosette, Joseph R. Davidson

机构 * Collaborative Robotics and Intelligent Systems (CoRIS) Institute(协作机器人与智能系统研究所)

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出一种多模态传感系统,用于评估不同采摘阶段传感器的效用,通过实验证明随机森林和多层感知器在检测成功采摘和即将失败事件中的高准确率。

Comments IROS Conference Format, 6 pages, 6 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏