arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-05 至 2026-05-05 共收录 15 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 15 篇

2605.01024 2026-05-05 cs.CV cs.AI 93%

EmoMM: Benchmarking and Steering MLLM for Multimodal Emotion Recognition under Conflict and Missingness

EmoMM:针对冲突和缺失性下的多模态情绪识别的MLLM基准测试与引导

Yueru Sun, Yimeng Zhang, Haoyu Gu, Nuo Chen, Dong She, Xianrong Yao, Yang Gao, Zhanpeng Jin

机构 * School of Future Technology, South China University of Technology(华南理工大学未来技术学院)

专题命中 多模态评测 :MLLM(title,title_cn);multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出EmoMM基准,用于研究多模态情绪识别中模态冲突和缺失性下的MLLM决策机制,发现视频贡献崩溃现象,并提出CHASE机制减轻决策偏差,提升模型在复杂情感场景中的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00877 2026-05-05 cs.MM cs.AI cs.CL cs.CV cs.LG 85%

OceanPile: A Large-Scale Multimodal Ocean Corpus for Foundation Models

OceanPile:一个大规模多模态海洋语料库用于基础模型

Yida Xue, Ningyu Zhang, Tingwei Wu, Zhe Ma, Daxiong Ji, Zhao Wang, Guozhou Zheng, Huajun Chen

机构 * College of Computer Science and Technology, Zhejiang University, Hangzhou 310027, China(浙江大学计算机科学与技术学院) ZJU-Hangzhou Global Scientific and Technological Innovation Center, Hangzhou 311200, China(浙江大学杭州全球科技创新中心) School of Software Technology, Zhejiang University, Ningbo 315048, China(浙江大学软件学院) Ocean College, Zhejiang University, Zhoushan 316021, China(浙江大学海洋学院) State Key Laboratory of Ocean Sensing, Hangzhou 311200, China(杭州海洋传感国家重点实验室) Ocean Research Center of Zhoushan, Zhejiang University, Zhoushan 316021, China(舟山海洋研究中心)

专题命中 多模态评测 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出OceanPile,一个用于海洋基础模型的多模态语料库,整合了声呐数据、水下图像、海洋科学图像和科学文本,通过高质量指令数据集和评估基准提升海洋领域模型性能。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01371 2026-05-05 cs.RO 83%

ESARBench: A Benchmark for Agentic UAV Embodied Search and Rescue

ESARBench: 一种用于代理无人机体感知搜索与救援的基准

Daoxuan Zhang, Ping Chen, Jianyi Zhou, Shuo Yang

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 多模态评测 :MLLM(summary_cn,abstract);multimodal(abstract)

AI总结 本文提出ESARBench,首个用于评估基于MLLM的无人机在高真实感搜索与救援场景中的基准,通过构建高保真环境和600个任务数据集,揭示了ESAR中的关键瓶颈。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01638 2026-05-05 cs.CV 83%

Omni-Fake: Benchmarking Unified Multimodal Social Media Deepfake Detection

Omni-Fake:面向社交媒体的统一多模态深度伪造检测基准测试

Tianxiao Li, Zhenglin Huang, Haiquan Wen, Yiwei He, Xinze Li, Bingyu Zhu, Wuhui Duan, Congang Chen, Zeyu Fu, Yi Dong, Baoyuan Wu, Jason Li, Guangliang Cheng

机构 * University of Liverpool(利物浦大学) University of Exeter(埃克塞特大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Nanyang Technological University(南洋理工大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出Omni-Fake多模态深度伪造检测基准,包含大规模数据集和分布外基准,支持联合检测-定位-解释协议,并提出基于强化学习的多模态检测器,提升检测准确性和可解释性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01250 2026-05-05 cs.AI 83%

EO-Gym: A Multimodal, Interactive Environment for Earth Observation Agents

EO-Gym: 一种多模态、交互式环境用于地球观测代理

Sai Ma, Zhuang Li, Sichao Li, Xinyue Xu, Ruibiao Zhu, Tony Boston, John A. Taylor

机构 * The Australian National University(澳大利亚国立大学) Royal Melbourne Institute of Technology(皇家墨尔本理工学院) University of Sydney(悉尼大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 EO-Gym通过构建多模态交互环境,解决地球观测分析中不确定性处理问题,提供9078条轨迹和34604步的基准数据,评估10种VLMs显示通用模型在时空和跨模态任务上表现不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01384 2026-05-05 q-fin.CP 82%

SBCA: Cross-Modal BERT-driven Actor-Critic for Multi-Asset Portfolio Optimization

SBCA:跨模态BERT驱动的Actor-Critic多资产组合优化框架

Jinfeng Pan, Jiahao Chen

专题命中 多模态评测 :cross-modal(title,abstract);multi-modal(abstract)

AI总结 本文提出SBCA框架,通过跨模态门控融合机制整合价格数据与文本语义,结合风险与交易成本约束,提升多资产组合优化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00907 2026-05-05 cs.CV cs.AI cs.LG 81%

TRIP-Evaluate: An Open Multimodal Benchmark for Evaluating Large Models in Transportation

TRIP-Evaluate: 一个用于评估交通领域大模型的开放多模态基准

Han Gong, Zhen Zhou, Yunyang Shi, Yan Tan, Jinbiao Huo, Qi Hong, Zhiyuan Liu

机构 * School of Transportation(交通学院) Southeast University(东南大学) School of Artificial Intelligence and Computer Science(人工智能与计算机科学学院) Jiangnan University(江南大学) Department of Civil and Environmental Engineering(土木与环境工程系) Hong Kong Polytechnic University(香港理工大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 TRIP-Evaluate是首个开放多模态交通评估基准,通过837项任务覆盖车辆、交通管理、旅行者和规划设计功能,提供能力、模态和难度标签,支持跨模态诊断,揭示大模型在多步工程计算、规则约束推理和多模态场景理解方面的不足。

Comments 19 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01424 2026-05-05 cs.LG cs.AI 79%

Quantifying Multimodal Capabilities: Formal Generalization Guarantees in Pairwise Metric Learning

量化多模态能力:成对度量学习中的形式泛化保证

Richeng Zhou, Xuelin Zhang, Liyuan Liu

机构 * College of Informatics, Huazhong Agricultural Univeristy, Wuhan, China

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文通过理论分析多模态度量学习模型的泛化性质,揭示模态选择与算法性能的关系,推导新的泛化误差界,证明细粒度模态特征能降低假设空间复杂度,提升多模态学习系统的收敛速度和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12539 2026-05-05 cs.AI cs.CL 62%

MemeLens: Multilingual Multitask VLMs for Memes

MemeLens:多语言多任务VLMs用于表情包

Ali Ezzat Shahroor, Mohamed Bayan Kmainasi, Abul Hasnat, Dimitar Dimitrov, Giovanni Da San Martino, Preslav Nakov, Firoj Alam

机构 * Qatar Computing Research Institute(卡塔尔计算研究所) Sofia University "St. Kliment Ohridski"(索菲亚大学"圣克莱孟·奥赫里迪斯") University of Padova(帕多瓦大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MemeLens,一种统一的多语言多任务解释增强视觉语言模型,用于表情包理解。通过整合38个公开数据集,建立20个任务的共享分类体系,并分析不同模型范式和数据集的表现,发现多模态训练和统一训练对表情包理解至关重要。

Comments disinformation, misinformation, factuality, harmfulness, fake news, propaganda, hateful meme, multimodality, text, images

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01496 2026-05-05 cs.CV 57%

SF20K Competition 2025: Summary and findings

SF20K竞赛2025:总结与发现

Ridouane Ghermi, Xi Wang, Vicky Kalogeiton, Ivan Laptev

机构 * SLoMO Workshop(SLoMO工作坊) Hugging Face

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文总结了首个SF20K竞赛的结果,探讨了视频问答任务中多模态理解的重要性,并指出信息选择和推理结构是长视频问答的主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01449 2026-05-05 cs.CR cs.AI 57%

VisInject: Disruption != Injection -- A Dual-Dimension Evaluation of Universal Adversarial Attacks on Vision-Language Models

VisInject:破坏≠注入——对视觉-语言模型中通用对抗攻击的双维度评估

Pang Liu, Yingjie Lao

机构 * Department of Electrical and Computer Engineering, Tufts University(Tufts大学电气与计算机工程系)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文通过双维度评估揭示视觉-语言模型中通用对抗攻击的脆弱性,发现攻击成功与精确注入存在显著差异,揭示了模型在微小扰动下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01338 2026-05-05 cs.AI 57%

DiagramNet: An End-to-End Recognition Framework and Dataset for Non-Standard System-Level Diagrams

DiagramNet: 一种面向非标准系统级图表的端到端识别框架和数据集

Jincheng Lou, Ruohan Xu, Jiapeng Li, Junyin Pi, Runzhe Tao, Weijian Fan, Xiao Tan, Guojie Luo, Yibo Lin

机构 * School of IC, Peking University, Beijing, China(北京大学信息科学技术学院) College of Artificial Intelligence, Xi'an Jiaotong University, Xi'an, China(西安交通大学人工智能学院) Department of Precision Instruments, Tsinghua University, Beijing, China(清华大学精密仪器系) School of Software and Microelectronics, Peking University, Beijing, China(北京大学软件与微电子学院) School of Computer Science, Peking University, Beijing, China(北京大学计算机科学系) Institute of EDA, Peking University, Beijing, China(北京大学EDA研究院) Beijing Advanced Innovation Center for IC, Beijing, China(北京集成电路先进创新中心)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出DiagramNet数据集和训练框架,通过端到端方法在系统级图表识别中超越现有模型,提升多模态大语言模型的图表理解能力。

Comments 13 pages, 7 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01238 2026-05-05 cs.HC cs.CV 57%

EduGage: Methods and Dataset for Sensor-Based Momentary Assessment of Engagement in Self-Guided Video Learning

EduGage:基于传感器的自我引导视频学习中即时参与度评估的方法与数据集

Zikang Leng, Edan Eyal, Yingtian Shi, Jiaman He, Yaqi Liu, Thomas Plötz

机构 * School of Interactive Computing, Georgia Institute of Technology(佐治亚理工学院交互计算学院) College of Computing, Georgia Institute of Technology(佐治亚理工学院计算机学院) School of Computing Technologies, RMIT University(皇家墨尔本理工大学计算技术学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出EduGage方法与数据集,通过可穿戴和摄像头设备收集生理和运动信号,评估学习者参与度,实验显示多模态建模在参与度评估中有效,且轻量级的生理与行为信号组合优于全多模态设备。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01234 2026-05-05 cs.CV 57%

TT4D: A Pipeline and Dataset for Table Tennis 4D Reconstruction From Monocular Videos

TT4D:一个用于从单目视频中进行乒乓球4D重建的流水线和数据集

Nima Rahmanian, Daniel Kienzle, Thomas Gossard, Dvij Kalaria, Rainer Lienhart, Shankar Sastry

机构 * University of California, Berkeley(加州大学伯克利分校) University of Augsburg(奥格斯堡大学) University of Tübingen(图宾根大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出TT4D数据集,通过创新的重建流水线实现大规模高精度乒乓球比赛重建,解决单目视频中遮挡和视角变化带来的重建难题,支持虚拟回放和机器人学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15311 2026-05-05 cs.CV cs.ET 57%

A Comprehensive Review of Fish Feeding Behavior Analysis in Aquaculture: Tasks, Techniques, and Applications

水产养殖中鱼类摄食行为分析的全面综述:任务、技术与应用

Shulong Zhang, Daoliang Li, Jiayin Zhao, Mingyuan Yao, Yingyi Chen, Haihua Wang

机构 * National Innovation Center for Digital Fishery(数字渔业国家创新中心) Key Laboratory of Smart Farming Technologies for Aquatic Animal and Livestock(水产动植物智能养殖技术重点实验室) State Key Laboratory of Efficient Utilization of Agricultural Water Resources(农业用水高效利用国家重点实验室) Beijing Engineering and Technology Research Center for Internet of Things in Agriculture(农业物联网工程技术研究中心) Key Laboratory of Digital Fisheries of Shandong Province(山东省数字渔业重点实验室) College of Information and Electrical Engineering, China Agricultural University(中国农业大学信息与电气工程学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文综述了水产养殖中鱼类摄食行为分析的任务定义、技术支撑及应用现状,探讨了计算机视觉、声学、传感器及多模态融合技术的发展,分析了其在智能投喂和养殖管理中的应用价值及未来研究方向。

Comments 37 pages, 8 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏