arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-11 至 2026-03-11 共收录 11 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 11 篇

2603.09478 2026-03-11 cs.MM 83%

MORE-R1: Guiding LVLM for Multimodal Object-Entity Relation Extraction via Stepwise Reasoning with Reinforcement Learning

MORE-R1: 通过强化学习引导大视觉-语言模型进行多模态对象-实体关系提取的分步推理

Xiang Yuan, Xu Chu, Xinrong Chen, Haochen Li, Zonghong Dai, Hongcheng Fan, Xiaoyue Yuan, Weiping Li, Tong Mo

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.MM

AI总结 MORE-R1通过强化学习引导大视觉-语言模型进行多模态对象-实体关系提取,提升推理能力与模型性能。

Comments Accepted by the 31st International Conference on Database Systems for Advanced Applications. This is the Accepted Manuscript (AM) version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09320 2026-03-11 cs.CV cs.AI 81%

SpaceSense-Bench: A Large-Scale Multi-Modal Benchmark for Spacecraft Perception and Pose Estimation

SpaceSense-Bench: 一个大规模多模态基准用于航天器感知与姿态估计

Aodi Wu, Jianhong Zuo, Zeyuan Zhao, Xubo Luo, Ruisuo Wang, Xue Wan

机构 * University of Chinese Academy of Sciences(中国科学院大学) Technology and Engineering Center for Space Utilization, Chinese Academy of Sciences(中国科学院空间利用技术与工程中心) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 SpaceSense-Bench通过大规模多模态数据集提升航天器感知与姿态估计的鲁棒性与准确性。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09155 2026-03-11 cs.CL cs.AI 81%

OPENXRD: A Comprehensive Benchmark Framework for LLM/MLLM XRD Question Answering

OPENXRD:一个全面的基准框架用于LLM/MLLM XRD问答

Ali Vosoughi, Ayoub Shahnazari, Yufeng Xi, Zeliang Zhang, Griffin Hess, Chenliang Xu, Niaz Abdolrahim

专题命中 多模态评测 :MLLM(title);multimodal(abstract);分类 cs.CL、cs.AI

AI总结 OPENXRD是一个用于评估LLM和MLLM在晶体学问答中性能的综合基准框架,通过专家审核材料验证内容质量对模型性能的关键影响。

Comments Accepted at Digital Discovery (Royal Society of Chemistry)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09874 2026-03-11 cs.CV 79%

MissBench: Benchmarking Multimodal Affective Analysis under Imbalanced Missing Modalities

MissBench:在不平衡缺失模态下的多模态情感分析基准测试

Tien Anh Pham, Phuong-Anh Nguyen, Duc-Trong Le, Cam-Van Thi Nguyen

机构 * VNU University of Engineering and Technology(越南工程技术大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 MissBench通过标准化不平衡缺失模态协议和定义诊断指标,为多模态情感分析提供实用工具,揭示模型在不完整模态下的公平性和优化问题

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09940 2026-03-11 cs.LG 78%

SignalMC-MED: A Multimodal Benchmark for Evaluating Biosignal Foundation Models on Single-Lead ECG and PPG

SignalMC-MED: 一种用于评估单导联ECG和PPG上生物信号基础模型的多模态基准

Fredrik K. Gustafsson, Xiao Gu, Mattia Carletti, Patitapaban Palo, David W. Eyre, David A. Clifton

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 SignalMC-MED是一个用于评估单导联ECG和PPG上生物信号基础模型的多模态基准,展示了多模态融合和长时信号在提升模型性能上的优势。

Comments Code is available at https://github.com/fregu856/SignalMC-MED

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08008 2026-03-11 cs.CV 77%

A Survey on Wi-Fi Sensing Generalizability: Taxonomy, Techniques, Datasets, and Future Research Prospects

关于Wi-Fi感知通用性的综述:分类、技术、数据集与未来研究前景

Fei Wang, Tingting Zhang, Wei Xi, Han Ding, Ge Wang, Di Zhang, Yuanhao Cui, Fan Liu, Jinsong Han, Jie Xu, Tony Xiao Han

机构 * School of Software Engineering and the State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Xi’an Jiaotong University(软件工程学院和人机混合增强智能国家重点实验室,西安交通大学) School of Computer Science and Technology, Xi’an Jiaotong University(计算机科学与技术学院,西安交通大学) Information and Communication Engineering,Beijing University of Posts and Telecommunications(信息与通信工程,北京邮电大学) School of Information Science and Engineering, Southeast University(信息科学与工程学院,东南大学)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.CV

AI总结 本文综述了Wi-Fi感知通用性研究,涵盖技术分类、数据集及未来方向,旨在提升系统在不同环境下的适应能力。

Comments Accepted for publication in IEEE Communications Surveys & Tutorials 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09774 2026-03-11 cs.AI 70%

World2Mind: Cognition Toolkit for Allocentric Spatial Reasoning in Foundation Models

World2Mind: 用于基础模型的方位认知工具包

Shouwei Ruan, Bin Wang, Zhenyu Wu, Qihui Zhu, Yuxiang Zhang, Hang Su, Yubin Wang

机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院) Huawei Noah’s Ark Lab(华为诺亚方舟实验室) Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center, Tsinghua University(清华大学人工智能院计算机科学与技术系、清华大学-博世联合机器学习中心、THBI实验室、BNRist中心、清华大学)

专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.AI

AI总结 World2Mind通过构建空间认知地图和三阶段推理链,提升基础模型的空间推理能力,使纯文本模型也能实现复杂3D空间推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08173 2026-03-11 cs.RO cs.AI cs.CL cs.CV 67%

NavSpace: How Navigation Agents Follow Spatial Intelligence Instructions

NavSpace: 导航代理如何遵循空间智能指令

Haolin Yang, Yuxing Long, Zhuoyuan Yu, Zihan Yang, Minghan Wang, Jiapeng Xu, Yihan Wang, Ziyan Yu, Wenzhe Cai, Lei Kang, Hao Dong

机构 * CFCS, School of Computer Science, Peking University(计算机学院,北京大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 NavSpace基准测试通过评估导航代理的空间感知与推理能力,提出SNav模型在指令遵循任务中表现优异,为具身智能研究提供新基准。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09392 2026-03-11 cs.CV cs.AI 62%

ICDAR 2025 Competition on End-to-End Document Image Machine Translation Towards Complex Layouts

ICDAR 2025竞赛:面向复杂布局的端到端文档图像机器翻译

Yaping Zhang, Yupu Liang, Zhiyang Zhang, Zhiyuan Chen, Lu Xiang, Yang Zhao, Yu Zhou, Chengqing Zong

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Fanyu AI Laboratory, Zhongke Fanyu Technology Company Ltd.(中科泛宇人工智能实验室,中科泛宇科技有限公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 ICDAR 2025竞赛聚焦于复杂布局文档图像的端到端机器翻译,通过OCR-free和OCR-based两个赛道推动多模态文档理解领域的发展。

Comments accepted by ICDAR 2025

Journal ref ICDAR 2025. Lecture Notes in Computer Science, vol 16027

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21609 2026-03-11 cs.CV cs.LG 57%

VLCE: A Knowledge-Enhanced Framework for Image Description in Disaster Assessment

VLCE:一种用于灾害评估图像描述的知识增强框架

Md. Mahfuzur Rahman, Kishor Datta Gupta, Marufa Kamal, Fahad Rahman, Sunzida Siddique, Ahmed Rafi Hasan, Mohd Ariful Haque, Roy George

机构 * Clark Atlanta University(克拉克亚特兰大大学) BRAC University(布拉克大学) United International University(国际联合大学) Daffodil International University(花王国际大学)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 VLCE通过整合知识图谱提升灾害影像描述的准确性和领域相关性,其在RescueNet上优于QwenVL基线。

Comments 28 pages, 30 figures, 1 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08880 2026-03-11 cs.DB 50%

OptBench: An Interactive Workbench for AI/ML-SQL Co-Optimization[Extended Demonstration Proposal]

OptBench: 一个用于AI/ML-SQL联合优化的交互式工作台[扩展演示提案]

Jaykumar Tandel, Douglas Oscarson, Jia Zou

专题命中 多模态评测 :multimodal(abstract)

AI总结 OptBench是一个交互式工作台,用于构建和评估混合SQL+AI/ML查询的查询优化器,通过统一后端和交互式界面实现透明公平的比较。

Comments 12 pages. Extended version of accepted SIGMOD 2026 demonstration paper

详情

展开后加载摘要…

URL PDF HTML 收藏