arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-06 至 2026-03-06 共收录 16 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 16 篇

2603.05075 2026-03-06 cs.CV 89%

UniM: A Unified Any-to-Any Interleaved Multimodal Benchmark

UniM:一个统一的任意到任意交错多模态基准

Yanlin Li, Minghui Guo, Kaiwen Zhang, Shize Zhang, Yiran Zhao, Haodong Li, Congyue Zhou, Weijie Zheng, Yushen Yan, Shengqiong Wu, Wei Ji, Lei Cui, Furu Wei, Hao Fei, Mong-Li Lee, Wynne Hsu

机构 * NUS(新加坡国立大学) SCUT(上海交通大学) NTU(国立科技大学) NJU(南京大学) Microsoft Research(微软研究院)

专题命中 多模态评测 :multimodal(title,abstract);any-to-any(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 UniM基准通过统一的任意到任意交错多模态数据集和评估套件,评估多模态大语言模型在复杂交错生成任务中的能力与挑战。

Comments 70 pages, 63 figures, 30 tables, CVPR

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16333 2026-03-06 cs.CV cs.AI cs.CL 85%

Where is the multimodal goal post? On the Ability of Foundation Models to Recognize Contextually Important Moments

多模态目标时刻在哪里?关于基础模型识别情境重要时刻的能力

Aditya K Surikuchi, Raquel Fernández, Sandro Pezzelle

机构 * Institute for Logic, Language and Computation University of Amsterdam(逻辑、语言与计算研究所 阿姆斯特丹大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文研究了多模态基础模型识别足球比赛中重要时刻的能力,发现现有模型在识别重要子事件时表现欠佳,需改进架构与训练方法以提升跨模态协同能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04763 2026-03-06 cs.CV cs.AI cs.LG 81%

Evaluating GPT-5 as a Multimodal Clinical Reasoner: A Landscape Commentary

评估GPT-5作为多模态临床推理者的有效性:领域评论

Alexandru Florea, Shansong Wang, Mingzhe Hu, Qiang Li, Zach Eidex, Luke del Balzo, Mojtaba Safari, Xiaofeng Yang

机构 * Department of Radiation Oncology, Winship Cancer Institute, Emory University School of Medicine(放射肿瘤科,Winship癌症研究所,埃默里大学医学院) Department of Biomedical Engineering, Georgia Institute of Technology(生物医学工程系,佐治亚理工学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文评估GPT-5在多模态临床推理中的表现,发现其在文本推理和部分视觉问答任务中优于GPT-4o,但在神经放射学和乳腺摄影等专业领域仍显不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05484 2026-03-06 cs.CV 79%

Towards Multimodal Lifelong Understanding: A Dataset and Agentic Baseline

迈向多模态终身理解:一个数据集和代理基准

Guo Chen, Lidong Lu, Yicheng Liu, Liangrui Dong, Lidong Zou, Jixin Lv, Zhenquan Li, Xinyi Mao, Baoqi Pei, Shihao Wang, Zhiqi Li, Karan Sapra, Fuxiao Liu, Yin-Dong Zheng, Yifei Huang, Limin Wang, Zhiding Yu, Andrew Tao, Guilin Liu, Tong Lu

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出MM-Lifelong数据集和ReMA代理,解决多模态终身理解中的工作记忆瓶颈和全局定位崩溃问题,通过动态内存管理提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07080 2026-03-06 cs.CV 79%

FLAIR-HUB: Large-scale Multimodal Dataset for Land Cover and Crop Mapping

FLAIR-HUB:大规模多模态数据集用于土地覆盖和作物制图

Anatol Garioud, Sébastien Giordano, Nicolas David, Nicolas Gonthier

机构 * Institut national de l’information géographique et forestière (IGN), France(法国国家地理与森林信息研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 FLAIR-HUB是一个大规模多模态数据集,用于提升土地覆盖和作物制图的准确性,通过多模态融合和深度学习模型实现高精度分类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03621 2026-03-06 cs.CV 79%

PhysLLM: Harnessing Large Language Models for Cross-Modal Remote Physiological Sensing

PhysLLM:利用大语言模型进行跨模态远程生理传感

Yiping Xie, Bo Zhao, Mingtong Dai, Jian-Ping Zhou, Yue Sun, Tao Tan, Weicheng Xie, Linlin Shen, Zitong Yu

机构 * Shenzhen University(深圳大学) Great Bay University(大鹏大学) National Engineering Laboratory for Big Data System Computing Technology(大数据系统计算技术国家工程实验室) Dongguan Key Laboratory for Intelligence and Information Technology(东莞智能与信息技术重点实验室) Guangdong Medical University(广东医科大学) Southern Medical University (Dongguan People’s Hospital)(南方医科大学(东莞人民医院)) Macao Polytechnic University(澳门理工学院)

专题命中 多模态评测 :cross-modal(title,abstract);分类 cs.CV

AI总结 PhysLLM通过结合大语言模型与领域特定的rPPG组件,利用跨模态学习提升远程生理传感的准确性和鲁棒性。

Comments Accepted by International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04670 2026-03-06 cs.AI cs.CL cs.CV 67%

Using Vision + Language Models to Predict Item Difficulty

利用视觉与语言模型预测项目难度

Samin Khan

机构 * Stanford Graduate School of Education(斯坦福大学教育研究生院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 利用视觉与语言模型结合预测数据可视化测试项目难度,通过多模态方法实现更低的误差率,展示了LLMs在心理测量中的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05058 2026-03-06 cs.CV cs.AI eess.IV 62%

A 360-degree Multi-camera System for Blue Emergency Light Detection Using Color Attention RT-DETR and the ABLDataset

一种360度多摄像头系统用于蓝色应急灯检测,采用颜色关注RT-DETR和ABLDataset

Francisco Vacalebri-Lloret, Lucas Banchero, Jose J. Lopez, Jose M. Mossi

机构 * Institute of Telecommunications and Multimedia Applications, Universitat Politècnica de València(电信与多媒体应用研究所,巴塞罗那理工大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种基于颜色关注RT-DETR和ABLDataset的360度多摄像头系统,用于检测应急车辆蓝色灯光,实现高准确率和召回率,提升ADAS和道路安全性能。

Comments 16 pages, 17 figures. Submitted to IEEE Transactions on Intelligent Vehicles

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04452 2026-03-06 cs.CL cs.AI 62%

A unified foundational framework for knowledge injection and evaluation of Large Language Models in Combustion Science

为燃烧科学中的大语言模型知识注入和评估构建统一的基础框架

Zonglin Yang, Runze Mao, Tianhao Wu, Han Li, QingGuo Zhou, Zhi X. Chen

机构 * School of Mechanics and Engineering Science, Peking University(力学与工程科学学院,北京大学) AI for Science Institute(人工智能科学研究院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出一个统一框架,用于开发燃烧科学专用的大语言模型,通过三阶段知识注入路径提升模型性能。

Comments 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16714 2026-03-06 cs.CV cs.AI 62%

SceneCOT: Eliciting Grounded Chain-of-Thought Reasoning in 3D Scenes

SceneCOT: 在3D场景中引导链式推理

Xiongkun Linghu, Jiangyong Huang, Ziyu Zhu, Baoxiong Jia, Siyuan Huang

机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SCENECOT框架,通过分解复杂任务并构建视觉线索,首次在3D场景中实现 grounded 链式推理,提升场景理解的推理能力。

Comments Accepted by ICLR 2026. Project page: https://scenecot.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03160 2026-03-06 cs.CV cs.AI 62%

SpineBench: A Clinically Salient, Level-Aware Benchmark Powered by the SpineMed-450k Corpus

SpineBench:一种临床显著、层级感知的基准,由SpineMed-450k语料库驱动

Ming Zhao, Wenhui Dong, Yang Zhang, Xiang Zheng, Zhonghao Zhang, Zian Zhou, Yunzhi Guan, Liukun Xu, Wei Peng, Zhaoyang Gong, Zhicheng Zhang, Dachuan Li, Xiaosheng Ma, Yuli Ma, Jianing Ni, Changjiang Jiang, Lixia Tian, Qixin Chen, Kaishun Xia, Pingping Liu, Tongshun Zhang, Zhiqiang Liu, Zhongyan Bi, Chenyang Si, Tiansheng Sun, Caifeng Shan

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 SpineBench通过SpineMed-450k语料库驱动,针对脊柱疾病提供临床显著的层级感知基准,评估模型在多模态数据下的细粒度推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04477 2026-03-06 cs.LG cs.AI 57%

Activity Recognition from Smart Insole Sensor Data Using a Circular Dilated CNN

基于智能鞋垫传感器数据的活动识别使用圆形扩张卷积神经网络

Yanhua Zhao

机构 * Yanhua Zhao

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出了一种基于圆形扩张卷积神经网络的活动识别方法,利用多模态时间序列数据实现高准确率的活动分类。

Comments 4 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01832 2026-03-06 cs.NE cs.AI 57%

Yukthi Opus: A Multi-Chain Hybrid Metaheuristic for Large-Scale NP-Hard Optimization

Yukthi Opus:一种多链混合元启发式算法用于大规模NP难优化

SB Danush Vikraman, Hannah Abigail, Prasanna Kesavraj, Gajanan V Honnavar

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 Yukthi Opus通过结合MCMC、贪心局部搜索和模拟退火,提出了一种多链混合元启发式算法,用于解决大规模NP难优化问题,兼顾解的质量和稳定性。

Comments 22 pages, 9 figures, includes extensive ablation studies and benchmark comparisons

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14654 2026-03-06 cs.CV 57%

ViRC: Enhancing Visual Interleaved Mathematical CoT with Reason Chunking

ViRC: 通过推理分块增强视觉交错数学思维链

Lihong Wang, Liangqi Li, Weiwei Feng, Jiamin Wu, Changtao Miao, Tieru Wu, Rui Ma, Bo Zhang, Zhe Li

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 ViRC通过引入推理分块机制,提升多模态数学任务中的推理能力,实现18.8%的性能提升。

Comments Accepted to CVPR 2026 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04772 2026-03-06 cs.RO cs.SY eess.SY 50%

TEMPO-VINE: A Multi-Temporal Sensor Fusion Dataset for Localization and Mapping in Vineyards

TEMPO-VINE:一个多时序传感器融合数据集用于葡萄园的定位与建图

Mauro Martini, Marco Ambrosio, Judith Vilella-Cantos, Alessandro Navone, Marcello Chiaberge

机构 * Department of Electronics and Communications, Politecnico di Torino(电子与通信系,politecnico di torino大学) University Institute for Engineering Research, Miguel Hernández University(工程研究大学学院,miguel hernández大学)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 TEMPO-VINE数据集通过多时序传感器融合数据,为葡萄园的定位与建图提供全面的基准测试资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00677 2026-03-06 cs.RO 50%

Walk Like Dogs: Learning Steerable Imitation Controllers for Legged Robots from Unlabeled Motion Data

像狗一样行走:从未标记的动作数据中学习可调节的模仿控制器用于四足机器人

Dongho Kang, Jin Cheng, Fatemeh Zargarbashi, Taerim Yoon, Sungjoon Choi, Stelian Coros

机构 * Computational Robotics Lab in the Department of Computer Science, ETH Zurich, Switzerland(计算机科学系计算机器人实验室,瑞士苏黎世联邦理工学院) Robot Intelligence Lab in the Department of Artificial Intelligence, Korea University, South Korea(人工智能系机器人智能实验室,韩国大学)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本文提出了一种从未标记动作数据中学习可调节模仿控制器的方法,通过自动发现行为模式并生成风格一致的运动目标,实现四足机器人自主步态生成与转换。

Comments The supplementary video is available at https://youtu.be/DukyUGNYf5A

详情

展开后加载摘要…

URL PDF HTML 收藏