arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-30 至 2026-03-30 共收录 21 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 21 篇

2603.16629 2026-03-30 cs.CV cs.AI 84%

MLLM-based Textual Explanations for Face Comparison

基于MLLM的文本解释用于面部比较

Redwan Sony, Anil K Jain, Arun Ross

机构 * Michigan State University(密歇根州立大学)

专题命中 多模态评测 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了MLLM在无约束面部验证任务中生成解释的可靠性,发现其解释常依赖不可验证的面部属性,并提出基于似然比的框架评估解释可信度。

Comments Accepted at 14th International Workshop on Biometrics and Forensics (IWBF)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16816 2026-03-30 cs.CV cs.DL 83%

WildDepth: A Multimodal Dataset for 3D Wildlife Perception and Depth Estimation

WildDepth:用于野生动物感知和深度估计的多模态数据集

Muhammad Aamir, Naoya Muramatsu, Sangyun Shin, Matthew Wijers, Jia-Xing Zhong, Xinyu Hou, Amir Patel, Andrew Loveridge, Andrew Markham

机构 * University of Oxford(牛津大学) University of Cape Town(开普敦大学) University College London(伦敦大学学院)

专题命中 多模态评测 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV

AI总结 本文提出WildDepth数据集,通过同步RGB和LiDAR数据提升动物深度估计和3D重建性能,实验表明多模态数据使深度可靠性提升10%RMSE,3D重建精度提高12%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25946 2026-03-30 cs.CV cs.AI cs.LG 81%

Collision-Aware Vision-Language Learning for End-to-End Driving with Multimodal Infraction Datasets

面向端到端驾驶的碰撞感知视觉-语言学习:多模态违规数据集

Alex Koran, Dimitrios Sinodinos, Hadi Hojjati, Takuya Nanri, Fangge Chen, Narges Armanfard

机构 * McGill University(麦吉尔大学) Mila - Québec AI Institute(米拉-魁北克人工智能研究所) Nissan Motor Corporation(日产汽车公司)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出VLAAD模型,通过多实例学习获取碰撞信号,提升驾驶评分,并在真实数据集上验证其泛化能力。

Comments 33 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26498 2026-03-30 cs.DC cs.AI 79%

Rocks, Pebbles and Sand: Modality-aware Scheduling for Multimodal Large Language Model Inference

岩石、鹅卵石和沙子:面向多模态大语言模型推理的模态感知调度

Konstantinos Papaioannou, Thaleia Dimitra Doudali

机构 * IMDEA Software Institute(IMDEA软件研究所) Universidad Politécnica de Madrid(马德里理工大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 针对多模态大语言模型推理中资源需求差异大导致的延迟和内存问题,提出RPS-Serve调度器,通过动态优先级和老化机制实现高效资源利用,降低TTFT并提升响应性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26316 2026-03-30 cs.CV cs.LG 79%

SALMUBench: A Benchmark for Sensitive Association-Level Multimodal Unlearning

SALMUBench:一种用于敏感关联级多模态反训练的基准

Cai Selvas-Sala, Lei Kang, Lluis Gomez

机构 * Computer Vision Center(计算机视觉中心) Universitat Politècnica de Catalunya(加泰罗尼亚理工大学) Universitat Autònoma de Barcelona(巴塞罗那自治大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出SALMUBench基准,用于评估多模态反训练中敏感信息删除的效果,通过合成数据和基础模型测试发现现有方法存在遗忘不足或过度泛化问题。

Comments Accepted to CVPR 2026. Project page: http://cvc-mmu.github.io/salmubench

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13239 2026-03-30 cs.CY cs.CV cs.IR 79%

CrisiSense-RAG: Crisis Sensing Multimodal Retrieval-Augmented Generation for Rapid Disaster Impact Assessment

CrisiSense-RAG:面向快速灾害影响评估的多模态检索增强生成系统

Yiming Xiao, Kai Yin, Ali Mostafavi

机构 * Zachry Department of Civil Environmental Engineering, Texas A\&M University Department of Computer Science Engineering, Texas A\&M University

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出CrisiSense-RAG系统,通过多模态检索增强生成技术,解决灾害影响评估中时空不对齐问题,实现零样本设置下的高精度灾害评估。

Comments 27 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25799 2026-03-30 eess.SP 78%

Occlusion-Aware Multimodal Beam Prediction and Pose Estimation for mmWave V2I

面向毫米波V2I的遮挡感知多模态波束预测与姿态估计

Abidemi Orimogunje, Hyunwoo Park, Kyeong-Ju Cha, Igbafe Orikumhi, Sunwoo Kim, Dejan Vukobratovic

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出一种受SLAM启发的多模态学习框架,用于动态遮挡下的毫米波V2I波束管理,通过融合RGB图像、LiDAR点云、雷达范围-角度图、GNSS和短时毫米波功率历史,实现波束索引、遮挡概率和2D位置的联合预测,验证了感知与通信结合在6G V2I系统中的价值。

Comments IEEE VTC

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20964 2026-03-30 cs.CV cs.AI 73%

Evidence-based diagnostic reasoning with multi-agent copilot for human pathology

基于多智能体助手的证据驱动诊断推理

Luca L. Weishaupt, Chengkuan Chen, Drew F. K. Williamson, Richard J. Chen, Guillaume Jaume, Tong Ding, Bowen Chen, Anurag Vaidya, Long Phi Le, Guillaume Jaume, Ming Y. Lu, Faisal Mahmood

机构 * Health Sciences and Technology, Harvard-MIT(哈佛-MIT健康科学与技术) Department of Pathology, Massachusetts General Hospital, Harvard Medical School(麻省总医院病理科,哈佛医学院) Cancer Program, Broad Institute of Harvard and MIT(哈佛-MIT博德研究所癌症项目) Harvard John A. Paulson School of Engineering and Applied Sciences, Harvard University(哈佛大学约翰·A·保尔森工程与应用科学学院) Electrical Engineering and Computer Science, Massachusetts Institute of Technology (MIT)(麻省理工学院电气工程与计算机科学) Harvard Data Science Initiative, Harvard University(哈佛大学数据科学计划)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出PathChat+,一种专为人类病理设计的多模态大语言模型,通过大量病理特定指令样本训练,显著优于现有模型,在多图像理解与自主诊断推理方面表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25791 2026-03-30 cs.CV 70%

ArtHOI: Taming Foundation Models for Monocular 4D Reconstruction of Hand-Articulated-Object Interactions

ArtHOI:通过基础模型驯化实现单目4D手-物体交互重建

Zikai Wang, Zhilu Zhang, Yiqing Wang, Hui Li, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出ArtHOI框架,通过整合多基础模型先验知识,解决单目视频中手-物体交互的4D重建问题,引入自适应采样细化和多模态大语言模型引导对齐方法,构建两个新数据集并验证方法有效性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00262 2026-03-30 cs.CV cs.AI 62%

INSIGHT: Enhancing Autonomous Driving Safety through Vision-Language Models on Context-Aware Hazard Detection and Edge Case Evaluation

洞察:通过基于视觉-语言模型的上下文感知危险检测与边缘案例评估提升自动驾驶安全性

Dianwei Chen, Zifan Zhang, Lei Cheng, Yuchen Liu, Xianfeng Terry Yang

机构 * University of Maryland(马里兰大学) North Carolina State University(北卡罗来纳州立大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出INSIGHT框架,通过多模态数据融合提升自动驾驶中危险检测和边缘案例评估的准确性和泛化能力,实验表明在BDD100K数据集上显著提高了危险预测的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25864 2026-03-30 cs.CV cs.AI cs.HC 62%

GUIDE: A Benchmark for Understanding and Assisting Users in Open-Ended GUI Tasks

GUIDE:一个用于理解和协助用户进行开放性GUI任务的基准测试

Saelyne Yang, Jaesang Yu, Yi-Hao Peng, Kevin Qinghong Lin, Jae Won Cho, Yale Song, Juho Kim

机构 * KAIST(韩国科学技术院) Carnegie Mellon University(卡内基梅隆大学) University of Oxford(牛津大学) Konkuk University(建国大学) Google Inc.(谷歌公司) SkillBench

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 GUIDE基准测试旨在评估AI模型在开放性GUI任务中感知用户行为、推断意图和提供帮助的能力,通过120名新手用户的10种软件屏幕记录,发现模型在行为状态和帮助预测上准确率仅为44.6%和55.0%,但提供用户上下文可提升帮助预测性能达50.2个百分点。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25823 2026-03-30 cs.CV cs.AI 62%

ViGoR-Bench: How Far Are Visual Generative Models From Zero-Shot Visual Reasoners?

ViGoR-Bench:视觉生成模型距离零样本视觉推理还有多远?

Haonan Han, Jiancheng Huang, Xiaopeng Sun, Junyan He, Rui Yang, Jie Hu, Xiaojiang Peng, Lin Ma, Xiaoming Wei, Xiu Li

机构 * Tsinghua University(清华大学) The University of Hong Kong(香港大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出ViGoR-Bench基准,通过跨模态覆盖、双轨评估、证据驱动裁判和细粒度分析,揭示生成模型在因果推理和空间认知上的缺陷,验证了先进模型在零样本推理上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26646 2026-03-30 cs.CV 57%

Beyond Language: Grounding Referring Expressions with Hand Pointing in Egocentric Vision

超越语言:基于手部指向的自我中心视觉指称表达定位

Ling Li, Bowen Liu, Zinuo Zhan, Peng Jie, Jianhui Zhong, Kenglun Chang, Zhidong Deng

机构 * Tsinghua University(清华大学) Dalian University of Technology(大连理工大学) Northwestern Polytechnical University(西北工业大学) Apple(苹果公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出EgoPoint-Ground数据集,通过手部指向与语音结合的指称机制,改进视觉指称表达的定位方法,并提出SV-CoT框架提升多模态理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26174 2026-03-30 cs.CV 57%

CREval: An Automated Interpretable Evaluation for Creative Image Manipulation under Complex Instructions

CREval: 一种自动化可解释的评估方法用于复杂指令下的创意图像操纵

Chonghuinan Wang, Zihan Chen, Yuxiang Wei, Tianyi Jiang, Xiaohe Wu, Fan Li, Wangmeng Zuo, Hongxun Yao

机构 * Harbin Institute of Technology(哈尔滨工业大学) Huawei Noah’s Ark Lab(华为诺亚方舟实验室) Pengcheng Lab, Guangzhou(广州鹏城实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出CREval,一种基于问答的自动化评估框架,用于评估复杂指令下的创意图像编辑任务,通过CREval-Bench基准测试揭示模型在复杂创意任务中的表现及挑战。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26109 2026-03-30 cs.CV 57%

SDDF: Specificity-Driven Dynamic Focusing for Open-Vocabulary Camouflaged Object Detection

SDDF: 专门性驱动的动态聚焦用于开放词汇伪装物体检测

Jiaming Liang, Yifeng Zhan, Chunlin Liu, Weihua Zheng, Bingye Peng, Qiwei Liang, Boyang Cai, Xiaochun Mai, Qiang Nie

机构 * Shenzhen University(深圳大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出SDDF方法,通过专门性感知子描述和动态聚焦提升开放词汇伪装物体检测性能,在OVCOD-D基准上达到56.4的AP。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02531 2026-03-30 cs.LG cs.AI 57%

Causal Graph Neural Networks for Healthcare

因果图神经网络用于医疗保健

Munib Mesinovic, Max Buhlan, Tingting Zhu

机构 * University of Oxford(牛津大学) Leipzig University(莱比锡大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 本文探讨了因果图神经网络在医疗保健中的应用,通过结合生物医学数据的图表示与因果推断,学习不变机制而非虚假相关性,旨在提升跨机构部署的性能并减少歧视性模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11647 2026-03-30 cs.CV 57%

IVEBench: Modern Benchmark Suite for Instruction-Guided Video Editing Assessment

IVEBench:现代指令引导视频编辑评估基准套件

Yinan Chen, Jiangning Zhang, Teng Hu, Yuxiang Zeng, Zhucun Xue, Qingdong He, Chengjie Wang, Yong Liu, Xiaobin Hu, Shuicheng Yan

机构 * Zhejiang University(浙江大学) Tencent Youtu Lab(腾讯优图实验室) Shanghai Jiao Tong University(上海交通大学) University of Auckland(奥克兰大学) National University of Singapore(新加坡国立大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 IVEBench通过引入多样化的视频数据库和多维评估协议,解决现有视频编辑基准在评估指令引导视频编辑方面的不足,提供全面的人类对齐评估结果。

Comments Accepted by ICLR 2026. Equal contributions from first two authors. Project page: https://ryanchenyn.github.io/projects/IVEBench Code: https://github.com/RyanChenYN/IVEBench Dataset: https://huggingface.co/datasets/Coraxor/IVEBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21011 2026-03-30 cs.CV 57%

Score2Instruct: Scaling Up Video Quality-Centric Instructions via Automated Dimension Scoring

Score2Instruct: 通过自动化维度评分扩展视频质量导向的指令

Qizhi Xie, Kun Yuan, Yunpeng Qu, Jiachao Gong, Mingda Wu, Ming Sun, Chao Zhou, Jihong Zhu

机构 * Tsinghua University(清华大学) Kuaishou Technology(快手科技)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Score2Instruct管道,通过自动化生成视频质量指令数据,提升视频大模型的质量评分和解释能力,构建了S2I-Bench基准测试集并验证了方法的有效性。

Comments 16 pages, 5 figures. Accepted by CVPR 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26013 2026-03-30 cs.CL 57%

Toward Culturally Grounded Natural Language Processing

迈向文化扎根的自然语言处理

Sina Bagheri Nezhad

机构 * Independent Researcher(独立研究员)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本文探讨多语言NLP中文化素养与语言能力的脱节问题,提出通过丰富上下文元数据和文化分层评估等方法,推动文化扎根的NLP研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25747 2026-03-30 cs.AI 57%

BeSafe-Bench: Unveiling Behavioral Safety Risks of Situated Agents in Functional Environments

BeSafe-Bench:揭示功能环境中情境代理的行为安全风险

Yuxuan Li, Yi Lin, Peng Wang, Shiming Liu, Xuetao Wei

机构 * Southern University of Science and Technology(南方科技大学) Huawei RAMS Lab(华为RAMS实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出BeSafe-Bench,通过构建功能环境和引入九类安全关键风险,评估代理在Web、Mobile、Embodied VLM和Embodied VLA等领域的行为安全风险,发现最佳性能代理在安全约束下完成任务的比例不足40%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26483 2026-03-30 cs.LG 50%

EcoFair: Trustworthy and Energy-Aware Routing for Privacy-Preserving Vertically Partitioned Medical Inference

EcoFair:面向隐私保护垂直分区医疗推断的可信且节能路由

Mostafa Anoosha, Dhavalkumar Thakker, Kuniko Paxton, Koorosh Aslansefat, Bhupesh Kumar Mishra, Baseer Ahmad, Rameez Raja Kureshi

机构 * School of Digital and Physical Science, University of Hull(赫尔大学数字与物理科学学院)

专题命中 多模态评测 :multimodal(abstract)

AI总结 EcoFair通过轻量级优先路由机制,在保持数据本地化的同时,减少边缘侧推断能耗,同时保持分类性能,提升高危病例的敏感性。

Comments 16 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏