arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-24 至 2026-06-24 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9 篇

2606.24233 2026-06-24 cs.CV 新提交 79%

Latent Visual States for Efficient Multimodal Reasoning

用于高效多模态推理的潜在视觉状态

Xiuwei Chen, Wentao Hu, Yongxin Wang, Zisheng Chen, Likui Zhang, Kun Xiang, Jianhua Han, Hui-Ling Zhen, Jingyuan Zou, Hang Xu, Xiaodan Liang

机构 * Sun Yat-sen University(中山大学) The Hong Kong Polytechnic University(香港理工大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Huawei Noah’s Ark Lab(华为诺亚方舟实验室) Yinwang Intelligent Technology Co. Ltd(银旺智能科技有限公司)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 提出EVA框架,通过生成连续潜在视觉表示(Latent_slot tokens)作为中间推理思考,并设计D-GSPO解决优化策略偏差,构建EVA-230K数据集,在多个基准上提升性能与推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24129 2026-06-24 cs.AI 新提交 76%

OmniPath: A Multi-Modal Agentic Framework for Auditing Wheelchair Accessibility

OmniPath: 用于审计轮椅可达性的多模态智能体框架

ASM Mobarak Hossain, Nadim Mahmud, Vaskar Raychoudhury, Md Osman Gani

机构 * Causal AI Lab, Department of Information Systems, University of Maryland Baltimore County(因果AI实验室,信息系统系,马里兰大学巴尔的摩分校) Department of Computer Science & Software Engineering, Miami University(计算机科学与软件工程系,迈阿密大学)

专题命中 多模态评测 :multi-modal(title,comments);分类 cs.AI

AI总结 提出OmniPath框架,融合OSM网络拓扑与机载LiDAR数据,通过虚拟遍历量化坡度、横坡等物理摩擦点,按ADA标准分级评估轮椅可达性,经实地验证有效识别标准地图遗漏的障碍。

Comments 10 pages, 13 figures. Submitted to IEEE COMPSAC 2026. OmniPath: A Multi-Modal Agentic Framework for Auditing Wheelchair Accessibility

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24770 2026-06-24 cs.CY cs.AI cs.LG 新提交 74%

Context-Aware Prediction of Student Quiz Performance with Multimodal Textbook Features

基于多模态教材特征的情境感知学生测验表现预测

Samin Khan

机构 * Stanford University(斯坦福大学)

专题命中 多模态评测 :multimodal(title);分类 cs.AI

AI总结 本研究通过提取CourseKata教材中复习题的文字和图像特征,结合学生历史表现,将章节测验预测准确率相对提升9.1%,表明情境感知模型能利用内容特征改进预测。

Comments 4 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24388 2026-06-24 cs.AI cs.LG 新提交 74%

PHANTOM: A Large-Scale Dataset of Multimodal Adversarial Attacks for Vision-Language Models

PHANTOM:面向视觉-语言模型的多模态对抗攻击大规模数据集

Simone Gallivanone, Hossein Khodadadi, Mauro Dore, Mauro Medda, Nicola Franco

机构 * The Italian Institute of Artificial Intelligence (AI4I)(意大利人工智能研究所(AI4I)) HikmaAI S.r.l.(HikmaAI有限责任公司)

专题命中 多模态评测 :multimodal(title);分类 cs.AI

AI总结 提出一个大规模开源对抗攻击数据集PHANTOM,涵盖10个高级类别和55个子类别的有害意图,包含47,524个对抗样本,旨在降低对抗研究门槛,促进VLM鲁棒性和安全性的系统评估。

Comments The dataset has been released at: https://huggingface.co/datasets/it4lia/PHANTOM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24539 2026-06-24 cs.CV 新提交 70%

PointVG-R: Internalizing Geometric Reasoning in MLLMs for Precise Pointing Localization via Visual Chain of Thought

PointVG-R: 通过视觉思维链在多模态大语言模型中内化几何推理以实现精确指向定位

Ling Li, Bowen Liu, Zinuo Zhan, Jianhui Zhong, Ziyu Zhu, Bingcai Wei, Kenglun Chang, Zhidong Deng

机构 * Tsinghua University(清华大学) Dalian University of Technology(大连理工大学) Northwestern Polytechnical University(西北工业大学) Wuhan University(武汉大学)

专题命中 多模态评测 :multi-modal(abstract);MLLM(abstract);分类 cs.CV

AI总结 提出PointVG-R,通过强化学习和冷启动数据内化几何推理,结合视觉思维链数据集EgoPoint-CoT,在指向性视觉定位任务中实现mIoU提升15.86个点的SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24488 2026-06-24 cs.CV cs.AI stat.ME 新提交 62%

RetiSEM: Generalising Causal Models for Fragmented Biomedical Data

RetiSEM:泛化碎片化生物医学数据的因果模型

Inam Ullah, Imran Razzak, Shoaib Jameel

机构 * University of Southampton(南安普顿大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出RetiSEM框架,通过领域约束的结构方程模型从碎片化生物医学数据中恢复因果图并进行中介分析,在合成和真实数据上优于无约束基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23892 2026-06-24 cs.CV 新提交 57%

REALM: A Unified Red-Teaming Benchmark for Physical-World VLMs

REALM: 面向物理世界视觉语言模型的统一红队基准

Yifei Zhao, Qian Lou, Mengxin Zheng

机构 * University of Central Florida(中佛罗里达大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出REALM,首个统一红队基准,集成12种攻击方法、3种防御和13个视觉语言模型,通过代理目标生成管道实现公平比较,发现文本注入攻击最有效。

Comments 20 pages, 5 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02978 2026-06-24 q-bio.NC cs.AI cs.HC cs.LG q-bio.QM 57%

Rethinking Generalized BCIs: Benchmarking 340,000+ Unique Algorithmic Configurations for EEG Mental Command Decoding

重新思考通用BCI:对超过340,000种独特的算法配置进行基准测试以解码EEG心理命令解码

Paul Barbaste, Olivier Oullier, Xavier Vasques

机构 * Inclusive Brains(包容大脑) Wavestone Human Technology Foundation(人类科技基金会) Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学) Institute for Artificial Intelligence, Biotech Dental Group(人工智能研究所,生物技术牙科集团) IBM Technology(IBM技术) IBM France Lab(IBM法国实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文通过评估超过340,000种独特的空间和非线性EEG分类组合,重新审视通用BCI,发现非线性方法在特定个体中表现更优,强调个性化流程选择的必要性。

Comments 28 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08690 2026-06-24 cs.CV 版本更新 57%

CanadaFireSat: Toward high-resolution wildfire forecasting with multiple modalities

CanadaFireSat:面向多模态高分辨率野火预测

Hugo Porta, Emanuele Dalsasso, Jessica L. McCarty, Devis Tuia

机构 * EPFL(瑞士联邦理工学院) Université Grenoble Alpes, Inria, CNRS, Grenoble INP, LJK(格勒诺布尔阿尔卑斯大学,法国国家科学研究中心,格勒诺布尔INP,LJK实验室) NASA Ames Research Center, Earth Science Division(美国航空航天局阿姆斯研究中心,地球科学部门)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 提出CanadaFireSat基准数据集,利用多模态数据(高分辨率多光谱卫星图像、中分辨率卫星产品和环境因子)结合深度学习模型,实现加拿大100米分辨率野火预测,多模态输入在2023年野火季F1分数达60.3%。

Comments 37 pages, 11 figures. Published in ISPRS Journal of Photogrammetry and Remote Sensing (2026)

Journal ref ISPRS Journal of Photogrammetry and Remote Sensing, Volume 239, September 2026, Pages 555-572

详情

展开后加载摘要…

URL PDF HTML 收藏