arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-20 至 2026-03-20 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 7 篇

2603.19092 2026-03-20 cs.CV cs.AI cs.CL cs.LG 67%

SAVeS: Steering Safety Judgments in Vision-Language Models via Semantic Cues

SAVeS: 通过语义线索引导视觉-语言模型中的安全判断

Carlos Hinojosa, Clemens Grange, Bernard Ghanem

机构 * King Abdullah University of Science and Technology(国王阿卜杜勒-阿齐兹大学科学与技术学院) Technical University of Munich(慕尼黑技术大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究通过语义线索引导视觉-语言模型的安全判断,提出SAVeS基准和评估协议,验证安全决策对语义线索的敏感性,揭示模型对视觉-语言关联的依赖及潜在安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02906 2026-03-20 cs.CV cs.AI cs.MM 67%

MRD: Multi-resolution Retrieval-Detection Fusion for High-Resolution Image Understanding

MRD:多分辨率检索-检测融合用于高分辨率图像理解

Fan Yang, Xingping Dong, Xin Yu, Wenhan Luo, Wei Liu, Kaihao Zhang

机构 * HITSZ(哈尔滨工业大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出MRD框架,通过多分辨率语义融合和开放词汇检测提升高分辨率图像理解,实现局部和全局视角的增强,取得单目标和多目标理解任务的最先进性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17024 2026-03-20 cs.CV cs.AI cs.CL 67%

HopChain: Multi-Hop Data Synthesis for Generalizable Vision-Language Reasoning

HopChain: 多跳数据合成用于通用视觉语言推理

Shenzhi Wang, Shixuan Liu, Jing Zhou, Chang Gao, Xiong-Hui Chen, Binghai Wang, An Yang, Shiji Song, Bowen Yu, Gao Huang, Junyang Lin

机构 * Qwen Team, Alibaba Inc.(通义实验室,阿里巴巴公司) LeapLab, Tsinghua University(清华大学跃迁实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出HopChain框架,通过多跳视觉语言推理数据合成提升VLMs的通用推理能力,实验表明其在多个基准测试中显著提升性能。

Comments 28 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23098 2026-03-20 cs.CV cs.AI 62%

Blind to Position, Biased in Language: Probing Mid-Layer Representational Bias in Vision-Language Encoders for Zero-Shot Language-Grounded Spatial Understanding

无视位置,语言偏见:探测视觉语言编码器中中间层表征偏见以实现零样本语言基础空间理解

Na Min An, Inha Kang, Minhyun Lee, Hyunjung Shim

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) Samsung Electronics(三星电子)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究探讨了视觉语言编码器中间层中位置和语言相关信息的偏见,通过层间分析发现常规最终层多模态嵌入优先考虑全局语义对齐,导致视觉嵌入对位置线索敏感性低,多语言文本嵌入在共享空间中形成语言依赖的几何偏移,提出构建空间地图的方法提升零样本图像分割性能。

Comments 61 pages, 28 Figures, 15 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12696 2026-03-20 cs.RO cs.CV 57%

HaltNav: Reactive Visual Halting over Lightweight Topological Priors for Robust Vision-Language Navigation

HaltNav: 基于轻量拓扑先验的反应式视觉停止用于鲁棒视觉-语言导航

Zihui Yu, Pingcong Li, Bichi Zhang, Sören Schwertfeger

机构 * SIST, ShanghaiTech University(上海科技大学信息与通信科学核心平台,上海科技大学) Key Laboratory of Intelligent Perception and Human-Machine Collaboration(智能感知与人机协同重点实验室)

专题命中 图文多模态 :MLLM(abstract);分类 cs.CV

AI总结 本文提出HaltNav框架,结合轻量拓扑先验与局部探索能力,通过反应式视觉停止机制提升视觉-语言导航的鲁棒性,实验表明其在复杂环境下的表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10846 2026-03-20 cs.CL 57%

DUAL-Bench: Measuring Over-Refusal and Robustness in Vision-Language Models

DUAL-Bench: 测量视觉语言模型中的过度拒绝与鲁棒性

Kaixuan Ren, Preslav Nakov, Usman Naseem

机构 * Macquarie University(麦考瑞大学) MBZUAI(马克斯·普朗克智能系统研究所)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出DUAL-Bench,通过评估18种VLM在12类危险场景下的表现,揭示模型在双重使用场景中的脆弱安全边界,强调安全完成与过度拒绝的平衡需求。

Comments 26pages, 13 figures, Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19233 2026-03-20 cs.RO 56%

Not All Features Are Created Equal: A Mechanistic Study of Vision-Language-Action Models

并非所有特征都具有同等价值:一种视觉-语言-动作模型的机制研究

Bryce Grant, Xijia Zhao, Peng Wang

机构 * Case Western Reserve University(凯斯西储大学)

专题命中 图文多模态 :multimodal(abstract,comments)

AI总结 研究通过激活注入、稀疏自编码器和线性探针分析视觉-语言-动作模型,发现视觉路径主导动作生成,语言敏感性取决于任务结构而非模型设计,且专家路径编码运动程序,VLM路径编码目标语义,释放Action Atlas供探索。

Comments Accepted to Multimodal Intelligence Workshop @ ICLR

详情

展开后加载摘要…

URL PDF HTML 收藏