arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4651 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4651 篇

2606.08063 2026-06-09 cs.CV cs.AI cs.CL 新提交 67%

Robust-U1: Can MLLMs Self-Recover Corrupted Visual Content for Robust Understanding?

Robust-U1: MLLMs能否自我恢复受损视觉内容以实现鲁棒理解?

Jiaqi Tang, Jianmin Chen, Youyang Zhai, Wei Wei, Runtao Liu, Mengjie Zhao, Xiangyu Wu, Qingfa Xiao, Qifeng Chen

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出Robust-U1框架,通过监督微调、强化学习和多模态推理,使多模态大模型具备显式视觉自恢复能力,在真实和对抗性损坏下达到最先进鲁棒性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07451 2026-06-08 cs.CV cs.AI cs.CL cs.LG 新提交 67%

TEVI: Text-Conditioned Editing of Visual Representations via Sparse Autoencoders for Improved Vision-Language Alignment

TEVI: 基于稀疏自编码器的文本条件视觉表示编辑以改进视觉-语言对齐

Sweta Mahajan, Sukrut Rao, Jiahao Xie, Alexander Koller, Bernt Schiele

机构 * Max Planck Institute for Informatics, Saarland Informatics Campus, Saarbrücken, Germany(马克斯·普朗克研究所信息学院,萨尔兰信息学院,德国萨尔布吕肯) Department of Language Science and Technology, Saarland University, Saarbrücken, Germany(语言科学与技术系,萨尔兰大学,德国萨尔布吕肯)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出TEVI框架,利用稀疏自编码器解耦图像嵌入,并通过文本条件掩码模块选择性重构嵌入,以改善CLIP等视觉-语言模型的图像-文本对齐,在多个检索基准上取得提升。

Comments 20 pages, 13 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14637 2026-06-08 cs.CV cs.AI cs.CL cs.HC 67%

Forest-Chat: Adapting Vision-Language Agents for Interactive Forest Change Analysis

Forest-Chat: 为交互式森林变化分析适应视觉-语言代理

James Brock, Ce Zhang, Nantheera Anantrasirichai

机构 * School of Computer Science, University of Bristol(布里斯托尔大学计算机科学学院) School of Geographical Sciences, University of Bristol(布里斯托尔大学地理科学学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出Forest-Chat,一种基于LLM的森林变化分析代理,通过多任务处理实现自然语言查询,提升森林变化检测与语义解释的准确性与可解释性。

Comments 28 pages, 9 figures, 12 tables, Submitted to Ecological Informatics

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05748 2026-06-05 cs.MM cs.AI cs.CL 67%

UNIVID: Unified Vision-Language Model for Video Moderation

UNIVID:用于视频审核的统一视觉语言模型

Kejuan Yang, Yizhuo Zhang, Mingyuan Du, Yue Zhang, Dixin Zheng, Kaili Zhao, Yang Xiao, Hanzhong Liang, Kenan Xiao

机构 * Bytedance(字节跳动)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CL、cs.AI、cs.MM

AI总结 提出UNIVID统一视觉语言模型,通过生成可解释的策略感知字幕,实现端到端视频审核,减少违规泄露42.7%和过度审核率37.0%。

Comments 7 pages, 3 figures. Accepted to ACL 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06006 2026-06-04 cs.CV cs.AI cs.CL 67%

Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics

视觉语言模型能预测未来状态吗?从逆动力学引导世界模型

Yifu Qiu, Yftah Ziser, Anna Korhonen, Shay B. Cohen, Edoardo M. Ponti

机构 * Institute for Language, Cognition and Computation, University of Edinburgh(语言、认知与计算研究所,爱丁堡大学) Language Technology Lab, University of Cambridge(语言技术实验室,剑桥大学) NVIDIA(NVIDIA公司) University of Groningen(格罗宁根大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文发现视觉语言模型(VLM)难以直接进行前向动力学预测(FDP),但逆动力学预测(IDP)更容易学习,并利用IDP通过弱监督学习和推理时验证两种策略引导FDP,在Aurora-Bench上取得与最先进图像编辑模型竞争的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21397 2026-06-02 cs.CV cs.AI cs.CL cs.LG 67%

Understanding the Effects of Distractors on Reasoning Vision-Language Models

理解干扰项对推理视觉语言模型的影响

Jiyun Bae, Hyunjong Ok, Sangwoo Mo, Jaeho Lee

机构 * Pohang University of Science and Technology (POSTECH)(坡山科学技术大学(POSTECH))

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文通过构建包含语义和数值维度干扰项的视觉问答数据集Idis,研究视觉干扰项如何影响视觉语言模型的测试时缩放行为,发现视觉干扰项以与文本干扰项根本不同的方式降低准确率而不增加推理长度,并提出简单提示策略缓解干扰项驱动的预测。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14621 2026-05-15 cs.CV cs.AI cs.CL 67%

Do We Really Need External Tools to Mitigate Hallucinations? SIRA: Shared-Prefix Internal Reconstruction of Attribution

我们真的需要外部工具来缓解幻觉吗?SIRA:共享前缀内部重构归因

Tian Qin, Junzhe Chen, Yuqing Shi, Tianshu Zhang, Qiang Ju, Lijie Wen

机构 * Tsinghua University(清华大学) The University of Sydney(悉尼大学) Stanford University(斯坦福大学) Baichuan AI(百川AI)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 SIRA通过内部构建对比参考减少视觉语言模型的幻觉,无需外部工具或额外计算,保持描述覆盖并降低开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25584 2026-05-11 cs.AI cs.CL cs.CV cs.IT cs.LG math.IT 67%

Skip-It? Theoretical Conditions for Layer Skipping in Vision-Language Models

跳过层?视觉-语言模型中层跳过的理论条件

Max Hartman, Vidhata Jayaraman, Moulik Choraria, Akhil Bhimaraju, Lav R. Varshney

机构 * Department of Electrical and Computer Engineering, The University of Illinois, Champaign, IL, United States(电气与计算机工程系,伊利诺伊大学香槟分校) Department of Mathematics, The University of Illinois, Champaign, IL, United States(数学系,伊利诺伊大学香槟分校) AI Innovation Institute, Stony Brook University, Stony Brook, NY, United States(人工智能创新研究所,石溪大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出统一框架,通过可验证的冗余概念,理论分析视觉-语言模型中层跳过的条件,验证早期和晚期视觉token的冗余性,并统一现代层跳技术的理论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23276 2026-04-28 cs.CV cs.AI cs.CL 67%

Lightweight and Production-Ready PDF Visual Element Parsing

轻量且适用于生产的PDF视觉元素解析

Meizhu Liu, Yassi Abbasi, Matthew Rowe, Michael Avendi, Paul Li

机构 * Oracle AI

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出一种轻量级PDF解析框架,通过空间启发式、布局分析和语义相似性结合,实现高准确率的视觉元素检测与标题关联,提升多模态RAG检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20806 2026-04-23 cs.CV cs.AI cs.CL 67%

OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Model

OMIBench:用于大型视觉-语言模型在奥林匹克级多图像推理中的基准测试

Qiguang Chen, Chengyu Luan, Jiajun Wu, Qiming Yu, Yi Yang, Yizhuo Li, Jingqi Tong, Xiachong Feng, Libo Qin, Wanxiang Che

机构 * Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究室) Harbin Institute of Technology(哈尔滨工业大学) Central South University(中南大学) Fudan University(复旦大学) The University of Hong Kong(香港大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Text Computing and Cognitive Intelligence Ministry of Education Engineering Research Center(教育部文本计算与认知智能工程研究中心) Guizhou University(贵州大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 OMIBench旨在评估多图像推理能力,包含生物、化学、数学和物理奥林匹克问题,提供精确和语义答案匹配的评估协议,实验显示现有模型性能存在显著差距。

Comments ACL 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12033 2026-04-15 cs.CL cs.AI cs.CV 67%

Benchmarking Deflection and Hallucination in Large Vision-Language Models

对大视觉-语言模型中偏移和幻觉的基准测试

Nicholas Moratelli, Christopher Davis, Leonardo F. R. Ribeiro, Bill Byrne, Gonzalo Iglesias

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) Amazon AGI(亚马逊人工智能实验室) University of Cambridge(剑桥大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出VLM-DeflectionBench基准,通过2775个样本评估模型在冲突或不足证据下的行为,揭示模型在面对噪声或误导性证据时的偏移能力不足,为可靠的KB-VQA评估提供可扩展的基准。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11320 2026-04-14 cs.RO 67%

CLASP: Closed-loop Asynchronous Spatial Perception for Open-vocabulary Desktop Object Grasping

CLASP: 闭环异步空间感知用于开放词汇桌面物体抓取

Yiran Ling, Wenxuan Li, Siying Dong, Yize Zhang, Xiaoyao Huang, Jing Jiang, Ruonan Li, Jie Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学) National Key Laboratory of Smart Farm Technologies and Systems(智慧农场技术与系统全国重点实验室) Peng Cheng Laboratory(鹏城实验室) Northeastern University(东北大学)

专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract)

AI总结 本文提出CLASP框架,通过异步闭环机制整合多模态感知、逻辑推理与状态反馈,解决低级抓取中多模态演示不足、空间幻觉和开放环执行脆弱性问题,实现87%的成功率和强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10985 2026-04-14 cs.AI cs.CL cs.CV 67%

Back to the Barn with LLAMAs: Evolving Pretrained LLM Backbones in Finetuning Vision Language Models

回到牛棚与LLAMAs:在微调视觉语言模型中进化预训练LLM骨干

Sameera Horawalavithana, Lauren Phillips, Ian Stewart, Sai Munikoti, Karl Pazdernik

机构 * Pacific Northwest National Laboratory(太平洋西北国家实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究探讨了在微调视觉语言模型时,不同预训练LLM骨干对下游任务性能的影响,发现新版本LLM并非总能提升性能,且表现依赖具体任务。

Comments Preprint and under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09529 2026-04-13 cs.CV cs.AI cs.CL 67%

VL-Calibration: Decoupled Confidence Calibration for Large Vision-Language Models Reasoning

VL-Calibration:解耦的大型视觉-语言模型推理置信度校准

Wenyi Xiao, Xinchi Xu, Leilei Gan

机构 * Zhejiang University(浙江大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出VL-Calibration,通过强化学习框架解耦视觉和推理置信度,提升大视觉-语言模型的校准与视觉推理准确率。

Comments 24 pages, ACL 2026 Main. Repository: https://github.com/Mr-Loevan/VL-Calibration

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21472 2026-04-13 cs.CV cs.CL cs.MM 67%

Mitigating Hallucination in Large Vision-Language Models via Adaptive Attention Calibration

通过自适应注意力校准缓解大视觉-语言模型中的幻觉

Mehrdad Fazli, Bowen Wei, Ahmet Sari, Ziwei Zhu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.MM

AI总结 本文提出CAAC框架,通过解决空间感知偏差和模态偏差,提升大视觉-语言模型在长文本生成中的准确性和视觉对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14971 2026-04-08 cs.CV cs.AI cs.CL cs.LG 67%

Sim-CLIP: Unsupervised Siamese Adversarial Fine-Tuning for Robust and Semantically-Rich Vision-Language Models

Sim-CLIP: 无监督的孪生对抗微调用于鲁棒且语义丰富的视觉-语言模型

Md Zarif Hossain, Ahmed Imteaj

机构 * Florida Atlantic University(佛罗里达大西洋大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 Sim-CLIP通过无监督对抗微调提升CLIP视觉编码器的鲁棒性,同时保持语义表示。采用孪生架构和余弦相似度目标,避免大批次对比学习和额外动量编码器,实现低计算开销的鲁棒训练。

Comments Accepted at IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05623 2026-04-08 cs.CV cs.CL cs.MM 67%

DetailVerifyBench: A Benchmark for Dense Hallucination Localization in Long Image Captions

DetailVerifyBench:长图像描述中密集 hallucination 定位的基准

Xinran Wang, Yuxuan Zhang, Xiao Zhang, Haolong Yan, Muxi Diao, Songyu Xu, Zhonghao Yan, Hongbing Li, Kongming Liang, Zhanyu Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.MM

AI总结 本文提出 DetailVerifyBench,通过1000张高质量图像和密集的token级注释,评估长图像描述中hallucination的精确定位能力。

Comments 8 pages, 5 figures. The dataset and code are available at https://zyx-hhnkh.github.io/DetailVerifyBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05201 2026-04-08 cs.AI cs.CL cs.CV 67%

MedGemma Technical Report

MedGemma 技术报告

Andrew Sellergren, Sahar Kazemzadeh, Tiam Jaroensri, Atilla Kiraly, Madeleine Traverse, Timo Kohlberger, Shawn Xu, Fayaz Jamil, Cían Hughes, Charles Lau, Justin Chen, Fereshteh Mahvar, Liron Yatziv, Tiffany Chen, Bram Sterling, Stefanie Anna Baby, Susanna Maria Baby, Jeremy Lai, Samuel Schmidgall, Lu Yang, Kejia Chen, Per Bjornsson, Shashir Reddy, Ryan Brush, Kenneth Philbrick, Mercy Asiedu, Ines Mezerreg, Howard Hu, Howard Yang, Richa Tiwari, Sunny Jansen, Preeti Singh, Yun Liu, Shekoofeh Azizi, Aishwarya Kamath, Johan Ferret, Shreya Pathak, Nino Vieillard, Ramona Merhej, Sarah Perrin, Tatiana Matejovicova, Alexandre Ramé, Morgane Riviere, Louis Rouillard, Thomas Mesnard, Geoffrey Cideron, Jean-bastien Grill, Sabela Ramos, Edouard Yvinec, Michelle Casbon, Elena Buchatskaya, Jean-Baptiste Alayrac, Dmitry Lepikhin, Vlad Feinberg, Sebastian Borgeaud, Alek Andreev, Cassidy Hardin, Robert Dadashi, Léonard Hussenot, Armand Joulin, Olivier Bachem, Yossi Matias, Katherine Chou, Avinatan Hassidim, Kavi Goel, Clement Farabet, Joelle Barral, Tris Warkentin, Jonathon Shlens, David Fleet, Victor Cotruta, Omar Sanseviero, Gus Martins, Phoebe Kirk, Anand Rao, Shravya Shetty, David F. Steiner, Can Kirmizibayrak, Rory Pilgrim, Daniel Golden, Lin Yang

机构 * Google Research(谷歌研究) Google DeepMind(谷歌DeepMind)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 MedGemma 是基于 Gemma 3 的医学视觉-语言基础模型,具备强大的医学理解和推理能力,在医疗多模态问答、胸部X光分类等任务中表现优异,同时保持通用能力,为医疗AI发展提供基础。

Comments Fix references

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03556 2026-04-07 cs.CV cs.AI cs.CL 67%

Focus Matters: Phase-Aware Suppression for Hallucination in Vision-Language Models

重点至关重要:面向视觉语言模型中幻觉的相位感知抑制

Sohyeon Kim, Sang Yeon Yoon, Kyeongbo Kong

机构 * Pusan National University(釜山大学) Pukyong National University(釜庆大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出一种轻量级干预方法,在视觉编码器的聚焦阶段选择性抑制低关注的token,通过单次前向传递统计信息和DPP保留多样视觉线索,减少幻觉的同时保持caption质量,且推理延迟低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00455 2026-04-02 cs.CV cs.AI cs.CL 67%

First Logit Boosting: Visual Grounding Method to Mitigate Object Hallucination in Large Vision-Language Models

首个Logit提升:一种缓解大视觉-语言模型中物体幻觉的视觉 grounding 方法

Jiwoo Ha, Jongwoo Baek, Jinhyun So

机构 * DGIST EECS(大邱庆北科学技术院电子工程与计算机科学系)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出FLB方法,通过存储首个生成token的logit并加到后续预测中,缓解大视觉-语言模型中的长期衰减问题,有效减少物体幻觉并保持视觉信息。

Comments 19 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28504 2026-03-31 astro-ph.SR astro-ph.IM 67%

JW-VL: A Vision-Language Model for Solar Physics

JW-VL:用于太阳物理的视觉-语言模型

Mingfu Shao, Hui Wang, Liyue Tong, Yuyang Li, Cunshi Wang, Jiaben Lin, Suo Liu, Haiqing Xu, Yin Zhang, Jing Huang

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract)

AI总结 本文提出JW-VL模型,专为太阳物理设计,整合多波段观测数据,实现从原始观测数据到图像识别、活动分析和OCR的端到端处理,同时构建多波段图像基准数据集。

Comments 16 Pages,8figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24275 2026-03-26 cs.LG 67%

Language-Assisted Image Clustering Guided by Discriminative Relational Signals and Adaptive Semantic Centers

基于判别关系信号和自适应语义中心的语言辅助图像聚类

Jun Ma, Xu Zhang, Zhengxing Jiao, Yaxin Hou, Hui Liu, Junhui Hou, Yuheng Jia

机构 * School of Computer Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院) School of Computing Information Sciences, Saint Francis University, Hong Kong, China(圣弗朗西斯大学计算信息科学学院) Department of Computer Science, City University of Hong Kong, Hong Kong, China(香港城市大学计算机科学系)

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract)

AI总结 本文提出一种新的语言辅助图像聚类框架,通过跨模态关系生成更判别的自监督信号,并利用提示学习学习类别连续语义中心,提升聚类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12665 2026-03-26 cs.RO 67%

TacVLA: Contact-Aware Tactile Fusion for Robust Vision-Language-Action Manipulation

TacVLA: 基于接触感知的触觉融合用于鲁棒的视觉-语言-动作操控

Kaidi Zhang, Heng Zhang, Zhengtong Xu, Zhiyuan Zhang, Md Rakibul Islam Prince, Xiang Li, Xiaojing Han, Yuhao Zhou, Arash Ajoudani, Yu She

机构 * Human-Robot Interfaces and Interaction Lab, Istituto Italiano di Tecnologia(人机交互实验室,意大利理工学院) Ph.D. program of national interest in Robotics and Intelligent Machines (DRIM) and Università di Genova(机器人与智能机器国家级博士项目(DRIM)和热那亚大学) Edwardson School of Industrial Engineering, Purdue University(工业工程学院,普渡大学)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract)

AI总结 TacVLA通过引入触觉模态提升视觉-语言-动作操控的鲁棒性,采用接触感知门控机制实现多模态融合,实验显示在拆解、箱内拾取和视觉遮挡场景中性能提升显著。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17246 2026-03-23 cs.LG 67%

On the Cone Effect and Modality Gap in Medical Vision-Language Embeddings

关于医学视觉-语言嵌入中的锥效应与模态间隙

David Restrepo, Miguel L Martins, Chenwei Wu, Luis Filipe Nakayama, Diego M Lopez, Stergios Christodoulidis, Maria Vakalopoulou, Enzo Ferrante

机构 * CentraleSupélec, Université Paris-Saclay, France(中央理工巴黎高等学院,巴黎萨克雷大学,法国) University of Porto, Portugal(葡萄牙波尔图大学) University of Michigan, USA(美国密歇根大学) Federal University of São Paulo, Brazil(巴西圣保罗联邦大学) Universidad del Cauca, Colombia(哥伦比亚考卡大学) Universidad de Buenos Aires, Argentina(阿根廷布宜诺斯艾利斯大学)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract)

AI总结 本文研究了视觉语言模型中的锥效应及其对多模态性能的影响,通过轻量级机制调控模态间隙,发现医学数据集对间隙调节更敏感,但过度消除间隙并非最优,任务相关分离更佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19092 2026-03-20 cs.CV cs.AI cs.CL cs.LG 67%

SAVeS: Steering Safety Judgments in Vision-Language Models via Semantic Cues

SAVeS: 通过语义线索引导视觉-语言模型中的安全判断

Carlos Hinojosa, Clemens Grange, Bernard Ghanem

机构 * King Abdullah University of Science and Technology(国王阿卜杜勒-阿齐兹大学科学与技术学院) Technical University of Munich(慕尼黑技术大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究通过语义线索引导视觉-语言模型的安全判断,提出SAVeS基准和评估协议,验证安全决策对语义线索的敏感性,揭示模型对视觉-语言关联的依赖及潜在安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02906 2026-03-20 cs.CV cs.AI cs.MM 67%

MRD: Multi-resolution Retrieval-Detection Fusion for High-Resolution Image Understanding

MRD:多分辨率检索-检测融合用于高分辨率图像理解

Fan Yang, Xingping Dong, Xin Yu, Wenhan Luo, Wei Liu, Kaihao Zhang

机构 * HITSZ(哈尔滨工业大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出MRD框架,通过多分辨率语义融合和开放词汇检测提升高分辨率图像理解,实现局部和全局视角的增强,取得单目标和多目标理解任务的最先进性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17024 2026-03-20 cs.CV cs.AI cs.CL 67%

HopChain: Multi-Hop Data Synthesis for Generalizable Vision-Language Reasoning

HopChain: 多跳数据合成用于通用视觉语言推理

Shenzhi Wang, Shixuan Liu, Jing Zhou, Chang Gao, Xiong-Hui Chen, Binghai Wang, An Yang, Shiji Song, Bowen Yu, Gao Huang, Junyang Lin

机构 * Qwen Team, Alibaba Inc.(通义实验室,阿里巴巴公司) LeapLab, Tsinghua University(清华大学跃迁实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出HopChain框架,通过多跳视觉语言推理数据合成提升VLMs的通用推理能力,实验表明其在多个基准测试中显著提升性能。

Comments 28 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18002 2026-03-19 cs.CV cs.AI cs.CL 67%

Loc3R-VLM: Language-based Localization and 3D Reasoning with Vision-Language Models

Loc3R-VLM:基于语言的定位与3D推理的视觉语言模型

Kevin Qu, Haozhe Qi, Mihai Dusmanu, Mahdi Rad, Rui Wang, Marc Pollefeys

机构 * Microsoft Spatial AI Lab(微软空间AI实验室) ETH Zurich(苏黎世联邦理工学院) EPFL(苏黎世联邦理工学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 Loc3R-VLM通过结合全局布局重建和显式情境建模,提升视觉语言模型的3D空间理解能力,在语言定位和3D问答任务中取得最优性能。

Comments Project Page: https://kevinqu7.github.io/loc3r-vlm

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21991 2026-03-18 cs.CV cs.AI cs.CL cs.LG 67%

ERGO: Efficient High-Resolution Visual Understanding for Vision-Language Models

ERGO:高效高分辨率视觉理解用于视觉-语言模型

Jewon Lee, Wooksu Shin, Seungmin Yang, Ki-Ung Song, DongUk Lim, Jaeyeon Kim, Tae-Ho Kim, Bo-Kyeong Kim

机构 * Nota Inc.(Nota公司)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 ERGO提出一种两阶段'粗到细'推理流程,通过下采样图像识别任务相关区域,再以全分辨率裁剪处理,从而在降低计算成本的同时保留必要的细粒度视觉细节,提升视觉-语言模型的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.17066 2026-03-12 cs.AI cs.CL cs.CV cs.LG cs.MA 67%

Mindstorms in Natural Language-Based Societies of Mind

自然语言基础的思维社会中的风暴

Mingchen Zhuge, Haozhe Liu, Francesco Faccio, Dylan R. Ashley, Róbert Csordás, Anand Gopalakrishnan, Abdullah Hamdi, Hasan Abed Al Kader Hammoud, Vincent Herrmann, Kazuki Irie, Louis Kirsch, Bing Li, Guohao Li, Shuming Liu, Jinjie Mai, Piotr Piękos, Aditya Ramesh, Imanol Schlag, Weimin Shi, Aleksandar Stanić, Wenyi Wang, Yuhui Wang, Mengmeng Xu, Deng-Ping Fan, Bernard Ghanem, Jürgen Schmidhuber

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文探讨了基于自然语言的思维社会(NLSOMs)的结构和应用,通过多代理系统解决多种AI任务,并提出未来研究方向。

Comments published in Computational Visual Media Journal (CVMJ); 9 pages in main text + 7 pages of references + 38 pages of appendices, 14 figures in main text + 13 in appendices, 7 tables in appendices

Journal ref (2025). Computational Visual Media, 11(1), 29-81

详情

展开后加载摘要…

URL PDF HTML 收藏