arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1562 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 1562 篇

2410.10247 2026-05-12 cs.CV cs.AI 81%

LPT: Less-overfitting Prompt Tuning for Vision-Language Model

LPT: 降低过拟合的提示微调用于视觉-语言模型

Chenhao Ding, Xinyuan Gao, Songlin Dong, Jizhou Han, Qiang Wang, Zhengdong Zhou, Yuhang He, Yihong Gong

机构 * IEEE(国际电气电子工程师协会)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出LPT框架,通过CLIP过滤细粒度前景信息并引入结构保持和层级logit约束,提升视觉-语言模型的泛化能力并缓解过拟合问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13868 2026-04-21 cs.CV cs.AI 81%

When Seeing Overrides Knowing: Disentangling Knowledge Conflicts in Vision-Language Models

当感知超越认知:在视觉-语言模型中解构知识冲突

Francesco Ortu, Zhijing Jin, Diego Doimo, Alberto Cazzaniga

机构 * University of Trieste(特里este大学) AREA Science Park(AREAS科学公园) MPI University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文研究视觉-语言模型如何解决跨模态冲突,通过引入WHOOPS-AHA!数据集,发现特定注意力头可调节模型对内部知识或视觉信息的偏好,提升冲突解决的精确度。

Comments ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16734 2026-04-21 cs.CV cs.AI 81%

Reducing Peak Memory Usage for Modern Multimodal Large Language Model Pipelines

降低现代多模态大语言模型流水线的峰值内存使用

Junwan Kim, Hyunkyung Bae

机构 * New York University(纽约大学)

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种顺序输入压缩机制,在预填充阶段通过结构感知的键值缓存压缩,降低多模态大语言模型的峰值内存使用,同时保持生成性能。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14883 2026-04-02 cs.CV cs.AI 81%

How Blind and Low-Vision Individuals Prefer Large Vision-Language Model-Generated Scene Descriptions

盲人和低视力者如何偏好大型视觉-语言模型生成的场景描述

Na Min An, Eunki Kim, Wan Ju Kang, Sangryul Kim, James Thorne, Hyunjung Shim

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 研究探讨了盲人和低视力用户对大型视觉-语言模型生成场景描述的偏好,通过用户研究评估了六种描述类型,发现用户对描述的充分性和简洁性存在较大差异,提出需构建以盲人和低视力用户为中心的评估指标。

Comments This paper has been superseded by version 2 of arXiv:2510.00766

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29252 2026-04-01 cs.CV cs.AI 81%

Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism

通过视觉记忆机制扩展多模态大语言模型的长视频理解

Tao Chen, Kun Zhang, Qiong Wu, Xiao Chen, Chao Chang, Xiaoshuai Sun, Yiyi Zhou, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室) National University of Defense Technology(国防科技大学)

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出FlexMem方法,通过视觉记忆机制实现长视频理解,有效提升多模态大语言模型处理无限长视频的能力,实验显示其在单块3090 GPU上能处理超1000帧视频并优于现有方法。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09771 2026-03-12 cs.CV cs.AI 81%

Ego: Embedding-Guided Personalization of Vision-Language Models

Ego:基于嵌入的视觉-语言模型个性化

Soroush Seifi, Simon Gardier, Vaggelis Dorovatas, Daniel Olmeda Reino, Rahaf Aljundi

机构 * Toyota Motor Europe(丰田欧洲公司)

专题命中 其他VLM :vision-language model(title);vision language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种基于模型内部机制的高效视觉-语言模型个性化方法,通过提取目标概念的视觉标记实现个性化描述与记忆。

Comments Accepted at the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14613 2026-03-10 cs.CL cs.AI cs.CV 81%

Multi-modal, Multi-task, Multi-criteria Automatic Evaluation with Vision Language Models

多模态、多任务、多标准自动评估与视觉语言模型

Masanari Ohi, Masahiro Kaneko, Naoaki Okazaki, Nakamasa Inoue

机构 * Institute of Science Tokyo(东京科学研究所) MBZUAI NII LLMC(日本国立信息与通信技术研究所语言模型中心)

专题命中 其他VLM :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出HarmonicEval,一种无需参考的多任务多标准自动评估指标,通过聚合标准评分提升与人类判断的相关性,并构建MMHE基准测试多任务场景下的评估泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20066 2026-02-24 cs.CV cs.AI 81%

HeatPrompt: Zero-Shot Vision-Language Modeling of Urban Heat Demand from Satellite Images

HeatPrompt: 从卫星图像进行零样本的城市热需求视觉-语言建模

Kundan Thota, Xuanhao Mu, Thorsten Schlachter, Veit Hagenmeyer

机构 * Institute for Automation and Applied Informatics (IAI), Karlsruhe Institute of Technology (KIT), Germany(自动化与应用信息研究所(IAI)、卡尔斯鲁厄理工学院(KIT))

专题命中 其他VLM :vision-language model(title);vision language model(abstract);分类 cs.CV、cs.AI

AI总结 HeatPrompt通过卫星图像和地理信息数据,利用零样本视觉语言模型估算城市热需求,提升预测精度并支持数据稀缺地区的热规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20174 2026-02-24 cs.CV cs.AI 81%

LRR-Bench: Left, Right or Rotate? Vision-Language models Still Struggle With Spatial Understanding Tasks

LRR-Bench:左、右还是旋转?视觉-语言模型在空间理解任务上仍面临挑战

Fei Kong, Jinhao Duan, Kaidi Xu, Zhenhua Guo, Xiaofeng Zhu, Xiaoshuang Shi

机构 * University of Electronic Science and Technology of China(电子科技大学) Drexel University(德雷塞尔大学) Tianyijiaotong Technology Ltd.(天奕交通技术有限公司)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 LRR-Bench通过合成数据评估视觉-语言模型在空间理解任务上的性能,发现其在复杂任务上的表现远低于人类水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00686 2026-02-17 cs.CV cs.AI 81%

LVLM-COUNT: Enhancing the Counting Ability of Large Vision-Language Models

LVLM-COUNT: 提升大视觉-语言模型的计数能力

Muhammad Fetrat Qharabagh, Mohammadreza Ghofrani, Kimon Fountoulakis

机构 * University of Waterloo(滑铁卢大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 LVLM-COUNT通过分而治之的方法提升大视觉-语言模型对大量对象的计数能力,有效解决计数任务中的重复计数问题。

Comments 38 pages, 24 Figures, 19 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01091 2026-02-16 cs.CV cs.AI 81%

Any-to-Any Vision-Language Model for Multimodal X-ray Imaging and Radiological Report Generation

任意到任意的视觉-语言模型用于多模态X射线成像与放射学报告生成

Daniele Molino, Francesco di Feola, Linlin Shen, Paolo Soda, Valerio Guarrasi

机构 * Department of Diagnostics and Intervention, Biomedical Engineering and Radiation Physics, Umeå University(诊断与介入部门,生物医学工程与放射物理,乌梅大学) College of Computer Science and Software Engineering, Shenzhen University(计算机科学与软件工程学院,深圳大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种任意到任意的视觉-语言模型,用于多模态X射线成像和放射学报告生成,通过生成高质量图像和语义连贯的报告,提升了医疗领域生成模型的临床应用价值。

Comments arXiv admin note: substantial text overlap with arXiv:2501.04614

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11733 2026-02-13 cs.CV cs.AI 81%

Adapting Vision-Language Models for E-commerce Understanding at Scale

大规模电商理解中的视觉-语言模型适应

Matteo Nulli, Vladimir Orshulevich, Tala Bazazo, Christian Herold, Michael Kozielski, Marcin Mazur, Szymon Tuzel, Cees G. M. Snoek, Seyyed Hadi Hashemi, Omar Javed, Yannick Versley, Shahram Khadivi

机构 * eBay Inc.(eBay公司) University of Amsterdam(阿姆斯特丹大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种方法,通过大规模实验研究,展示如何通过针对性适应通用视觉-语言模型以提升电子商务性能,同时保持多模态能力,并提出新的评估套件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02510 2026-02-04 cs.CY cs.AI cs.CL cs.CV 81%

Beyond Translation: Cross-Cultural Meme Transcreation with Vision-Language Models

超越翻译:基于视觉-语言模型的跨文化表情包再创作

Yuming Zhao, Peiyi Zhang, Oana Ignat

机构 * Santa Clara University(圣克拉拉大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种基于视觉-语言模型的跨文化表情包再创作框架,通过大规模数据集和多维度评估,揭示了跨文化再创作中的方向性差异及挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23253 2026-02-02 cs.CV cs.LG 81%

Training-Free Test-Time Adaptation with Brownian Distance Covariance in Vision-Language Models

无需训练的测试时适应与布朗距离协方差在视觉-语言模型中

Yi Zhang, Chun-Wun Cheng, Angelica I. Aviles-Rivero, Zhihai He, Liang-Jie Zhang

机构 * College of Computer Science and Software Engineering, Shenzhen University, China(深圳大学计算机科学与软件工程学院) University of Cambridge, Cambridge, UK(剑桥大学) Yau Mathematical Sciences Center, Tsinghua University, Beijing, China(清华大学尤里伊数学科学中心) Southern University of Science and Technology, Shenzhen, China(南方科技大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 TaTa通过布朗距离协方差实现无需训练的测试时适应,提升视觉-语言模型在领域偏移下的效率与稳定性,同时在泛化性能上取得突破。

Comments Accepted in ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19700 2026-02-02 cs.LG cs.AI 81%

Generalizable Multimodal Large Language Model Editing via Invariant Trajectory Learning

通过不变轨迹学习实现通用的多模态大语言模型编辑

Jiajie Su, Haoyuan Wang, Xiaohua Feng, Yunshan Ma, Xiaobo Xia, Yuyuan Li, Xiaolin Zheng, Jianmao Xiao, Chaochao Chen

机构 * Zhejiang University, China(浙江大学) Singapore Management University, Singapore(新加坡管理学院) National University of Singapore, Singapore(新加坡国立大学) Hangzhou Dianzi University, China(杭州电子科技大学) Jiangxi Normal University, China(江西师范大学)

专题命中 其他VLM :multimodal large language model(title);MLLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ODEit框架,通过不变轨迹学习提升多模态大语言模型的编辑可靠性、局部性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10945 2026-01-19 cs.CV cs.AI cs.CL 81%

PatientVLM Meets DocVLM: Pre-Consultation Dialogue Between Vision-Language Models for Efficient Diagnosis

PatientVLM 与 DocVLM 相遇:为高效诊断的预咨询对话

K Lokesh, Abhirama Subramanyam Penamakuri, Uday Agarwal, Apoorva Challa, Shreya K Gowda, Somesh Gupta, Anand Mishra

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出预咨询对话框架,通过视觉语言模型模拟医生与患者对话,利用合成症状提升诊断效率。

Comments Accepted at AAAI 2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15254 2025-12-18 cs.CV cs.LG 81%

Assessing the Visual Enumeration Abilities of Specialized Counting Architectures and Vision-Language Models

评估专用计数架构和视觉-语言模型的视觉计数能力

Kuinan Hou, Jing Mi, Marco Zorzi, Lamberto Ballan, Alberto Testolin

机构 * University of Padova(帕多瓦大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 本文比较了专用计数架构与VLMs在物体计数任务中的性能,发现VLMs在生成中间表示时计数准确率显著提高,但复杂场景计数仍需进一步研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03623 2025-12-04 cs.LG cs.AI physics.ao-ph 81%

The promising potential of vision language models for the generation of textual weather forecasts

视觉语言模型在生成文本天气预报中的巨大潜力

Edward C. C. Steele, Dinesh Mane, Emilio Monti, Luis Orus, Rebecca Chantrill-Cheyette, Matthew Couch, Kirstine I. Dale, Simon Eaton, Govindarajan Rangarajan, Amir Majlesi, Steven Ramsdale, Michael Sharpe, Craig Smith, Jonathan Smith, Rebecca Yates, Holly Ellis, Charles Ewen

机构 * Met Office(英国气象局) Amazon Web Services(亚马逊网络服务) University of East Anglia(东安格利亚大学)

专题命中 其他VLM :vision language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了视觉语言模型在直接生成文本天气预报中的潜力,通过视频编码的格网天气数据提升气象服务的生产效率与创新。

Comments 7 pages, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24242 2025-10-29 cs.NI cs.AI cs.LG 81%

Enabling Near-realtime Remote Sensing via Satellite-Ground Collaboration of Large Vision-Language Models

Zihan Li, Jiahao Yang, Yuxin Zhang, Zhe Chen, Yue Gao

机构 * Fudan University(复旦大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.AI、cs.LG

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22828 2025-10-28 cs.CV cs.AI 81%

CapRecover: A Cross-Modality Feature Inversion Attack Framework on Vision Language Models

Kedong Xiu, Sai Qian Zhang

机构 * New York University(纽约大学)

专题命中 其他VLM :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

Comments 9 pages, accepted by the 2025 ACM Multimedia Conference. Code is available at https://jus1mple.github.io/Image2CaptionAttack

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08222 2025-10-28 cs.CV cs.AI cs.CY cs.HC 81%

Refusal as Silence: Gendered Disparities in Vision-Language Model Responses

Sha Luo, Sang Jung Kim, Zening Duan, Kaiping Chen

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20444 2025-10-09 cs.LG cs.CV 81%

HoPE: Hybrid of Position Embedding for Long Context Vision-Language Models

Haoran Li, Yingjie Qin, Baoyuan Ou, Lai Xu, Ruiwen Xu

机构 * Carnegie Mellon University(卡内基梅隆大学) Xiaohongshu Inc.(小红书公司)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06064 2025-10-08 cs.CV cs.LG 81%

Medical Vision Language Models as Policies for Robotic Surgery

Akshay Muppidi, Martin Radfar

机构 * Department of Computer Science(计算机科学系) Stony Brook University(史泰尼斯布鲁克大学)

专题命中 其他VLM :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.LG

Comments IEEE CAI 2025

Journal ref 2025 IEEE Conference on Artificial Intelligence (CAI), Santa Clara, CA, USA, 2025, pp. 513,518

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17551 2025-10-03 cs.MM cs.AI cs.CV cs.SD eess.AS 81%

Audio-Enhanced Vision-Language Modeling with Latent Space Broadening for High Quality Data Expansion

Yu Sun, Yin Li, Ruixiao Sun, Chunhui Liu, Fangming Zhou, Ze Jin, Linjie Wang, Xiang Shen, Zhuolin Hao, Hongyu Xiong

机构 * ByteDance Inc.(字节跳动公司)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07766 2025-08-12 cs.CV cs.AI 81%

UniSVG: A Unified Dataset for Vector Graphic Understanding and Generation with Multimodal Large Language Models

Jinke Li, Jiarui Yu, Chenxing Wei, Hande Dong, Qiang Lin, Liangjing Yang, Zhicai Wang, Yanbin Hao

机构 * Zhejiang University(浙江大学) Tencent(腾讯) Shenzhen University(深圳大学) Hefei University of Technology(合肥工业大学)

专题命中 其他VLM :multimodal large language model(title);MLLM(abstract);分类 cs.CV、cs.AI

Comments Accepted at ACM MM 2025 Dataset Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01380 2025-08-05 cs.CV cs.AI 81%

Effective Damage Data Generation by Fusing Imagery with Human Knowledge Using Vision-Language Models

Jie Wei, Erika Ardiles-Cruz, Aleksey Panasyuk, Erik Blasch

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments 6 pages, IEEE NAECON'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12060 2025-07-31 cs.CV cs.AI cs.MM 81%

InstructFLIP: Exploring Unified Vision-Language Model for Face Anti-spoofing

Kun-Hsiang Lin, Yu-Wen Tseng, Kang-Yang Huang, Jhih-Ciang Wu, Wen-Huang Cheng

机构 * National Taiwan University(国立台湾大学) National Taiwan Normal University(国立台湾师范大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments Accepted by MM'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10300 2025-07-15 cs.CV cs.AI cs.CL 81%

FaceLLM: A Multimodal Large Language Model for Face Understanding

Hatef Otroshi Shahreza, Sébastien Marcel

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

Comments Accepted in ICCV 2025 workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05731 2025-07-09 cs.NI cs.AI cs.LG 81%

A Satellite-Ground Synergistic Large Vision-Language Model System for Earth Observation

Yuxin Zhang, Jiahao Yang, Zhe Chen, Wenjun Zhu, Jin Zhao, Yue Gao

机构 * Institute of Space Internet, Fudan University, Shanghai China(空间互联网研究所,复旦大学,上海中国)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.AI、cs.LG

Comments 11 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04410 2025-07-08 cs.CV cs.AI cs.IR 81%

Multimedia Verification Through Multi-Agent Deep Research Multimodal Large Language Models

Huy Hoan Le, Van Sy Thinh Nguyen, Thi Le Chi Dang, Vo Thanh Khang Nguyen, Truong Thanh Hung Nguyen, Hung Cao

机构 * University of New Brunswick(新 Brunswick大学) Institute for Clarity in Documentation(文档清晰研究所) Inria Paris-Rocquencourt(巴黎-罗克琴特研究所) Rajiv Gandhi University(拉贾·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒尔研究实验室)

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

Comments 33rd ACM International Conference on Multimedia (MM'25) Grand Challenge on Multimedia Verification

详情

展开后加载摘要…

URL PDF HTML 收藏