arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1565 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 1565 篇

2501.18648 2025-03-25 cs.CV 74%

Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey

Ranjan Sapkota, Shaina Raza, Maged Shoman, Achyut Paudel, Manoj Karkee

专题命中 其他VLM :multimodal large language model(title);分类 cs.CV

Comments 52 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01531 2025-03-04 cs.CV 74%

Diversity Covariance-Aware Prompt Learning for Vision-Language Models

Songlin Dong, Zhengdong Zhou, Chenhao Ding, Xinyuan Gao, Alex Kot, Yihong Gong

专题命中 其他VLM :vision-language model(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15888 2025-02-25 cs.CV 74%

Understanding and Evaluating Hallucinations in 3D Visual Language Models

Ruiying Peng, Kaiyuan Li, Weichen Zhang, Chen Gao, Xinlei Chen, Yong Li

专题命中 其他VLM :visual language model(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12356 2025-01-22 cs.CV 74%

Vision-Language Models for Automated Chest X-ray Interpretation: Leveraging ViT and GPT-2

Md. Rakibul Islam, Md. Zahid Hossain, Mustofa Ahmed, Most. Sharmin Sultana Samu

专题命中 其他VLM :vision-language model(title);分类 cs.CV

Comments Preprint, manuscript under-review

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.17051 2025-01-09 cs.CV 74%

FILP-3D: Enhancing 3D Few-shot Class-incremental Learning with Pre-trained Vision-Language Models

Wan Xu, Tianyu Huang, Tianyu Qu, Guanglei Yang, Yiwen Guo, Wangmeng Zuo

专题命中 其他VLM :vision-language model(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07315 2024-11-22 cs.CV 74%

CosmoCLIP: Generalizing Large Vision-Language Models for Astronomical Imaging

Raza Imam, Mohammed Talha Alam, Umaima Rahman, Mohsen Guizani, Fakhri Karray

专题命中 其他VLM :vision-language model(title);分类 cs.CV

Comments Accepted at SPAICE Conference, ECSAT, UK, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02919 2024-09-10 cs.CV 74%

HiPrompt: Tuning-free Higher-Resolution Generation with Hierarchical MLLM Prompts

Xinyu Liu, Yingqing He, Lanqing Guo, Xiang Li, Bu Jin, Peng Li, Yan Li, Chi-Min Chan, Qifeng Chen, Wei Xue, Wenhan Luo, Qifeng Liu, Yike Guo

专题命中 其他VLM :MLLM(title);分类 cs.CV

Comments https://liuxinyv.github.io/HiPrompt/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13532 2024-05-24 cs.CV 74%

What Makes Good Few-shot Examples for Vision-Language Models?

Zhaojun Guo, Jinghui Lu, Xuejing Liu, Rui Zhao, ZhenXing Qian, Fei Tan

专题命中 其他VLM :vision-language model(title);分类 cs.CV

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10667 2024-03-29 cs.IR cs.AI cs.CL cs.MM 74%

Towards Unified Multi-Modal Personalization: Large Vision-Language Models for Generative Recommendation and Beyond

Tianxin Wei, Bowen Jin, Ruirui Li, Hansi Zeng, Zhengyang Wang, Jianhui Sun, Qingyu Yin, Hanqing Lu, Suhang Wang, Jingrui He, Xianfeng Tang

专题命中 其他VLM :vision-language model(title);分类 cs.AI

Comments ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12730 2024-03-27 cs.CV 74%

A Closer Look at the Few-Shot Adaptation of Large Vision-Language Models

Julio Silva-Rodríguez, Sina Hajimiri, Ismail Ben Ayed, Jose Dolz

专题命中 其他VLM :vision-language model(title);分类 cs.CV

Comments CVPR 2024. Code: https://github.com/jusiro/CLAP

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13467 2024-03-21 cs.RO cs.CV 74%

CLIPSwarm: Generating Drone Shows from Text Prompts with Vision-Language Models

Pablo Pueyo, Eduardo Montijano, Ana C. Murillo, Mac Schwager

专题命中 其他VLM :vision-language model(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.16494 2024-03-14 cs.CV 74%

ArGue: Attribute-Guided Prompt Tuning for Vision-Language Models

Xinyu Tian, Shu Zou, Zhaoyuan Yang, Jing Zhang

专题命中 其他VLM :vision-language model(title);分类 cs.CV

Comments Accepted to CVPR2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15011 2023-12-27 cs.CV 74%

Gemini vs GPT-4V: A Preliminary Comparison and Combination of Vision-Language Models Through Qualitative Cases

Zhangyang Qi, Ye Fang, Mengchen Zhang, Zeyi Sun, Tong Wu, Ziwei Liu, Dahua Lin, Jiaqi Wang, Hengshuang Zhao

专题命中 其他VLM :vision-language model(title);分类 cs.CV

Comments Project Page: https://github.com/Qi-Zhangyang/Gemini-vs-GPT4V. arXiv admin note: substantial text overlap with arXiv:2309.17421

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06323 2023-12-12 cs.CV 74%

Learning Hierarchical Prompt with Structured Linguistic Knowledge for Vision-Language Models

Yubin Wang, Xinyang Jiang, De Cheng, Dongsheng Li, Cairong Zhao

专题命中 其他VLM :vision-language model(title);分类 cs.CV

Comments AAAI2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.13165 2023-11-23 cs.AI 74%

Multimodal Large Language Models: A Survey

Jiayang Wu, Wensheng Gan, Zefeng Chen, Shicheng Wan, Philip S. Yu

专题命中 其他VLM :multimodal large language model(title);分类 cs.AI

Comments IEEE BigData 2023. 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.06571 2023-08-21 cs.CV 74%

Gradient-Regulated Meta-Prompt Learning for Generalizable Vision-Language Models

Juncheng Li, Minghe Gao, Longhui Wei, Siliang Tang, Wenqiao Zhang, Mengze Li, Wei Ji, Qi Tian, Tat-Seng Chua, Yueting Zhuang

专题命中 其他VLM :vision-language model(title);分类 cs.CV

Comments Accepted by ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.06159 2023-05-11 cs.CL cs.AI 74%

A Review of Vision-Language Models and their Performance on the Hateful Memes Challenge

Bryan Zhao, Andrew Zhang, Blake Watson, Gillian Kearney, Isaac Dale

专题命中 其他VLM :vision-language model(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.08333 2022-07-25 cs.CV 74%

Towards the Human Global Context: Does the Vision-Language Model Really Judge Like a Human Being?

Sangmyeong Woh, Jaemin Lee, Ho Joong Kim, Jinsuk Lee

专题命中 其他VLM :vision-language model(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01794 2026-08-04 cs.CV cs.AI cs.CL 新提交 73%

Illuminating Visual Identity in Universal Multimodal Embeddings

揭示通用多模态嵌入中的视觉身份

Jiawei Cao, Junyi Feng, Jiashen Hua, Ziheng Huang, Bing Deng, Kaijie Wu, Chaochen Gu, Jieping Ye

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团)

专题命中 其他VLM :multimodal large language model(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 该研究针对通用多模态嵌入缺乏视觉身份判别能力的问题,提出视觉身份判别统一形式化,构建MVEB基准,设计身份感知采样的学习框架,提升了UMEs的身份判别能力。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00143 2026-06-23 cs.LG cs.CV 版本更新 73%

Is Oracle Pruning the True Oracle?

Oracle剪枝真的是真正的Oracle吗?

Sicheng Feng, Keda Tao, Huan Wang

机构 * Westlake University(西湖大学) Nankai University(南开大学) ENCODE Lab, Westlake University(西湖大学ENCODE实验室)

专题命中 其他VLM :MLLM(abstract,abstract_cn);分类 cs.CV、cs.LG

AI总结 本文通过大规模实验(37K模型)发现,对于中等规模以上的深度学习模型,Oracle剪枝选择的权重在重训练后性能与重训练前几乎无关,质疑了Oracle剪枝作为剪枝方法基础的有效性。

Comments TMLR, Webpage: https://fscdc.github.io/Oracle-Pruning-Sanity-Check/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16822 2026-04-22 cs.CV cs.AI 73%

ReefNet: A Large-Scale Dataset and Benchmark for Fine-Grained Coral Reef Recognition

ReefNet:一个大规模数据集和基准,用于细粒度珊瑚礁识别

Abdulwahab Felemban, Yahia Battach, Faizan Farooq Khan, Yuqian Fu, Xuhui Liu, Yesmeen M. Khattab, Yousef A. Radwan, Xiang Li, Fabio Marchese, Sara Beery, Burton H. Jones, Francesca Benzoni, Mohamed Elhoseiny

机构 * King Abdullah University of Science and Technology (KAUST)(国王阿卜杜勒·阿齐兹科技大学) Massachusetts Institute of Technology (MIT)(麻省理工学院)

专题命中 其他VLM :vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出ReefNet,一个大规模珊瑚礁图像数据集,用于细粒度识别。通过专家验证和过滤,构建了高置信度基准子集,揭示了多模态模型在生物多样性监测中的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25841 2026-03-30 cs.CV cs.AI 73%

GazeQwen: Lightweight Gaze-Conditioned LLM Modulation for Streaming Video Understanding

GazeQwen: 轻量级 gaze-条件 LLM 调制用于流视频理解

Trong Thang Pham, Hien Nguyen, Ngan Le

机构 * University of Arkansas(阿肯色大学) University of Houston(休斯顿大学)

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 GazeQwen 通过隐藏状态调制使开源 MLLM 获得 gaze 意识,采用紧凑的 gaze resampler 和可选 LoRA 调整,在 StreamGaze 基准上达到 63.9% 准确率,优于其他模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22492 2026-03-26 cs.CV cs.AI cs.MM 73%

Tiny Inference-Time Scaling with Latent Verifiers

微小推理时间缩放与潜在验证器

Davide Bucciarelli, Evelyn Turri, Lorenzo Baraldi, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Pisa(比萨大学)

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VHS验证器,直接在扩散变换器单步生成器的中间隐藏表示上操作,减少验证成本并提升性能,实现更高效的推理时间缩放。

Comments Findings of CVPR 2026 - Code at: https://aimagelab.github.io/VHS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07993 2026-02-10 cs.CV cs.AI 73%

MCIE: Multimodal LLM-Driven Complex Instruction Image Editing with Spatial Guidance

MCIE: 多模态大语言模型驱动的复杂指令图像编辑与空间引导

Xuehai Bai, Xiaoling Gu, Akide Liu, Hangjie Yuan, YiFan Zhang, Jack Ma

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 MCIE通过空间引导和背景一致性模块,提升复杂指令图像编辑的指令合规性,实现23.96%的性能提升。

Comments Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07104 2026-02-10 cs.CV cs.AI 73%

Extended to Reality: Prompt Injection in 3D Environments

扩展到现实:3D环境中的提示注入

Zhuoheng Li, Ying Chen

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 研究提出PI3D攻击,通过在3D环境中放置带文本的物理物体来注入提示,挑战多模态大语言模型的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18733 2026-01-27 cs.RO cs.AI cs.CV 73%

Advances and Innovations in the Multi-Agent Robotic System (MARS) Challenge

多智能体机器人系统(MARS)挑战的进展与创新

Li Kang, Heng Zhou, Xiufeng Song, Rui Li, Bruno N. Y. Chen, Ziye Wang, Ximeng Meng, Stone Tao, Yiran Qin, Xiaohong Liu, Ruimao Zhang, Lei Bai, Yilun Du, Hao Su, Philip Torr, Zhenfei Yin, Ruihao Gong, Yejun Zeng, Fengjun Zhong, Shenghao Jin, Jinyang Guo, Xianglong Liu, Xiaojun Jia, Tianqi Shan, Wenqi Ren, Simeng Qin, Jialing Yang, Xiaoyu Ma, Tianxing Chen, Zixuan Li, Zijian Cai, Yan Qin, Yusen Qin, Qiangyu Chen, Kaixuan Wang, Zhaoming Han, Yao Mu, Ping Luo, Yuanqi Yao, Haoming Song, Jan-Nico Zaech, Fabien Despinoy, Danda Pani Paudel, Luc Van Gool

机构 * SJTU(上海交通大学) Oxford(牛津大学) USTC(中国科学技术大学) Shanghai AI Lab(上海人工智能实验室) CMU(卡内基梅隆大学) HKU(香港大学) Tongji(同济大学) UC San Diego(南加州大学) CUHK-SZ(香港中文大学(深圳)) SYSU(华南理工大学) Harvard(哈佛大学)

专题命中 其他VLM :vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 MARS挑战通过多智能体具身规划与控制任务,推动多智能体协作AI系统的发展。

Comments MARS Challenge @ NeurIPS 2025 Workshop on Space in Vision, Language, and Embodied AI. Challenge page: https://mars-eai.github.io/MARS-Challenge-Webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06921 2025-12-09 cs.CV cs.AI cs.CL 73%

NeuroABench: A Multimodal Evaluation Benchmark for Neurosurgical Anatomy Identification

NeuroABench: 一种多模态评估基准,用于神经外科解剖识别

Ziyang Song, Zelin Zang, Xiaofan Ye, Boqiang Xu, Long Bai, Jinlin Wu, Hongliang Ren, Hongbin Liu, Jiebo Luo, Zhen Lei

机构 * Hong Kong Institute of Science and Innovation(香港科学与创新研究院) The University of Hong Kong-Shenzhen Hospital(香港大学深圳医院) Department of Electronic Engineering, The Chinese University of Hong Kong(香港中文大学电子工程系)

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 NeuroABench是首个用于评估神经外科领域解剖理解的多模态基准,通过实验揭示了MLLMs在解剖识别任务中的局限性,并展示了人类表现与模型之间的差距。

Comments Accepted by IEEE ICIA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07663 2025-10-23 cs.LG cs.AI 73%

Merge then Realign: Simple and Effective Modality-Incremental Continual Learning for Multimodal LLMs

Dingkun Zhang, Shuhan Qi, Xinyu Xiao, Kehai Chen, Xuan Wang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Guangdong Provincial Key Laboratory of Novel Security Intelligence Technologies(广东省新型安全智能技术重点实验室)

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI、cs.LG

Comments EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15877 2025-10-15 cs.CV cs.CL cs.LG 73%

Highlighting What Matters: Promptable Embeddings for Attribute-Focused Image Retrieval

Siting Li, Xiang Gao, Simon Shaolei Du

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.LG

Comments NeurIPS 2025; 27 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05538 2025-10-08 cs.CV cs.AI 73%

Seeing the Big Picture: Evaluating Multimodal LLMs' Ability to Interpret and Grade Handwritten Student Work

Owen Henkel, Bill Roberts, Doug Jaffe, Laurence Holt

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏