arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1565 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 1565 篇

2509.02349 2025-09-05 cs.SD cs.AI cs.LG 62%

AudioCodecBench: A Comprehensive Benchmark for Audio Codec Evaluation

Lu Wang, Hao Chen, Siyu Wu, Zhiyue Wu, Hao Zhou, Chengfeng Zhang, Ting Wang, Haodi Zhang

机构 * Lu Wang(卢王) Hao Chen(何晨) Siyu Wu(武士) Zhiyue Wu(吴致岳) Hao Zhou(周浩) Chengfeng Zhang(张成峰) Ting Wang(王婷) Haodi Zhang(张浩迪)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12722 2025-09-05 cs.CV cs.AI cs.CR 62%

Defending LVLMs Against Vision Attacks through Partial-Perception Supervision

Qi Zhou, Tianlin Li, Qing Guo, Dongxia Wang, Yun Lin, Yang Liu, Jin Song Dong

机构 * College of Control Science and Engineering, Zhejiang University, China(控制科学与工程学院,浙江大学,中国) Huzhou Institute of Industrial Control Technology, China(湖州工业控制技术研究所,中国) School of Computer Science and Engineering, Nanyang Technological University, Singapore(计算机科学与工程学院,南洋理工大学,新加坡) School of Computer Science, Shanghai Jiao Tong University, China(计算机科学学院,上海交通大学,中国) School of Computing, National University of Singapore, Singapore(计算学院,新加坡国立大学,新加坡) Research, Singapore(研究,新加坡)

专题命中 其他VLM :vision language model(abstract);分类 cs.CV、cs.AI

Comments Accepted to ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19608 2025-09-04 cs.AI cs.LG 62%

ChordPrompt: Orchestrating Cross-Modal Prompt Synergy for Multi-Domain Incremental Learning in CLIP

Zhiyuan Wang, Bokui Chen

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院,清华大学,中国)

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI、cs.LG

Comments Accepted by the European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases (ECML-PKDD 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09284 2025-08-27 cs.RO cs.AI cs.CV 62%

UAD: Unsupervised Affordance Distillation for Generalization in Robotic Manipulation

Yihe Tang, Wenlong Huang, Yingke Wang, Chengshu Li, Roy Yuan, Ruohan Zhang, Jiajun Wu, Li Fei-Fei

机构 * Stanford University(斯坦福大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15297 2025-08-22 cs.CV cs.AI 62%

DesignCLIP: Multimodal Learning with CLIP for Design Patent Understanding

Zhu Wang, Homaira Huda Shomee, Sathya N. Ravi, Sourav Medya

机构 * Department of Computer Science, University of Illinois Chicago(计算机科学系,伊利诺伊大学芝加哥分校)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

Comments Accepted by EMNLP 2025. 22 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20469 2025-08-15 cs.CV cs.AI 62%

CCL-LGS: Contrastive Codebook Learning for 3D Language Gaussian Splatting

Lei Tian, Xiaomin Li, Liqian Ma, Hao Yin, Zirui Zheng, Hefei Huang, Taiqing Li, Huchuan Lu, Xu Jia

机构 * Dalian University of Technology(大连理工大学) ZMO AI Inc.(ZMO人工智能公司)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09966 2025-08-14 cs.CV cs.AI 62%

January Food Benchmark (JFB): A Public Benchmark Dataset and Evaluation Suite for Multimodal Food Analysis

Amir Hosseinian, Ashkan Dehghani Zahedani, Umer Mansoor, Noosheen Hashemi, Mark Woodward

机构 * January AI

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12436 2025-08-12 cs.CV cs.AI 62%

Sparsity Outperforms Low-Rank Projections in Few-Shot Adaptation

Nairouz Mrabah, Nicolas Richet, Ismail Ben Ayed, Éric Granger

机构 * LIVIA ILLS Department of Systems Engineering, ÉTS Montreal(系统工程系,蒙特利尔ÉTS) ÉTS Montreal(蒙特利尔ÉTS)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

Comments ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08035 2025-08-12 cs.CV cs.AI 62%

LVBench: An Extreme Long Video Understanding Benchmark

Weihan Wang, Zehai He, Wenyi Hong, Yean Cheng, Xiaohan Zhang, Ji Qi, Xiaotao Gu, Shiyu Huang, Bin Xu, Yuxiao Dong, Ming Ding, Jie Tang

机构 * Zhipu AI(智谱AI) Tsinghua University(清华大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06072 2025-08-11 cs.CV cs.AI 62%

Can Large Models Fool the Eye? A New Turing Test for Biological Animation

Zijian Chen, Lirong Deng, Zhengyu Chen, Kaiwei Zhang, Qi Jia, Yuan Tian, Yucheng Zhu, Guangtao Zhai

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments 24 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18688 2025-08-06 cs.CV cs.AI 62%

Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation

Faraz Waseem, Muhammad Shahzad

机构 * University Of Reading(阅读大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments 35 pages, 18 figures, Manuscript submitted to ACM

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10342 2025-08-05 cs.CV cs.AI 62%

UrbanSense:A Framework for Quantitative Analysis of Urban Streetscapes leveraging Vision Large Language Models

Jun Yin, Jing Zhong, Peilin Li, Ruolin Pan, Pengyu Zeng, Miao Zhang, Shuai Lu

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07739 2025-08-05 cs.CV cs.AI 62%

ArchiLense: A Framework for Quantitative Analysis of Architectural Styles Based on Vision Large Language Models

Jing Zhong, Jun Yin, Peilin Li, Pengyu Zeng, Miao Zang, Ran Luo, Shuai Lu

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22896 2025-08-01 cs.HC cs.AI cs.CV cs.RO 62%

iLearnRobot: An Interactive Learning-Based Multi-Modal Robot with Continuous Improvement

Kohou Wang, ZhaoXiang Liu, Lin Bai, Kun Fan, Xiang Liu, Huan Hu, Kai Wang, Shiguo Lian

机构 * Unicom Data Intelligence(中国联通数据智能研究所) Data Science & Artificial Intelligence Research Institute(数据科学与人工智能研究院) China United Network Communications Group Corporation Limited(中国联合网络通信集团有限公司)

专题命中 其他VLM :MLLM(abstract);分类 cs.CV、cs.AI

Comments 17 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14200 2025-07-31 cs.CV cs.AI 62%

Enhancing Multimodal In-Context Learning for Image Classification through Coreset Optimization

Huiyi Chen, Jiawei Peng, Kaihua Tang, Xin Geng, Xu Yang

机构 * Southeast University(东南大学) Huawei Singapore Research Center(华为新加坡研究中心)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19398 2025-07-28 cs.CV cs.AI 62%

CXR-CML: Improved zero-shot classification of long-tailed multi-label diseases in Chest X-Rays

Rajesh Madhipati, Sheethal Bhat, Lukas Buess, Andreas Maier

机构 * Friedrich-Alexander University Erlangen-Nuremberg(弗里德里希-亚历山大大学埃尔朗根-纽伦堡)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18929 2025-07-28 cs.CV cs.AI 62%

MGHFT: Multi-Granularity Hierarchical Fusion Transformer for Cross-Modal Sticker Emotion Recognition

Jian Chen, Yuxuan Hu, Haifeng Lu, Wei Wang, Min Yang, Chengming Li, Xiping Hu

机构 * Shenzhen MSU-BIT University(深圳MSU-BIT大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments Accepted by ACMMM2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08510 2025-07-25 cs.CV cs.LG 62%

External Knowledge Injection for CLIP-Based Class-Incremental Learning

Da-Wei Zhou, Kai-Wen Li, Jingyi Ning, Han-Jia Ye, Lijun Zhang, De-Chuan Zhan

机构 * School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

Comments Accepted to ICCV 2025. Code is available at: https://github.com/LAMDA-CL/ICCV25-ENGINE

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15379 2025-07-11 cs.IR cs.AI cs.CV 62%

Diffusion Augmented Retrieval: A Training-Free Approach to Interactive Text-to-Image Retrieval

Zijun Long, Kangheng Liang, Gerardo Aragon-Camarasa, Richard Mccreadie, Paul Henderson

机构 * Hunan University(湖南大学) University of Glasgow(格拉斯哥大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07148 2025-07-11 cs.CV cs.LG 62%

Explainable Artificial Intelligence in Biomedical Image Analysis: A Comprehensive Survey

Getamesay Haile Dagnaw, Yanming Zhu, Muhammad Hassan Maqsood, Wencheng Yang, Xingshuai Dong, Xuefei Yin, Alan Wee-Chung Liew

机构 * Griffith University(格里菲斯大学) University of Southern Queensland(南部昆士兰大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04769 2025-07-08 cs.CV cs.AI 62%

From Imitation to Innovation: The Emergence of AI Unique Artistic Styles and the Challenge of Copyright Protection

Zexi Jia, Chuanwei Huang, Yeshuang Zhu, Hongyan Fei, Ying Deng, Zhiqiang Yuan, Jiapei Zhang, Jinchao Zhang, Jie Zhou

机构 * WeChat AI, Tencent Inc(腾讯公司)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09721 2025-07-08 cs.LG cs.CV 62%

Finetuning CLIP to Reason about Pairwise Differences

Dylan Sam, Devin Willmott, Joao D. Semedo, J. Zico Kolter

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03275 2025-07-08 cs.CV cs.LG 62%

ConceptMix++: Leveling the Playing Field in Text-to-Image Benchmarking via Iterative Prompt Optimization

Haosheng Gan, Berk Tinaz, Mohammad Shahab Sepehri, Zalan Fabian, Mahdi Soltanolkotabi

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

Comments An earlier version appeared in the CVPR 2025 Workshop on Generative Models for Computer Vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.24016 2025-07-01 cs.CL cs.AI cs.CV 62%

EXPERT: An Explainable Image Captioning Evaluation Metric with Structured Explanations

Hyunjong Kim, Sangyeop Kim, Jongheon Jeong, Yeongjae Cho, Sungzoon Cho

机构 * Seoul National University(首尔国立大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

Comments Accepted at ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23639 2025-07-01 cs.CV cs.AI 62%

Unified Multimodal Understanding via Byte-Pair Visual Encoding

Wanpeng Zhang, Yicheng Feng, Hao Luo, Yijiang Li, Zihao Yue, Sipeng Zheng, Zongqing Lu

机构 * Peking University(北京大学) UC San Diego(加州大学圣地亚哥分校) Renmin University of China(中国人民大学) BeingBeyond

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21144 2025-06-27 cs.LG cs.CV 62%

Personalized Federated Learning via Dual-Prompt Optimization and Cross Fusion

Yuguang Zhang, Kuangpu Guo, Zhihe Lu, Yunbo Wang, Jian Liang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Hamad Bin Khalifa University(哈马德·本·卡西姆大学) Central South University(中南大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15724 2025-06-23 cs.LG cs.AI cs.CL 62%

MadaKV: Adaptive Modality-Perception KV Cache Eviction for Efficient Multimodal Long-Context Inference

Kunxi Li, Zhonghua Jiang, Zhouzhou Shen, Zhaode Wang, Chengfei Lv, Shengyu Zhang, Fan Wu, Fei Wu

机构 * Zhejiang University(浙江大学) Southeast University(东南大学) Alibaba(阿里巴巴) Shanghai Jiao Tong University(上海交通大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03147 2025-06-23 cs.CV cs.AI cs.CL 62%

UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation

Bin Lin, Zongjian Li, Xinhua Cheng, Yuwei Niu, Yang Ye, Xianyi He, Shenghai Yuan, Wangbo Yu, Shaodong Wang, Yunyang Ge, Yatian Pang, Li Yuan

机构 * Peking University(北京大学) Shenzhen Graduate School(深圳研究生院) Peng Cheng Laboratory(鹏城实验室) Rabbitpre AI

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14797 2025-06-19 cs.LG cs.AI 62%

Bound by semanticity: universal laws governing the generalization-identification tradeoff

Marco Nurisso, Jesseba Fernando, Raj Deshpande, Alan Perotti, Raja Marjieh, Steven M. Frankland, Richard L. Lewis, Taylor W. Webb, Declan Campbell, Francesco Vaccarino, Jonathan D. Cohen, Giovanni Petri

机构 * Dipartimento di Scienze Matematiche, Politecnico di Torino(都灵理工大学数学科学系) CENTAI Institute(CENTAI研究院) Network Science Institute, Northeastern University(东北大学网络科学研究所) Institute for Experiential AI, Northeastern University(东北大学体验人工智能研究所) NP Lab, Network Science Institute, Northeastern University London(东北大学伦敦网络科学研究所NP实验室) Department of Psychology, Princeton University(普林斯顿大学心理学系) Program in Cognitive Science, Dartmouth College(达特茅斯学院认知科学项目) Department of Psychology, University of Michigan(密歇根大学心理学系) Microsoft Research(微软研究院) Princeton Neuroscience Institute(普林斯顿神经科学研究所) Department of Physics, Northeastern University(东北大学物理系)

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11906 2025-06-18 cs.CV cs.AI 62%

PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension

Kun Ouyang, Yuanxin Liu, Shicheng Li, Yi Liu, Hao Zhou, Fandong Meng, Jie Zhou, Xu Sun

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) WeChat AI, Tencent Inc., China(微信AI,腾讯公司,中国)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments This is the camera-ready version for ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏