arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1566 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 1566 篇

2412.05892 2025-09-03 cs.CR cs.AI 57%

PBI-Attack: Prior-Guided Bimodal Interactive Black-Box Jailbreak Attack for Toxicity Maximization

Ruoxi Cheng, Yizhong Ding, Shuirong Cao, Ranjie Duan, Xiaoshuang Jia, Shaowei Yuan, Simeng Qin, Zhiqiang Wang, Xiaojun Jia

机构 * Alibaba Group(阿里巴巴集团) Beijing Electronic Science and Technology Institute(北京电子科技研究所) Nanjing University(南京大学) Renmin University of China(中国人民大学) Northeastern University(东北大学) BraneMatrix AI Nanyang Technological University(南洋理工大学)

专题命中 其他VLM :vision language model(abstract);分类 cs.AI

Comments Prior-Guided Bimodal Interactive Black-Box Jailbreak Attack for Toxicity Maximization

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19024 2025-08-27 cs.CV 57%

ProPy: Building Interactive Prompt Pyramids upon CLIP for Partially Relevant Video Retrieval

Yi Pan, Yujia Zhang, Michael Kampffmeyer, Xiaoguang Zhao

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Department of Physics and Technology, UiT The Arctic University of Norway(物理与技术系,UiT 北极大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted by EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17467 2025-08-26 cs.LG cs.PF 57%

MoE-Inference-Bench: Performance Evaluation of Mixture of Expert Large Language and Vision Models

Krishna Teja Chitty-Venkata, Sylvia Howland, Golara Azar, Daria Soboleva, Natalia Vassilieva, Siddhisanket Raskar, Murali Emani, Venkatram Vishwanath

机构 * Argonne National Laboratory(阿贡国家实验室) Cerebras(Cerebras公司) Pacific Northwest National Laboratory(太平洋西北国家实验室)

专题命中 其他VLM :vision language model(abstract);分类 cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16789 2025-08-26 cs.CV cs.CL 57%

Leveraging the Power of MLLMs for Gloss-Free Sign Language Translation

Jungeun Kim, Hyeongwoo Jeon, Jongseong Bae, Ha Young Kim

机构 * Department of Artificial Intelligence, Yonsei University(人工智能系,延世大学) Graduate School of Information, Yonsei University(信息研究生院,延世大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16158 2025-08-25 cs.CV 57%

RAGSR: Regional Attention Guided Diffusion for Image Super-Resolution

Haodong He, Yancheng Bai, Rui Lan, Xu Duan, Lei Sun, Xiangxiang Chu, Gui-Song Xia

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Amap, Alibaba Group(阿里巴巴集团阿里的)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13713 2025-08-20 cs.CV 57%

Hierarchical Vision-Language Retrieval of Educational Metaverse Content in Agriculture

Ali Abdari, Alex Falcon, Giuseppe Serra

机构 * University of Udine(乌迪大学) University of Naples Federico II(那不勒斯费德里科二世大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted for publication at the 23rd International Conference on Image Analysis and Processing (ICIAP 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22884 2025-08-20 cs.CV 57%

AutoComPose: Automatic Generation of Pose Transition Descriptions for Composed Pose Retrieval Using Multimodal LLMs

Yi-Ting Shen, Sungmin Eum, Doheon Lee, Rohit Shete, Chiao-Yi Wang, Heesung Kwon, Shuvra S. Bhattacharyya

机构 * University of Maryland, College Park(马里兰大学学院市分校) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12668 2025-08-19 cs.CV 57%

WP-CLIP: Leveraging CLIP to Predict Wölfflin's Principles in Visual Art

Abhijay Ghildyal, Li-Yun Wang, Feng Liu

机构 * Portland State University(波特兰州立大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments ICCV 2025 AI4VA workshop (oral), Code: https://github.com/abhijay9/wpclip

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12396 2025-08-19 cs.CV 57%

DeCoT: Decomposing Complex Instructions for Enhanced Text-to-Image Generation with Large Language Models

Xiaochuan Lin, Xiangyong Chen, Xuan Li, Yichen Su

机构 * Henan Polytechnic University(河南理工大学)

专题命中 其他VLM :MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12291 2025-08-19 cs.AI 57%

RadarQA: Multi-modal Quality Analysis of Weather Radar Forecasts

Xuming He, Zhiyuan You, Junchao Gong, Couhua Liu, Xiaoyu Yue, Peiqin Zhuang, Wenlong Zhang, Lei Bai

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ZheJiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学) Center for Earth System Modeling and Prediction of China Meteorological Administration(中国气象局地球系统模拟与预测中心)

专题命中 其他VLM :MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11801 2025-08-19 cs.CV cs.CL 57%

VideoAVE: A Multi-Attribute Video-to-Text Attribute Value Extraction Dataset and Benchmark Models

Ming Cheng, Tong Wu, Jiazhen Hu, Jiaying Gong, Hoda Eldardiry

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 其他VLM :vision language model(abstract);分类 cs.CV

Comments 5 pages, 2 figures, 5 tables, accepted in CIKM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08536 2025-08-18 cs.CV 57%

SenCLIP: Enhancing zero-shot land-use mapping for Sentinel-2 with ground-level prompting

Pallavi Jain, Dino Ienco, Roberto Interdonato, Tristan Berchoux, Diego Marcos

机构 * Mediterranean Agronomic Institute of Montpellier - CIHEAM-IAMM(地中海农业研究院-CIHEAM-IAMM) Inria(法国国家信息与自动化技术研究院) INRAE(法国国家农业研究咨询中心) Cirad(国际热带农业研究中心) UMR TETIS(TETIS联合研究单位) Univ. of Montpellier(蒙彼利埃大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted at WACV'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09858 2025-08-14 cs.CV 57%

HumanGenesis: Agent-Based Geometric and Generative Modeling for Synthetic Human Dynamics

Weiqi Li, Zehao Zhang, Liang Lin, Guangrun Wang

专题命中 其他VLM :MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08220 2025-08-12 cs.CV 57%

Learning User Preferences for Image Generation Model

Wenyi Mo, Ying Ba, Tianyu Zhang, Yalong Bai, Biye Li

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06342 2025-08-11 cs.CV cs.SI 57%

Street View Sociability: Interpretable Analysis of Urban Social Behavior Across 15 Cities

Kieran Elrod, Katherine Flanigan, Mario Bergés

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05661 2025-08-11 cs.IR cs.AI 57%

Zero-Shot Retrieval for Scalable Visual Search in a Two-Sided Marketplace

Andre Rusli, Shoma Ishimoto, Sho Akiyama, Aman Kumar Singh

机构 * Mercari, Inc.(Mercari公司)

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI

Comments 6 pages, KDD 2025 Workshop on Two-sided Marketplace Optimization: Search, Pricing, Matching & Growth (TSMO)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04998 2025-08-08 cs.CV 57%

Attribute Guidance With Inherent Pseudo-label For Occluded Person Re-identification

Rui Zhi, Zhen Yang, Haiyang Zhang

机构 * Beijing University of Post and Telecommunication(北京邮电大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments 8 pages, 2 supplement pages, 3 figures, ECAI2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04732 2025-08-08 cs.LG cs.GR 57%

LumiGen: An LVLM-Enhanced Iterative Framework for Fine-Grained Text-to-Image Generation

Xiaoqi Dong, Xiangyu Zhou, Nicholas Evans, Yujia Lin

机构 * Dali University(大理大学) Bandırma Onyedi Eylül University(班迪尔马第十七个九月大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15098 2025-08-07 cs.CV 57%

CLIP-AGIQA: Boosting the Performance of AI-Generated Image Quality Assessment with CLIP

Zhenchen Tang, Zichuan Wang, Bo Peng, Jing Dong

机构 * New Laboratory of Pattern Recognition, Institute of Automation, Chinese Academy of Sciences(模式识别新实验室,自动化研究所,中国科学院)

专题命中 其他VLM :visual language model(abstract);分类 cs.CV

Comments accepted by ICPR2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03562 2025-08-06 cs.CV cs.CL 57%

Beyond Meme Templates: Limitations of Visual Similarity Measures in Meme Matching

Muzhaffar Hazman, Susan McKeever, Josephine Griffith

机构 * School of Computer Science University of Galway(计算机科学学院 Galway大学) School of Computer Science Technological University Dublin(计算机科学学院 技术大学都柏林)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments Accepted for publication at IEEE International Conference on Image Processing Theory, Tools and Applications (IPTA) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03535 2025-08-06 cs.CV 57%

CoEmoGen: Towards Semantically-Coherent and Scalable Emotional Image Content Generation

Kaishen Yuan, Yuting Zhang, Shang Gao, Yijie Zhu, Wenshuo Chen, Yutao Yue

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00991 2025-08-06 cs.CV 57%

GOBench: Benchmarking Geometric Optics Generation and Understanding of MLLMs

Xiaorong Zhu, Ziheng Jia, Jiarui Wang, Xiangyu Zhao, Haodong Duan, Xiongkuo Min, Jia Wang, Zicheng Zhang, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 其他VLM :MLLM(abstract);分类 cs.CV

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06690 2025-08-05 cs.SD cs.AI cs.MM 57%

Benchmarking Sub-Genre Classification For Mainstage Dance Music

Hongzhi Shu, Xinglin Li, Hongyu Jiang, Minghao Fu, Xinyu Li

机构 * Johns Hopkins University(约翰霍普金斯大学) Southeast University(东南大学) National University of Defense Technology(国防科技大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

Comments WASPAA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01074 2025-08-05 cs.CV cs.CR 57%

Evading Data Provenance in Deep Neural Networks

Hongyu Zhu, Sichu Liang, Wenwen Wang, Zhuomeng Zhang, Fangqi Li, Shi-Lin Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Southeast University(东南大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments ICCV 2025 Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04981 2025-08-05 cs.CV 57%

AutoOcc: Automatic Open-Ended Semantic Occupancy Annotation via Vision-Language Guided Gaussian Splatting

Xiaoyu Zhou, Jingqi Wang, Yongtao Wang, Yufei Wei, Nan Dong, Ming-Hsuan Yang

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机技术研究院) Chongqing Changan Automobile Co., Ltd(重庆长安汽车有限公司) University of California, Merced(加州大学默塞德分校)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments ICCV 2025 Hightlight (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00391 2025-08-04 cs.CV eess.AS 57%

Cued-Agent: A Collaborative Multi-Agent System for Automatic Cued Speech Recognition

Guanjie Huang, Danny H. K. Tsang, Shan Yang, Guangzhi Lei, Li Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tencent AI Lab(腾讯AI实验室)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22075 2025-07-31 cs.LG 57%

Prototype-Guided Pseudo-Labeling with Neighborhood-Aware Consistency for Unsupervised Adaptation

Eman Ali, Chetan Arora, Muhammad Haris Khan

机构 * Mohamed Bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) Indian Institute of Technology Delhi(印度德里理工学院) Alexandria University(亚历山大大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21745 2025-07-29 cs.CV 57%

3DGen-Bench: Comprehensive Benchmark Suite for 3D Generative Models

Yuhan Zhang, Mengchen Zhang, Tong Wu, Tengfei Wang, Gordon Wetzstein, Dahua Lin, Ziwei Liu

机构 * Fudan University(复旦大学) Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Stanford University(斯坦福大学) The Chinese University of Hong Kong(香港中文大学) S-Lab, Nanyang Technological University(南洋理工大学S实验室)

专题命中 其他VLM :MLLM(abstract);分类 cs.CV

Comments Page: https://zyh482.github.io/3DGen-Bench/ ; Code: https://github.com/3DTopia/3DGen-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15680 2025-07-24 cs.CV 57%

Visual-Language Model Knowledge Distillation Method for Image Quality Assessment

Yongkang Hou, Jiarun Song

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22139 2025-07-23 cs.CV 57%

Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs

Shaojie Zhang, Jiahui Yang, Jianqin Yin, Zhenbo Luo, Jian Luan

机构 * MiLM Plus, Xiaomi Inc.(小米公司)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments Accepted at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏