arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5048 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5048 篇

2507.06210 2025-07-17 cs.CV cs.CL 70%

CultureCLIP: Empowering CLIP with Cultural Awareness through Synthetic Images and Contextualized Captions

Yuchen Huang, Zhiyuan Fan, Zhitao He, Sandeep Polisetty, Wenyan Li, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港理工大学) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) University of Copenhagen(哥本哈根大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments 25 pages, COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10302 2025-07-15 cs.CV 70%

DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs

Jiahe Zhao, Rongkun Zheng, Yi Wang, Helin Wang, Hengshuang Zhao

机构 * University of Chinese Academy of Sciences(中国科学院大学) The University of Hong Kong(香港大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07135 2025-07-11 cs.LG 70%

FACap: A Large-scale Fashion Dataset for Fine-grained Composed Image Retrieval

François Gardères, Shizhe Chen, Camille-Sovanneary Gauthier, Jean Ponce

机构 * Inria, \'Ecole normale sup\'erieure, CNRS, PSL Research University Courant Institute of Mathematical Sciences Center for Data Science, New York University

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03542 2025-07-10 cs.CV 70%

Beyond Accuracy: Metrics that Uncover What Makes a 'Good' Visual Descriptor

Ethan Lin, Linxi Zhao, Atharva Sehgal, Jennifer J. Sun

机构 * Cornell University(康奈尔大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments VisCon @ CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05601 2025-07-09 cs.CV 70%

Rethinking Layered Graphic Design Generation with a Top-Down Approach

Jingye Chen, Zhaowen Wang, Nanxuan Zhao, Li Zhang, Difan Liu, Jimei Yang, Qifeng Chen

机构 * HKUST(香港科技大学) Adobe Research(Adobe研究院) Runway

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05321 2025-07-09 cs.CY cs.AI 70%

AGACCI : Affiliated Grading Agents for Criteria-Centric Interface in Educational Coding Contexts

Kwangsuk Park, Jiwoong Yang

机构 * AA LAB, MODULABS(AA实验室,MODULABS) Aiffel, MODULABS(Aiffel,MODULABS) Department of Statistics, Inha university(统计系,Inha大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.AI

Comments Accepted at ICML 2025 Workshop on Multi-Agent Systems in the Era of Foundation Models: Opportunities, Challenges and Futures (MAS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05165 2025-07-08 cs.CV 70%

Differential Attention for Multimodal Crisis Event Analysis

Nusrat Munia, Junfeng Zhu, Olfa Nasraoui, Abdullah-Al-Zubaer Imran

机构 * University of Kentucky(肯塔基大学) Kentucky Geological Survey(肯塔基地质调查局) University of Louisville(路易斯维尔大学)

专题命中 VLM训练与架构 :vision language model(abstract);LLaVA(abstract);分类 cs.CV

Comments Presented at CVPRw 2025, MMFM3

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03875 2025-07-08 cs.CL cs.AI 70%

Demystifying ChatGPT: How It Masters Genre Recognition

Subham Raj, Sriparna Saha, Brijraj Singh, Niranjan Pedanekar

机构 * Department of Computer Science and Engineering, Indian Institute of Technology Patna(计算机科学与工程系,印度理工学院帕纳布分校) Sony Research India(索尼印度研究)

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01728 2025-07-03 eess.SP cs.LG 70%

Token Communication in the Era of Large Models: An Information Bottleneck-Based Approach

Hao Wei, Wanli Ni, Wen Wang, Wenjun Xu, Dusit Niyato, Ping Zhang

机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications(网络与交换技术国家重点实验室,北京邮电大学) Department of Mathematics and Theories, Peng Cheng Laboratory(数学与理论部,鹏城实验室) Department of Electronic Engineering, Tsinghua University(电子工程系,清华大学) Pervasive Communications Center, Purple Mountain Laboratories(感知计算中心,紫金山实验室) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22756 2025-07-01 cs.CV cs.RO 70%

RoboPearls: Editable Video Simulation for Robot Manipulation

Tao Tang, Likui Zhang, Youpeng Wen, Kaidong Zhang, Jia-Wang Bian, xia zhou, Tianyi Yan, Kun Zhan, Peng Jia, Hefeng Wu, Liang Lin, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Sun Yat-sen University(中山大学) Bytedance Seed(字节跳动种子) Li Auto Inc.(李自动公司)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20795 2025-06-27 cs.CV cs.HC cs.RO 70%

How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?

Stephanie Käs, Anton Burenko, Louis Markert, Onur Alp Culha, Dennis Mack, Timm Linder, Bastian Leibe

机构 * Chair for Computer Vision, RWTH Aachen University(计算机视觉教研室,亚琛RWTH大学) Robert Bosch GmbH, Corporate Research & Bosch Center for AI(博世公司,博世企业研究院及博世人工智能中心)

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18943 2025-06-25 cs.CV 70%

From Pixels and Words to Waves: A Unified Framework for Spectral Dictionary vLLMs

Andrew Kiruluta, Priscilla Burity

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07491 2025-06-24 cs.CV 70%

Kimi-VL Technical Report

Kimi Team, Angang Du, Bohong Yin, Bowei Xing, Bowen Qu, Bowen Wang, Cheng Chen, Chenlin Zhang, Chenzhuang Du, Chu Wei, Congcong Wang, Dehao Zhang, Dikang Du, Dongliang Wang, Enming Yuan, Enzhe Lu, Fang Li, Flood Sung, Guangda Wei, Guokun Lai, Han Zhu, Hao Ding, Hao Hu, Hao Yang, Hao Zhang, Haoning Wu, Haotian Yao, Haoyu Lu, Heng Wang, Hongcheng Gao, Huabin Zheng, Jiaming Li, Jianlin Su, Jianzhou Wang, Jiaqi Deng, Jiezhong Qiu, Jin Xie, Jinhong Wang, Jingyuan Liu, Junjie Yan, Kun Ouyang, Liang Chen, Lin Sui, Longhui Yu, Mengfan Dong, Mengnan Dong, Nuo Xu, Pengyu Cheng, Qizheng Gu, Runjie Zhou, Shaowei Liu, Sihan Cao, Tao Yu, Tianhui Song, Tongtong Bai, Wei Song, Weiran He, Weixiao Huang, Weixin Xu, Xiaokun Yuan, Xingcheng Yao, Xingzhe Wu, Xinhao Li, Xinxing Zu, Xinyu Zhou, Xinyuan Wang, Y. Charles, Yan Zhong, Yang Li, Yangyang Hu, Yanru Chen, Yejie Wang, Yibo Liu, Yibo Miao, Yidao Qin, Yimin Chen, Yiping Bao, Yiqin Wang, Yongsheng Kang, Yuanxin Liu, Yuhao Dong, Yulun Du, Yuxin Wu, Yuzhi Wang, Yuzi Yan, Zaida Zhou, Zhaowei Li, Zhejun Jiang, Zheng Zhang, Zhilin Yang, Zhiqi Huang, Zihao Huang, Zijia Zhao, Ziwei Chen, Zongyu Lin

机构 * Kimi Team(Kimi 团队)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments Updated Kimi-VL-A3B-Thinking-2506 information

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11672 2025-06-16 cs.CV 70%

Dynamic Mixture of Curriculum LoRA Experts for Continual Multimodal Instruction Tuning

Chendi Ge, Xin Wang, Zeyang Zhang, Hong Chen, Jiapei Fan, Longtao Huang, Hui Xue, Wenwu Zhu

机构 * Department of Computer Science and Technology, BNRist, Tsinghua University, Beijing, China(计算机科学与技术系,BNRist,清华大学,北京,中国) Alibaba Group, Hangzhou, China(阿里巴巴集团,杭州,中国)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted by ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10182 2025-06-13 cs.CV 70%

Improving Personalized Search with Regularized Low-Rank Parameter Updates

Fiona Ryan, Josef Sivic, Fabian Caba Heilbron, Judy Hoffman, James M. Rehg, Bryan Russell

机构 * Georgia Tech(佐治亚理工学院) Adobe Research(Adobe研究) CIIRC CTU(查理大学CIIRC) UIUC(伊利诺伊大学厄巴纳-香槟分校)

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV

Comments CVPR 2025 Highlight. Code: http://github.com/adobe-research/polar-vl

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07631 2025-06-10 cs.CL cs.CV 70%

Unblocking Fine-Grained Evaluation of Detailed Captions: An Explaining AutoRater and Critic-and-Revise Pipeline

Brian Gordon, Yonatan Bitton, Andreea Marzoca, Yasumasa Onoe, Xiao Wang, Daniel Cohen-Or, Idan Szpektor

机构 * Tel Aviv University(特拉维夫大学) Google Research(谷歌研究)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06084 2025-06-09 cs.CV 70%

WisWheat: A Three-Tiered Vision-Language Dataset for Wheat Management

Bowen Yuan, Selena Song, Javier Fernandez, Yadan Luo, Mahsa Baktashmotlagh, Zijian Wang

机构 * The University of Queensland(昆士兰大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05318 2025-06-09 cs.CV 70%

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs

Haoyuan Li, Yanpeng Zhou, Yufei Gao, Tao Tang, Jianhua Han, Yujie Yuan, Dave Zhenyu Chen, Jiawang Bian, Hang Xu, Xiaodan Liang

机构 * Shenzhen campus of Sun Yat-sen University(中山大学深圳校区) Huawei Noah’s Ark Lab(华为诺亚实验室) MBZUAI Peng Cheng Laboratory(鹏城实验室) Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05450 2025-06-09 cs.CV 70%

Degradation-Aware Image Enhancement via Vision-Language Classification

Jie Cai, Kangning Yang, Jiaming Ding, Lan Fu, Ling Ouyang, Jiang Li, Jinglin Shen, Zibo Meng

机构 * OPPO AI Center(OPPO人工智能中心)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04158 2025-06-05 cs.CV 70%

Image Editing As Programs with Diffusion Models

Yujia Hu, Songhua Liu, Zhenxiong Tan, Xingyi Yang, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02041 2025-06-04 cs.CL cs.AI 70%

Enhancing Multimodal Continual Instruction Tuning with BranchLoRA

Duzhen Zhang, Yong Ren, Zhong-Zhi Li, Yahan Yu, Jiahua Dong, Chenxing Li, Zhilong Ji, Jinfeng Bai

机构 * Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Kyoto University(京都大学) Tencent AI Lab(腾讯AI实验室) Tomorrow Advancing Life(明天生命科技)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

Comments Accepted by ACL2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00993 2025-06-03 cs.CV 70%

FlexSelect: Flexible Token Selection for Efficient Long Video Understanding

Yunzhu Zhang, Yu Lu, Tianyi Wang, Fengyun Rao, Yi Yang, Linchao Zhu

机构 * The College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) WeChat Vision, Tencent Inc(腾讯公司微信视觉团队)

专题命中 VLM训练与架构 :LLaVA(abstract);InternVL(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24517 2025-06-02 cs.CV 70%

un$^2$CLIP: Improving CLIP's Visual Detail Capturing Ability via Inverting unCLIP

Yinqi Li, Jiahe Zhao, Hong Chang, Ruibing Hou, Shiguang Shan, Xilin Chen

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 VLM训练与架构 :VLM(abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19036 2025-06-02 cs.CV 70%

RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs

Hongliang Li, Jiaxin Zhang, Wenhui Liao, Dezhi Peng, Kai Ding, Lianwen Jin

机构 * South China University of Technology(华南理工大学) Intsig Information Co., Ltd.(Intsig信息有限公司) INTSIG-SCUT Joint Lab on Document Analysis and Recognition(INTSIG-SCUT文档分析与识别联合实验室)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09786 2025-06-02 cs.CV 70%

Graph-guided Cross-composition Feature Disentanglement for Compositional Zero-shot Learning

Yuxia Geng, Runkai Zhu, Jiaoyan Chen, Jintai Chen, Xiang Chen, Zhuo Chen, Shuofei Qiao, Yuxiang Wang, Xiaoliang Xu, Sheng-Jun Huang

机构 * PowerChina Huadong Engineering Corporation Limited(国家电力投资集团华东工程公司) Hangzhou Dianzi University(杭州电子科技大学) The University of Manchester(曼彻斯特大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Zhejiang University(浙江大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments Accepted in ACL 2025 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.21075 2025-06-02 cs.CV cs.CL 70%

Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis

Chaoyou Fu, Yuhan Dai, Yongdong Luo, Lei Li, Shuhuai Ren, Renrui Zhang, Zihan Wang, Chenyu Zhou, Yunhang Shen, Mengdan Zhang, Peixian Chen, Yanwei Li, Shaohui Lin, Sirui Zhao, Ke Li, Tong Xu, Xiawu Zheng, Enhong Chen, Caifeng Shan, Ran He, Xing Sun

机构 * State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) School of Intelligence Science and Technology(智能科学与技术学院) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) XMU(厦门大学) HKU(香港大学) PKU(北京大学) CUHK(香港中文大学) ECNU(华东师范大学) CASIA(中国科学院自动化研究所)

专题命中 VLM训练与架构 :LLaVA(abstract);InternVL(abstract);分类 cs.CV

Comments Project Page: https://video-mme.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23504 2025-05-30 cs.CV 70%

VAU-R1: Advancing Video Anomaly Understanding via Reinforcement Fine-Tuning

Liyun Zhu, Qixiang Chen, Xi Shen, Xiaodong Cun

机构 * Australian National University(澳大利亚国立大学) GVC Lab, Great Bay University(大湾大学GVC实验室) Intellindust AI Lab(Intellindust AI实验室)

专题命中 VLM训练与架构 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21594 2025-05-29 cs.RO cs.AI cs.DC 70%

Fast and Cost-effective Speculative Edge-Cloud Decoding with Early Exits

Yeshwanth Venkatesha, Souvik Kundu, Priyadarshini Panda

机构 * Yale University(耶鲁大学) Intel Labs(英特尔实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21079 2025-05-28 cs.CV 70%

Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts

Yue Zhang, Yingzhao Jian, Hehe Fan, Yi Yang, Roger Zimmermann

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05804 2025-05-27 cs.CV 70%

Describe Anything in Medical Images

Xi Xiao, Yunbei Zhang, Thanh-Huy Nguyen, Ba-Thinh Lam, Janet Wang, Lin Zhao, Jihun Hamm, Tianyang Wang, Xingjian Li, Xiao Wang, Hao Xu, Tianming Liu, Min Xu

专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏