arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5058 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5058 篇

2502.11494 2025-06-10 cs.CL cs.CV 57%

Stop Looking for Important Tokens in Multimodal Language Models: Duplication Matters More

Zichen Wen, Yifeng Gao, Shaobo Wang, Junyuan Zhang, Qintong Zhang, Weijia Li, Conghui He, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Sun Yat-sen University(中山大学) Peking University(北京大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03604 2025-06-10 cs.CL cs.CV 57%

Modality-Specialized Synergizers for Interleaved Vision-Language Generalists

Zhiyang Xu, Minqian Liu, Ying Shen, Joy Rimchala, Jiaxin Zhang, Qifan Wang, Yu Cheng, Lifu Huang

机构 * Virginia Tech(弗吉尼亚理工大学) Intuit AI Research(Intuit AI研究院) Meta AI The Chinese University of Hong Kong(香港中文大学) University of California, Davis(加州大学戴维斯分校)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments 8 Pages, interleaved instruction tuning, parameter-efficient tuning, image understanding, image generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05083 2025-06-09 cs.CV 57%

SeedEdit 3.0: Fast and High-Quality Generative Image Editing

Peng Wang, Yichun Shi, Xiaochen Lian, Zhonghua Zhai, Xin Xia, Xuefeng Xiao, Weilin Huang, Jianchao Yang

机构 * ByteDance(字节跳动)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

Comments Website: https://seed.bytedance.com/tech/seededit

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05689 2025-06-09 cs.CV 57%

Pts3D-LLM: Studying the Impact of Token Structure for 3D Scene Understanding With Large Language Models

Hugues Thomas, Chen Chen, Jian Zhang

机构 * Apple(苹果公司)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

Comments Main paper and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05401 2025-06-09 cs.CR cs.CV 57%

Robust Anti-Backdoor Instruction Tuning in LVLMs

Yuan Xun, Siyuan Liang, Xiaojun Jia, Xinwei Liu, Xiaochun Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Nanyang Technological University(南洋理工大学) Sun Yat-sen University-Shenzhen(中山大学深圳校区)

专题命中 VLM训练与架构 :visual language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08503 2025-06-09 cs.AI 57%

Revisiting 3D LLM Benchmarks: Are We Really Testing 3D Capabilities?

Jiahe Jin, Yanheng He, Mingyan Yang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.AI

Comments Accepted to ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03990 2025-06-05 cs.CL cs.CV 57%

DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding

Hongzhi Zhang, Jingyuan Zhang, Xingguang Ji, Qi Wang, Fuzheng Zhang

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15358 2025-06-05 cs.CL cs.CV 57%

SemEval-2025 Task 1: AdMIRe -- Advancing Multimodal Idiomaticity Representation

Thomas Pickard, Aline Villavicencio, Maggie Mi, Wei He, Dylan Phelps, Marco Idiart

机构 * University of Sheffield, UK(谢菲尔德大学) University of Exeter, UK(埃克塞特大学) Federal University of Rio Grande do Sul, Brazil(里约格朗德杜斯尔大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments Author accepted version; SemEval-2025 proceedings to appear at ACL 2025. This version corrects a typo in the results table

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02781 2025-06-04 cs.CV 57%

FreeScene: Mixed Graph Diffusion for 3D Scene Synthesis from Free Prompts

Tongyuan Bai, Wangyuanfan Bai, Dong Chen, Tieru Wu, Manyi Li, Rui Ma

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) School of Software, Shandong University(山东大学软件学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(知识驱动人机智能工程研究中心,教育部,中国)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01801 2025-06-03 cs.CV 57%

OmniV2V: Versatile Video Generation and Editing via Dynamic Content Manipulation

Sen Liang, Zhentao Yu, Zhengguang Zhou, Teng Hu, Hongmei Wang, Yi Chen, Qin Lin, Yuan Zhou, Xin Li, Qinglin Lu, Zhibo Chen

机构 * University of Science and Technology of China(中国科学技术大学) Tencent Hunyuan(腾讯文言)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23661 2025-06-03 cs.CV 57%

OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation

Size Wu, Zhonghua Wu, Zerui Gong, Qingyi Tao, Sheng Jin, Qinyue Li, Wei Li, Chen Change Loy

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) SenseTime Research(商汤科技研究院) SenseTime Research and Tetras.AI(商汤研究与Tetras.AI)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00415 2025-06-03 cs.CY cs.AI 57%

Wide Reflective Equilibrium in LLM Alignment: Bridging Moral Epistemology and AI Safety

Matthew Brophy

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

Comments 24 pages excluding references, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03169 2025-06-02 cs.CV 57%

REJEPA: A Novel Joint-Embedding Predictive Architecture for Efficient Remote Sensing Image Retrieval

Shabnam Choudhury, Yash Salunkhe, Sarthak Mehrotra, Biplab Banerjee

机构 * Indian Institute of Technology Bombay(印度理工学院孟买学院)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11867 2025-06-02 cs.LG 57%

Targeted Unlearning with Single Layer Unlearning Gradient

Zikui Cai, Yaoteng Tan, M. Salman Asif

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG

Comments Accepted to ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23380 2025-05-30 cs.CV 57%

UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning

Weijia Mao, Zhenheng Yang, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(1 显示实验室,新加坡国立大学) ByteDance(2 字节跳动)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21494 2025-05-28 cs.CV 57%

Adversarial Attacks against Closed-Source MLLMs via Feature Optimal Alignment

Xiaojun Jia, Sensen Gao, Simeng Qin, Tianyu Pang, Chao Du, Yihao Huang, Xinfeng Li, Yiming Li, Bo Li, Yang Liu

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) MBZUAI, United Arab Emirates(马克斯·普朗克人工智能研究所,阿拉伯联合酋长国) Sea AI Lab, Singapore(海思人工智能实验室,新加坡) University of Illinois Urbana-Champaign, USA(伊利诺伊大学厄巴纳-香槟分校,美国)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21382 2025-05-28 cs.LG 57%

DeCAF: Decentralized Consensus-And-Factorization for Low-Rank Adaptation of Foundation Models

Nastaran Saadati, Zhanhong Jiang, Joshua R. Waite, Shreyan Ganguly, Aditya Balu, Chinmay Hegde, Soumik Sarkar

机构 * Iowa State University(爱荷华州立大学) New York University(纽约大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21146 2025-05-28 cs.GR cs.CV 57%

IKMo: Image-Keyframed Motion Generation with Trajectory-Pose Conditioned Motion Diffusion Model

Yang Zhao, Yan Zhang, Xubo Yang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12635 2025-05-28 cs.CV 57%

Corrupted but Not Broken: Understanding and Mitigating the Negative Impacts of Corrupted Data in Visual Instruction Tuning

Yunhao Gou, Hansi Yang, Zhili Liu, Kai Chen, Yihan Zeng, Lanqing Hong, Zhenguo Li, Qun Liu, Bo Han, James T. Kwok, Yu Zhang

机构 * Southern University of Science and Technology(南方科技大学) The Hong Kong University of Science and Technology(香港科技大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Hong Kong Baptist University(香港 Baptist 大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19895 2025-05-27 cs.CV 57%

Underwater Diffusion Attention Network with Contrastive Language-Image Joint Learning for Underwater Image Enhancement

Afrah Shaahid, Muzammil Behzad

机构 * King Fahd University of Petroleum and Minerals(国王法赫德石油与矿物大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19694 2025-05-27 cs.CV 57%

Knowledge-Aligned Counterfactual-Enhancement Diffusion Perception for Unsupervised Cross-Domain Visual Emotion Recognition

Wen Yin, Yong Wang, Guiduo Duan, Dongyang Zhang, Xin Hu, Yuan-Fang Li, Tao He

机构 * The Laboratory of Intelligent Collaborative Computing of UESTC(UESTC智能协同计算实验室) Ubiquitous Intelligence and Trusted Services Key Laboratory of Sichuan Province(四川省 ubiquitous intelligence and trusted services 重点实验室) Faculty of Information Technology, Monash University(墨尔本大学信息技术学院)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

Comments Accepted at CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18730 2025-05-27 cs.CV 57%

Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation

Wenchao Zhang, Jiahe Tian, Runze He, Jizhong Han, Jiao Dai, Miaomiao Feng, Wei Mi, Xiaodan Zhang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(信息工程研究所,中国科学院)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

Comments Code: https://github.com/smile365317/ABP

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05645 2025-05-27 cs.CV cs.MM 57%

OneDiff: A Generalist Model for Image Difference Captioning

Erdong Hu, Longteng Guo, Tongtian Yue, Zijia Zhao, Shuning Xue, Jing Liu

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18039 2025-05-26 cs.CV 57%

Clip4Retrofit: Enabling Real-Time Image Labeling on Edge Devices via Cross-Architecture CLIP Distillation

Li Zhong, Ahmed Ghazal, Jun-Jun Wan, Frederik Zilly, Patrick Mackens, Joachim E. Vollrath, Bogdan Sorin Coseriu

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11945 2025-05-23 cs.CV 57%

Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning

Bonan li, Zicheng Zhang, Songhua Liu, Weihao Yu, Xinchao Wang

机构 * UCAS(中国科学技术大学) NUS(新加坡国立大学)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14505 2025-05-21 cs.CL cs.AI 57%

ModRWKV: Transformer Multimodality in Linear Time

Jiale Kang, Ziyin Yue, Qingyu Yin, Jiang Rui, Weile Li, Zening Lu, Zhouran Ji

机构 * RWKVOS Zhejiang University(浙江大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13281 2025-05-20 cs.CV 57%

Computer Vision Models Show Human-Like Sensitivity to Geometric and Topological Concepts

Zekun Wang, Sashank Varma

机构 * School of Interactive Computing(交互计算学院) School of Psychology(心理学学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments 10 pages, 4 figures, CosSci 2025

Journal ref Cognitive Science Society 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15270 2025-05-20 cs.CV 57%

FIOVA: A Multi-Annotator Benchmark for Human-Aligned Video Captioning

Shiyu Hu, Xuchen Li, Xuzhao Li, Jing Zhang, Yipei Wang, Xin Zhao, Kang Hao Cheong

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11183 2025-05-19 stat.ML cs.CL cs.LG 57%

On Next-Token Prediction in LLMs: How End Goals Determine the Consistency of Decoding Algorithms

Jacob Trauger, Ambuj Tewari

机构 * Department of Statistics University of Michigan(统计学系 密歇根大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08106 2025-05-14 cs.CL cs.AI 57%

Are LLMs complicated ethical dilemma analyzers?

Jiashen, Du, Jesse Yao, Allen Liu, Zhekai Zhang

机构 * Department of Computer Science, University of California, Berkeley(加州大学伯克利分校计算机科学系)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

Comments CS194-280 Advanced LLM Agents project. Project page: https://github.com/ALT-JS/ethicaLLM

详情

展开后加载摘要…

URL PDF HTML 收藏