arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5058 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5058 篇

2507.04976 2025-07-08 cs.CV cs.CL 57%

Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models

Eunseop Yoon, Hee Suk Yoon, Mark A. Hasegawa-Johnson, Chang D. Yoo

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) University of Illinois at Urbana-Champaign (UIUC)(伊利诺伊大学厄巴纳-香槟分校)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04664 2025-07-08 cs.CV 57%

VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs

Tao Zhang, Shiqing Wei, Shihao Chen, Wenling Yu, Muying Luo, Shunping Ji

机构 * School of Remote Sensing and Information Engineering(遥感与信息工程学院) College of Oceanography and Space Informatics(海洋学与空间信息学院) School of Surveying and Geoinformation Engineering(测绘与地理信息工程学院)

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04635 2025-07-08 cs.CV 57%

MODA: MOdular Duplex Attention for Multimodal Perception, Cognition, and Emotion Understanding

Zhicheng Zhang, Wuyou Xia, Chenxi Zhao, Zhou Yan, Xiaoqiang Liu, Yongjie Zhu, Wenyu Qin, Pengfei Wan, Di Zhang, Jufeng Yang

机构 * VCIP \& TMCC \& DISSec, College of Computer Science, Nankai University Pengcheng Laboratory

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

Comments ICML 2025 (Spotlight, Top 2.6%)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04000 2025-07-08 cs.IR cs.AI 57%

Leveraging Multimodal Data and Side Users for Diffusion Cross-Domain Recommendation

Fan Zhang, Jinpeng Chen, Huan Li, Senzhang Wang, Yuan Cao, Kaimin Wei, JianXiang He, Feifei Kou, Jinqing Wang

机构 * School of Computer Science (National Pilot Software Engineering School), Beijing University of Posts and Telecommunications(北京邮电大学计算机学院(国家级试点软件工程学院)) The State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全国家重点实验室) Central South University(中南大学) National University of Singapore(新加坡国立大学) Jinan University(暨南大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03434 2025-07-08 cs.CV cs.MM 57%

Unlearning the Noisy Correspondence Makes CLIP More Robust

Haochen Han, Alex Jinpeng Wang, Peijun Ye, Fangming Liu

机构 * Peng Cheng Laboratory(鹏城实验室) Central South University(中南大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01938 2025-07-03 cs.CV 57%

CI-VID: A Coherent Interleaved Text-Video Dataset

Yiming Ju, Jijin Hu, Zhengxiong Luo, Haoge Deng, hanyu Zhao, Li Du, Chengwei Wu, Donglin Hao, Xinlong Wang, Tengfei Pan

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01492 2025-07-03 cs.CV 57%

AVC-DPO: Aligned Video Captioning via Direct Preference Optimization

Jiyang Tang, Hengyi Li, Yifan Du, Wayne Xin Zhao

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) College of Artificial Intelligence, Nankai University(南开大学人工智能学院) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01409 2025-07-03 cs.CV 57%

CaptionSmiths: Flexibly Controlling Language Pattern in Image Captioning

Kuniaki Saito, Donghyun Kim, Kwanyong Park, Atsushi Hashimoto, Yoshitaka Ushiku

机构 * University of Seoul(首尔大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments Accepted to ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01255 2025-07-03 cs.CV 57%

AIGVE-MACS: Unified Multi-Aspect Commenting and Scoring Model for AI-Generated Video Evaluation

Xiao Liu, Jiawei Zhang

机构 * IFM Lab, University of California, Davis(信息与媒体实验室,加州大学戴维斯分校)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments Working in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22663 2025-07-02 cs.CV 57%

Training Free Stylized Abstraction

Aimon Rahman, Kartik Narayan, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments Project Page: https://kartik-3004.github.io/TF-SA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05288 2025-07-02 cs.CV cs.CL 57%

Seeking and Updating with Live Visual Knowledge

Mingyang Fu, Yuyang Peng, Dongping Chen, Zetong Zhou, Benlin Liu, Yao Wan, Zhou Zhao, Philip S. Yu, Ranjay Krishna

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

Comments Preprint. Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11346 2025-07-01 cs.CV 57%

Seedream 3.0 Technical Report

Yu Gao, Lixue Gong, Qiushan Guo, Xiaoxia Hou, Zhichao Lai, Fanshi Li, Liang Li, Xiaochen Lian, Chao Liao, Liyang Liu, Wei Liu, Yichun Shi, Shiqi Sun, Yu Tian, Zhi Tian, Peng Wang, Rui Wang, Xuanda Wang, Xun Wang, Ye Wang, Guofeng Wu, Jie Wu, Xin Xia, Xuefeng Xiao, Zhonghua Zhai, Xinyu Zhang, Qi Zhang, Yuwei Zhang, Shijia Zhao, Jianchao Yang, Weilin Huang

机构 * ByteDance(字节跳动)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

Comments Seedream 3.0 Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21895 2025-06-30 cs.CV 57%

Exploring Task-Solving Paradigm for Generalized Cross-Domain Face Anti-Spoofing via Reinforcement Fine-Tuning

Fangling Jiang, Qi Li, Weining Wang, Gang Wang, Bing Liu, Zhenan Sun

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21272 2025-06-30 cs.GR cs.CV cs.MM 57%

FairyGen: Storied Cartoon Video from a Single Child-Drawn Character

Jiayi Zheng, Xiaodong Cun

机构 * GVC Lab, Great Bay University(Great Bay大学GVC实验室)

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV

Comments Project Page: https://jayleejia.github.io/FairyGen/ ; Code: https://github.com/GVCLab/FairyGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21393 2025-06-27 cs.AI 57%

TableMoE: Neuro-Symbolic Routing for Structured Expert Reasoning in Multimodal Table Understanding

Junwen Zhang, Pu Chen, Yin Zhang

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI

Comments 43 pages and 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21276 2025-06-27 cs.CV 57%

WordCon: Word-level Typography Control in Scene Text Rendering

Wenda Shi, Yiren Song, Zihan Rao, Dengming Zhang, Jiaming Liu, Xingxing Zou

机构 * The Hong Kong Polytechnic University(香港理工大学) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05090 2025-06-27 cs.LG stat.ML 57%

HyperINF: Unleashing the HyperPower of the Schulz's Method for Data Influence Estimation

Xinyu Zhou, Simin Fan, Martin Jaggi

机构 * Machine Learning and Optimization Lab, EPFL(机器学习与优化实验室,EPFL)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20449 2025-06-26 cs.CV 57%

Med-Art: Diffusion Transformer for 2D Medical Text-to-Image Generation

Changlu Guo, Anders Nymark Christensen, Morten Rieger Hannemose

机构 * Department of Applied Mathematics and Computer Science(应用数学与计算机科学系)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments The project is available at \url{https://medart-ai.github.io}

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10044 2025-06-25 cs.CV 57%

Aligning Anime Video Generation with Human Feedback

Bingwen Zhu, Yudong Jiang, Baohan Xu, Siqian Yang, Mingyu Yin, Yidi Wu, Huyang Sun, Zuxuan Wu

机构 * Fudan University(复旦大学) Bilibili Inc(哔哩哔哩公司)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments 10 pages, 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14136 2025-06-18 cs.CV 57%

Interpreting Biomedical VLMs on High-Imbalance Out-of-Distributions: An Insight into BiomedCLIP on Radiology

Nafiz Sadman, Farhana Zulkernine, Benjamin Kwan

机构 * School of Computing(计算学院) Department of Diagnostic Radiology(诊断放射科) Queen's University(皇后大学) Kingston Health Sciences Centre(金斯顿健康科学中心)

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV

Comments GitHub: https://github.com/Nafiz95/BioVLM_Eval_CXR

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00513 2025-06-17 cs.CV 57%

Inst3D-LMM: Instance-Aware 3D Scene Understanding with Multi-modal Instruction Tuning

Hanxun Yu, Wentong Li, Song Wang, Junbo Chen, Jianke Zhu

机构 * Zhejiang University(浙江大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

Comments CVPR2025, Code Link: https://github.com/hanxunyu/Inst3D-LMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11820 2025-06-16 cs.CV cs.CL 57%

Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation

Xintong Wang, Jingheng Pan, Yixiao Liu, Xiaohu Zhao, Chenyang Lyu, Minghao Wu, Chris Biemann, Longyue Wang, Linlong Xu, Weihua Luo, Kaifu Zhang

机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商务集团) Universität Hamburg, Department of Informatics(汉堡大学信息学院) Nanyang Technological University(南洋理工大学) Monash University(莫纳什大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02471 2025-06-16 cs.CV 57%

Ming-Lite-Uni: Advancements in Unified Architecture for Natural Multimodal Interaction

Inclusion AI, Biao Gong, Cheng Zou, Dandan Zheng, Hu Yu, Jingdong Chen, Jianxin Sun, Junbo Zhao, Jun Zhou, Kaixiang Ji, Lixiang Ru, Libin Wang, Qingpei Guo, Rui Liu, Weilong Chai, Xinyu Xiao, Ziyuan Huang

机构 * Inclusion AI Ant Group(Inclusion AI蚂蚁集团)

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV

Comments https://github.com/inclusionAI/Ming/tree/Ming-Lite-Omni-Preview/Ming-unify

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10639 2025-06-13 cs.CV 57%

GigaVideo-1: Advancing Video Generation via Automatic Feedback with 4 GPU-Hours Fine-Tuning

Xiaoyi Bao, Jindi Lv, Xiaofeng Wang, Zheng Zhu, Xinze Chen, YuKun Zhou, Jiancheng Lv, Xingang Wang, Guan Huang

机构 * GigaAI Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Computer Science, Sichuan University(四川大学计算机学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10575 2025-06-13 cs.CV 57%

Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning

Chun-Mei Feng, Kai Yu, Xinxing Xu, Salman Khan, Rick Siow Mong Goh, Wangmeng Zuo, Yong Liu

机构 * Institute of High Performance Computing (IHPC), Agency for Science, Technology and Research (A*STAR)(高性能计算研究所,科技研究局) University of Minnesota(明尼苏达大学) Microsoft Research Asia Singapore(微软亚洲研究院新加坡分部) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(Mohamed bin Zayed人工智能大学) Australian National University(澳大利亚国立大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Journal ref TPAMI-2024-04-1021

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17353 2025-06-13 cs.CL cs.CV cs.MM 57%

M-MRE: Extending the Mutual Reinforcement Effect to Multimodal Information Extraction

Chengguang Gan, Zhixi Cai, Yanbin Wei, Yunhao Liang, Shiwen Ni, Tatsunori Mori

机构 * Yokohama National University(Yokohama国立大学) Monash University(墨尔本大学) Southern University of Science and Technology(南方科技大学) Hong Kong University of Science and Technology(香港科学大学) University of Chinese Academy of Sciences(中国科学院大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10688 2025-06-13 cs.CV 57%

TDS-CLIP: Temporal Difference Side Network for Efficient VideoAction Recognition

Bin Wang, Wentong Li, Wenqian Wang, Mingliang Gao, Runmin Cong, Wei Zhang

机构 * School of Electrical and Electronic Engineering, Shandong University of Technology(山东理工大学电子与电气工程学院) School of Control Scienceand Engineering, Shandong University(山东大学控制科学与工程学院) School of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics(南京航空航天大学人工智能学院) Pillar of Information Systems Technology and Design, Singapore University of Technology and Design(新加坡科技设计大学信息系统技术与设计支柱)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08227 2025-06-11 cs.CV 57%

A Good CREPE needs more than just Sugar: Investigating Biases in Compositional Vision-Language Benchmarks

Vishaal Udandarao, Mehdi Cherti, Shyamgopal Karthik, Jenia Jitsev, Samuel Albanie, Matthias Bethge

机构 * University of Tübingen and Tübingen AI Center(图宾根大学和图宾根人工智能中心) Juelich Supercomputing Centre (JSC)(焦耳ich超算中心) University of Cambridge(剑桥大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08071 2025-06-11 cs.CV 57%

CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems

Aniket Rege, Zinnia Nie, Mahesh Ramesh, Unmesh Raskar, Zhuoran Yu, Aditya Kusupati, Yong Jae Lee, Ramya Korlakai Vinayak

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of Washington(华盛顿大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments 41 pages, 22 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07803 2025-06-10 cs.CV 57%

Image Reconstruction as a Tool for Feature Analysis

Eduard Allakhverdov, Dmitrii Tarasov, Elizaveta Goncharova, Andrey Kuznetsov

机构 * AIRI Moscow, Russia(莫斯科AIRI机构) MIPT Dolgoprudny, Russia(多尔戈普鲁德尼 MIPT)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments 23 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏