arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5058 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5058 篇

2509.26462 2025-10-01 cs.AI cs.CV cs.LG 67%

Zero-Shot Decentralized Federated Learning

Alessio Masano, Matteo Pennisi, Federica Proietto Salanitri, Concetto Spampinato, Giovanni Bellitto

机构 * University of Catania(卡塔尼亚大学) PeRCeiVe Lab, University of Catania(PeRCeiVe实验室,卡塔尼亚大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted at International Joint Conference on Neural Networks (IJCNN) 2025. Code available at https://github.com/perceivelab/ZeroDFL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09372 2025-09-23 cs.RO 67%

VLA-Adapter: An Effective Paradigm for Tiny-Scale Vision-Language-Action Model

Yihao Wang, Pengxiang Ding, Lingxiao Li, Can Cui, Zirui Ge, Xinyang Tong, Wenxuan Song, Han Zhao, Wei Zhao, Pengxu Hou, Siteng Huang, Yifan Tang, Wenhui Wang, Ru Zhang, Jianyi Liu, Donglin Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Westlake University(西湖大学) Zhejiang University(浙江大学) OpenHelix Team(OpenHelix团队) State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract)

Comments 28 pages; Project page: https://vla-adapter.github.io/; Github: https://github.com/OpenHelix-Team/VLA-Adapter; HuggingFace: https://huggingface.co/VLA-Adapter

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15775 2025-09-22 cs.SD eess.AS 67%

EmoQ: Speech Emotion Recognition via Speech-Aware Q-Former and Large Language Model

Yiqing Yang, Man-Wai Mak

机构 * Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(电子与电气工程系,香港理工大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract)

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13731 2025-09-18 cs.RO 67%

Reinforcement Learning for Robotic Insertion of Flexible Cables in Industrial Settings

Jeongwoo Park, Seabin Lee, Changmin Park, Wonjong Lee, Changjoo Nam

机构 * Dept. of Electronic Engineering, Sogang University(电子工程系,成均馆大学) Dept. of Artificial Intelligence, Sogang University(人工智能系,成均馆大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11620 2025-09-16 cs.CL cs.CY 67%

AesBiasBench: Evaluating Bias and Alignment in Multimodal Language Models for Personalized Image Aesthetic Assessment

Kun Li, Lai-Man Po, Hongzheng Yang, Xuyuan Xu, Kangcheng Liu, Yuzhi Zhao

专题命中 VLM训练与架构 :InternVL(abstract);multimodal large language model(abstract)

Comments Accepted by EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10765 2025-09-16 eess.IV 67%

Language-based Color ISP Tuning

Owen Mayer, Shohei Noguchi, Alexander Berestov, Jiro Takatori

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract)

Comments Accepted to Color and Imaging Conference (CIC) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07436 2025-09-10 eess.SP 67%

SA-OOSC: A Multimodal LLM-Distilled Semantic Communication Framework for Enhanced Coding Efficiency with Scenario Understanding

Feifan Zhang, Yuyang Du, Yifan Xiang, Xiaoyan Liu, Soung Chang Liew

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00351 2025-09-03 cs.CV cs.AI cs.LG 67%

Target-Oriented Single Domain Generalization

Marzi Heidari, Yuhong Guo

机构 * School of Computer Science, Carleton University(计算机科学学院,卡尔顿大学)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08869 2025-09-03 cs.LG cs.AI cs.CV 67%

Harnessing Vision Models for Time Series Analysis: A Survey

Jingchao Ni, Ziming Zhao, ChengAo Shen, Hanghang Tong, Dongjin Song, Wei Cheng, Dongsheng Luo, Haifeng Chen

机构 * University of Houston(德克萨斯大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Connecticut(康涅狄格大学) NEC Laboratories America(日本 NEC 美国实验室) Florida International University(佛罗里达国际大学)

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12458 2025-08-19 cs.CL 67%

M3PO: Multimodal-Model-Guided Preference Optimization for Visual Instruction Following

Ruirui Gao, Emily Johnson, Bowen Tan, Yanfei Qian

机构 * University of Massachusetts, Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11737 2025-08-19 cs.CV cs.AI cs.CL cs.LG 67%

Ovis2.5 Technical Report

Shiyin Lu, Yang Li, Yu Xia, Yuwei Hu, Shanshan Zhao, Yanqing Ma, Zhichao Wei, Yinglun Li, Lunhao Duan, Jianshan Zhao, Yuxuan Han, Haijun Li, Wanying Chen, Junke Tang, Chengkun Hou, Zhixing Du, Tianli Zhou, Wenjie Zhang, Huping Ding, Jiahe Li, Wen Li, Gui Hu, Yiliang Gu, Siran Yang, Jiamang Wang, Hailong Sun, Yibo Wang, Hui Sun, Jinlong Huang, Yuping He, Shengze Shi, Weihong Zhang, Guodong Zheng, Junpeng Jiang, Sensen Gao, Yi-Feng Wu, Sijia Chen, Yuhui Chen, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11673 2025-08-19 cs.LG cs.AI cs.CV cs.MM 67%

Contrastive Regularization over LoRA for Multimodal Biomedical Image Incremental Learning

Haojie Zhang, Yixiong Liang, Hulin Kuang, Lihui Cen, Zhe Qu, Yigang Cen, Min Zeng, Shichao Kan

机构 * School of Computer Science and Engineering, Central South University(计算机科学与工程学院,中南大学) School of Automation, Central South University(自动化学院,中南大学) School of Computer Science and Technology, Beijing Jiaotong University(计算机科学与技术学院,北京交通大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 10 pages, 3 figures, submitted to ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10116 2025-08-15 cs.IR 67%

Bridging Modality Gaps in e-Commerce Products via Vision-Language Alignment

Yipeng Zhang, Hongju Yu, Aritra Mandal, Canran Xu, Qunzhi Zhou, Zhe Wu

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01805 2025-08-05 cs.NI 67%

M3LLM: Model Context Protocol-aided Mixture of Vision Experts For Multimodal LLMs in Networks

Yongjie Zeng, Hongyang Du

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16466 2025-07-29 cs.HC 67%

SceneLoom: Communicating Data with Scene Context

Lin Gao, Leixian Shen, Yuheng Zhao, Jiexiang Lan, Huamin Qu, Siming Chen

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22827 2025-07-11 cs.RO 67%

Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation

André Schakkal, Ben Zandonati, Zhutian Yang, Navid Azizan

机构 * Massachusetts Institute of Technology(麻省理工学院) École Polytechnique Fédérale de Lausanne(瑞士联邦理工学院)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract)

Comments Accepted at the RSS 2025 Workshop on Robot Planning in the Era of Foundation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05799 2025-07-09 cs.CL 67%

Bridging Perception and Language: A Systematic Benchmark for LVLMs' Understanding of Amodal Completion Reports

Amane Watahiki, Tomoki Doi, Taiga Shinozaki, Satoshi Nishida, Takuya Niikawa, Katsunori Miyahara, Hitomi Yanaka

机构 * The University of Tokyo(东京大学) Keio University(庆应大学) NICT(国家信息与通信技术研究所) Osaka University(大阪大学) Hokkaido University(北海道大学) CiNET(信息网络研究中心) Kobe University(Kobe 大学)

专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract)

Comments To appear in the Proceedings of the 47th Annual Meeting of the Cognitive Science Society (COGSCI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04789 2025-07-08 cs.RO 67%

Training-free Generation of Temporally Consistent Rewards from VLMs

Yinuo Zhao, Jiale Yuan, Zhiyuan Xu, Xiaoshuai Hao, Xinyi Zhang, Kun Wu, Zhengping Che, Chi Harold Liu, Jian Tang

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16385 2025-06-23 cs.CV cs.AI cs.LG 67%

CLIP-MG: Guiding Semantic Attention with Skeletal Pose Features and RGB Data for Micro-Gesture Recognition on the iMiGUE Dataset

Santosh Patapati, Trisanth Srinivasan, Amith Adiraju

机构 * Cyrion Labs, Texas, United States(Cyrion实验室,德克萨斯州,美国)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14786 2025-06-19 cs.LG cs.AI cs.CV 67%

PIPE: Physics-Informed Position Encoding for Alignment of Satellite Images and Time Series

Haobo Li, Eunseo Jung, Zixin Chen, Zhaowei Wang, Yueya Wang, Huamin Qu, Alexis Kai Hon Lau

机构 * Department of Computer Science & Engineering(香港理工大学计算机科学与工程系) Division of Environment & Sustainability(香港理工大学环境与可持续发展学院)

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14763 2025-06-18 cs.RO 67%

RobotSmith: Generative Robotic Tool Design for Acquisition of Complex Manipulation Skills

Chunru Lin, Haotian Yuan, Yian Wang, Xiaowen Qiu, Tsun-Hsuan Wang, Minghao Guo, Bohan Wang, Yashraj Narang, Dieter Fox, Chuang Gan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Massachusetts Institute of Technology(麻省理工学院) National University of Singapore(新加坡国立大学) NVIDIA(英伟达) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13187 2025-06-17 cs.LG cs.AI cs.CL cs.CV 67%

Dynamic Context-oriented Decomposition for Task-aware Low-rank Adaptation with Less Forgetting and Faster Convergence

Yibo Yang, Sihao Liu, Chuan Rao, Bang An, Tiancheng Shen, Philip H. S. Torr, Ming-Hsuan Yang, Bernard Ghanem

机构 * King Abdullah University of Science and Technology, Saudi Arabia(卡布尔大学) University of California, Merced, USA(加州大学梅尔德分校) University of Oxford, U.K.(牛津大学)

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08990 2025-06-11 cs.CV cs.AI cs.LG 67%

Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models

Chenyu Lian, Hong-Yu Zhou, Dongyun Liang, Jing Qin, Liansheng Wang

机构 * School of Informatics, Xiamen University(厦门大学信息学院) Center for Smart Health, School of Nursing, The Hong Kong Polytechnic University(香港理工大学护理学院智能健康中心) Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) Department of Radiology, Zhongshan Hospital (Xiamen), Fudan University(复旦大学中山医院放射科) National Institute for Data Science in Health and Medicine(医学与数据科学国家研究院) Department of Computer Science, School of Informatics, Xiamen University(厦门大学信息学院计算机科学系)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments TMI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07509 2025-06-10 cs.RO 67%

Taking Flight with Dialogue: Enabling Natural Language Control for PX4-based Drone Agent

Shoon Kit Lim, Melissa Jia Ying Chong, Jing Huey Khor, Ting Yang Ling

机构 * University of Southampton Malaysia(英国南安普顿大学马来西亚分校) Connected Intelligence Research Group(连接智能研究组) Sustainable Electronic Technologies(可持续电子技术)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract)

Comments Source code available at: https://github.com/limshoonkit/ros2-agent-ws

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04929 2025-06-10 cs.CL 67%

ConECT Dataset: Overcoming Data Scarcity in Context-Aware E-Commerce MT

Mikołaj Pokrywka, Wojciech Kusa, Mieszko Rutkowski, Mikołaj Koszowski

机构 * Machine Learning Research Allegro.com(Allegro公司机器学习研究部) NASK

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract)

Comments Accepted at ACL 2025 (The 63rd Annual Meeting of the Association for Computational Linguistics)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00814 2025-06-09 cs.CL 67%

GuessBench: Sensemaking Multimodal Creativity in the Wild

Zifeng Zhu, Shangbin Feng, Herun Wan, Ningnan Wang, Minnan Luo, Yulia Tsvetkov

机构 * Xi’an Jiaotong University(西安交通大学) University of Washington(华盛顿大学)

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17709 2025-06-06 cs.CV cs.AI cs.CL cs.LG cs.MM 67%

Contrastive Visual Data Augmentation

Yu Zhou, Bingxuan Li, Mohan Tang, Xiaomeng Jin, Te-Lin Wu, Kuan-Hao Huang, Heng Ji, Kai-Wei Chang, Nanyun Peng

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG

Journal ref ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11784 2025-06-05 cs.AI cs.CV cs.LG 67%

Data-Juicer Sandbox: A Feedback-Driven Suite for Multimodal Data-Model Co-development

Daoyuan Chen, Haibin Wang, Yilun Huang, Ce Ge, Yaliang Li, Bolin Ding, Jingren Zhou

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted by ICML 2025 (Spotlight). 33 pages, 16 tables, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20937 2025-05-28 cs.CL 67%

On VLMs for Diverse Tasks in Multimodal Meme Classification

Deepesh Gavit, Debajyoti Mazumder, Samiran Das, Jasabanta Patro

机构 * Peng Wang and Shuai Bai and Sinan Tan and Shijie Wang and Zhihao Fan and Jinze Bai and Keqin Chen and Xuejing Liu and Jialin Wang and Wenbin Ge and Yang Fan and Kai Dang and Mengfei Du and Xuancheng Ren and Rui Men and Dayiheng Liu and Chang Zhou and Jingren Zhou and Junyang Lin(研究人员)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract)

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02539 2025-05-27 cs.CV cs.AI cs.CL cs.LG 67%

Parrot: Multilingual Visual Instruction Tuning

Hai-Long Sun, Da-Wei Zhou, Yang Li, Shiyin Lu, Chao Yi, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang, De-Chuan Zhan, Han-Jia Ye

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted to ICML 2025. Code and dataset are available at: https://github.com/AIDC-AI/Parrot

详情

展开后加载摘要…

URL PDF HTML 收藏