arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5030 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5030 篇

2511.18306 2025-11-25 cs.CL 82%

Table Comprehension in Building Codes using Vision Language Models and Domain-Specific Fine-Tuning

利用视觉语言模型和领域特定微调进行建筑规范中的表格理解

Mohammad Aqib, Mohd Hamza, Ying Hei Chui, Qipei Mei

专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract)

AI总结 本文研究了利用视觉语言模型和领域特定微调提取建筑规范中表格信息的方法,发现直接输入方法在准确性上优于间接输入方法,且微调后模型性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16743 2025-11-24 cs.CV cs.AI cs.LG 82%

SafeR-CLIP: Mitigating NSFW Content in Vision-Language Models While Preserving Pre-Trained Knowledge

SafeR-CLIP: 通过保留预训练知识来缓解视觉-语言模型中的不适宜内容

Adeel Yousaf, Joseph Fioresi, James Beetham, Amrit Singh Bedi, Mubarak Shah

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 SafeR-CLIP通过最小化干预策略,在保留预训练知识的同时提升视觉-语言模型的安全性,实现性能与安全性的平衡。

Comments AAAI 2026 (Main Technical Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13428 2025-11-24 cs.RO 82%

VLM-SFD: VLM-Assisted Siamese Flow Diffusion Framework for Dual-Arm Cooperative Manipulation

VLM-SFD:基于视觉语言模型的双臂协作操作Siamese流扩散框架

Jiaming Chen, Yiyu Jiang, Aoshen Huang, Yang Li, Wei Pan

机构 * Department of Computer Science, The University of Manchester(计算机科学系,曼彻斯特大学) School of Control Science and Engineering, Shandong University(控制科学与工程学院,山东大学)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract)

AI总结 VLM-SFD通过双编码器-解码器架构和视觉语言模型,提升双臂协作操作的模仿学习效率与泛化能力。

Comments Accepted by IEEE RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02584 2025-11-21 cs.CV cs.AI cs.CL cs.LG 82%

Efficient Architectures for High Resolution Vision-Language Models

高效高分辨率视觉-语言模型架构

Miguel Carvalho, Bruno Martins

机构 * INESC-ID and Instituto Superior Técnico, University of Lisbon(INESC-ID 和 里斯本大学技术学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 Pheye是一种高效处理高分辨率图像的视觉-语言模型架构,通过减少参数数量实现高效率和强性能,尤其在细粒度图像理解和场景文本处理任务中表现突出。

Comments Accepted at COLING 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12658 2025-11-11 cs.DC 82%

HydraInfer: Hybrid Disaggregated Scheduling for Multimodal Large Language Model Serving

Xianzhe Dong, Tongxuan Liu, Yuting Zeng, Liangyu Liu, Yang Liu, Siyu Wu, Yu Wu, Hailong Yang, Ke Zhang, Jing Li

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05855 2025-11-11 cs.RO 82%

Gentle Manipulation Policy Learning via Demonstrations from VLM Planned Atomic Skills

Jiayu Zhou, Qiwei Wu, Jian Li, Zhe Chen, Xiaogang Xiong, Renjing Xu

专题命中 VLM训练与架构 :VLM(title,abstract);visual language model(abstract)

Comments Accepted for the 40th Annual AAAI Conference on Artificial Intelligence (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02367 2025-11-05 cs.HC 82%

The Pervasive Blind Spot: Benchmarking VLM Inference Risks on Everyday Personal Videos

Shuning Zhang, Zhaoxin Li, Changxi Wen, Ying Ma, Simin Li, Gengrui Zhang, Ziyi Zhang, Yibo Meng, Hantao Zhao, Xin Yi, Hewu Li

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13145 2025-11-03 cs.SD 82%

UTI-LLM: A Personalized Articulatory-Speech Therapy Assistance System Based on Multimodal Large Language Model

Yudong Yang, Xiaokang Liu, Shaofeng zhao, Rongfeng Su, Nan Yan, Lan Wang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, China(深圳先进技术研究院,中国科学院,中国) Key Laboratory of Biomedical Imaging Science and System, Chinese Academy of Sciences, China(生物医学成像科学与系统重点实验室,中国科学院,中国)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25413 2025-10-30 cs.CL 82%

Seeing, Signing, and Saying: A Vision-Language Model-Assisted Pipeline for Sign Language Data Acquisition and Curation from Social Media

Shakib Yazdani, Yasser Hamidullah, Cristina España-Bonet, Josef van Genabith

机构 * German Research Center for Artificial Intelligence (DFKI GmbH)(德国人工智能研究中心(DFKI GmbH)) Saarland Informatics Campus(萨尔兰州信息技术校区) Barcelona Supercomputing Center (BSC-CNS)(巴塞罗那超级计算中心(BSC-CNS))

专题命中 VLM训练与架构 :vision-language model(title);vision language model(abstract);VLM(abstract)

Comments Accepted by RANLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14735 2025-09-19 cs.CL 82%

Decoupled Proxy Alignment: Mitigating Language Prior Conflict for Multimodal Alignment in MLLM

Chenkun Tan, Pengyu Wang, Shaojun Zhou, Botian Jiang, Zhaowei Li, Dong Zhang, Xinghao Wang, Yaqian Zhou, Xipeng Qiu

机构 * Fudan University(复旦大学)

专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract)

Comments Accepted by Findings of EMNLP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19639 2025-08-28 cs.MM 82%

FakeSV-VLM: Taming VLM for Detecting Fake Short-Video News via Progressive Mixture-Of-Experts Adapter

Junxi Wang, Yaxiong Wang, Lechao Cheng, Zhun Zhong

专题命中 VLM训练与架构 :VLM(title,abstract);vision language model(abstract)

Comments EMNLP2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17568 2025-08-26 cs.CV cs.AI cs.CE cs.LG cs.PL 82%

MetaGen: A DSL, Database, and Benchmark for VLM-Assisted Metamaterial Generation

Liane Makatura, Benjamin Jones, Siyuan Bian, Wojciech Matusik

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16762 2025-08-26 cs.CL cs.CY 82%

Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation

Arka Mukherjee, Shreya Ghosh

机构 * KIIT Deemed University(KIIT大学) Indian Institute of Technology (IIT) Bhubaneswar(印度理工学院(Bhubaneswar分校))

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract)

Comments Accepted at ASI @ ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11370 2025-08-21 cs.CL 82%

G-LLaVA: Solving Geometric Problem with Multi-Modal Large Language Model

Jiahui Gao, Renjie Pi, Jipeng Zhang, Jiacheng Ye, Wanjun Zhong, Yufei Wang, Lanqing Hong, Jianhua Han, Hang Xu, Zhenguo Li, Lingpeng Kong

机构 * Noah’s Ark Lab(诺亚 Ark 实验室) The University of Hong Kong(香港大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 VLM训练与架构 :LLaVA(title,abstract);multimodal large language model(abstract)

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11002 2025-08-13 cs.SD cs.MM eess.AS 82%

Dopamine Audiobook: A Training-free MLLM Agent for Emotional and Immersive Audiobook Generation

Yan Rong, Shan Yang, Chenxing Li, Dong Yu, Li Liu

专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07658 2025-08-12 cs.HC 82%

Through Their Eyes: User Perceptions on Sensitive Attribute Inference of Social Media Videos by Visual Language Models

Shuning Zhang, Gengrui Zhang, Yibo Meng, Ziyi Zhang, Hantao Zhao, Xin Yi, Hewu Li

专题命中 VLM训练与架构 :visual language model(title,abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04524 2025-07-08 cs.RO 82%

VLM-TDP: VLM-guided Trajectory-conditioned Diffusion Policy for Robust Long-Horizon Manipulation

Kefeng Huang, Tingguang Li, Yuzhen Liu, Zhe Zhang, Jiankun Wang, Lei Han

机构 * Tencent Robotics X(腾讯机器人实验室) Southern University of Science and Technology(南方科技大学)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18443 2025-07-03 cs.CL 82%

olmOCR: Unlocking Trillions of Tokens in PDFs with Vision Language Models

Jake Poznanski, Aman Rangapur, Jon Borchardt, Jason Dunkelberger, Regan Huff, Daniel Lin, Aman Rangapur, Christopher Wilhelm, Kyle Lo, Luca Soldaini

机构 * Allen Institute for AI(艾伦人工智能研究所)

专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12884 2025-07-01 cs.LG cs.AI cs.CV 82%

TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks

Yuanze Hu, Zhaoxin Fan, Xinyu Wang, Gen Li, Ye Qiu, Zhichao Yang, Wenjun Wu, Kejian Wu, Yifan Sun, Xiaotie Deng, Jin Dong

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(北京未来区块链与隐私计算先进创新中心) Beihang University(北京航空航天大学) Hangzhou International Innovation Institute(杭州国际创新研究院) Xreal Renmin University(中国人民大学) Peking University(北京大学) Beijing Academy of Blockchain and Edge Computing (BABEC)(北京区块链与边缘计算研究院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06506 2025-06-10 cs.CL 82%

Biases Propagate in Encoder-based Vision-Language Models: A Systematic Analysis From Intrinsic Measures to Zero-shot Retrieval Outcomes

Kshitish Ghate, Tessa Charlesworth, Mona Diab, Aylin Caliskan

机构 * Carnegie Mellon University(卡内基梅隆大学) Northwestern University(西北大学) University of Washington(华盛顿大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract)

Comments Accepted to ACL Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07164 2025-05-13 cs.MM 82%

EmoVLM-KD: Fusing Distilled Expertise with Vision-Language Models for Visual Emotion Analysis

SangEun Lee, Yubeen Lee, Eunil Park

专题命中 VLM训练与架构 :vision-language model(title,abstract);vision language model(abstract)

Comments Accepted at Workshop and Competition on Affective & Behavior Analysis in-the-wild (ABAW), CVPR 2025, 10 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13624 2025-04-21 eess.SP 82%

PV-VLM: A Multimodal Vision-Language Approach Incorporating Sky Images for Intra-Hour Photovoltaic Power Forecasting

Huapeng Lin, Miao Yu

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13119 2025-04-18 cs.HC 82%

Object-Driven Narrative in AR: A Scenario-Metaphor Framework with VLM Integration

Yusi Sun, Haoyan Guan, leith Kin Yep Chan, Yong Hong Kuo

专题命中 VLM训练与架构 :VLM(title,abstract);vision language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02765 2025-04-04 cs.RO 82%

Robot-Led Vision Language Model Wellbeing Assessment of Children

Nida Itrat Abbasi, Fethiye Irmak Dogan, Guy Laban, Joanna Anderson, Tamsin Ford, Peter B. Jones, Hatice Gunes

专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02816 2025-03-05 cs.HC 82%

"What If Smart Homes Could See Our Homes?": Exploring DIY Smart Home Building Experiences with VLM-Based Camera Sensors

Sojeong Yun, Youn-kyung Lim

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract)

Journal ref CHI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02748 2025-03-05 cs.RO 82%

Bridging VLM and KMP: Enabling Fine-grained robotic manipulation via Semantic Keypoints Representation

Junjie Zhu, Huayu Liu, Jin Wang, Bangrong Wen, Kaixiang Huang, Xiaofei Li, Haiyun Zhan, Guodong Lu

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15973 2025-02-11 cs.CV cs.AI cs.CL cs.LG 82%

Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement

Xiyao Wang, Jiuhai Chen, Zhaoyang Wang, Yuhang Zhou, Yiyang Zhou, Huaxiu Yao, Tianyi Zhou, Tom Goldstein, Parminder Bhatia, Furong Huang, Cao Xiao

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments NAACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15021 2025-01-28 cs.CL 82%

AKVQ-VL: Attention-Aware KV Cache Adaptive 2-Bit Quantization for Vision-Language Models

Zunhai Su, Wang Shen, Linge Li, Zhe Chen, Hanyu Wei, Huangqi Yu, Kehong Yuan

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08771 2024-12-13 cs.CV cs.AI cs.LG 82%

LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information

Ke Wang, Hong Xuan

专题命中 VLM训练与架构 :LLaVA(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02760 2024-12-05 cs.AI cs.CL cs.CV cs.LG 82%

Cosmos-LLaVA: Chatting with the Visual Cosmos-LLaVA: Görselle Sohbet Etmek

Ahmed Zeer, Eren Dogan, Yusuf Erdem, Elif Ince, Osama Shbib, M. Egemen Uzun, Atahan Uz, M. Kaan Yuce, H. Toprak Kesgin, M. Fatih Amasyali

专题命中 VLM训练与架构 :LLaVA(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments in Turkish language, 2024 8th International Artificial Intelligence and Data Processing Symposium (IDAP)

详情

展开后加载摘要…

URL PDF HTML 收藏