arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5048 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5048 篇

2601.07877 2026-01-14 cs.LG cs.AI 73%

E^2-LLM: Bridging Neural Signals and Interpretable Affective Analysis

E²-LLM:连接神经信号与可解释的情感分析

Fei Ma, Han Lin, Yifan Xie, Hongwei Ren, Xiaoyu Shen, Wenbo Ding, Qi Tian

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室) Zhejiang University(浙江大学) Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学) Eastern Institute of Technology(东方技术研究所) Huawei(华为)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI、cs.LG

AI总结 E²-LLM通过整合预训练EEG编码器与Qwen-based LLM,实现了可解释的情绪分析,展示了模型扩展在情感识别和可解释性上的优势。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07359 2026-01-13 cs.CV cs.AI 73%

Seeing Right but Saying Wrong: Inter- and Intra-Layer Refinement in MLLMs without Training

看到正确却说错:在MLLMs中无需训练的跨层和内层细化

Shezheng Song, Shasha Li, Jie Yu

专题命中 VLM训练与架构 :LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 DualPD通过双视角解码细化策略,无需额外训练提升多模态大语言模型的视觉理解准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05851 2026-01-12 cs.CL cs.AI cs.CV 73%

Router-Suggest: Dynamic Routing for Multimodal Auto-Completion in Visually-Grounded Dialogs

Router-Suggest: 动态路由用于视觉 grounded 对话中的多模态自动补全

Sandeep Mishra, Devichand Budagam, Anubhab Mandal, Bishal Santra, Pawan Goyal, Manish Gupta

机构 * IIT Kharagpur(印度IIT卡拉格浦大学) Microsoft(微软公司)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 Router-Suggest 通过动态路由选择文本模型和 VLMs,提升多模态对话中的自动补全效率和用户满意度。

Comments Accepted to EACL 2026 Industry Track, 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03666 2026-01-12 cs.CL cs.AI cs.CV 73%

e5-omni: Explicit Cross-modal Alignment for Omni-modal Embeddings

e5-omni: 显式跨模态对齐用于多模态嵌入

Haonan Chen, Sicheng Gao, Radu Timofte, Tetsuya Sakai, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) University of Würzburg(乌尔姆大学) Waseda University(早稻田大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 e5-omni通过显式对齐方法改进多模态嵌入,解决相似性尺度不一致、负样本效果下降和跨模态统计不匹配问题。

Comments https://huggingface.co/Haon-Chen/e5-omni-7B

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03460 2026-01-08 cs.CV cs.AI 73%

FROST-Drive: Scalable and Efficient End-to-End Driving with a Frozen Vision Encoder

FROST-Drive: 可扩展且高效的端到端驾驶方法,采用冻结的视觉编码器

Zeyu Dong, Yimin Zhu, Yu Wu, Yu Sun

机构 * Stony Brook University(石溪大学) Rutgers University(罗格斯大学) Sunrise Technology Inc.(Sunrise技术公司)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 FROST-Drive通过冻结预训练视觉编码器,结合适配器和解码器,实现高效端到端驾驶,优于全微调方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09040 2026-01-06 cs.CV cs.AI cs.CL 73%

Autoregressive Semantic Visual Reconstruction Helps VLMs Understand Better

自回归语义视觉重建有助于VLMs更好地理解

Dianyi Wang, Wei Song, Yikun Wang, Siyuan Wang, Kaicheng Yu, Zhongyu Wei, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) AutoLab, Westlake University(西湖大学AutoLab) Zhejiang University(浙江大学) Shanghai AI Lab(上海人工智能实验室) University of Southern California(美国南加州大学)

专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 自回归语义视觉重建通过提升多模态理解能力,改进了VLMs对视觉信息的把握

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23028 2025-12-30 cs.CV cs.AI cs.SE 73%

An Architecture-Led Hybrid Report on Body Language Detection Project

以架构为导向的混合报告:身体语言检测项目

Thomson Tong, Diba Darooneh

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本报告分析了两种视觉-语言模型的架构特性,并探讨了其在视频到制品管道中的应用及系统限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00654 2025-12-30 cs.CV cs.CL cs.LG 73%

ICONS: Influence Consensus for Vision-Language Data Selection

ICONS: 视觉-语言数据选择中的影响共识

Xindi Wu, Mengzhou Xia, Rulin Shao, Zhiwei Deng, Pang Wei Koh, Olga Russakovsky

机构 * Princeton University(普林斯顿大学) University of Washington(华盛顿大学) Google DeepMind(谷歌DeepMind) Allen Institute for AI(人工智能研究院)

专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV、cs.LG

AI总结 ICONS通过影响共识方法高效选择视觉-语言数据,保持高性能并支持多任务泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20675 2025-12-25 cs.LG cs.AI 73%

Revisiting the Learning Objectives of Vision-Language Reward Models

重新审视视觉-语言奖励模型的学习目标

Simon Roy, Samuel Barbeau, Giovanni Beltrame, Christian Desrosiers, Nicolas Thome

机构 * Polytechnique Montréal(蒙特利尔理工学院) École de Technologie Supérieure(高级技术学院) Sorbonne Université(索邦大学)

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.AI、cs.LG

AI总结 本文通过统一框架评估了基于VLM的奖励模型,发现简单三元组损失在性能上优于现有方法,表明改进可能源于数据和架构差异。

Comments Published as an extended abstract at World Modeling Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09172 2025-12-18 cs.CV cs.AI 73%

Prompt-Based Continual Compositional Zero-Shot Learning

基于提示的持续组成零样本学习

Sauda Maryam, Sara Nadeem, Faisal Qureshi, Mohsen Ali

机构 * Intelligent Machines Lab(智能机器实验室) Information Technology University(信息技术大学) Visual Computing Lab(视觉计算实验室) Ontario Tech University(安大略技术大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 PromptCCZSL通过多教师蒸馏和正交投影损失,实现持续组成零样本学习中的知识保留与泛化提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14068 2025-12-17 cs.CV cs.AI 73%

SDAR-VL: Stable and Efficient Block-wise Diffusion for Vision-Language Understanding

SDAR-VL: 稳定且高效的块状扩散用于视觉语言理解

Shuang Cheng, Yuhua Jiang, Zineng Zhou, Dawei Liu, Wang Tao, Linfeng Zhang, Biqing Qi, Bowen Zhou

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) ByteDance(字节跳动)

专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 SDAR-VL通过高效的块状扩散方法,在视觉语言理解中实现了更高的训练效率、收敛稳定性及任务性能,优于传统块扩散并匹敌强AR基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18638 2025-12-17 cs.CV cs.AI 73%

Learning neuroimaging models from health system-scale data

从健康系统级数据中学习神经影像模型

Yiwei Lyu, Samir Harake, Asadur Chowdury, Soumyanil Banerjee, Rachel Gologorsky, Shixuan Liu, Anna-Katharina Meissner, Akshay Rao, Chenhui Zhao, Akhil Kondepudi, Cheng Jiang, Xinhai Hou, Rushikesh S. Joshi, Volker Neuschmelting, Ashok Srinivasan, Dawn Kleindorfer, Brian Athey, Vikas Gulani, Aditya Pandey, Honglak Lee, Todd Hollon

机构 * University of Michigan Computer Science and Engineering(密歇根大学计算机科学与工程系) University of Michigan Neurosugery(密歇根大学神经外科) University of Cologne Neurosugery(科隆大学神经外科) University of Michigan Radiology(密歇根大学放射学) University of Michigan Neurology(密歇根大学神经病学) University of Michigan Computational Medicine and Bioinformatics(密歇根大学计算医学与生物信息学)

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 Prima是一款基于健康系统级数据训练的视觉语言模型,用于神经影像学,实现了高准确率的诊断和临床决策支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12885 2025-12-16 cs.CV cs.AI cs.CL cs.IR cs.RO 73%

SignRAG: A Retrieval-Augmented System for Scalable Zero-Shot Road Sign Recognition

SignRAG:一种用于可扩展零样本道路标志识别的检索增强系统

Minghao Zhu, Zhihao Zhang, Anmol Sidhu, Keith Redmill

机构 * Computer Engineering The Ohio State University(计算机工程 俄亥俄州立大学) Applied Research Transportation Research Center Inc.(应用研究 交通运输研究中心公司) Computer Engineering The Ohio State University Columbus, Ohio, USA(计算机工程 俄亥俄州立大学 哥伦布俄亥俄州) Applied Research Transportation Research Center Inc. East Liberty, Ohio, USA(应用研究 交通运输研究中心公司 埃斯特利比 俄亥俄州)

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 SignRAG通过检索增强生成范式实现可扩展的零样本道路标志识别,结合视觉语言模型和大型语言模型,实现高准确率的标志识别。

Comments Submitted to IV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10596 2025-12-12 cs.CV cs.AI 73%

Beyond Pixels: A Training-Free, Text-to-Text Framework for Remote Sensing Image Retrieval

超越像素:一种无训练的文本到文本框架用于遥感图像检索

J. Xiao, Y. Guo, X. Zi, K. Thiyagarajan, C. Moreira, M. Prasad

机构 * Information Technology University of Technology Sydney Sydney, Australia(信息科技技术大学悉尼分校悉尼澳大利亚) Robotics Laboratory (SensR Lab) Centre for Advanced Manufacturing Technology Western Sydney University Sydney, Australia(机器人实验室(SensR实验室)先进制造技术中心西悉尼大学悉尼澳大利亚) The Data Science Institute Faculty of Engineering(数据科学学院工程学院)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出无训练的文本到文本框架TRSLLaVA,通过结构化文本实现高效遥感图像检索,实验表明其性能优于现有监督模型。

Comments 6 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19575 2025-12-12 cs.CV cs.AI 73%

HunyuanOCR Technical Report

HunyuanOCR 技术报告

Hunyuan Vision Team, Pengyuan Lyu, Xingyu Wan, Gengluo Li, Shangpin Peng, Weinong Wang, Liang Wu, Huawen Shen, Yu Zhou, Canhui Tang, Qi Yang, Qiming Peng, Bin Luo, Hower Yang, Xinsong Zhang, Jinnian Zhang, Houwen Peng, Hongming Yang, Senhao Xie, Longsha Zhou, Ge Pei, Binghong Wu, Rui Yan, Kan Wu, Jieneng Yang, Bochao Wang, Kai Liu, Jianchen Zhu, Jie Jiang, Linus, Han Hu, Chengquan Zhang

机构 * Tencent(腾讯)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 HunyuanOCR是一款轻量级视觉-语言模型,通过统一通用性与效率、简化端到端架构、采用数据驱动和强化学习策略,在OCR任务中实现卓越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09010 2025-12-11 cs.CV cs.AI 73%

Towards Lossless Ultimate Vision Token Compression for VLMs

面向视觉语言模型的无损终极视觉标记压缩

Dehua Zheng, Mouxiao Huang, Borui Jiang, Hailin Hu, Xinghao Chen

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 VLM训练与架构 :VLM(abstract);visual language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出LUVC框架,通过正交空间轴的迭代合并和频谱修剪单元,实现视觉语言模型中视觉标记的无损压缩,提升推理速度并保持精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20793 2025-12-02 cs.CV cs.AI 73%

Rendering-Aware Reinforcement Learning for Vector Graphics Generation

面向渲染的强化学习用于矢量图形生成

Juan A. Rodriguez, Haotian Zhang, Abhay Puri, Aarash Feizi, Rishav Pramanik, Pascal Wichmann, Arnab Mondal, Mohammad Reza Samsami, Rabiul Awal, Perouz Taslakian, Spandana Gella, Sai Rajeswar, David Vazquez, Christopher Pal, Marco Pedersoli

机构 * ServiceNow Research(ServiceNow研究机构) Mila ÉTS Montréal(蒙特利尔ÉTS) Polytechnique Montréal(蒙特利尔Polytechnique) Columbia University(哥伦比亚大学) Stony Brook University(石溪大学) Apple(苹果公司) Google Research(谷歌研究) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席) McGill University(麦吉尔大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出RLRF方法,通过利用渲染反馈提升自回归VLMs中SVG生成的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21631 2025-12-01 cs.CV cs.AI 73%

Qwen3-VL Technical Report

Qwen3-VL 技术报告

Shuai Bai, Yuxuan Cai, Ruizhe Chen, Keqin Chen, Xionghui Chen, Zesen Cheng, Lianghao Deng, Wei Ding, Chang Gao, Chunjiang Ge, Wenbin Ge, Zhifang Guo, Qidong Huang, Jie Huang, Fei Huang, Binyuan Hui, Shutong Jiang, Zhaohai Li, Mingsheng Li, Mei Li, Kaixin Li, Zicheng Lin, Junyang Lin, Xuejing Liu, Jiawei Liu, Chenglong Liu, Yang Liu, Dayiheng Liu, Shixuan Liu, Dunjie Lu, Ruilin Luo, Chenxu Lv, Rui Men, Lingchen Meng, Xuancheng Ren, Xingzhang Ren, Sibo Song, Yuchong Sun, Jun Tang, Jianhong Tu, Jianqiang Wan, Peng Wang, Pengfei Wang, Qiuyue Wang, Yuxuan Wang, Tianbao Xie, Yiheng Xu, Haiyang Xu, Jin Xu, Zhibo Yang, Mingkun Yang, Jianxin Yang, An Yang, Bowen Yu, Fei Zhang, Hang Zhang, Xi Zhang, Bo Zheng, Humen Zhong, Jingren Zhou, Fan Zhou, Jing Zhou, Yuanzhi Zhu, Ke Zhu

专题命中 VLM训练与架构 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 Qwen3-VL 是一款强大的多模态模型,具备强大的纯文本理解、长上下文处理和多模态推理能力,适用于图像推理、代理决策和多模态代码智能。

Comments 42 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12002 2025-11-18 cs.LG cs.CV 73%

Selecting Fine-Tuning Examples by Quizzing VLMs

Tenghao Ji, Eytan Adar

机构 * University of Michigan(密歇根大学)

专题命中 VLM训练与架构 :VLM(abstract);visual reasoning(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11066 2025-11-17 cs.CV cs.AI cs.CL 73%

S2D-ALIGN: Shallow-to-Deep Auxiliary Learning for Anatomically-Grounded Radiology Report Generation

Jiechao Gao, Chang Liu, Yuangang Li

专题命中 VLM训练与架构 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23318 2025-11-17 cs.CV cs.AI 73%

FastDriveVLA: Efficient End-to-End Driving via Plug-and-Play Reconstruction-based Token Pruning

Jiajun Cao, Qizhe Zhang, Peidong Jia, Xuhui Zhao, Bo Lan, Xiaoan Zhang, Zhuo Li, Xiaobao Wei, Sixiang Chen, Liyun Li, Xianming Liu, Ming Lu, Yang Wang, Shanghang Zhang

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10301 2025-11-14 cs.CV cs.AI 73%

Rethinking Visual Information Processing in Multimodal LLMs

Dongwan Kim, Viresh Ranjan, Takashi Nagata, Arnab Dhua, Amit Kumar K C

机构 * Seoul National University(首尔国立大学) Amazon(亚马逊)

专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16781 2025-11-14 cs.CV cs.AI cs.CL 73%

Xiaoice: Training-Free Video Understanding via Self-Supervised Spatio-Temporal Clustering of Semantic Features

Shihao Ji, Zihui Song

专题命中 VLM训练与架构 :VLM(abstract);visual language model(abstract);分类 cs.CV、cs.AI

Comments This paper is being withdrawn because we have identified a significant error in the implementation of our self-supervised clustering approach. Specifically, our feature aggregation step inadvertently leaked temporal information across frames, which violates the core assumption of our training-free method. We sincerely apologize to the research community

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22443 2025-10-28 cs.CV cs.LG 73%

Benchmarking Egocentric Multimodal Goal Inference for Assistive Wearable Agents

Vijay Veerabadran, Fanyi Xiao, Nitin Kamra, Pedro Matias, Joy Chen, Caley Drooff, Brett D Roads, Riley Williams, Ethan Henderson, Xuanyi Zhao, Kevin Carlberg, Joseph Tighe, Karl Ridgeway

机构 * Meta Reality Labs(Meta 现实实验室) Meta FAIR

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

Comments Accepted as a spotlight paper at the 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21323 2025-10-27 cs.CV cs.LG 73%

VL-SAE: Interpreting and Enhancing Vision-Language Alignment with a Unified Concept Set

Shufan Shen, Junshu Sun, Qingming Huang, Shuhui Wang

机构 * Key Lab of Intell. Info. Process., Inst. of Comput. Tech., CAS(智能信息处理重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV、cs.LG

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17800 2025-10-22 cs.CV cs.CL cs.LG 73%

Glyph: Scaling Context Windows via Visual-Text Compression

Jiale Cheng, Yusen Liu, Xinyu Zhang, Yulin Fei, Wenyi Hong, Ruiliang Lyu, Weihan Wang, Zhe Su, Xiaotao Gu, Xiao Liu, Yushi Bai, Jie Tang, Hongning Wang, Minlie Huang

机构 * The Conversational Artificial Intelligence (CoAI) Group, Tsinghua University(清华大学对话人工智能(CoAI)小组) Zhipu AI(智谱AI) The Knowledge Engineering Group (KEG), Tsinghua University(清华大学知识工程小组(KEG))

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23379 2025-10-20 cs.CL cs.AI cs.CV 73%

CCD: Mitigating Hallucinations in Radiology MLLMs via Clinical Contrastive Decoding

Xi Zhang, Zaiqiao Meng, Jake Lever, Edmond S. L. Ho

机构 * School of Computing Science, University of Glasgow(计算科学学院,格拉斯哥大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments Preprint, 27 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14526 2025-10-17 cs.CV cs.LG 73%

Noise Projection: Closing the Prompt-Agnostic Gap Behind Text-to-Image Misalignment in Diffusion Models

Yunze Tong, Didi Zhu, Zijing Hu, Jinluan Yang, Ziyu Zhao

机构 * Zhejiang University(浙江大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

Comments Appendix will be appended soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11693 2025-10-14 cs.CL cs.AI cs.CV 73%

Scaling Language-Centric Omnimodal Representation Learning

Chenghao Xiao, Hou Pong Chan, Hao Zhang, Weiwen Xu, Mahani Aljunied, Yu Rong

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09426 2025-10-14 cs.CV cs.AI cs.CL 73%

BabyVLM: Data-Efficient Pretraining of VLMs Inspired by Infant Learning

Shengao Wang, Arjun Chandra, Aoming Liu, Venkatesh Saligrama, Boqing Gong

机构 * Boston University(波士顿大学)

专题命中 VLM训练与架构 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏