arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-17 至 2026-03-17 共收录 28 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 28 篇

2412.04467 2026-03-17 cs.CV cs.AI cs.CL cs.LG 85%

VisionZip: Longer is Better but Not Necessary in Vision Language Models

VisionZip: 更长并非必要,但在视觉语言模型中更优

Senqiao Yang, Yukang Chen, Zhuotao Tian, Chengyao Wang, Jingyao Li, Bei Yu, Jiaya Jia

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出VisionZip方法,通过选择信息性视觉token提升效率并保持性能,实验显示在多种设置下性能提升至少5%,同时显著加快推理速度。

Comments Code: https://github.com/dvlab-research/VisionZip

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13389 2026-03-17 cs.CV cs.LG 84%

High-Fidelity Text-to-Image Generation from Pre-Trained Vision-Language Models via Distribution-Conditioned Diffusion Decoding

通过分布条件扩散解码从预训练视觉-语言模型生成高保真的文本到图像

Ji Woo Hong, Hee Suk Yoon, Gwanhyeong Koo, Eunseop Yoon, SooHwan Eom, Qi Dai, Chong Luo, Chang D. Yoo

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) Microsoft Research Asia (MSRA)(微软亚洲研究院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出一种基于扩散解码的框架,通过训练仅需扩散解码器即可提升图像保真度,利用分布加权代码向量增强视觉质量,仅需ImageNet-1K短训练即可改进VQ-VAE重建和文本到图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13370 2026-03-17 cs.CV cs.LG 84%

GraphVLM: Benchmarking Vision Language Models for Multimodal Graph Learning

GraphVLM:多模态图学习的视觉语言模型基准测试

Jiajin Liu, Dongzhe Fan, Chuanhao Ji, Daochen Zha, Qiaoyu Tan

机构 * NYU Shanghai(纽约大学上海分校) New York University(纽约大学) Rice University(休斯顿大学) East China Normal University(华东师范大学)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 GraphVLM通过三种范式评估视觉语言模型在多模态图学习中的能力,发现VLM-as-Predictor在性能上表现最佳,展示了其在多模态图学习中的潜力。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15166 2026-03-17 cs.CV 83%

DAIT: Distillation from Vision-Language Models to Lightweight Classifiers with Adaptive Intermediate Teacher Transfer

DAIT: 从视觉-语言模型到轻量分类器的适应性中间教师知识蒸馏

Zhengxu He, Jun Li, Zhijian Wu

机构 * School of Computer and Electronic Information, Nanjing Normal University, Nanjing, China(南京师范大学计算机与电子信息学院) Medical Artificial Intelligence Lab, Westlake University(西湖大学医学人工智能实验室)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出DAIT方法,通过引入可训练的中间教师模型,从冻结的视觉-语言模型中适应性地蒸馏出任务对齐的知识,提升细粒度视觉分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06569 2026-03-17 cs.CV 83%

Penguin-VL: Exploring the Efficiency Limits of VLM with LLM-based Vision Encoders

Penguin-VL:探索基于大语言模型的视觉编码器的效率极限

Boqiang Zhang, Lei Ke, Ruihan Yang, Qi Gao, Tianyuan Qu, Rossell Chen, Dong Yu, Leoweiliang

机构 * Tencent AI Lab(腾讯AI实验室)

专题命中 VLM训练与架构 :VLM(title,abstract);vision language model(abstract);分类 cs.CV

AI总结 本文提出Penguin-VL,通过基于大语言模型的视觉编码器替代传统对比预训练,实现更高效的多模态理解,在文档理解、视觉知识和多视角视频理解等任务中超越现有领先VLM。

Comments Penguin-VL demonstrates that text-only initialized vision encoders can achieve superior performance in multimodal understanding tasks; Code: https://github.com/tencent-ailab/Penguin-VL

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14012 2026-03-17 cs.CV 81%

Multi-Grained Vision-Language Alignment for Domain Generalized Person Re-Identification

多粒度视觉-语言对齐用于领域泛化的人员重识别

Jiachen Li, Xiaojin Gong, Dongping Zhang

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);grounding(abstract);MLLM(abstract)

AI总结 本文提出基于CLIP的多粒度视觉-语言对齐框架,通过引入多粒度提示和自适应掩码模块提升领域泛化人员重识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15259 2026-03-17 cs.LG cs.AI cs.CL cs.CR 81%

Directional Embedding Smoothing for Robust Vision Language Models

方向嵌入平滑用于鲁棒视觉语言模型

Ye Wang, Jing Liu, Toshiaki Koike-Akino

机构 * Mitsubishi Electric Research Laboratories(三菱电机研究实验室)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过方向嵌入平滑技术提升视觉语言模型的鲁棒性,针对多模态劫持攻击,验证了方向嵌入噪声在降低攻击成功率中的有效性。

Comments Accepted at ICLR 2026 Workshop on Agents in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14951 2026-03-17 cs.CV 79%

GT-PCQA: Geometry-Texture Decoupled Point Cloud Quality Assessment with MLLM

GT-PCQA: 一种基于多模态大语言模型的几何-纹理解耦点云质量评估方法

Guohua Zhang, Jian Jin, Meiqin Liu, Chao Yao, Weisi Lin, Yao Zhao

机构 * Beijing Jiaotong University(北京交通大学) Nanyang Technological University(南洋理工大学) University of Science and Technology Beijing(北京科技大学)

专题命中 VLM训练与架构 :MLLM(title,abstract);分类 cs.CV

AI总结 本文提出GT-PCQA框架,通过2D-3D联合训练和几何-纹理解耦策略,解决点云质量评估中数据量少和模型对几何退化不敏感的问题,实现高效且泛化能力强的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13394 2026-03-17 cs.CV 79%

Language-Guided Token Compression with Reinforcement Learning in Large Vision-Language Models

基于强化学习的语言引导标记压缩在大视觉-语言模型中

Sihan Cao, Jianwei Zhang, Pengcheng Zheng, Jiaxin Yan, Caiyan Qin, Yalan Ye, Wei Dong, Peng Wang, Yang Yang, Chaoning Zhang

机构 * School of Computer Science and Engineering(计算机科学与工程学院) University of Electronic Science and Technology of China(电子科学与技术大学) School of Robotics and Advanced Manufacture(机器人与先进制造学院) Harbin Institute of Technology(哈尔滨工业大学) College of Information and Control Engineering(信息与控制工程学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出TPRL框架,通过语言引导的序列优化实现视觉标记压缩,减少推理成本并提升效率,实验显示可减少66.7%的视觉标记和54.2%的FLOPs,精度损失仅0.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14493 2026-03-17 cs.CV cs.CL cs.LG 79%

Fine-tuning MLLMs Without Forgetting Is Easier Than You Think

对多模态大语言模型进行微调而不遗忘比你想象的更容易

He Li, Yuhui Zhang, Xiaohan Wang, Kaifeng Lyu, Serena Yeung-Levy

专题命中 VLM训练与架构 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.LG

AI总结 本文通过实验框架展示,简单调整微调方法可缓解灾难性遗忘,提出数据混合训练策略解决特定任务过拟合问题,并证明该方法可扩展至持续学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17741 2026-03-17 cs.CV 77%

Reasoning to Attend: Try to Understand How <SEG> Token Works

推理以关注:尝试理解<SEG>标记的作用

Rui Qian, Xin Yin, Dejing Dou

专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);grounding(abstract);分类 cs.CV

AI总结 本文研究了<SEG>标记在多模态模型中的作用,通过可视化相似性图揭示其在图像-文本对中的语义相似性贡献,并提出READ方法提升模型的推理能力。

Comments This work has been accepted to CVPR 2025, please refer to https://github.com/rui-qian/READ

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13341 2026-03-17 cs.CV cs.AI 73%

Mind the Discriminability Trap in Source-Free Cross-domain Few-shot Learning

注意源无关跨域少样本学习中的判别性陷阱

Zhenyu Zhang, Yixiong Zou, Yuhua Li, Ruixuan Li, Guangyao Chen

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) National Key Laboratory for Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文研究源无关跨域少样本学习中增强视觉模态判别性会抑制VLM性能的现象,提出通过扰动视觉学习以引导跨模态对齐的方法,实验显示在多种设置和数据集上取得新状态-of-the-art结果。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14916 2026-03-17 cs.CV cs.MM 70%

EditHF-1M: A Million-Scale Rich Human Preference Feedback for Image Editing

EditHF-1M: 一个百万级的丰富人类偏好反馈用于图像编辑

Zitong Xu, Huiyu Duan, Zhongpeng Ji, Xinyun Zhang, Yutao Liu, Xiongkuo Min, Ke Gu, Jian Zhang, Shusong Xu, Jinwei Chen, Bo Li, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Vivo Mobile Communication Co., Ltd(vivo移动通信有限公司) University of Electronic and Science Technology of China(电子科技大学) Ocean University of China(海洋大学) Beijing University of Technology(北京理工大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出EditHF-1M百万级图像编辑数据集及基于其的EditHF评估模型和EditHF-Reward奖励模型,通过强化学习优化文本引导图像编辑模型,实验表明其在对齐人类偏好和泛化能力方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14892 2026-03-17 cs.CV 70%

Balancing Saliency and Coverage: Semantic Prominence-Aware Budgeting for Visual Token Compression in VLMs

平衡显著性与覆盖:面向视觉令牌压缩的语义显著性感知预算分配

Jaehoon Lee, Mingi Jung, Soohyuk Jang, Seungryong Yoo, Dahuin Jung, Sungroh Yoon

机构 * Interdisciplinary Program in AI, Seoul National University(首尔国立大学人工智能跨学科项目) Department of Electrical and Computer Engineering, Seoul National University(首尔国立大学电子与计算机工程系) Department of Artificial Intelligence, Chung-Ang University(成均馆大学人工智能系)

专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV

AI总结 本文提出PromPrune框架,通过语义显著性感知预算分配和两阶段选择流程,在视觉令牌压缩中平衡局部显著性保留与全局覆盖,提升性能并减少计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11664 2026-03-17 cs.CV 70%

BackdoorIDS: Zero-shot Backdoor Detection for Pretrained Vision Encoder

BackdoorIDS: 预训练视觉编码器的零样本后门检测

Siquan Huang, Yijiang Li, Ningzhi Gao, Xingfu Yan, Leyu Shi, Ying Gao

专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV

AI总结 BackdoorIDS通过分析输入在逐步遮蔽过程中的嵌入序列变化,利用密度聚类检测后门攻击,实现对预训练视觉编码器的零样本后门检测,优于现有防御方法。

Comments 17 pages, 10 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08309 2026-03-17 cs.CV cs.AI cs.LG 67%

Concept-Guided Fine-Tuning: Steering ViTs away from Spurious Correlations to Improve Robustness

基于概念引导的微调:引导ViT远离虚假相关性以提高鲁棒性

Yehonatan Elisha, Oren Barkan, Noam Koenigstein

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出一种引导模型推理至概念层面语义的微调框架,通过优化内部相关性映射对齐空间 grounded 的概念掩码,提升模型在分布偏移下的鲁棒性。

Comments CVPR 2026 ; Project page: https://yonisgit.github.io/concept-ft/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01450 2026-03-17 cs.CL 67%

Towards Efficient Medical Reasoning with Minimal Fine-Tuning Data

面向最少微调数据的高效医疗推理

Xinlin Zhuang, Feilong Tang, Haolin Yang, Xiwei Liu, Ming Hu, Huifa Li, Haochen Xue, Junjun He, Zongyuan Ge, Yichen Li, Ying Qian, Imran Razzak

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract)

AI总结 本文提出DIQ数据选择策略,通过平衡难度与梯度影响,提升医疗推理效率,实验证明仅用1%数据即可达到全数据表现,10%数据优于基线方法。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22170 2026-03-17 cs.LG cs.CV 62%

SoliReward: Mitigating Susceptibility to Reward Hacking and Annotation Noise in Video Generation Reward Models

SoliReward: 缓解视频生成奖励模型对奖励黑客和标注噪声的敏感性

Jiesong Lian, Ruizhe Zhong, Zixiang Zhou, Xiaoyue Mi, Long Hu, Yuan Zhou, Qinglin Lu, Yixue Hao, Junchi Yan

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出SoliReward框架,通过单项目二元标注获取高质量数据,采用交叉提示配对策略构建偏好对,并引入改进的BT损失函数以缓解奖励黑客问题,提升视频生成奖励模型的鲁棒性。

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11656 2026-03-17 cs.CV cs.AI cs.RO 62%

SToRM: Supervised Token Reduction for Multi-modal LLMs toward efficient end-to-end autonomous driving

SToRM:面向高效端到端自动驾驶的多模态大语言模型监督令牌缩减

Seo Hyun Kim, Jin Bok Park, Do Yeon Koo, Hogun Park, Il Yong Chun

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SToRM框架,通过监督令牌缩减方法在保持性能的同时降低计算成本,实现实时端到端自动驾驶。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18269 2026-03-17 cs.CV cs.AI 62%

StreamingTOM: Streaming Token Compression for Efficient Video Understanding

StreamingTOM: 流式令牌压缩以实现高效的视频理解

Xueyi Chen, Keda Tao, Kele Shao, Huan Wang

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 StreamingTOM通过双阶段框架解决流式视频视觉-语言模型中预-后LLM瓶颈,实现kv-cache压缩和低延迟,提升实时视频理解效率。

Comments Accepted at CVPR 2026. Project page: https://yige24.github.io/StreamingTOM

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18600 2026-03-17 cs.CV cs.AI cs.CL 62%

OraPO: Oracle-educated Reinforcement Learning for Data-efficient and Factual Radiology Report Generation

OraPO:基于 oracle 的强化学习用于数据高效且事实准确的放射科报告生成

Zhuoxiao Chen, Hongyang Yu, Ying Xu, Yadan Luo, Long Duong, Yuan-Fang Li

机构 * Oracle Health & AI(Oracle健康与人工智能)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI

AI总结 OraPO 通过 FactScore 奖励机制提升放射科报告生成效率,在受限预算下实现 SOTA 性能,使用小规模 VLM 和适度硬件,在 CheXpert Plus 数据集上取得 0.341 的 F1 分数。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14336 2026-03-17 cs.CV 57%

UAVBench and UAVIT-1M: Benchmarking and Enhancing MLLMs for Low-Altitude UAV Vision-Language Understanding

UAVBench 和 UAVIT-1M:用于低空无人机视觉-语言理解的LLM基准测试与增强

Yang Zhan, Yuan Yuan

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出UAVBench和UAVIT-1M,用于评估和提升LLM在低空无人机视觉-语言任务中的能力,通过大规模数据集和基准测试揭示开源LLM在低空视觉内容生成上的不足,并通过微调提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16931 2026-03-17 cs.AI 57%

Narrow Fine-Tuning Erodes Safety Alignment in Vision-Language Agents

细粒度微调会削弱视觉语言代理的安全对齐

Idhant Gulati, Shivam Raval

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI

AI总结 研究发现细粒度微调在有害数据集上会导致广泛的任务和模态对齐偏差,且单模态安全基准可能低估视觉语言模型的对齐退化。

Comments 25 pages, 14 figures, Published at the Lifelong Agent Workshop at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09586 2026-03-17 cs.CV 57%

Delving into Spectral Clustering with Vision-Language Representations

深入探讨基于视觉-语言表示的谱聚类

Bo Peng, Yuanwei Hu, Bo Liu, Ling Chen, Jie Lu, Zhen Fang

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出基于预训练视觉语言模型的神经切线核谱聚类方法,通过跨模态对齐提升图像聚类性能,实验表明在16个基准数据集上显著优于现有方法。

Comments ICLR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11301 2026-03-17 cs.AI 57%

EcoAlign: An Economically Rational Framework for Efficient LVLM Alignment

EcoAlign:一种经济理性框架,用于高效LVLM对齐

Ruoxi Cheng, Haoxuan Ma, Teng Ma, Hongyi Zhang

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI

AI总结 本文提出EcoAlign框架,通过经济理性搜索提升LVLM对齐效率,在安全、效用和成本间取得平衡,实验表明其在计算成本更低的情况下性能更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02184 2026-03-17 cs.LG 57%

Retrieval-augmented Decoding for Improving Truthfulness in Open-ended Generation

基于检索的解码方法用于提升开放式生成中的真实性

Manh Nguyen, Sunil Gupta, Hung Le

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG

AI总结 本文提出Retrieval-Augmented Decoding方法,通过构建紧凑的参考 grounding 空间,在推理过程中利用检索到的上下文信息调整模型logits,提升生成文本的真实性。

Comments updated experiments and presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13399 2026-03-17 cs.CV 57%

FlowAD: Ego-Scene Interactive Modeling for Autonomous Driving

FlowAD: 无人驾驶中的自体场景交互建模

Mingzhe Guo, Yixiang Yang, Chuanrong Han, Rufeng Zhang, Shirui Li, Ji Wan, Zhipeng Zhang

机构 * AutoLab, School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院AutoLab) Baidu Inc(百度公司)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 本文提出FlowAD框架,通过自体场景交互建模提升自动驾驶性能,利用场景流建模动态变化,结合新颖的FCP指标评估场景理解能力,实验表明其在碰撞率和驾驶评分上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17434 2026-03-17 cs.AI 57%

Resource Rational Contractualism Should Guide AI Alignment

资源理性契约主义应指导AI对齐

Sydney Levine, Matija Franklin, Tan Zhi-Xuan, Secil Yanik Guyot, Lionel Wong, Daniel Kilov, Yejin Choi, Joshua B. Tenenbaum, Noah Goodman, Seth Lazar, Iason Gabriel

机构 * Harvard(哈佛大学) MIT(麻省理工学院) Google Deepmind(谷歌DeepMind) Australian National University(澳大利亚国立大学) Stanford Psychology Department(斯坦福心理学系) Stanford(斯坦福大学) Computer Science Department(计算机科学系)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文提出资源理性契约主义框架,通过认知启发式方法提升AI决策效率与适应性,解决大规模契约达成成本高问题。

Comments 24 pages, 10 figures

Journal ref International Association for Safe and Ethical AI, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏