arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-18 至 2026-03-18 共收录 8 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 8 篇

2603.16781 2026-03-18 cs.CV cs.AI 84%

IOSVLM: A 3D Vision-Language Model for Unified Dental Diagnosis from Intraoral Scans

IOSVLM:一种用于从牙科内窥扫描进行统一牙科诊断的3D视觉-语言模型

Huimin Xiong, Zijie Meng, Tianxiang Hu, Chenyi Zhou, Yang Feng, Zuozhu Liu

机构 * ZJU-UIUC Institute, Zhejiang University, Haining, 314400, China(浙大浙ICU研究所,浙江大学,海宁,314400,中国) Stomatology Hospital, School of Stomatology, Zhejiang University School of Medicine, Hangzhou, 310058, China(口腔医院,口腔医学院,浙江大学医学院,杭州,310058,中国) Angelalign Research Institute, Angel Align Inc., Shanghai, 200011, China(天使对齐研究院,天使对齐公司,上海,200011,中国)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出IOSVLM,一种端到端的3D视觉-语言模型,利用点云表示内窥扫描,并结合大规模多源数据集,提升牙科诊断和生成式视觉问答的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16653 2026-03-18 cs.CV 83%

HeBA: Heterogeneous Bottleneck Adapters for Robust Vision-Language Models

HeBA:异构瓶颈适配器用于鲁棒的视觉-语言模型

Md Jahidul Islam

机构 * Department of Electrical and Electronic Engineering(电气电子工程系) Bangladesh University of Engineering and Technology(孟加拉工程与技术大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 HeBA通过引入模态特定的结构归纳偏置,改进了视觉-语言模型在下游任务中的适应性,提升了稳定性和准确性,达到11个少样本基准的新状态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11098 2026-03-18 cs.CV cs.RO 83%

Vision-Language Models for Infrared Industrial Sensing in Additive Manufacturing Scene Description

面向增材制造场景的红外工业感知的视觉-语言模型

Nazanin Mahjourian, Vinh Nguyen

机构 * Department of Mechanical and Aerospace Engineering, Michigan Technological University(机械与航空航天工程系,密歇根技术大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出VLM-IRIS框架,通过预处理红外图像为RGB兼容输入,利用CLIP编码器实现无监督的零样本工作件存在检测,展示了在热成像中的高精度应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16581 2026-03-18 cs.AI 79%

V-DyKnow: A Dynamic Benchmark for Time-Sensitive Knowledge in Vision Language Models

V-DyKnow:面向视觉语言模型的时间敏感知识动态基准

Seyed Mahed Mousavi, Christian Moiola, Massimo Rizzoli, Simone Alghisi, Giuseppe Riccardi

机构 * Signals and Interactive Systems Lab, University of Trento(信号与交互系统实验室,特伦托大学)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);分类 cs.AI

AI总结 本文提出V-DyKnow基准,评估视觉语言模型对时间敏感事实知识的处理能力,分析模型响应可靠性、知识更新方法有效性及过时预测原因,揭示当前VLM在多模态时间敏感知识获取与更新中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16860 2026-03-18 cs.RO 75%

DreamPlan: Efficient Reinforcement Fine-Tuning of Vision-Language Planners via Video World Models

DreamPlan: 通过视频世界模型高效强化微调视觉语言规划器

Emily Yue-Ting Jia, Weiduo Yuan, Tianheng Shi, Vitor Guizilini, Jiageng Mao, Yue Wang

机构 * USC Physical Superintelligence Lab(USC物理超智能实验室) Toyota Research Institute(丰田研究院)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);grounding(abstract)

AI总结 DreamPlan通过视频世界模型高效强化微调视觉语言规划器,利用零样本VLM生成探索数据训练动作条件视频生成模型,再通过ORPO在虚拟环境中微调VLM,提升物体 manipulation 成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04153 2026-03-18 cs.CV 70%

Diffusion-DRF: Free, Rich, and Differentiable Reward for Video Diffusion Fine-Tuning

Diffusion-DRF:免费、丰富且可微的奖励用于视频扩散微调

Yifan Wang, Yanyu Li, Gordon Guocheng Qian, Sergey Tulyakov, Yun Fu, Anil Kag

机构 * Northeastern University(东北大学) Snap Inc.(Snap公司)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出Diffusion-DRF框架,通过多维问题和密集VQA解释查询生成丰富反馈,实现稳定奖励微调,无需偏好数据集。

Comments Webpage: https://snap-research.github.io/diffusion-drf/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18444 2026-03-18 cs.CV 70%

SineProject: Machine Unlearning for Stable Vision Language Alignment

SineProject:用于稳定视觉语言对齐的机器反遗忘

Arpit Garg, Hemanth Saratchandran, Simon Lucey

机构 * Australian Institute for Machine Learning(澳大利亚机器学习研究所)

专题命中 VLM训练与架构 :LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 SineProject通过在冻结的投影器中加入正弦调制的可训练参数,提升Jacobian的谱条件数,稳定反遗忘过程中的视觉语言对齐,减少无害查询拒绝并实现目标信息遗忘。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16641 2026-03-18 cs.CV 57%

FlowComposer: Composable Flows for Compositional Zero-Shot Learning

FlowComposer: 用于组合零样本学习的可组合流

Zhenqi He, Lin Li, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出FlowComposer,通过学习两个基础流将视觉特征传输到属性和对象文本嵌入,并引入可学习的Composer显式融合速度场以生成组合流,有效解决组合零样本学习中的隐式组合构造和特征纠缠问题。

Comments Accepted to CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏