arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-08 至 2026-04-08 共收录 18 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 18 篇

2407.14971 2026-04-08 cs.CV cs.AI cs.CL cs.LG 85%

Sim-CLIP: Unsupervised Siamese Adversarial Fine-Tuning for Robust and Semantically-Rich Vision-Language Models

Sim-CLIP: 无监督的孪生对抗微调用于鲁棒且语义丰富的视觉-语言模型

Md Zarif Hossain, Ahmed Imteaj

机构 * Florida Atlantic University(佛罗里达大西洋大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 Sim-CLIP通过无监督对抗微调提升CLIP视觉编码器的鲁棒性,同时保持语义表示。采用孪生架构和余弦相似度目标,避免大批次对比学习和额外动量编码器,实现低计算开销的鲁棒训练。

Comments Accepted at IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18117 2026-04-08 cs.CV 83%

Online In-Context Distillation for Low-Resource Vision Language Models

在线上下文蒸馏用于低资源视觉语言模型

Zhiqi Kang, Rahaf Aljundi, Vaggelis Dorovatas, Karteek Alahari

机构 * Inria(法国国家信息与自动化研究所) Toyota Motor Europe(丰田汽车欧洲公司)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出在线上下文蒸馏方法,通过小模型与强教师模型协作,利用稀疏演示高效缩小性能差距,提升小模型性能达33%,在低资源条件下实现与零样本性能相当的成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01831 2026-04-08 cs.LG cs.AI 81%

Routing-Based Continual Learning for Multimodal Large Language Models

基于路由的多模态大语言模型持续学习

Jay Mohta, Kenan Emir Ak, Gwang Lee, Dimitrios Dimitriadis, Yan Xu, Mingwei Shen

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于路由的持续学习方法,用于多模态大语言模型,有效缓解灾难性遗忘并提升跨模态迁移性能,同时保持训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04972 2026-04-08 cs.CV 79%

RCP: Representation Consistency Pruner for Mitigating Distribution Shift in Large Vision-Language Models

RCP:一种用于缓解大视觉-语言模型中分布偏移的表示一致性剪枝方法

Jianwei Zhang, Chaoning Zhang, Sihan Cao, Wang Liu, Pengcheng Zheng, Jiaxin Huang, Caiyan Qin, Yalan Ye, Wei Dong, Yang Yang

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) Machine Learning Department, Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学机器学习系) School of Robotics and Advanced Manufacture, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)机器人与先进制造学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出RCP框架,通过累积视觉token剪枝与延迟修复机制,有效缓解大视觉-语言模型中的分布偏移问题,实验表明可剪除高达88.9%的视觉token并减少85.7%的FLOPs,同时保持较低的精度损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05614 2026-04-08 cs.RO 78%

Grounding Hierarchical Vision-Language-Action Models Through Explicit Language-Action Alignment

通过显式语言-动作对齐实现层次化视觉-语言-动作模型的 grounding

Theodor Wulff, Federico Tavella, Rahul Singh Maharjan, Manith Adikari, Angelo Cangelosi

机构 * The University of Manchester(曼彻斯特大学)

专题命中 VLM训练与架构 :grounding(title,abstract)

AI总结 本文提出通过显式语言-动作对齐训练框架,提升视觉-语言-动作模型的 grounding 能力,基于 LanguageTable 数据集验证了多模态 grounding 表示的有效性,并建立强基线性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06124 2026-04-08 cs.CV cs.AI 76%

Lightweight Multimodal Adaptation of Vision Language Models for Species Recognition and Habitat Context Interpretation in Drone Thermal Imagery

轻量级多模态适应:为无人机热成像中的物种识别和栖息地上下文解释优化视觉语言模型

Hao Chen, Fang Qiu, Fangchao Dong, Defei Yang, Eve Bohnett, Li An

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Florida(佛罗里达大学) Auburn University(奥本大学)

专题命中 VLM训练与架构 :vision language model(title);分类 cs.CV、cs.AI

AI总结 本研究提出轻量级多模态适应框架,用于提升视觉语言模型在无人机热成像中的物种识别与栖息地上下文解释能力,通过热数据集优化模型性能,实现从RGB到热辐射的高效迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06126 2026-04-08 cs.LG cs.AI 73%

Gym-Anything: Turn any Software into an Agent Environment

Gym-Anything: 将任意软件转化为智能体环境

Pranjal Aggarwal, Graham Neubig, Sean Welleck

机构 * CMU(卡内基梅隆大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Gym-Anything框架,通过多智能体任务将任意软件转化为交互式计算机使用环境,生成涵盖医疗、天文、工程等领域的10K+长周期任务,提升现实场景下的智能体研究效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05839 2026-04-08 cs.AI 70%

Vision-Guided Iterative Refinement for Frontend Code Generation

基于视觉引导的前端代码生成迭代精修

Hannah Sansford, Derek H. C. Law, Wei Liu, Abhishek Tripathi, Niresh Agarwal, Gerrit J. J. van den Burg

机构 * School of Mathematics, University of Bristol, UK(英国布里斯托大学数学学院) Amazon AGI(亚马逊AGI)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 本文提出一种全自动的批评者循环框架,利用视觉语言模型提供结构化反馈以指导代码生成的迭代优化,实验证明其在前端开发中能显著提升代码质量。

Comments Accepted at ICLR 2026 Workshop on AI with Recursive Self-Improvement

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05601 2026-04-08 cs.CV 70%

ID-Selection: Importance-Diversity Based Visual Token Selection for Efficient LVLM Inference

基于重要性与多样性的视觉令牌选择:用于高效大视觉-语言模型推理

Zhaohong Huang, Wenjing Liu, Yuxin Zhang, Fei Chao, Rongrong Ji

机构 * Xiamen University(厦门大学)

专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV

AI总结 本文提出ID-Selection方法,结合重要性估计与多样性意识迭代选择,有效平衡令牌重要性与多样性,在极端剪枝比下实现高效推理与性能保持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07833 2026-04-08 cs.CV 70%

MIMIC: Multimodal Inversion for Model Interpretation and Conceptualization

MIMIC:多模态逆向用于模型解释与概念化

Animesh Jain, Alexandros Stergiou

机构 * University of Twente(特温特大学)

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出MIMIC框架,通过逆向处理多模态模型内部编码,提升模型可解释性与概念化能力,采用联合逆向与特征对齐目标,结合三种正则化器提升空间对齐、图像平滑与语义真实度。

Comments Accepted at CVPRw 2026 - How Do Vision Models Work? (HOW) Workshop, Project page: https://anaekin.github.io/MIMIC

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06079 2026-04-08 cs.CV cs.AI 62%

Scientific Graphics Program Synthesis via Dual Self-Consistency Reinforcement Learning

通过双自一致性强化学习实现科学图形程序合成

Juekai Lin, Yun Zhu, Honglin Lin, Sijing Li, Tianwei Lin, Zheng Liu, Xiaoyang Wang, Wenqiao Zhang, Lijun Wu

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory, OpenDataLab(上海人工智能实验室,OpenDataLab) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出双自一致性强化学习框架,结合高质量数据集和多维基准,提升科学图形到可编辑TikZ代码的转换能力,实现视觉与结构的高精度优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10075 2026-04-08 cs.CV cs.GR cs.LG 62%

Thinking Like Van Gogh: Structure-Aware Style Transfer via Flow-Guided 3D Gaussian Splatting

像梵高一样思考:通过流引导的3D高斯点划法实现结构感知的风格迁移

Lebin Zhou, Jingchuan Xiao, Zhendong Wang, Jinhao Wang, Rongduo Han, Nam Ling, Cihan Ruan

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出一种流引导的3D高斯点划法框架,通过将二维艺术运动转换为三维高斯几何,实现结构感知的风格迁移,同时采用亮度-结构解耦策略和VLM-as-a-Judge评估框架,提升艺术真实感。

Comments 7 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05445 2026-04-08 cs.CL cs.AI cs.CV 62%

Learning What Matters: Dynamic Dimension Selection and Aggregation for Interpretable Vision-Language Reward Modeling

学习什么重要:可解释视觉语言奖励建模的动态维度选择与聚合

Qiyuan Chen, Hongsen Huang, Jiahe Chen, Qian Shao, Jintai Chen, Hongxia Xu, Renjie Hua, Chuan Ren, Jian Wu

机构 * Zhejiang University(浙江大学) Soochow Securities Co.,Ltd.(东吴证券股份有限公司) HKUST(GZ)(香港科技大学(广州)) Nanjing University(南京大学)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VL-MDR框架,通过动态分解评价为细粒度可解释维度,提升视觉语言奖励建模的可解释性与效率,实验显示其在基准测试中优于现有模型,并有效缓解视觉幻觉。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05831 2026-04-08 cs.LG cs.AI 62%

HeartcareGPT: A Unified Multimodal ECG Suite for Dual Signal-Image Modeling and Understanding

HeartcareGPT:一种统一的多模态ECG套件,用于双信号-图像建模与理解

Yihan Xie, Sijing Li, Tianwei Lin, Zhuonan Wang, Chenglin Yang, Yu Zhong, Wenjie Yan, Wenqiao Zhang, Xiaogang Guo, Jun Xiao, Yueting Zhuang, Beng Chin Ooi

机构 * Zhejiang University(浙江大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出HeartcareGPT,通过Dual Stream Projection Alignment机制,实现ECG信号与图像的统一建模,提升多视角ECG理解能力,并建立医学多模态大语言模型向生理信号领域扩展的方法论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00727 2026-04-08 cs.LG cs.CR cs.CV 62%

Perturb and Recover: Fine-tuning for Effective Backdoor Removal from CLIP

扰动与恢复:用于从CLIP中有效移除后门的微调

Naman Deep Singh, Francesco Croce, Matthias Hein

机构 * University of Tübingen & Tübingen AI Center(蒂宾根大学 & 蒂宾根人工智能中心) EPFL(瑞士联邦理工学院洛桑)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出PAR机制,通过微调有效移除CLIP中的后门,实验表明其在不同编码器和攻击类型上均能保持良好性能,且无需真实训练数据。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07310 2026-04-08 cs.CV 57%

MATRIX: Mask Track Alignment for Interaction-aware Video Generation

MATRIX:用于交互感知视频生成的遮罩跟踪对齐

Siyoon Jin, Seongchan Kim, Dahyun Chung, Jaeho Lee, Hyunwook Choi, Jisu Nam, Jiyoung Kim, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能系)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

AI总结 MATRIX通过引入遮罩跟踪对齐方法,提升视频生成中交互感知能力,增强语义对齐与传播,减少漂移和幻觉。

Comments Project Page is available at: https://cvlab-kaist.github.io/MATRIX/, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05180 2026-04-08 cs.CV 57%

MIRAGE: Benchmarking and Aligning Multi-Instance Image Editing

MIRAGE:多实例图像编辑的基准测试与对齐

Ziqian Liu, Stephan Alaniz

机构 * LTCI, Télécom Paris, Institut Polytechnique de Paris, France(法国巴黎理工学院电信巴黎分校LTCI实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出MIRAGE框架,通过多分支并行去噪策略实现精确多实例编辑,解决现有方法在多实例和复合指令下的过度编辑和空间错位问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09746 2026-04-08 cs.MA 50%

Multi-Agent Cooperative Learning for Robust Vision-Language Alignment under OOD Concepts

多智能体协作学习用于应对异常概念下的鲁棒视觉语言对齐

Philip Xu

专题命中 VLM训练与架构 :vision-language model(abstract)

AI总结 本文提出多智能体协作学习框架,通过结构化信息传递缓解模态不平衡,提升视觉语言模型在异常概念下的对齐性能,实验表明在少样本和零样本设置中精度提升1-5%。

Comments arXiv admin note: This submission has been withdrawn by arXiv administrators due to incorrect authorship. Author list truncated

详情

展开后加载摘要…

URL PDF HTML 收藏