arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-07 至 2026-04-07 共收录 8 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 8 篇

2604.04145 2026-04-07 cs.AI 86%

Solar-VLM: Multimodal Vision-Language Models for Augmented Solar Power Forecasting

Solar-VLM:用于增强太阳能发电预测的多模态视觉语言模型

Hang Fan, Haoran Pei, Runze Liang, Weican Liu, Long Cheng, Wei Wei

机构 * North China Electric Power University(华北电力大学) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(title);分类 cs.AI

AI总结 本文提出Solar-VLM框架,通过融合时序观测、卫星图像和文本天气信息,提升太阳能发电预测的准确性,采用多模态编码器和图注意力网络捕捉空间依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04863 2026-04-07 cs.CV 83%

Beyond the Global Scores: Fine-Grained Token Grounding as a Robust Detector of LVLM Hallucinations

超越全局评分:细粒度令牌接地作为检测LVLM幻觉的稳健检测器

Tuan Dung Nguyen, Minh Khoi Ho, Qi Chen, Yutong Xie, Nguyen Cam-Tu, Minh Khoi Nguyen, Dang Huy Pham Nguyen, Anton van den Hengel, Johan W. Verjans, Phi Le Nguyen, Vu Minh Hieu Phan

机构 * Hanoi University of Science and Technology(河内科技大学) Australian Institute for Machine Learning, University of Adelaide(澳大利亚机器学习研究所,阿德莱德大学) Nanjing University(南京大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Hanoi-Amsterdam High School for the Gifted(河内阿姆斯特丹天才高中)

专题命中 VLM训练与架构 :grounding(title);vision-language model(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 本文提出细粒度令牌接地方法,通过分析模型层间令牌交互,发现幻觉令牌的扩散注意力模式和语义对齐失败特征,实现90%的幻觉检测准确率。

Comments Accepted at CVPR2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04488 2026-04-07 cs.CV cs.LG 81%

A Patch-based Cross-view Regularized Framework for Backdoor Defense in Multimodal Large Language Models

基于补丁的跨视图正则化框架用于多模态大语言模型中的后门防御

Tianmeng Fang, Yong Wang, Zetai Kong, Zengzhen Su, Jun Wang, Chengjin Yu, Wei Wang

机构 * Singapore Management University(新加坡管理大学) China University of Mining and Technology(中国矿业大学) The University of Melbourne(墨尔本大学) Anhui University(安徽大学) Xi’an Jiaotong University(西安交通大学) Sun Yat-sen University(中山大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV、cs.LG

AI总结 本文提出一种基于补丁增强和跨视图正则化的统一后门防御框架,通过约束特征表示和输出分布层面的异常行为,有效降低后门攻击成功率并保持正常生成能力。

Comments 26 pages, 3 figures. Subjects: Machine Learning (cs.LG)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03980 2026-04-07 cs.CV cs.AI 81%

Gram-Anchored Prompt Learning for Vision-Language Models via Second-Order Statistics

基于二阶统计的Gram锚定提示学习用于视觉-语言模型

Minglei Chen, Weilong Wang, Jiang Duan, Ye Deng

机构 * Southwestern University of Finance and Economics(西南财经大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出GAPL框架,通过引入Gram矩阵增强局部语义对齐与全局结构一致性,解决传统一阶特征在领域偏移下的鲁棒性不足问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04905 2026-04-07 cs.CV cs.GR cs.HC 70%

ClickAIXR: On-Device Multimodal Vision-Language Interaction with Real-World Objects in Extended Reality

ClickAIXR: 基于设备的多模态视觉-语言交互与现实世界对象在扩展现实中的交互

Dawar Khan, Alexandre Kouyoumdjian, Xinyu Liu, Omar Mena, Dominik Engel, Ivan Viola

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 ClickAIXR通过设备端视觉-语言模型与基于控制器的对象选择方法,实现对现实世界对象的精确点击交互,提升隐私和延迟方面的可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01554 2026-04-07 cs.LG cs.AI cs.CV 67%

InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs

InfoTok: 基于信息理论的容量受限共享视觉标记化在统一多模态大语言模型中的应用

Lv Tang, Tianyi Zheng, Bo Li, Xingyu Li

机构 * University of Alberta(阿尔伯塔大学) vivo Mobile Communication Co., Ltd(维沃移动通信有限公司)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出InfoTok,一种基于信息瓶颈原理的信息正则化标记化机制,通过互信息约束平衡压缩与任务相关性,提升统一多模态大语言模型的图像理解和生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04857 2026-04-07 cs.CV 57%

The Blind Spot of Adaptation: Quantifying and Mitigating Forgetting in Fine-tuned Driving Models

适应的盲区:量化和缓解在微调驾驶模型中的遗忘

Runhao Mao, Hanshi Wang, Yixiang Yang, Qianli Ma, Jingmeng Zhou, Zhipeng Zhang

机构 * AutoLab, School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院AutoLab实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文首次系统研究驾驶模型中灾难性遗忘问题,提出Drive Expert Adapter框架,通过提示空间适应提升驾驶性能并保留通用能力。

Comments received by cvpr2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04183 2026-04-07 cs.CV 57%

Scale-Aware Vision-Language Adaptation for Extreme Far-Distance Video Person Re-identification

面向极端远距离视频人的规模感知视觉语言适应

Ashwat Rajbhandari, Bharatesh Chakravarthi

机构 * Arizona State University(亚利桑那州立大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出一种基于CLIP的视觉语言模型,通过升级视觉主干和引入选择性微调机制,提升远距离视频人重识别的鲁棒性,实验表明在DetReIDX基准上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏