arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-04 至 2026-05-04 共收录 9 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 9 篇

2605.00480 2026-05-04 cs.CV 89%

Leveraging Vision-Language Models as Weak Annotators in Active Learning

利用视觉语言模型作为弱标注器在主动学习中的应用

Phuong Ngoc Nguyen, Kaito Shiku, Ryoma Bise, Seiichi Uchida, Shinnosuke Matsuo

机构 * Kyushu University(九州大学)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出结合细粒度人工标注与粗粒度VLM生成弱标注的主动学习框架,通过实例级标注分配和系统噪声建模,在CUB200和FGVC-Aircraft数据集上优于现有方法。

Comments Accepted at ICIP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00583 2026-05-04 cs.CV cs.AI cs.LG 87%

Jailbreaking Vision-Language Models Through the Visual Modality

通过视觉模态 jailbreak 视觉-语言模型

Aharon Azulay, Jan Dubiński, Zhuoyun Li, Atharv Mittal, Yossi Gandelsman

机构 * Warsaw University of Technology(华沙理工大学) NASK National Research Institute(波兰国家研究研究院) University of Liverpool(利物浦大学) Indian Institute of Technology Roorkee(印度理工学院拉胡尔分校) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出四种利用视觉组件的 jailbreak 攻击,揭示了文本安全训练无法自动推广到视觉传达的有害意图,展示了视觉模态在安全对齐中的关键作用。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18064 2026-05-04 cs.CV 84%

Adapting Large VLMs with Iterative and Manual Instructions for Generative Low-light Enhancement

适配大型视觉语言模型以生成低光照增强

Xiaoran Sun, Liyan Wang, Yeying Jin, Kin-man Lam, Zhixun Su, Yang Yang, Jinshan Pan, Cong Wang

机构 * Dalian University of Technology(大连理工大学) National University of Singapore(新加坡国立大学) Hong Kong Polytechnic University(香港理工大学) University of California, San Francisco(加州大学旧金山分校) Nanjing University of Science and Technology(南京理工大学)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 本文提出VLM-IMI框架,通过迭代和手动指令适配大型视觉语言模型,用于生成低光照增强。该框架包含正常光照指令先验生成和指令感知光照增强扩散两个分支,通过融合模块整合跨模态先验,提升生成效果。

Comments 11 papers,8 figures, CVPR2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00347 2026-05-04 cs.LG cs.AI cs.CL 79%

Odysseus: Scaling VLMs to 100+ Turn Decision-Making in Games via Reinforcement Learning

Odysseus:通过强化学习扩展VLMs以实现游戏中的100+回合决策

Chengshuai Shi, Wenzhe Li, Xinran Liang, Yizhou Lu, Wenjia Yang, Ruirong Feng, Seth Karten, Ziran Yang, Zihan Ding, Gabriel Sarch, Danqi Chen, Karthik Narasimhan, Chi Jin

机构 * Princeton Language and Intelligence(普林斯顿语言与智能实验室) Princeton University(普林斯顿大学) Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了通过强化学习训练VLMs进行长回合决策,提出轻量级回合级批评机改进训练稳定性,利用预训练VLMs提升样本效率,引入Odysseus框架在多个游戏层级取得显著进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02327 2026-05-04 cs.CV 70%

PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance

PPLLaVA:通过提示引导的视频序列理解

Shangkun Sun, Ruyang Liu, Haoran Tang, Yixiao Ge, Haibo Lu, Wei Gao, Jiankun Yang, Chen Li

机构 * Peng Cheng Laboratory(鹏城实验室) Peking University(北京大学) XPeng Inc.(小鹏汽车有限公司) Ministry of Industry and Information Technology of the People’s Republic of China, China Electronics Standardization Institute, Beijing, China(中华人民共和国工业和信息化部,中国电子标准化研究院,北京,中国)

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);分类 cs.CV

AI总结 PPLLaVA通过提示引导的池化策略实现视频序列高效理解,减少18倍token,提升推理效率并在多种视频理解任务中取得最佳性能。

Comments Accepted to ICLR' 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00371 2026-05-04 cs.SD cs.AI 70%

GaMMA: Towards Joint Global-Temporal Music Understanding in Large Multimodal Models

GaMMA:迈向大规模多模态模型中的联合全局-时间音乐理解

Zuyao You, Zhesong Yu, Mingyu Liu, Bilei Zhu, Yuan Wan, Zuxuan Wu

机构 * Fudan University(复旦大学)

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);分类 cs.AI

AI总结 GaMMA通过融合音频编码器和跨模态学习,实现音乐内容的全面理解,并在MusicBench基准测试中取得新高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00789 2026-05-04 cs.CV cs.AI cs.LG 67%

Make Your LVLM KV Cache More Lightweight

使大型视觉-语言模型的KV缓存更轻量

Xihao Chen, Yangyang Guo, Roger Zimmermann

机构 * Integrative Sciences and Engineering Programme, National University of Singapore(国立新加坡大学整合科学与工程学程) School of Computing, National University of Singapore(国立新加坡大学计算机学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出LightKV方法,通过利用视觉token嵌入的冗余性,减少KV缓存大小,提升解码效率并降低GPU内存消耗。

Comments Accepted to Transactions on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22908 2026-05-04 cs.CV cs.LG 62%

Adaptive Dual-Teacher Distillation with Subnetwork Rectification for Bridging Semantic Gaps in Black-Box Domain Adaptation

自适应双教师蒸馏与子网络校正用于桥接黑盒领域适应中的语义间隙

Zhe Zhang, Jing Li, Wanli Xue, Xu Cheng, Jianhua Zhang, Qinghua Hu, Shengyong Chen

机构 * School of Computer Science and Engineering, Tianjin University of Technology(天津理工大学计算机科学与工程学院) School of Artificial Intelligence, Tianjin University(天津大学人工智能学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出DDSR框架,通过自适应预测融合策略和子网络正则化机制,解决黑盒领域适应中任务特定知识与语言对齐语义先验的不一致问题,提升领域适应性能。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00475 2026-05-04 cs.RO cs.CV 57%

MSACT: Multistage Spatial Alignment for Stable Low-Latency Fine Manipulation

MSACT:多阶段空间对齐用于稳定低延迟精细操控

Xianbo Cai, Hideyuki Ichiwara, Masaki Yoshikawa, Tetsuya Ogata

机构 * Department of Intermedia Art and Science, Waseda University(武藏大学多媒体艺术与科学系) National Institute of Advanced Industrial Science and Technology (AIST)(国家先进工业科学与技术研究院)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

AI总结 本文提出MSACT,通过多阶段空间对齐模块提升低延迟精细操控的稳定性,结合预训练ResNet视觉先验,增强视觉到动作的映射稳定性,实验证明在模拟和真实任务中提升了定位稳定性和任务性能。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏