arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-01 至 2026-05-01 共收录 8 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 8 篇

2507.12414 2026-05-01 cs.CV cs.AI cs.LG cs.RO 87%

AutoVDC: Automated Vision Data Cleaning Using Vision-Language Models

AutoVDC:利用视觉-语言模型实现自动化视觉数据清洗

Santosh Vasa, Aditi Ramadwar, Jnana Rama Krishna Darabattula, Md Zafar Anwar, Stanislaw Antol, Andrei Vatavu, Thomas Monninger, Sihao Ding

机构 * Mercedes-Benz Research & Development North America(梅赛德斯-奔驰北美研发公司) University of Stuttgart, Institute for Artificial Intelligence(斯图加特大学人工智能研究所)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出AutoVDC框架,利用视觉-语言模型自动识别视觉数据集中的错误标注,提升数据质量。通过KITTI和nuImages数据集验证,展示了方法在错误检测和数据清洗中的高性能。

Comments Accepted to IV 2026 Drive-X Foundation Models for Autonomous Driving (Oral presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27953 2026-05-01 cs.AI cs.CV 86%

The Effects of Visual Priming on Cooperative Behavior in Vision-Language Models

视觉提示对视觉语言模型合作行为的影响

Kenneth J. K. Ong

机构 * ST Engineering, Singapore(1 ST工程,新加坡)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文研究了视觉提示如何影响视觉语言模型在囚徒困境中的合作行为,通过图像内容和颜色奖励矩阵实验,发现图像内容和颜色提示对模型决策模式有影响,不同模型的敏感性和缓解效果各异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28169 2026-05-01 cs.CV cs.AI cs.LG 80%

PhyCo: Learning Controllable Physical Priors for Generative Motion

PhyCo:学习可控制的物理先验以生成运动

Sriram Narayanan, Ziyu Jiang, Srinivasa Narasimhan, Manmohan Chandraker

机构 * Carnegie Mellon University(卡内基梅隆大学) NEC Labs America(NEC美国实验室) UC San Diego(圣地亚哥大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 PhyCo通过整合物理可控的生成模型,实现了在视频生成中物理一致性和可控性的提升,无需模拟器或几何重建。

Comments CVPR 2026. Project Page: https://phyco-video.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27715 2026-05-01 cs.CV 79%

Improving Calibration in Test-Time Prompt Tuning for Vision-Language Models via Data-Free Flatness-Aware Prompt Pretraining

通过数据无关的平坦性感知提示预训练提升视觉语言模型测试时提示调优的校准

Hyeonseo Jang, Jaebyeong Jeon, Joong-Won Hwang, Kibok Lee

机构 * Yonsei University(延世大学) ETRI(韩国电子技术研究院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出FPP框架,通过在提示初始化时选择平坦区域,提升测试时提示调优的校准和性能,无需额外标注数据和计算成本。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06033 2026-05-01 cs.CV 79%

Analysis of Blood Report Images Using General Purpose Vision-Language Models

使用通用视觉-语言模型分析血检报告图像

Nadia Bakhsheshi, Hamid Beigy

机构 * Sharif University of Technology(谢里夫理工学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文探讨了通用视觉-语言模型在自动分析血检报告图像中的应用,通过比较三种模型在100张不同血检图像上的表现,验证了其在初步分析中的潜力。

Comments 4 pages , 3 figures , This paper has been submitted to the IEEE-affiliated ICBME Conference (Iran), 2025, and is currently under review. DOR number: [20.1001.2.0425023682.1404.10.1.440.7]

Journal ref Proc. 2025 32nd ICBME, IEEE, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27002 2026-05-01 cs.CR 67%

Membership Inference Attacks Against Video Large Language Models

针对视频大语言模型的成员推断攻击

Wei Song, Yuxin Cao, Ziqi Ding, Yi Liu, Gelei Deng, Yuekang Li

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn)

AI总结 本文研究了针对视频大语言模型的黑盒成员推断攻击,通过温度扰动生成与视频感知难度特征结合,验证了视频大语言模型对隐私风险的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22500 2026-05-01 cs.CV cs.AI 62%

OR-VSKC: Resolving Visual-Semantic Knowledge Conflicts in Operating Rooms with Synthetic Data-Guided Alignment

OR-VSKC:通过合成数据引导对齐解决手术室中的视觉-语义知识冲突

Weiyi Zhao, Xiaoyu Tan, Liang Liu, Sijia Li, Youwei Song, Xihe Qiu

机构 * Shanghai University of Engineering Science(上海工程技术大学) Tencent YouTu Lab(腾讯优图实验室) Clinical Research Unit, Zhongshan Hospital of Fudan University(复旦大学中山医院临床研究部)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出OR-VSKC基准,通过合成数据引导对齐解决手术室中的视觉-语义知识冲突,评估多模态大语言模型的可靠性,并展示微调后的模型在未见视角上的鲁棒性。

Comments 13 pages, 5 figures. The dataset and appendix are available at https://github.com/zgg2577/VS-KC

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27393 2026-05-01 cs.CL 50%

MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction

MiniCPM-o 4.5:迈向实时全双工多模态交互

Junbo Cui, Bokai Xu, Chongyi Wang, Tianyu Yu, Weiyue Sun, Yingjing Xu, Tianran Wang, Zhihui He, Wenshuo Ma, Tianchi Cai, Jiancheng Gui, Luoyuan Zhang, Xian Sun, Fuwei Huang, Moye Chen, Zhuo Lin, Hanyu Liu, Qingxin Gui, Qingzhe Han, Yuyang Wen, Huiping Liu, Rongkang Wang, Yaqi Zhang, Hongliang Wei, Chi Chen, You Li, Kechen Fang, Jie Zhou, Yuxuan Li, Guoyang Zeng, Chaojun Xiao, Yankai Lin, Xu Han, Maosong Sun, Zhiyuan Liu, Yuan Yao

机构 * OpenBMB(开放大脑)

专题命中 VLM训练与架构 :multimodal large language model(abstract)

AI总结 MiniCPM-o 4.5通过实时全双工多模态交互技术,解决多模态交互中感知与响应分离及被动响应的问题,实现更接近人类水平的多模态交互能力。

详情

展开后加载摘要…

URL PDF HTML 收藏