arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-01 至 2026-05-01 共收录 54 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 18 篇

2504.08678 2026-05-01 cs.SE cs.HC 50%

The Ultimate Configuration Management Tool? Lessons from a Mixed Methods Study of Ansible's Challenges

终极配置管理工具?来自对Ansible挑战的混合方法研究的启示

Carolina Carreira, Nuno Saavedra, Alexandra Mendes, João F. Ferreira

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文通过混合方法研究Ansible面临的挑战,揭示了改进Ansible的关键方向,包括增强故障本地性、明确语言与模板边界、针对性文档和改进执行后端,为配置管理工具设计提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27000 2026-05-01 cs.SE cs.CR cs.PL 50%

Adaptive and AI-Augmented Security Testing: A Systematic Survey of Program Analysis, Feedback-Driven Testing, and Hybrid Learning-Based Approaches

自适应与AI增强的安全测试:程序分析、反馈驱动测试和基于混合学习方法的系统性综述

Michael Wienczkowski

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文系统综述了自适应和AI增强的安全测试研究,探讨了程序分析、DevSecOps、反馈驱动模糊测试、LLM自动化测试生成及混合系统等五个领域,揭示了结构化程序表示与自适应测试机制之间的断层,并提出五个开放研究挑战。

Comments 29 pages, submitted for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21995 2026-05-01 cs.HC 50%

Emergent Technology, Emergent Critique: Students and Teachers Developing Critical AI Literacy through Participatory Design around Generative AI

涌现技术,涌现批判:学生和教师通过参与式设计围绕生成式AI发展批判性AI素养

Santiago Ojeda-Ramirez, Eva Durall Gazulla, Kylie Peppler

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文探讨学生和教师通过参与式设计发展批判性AI素养,揭示了共同质疑AI假设、互补学习和基于文化知识的AI批判三种核心实践。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 文档图表理解 2 篇

2604.25186 2026-05-01 cs.CV cs.CE cs.MM 70%

FCMBench-Video: Benchmarking Document Video Intelligence

FCMBench-Video:文档视频智能基准测试

Runze Cui, Fangxin Shang, Yehui Yang, Qing Yang, Yanwu Xu, Tao Chen

机构 * AI Lab, Qifu Technology(启赋科技AI实验室) College of Future Information Technology, Fudan University(复旦大学未来信息学院) School of Future Technology, South China University of Technology(华南理工大学未来技术学院) Pazhou Lab(琶洲实验室)

专题命中 文档图表理解 :grounding(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出FCMBench-Video基准测试,用于评估文档视频理解中的文档感知、时间定位和证据推理能力,通过真实场景数据验证系统性能,揭示不同任务的敏感性和能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27361 2026-05-01 cs.CV cs.GR 57%

CasLayout: Cascaded 3D Layout Diffusion for Indoor Scene Synthesis with Implicit Relation Modeling

CasLayout:基于级联3D布局扩散的室内场景合成与隐式关系建模

Yingrui Wu, Youkang Kong, Mingyang Zhao, Weize Quan, Dong-Ming Yan, Yang Liu

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences and School of Artificial Intelligence, University of Chinese Academy of Sciences(MAIS,自动化研究所,中国科学院,人工智能学院,中国科学院大学) Tsinghua University(清华大学) SKLMS, Academy of Mathematics and Systems Science, Chinese Academy of Sciences(系统科学研究所,中国科学院) Microsoft Research Asia(微软亚洲研究院)

专题命中 文档图表理解 :vision language model(abstract);分类 cs.CV

AI总结 CasLayout通过级联扩散框架将场景生成分解为四个阶段,结合物理与语义约束,提升生成效率与可控性,实现高质量室内场景合成。

Comments SIGGARPH 2026 (Journal Track), Code: https://github.com/YingruiWoo/CasLayout

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与屏幕智能体 7 篇

2601.06394 2026-05-01 cs.CV cs.AI 91%

Context Matters: Peer-Aware Student Behavioral Engagement Measurement via VLM Action Parsing and LLM Sequence Classification

语境至关重要:通过VLM动作解析和LLM序列分类进行同伴感知的学生行为参与度测量

Ahmed Abdelkawy, Ahmed Elsayed, Asem Ali, Aly Farag, Thomas Tretter, Michael McIntyre

机构 * University of Louisville(路易斯维尔大学)

专题命中 GUI与屏幕智能体 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种三阶段框架,通过VLM动作识别和LLM序列分类,结合课堂语境中的同伴行为,有效测量学生参与度。

Comments accepted to the Computer Vision for Education (CV4Edu) workshop, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27974 2026-05-01 cs.CV cs.DB 83%

FineState-Bench: Benchmarking State-Conditioned Grounding for Fine-grained GUI State Setting

FineState-Bench:面向细粒度GUI状态设置的状态条件化基准测试

Fengxian Ji, Jingpu Yang, Zirui Song, Yuanxi Wang, Zhexuan Cui, Yuke Li, Qian Jiang, Xiuying Chen

机构 * MBZUAI, United Arab Emirates(阿联酋MBZUAI研究院) Northeastern University, China(中国东北大学)

专题命中 GUI与屏幕智能体 :grounding(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 FineState-Bench通过精确目标状态评估,检验智能体能否正确映射指令至UI控件,提出FineState-Metrics与VDA诊断工具,实验显示视觉接地仍有提升空间,但整体准确率不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27419 2026-05-01 cs.AI cs.CL 77%

InteractWeb-Bench: Can Multimodal Agent Escape Blind Execution in Interactive Website Generation?

InteractWeb-Bench: 多模态代理能否在交互式网站生成中避免盲目执行?

Qiyao Wang, Haoran Hu, Longze Chen, Hongbo Wang, Hamid Alinejad-Rokny, Yuan Lin, Min Yang

机构 * Shenzhen Institute of Advanced Technology Chinese Academy of Sciences(深圳先进技术研究院中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Dalian University of Technology(大连理工大学) UNSW Sydney(悉尼大学) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 GUI与屏幕智能体 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出InteractWeb-Bench,首个针对非专家低代码用户的多模态交互基准,通过模拟用户行为中的模糊性、冗余性和矛盾性,揭示前沿多模态大语言模型在意图识别和适应性交互上的局限。

Comments 21 pages, 13 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13559 2026-05-01 cs.AI 77%

OpAgent: Operator Agent for Web Navigation

OpAgent:网页导航的运算代理

Yuyu Guo, Wenjie Yang, Siyuan Yang, Ziyang Liu, Cheng Chen, Yuan Wei, Yun Hu, Yang Huang, Guoliang Hao, Dongsheng Yuan, Jianming Wang, Xin Chen, Hang Yu, Lei Lei, Peng Di

机构 * Ant Group(蚂蚁集团)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.AI

AI总结 本文提出OpAgent,通过在线强化学习优化网页导航策略,结合层级多任务微调和混合奖励机制,实现71.6%的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27620 2026-05-01 cs.CV 70%

SpaAct: Spatially-Activated Transition Learning with Curriculum Adaptation for Vision-Language Navigation

SpaAct:基于课程适应的空间激活转换学习用于视觉语言导航

Pengna Li, Kangyi Wu, Shaoqing Xu, Fang Li, Hanbing Li, Lin Zhao, Kailin Lyu, Long Chen, Zhi-Xin Yang, Nanning Zheng

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家重点实验室) National Engineering Research Center for Visual Information and Applications(视觉信息与应用国家工程研究中心) Institute of Artificial Intelligence and Robotics(人工智能与机器人研究所) The State Key Laboratory of Internet of Things for Smart City(智能城市物联网国家重点实验室) Centre for Artificial Intelligence and Robotics(人工智能与机器人中心) University of Macau(澳门大学) Xiaomi EV(小i EV) School of Automation(自动化学院) Beijing Institute of Technology(北京理工大学) Institute of Automation(自动化研究所) Chinese Academy of Sciences(中国科学院)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 SpaAct通过引入空间激活任务和课程适应方法,提升视觉语言导航中动态空间感知能力,实现更高效的导航性能。

Comments Submmited to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27253 2026-05-01 cs.AI 70%

AutoSurfer -- Teaching Web Agents through Comprehensive Surfing, Learning, and Modeling

AutoSurfer -- 通过全面浏览、学习和建模教学网络代理

Fazle Elahi Faisal, Qianhui Wu, Baolin Peng, Jianfeng Gao

机构 * Microsoft Research(微软研究院)

专题命中 GUI与屏幕智能体 :grounding(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 AutoSurfer通过系统性广度优先探索策略、任务合成引导和轨迹优化,实现全面覆盖网站操作空间,提升网络代理轨迹生成的准确性和多样性。

Comments 21 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12844 2026-05-01 cs.CV 70%

GuideDog: A Real-World Egocentric Multimodal Dataset for Blind and Low-Vision Accessibility-Aware Guidance

GuideDog: 一种用于视障和低视力者无障碍引导的现实世界单人视角多模态数据集

Junhyeok Kim, Jaewoo Park, Junhee Park, Sangeyl Lee, Jiwan Chung, Jisung Kim, Ji Hoon Joung, Youngjae Yu

机构 * Yonsei University(延世大学) LG AI Research(LG AI研究所) Euler Robotics(Euler机器人) Seoul National University(首尔国立大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 本文提出GuideDog数据集,包含22K图像描述对,用于提升视障者导航能力,通过人机协同标注提升数据质量,并展示深度感知评估基准,揭示当前多模态大语言模型在深度感知方面的挑战。

Comments ACL 2026 Main. Project page: https://jun297.github.io/GuideDog/

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与鲁棒性 3 篇

2604.27414 2026-05-01 cs.CV cs.CR cs.LG 86%

Understanding Adversarial Transferability in Vision-Language Models for Autonomous Driving: A Cross-Architecture Analysis

理解视觉语言模型在自动驾驶中的对抗转移性:跨架构分析

David Fernandez, Pedram MohajerAnsari, Amir Salarpour, Mert D. Pese

机构 * School of Computing, Clemson University, USA(克莱姆森大学计算机学院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.LG

AI总结 本文通过跨架构研究探讨视觉语言模型在自动驾驶中的对抗转移性,评估了三种架构在不同场景下的对抗效果,发现高跨架构有效性。

Comments 9 pages, 2 figures. Accepted at SAE WCX 2026

Journal ref SAE Technical Paper 2026-01-0170, SAE WCX 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02671 2026-05-01 cs.CV 84%

Test-Time Distillation for Continual Model Adaptation

测试时蒸馏用于持续模型适应

Xiao Chen, Jiazhen Huang, Zhiming Liu, Qinting Jiang, Fanding Huang, Jingyan Jiang, Zhi Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Shenzhen Technology University(深圳技术大学)

专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 本文提出CoDiRe框架,通过动态融合VLM和目标模型预测构建鲁棒教师,利用MSP缓解熵偏见,通过最优传输对齐预测,实现稳定持续适应,优于现有方法。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26327 2026-05-01 eess.AS 50%

Dual-LoRA: Parameter-Efficient Adversarial Disentanglement for Cross-Lingual Speaker Verification

Dual-LoRA: 交叉语言说话人验证中的参数高效对抗解缠

Qituan Shangguan, Junhao Du, Kunyang Peng, Feng Xue, Hui Zhang, Xinsheng Wang, Kai Yu, Shuai Wang

专题命中 幻觉与鲁棒性 :grounding(abstract)

AI总结 本文提出Dual-LoRA,通过注入可训练任务因子化LoRA适配器解决交叉语言说话人验证中的语言-说话人纠缠问题,采用语言锚定对抗器提升说话人区分度。

Comments Submitted to Interspeech 2026; 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

5. VLM训练与架构 8 篇

2507.12414 2026-05-01 cs.CV cs.AI cs.LG cs.RO 87%

AutoVDC: Automated Vision Data Cleaning Using Vision-Language Models

AutoVDC:利用视觉-语言模型实现自动化视觉数据清洗

Santosh Vasa, Aditi Ramadwar, Jnana Rama Krishna Darabattula, Md Zafar Anwar, Stanislaw Antol, Andrei Vatavu, Thomas Monninger, Sihao Ding

机构 * Mercedes-Benz Research & Development North America(梅赛德斯-奔驰北美研发公司) University of Stuttgart, Institute for Artificial Intelligence(斯图加特大学人工智能研究所)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出AutoVDC框架,利用视觉-语言模型自动识别视觉数据集中的错误标注,提升数据质量。通过KITTI和nuImages数据集验证,展示了方法在错误检测和数据清洗中的高性能。

Comments Accepted to IV 2026 Drive-X Foundation Models for Autonomous Driving (Oral presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27953 2026-05-01 cs.AI cs.CV 86%

The Effects of Visual Priming on Cooperative Behavior in Vision-Language Models

视觉提示对视觉语言模型合作行为的影响

Kenneth J. K. Ong

机构 * ST Engineering, Singapore(1 ST工程,新加坡)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文研究了视觉提示如何影响视觉语言模型在囚徒困境中的合作行为,通过图像内容和颜色奖励矩阵实验,发现图像内容和颜色提示对模型决策模式有影响,不同模型的敏感性和缓解效果各异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28169 2026-05-01 cs.CV cs.AI cs.LG 80%

PhyCo: Learning Controllable Physical Priors for Generative Motion

PhyCo:学习可控制的物理先验以生成运动

Sriram Narayanan, Ziyu Jiang, Srinivasa Narasimhan, Manmohan Chandraker

机构 * Carnegie Mellon University(卡内基梅隆大学) NEC Labs America(NEC美国实验室) UC San Diego(圣地亚哥大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 PhyCo通过整合物理可控的生成模型,实现了在视频生成中物理一致性和可控性的提升,无需模拟器或几何重建。

Comments CVPR 2026. Project Page: https://phyco-video.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27715 2026-05-01 cs.CV 79%

Improving Calibration in Test-Time Prompt Tuning for Vision-Language Models via Data-Free Flatness-Aware Prompt Pretraining

通过数据无关的平坦性感知提示预训练提升视觉语言模型测试时提示调优的校准

Hyeonseo Jang, Jaebyeong Jeon, Joong-Won Hwang, Kibok Lee

机构 * Yonsei University(延世大学) ETRI(韩国电子技术研究院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出FPP框架,通过在提示初始化时选择平坦区域,提升测试时提示调优的校准和性能,无需额外标注数据和计算成本。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06033 2026-05-01 cs.CV 79%

Analysis of Blood Report Images Using General Purpose Vision-Language Models

使用通用视觉-语言模型分析血检报告图像

Nadia Bakhsheshi, Hamid Beigy

机构 * Sharif University of Technology(谢里夫理工学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文探讨了通用视觉-语言模型在自动分析血检报告图像中的应用,通过比较三种模型在100张不同血检图像上的表现,验证了其在初步分析中的潜力。

Comments 4 pages , 3 figures , This paper has been submitted to the IEEE-affiliated ICBME Conference (Iran), 2025, and is currently under review. DOR number: [20.1001.2.0425023682.1404.10.1.440.7]

Journal ref Proc. 2025 32nd ICBME, IEEE, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27002 2026-05-01 cs.CR 67%

Membership Inference Attacks Against Video Large Language Models

针对视频大语言模型的成员推断攻击

Wei Song, Yuxin Cao, Ziqi Ding, Yi Liu, Gelei Deng, Yuekang Li

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn)

AI总结 本文研究了针对视频大语言模型的黑盒成员推断攻击,通过温度扰动生成与视频感知难度特征结合,验证了视频大语言模型对隐私风险的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22500 2026-05-01 cs.CV cs.AI 62%

OR-VSKC: Resolving Visual-Semantic Knowledge Conflicts in Operating Rooms with Synthetic Data-Guided Alignment

OR-VSKC:通过合成数据引导对齐解决手术室中的视觉-语义知识冲突

Weiyi Zhao, Xiaoyu Tan, Liang Liu, Sijia Li, Youwei Song, Xihe Qiu

机构 * Shanghai University of Engineering Science(上海工程技术大学) Tencent YouTu Lab(腾讯优图实验室) Clinical Research Unit, Zhongshan Hospital of Fudan University(复旦大学中山医院临床研究部)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出OR-VSKC基准,通过合成数据引导对齐解决手术室中的视觉-语义知识冲突,评估多模态大语言模型的可靠性,并展示微调后的模型在未见视角上的鲁棒性。

Comments 13 pages, 5 figures. The dataset and appendix are available at https://github.com/zgg2577/VS-KC

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27393 2026-05-01 cs.CL 50%

MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction

MiniCPM-o 4.5:迈向实时全双工多模态交互

Junbo Cui, Bokai Xu, Chongyi Wang, Tianyu Yu, Weiyue Sun, Yingjing Xu, Tianran Wang, Zhihui He, Wenshuo Ma, Tianchi Cai, Jiancheng Gui, Luoyuan Zhang, Xian Sun, Fuwei Huang, Moye Chen, Zhuo Lin, Hanyu Liu, Qingxin Gui, Qingzhe Han, Yuyang Wen, Huiping Liu, Rongkang Wang, Yaqi Zhang, Hongliang Wei, Chi Chen, You Li, Kechen Fang, Jie Zhou, Yuxuan Li, Guoyang Zeng, Chaojun Xiao, Yankai Lin, Xu Han, Maosong Sun, Zhiyuan Liu, Yuan Yao

机构 * OpenBMB(开放大脑)

专题命中 VLM训练与架构 :multimodal large language model(abstract)

AI总结 MiniCPM-o 4.5通过实时全双工多模态交互技术,解决多模态交互中感知与响应分离及被动响应的问题,实现更接近人类水平的多模态交互能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他VLM 1 篇

2604.27553 2026-05-01 cs.CV 79%

Revealing the Impact of Visual Text Style on Attribute-based Descriptions Produced by Large Visual Language Models

揭示视觉文本风格对大型视觉语言模型生成的基于属性的描述的影响

Xiaomeng Wang, Martha Larson, Zhengyu Zhao

机构 * Radboud University(拉博德大学) Xi'an Jiaotong University(西安交通大学)

专题命中 其他VLM :visual language model(title,abstract);分类 cs.CV

AI总结 研究视觉文本风格如何影响大型视觉语言模型对概念属性的描述,发现即使正确识别概念,文本风格仍会影响模型输出,推动风格感知评估与缓解。

Comments Accepted by ICMR 2026. Code is available at https://github.com/XiaomengWang-AI/The-Impact-of-Visual-Text-style-on-Attribute-based-Descriptions-Produced-by-LVLMs

详情

展开后加载摘要…

URL PDF HTML 收藏