arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-23 至 2026-04-23 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 3 篇

2604.20012 2026-04-23 cs.CV cs.AI cs.CL 89%

EmbodiedMidtrain: Bridging the Gap between Vision-Language Models and Vision-Language-Action Models via Mid-training

EmbodiedMidtrain: 通过中训练弥合视觉语言模型与视觉语言动作模型之间的差距

Yiyang Du, Zhanqiu Guo, Xin Ye, Liu Ren, Chenyan Xiong

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Bosch Research North America & Bosch Center for Artificial Intelligence (BCAI)(博世北美研究部及博世人工智能中心(BCAI))

专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出EmbodiedMidtrain方法,通过中训练弥合视觉语言模型与视觉语言动作模型之间的差距,实验表明中训练能提升不同VLM骨干网络的性能,且在初始化阶段对VLA微调有显著帮助。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19905 2026-04-23 cs.SE 78%

ViBR: Automated Bug Replay from Video-based Reports using Vision-Language Models

ViBR:基于视频报告的自动化Bug回放

Sidong Feng, Dingbang Wang, Nikola Tomic, Tingting Yu, Aldeida Aleti, Chunyang Chen

专题命中 GUI与屏幕智能体 :vision-language model(title,abstract)

AI总结 本文提出ViBR,一种基于视觉-语言模型的自动化Bug回放方法,通过动作边界分割和区域感知的GUI状态比较,实现从GUI视频记录中自动复现Bug,实验表明其复现率达72%。

Comments accepted to FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26557 2026-04-23 cs.HC 50%

The Invisible Mentor: Inferring User Actions from Screen Recordings to Recommend Better Workflows

隐形导师:从屏幕记录推断用户行为以推荐更好的工作流程

Litao Yan, Andrew Head, Ken Milne, Vu Le, Sumit Gulwani, Chris Parnin, Emerson Murphy-Hill

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 本文提出InvisibleMentor系统,通过屏幕记录推断用户行为,推荐更高效的工作流程,优于传统依赖日志或用户提示的助手。

Comments 15 pages, 6 figures

Journal ref Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI '26), 1-17, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏