arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-22 至 2026-04-22 共收录 7 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 7 篇

2602.02063 2026-04-22 cs.HC cs.AI 77%

See2Refine: Vision-Language Feedback Improves LLM-Based eHMI Action Designers

See2Refine:视觉语言反馈提升基于LLM的eHMI动作设计

Ding Xia, Xinyue Gui, Mark Colley, Fan Gao, Zhongyi Zhou, Dongyuan Li, Renhe Jiang, Takeo Igarashi

机构 * The University of Tokyo(东京大学) University College London(伦敦大学学院) Google(谷歌)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.AI

AI总结 See2Refine通过视觉语言模型的反馈机制,提升基于大语言模型的eHMI动作设计能力,实现无需人工干预的闭环改进,优于传统提示和人工指定基线。

Comments Accepted to ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19728 2026-04-22 cs.RO cs.AI cs.CV cs.LG cs.SE 75%

VLA Foundry: A Unified Framework for Training Vision-Language-Action Models

VLA Foundry:一种统一训练视觉-语言-动作模型的框架

Jean Mercat, Sedrick Keh, Kushal Arora, Isabella Huang, Paarth Shah, Haruki Nishimura, Shun Iwase, Katherine Liu

机构 * Toyota Research Institute(丰田研究院)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 VLA Foundry 提供了一个统一的训练框架,整合了大语言模型、视觉语言模型和视觉-语言-动作模型的训练,支持从头训练和预训练模型,并在 LBM Eval 模拟器上评估了闭合回路策略性能。

Comments 32 pages, 16 figures, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19710 2026-04-22 cs.CV 70%

SpanVLA: Efficient Action Bridging and Learning from Negative-Recovery Samples for Vision-Language-Action Model

SpanVLA: 一种高效的视觉-语言-动作模型,通过负样本恢复学习实现动作桥接与学习

Zewei Zhou, Ruining Yang, Xuewei, Qi, Yiluan Guo, Sherry X. Chen, Tao Feng, Kateryna Pistunova, Yishan Shen, Lili Su, Jiaqi Ma

机构 * University of California, Los Angeles, USA(加州大学洛杉矶分校) Motional, USA(Motional公司) Northeastern University, USA(东北大学)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出SpanVLA,一种端到端自动驾驶框架,结合自回归推理与流匹配动作专家,通过高效桥接和负样本恢复学习提升推理效率和鲁棒性。

Comments Project page: https://spanvla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19643 2026-04-22 cs.RO 67%

A Gesture-Based Visual Learning Model for Acoustophoretic Interactions using a Swarm of AcoustoBots

基于手势的视觉学习模型用于声学聚沉交互的声学机器人群

Alex Lin, Lei Gao, Narsimlu Kemsaram, Sriram Subramanian

机构 * Department of Computer Science University College London London United Kingdom(计算机科学系伦敦大学学院伦敦英国) Department of Artificial Intelligence University of Malaya Kuala Lumpur Malaysia(人工智能系马来大学吉隆坡马来西亚) University College London(伦敦大学学院) University of Malaya(马来大学)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn)

AI总结 本文提出基于手势的视觉学习框架,实现无接触人-机器人群交互,通过多模态AcoustoBot平台实现手势识别与触觉、音频、悬浮等模态映射,验证准确率提升至98%。

Comments This paper has been accepted for publication in the Proceedings of the 2026 4th International Conference on Robotics, Control and Vision Engineering (RCVE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18591 2026-04-22 cs.HC cs.AI 57%

SPRITE: From Static Mockups to Engine-Ready Game UI

SPRITE:从静态草图到引擎-ready的游戏UI

Yunshu Bai, RuiHao Li, Hao Zhang, Chien Her Lim, Ming Yan, Mengtian Li

机构 * Shanghai University(上海大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

AI总结 SPRITE通过整合视觉语言模型与结构化YAML表示,将静态截图转化为可编辑的引擎资产,提升了游戏UI开发的效率和准确性。

Comments CHI EA '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19536 2026-04-22 cs.RO 50%

LiveVLN: Breaking the Stop-and-Go Loop in Vision-Language Navigation

LiveVLN: 突破视觉语言导航中的停止与前进循环

Xiangchen Wang, Weiye Zhu, Teng Wang, TianTian Geng, Zekai Zhang, Zhiyuan Qi, Jinyu Yang, Feng Zheng

机构 * Southern University of Science and Technology(南方科技大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Spatialtemporal AI(时空AI)

专题命中 GUI与屏幕智能体 :VLM(abstract)

AI总结 LiveVLN通过增强预训练视觉语言导航器,实现更连续的具身导航,减少等待时间并提升动作可用性,实验证明在真实部署中显著提升执行效率。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19081 2026-04-22 cs.SE 50%

Proactive Detection of GUI Defects in Multi-Window Scenarios via Multimodal Reasoning

通过多模态推理主动检测多窗口场景中的GUI缺陷

Xinyao Zhang, Rui Wang, Jinhao Cui, Haotian Huang, Wei Xue, Wenhua Hu, Jianwen Xiang, Rui Hao

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract)

AI总结 本文提出一种端到端框架,通过主动触发多窗口状态,利用多模态大语言模型检测定位GUI缺陷,实验表明多窗口设置显著增加布局缺陷暴露,方法在应用和细粒度层面均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏