arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-24 至 2026-04-24 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 3 篇

2604.21268 2026-04-24 cs.LG cs.AI cs.CV 82%

Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding

两次测量,一次点击:通过强化学习共进化提议者和视觉评论者进行GUI定位

Wenkai Wang, Xiyun Li, Hongcan Guo, Wenhao Yu, Tianqing Fang, Haitao Mi, Dong Yu, Shengyu Zhang

机构 * Zhejiang University(浙江大学) Tencent AI Lab(腾讯AI实验室) The University of Hong Kong(香港大学)

专题命中 GUI与屏幕智能体 :grounding(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出通过强化学习共进化提议者和视觉评论者,以提升GUI定位的准确性和鲁棒性,通过动态平衡训练目标,增强模型在复杂界面布局中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03956 2026-04-24 cs.CV cs.AI 62%

VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models

VLA-Forget:面向具身基础模型的视觉-语言-动作去学习

Ravi Ranjan, Agoritsa Polyzou

机构 * Florida International University(佛罗里达国际大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VLA-Forget框架,通过结合感知选择性编辑与层选择性推理去学习,提升去学习效果,保留感知特性和推理能力,减少量化恢复。

Comments 18 pages, 9 figures, Accepted to ACL-2026, KnowFM

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05320 2026-04-24 cs.RO 50%

ExpressMM: Expressive Mobile Manipulation Behaviors in Human-Robot Interactions

ExpressMM: 人机交互中的表达性移动 manipulation 行为

Souren Pashangpour, Haitong Wang, Matthew Lisondra, Goldie Nejat

机构 * Autonomous Systems and Biomechatronics Laboratory(自主系统与生物机械实验室) Department of Mechanical and Engineering(机械与工程系) University of Toronto(多伦多大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 本文提出ExpressMM框架,结合视觉语言模型和低层策略生成表达性机器人行为,支持中断交互,提升人机协作任务中的沟通效果与社会适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏