arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-14 至 2026-05-14 共收录 11 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 11 篇

2605.13667 2026-05-14 cs.CV 85%

SceneGraphVLM: Dynamic Scene Graph Generation from Video with Vision-Language Models

SceneGraphVLM:基于视频的动态场景图生成方法

Vladislav Makarov, Mark Gizetdinov, Dmitry Yudin

机构 * MIRAI

专题命中 GUI与屏幕智能体 :vision-language model(title);VLM(abstract,abstract_cn);visual language model(abstract);分类 cs.CV

AI总结 SceneGraphVLM通过紧凑的视觉语言模型生成视频场景图,采用TOON格式提升效率,结合监督微调与强化学习实现高精度与速度的平衡,适用于PSG、PVSG和Action Genome数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12620 2026-05-14 cs.AI 84%

Think Twice, Act Once: Verifier-Guided Action Selection For Embodied Agents

再思一次,行动一次:验证引导的动作选择用于具身智能体

Nishad Singhi, Christian Bialas, Snehal Jauhri, Vignesh Prasad, Georgia Chalvatzaki, Marcus Rohrbach, Anna Rohrbach

机构 * Technical University of Darmstadt(达姆斯塔特技术大学)

专题命中 GUI与屏幕智能体 :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出验证引导的动作选择框架,通过显式验证步骤提升基于MLLM的具身智能体的鲁棒性,实验证明在复杂任务中性能提升达36%。

Comments CVPR 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12549 2026-05-14 cs.CV 83%

What Happens Before Decoding? Prefill Determines GUI Grounding in VLMs

解码之前发生了什么?预填充决定了VLMs中的GUI接地

Jiaping Lin, Fei Shen, Junzhe Li, Ping Nie, Fei Yu, Ming Li, Haizhou Li

机构 * Guangming Laboratory(光明实验室) National University of Singapore(新加坡国立大学) Peking University(北京大学) University of Waterloo(滑铁卢大学) The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳))

专题命中 GUI与屏幕智能体 :grounding(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 本文研究了VLMs中GUI接地的两阶段机制,发现预填充阶段决定候选UI元素,解码阶段进一步优化坐标。提出Re-Prefill方法通过引入注意力引导的第二预填充阶段提升目标选择精度,实验显示在多个基准上提升4.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13119 2026-05-14 cs.RO cs.AI cs.CV 79%

Towards Long-horizon Embodied Agents with Tool-Aligned Vision-Language-Action Models

面向长周期具身智能体的工具对齐视觉-语言-动作模型

Zixing Lei, Changxing Liu, Yichen Xiong, Minhao Xiong, Yuanzhuo Ding, Zhipeng Zhang, Weixin Li, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Zhongguancun Academy(中关村学院) Beihang University(北京航空航天大学)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VLAs-as-Tools方法,通过高阶视觉语言模型与专用工具协作,提升长周期任务的成功率与调用忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07642 2026-05-14 cs.AI cs.CL cs.CV 79%

Breaking Down and Building Up: Mixture of Skill-Based Vision-and-Language Navigation Agents

拆解与构建:基于技能的视觉-语言导航代理混合

Tianyi Ma, Yue Zhang, Zehao Wang, Parisa Kordjamshidi

机构 * Michigan State University(密歇根州立大学) ESAT-PSI, KU Leuven(KU莱顿大学ESAT-PSI实验室)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SkillNav框架,通过模块化技能推理提升视觉-语言导航性能,通过合成数据训练无监督的路由模型,实现对复杂场景的泛化能力。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09423 2026-05-14 cs.AI 70%

SimWorld Studio: Automatic Environment Generation with Evolving Coding Agent for Embodied Agent Learning

SimWorld Studio:基于进化编码代理的自动环境生成用于具身学习

Haoqiang Kang, Xiaokang Ye, Yuhan Liu, Siddhant Hitesh Mantri, Lingjun Mao, James Fleming, Drishti Regmi, Lianhui Qin

机构 * UC San Diego(加州大学圣迭戈分校) New York University(纽约大学)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出SimWorld Studio平台,通过进化编码代理生成动态3D环境,提升具身学习性能。环境生成与学习相互促进,使代理在未见基准上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13328 2026-05-14 cs.RO cs.AI cs.CL cs.CV 62%

What Limits Vision-and-Language Navigation ?

什么是限制视觉-语言导航的因素?

Yunheng Wang, Yuetong Fang, Taowen Wang, Lusong Li, Kun Liu, Junzhe Xu, Zizhao Yuan, Yixiao Feng, Jiaxi Zhang, Wei Lu, Zecui Zeng, Renjing Xu

机构 * HKUST(GZ)(香港科技大学(广州)) JD Explore Academy(京东探索研究院)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出StereoNav框架,通过引入目标-位置先验和立体视觉,提升真实环境导航一致性,实验显示其在RGB性能和参数效率上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13202 2026-05-14 cs.CV cs.AI 62%

STAR: Semantic-Temporal Adaptive Representation Learning for Few-Shot Action Recognition

STAR:语义-时间自适应表示学习用于少样本动作识别

Hongli Liu, Yu Wang, Shengjie Zhao

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) Engineering Research Center of Key Software Technologies for Smart City Perception and Planning, Ministry of Education(教育部智能城市感知与规划关键软件技术工程研究中心)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 STAR通过语义对齐和时间感知模块,解决少样本动作识别中的语义-时间对齐和多尺度时间动态建模问题,提升模型在有限样本下的泛化能力。

Comments Accepted for publication in IEEE Transactions on Circuits and Systems for Video Technology (TCSVT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18842 2026-05-14 cs.CR cs.AI cs.CV 62%

GUIGuard-Bench: Toward a General Evaluation for Privacy-Preserving GUI Agents

GUIGuard-Bench:面向隐私保护GUI代理的通用评估

Yanxi Wang, Zhiling Zhang, Wenbo Zhou, Weiming Zhang, Jie Zhang, Qiannan Zhu, Yu Shi, Shuxin Zheng, Jiyan He

机构 * Beijing Normal University(北京师范大学) Zhongguancun Academy(中关村学院) University of Science and Technology of China(中国科学技术大学) A*STAR Zhongguancun Institution of Artificial Intelligence(中关村人工智能研究所)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 GUIGuard-Bench通过241个真实GUI代理轨迹和4080张截图,评估隐私保护GUI代理的隐私识别、规划一致性和保护策略影响,揭示隐私识别是实际应用中的关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13737 2026-05-14 cs.AI cs.CL 57%

Senses Wide Shut: A Representation-Action Gap in Omnimodal LLMs

宽视角闭合:多模态大语言模型中的表征-行动鸿沟

Trung Nguyen Quang, Yiming Gao, Fanyi Pu, Kaichen Zhang, Shuo Sun, Ziwei Liu

机构 * Nanyang Technological University(南洋理工大学) LMMs-Lab Team(多模态大模型实验室团队) Johns Hopkins University(约翰霍普金斯大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 研究发现多模态大语言模型在感知与行动之间存在鸿沟,通过IMAVB基准测试揭示模型在处理冲突信息时的不足,提出PGLA方法提升拒绝行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13403 2026-05-14 cs.RO cs.CV 57%

RotVLA: Rotational Latent Action for Vision-Language-Action Model

RotVLA: 旋转的潜在动作用于视觉-语言-动作模型

Qiwei Li, Xicheng Gong, Xinghang Li, Peiyan Li, Quanyun Zhou, Hangjun Ye, Jiahuan Zhou, Yadong Mu

机构 * Wangxuan Institute of Computer Technology, Peking University(王轩计算机技术研究所,北京大学) Xiaomi Robotics(小米机器人) CASIA

专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.CV

AI总结 RotVLA提出基于连续旋转潜在动作表示的VLA框架,通过三元组帧学习和流匹配头实现高效动作建模,实现98.2%的LIBERO和89.6%/88.5%的RoboTwin2.0性能。

详情

展开后加载摘要…

URL PDF HTML 收藏