Teaching RL Agents to Act Better: VLM as Action Advisor for Online Reinforcement Learning
机构 * Wuhan University(武汉大学)
专题命中 GUI与屏幕智能体 :VLM(title);vision-language model(abstract);分类 cs.AI、cs.LG
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * Wuhan University(武汉大学)
专题命中 GUI与屏幕智能体 :VLM(title);vision-language model(abstract);分类 cs.AI、cs.LG
机构 * Shanghai Jiao Tong University(上海交通大学) ; Ant Group(蚂蚁集团)
专题命中 GUI与屏幕智能体 :vision language model(title);multimodal large language model(abstract);分类 cs.CV、cs.LG
Comments 10pageV0
机构 * Microsoft(微软)
专题命中 GUI与屏幕智能体 :grounding(title,abstract);分类 cs.CV、cs.AI
机构 * School of Automation Science and Engineering, South China University of Technology(自动化科学与工程学院,华南理工大学) ; Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou)(人工智能方向,香港科学与技术大学(广州))
专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);分类 cs.CV、cs.AI
Comments PRCV
机构 * Computer and Data Sciences, School of Engineering(计算机与数据科学系,工程学院)
专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);分类 cs.CV、cs.AI
专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);分类 cs.CV、cs.AI
专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);分类 cs.CV、cs.AI
Comments NeurIPS 2024. First three authors contributed equally
专题命中 GUI与屏幕智能体 :vision language model(title,abstract);分类 cs.CV、cs.AI
专题命中 GUI与屏幕智能体 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI
专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);分类 cs.CV、cs.AI
Comments Accepted to International Joint Conference on Artificial Intelligence (IJCAI), 2024. Revision Notes: full version of the paper, including 1) Camera-ready version for IJCAI-24; 2) Appendices that are mentioned, but not included in 1)
专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);分类 cs.CV、cs.AI
Comments Accepted at the 7th Conference on Robot Learning (CoRL 2023)
专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);分类 cs.CV、cs.LG
Comments Published as a conference paper at ICLR 2023
专题命中 GUI与屏幕智能体 :grounding(title,abstract);分类 cs.CV、cs.AI
Comments Accepted to IEEE TCSVT
ARIES-Mission2:用于快速大规模空中任务生成的零样本视觉-语言-动作框架
专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);grounding(abstract);multimodal large language model(abstract)
AI总结 ARIES-Mission2是解耦视觉语义感知与路径优化的零样本VLA框架,在UAV基准上,其飞行距离更短、任务生成速度更快,且TSP模块可扩展性佳。
DyPES-VLA:学习共享动态先验与具身特定控制以实现跨具身操作
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; COCO Matrix
专题命中 GUI与屏幕智能体 :vision-language model(abstract,abstract_cn);VLM(abstract,abstract_cn)
AI总结 该研究针对跨具身机器人操作问题,提出DyPES-VLA模型,通过学习共享动态先验与具身特定MoE动作头,在LIBERO等数据集上达到先进操作成功率。
用于动态视觉语言导航的从慢速推理器到快速规划器的逐令牌潜在流
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; National University of Singapore(新加坡国立大学) ; Zhejiang University(浙江大学)
专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract)
AI总结 针对动态视觉语言导航中语言推理慢与规划需即时的矛盾,提出SPARK-VLN双系统框架,通过三个模块将慢速VLM推理器知识流到快速规划器,引入新基准套件,提高了导航成功率、社会合规性及推理效率。
InternVLA-A1.5:统一理解、潜在预见与组合泛化的行动
机构 * Physical Intelligence Team Shanghai AI Laboratory(上海人工智能实验室物理智能团队)
专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract)
AI总结 研究旨在统一机器人操作模型,提出InternVLA-A1.5,基于原生VLM骨干构建策略,将未来预测转化为潜在查询问题,继承预训练视频生成模型动力学先验,在模拟和现实基准测试中效果良好。
Comments Homepage: https://internrobotics.github.io/internvla-a15.github.io/
SurveilNav: 机器人与监控系统协同的目标导航
机构 * Beihang University(北京航空航天大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Beijing Jiaotong University(北京交通大学) ; ATeam ; University of Chinese Academy of Sciences(中国科学院大学) ; Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)
专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract)
AI总结 提出SurveilNav框架,通过主动摄像头调度、联合2D/3D建图、基于VLM的价值估计和协同目标验证,融合机器人动态局部感知与监控全局视图,在HM3D数据集上实现领先的探索效率和导航成功率。
Comments Accepted by ICRA 2026
在视觉-语言-动作模型中解耦声明性知识与程序性知识
机构 * University of Edinburgh(爱丁堡大学) ; UCL(伦敦大学学院) ; Samsung AI Center - Cambridge, UK(三星人工智能中心 - 英国剑桥)
专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 针对现有VLA模型无法解耦声明性与程序性知识导致零样本技能迁移脆弱的问题,提出w$^{2}$VLA模型,通过重构信息流实现模块化、可解释的知识解耦,显著提升对未见物体的零样本技能迁移能力。
AllDayNav: 通过真实世界强化学习实现终身导航
机构 * Tsinghua University(清华大学) ; Galbot Robotics ; Peking University(北京大学) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院)
专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract)
AI总结 提出AllDayNav框架,利用自进化多模态记忆和强化学习隐式编码场景动态,在跨房间、跨回合和跨任务场景中实现接近100%的成功率,超越基于地图、VLM和RL的基线方法。
Comments Project Page: https://bagh2178.github.io/AllDayNav/
Video2GUI:合成大规模交互轨迹用于通用GUI代理预训练
机构 * National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(国家多媒体信息处理重点实验室,计算机科学学院,北京大学) ; The University of Hong Kong(香港大学) ; Renmin University of China(中国人民大学)
专题命中 GUI与屏幕智能体 :grounding(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出Video2GUI框架,通过自动提取互联网视频中的GUI交互轨迹,生成大规模数据集WildGUI,提升了GUI代理的泛化能力。
Comments Accepted at ICML 2026
带我走:面向以人为本的户外助行的长周期社交导航
机构 * Tsinghua University(清华大学) ; Pengcheng Laboratory(鹏城实验室) ; Hefei University of Technology(合肥工业大学)
专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision-language model(abstract);grounding(abstract)
AI总结 本文提出Walk with Me框架,通过高阶视觉语言模型和轻量级兴趣点,实现无地图的长周期社交导航,结合语义意图定位、安全推理和低层动作生成,提升户外助行的实用性。
A1: 一个完全透明的开源、自适应和高效的截断视觉-语言-动作模型
机构 * SYSU(华南理工大学) ; MBZUAI(微软亚洲人工智能研究院) ; Spatialtemporal AI(时空人工智能)
专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract)
AI总结 A1通过利用预训练的VLM提供隐含的 affordance 先验知识,实现低成本、高吞吐量的推理,同时提高机器人操作的成功率,且在多个基准和真实机器人上实现了最先进的成功率。
LookAgain:基于视觉反思的闭环GUI定位方法
专题命中 GUI与屏幕智能体 :grounding(title,abstract);分类 cs.CV
AI总结 本文针对现有GUI定位方法在小目标等场景性能骤降的问题,提出LookAgain闭环GUI定位器,通过预测后视觉反思的多轮过程结合SFT与GRPO训练,在相关基准上达到SOTA性能。
MissClick:利用序列化数字坐标攻击GUI定位模型
专题命中 GUI与屏幕智能体 :grounding(title,abstract);分类 cs.AI
AI总结 本研究提出MissClick攻击方法,针对GUI定位模型设计两种目标的白盒对抗攻击,在OS-Atlas和UGround数据集上大幅提升无目标与有目标攻击成功率。
通过全景感知和视觉语言模型进行低空信道多径预测
专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);分类 cs.CV
AI总结 针对无人机通信中传统信道预测方法的局限,提出基于全景感知和视觉语言模型的PanoLAMP框架,利用预训练模型及全景观测捕捉特征预测多径参数,实验显示其在多径参数、统计指标及泛化性上表现出色。
小语言和视觉语言模型网络智能体中GRPO的学习率门控失败:一个可控的无效结果及其机制
机构 * Monash University(莫纳什大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Shenzhen University of Advanced Technology(深圳先进技术大学) ; Pusan National University(釜山国立大学)
专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);分类 cs.AI
AI总结 研究4B到8B规模小语言和视觉语言模型网络智能体中GRPO的效果,通过控制变量实验发现其在已掌握任务上无明显提升,解释了学习率导致失败的机制,表明该耦合与模型规模相关。
学习拒绝:多模态大语言模型中的动作否定
机构 * Institute of Artificial Intelligence, University of Central Florida(中佛罗里达大学人工智能研究所)
专题命中 GUI与屏幕智能体 :multimodal large language model(title,abstract);分类 cs.CV
AI总结 提出UCF101-AD基准测试,评估多模态大语言模型在强上下文线索下识别动作缺失的能力,发现模型倾向于肯定动作而非验证其真实性,并通过因果图CausalAct减少误报。
Comments Accepted to ECCV 2026 main conference
EfficientUICoder: 一种用于高效基于多模态大语言模型的UI代码生成的双向标记压缩框架
机构 * The Chinese University of Hong Kong(香港中文大学) ; Huazhong University of Science and Technology(华中科技大学) ; Singapore Management University(新加坡管理大学) ; Nanyang Technological University(南洋理工大学)
专题命中 GUI与屏幕智能体 :MLLM(title);multimodal large language model(abstract);分类 cs.AI
AI总结 本文提出EfficientUICoder,通过元素和布局感知标记压缩、区域感知标记精炼和自适应重复标记抑制,有效压缩UI代码生成的标记数量,提升生成效率和代码质量。
Comments Published in the Proceedings of the 2026 ACM International Conference on the Foundations of Software Engineering (FSE 2026)
VISTA: 视图一致的自验证训练用于GUI定位
机构 * Zhejiang University(浙江大学) ; Venus Team, Ant Group(蚂蚁集团金星团队)
专题命中 GUI与屏幕智能体 :grounding(title,abstract);分类 cs.AI
AI总结 提出VISTA框架,通过多视图分组和自验证锚点改进GRPO训练,在GUI定位任务中显著提升准确率。