Mechanistic Finetuning of Vision-Language-Action Models via Few-Shot Demonstrations
通过少样本示范机制性微调视觉-语言-动作模型
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV
AI总结 本研究提出Robotic Steering方法,通过少样本示范机制性微调视觉-语言-动作模型,提升其在机器人任务中的适应性和鲁棒性。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
通过少样本示范机制性微调视觉-语言-动作模型
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV
AI总结 本研究提出Robotic Steering方法,通过少样本示范机制性微调视觉-语言-动作模型,提升其在机器人任务中的适应性和鲁棒性。
Prune4Web: 面向Web代理的DOM树剪枝编程
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI
AI总结 Prune4Web通过DOM树剪枝编程提升Web自动化精度,实现25-50倍候选元素减少,显著提高接地任务准确性至88.28%。
Comments Paper accepted to AAAI 2026
迈向细粒度视频动作识别的有效动作-区域跟踪框架
机构 * DUT-RU International School of Information Science & Engineering, Dalian University of Technology, China(大连理工大学国际信息科学与工程学院,大连理工大学,中国) ; Beihang University, China(北京航空航天大学,中国) ; The University of Sydney, Australia(悉尼大学,澳大利亚)
专题命中 GUI与屏幕智能体 :visual language model(abstract);分类 cs.CV
AI总结 本文提出了一种动作-区域跟踪框架,通过查询-响应机制捕捉细粒度动作细节,提升视频动作识别性能。
UITron-Speech: 向基于语音指令的自动化GUI代理迈进
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI
AI总结 UITron-Speech通过语音指令和截图处理,实现首个端到端GUI代理,提升无障碍人机交互的可行性。
我们完成了吗?
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI
AI总结 本文提出了一种基于视觉的评估机制,通过视觉-语言模型评估计算机使用代理的任务完成情况,提升了任务完成的准确性和可靠性。
Comments This work has been accepted to appear at the AAAI 2026 Workshop on Trust and Control in Agentic AI (TrustAgent)
ReEXplore: 通过上下文化回顾经验回放提升具身探索的MLLMs
机构 * LMU Munich(慕尼黑大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心) ; TU Munich(慕尼黑技术大学)
专题命中 GUI与屏幕智能体 :MLLM(abstract);分类 cs.CV
AI总结 ReEXplore通过回顾经验回放和分层前沿选择,提升MLLMs在具身探索中的效率和性能。
Comments 8 main pages plus 13 pages Appendix
Evo-0:具有隐式空间理解的视觉-语言-动作模型
机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) ; EvoMind Tech(EvoMind科技) ; IAAR-Shanghai(IAAR-上海) ; University of Cambridge(剑桥大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV
AI总结 Evo-0通过隐式整合3D几何特征,提升视觉-语言-动作模型在现实世界中的空间理解能力。
MobileVLA-R1: 为移动机器人强化视觉-语言-动作
机构 * Peking University(北京大学)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV
AI总结 MobileVLA-R1通过结合监督CoT对齐与GRPO强化学习,提升四足机器人在复杂环境中的视觉-语言-动作控制性能。
语义裂隙:自主像素云中的代理与艺术性
机构 * The University of Tokyo(东京大学) ; Tokyo University of the Arts(东京艺术大学) ; Keio University(庆应大学) ; SONY CSL Kyoto(索尼 CSL 京都)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI
AI总结 本文提出语义裂隙,通过多模态大语言模型实现自主导航,展示低 fidelity方法在创造不完美但富有艺术性的机器人同伴中的应用。
Comments NeurIPS 2025 Creative AI Track, The Thirty-Ninth Annual Conference on Neural Information Processing Systems
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI
Comments Accepted to AAAI-26 (Main Technical Track)
机构 * School of Electrical Engineering, KAIST(韩国科学技术院电子工程学院)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV
Comments 9 pages, 9 figures
机构 * MAIS, Institute of Automation, Chinese Academy of Sciences, China(自动化研究所,中国科学院,中国) ; School of Artificial Intelligence, University of Chinese Academy of Sciences, China(中国科学院大学人工智能学院,中国) ; Alibaba Group(阿里巴巴集团)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI
Comments 18 pages, 11 figures
机构 * Indian Institute of Technology Mandi(印度理工学院曼迪分校) ; Vellore Institute of Technology(韦洛雷理工学院) ; Indian Institute of Technology Kharagpur(印度理工学院哈里科普分校)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV
Comments 8 pages
机构 * ByteDance Seed(字节跳动种子) ; NTU(国立科技大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV
Comments Accepted as a poster in AAAI 2026
机构 * Nanjing University(南京大学) ; Microsoft(微软) ; ZJU-UIUC(浙大-UIUC) ; Peking University(北京大学)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI
机构 * Lanzhou University, China(兰州大学) ; National University of Singapore, Singapore(新加坡国立大学) ; Institute of Computing Technology, Chinese Academy of Sciences, China(中国科学院计算技术研究所) ; NExT++ Research Centre, National University of Singapore, Singapore(新加坡国立大学NExT++研究中心)
专题命中 GUI与屏幕智能体 :vision language model(abstract);分类 cs.AI
机构 * Faculty of Mathematics, University of Waterloo(滑铁卢大学数学系) ; The Knowledge Engineering Group (KEG), Tsinghua University(清华大学知识工程集团) ; Zhipu AI(智谱AI)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI
Comments 36 pages, 30 figures
专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.AI
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; University of Oxford(牛津大学) ; Xi’an Jiaotong University(西安交通大学) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; City University of Hong Kong(香港城市大学) ; Beijing University of Technology(北京理工大学) ; Duke University(杜克大学) ; X-Humanoid Project(X-Humanoid 项目)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV
机构 * Department of Artificial Intelligence, Korea University(韩国大学人工智能系)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV
机构 * Australian Institute for Machine Learning, the University of Adelaide(澳大利亚机器学习研究所、阿德莱德大学) ; CREATE Lab, Swiss Federal Institute of Technology Lausanne (EPFL)(洛桑联邦理工学院CREATE实验室)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; National University of Singapore(新加坡国立大学)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV
机构 * University of Göttingen(戈丁根大学) ; University of Notre Dame(诺特大学) ; State and University Library of Göttingen(戈丁根州立大学图书馆)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI
机构 * Future Network of Intelligence Institute(Shenzhen)(智能未来网络研究所(深圳)) ; Tsinghua University(清华大学) ; The Chinese University of Hongkong(Shenzhen)(香港大学(深圳))
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI
Comments under review
机构 * Institute of Science Tokyo(东京科学研究所) ; RIKEN AIP(日本科学技术研究所AIP)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV
Comments ICCV 2025 Poster
专题命中 GUI与屏幕智能体 :vision language model(abstract);分类 cs.AI
Comments 21 pages, 9 figures, 2 tables
机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工大学) ; Robotics Institute Germany(德国机器人研究所) ; Microsoft Research(微软研究院)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.LG
Comments Accepted by NeurIPS 2025
机构 * UC Berkeley(伯克利大学) ; Physical Intelligence(物理智能)
专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.AI
Comments 7 pages and appendix