arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1561 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 1561 篇

2406.17768 2024-09-20 cs.RO cs.AI cs.LG 62%

EXTRACT: Efficient Policy Learning by Extracting Transferable Robot Skills from Offline Data

Jesse Zhang, Minho Heo, Zuxin Liu, Erdem Biyik, Joseph J Lim, Yao Liu, Rasool Fakoor

专题命中 GUI与屏幕智能体 :vision language model(abstract);分类 cs.AI、cs.LG

Comments 25 pages, 16 figures

Journal ref CoRL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08282 2024-08-16 cs.RO cs.AI cs.LG 62%

Autonomous Behavior Planning For Humanoid Loco-manipulation Through Grounded Language Model

Jin Wang, Arturo Laurenzi, Nikos Tsagarakis

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI、cs.LG

Comments Paper accepted by IROS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20798 2024-07-31 cs.LG cs.AI cs.RO 62%

Diffusion Augmented Agents: A Framework for Efficient Exploration and Transfer Learning

Norman Di Palo, Leonard Hasenclever, Jan Humplik, Arunkumar Byravan

专题命中 GUI与屏幕智能体 :vision language model(abstract);分类 cs.AI、cs.LG

Comments Published at 3rd Conference on Lifelong Learning Agents (CoLLAs), 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11815 2024-06-18 cs.RO cs.CV cs.LG 62%

LLARVA: Vision-Action Instruction Tuning Enhances Robot Learning

Dantong Niu, Yuvan Sharma, Giscard Biamby, Jerome Quenum, Yutong Bai, Baifeng Shi, Trevor Darrell, Roei Herzig

专题命中 GUI与屏幕智能体 :visual question answering(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.18297 2024-02-23 cs.CV cs.AI 62%

Image Clustering Conditioned on Text Criteria

Sehyun Kwon, Jaeseung Park, Minkyu Kim, Jaewoong Cho, Ernest K. Ryu, Kangwook Lee

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.14656 2024-01-17 cs.CV cs.AI 62%

Charting New Territories: Exploring the Geographic and Geospatial Capabilities of Multimodal LLMs

Jonathan Roberts, Timo Lüddecke, Rehan Sheikh, Kai Han, Samuel Albanie

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments V3: Fixed typo in Fig.1; V2: Minor formatting changes and added missing subfigure captions

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.15127 2023-11-21 cs.AI cs.CL cs.LG cs.RO 62%

Open-Ended Instructable Embodied Agents with Memory-Augmented Large Language Models

Gabriel Sarch, Yue Wu, Michael J. Tarr, Katerina Fragkiadaki

专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.AI、cs.LG

Comments Project page with code & videos: https://helper-agent-llm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.14774 2023-09-27 cs.LG cs.CL cs.CV cs.HC 62%

BLIP-Adapter: Parameter-Efficient Transfer Learning for Mobile Screenshot Captioning

Ching-Yu Chiang, I-Hua Chang, Shih-Wei Liao

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.03112 2023-04-18 cs.LG cs.CL cs.CV cs.RO 62%

A New Path: Scaling Vision-and-Language Navigation with Synthetic Instructions and Imitation Learning

Aishwarya Kamath, Peter Anderson, Su Wang, Jing Yu Koh, Alexander Ku, Austin Waters, Yinfei Yang, Jason Baldridge, Zarana Parekh

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.LG

Comments CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.06415 2022-07-15 cs.LG cs.AI q-bio.NC 62%

The Free Energy Principle for Perception and Action: A Deep Learning Perspective

Pietro Mazzaglia, Tim Verbelen, Ozan Çatal, Bart Dhoedt

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI、cs.LG

Journal ref Entropy 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.01156 2021-02-08 cs.RO cs.AI cs.CV 62%

Action sequencing using visual permutations

Michael Burke, Kartic Subr, Subramanian Ramamoorthy

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI

Comments This paper has been accepted for publication at IEEE RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.03220 2020-03-09 cs.AI cs.LG 62%

Deep Active Inference for Autonomous Robot Navigation

Ozan Çatal, Samuel Wauthier, Tim Verbelen, Cedric De Boom, Bart Dhoedt

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI、cs.LG

Comments workshop paper at BAICS at ICLR 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.10092 2019-04-09 cs.CV cs.AI cs.CL cs.RO 62%

Reinforced Cross-Modal Matching and Self-Supervised Imitation Learning for Vision-Language Navigation

Xin Wang, Qiuyuan Huang, Asli Celikyilmaz, Jianfeng Gao, Dinghan Shen, Yuan-Fang Wang, William Yang Wang, Lei Zhang

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI

Comments CVPR 2019 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
1901.03035 2019-01-11 cs.AI cs.CL cs.CV cs.RO 62%

Self-Monitoring Navigation Agent via Auxiliary Progress Estimation

Chih-Yao Ma, Jiasen Lu, Zuxuan Wu, Ghassan AlRegib, Zsolt Kira, Richard Socher, Caiming Xiong

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI

Comments ICLR 2019, code is available at https://github.com/chihyaoma/selfmonitoring-agent

详情

展开后加载摘要…

URL PDF HTML 收藏
1803.07729 2018-07-27 cs.CV cs.AI cs.CL cs.RO 62%

Look Before You Leap: Bridging Model-Free and Model-Based Reinforcement Learning for Planned-Ahead Vision-and-Language Navigation

Xin Wang, Wenhan Xiong, Hongmin Wang, William Yang Wang

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI

Comments 21 pages, 7 figures, with supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
1711.07280 2018-04-09 cs.CV cs.AI cs.CL cs.RO 62%

Vision-and-Language Navigation: Interpreting visually-grounded navigation instructions in real environments

Peter Anderson, Qi Wu, Damien Teney, Jake Bruce, Mark Johnson, Niko Sünderhauf, Ian Reid, Stephen Gould, Anton van den Hengel

专题命中 GUI与屏幕智能体 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments CVPR 2018 Spotlight presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
1707.08668 2017-07-28 cs.AI cs.CL 61%

A Tale of Two DRAGGNs: A Hybrid Approach for Interpreting Action-Oriented and Goal-Oriented Instructions

Siddharth Karamcheti, Edward C. Williams, Dilip Arumugam, Mina Rhee, Nakul Gopalan, Lawson L. S. Wong, Stefanie Tellex

专题命中 GUI与屏幕智能体 :grounding(abstract,comments);分类 cs.AI

Comments Accepted at the 1st Workshop on Language Grounding for Robotics at ACL 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11588 2026-08-13 cs.AI 新提交 57%

CoAdapt-GUI: Joint Workflow Context and Policy Adaptation for Unseen GUI Applications

CoAdapt-GUI:面向未知GUI应用的工作流上下文与策略联合适配

Linqiang Guo, Li Gu, Zihuan Jiang, Zhixiang Chi, Siobhan Reid, Ziqiang Wang, Yuanhao Yu, Wei Liu, Yang Wang, Tse-Hsun, Chen

机构 * Li Gu(李谷(音译))

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

AI总结 CoAdapt-GUI框架通过联合适配工作流上下文与策略,在有限交互预算无目标演示的未知GUI应用场景下,将AndroidWorld泛化性能提至45.0%、AndroidWorld Plus提至52.9%,优于仅策略TTA基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00237 2026-08-13 cs.CV cs.RO 版本更新 57%

Latent-Centroid Steering: Single-Pass Classifier-Free Guidance for Command-Aligned Autonomous Driving

隐式质心引导:用于指令对齐自动驾驶的单次无分类器引导

Meibo Hu, Jiamian Wang, Pichao Wang, Zhiqiang Tao

机构 * Rochester Institute of Technology(罗切斯特理工学院) NVIDIA(英伟达公司)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

AI总结 针对视觉语言自动驾驶模型的指令跟随差距,提出单次引导机制LCS,降低推理延迟约50%,在Bench2Drive和nuScenes基准上提升指令遵循与驾驶性能。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09946 2026-08-12 cs.HC cs.AI 新提交 57%

HoosierHelp: Benchmarking LLM Agents for Social Service Navigation

HoosierHelp:面向社会服务导航的大语言模型智能体基准测试

Yiyang Li, Weixiang Sun, Tianyi Ma, Kaiwen Shi, Zheyuan Zhang, Yanfang Ye

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 该研究推出基于印第安纳州3971项公共社会服务资源的交互式基准HoosierHelp,测试发现现有LLM智能体在社会服务导航中对复杂非理想用户交互鲁棒性不足,需更可靠的智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09298 2026-08-11 cs.RO cs.AI 新提交 57%

WorldSimProbe: Diagnosing Simulator Faithfulness in Action-Conditioned World Models for Embodied Manipulation

WorldSimProbe:面向具身操控的动作条件世界模型的模拟器保真度诊断

Peterson Co, Sicheng Hu, Chunxuan Jiao, Hongyang Cheng, Yulin Luo, Yijie Xu, Sixiang Chen, Zhongxia Zhao, Zihao Wang, DaFeng Chi, Peidong Liu, YuTong Chen, Henghua Liu, Zhihao Yuan, Huizhu Jia, Yuzheng Zhuang, Tianle Zhang, Liang Lin, Huajie Tan, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) EvoPhys AI(EvoPhys人工智能公司) Joy Future Academy, JD(京东探索研究院) The University of Sydney(悉尼大学) The Hong Kong University of Science and Technology(香港科技大学) Beijing Institute of Technology(北京理工大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 该研究提出WorldSimProbe框架,通过五套受控测试评估动作条件世界模型的模拟器保真度,发现其存在动作实现退化等问题,为具身操控模型提供标准化诊断方法。

Comments 20 pages, 18 figures, and 10 tables, including supplementary material. Code and data: https://evophys.com/WorldSimProbe/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26041 2026-08-11 cs.CV 版本更新 57%

Where and How to Prune: An Empirical Study of Visual Token Pruning for GUI Agent Navigation

重新思考GUI视觉代理中历史截图的标记剪枝:语义、空间和时间视角

Daiqiang Li, Zihao Pan, Zeyu Zhang, Xuyang Liu, Shijia Xu, Ronghao Chen, Huacan Wang, Honggang Chen, Linfeng Zhang, Zhangquan Chen, Haiyun Jiang

机构 * Sichuan University(四川大学) Sun Yat-sen University(中山大学) Australian National University(澳大利亚国立大学) Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 GUI与屏幕智能体 :MLLM(abstract_cn);分类 cs.CV

AI总结 本文从语义、空间和时间角度研究GUI视觉代理中历史截图的标记剪枝,发现背景区域对界面状态转换有重要价值,随机剪枝在空间结构保留上更有效,且GUI代理具有近期效应,通过分配更多预算给近期截图可降低计算成本而不影响性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07154 2026-08-10 cs.RO cs.AI 新提交 57%

Representation Handoffs for OpenArm-Based Laboratory Mobile Manipulation

基于OpenArm的实验室移动操作的表示交接

Yang Shen, Chonghao Cheng, Ziyi Zhao, Jialuo Zhu, Zhenyi Yi, Qi Zhao, Jian Yang, Yuhui Shi, Chin-Teng Lin

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 本研究提出基于OpenArm的实验室移动操作原型,通过表示交接整合多模块,可暴露部署阻碍并为具身系统整合提供调试接口。

Comments Robotics: Science and Systems (RSS) Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06861 2026-08-10 cs.AI 新提交 57%

Gated-BEPO: Confidence-Gated Bellman Credit Assignment for Large Language Model Agents

Gated-BEPO:用于大语言模型智能体的置信门控贝尔曼信用分配

Hongxi Yan, Ziyue Huang, Shichao Fan, Qingjie Liu

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

AI总结 本研究针对大语言模型智能体长视域训练的信用分配问题,提出Gated-BEPO方法,通过经验rollout图推导步骤级信用并结合置信门自适应融合回合与步骤级信用,在多任务基准上取得性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05903 2026-08-10 cs.CV cs.RO 版本更新 57%

Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models

Robust-WAM:桥接生成式预训练与世界-动作模型中的语义前瞻

Haodong Yan, Junfeng Li, Junjie He, Zhide Zhong, MingMing Yu, Wenxuan Song, Jiaguan Zhu, Yangyang Zheng, Yuqiao Du, Jiadi You, Yingjie Cai, Xu Yan, Guanyi Zhao, Bingbing Liu, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Beihang University(北京航空航天大学) Huawei Foundation Model Department(华为基础模型部门)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 Robust-WAM是一种通用后训练方法,在保留VAE生成路径的同时添加语义前瞻对齐,可提升多个WAM基线在分布外条件下的动作预测成功率且不损失分布内性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22539 2026-08-10 cs.RO cs.CV 版本更新 57%

VLA-Arena: An Open-Source Framework for Benchmarking Vision-Language-Action Models

VLA-Arena:一个用于基准测试视觉-语言-动作模型的开源框架

Borong Zhang, Jiahao Li, Jiachen Shen, Yuhao Zhang, Yishuai Cai, Lu Liu, Hailu Ji, Yuanpei Chen, Juntao Dai, Jiaming Ji, Yaodong Yang

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 提出VLA-Arena基准,通过三正交轴(任务结构、语言命令、视觉观察)量化任务难度,系统评估视觉-语言-动作模型的能力边界与失败模式。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06065 2026-08-07 cs.CV 新提交 57%

The Next Screenshot Knows: Gated Hindsight Distillation for Mobile GUI Agents

下一张截图知晓:面向移动GUI智能体的门控事后蒸馏(Gated Hindsight Distillation)

Weiwei Li, Junzhuo Liu, Tong Chu, Hengfu Yu, Wen Li

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

AI总结 本文针对移动GUI智能体训练中丢失动作依据的问题,提出门控事后蒸馏方法,利用下一张截图作为特权信息,在AndroidWorld等基准上相比GRPO提升了任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05369 2026-08-07 cs.RO cs.CV 新提交 57%

World-to-Wrist: Task-Conditioned Future Wrist Modeling for Fine-Grained Robot Manipulation

世界到手腕:面向精细机器人操作的任务条件未来手腕建模

Yuhao Pan, Haosong Peng, Zhengshen Zhang, Zhengyang Yan, Yalun Dai, Fushuo Huo, Chujie Wang, Tianyu Qi, Xiucheng Wang, Nan Cheng, Wenchao Xu

机构 * The Hong Kong University of Science and Technology(香港科技大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Wuhan University(武汉大学) Sun Yat-sen University(中山大学) Xidian University(西安电子科技大学) Southeast University(东南大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

AI总结 本研究提出W2-VLA模型,通过任务条件未来手腕建模结合W2-CoT辅助监督,在LIBERO等数据集及真实任务中提升了机器人精细接触敏感操作能力,动作生成速率超80Hz。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16284 2026-08-07 cs.CV cs.MM 版本更新 57%

MAC 2026: Advancing Micro-Action Analysis Towards Fine-Grained Understanding

MAC 2026:推动微动作分析迈向细粒度理解

Kun Li, Dan Guo, Jihao Gu, Pengyu Liu, Xiaobai Li, Haoyu Chen, Yanbin Hao, Guoying Zhao, Meng Wang

机构 * United Arab Emirates University(阿联酋大学) Hefei University of Technology(合肥工业大学) University College London(伦敦大学学院) Zhejiang University(浙江大学) University of Oulu(奥卢大学) CMVS, University of Oulu(奥卢大学计算机视觉与媒体研究中心)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文介绍第三届MAC 2026,以从识别到细粒度微动作理解为主题,扩大挑战范围,引入新任务并借助多模态大语言模型评估,总结了相关数据集、设置、结果等,还探讨了微动作分析未来方向及在视频理解中的作用。

Comments Challenge Summary Paper of the 3rd Micro-Action Analysis Grand Challenge (MAC 2026) at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04501 2026-08-06 cs.CV 新提交 57%

Privacy-Preserving Action Recognition: Taxonomy, Methods, and Privacy-Utility Trade-offs

隐私保护动作识别:分类、方法与隐私-效用权衡

Sareer Ul Amin, Muhammad Ayaz, Muhammad Munsif, Sanghyun Seo

机构 * Chung-Ang University(中央大学) Ulsan National Institute of Science and Technology (UNIST)(蔚山科学技术院) College of Art and Technology, Chung-Ang University(中央大学艺术与技术学院)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 该研究通过PRISMA指导的综述,梳理32篇PPAR论文,提出分类法、评估协议等,分析各方法权衡,指出评估不足,推动PPAR从原型向部署发展。

详情

展开后加载摘要…

URL PDF HTML 收藏