arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1565 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 1565 篇

2502.13508 2025-02-24 cs.RO 50%

VLAS: Vision-Language-Action Model With Speech Instructions For Customized Robot Manipulation

Wei Zhao, Pengxiang Ding, Min Zhang, Zhefei Gong, Shuanghao Bai, Han Zhao, Donglin Wang

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

Comments Accepted as a conference paper at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09238 2025-02-14 cs.RO 50%

OpenBench: A New Benchmark and Baseline for Semantic Navigation in Smart Logistics

Junhui Wang, Dongjie Huo, Zehui Xu, Yongliang Shi, Yimin Yan, Yuanxin Wang, Chao Gao, Yan Qiao, Guyue Zhou

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17022 2025-01-29 cs.RO 50%

Mobile Manipulation Instruction Generation from Multiple Images with Automatic Metric Enhancement

Kei Katsumata, Motonari Kambara, Daichi Yashima, Ryosuke Korekata, Komei Sugiura

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract)

Comments Accepted for IEEE RA-L 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19153 2025-01-08 cs.RO 50%

Sketch-MoMa: Teleoperation for Mobile Manipulator via Interpretation of Hand-Drawn Sketches

Kosei Tanada, Yuka Iwanaga, Masayoshi Tsuchinaga, Yuji Nakamura, Takemitsu Mori, Remi Sakai, Takashi Yamamoto

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

Comments This work has been submitted to the IEEE for possible publication. Project Page: https://toyotafrc.github.io/SketchMoMa-Proj

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12273 2024-12-31 cs.RO 50%

Multimodal Human-Autonomous Agents Interaction Using Pre-Trained Language and Visual Foundation Models

Linus Nwankwo, Elmar Rueckert

专题命中 GUI与屏幕智能体 :visual language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10282 2024-12-16 eess.SP 50%

A model-based approach for transforming InSAR-derived vertical land motion from a local to a global reference frame

Mahmoud Reshadati, Manoochehr Shirzaei

专题命中 GUI与屏幕智能体 :VLM(abstract)

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07312 2024-11-05 cs.RO 50%

RoLD: Robot Latent Diffusion for Multi-task Policy Modeling

Wenhui Tan, Bei Liu, Junbo Zhang, Ruihua Song, Jianlong Fu

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04837 2024-11-05 cs.RO 50%

Context-Aware Replanning with Pre-explored Semantic Map for Object Navigation

Po-Chen Ko, Hung-Ting Su, Ching-Yuan Chen, Jia-Fong Yeh, Min Sun, Winston H. Hsu

专题命中 GUI与屏幕智能体 :visual language model(abstract)

Comments CoRL 2024 camera ready. The first three authors contributed equally, and their order of authorship is interchangeable. Project page: https://care-maps.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.12610 2024-11-01 cs.RO 50%

A Joint Modeling of Vision-Language-Action for Target-oriented Grasping in Clutter

Kechun Xu, Shuqi Zhao, Zhongxiang Zhou, Zizhang Li, Huaijin Pi, Yue Wang, Rong Xiong

专题命中 GUI与屏幕智能体 :grounding(abstract)

Comments Accepted by ICRA 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18060 2024-10-10 cs.HC cs.SE 50%

Inferring Alt-text For UI Icons With Large Language Models During App Development

Sabrina Haque, Christoph Csallner

专题命中 GUI与屏幕智能体 :vision language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03603 2024-10-07 cs.RO 50%

LeLaN: Learning A Language-Conditioned Navigation Policy from In-the-Wild Videos

Noriaki Hirose, Catherine Glossop, Ajay Sridhar, Dhruv Shah, Oier Mees, Sergey Levine

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

Comments 23 pages, 9 figures, 5 tables, Conference on Robot Learning 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16484 2024-10-04 cs.RO 50%

BehAV: Behavioral Rule Guided Autonomy Using VLMs for Robot Navigation in Outdoor Scenes

Kasun Weerakoon, Mohamed Elnoor, Gershom Seneviratne, Vignesh Rajagopal, Senthil Hariharan Arul, Jing Liang, Mohamed Khalid M Jaffar, Dinesh Manocha

专题命中 GUI与屏幕智能体 :vision language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03806 2024-10-03 cs.HC 50%

In Situ AI Prototyping: Infusing Multimodal Prompts into Mobile Settings with MobileMaker

Savvas Petridis, Michael Xieyang Liu, Alexander J. Fiannaca, Vivian Tsai, Michael Terry, Carrie J. Cai

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13393 2024-09-23 cs.RO 50%

Hey Robot! Personalizing Robot Navigation through Model Predictive Control with a Large Language Model

Diego Martinez-Baselga, Oscar de Groot, Luzia Knoedler, Javier Alonso-Mora, Luis Riazuelo, Luis Montano

专题命中 GUI与屏幕智能体 :visual language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11667 2024-09-19 cs.SE 50%

Bridging Design and Development with Automated Declarative UI Code Generation

Ting Zhou, Yanjie Zhao, Xinyi Hou, Xiaoyu Sun, Kai Chen, Haoyu Wang

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10578 2024-08-21 cs.RO 50%

Where to Fetch: Extracting Visual Scene Representation from Large Pre-Trained Models for Robotic Goal Navigation

Yu Li, Dayou Li, Chenkun Zhao, Ruifeng Wang, Ran Song, Wei Zhang

专题命中 GUI与屏幕智能体 :visual language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14146 2024-07-22 cs.MM 50%

Fine-grained Knowledge Graph-driven Video-Language Learning for Action Recognition

Rui Zhang, Yafen Lu, Pengli Ji, Junxiao Xue, Xiaoran Yan

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.00956 2024-05-28 cs.CL 50%

Exploring Spatial Schema Intuitions in Large Language and Vision Models

Philipp Wicke, Lennart Wachowiak

专题命中 GUI与屏幕智能体 :vision language model(abstract)

Comments ACL Findings 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.04497 2024-05-09 cs.HC 50%

Unveiling Disparities in Web Task Handling Between Human and Web Agent

Kihoon Son, Jinhyeon Kwon, DaEun Choi, Tae Soo Kim, Young-Ho Kim, Sangdoo Yun, Juho Kim

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03049 2024-04-05 cs.CL 50%

Language, Environment, and Robotic Navigation

Johnathan E. Avery

专题命中 GUI与屏幕智能体 :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.19028 2024-03-29 eess.SY cs.SY 50%

Nonlinear Model Predictive Control for Enhanced Navigation of Autonomous Surface Vessels

Daniel Menges, Trym Tengesdal, Adil Rasheed

专题命中 GUI与屏幕智能体 :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10670 2024-03-26 cs.CL cs.RO 50%

OpenFMNav: Towards Open-Set Zero-Shot Object Navigation via Vision-Language Foundation Models

Yuxuan Kuang, Hai Lin, Meng Jiang

专题命中 GUI与屏幕智能体 :vision language model(abstract)

Comments NAACL 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02559 2024-02-06 cs.CL 50%

NavHint: Vision and Language Navigation Agent with a Hint Generator

Yue Zhang, Quan Guo, Parisa Kordjamshidi

专题命中 GUI与屏幕智能体 :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.15003 2023-11-14 cs.MA 50%

Feasible Action-Space Reduction as a Metric of Causal Responsibility in Multi-Agent Spatial Interactions

Ashwin George, Luciano Cavalcante Siebert, David Abbink, Arkady Zgonnikov

专题命中 GUI与屏幕智能体 :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02324 2023-10-05 cs.RO 50%

ALT-Pilot: Autonomous navigation with Language augmented Topometric maps

Mohammad Omama, Pranav Inani, Pranjal Paul, Sarat Chandra Yellapragada, Krishna Murthy Jatavallabhula, Sandeep Chinchali, Madhava Krishna

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.10309 2023-09-22 cs.RO 50%

Bridging Zero-shot Object Navigation and Foundation Models through Pixel-Guided Navigation Skill

Wenzhe Cai, Siyuan Huang, Guangran Cheng, Yuxing Long, Peng Gao, Changyin Sun, Hao Dong

专题命中 GUI与屏幕智能体 :grounding(abstract)

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.07615 2023-05-24 cs.CL 50%

UGIF: UI Grounded Instruction Following

Sagar Gubbi Venkatesh, Partha Talukdar, Srini Narayanan

专题命中 GUI与屏幕智能体 :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.11011 2022-08-03 cs.RO 50%

SOCIALGYM: A Framework for Benchmarking Social Robot Navigation

Jarrett Holtz, Joydeep Biswas

专题命中 GUI与屏幕智能体 :grounding(abstract)

Comments Published in IROS2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.10667 2022-02-25 cs.RO 50%

Visually Grounded Task and Motion Planning for Mobile Manipulation

Xiaohan Zhang, Yifeng Zhu, Yan Ding, Yuke Zhu, Peter Stone, Shiqi Zhang

专题命中 GUI与屏幕智能体 :grounding(abstract)

Comments To be published in IEEE International Conference on Robotics and Automation (ICRA), May 23-27, 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.10396 2021-12-23 cs.RO cs.CL 50%

Language Understanding for Field and Service Robots in a Priori Unknown Environments

Matthew R. Walter, Siddharth Patki, Andrea F. Daniele, Ethan Fahnestock, Felix Duvallet, Sachithra Hemachandra, Jean Oh, Anthony Stentz, Nicholas Roy, Thomas M. Howard

专题命中 GUI与屏幕智能体 :grounding(abstract)

Comments Field Robotics (accepted, to appear)

详情

展开后加载摘要…

URL PDF HTML 收藏