arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1561 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 1561 篇

2311.17944 2024-07-19 cs.CV 57%

PALM: Predicting Actions through Language Models

Sanghwan Kim, Daoji Huang, Yongqin Xian, Otmar Hilliges, Luc Van Gool, Xi Wang

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11650 2024-07-18 cs.CV 57%

Prioritized Semantic Learning for Zero-shot Instance Navigation

Xinyu Sun, Lizhao Liu, Hongyan Zhi, Ronghe Qiu, Junwei Liang

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

Comments Accepted by ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10528 2024-07-16 cs.CV 57%

Local Action-Guided Motion Diffusion Model for Text-to-Motion Generation

Peng Jin, Hao Li, Zesen Cheng, Kehan Li, Runyi Yu, Chang Liu, Xiangyang Ji, Li Yuan, Jie Chen

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

Comments Accepted by ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03913 2024-07-08 cs.AI cs.HC 57%

MobileExperts: A Dynamic Tool-Enabled Agent Team in Mobile Devices

Jiayi Zhang, Chuang Zhao, Yihan Zhao, Zhaoyang Yu, Ming He, Jianping Fan

专题命中 GUI与屏幕智能体 :visual language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17520 2024-06-26 cs.CV cs.RO 57%

Tell Me Where You Are: Multimodal LLMs Meet Place Recognition

Zonglin Lyu, Juexiao Zhang, Mingxuan Lu, Yiming Li, Chen Feng

专题命中 GUI与屏幕智能体 :MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.08144 2024-06-14 cs.AI 57%

Mobile-Env: Building Qualified Evaluation Benchmarks for LLM-GUI Interaction

Danyang Zhang, Zhennan Shen, Rui Xie, Situo Zhang, Tianbao Xie, Zihan Zhao, Siyuan Chen, Lu Chen, Hongshen Xu, Ruisheng Cao, Kai Yu

专题命中 GUI与屏幕智能体 :vision language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01014 2024-06-04 cs.CL cs.CV 57%

Mobile-Agent-v2: Mobile Device Operation Assistant with Effective Navigation via Multi-Agent Collaboration

Junyang Wang, Haiyang Xu, Haitao Jia, Xi Zhang, Ming Yan, Weizhou Shen, Ji Zhang, Fei Huang, Jitao Sang

专题命中 GUI与屏幕智能体 :MLLM(abstract);分类 cs.CV

Comments 22 pages, 11 figures, 10 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.07939 2024-05-24 cs.HC cs.AI cs.CL 57%

UFO: A UI-Focused Agent for Windows OS Interaction

Chaoyun Zhang, Liqun Li, Shilin He, Xu Zhang, Bo Qiao, Si Qin, Minghua Ma, Yu Kang, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang, Qi Zhang

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.05363 2024-05-10 cs.CV cs.RO 57%

LOC-ZSON: Language-driven Object-Centric Zero-Shot Object Retrieval and Navigation

Tianrui Guan, Yurou Yang, Harry Cheng, Muyuan Lin, Richard Kim, Rajasimman Madhivanan, Arnie Sen, Dinesh Manocha

专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.CV

Comments Accepted to ICRA 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09951 2024-04-16 cs.CV 57%

Unifying Global and Local Scene Entities Modelling for Precise Action Spotting

Kim Hoang Tran, Phuc Vuong Do, Ngoc Quoc Ly, Ngan Le

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

Comments Accepted to IJCNN 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.03480 2024-04-16 cs.RO cs.AI cs.CL 57%

Can an Embodied Agent Find Your "Cat-shaped Mug"? LLM-Guided Exploration for Zero-Shot Object Navigation

Vishnu Sashank Dorbala, James F. Mullen, Dinesh Manocha

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

Comments 10 pages

Journal ref IEEE Robotics and Automation Letters 9.5 (2024) 4083-4090

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05337 2024-04-09 cs.CL cs.AI 57%

Towards Objectively Benchmarking Social Intelligence for Language Agents at Action Level

Chenxu Wang, Bin Dai, Huaping Liu, Baoyuan Wang

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00096 2024-03-29 cs.CV 57%

OST: Refining Text Knowledge with Optimal Spatio-Temporal Descriptor for General Video Recognition

Tongjia Chen, Hongshan Yu, Zhengeng Yang, Zechuan Li, Wei Sun, Chen Chen

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

Comments Technical report. Project Page: https://tomchen-ctj.github.io/OST/

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.07472 2024-03-28 cs.CV 57%

MP5: A Multi-modal Open-ended Embodied System in Minecraft via Active Perception

Yiran Qin, Enshen Zhou, Qichang Liu, Zhenfei Yin, Lu Sheng, Ruimao Zhang, Yu Qiao, Jing Shao

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV

Comments Accepted to CVPR2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.09209 2024-03-12 cs.CV cs.CL 57%

Summarize the Past to Predict the Future: Natural Language Descriptions of Context Boost Multimodal Object Interaction Anticipation

Razvan-George Pasca, Alexey Gavryushin, Muhammad Hamza, Yen-Ling Kuo, Kaichun Mo, Luc Van Gool, Otmar Hilliges, Xi Wang

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08369 2024-02-14 cs.AI 57%

One-shot Imitation in a Non-Stationary Environment via Multi-Modal Skill

Sangwoo Shin, Daehee Lee, Minjong Yoo, Woo Kyung Kim, Honguk Woo

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

Comments ICML-2023 Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.11561 2023-12-15 cs.CV 57%

Target-Grounded Graph-Aware Transformer for Aerial Vision-and-Dialog Navigation

Yifei Su, Dong An, Yuan Xu, Kehan Chen, Yan Huang

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

Comments 1st Place Solution for the AVDN Challenge in ICCV CLVL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03275 2023-12-07 cs.RO cs.AI 57%

VLFM: Vision-Language Frontier Maps for Zero-Shot Semantic Navigation

Naoki Yokoyama, Sehoon Ha, Dhruv Batra, Jiuguang Wang, Bernadette Bucher

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.08245 2023-11-15 cs.CV 57%

TENT: Connect Language Models with IoT Sensors for Zero-Shot Activity Recognition

Yunjiao Zhou, Jianfei Yang, Han Zou, Lihua Xie

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

Comments Preprint manuscript in submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.15435 2023-10-25 cs.HC cs.AI 57%

PromptInfuser: How Tightly Coupling AI and UI Design Impacts Designers' Workflows

Savvas Petridis, Michael Terry, Carrie J. Cai

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.15324 2023-10-25 cs.CV 57%

Videoprompter: an ensemble of foundational models for zero-shot video understanding

Adeel Yousaf, Muzammal Naseer, Salman Khan, Fahad Shahbaz Khan, Mubarak Shah

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.09756 2023-10-11 cs.CV 57%

Video Action Recognition with Attentive Semantic Units

Yifei Chen, Dapeng Chen, Ruijin Liu, Hao Li, Wei Peng

专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.CV

Comments Accepted at ICCV 2023

Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), 2023, pp. 10170-10180

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.11932 2023-10-06 cs.CV 57%

RIC: Rotate-Inpaint-Complete for Generalizable Scene Reconstruction

Isaac Kasahara, Shubham Agrawal, Selim Engin, Nikhil Chavan-Dafle, Shuran Song, Volkan Isler

专题命中 GUI与屏幕智能体 :visual language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.07409 2023-09-15 cs.CV 57%

Masked Diffusion with Task-awareness for Procedure Planning in Instructional Videos

Fen Fang, Yun Liu, Ali Koksal, Qianli Xu, Joo-Hwee Lim

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

Comments 7 pages (main text excluding references), 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.01372 2023-09-06 cs.CV 57%

DiverseMotion: Towards Diverse Human Motion Generation via Discrete Diffusion

Yunhong Lou, Linchao Zhu, Yaxiong Wang, Xiaohan Wang, Yi Yang

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.13368 2023-07-26 cs.CV 57%

Kefa: A Knowledge Enhanced and Fine-grained Aligned Speaker for Navigation Instruction Generation

Haitian Zeng, Xiaohan Wang, Wenguan Wang, Yi Yang

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.07298 2023-06-14 cs.HC cs.AI 57%

Referring to Screen Texts with Voice Assistants

Shruti Bhargava, Anand Dhoot, Ing-Marie Jonsson, Hoang Long Nguyen, Alkesh Patel, Hong Yu, Vincent Renkens

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

Comments 7 pages, Accepted to ACL Industry Track 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.05662 2023-06-05 cs.CV 57%

InternGPT: Solving Vision-Centric Tasks by Interacting with ChatGPT Beyond Language

Zhaoyang Liu, Yinan He, Wenhai Wang, Weiyun Wang, Yi Wang, Shoufa Chen, Qinglong Zhang, Zeqiang Lai, Yang Yang, Qingyun Li, Jiashuo Yu, Kunchang Li, Zhe Chen, Xue Yang, Xizhou Zhu, Yali Wang, Limin Wang, Ping Luo, Jifeng Dai, Yu Qiao

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.02280 2023-03-31 cs.CV 57%

Filtering, Distillation, and Hard Negatives for Vision-Language Pre-Training

Filip Radenovic, Abhimanyu Dubey, Abhishek Kadian, Todor Mihaylov, Simon Vandenhende, Yash Patel, Yi Wen, Vignesh Ramanathan, Dhruv Mahajan

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

Comments CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.10165 2023-01-25 cs.CL cs.AI 57%

Lexi: Self-Supervised Learning of the UI Language

Pratyay Banerjee, Shweti Mahajan, Kushal Arora, Chitta Baral, Oriana Riva

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

Comments EMNLP (Findings) 2022

详情

展开后加载摘要…

URL PDF HTML 收藏