arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1561 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 1561 篇

2508.17442 2025-08-26 cs.CV 57%

Multi-Level LVLM Guidance for Untrimmed Video Action Recognition

Liyang Peng, Sihan Zhu, Yunjie Guo

机构 * Kunming University of Science and Technology(昆明理工大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15663 2025-08-22 cs.RO cs.AI 57%

Mind and Motion Aligned: A Joint Evaluation IsaacSim Benchmark for Task Planning and Low-Level Policies in Mobile Manipulation

Nikita Kachaev, Andrei Spiridonov, Andrey Gorodetsky, Kirill Muravyev, Nikita Oskolkov, Aditya Narendra, Vlad Shakhuro, Dmitry Makarov, Aleksandr I. Panov, Polina Fedotova, Alexey K. Kovalev

机构 * AIRI Moscow Institute of Physics and Technology (MIPT)(莫斯科物理技术学院) Lomonosov Moscow State University(罗蒙诺索夫莫斯科国立大学) Sberbank, Robotics Center(Sberbank机器人中心) Skoltech

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15206 2025-08-21 cs.RO cs.AI 57%

EndoVLA: Dual-Phase Vision-Language-Action Model for Autonomous Tracking in Endoscopy

Chi Kit Ng, Long Bai, Guankun Wang, Yupeng Wang, Huxin Gao, Kun Yuan, Chenhan Jin, Tieyong Zeng, Hongliang Ren

机构 * The Chinese University of Hong Kong(香港中文大学) Technical University of Munich(慕尼黑技术大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11334 2025-08-18 cs.AI cs.RO 57%

CogDDN: A Cognitive Demand-Driven Navigation with Decision Optimization and Dual-Process Thinking

Yuehao Huang, Liang Liu, Shuangming Lei, Yukai Ma, Hao Su, Jianbiao Mei, Pengxiang Zhao, Yaqing Gu, Yong Liu, Jiajun Lv

机构 * Zhejiang University(浙江大学) vivo AI Lab(vivo AI实验室)

专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.AI

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10333 2025-08-15 cs.RO cs.CV 57%

ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver

Wenxuan Song, Ziyang Zhou, Han Zhao, Jiayi Chen, Pengxiang Ding, Haodong Yan, Yuxin Huang, Feilong Tang, Donglin Wang, Haoang Li

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17490 2025-08-15 cs.HC cs.AI cs.MM 57%

AMEX: Android Multi-annotation Expo Dataset for Mobile GUI Agents

Yuxiang Chai, Siyuan Huang, Yazhe Niu, Han Xiao, Liang Liu, Dingyu Zhang, Shuai Ren, Hongsheng Li

机构 * SJTU(上海交通大学) vivo AI Lab(vivo人工智能实验室)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06553 2025-08-12 cs.CV 57%

Static and Plugged: Make Embodied Evaluation Simple

Jiahao Xiao, Jianbo Zhang, BoWen Yan, Shengyu Guo, Tongrui Ye, Kaiwei Zhang, Zicheng Zhang, Xiaohong Liu, Zhengxue Cheng, Lei Fan, Chuyi Li, Guangtao Zhai

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06134 2025-08-12 cs.CV 57%

X2I: Seamless Integration of Multimodal Understanding into Diffusion Transformer via Attention Distillation

Jian Ma, Qirong Peng, Xu Guo, Chen Chen, Haonan Lu, Zhenyu Yang

机构 * OPPO AI Center(OPPO人工智能中心) Tsinghua University(清华大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00893 2025-08-05 cs.CL cs.AI 57%

Affordance Benchmark for MLLMs

Junying Wang, Wenzhe Li, Yalun Wu, Yingji Liang, Yijin Guo, Chunyi Li, Haodong Duan, Zicheng Zhang, Guangtao Zhai

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19478 2025-07-28 cs.CV cs.CL 57%

MMBench-GUI: Hierarchical Multi-Platform Evaluation Framework for GUI Agents

Xuehui Wang, Zhenyu Wu, JingJing Xie, Zichen Ding, Bowen Yang, Zehao Li, Zhaoyang Liu, Qingyun Li, Xuan Dong, Zhe Chen, Weiyun Wang, Xiangyu Zhao, Jixuan Chen, Haodong Duan, Tianbao Xie, Chenyu Yang, Shiqian Su, Yue Yu, Yuan Huang, Yiqian Liu, Xiao Zhang, Yanting Zhang, Xiangyu Yue, Weijie Su, Xizhou Zhu, Wei Shen, Jifeng Dai, Wenhai Wang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Xiamen University(厦门大学) University of Science and Technology of China(中国科学技术大学) The Hong Kong University of Science and Technology(香港科技大学) Harbin Institute of Technology(哈尔滨工业大学) Tsinghua University(清华大学) Nanjing University(南京大学) Fudan University(复旦大学) University of Hong Kong(香港大学) Donghua University(东华大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

Comments in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15174 2025-07-22 cs.LG 57%

Joint-Local Grounded Action Transformation for Sim-to-Real Transfer in Multi-Agent Traffic Control

Justin Turnau, Longchao Da, Khoa Vo, Ferdous Al Rafi, Shreyas Bachiraju, Tiejin Chen, Hua Wei

机构 * ASU(亚利桑那州立大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.LG

Comments This paper was accepted to RLC/RLJ 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09617 2025-07-15 cs.AI cs.RO 57%

Bridging Bots: from Perception to Action via Multimodal-LMs and Knowledge Graphs

Margherita Martorana, Francesca Urgese, Mark Adamik, Ilaria Tiddi

机构 * Vrije Universiteit Amsterdam(范·艾克大学阿姆斯特丹)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07663 2025-07-11 cs.CV 57%

MolCLIP: A Molecular-Auxiliary CLIP Framework for Identifying Drug Mechanism of Action Based on Time-Lapsed Mitochondrial Images

Fengqian Pang, Chunyue Lei, Hongfei Zhao, Chenghao Liu, Zhiqiang Xing, Huafeng Wang, Chuyang Ye

专题命中 GUI与屏幕智能体 :visual language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02747 2025-07-04 cs.CV cs.RO 57%

DexVLG: Dexterous Vision-Language-Grasp Model at Scale

Jiawei He, Danshi Li, Xinqiang Yu, Zekun Qi, Wenyao Zhang, Jiayi Chen, Zhaoxiang Zhang, Zhizheng Zhang, Li Yi, He Wang

机构 * Institution1(机构1) Institution2(机构2)

专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11818 2025-07-03 cs.RO cs.AI 57%

Embodied Instruction Following in Unknown Environments

Zhenyu Wu, Ziwei Wang, Xiuwei Xu, Hang Yin, Yinan Liang, Angyuan Ma, Jiwen Lu, Haibin Yan

机构 * School of Intelligent Engineering and Automation, Beijing University of Posts and Telecommunications(北京邮电大学智能工程与自动化学院) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) Department of Automation, Tsinghua University(清华大学自动化学院)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI

Comments Project Page: https://gary3410.github.io/eif_unknown/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07217 2025-07-01 cs.AI 57%

BIMgent: Towards Autonomous Building Modeling via Computer-use Agents

Zihan Deng, Changyu Du, Stavros Nousias, André Borrmann

机构 * Chair of Computing in Civil and Building Engineering, Technical University of Munich, Germany(土木与建筑工程计算系,慕尼黑技术大学) TUM Georg Nemetschek Institute, Munich, Germany(慕尼黑技术大学Georg Nemetschek研究所)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI

Comments ICML 2025 Workshop on Computer Use Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22056 2025-06-30 cs.AI 57%

Universal Retrieval for Multimodal Trajectory Modeling

Xuan Zhang, Ziyan Jiang, Rui Meng, Yifei Leng, Zhenbang Xiao, Zora Zhiruo Wang, Yanyi Shang, Dehan Kong

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

Comments 18 pages, 3 figures, accepted by Workshop on Computer-use Agents @ ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17221 2025-06-26 cs.CV 57%

VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning

Zhangyang Qi, Zhixiong Zhang, Yizhou Yu, Jiaqi Wang, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

Comments project page: vlnr1.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19884 2025-06-26 cs.OS cs.AI cs.PF cs.SE 57%

MNN-AECS: Energy Optimization for LLM Decoding on Mobile Devices via Adaptive Core Selection

Zhengxiang Huang, Chaoyue Niu, Zhaode Wang, Jiarui Xue, Hanming Zhang, Yugang Wang, Zewei Xin, Xiaotang Jiang, Chengfei Lv, Fan Wu, Guihai Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团)

专题命中 GUI与屏幕智能体 :MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19850 2025-06-25 cs.CV cs.RO 57%

Unified Vision-Language-Action Model

Yuqi Wang, Xinghang Li, Wenxuan Wang, Junbo Zhang, Yingyan Li, Yuntao Chen, Xinlong Wang, Zhaoxiang Zhang

机构 * CASIA(中国科学院自动化研究所) BAAI(阿里巴巴人工智能研究院) THU(清华大学) HKISI(香港理工大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17746 2025-06-24 cs.CV 57%

PhysID: Physics-based Interactive Dynamics from a Single-view Image

Sourabh Vasant Gothe, Ayon Chattopadhyay, Gunturi Venkata Sai Phani Kiran, Pratik, Vibhav Agarwal, Jayesh Rajkumar Vachhani, Sourav Ghosh, Parameswaranath VM, Barath Raj KR

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV

Comments Published in 2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). Project page: https://physid.github.io/

Journal ref 2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), Hyderabad, India, 2025, pp. 1-5

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04217 2025-06-24 cs.RO cs.AI 57%

OWMM-Agent: Open World Mobile Manipulation With Multi-modal Agentic Data Synthesis

Junting Chen, Haotian Liang, Lingxiao Du, Weiyun Wang, Mengkang Hu, Yao Mu, Wenhai Wang, Jifeng Dai, Ping Luo, Wenqi Shao, Lin Shao

机构 * Shanghai AI Laboratory(上海人工智能实验室) School of Computing, National University of Singapore(新加坡国立大学计算机学院) Shanghai Jiaotong University(上海交通大学) Tsinghua University(清华大学)

专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.AI

Comments 9 pages of main content, 19 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10387 2025-06-13 cs.AI 57%

Mirage-1: Augmenting and Updating GUI Agent with Hierarchical Multimodal Skills

Yuquan Xie, Zaijing Li, Rui Shao, Gongwei Chen, Kaiwen Zhou, Yinchuan Li, Dongmei Jiang, Liqiang Nie

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 GUI与屏幕智能体 :MLLM(abstract);分类 cs.AI

Comments 20 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20279 2025-06-10 cs.CL cs.AI cs.CR 57%

sudo rm -rf agentic_security

Sejin Lee, Jian Kim, Haon Park, Ashkan Yousefpour, Sangyoon Yu, Min Song

机构 * Aim Intelligence Yonsei University(延世大学) Seoul National University(首尔国立大学)

专题命中 GUI与屏幕智能体 :vision language model(abstract);分类 cs.AI

Comments Accepted ACL 2025 Industry track

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06630 2025-06-10 cs.RO cs.AI 57%

Active Test-time Vision-Language Navigation

Heeju Ko, Sungjune Kim, Gyeongrok Oh, Jeongyoon Yoon, Honglak Lee, Sujin Jang, Seungryong Kim, Sangpil Kim

机构 * Korea University(韩国大学) University of Michigan(密歇根大学) Samsung AI Center, DS Division(三星人工智能中心,DS部门) Korea Advanced Institute of Science & Technology(韩国先进科学技术研究所)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02327 2025-06-04 cs.CV 57%

Medical World Model: Generative Simulation of Tumor Evolution for Treatment Planning

Yijun Yang, Zhao-Yang Wang, Qiuping Liu, Shuwen Sun, Kang Wang, Rama Chellappa, Zongwei Zhou, Alan Yuille, Lei Zhu, Yu-Dong Zhang, Jieneng Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Johns Hopkins University(约翰霍普金斯大学) The First Affiliated Hospital of Nanjing Medical University(南京医科大学第一附属医院) University of California, San Francisco(加州大学旧金山分校)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19901 2025-06-04 cs.CV 57%

Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM

Peng Liu, Xiaoming Ren, Fengkai Liu, Qingsong Xie, Quanlong Zheng, Yanhao Zhang, Haonan Lu, Yujiu Yang

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01844 2025-06-03 cs.LG cs.RO 57%

SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics

Mustafa Shukor, Dana Aubakirova, Francesco Capuano, Pepijn Kooijmans, Steven Palma, Adil Zouitine, Michel Aractingi, Caroline Pascal, Martino Russi, Andres Marafioti, Simon Alibert, Matthieu Cord, Thomas Wolf, Remi Cadene

机构 * Hugging Face Sorbonne University(索邦大学) École Normale Supérieure Paris-Saclay(巴黎萨克雷高等师范学院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.LG

Comments 24 pages. Code and assets: https://github.com/huggingface/lerobot

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09306 2025-06-03 cs.CV 57%

Keypoint-Integrated Instruction-Following Data Generation for Enhanced Human Pose and Action Understanding in Multimodal Models

Dewen Zhang, Wangpeng An, Hayaru Shouno

机构 * Department of Informatics, Graduate School of Informatics and Engineering, The University of Electro-Communications(信息学院、信息与工程研究生院、电通通信大学)

专题命中 GUI与屏幕智能体 :LLaVA(abstract);分类 cs.CV

Comments Accepted at the International Conference on Advanced Concepts for Intelligent Vision Systems (ACIVS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01014 2025-06-02 cs.CV 57%

AnimeGamer: Infinite Anime Life Simulation with Next Game State Prediction

Junhao Cheng, Yuying Ge, Yixiao Ge, Jing Liao, Ying Shan

机构 * ARC Lab, Tencent PCG(腾讯PCG ARC实验室) City University of Hong Kong(香港城市大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV

Comments Project released at: https://howe125.github.io/AnimeGamer.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏