arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1561 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 1561 篇

2605.13527 2026-06-02 cs.AI 57%

MMSkills: Towards Multimodal Skills for General Visual Agents

MMSkills: 面向通用视觉智能体的多模态技能

Kangning Zhang, Shuai Shao, Qingyao Li, Jianghao Lin, Lingyue Fu, Shijian Wang, Wenxiang Jiao, Yuan Lu, Weiwen Liu, Weinan Zhang, Yong Yu

机构 * Shanghai Jiao Tong University(上海交通大学) Xiaohongshu Inc.(小红书公司) Southeast University(东南大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 提出MMSkills框架,通过将多模态程序知识编码为紧凑的状态条件包(包含文本程序、运行时状态卡和多视角关键帧),并利用轨迹到技能生成器和分支加载多模态技能智能体,显著提升GUI和游戏场景下视觉智能体的决策能力。

Comments 25 pages, 8 figures, 8 tables. Project page: https://zkangning.github.io/MMSkills_for_Visual_Agents/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06995 2026-06-02 cs.AI 57%

What's Missing in Screen-to-Action? Towards a UI-in-the-Loop Paradigm for Multimodal GUI Reasoning

屏幕到动作中缺失了什么?面向多模态GUI推理的UI-in-the-Loop范式

Songze Li, Xiaoke Guo, Tianqi Liu, Biao Yi, Zhaoyan Gong, Zhiqiang Liu, Huajun Chen, Wen Zhang

机构 * Zhejiang University(浙江大学) ZJU-Ant Group Joint Lab of Knowledge Graph(浙大蚂蚁集团知识图谱联合实验室)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI

AI总结 提出UI-in-the-Loop (UILoop) 范式,通过循环的屏幕-UI元素-动作过程,让多模态大模型显式学习UI元素的定位、语义和用法,实现可解释推理,并在UI理解任务上达到最优。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11460 2026-06-02 cs.RO cs.LG 57%

Semantic-Geometric Task Representations for Bimanual Manipulation from Human Demonstrations to Robot Action Planning

面向双臂操作的语义-几何任务表示:从人类示范到机器人动作规划

Franziska Herbert, Vignesh Prasad, Han Liu, Dorothea Koert, Georgia Chalvatzaki

机构 * Interactive Robot Perception & Learning (PEARL) Lab, Computer Science Dept., TU Darmstadt, Germany(图腾大学达姆施塔特分校计算机科学系交互机器人感知与学习实验室) Hessian.AI, Darmstadt, Germany(黑森人工智能公司) Robotics Institute Germany (RIG)(德国机器人研究所) Interactive AI Algorithms & Cognitive Models for Human-AI Interaction (IKIDA), Computer Science Dept., TU Darmstadt, Germany(人机交互的交互人工智能算法与认知模型(IKIDA),图腾大学达姆施塔特分校计算机科学系) Center for Cognitive Science, TU Darmstadt, Germany(图腾大学达姆施塔特分校认知科学中心)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.LG

AI总结 提出一种语义-几何图任务表示,通过消息传递神经网络编码器和Transformer解码器联合编码对象身份、语义关系和运动历史,实现从人类示范中学习结构化任务表示,并支持跨实体迁移和双臂操作规划。

Comments 9 pages, 7 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31365 2026-06-01 cs.AI 57%

Learning to Adapt: Self-Improving Web Agent via Cognitive-Aware Exploration

学习适应:通过认知感知探索实现自我改进的网络智能体

Weile Chen, Bingchen Miao, Qifan Yu, Wendong Bu, Guoming Wang, Wenqiao Zhang, Shengyu Zhang, Juncheng Li, Siliang Tang

机构 * Zhejiang University(浙江大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI

AI总结 提出SCALE框架,利用选择器、预测器和评判器三个对抗角色,通过环境探索自主发现智能体局限性并扩展认知边界,结合SCALE-Hop图探索策略和SCALE-20k数据集,显著提升多模态大语言模型在多种网络环境中的性能和泛化能力。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17111 2026-06-01 cs.RO cs.LG 57%

Efficient Vision-Language-Action Models for Embodied Manipulation: A Systematic Survey

面向具身操作的高效视觉-语言-动作模型:系统综述

Weifan Guan, Qinghao Hu, Aosheng Li, Jian Cheng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) AiRiA Nanjing University of Information Science and Technology(南京信息科学技术大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.LG

AI总结 本文系统综述了通过模型架构、感知特征、动作生成和训练/推理策略四个维度降低视觉-语言-动作模型延迟、内存占用及计算成本的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30117 2026-05-29 cs.AI 57%

VLA-Trace: Diagnosing Vision-Language-Action Models through Representation and Behavior Tracing

VLA-Trace: 通过表示与行为追踪诊断视觉-语言-动作模型

Haoyuan Shi, Xiancong Ren, Yingji Zhang, Qinfan Zhang, Jiayu Hu, Haozhe Shan, Han Dong, Jinpeng Lu, Yinda Chen, Yi Zhang, Yong Dai, Xiaozhu Ju

机构 * University of Science and Technology of China(中国科学技术大学) University of Manchester(曼彻斯特大学) Beihang University(北航) Fudan University(复旦大学) University of New South Wales(新南威尔士大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 提出VLA-Trace诊断框架,通过表示演化、因果控制归因和行为表现分析,揭示VLA模型在多模态知识向具身控制转化中的机制,发现不同模型在微调适应、多模态路由和语义遵循上的差异与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29534 2026-05-29 cs.AI 57%

UI-KOBE: Knowledge-Oriented Behavior Exploration for Lightweight Graph-Guided GUI Agents

UI-KOBE:面向轻量级图引导GUI代理的知识导向行为探索

Yuxiang Chai, Han Xiao, Xinyu Fu, Jinpeng Chen, Rui Liu, Hongsheng Li

机构 * CUHK MMLab(香港大学多模态实验室) Huawei Research(华为研究) Shenzhen Loop Area Institute(深圳河套学院) CPII under InnoHK(创新香港下的CPII)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

AI总结 提出UI-KOBE框架,通过自动构建应用知识图谱并引导轻量级GUI代理进行运行时决策,以提升其移动端GUI任务执行效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28056 2026-05-28 cs.CV 57%

CogPortrait: Fine-Grained Eye-Region Control in Portrait Animation via Hierarchical Agent Planning

CogPortrait: 通过分层智能体规划实现肖像动画中的细粒度眼部区域控制

He Feng, Yongjia Ma, Donglin Di, Lei Fan, Tonghua Su

机构 * Harbin Institute of Technology(哈尔滨工业大学) University of New South Wales(新南威尔士大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV

AI总结 提出CogPortrait两阶段框架,利用多模态大语言模型智能体从高层标签生成关键点,再通过DiT视频生成骨干合成动画,实现细粒度眼部控制,并引入EMH基准评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26503 2026-05-27 cs.CV 57%

Uncertainty-Aware Gaussian Map for Vision-Language Navigation

面向视觉-语言导航的不确定性感知高斯地图

Jianzhe Gao, Rui Liu, Yuxuan Xu, Tongtong Cao, Yingxue Zhang, Zhanguang Zhang, Sida Peng, Yi Yang, Wenguan Wang

机构 * The State Key Lab of Brain-Machine Intelligence(脑机智能国家重点实验室) Department of Foundation model, 2012 Labs, Huawei(基础模型部门,2012实验室,华为) Noah’s Ark Lab, 2012 Labs, Huawei(诺亚方舟实验室,2012实验室,华为) School of Software Technology, Zhejiang University(浙江大学软件学院)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 提出不确定性感知高斯地图,通过显式建模几何、语义和外观三种感知不确定性并融入观测空间,提升视觉-语言导航中智能体的决策可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08047 2026-05-26 cs.AI cs.MA 57%

WorldGUI: An Interactive Benchmark for Desktop GUI Automation from Any Starting Point

WorldGUI: 一个从任意起点进行桌面GUI自动化的交互式基准测试

Henry Hengyuan Zhao, Kaiming Yang, Wendi Yu, Difei Gao, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 提出WorldGUI基准测试,覆盖10个桌面和Web应用,在多种系统构建的初始状态下评估GUI代理的规划鲁棒性,并引入WorldGUI-Agent框架通过三阶段批评提升动态环境下的可靠性。

Comments Technique Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23187 2026-05-25 cs.CV cs.RO 57%

IntentionNav: A Benchmark for Intent-Driven Object Navigation from Implicit Human Instruction

IntentionNav: 一种基于隐式人类指令的意图驱动目标导航基准

Lin Qian, Shijie Li, Sihao Lin, Xuan Zhang, Bangya Liu, Yanran Li, Hujun Yin

机构 * The University of Manchester(曼彻斯特大学) A*STAR Responsible AI Research Centre, Adelaide University(阿德莱德大学负责任人工智能研究中心) University of Bedfordshire(贝福德郡大学)

专题命中 GUI与屏幕智能体 :VLM(abstract_cn);分类 cs.CV

AI总结 提出IntentionNav基准,通过隐式人类指令(如“我需要热一下食物”)驱动智能体推断目标物体并导航至其位置,实验表明当前模型在终端成功率和精确定位方面存在显著瓶颈。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10347 2026-05-25 cs.AI cs.CL 57%

How Mobile World Model Guides GUI Agents?

移动世界模型如何指导GUI代理?

Weikai Xu, Kun Huang, Yunren Feng, Jiaxing Li, Yuhan Chen, Yuxuan Liu, Zhizheng Jiang, Heng Qu, Pengzhi Gao, Wei Liu, Jian Luan, Xiaolin Hu, Bo An

机构 * Nanyang Technological University(南洋理工大学) MiLM Plus, Xiaomi Inc.(小米公司) Independent Researchers(独立研究人员) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Wuhan University(武汉大学) Xiamen University(厦门大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

AI总结 本文通过训练四种模态(增量文本、完整文本、扩散图像、可渲染代码)的世界模型,并评估其在下游任务中的效用,发现可渲染代码重建在分布内保真度高,文本反馈对在线分布外执行更鲁棒,世界模型生成的轨迹可提供迁移经验但无法替代原始分布,且对低熵过度自信的代理,后验自省收益有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22816 2026-05-22 cs.RO cs.CV 57%

AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation

AwareVLN: 基于自感知的视觉语言导航推理

Wenxuan Guo, Xiuwei Xu, Yichen Liu, Xiangyu Li, Hang Yin, Huangxing Chen, Wenzhao Zheng, Jianjiang Feng, Jie Zhou, Jiwen Lu

机构 * Tsinghua University(清华大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出AwareVLN框架,通过自感知推理机制实现端到端的视觉语言导航,解决了传统方法在理解代理、指令和场景关系上的不足,并在多个数据集上实现了优于现有方法的性能。

Comments Accepted to CVPR 2026. Project page: https://gwxuan.github.io/AwareVLN/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05765 2026-05-22 cs.CV 57%

X-OmniClaw Technical Report: A Unified Mobile Agent for Multimodal Understanding and Interaction

X-OmniClaw 技术报告:一种统一的移动代理用于多模态理解和交互

Xiaoming Ren, Ru Zhen, Chao Li, Yang Song, Qiuxia Hou, Yanhao Zhang, Peng Liu, Qi Qi, Quanlong Zheng, Qi Wu, Zhenyi Liao, Binqiang Pan, Haobo Ji, Haonan Lu

机构 * OPPO AI Center(OPPO人工智能中心)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 本文提出X-OmniClaw,一种统一的移动代理,用于Android生态系统中的多模态理解和交互,通过统一的感知、记忆和行动架构,提升复杂移动任务的上下文感知能力,展示了其在多模态交互中的高效性和可靠性。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21463 2026-05-21 cs.CL cs.AI 57%

Mem-$π$: Adaptive Memory through Learning When and What to Generate

Mem-$π$: 通过学习何时以及生成什么来实现自适应记忆

Xiaoqiang Wang, Chao Wang, Hadi Nekoei, Christopher Pal, Alexandre Lacoste, Spandana Gella, Bang Liu, Perouz Taslakian

机构 * ServiceNow AI Research(ServiceNow AI研究院) Mila -- Quebec AI Institute(魁北克AI研究所) McGill University(麦吉尔大学) CIFAR AI Chair(CIFAR人工智能主席)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

AI总结 Mem-$π$ 通过学习在何时以及生成什么来实现自适应记忆,利用专门的语言或视觉-语言模型生成上下文特定的指导,从而在多种代理任务中优于基于检索和先前RL优化的记忆基线。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21414 2026-05-21 cs.RO cs.CV 57%

PointACT: Vision-Language-Action Models with Multi-Scale Point-Action Interaction

PointACT: 多尺度点-动作交互的视觉-语言-动作模型

Shizhe Chen, Paul Pacaud, Cordelia Schmid

机构 * Inria(法国国家信息与自动化研究所) École normale supérieure(法国高等科学研究院) CNRS(法国国家科学研究中心) PSL Research University(巴黎综合理工研究院)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 本文提出PointACT,一种集成层次化3D点云表示的3D感知视觉-语言-动作政策,通过多尺度点-动作交互机制提升机器人在3D环境中的精细几何推理和空间定位能力。

Comments Accepted to RSS 2026; project webpage: https://cshizhe.github.io/projects/pointact.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21132 2026-05-21 cs.CV 57%

SurgOnAir: Hierarchy-Aware Real-Time Surgical Video Commentary

SurgOnAir: 基于层次感知的实时手术视频评论

Jingyi He, Yue Zhou, Long Bai, Kun Yuan, Nassir Navab, Yuan Bi

机构 * Computer Aided Medical Procedures (CAMP), TU Munich, Germany Munich Center for Machine Learning (MCML), Munich, Germany University of Strasbourg, France The Chinese University of Hong Kong, Hong Kong

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

AI总结 本研究提出SurgOnAir,一种流式视觉-语言模型,通过层次化数据集实现对手术流程多层级的实时理解与评论生成,提升手术过程中的即时响应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16116 2026-05-18 cs.AI 57%

ShopGym: An Integrated Framework for Realistic Simulation and Scalable Benchmarking of E-Commerce Web Agents

ShopGym: 一个集成框架,用于电子商务网络代理的现实模拟和可扩展基准测试

Chinmay Savadikar, Mingyu Zhao, Yuanzheng Zhu, Han Li, Shuang Xie, Alberto Castelo, Tianfu Wu, Lingyun Wang

机构 * North Carolina State University(北卡罗来纳州立大学) Shopify

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 本文提出ShopGym框架,通过模拟层ShopArena和基准层ShopGuru,实现电子商务网络代理的现实模拟与可扩展基准测试,验证了合成商店在结构属性和代理性能上的有效性。

Comments 32 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15963 2026-05-18 cs.AI 57%

PAGER: Bridging the Semantic-Execution Gap in Point-Precise Geometric GUI Control

PAGER:弥合点精确几何GUI控制中的语义-执行鸿沟

Jingxuan Wei, Xi Bai, Shan Liu, Caijun Jia, Zheng Sun, Xinglong Xu, Siyuan Li, Linzhuang Sun, Bihui Yu, Conghui He, Cheng Tan

机构 * University of Chinese Academy of Sciences(中国科学院大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) China University of Petroleum-Beijing(中国石油大学(北京))

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

AI总结 本文提出PAGER,通过依赖结构规划与像素级执行,解决对点精确几何GUI任务的需求,提升任务成功率至62%以上,填补语义-执行鸿沟。

Comments 27 pages, 11 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14950 2026-05-15 cs.CV cs.RO 57%

Evo-Depth: A Lightweight Depth-Enhanced Vision-Language-Action Model

Evo-Depth:一种轻量化的深度增强视觉-语言-动作模型

Tao Lin, Yuxin Du, Jiting Liu, Nuobei Zhu, Yunhe Li, Yuqian Fu, Yinxinyu Chen, Hongyi Cai, Zewei Ye, Bing Cheng, Kai Ye, Yiran Mao, Yilei Zhong, MingKang Dong, Junchi Yan, Gen Li, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) King Abdullah University of Science and Technology(卡塔尔国王 Abdullah 大学科学与技术大学) Nanyang Technological University(南洋理工大学) SJTU-Quic Robot Joint Lab(上海交通大学-Quick 机器人联合实验室)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 本文提出Evo-Depth模型,通过轻量隐式深度编码模块和空间增强模块提升视觉-语言-动作任务中的空间感知能力,实现高效部署与高精度操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14851 2026-05-15 cs.CV cs.RO 57%

AutoMoT: A Unified Vision-Language-Action Model with Asynchronous Mixture-of-Transformers for End-to-End Autonomous Driving

AutoMoT:一种基于异步混合变换器的统一视觉-语言-动作模型用于端到端自动驾驶

Wenhui Huang, Songyan Zhang, Qihang Huang, Zhidong Wang, Zhiqi Mao, Collister Chua, Zhan Chen, Long Chen, Chen Lv

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Harvard University, US(哈佛大学,美国)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出AutoMoT,一种统一视觉-语言-动作模型,通过异步混合变换器架构解决自动驾驶中推理与动作空间分布不一致、推理效率低等问题,实验证明其在多基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14051 2026-05-15 cs.AI 57%

SPIN: Structural LLM Planning via Iterative Navigation for Industrial Tasks

SPIN:通过迭代导航进行工业任务的结构LLM规划

Yusuke Ozaki, Dhaval Patel

机构 * University at Albany(阿尔巴马大学) IBM(国际商业机器公司) Kwansei Gakuin University(关西大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 SPIN通过结合验证的有向无环图规划与前缀执行控制,减少任务执行次数并提高完成率,适用于工业任务规划。

Comments 31 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13737 2026-05-14 cs.AI cs.CL 57%

Senses Wide Shut: A Representation-Action Gap in Omnimodal LLMs

宽视角闭合:多模态大语言模型中的表征-行动鸿沟

Trung Nguyen Quang, Yiming Gao, Fanyi Pu, Kaichen Zhang, Shuo Sun, Ziwei Liu

机构 * Nanyang Technological University(南洋理工大学) LMMs-Lab Team(多模态大模型实验室团队) Johns Hopkins University(约翰霍普金斯大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 研究发现多模态大语言模型在感知与行动之间存在鸿沟,通过IMAVB基准测试揭示模型在处理冲突信息时的不足,提出PGLA方法提升拒绝行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13403 2026-05-14 cs.RO cs.CV 57%

RotVLA: Rotational Latent Action for Vision-Language-Action Model

RotVLA: 旋转的潜在动作用于视觉-语言-动作模型

Qiwei Li, Xicheng Gong, Xinghang Li, Peiyan Li, Quanyun Zhou, Hangjun Ye, Jiahuan Zhou, Yadong Mu

机构 * Wangxuan Institute of Computer Technology, Peking University(王轩计算机技术研究所,北京大学) Xiaomi Robotics(小米机器人) CASIA

专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.CV

AI总结 RotVLA提出基于连续旋转潜在动作表示的VLA框架,通过三元组帧学习和流匹配头实现高效动作建模,实现98.2%的LIBERO和89.6%/88.5%的RoboTwin2.0性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11808 2026-05-13 cs.CV 57%

Mitigating Action-Relation Hallucinations in LVLMs via Relation-aware Visual Enhancement

通过关系感知视觉增强缓解LVLM中的动作关系幻觉

Zhenxin Qin, Qiang Li, Qingzhuo Wang, Ruiyang Qin, Zhihua Wei, Wen Shen

机构 * Tongji University(同济大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出通过关系感知视觉增强方法,缓解LVLM中动作关系幻觉问题,通过提升模型对关键视觉区域的关注度,有效减少幻觉并泛化至其他关系幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12177 2026-05-13 cs.AI 57%

Floorplan2Guide: LLM-Guided Floorplan Parsing for BLV Indoor Navigation

Floorplan2Guide: 基于LLM的BLV室内导航floorplan解析

Aydin Ayanzadeh, Tim Oates

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校)

专题命中 GUI与屏幕智能体 :visual reasoning(abstract);分类 cs.AI

AI总结 本文提出利用基础模型将floor plan转化为可导航的知识图谱,并生成可读的导航指令,通过LLM提取空间信息,提升BLV用户室内导航的精度与安全性。

Comments Accepted for publication in the proceedings of the IEEE International Conference on Big Data (IEEE BigData 2025)

Journal ref IEEE International Conference on Big Data (IEEE BigData 2025), pp. 7477-7485

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09528 2026-05-12 cs.AI 57%

Cplus2ASP: Computing Action Language C+ in Answer Set Programming

Cplus2ASP:在答案集编程中计算动作语言C+

Joseph Babb, Joohyung Lee

机构 * School of Computing, Informatics, and Decision Systems Engineering(计算、信息与决策系统工程学院)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 Cplus2ASP 2.0实现了动作语言C+的确定性片段,通过现代答案集求解技术提升效率,结合多种理论成果,利用工具链实现C+到ICLingo的翻译,并支持扩展多模态翻译。

Journal ref In Proceedings of the 12th International Conference on Logic Programming and Nonmonotonic Reasoning (LPNMR 2013), 122-134, 2013

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00884 2026-05-12 cs.CV 57%

LiteVLA-H: Dual-Rate Vision-Language-Action Inference for Onboard Aerial Guidance and Semantic Perception

LiteVLA-H: 双速率视觉-语言-动作推断用于机载空中引导与语义感知

Justin williams, Kishor Datta Gupta, Roy George, Mrinmoy Sarkar

机构 * Department of Cyber Physical Systems, Clark Atlanta University(克劳克阿特拉大学网络物理系统系)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 LiteVLA-H通过双速率操作在边缘设备上实现高效视觉-语言-动作推断,兼顾快速动作输出与语义理解,提升空中引导与场景感知性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21858 2026-05-11 cs.AI 57%

ProactiveMobile: A Comprehensive Benchmark for Boosting Proactive Intelligence on Mobile Devices

ProactiveMobile: 一个全面的基准,用于提升移动设备上的主动智能

Dezhi Kong, Zhengzhao Feng, Qiliang Liang, Hao Wang, Haofei Sun, Changpeng Yang, Yang Li, Peng Zhou, Shuai Nie, Hongzhen Wang, Linfeng Zhou, Hao Jia, Jiaming Xu, Runyu Shi, Ying Huang

机构 * HyperAI Team, Xiaomi Corporation(小米公司HyperAI团队) Zhejiang University(浙江大学) Peking University(北京大学) Northeastern University(东北大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出ProactiveMobile基准,通过多模态大语言模型在移动代理中实现主动智能,通过63个API生成可执行函数序列,实验表明Qwen2.5-VL-7B-Instruct在主动智能任务中表现优于其他模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15840 2026-05-11 cs.RO cs.CV 57%

Large Video Planner Enables Generalizable Robot Control

大视频规划器实现通用机器人控制

Boyuan Chen, Tianyuan Zhang, Haoran Geng, Caiyi Zhang, Peihao Li, Kiwhan Song, William T. Freeman, Jitendra Malik, Pieter Abbeel, Russ Tedrake, Vincent Sitzmann, Yilun Du

机构 * MIT(麻省理工学院) UC Berkeley(加州大学伯克利分校) Harvard(哈佛大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出利用大规模视频预训练构建通用机器人基础模型,通过生成视频计划实现跨任务和环境的泛化控制,并在真实机器人上验证了其可行性。

Comments 29 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏