arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1561 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 1561 篇

2607.14586 2026-07-17 cs.RO 新提交 83%

SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation

SoftNav:将3D场景令牌注入视觉语言模型以进行具身导航

Yi Wu, Junjie An, Xiao Liu, Yiqun Zhou, Yuechen Wu, Xiaoqing Guan, Shuyang Yu, You Wang, Guang Li

机构 * Zhejiang University(浙江大学) Shandong University(山东大学)

专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract);vision-language model(abstract)

AI总结 研究针对具身导航中3D场景理解与导航推理协同问题,提出SoftNav方法,通过轻量级投影仪将3D连续表示作为软令牌注入VLM隐藏空间,在HM3D-OVON上超越先前方法,且能零样本转移到其他场景,弥合表征差距实现可转移导航。

Comments 8 pages, 6 figures. Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30367 2026-06-30 cs.RO 83%

FutureNav: Unified World-Action Modeling for Vision-and-Language Navigation

FutureNav: 面向视觉与语言导航的统一世界-动作建模

Lingfeng Zhang, Zeying Gong, Xiaoshuai Hao, Haoxiang Fu, Qiang Zhang, Mingliang Zhou, Hangjun Ye, Xiaojun Liang, Junwei Liang, Wenbo Ding

机构 * Tsinghua University(清华大学) Pengcheng Laboratory(鹏城实验室) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Xiaomi EV(小米电动车) National University of Singapore(新加坡国立大学)

专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract);vision-language model(abstract)

AI总结 提出FutureNav,一种基于VLM的统一世界-动作建模框架,通过联合优化动作策略、逆/前向动力学和未来状态预测四个目标,在4B规模骨干上实现多VLN基准的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27906 2026-06-29 cs.AR 新提交 83%

Phase Matters: Characterizing Heterogeneous Vision-Language Inference on a Mobile SoC

阶段至关重要:移动SoC上异构视觉-语言推理的特征分析

Aryama V Murthy, Yashas N Kotre, Prathmesh Sharma, Pragya Mishra, Sanjith Ganapathi, Priyesh Shukla

专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract);vision-language model(abstract)

AI总结 本文通过硬件在环实验,系统表征了移动SoC上VLM推理的阶段性特征,发现NPU执行高度依赖阶段,在预填充阶段加速1.64倍,解码阶段仅1.18倍,视觉编码器加速20-45倍,并展示了四步图重写方法使Phi-3.5-V等编码器获得22倍加速。

Comments 6 pages, 5 figures. Published in MobiSys Workshop '26

Journal ref In Proceedings of the 24th Annual International Conference on Mobile Systems, Applications and Services Workshops (MobiSys Workshop '26), June 21-25, 2026, Cambridge, United Kingdom. ACM, New York, NY, USA, 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13878 2026-06-15 cs.RO 新提交 83%

AnyGoal: Vision-Language Guided Multi-Agent Exploration for Training-Free Lifelong Navigation

AnyGoal: 视觉-语言引导的多智能体探索实现免训练终身导航

MoniJesu James, Marcelino Julio Fernando, Miguel Altamirano Cabrera, Dzmitry Tsetserukou

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract);vision-language model(abstract)

AI总结 提出AnyGoal,一种免训练多机器人架构,利用视觉-语言模型(VLM)驱动前沿探索,通过共享2D高斯贝叶斯价值图(BVM)协调智能体,实现终身证据积累,在GOAT-Bench上达到52.4%子任务成功率,优于模块化方法27.7个百分点。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08736 2026-08-11 cs.AI 新提交 83%

FitAQA: A Benchmark of Fitness Action Quality Assessment for Multimodal Large Language Models

FitAQA:面向多模态大语言模型的健身动作质量评估基准

Kaili Zheng, Kaiwen Wang, Xun Zhu, Qingyuan Yang, Chenyi Guo, Ji Wu

专题命中 GUI与屏幕智能体 :multimodal large language model(title,abstract);grounding(abstract);分类 cs.AI

AI总结 本研究推出FitAQA基准,含2219个视频等数据,设计三项评估任务,发现当前MLLMs评估健身动作质量及定位错误存在瓶颈,视觉感知是关键瓶颈,相关数据和代码将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06882 2026-07-28 cs.RO cs.AI 版本更新 83%

GemNav: Discrete-Token Visual Robot Navigation using a Multimodal Large Language Model

GemNav:使用多模态大语言模型的离散令牌视觉机器人导航

Peter Bohm, Saimunur Rahman, Abdelwahed Khamis, Sagun Man Singh Shrestha, Chris McCool, Peyman Moghadam

机构 * CSIRO Technology(联邦科学与工业研究组织)

专题命中 GUI与屏幕智能体 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 研究探索基于大型预训练模型的视觉机器人导航策略新方法,提出GemNav,仅对语言塔用LoRA适配冻结的多模态大语言模型用于中短程航点导航,无辅助视觉编码器等,在小语料库上零样本转移到未见环境,提供了数据高效、可部署的导航替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15417 2026-06-16 cs.CV 新提交 83%

From Frames to Temporal Graphs: In-Context Egocentric Action Recognition with Vision-Language Models

从帧到时间图:基于视觉语言模型的上下文第一人称动作识别

Bessie Dominguez-Dager, Francisco Gomez-Donoso, Miguel Cazorla, Marc Pollefeys, Daniel Barath, Zuria Bauer

机构 * University of Alicante(阿利坎特大学) ETH Zürich(苏黎世联邦理工学院) Microsoft(微软)

专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出将视频转换为时间动作图,通过多阶段提示生成自然语言叙述并结构化,实现上下文学习,在EGTEA和Epic-Kitchens-100上显著提升零样本和少样本动作识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13019 2026-05-29 cs.CV 83%

PrecisionCUA: Iterative Visual Refinement for Pixel-Precise Cursor Grounding in Code Editors

PrecisionCUA:代码编辑器中像素级光标定位的迭代视觉细化

Himangi Mittal, Gaurav Mittal, Nelson Daniel Troncoso, Yu Hu

机构 * Microsoft(微软公司) Carnegie Mellon University(卡内基梅隆大学)

专题命中 GUI与屏幕智能体 :grounding(title,abstract);visual reasoning(abstract);分类 cs.CV

AI总结 提出PrecisionCUA方法,通过迭代视觉反馈细化机制实现代码编辑器中像素级光标定位,显著提升点击精度和任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02239 2026-05-25 cs.RO cs.AI 83%

LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation

LACY: 基于视觉-语言模型的语言-动作循环用于自我改进的机器人操作

Youngjin Hong, Houjian Yu, Mingen Li, Changhyun Choi

机构 * Department of Electrical and Computer Engineering, Univ. of Minnesota(电气与计算机工程系,明尼苏达大学)

专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);grounding(abstract);分类 cs.AI

AI总结 提出LACY框架,通过联合学习语言到动作、动作到语言和语言一致性验证三个任务,实现机器人操作的自我改进,平均任务成功率提升56.46%。

Comments Accepted to ICRA 2026. Project page: https://vla2026.github.io/LACY/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16402 2026-05-19 cs.CV 83%

WinDeskGround: A Benchmark for Robust GUI Grounding in Complex Multi-Window Desktop Environments

WinDeskGround:复杂多窗口桌面环境中的鲁棒GUI定位基准

Haoren Zhao, Tianyi Chen, Zhen Wang

机构 * School of Cyberspace, Hangzhou Dianzi University, Hangzhou, China(杭州电子科技大学信息学院) Microsoft(微软公司)

专题命中 GUI与屏幕智能体 :grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出WinDeskGround基准,通过参数生成复杂桌面场景,评估GUI定位鲁棒性。实验显示顶级模型在简单环境表现佳,但部分遮挡下准确率下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12549 2026-05-14 cs.CV 83%

What Happens Before Decoding? Prefill Determines GUI Grounding in VLMs

解码之前发生了什么?预填充决定了VLMs中的GUI接地

Jiaping Lin, Fei Shen, Junzhe Li, Ping Nie, Fei Yu, Ming Li, Haizhou Li

机构 * Guangming Laboratory(光明实验室) National University of Singapore(新加坡国立大学) Peking University(北京大学) University of Waterloo(滑铁卢大学) The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳))

专题命中 GUI与屏幕智能体 :grounding(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 本文研究了VLMs中GUI接地的两阶段机制,发现预填充阶段决定候选UI元素,解码阶段进一步优化坐标。提出Re-Prefill方法通过引入注意力引导的第二预填充阶段提升目标选择精度,实验显示在多个基准上提升4.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27974 2026-05-01 cs.CV cs.DB 83%

FineState-Bench: Benchmarking State-Conditioned Grounding for Fine-grained GUI State Setting

FineState-Bench:面向细粒度GUI状态设置的状态条件化基准测试

Fengxian Ji, Jingpu Yang, Zirui Song, Yuanxi Wang, Zhexuan Cui, Yuke Li, Qian Jiang, Xiuying Chen

机构 * MBZUAI, United Arab Emirates(阿联酋MBZUAI研究院) Northeastern University, China(中国东北大学)

专题命中 GUI与屏幕智能体 :grounding(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 FineState-Bench通过精确目标状态评估,检验智能体能否正确映射指令至UI控件,提出FineState-Metrics与VDA诊断工具,实验显示视觉接地仍有提升空间,但整体准确率不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16165 2026-04-13 cs.SE cs.AI cs.HC 83%

Investigating Multimodal Large Language Models to Support Usability Evaluation

探究多模态大语言模型以支持可用性评估

Sebastian Lubos, Alexander Felfernig, Damian Garber, Gerhard Leitner, Julian Schwazer, Manuel Henrich

机构 * Graz University of Technology(格拉茨技术大学) University of Klagenfurt(克拉根福大学) UNiQUARE Software Development GmbH(UNiQUARE软件开发有限公司)

专题命中 GUI与屏幕智能体 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 本文探讨了多模态大语言模型在可用性评估中的应用,通过优先级问题框架识别并排名可用性问题,比较了MLLM与专家评估结果,展示了交互可视化工具,并提出整合MLLM评估到实际开发流程的概念。

Comments To appear in the Proceedings of IEA/AIE 2026, Springer LNAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18359 2026-04-08 cs.CV 83%

TRANSPORTER: Transferring Visual Semantics from VLM Manifolds

TRANSPORTER:从VLM流形转移视觉语义

Alexandros Stergiou

机构 * University of Twente, NL(荷兰特温特大学)

专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision language model(abstract);分类 cs.CV

AI总结 本文提出TRANSPORTER方法,通过logits-to-video任务生成视频,揭示VLM预测背后的规则,为模型可解释性提供新方向。

Comments Accepted at IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026, Project page: https://alexandrosstergiou.github.io/TRANSPORTER

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05955 2026-04-01 cs.RO cs.CV 83%

SIMPACT: Simulation-Enabled Action Planning using Vision-Language Models

SIMPACT:基于视觉-语言模型的仿真增强动作规划

Haowen Liu, Shaoxiong Yao, Haonan Chen, Jiawei Gao, Jiayuan Mao, Jia-Bin Huang, Yilun Du

机构 * UMD(马里兰大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) Harvard(哈佛大学) Amazon FAR(亚马逊FAR) UPenn(宾夕法尼亚大学)

专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 SIMPACT通过仿真循环世界建模赋予视觉-语言模型物理推理能力,实现高效动作规划,优于现有通用机器人操作模型,在五个复杂真实世界任务中表现优异。

Comments Accepted to CVPR 2026; camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29161 2026-04-01 cs.AI 83%

Webscraper: Leverage Multimodal Large Language Models for Index-Content Web Scraping

Webscraper:利用多模态大语言模型进行索引-内容网页抓取

Guan-Lun Huang, Yuh-Jzer Joung

机构 * Dept. of Information Management, National Taiwan University, Taipei, Taiwan(国立台湾大学资讯管理学系,台北,台湾)

专题命中 GUI与屏幕智能体 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 本文提出Webscraper框架,利用多模态大语言模型自动导航交互界面并提取结构化数据,通过五阶段提示和定制工具提升动态网站抓取准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20164 2026-03-23 cs.RO cs.AI 83%

The Robot's Inner Critic: Self-Refinement of Social Behaviors through VLM-based Replanning

机器人的内在批评者:通过基于视觉语言模型的重新规划实现社会行为的自我完善

Jiyu Lim, Youngwoo Yoon, Kwanghyun Park

机构 * KwangWoon University(匡文大学) ETRI(电子技术研究院)

专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI

AI总结 本文提出CRISP框架,通过基于视觉语言模型的重新规划,使机器人自主评估并优化其社会行为,提高灵活性和自主性,适用于多种平台。

Comments Accepted to ICRA 2026. 8 pages, 9 figures, Project page: https://limjiyu99.github.io/inner-critic/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06251 2026-03-17 cs.SE cs.AI 83%

DesignBench: A Comprehensive Benchmark for MLLM-based Front-end Code Generation

DesignBench: 一个全面的基于MLLM的前端代码生成基准测试

Jingyu Xiao, Ming Wang, Man Ho Lam, Yuxuan Wan, Junliang Liu, Yintong Huo, Michael R. Lyu

专题命中 GUI与屏幕智能体 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 DesignBench针对MLLM在前端工程中的应用,提出多框架、多任务的评估基准,涵盖生成、编辑和修复三个任务,通过900个网页样本分析模型性能,揭示框架特定限制和任务瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03292 2026-03-03 cs.SE cs.AI cs.HC 83%

Interaction2Code: Benchmarking MLLM-based Interactive Webpage Code Generation from Interactive Prototyping

Interaction2Code: 基于MLLM的交互式网页代码生成基准测试

Jingyu Xiao, Yuxuan Wan, Yintong Huo, Zixin Wang, Xinyi Xu, Wenxuan Wang, Zhiyao Xu, Yuhang Wang, Michael R. Lyu

机构 * The Chinese University of Hong Kong, China(香港中文大学) Singapore Management University, Singapore(新加坡管理学院) Renmin University of China, China(中国人民大学) Tsinghua University, China(清华大学) Southwest University, China(西南大学)

专题命中 GUI与屏幕智能体 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 Interaction2Code提出首个基于MLLM的交互式网页代码生成基准测试,识别MLLM在交互生成中的四个限制并提出四种增强策略。

Comments Published in the Proceedings of the 40th IEEE/ACM International Conference on Automated Software Engineering (ASE 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20687 2026-02-25 cs.AI 83%

How Foundational Skills Influence VLM-based Embodied Agents:A Native Perspective

基础技能如何影响基于VLM的具身体验代理:一种原生视角

Bo Peng, Pi Bu, Keyu Pan, Xinrun Xu, Yinxiu Zhao, Miao Chen, Yang Du, Lin Li, Jun Song, Tong Xu

机构 * Alibaba-inc(阿里巴巴集团)

专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI

AI总结 本文提出NativeEmbodied基准测试,通过统一的原生低级动作空间评估VLM驱动具身体验代理的综合性能,并揭示基础技能缺陷对高级任务性能的限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18424 2026-02-23 cs.CV cs.RO 83%

CapNav: Benchmarking Vision Language Models on Capability-conditioned Indoor Navigation

CapNav:基于能力条件的室内导航基准测试

Xia Su, Ruiqi Chen, Benlin Liu, Jingwei Ma, Zonglin Di, Ranjay Krishna, Jon Froehlich

专题命中 GUI与屏幕智能体 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 CapNav基准测试评估VLMs在不同移动约束下室内导航能力,发现其性能随约束增加而下降,且先进模型仍难以处理空间推理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09002 2026-02-10 cs.RO cs.AI 83%

From Obstacles to Etiquette: Robot Social Navigation with VLM-Informed Path Selection

从障碍到礼仪:基于VLM引导路径选择的机器人社交导航

Zilin Fang, Anxing Xiao, David Hsu, Gim Hee Lee

机构 * School of Computing(计算机学院) Smart Systems Institute(智能系统研究所)

专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI

AI总结 本文提出了一种结合几何规划与上下文社交推理的机器人社交导航框架,通过VLM模型优化路径选择,以减少对人类活动的干扰并遵守社会规范。

Comments Accepted to IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06391 2026-02-09 cs.CV 83%

POINTS-GUI-G: GUI-Grounding Journey

POINTS-GUI-G:GUI接地之旅

Zhongyin Zhao, Yuan Liu, Yikun Liu, Haicheng Wang, Le Tian, Xiao Zhou, Yangxiu You, Zilin Yu, Yang Yu, Jie Zhou

机构 * Tencent(腾讯)

专题命中 GUI与屏幕智能体 :grounding(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 POINTS-GUI-G通过精细化数据工程、改进训练策略和强化学习提升GUI接地性能,实现多个基准测试的最优表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22701 2026-02-02 cs.AI 83%

Best-of-Q: Improving VLM agents with Q-function Action Ranking at Inference

Best-of-Q: 通过推理中的Q函数动作排名提升VLM代理

Emilien Biré, María Santos, Kai Yuan

专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI

AI总结 Best-of-Q通过在推理过程中利用Q函数动作排名提升VLM代理性能,显著提高任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12742 2026-01-21 cs.RO cs.AI 83%

AirHunt: Bridging VLM Semantics and Continuous Planning for Efficient Aerial Object Navigation

AirHunt: 通过融合视觉语言模型语义与连续规划实现高效空中物体导航

Xuecheng Chen, Zongzhuo Liu, Jianfa Ma, Bang Du, Tiantian Zhang, Xueqian Wang, Boyu Zhou

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Department of Mechanical and Energy Engineering, Southern University of Science and Technology(南方科技大学机械与能源工程系) Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系) Department of Physics, Southern University of Science and Technology(南方科技大学物理系)

专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI

AI总结 AirHunt通过融合视觉语言模型语义与连续规划,实现高效空中物体导航,提升开放集物体定位的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12622 2025-12-16 cs.CV cs.RO 83%

D3D-VLP: Dynamic 3D Vision-Language-Planning Model for Embodied Grounding and Navigation

D3D-VLP:动态3D视觉-语言-规划模型用于具身接地与导航

Zihan Wang, Seungjun Lee, Guangzhao Dai, Gim Hee Lee

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) Nanjing University of Science and Technology(南京理工大学)

专题命中 GUI与屏幕智能体 :grounding(title,abstract);VLM(abstract);分类 cs.CV

AI总结 D3D-VLP通过动态3D链式思维和协同学习策略,实现具身接地与导航的高效统一,提升多任务导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05731 2025-12-09 cs.AI cs.CL 83%

InfiGUI-G1: Advancing GUI Grounding with Adaptive Exploration Policy Optimization

InfiGUI-G1: 通过自适应探索策略优化推进GUI接地

Yuhang Liu, Zeyu Liu, Shuanghe Zhu, Pengxiang Li, Congkai Xie, Jiasheng Wang, Xavier Hu, Xiaotian Han, Jianbo Yuan, Xinyao Wang, Shengyu Zhang, Hongxia Yang, Fei Wu

机构 * Amazon(亚马逊)

专题命中 GUI与屏幕智能体 :grounding(title,abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 InfiGUI-G1通过自适应探索策略优化改进GUI接地,实现显著的语义对齐和性能提升。

Comments Accepted to AAAI 2026 (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14499 2025-11-19 cs.CV cs.RO 83%

Enhancing End-to-End Autonomous Driving with Risk Semantic Distillaion from VLM

Jack Qin, Zhitao Wang, Yinan Zheng, Keyu Chen, Yang Zhou, Yuanxin Zhong, Siyuan Cheng

机构 * Tsinghua University(清华大学) Laboratories, Huawei Technologies(华为技术有限公司2012实验室)

专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13269 2025-11-18 cs.CV 83%

Is your VLM Sky-Ready? A Comprehensive Spatial Intelligence Benchmark for UAV Navigation

Lingfeng Zhang, Yuchen Zhang, Hongsheng Li, Haoxiang Fu, Yingbo Tang, Hangjun Ye, Long Chen, Xiaojun Liang, Xiaoshuai Hao, Wenbo Ding

专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08942 2025-11-13 cs.RO cs.AI 83%

Think, Remember, Navigate: Zero-Shot Object-Goal Navigation with VLM-Powered Reasoning

Mobin Habibpour, Fatemeh Afghah

机构 * Holcombe Department of Electrical and Computer Engineering(霍尔科姆电气与计算机工程系) Clemson University(克莱姆森大学)

专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏