arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 192 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 192 篇

2607.18580 2026-07-22 cs.RO 新提交 82%

STeP: Signal Temporal Logic for Precise Specifications for Action Generation with Vision Language Models

STeP:用于视觉语言模型动作生成精确规范的信号时序逻辑

Kasra Torshizi, Anukriti Singh, Sidharth Mathur, Khuzema Habib, Leo Du, Pratap Tokekar

机构 * University of Maryland(马里兰大学)

专题命中 GUI与屏幕智能体 :vision language model(title);VLM(abstract,abstract_cn)

AI总结 针对视觉语言动作模型缺乏可解释性及难以遵循精确自然语言指令的问题,提出用信号时序逻辑(STL)连接高级语言理解与低级机器人执行的分层框架,经实验验证该框架能提高语言条件下机器人规划的精度、可靠性和可解释性。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08596 2026-08-11 cs.CV 新提交 81%

Goal-oriented Navigation Instruction Generation with Tour Video Priors

基于旅游视频先验的面向目标的导航指令生成

Fangdi Li, Juncheng Liao, Changxu Cheng, Jiazhi Wang, Senda Chen, Tao Wang, Wuyue Zhao

机构 * Uni-Ubi AI(优必爱人工智能) Zhejiang University(浙江大学) Tongji University(同济大学)

专题命中 GUI与屏幕智能体 :grounding(summary_cn,abstract_cn);MLLM(abstract_cn);分类 cs.CV

AI总结 本研究提出面向目标的视频 grounding 导航指令生成任务VideoNIG,设计两阶段课程学习框架解决该任务,实验表明其可提升指令质量,集成VLN智能体后可实现端到端导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21400 2026-07-24 cs.RO cs.AI 新提交 81%

VoLN: Vision-Only Long-Horizon Navigation---Paradigm, Benchmark, and Method

VoLN:仅视觉的长距离导航——范式、基准和方法

Jiabin Lou, Haopeng Wang, Yuanshuai Wang, Xinyu Liu, Xuxin Lv, Yuxin Guo, Lei Huang, Rongye Shi, Wenjun Wu

机构 * Beihang University(北京航空航天大学) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)

专题命中 GUI与屏幕智能体 :MLLM(summary_cn,abstract);分类 cs.AI

AI总结 研究提出仅视觉的长距离导航(VoLN)范式,通过VoLN-UAV基准及VoLN-MLLM基线进行实例化。在五个环境测试未见分割中评估,揭示了长距离导航在证据整合、目标匹配和闭环稳定性方面的挑战。

Comments 10 pages, 7 figures, 2 tables. Project page: https://admire-ljb.github.io/VoLN-UAV/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13192 2026-06-12 cs.AI 新提交 81%

Reasoning for Mobile User Experience with Multimodal LLMs: Task, Benchmark, and Approach

基于多模态大语言模型的移动用户体验推理:任务、基准与方法

Ruichao Mao, Zhou Fang, Teng Guo, Hao Yang, Yaping Li, Shaohua Peng, Maji Huang, Xiaoyu Lin, Shuoyang Liu, Xuepeng Li, Yuyu Zhang, Hai Rao

机构 * Ant Group(蚂蚁集团)

专题命中 GUI与屏幕智能体 :MLLM(abstract,abstract_cn);grounding(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 提出UXBench基准(2000个VQA样本)评估多模态大模型在UI推理上的能力,并设计UI-UX模型,通过奖励路由和不对称过渡奖励机制在UXBench上达到0.7963准确率,超越Claude-4.5-Sonnet。

Comments 10 pages, 6 figures, Accepted at CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25964 2026-06-25 cs.AI cs.LG 新提交 81%

WinDOM: Self-Family Distillation for Small-Model GUI Grounding

WinDOM:面向小型模型GUI定位的自家族蒸馏

Chengheng Li-Chen, Zhiqian Zhou, Hao Chen, Nicolas Chauvin

机构 * \'Ecole Polytechnique F\'ed\'erale de Lausanne (EPFL), Lausanne, Switzerland

专题命中 GUI与屏幕智能体 :grounding(title,abstract);分类 cs.AI、cs.LG

AI总结 提出WinDOM数据集和自家族蒸馏方法,通过DOM直接获取边界框数据,结合强化学习提升小模型GUI定位性能,在Qwen3.5-2B上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12763 2026-08-14 cs.CE 新提交 80%

ARIES-Mission2: A Zero-Shot Vision-Language-Action Framework for Fast Large-Scale Aerial Mission Generation

ARIES-Mission2:用于快速大规模空中任务生成的零样本视觉-语言-动作框架

Junhao Wei, Yanxiao Li, Haochen Li, Yifu Zhao, Dexing Yao, Baili Lu, Zikun Li, Yapeng Wang, Sio-Kei Im, Dingcheng Yang, Xu Yang

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);grounding(abstract);multimodal large language model(abstract)

AI总结 ARIES-Mission2是解耦视觉语义感知与路径优化的零样本VLA框架,在UAV基准上,其飞行距离更短、任务生成速度更快,且TSP模块可扩展性佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06374 2026-08-07 cs.RO 新提交 80%

DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation

DyPES-VLA:学习共享动态先验与具身特定控制以实现跨具身操作

Junfeng Li, Junjie He, Zhide Zhong, Yangyang Zheng, Pingyue Sheng, Jiayu Dong, Ruixin Li, Haodong Yan, Jiaguan Zhu, Tianran Zhang, Runze Yu, Wen Chen, Liuqing Yang, Yuxiang Gao, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) COCO Matrix

专题命中 GUI与屏幕智能体 :vision-language model(abstract,abstract_cn);VLM(abstract,abstract_cn)

AI总结 该研究针对跨具身机器人操作问题,提出DyPES-VLA模型,通过学习共享动态先验与具身特定MoE动作头,在LIBERO等数据集上达到先进操作成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16806 2026-07-21 cs.RO 新提交 80%

Token-Wise Latent Streaming from Slow Reasoners to Fast Planners for Dynamic Vision Language Navigation

用于动态视觉语言导航的从慢速推理器到快速规划器的逐令牌潜在流

Tianshuai Hu, Yangyi Zhong, Zeying Gong, Lingdong Kong, Xiaodong Mei, Guoyang Zhao, Xiaolu Liu, Song Wang, Rong Li, Junwei Liang

机构 * The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract)

AI总结 针对动态视觉语言导航中语言推理慢与规划需即时的矛盾,提出SPARK-VLN双系统框架,通过三个模块将慢速VLM推理器知识流到快速规划器,引入新基准套件,提高了导航成功率、社会合规性及推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04988 2026-07-07 cs.RO 新提交 80%

InternVLA-A1.5: Unifying Understanding, Latent Foresight, and Action for Compositional Generalization

InternVLA-A1.5:统一理解、潜在预见与组合泛化的行动

Haoxiang Ma, Junhao Cai, Xiaoxu Xu, Hao Li, Yuyin Yang, Yang Tian, Jiafei Cao, Hongrui Zhu, Zherui Qiu, Zhaxizhuoma, Yuqiang Yang, Jiaqi Peng, Xueyuan Wei, Yangkun Zhu, Jiahao Jiang, Xing Gao, Hanqing Wang, Feng Yuan, Kailin Li, Xueyue Zhu, Tai Wang, Yan Ding, Jiangmiao Pang, Jia Zeng, Jingjing Zhang, Bowen Zhou, Yao Mu, Chunhua Shen, Weinan Zhang

机构 * Physical Intelligence Team Shanghai AI Laboratory(上海人工智能实验室物理智能团队)

专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract)

AI总结 研究旨在统一机器人操作模型,提出InternVLA-A1.5,基于原生VLM骨干构建策略,将未来预测转化为潜在查询问题,继承预训练视频生成模型动力学先验,在模拟和现实基准测试中效果良好。

Comments Homepage: https://internrobotics.github.io/internvla-a15.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25119 2026-06-25 cs.RO 新提交 80%

SurveilNav: Collaborative Object Goal Navigation with Robot and Surveillance System

SurveilNav: 机器人与监控系统协同的目标导航

Ming-Ming Yu, Qunbo Wang, Rongtao Xu, Yanghong Mei, Yirong Yang, Longteng Guo, Wenjun Wu, Jing Liu

机构 * Beihang University(北京航空航天大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Jiaotong University(北京交通大学) ATeam University of Chinese Academy of Sciences(中国科学院大学) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)

专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract)

AI总结 提出SurveilNav框架,通过主动摄像头调度、联合2D/3D建图、基于VLM的价值估计和协同目标验证,融合机器人动态局部感知与监控全局视图,在HM3D数据集上实现领先的探索效率和导航成功率。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21496 2026-06-23 cs.RO cs.AI cs.CV cs.LG 新提交 80%

Decoupling the Declarative from the Procedural in Vision-Language-Action Models

在视觉-语言-动作模型中解耦声明性知识与程序性知识

Nikolaos Tsagkas, Andreas Sochopoulos, Chris Xiaoxuan Lu, Oisin Mac Aodha, Alexandros Kouris

机构 * University of Edinburgh(爱丁堡大学) UCL(伦敦大学学院) Samsung AI Center - Cambridge, UK(三星人工智能中心 - 英国剑桥)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 针对现有VLA模型无法解耦声明性与程序性知识导致零样本技能迁移脆弱的问题,提出w$^{2}$VLA模型,通过重构信息流实现模块化、可解释的知识解耦,显著提升对未见物体的零样本技能迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10927 2026-06-10 cs.RO 新提交 80%

AllDayNav: Lifelong Navigation via Real-World Reinforcement Learning

AllDayNav: 通过真实世界强化学习实现终身导航

Hang Yin, Yinan Liang, Jiazhao Zhang, Jiahang Liu, Minghan Li, Zhizheng Zhang, He Wang

机构 * Tsinghua University(清华大学) Galbot Robotics Peking University(北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract)

AI总结 提出AllDayNav框架,利用自进化多模态记忆和强化学习隐式编码场景动态,在跨房间、跨回合和跨任务场景中实现接近100%的成功率,超越基于地图、VLM和RL的基线方法。

Comments Project Page: https://bagh2178.github.io/AllDayNav/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09723 2026-08-11 cs.CV 新提交 79%

LookAgain: Closed-Loop GUI Grounding with Visually Grounded Reflection

LookAgain:基于视觉反思的闭环GUI定位方法

Renshan Zhang, Haoyang Meng, Yixiao He, Rui Shao, April Hua Liu, Liqiang Nie

专题命中 GUI与屏幕智能体 :grounding(title,abstract);分类 cs.CV

AI总结 本文针对现有GUI定位方法在小目标等场景性能骤降的问题,提出LookAgain闭环GUI定位器,通过预测后视觉反思的多轮过程结合SFT与GRPO训练,在相关基准上达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03740 2026-08-05 cs.AI 新提交 79%

MissClick: Exploiting Digit-Serialized Coordinates to Attack GUI Grounding Models

MissClick:利用序列化数字坐标攻击GUI定位模型

Yu Ran, Wentao Zhao, Xin Zhang, Yi Pan

专题命中 GUI与屏幕智能体 :grounding(title,abstract);分类 cs.AI

AI总结 本研究提出MissClick攻击方法,针对GUI定位模型设计两种目标的白盒对抗攻击,在OS-Atlas和UGround数据集上大幅提升无目标与有目标攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21953 2026-07-27 cs.CV eess.SP 新提交 79%

Low-Altitude Channel Multipath Prediction via Panoramic Perception and Vision-Language Model

通过全景感知和视觉语言模型进行低空信道多径预测

Zihang Zeng, Shu Sun, Meixia Tao, Zhiyong Chen, Jianhua Mo, Xiangwen Gu

专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);分类 cs.CV

AI总结 针对无人机通信中传统信道预测方法的局限,提出基于全景感知和视觉语言模型的PanoLAMP框架,利用预训练模型及全景观测捕捉特征预测多径参数,实验显示其在多径参数、统计指标及泛化性上表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12640 2026-07-15 cs.AI cs.CL 新提交 79%

A Learning-Rate-Gated Failure of GRPO in a Small Language and Vision-Language Model Web Agent: A Controlled Null and Its Mechanism

小语言和视觉语言模型网络智能体中GRPO的学习率门控失败:一个可控的无效结果及其机制

Chengguang Gan, Zhixi Cai, Yunhao Liang, Hanjun Wei, Shiwen Ni, Qinghao Zhang

机构 * Monash University(莫纳什大学) University of Chinese Academy of Sciences(中国科学院大学) Shenzhen University of Advanced Technology(深圳先进技术大学) Pusan National University(釜山国立大学)

专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);分类 cs.AI

AI总结 研究4B到8B规模小语言和视觉语言模型网络智能体中GRPO的效果,通过控制变量实验发现其在已掌握任务上无明显提升,解释了学习率导致失败的机制,表明该耦合与模型规模相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31187 2026-07-01 cs.CV 新提交 79%

Learning to Deny: Action Denial in Multimodal Large Language Models

学习拒绝:多模态大语言模型中的动作否定

Raiyaan Abdullah, Shehreen Azad, Yogesh Singh Rawat

机构 * Institute of Artificial Intelligence, University of Central Florida(中佛罗里达大学人工智能研究所)

专题命中 GUI与屏幕智能体 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 提出UCF101-AD基准测试,评估多模态大语言模型在强上下文线索下识别动作缺失的能力,发现模型倾向于肯定动作而非验证其真实性,并通过因果图CausalAct减少误报。

Comments Accepted to ECCV 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14579 2026-06-15 cs.AI 新提交 79%

VISTA: View-Consistent Self-Verified Training for GUI Grounding

VISTA: 视图一致的自验证训练用于GUI定位

Xinyu Qiu, Yunzhu Zhang, Heng Jia, Shuheng Shen, Changhua Meng, Linchao Zhu

机构 * Zhejiang University(浙江大学) Venus Team, Ant Group(蚂蚁集团金星团队)

专题命中 GUI与屏幕智能体 :grounding(title,abstract);分类 cs.AI

AI总结 提出VISTA框架,通过多视图分组和自验证锚点改进GRPO训练,在GUI定位任务中显著提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07267 2026-08-10 cs.AI cs.CV cs.RO 新提交 79%

WNM-3D: A World Navigation Model with 3D Scene Conditioning for Closed-Loop VLN

WNM-3D:一种用于闭环视觉语言导航的带3D场景条件的世界导航模型

Yuehao Huang, Yunzi Wu, Xiaotao Zhang, Xinhai Li, Jiankun Dong, Jiajun Lv, Chi Zhang, Chenjia Bai, Yong Liu, Xuelong Li

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 该研究提出带3D场景条件的WNM-3D模型,通过几何编码器与适配器整合场景上下文,经多阶段训练后在GN-Bench等数据集上的闭环导航性能优于同类模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22393 2026-07-27 cs.AI cs.CV 新提交 79%

SceneActBench: Can Agents Act on the 3D Scenes They See?

SceneActBench:智能体能否对其所看到的3D场景采取行动?

Yifei Zhao, Xiangxin Zhou, Wenhao Yang, Jiaqi Tang, Pu Jian, Huanjin Yao, Jiarui Yao, Haowei Lin, Chunchao Guo, Zhuo Chen, Wenkai Lyu, Jianzhu Ma, Xueqian Wang, Wenxi Zhu

机构 * Tencent Hunyuan(腾讯混元) THU(清华大学) NJU(南京大学) HKUST(香港科技大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) PKU(北京大学)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 研究视觉语言模型智能体在3D场景行动能力,提出SceneActBench基准测试,涵盖五个3D任务,通过特定指标评估智能体输出,分析不同配置得分及失败情况,为评估智能体在多对象3D场景行动提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17050 2026-07-21 cs.CV cs.AI 新提交 79%

EvoGUI: An Evolution-Aware Benchmark for GUI State-Transition Understanding

EvoGUI:用于GUI状态转换理解的进化感知基准测试

Yaohan Yang, Minglei Shi, Borui Zhang, Jie Zhou, Jiwen Lu

机构 * Tsinghua University(清华大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 研究GUI状态转换理解,提出EvoGUI诊断框架,将GUI轨迹转化为视觉问答探针,无需额外注释。通过Mind2Web和WebLINX实例化EvoGUI-Bench并零样本评估28种模型配置,结果显示其可补充端到端评估,揭示理解提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26095 2026-06-25 cs.RO cs.AI cs.CV 新提交 79%

Learning Action Priors for Cross-embodiment Robot Manipulation

跨具身机器人操作的动作先验学习

Dong Jing, Tianqi Zhang, Jiaqi Liu, Jinman Zhao, Zelong Sun, Li Erran Li, Zhiwu Lu, Mingyu Ding

机构 * Renmin University of China(中国人民大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Toronto(多伦多大学) Amazon(亚马逊)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 提出两阶段训练框架,先通过流匹配预训练动作模块学习跨具身时间运动结构,再迁移至VLA训练,提升数据效率与任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20717 2026-06-23 cs.CV cs.AI cs.CR 新提交 79%

MIRAGE: Stealthy Visual Prompt Injection for Vulnerability Detection in Web Agents

MIRAGE: 针对Web代理的隐蔽视觉提示注入漏洞检测

Xuelong Dai, Jianyu Ma, Boyang Ma, Biwei Yan, Yijun Yang, Yue Zhang

机构 * SDU(山东大学)

专题命中 GUI与屏幕智能体 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出MIRAGE框架,利用扩散模型在受限区域生成视觉上无害的对抗图像,实现针对多模态大模型Web代理的隐蔽间接提示注入攻击,以检测其视觉漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07403 2026-07-09 cs.MA cs.RO 新提交 78%

Multi-Agent Robotic Control with Onboard Vision-Language Models

基于机载视觉语言模型的多智能体机器人控制

Kajetan Rachwał, Maciej Majek, Bartłomiej Boczek, Jakub Matejczyk, Dominik Matejkowski, Adam Dąbrowski, Tim Seyde, Alexander Amini, Maria Ganzha

机构 * Faculty of Mathematics and Information Science, Warsaw University of Technology(华沙技术大学数学与信息科学学院)

专题命中 GUI与屏幕智能体 :vision-language model(title);vision language model(abstract)

AI总结 研究针对视觉语言模型用于机器人控制的挑战,提出多智能体系统架构,在机载硬件部署智能体,用紧凑型VLMs并经微调及新型编排智能体,经硬件在环模拟验证,证明该机载架构可行高效,有实际应用潜力且模拟环境已开源。

Comments 6 pages, 2 figures, accepted to 24th International Conference on Practical applications of Agents and Multi-Agent Systems (PAAMS'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11739 2026-08-13 cs.RO cs.AI 新提交 77%

G0.5: One Autoregressive Stream for Robot Reasoning and Action

G0.5:用于机器人推理与动作的单自回归流

Yicheng Liu, Zibin Dong, Baijun Ye, Tianyuan Yuan, Tao Jiang, Anqi Yang, Shicheng Cao, Haonan Liu, Yue Sun, Zihan Guo, Xiao Liu, Dong Ke, Changxun Pan, Chenru Wu, Tailai Cheng, Xiaoshu Ren, Xinlei Zhang, Jianning Cui, Zijie Zhao, Haoyu Zhang, Kaiming Xu, Haodong Yang, Bowen Zhang, Jiahui Niu, Shaoting Zhu, Shiduo Zhang, Hang Zhao

机构 * Galaxea(星系科技(Galaxea))

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);grounding(abstract);分类 cs.AI

AI总结 本文提出G0.5,一种单自回归流的VLA模型,通过三个关键组件实现推理与动作统一,在7项基准中超越现有最优模型,展现出良好的泛化与指令跟随能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08273 2026-08-11 cs.RO cs.CV 新提交 77%

Action- and Language-Conditioned Video Assessment for Embodied Control

面向具身控制的动作与语言条件视频评估

Hwanhee Kim, Jaehyun Jang, Seungmin Cha, Hyeonseo Yun, Donghoon Lee, Chang D. Yoo

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 该研究提出ALVA轨迹评估器,结合视觉观测、动作序列与语言指令评估具身控制任务,在模拟3D家庭环境中误报率低,作为反馈机制可提升闭环策略优化效果。

Comments 21 pages, 7 figures, Published in Sensors

Journal ref Sensors 26(16), 5046 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06474 2026-08-10 cs.AI 新提交 77%

WebGrader: Training LLMs for Web Development with Self-Evolving Programmatic Grader

WebGrader:利用自演化程序化评分器训练用于网页开发的大语言模型

Boshui Chen, Huiping Liu, Shaolei Zhang

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);grounding(abstract);分类 cs.AI

AI总结 本研究提出自演化程序化评分器WebGrader,通过分离测试规划等环节生成准确奖励,训练8B策略在WebGen-Bench、WG-core-250数据集上的功能成功率及得分优于多款大语言模型。

Comments 17 pages, 3 figures. Supplementary material is included in the main PDF

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03474 2026-08-05 cs.CV 新提交 77%

MT-Web2Code: Benchmarking Coding Agents on Multi-Turn Regional Reconstruction and Localized Modification

MT-Web2Code:面向多轮区域重构与局部修改的编码智能体基准测试

Qiming Li, Shujie Hu, Haohan Liu, Xiaocheng Feng, Songxiang Liu, Guanglu Wan

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 MT-Web2Code是首个面向多轮区域重构与局部修改的多模态编码基准,实验发现现有编码智能体存在多轮错误滚雪球等问题,其评估指标或助力相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01802 2026-08-04 cs.AI cs.RO 新提交 77%

CoNav-UAV: Cooperative Dual-Altitude Aerial Navigation via Stackelberg Learning

CoNav-UAV:基于Stackelberg学习的协同双高度无人机导航

Junru Song, Wenhao Zhang, Yang Yang, Xuekai Qiu, Feifei Wang, Weien Zhou, Tingsong Jiang, Ying Wen, Yang Li, Wen Yao

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);grounding(abstract);分类 cs.AI

AI总结 针对双高度无人机协同导航的合作问题,本文提出CoNav-UAV,通过迭代Stackelberg学习优化高空领导者与低空跟随者,在AerialVLN基准上显著提升导航成功率且适配数据需求更少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31329 2026-07-02 cs.RO cs.AI 新提交 77%

3D HAMSTER: Bridging Planning and Control in Hierarchical Vision Language Action Models through 3D Trajectory Guidance

3D HAMSTER:通过3D轨迹引导在分层视觉语言动作模型中桥接规划与控制

Dongyoon Hwang, Byungkun Lee, Dongjin Kim, Hyojin Jang, Hoiyeong Jin, Jueun Mun, Minho Park, Hojoon Lee, Hyunseung Kim, Jaegul Choo

机构 * Kim Jaechul Graduate School of AI, KAIST(韩国科学技术院金载哲人工智能研究生院) Graduate School of Artificial Intelligence, POSTECH(浦项工业大学人工智能研究生院) KRAFTON AI

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.AI

AI总结 提出3D HAMSTER框架,通过让规划器直接输出度量可靠的3D轨迹,弥合2D引导与3D低层策略之间的差距,在3D轨迹预测、仿真和真实操作中优于现有方法。

Comments Published in IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026. Code: https://github.com/DAVIAN-Robotics/3D_HAMSTER. Project page: https://davian-robotics.github.io/3D_HAMSTER/

详情

展开后加载摘要…

URL PDF HTML 收藏