arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-20 至 2026-08-20 共收录 4 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 4 篇

2608.18531 2026-08-20 cs.AI cs.LG 新提交 73%

Pairwise Ranking Outperforms Single-Action RL for Offline Explanation Selection: A Practical Lesson

离线解释选择中, pairwise 排序优于单动作强化学习:一个实践经验

Tanay Chowdhury, Saeideh Shahrokh Esfahani

机构 * Amazon(亚马逊公司)

专题命中 GUI与屏幕智能体 :grounding(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 该研究针对工业可解释推荐系统的高成本问题,提出将 LLM 解释生成与选择分离的方案,发现 pairwise 排序方法在离线解释选择中优于单动作强化学习,且构建成本低、延迟小。

Comments This is an extended version of a 3-page paper accepted to the RecSys 2026 Research and Practice Notes track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12854 2026-08-20 cs.RO cs.AI cs.CV 版本更新 73%

BrainWAM: Action-Space Coordination of Semantic Priors and Predictive Dynamics for Autonomous Driving

BrainWAM:面向自动驾驶的语义先验与预测动力学的动作空间协调框架

Bing Zhan, Shuyao Shang, Shuo Lu, Yuan Xu, Zhao Wang, Yida Wang, Xueyang Zhang, Kun Zhan, Jiahao Gu

机构 * Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) Li Auto Inc.(理想汽车)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 该研究针对自动驾驶中语义与预测动力学的规划需求,提出BrainWAM框架,通过结构化动作空间协调及异步整流流推理,在NAVSIM数据集上实现最优性能,优于仅VLA或仅WAM方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18307 2026-08-20 cs.AI cs.CL cs.HC 新提交 57%

ComponentBench: Diagnosing Component-Level Failures in Computer-Use Agents

ComponentBench:诊断计算机使用智能体的组件级故障

Tianchen Guan, Xinlei Lin, Royce Cheng-Yue, Xiangjun Wang, Shuyan Zhou

机构 * Duke University(杜克大学) Amazon AGI SF Lab(亚马逊AGI旧金山实验室)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 本文提出ComponentBench基准及诊断流水线,评估7种计算机使用智能体在4种观测动作空间下的表现,发现观测动作空间会显著影响性能,且空间操作仍是智能体的挑战。

Comments Accepted at COLM 2026. 30 pages (10 pages main text), 10 figures, 15 tables. Website: this https URL (https://componentbench.com) Code: this https URL (https://github.com/TianchenGuan/ComponentBench) Data: this https URL (https://huggingface.co/datasets/TianchenGuan/ComponentBench)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18254 2026-08-20 cs.RO 新提交 50%

GAPL: Grounded Action-effect Policy Learning for LLM-Based Trajectory Planning

GAPL:面向基于大语言模型的轨迹规划的接地动作效果策略学习

Zhihong Cui, Hengyu Liu, Zhangkai Wu, Yushuai Li, Tianyi Li, Peiyuan Guan, Amir Taherkordi, Tor Skeie

机构 * University of Oslo(奥斯陆大学) Aalborg University(奥尔堡大学) University of Sydney(悉尼大学) Nanjing University of Information Science and Technology(南京信息工程大学) Simula Research Laboratory(西穆拉研究院)

专题命中 GUI与屏幕智能体 :grounding(abstract)

AI总结 针对LLM用于自动驾驶轨迹规划时存在的幻觉、接地不足等问题,提出GAPL框架,整合三类模块并经实验验证其性能优于基线方法

Comments 11 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏