arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-07-29 至 2026-07-29 共收录 2 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 2 篇

2601.02295 2026-07-29 cs.RO 版本更新 67%

CycleVLA: Proactive Self-Correcting Vision-Language-Action Models via Subtask Backtracking and Minimum Bayes Risk Decoding

CycleVLA: 通过子任务回溯和最小贝叶斯风险解码实现的前瞻性自修正视觉-语言-动作模型

Chenyang Ma, Kai Lu, Guangyu Yang, Jiuming Liu, Shitong Xu, Bill Byrne, Ioannis Havoutis, Niki Trigoni, Andrew Markham

机构 * Department of Computer Science, University of Oxford(牛津大学计算机科学系) Department of Engineering, University of Cambridge(剑桥大学工程系)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn)

AI总结 CycleVLA通过子任务回溯和最小贝叶斯风险解码实现前瞻性自修正,提升视觉-语言-动作模型的故障预测与恢复能力

Comments Project Page: https://dannymcy.github.io/cyclevla/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21409 2026-07-29 cs.RO 版本更新 50%

DSCD-Nav: Dual-Stance Cooperative Debate for Object Navigation

DSCD-Nav: 双视角协作辩论用于物体导航

Weitao An, Qi Liu, Chenghao Xu, Jiayi Chai, Xu Yang, Kun Wei, Cheng Deng

机构 * School of Electronic Engineering, Xidian University, Xi' an 710071, China.(西安电子科技大学电子工程学院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 DSCD-Nav通过双视角协作辩论机制提升机器人在部分可观测环境中的导航可靠性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏