arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-26 至 2026-02-26 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 3 篇

2602.20659 2026-02-26 cs.AI 77%

Recursive Belief Vision Language Action Models

递归信念视觉语言动作模型

Vaidehi Bagaria, Bijo Sebastian, Nirav Kumar Patel

机构 * Department of Engineering Design, Indian Institute of Technology, Madras, Chennai, India(工程设计系,印度理工学院,马德拉斯,钦奈,印度)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.AI

AI总结 RB-VLA通过信念与意图联合条件化扩散策略,实现长周期任务的高效执行,显著提升成功率并降低推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22548 2026-02-26 cs.CV cs.RO 70%

JanusVLN: Decoupling Semantics and Spatiality with Dual Implicit Memory for Vision-Language Navigation

JanusVLN: 通过双隐式记忆解耦语义与空间性用于视觉-语言导航

Shuang Zeng, Dekang Qi, Xinyuan Chang, Feng Xiong, Shichao Xie, Xiaolong Wu, Shiyi Liang, Mu Xu, Xing Wei, Ning Guo

机构 * Xi’an Jiaotong University(西安交通大学) Amap, Alibaba Group(阿里巴巴集团)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 JanusVLN通过双隐式记忆解耦语义与空间性,提升视觉-语言导航的性能和效率。

Comments Accepted to ICLR 2026. Project page: https://miv-xjtu.github.io/JanusVLN.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21633 2026-02-26 cs.RO cs.AI cs.CV 62%

Self-Correcting VLA: Online Action Refinement via Sparse World Imagination

自校正视觉-语言-动作模型:通过稀疏世界想象实现在线动作细化

Chenyv Liu, Wentao Tan, Lei Zhu, Fengling Li, Jingjing Li, Guoli Yang, Heng Tao Shen

机构 * Tongji University(同济大学) University of Technology Sydney(技术悉尼大学) University of Electronic Science(电子科学大学) Advanced Institute of Big Data(大数据高级研究所)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 SC-VLA通过稀疏世界想象实现自校正,提升机器人操作任务的效率和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏