arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-24 至 2026-02-24 共收录 5 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 5 篇

2602.18742 2026-02-24 cs.RO cs.AI cs.CV 62%

RoboCurate: Harnessing Diversity with Action-Verified Neural Trajectory for Robot Learning

RoboCurate: 利用动作验证的神经轨迹 harnessing 多样性以促进机器人学习

Seungku Kim, Suhyeok Jang, Byungjun Yoon, Dongyoung Kim, John Won, Jinwoo Shin

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 RoboCurate通过动作验证的神经轨迹和图像编辑技术,提升机器人学习中合成数据的质量和多样性,显著提高任务成功率。

Comments 20 pages; 6 figures; Project page is available at https://seungkukim.github.io/robocurate/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18941 2026-02-24 cs.CV 57%

Global Commander and Local Operative: A Dual-Agent Framework for Scene Navigation

全局指挥官与局部执行者:一种双智能体框架用于场景导航

Kaiming Jin, Yuefan Wu, Shengqiong Wu, Bobo Li, Shuicheng Yan, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Simon Fraser University(西蒙弗雷泽大学) University of Oxford(牛津大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 DACo提出双智能体框架,通过解耦全局推理与局部执行,提升复杂环境中长时序导航的稳定性和性能。

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18884 2026-02-24 cs.AI 57%

TPRU: Advancing Temporal and Procedural Understanding in Large Multimodal Models

TPRU: 推动大型多模态模型中的时序与过程理解

Zhenkun Gao, Xuhong Wang, Xin Tan, Yuan Xie

机构 * East China Normal University(东华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI

AI总结 TPRU通过引入大规模多模态数据集和强化学习微调方法,显著提升大型模型在时序和过程理解上的表现,达到当前最先进的准确率。

Comments Accepted to ICLR 2026. 17 pages. Code, data, and models are available at: https://github.com/Stephen-gzk/TPRU

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19184 2026-02-24 cs.RO 50%

Human-to-Robot Interaction: Learning from Video Demonstration for Robot Imitation

人机交互:从视频演示中学习机器人模仿

Thanh Nguyen Canh, Thanh-Tuan Tran, Haolan Zhang, Ziyan Gao, Nak Young Chong, Xiem HoangVan

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 本研究提出了一种基于视频演示的机器人模仿学习方法,通过模块化框架结合时间位移模块和深度强化学习,实现机器人从无结构视频中学习基本操作技能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10040 2026-02-24 cs.RO 50%

Diffusion Trajectory-guided Policy for Long-horizon Robot Manipulation

用于长时程机器人操作的扩散轨迹引导策略

Shichao Fan, Quantao Yang, Yajie Liu, Kun Wu, Zhengping Che, Qingjie Liu, Min Wan

机构 * School of Mechanical Engineering and Automation, BeiHang University(机械工程与自动化学院,北航) School of Computer Science and Engineering, BeiHang University(计算机科学与工程学院,北航) Beijing Innovation Center of Humanoid Robotics(人形机器人创新中心) Division of Robotics, Perception and Learning (RPL), KTH Royal Institute of Technology(机器人、感知与学习 division,皇家理工学院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 本文提出DTP框架,通过生成轨迹减少模仿学习中的误差累积,提升长时程机器人任务的性能。

Comments 8 pages, 5 figures, accepted to IEEE Robotics and Automation Letters (RAL)

Journal ref IEEE Robotics and Automation Letters (Volume: 10, Issue: 12, December 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏