arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-07-23 至 2026-07-23 共收录 2 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 2 篇

2602.01429 2026-07-23 cs.RO 75%

Sem-NaVAE: Semantically-Guided Outdoor Mapless Navigation via Generative Trajectory Priors

Sem-NaVAE: 基于语义引导的室外无地图导航通过生成式轨迹先验

Gonzalo Olguín, Javier Ruiz-del-Solar

机构 * Department of Electrical Engineering & the Advanced Mining Technology Center (AMTC), Universidad de Chile(电气工程系及先进采矿技术中心(AMTC)、智利大学)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);visual language model(abstract)

AI总结 提出Sem-NaVAE方法,结合条件变分自编码器生成多样化轨迹和轻量视觉语言模型进行语义选择,实现室外无地图实时导航,在未见环境中达到90%成功率。

Comments Accepted for publication in IEEE Robotics and Automation Letters (RA-L). 8 pages, 5 figures

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 8, pp. 9335-9342, Aug. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19850 2026-07-23 cs.RO 新提交 67%

SOPD-SocialNav: Selective On-Policy Distillation for Vision-Language Social Navigation

SOPD-SocialNav:用于视觉语言社交导航的选择性在线策略蒸馏

Xinyu Zhang, Zishuo Wang, Ling Xiao

机构 * Graduate School of Information Science and Technology, Hokkaido University(北海道大学信息科学与技术研究生院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)

AI总结 针对大规模视觉语言模型难部署、轻量级模型社交推理能力不足的问题,提出SOPD-SocialNav方法,通过基于熵的令牌选择机制及温度控制的散度目标,将社交导航知识从大型教师模型转移到轻量级学生模型,实验证明该方法有效。

Comments This paper has been accepted to 2026 WRC Symposium on Advanced Robotics and Automation (WRC SARA)

详情

展开后加载摘要…

URL PDF HTML 收藏