arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-13 至 2026-03-13 共收录 4 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 4 篇

2603.11447 2026-03-13 cs.RO 82%

Enhancing Lightweight Vision Language Models through Group Competitive Learning for Socially Compliant Navigation

通过群体竞争学习增强轻量级视觉语言模型以实现符合社会规范的导航

Xinyu Zhang, Atsushi Konno, Toshihiko Yamasaki, Ling Xiao

机构 * Hokkaido University(北海道大学) The University of Tokyo(东京大学)

专题命中 GUI与屏幕智能体 :vision language model(title,abstract);VLM(abstract)

AI总结 本文提出群体竞争学习策略,通过协调全局语义与分布正则化,提升轻量级VLMs在社交导航中的推理与决策能力,实现高准确性和高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12138 2026-03-13 cs.CV 57%

HATS: Hardness-Aware Trajectory Synthesis for GUI Agents

HATS: 为GUI代理的硬度感知轨迹合成

Rui Shao, Ruize Gao, Bin Xie, Yixing Li, Kaiwen Zhou, Shuai Wang, Weili Guan, Gongwei Chen

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

AI总结 HATS通过硬度感知轨迹合成框架,解决GUI代理训练中语义模糊性问题,提升任务执行鲁棒性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16667 2026-03-13 cs.RO cs.CV 57%

ReViP: Mitigating False Completion in Vision-Language-Action Models with Vision-Proprioception Rebalance

ReViP: 通过视觉-本体感知再平衡缓解视觉语言动作模型中的虚假完成

Zhuohao Li, Yinghao Li, Jian-Jian Jiang, Lang Zhou, Tianyu Zhang, Jiadong Yin, Mu Lin, Yi-Lin Wei, Wei-Shi Zheng

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 ReViP通过引入视觉-本体感知再平衡机制,缓解视觉语言动作模型中的虚假完成问题,提升模型在扰动下的鲁棒性和任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12263 2026-03-13 cs.RO 50%

$Ψ_0$: An Open Foundation Model Towards Universal Humanoid Loco-Manipulation

$Ψ_0$:一种面向通用人形机器人运动- manipulation 的开放基础模型

Songlin Wei, Hongyi Jing, Boqian Li, Zhenyu Zhao, Jiageng Mao, Zhenhao Ni, Sicheng He, Jie Liu, Xiawei Liu, Kaidi Kang, Sheng Zang, Weiduo Yuan, Marco Pavone, Di Huang, Yue Wang

专题命中 GUI与屏幕智能体 :VLM(abstract)

AI总结 本文提出$Ψ_0$模型,通过分阶段训练和异构数据利用,实现高效的人形机器人运动- manipulation 任务,仅用800小时视频和30小时机器人数据即超越基线性能。

详情

展开后加载摘要…

URL PDF HTML 收藏