arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-05-11 至 2026-05-11 共收录 2 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. 数据集与评测 2 篇

2605.06747 2026-05-11 cs.CV cs.RO 73%

HumanNet: Scaling Human-centric Video Learning to One Million Hours

HumanNet: 将以人为中心的视频学习扩展到一百万小时

Yufan Deng, Daquan Zhou

机构 * Peking University(北京大学)

专题命中 数据集与评测 :vision-language-action(abstract);embodied foundation model(abstract);分类 cs.RO、cs.CV

AI总结 HumanNet通过构建大规模人类活动视频数据集,探索以人为中心的视频在扩展具身基础模型中的潜力,展示其在动作生成和人机转移中的优势。

Comments Github: https://github.com/DAGroup-PKU/HumanNet Project website: https://dagroup-pku.github.io/HumanNet/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07299 2026-05-11 cs.CV cs.AI 62%

EgoPro-Bench: Benchmarking Personalized Proactive Interaction in Egocentric Video Streams

EgoPro-Bench:基于眼动视频流的个性化主动交互基准测试

Dongchuan Ran, Linyu Ou, Xueheng Li, Wenwen Tong, Chenxu Guo, Hewei Guo, Kaibing Wang, Lewei Lu

机构 * Beijing Institute of Technology(北京理工大学) University of Science and Technology of China(中国科学技术大学)

专题命中 数据集与评测 :action model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出EgoPro-Bench,通过模拟用户画像生成多样化意图,构建高保真人机交互数据,评估主动交互能力,提升多模态大语言模型的意图理解与交互时机识别能力。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏