arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-04-01 至 2026-04-01 共收录 1 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. 数据集与评测 1 篇

2603.14794 2026-04-01 cs.CV cs.LG 76%

Face-to-Face: A Video Dataset for Multi-Person Interaction Modeling

面对面:一个多人物交互建模的视频数据集

Ernie Chu, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 数据集与评测 :action model(title);分类 cs.CV、cs.LG

AI总结 本文提出F2F-JF数据集,用于研究多人物交互建模,通过半自动流程提取对齐的主持人和嘉宾轨迹,并展示基于该数据集的反应式数字虚拟形象任务,验证了扩散模型在跨人物视觉上下文中的表现。

Comments Project Page: https://face2face2026.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏