arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanjing University(南京大学)

2026-06-24 至 2026-06-24 共收录 4
2606.24726 2026-06-24 cs.CV 新提交

SER: Learning to Ground Video Reasoning with Semantic Evidence Rewards

SER: 用语义证据奖励学习视频推理定位

Sheng Xia, Zhengqin Lai, Tianxiang Jiang, Kanghui Tian, Shoujun Zhou, Bin Li, Yi Wang

机构 * Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Laboratory(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学) Shenzhen Institutes of Advanced Technology(深圳先进技术研究院)

AI总结 提出语义证据奖励(SER),通过将时空证据定位重构为约束验证任务,利用裁判VLM评估证据的相关性和定位质量,在V-STAR基准上提升3.0点mLGM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24255 2026-06-24 cs.CV cs.AI 新提交

Social Structure Matters in 3D Human-Human Interaction Generation

社会结构在三维人-人交互生成中的重要性

Zhongju Wang, Beier Wang, Yatao Bian, Pichao Wang, Zhi Wang, Daoyi Dong, Hongdong Li, Huadong Mo, Zhenhong Sun

机构 * University of New South Wales(新南威尔士大学) National University of Singapore(新加坡国立大学) NVIDIA(英伟达) Nanjing University(南京大学) University of Technology Sydney(悉尼科技大学) Australian National University(澳大利亚国立大学)

AI总结 提出Solo-to-Social框架,利用LLM规划社会结构(阶段分解、角色分配)并指导运动执行器生成协调的双人3D运动,解决文本驱动的人-人交互生成问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22998 2026-06-24 cs.RO 新提交

TEXEDO : Test Time Scaling for Controller-aware Language-conditioned Humanoid Motion Generation

TEXEDO:面向控制器感知的语言条件人形运动生成的测试时缩放

Jianuo Cao, Yuxin Chen, Yuzhen Song, Masayoshi Tomizuka, Chenran Li, Thomas Tian

机构 * Nanjing University(南京大学) University of California, Berkeley(加州大学伯克利分校) Southern University of Science and Technology(南方科技大学)

AI总结 提出TEXEDO框架,在测试时从预训练生成器中采样多个候选运动,通过动态可行性验证和语义对齐验证选择可执行且任务对齐的最佳运动,提升人形机器人运动生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22136 2026-06-24 cs.RO 新提交

Wh0: Generative World Models as Scalable Sources of Egocentric Human Hand Manipulation Data

Wh0: 生成式世界模型作为自我中心人类手部操作数据的可扩展来源

Yangtao Chen, Zixuan Chen, Peiyang Wang, Yong-Lu Li, Jing Huo, Jieqi Shi, Yang Gao

机构 * Shanghai Innovation Institute(上海创新研究院) Nanjing University(南京大学) Shanghai Jiaotong University(上海交通大学)

AI总结 提出Wh0框架,利用生成式视频世界模型产生自我中心人-物交互数据集WM-H,通过手部运动重建和视觉编辑转化为机器人可训练监督,提升预训练灵巧VLA模型在真实任务上的零样本成功率。

Comments Under review. The first three authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏