arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanjing University(南京大学)

2026-08-06 至 2026-08-06 共收录 2
2608.04956 2026-08-06 cs.CV 新提交

ContextMaster: Interactive Multi-Shot Video Creation via Fixed-Budget Sparse Context Routing

ContextMaster:基于固定预算稀疏上下文路由的交互式多镜头视频创作

Xu Guo, Zhengxuan Wei, Xinghui Li, Hanzhuo Huang, Xinyu Liu, Xiangyang Luo, Min Wei, Yiran Zhu, Qiulin Wang, Yulong Xu, Xintao Wang, Pengfei Wan, Qi Fan, Xiangwang Hou

机构 * Tsinghua University(清华大学) Nanjing University(南京大学) Kling Team, Kuaishou Technology(快手科技影团队) ShanghaiTech University(上海科技大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 该研究提出统一模型ContextMaster,以固定预算稀疏上下文路由等技术解决交互式多镜头视频创作问题,在基础任务表现优于专用基线,单GPU达16 FPS且支持灵活工作流。

Comments Project page: https://guoxu1233.github.io/ContextMaster/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04633 2026-08-06 cs.RO 新提交

Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models

Mind-VLA:面向视觉-语言-动作模型的指令感知空间表示对齐方法

Xingyu Ding, Yuzhong Zhao, Yang Wu, Chaoyang Zhao, Chunhai Zhao, Yifan Zhang, Jian Cheng

机构 * Nanjing University(南京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文针对现有VLA方法忽略指令指定目标物体3D几何的问题,提出Mind-VLA方法,通过对齐目标物体相关特征实现指令感知3D理解,在LIBERO、CALVIN及真实机器人遮挡任务上性能显著优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏