BindWeave: Subject-Consistent Video Generation via Cross-Modal Integration
BindWeave:通过跨模态整合实现主体一致的视频生成
Zhaoyang Li, Dongjun Qian, Kai Su, Qishuai Diao, Xiangyang Xia, Chang Liu, Wenfei Yang, Tianzhu Zhang, Zehuan Yuan
机构
*
University of Science and Technology of China(中国科学技术大学)
;
ByteDance(字节跳动)
;
National Key Laboratory of Deep Space Exploration, Deep Space Exploration Laboratory(国家深空探测重点实验室,深空探测实验室)
机构
*
McMaster University(麦克 master 大学)
;
University of Toronto(多伦多大学)
;
The University of Hong Kong(香港大学)
;
McGill University(麦吉尔大学)
;
Concordia University(Concordia 大学)
;
MBZUAI
Slot-BERT: Self-supervised Object Discovery in Surgical Video
Slot-BERT: 在手术视频中实现自监督的对象发现
Guiqiu Liao, Matjaz Jogan, Marcel Hussing, Kenta Nakahashi, Kazuhiro Yasufuku, Amin Madani, Eric Eaton, Daniel A. Hashimoto
机构
*
Outcomes Laboratory, Department of Surgery, University of Pennsylvania, Philadelphia, PA, USA.
;
Department of Computer
;
Information Science, University of Pennsylvania, Philadelphia, PA, USA.
;
Division of Thoracic Surgery, Toronto General Hospital, University Health Network, Toronto, Ontario, Canada.
;
Surgical Artificial Intelligence Research Academy, University Health Network, Toronto, ON, Canada.
机构
*
University of British Columbia(不列颠哥伦比亚大学)
;
Vector Institute for AI(人工智能向量研究所)
;
Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)
;
Nanyang Technological University(南洋理工大学)
APPO: Attention-guided Perception Policy Optimization for Video Reasoning
APPO:基于注意力的视频推理感知策略优化
Henghui Du, Chang Zhou, Xi Chen, Di Hu
机构
*
Gaoling School of Artificial Intelligence, Renmin University of China, Beijing(中国人民大学北京校区人工智能学院)
;
AI Technology Center, Online Video Business Unit, Tencent PCG(腾讯PCG人工智能技术中心)