SignDATA: Data Pipeline for Sign Language Translation
SignDATA:手语翻译的数据管道
Kuanwei Chen, Tingyi Lin
机构
*
Computer Science and Information Engineering National Central University(计算机科学与信息工程国家级中央大学)
;
Electrical Engineering National Changhua University Of Education(电气工程国家彰化教育大学)
DynamicRad: Content-Adaptive Sparse Attention for Long Video Diffusion
动态Rad:面向长视频扩散的内容自适应稀疏注意力
Yongji Long, Shijun Liang, Jintao Li, Yun Li
机构
*
University of Electronic Science and Technology of China(电子科学与技术大学)
;
Shenzhen Institute for Advanced Study, UESTC(深圳先进研究院)
;
Computational Mathematics, Science, & Engineering at Michigan State University (MSU)(密歇根州立大学计算数学、科学与工程)
机构
*
Peking University, Beijing, China
;
State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University
;
Beijing Academy of Artificial Intelligence, Beijing, China
;
National University of Singapore, Singapore
;
The Hong Kong University of Science
;
Nanjing University, Nanjing, China
专题命中
视频扩散模型
:video diffusion(abstract)
AI总结
本文提出Mask World Model,通过预测语义遮罩而非像素,提升机器人策略学习的鲁棒性与泛化能力,实验证明其在仿真和现实任务中均优于现有方法。