arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Science and Technology of China(中国科学技术大学)

2026-08-05 至 2026-08-05 共收录 2
2608.02990 2026-08-05 cs.RO 新提交

EmbodiedVAE: Disentangled Video VAE for Efficient and Controllable Embodied Manipulation

EmbodiedVAE:用于高效可控具身操作的解耦视频变分自编码器

Jiayi Luo, Hanxin Zhu, Chen Gao, Jiankun Wang, Cong Wang, Tianyu He, Jianxin Li, Zhibo Chen

机构 * Beihang University(北京航空航天大学) Zhongguancun Academy(中关村学院) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) CASIA, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所(CASIA)) Microsoft Research Asia(微软亚洲研究院)

AI总结 针对现有潜在扩散模型适配具身操作场景的缺陷,提出EmbodiedVAE视频变分自编码器,通过双编码器架构与最优传输一致性模块实现更优重建质量、压缩率及精确动作控制。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02694 2026-08-05 cs.CL cs.LG 新提交

Crayotter: Learning Long-Horizon Video Editing Agents via Group-Relative Preference Backpropagation

Crayotter:通过组相对偏好反向传播学习长时程视频编辑智能体

Lecheng Yan, Jianze Lin, Yichong Zhang, Ben Pan, Wenxi Li, Chenyang Lyu, Liting Zhou, Cathal Gurrin

机构 * University of Science and Technology of China(中国科学技术大学) Beijing Normal University(北京师范大学) Jilin University(吉林大学) Tianjin University(天津大学) East China Normal University(华东师范大学) Alibaba Group(阿里巴巴集团) Dublin City University(都柏林城市大学)

AI总结 该研究提出 GRPB 方法,构建长时程视频编辑任务集,训练出的 9B Crayotter 模型在 AgenticVBench 上超越多个专有系统,实现从主观延迟结果中学习视频编辑智能体。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏