arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The University of Hong Kong(香港大学)

2026-04-29 至 2026-04-29 共收录 7
2604.25427 2026-04-29 cs.CV

A Systematic Post-Train Framework for Video Generation

视频生成的系统性后训练框架

Zeyue Xue, Siming Fu, Jie Huang, Shuai Lu, Haoran Li, Yijun Liu, Yuming Li, Xiaoxuan He, Mengzhao Chen, Haoyang Huang, Nan Duan, Ping Luo

机构 * The University of Hong Kong(香港大学) JD Explore Academy(京东探索研究院) Tsinghua University(清华大学) Peking University(北京大学) Zhejiang University(浙江大学)

AI总结 本文提出系统性后训练框架,通过四个协同阶段提升视频生成的视觉质量、时间一致性和指令遵循性,同时保持预训练阶段的可控性。

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25310 2026-04-29 cs.CV eess.IV

Rapid tracking through strongly scattering media with physics-informed neuromorphic speckle analysis

通过强散射介质快速跟踪的物理引导神经形态斑点分析

Yuqing Cao, Shuo Zhu, Rongzhou Chen, Jingyan Chen, Ni Chen, Edmund Y. Lam

机构 * Department of Electrical and Computer Engineering, The University of Hong Kong(香港大学电子与计算机工程系)

AI总结 本文提出基于物理引导的神经形态跟踪方法,通过异步事件传感与任务驱动斑点分析实现强散射介质中快速且低光照下的稳定跟踪,实验表明其在速度和光照条件上均优于传统系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29844 2026-04-29 cs.RO cs.AI cs.CV cs.LG

DIAL: Decoupling Intent and Action via Latent World Modeling for End-to-End VLA

DIAL: 通过潜在世界建模解耦意图与动作以实现端到端VLA

Yi Chen, Yuying Ge, Hui Zhou, Mingyu Ding, Yixiao Ge, Xihui Liu

机构 * The University of Hong Kong(香港大学) XPENG Robotics(小鹏机器人) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 DIAL通过潜在意图瓶颈解耦意图与动作,利用VLM进行潜在世界建模并结合轻量策略实现端到端VLA,实验表明其在RoboCasa GR1任务中优于现有方法,且在真实世界部署中表现稳健。

Comments Project page: https://xpeng-robotics.github.io/dial

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11075 2026-04-29 cs.RO

RISE: Self-Improving Robot Policy with Compositional World Model

RISE:具有组合世界模型的自改进机器人策略

Jiazhi Yang, Kunyang Lin, Jinwei Li, Wencong Zhang, Tianwei Lin, Longyan Wu, Zhizhong Su, Hao Zhao, Ya-Qin Zhang, Li Chen, Ping Luo, Xiangyu Yue, Hongyang Li

机构 * The Chinese University of Hong Kong(香港中文大学) Kinetix AI The University of Hong Kong(香港大学) Shanghai Innovation Institute(上海创新研究院) Horizon Robotics Tsinghua University(清华大学)

AI总结 本文提出RISE框架,通过组合世界模型提升机器人策略鲁棒性,在动态砖块排序、背包打包和箱盖闭合任务中分别取得+35%、+45%和+35%的性能提升。

Comments RSS 2026. Project page: https://opendrivelab.com/RISE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10813 2026-04-29 cs.CV cs.RO

InternScenes: A Large-scale Simulatable Indoor Scene Dataset with Realistic Layouts

InternScenes: 一个大规模可模拟室内场景数据集,具有逼真布局

Weipeng Zhong, Peizhou Cao, Yichen Jin, Li Luo, Wenzhe Cai, Jingli Lin, Hanqing Wang, Zhaoyang Lyu, Tai Wang, Bo Dai, Xudong Xu, Jiangmiao Pang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Beihang University(北航) The University of Hong Kong(香港大学)

AI总结 本文提出InternScenes数据集,包含4万多个多样化场景,涵盖15种常见场景类型和288个物体类别,通过整合现实扫描、程序生成和设计师创作的场景,保留大量小物品以实现逼真布局,用于场景布局生成和点-目标导航任务。

Comments Accepted by NeurIPS 2025; Project page: https://marjordcpz.github.io/InternScenes.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23690 2026-04-29 cs.CV

SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation

SynMotion: 语义-视觉适应用于运动定制视频生成

Shuai Tan, Biao Gong, Yujie Wei, Shiwei Zhang, Zhuoxin Liu, Ke Ma, Yan Wang, Kecheng Zheng, Xing Zhu, Yujun Shen, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Ant Group(蚂蚁集团) Tongyi(通义) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Huazhong University of Science and Technology(华中科技大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 SynMotion通过联合语义指导和视觉适应,解决视频生成中语义与视觉信息的平衡问题,提出双嵌入语义理解机制和参数高效运动适配器,提升运动细节和时间一致性。

Comments Project page: https://lucaria-academy.github.io/SynMotion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09981 2026-04-29 cs.CV cs.RO

ReSim: Reliable World Simulation for Autonomous Driving

ReSim:面向自动驾驶的可靠世界模拟

Jiazhi Yang, Kashyap Chitta, Shenyuan Gao, Long Chen, Yuqian Shao, Xiaosong Jia, Hongyang Li, Andreas Geiger, Xiangyu Yue, Li Chen

机构 * The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) OpenDriveLab at Shanghai AI Lab(上海人工智能实验室OpenDrive实验室) NVIDIA Research(NVIDIA研究) Xiaomi EV(小米电动车) Shanghai Jiao Tong University(上海交通大学) University of Tübingen, Tübingen AI Center(图宾根大学,图宾根人工智能中心) HKUST(香港科技大学)

AI总结 本文提出ReSim模型,通过整合真实数据与模拟数据提升自动驾驶场景模拟的可靠性与可控性,提升规划和策略选择性能。

Comments NeurIPS 2025 Spotlight. Project page: https://opendrivelab.com/ReSim

详情

展开后加载摘要…

URL PDF HTML 收藏