arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

2026-07-16 至 2026-07-16 共收录 6
2607.14088 2026-07-16 cs.CV 新提交

VideoRAE: Taming Video Foundation Models for Generative Modeling via Representation Autoencoders

VideoRAE:通过表示自动编码器驯服用于生成建模的视频基础模型

Zhihao Xie, Junfeng Wu, Xinting Hu, Junchao Huang, Li Jiang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Huazhong University of Science and Technology(华中科技大学) Shenzhen Loop Area Institute(深圳河套学院) University of Science and Technology of China(中国科学技术大学)

AI总结 研究视频生成模型潜在空间问题,提出VideoRAE,利用冻结视频基础编码器特征经1D自注意力投影仪压缩,支持多种潜在空间,通过多码本高维量化等实现强大重建,收敛快,验证了冻结VFM表示的有效性。

Comments Home page: https://zhxie0117.github.io/VideoRAE

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13931 2026-07-16 cs.CV 新提交

SIVA-RL: Sensitivity-Invariance Visual Alignment for Multimodal Reinforcement Learning

SIVA-RL:用于多模态强化学习的灵敏度不变视觉对齐

Cheng Tang, Junzhi Ning, Min Cen, Wei Li, Xinyi Zeng, Pinxian Zeng, Rongbin Li, Qiming Zhu, Yuqiang Li, Junjun He, Yirong Chen, Ming Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Sichuan University(四川大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Macau(澳门大学)

AI总结 研究多模态强化学习中视觉语言模型预测与视觉证据结合问题,提出SIVA-RL框架,通过特定方法构建局部干预并以奖励下降为权重驱动对齐,在多基准测试中相比基线改进了模型。

Comments 27 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13633 2026-07-16 cs.RO 新提交

Design and Control of the "QuadBoat": A Quadruped Surface Vehicle for Drowning Rescue

“四足船”的设计与控制:一种用于溺水救援的四足水面机器人

Lianxin Zhang, Yihan Huang, Huihuan Qian

机构 * Shenzhen Institute of Artificial Intelligence and Robotics for Society (AIRS)(深圳社会人工智能与机器人研究所) The Chinese University of Hong Kong, Shenzhen (CUHK-Shenzhen)(香港中文大学(深圳)) Stevens Institute of Technology(史蒂文斯理工学院)

AI总结 研究针对水面救援中快速捞出受害者的问题,提出QuadBoat四足水面机器人,通过逆运动学及级联控制实现精确追踪找回物体,经机动性、跟踪等实验验证其高敏捷性、精度及系统机动性,视觉实验进一步验证其救援有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13481 2026-07-16 cs.CV 新提交

GPOcc++: Unified Sparse Gaussian Occupancy Prediction with Visual Geometry Priors

GPOcc++:具有视觉几何先验的统一稀疏高斯占用预测

Changqing Zhou, Yueru Luo, Yulan Guo, Bing Wang, Jie Qin, Changhao Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Sun Yat-sen University(中山大学) The Hong Kong Polytechnic University(香港理工大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

AI总结 研究针对3D场景理解中从视觉观察恢复完整体积表示的挑战,提出GPOcc++,它基于视觉几何先验,将其转换为占用感知的稀疏高斯表示,能在统一框架中处理多视图观察和时间序列,扩展到室外,实验证明其性能强、效率高且泛化能力好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13399 2026-07-16 cs.CL cs.LG 新提交

Demystifying On-Policy Distillation: Roles, Pathologies, and Regulations

揭开在线策略蒸馏的神秘面纱:作用、问题及调控

Rui Wang, Hongru Wang, Yi Chen, Boyang Xue, Tianqing Fang, Wenhao Yu, Kam-Fai Wong

机构 * The Chinese University of Hong Kong(香港中文大学) Tencent AI Lab(腾讯人工智能实验室)

AI总结 研究在线策略蒸馏的作用、问题及调控,阐明其为探索催化剂,揭示师生不匹配和长度利用问题,提出优势裁剪和对数尺度压缩调控,实验表明良好调控的信号质量决定OPD中成功探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13101 2026-07-16 cs.LG cs.AI 新提交

TSSM: Triaxial State Space Model for Global Station Weather Forecasting with Temporal-Variable-Historical Modeling

TSSM:用于全球台站天气预报的具有时间可变历史建模的三轴状态空间模型

Songru Yang, Zili Liu, Tao Han, Ben Fei, Fenghua Ling, Lei Bai, Chang Liu, Xiangyang Ji, Zhenwei Shi, Zhengxia Zou

机构 * Beihang University(北京航空航天大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学)

AI总结 研究针对全球台站天气预报中现有方法的局限,提出三轴状态空间模型TSSM,通过时间可变历史范式纳入历史数据,设计扫描捕捉多种特性,在多数据集上性能优异,尤其在长期和迭代预测及应对缺失观测方面优势明显。

详情

展开后加载摘要…

URL PDF HTML 收藏