Critic-Free Pretraining for Efficient Online Reinforcement Learning Fine-Tuning
用于高效在线强化学习微调的无评判者预训练
机构 * Tsinghua University(清华大学)
AI总结 该研究针对离线转在线强化学习中复用离线评判者导致的适配问题,提出无评判者预训练范式,兼容主流算法且在多任务上表现更优。
高校专区
用于高效在线强化学习微调的无评判者预训练
机构 * Tsinghua University(清华大学)
AI总结 该研究针对离线转在线强化学习中复用离线评判者导致的适配问题,提出无评判者预训练范式,兼容主流算法且在多任务上表现更优。
HandsOnWorld: 无约束的自我中心视频生成,具有相机解耦的手部控制
机构 * Tsinghua University(清华大学) ; Kling Team, Kuaishou Technology(快手科技 Kling 团队) ; Chinese University of Hong Kong(香港中文大学)
AI总结 提出HandsOnWorld框架,通过单目重建从无约束视频中学习手部控制,利用Plücker手部映射解耦相机与手部运动,生成高保真自我中心视频。
Comments Project Page: https://shad0wta9.github.io/handsonworld-page/
GenEraser:通过平衡文本-掩码引导和解耦定位器-保持器实现可泛化的视频对象移除
机构 * Tsinghua University(清华大学) ; Pengcheng National Laboratory(鹏城实验室) ; Huawei(华为) ; Southeast University(东南大学) ; Harbin Institute of Technology(哈尔滨工业大学)
AI总结 提出GenEraser框架,通过多条件混合专家、可学习深度CFG融合机制和解耦专家架构,解决视频对象移除中目标与物理效应同时消除的泛化难题,在ROSE和VOR-Eval上分别提升2.16 dB和1.44 dB。
多视角视频扩散策略:一种3D空间-时间感知的视频动作模型
机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; FiveAges(五时代) ; Tsinghua University(清华大学) ; Xi’an Jiaotong University(西安交通大学) ; Wuhan University(武汉大学) ; Nanjing University(南京大学)
AI总结 本文提出MV-VDP,通过联合建模环境的3D空间-时间状态,解决机器人操控中对3D空间结构和时间演变理解不足的问题,实现高效、鲁棒且可解释的动作执行。
Comments Updated Version; Project Website: https://spatialvam.github.io/
最小最大与自适应协方差矩阵估计在差分隐私下的研究
机构 * The Wharton School, University of Pennsylvania(宾夕法尼亚大学沃顿商学院) ; Department of Statistics and Data Science(统计与数据科学系) ; Tsinghua University(清华大学)
AI总结 本文研究在差分隐私约束下高维带状协方差矩阵的最小最大与自适应估计,提出一种新的差分隐私分块三对角估计器,达到运算规范和弗罗贝尼乌斯范数下的最优收敛速率,并引入自适应估计器在不预知衰减参数的情况下达到最优速率。
深入探讨级联不稳定:从Lipschitz连续性视角看图像恢复与目标检测的协同
机构 * Sun Yat-sen University(中山大学) ; Australian National University(澳大利亚国立大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; Tsinghua University(清华大学) ; Peng Cheng Laboratory(鹏城实验室)
AI总结 通过Lipschitz连续性视角,提出LR-YOLO框架,将图像恢复与目标检测整合,提升检测稳定性与准确性。
Comments NeurIPS 2025
CityRiSE:基于强化学习的大视觉语言模型城市社会经济地位推理框架
机构 * Information Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心) ; Department of Electronic Engineering, BNRist, Tsinghua University(清华大学电子工程系)
AI总结 本研究提出CityRiSE框架,结合强化学习与大视觉语言模型,提升城市社会经济感知的预测准确性与泛化能力,尤其在未见城市和指标上表现优异。
Comments Accepted by ACM MM 2026, https://github.com/tsinghua-fib-lab/CityRiSE