arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2026-08-14 至 2026-08-14 共收录 7
2608.10473 2026-08-14 cs.LG cs.AI 版本更新

Critic-Free Pretraining for Efficient Online Reinforcement Learning Fine-Tuning

用于高效在线强化学习微调的无评判者预训练

Daoyi Li, Yixian Zhang, Wenbo Ding, Yu Wang, Chao Yu

机构 * Tsinghua University(清华大学)

AI总结 该研究针对离线转在线强化学习中复用离线评判者导致的适配问题,提出无评判者预训练范式,兼容主流算法且在多任务上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02075 2026-08-14 cs.CV 版本更新

HandsOnWorld: Unconstrained Egocentric Video Generation with Camera-Disentangled Hand Control

HandsOnWorld: 无约束的自我中心视频生成,具有相机解耦的手部控制

Yushuo Chen, Xiaoyu Shi, Xiaoshi Wu, Xintao Wang, Pengfei Wan, Yebin Liu

机构 * Tsinghua University(清华大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Chinese University of Hong Kong(香港中文大学)

AI总结 提出HandsOnWorld框架,通过单目重建从无约束视频中学习手部控制,利用Plücker手部映射解耦相机与手部运动,生成高保真自我中心视频。

Comments Project Page: https://shad0wta9.github.io/handsonworld-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30045 2026-08-14 cs.CV 版本更新

DualEraser: Joint Video Object and Effect Removal via Balanced Text-Mask Guidance and Decoupled Locator-Preserver

GenEraser:通过平衡文本-掩码引导和解耦定位器-保持器实现可泛化的视频对象移除

Yuqing Chen, Lin Liu, Haisu Wu, Xiaopeng Zhang, Yaowei Wang, Yujiu Yang, Qi Tian

机构 * Tsinghua University(清华大学) Pengcheng National Laboratory(鹏城实验室) Huawei(华为) Southeast University(东南大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 提出GenEraser框架,通过多条件混合专家、可学习深度CFG融合机制和解耦专家架构,解决视频对象移除中目标与物理效应同时消除的泛化难题,在ROSE和VOR-Eval上分别提升2.16 dB和1.44 dB。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03181 2026-08-14 cs.RO cs.CV 版本更新

SpatialVAM:Spatial-Aware Multi-View Video Diffusion as a Data-Efficient Robot Policy

多视角视频扩散策略:一种3D空间-时间感知的视频动作模型

Peiyan Li, Yixiang Chen, Yuan Xu, Jiabing Yang, Xiangnan Wu, Jun Guo, Nan Sun, Long Qian, Xinghang Li, Xin Xiao, Jing Liu, Nianfeng Liu, Tao Kong, Yan Huang, Liang Wang, Tieniu Tan

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) FiveAges(五时代) Tsinghua University(清华大学) Xi’an Jiaotong University(西安交通大学) Wuhan University(武汉大学) Nanjing University(南京大学)

AI总结 本文提出MV-VDP,通过联合建模环境的3D空间-时间状态,解决机器人操控中对3D空间结构和时间演变理解不足的问题,实现高效、鲁棒且可解释的动作执行。

Comments Updated Version; Project Website: https://spatialvam.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19703 2026-08-14 math.ST cs.LG stat.TH 版本更新

Minimax and Adaptive Covariance Matrix Estimation under Differential Privacy

最小最大与自适应协方差矩阵估计在差分隐私下的研究

T. Tony Cai, Yicheng Li

机构 * The Wharton School, University of Pennsylvania(宾夕法尼亚大学沃顿商学院) Department of Statistics and Data Science(统计与数据科学系) Tsinghua University(清华大学)

AI总结 本文研究在差分隐私约束下高维带状协方差矩阵的最小最大与自适应估计,提出一种新的差分隐私分块三对角估计器,达到运算规范和弗罗贝尼乌斯范数下的最优收敛速率,并引入自适应估计器在不预知衰减参数的情况下达到最优速率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24232 2026-08-14 cs.CV 版本更新

Delving into Cascaded Instability: A Lipschitz Continuity View on Image Restoration and Object Detection Synergy

深入探讨级联不稳定:从Lipschitz连续性视角看图像恢复与目标检测的协同

Qing Zhao, Weijian Deng, Pengxu Wei, ZiYi Dong, Hannan Lu, Xiangyang Ji, Liang Lin

机构 * Sun Yat-sen University(中山大学) Australian National University(澳大利亚国立大学) Harbin Institute of Technology(哈尔滨工业大学) Tsinghua University(清华大学) Peng Cheng Laboratory(鹏城实验室)

AI总结 通过Lipschitz连续性视角,提出LR-YOLO框架,将图像恢复与目标检测整合,提升检测稳定性与准确性。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22282 2026-08-14 cs.CV cs.AI cs.CL 版本更新

CityRiSE: Reasoning Urban Socio-Economic Status in Large Vision-Language Models via Reinforcement Learning

CityRiSE:基于强化学习的大视觉语言模型城市社会经济地位推理框架

Tianhui Liu, Hetian Pang, Xin Zhang, Jie Feng, Pan Hui, Yong Li

机构 * Information Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心) Department of Electronic Engineering, BNRist, Tsinghua University(清华大学电子工程系)

AI总结 本研究提出CityRiSE框架,结合强化学习与大视觉语言模型,提升城市社会经济感知的预测准确性与泛化能力,尤其在未见城市和指标上表现优异。

Comments Accepted by ACM MM 2026, https://github.com/tsinghua-fib-lab/CityRiSE

详情

展开后加载摘要…

URL PDF HTML 收藏