Critic-Free Pretraining for Efficient Online Reinforcement Learning Fine-Tuning
用于高效在线强化学习微调的无评判者预训练
机构 * Tsinghua University(清华大学)
AI总结 该研究针对离线转在线强化学习中复用离线评判者导致的适配问题,提出无评判者预训练范式,兼容主流算法且在多任务上表现更优。
高校专区
用于高效在线强化学习微调的无评判者预训练
机构 * Tsinghua University(清华大学)
AI总结 该研究针对离线转在线强化学习中复用离线评判者导致的适配问题,提出无评判者预训练范式,兼容主流算法且在多任务上表现更优。
HandsOnWorld: 无约束的自我中心视频生成,具有相机解耦的手部控制
机构 * Tsinghua University(清华大学) ; Kling Team, Kuaishou Technology(快手科技 Kling 团队) ; Chinese University of Hong Kong(香港中文大学)
AI总结 提出HandsOnWorld框架,通过单目重建从无约束视频中学习手部控制,利用Plücker手部映射解耦相机与手部运动,生成高保真自我中心视频。
Comments Project Page: https://shad0wta9.github.io/handsonworld-page/
GenEraser:通过平衡文本-掩码引导和解耦定位器-保持器实现可泛化的视频对象移除
机构 * Tsinghua University(清华大学) ; Pengcheng National Laboratory(鹏城实验室) ; Huawei(华为) ; Southeast University(东南大学) ; Harbin Institute of Technology(哈尔滨工业大学)
AI总结 提出GenEraser框架,通过多条件混合专家、可学习深度CFG融合机制和解耦专家架构,解决视频对象移除中目标与物理效应同时消除的泛化难题,在ROSE和VOR-Eval上分别提升2.16 dB和1.44 dB。
多视角视频扩散策略:一种3D空间-时间感知的视频动作模型
机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; FiveAges(五时代) ; Tsinghua University(清华大学) ; Xi’an Jiaotong University(西安交通大学) ; Wuhan University(武汉大学) ; Nanjing University(南京大学)
AI总结 本文提出MV-VDP,通过联合建模环境的3D空间-时间状态,解决机器人操控中对3D空间结构和时间演变理解不足的问题,实现高效、鲁棒且可解释的动作执行。
Comments Updated Version; Project Website: https://spatialvam.github.io/
最小最大与自适应协方差矩阵估计在差分隐私下的研究
机构 * The Wharton School, University of Pennsylvania(宾夕法尼亚大学沃顿商学院) ; Department of Statistics and Data Science(统计与数据科学系) ; Tsinghua University(清华大学)
AI总结 本文研究在差分隐私约束下高维带状协方差矩阵的最小最大与自适应估计,提出一种新的差分隐私分块三对角估计器,达到运算规范和弗罗贝尼乌斯范数下的最优收敛速率,并引入自适应估计器在不预知衰减参数的情况下达到最优速率。
深入探讨级联不稳定:从Lipschitz连续性视角看图像恢复与目标检测的协同
机构 * Sun Yat-sen University(中山大学) ; Australian National University(澳大利亚国立大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; Tsinghua University(清华大学) ; Peng Cheng Laboratory(鹏城实验室)
AI总结 通过Lipschitz连续性视角,提出LR-YOLO框架,将图像恢复与目标检测整合,提升检测稳定性与准确性。
Comments NeurIPS 2025
CityRiSE:基于强化学习的大视觉语言模型城市社会经济地位推理框架
机构 * Information Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心) ; Department of Electronic Engineering, BNRist, Tsinghua University(清华大学电子工程系)
AI总结 本研究提出CityRiSE框架,结合强化学习与大视觉语言模型,提升城市社会经济感知的预测准确性与泛化能力,尤其在未见城市和指标上表现优异。
Comments Accepted by ACM MM 2026, https://github.com/tsinghua-fib-lab/CityRiSE
具身融合智能体:以人为中心的智能体人工智能新范式
机构 * Université de Montréal(蒙特利尔大学) ; Mila – Quebec Artificial Intelligence Institute(米拉-魁北克人工智能研究所) ; Institute of Advanced Intelligence and Computing (IAIC), A*STAR(新加坡科技研究局高级智能与计算研究所) ; Nanjing Medical University(南京医科大学) ; Nanjing University(南京大学) ; Renmin University of China(中国人民大学) ; University of Cambridge(剑桥大学) ; University of Oxford(牛津大学) ; Tsinghua University(清华大学) ; National University of Singapore(新加坡国立大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; The Hong Kong Polytechnic University(香港理工大学) ; Southern University of Science and Technology(南方科技大学) ; Southeast University(东南大学) ; University of Glasgow(格拉斯哥大学) ; Nanyang Technological University(南洋理工大学)
AI总结 该研究提出以人为中心的 Combodied Agents 新范式,整合多类智能体能力形成闭环,聚焦人类状态轨迹建模,推动智能体 AI 从任务完成转向人类持续福祉。
Comments 38 pages, 6 figures, 10 tables
MuseVLA: 一种用于机器人操作的自适应多模态感知视觉-语言-动作模型
机构 * School of Computer Science, Peking University(北京大学计算机科学学院) ; Microsoft Research Asia(微软亚洲研究院) ; Princeton University(普林斯顿大学) ; Tsinghua University(清华大学)
AI总结 提出MuseVLA模型,通过将传感器作为按需工具集成,实现自适应多模态感知;设计传感器图像统一表示,并引入数据合成流水线,在灵巧手操作任务中平均成功率80.6%,显著优于RGB-only和多模态基线。
基于评分标准的强化学习中的奖励黑客行为的复现、分析与检测
机构 * Tsinghua University(清华大学) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Xi’an Jiaotong University(西安交通大学)
AI总结 本文提出可控黑客环境CHERRL,通过注入已知偏见复现奖励黑客行为,分析其可发现性与可利用性,并探索基于智能体的自动检测方法。
Comments 23 pages, 7 figures
超图增强的无训练和无语言少样本异常检测
机构 * Nankai University(南开大学) ; Tianjin University of Technology(天津工业大学) ; Tsinghua University(清华大学)
AI总结 本文提出HyperFSAD框架,通过超图推理机制实现无训练和无语言的少样本异常检测,利用稀疏超匹配和双分支图像评分提升鲁棒性,无需手工艺文本提示,在多个工业和医疗数据集上取得最佳性能。
RLinf-VLA: 一种用于视觉-语言-动作模型强化学习的统一高效框架
机构 * Tsinghua University(清华大学) ; Zhongguancun Academy(中关村学院) ; Infinigence AI ; Peking University(北京大学) ; UC Berkeley(加州大学伯克利分校) ; Harbin Institute of Technology(哈尔滨工程学院) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
AI总结 RLinf-VLA是一种统一高效的框架,用于提升视觉-语言-动作模型在具身环境中的强化学习性能,通过统一接口和高效资源分配实现统一和可扩展的训练。
Comments Accepted to RSS 2026. This is the technical report of the RLinf Team, focusing on the algorithm side. For the system-level design, please refer to arXiv:2509.15965. The open-sourced code link: https://github.com/RLinf/RLinf
大语言模型作为网络优化的通用策略
机构 * Bytedance(字节跳动) ; Shenzhen International Graduate School(深圳国际研究生院) ; Tsinghua University(清华大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Department of Computer Science and Technology(计算机科学与技术系)
AI总结 本文提出Trailblazer框架,利用大语言模型实现跨任务和环境的通用网络策略,通过网络对齐和策略协作机制提升效率与泛化能力。
Comments Arxiv version. Official version has been submitted to IEEE Transactions on Mobile Computing
Sekai2:从世界探索到交互式世界建模
机构 * Alaya Lab(Alaya实验室) ; Shanghai Innovation Institute(上海创新研究院) ; Wuhan University(武汉大学) ; Tsinghua University(清华大学)
AI总结 研究人员推出多源真实世界视频数据集Sekai2,其具备丰富观测数据与标注,可用于长时程视频生成、相机可控合成及交互式世界模型预训练。
Comments Sekai2 dataset technical report. Developed at Alaya Lab
X-NavDP:通过组Q分数重加权匹配将导航扩散策略泛化到新行为和实体
机构 * Fudan University(复旦大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Sun Yat-sen University(中山大学) ; Tsinghua University(清华大学)
AI总结 该研究针对导航扩散策略泛化性不足的问题,提出GQRM框架对X-NavDP进行后训练,大幅提升了跨实体视觉导航的模拟与现实场景成功率。
Comments 20 pages, 4 figures
SinD 2.0:一个用于信号交叉口面向SOTIF安全验证的具有语义风险注释的多城市无人机数据集
机构 * Tsinghua University(清华大学) ; Beijing Institute of Technology(北京理工大学) ; Guangzhou Automobile Group Co., Ltd.(广州汽车集团股份有限公司) ; Jilin University(吉林大学) ; Chang’an University(长安大学) ; Chongqing University(重庆大学) ; Southwest University(西南大学) ; Wuhan University of Technology(武汉理工大学) ; Virginia Tech Transportation Institute(弗吉尼亚理工大学交通研究所) ; Virginia Tech(弗吉尼亚理工大学)
AI总结 针对自动驾驶系统在信号交叉口安全验证的瓶颈,介绍SinD 2.0多城市无人机数据集。通过跨域多样、高密度风险交互、分层语义注释及全栈测试工具链,能有效暴露算法性能局限,为ADS安全分析提供有力支持。
ReMMD: 面向多模态虚假信息检测的现实多语言多图像智能体验证
机构 * Shanghai Jiaotong University(上海交通大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Tsinghua University(清华大学) ; Central South University(中南大学) ; China Electronics Technology Group Corporation 15th Research Institute(中国电子科技集团公司第十五研究所)
AI总结 提出ReMMD框架,包含多语言多图像基准ReMMDBench和持久记忆验证器ReMMD-Agent,通过原子点分解和可重用证据集实现高效准确的多模态虚假信息检测。
Comments The project is available at https://dang-ai.github.io/ReMMD
R2AoP: 从产前超声可靠且鲁棒地估计进展角
机构 * Tsinghua University(清华大学) ; Hangzhou Dianzi University(杭州电子科技大学) ; Shenzhen Research Institute of Big Data(深圳大数据研究院)
AI总结 本文提出R2AoP框架,通过结构引导的分割和置信度引导的几何建模,实现了稳定的进展角估计,同时引入轻量级几何可靠测试时适应策略以提高在异质采集条件下的性能。
Comments 11pages,4 figures,Accepted by MICCAI PIPPI Workshop 2026
多源人机协同数字孪生测试平台用于混合交通流中的连接与自动驾驶车辆
机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动性学院) ; Department of Civil and Environmental Engineering, University of Michigan(密歇根大学土木与环境工程系)
AI总结 本文提出了一种多源人机协同混合云控制测试平台(MSH-MCCT),用于在混合交通环境中测试连接与自动驾驶车辆(CAVs)与人类驾驶车辆(HDVs)之间的复杂交互,通过混合数字孪生概念结合混合现实与数字孪生,提升实验灵活性和可扩展性。
Journal ref 2026 in Journal of Intelligent and Connected Vehicles
OmniVTA: 用于接触密集机械操作的视觉-触觉世界建模
机构 * TARS Robotics(TARS机器人实验室) ; National University of Singapore(新加坡国立大学) ; Fudan University(复旦大学) ; CASIA(中国科学院自动化研究所) ; Tsinghua University(清华大学) ; Zhongguancun Academy(中关村学院) ; Beihang University(北京航空航天大学)
AI总结 本文提出OmniVTA框架,结合预测接触建模与高频触觉反馈,通过大规模视觉-触觉-动作数据集提升接触密集操作的性能与泛化能力。
Comments Project Page: https://mrsecant.github.io/OmniVTA
HSSBench: 多模态大语言模型在人文学与社会科学能力评估中的基准测试
机构 * National Engineering Research Center for Software Engineering, Peking University(北京大学软件工程国家工程研究中心) ; Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院) ; Tsinghua University(清华大学) ; Chinese Academy of Sciences(中国科学院) ; University of British Columbia(不列颠哥伦比亚大学) ; Renmin University of China(中国人民大学)
AI总结 HSSBench是一个专门评估多模态大语言模型在人文学与社会科学任务能力的基准测试,包含多语言样本,通过协作生成数据提升跨学科推理能力。
Comments ICLR 2026 (OpenReview: https://openreview.net/forum?id=iQsKotob31)
关于双层优化中条件数依赖性的研究
机构 * IIIS, Tsinghua University(清华大学信息学院)
AI总结 本文针对非凸上层、强凸下层的双层优化问题,建立了条件数依赖性的下界,揭示了双层与极小极大优化在条件数依赖上的首次可证明差距。
Comments v4 is a merge with v3 (Chen and Zhang) and https://arxiv.org/abs/2511.19656 (Ji, ICML 2026)
Argus:面向长程推理的通用智能体运行时
机构 * Microsoft(微软公司) ; Shanghai Jiao Tong University(上海交通大学) ; Fudan University(复旦大学) ; Nanjing University(南京大学) ; Tsinghua University(清华大学) ; The University of Hong Kong(香港大学) ; Peking University(北京大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Donghua University(东华大学)
AI总结 Argus是面向长程推理的通用智能体运行时,通过多角色协作与自进化,在多个基准测试中表现优于同类方法,还完成了实际应用任务并产出结构化轨迹。
ActiveFly-Bench:将具身问答与视觉-语言-动作对齐用于空中具身感知
机构 * Tsinghua University(清华大学) ; Manifold AI(流形人工智能)
AI总结 介绍用于无人机具身感知的ActiveFly-Bench基准测试,它分解主动感知为三个层次任务,收集数据集,开发集成视觉语言推理与细粒度控制的ActiveFly智能体,实验表明当前无人机智能体有困难,该基准成为具身空中智能新测试平台。
UI-MOPD:用于持续GUI智能体学习的多平台策略蒸馏
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Xiaomi(小米) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Zhejiang University(浙江大学) ; Peng Cheng Laboratory(鹏城实验室)
AI总结 针对构建多平台GUI智能体的挑战,构建高质量数据集Uni-GUI,提出UI-MOPD方法,通过多教师策略蒸馏实现持续学习,动态选教师并转移行为先验,实验证明其能平衡跨平台能力保留与新平台适应。
Comments Technical report. 27 pages, 7 figures, 7 tables
Embodied.cpp:面向异构机器人的具身AI模型可移植推理运行时
机构 * Southeast University(东南大学) ; Nanjing University(南京大学) ; Microsoft Research(微软研究院) ; Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR))
AI总结 提出Embodied.cpp,一个基于C++的可移植推理运行时,通过五层架构支持多速率执行、延迟优先融合推理和可扩展接口,在异构机器人上高效部署VLA和世界动作模型。
Comments 18 pages, 2 figures, Project website: https://github.com/SEU-PAISys/Embodied.cpp
DRIFT: 基于难度路由的自我蒸馏与节奏门控探索及成功缓冲训练
机构 * Tsinghua University(清华大学) ; ENS Paris-Saclay(巴黎-萨克雷大学) ; Beike Language and Intelligence(贝克语言与智能)
AI总结 提出DRIFT框架,通过难度路由和节奏门控动态分配自蒸馏与强化学习信号,结合成功缓冲和两阶段课程学习,提升大模型在复杂推理任务中的自我进化稳定性,在五个基准上平均得分79.5%,超越GRPO和SDPO。
READER: 基于提取表示的鲁棒证据作者身份解码
机构 * National University of Singapore(新加坡国立大学) ; Xidian University(西安电子科技大学) ; Tsinghua University(清华大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
AI总结 针对黑盒LLM来源识别问题,提出READER框架,通过冻结代理LLM读取隐藏作者证据,利用贝叶斯证据累积实现多查询归因,在Agent500数据集上显著优于基线方法。
SearchSwarm:面向长周期深度研究的代理LLM委托智能
机构 * Tsinghua University(清华大学) ; Peking University(北京大学) ; Ant Group(蚂蚁集团) ; Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)
AI总结 提出SearchSwarm框架,通过监督微调将任务分解与委托决策内化到模型权重中,在BrowseComp和BrowseComp-ZH上取得同规模最佳性能。
基准测试LLM作为裁判在长文本输出评估中的应用
机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) ; University of Science and Technology Beijing(北京科技大学)
AI总结 提出LongJudgeBench基准,系统评估LLM裁判在长文本输出评估中的可靠性,发现当前模型存在显著可靠性差距。