Internalize the Temperature: On-Policy Self-Distillation as Policy Reheater for Reinforcement Learning
内化温度:面向强化学习的同策略自蒸馏作为策略加热器
机构 * Tsinghua University(清华大学)
AI总结 提出温度缩放同策略自蒸馏(TS-OPSD),通过将温度探索效应内化到模型参数中,缓解强化学习中的熵崩溃问题,无需外部教师或额外推理成本。
高校专区
内化温度:面向强化学习的同策略自蒸馏作为策略加热器
机构 * Tsinghua University(清华大学)
AI总结 提出温度缩放同策略自蒸馏(TS-OPSD),通过将温度探索效应内化到模型参数中,缓解强化学习中的熵崩溃问题,无需外部教师或额外推理成本。
何处精炼,何时停止:通过潜在差异重新思考高效视觉自回归生成中的冗余
机构 * University of Science and Technology of China(中国科学技术大学) ; Tsinghua University(清华大学)
AI总结 提出基于潜在差异(Latent Discrepancy)的无训练剪枝框架LD-Pruning,通过解码无关区域选择和自适应无条件分支跳过,在视觉自回归模型中实现高达2.35倍加速并保持生成质量。
LithoGRPO: 通过GRPO强化流匹配的快速逆向光刻
机构 * University of Science and Technology of China(中国科学技术大学) ; Tsinghua University(清华大学)
AI总结 提出LithoGRPO框架,结合流匹配与GRPO强化学习微调,利用物理奖励函数优化掩模,实现高效逆向光刻,性能优于现有方法。
Comments ICML 2026
一种用于定量扩散MRI的物理信息基础模型
机构 * School of Biomedical Engineering, Tsinghua University(清华大学生物医学工程系) ; Oxford Centre for Integrative Neuroimaging, FMRIB, Nuffield Department of Clinical Neurosciences, University of Oxford(牛津大学整合神经影像中心、FMRIB、临床神经科学系) ; Department of Radiology, West China Second University Hospital, Sichuan University(四川大学华西第二医院放射科) ; School of Biomedical Engineering and the Institute of Medical Robotics, Shanghai Jiaotong University(上海交通大学生物医学工程学院和医学机器人研究院) ; Department of Radiology, Institution of Radiology and Medical Imaging, West China Hospital, Sichuan University(四川大学华西医院放射科、放射医学与影像研究所) ; Department of Radiology and Biomedical Imaging, University of California San Francisco(加州大学旧金山分校放射科和生物医学影像系) ; Department of Psychiatry and Behavioral Sciences, Stanford University School of Medicine(斯坦福大学医学院精神病学与行为科学系)
AI总结 提出物理信息生成微结构网络(PIGMENT),通过零样本适应实现从稀疏数据中恢复可靠的定量扩散MRI参数映射。
CoilDrop-MRI:基于线圈丢弃的自监督物理引导MRI重建
机构 * School of Biomedical Engineering, Tsinghua Medicine, Tsinghua University(清华大学生物医学工程系) ; Oxford Centre for Integrative Neuroimaging, FMRIB, Nuffield Department of Clinical Neurosciences, University of Oxford(牛津大学整合神经影像中心) ; Department of Radiology & Biomedical Imaging, University of California San Francisco(加州大学旧金山分校放射科与生物医学成像系)
AI总结 提出CoilDrop-MRI方法,通过在线圈维度进行丢弃并作为自监督训练目标,结合图像域和k空间域展开架构,实现无需全采样数据的并行MRI重建,在多站点、多场强、多模态数据集上性能优于现有自监督方法。
从人类视频到机器人操作:基于人类中心数据的可扩展视觉-语言-动作学习综述
机构 * Tsinghua University(清华大学) ; HKUST(香港科技大学) ; Xi’an Jiaotong University(西安交通大学) ; Fudan University(复旦大学) ; Microsoft Research Asia(微软亚洲研究院) ; Peking University(北京大学) ; Microsoft Zurich Project(微软苏黎世实验室)
AI总结 本文综述了如何将丰富的人类视频转化为视觉-语言-动作(VLA)模型的有效知识,分类了四种方法(潜在动作表示、预测世界模型、显式2D监督、显式3D重建),并指出了结构化非结构化视频、跨具身和视角的动作映射、以及评估协议设计三大挑战。
Comments Accepted to IJCAI 2026 Survey Track. Project page: https://aaronfengzy.github.io/HumanCentricToVLA-Survey/
测试时深度思考以探索隐式规则
机构 * Renmin University of China(中国人民大学) ; Department of Statistics and Data Science, Tsinghua University(清华大学统计与数据科学系) ; School of Computer Science and Engineering, UESTC(UESTC计算机科学与工程学院) ; Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) ; School of Mathematical Sciences, Nankai University(南开大学数学科学学院) ; Whiting School, Johns Hopkins University(约翰斯·霍普金斯大学惠特林学院) ; School of Artificial Intelligence, Shanghai Jiaotong University(上海交通大学人工智能学院)
AI总结 针对智能体在隐式规则环境中失败的问题,提出TTExplore框架,通过训练专用模型Exp-Thinker进行测试时推理,平均提升基线性能14-19点。
Mix-MoE:通过混合专家混合提升大语言模型的多语言机器翻译
机构 * School of Software, Tsinghua University(清华大学软件学院) ; College of Intelligence and Computing, Tianjin University(天津大学智能与计算学院)
AI总结 提出Mix-MoE框架,通过将MoE层分为语言模型专家和机器翻译专家,并利用傅里叶变换增强路由机制,解决大语言模型在多语言机器翻译微调中的参数干扰问题。
Comments Accepted by TASLP
PBT-Bench:基于属性测试的AI智能体基准
机构 * Tsinghua University(清华大学) ; University of Washington(华盛顿大学) ; Beneficial AI Foundation(有益人工智能基金会)
AI总结 提出PBT-Bench基准,包含100个基于属性测试的问题,用于评估AI智能体从文档中推导语义不变量并生成输入策略的能力。
Co-Fusion4D:面向鲁棒3D目标检测的时空协同融合
机构 * Tsinghua University(清华大学)
AI总结 提出Co-Fusion4D框架,通过当前帧主导-历史帧互补机制和双注意力融合模块,解决BEV检测器中跨帧时空不一致问题,在nuScenes上达到74.9% mAP和75.6% NDS。
Causal Forcing++:用于实时交互式视频生成的可扩展少步自回归扩散蒸馏
机构 * Tsinghua University(清华大学) ; ShengShu(盛数) ; Renmin University of China(中国人民大学)
AI总结 提出Causal Forcing++框架,通过因果一致性蒸馏(causal CD)实现帧级1-2步自回归扩散蒸馏,在降低延迟和训练成本的同时提升视频生成质量。
打破双重瓶颈:将统一多模态模型演化为自适应交错视觉推理器
机构 * Tsinghua University(清华大学)
AI总结 针对统一多模态模型在理解与生成之间的鸿沟导致的注意力纠缠和视觉细化瓶颈,提出一种自适应切换生成策略的框架,通过分层数据流水线和两阶段训练(SFT+RL)提升X2I任务性能。
Comments Accepted by ICML 2026
Render-of-Thought: 将文本思维链渲染为图像以进行视觉潜在推理
机构 * Tencent BAC(腾讯BAC) ; Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学) ; School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) ; School of Mathematics and Statistics, University of Glasgow(格拉斯哥大学数学与统计学学院)
AI总结 提出Render-of-Thought框架,通过将思维链的文本步骤渲染为图像,利用视觉语言模型的视觉编码器进行语义对齐,实现3-4倍令牌压缩和推理加速,同时保持竞争性能。
Comments Accepted by ACL 2026 Main Conference
Safe-FedLLM:深入探究联邦大语言模型的安全性
机构 * Hainan University(海南大学) ; Tsinghua University(清华大学) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 本文提出Safe-FedLLM,一种基于探针的防御框架,通过三级防御(步骤级、客户端级和阴影级)利用轻量级分类器区分恶意与良性LoRA更新,以增强联邦大语言模型对恶意客户端的鲁棒性。
进退维谷:大型语言模型中伦理推理与安全对齐之间的张力
机构 * Department of Computer Science and Technology, Institute for AI, BNRist, Tsinghua University(计算机科学与技术系,人工智能研究院,BNRist,清华大学) ; IDG/McGovern Institute for Brain Research, Tsinghua University(IDG/麦克戈文脑科学研究院,清华大学) ; Chinese Institute for Brain Research (CIBR)(中国脑科学研究院(CIBR)) ; Shanghai Jiao Tong University(上海交通大学) ; ByteDance(字节跳动)
AI总结 本文提出TRIAL多轮红队方法,通过将有害请求嵌入伦理框架来利用模型伦理推理能力,并引入ERR防御框架(分层有害门控LoRA架构)以区分工具性回应与解释性回应,实现鲁棒防御。
AffordGen: 通过可供性对应生成多样化演示以实现通用物体操作
机构 * Shanghai Qi Zhi Institute(上海启智研究院) ; Tsinghua University(清华大学) ; Fudan University(复旦大学) ; UC Berkeley(伯克利大学)
AI总结 提出AffordGen框架,利用3D生成模型和视觉基础模型在大规模3D网格上的语义对应生成多样化操作轨迹,训练鲁棒的闭环视觉运动策略,实现零样本泛化到未见物体。
参数化社会身份注入与多样化在舆论模拟中的应用
机构 * DCST, Tsinghua University(清华大学信息科技系) ; Quancheng Laboratory(泉城实验室) ; Tsinghua University(清华大学) ; Shandong China(山东中国)
AI总结 针对大语言模型在舆论模拟中社会多样性不足的问题,提出参数化社会身份注入(PSII)框架,通过向中间隐藏状态注入显式参数化的人口属性与价值取向表示,显著提升分布保真度与多样性。
Comments Accepted to KDD 2026 Research Track. Project page: https://github.com/halsayxi/PSII
AgentProcessBench:诊断工具使用代理的步骤级过程质量
机构 * Renmin University of China(中国人民大学) ; Beijing Jiaotong University(北京交通大学) ; Shanghai Jiao Tong University(上海交通大学) ; Tsinghua University(清华大学)
AI总结 提出AgentProcessBench基准,通过三元标注方案和错误传播规则评估工具增强轨迹中的步骤级有效性,揭示当前模型在区分中立与错误动作方面的挑战,并证明过程信号对结果监督的补充价值。
SmartThinker: 渐进式思维链长度校准以实现高效的大语言模型推理
机构 * Tsinghua University(清华大学)
AI总结 针对大型推理模型输出冗余问题,提出基于GRPO的渐进式CoT长度校准方法SmartThinker,通过动态估计最优长度和调节长度奖励系数,在压缩响应长度同时提升准确率。
Comments Accepted by ICML 2026, 18 pages, 13 figures
从陌生到熟悉:通过梯度偏差检测大型语言模型中的预训练数据
机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, Beihang University(北京未来区块链与隐私计算先进创新中心,北京航空航天大学) ; School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) ; Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)
AI总结 提出GDS方法,通过分析目标样本的梯度偏差分数(包括更新幅度、位置和神经元激活集中度)来区分预训练成员与非成员数据,实现高效且跨数据集迁移的预训练数据检测。
Comments 17 pages, 8 figures
Code2Math:你的代码智能体能否通过探索有效演化数学问题?
机构 * Hong Kong University of Science and Technology(香港科技大学) ; Tsinghua University(清华大学) ; Zhejiang University(浙江大学) ; Nanjing Tech University(南京工业大学) ; Shanghai Jiao Tong University(上海交通大学) ; University of Michigan(密歇根大学) ; Independent Researcher(独立研究者)
AI总结 本文提出一个多智能体框架,利用代码智能体通过探索将现有数学问题自主演化为更复杂、更困难的变体,并验证其可解性和难度提升。
Comments 38 pages
REAL: 通过推理枢轴对齐解决知识密集型视觉问答中的知识冲突
机构 * University of Science and Technology of China(中国科学技术大学) ; Tsinghua University(清华大学)
AI总结 提出REAL框架,通过推理枢轴对齐和引导解码,解决知识密集型视觉问答中因开放域检索引起的知识冲突问题。
Comments Accepted by ICML 2026
超越模型库检索:编织知识以掌握细粒度神经网络设计
机构 * National University of Singapore(新加坡国立大学) ; Tsinghua University(清华大学) ; University of Science and Technology of China(中国科学技术大学)
AI总结 提出M-DESIGN框架,通过构建编辑效应证据图并采用自适应检索与预测任务规划器,在严格预算下高效发现近最优细粒度架构修改路径,在33个案例中26个达到搜索空间最佳性能。
Comments Accepted at ICML 2026. Title changed from "Beyond Model Base Selection: Weaving Knowledge to Master Fine-grained Neural Network Design" to "Beyond Model Base Retrieval: Weaving Knowledge to Master Fine-grained Neural Network Design"
ChatUMM: 面向对话式交错生成的鲁棒上下文追踪
机构 * Tsinghua University(清华大学) ; Tencent Hunyuan Project lead(腾讯文心一言项目负责人)
AI总结 提出ChatUMM,一种通过交错多轮训练策略和系统化对话数据合成流水线实现鲁棒上下文追踪的对话式统一多模态模型,在视觉理解和指令引导编辑基准上达到开源模型最优性能。
Comments ChatUMM Project
Fast-SAM3D: 更快地将图像中的任何物体三维化
机构 * University of Science and Technology of China(中国科学技术大学) ; Tsinghua University(清华大学)
AI总结 提出Fast-SAM3D,一种无需训练的三维重建加速框架,通过多级异构性感知机制(模态感知步骤缓存、联合时空令牌雕刻、频谱感知令牌聚合)实现高达2.67倍端到端加速且保真度损失极小。
Comments Accepted by ICML 2026
从人类偏好中学习查询特定评分标准用于DeepResearch报告生成
机构 * Tencent(腾讯) ; Fudan University(复旦大学) ; Tsinghua University(清华大学)
AI总结 提出一种通过强化学习训练查询特定评分标准生成器的流水线,以解决DeepResearch长报告生成中缺乏可验证奖励信号的问题,并在人类偏好测试和下游任务中取得显著性能提升。
MulFeRL:在多轮循环中利用语言反馈增强强化学习
机构 * Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系,北京,中国) ; Quancheng Laboratory(千晨实验室)
AI总结 针对强化学习中标量奖励稀疏且缺乏信息的问题,提出MulFeRL框架,通过多轮语言反馈引导失败样本的再生、进度信用分配和结构化反馈注入,提升模型推理性能。
APB-V: 通过序列并行感知的近似注意力加速长视频理解
机构 * NLP Group, DCST, IAI, BNRIST, Tsinghua University, Beijing, China(清华大学北京校区自然语言处理组、国防科技大学、人工智能研究院、北京理工大学、清华大学) ; Department of CS&T, Central South University, Changsha, China(中南大学计算机与技术系,长沙,中国) ; BUPT, Beijing, China(北京邮电大学,北京,中国) ; Pattern Recognition Center, WeChat AI, Tencent Inc.(腾讯公司微信人工智能研究院)
AI总结 提出APB-V,一种序列并行框架,通过分布式近似注意力在多GPU上加速长视频推理,显著提升速度且不损失性能。
Comments ACL 2026 main
寻找关键:通过演化索引锚定上下文知识进行迭代检索
机构 * School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) ; Department of Computer Science and Technology, Institute for AI, Tsinghua University, China(清华大学人工智能研究院计算机科学与技术系) ; Beijing National Research Center for Information Science and Technology, China(北京信息科学与技术国家研究中心) ; School of Computer Science, Beijing University of Posts and Telecommunications, China(北京邮电大学计算机学院)
AI总结 提出KAIR框架,通过迭代检索中动态更新的知识索引锚定关键证据,引导大语言模型在多跳问答中有效推理并缓解噪声干扰。
VLM4VLA:重新审视视觉-语言-动作模型中的视觉-语言模型
机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) ; Qwen Team, Alibaba Inc.(阿里巴巴公司Qwen团队)
AI总结 本文通过VLM4VLA最小适配管道,系统研究视觉-语言模型(VLM)的选择和能力如何影响下游视觉-语言-动作(VLA)策略性能,发现VLM通用能力无法预测下游任务表现,且视觉模块是性能瓶颈。