AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning
AReaL: 一种用于语言推理的大规模异步强化学习系统
机构 * IIIS, Tsinghua University(清华信息学院) ; Ant Group(蚂蚁集团) ; HKUST(香港科技大学)
AI总结 AReaL通过异步机制提升大语言模型推理训练效率,实现GPU利用率显著提升
高校专区
AReaL: 一种用于语言推理的大规模异步强化学习系统
机构 * IIIS, Tsinghua University(清华信息学院) ; Ant Group(蚂蚁集团) ; HKUST(香港科技大学)
AI总结 AReaL通过异步机制提升大语言模型推理训练效率,实现GPU利用率显著提升
OneTwoVLA:一种具有自适应推理能力的统一视觉-语言-动作模型
机构 * Tsinghua University(清华大学) ; Shanghai Qi Zhi Institute(上海启智研究院)
AI总结 OneTwoVLA通过自适应推理机制实现视觉-语言-动作统一,提升机器人在复杂任务中的规划、交互与执行能力。
MoMa:一种用于材料属性预测的模块化深度学习框架
机构 * Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学) ; Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学) ; School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) ; Department of Chemical Engineering, Tsinghua University(化学工程系,清华大学)
AI总结 MoMa提出了一种模块化深度学习框架,通过训练专门模块并自适应组合以提升材料属性预测的性能,实验表明其在多个数据集上表现优异。
Comments Accepted to ICLR 2026
大语言模型中上下文长度扩展的内在熵
机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) ; Carnegie Mellon University(卡内基梅隆大学) ; CPHOS ; University of Washington(华盛顿大学)
AI总结 本研究提出'内在熵'理论,通过实验验证长上下文对语言模型的影响,揭示训练数据集大小与最佳上下文长度的关系。
Comments 36 pages, 18 figures, 2 tables
Thoth:中期训练使LLM具备时间序列理解能力
机构 * School of Software, BNRist, Tsinghua University(软件学院、BNRist、清华大学)
AI总结 Thoth通过中期训练和Book-of-Thoth语料库,使LLM具备时间序列理解能力,并在多个基准测试中表现优异。
UD-SfPNet: 一种用于水下散射消除的偏振形状从偏振网络用于3D法线重建
机构 * School of Mechanical Engineering and Automation, Fuzhou University(福州大学机械与自动化学院) ; The Research Institute of Highway, Ministry of Transport(交通部高速公路研究 institute) ; The State Key Laboratory of Precision Measurement Technology and Instruments, Department of Precision Instruments, Tsinghua University(清华大学精密测量技术与仪器国家重点实验室)
AI总结 UD-SfPNet通过结合偏振成像的散射消除与形状从偏振技术,实现了水下3D法线重建的高精度与高效性。
神经潜在任意拉格朗日-欧拉网格用于流固耦合
机构 * School of Computer Science, Peking University(北京大学计算机科学学院) ; Global Innovation Exchange, Tsinghua University(清华大学全球创新交流中心) ; School of Electrical and Computer Science, University of Southampton(南安普顿大学电子与计算机科学学院)
AI总结 Fisale通过多尺度潜在ALE网格和分区耦合模块,实现复杂双向流固耦合问题的高效建模与学习。
Comments Proceedings of the 14th International Conference on Learning Representations
K^2-Agent: 为分层移动设备控制共进化知什么和知如何
机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) ; Huawei Noah’s Ark Lab(华为诺亚实验室) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
AI总结 K2-Agent通过分层框架共进化声明性与程序性知识,提升复杂移动设备任务的规划与执行能力,实现76.1%的成功率和跨任务的强泛化能力。
适应数据到模型:面向领域共享时间序列基础模型的自适应转换优化
机构 * School of Software, BNRist, Tsinghua University(软件学院、BNRist、清华大学)
AI总结 TATO通过自适应转换优化提升领域适应的预测性能,显著降低MSE并提高效率。
Comments Published as a conference paper at ICLR 2026
TraceSIR: 一个用于结构化分析和报告代理执行轨迹的多代理框架
机构 * Beijing Institute of Technology(北京理工大学) ; Zhipu AI(智谱AI) ; Tsinghua University(清华大学) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 TraceSIR通过多代理框架结构化分析和报告代理执行轨迹,提升故障诊断和根本原因分析效率。
TGM-VLA:基于任务的混合学习用于高效且鲁棒的机器人操作
机构 * Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院) ; The National and Local Co-Build Humanoid Robotics Innovation Center(国家级与地方共建人形机器人创新中心)
AI总结 TGM-VLA通过优化关键帧采样策略和引入颜色反转投影模块,提升机器人操作任务的效率和鲁棒性。
Comments 8 pages, 7 figures
LOGIGEN: 逻辑驱动的可验证代理任务生成
机构 * Baidu Inc.(百度公司) ; Tsinghua University(清华大学)
AI总结 LOGIGEN通过逻辑驱动和验证训练生成可验证的复杂任务,提升代理在复杂环境中的任务完成率。
DenoiseFlow:面向可靠LLM代理工作流的不确定性感知去噪
机构 * School of Computer Science, Peking University(北京大学计算机科学学院) ; School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院) ; SKLCCSE, School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) ; Tsinghua University(清华大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Key Laboratory of High Confidence Software Technologies(PKU), MOE(北京大学高可信软件技术重点实验室) ; Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) ; National Engineering Research Center for Software Engineering, Peking University(软件工程国家工程研究中心)
AI总结 DenoiseFlow通过闭环框架实现多步推理的不确定性感知去噪,提升LLM代理工作流的可靠性与效率。
Jano:具有早期阶段收敛意识的自适应扩散生成
机构 * Shanghai Jiaotong University(上海交通大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Tsinghua University(清华大学)
AI总结 Jano通过自适应区域感知生成方法,提升扩散模型的生成效率,实现2.0至2.4倍的加速,同时保持生成质量。
TENG-BC:用于具有通用边界条件的神经PDE求解器的统一时间演进自然梯度
机构 * School of Mathematical Sciences, Peking University, Beijing, China(北京大学数学科学学院) ; Department of Physics, Tsinghua University, Beijing, China(清华大学物理系) ; Institute of Advanced Study, Tsinghua University, Beijing, China(清华大学advanced study研究所)
AI总结 TENG-BC通过统一时间演进自然梯度方法,实现对具有通用边界条件的神经PDE求解器的高精度求解,优于传统方法和PINN基线。
常深神经网络中的平滑适应性:通过平滑激活函数实现最优速率
机构 * Department of Mathematical Sciences, Tsinghua University(清华大学数学科学系) ; School of Mathematical Sciences, Peking University(北京大学数学科学学院) ; Center for Machine Learning Research, Peking University(北京大学机器学习研究中心) ; AI for Science Institute, Beijing(北京人工智能科学研究院)
AI总结 本研究证明,使用平滑激活函数的常深神经网络能够通过增加宽度实现最优的平滑适应性,而非平滑激活函数如ReLU则受限于深度增长。
Echo:通过音频交错推理实现高级音频理解
机构 * IIE, Chinese Academy of Sciences(中国科学院信息工程研究所) ; Zhejiang University(浙江大学) ; ByteDance China(字节跳动中国) ; VCIP & TMCC & DISSec, College of Computer Science, Nankai University(VCIP与TMCC与DISSec,南开大学计算机学院) ; School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院) ; Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理学与认知科学系) ; University of Chinese Academy of Sciences(中国科学院大学)
AI总结 Echo通过音频交错推理方法,提升音频理解能力,在基准测试中表现出色。
Comments Accepted by ICLR 2026
UltraViCo: 突破视频扩散变换器的 extrapolation 限制
机构 * Dept. of Comp. Sci. & Tech., BNRist Center, THU-Bosch ML Center, Tsinghua University(清华大学计算机科学与技术系,BNRist中心,THU-Bosch机器学习中心,清华大学) ; ShengShu(盛书) ; Gaoling School of Artificial Intelligence, Renmin University of China(北京理工大学人工智能学院,中国人民大学) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Princeton University(普林斯顿大学)
AI总结 UltraViCo通过抑制超出训练窗口的token注意力,突破视频扩散变换器的extrapolation限制,提升泛化能力和性能。
Comments ICLR2026. Project page: https://thu-ml.github.io/UltraViCo.github.io/
鲁棒可微碰撞检测用于通用物体
机构 * Peking University(北京大学) ; Galbot ; Tsinghua University(清华大学) ; The Hong Kong Polytechnic University(香港理工大学)
AI总结 本文提出了一种鲁棒且高效的可微碰撞检测框架,支持凸和凹物体,通过基于距离的随机平滑、自适应采样和等价梯度传输提升梯度计算的鲁棒性和信息性,并在复杂网格上实现了显著的性能提升。
Ctrl-World: 一个可控制的生成世界模型用于机器人操作
机构 * Stanford University(斯坦福大学) ; Tsinghua University(清华大学)
AI总结 本文提出了一种可控的多视图世界模型,用于评估和改进通用机器人策略的指令遵循能力,通过姿态条件化记忆检索和帧级动作条件化实现长时一致性和精确动作控制,提升策略成功率44.7%。
Comments 17 pages
Doctor-R1:通过经验代理强化学习掌握临床探究
机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University(计算机科学与技术系,人工智能研究院,清华大学) ; College of AI, Tsinghua University(人工智能学院,清华大学) ; Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学)
AI总结 Doctor-R1通过经验代理强化学习提升临床决策与患者咨询能力,实现更高效的医疗咨询和决策支持。
PoLi-RL: 一种用于条件语义文本相似度的点到列表强化学习框架
机构 * Tsinghua University(清华大学) ; Tencent Youtu Lab(腾讯优图实验室)
AI总结 PoLi-RL通过点到列表强化学习框架,解决条件语义文本相似度中的优化难题,实现Spearman相关系数达48.18,为复杂条件判断任务提供新范式。
交叉熵缩放定律中什么因素具有可扩展性?
机构 * Tsinghua University(清华大学)
AI总结 本文通过分解交叉熵为误差熵、自我对齐和置信度三个部分,揭示了误差熵是唯一遵循幂律缩放的因素,从而解释了交叉熵缩放定律在小规模有效但在大尺度失效的原因。
通过纠正干预实现大推理模型的安全推理
机构 * Tsinghua University(清华大学) ; Shanghai Qi Zhi Institute(上海启智机构) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; RealAI
AI总结 本文提出IPO方法,通过干预优化提升大推理模型的安全性,显著降低有害性并保持性能。
Comments ICLR 2026
为MLLMs定制视觉情绪评估:一种开放词汇、多维且可扩展的方法
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; VCIP & TMCC & DISSec, College of Computer Science, Nankai University(南开大学计算机学院) ; Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理学与认知科学系) ; University of Chinese Academy of Sciences(中国科学院大学)
AI总结 本文提出一种开放词汇、多维且可扩展的方法,用于定制MLLMs的视觉情绪评估,通过情绪陈述判断任务和自动化流程,评估现有模型在情绪识别和上下文判断中的表现,并揭示其局限性。
Comments Accepted by ICLR 2026
AssemMate:基于图的LLM用于机器人装配辅助
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院,清华大学,深圳,中国)
AI总结 AssemMate是一种基于图的LLM,通过知识图谱问答和视觉增强策略提升机器人装配任务的精度和效率。
XISM:一种探索性和交互式的图工具,用于可视化和评估语义图模型
机构 * School of Humanities Tsinghua University(人文学院 清华大学) ; School of Environment and Society Institute of Science(环境与社会学院 科学研究院)
AI总结 XISM是一种结合数据驱动推断与专家知识的交互式工具,用于提升语义图模型的可扩展性和可解释性。
Comments Paper under review
OmniSpatial:迈向视觉语言模型的空间推理综合基准
机构 * Tsinghua University(清华大学) ; Xian Jiaotong University(西安交通大学) ; Shanghai Jiao Tong University(上海交通大学) ; Galbot ; Peking University(北京大学) ; Shanghai Qi Zhi Institute(上海启智研究院)
AI总结 OmniSpatial是一个基于认知心理学的综合性空间推理基准,通过动态推理、复杂空间逻辑等四个类别,评估视觉语言模型在空间推理上的能力与局限。
Comments ICLR 2026
SenseFlow: 为基于流的文本到图像蒸馏扩展分布匹配
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) ; SenseTime Research(商汤科技研究院) ; Vivix AI(维维克斯人工智能) ; Institute for AI Industry Research, Tsinghua University(清华大学人工智能产业研究所)
AI总结 SenseFlow通过引入隐式分布对齐和段内指导,解决大规模基于流的文本到图像模型蒸馏中的收敛问题,提升蒸馏效果。
Comments Published as a conference paper at ICLR 2026
JALMBench: 对音频语言模型中越权攻击的基准测试
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; State Key Laboratory of Internet Architecture, Tsinghua University(清华大学互联网架构国家重点实验室) ; University of North Texas(北卡罗来纳州立大学) ; University of Science and Technology of China(中国科学技术大学) ; Fujian Normal University(福建师范大学) ; Nanjing University of Aeronautics and Astronautics(南京航空航天大学)
AI总结 JALMBench通过评估11,316个文本样本和245,355个音频样本,分析LALMs对越权攻击的安全性,揭示模态和架构对安全性的影响,强调需专门设计的防御方法。