Guiding LLM Post-training Data Engineering with Model Internals from Sparse Autoencoders
利用稀疏自编码器的模型内部状态指导LLM后训练数据工程
机构 * Tsinghua University(清华大学)
AI总结 提出SAERL框架,通过稀疏自编码器提取模型内部状态,建模数据多样性、难度和质量,用于强化学习数据工程,提升准确率并减少训练步数。
高校专区
利用稀疏自编码器的模型内部状态指导LLM后训练数据工程
机构 * Tsinghua University(清华大学)
AI总结 提出SAERL框架,通过稀疏自编码器提取模型内部状态,建模数据多样性、难度和质量,用于强化学习数据工程,提升准确率并减少训练步数。
FinHarness:面向金融LLM代理的内联生命周期安全约束框架
机构 * Peking University(北京大学) ; Nanyang Technological University(南洋理工大学) ; Tsinghua University(清华大学) ; University of Science and Technology of China(中国科学技术大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Soochow University(苏州大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; University of Leeds(利兹大学) ; Fullive Innovation (Beijing) AI Technology Co., Ltd.(全维创新(北京)人工智能科技有限公司) ; Beihang University(北京航空航天大学) ; University of Illinois Chicago(伊利诺伊大学芝加哥分校)
AI总结 针对金融LLM代理在阻止提示诱导的未授权操作与批准合法多步骤业务流程之间的冲突,提出FinHarness内联安全约束框架,通过查询监控、工具监控和级联模块实现逐步骤风险评估与自适应验证,显著降低攻击成功率并保持良性批准率。
在噪声中学习行动:通过噪声环境增强智能体鲁棒性
机构 * National University of Singapore(国立新加坡大学) ; Meituan(美团) ; Tsinghua University(清华大学) ; Tianjin University(天津大学) ; University of Science and Technology of China(中国科学技术大学)
AI总结 提出NoisyAgent框架,通过在训练中引入用户噪声和工具噪声,提升智能体在真实世界噪声环境下的鲁棒性和泛化能力。
IPIBench: 在连续流下评估多模态大模型的交互式主动智能
机构 * College of AI, Tsinghua University(清华大学人工智能学院) ; ByteDance(字节跳动)
AI总结 提出IPIBench基准,用于评估多模态大模型在流式视频场景中的交互式主动智能,并设计IPI-Agent框架以改善主动触发和交互协调。
ExTax:基于说服、情感和叙事角色分类学的可解释虚假信息检测
机构 * Peking University(北京大学) ; University of Science and Technology of China(中国科学技术大学) ; North China University of Science and Technology(华北理工大学) ; Tsinghua University(清华大学) ; Nanjing University of Aeronautics and Astronautics(南京航空航天大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Soochow University(苏州大学) ; Beihang University(北航) ; University of Illinois Chicago(伊利诺伊大学芝加哥分校)
AI总结 提出ExTax框架,统一说服修辞、情感操纵和叙事角色为17维分类空间,通过熵驱动动态标签平滑和多头注意力融合分类与上下文特征,实现可解释的虚假信息检测,在跨域基准上达到0.8456 Macro F1。
黑盒成员推断攻击:针对图像生成模型的预训练数据
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Tsinghua University(清华大学)
AI总结 提出一种基于跨模态数据扰动的黑盒成员推断攻击框架SD-MIA,通过分析扩散模型对目标图像和扰动文本指令的去噪过程,有效检测预训练数据中的成员关系。
Comments 13 pages, 9 figures; CVPR 2026 camera-ready
学习适应SFT数据以实现更好的推理泛化
机构 * Beihang University(北京航空航天大学) ; Tsinghua University(清华大学) ; Nanyang Technological University(南洋理工大学) ; Hangzhou International Innovation Institute(杭州国际创新研究院) ; Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(北京未来区块链与隐私计算高级创新中心)
AI总结 提出DART方法,通过强化学习训练映射器将分布不匹配的SFT数据转化为模型自适应的监督,提升推理泛化能力。
ContextGuard: 语言模型中上下文学习的结构化自我审计
机构 * Peking University(北京大学) ; SCUT(上海交通大学) ; Tsinghua University(清华大学)
AI总结 提出ContextGuard框架,通过结构化自我审计机制使大语言模型在复杂上下文任务中忠实遵循所有上下文约束,包括外围、持久和格式敏感要求。
比率方差正则化策略优化
机构 * Department of Foundation Model, 2012 Labs, Huawei(华为基础模型部门,2012实验室) ; Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(上海智能自主系统研究院,同济大学) ; Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) ; College of Intelligence and Computing, Tianjin University(天津大学智能与计算学院)
AI总结 提出R²VPO方法,通过约束策略比率方差作为信任区域的局部近似,替代启发式裁剪,在LLM和机器人控制任务中提升性能与样本效率。
面向CUDA内核生成中自进化LLM代理的反馈到计划决策
机构 * Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) ; Beijing National Research Center for Information Science and Technology, Beijing, China(北京信息科学国家研究中心)
AI总结 通过轨迹冻结和选择性反馈注入,提出CUDAnalyst框架以归因规划决策对反馈组件的贡献,揭示显式规划仅在反馈对齐时有效,且有效规划源于结构化多反馈交互。
Comments ICML 2026 accpeted, camera-ready in progress
EgoProx: 在认知层级上评估多模态大语言模型的自我中心3D邻近推理能力
机构 * College of AI, Tsinghua University(清华大学人工智能学院) ; ByteDance(字节跳动) ; State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)
AI总结 提出EgoProx基准,通过认知链任务和基于智能体的数据引擎,评估多模态大语言模型在自我中心3D邻近推理中的表现,发现模型虽具备空间知识但难以有效利用。
Comments Accepted to CVPR 2026
神经流算子可以逼近任意算子:抽象框架与通用逼近
机构 * Qiuzhen College, Tsinghua University(清华大学齐遵学院) ; Yau Mathematical Sciences Center, Tsinghua University(清华大学尤 mathematical sciences center) ; Norwegian Research Center(挪威研究中心)
AI总结 提出神经流抽象框架,涵盖组合与分离结构的连续深度模型,证明其在有限维和无限维空间中的通用逼近性质,并通过时间离散化统一残差与普通架构。
利用工具实现可扩展的具身能力
机构 * Huazhong University of Science and Technology(华中科技大学) ; Hebei University of Technology(河北工业大学) ; Tianjin University(天津大学) ; Lehigh University(莱特大学) ; College of AI, Tsinghua University(清华大学人工智能学院)
AI总结 提出一种通过外部化能力为工具、并借助标准化协议ETP动态调用工具的方法,在仿真和真实平台上平均提升具身性能31%-36%,但揭示了工具使用在认知和感知方面增益显著而在执行方面有限。
Comments 51 pages, 20 figures,
MedVol-R1:基于奖励驱动的证据基础用于体积推理分割
机构 * School of Biological Science and Medical Engineering, Beihang University, Beijing, China(生物科学与医学工程学院,北京航空航天大学) ; Center for Information and Computer Science, School of Science for Open and Environmental Systems, Graduate School of Science and Technology, Keio University, Kanagawa, Japan(信息与计算机科学中心,开放与环境系统科学学院,科技研究生学校,东京大学,神奈川,日本) ; Bytedance Inc., China(字节跳动公司,中国) ; Tsinghua University, Beijing, China(清华大学,北京,中国)
AI总结 提出MedVol-R1框架,通过强化学习将临床推理解耦为可验证的2D证据锚点,再传播为3D掩膜,实现体积推理分割,在多个基准上达到最优性能。
LongAV-Compass:面向分钟级音视频生成在T2AV、I2AV和V2AV上的统一评估
机构 * Peking University(北京大学) ; Kling Team(Kling团队) ; Nanjing University(南京大学) ; SJTU(上海交通大学) ; HKUST(GZ)(香港科技大学(广州)) ; Shanghai AI Lab(上海人工智能实验室) ; Nanyang Technological University(南洋理工大学) ; CASIA(中国科学院自动化所) ; Tsinghua University(清华大学)
AI总结 针对现有评估协议局限于短片段的问题,提出LongAV-Compass基准,通过284个测试用例和统一评估框架,系统评估分钟级音视频生成在文本、图像、视频条件下的质量、一致性和对齐。
RepoMirage: 通过扰动探测代码智能体的仓库上下文推理
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Tsinghua University(清华大学) ; Tencent(腾讯)
AI总结 提出RepoMirage评估套件,通过语义保持的仓库级扰动和扩展任务,揭示代码智能体在仓库上下文推理中的显著缺陷,并基于结构优先的原型工作流RepoAnchor展示改进。
ParkingWorld: 基于3DGS仿真中纠正性经验的端到端自主泊车强化学习
机构 * Tsinghua University(清华大学) ; Shanghai Jiaotong University(上海交通大学)
AI总结 提出一种基于纠正性经验的样本高效强化学习框架(CIL-SERL),在逼真的3D高斯溅射(3DGS)仿真器中训练端到端自主泊车策略,通过多级回放缓冲区机制提高成功率、效率和安全性。
Comments 9 pages(including 1 page of Appendix), 6 figures. Will be submitted to RA-L 2026
动态对抗微调重组拒绝几何结构
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Inner Mongolia University of Technology(内蒙古科技大学) ; Tsinghua University(清华大学) ; Shandong University(山东大学)
AI总结 研究动态对抗微调如何改变安全对齐语言模型中拒绝行为的因果控制载体(低维子空间),发现R2D2沿鲁棒性-效用前沿重组几何结构但未建立自适应鲁棒性。
MiVE:用于参考引导视频编辑的多尺度视觉语言特征
机构 * MT Lab, Meitu Inc., Beijing 100083, China(美图实验室,美图公司,北京100083,中国) ; Department of Computer Science and Technology, BNRist, IDG/McGovern Institute for Brain Research, Tsinghua University, Beijing 100084, China(计算机科学与技术系,BNRist,IDG/麦戈文脑研究学院,清华大学,北京100084,中国) ; Beijing University of Posts(北京邮电大学)
AI总结 提出MiVE框架,利用VLM的多尺度层次特征(早期层保留空间细节,深层编码全局语义)统一到自注意力扩散Transformer中,解决模态间隙和细粒度信息丢失问题,在参考引导视频编辑中达到SOTA性能。
Comments ICML 2026
Grokking 还是 Glitching?低精度如何驱动 Slingshot 损失尖峰
机构 * Tsinghua University(清华大学) ; The University of Tokyo(东京大学)
AI总结 本文证明深度神经网络训练中的 Slingshot 损失尖峰现象是由浮点精度限制导致的数值特征膨胀(NFI)机制引起的,并解释了参数范数快速增长和梯度消失等现象。
Comments 28 pages, 13 figures; ICML 2026 Workshop on High-dimensional Learning Dynamics (Spotlight)
Continuum: 基于KV缓存生存时间的高效鲁棒多轮LLM智能体调度
机构 * UC Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学) ; Tensormesh(Tensormesh公司) ; Tsinghua University(清华大学)
AI总结 针对多轮智能体工作负载中工具调用导致KV缓存无法跨轮重用的问题,提出Continuum系统,通过引入KV缓存的生存时间(TTL)机制,在GPU内存中选择性固定缓存,权衡重算/重载成本与排队延迟,实现作业完成时间平均提升8倍以上。
DirectFisheye-GS: 在三维高斯泼溅中通过跨视图联合优化实现原生鱼眼输入
机构 * BNRist, Tsinghua University(北京理工大学,清华大学) ; Beihang University(北航) ; JD.com, Beijing, China(京东(北京,中国)) ; Shanghai AI Lab(上海人工智能实验室)
AI总结 针对鱼眼相机输入导致的信息丢失和细节模糊问题,提出将鱼眼相机模型集成到3DGS框架中,并引入基于特征重叠的跨视图联合优化策略,实现无需预处理的原生鱼眼图像训练,提升重建质量。
Comments CVPR 2026 Highlight; Fix NSFC ID
分离跳跃链接与$R$-探针:解耦特征聚合与梯度传播用于MLLM OCR
机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, PKU-Anker LLM Lab, Beijing Key Laboratory of Software and Hardware Cooperative Artificial Intelligence Systems, Peking University, Beijing, China(多媒体信息处理国家重点实验室,计算机科学学院,PKU-Anker LLM实验室,软件与硬件协同人工智能系统北京重点实验室,北京大学,北京,中国) ; Tsinghua University, Beijing, China(清华大学,北京,中国) ; Baidu Inc, Beijing, China(百度公司,北京,中国)
AI总结 针对多模态大语言模型在OCR任务中因梯度干扰导致细粒度视觉信息丢失的问题,提出分离跳跃链接(Detached Skip-Links)以解耦前向特征聚合与反向梯度传播,并引入$R$-探针($R$-Probe)诊断视觉令牌的可重构性,从而提升OCR及通用多模态任务性能。
Comments Accepted by ICML 2026. Ziye Yuan and Ruchang Yao contributed equally to this work (co-first authors, listed in random order)
GS-CLIP: 基于几何感知提示与协同视图表示学习的零样本3D异常检测
机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) ; Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)
AI总结 提出GS-CLIP框架,通过几何感知提示和协同视图表示学习,在零样本设置下有效检测3D点云中的几何异常。
Comments Accepted by CVPR 2026
MVISTA-4D: 用于机器人操作的一致性视图4D世界模型与测试时动作推理
机构 * MMLab, The Chinese University of Hong Kong, Hong Kong SAR(香港理工大学MMLab,香港中文大学,香港特别行政区) ; The Hong Kong University of Science(香港理工大学) ; The University of Hong Kong(香港大学) ; Tsinghua University(清华大学)
AI总结 提出一种基于世界模型的4D场景生成方法,通过多视图RGBD预测和测试时动作优化,实现几何一致的4D动态预测与机器人操作。
Journal ref International Conference on Machine Learning 2026
基于双层优化稀疏查询的GraphLLM扩展
机构 * Huazhong University of Science and Technology(华中科技大学) ; Tsinghua University(清华大学)
AI总结 提出BOSQ框架,通过自适应稀疏查询策略选择性调用LLM,在降低计算成本的同时保持或提升图节点任务性能。
基于高斯VAE的无训练向量量化
机构 * AIR, Tsinghua University(清华空气研究院) ; CST, Tsinghua University(清华计算机研究所) ; University of Cambridge(剑桥大学)
AI总结 提出Gaussian Quant (GQ)方法,通过约束训练高斯VAE并直接转换为VQ-VAE,无需额外训练,在UNet和ViT架构上优于现有VQ-VAE。
可调质心的重力驱动滑翔机的智能导航
机构 * AML, Department of Engineering Mechanics, Tsinghua University, 100084 Beijing, China(AML,工程力学系,清华大学,北京100084,中国) ; Department of Physics, Gothenburg University, 41296 Gothenburg, Sweden(物理系,哥德堡大学,瑞典41296哥德堡)
AI总结 通过直接数值模拟和强化学习,研究了可调质心的紧凑型滑翔机在粘性流体中沉降时的最优导航策略,揭示了粒子雷诺数对策略选择的关键影响。
Comments 13 pages, 8 figures
Journal ref Phys. Rev. Research 7 (2025) 043200
V2V3D:用于光场显微镜的视图到视图去噪三维重建
机构 * Tsinghua University, Beijing 100084, China(清华大学,北京100084,中国) ; Shanghai AI Laboratory, China(上海人工智能实验室,中国)
AI总结 提出无监督视图到视图框架V2V3D,联合优化图像去噪和三维重建,利用噪声独立性实现噪声到噪声去噪,并设计基于波动光学的特征对齐技术恢复高频细节,在效率和性能上超越现有方法。
Comments CVPR 2025; New version: Fix NSFC ID
MotionPRO:探索压力在人体动作捕捉及其它领域中的作用
机构 * School of Electronic Science and Engineering, Nanjing University, Nanjing, China(南京大学电子科学与技术学院,南京,中国) ; Key Laboratory of Optoelectronic Devices and Systems with Extreme Performances of MOE, Nanjing University, Nanjing, China(南京大学极端性能光电器件与系统MOE重点实验室,南京,中国) ; BNRist, Tsinghua University, Beijing, China(清华大学北京研究院,北京,中国)
AI总结 本文通过构建包含压力、RGB和光学传感器的大规模人体动作捕捉数据集MotionPRO,并设计基于压力信号或融合压力与RGB的位姿和轨迹估计网络,证明了压力信号在提高物理合理性、全局轨迹精度以及驱动虚拟人和人形机器人方面的必要性和有效性。
Comments fix NSFC ID