MemPO: Self-Memory Policy Optimization for Long-Horizon Agents
MemPO:面向长时程智能体的自我记忆策略优化
机构 * Tsinghua University(清华大学) ; Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室)
AI总结 提出自我记忆策略优化算法(MemPO),让智能体自主管理记忆,通过基于记忆有效性的信用分配机制选择性保留关键信息,在减少令牌消耗的同时提升任务性能。
高校专区
MemPO:面向长时程智能体的自我记忆策略优化
机构 * Tsinghua University(清华大学) ; Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室)
AI总结 提出自我记忆策略优化算法(MemPO),让智能体自主管理记忆,通过基于记忆有效性的信用分配机制选择性保留关键信息,在减少令牌消耗的同时提升任务性能。
All-Mem: 通过动态拓扑演化实现智能体终身记忆
机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(北京未来区块链与隐私计算先进创新中心) ; Beihang University(北航) ; Tsinghua University(清华大学) ; Chalmers University of Technology(查尔姆斯理工大学)
AI总结 提出All-Mem框架,通过在线/离线结合的非破坏性拓扑结构记忆库,解决终身交互代理中历史增长导致的检索冗余和噪声问题,在LoCoMo和LongMemEval-s上提升检索与问答性能。
全脑连接组图模型实现果蝇全身运动控制
机构 * Tsinghua University(清华大学)
AI总结 提出Fly-connectomic Graph Model,将果蝇全脑连接组作为图结构控制器,通过深度强化学习驱动仿真果蝇运动,在多种任务中表现稳定且样本效率优于基线。
SDFLoRA: 面向异构客户隐私保护微调的选择性解耦联邦LoRA
机构 * Zhejiang University(浙江大学) ; Tsinghua University(清华大学)
AI总结 提出SDFLoRA,通过将LoRA更新解耦为共享和私有组件,仅聚合共享部分并注入差分隐私噪声,解决联邦微调中的秩异构和数据异构问题,提升隐私-效用权衡。
CLAP: 从人类视频中学习视觉-语言-动作模型的对比潜在动作预训练
机构 * Tsinghua University(清华大学) ; Astribot ; University of Hong Kong(香港大学) ; Massachusetts Institute of Technology(麻省理工学院)
AI总结 提出CLAP框架,通过对比学习将人类视频与机器人动作词汇对齐,利用伪标签训练VLA模型,实现从人类视频到机器人执行的有效技能迁移。
Comments The code is available at: https://github.com/LinShan-Bin/OpenCLAP
CoIRL-AD:面向自动驾驶的潜在世界模型中的协作-竞争模仿-强化学习
机构 * University of Science and Technology of China(中国科学技术大学) ; Tsinghua University(清华大学)
AI总结 提出CoIRL-AD框架,通过解耦模仿学习与强化学习、利用潜在世界模型进行长时程奖励估计以及引入竞争机制,在离线训练中提升自动驾驶的鲁棒性,尤其在跨城市泛化和长尾场景中表现优异。
Comments 19 pages, 22 figures, ICML 2026
多扫点云上的高效3D感知与Gumbel空间修剪
机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) ; Department of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) ; Noah’s Ark Lab(诺亚实验室) ; Department of Computer Science, University of Hong Kong(香港大学计算机科学系)
AI总结 本文研究了户外环境中点云感知问题,通过累积多个连续点云扫描以提高感知精度,引入Gumbel空间修剪层有效减少冗余点,提升3D感知性能。
映射11个大语言模型中的地缘政治偏见:美中紧张局势的双语、双框架分析
机构 * Department of Industrial Engineering, Tsinghua University(清华大学工业工程系) ; School of Social Sciences, Tsinghua University(清华大学社会科学部) ; Department of Industrial Engineering, Federal University of Rio de Janeiro(里约热内卢联邦大学工业工程系)
AI总结 通过引入调查心理测量学的平衡键控方法,量化11个模型在2种语言中对美中地缘政治问题的立场,发现开发者起源、查询语言和议题领域是三个近等加性因素,所有模型在中文下更亲华。
Comments 37 pages, 6 main-text figures, 12 supplementary figures, 5 supplementary tables; supplementary information included
弥合差距:通过文本到NoSQL翻译实现NoSQL数据库的自然语言查询
机构 * University of Science and Technology of China(中国科学技术大学) ; Tsinghua University(清华大学) ; The University of Hong Kong(香港大学)
AI总结 本文研究Text-to-NoSQL任务,提出TEND基准和SAG求解器,用于将自然语言请求翻译为MongoDB聚合管道,验证了无模式文档推理的独特挑战。
GePBench:评估多模态大语言模型的基础几何感知能力
机构 * University of Science and Technology of China(中国科学技术大学) ; Tsinghua University(清华大学)
AI总结 提出GePBench基准,系统评估多模态大语言模型的几何形状识别与空间关系感知能力,发现现有模型存在显著缺陷,而基于该基准训练可提升下游任务性能。
基于知识蒸馏和分布导师的LLM隐私数据增强方法用于医学文本分类
机构 * College of Science, National University of Defense Technology, Hunan, China(国防科技大学科学学院,湖南,中国) ; College of Computer, National University of Defense Technology, Hunan, China(国防科技大学计算机学院,湖南,中国) ; The CoAI Group, DCST, BNRist, Tsinghua University, Beijing(清华大学北京人工智能研究院,北京)
AI总结 本文提出一种结合LLM和知识蒸馏的隐私数据增强方法,通过分布导师控制生成分布,提升医学文本分类的隐私保护与性能。
Journal ref Neural Networks, Vol. 199, 2026, 108668
CORA: 通过一致性导向的推理对齐分析与弥合多模态RLVR中的思考-答案差距
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Wuhan University(武汉大学) ; Tsinghua University(清华大学) ; Tianjin University(天津大学)
AI总结 本文分析多模态RLVR中思考与答案的语义不一致问题,提出CORA方法,通过轻量级一致性奖励模型引入语义一致性,并采用混合奖励优势分裂稳定优化,提升推理忠实度。
Comments Submitted to EMNLP 2026
HPSv3++:跨扩散模型能力全谱系扩展奖励模型
机构 * Tsinghua University(清华大学) ; JD Explore Academy(京东探索研究院) ; Peking University(北京大学) ; Zhejiang University(浙江大学)
AI总结 提出HPSv3++奖励模型框架,通过双维度偏好数据集HPDv3++和两阶段训练(正交梯度投影+无监督引导),提升对各类T2I模型及RL迭代的偏好预测能力,在多个基准上达到最优。
假设冗余下的发现:发现瓶颈的几何理论
机构 * School of Economics and Management, Tsinghua University(清华大学经济管理学院) ; Platform & Content Group, Tencent(腾讯平台与内容事业群)
AI总结 提出搜索压缩假说,通过谱压缩、正交逃逸和残差信号对齐三个几何条件解释混合发现系统的优势,实验表明仅新颖性不足,需预测对齐。
Comments 23 pages, 1 figure, 27 tables
解耦混合专家用于参数化知识注入
机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)
AI总结 提出解耦混合专家(DMoE)架构,将外部知识转化为独立可更新的专家模块,通过轻量级不确定性感知路由器在基础模型知识不足时激活相关专家,实现参数级知识增强,在知识密集型基准上优于检索和适配器基线。
编码器胜者无法可靠跨VLA骨干网络规模迁移:一种冻结骨干嫁接诊断方法
机构 * Tsinghua University(清华大学)
AI总结 提出冻结骨干嫁接诊断方法,发现小规模VLA上最优的视觉编码器在大规模骨干上并非最优,编码器选择依赖于骨干网络规模。
Comments 23 pages, 5 figures, 8 tables
使用置信度分数和强化学习修正语音情感描述子的可解释且可信的语音情感识别
机构 * The Chinese University of Hong Kong(香港中文大学) ; Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) ; National Research Council Canada(加拿大国家研究委员会) ; Tsinghua University(清华大学)
AI总结 提出基于置信度分数和强化学习的在线语音情感描述子修正方法,用于后训练语音情感识别系统,在IEMOCAP和MELD上分别取得2.9%和3.3%的绝对性能提升。
Comments Accepted by Interspeech2026
DLawBench: 通过多轮法律咨询评估大语言模型
机构 * University of Pittsburgh(匹兹堡大学) ; Alibaba Group(阿里巴巴集团) ; University of Waterloo(滑铁卢大学) ; Shandong University(山东大学) ; Skylenage ; China University of Political Science and Law(中国政法大学) ; Qwen Team, Alibaba Group(阿里巴巴集团Qwen团队) ; Fordham University(福特汉姆大学) ; Shanghai Jiao Tong University(上海交通大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Tsinghua University(清华大学)
AI总结 提出DLawBench基准,通过模拟四种客户类型(合作、依赖、退缩、对抗)的多轮对话,评估大语言模型在真实法律咨询中的交互能力。
Comments 37 pages, 8 figures, 26 tables. Code and data: https://github.com/SKYLENAGE-AI/DLawBench
基于移动NPU的高效设备端扩散大语言模型推理
机构 * Tsinghua University(清华大学) ; Beihang University(北京航空航天大学)
AI总结 提出首个NPU感知推理框架Diffusion-LLM-on-NPU,通过多块推测解码、双路径渐进修正和交换优化内存运行时,在移动设备上加速扩散大语言模型推理,相比CPU基线实现17-42倍延迟降低。
EurekAgent:自主科学发现中,智能体环境工程即一切
机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) ; Zhipu AI(智谱AI)
AI总结 提出环境工程框架EurekAgent,通过权限、工件、预算和人机交互四维工程设计,在数学、内核工程和机器学习任务上取得新最优结果,总API成本低于11美元。
学习者能动性与自主性的大规模语义映射揭示测量与生成式AI研究的忽视
机构 * School of Education, Tsinghua University(清华大学教育学院) ; Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理与认知科学系) ; Institute of Education, University College London(伦敦大学教育学院)
AI总结 通过语义分析管道从超过14,000篇出版物中提取定义和量表项目,发现学习者能动性与自主性包含任务、个人和社会文化三个维度,现有量表忽视社会文化维度,且生成式AI研究过度聚焦学习调节与控制。
Comments 45 pages, 12 figures, 1 table, including appendices, added funding information
X-Loco:通过协同策略蒸馏实现通用人形机器人运动控制
机构 * University of Science and Technology of China(中国科学技术大学) ; Tsinghua University(清华大学)
AI总结 提出X-Loco框架,通过协同策略蒸馏和案例自适应专家选择,训练视觉通用人形运动策略,整合直立行走、全身协调和跌倒恢复,仅基于速度指令,无需参考运动。
Comments Accepted by RSS 2026. Project page: https://x-loco-humanoid.github.io/
Reward-SQL:通过逐步执行感知推理和过程监督奖励提升Text-to-SQL
机构 * Renmin University of China(中国人民大学) ; Tsinghua University(清华大学) ; Alibaba Cloud Computing(阿里云 computing)
AI总结 针对强化学习在Text-to-SQL中缺乏逐步执行感知推理和过程级奖励的问题,提出CoCTE框架和Reward-SQL方法,通过中间视图验证、结构化CTE及过程奖励模型,显著提升复杂查询的准确性和可解释性。
MaskWAM:统一掩码提示与预测的世界-动作模型
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Tencent Robotics X(腾讯机器人X实验室) ; Tsinghua University(清华大学)
AI总结 提出MaskWAM,通过统一掩码输入与预测的混合Transformer架构,解决世界-动作模型的空间瓶颈,提升策略泛化能力,在LIBERO等任务上显著优于基线。
MaxProof: 通过生成-验证器强化学习与群体级测试时扩展实现数学证明规模化
机构 * MiniMax ; The Chinese University of Hong Kong(香港中文大学) ; Fudan University(复旦大学) ; Peking University(北京大学) ; Tsinghua University(清华大学)
AI总结 提出MaxProof框架,结合生成-验证器强化学习与群体级测试时扩展,在MiniMax-M3系列上实现竞赛级数学证明,在IMO 2025和USAMO 2026上超越人类金牌阈值。
OmniDirector: 无需配对数据的通用多镜头相机克隆
机构 * Kuaishou Technology(快手科技) ; Tsinghua University(清华大学) ; University of Science and Technology of China(中国科学技术大学)
AI总结 提出OmniDirector框架,通过将相机参数编码为网格运动视频,并利用百万级配对数据训练,实现无需交叉配对数据的多镜头相机运动克隆,具备卓越的控制性能。
Comments 12 pages, 8 figures
NTS-CoT: 基于思维链推理减轻大模型新闻时间线摘要中的幻觉
机构 * Central South University(中南大学) ; Tsinghua University(清华大学) ; Nanjing University(南京大学) ; Suzhou Aerospace Information Research Institute(苏州空天信息研究院) ; McGill University(麦吉尔大学)
AI总结 针对大模型在新闻时间线摘要中产生内容不忠实和信息遗漏两类幻觉,提出NTS-CoT框架,通过元素思维链、日期选择和因果思维链三个模块有效缓解幻觉,在三个基准上超越现有方法。
TetherCache: 基于门控召回与可信对齐的自回归长视频生成稳定性方法
机构 * Tsinghua University(清华大学) ; D-INFK, ETH Zürich(苏黎世联邦理工学院计算机科学系)
AI总结 提出TetherCache,一种无需训练、即插即用的缓存管理策略,通过门控召回(GRAB)和可信对齐编辑(TAME)缓解自回归视频扩散模型中的上下文漂移,实现稳定长视频生成。
Comments 17 pages, 8 figures
基于骨架的人体动作识别中保质量不可察觉对抗攻击
机构 * Durham University(杜伦大学) ; Tsinghua University(清华大学) ; Beihang University(北京航空航天大学) ; Zhongguancun Laboratory(中关村实验室)
AI总结 针对骨架动作识别的对抗攻击常引入噪声扰动降低动作质量,本文提出一种基于分布的对抗攻击方法,通过最小化经验风险与真实风险的差距来保持动作质量,并设计新指标评估自然性,实验表明该方法在攻击成功率和动作质量上均优于现有方法。
EmbodiSteer: 用关节空间引导的具身无关视觉运动策略实现零样本跨具身部署
机构 * Department of Automation, Tsinghua University(清华大学自动化系) ; Beijing Key Laboratory of Embodied Intelligence Systems(北京具身智能系统重点实验室) ; Institute for Embodied Intelligence and Robotics, Tsinghua University(清华大学具身智能与机器人研究所)
AI总结 提出EmbodiSteer框架,通过前向运动学和雅可比更新将推理时的扩散采样提升到目标机器人关节空间,并加入全身碰撞感知引导,实现零样本、具身感知的部署,在模拟和物理机器人上显著降低碰撞率并提高任务成功率。
Comments The first two authors contribute equally