Self-Distilled Agentic Reinforcement Learning
自蒸馏代理强化学习
机构 * Zhejiang University(浙江大学) ; Meituan(美团) ; Tsinghua University(清华大学)
AI总结 本文提出SDAR方法,通过将OPSD作为辅助目标并保持RL为主优化,解决多轮代理中的稳定性问题,提升性能。
高校专区
自蒸馏代理强化学习
机构 * Zhejiang University(浙江大学) ; Meituan(美团) ; Tsinghua University(清华大学)
AI总结 本文提出SDAR方法,通过将OPSD作为辅助目标并保持RL为主优化,解决多轮代理中的稳定性问题,提升性能。
Sat3DGen:从单张卫星图像生成全面的街景3D场景
机构 * LIESMARS & School of Artificial Intelligence, Wuhan University(珞珈实验室与武汉大学人工智能学院) ; EPFL(苏黎世联邦理工学院) ; HKUST(香港科技大学) ; Northeastern University(东北大学) ; Zhejiang University(浙江大学) ; Ant Group(蚂蚁集团) ; Amap, Alibaba Group(高德地图,阿里巴巴集团)
AI总结 本文提出Sat3DGen,通过几何优先方法提升从单张卫星图像生成高精度3D场景的性能,改进几何精度和真实感,并在新基准上验证其效果。
Comments ICLR 2026; code: https://github.com/qianmingduowan/Sat3DGen demo: https://huggingface.co/spaces/qian43/Sat3DGen project page: https://qianmingduowan.github.io/Sat3DGen_project_page/
诱导过度思考:基于分层遗传算法的黑盒大语言推理模型DoS攻击
机构 * The State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) ; Alibaba Group(阿里巴巴集团)
AI总结 本文提出一种基于分层遗传算法的黑盒攻击方法,通过系统扰动输入问题的逻辑结构,诱导大语言模型产生过度思考,从而引发资源耗尽攻击。
Comments Accepted at ICML 2026. Code available at: https://github.com/EndlessCao/Overthink-HGA
Journal ref Proceedings of the 43rd International Conference on Machine Learning (ICML 2026), PMLR 306, 2026
BiTrajDiff: 用于离线强化学习的双向轨迹生成扩散模型
机构 * Zhejiang University(浙江大学) ; Zhejiang Lab(浙江省实验室) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Nanyang Technological University(南洋理工大学) ; Rutgers University(罗格斯大学)
AI总结 本文提出BiTrajDiff,通过双向扩散模型生成轨迹,解决离线强化学习中数据分布偏差问题,提升数据集多样性。
天使或恶魔:探讨塑性干预对深度强化学习中后门威胁的影响
机构 * Zhejiang University(浙江大学) ; National University of Defense Technology(国防科技大学) ; Xi'an Jiaotong University(西安交通大学)
AI总结 研究通过分析14664个案例,发现仅有一种干预(SAM)加剧了后门威胁,其他干预则缓解了威胁,提出新的稳健后门注入框架和异常损失景观尖锐度作为检测指标。
Comments To appear in the Forty-Third International Conference on Machine Learning (ICML 2026), July 6-11, 2026, Seoul, South Korea
在权重空间中发现物理方向:组合神经PDE专家
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Zhejiang University(浙江大学) ; Tsinghua University(清华大学) ; Nanyang Technological University(南洋理工大学)
AI总结 本文研究了神经PDE专家在连续物理家族中多模式微调后的权重空间更新性质,提出CCM方法通过物理方向整合专家模型,提升跨物理域的预测性能。
GeRM:从物理真实到照片级的生成渲染模型
机构 * State Key Lab of CAD\&CG, Zhejiang University ; Zhejiang Lab China ; State Key Laboratory of Industrial Control Technology, Zhejiang University China ; Zhejiang University China ; Zhejiang Lab ; State Key Laboratory of Industrial Control Technology, Zhejiang University ; Zhejiang University
AI总结 GeRM是首个多模态生成渲染模型,通过学习分布转移向量场实现从物理真实到照片级的过渡,结合控制网络和多代理框架提升图像生成质量。
解耦稳定性与可塑性以实现多模态测试时适应
机构 * Zhejiang University(浙江大学)
AI总结 本文提出DASP框架,通过解耦多模态测试时适应中的稳定性与可塑性,解决现有方法在无偏模态中的负迁移和有偏模态中的灾难性遗忘问题。
Comments Accepted to CVPR 2026
超球面能量正则化的序列模型编辑
机构 * Columbia University(哥伦比亚大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Zhejiang University(浙江大学) ; University of Science and Technology of China(中国科学技术大学)
AI总结 本文提出SPHERE方法,通过超球面能量正则化提升模型在序列编辑中的稳定性与知识保留能力,实验表明其在编辑性能上优于基线方法16.41%。
Comments Accepted by ICLR 2026. The code is available at https://github.com/PlusLabNLP/SPHERE. Project page: https://www.qingyuanliu.net/sphere_projectpage/
SkillFlow: 以流程驱动的递归技能进化用于代理编排
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; National University of Singapore(新加坡国立大学) ; Nanyang Technological University(南洋理工大学) ; Zhejiang University(浙江大学)
AI总结 SkillFlow通过流程驱动的递归技能进化解决代理编排中的策略崩溃、梯度方差高和无指导技能进化问题,实现高效任务编排。
Comments 49 pages, 5 figures, 6 tables
重新思考分子OOD泛化 via 目标感知源选择
机构 * Department of Data Science and Artificial Intelligence, Monash University(墨尔本大学数据科学与人工智能系) ; College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; School of Life Sciences and Technology, Tongji University(同济大学生命科学与技术学院)
AI总结 本文提出SCOPE-BENCH和POMA框架,通过集群级分区和多源适应策略提升分子在极端OOD场景下的预测鲁棒性,实验显示SOTA模型误差显著增加,而POMA在不同架构上实现平均6.2%的改进。
SparseOIT:通过主动集方法改进Order-Independent Transparency 3DGS
机构 * Zhejiang University(浙江大学) ; Westlake University(西湖大学)
AI总结 本文提出SparseOIT,通过主动集方法利用3DGS渲染方程中稀疏变量依赖性,提升Order-Independent Transparency效果,优于现有方法并达到体积渲染方法的性能。
每帧一个令牌:重新考虑世界模型中的视觉带宽
机构 * Zhejiang University(浙江大学) ; Central South University(中南大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; Embodied Intelligence General Platform Laboratory, Chery Auto(奇瑞汽车 embodied intelligence 通用平台实验室) ; E-surfing Digital Life Technology Co., Ltd., China Telecom(亿联数字生活技术有限公司,中国电信)
AI总结 本文提出OneWM-VLA,通过自适应注意力池化将每帧视图压缩为一个语义令牌,以单一流匹配目标生成潜在流和动作轨迹,从而减少每帧视觉带宽而不影响长视界性能。