Towards Sustainable Investment Policies Informed by Opponent Shaping
面向可持续投资政策的对手塑造驱动的投资策略
机构 * University of Montreal and MILA(蒙特利尔大学和MILA)
AI总结 本文提出通过对手塑造算法优化投资策略,以解决可持续发展中的社会困境问题。
Comments Accepted at ICLR 2026
期刊&会议
International Conference on Learning Representations · 会议 · Machine Learning
面向可持续投资政策的对手塑造驱动的投资策略
机构 * University of Montreal and MILA(蒙特利尔大学和MILA)
AI总结 本文提出通过对手塑造算法优化投资策略,以解决可持续发展中的社会困境问题。
Comments Accepted at ICLR 2026
温度作为元策略:LLM强化学习中的自适应温度
机构 * Tsinghua University(清华大学) ; Microsoft Research Asia(微软亚洲研究院)
AI总结 TAMPO通过将温度控制转化为可学习的元策略,实现了LLM强化学习中的自适应探索,优于固定或启发式温度方法。
Comments Accepted at ICLR 2026. 10 pages (main text) + supplementary material, 6 figures
AutoFigure: 生成和细化可用于出版的科学插图
AI总结 AutoFigure通过代理框架自动生成高质量科学插图,基于长篇科学文本并优于基线方法,实现结构和视觉的双重完善。
Comments Accepted at the ICLR 2026
EGG-SR: 通过等式图将符号等价性嵌入符号回归
机构 * University of Texas at El Paso(德克萨斯理工大学) ; Purdue University(普渡大学)
AI总结 EGG-SR通过引入等式图模块,将符号等价性整合到符号回归方法中,以减少搜索空间并提升学习效率。
Comments Camera-ready version accepted for ICLR 2026
为何原型崩溃:诊断并防止原型自监督学习中的部分崩溃
机构 * University of Oslo(奥斯陆大学) ; UiT The Arctic University of Norway(挪威北极大学) ; University of Campinas(坎皮纳斯大学)
AI总结 本文提出了一种解耦训练策略,通过独立优化编码器和原型,防止原型自监督学习中的部分崩溃问题,从而提升表示多样性和下游任务性能。
Comments Published in ICLR 2026. Code: https://dsb-ifi.github.com/proto-decoupling
人类行为图谱:统一心理与社会行为理解的基准测试
AI总结 人类行为图谱通过统一基准和三种模型提升心理与社会行为理解的多模态性能
Comments Accepted to ICLR 2026 Main Conference
一个演示就足够:从单个演示中利用LLM进行规划域推导
机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) ; McGill University(麦吉尔大学)
AI总结 PDDLLM通过结合LLM推理与物理模拟,从单个演示中自动推导规划域,提升长时间跨度任务规划的自动化与可靠性。
Comments Published as a conference paper at ICLR 2026
PASER:基于后训练数据选择的高效剪枝大语言模型恢复
机构 * City University of Hong Kong(香港城市大学) ; Huawei Noah’s Ark Lab(华为诺亚实验室)
AI总结 PASER通过后训练数据选择方法高效恢复剪枝大语言模型的能力,显著优于传统基线方法。
Comments Accepted by ICLR 2026
自适应去偏Tsallis熵用于测试时适应
机构 * Nanjing University of Science and Technology(南京理工大学) ; Alibaba Cloud(阿里云) ; University of Texas at Dallas(德克萨斯大学达拉斯分校) ; University of Sussex(Sussex 大学) ; Hong Kong University of Science and Technology(香港科学与技术大学)
AI总结 本文提出自适应去偏Tsallis熵用于测试时适应,通过引入非广延参数q来缓解预训练数据偏差,提升模型适应性能。
Comments Accepted for publication at ICLR 2026; 24 pages; 5 figures
统一稳定优化与参考正则化在RLHF中
机构 * Sydney AI Centre, The University of Sydney(悉尼人工智能中心、悉尼大学) ; CSIRO, Data61(澳大利亚联邦科学与工业研究组织、Data61) ; University of New South Wales(新南威尔士大学)
AI总结 本文提出了一种统一正则化方法,通过平衡防止奖励黑客和稳定策略更新,提升RLHF的对齐性能和稳定性。
Comments ICLR 2026
Ctrl&Shift: 视觉生成中高质量的几何感知物体操控
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Southern University of Science and Technology(南方科技大学) ; The Chinese University of Hong Kong(香港中文大学) ; IntelliFusion Inc.(IntelliFusion公司) ; University of Electronic Science and Technology of China(电子科技大学) ; NVIDIA
AI总结 Ctrl&Shift通过端到端扩散框架实现高质量几何感知物体操控,无需显式3D建模,兼顾细粒度控制与现实泛化能力。
Comments Accepted at ICLR 2026
基于鲁棒价值因子化的分布鲁棒合作多智能体强化学习
AI总结 本文提出分布鲁棒IGM原则,改进价值因子化架构以提升鲁棒性和现实适应性。
Comments ICLR 2026
基于神经高斯力场的学习物理 grounded 4D 动力学
机构 * Institute for AI, Peking University(北京大学人工智能研究院) ; School of Psychological and Cognitive Sciences, Peking University(北京大学心理学与认知科学学院) ; School of EECS, Peking University(北京大学电子工程学院) ; Department of Automation, Tsinghua University(清华大学自动化系) ; Yuanpei College, Peking University(北京大学元培学院) ; State Key Lab of General AI, Peking University(北京大学通用人工智能国家重点实验室) ; Beijing Key Laboratory of Behavior and Mental Health, Peking University(北京行为与心理健康重点实验室)
AI总结 本文提出神经高斯力场(NGFF),通过结合3D高斯感知与物理动力学建模,从多视角RGB输入生成交互式、物理真实的4D视频,提升视频预测的物理 grounded 性。
Comments 43 pages, ICLR 2026
基于希尔伯特曲线的稀疏局部注意机制
AI总结 本文提出基于希尔伯特曲线的局部注意力机制,通过重新排列图像token以提高块稀疏性,从而提升2D局部注意力的效率。
Comments Accepted at ICLR 2026
时间序列预测中的测试时高效预训练模型组合
机构 * Dalle Molle Institute for Artificial Intelligence (IDSIA) - USI/SUPSI, Switzerland(达摩信息技术研究所(IDSIA)- USI/SUPSI,瑞士) ; Amazon Web Services(亚马逊网络服务)
AI总结 本文提出了一种测试时高效的预训练模型组合方法,通过集成或模型选择在时间序列预测中实现高性能,且计算成本更低。
Comments Accepted as an ICLR 2026 conference paper
通过分布鲁棒学习与分层模糊集缓解虚假相关性
机构 * Pohang University of Science and Technology(釜山科学技术大学)
AI总结 本文提出一种分层扩展的Group DRO方法,通过扩大模糊集以提高对组间和组内分布偏移的鲁棒性,并在少数群体分布偏移模拟中取得优异表现。
Comments Accepted at ICLR 2026
通过专家(去)激活引导MoE LLMs
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; Adobe Research(Adobe研究) ; CIS, LMU Munich(慕尼黑大学计算机学院) ; Munich Center for Machine Learning(慕尼黑机器学习中心)
AI总结 SteerMoE通过激活或去激活特定专家,在不微调的情况下提升LLM的安全性和忠实性,同时揭示了MoE模型的潜在漏洞。
Comments ICLR 2026
使用零阶优化进行量化神经网络微调
机构 * Hong Kong Baptist University(香港 Baptist 大学) ; Nanjing University of Science and Technology(南京理工大学)
AI总结 本文提出量化零阶优化方法,通过消除梯度和优化器状态来减少内存使用,实现4位LLM在24GB GPU上高效微调。
Comments Accepted by ICLR 2026
将策略翻译为语言:通过生成连续归一化流生成的奖励用于LLM解释
机构 * AIPD, Tencent, Shenzhen, China(腾讯人工智能与大数据研究院,深圳,中国) ; IIIS, Tsinghua University, Beijing, China(清华大学人工智能学院,北京,中国) ; EE, Tsinghua University, Beijing, China(清华大学电子工程系,北京,中国) ; CS, Tsinghua University, Beijing, China(清华大学计算机系,北京,中国) ; SEAS, Harvard University, Cambridge, USA(哈佛大学工程学院,剑桥,美国) ; College of AI, Tsinghua University, Beijing, China(清华大学人工智能学院,北京,中国)
AI总结 本文提出通过生成连续归一化流生成奖励,训练LLM生成更准确、逻辑严谨且认知负担更低的解释,以提升智能体与人类共存的可靠性。
Comments Accepted by ICLR 2026
通过Co-T训练从已学技能中实现组合泛化:一种理论和结构分析用于推理
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) ; Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究重点实验室) ; Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(下一代智能搜索与推荐工程研究中心,教育部) ; Tianjin University of Science and Technology(天津科技大学) ; Beijing Institute of Technology(北京理工大学)
AI总结 本文通过理论和结构分析揭示CoT训练通过组合学习技能提升模型推理泛化能力的核心机制。
Comments ICLR 2026
SCRAPL: 用于机器学习的随机路径散射变换
机构 * Centre for Digital Music, Queen Mary University of London, UK(伦敦女王玛丽大学数字音乐中心) ; Nantes Université, École Centrale Nantes, CNRS, LS2N, UMR 6004, France(南特大学、南特中央理工学院、法国国家科学研究中心、LS2N、UMR 6004)
AI总结 SCRAPL通过随机路径散射变换提高多变量散射变换的计算效率,应用于无监督声音匹配和神经网络训练优化。
Comments Accepted to ICLR 2026. Code, audio samples, and Python package provided at https://christhetree.github.io/scrapl/
FastFlow: 通过多臂老虎机推断加速生成流匹配模型
机构 * Indian Institute of Technology Bombay(印度理工学院孟买分校) ; Amazon(亚马逊)
AI总结 FastFlow通过多臂老虎机推断方法,实现流匹配模型生成过程的加速,同时保持生成质量。
Comments Accepted at International Conference on Learning Representations (ICLR) 2026
分割、调和、然后征服:利用多模态语言模型解决多商品流问题
机构 * Zhejiang University(浙江大学) ; Hefei University of Technology(合肥工业大学) ; Co-corresponding authors(共同通讯作者)
AI总结 Pram利用多模态语言模型解决多商品流问题,通过分解和调和子问题实现高效优化,性能接近线性规划求解器且运行时间显著降低。
Comments Published as a conference paper at ICLR 2026
FeatureBench: 评估代理编码在复杂特性开发中的性能
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Huawei Technologies Co., Ltd(华为技术有限公司)
AI总结 FeatureBench通过基于执行的评估协议和自动化任务收集方法,评估代理在复杂特征开发中的性能,发现先进模型在该基准上表现有限,为提升代理编码能力提供新机会。
Comments Accepted by ICLR 2026
调节循环神经网络训练中的预热阶段以提高其性能
机构 * Leibniz University Hannover(莱比锡大学汉诺威分校)
AI总结 本文通过调节循环神经网络训练中的预热阶段,显著提高了其在时间序列任务中的性能,减少了预测误差超过60%。
Comments Published as a conference paper at ICLR 2026, https://openreview.net/forum?id=jwkdKpioHJ
ResWorld: 用于端到端自动驾驶的时序残差世界模型
机构 * State Key Laboratory of Virtual Reality Technology and Systems, Beihang University, Beijing, China(虚拟现实技术与系统国家重点实验室,北京航空航天大学) ; Zhongguancun Laboratory, Beijing, China(中关村实验室) ; Beijing Jingwei Hirain Technologies Co., Inc.(北京京wei Hirain科技有限公司) ; Hangzhou Innovation Institute, Beihang University, Hangzhou, China(杭州创新研究院,北京航空航天大学)
AI总结 ResWorld通过时序残差世界模型和未来引导轨迹细化模块,提升端到端自动驾驶的规划性能。
Comments ICLR 2026
通过全局时间检索增强多变量时间序列预测
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; Shandong University(山东大学)
AI总结 GTR通过引入全局时间检索模块,有效提升多变量时间序列预测的长期周期性建模能力,实现高效且通用的预测性能改进。
Comments ICLR 2026
超越置信度:生成模型推理的节奏
机构 * Harbin Institute of Technology(哈尔滨工业大学)
AI总结 本文提出δ_TC B度量标准,用于评估生成模型在预测稳定性方面的鲁棒性,揭示了传统度量在上下文学习中的不足,并为提升模型稳定性提供新方法。
Comments ICLR 2026
Splat和Distill:通过馈送式3D重建增强教师模型以实现3D感知的蒸馏
机构 * Department of Computer Science(计算机科学系) ; The Hebrew University of Jerusalem(耶路撒冷希伯来大学)
AI总结 Splat和Distill通过馈送式3D重建增强教师模型,提升2D VFMs的3D意识和语义丰富性。
Comments Accepted to ICLR 2026
Journal ref ICLR 2026
可扩展的时空SE(3)扩散用于长时间尺度蛋白质动力学
机构 * Georgia Institute of Technology(佐治亚理工学院)
AI总结 STAR-MD通过联合时空建模实现高效蛋白质动态模拟,显著提升构象覆盖和动态保真度,适用于微秒级长时间尺度生成。
Comments 49 pages, 28 figures. Accepted by ICLR 2026. Project page: https://bytedance-seed.github.io/ConfRover/starmd