Rethinking Evaluation Paradigms in IBP-based Certified Training
重新思考基于IBP的认证训练中的评估范式
机构 * University of Freiburg(弗赖堡大学) ; ETH Zurich(苏黎世联邦理工学院)
AI总结 针对认证训练中自然精度与认证精度的权衡问题,提出基于Pareto前沿的多目标超参数优化方法,实现公平的方法间比较,并发现先前配置的欠调优现象,建立新的最优性能。
Comments ICML 2026
期刊&会议
International Conference on Machine Learning · 会议 · Machine Learning
重新思考基于IBP的认证训练中的评估范式
机构 * University of Freiburg(弗赖堡大学) ; ETH Zurich(苏黎世联邦理工学院)
AI总结 针对认证训练中自然精度与认证精度的权衡问题,提出基于Pareto前沿的多目标超参数优化方法,实现公平的方法间比较,并发现先前配置的欠调优现象,建立新的最优性能。
Comments ICML 2026
通过对齐约束缓解PINN中的梯度病理
机构 * Department of Information Science and Engineering, KTH Royal Institute of Technology, Stockholm, Sweden(信息科学与工程系,皇家理工学院,斯德哥尔摩,瑞典) ; School of Advanced Manufacturing and Robotics, Peking University, Beijing, China(先进制造与机器人学院,北京大学,北京,中国) ; School of Advanced Technology, Xi’an Jiaotong-Liverpool University, Suzhou, China(先进技术学院,西安交通大学利物浦大学,苏州,中国) ; Department of AI, School of Engineering, Westlake University, Hangzhou, China(人工智能系,工程学院,西湖大学,杭州,中国)
AI总结 针对物理信息神经网络训练中梯度冲突导致的局部最优问题,提出约束对齐损失与流形提升方法,通过重新表述零阶项为对齐约束并引入延迟因子,显著提升数值稳定性和效率。
Comments Accepted by ICML 2026
Journal ref Forty-Third International Conference on Machine Learning (ICML 2026)
尺度思考:通过自适应连续推理加速千兆像素病理图像分析
机构 * School of Computer Science(计算机科学学院) ; Technology, Xi’an Jiaotong University, Xi’an, China(技术学院,西安交通大学,西安,中国) ; Department of Transmedia Art, Xi’an Academy of Fine Arts, Xi’an, China(多媒体艺术系,西安美术学院,西安,中国) ; Department of Oncology, University of Cambridge, Cambridge, U.K.(肿瘤学系,剑桥大学,剑桥,英国) ; Language Technology Lab, University of Cambridge, Cambridge, U.K.(语言技术实验室,剑桥大学,剑桥,英国) ; Institute of High Performance Computing, Agency for Science, Technology(高性能计算研究所,科技研究局)
AI总结 提出PathCTM模型,通过动态尺度切换和注意力引导的区域剪枝实现高效连续推理,大幅减少计算开销并保持诊断性能。
Comments Accepted to ICML 2026
对比表示学习的几何力学:对齐势、熵分散和跨模态散度
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 本文通过测度论框架,在大批量极限下证明InfoNCE目标与确定性能量景观的等价性,揭示单模态与对称多模态之间的几何分岔,并指出跨模态散度项导致模态间隙。
Comments 54 Pages, ICML 2026 (Refined document aesthetics for clearer reading)
低精度softmax变换器的表达能力(摘要)链式思维
机构 * Department of Mathematics, University of Tübingen, Germany(图宾根大学数学系)
AI总结 本文研究了低精度softmax变换器在链式思维中的表达能力,通过构造三元激活和分离注意力分数的硬max变换器来模拟图灵机,从而将构造转换为等效的softmax变换器,并分析了最近提出的总结链式思维范式在模拟图灵机时的效率。
Comments Accepted to ICML 2026
无参数动态遗憾:时变移动成本、延迟反馈和记忆
机构 * University of Iowa(爱荷华大学) ; National University of Singapore(新加坡国立大学)
AI总结 本文提出一种新算法,在具有时变移动成本的在线凸优化中,首次实现了比较器自适应的动态遗憾界,并应用于延迟反馈和时变记忆问题。
Comments 28 pages; v2: ICML 2026; v3: typos + fixed document outline
VLA-Arena:一个用于基准测试视觉-语言-动作模型的开源框架
AI总结 提出VLA-Arena基准,通过三正交轴(任务结构、语言命令、视觉观察)量化任务难度,系统评估视觉-语言-动作模型的能力边界与失败模式。
Comments Accepted by ICML 2026
EvReflection:用于去除反射的事件驱动微动力学
AI总结 本文提出事件驱动反射去除网络EvReflection,利用事件信号打破反射层与透射层的歧义,结合微动力学解耦器与视差注意力矫正器,在合成和真实基准上PSNR分别提升超1.6 dB、1.2 dB,构建了首个该任务真实数据集EVR²。
Comments ICML 2026
多智能体大语言模型系统推理时并行性的两层视角
AI总结 本文提出整合两类并行性的TIPEX框架,在GAIA基准上验证推理时并行性可提升多智能体系统性能,中等难度任务从两类并行性协调中获益最多。
Comments Accepted to ICML 2026
阈下学习(Subliminal Learning, SL)是非语义知识蒸馏
AI总结 该研究探究阈下学习(SL)的机制,发现非语义权重结构是关键,引导向量可生成阈下数据,相关梯度或助力数据审计,凸显识别训练数据潜在信号的重要性。
Comments Accepted as spotlight paper for the ICML 2026 Mechanistic Interpretability Workshop
PPDL:基于大语言模型的流作为概率程序
AI总结 本文提出用于编程基于LLM的流的概率语言PPDL,可量化传播流中不确定性,无需额外代码即可尝试推理缩放技术,还通过实验及面向Rocq的定理证明智能体案例验证了其能力。
Comments Published at ICML 2026
立场:是时候针对自一致性优化大型语言模型(LLMs)了
AI总结 本文提出自一致性框架,指出LM的缺陷源于单输出对独立评估的假设,可通过一致性优化解决,为开发通用一致性LLM提供思路。
Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026), Position Paper Track
通过跨动作的高效值共享加速Q学习
机构 * Department of Computing Science, University of Alberta(阿尔伯塔大学计算机科学系) ; Alberta Machine Intelligence Institute(阿尔伯塔人工智能研究所) ; Meta
AI总结 提出均值扩展层,通过跨动作共享值和学习低范数表示来加速动作值学习,在深度Q网络和隐分位数网络上提升Atari游戏性能并减少过估计。
Comments ICML 2026 (Spotlight); Adaptive and Learning Agents workshop 2026 (Best paper runner-up)
SP-Mind: 用于空间蛋白质组学分析的自主推理智能体
机构 * Department of Computer Science, Stanford University, Stanford, USA(计算机科学系,斯坦福大学,斯坦福,美国) ; Department of Radiation Oncology, Stanford University, Stanford, USA(放射肿瘤学系,斯坦福大学,斯坦福,美国)
AI总结 提出首个自主AI智能体SP-Mind,统一空间蛋白质组学分析流程,通过自然语言查询实现端到端分析,在SP-Bench基准上达到最优性能。
Comments 24 pages, 6 figures. Accepted to ICML 2026. Equal contribution by Yucheng Yuan and Yuanfeng Ji
MotionMAR:基于稀疏观测的多尺度自回归人体运动重建
机构 * Fujian Key Laboratory of Urban Intelligent Sensing and Computing, Xiamen University(福建省城市智能感知与计算重点实验室,厦门大学) ; Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, School of Informatics, Xiamen University(多媒体可信感知与高效计算教育部重点实验室,厦门大学信息学院) ; National Institute for Data Science in Health and Medicine, Xiamen University(厦门大学健康医疗大数据国家研究院) ; ShanghaiTech University(上海科技大学)
AI总结 提出MotionMAR框架,通过多尺度自回归模型从稀疏观测中粗到细重建人体运动,在AMASS数据集上达到最先进精度。
Comments Accepted to ICML 2026
Persona-Pruner: 为角色扮演雕琢轻量级模型
机构 * Department of Artificial Intelligence, Korea University, Seoul, South Korea(韩国大学人工智能系) ; Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)
AI总结 提出Persona-Pruner框架,通过从单个描述中隔离特定角色的子网络来剪枝语言模型,在保持角色扮演性能的同时大幅降低计算成本,性能下降比最强基线减少93.8%。
Comments 25 pages; ICML 2026; Code is available at https://github.com/jsu-kim/Persona-Pruner
Dream-MPC:基于梯度与潜在想象的模型预测控制
机构 * Autonomous Intelligent Systems, Computer Science Institute VI - Intelligent Systems(自主智能系统,计算机科学研究所VI - 智能系统) ; Robotics, Center for Robotics(机器人学,机器人中心) ; the Lamarr Institute for Machine Learning(拉马尔机器学习研究所) ; Artificial Intelligence, University of Bonn, Germany(人工智能,波恩大学,德国)
AI总结 提出Dream-MPC方法,通过从展开策略生成少量候选轨迹,并利用学习的世界模型进行梯度上升优化,结合不确定性正则化和时间上的优化迭代摊销,显著提升了底层策略性能,在24个连续控制任务上优于无梯度MPC和现有基线。
Comments Accepted for International Conference on Machine Learning (ICML) 2026
可实现的贝叶斯一致性用于通用度量损失
机构 * Ben-Gurion University of the Negev(贝内-约尔大学) ; Purdue University, USA(普渡大学)
AI总结 本文研究了在可实现设定下,针对一般度量损失的学习中的强通用贝叶斯一致性,扩展了经典特征化,解决了Tsir Cohen和Kontorovich(2022)提出的问题,提出了新的组合障碍条件。
Comments 14 pages. Accepted to ICML 2026; v2: fixed abstract metadata rendering; v3: strengthened lower-bound theorem statement to almost-sure infinite risk (proof unchanged)
BioAgent Bench: 一个用于生物信息学的AI代理评估套件
机构 * Entropic
AI总结 本文提出BioAgent Bench,用于评估AI代理在常见生物信息学任务中的性能和鲁棒性。通过定制端到端任务和压力测试,发现前沿代理可完成多步骤流程,但鲁棒性测试揭示了在受控扰动下的失败模式,表明高阶流程构建不保证可靠步骤推理。
Comments ICML 2026 camera ready
当草稿进化:推测解码与在线学习的交汇
机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) ; School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) ; University of California, San Diego(加州大学圣地亚哥分校)
AI总结 本文提出OnlineSpec框架,利用交互反馈持续进化草稿模型,通过动态遗憾最小化建立在线学习性能与推测系统加速率的联系,实现24%的加速提升。
Comments ICML 2026
当AI基准测试达到平台期:基准饱和的系统性研究
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Toronto(多伦多大学) ; University of Washington(华盛顿大学) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Michigan(密歇根大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 本研究定义并分析了60个语言模型基准的饱和现象,发现近半数基准出现饱和,且专家策划而非公开测试数据影响抗饱和能力,为延长基准寿命提供了设计建议。
Comments Published at ICML 2026 (Forty-Third International Conference on Machine Learning)
d3LLM:基于伪轨迹蒸馏的超快扩散大语言模型
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) ; National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家实验室) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 d3LLM通过伪轨迹蒸馏和熵基多块解码技术,在提升并行性的同时保持准确性,实现超快的扩散大语言模型。
Comments ICML 2026
SCORE: 在线FDR控制中过冲退款的统一框架
AI总结 提出SCORE框架,利用不等式回收超过拒绝阈值的证据,增强基于e值的在线多重假设检验方法的统计功效,并严格保持FDR控制。
Journal ref Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea, PMLR 306, 2026
带RL或SFT的Transformer可证明学习稀疏布尔函数,但方式不同
机构 * School of Electronics and Computer Science, University of Southampton, United Kingdom(南安普顿大学电子与计算机科学学院,英国) ; Independent Researcher(独立研究员)
AI总结 本文通过统一分析RL(过程奖励)和SFT微调Transformer学习可递归分解的k-稀疏布尔函数的动态,证明两者都能学习k-PARITY、k-AND、k-OR等函数,但RL同时学习整个CoT链,而SFT逐步学习。
Comments ICML 2026 final version. 50 pages
基于二元主成分的无训练哈希注意力机制
AI总结 针对长上下文LLMs自注意力的解码效率瓶颈,提出无训练的BinaryPC方法,通过数据二元主成分构建哈希码,在保持精度的同时将解码吞吐量提升3.56倍。
Comments ICML 2026
理论层面的自动形式化:从孤立陈述到统一形式知识库
AI总结 探讨自动形式化从单个陈述到理论层面的转变,主张将完整理论及其相互依赖关系形式化为结构化库,分析转变意义,回应不同观点,识别挑战并提出三条前进路径。
Comments ICML 2026 Spotlight
N选最佳语音合成评估受自动语音识别家族对齐的影响
AI总结 研究发现最佳N选语音合成评估受ASR家族对齐影响,同家族验证器-评估器对效果更好。提出两种跨家族排名集成方法,能降低平均词错误率,建议交叉评估器三角测量作为默认报告实践。
Comments Accepted at ICML 2026 Workshop on Machine Learning for Audio
DELTA-TTS:将自回归模型适配为扩散语言模型以实现文本转语音
机构 * Sungkyunkwan University(首尔大学) ; University of Seoul(首尔大学)
AI总结 针对自回归TTS推理慢、鲁棒性差的问题,提出基于LoRA的轻量适配框架DELTA-TTS,将预训练AR TTS转为离散扩散语言模型,推理速度提升3.3倍且性能更优。
Comments ICML 2026 SPIGM Workshop
基于自适应投注的序列核条件独立性检验
机构 * Department of Computer Science, University of British Columbia, Vancouver, Canada(不列颠哥伦比亚大学计算机科学系,温哥华,加拿大) ; Alberta Machine Intelligence Institute, Edmonton, Canada(阿尔伯塔机器智能研究所,爱德蒙顿,加拿大)
AI总结 提出一种对估计误差更鲁棒的序列条件独立性检验方法,通过自适应优化核条件独立性统计量、归一化及截断平移校准,在合成与真实数据上控制第一类错误并保持高功效。
Comments Published at ICML 2026: https://openreview.net/forum?id=vUMdIyTs9c
信号驱动观测:面向长程任务的Web智能体
机构 * University of Cambridge(剑桥大学)
AI总结 提出信号驱动观测(SDO)方法,通过专用子调用读取完整DOM但仅返回任务相关元素,并由轻量信号检测器触发重新调用,解决长程Web智能体中上下文退化问题。
Comments 10 pages, 1 figure. Accepted to the Failure Modes in Agentic AI (FAGEN) Workshop at ICML 2026