arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Machine Learning · 会议 · Machine Learning

共收录 11753
2606.10762 2026-07-22 astro-ph.SR astro-ph.IM 版本更新

Amortized Simulation-Based Inference of Colliding-Wind Binaries from Short, Noisy Image Time Series

基于摊销模拟推断的短时、含噪图像时间序列中碰撞风双星参数反演

Niklas Knöll, Tobias Buck, Lorenzo Branca, Giuseppe Viterbo

AI总结 针对碰撞风双星从短时序列图像推断物理参数这一逆问题,提出一种分解时空架构的摊销后验推断方法,结合神经样条流实现七参数联合推断,在低信噪比下仍能稳健恢复轨道参数和质量损失率。

Comments Accepted to the International Conference for Machine Learning (ICML) workshop AI4Physics 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03698 2026-07-22 cs.LG 版本更新

Multi$^2$: Hierarchical Multi-Agent Decision-Making with LLM-Based Agents in Interactive Environments

Multi$^2$:基于LLM智能体在交互环境中的分层多智能体决策

Sangeun Park, Minhae Kwon

机构 * KAIST(韩国科学技术院)

AI总结 提出Multi$^2$分层多智能体决策框架,通过高层智能体(System 1)使用监督微调生成子目标,低层智能体(System 2)使用离线到在线强化学习执行原子动作,以缓解目标漂移并实现长期稳定控制。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22350 2026-07-22 cs.LG stat.ML 版本更新

Partial Fusion of Neural Networks: Efficient Tradeoffs Between Ensembles and Weight Aggregation

神经网络的部分融合:集成与权重聚合之间的高效权衡

Fabian Morelli, Stephan Eckstein

机构 * Department of Mathematics, University of Tübingen, Germany(图宾根大学数学系,德国) Department of Computer Science, University of Tübingen, Germany(图宾根大学计算机科学系,德国)

AI总结 提出神经网络的部分融合方法,通过基于神经元相似性的部分最优传输实现集成与权重聚合之间的灵活权衡,并推广为广义剪枝。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03517 2026-07-22 cs.LG stat.ML 版本更新

Understanding Self-Supervised Learning via Latent Distribution Matching

通过潜在分布匹配理解自监督学习

Fabian A Mikulasch, Friedemann Zenke

机构 * Friedrich Miescher Institute for Biomedical Research, 4056 Basel, Switzerland(弗里德里希·迈斯彻生物医学研究所) Faculty of Science, University of Basel, 4033 Basel, Switzerland(巴塞尔大学科学学院)

AI总结 本文将自监督学习形式化为潜在分布匹配(LDM),通过对齐和均匀性最大化潜在表示的对数概率和熵,统一了多种SSL方法,并推导出用于高维时间序列的非线性无采样贝叶斯滤波模型。

Comments Accepted to ICML 2026 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11836 2026-07-22 cs.LG cs.CL 版本更新

More Edits, More Stable: Understanding the Lifelong Normalization in Sequential Model Editing

更多编辑,更稳定:理解连续模型编辑中的终身规范化

Xin Ma, Wei Chen, Qi Liu, Derong Xu, Zhi Zheng, Tong Xu, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)

AI总结 本文研究了连续模型编辑中的终身规范化,提出理论分析揭示其自增强稳定性循环,并通过StableEdit提升长期稳定性。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24927 2026-07-22 cs.CL cs.AI cs.LG 版本更新

Large Language Models Explore by Latent Distilling

通过潜在蒸馏探索大语言模型

Yuanhao Zeng, Ao Lu, Lufei Li, Zheng Zhang, Yexin Li, Kan Ren

机构 * State Key Laboratory of General Artificial Intelligence, BIGAI, Beijing, China(人工智能通用基础理论国家重点实验室,BIGAI,北京,中国) School of Information Science and Technology, ShanghaiTech University, Shanghai, China(信息科学与技术学院,上海交通大学,上海,中国)

AI总结 本文提出Exploratory Sampling方法,通过蒸馏模型引导生成过程,提升语义多样性与推理效率,在数学、科学和代码生成中表现优异。

Comments 25 pages, 5 figures. Accepted in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13428 2026-07-22 cs.SE cs.AI 版本更新

SWE-Milestone: Evaluating AI Agents on Continuous Software Evolution

EvoClaw: 评估AI代理在持续软件演化中的表现

Gangda Deng, Zhaoling Chen, Zhongming Yu, Haoyang Fan, Yuhong Liu, Yuxin Yang, Dhruv Parikh, Rajgopal Kannan, Le Cong, Mengdi Wang, Qian Zhang, Viktor Prasanna, Xiangru Tang, Xingyao Wang

机构 * USC(美国斯克利普斯大学) UCR(加州大学河滨分校) UCSD(加州大学圣地亚哥分校) Army Research Office(陆军研究办公室) Stanford(斯坦福大学) Princeton(普林斯顿大学) Haven OpenHands

AI总结 针对现有基准测试忽视软件演化中时间依赖和技术债务的问题,提出EvoClaw基准,通过从提交日志重建可验证里程碑DAG,评估AI代理在持续开发中维持系统完整性和限制错误累积的能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14516 2026-07-22 cs.DC 版本更新

Efficient Multi-round LLM Inference over Disaggregated Serving

高效多轮LLM推理的解耦服务

Wenhao He, Youhe Jiang, Penghao Zhao, Quanqing Xu, Eiko Yoneki, Bin Cui, Fangcheng Fu

AI总结 AMPD通过自适应协调预填充和解码工作负载,提升多轮LLM推理的服务级别目标达成率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14469 2026-07-22 cs.CL 版本更新

Measuring and Mitigating Post-hoc Rationalization in Reverse Chain-of-Thought Generation

反向思维链生成中的事后合理化测量与缓解

Guangyue Peng, Zongchao Chen, Wen Luo, Yuntao Wen, Wei Li, Ruixiang Feng, Ran Le, Chen Yang, Zhenwei An, Yang Song, Tao Zhang, Houfeng Wang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息处理国家重点实验室,计算机科学学院,北京大学) University of Electronic Science and Technology of China(电子科技大学) Nanbeige Lab, BOSS Zhipin(纳贝格实验室,BOSS智联)

AI总结 针对反向思维链生成中的事后合理化问题,提出结构骨架引导推理方法,通过解耦答案依赖而非抑制答案来缓解锚定效应,在开放推理基准上提升10%性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02345 2026-07-22 cs.CL cs.AI cs.DC cs.LG cs.NE 版本更新

Breaking the MoE LLM Trilemma: Dynamic Expert Clustering with Structured Compression

打破MoE大语言模型三重困境:动态专家聚类与结构压缩

Peijun Zhu, Ning Yang, Baoliang Tian, Jiayu Wei, Weihao Zhang, Haijun Zhang, Pin Lv

机构 * Guangzhou University(广州大学) Institue of Automation Chinese Academy of Sciences(中国科学院自动化研究所) ByteDance Inc.(字节跳动公司) University of Science and Technology Beijing(北京科技大学)

AI总结 本文提出动态专家聚类与结构压缩框架,通过参数分解和分层路由策略,显著提升MoE大语言模型的效率和内存利用率。

Comments 10 pages, 2 figures, 8 tables. Under review as a conference paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22328 2026-07-22 cs.LG 版本更新

Knowledge-Informed Kernel State Reconstruction from Heterogeneous Partial Observations

知识驱动的异质部分观测核状态重建

Luca Muscarnera, Silas Ruhrberg Estévez, Samuel Holt, Evgeny Saveliev, Mihaela van der Schaar

AI总结 提出MAAT框架,利用再生核希尔伯特空间和异质观测算子及先验知识,从部分、噪声、异质观测中重建平滑且物理一致的动态系统状态,显著降低轨迹和导数重建误差。

Comments Accepted at ICML 2026 SD4H Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18537 2026-07-22 cs.RO cs.AI 版本更新

SKETCH: Semantic Key-Point Conditioning for Long-Horizon Vessel Trajectory Prediction

SKETCH: 面向长时域船舶轨迹预测的语义关键点条件建模

Linyong Gan, Zimo Li, Wenxin Xu, Xingjian Li, Jianhua Z. Huang, Enmei Tu, Shuhang Chen

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)数据科学学院) School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)科学与工程学院) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)人工智能学院) COSCO SHIPPING Advanced Technology Institute, Shanghai, China(中远海运技术研究院)

AI总结 针对长时域轨迹预测中方向漂移问题,提出基于语义关键点(NKP)的条件轨迹建模框架,将预测分解为全局语义决策与局部运动建模,采用预训练-微调策略估计NKP先验,在真实AIS数据上显著提升长时域、方向精度和细粒度预测性能。

Comments Final Camera-Ready Version. Accepted by ICML 2026 (PMLR Vol. 306)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18004 2026-07-21 cs.AI cs.LG 新提交

PAMD: Structured Adaptive Distances for Bisimulation Representations in Visual Reinforcement Learning

PAMD:视觉强化学习中用于双模拟表示的结构化自适应距离

Daegyeong Roh, Juho Bae, Han-Lim Choi

AI总结 针对视觉强化学习中潜在距离选择影响性能的问题,提出PAMD(成对自适应马氏距离),它为测量潜在状态相似性参数化正定成对条件度量,是现有双模拟方法的简单插件,在视觉MuJoCo任务中显著提升了相关算法性能。

Comments 9 pages, 6 figures, plus appendix. Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17972 2026-07-21 cs.LG 新提交

DiFA: Inference-Time Forward-Process Alignment for Diffusion Models

DiFA:扩散模型的推理时间前向过程对齐

Shigui Li, Delu Zeng

AI总结 研究提出DiFA框架,将扩散模型推理时的数据预测细化转为顺序状态估计问题,受卡尔曼滤波启发建立前向对齐时间一致性,引入偏差引导机制,实验表明该方法在多个指标上显著提升CIFAR-10和ImageNet的生成保真度。

Comments Accepted to ICML 2026. 23 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17946 2026-07-21 cs.LG cs.AI 新提交

A Geometric Perspective on Stabilizing Value Conflict Resolution

稳定价值冲突解决的几何视角

Saket Reddy, Andy Liu

机构 * University of Illinois - Urbana-Champaign(伊利诺伊大学厄巴纳 - 香槟分校) Carnegie Mellon University(卡内基梅隆大学)

AI总结 研究大语言模型在RLHF训练中应对价值冲突的问题,核心方法是利用思维链推理,通过几何视角分析其作用,创建新的以价值冲突为重点的CoT设计,提升了道德推理性能,为改进模型处理复杂价值冲突请求的性能提供新途径。

Comments Accepted to ICML Workshop on High-Dimensional Learning Dynamics

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17884 2026-07-21 cs.AI 新提交

ST-Veto: Spatio-Temporal Token Veto for Diffusion MLLMs via Taylor Prediction and Visual Grounding

ST-Veto:通过泰勒预测和视觉基础实现用于扩散多模态语言模型的时空令牌否决

Keuntae Kim, Beomseok Lee, Hyunwoo Kim, Yong Suk Choi

AI总结 研究针对扩散多模态大语言模型推理不足问题,提出无需训练的ST-Veto方法,利用二阶泰勒预测和图像注意力质量否决不稳定及弱基础令牌,与更安全候选交换,在多基准测试中优于其他方法,提升准确率且无额外成本。

Comments ICML 2026 - main

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17800 2026-07-21 cs.LG 新提交

The Concept of Representation in ML: Beyond Plato and Aristotle

机器学习中的表征概念:超越柏拉图与亚里士多德

Gilad Landau, Aviv Keren

AI总结 探讨机器学习中表征概念,随着模型发展其从工程领域转向心理表征领域。评估《柏拉图式表征假说》中关于不同AI模型表征属性趋同由现实统一结构驱动的说法,借助心灵哲学观点审视,阐明关键、解释不足并给出研究方向。

Comments 8 pages. Accepted for oral presentation at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17264 2026-07-21 cs.AI 新提交

Coordinated Disentanglement with Iterative Mode Discovery Under Hidden Correlations

在隐藏相关性下通过迭代模式发现进行协同解缠

Rong Hu, Ling Chen

AI总结 研究针对解缠表示学习中隐藏相关性未充分探索的问题,提出CoDID框架,通过动态架构适应模式数量变化,利用协调机制减轻误差放大以实现协同解缠,在多样任务上展现最优性能。

Comments Published at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17147 2026-07-21 cs.CR cs.CL 新提交

SlotGuard: Stop Oversharing Private Local Context in LLM Agent Transcri

SlotGuard:阻止大语言模型代理转录中过度共享私有本地上下文

Haocheng Xia, Yongjoo Park

机构 * Siebel School of Computing(计算机科学系) Data Science, University of Illinois Urbana-Champaign(数据科学,伊利诺伊大学厄巴纳-香槟分校)

AI总结 研究大语言模型代理转录本隐私泄露问题,提出SlotGuard方法,通过重写结构绑定、替换机密值、链接跨轮引用等操作隐藏敏感数据,在保持代理性能的同时大幅降低凭证泄漏率。

Comments ICML 2026 AIWILD

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16972 2026-07-21 cs.AI cs.CL 新提交

Training Continuous Chain of Thought Models: A Tale of Two Regimes

训练连续思维链模型:两种模式的故事

Varun Yerram, He He, Eunsol Choi

AI总结 研究训练连续思维链模型,提出C-MTP直接监督方法,该方法在简化轨迹评估中表现良好,还扩展评估到复杂任务,发现当前直接和间接监督训练方法在长推理轨迹任务中表现差,揭示了现有方法的局限性。

Comments Accepted to AdaptFM Workshop, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16652 2026-07-21 cs.CV cs.AI 新提交

Position: Explanation Stability Is a Property of the Model Method Pair, Not the Model

立场:解释稳定性是模型与方法对的属性,而非模型本身的属性

Kabilan Elangovan, Daniel Ting

AI总结 该论文指出关于解释稳定性的断言需经交叉方法验证,以胸部X光实验为例,不同模型在不同归因方法下稳定性排名反转,说明解释稳定性是模型与方法对的属性,基于解释的断言应多方法验证并明确归因算子。

Comments Accepted Position Paper at ICML 2026. https://openreview.net/forum?id=9r8sSaYhos

Journal ref Forty-third International Conference on Machine Learning Position Paper Track, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16591 2026-07-21 cs.LG cs.AI 新提交

Learning from World Feedback: Why Model Uncertainty Fails as a Risk Signal in Model-Based RL

从世界反馈中学习:为何模型不确定性在基于模型的强化学习中无法作为风险信号

Zhaohui Wang

AI总结 研究探讨 RLxF 中学习信号应源于世界反馈,在安全模型控制中实例化并提炼原则。通过实验表明基于动力学的不确定性惩罚会增加碰撞率,用世界反馈信号可降低碰撞率,提取原则并指出其适用于多种相关方法。

Comments Accepted at the ICML 2026 Workshop on Reinforcement Learning from X Feedback (RLxF). 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16524 2026-07-21 cs.LG 新提交

Feedback Attribution and Representation Geometry: Metrics for Comparing Individual and Shared Rewards in MARL

反馈归因与表示几何:多智能体强化学习中个体与共享奖励比较的度量

Tasha Pais, Richard Higgins

AI总结 研究多智能体强化学习中团队平均奖励下,学习表示上奖励归因的特征。提出EffRank/$n$和$D_\text{act}$指标,在SMACv2测试发现观测解释几何特征,奖励归因体现在行为,且指标开销低。

Comments Accepted at the Reinforcement Learning from World Feedback Workshop, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16263 2026-07-21 cs.LG cs.CE q-bio.QM 新提交

Preference-based Antibody Expression Ranking: Scaling with Large-scale Weak Supervision

基于偏好的抗体表达排序:大规模弱监督下的扩展

Josh Qixuan Sun, Morteza Babaie, Wenyang Hou, Mark Crowley, David Young

AI总结 研究针对抗体表达排序中标记数据稀缺问题,提出基于偏好的学习框架,结合定量表达与弱监督,通过改进DPO适用于蛋白质语言模型,在多样数据集上评估,该方法优于基线,为抗体可表达性优化提供可扩展方案。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16257 2026-07-21 cs.LG cs.AI cs.CL 新提交

From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training

从结果到行动:利用事后诸葛亮进行长期语言智能体训练

Zishang Jiang, Tingyun Li, Jinyi Han, Xinyi Wang, Sihang Jiang, Yizhou Ying, Xiaojun Meng, Jiansheng Wei, Jiaqing Liang, Yanghua Xiao

AI总结 研究长期语言智能体训练中现有强化学习方法面临的挑战,提出事后诸葛亮策略优化方法,通过投影到意图空间提取低方差学习信号,聚合相似状态和行动,理论和实证证明可稳定提升策略性能。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16240 2026-07-21 cs.LG cs.AI 新提交

Normalized Rewards for Preference Optimization

偏好优化的归一化奖励

Shawn Im, Federico Danieli, Skyler Seto, Barry-John Theobald, Katherine Metcalf

AI总结 研究针对直接对齐算法过度优化隐式奖励模型的问题,提出添加正则化项的方法,通过研究似然变化分布理解过度优化,应用该正则化于相关方法,实现生成质量与基准能力权衡及奖励建模改进,提升了模型性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16231 2026-07-21 cs.LG 新提交

Orthogonal Gradient Constraints Shape Noisy-Label Memorization Dynamics

正交梯度约束塑造噪声标签记忆动态

Richard Mai

AI总结 研究噪声标签学习中记忆驱动过拟合问题,核心方法是用OrthoGrad去除权重梯度中与当前权重向量平行的分量,在MNIST小数据及CIFAR-10 ResNet-18实验中验证其能改变记忆轨迹,但依赖数据情况,可作学习动态诊断。

Comments 7 pages, accepted into the ICML HiLD workshop 2026 @Seoul

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10640 2026-07-21 cs.CV 版本更新

Spectral Heat Flow for Conservative Token Condensation in Vision-Language Models

视觉语言模型中用于保守令牌压缩的谱热流

Zhaoyang Li, Yanjun Li, Wangkai Li, Yujia Chen, Tianzhu Zhang

机构 * School of Information Science/National Key Laboratory of Deep Space Exploration University of Science and Technology of China(中国科学技术大学信息科学学院/深空探测国家实验室)

AI总结 研究针对视觉语言模型推理成本高及现有令牌剪枝方法的问题,提出无需训练的SpecFlow框架,通过谱热流等操作实现保守压缩,在多方面优于现有方法,平衡了效率与准确性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25325 2026-07-21 cs.AI 版本更新

Omni-Perception Policy Optimization for Multimodal Emotion Reasoning

全模态感知策略优化用于多模态情感推理

Zhiyuan Han, Beier Zhu, Wenwen Tong, Pengyang Shao, Peipei Song, Xinyi Wang, Jiangnan Chen, Lewei Lu, Xun Yang

机构 * University of Science and Technology of China(中国科学技术大学) SenseTime Research(商汤科技研究院) National University of Singapore(新加坡国立大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)

AI总结 提出OPPO强化学习框架,通过全模态感知奖励和损失优化多模态感知,提升情感推理中模态利用率和忠实度,在多个基准上达到最优。

Comments Accepted at ICML 2026. Project page: https://zjycutieee.github.io/OPPO-page/ Code: https://github.com/ZhiyuanHan-Aaron/OPPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19341 2026-07-21 cs.CV cs.CL cs.SD 版本更新

Native Active Perception as Reasoning for Omni-Modal Understanding

原生主动感知作为全模态理解的推理

Zhenghao Xing, Ruiyang Xu, Yuxuan Wang, Jinzheng He, Ziyang Ma, Qize Yang, Yunfei Chu, Jin Xu, Junyang Lin, Chi-Wing Fu, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Qwen Team, Alibaba Group(阿里巴巴集团Qwen团队)

AI总结 提出OmniAgent,一种基于POMDP迭代观察-思考-行动循环的原生全模态智能体,通过主动感知将推理复杂度与视频时长解耦,在多个基准上达到开源模型最优性能。

Comments Accepted at ICML 2026. Code and models: https://github.com/harryhsing/omniagent

详情

展开后加载摘要…

URL PDF HTML 收藏