arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Machine Learning · 会议 · Machine Learning

共收录 11753
2604.18576 2026-07-14 cs.AI 版本更新

Agentic Forecasting using Sequential Bayesian Updating of Linguistic Beliefs

基于序列贝叶斯更新的语义信念的代理预测

Kevin Murphy

机构 * Department of Computer Science(计算机科学系) University of British Columbia(不列颠哥伦比亚大学)

AI总结 BLF系统通过语义信念状态、层级多试聚合和层级校准方法,在预测基准上超越了现有方法,同时具备低泄露率的回测框架。

Comments v4 adds 2 new appendices: app J evaluates a "generative" Bayesian alternative to BLF (which does worse than the "discriminative" approached used by BLF), and app K sketches how to do value of information computation to decide when to stop searching (although this idea has not been tried). v4 also adds a few more recent references

Journal ref v3 was published in ICML AI Forecasting workshop 2026 (https://forecasting-workshop.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17776 2026-07-14 cs.CL 版本更新

DEER: A Benchmark for Evaluating Deep Research Agents on Expert Report Generation

DEER:用于评估深度研究代理在专家报告生成上的基准

Janghoon Han, Heegyu Kim, Changho Lee, Dahm Lee, Min Hyung Park, Hosung Song, Stanley Jungkyu Choi, Moontae Lee, Honglak Lee

AI总结 DEER是一个用于评估深度研究代理在专家报告生成中性能的基准,通过系统化的评估标准和主张验证架构,提升报告质量和逻辑完整性。

Comments ICML 2026 (45 pages, 12 figures, 25 tables, 129 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19806 2026-07-14 cs.CY cs.CL cs.MA 版本更新

LLM-Based Social Simulations Require a Boundary

基于大语言模型的社会模拟需要边界

Zengqing Wu, Run Peng, Takayuki Ito, Makoto Onizuka, Chuan Xiao

机构 * Osaka University(大阪大学) Nagoya University(名古屋大学) University of Michigan(密歇根大学) Kyoto University(京都大学)

AI总结 探讨基于大语言模型的社会模拟,指出其因输出同质化限制对复杂社会动态行为多样性的捕捉。通过回顾研究发现验证实践与问题异质性要求不符,建议匹配验证深度、明确报告方差并合理限制结论,倡导有边界意识的方法为社会科学提供见解。

Comments ICML 2026 Position Paper Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02905 2026-07-14 cs.AI 版本更新

FIRE-Bench: Evaluating AI Agents on the Rediscovery of Scientific Insights

FIRE-Bench:评估人工智能代理在科学见解重新发现方面的表现

Zhen Wang, Fan Bai, Zhongyan Luo, Jinyan Su, Kaiser Sun, Xinle Yu, Jieyuan Liu, Kun Zhou, Claire Cardie, Mark Dredze, Zhiting Hu, Eric P. Xing

机构 * Johns Hopkins University(约翰霍普金斯大学) Cornell University(康奈尔大学)

AI总结 研究旨在评估大语言模型驱动的人工智能代理在科学见解重新发现上的能力。核心方法是引入FIRE-Bench基准,让代理基于高层次研究问题进行全周期探索。主要贡献是为衡量代理驱动的科学发现进展提供了严格诊断框架,揭示当前代理系统在全周期科研上的挑战。

Comments 34 pages, 3 figures, 16 tables; ICML 2026 Camera-ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09776 2026-07-14 cs.LG 版本更新

TimeSAE: Causal Sparse Decoding for Faithful Explanations of Black-Box Time Series Models

TimeSAE:用于对黑箱时间序列模型进行忠实解释的因果稀疏解码

Khalid Oublal, Quentin Bouniot, Qi Gan, Stephan Clémençon, Zeynep Akata

机构 * Telecom Paris(电信巴黎大学) Institut Polytechnique de Paris(巴黎理工学院) Technical University of Munich(慕尼黑技术大学) Helmholtz Munich(海德堡-慕尼黑马克斯·普朗克研究所) Munich Center for Machine Learning(慕尼黑机器学习中心) Munich Data Science Institute(慕尼黑数据科学研究所)

AI总结 针对黑箱时间序列模型难以解释且缺乏泛化能力的问题,基于稀疏自编码器概念引入TimeSAE框架,通过在合成和真实数据集上广泛评估并与基线比较,证明该框架能提供更忠实、稳健的模型解释。

Comments Accepted at ICML 2026

Journal ref International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01624 2026-07-14 cs.CV cs.AI

Q-Sched: Pushing the Boundaries of Few-Step Diffusion Models with Quantization-Aware Scheduling

Q-Sched: 推动少步扩散模型的边界,通过量化感知调度

Natalia Frumkin, Diana Marculescu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 Q-Sched通过量化感知调度器改进少步扩散模型,实现模型大小减少4倍并提升生成质量

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21833 2026-07-14 cs.LG 版本更新

Memory Savings at What Cost? A Study of Alternatives to Backpropagation

以何种代价节省内存?反向传播替代方案研究

Kunjal Panchal, Sunav Choudhary, Yuriy Brun, Hui Guan

机构 * College of Information and Computer Sciences, University of Massachusetts, Amherst(信息与计算机科学学院,马萨诸塞大学阿默斯特分校) Adobe, San Jose(Adobe公司,圣乔斯)

AI总结 研究比较BP、检查点BP、FmAD和ZO在LLM及视觉语言模型训练中的表现,发现FmAD和ZO虽省内存但有计算成本等问题,带检查点的BP在多方面更优,纠正了此前关于LLM优化的片面基准测试观点。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14411 2026-07-14 cs.LG cs.AI cs.RO 版本更新

Adaptive Reinforcement Learning for Unobservable Random Delays

用于不可观测随机延迟的自适应强化学习

John Wikman, Alexandre Proutiere, David Broman

机构 * KTH Royal Institute of Technology(皇家理工学院)

AI总结 研究现实动态环境中智能体与系统交互因延迟导致标准强化学习假设不成立的问题,提出交互层框架,在此基础上开发ACDA算法,能自适应处理不可观测和时变延迟,在多种环境中性能显著优于现有方法。

Comments Published at ICML 2026 (https://openreview.net/forum?id=QpgIOT06k3)

Journal ref Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09623 2026-07-13 cs.CL cs.AI 新提交

Task-Specific Multimodal Question Answering Agents via Confidence Calibration and Incremental Reasoning for QANTA 2026

通过置信度校准和增量推理实现特定任务的多模态问答代理,用于QANTA 2026

Nirjhar Das, Md. Al-Mamun Provath

机构 * Department of Computer Science Engineering, Chittagong University of Engineering \& Technology, Chattogram, Bangladesh

AI总结 针对QANTA 2026共享挑战,开发特定任务双代理架构,抢答代理用带置信度校准的模型及数值推理策略,加分代理用多种推理整合信息,强调仅托管环境下的高效推理与校准,系统取得高分,证明轻量级策略在资源受限问答中性能强。

Comments 10 pages, 1 figure. Accepted at the EMM-QA 2026 Workshop, ICML 2026 (Non-Archival). Rank #1 overall system in the QANTA 2026 Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09603 2026-07-13 cs.MA 新提交

Mosaic: Runtime-Efficient Multi-Agent Embodied Planning

Mosaic:运行时高效的多智能体实体规划

Kunjal Panchal, Saayan Mitra, Sunav Choudhary, Victor Bursztyn, Somdeb Sarkhel, Hui Guan

AI总结 研究基于LLM的多智能体实体规划执行延迟高问题,提出Mosaic框架,通过智能体中心语义内存和整数线性规划应对挑战,在多基准测试中执行更快、调用更少、步数更少且成功率更高,证明相关因素对多智能体规划的重要性。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09532 2026-07-13 cs.LG cs.CR stat.ML 新提交

Statistically Undetectable Backdoors in Deep Neural Networks

深度神经网络中统计上不可检测的后门

Andrej Bogdanov, Alon Rosen, Neekon Vafa

机构 * University of Ottawa(渥太华大学) Bocconi University(博科尼大学) Massachusetts Institute of Technology(麻省理工学院)

AI总结 研究对抗模型训练者在深度前馈神经网络中植入统计上不可检测的后门,此后门可提供基于不变性的对抗样本,揭示了模型训练者与使用者间的权力不对称,且无后门时多项式时间内无法生成此类样本。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09490 2026-07-13 cs.DS cs.CG cs.LG stat.ML 新提交

Terminal Dimension Reduction for Time Series with Applications

时间序列的终端降维及其应用

Alexander Munteanu, Matteo Russo, David Saulpic, Chris Schwiegelshohn

机构 * TU Dortmund(图宾根大学) EPFL(苏黎世联邦理工学院) CNRS & Université Paris Cité, IRIF(国家科学研究中心及巴黎cité大学,IRIF) Aarhus University(奥胡斯大学)

AI总结 研究针对时间序列聚类等复杂结构降维问题,将终端嵌入推广到仿射线段,利用保线终端嵌入结合约翰逊 - 林登施特劳斯嵌入获得无维核心集,实验表明其在时间序列降维上表现良好且有独特优势。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09450 2026-07-13 cs.CV cs.LG 新提交

Robustifying Vision-Language Models via Test-Time Prompt Adaptation

通过测试时提示自适应增强视觉语言模型的鲁棒性

Xingyu Zhu, Huanshen Wu, Shuo Wang, Beier Zhu, Jiannan Ge, Jiaheng Zhang, Long Chen

机构 * University of Science(科学大学) National University of Singapore(新加坡国立大学) The Hong Kong University of Science(香港科学大学)

AI总结 研究针对对抗扰动下视觉语言模型性能下降问题,提出RITA框架,通过最优传输实现分布级对齐,引入动态缓存积累线索,提升了模型对抗鲁棒性且不损干净准确率。

Comments ICML 2026 regular

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09134 2026-07-13 cs.SD cs.AI eess.AS eess.SP 新提交

ReGen: Hierarchical Multi-Prompt Representation Generation for Efficient Waveform Diffusion Models

ReGen:用于高效波形扩散模型的分层多提示表示生成

Sang-Hoon Lee, Ha-Yeong Choi

机构 * Department of Artificial Intelligence, Ajou University, Suwon, Korea(人工智能系,全州大学) KT Corp., Seoul, Korea(KT公司)

AI总结 研究针对扩散训练中中间表示正则化问题,提出ReGen框架联合估计向量场,引入GFM提高泛化能力。在波形扩散模型及文本到语音模型上验证,提升了波形生成质量、语音清晰度等,实现高效训练与采样。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09099 2026-07-13 cs.AI 新提交

L-MAD: A Systematic Evaluation of Multi-Agent Debate Structures in Legal Reasoning

L-MAD:法律推理中多智能体辩论结构的系统评估

Tan-Minh Nguyen, Hoang-Trung Nguyen, Huu-Dong Nguyen, Dinh-Truong Do, Thi-Hai-Yen Vuong, Le-Minh Nguyen

机构 * Japan Advanced Institute of Science(日本先进科学研究院) VNU University of Engineering(越南工程大学)

AI总结 研究在法律领域探索多智能体辩论(MAD)框架有效性,引入L-MAD框架评估不同结构和方法,通过分配专家角色提升效果,分析辩论规模发现权衡,明确了在法律推理中部署协作多智能体系统的边界与安全边际。

Comments Outstanding paper in the AI4Law Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08979 2026-07-13 cs.LG stat.AP stat.ML stat.OT 新提交

Optimal Top-$k$ Identification from Pairwise Comparisons

从成对比较中进行最优的前\(k\)项识别

Motti Goldberger, Nils Rudi

AI总结 研究从成对比较中进行固定置信度前\(k\)项识别的主动学习问题,刻画下界结构为鞍点问题并开发渐近最优算法,构造自适应比较分配算法并证明其渐近最优,最小化比较预期数量。

Comments accepted for ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28215 2026-07-13 cs.AI cs.CL cs.LG cs.LO cs.MA 版本更新

Explaining is Harder Than Predicting Alone: Evaluating Concept-based Explanations of MLLMs as ICL Visual Classifiers

解释比单独预测更难:评估基于概念的MLLM解释作为ICL视觉分类器

Carmen Quiles-Ramírez, Leticia L. Rodríguez, Nicolás Martorell, Natalia Díaz-Rodríguez

AI总结 本文通过五种形式化程度递增的条件,系统评估多模态大语言模型在少样本上下文学习中的基于概念的可解释性,发现解释比预测更难,且强制生成形式化解释会降低预测准确性。

Comments Accepted to the CompLearn Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20578 2026-07-13 cs.LG math.OC stat.ML 版本更新

Upper-Linearizability of Online Non-Monotone DR-Submodular Maximization over Down-Closed Convex Sets

在线非单调DR-子模最大化在下闭凸集上的上线性化

Yiyang Lu, Haresh Jadav, Mohammad Pedramfar, Ranveer Singh, Vaneet Aggarwal

机构 * Purdue University(普渡大学) IIT Indore(印度理工学院Indore) Mila - Quebec AI Institute/McGill University(魁北克AI研究所/麦吉尔大学)

AI总结 本文提出了一种将非单调DR-子模最大化问题转化为在线线性优化的方法,实现了O(T^{1/2})的静态后悔和改进的动态后悔保证。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026): https://icml.cc/virtual/2026/poster/64472

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10229 2026-07-13 cs.CL 版本更新

Latent Thoughts Tuning: Bridging Context and Reasoning with Fused Information in Latent Tokens

潜在思维调整:通过潜在令牌中的融合信息连接上下文与推理

Weihao Liu, Dehai Min, Lu Cheng

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校)

AI总结 研究提出潜在思维调整(LT-Tuning)框架,通过重新定义潜在思维构建与部署方式,引入上下文预测融合机制,结合三阶段课程学习,实现潜在与显式思维模式动态切换,优于现有潜在推理基线,有效缓解特征崩溃并提升推理精度。

Comments In Proceedings of the Forty-third International Conference on Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08173 2026-07-10 cs.AI 新提交

Overthinking: Amplifying Reasoning Weights to Extract Learned Secrets

过度思考:放大推理权重以提取学习到的秘密

Jack Hopkins, Dipika Khullar, Fabien Roger

AI总结 研究针对语言模型黑盒审计可能遗漏隐藏信息的问题,提出“过度思考”方法,通过特定模型构建及新策略放大推理,经实验证明该方法能更频繁揭示隐藏信息,不同秘密浮现方式有别。

Comments Accepted at ICML 2026. 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08109 2026-07-10 cs.LG 新提交

Contrastive Order Learning: A General Framework for Ordinal Regression

对比顺序学习:序数回归的通用框架

Chaewon Lee, BeomJun Shim, Kwang Pyo Choi, Chang-Su Kim

AI总结 该研究提出对比顺序学习框架ConOrd,整合对比学习与顺序学习优势,通过引入基于秩差的对比顺序损失解决相关局限,在面部年龄估计等序数回归任务实验中达最优性能且泛化性好。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08103 2026-07-10 cs.LG 新提交

Stochastic Order Learning: An Approach to Rank Estimation Using Noisy Data

随机序学习:一种使用噪声数据进行秩估计的方法

Chaewon Lee, Seon-Ho Lee, Chang-Su Kim

AI总结 研究标签噪声下的秩估计问题,提出随机序学习(SOL)框架,通过判别损失和随机序损失两个互补目标捕捉不确定性并学习嵌入空间,实验证明该框架能在多种标签噪声下实现可靠秩估计。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08059 2026-07-10 cs.LG cs.AI 新提交

When Thinking Hurts: Epistemic Signals in the Reasoning Chains of Visual Language Models

当思考有害时:视觉语言模型推理链中的认知信号

Mayank Singal

AI总结 研究视觉语言模型推理链中的认知信号,通过在相同对抗样本上运行四个模型,发现不同模型的答案熵行为模式有差异,思考链熵在部分情况下优于答案熵,还发现结构化弃权及其实用弃权门可提升准确率。

Comments 7 pages, 2 figures, 5 tables. Oral paper at the 2nd Workshop on Epistemic Intelligence in Machine Learning (EIML@ICML 2026), Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08029 2026-07-10 cs.LG 新提交

Rethinking Small VLM Quantization: From Component-Wise Analysis to Hardware-Aware Edge Deployment

重新思考小型视觉语言模型量化:从组件级分析到硬件感知边缘部署

Hyeju Shin, Chorwon Kim, Ryangsoo Kim, Hark Yoo, Jaein Kim

AI总结 本文针对小型视觉语言模型量化,提出系统评估框架,在特定硬件上验证五个假设,分离相关组件得出结论,包括量化敏感性受结构范式影响、SigLIP编码器延迟情况、大语言模型INT4量化利弊、复合量化误差特点及不同平台每焦耳智能差异。

Comments 14 pages. Accepted at the ICML 2026 Workshop on Hypothesis Testing

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07716 2026-07-10 cs.LG cs.AI 新提交

Towards the Explainability of Temporal Graph Networks via Memory Backtracking and Topological Attribution

通过记忆回溯和拓扑归因实现时间图网络的可解释性

Yazheng Liu, Xi Zhang, Sihong Xie, Hui Xiong

AI总结 研究如何增强时间图网络(TGNs)的可解释性,通过拓扑归因树和记忆回溯树对其预测进行归因,应用LRP并设计优化目标,在九个时间图数据集实验中表现出色,提供可靠解释且优于基线。

Comments ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10062 2026-07-10 cs.AI cs.MA 新提交

Deployment-Time Memorization in Foundation-Model Agents

基础模型智能体中的部署时记忆

Lei, Chen, Guilin Zhang, Kai Zhao, Dalmo Cirne, Andy Olsen, Xu Chu, Zeke Miller, Alet Blanken, Amine Anoun, Jerry Ting

机构 * Lei (Rachel) Chen Guilin Zhang Kai Zhao Dalmo Cirne Andy Olsen Zeke Miller Xu Chu Alet Blanken Amine Anoun Jerry Ting

AI总结 研究基础模型智能体在部署时记忆的设计选择如何影响个性化效用、提取风险和删除保真度,提出遗忘残差分数并揭示压缩与删除的权衡。

Comments 4 pages, ICML MemFM 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12726 2026-07-10 cs.LG 版本更新

Before the Last Token: Diagnosing Final-Token Safety Probe Failures

在最后的标记之前:诊断最终标记安全探针失败

Shravan Doda

机构 * SafeSwitch HarmBench SorryBench

AI总结 研究最终标记安全探针在预填充阶段的失败模式,发现安全证据分布在早期用户标记中,传统探针无法捕捉,提出基于PCA-HMM的轨迹模型提升诊断能力。

Comments 8 pages, 2 figures, 7 tables. Accepted at the ICML 2026 Mechanistic Interpretability Workshop and the ICML 2026 Failure Modes in Agentic AI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02998 2026-07-10 cs.LG stat.ME stat.ML 版本更新

Multi-Distribution Robust Conformal Prediction

多分布鲁棒共形预测

Yuqi Yang, Ying Jin

机构 * Mathematics Department, The Hong Kong University of Science(香港科学与技术大学数学系) Department of Statistics and Data Science, University of Pennsylvania(宾夕法尼亚大学统计与数据科学系) Data Science, University of Pennsylvania, Philadelphia, PA, USA(宾夕法尼亚大学数据科学)

AI总结 研究在多源分布下构建一致有效的共形预测集问题,提出最大\(p\)聚合方案,证明其最优性并给出学习一致性分数算法,实验表明该方法能在多分布上提供有效覆盖率且减小集合大小。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12857 2026-07-10 cs.CY cs.AI 版本更新

Adaptive Generation of Bias-Eliciting Questions for LLMs

为大语言模型自适应生成偏差引发问题

Robin Staab, Jasper Dekoninck, Maximilian Baader, Martin Vechev

机构 * ETH Zurich, Switzerland(苏黎世联邦理工学院)

AI总结 针对大语言模型固有偏差问题,引入反事实框架,通过迭代问题变异生成开放式问题评估偏差,构建CAB基准,评估发现模型在某些场景有持续偏差,凸显公平性研究需求。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06841 2026-07-09 stat.ML cs.LG 新提交

Tensor Train Diffusion: Leveraging Low-Rank Structures for High-Dimensional Score-Based Sampling

张量列车扩散:利用低秩结构进行高维基于分数的采样

Robert Gruhlke, Julius Berner, David Sommer, Lorenz Richter

AI总结 研究如何利用低秩结构进行高维基于分数的采样,提出基于函数张量列车格式求解HJB方程的方法,结合反向迭代方案,克服现有技术瓶颈,实现从复杂目标分布高效高保真采样。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏