arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Machine Learning · 会议 · Machine Learning

2026-07-27 至 2026-07-27 共收录 7
2601.12238 2026-07-27 stat.ML cs.LG math.OC 版本更新

On the Provable Suboptimality of Momentum SGD in Nonstationary Stochastic Optimization

关于动量SGD在非平稳随机优化中的可证明次优性的研究

Sharan Sahu, Cameron J. Hogan, Martin T. Wells

机构 * Cornell University(康奈尔大学)

AI总结 本文研究了在强凸性和光滑性条件下,随机梯度下降及其动量变体(Polyak重球和Nesterov)在跟踪时间变化最优解时的性能,揭示了动量方法在分布偏移下导致的显式漂移放大惩罚,并证明了这种惩罚并非分析伪影,而是信息论障碍,为动量方法在动态环境中的经验不稳定性提供了理论依据。

Comments Accepted to ICML 2026. 76 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28956 2026-07-27 math.FA cs.LG math.MG math.PR math.ST stat.TH 版本更新

Minimum Norm Interpolation via the Local Theory of Banach Spaces: The Role of $2$-Uniform Convexity

通过巴拿赫空间的局部理论实现最小范数插值:2-均匀凸性的作用

Gil Kur, Pierre Bizeul

机构 * Institute for Machine Learning, ETH Zürich(苏黎世联邦理工学院机器学习研究所) Department of Mathematics, Weizmann Institute of Science(魏茨曼科学研究所数学系)

AI总结 本文研究了在2-均匀凸性假设下最小范数插值器的性质,证明了其在线性和非线性模型中的偏差上界,并在特定条件下建立了非高斯协变量的泛化界。

Comments Submitted (minor corrections and improved readability from the previous version). A preliminary work titled "Minimum Norm Interpolation Meets the Local Theory of Banach Spaces'' appeared at the 2024 International Conference on Machine Learning (consider this information for citations)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25582 2026-07-27 cs.LG 版本更新

Safe In-Context Reinforcement Learning

安全的上下文强化学习

Amir Moeini, Minjae Kwon, Alper Kamil Bozkurt, Yuichi Motai, Rohan Chandra, Lu Feng, Shangtong Zhang

机构 * University of Virginia(弗吉尼亚大学) Virginia Commonwealth University(弗吉尼亚 Commonwealth 大学)

AI总结 提出SCARED方法,在无参数更新的上下文强化学习适应过程中,通过精确惩罚对偶法在约束马尔可夫决策过程框架下保证安全,实现奖励最大化与成本约束。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02130 2026-07-27 cs.AI cs.LG 版本更新

Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning

Re-FORC:用于高效思维链推理的自适应奖励预测

Renos Zabounidis, Aditya Golatkar, Michael Kleinman, Alessandro Achille, Wei Xia, Stefano Soatto

机构 * AWS Agentic AI(AWS智能代理部门) Carnegie Mellon University(卡内基梅隆大学)

AI总结 研究提出Re-FORC自适应奖励预测方法,通过在推理模型上训练轻量级适配器,实现早期停止无前景推理链、优化模型和思维长度选择以及自适应测试时缩放,有效提升推理效率和准确率。

Comments Accepted at ICML 2026; previously accepted as a non-archival paper at the Efficient Reasoning Workshop at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24668 2026-07-27 cs.CL cs.AI 版本更新

InteractComp: Evaluating Search Agents With Ambiguous Queries

InteractComp:使用模糊查询评估搜索代理

Mingyi Deng, Lijun Huang, Yani Fan, Fanqi Kong, Jiayi Zhang, Fashen Ren, Jinyi Bai, Fuzhen Yang, Dayi Miao, Zhaoyang Yu, Yifan Wu, Yanfei Zhang, Fengwei Teng, Yingjia Wan, Song Hu, Yude Li, Xin Jin, Conghao Hu, Haoyu Li, Qirui Fu, Tai Zhong, Xinyu Wang, Xiangru Tang, Nan Tang, Chenglin Wu, Yuyu Luo

机构 * DeepWisdom(深智科技) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Renmin University of China(中国人民大学) University of California, Los Angeles(加州大学洛杉矶分校) Agent Universe(智能体宇宙) McGill University(麦吉尔大学) Yale University(耶鲁大学)

AI总结 研究针对搜索代理缺乏处理模糊查询及交互能力的问题,引入InteractComp基准,通过目标-干扰物方法构建问题评估17个模型,发现模型存在过度自信问题,强制交互有提升,揭示交互能力停滞,该基准对评估和训练搜索代理交互能力有重要价值。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026), Seoul, South Korea. 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14562 2026-07-27 cs.LG math.OC 版本更新

LiMuon: Light and Fast Muon Optimizer for Large Models

LiMuon: 面向大模型的轻量快速Muon优化器

Feihu Huang, Yuning Luo, Songcan Chen

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出LiMuon优化器,结合动量方差缩减与随机SVD,在降低内存的同时实现更低的样本复杂度O(ε^{-3}),并在Mamba-130M等模型上验证有效性。

Comments Published in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05618 2026-07-27 cs.CL 版本更新

Learning to Reason for Factuality

学习进行事实性推理

Xilun Chen, Ilia Kulikov, Vincent-Pierre Berges, Barlas Oğuz, Rulin Shao, Gargi Ghosh, Jason Weston, Wen-tau Yih

机构 * FAIR at Meta(Meta 的 FAIR) University of Washington(华盛顿大学)

AI总结 研究推理大型语言模型在事实性推理方面的问题,提出同时考虑事实精度、响应细节和答案相关性的新型奖励函数,应用在线强化学习,使模型在长篇事实性基准测试中幻觉率降低、答案细节提升且响应帮助性无降。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏