arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Machine Learning · 会议 · Machine Learning

2026-06-24 至 2026-06-24 共收录 10
2606.24842 2026-06-24 cs.AI 新提交

World Models in Pieces: Structural Certification for General Agents

分片世界模型:通用智能体的结构化认证

Yikai Lu, Yifei Wu, Xinyu Lu, Tongxin Li

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen, Shenzhen, China(香港中文大学(深圳)数据科学学院)

AI总结 针对通用智能体在大世界场景下无法普遍胜任的问题,提出结构化认证框架,通过深度组合目标过滤特定转移,证明世界模型具有O(1/n)+O(δ)误差界,实现可认证部署。

Comments 30 pages, camera-ready version in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24790 2026-06-24 cs.LG cs.AI 新提交

Grad Detect: Gradient-Based Hallucination Detection in LLMs

Grad Detect: 基于梯度的 LLM 幻觉检测

Anand Kamat, Daniel Blake, Brent M. Werness

机构 * Amazon(亚马逊)

AI总结 提出 Grad Detect,通过单次前向-反向传播中的逐层梯度模式检测 LLM 幻觉,在多项基准上优于置信度与采样基线,并发现最后五层集中了97%以上的判别梯度信号。

Comments Accepted to the 2nd Workshop on Compositional Learning at ICML 2026, Seoul, South Korea. Copyright 2026 by the author(s)

Journal ref 2nd Workshop on Compositional Learning: Safety, Interpretability, and Agents, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24669 2026-06-24 cs.AI 新提交

LaGO: Latent Action Guidance for Online Reinforcement Learning

LaGO:面向在线强化学习的潜在动作引导

Kuan-Yen Liu, Ren-Jyun Huang, Ti-Rong Wu

机构 * Siebel School of Computing(计算科学系) Data Science, University of Illinois Urbana-Champaign, USA(数据科学,伊利诺伊大学厄巴纳-香槟分校,美国) Department of Computer Science, National Yang Ming Chiao Tung University, Taiwan(计算机科学系,National Yang Ming Chiao Tung大学,台湾) Institute of Information Science, Academia Sinica, Taiwan(信息科学研究所, Academia Sinica,台湾)

AI总结 提出LaGO框架,利用预训练大语言模型作为潜在动作先验,软引导在线策略优化,在离散和连续控制基准上显著提升奖励与成功率。

Comments 9 pages, 2 figures. Accepted at the ICML 2026 Workshop on Large Language Models for Planning (LM4Plan)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24626 2026-06-24 cs.AI 新提交

SAFARI: Scaling Long Horizon Agentic Fault Attribution via Active Investigation

SAFARI: 通过主动调查扩展长时域智能体故障归因

Chenyang Zhu, Jiayu Yao, Kushal Chawla, Youbing Yin, Nathan Wolfe, Pengshan Cai, Jingyu Wu, Spencer Hong, Sangwoo Cho, Shi-Xiong Zhang, Daben Liu, Sambit Sahu, Erin Babinsky

机构 * Department of Engineering Sciences(工程科学系) Applied Mathematics, Northwestern University(应用数学,西北大学)

AI总结 提出SAFARI框架,用工具增强的诊断循环替代线性上下文加载,结合短期记忆解耦诊断准确性与上下文限制,在Who&When和TRAIL GAIA数据集上分别提升20%和19%,并在超出上下文窗口5倍时保持0.58精度。

Comments Published at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24509 2026-06-24 cs.LG cs.AI cs.SI 新提交

A Fair Evaluation of Graph Foundation Models for Node Property Prediction

图基础模型在节点属性预测中的公平评估

Oleg Platonov, Gleb Bazhenov, Dmitry Eremeev, Liudmila Prokhorenkova

机构 * HSE University(俄罗斯高等经济学院) Yandex Research(Yandex研究院)

AI总结 本文对9种图基础模型进行公平评估,发现仅基于先验数据拟合网络的最新模型在预测性能上优于调优的图神经网络,但推理成本更高。

Comments Accepted at The Workshop on Graph Foundation Models at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24292 2026-06-24 cs.CV 新提交

ActiveScope: Actively Seeking and Correcting Perception for MLLMs

ActiveScope: 主动寻求和纠正MLLMs的感知

Yajing Wang, Chao Bi, Junshu Sun, Shufan Shen, Zhaobo Qi, Shuhui Wang, Qingming Huang

机构 * University of Chinese Academy of Sciences(中国科学院大学) State Key Lab of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(中国科学院人工智能安全国家重点实验室,计算技术研究所,北京,中国) Harbin Institute of Technology (Weihai)(哈尔滨工业大学(威海))

AI总结 提出ActiveScope框架,通过语义锚点定位和干扰抑制细化模块,解决MLLMs在高分辨率图像中的细粒度感知问题,在V* Bench上达到96.34%准确率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24124 2026-06-24 cs.AI 新提交

VeryTrace: Verifying Reasoning Traces through Compilable Formalism and Structured Verification

VeryTrace: 通过可编译形式化与结构化验证验证推理轨迹

Ninghan Zhong, Ahmet Ege Tanriverdi, Kaan Kale, Sriram Vishwanath

机构 * School of Electrical and Computer Engineering, Georgia Institute of Technology, USA(佐治亚理工学院电子与计算机工程学院) Department of Electrical and Computer Engineering, Bogazici University, Turkey(博亚奇大学电子与计算机工程系)

AI总结 提出VeryTrace框架,将自然语言推理轨迹形式化为可编译的领域特定语言(DSL),结合确定性检查与LLM审计进行混合验证,实现步骤级错误定位与修复,在数学、机器人规划、亲属推理任务上提升准确率。

Comments Accepted at LM4Plan Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23995 2026-06-24 cs.LG cs.AI cs.GT cs.MA 新提交

EMAgnet: Parameter-Space EMA Regularization for Policy Gradient Self-Play in Large Games

EMAgnet:大规模博弈中策略梯度自我博弈的参数空间EMA正则化

Tristan Maidment, JB Lanier, Chase McDonald, Nathan Tsang, Eugene Vinitsky, Roy Fox, Albert Wang, Wesley N. Kerr

机构 * Riot Games(拳头游戏) University of California, Irvine(加州大学尔湾分校) New York University(纽约大学)

AI总结 提出EMAgnet,通过指数移动平均(EMA)对策略参数进行自适应正则化,替代均匀分布正则化,在两人零和博弈中降低可剥削性。

Comments Accepted at NExT-Game 2026: New Frontiers in Game-Theoretic Learning (ICML 2026 Workshop). 13 pages, 2 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23740 2026-06-24 cs.LG cs.AI 新提交

Weight-Space Geometry of Offline Reasoning Training

离线推理训练的权重空间几何

Aleksandr Nikolich, Igor Kiselev, Vladimir Platonov, Karina Romanova

AI总结 通过余弦相似度、主角度子空间分析等方法,研究六种离线强化学习方法在数学推理任务中的权重更新几何,发现SFT、RFT、RIFT几乎共线,DFT方向偏离,Offline GRPO添加正交分量,DPO位于近正交子空间且准确率最高。

Comments accepted for ICML 2026 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23716 2026-06-24 cs.CY cs.AI 新提交

Legal Reasoning Is Not Lawyering: Rethinking Legal Benchmarks for Pro Se Access to Justice

法律推理不是律师工作:重新思考面向自助诉讼的司法基准

Andrew Lou, David Shin

机构 * Yale Law School, USA(耶鲁法学院,美国)

AI总结 本文指出当前法律AI基准仅评估专家预处理后的输入,忽略了自助诉讼者提供的杂乱、有误的提示,导致模型性能高估;通过实验展示上下界差距,呼吁建立直接衡量鲁棒性的基准。

Comments Both authors contributed equally. Accepted to the AI4Law Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏