arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Machine Learning · 会议 · Machine Learning

2026-06-24 至 2026-06-24 共收录 20
2606.24842 2026-06-24 cs.AI 新提交

World Models in Pieces: Structural Certification for General Agents

分片世界模型:通用智能体的结构化认证

Yikai Lu, Yifei Wu, Xinyu Lu, Tongxin Li

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen, Shenzhen, China(香港中文大学(深圳)数据科学学院)

AI总结 针对通用智能体在大世界场景下无法普遍胜任的问题,提出结构化认证框架,通过深度组合目标过滤特定转移,证明世界模型具有O(1/n)+O(δ)误差界,实现可认证部署。

Comments 30 pages, camera-ready version in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24790 2026-06-24 cs.LG cs.AI 新提交

Grad Detect: Gradient-Based Hallucination Detection in LLMs

Grad Detect: 基于梯度的 LLM 幻觉检测

Anand Kamat, Daniel Blake, Brent M. Werness

机构 * Amazon(亚马逊)

AI总结 提出 Grad Detect,通过单次前向-反向传播中的逐层梯度模式检测 LLM 幻觉,在多项基准上优于置信度与采样基线,并发现最后五层集中了97%以上的判别梯度信号。

Comments Accepted to the 2nd Workshop on Compositional Learning at ICML 2026, Seoul, South Korea. Copyright 2026 by the author(s)

Journal ref 2nd Workshop on Compositional Learning: Safety, Interpretability, and Agents, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24669 2026-06-24 cs.AI 新提交

LaGO: Latent Action Guidance for Online Reinforcement Learning

LaGO:面向在线强化学习的潜在动作引导

Kuan-Yen Liu, Ren-Jyun Huang, Ti-Rong Wu

机构 * Siebel School of Computing(计算科学系) Data Science, University of Illinois Urbana-Champaign, USA(数据科学,伊利诺伊大学厄巴纳-香槟分校,美国) Department of Computer Science, National Yang Ming Chiao Tung University, Taiwan(计算机科学系,National Yang Ming Chiao Tung大学,台湾) Institute of Information Science, Academia Sinica, Taiwan(信息科学研究所, Academia Sinica,台湾)

AI总结 提出LaGO框架,利用预训练大语言模型作为潜在动作先验,软引导在线策略优化,在离散和连续控制基准上显著提升奖励与成功率。

Comments 9 pages, 2 figures. Accepted at the ICML 2026 Workshop on Large Language Models for Planning (LM4Plan)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24626 2026-06-24 cs.AI 新提交

SAFARI: Scaling Long Horizon Agentic Fault Attribution via Active Investigation

SAFARI: 通过主动调查扩展长时域智能体故障归因

Chenyang Zhu, Jiayu Yao, Kushal Chawla, Youbing Yin, Nathan Wolfe, Pengshan Cai, Jingyu Wu, Spencer Hong, Sangwoo Cho, Shi-Xiong Zhang, Daben Liu, Sambit Sahu, Erin Babinsky

机构 * Department of Engineering Sciences(工程科学系) Applied Mathematics, Northwestern University(应用数学,西北大学)

AI总结 提出SAFARI框架,用工具增强的诊断循环替代线性上下文加载,结合短期记忆解耦诊断准确性与上下文限制,在Who&When和TRAIL GAIA数据集上分别提升20%和19%,并在超出上下文窗口5倍时保持0.58精度。

Comments Published at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24509 2026-06-24 cs.LG cs.AI cs.SI 新提交

A Fair Evaluation of Graph Foundation Models for Node Property Prediction

图基础模型在节点属性预测中的公平评估

Oleg Platonov, Gleb Bazhenov, Dmitry Eremeev, Liudmila Prokhorenkova

机构 * HSE University(俄罗斯高等经济学院) Yandex Research(Yandex研究院)

AI总结 本文对9种图基础模型进行公平评估,发现仅基于先验数据拟合网络的最新模型在预测性能上优于调优的图神经网络,但推理成本更高。

Comments Accepted at The Workshop on Graph Foundation Models at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24292 2026-06-24 cs.CV 新提交

ActiveScope: Actively Seeking and Correcting Perception for MLLMs

ActiveScope: 主动寻求和纠正MLLMs的感知

Yajing Wang, Chao Bi, Junshu Sun, Shufan Shen, Zhaobo Qi, Shuhui Wang, Qingming Huang

机构 * University of Chinese Academy of Sciences(中国科学院大学) State Key Lab of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(中国科学院人工智能安全国家重点实验室,计算技术研究所,北京,中国) Harbin Institute of Technology (Weihai)(哈尔滨工业大学(威海))

AI总结 提出ActiveScope框架,通过语义锚点定位和干扰抑制细化模块,解决MLLMs在高分辨率图像中的细粒度感知问题,在V* Bench上达到96.34%准确率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24124 2026-06-24 cs.AI 新提交

VeryTrace: Verifying Reasoning Traces through Compilable Formalism and Structured Verification

VeryTrace: 通过可编译形式化与结构化验证验证推理轨迹

Ninghan Zhong, Ahmet Ege Tanriverdi, Kaan Kale, Sriram Vishwanath

机构 * School of Electrical and Computer Engineering, Georgia Institute of Technology, USA(佐治亚理工学院电子与计算机工程学院) Department of Electrical and Computer Engineering, Bogazici University, Turkey(博亚奇大学电子与计算机工程系)

AI总结 提出VeryTrace框架,将自然语言推理轨迹形式化为可编译的领域特定语言(DSL),结合确定性检查与LLM审计进行混合验证,实现步骤级错误定位与修复,在数学、机器人规划、亲属推理任务上提升准确率。

Comments Accepted at LM4Plan Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23995 2026-06-24 cs.LG cs.AI cs.GT cs.MA 新提交

EMAgnet: Parameter-Space EMA Regularization for Policy Gradient Self-Play in Large Games

EMAgnet:大规模博弈中策略梯度自我博弈的参数空间EMA正则化

Tristan Maidment, JB Lanier, Chase McDonald, Nathan Tsang, Eugene Vinitsky, Roy Fox, Albert Wang, Wesley N. Kerr

机构 * Riot Games(拳头游戏) University of California, Irvine(加州大学尔湾分校) New York University(纽约大学)

AI总结 提出EMAgnet,通过指数移动平均(EMA)对策略参数进行自适应正则化,替代均匀分布正则化,在两人零和博弈中降低可剥削性。

Comments Accepted at NExT-Game 2026: New Frontiers in Game-Theoretic Learning (ICML 2026 Workshop). 13 pages, 2 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23740 2026-06-24 cs.LG cs.AI 新提交

Weight-Space Geometry of Offline Reasoning Training

离线推理训练的权重空间几何

Aleksandr Nikolich, Igor Kiselev, Vladimir Platonov, Karina Romanova

AI总结 通过余弦相似度、主角度子空间分析等方法,研究六种离线强化学习方法在数学推理任务中的权重更新几何,发现SFT、RFT、RIFT几乎共线,DFT方向偏离,Offline GRPO添加正交分量,DPO位于近正交子空间且准确率最高。

Comments accepted for ICML 2026 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23716 2026-06-24 cs.CY cs.AI 新提交

Legal Reasoning Is Not Lawyering: Rethinking Legal Benchmarks for Pro Se Access to Justice

法律推理不是律师工作:重新思考面向自助诉讼的司法基准

Andrew Lou, David Shin

机构 * Yale Law School, USA(耶鲁法学院,美国)

AI总结 本文指出当前法律AI基准仅评估专家预处理后的输入,忽略了自助诉讼者提供的杂乱、有误的提示,导致模型性能高估;通过实验展示上下界差距,呼吁建立直接衡量鲁棒性的基准。

Comments Both authors contributed equally. Accepted to the AI4Law Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21543 2026-06-24 cs.RO 版本更新

Self-CriTeach: LLM Self-Teaching and Self-Critiquing for Improving Robotic Planning via Automated Domain Generation

Self-CriTeach: LLM 自我教学与自我批评用于通过自动领域生成提升机器人规划

Jinbang Huang, Zhiyuan Li, Yuanzhao Hu, Zhanguang Zhang, Mark Coates, Xingyue Quan, Yingxue Zhang

机构 * Huawei Noah's Ark Lab(华为诺亚实验室) University of Toronto(多伦多大学) University of British Columbia(不列颠哥伦比亚大学) McGill University(麦吉尔大学)

AI总结 本文提出Self-CriTeach框架,通过LLM自动生成符号规划领域,用于自我教学生成规划问题-计划对及自我批评生成结构化奖励信号,提升机器人规划性能与泛化能力。

Comments International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00348 2026-06-24 cs.CR cs.CL 版本更新

Block-wise Codeword Embedding for Reliable Multi-bit Text Watermarking

分块码字嵌入用于可靠的多比特文本水印

Joeun Kim, HoEun Kim, Dongsup Jin, Young-Sik Kim

机构 * Department of AI, DGIST, Daegu, Republic of Korea(韩国大邱科学技术院人工智能系) Department of EECS, DGIST, Daegu, Republic of Korea(韩国大邱科学技术院电子工程与计算机科学系) ICT convergence, University of Ulsan, Ulsan, Republic of Korea(韩国釜山大学信息通信融合学院)

AI总结 本文提出BREW框架,通过分块盲消息估计和窗口位移验证,解决多比特水印中高误报率问题,实现高真阳性率和低误报率。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11284 2026-06-24 cs.LG cs.AI cs.LO 版本更新

THEIA: Learning Complete Kleene Three-Valued Logic in a Pure-Neural Modular Architecture

THEIA:在纯神经模块架构中学习完整的克里尔三值逻辑

Augustus Haoyang Li

机构 * Irvine Valley College(伊文斯谷学院)

AI总结 THEIA通过纯神经模块架构学习完整的克里尔三值逻辑,展示了其在任务数据中无需外部符号推理或手编码K3门原语的能力,同时揭示了学习系统中的不确定性传播和可靠性光谱特性。

Comments 41 pages, 3 figures, 15 tables, 8 appendices (A-H). Accepted to the 2nd Workshop on Compositional Learning at ICML 2026 (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14843 2026-06-24 stat.ML cs.LG stat.ME 版本更新

Predictive variational inference: Learn the predictively optimal posterior distribution

预测变分推断:学习预测最优的后验分布

Jinlin Lai, Antonio Linero, Yuling Yao

机构 * College of Information and Computer Sciences, University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校信息与计算机科学学院) Department of Statistics and Data Sciences, University of Texas, Austin(德克萨斯大学奥斯汀分校统计与数据科学系)

AI总结 提出预测变分推断(PVI)框架,通过优化后验分布使预测分布逼近真实数据生成过程,解决模型误设问题,并实现自动模型诊断。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20450 2026-06-24 cs.CL cs.AI cs.CY cs.LG 版本更新

Policies Permitting LLM Use for Polishing Peer Reviews Are Currently Not Enforceable

允许使用LLM润色同行评审的政策目前无法执行

Rounak Saha, Gurusha Juneja, Dayita Chaudhuri, Naveeja Sajeevan, Nihar B Shah, Danish Pruthi

机构 * Indian Institute of Science(印度科学研究院) University of California, Santa Barbara(加州大学圣芭芭拉分校) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本研究通过模拟多级人机协作的同行评审数据集,评估五种AI文本检测器,发现它们无法可靠区分LLM润色后的评审与纯人工评审,导致误判风险,表明当前政策不可执行。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15510 2026-06-24 cs.LG 版本更新

Not All Invariants Are Equal: Curating Training Data to Accelerate Program Verification with SLMs

并非所有不变式都同等重要:利用SLM通过精选训练数据加速程序验证

Ido Pinto, Yizhak Yisrael Elboher, Haoze Wu, Nina Narodytska, Guy Katz

机构 * Hebrew University of Jerusalem, Israel(特拉维夫大学) Amherst College, USA(阿默斯特学院) VMware Research by Broadcom, USA(Broadcom VMware 研究)

AI总结 提出Wonda数据筛选流水线,通过AST归一化和LLM语义重写从原始验证器输出中提取高质量训练不变式,微调小语言模型(SLM)后,在多个模型上使不变式正确性和加速率翻倍甚至三倍,小模型性能媲美大模型。

Comments A preprint of the ICML 2026 paper with the same title

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22548 2026-06-24 cs.CL cs.AI cs.LG 版本更新

Are LLM Evaluators Really Narcissists? Sanity Checking Self-Preference Evaluations

LLM评估者真的是自恋者吗?对自我偏好评估的健全性检查

Dani Roytburg, Matthew Bozoukov, Matthew Nguyen, Jou Barzdukas, Mackenzie Puig-Hall, Narmeen Oozeer

机构 * Department of Machine Learning, Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学机器学习系) Department of Computer Science and Engineering, University of California San Diego, La Jolla, CA, USA(加州大学圣地亚哥分校计算机科学与工程系) Department of Computer Science, University of Virginia, Charlottesville, VA, USA(弗吉尼亚大学计算机科学系) Martian Research, San Francisco, California, USA(火星研究公司) Apart Research, San Francisco, California, USA(Apart研究公司)

AI总结 通过比较评估者自我评价与评价其他模型时的投票分布,发现仅51%的先前结果具有统计显著性,表明自我偏好主要由评估者质量而非自恋驱动。

Comments ICML 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22879 2026-06-24 math.OC cs.LG 版本更新

Mixtures Closest to a Given Measure: A Semidefinite Programming Approach

最接近给定测度的混合:一种半定规划方法

Srećko Đurašinović, Jean-Bernard Lasserre, Victor Magron

机构 * College of Computing and Data Science, NTU, Singapore(新加坡国立大学计算与数据科学学院) LAAS-CNRS, Toulouse, France(法国图卢兹CNRS-Laas研究所) Toulouse School of Economics(图卢兹经济学院)

AI总结 针对仅知有限矩的目标测度,提出半定规划松弛层次法,用参数族混合逼近并最小化2-Wasserstein或全变差距离,渐近收敛且满足秩条件时有限收敛,可应用于聚类。

Comments 23 pages, 2 algorithms, 1 table, 4 figures

Journal ref ICML 2026 (oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13087 2026-06-24 cs.LG cs.AI 版本更新

Graph Alignment for Benchmarking Graph Neural Networks and Learning Positional Encodings

图对齐:用于基准测试图神经网络和学习位置编码

Adrien Lagesse, Marc Lelarge

机构 * INRIA, École Normale Supérieure - PSL, Paris, France(INRIA,法国国家信息与自动化研究所,巴黎高等师范学院-巴黎理工学院,巴黎,法国)

AI总结 提出基于图对齐问题的GNN基准测试方法,通过自监督学习生成难度递增的数据集,发现各向异性模型表现更优,且预训练嵌入可作为位置编码用于图回归或高精度结构重建。

Comments International Conference on Machine Learning, Seoul, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02583 2026-06-24 cs.LG

Transformer-based Stagewise Decomposition for Large-Scale Multistage Stochastic Optimization

基于Transformer的分阶段分解用于大规模多阶段随机优化

Chanyeong Kim, Jongwoong Park, Hyunglip Bae, Woo Chang Kim

机构 * Department of Industrial and Systems Engineering, KAIST, Daejeon, Republic of Korea(韩国成均馆大学工业与系统工程系) NCSOFT Corporation, Seongnam, Republic of Korea(韩国水原NCSOFT公司)

AI总结 本文提出TranSDDP算法,利用Transformer结构改进传统SDDP,通过生成分段线性近似函数提升大规模多阶段随机优化问题的求解效率与精度。

Comments Accepted at ICML 2023 (Oral Presentation)

Journal ref Proceedings of the 40th International Conference on Machine Learning, PMLR 202:16747-16770, 2023

详情

展开后加载摘要…

URL PDF HTML 收藏