arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Machine Learning · 会议 · Machine Learning

共收录 11753
2606.29503 2026-06-30 cs.CL cs.AI

The Verbose Context Problem in Medical Records

医疗记录中的冗长上下文问题

Shiva Kaul, Min-Gyu Kim, Anjum Khurshid, Sriram Vishwanath

机构 * Department of Population Medicine(人口医学部) Department of Biomedical Informatics(生物医学信息学部) School of Electrical and Computer Engineering(电气与计算机工程学院)

AI总结 针对群体健康分析中结构化概念导致的长文本瓶颈,提出PopMedQA基准,通过人工患者记录生成库neopatient构建任务,发现领域无关方法无法缓解该问题。

Comments SD4H ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29493 2026-06-30 cs.AI

Faults in Our Formal Benchmarking: Dataset Defects and Evaluation Failures in Lean Theorem Proving

我们形式化基准测试中的缺陷:Lean定理证明中的数据集缺陷与评估失败

Pawan Sasanka Ammanamanchi, Siddharth Bhat, Stella Biderman

AI总结 通过大规模静态检查器审计五个Lean定理证明基准,发现398个机械可验证问题(如反例、空洞定理),并提出缺陷分类、自动检查工具和评估标准。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29399 2026-06-30 cs.AI

LLM-Guided Planning for Multi-hop Reasoning over Multimodal Nuclear Regulatory Documents

LLM引导的规划:多模态核监管文档的多跳推理

Mingyu Jeon, Bokyeong Kim, Suwan Cho, Jae Young Suh, Yonggyun Yu

AI总结 提出LLM引导的规划方法,通过动态知识图谱状态和文档树工具,在多跳推理任务中实现81.5%准确率,显著优于无状态规划方法。

Comments Accepted at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond @ ICML 2026. 8 pages (main), 3 figures, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29346 2026-06-30 cs.LG

Reliability, Faithfulness, and the Limits of Post-hoc Explanations of Opaque Scientific Models

可靠性、忠实性与不透明科学模型事后解释的局限性

Nick Oh, Helen Jin

机构 * socius labs(socius实验室)

AI总结 本文论证事后解释方法不能仅凭可靠性和忠实性保证对现象结构的洞察,需外部验证支持候选假设。

Comments Presented at PhilML Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29331 2026-06-30 cs.LG stat.ML

Sample Complexity of Scientific Discovery: PAC Learnability of Compositional Function Trees

科学发现的样本复杂度:组合函数树的PAC可学习性

Şuayp Talha Kocabay, Talha Rüzgar Akkuş, Kerem Yalçın

AI总结 研究组合函数树的PAC可学习性,证明其Rademacher复杂度由深度和算子Lipschitz常数控制,风险界为O(L^d/√n),并通过实验验证理论。

Comments Accepted to the 2nd Workshop on Compositional Learning: Safety, Interpretability, and Agents at ICML 2026. To be presented in Seoul, South Korea, July 11, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29282 2026-06-30 cs.CV

ScaleErasure: Inference-Time Minimal Intervention for Precise Concept Erasure in Next-Scale Autoregressive Image Generation

ScaleErasure:下一尺度自回归图像生成中精确概念擦除的推理时最小干预

Cong Wang, Haiyu Wu, Zhiwei Jiang, Zifeng Cheng, Fei Shen, Yafeng Yin, Qing Gu

AI总结 提出ScaleErasure方法,通过推理时对与不安全概念最相关的logits进行选择和引导,在下一尺度自回归图像生成中实现精确概念擦除,同时保持生成能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29278 2026-06-30 cs.AI cs.CL

The Complexity Ceiling Benchmark: A Multi-Domain Evaluation of Sequential Reasoning Under Depth Scaling

复杂性天花板基准:深度缩放下顺序推理的多领域评估

Shubh Chapra, Dhruv Kumar, Murari Mandal, Yash Sinha

AI总结 提出复杂性天花板基准(CCB),通过控制任务语义内容、仅改变推理深度N,评估语言模型在三个结构不同领域中的顺序推理衰减,发现几何级数衰减和领域天花板差异,并引入跟踪级指标TFBC。

Comments 12 pages, 6 figures. Accepted to the 1st Workshop on Combining Theory and Benchmarks (CTB), CTB@ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29196 2026-06-30 cs.LG cs.CL

Representational Depth of Evaluation Awareness Shifts With Scale in Open-Weight Language Models

评估意识表征深度随规模在开放权重语言模型中变化

Archit Manek

AI总结 研究发现,在Qwen 2.5和Gemma 2等模型中,评估意识线性可恢复的层从较小模型的后期层转移到较大模型的早期层,表明规模改变了评估意识的表征深度,且白盒探针信号强于黑盒行为表达。

Comments 9 pages, 3 figures. Accepted at the Mechanistic Interpretability Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29178 2026-06-30 cs.AI cs.CL cs.LG

Selective Memory Retention for Long-Horizon LLM Agents

面向长周期LLM智能体的选择性记忆保留

Pranath Reddy

AI总结 提出TraceRetain框架,通过可解释特征评分和驱逐机制管理有限外部记忆,在噪声环境下保持任务成功率,验证了选择性记忆保留对长周期智能体的有效性。

Comments Accepted at the International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29175 2026-06-30 cs.AI cs.CY

Direct Causation in International Humanitarian Law and the Challenge of AI-Mediated Civilian Cyber Operations

国际人道法中的直接因果关系与AI中介平民网络行动的挑战

Alice Saito, Harold Godsoe, Phan Xuan Tan

AI总结 本文分析AI中介平民网络行动如何挑战国际人道法中“直接参与敌对行动”的因果关系标准,指出自主多智能体系统导致“一个因果步骤”标准失效,并提出目标规范粒度是关键属性。

Comments 11 pages, 1 figure, Workshop on Technical AI Governance Research ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29091 2026-06-30 cs.LG cs.AI cs.DB

Statistically Indistinguishable, Operationally Distinct: A Formal Barrier for Tabular Foundation Models

统计不可区分,操作上截然不同:表格基础模型的形式化障碍

Tassilo Klein, Johannes Hoffart

机构 * SAP SE(SAP公司)

AI总结 本文提出操作图灵测试,证明仅基于值的表格模型无法区分合法与违规数据库状态,而操作审计特征可突破该障碍,揭示可识别性而非模型容量是根本限制。

Comments Accepted at the 2nd ICML Workshop on Foundation Models for Structured Data, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28963 2026-06-30 cs.CL cs.CY cs.LG

Beyond the Mean: Three-Axis Fidelity for Aligning LLM-Based Survey Simulators from Small Pilot Data

超越均值:从小型试点数据对齐基于LLM的调查模拟器的三轴保真度

Eun Cheol Choi, Youngrae Kim, Prabhu Pugalenthi, Hong-En Chen, Bo-Ruei Huang

AI总结 针对LLM模拟社会调查响应时的系统偏差,提出结构、边际和个体三轴保真度框架,通过提示、修正和微调三种方法对比,发现微调小型试点数据可实现平衡保真度,但保真度水平因子样本而异。

Comments 11 pages, 8 tables, 3 figures; Pluralistic Alignment @ ICML 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28843 2026-06-30 cs.CL cs.AI

The Heterogeneous Safety Impacts of Benign Multilingual Fine-Tuning

良性多语言微调的安全影响异质性

Will Hawkins, Kaivalya Rawal, Jonathan Rystrøm, Stratis Tsirtsis, Zihao Fu, Greta Warren, Ryan Brown, Eoin Delaney, Sandra Wachter, Brent Mittelstadt, Chris Russell

AI总结 本研究通过多语言良性数据微调LLM,发现安全结果对微调语言和评估语言高度敏感,对抗性合规率在某些设置下增加四倍,且多语言安全漂移与通用能力指标脱钩,呈现异质性。

Comments 9 pages

Journal ref Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28831 2026-06-30 cs.LG cs.AI

HARD-KV: Head-Adaptive Regularization for Decoding-time KV Compression

HARD-KV: 面向解码时KV压缩的头自适应正则化

Yuxuan Yang, Feiyang Ren, Bowen Zeng, Dalin Zhang, Jinpeng Chen, Gang Chen, Huan Li

AI总结 提出HARD-KV框架,通过级联缓存层次和对数校准机制,解决头自适应压缩算法与静态内存模式的不匹配,实现高效长上下文推理。

Comments 25 pages, ICML 2026 poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28764 2026-06-30 cs.LG

Hierarchical Decision Making with Structured Policies: A Principled Design via Inverse Optimization

基于结构化策略的分层决策:通过逆优化的原则性设计

Yuexuan Wang, Jingyuan Zhou, Kaidi Yang

AI总结 提出一种逆优化框架,将上层目标抽象与下层结构化决策整合,确保下层策略目标与长期任务一致,在资源分配和避障任务中优于端到端RL等方法。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28747 2026-06-30 cs.AI cs.LG

Self-Supervised Theorem Discovery in a Formal Axiomatic System

形式化公理系统中的自监督定理发现

Kazuki Ota, Takayuki Osa, Tatsuya Harada

机构 * The University of Tokyo, Japan(东京大学,日本) RIKEN AIP, Japan(日本RIKEN AIP)

AI总结 提出一种自监督定理发现算法,通过交替进行证明搜索和有用定理提取,从公理和推理规则出发逐步构建定理库,实验表明发现的定理具有人类数学意义且能提升大语言模型证明性能。

Comments AI for Math Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28730 2026-06-30 math.ST stat.ML stat.TH

Full Conformal Prediction under Stochastic Non-Conformity Measure

随机非一致性度量下的全共形预测

Thanawat Sornwanee

AI总结 针对机器学习中随机非一致性度量导致传统全共形预测条件不充分的问题,提出条件独立与分布置换不变性作为新的充分条件,并验证其有效性。

Comments ICML 2026 Hypothesis Testing Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28694 2026-06-30 cs.CY

Verifying Restrictions on Frontier AI Research

验证前沿人工智能研究的限制

Aaron Scher

AI总结 本文分析如何验证国际协议中对人工智能研究的限制,探讨影响可验证性的关键因素,并列举28种候选验证机制,为未来开发可部署工具奠定基础。

Comments 12 pages. Accepted to the Second Workshop on Technical AI Governance Research (TAIGR) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28615 2026-06-30 cs.LG cs.AI cs.CL stat.ML

What LLMs explain is not what they believe: Evaluating explanation sufficiency under models' own input beliefs

LLM 解释的内容并非其信念:基于模型自身输入信念评估解释充分性

Nhi Nguyen, Shauli Ravfogel, Rajesh Ranganath

机构 * New York University(纽约大学)

AI总结 提出自洽充分性(SCSuff)指标,利用 LLM 自身生成替代输入来评估自由文本解释的充分性,发现 LLM 解释通常不充分且与模型大小、准确率等弱相关。

Comments 23 pages, 9 figures, 13 tables, Forty-Third International Conference on Machine Learning (ICML 2026)

Journal ref Forty-Third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28460 2026-06-30 cs.LG cs.AI

Counterfactual Residual Data Augmentation for Regression

反事实残差数据增强用于回归

Hossein Mohebbi, Oliver Schulte, Ke Li, Pascal Poupart

机构 * University of Waterloo(滑铁卢大学) Vector Institute(向量研究所)

AI总结 针对回归任务中数据有限、噪声大的问题,提出反事实残差数据增强(CRDA)方法,利用残差不变性生成新样本,在多个数据集上平均降低MLP回归器MSE 22.9%,XGBoost回归器MSE 6.4%。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026). 25 pages, 8 figures. Project page: https://crda-project.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28433 2026-06-30 cs.LG

Position: RL Researchers Need to Distinguish Between Solving Simulators and Using Simulators as a Proxy

立场:强化学习研究者需要区分解决模拟器和将模拟器作为代理使用

Matthew Vandergrift, Esraa Elelimy, Martha White

机构 * Department of Computing Science, University of Alberta(阿尔伯塔大学计算科学系) Alberta Machine Intelligence Institute (Amii)(阿尔伯塔机器智能研究所)

AI总结 本文主张强化学习研究者应明确区分两种模拟器使用场景:解决模拟器本身与将模拟器作为部署学习的代理,并分析两者在约束、算法和评估指标上的差异,避免误导性结论。

Comments This work has been accepted at the ICML 2026 position paper track. The peer reviewed reference is provided in the public OpenReview page at https://openreview.net/forum?id=KIobEIpCkp Additionally the publication can be seen at this link : https://icml.cc/virtual/2026/poster/67184

Journal ref ICML, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28348 2026-06-30 cs.NI

Intent-Driven 6G Service Orchestration: Grounded Translation, Validation, and Decomposition

意图驱动的6G服务编排:基于目录的翻译、验证与分解

Jean Martins, Leonid Mokrushin, Marin Orlic, Amardeep Kumar A

AI总结 提出一个三阶段智能体工作流,通过语义服务目录、SHACL验证和约束满足分解,实现6G意图驱动编排,在930次基准测试中成功率达97%,并减少26%的对抗性幻觉。

Comments AI4NextG @ ICML'26 Workshop on AI and ML for Next-Generation Wireless Communications and Networking

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28347 2026-06-30 cs.CY cs.AI cs.LG

Agentic Safety is an Epistemic Property, Not a Behavioral One

智能体安全是认知属性,而非行为属性

Charles L. Wang, Keir Dorchen, Peter Jin

AI总结 本文提出AI安全应视为认知属性,强调系统需保持可教性(teachability),即在学习、适应和自修改过程中仍能被纠正。

Comments To appear in proceedings of ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28343 2026-06-30 cs.IR cs.AI

The Crowded Embedding Space: A Mean-Field Mechanism for Emergent Marginalization in Retrieval-Augmented Agents

拥挤的嵌入空间:检索增强型智能体中涌现边缘化的平均场机制

Shwan Ashrafi, Dan Roth

AI总结 研究检索增强型智能体中密集检索导致少数内容被边缘化的问题,通过静态和动态分析揭示平均场机制,证明局部相关性目标会系统性地排斥少数兴趣。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08831 2026-06-30 cs.AI 新提交

Inference-Time Conformal Reasoning with Valid Factuality Control for Large Language Models

面向大语言模型的推理时保形推理与有效事实性控制

Ting Wang, Yuanjie Shi, Yan Yan, Huan Zhang

机构 * Machine Learning, ICML(机器学习,国际机器学习大会)

AI总结 提出推理时保形推理框架,将保形预测集成到推理图生成中,通过图级不确定性校准生成停止阈值,实现有效事实性控制。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04050 2026-06-30 cs.LG cs.AI

LiftQuant: Continuous Bit-Width LLM via Dimensional Lifting and Projection

LiftQuant: 通过维度提升和投影实现连续位宽的LLM

Liulu He, XuanAng Liu, Juntao Liu, Taolue Feng, Ting Lu, Chunsheng Gan, Zhiyv Peng, Yuan Du, Huanrui Yang, Yijiang Liu, Li Du

机构 * Nanyang Technological University(南洋理工大学)

AI总结 提出LiftQuant框架,通过“提升-投影”机制实现准连续位宽控制,以精确适配内存预算,在70B模型上以2.4位压缩超越现有2位模型。

Comments ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01215 2026-06-30 cs.CV cs.AI cs.CL cs.MM

Distilling Neuro-Symbolic Programs into 3D Multi-modal LLMs

将神经符号程序蒸馏到3D多模态大语言模型中

Wentao Mo, Yang Liu

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 提出APEIRIA,通过三阶段课程学习将符号推理模式蒸馏到3D多模态大语言模型中,实现透明推理与开放词汇空间推理的统一。

Comments To appear in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24844 2026-06-30 cs.AI cs.CL

Geo-Expert: Towards Expert-Level Geological Reasoning via Parameter-Efficient Fine-Tuning

Geo-Expert: 通过参数高效微调实现专家级地质推理

Chenyou Guo, Zongqi Liu, Yizhou Zhang, Zhaorui Jiang, Ze Liu

机构 * Ocean University of China(中国海洋大学) Peking University(北京大学) Monash University(墨尔本大学)

AI总结 本文提出Geo-Expert,通过参数高效微调(LoRA)在定制高质量指令数据集上微调小规模语言模型,在专门的地质推理基准Geo-Eval上,8B模型超越70B通用模型和GPT-4o,32B模型接近前沿推理模型。

Comments 11 pages, 1 figure, 3 tables. Accepted at ICML 2026 AI for Science Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16172 2026-06-30 cs.AI

Inference-Time Diversity in RL-Trained Lean Theorem Provers: A Diagnostic Study

强化学习训练的轻量定理证明器推理时的多样性:诊断研究

Zachary Burton

机构 * MIT(麻省理工学院)

AI总结 研究发现强化学习训练的轻量定理证明器在推理时存在模式崩溃,通过增加采样预算未能提升解题数量,但固定战术骨架调度可显著提升性能,且多样性控制揭示了提示多样性对证明能力的影响。

Comments 9 pages, accepted at the ICML AI4Math Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06516 2026-06-30 cs.CL

You Had One Job: Per-Task Quantization Using LLMs' Hidden Representations

你只有一份工作:利用LLM隐藏表示进行每任务量化

Amit LeVi, Raz Lapid, Rom Himelstein, Chaim Baskin, Ravid Shwartz Ziv, Avi Mendelson

机构 * Technion—Israel Institute of Technology(技术ion—以色列理工学院) Zenity(Zenity公司) DeepKeep(DeepKeep公司) Ben-Gurion University of the Negev(巴伊兰大学) New York University(纽约大学)

AI总结 本文提出TAQ框架,通过任务校准提示分配更高精度给任务相关的transformer层,提升精度-内存比和部署性能。

Comments Accepted at ICML 2026 Workshop on AdaptFM: Resource-Adaptive Foundation Model Inference

详情

展开后加载摘要…

URL PDF HTML 收藏