arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Machine Learning · 会议 · Machine Learning

2026-05-20 至 2026-05-20 共收录 46
2605.07379 2026-05-20 cs.CV cs.AI

RELO: Reinforcement Learning to Localize for Visual Object Tracking

RELO:用于视觉目标跟踪的强化学习定位

Xin Chen, Chuanyu Sun, Jiao Xu, Houwen Peng, Dong Wang, Huchuan Lu, Kede Ma

机构 * City University of Hong Kong(香港城市大学) Hunyuan Team, Tencent(腾讯文心团队) Dalian University of Technology(大连理工大学)

AI总结 本文提出RELO方法,通过将目标定位建模为马尔可夫决策过程,利用强化学习替代传统手工设计的空间先验,以提升跟踪性能和一致性。

Comments ICML 2026 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05974 2026-05-20 cs.CR cs.AI

PragLocker: Protecting Agent Intellectual Property in Untrusted Deployments via Non-Portable Prompts

PragLocker: 通过非可移植提示保护代理知识产权

Qinfeng Li, Yuntai Bao, Jianghui Hu, Wenqi Zhang, Jintao Chen, Huifeng Zhu, Yier Jin, Xuhong Zhang

机构 * Zhejiang University(浙江大学) Management Center, School of Software Technology (Ningbo), Zhejiang University(浙江大学软件学院(宁波)管理中心) University of Science and Technology of China(中国科学技术大学) Chang'an University(长安大学) Washington University in St. Louis(圣路易斯华盛顿大学)

AI总结 针对无信任部署中代理提示易被复制和重用的问题,PragLocker提出了一种保护方案,通过构建语义锚定的混淆提示并注入噪声,有效降低跨LLM可移植性,同时保持目标性能和对抗鲁棒性。

Comments accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04525 2026-05-20 cs.RO

HDFlow: Hierarchical Diffusion-Flow Planning for Long-horizon Tasks

HDFlow:用于长时间任务的分层扩散-流规划

Nandiraju Gireesh, Yuanliang Ju, Chaoyi Xu, Weiheng Liu, Yuxuan Wan, He Wang

机构 * Peking University(北京大学) University of Toronto(多伦多大学)

AI总结 本文提出HDFlow,一种新的分层规划框架,利用扩散和修正流模型的优势,克服了单一范式生成规划器的局限性,通过在模拟和现实中的家具组装任务验证其有效性。

Comments ICML 2026 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00578 2026-05-20 cs.CV

Federated Distillation for Whole Slide Image via Gaussian-Mixture Feature Alignment and Curriculum Integration

通过高斯混合特征对齐和课程整合实现全切片图像的联邦蒸馏

Luru Jing, Cong Cong, Yanyuan Chen, Yongzhi Cao

机构 * School of Computer Science, Peking University, Beijing, China(北京大学计算机科学系) Center for Health Informatics, Australian Institute of Health Innovation, Macquarie University, Sydney, NSW 2113, Australia(健康信息学中心,澳大利亚健康创新研究所,麦考利大学,悉尼,NSW 2113,澳大利亚) School of Data Science, University of Virginia, Charlottesville, VA, USA(数据科学学院,弗吉尼亚大学,夏洛特维尔,VA,美国)

AI总结 本文提出FedHD框架,通过高斯混合特征对齐和课程整合策略,在联邦学习中实现全切片图像分析,通过本地生成的语义丰富合成特征表示提升模型性能,同时保持诊断多样性。

Comments Accepted by ICML 2026, Camera-Ready version updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23183 2026-05-20 cs.CY cs.AI

Designing escalation criteria for international AI incident response: criteria, triggers, and thresholds

设计国际AI事件响应的升级标准:标准、触发条件和阈值

Francesca Gomez, Matthew Ball, Michael Harre, Lydia Preston, Josephine Schwab, Caio Machado

AI总结 本文提出了一种升级框架,用于确定何时需要将检测到的AI事件从国家层面升级到国际协调,通过分析现有法规和行业框架,提出了八个评估标准,并测试了该框架在实际AI事件中的应用,识别了可能导致系统性漏检的设计模式。

Comments Version accepted to ICML TAIGR workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07777 2026-05-20 cs.MA cs.GT

Talk, Judge, Cooperate: Gossip-Driven Indirect Reciprocity in Self-Interested LLM Agents

谈话、评判、合作:在自利LLM代理中基于 gossip 的间接互惠

Shuhui Zhu, Yue Lin, Shriya Kaistha, Wenhao Li, Baoxiang Wang, Hongyuan Zha, Gillian K. Hadfield, Pascal Poupart

AI总结 本文提出ALIGN框架,通过策略性分享开放式 gossip 实现去中心化代理的声誉形成、信任评估和社会规范协调,从而提升间接互惠并抵御恶意入侵,发现LLM的更强推理能力促进更激励对齐的合作,而聊天模型容易过度合作。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03454 2026-05-20 cs.CV

Contextualized Visual Personalization in Vision-Language Models

基于上下文的视觉个性化在视觉-语言模型中

Yeongtak Oh, Sangwon Yu, Junsung Park, Han Cheol Moon, Jisoo Mok, Sungroh Yoon

机构 * Department of Electrical and Computer Engineering, Seoul National University, Seoul, South Korea(电气电子工程系,首尔国立大学,首尔,韩国) Interdisciplinary Program in Artificial Intelligence, Seoul National University, Seoul, Korea(人工智能交叉学科项目,首尔国立大学,首尔,韩国)

AI总结 本文提出了一种基于上下文的视觉个性化方法,通过强化学习和生成增强技术改进视觉-语言模型的个性化图像描述能力,并通过诊断评估验证了模型对视觉上下文的真实利用,展示了CoViP在下游个性化任务中的全面提升。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21484 2026-05-20 cs.LG

ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment

ETS: 为无训练强化学习对齐的能耗引导测试时缩放

Xiuyu Li, Jinkai Zhang, Mingyang Yi, Yu Li, Longqiang Wang, Yue Wang, Ju Fan

机构 * Renmin University of China, Beijing, China(中国人民大学,北京,中国) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国)

AI总结 本文提出了一种无需训练的推理方法,直接从最优强化学习策略中采样,通过结合参考策略模型和能耗项来改进掩码语言模型的过渡概率,并通过在线蒙特卡洛方法估计关键能耗项,从而提高生成质量。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12707 2026-05-20 cs.LG stat.ML

Decoding Rewards in Competitive Games: Inverse Game Theory with Entropy Regularization

在竞争性游戏中解码奖励:带有熵正则化的逆向博弈论

Junyi Liao, Zihan Zhu, Ethan Fang, Zhuoran Yang, Vahid Tarokh

机构 * Department of Electrical and Computer Engineering, Duke University(杜克大学电气与计算机工程系) Department of Statistics and Data Science, University of Pennsylvania(宾夕法尼亚大学统计与数据科学系) Department of Biostatistics and Bioinformatics, Duke University(杜克大学生物统计与生物信息学系) Department of Statistics and Data Science, Yale University(耶鲁大学统计与数据科学系)

AI总结 本文研究了在竞争性游戏中通过逆向博弈论和熵正则化来恢复未知奖励函数的问题,提出了一种统一的框架,能够在静态和动态设置中学习奖励函数,并通过理论保证和数值实验验证了其有效性。

Comments Extended journal version of ICML 2025 paper. Submitted to Operations Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10292 2026-05-20 cs.CV cs.AI

Adaptive Residual-Update Steering for Low-Overhead Hallucination Mitigation in Large Vision Language Models

自适应残差更新引导用于大型视觉语言模型中低开销幻觉抑制

Zhengtao Zou, Ya Gao, Jiarui Guan, Bin Li, Pekka Marttinen

机构 * Aalto University, Espoo, Finland(艾尔沃大学,芬兰 Espoo) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, Shenzhen, China(深圳先进技术研究院,中国科学院,深圳)

AI总结 本文提出RUDDER框架,通过创建持久视觉锚点来对抗视觉稀释,利用模型的prefill残差更新提取鲁棒证据方向,并通过自适应门控机制注入解码过程,有效抑制幻觉并保持高吞吐量。

Comments Accepted by ICML 2026; Code available at: https://github.com/Akko000/RUDDER-Residual-Update-Directed-DEcoding-Regulation-

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03485 2026-05-20 cs.AI

Learning Efficient Guardrails for Compliance

学习高效的合规性防护措施

Xiaofei Wen, Wenjie Jacky Mo, Yanan Xie, Peng Qi, Muhao Chen

机构 * Department of Computer Science, University of California-Davis, CA, United States(加州大学戴维斯分校计算机科学系)

AI总结 本文提出PolicyGuardBench基准,通过6万条策略轨迹对评估合规性,训练出轻量级的PolicyGuard模型,实现高准确率和高效推理,展示了小规模下准确且可推广的合规防护措施的可行性。

Comments 16 pages, 5 figures. Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01499 2026-05-20 cs.LG cs.AI cs.GT

Beyond Majority Voting: LLM Aggregation by Leveraging Higher-Order Information

超越多数投票:利用高阶信息进行LLM聚合

Rui Ai, Yuqi Pan, David Simchi-Levi, Milind Tambe, Haifeng Xu

机构 * Massachusetts Institute of Technology(麻省理工学院) School of Engineering and Applied Sciences(工程与应用科学学院) Harvard University(哈佛大学) Data Science, The University of Chicago(数据科学,芝加哥大学)

AI总结 本文提出Optimal Weight和Inverse Surprising Popularity两种算法,通过结合一阶和二阶信息,有效缓解多数投票的局限性,提升多智能体LLM聚合的可靠性。

Comments Accepted into ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07183 2026-05-20 cs.CL cs.AI cs.LG cs.SI

Monitoring AI-Modified Content at Scale: A Case Study on the Impact of ChatGPT on AI Conference Peer Reviews

大规模监控AI修改内容:ChatGPT对AI会议同行评审影响的案例研究

Weixin Liang, Zachary Izzo, Yaohui Zhang, Haley Lepp, Hancheng Cao, Xuandong Zhao, Lingjiao Chen, Haotian Ye, Sheng Liu, Zhi Huang, Daniel A. McFarland, James Y. Zou

机构 * Department of Computer Science, Stanford University(斯坦福大学计算机科学系) Machine Learning Department, NEC Labs America(NEC美国实验室机器学习部门) Department of Biomedical Data Science, Stanford University(斯坦福大学生物医学数据科学系) Department of Electrical Engineering, Stanford University(斯坦福大学电气工程系) Graduate School of Education, Stanford University(斯坦福大学教育研究生院) Department of Sociology, Stanford University(斯坦福大学社会学系) Graduate School of Business, Stanford University(斯坦福大学商学院) Department of Management Science and Engineering, Stanford University(斯坦福大学管理科学与工程系) Department of Computer Science, UC Santa Barbara(加州大学圣芭芭拉分校计算机科学系)

AI总结 本文提出了一种方法,用于估计大规模语料库中可能被大语言模型(LLM)显著修改或生成的文本比例。通过专家撰写和AI生成的参考文本,该最大似然模型能够高效地在语料库层面考察实际的LLM使用情况。研究以ChatGPT发布后举行的AI会议同行评审(ICLR 2024、NeurIPS 2023、CoRL 2023和EMNLP 2023)为案例,发现6.5%至16.9%的提交文本可能被LLM显著修改。生成文本的情境揭示了用户行为:在信心较低、接近截止日期或回复作者反驳较少的评审中,估计的LLM生成文本比例更高。此外,观察到语料库层面的趋势可能过于微妙,无法在个体层面检测到,并讨论了这些趋势对同行评审的影响。呼吁未来跨学科研究探讨LLM使用如何改变我们的信息和知识实践。

Comments 46 pages, 31 figures, ICML '24

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18801 2026-05-20 cs.AI cs.IR cs.LG

Position: Let's Develop Data Probes to Fundamentally Understand How Data Affects LLM Performance

位置:让我们开发数据探针,以根本理解数据如何影响大语言模型性能

Shiqiang Wang, Herbert Woisetschläger, Hans Arno Jacobsen, Mingyue Ji

机构 * Department of Computer Science, University of Exeter, UK(埃克塞特大学计算机科学系) Technical University of Munich, Germany(慕尼黑技术大学) Department of Electrical and Computer Engineering, University of Toronto, Canada(多伦多大学电气与计算机工程系) Department of Electrical and Computer Engineering, University of Florida, FL, USA(佛罗里达大学电气与计算机工程系)

AI总结 本文提出通过开发数据探针系统方法生成合成序列,以揭示数据特性对大语言模型性能、泛化能力和鲁棒性的影响,从而超越经验启发式方法。

Comments Accepted to ICML 2026 Position Paper Track

Journal ref Link to ICML record: https://icml.cc/virtual/2026/poster/67154

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18798 2026-05-20 cs.LG cs.IT math.IT math.ST stat.ML stat.TH

Accurate Evaluation of Quickest Changepoint Detectors via Non-parametric Survival Analysis

通过非参数生存分析准确评估最快突变点检测器

Taiki Miyagawa, Akinori F. Ebihara

机构 * NEC Corporation(日本NEC公司)

AI总结 本文提出非参数估计方法用于快速突变点检测中的平均运行长度和平均检测延迟,通过将突变点检测与生存分析类比,解决了有限和不规则序列长度下的估计问题,提升了模型的鲁棒性和可解释性。

Comments Accepted to ICML 2026. GitHub: https://github.com/TaikiMiyagawa/Kaplan-Meier-Average-Run-Length

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04883 2026-05-20 cs.LG cs.AI q-bio.BM q-bio.QM

Protein Autoregressive Modeling via Multiscale Structure Generation

通过多尺度结构生成进行蛋白质自回归建模

Yanru Qu, Cheng-Yen Hsieh, Zaixiang Zheng, Ge Liu, Quanquan Gu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文提出了一种多尺度自回归框架PAR,用于通过粗到细的下一尺度预测生成蛋白质主链结构。核心方法包括多尺度下采样操作、自回归Transformer和基于流的主链解码器,通过噪声上下文学习和调度采样缓解曝光偏差,实现高质量主链生成,并展示了强大的零样本泛化能力。

Comments ICML 2026 Spotlight; ByteDance Seed Tech Report; Page: https://par-protein.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏