arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Machine Learning · 会议 · Machine Learning

2026-05-11 至 2026-05-11 共收录 22
2605.08011 2026-05-11 cs.AI stat.CO

Abductive Reasoning with Probabilistic Commonsense

基于概率常识的归纳推理

Joseph Cotnareanu, Chiara Roverato, Han Zhou, Didier Chetelat, Yingxue Zhang, Mark Coates

机构 * International Laboratory on Learning Systems(学习系统国际实验室) McGill University(麦吉尔大学) Mila - Quebec Artificial Intelligence Institute(魁北克人工智能研究所) Huawei Noah's Ark Lab(华为诺亚实验室)

AI总结 本文提出PACS算法,通过LLM和形式求解器结合,建模常识认知的个体差异,提升大语言模型的归纳推理能力。

Journal ref Proceedings of the International Conference on Machine Learning, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07545 2026-05-11 cs.CV cs.AI

Implicit Preference Alignment for Human Image Animation

隐式偏好对齐用于人类图像动画

Yuanzhi Wang, Xuhua Ren, Jiaxiang Cheng, Bing Ma, Kai Yu, Tianxiang Zheng, Qinglin Lu, Zhen Cui

机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Tencent Hunyuan(腾讯文脉)

AI总结 本文提出隐式偏好对齐框架,通过最大化自动生成高质量样本的似然并惩罚与预训练先验的偏差,提升手部生成质量并降低偏好数据构建门槛。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07522 2026-05-11 cs.CL

WeatherSyn: An Instruction Tuning MLLM For Weather Forecasting Report Generation

WeatherSyn: 一种用于天气预报报告生成的指令微调MLLM

Zinan Zheng, Yang Liu, Nuo Chen, Juepeng Zheng, Hong Cheng, Jia Li

机构 * Hong Kong University of Science(香港科学大学) HY Foundation Model Team, Tencent(腾讯HY基础模型团队) The Chinese University of Hong Kong(香港中文大学) Sun Yat-Sen University(中山大学) National Supercomputing Center in Shenzhen(深圳国家超算中心)

AI总结 本文提出WeatherForecastingReport任务,构建首个指令微调数据集,开发首个专为生成天气预报报告设计的模型,验证其在多地区和多天气方面的优越性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04712 2026-05-11 cs.LG

SPHERE: Mitigating the Loss of Spectral Plasticity in Mixture-of-Experts for Deep Reinforcement Learning

SPHERE: 缓解混合专家在深度强化学习中的频谱可塑性损失

Lirui Luo, Guoxi Zhang, Hongming Xu, Cong Fang, Qing Li

机构 * State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(人工智能国家重点实验室,智能科学与技术学院,北京大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学)

AI总结 本文提出SPHERE,通过引入Parseval惩罚来缓解混合专家策略在持续学习中的频谱可塑性损失,提升了MetaWorld和HumanoidBench的持续强化学习性能。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00380 2026-05-11 cs.LG cs.CL

ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning

ResRL: 通过负样本投影残差强化学习提升大语言模型推理能力

Zihan Lin, Xiaohan Wang, Jie Cao, Jiajun Chai, Li Wang, Xiaodong Lu, Wei Lin, Ran He, Guojun Yin

机构 * MAIS\&NLPR, Institute of Automation, Chinese Academy of Sciences, Beijing, China(MAIS与NLPR,自动化研究所,中国科学院,北京,中国) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences, Beijing, China(先进交叉学科学院,中国科学院大学,北京,中国)

AI总结 本文提出ResRL,通过解耦正负响应的语义分布,提升LLM推理能力同时保持生成多样性,在十二个基准测试中超越强基线,尤其在数学推理上表现更优。

Comments Accepted to ICML 2026. Preprint version. https://github.com/1229095296/ResRL.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03473 2026-05-11 cs.LG cs.CV

Scaling Continual Learning to 300+ Tasks with Bi-Level Routing Mixture-of-Experts

将Bi-Level路由混合专家扩展到300+任务的持续学习

Meng Lou, Yunxiang Fu, Yizhou Yu

机构 * School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学) Center for Embodied Artificial Intelligence and Computer Vision, Shenzhen Loop Area Institute(具身人工智能与计算机视觉中心,深圳环宇区研究所)

AI总结 本文提出CaRE,通过双级路由混合专家机制实现长任务序列的持续学习,提出OmniBenchmark-1K数据集,展示在多种数据集和任务设置上优于基线的性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00568 2026-05-11 cs.CL

ReSeek: A Self-Correcting Framework for Search Agents with Instructive Rewards

ReSeek:一种具有指导性奖励的自我纠正搜索代理框架

Shiyu Li, Yang Tang, Yifan Wang, Peiming Li, Xi Chen

机构 * Basic Algorithm Center, PCG, Tencent, Shenzhen, China(腾讯基本算法中心、PCG、腾讯,深圳,中国) Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生学院,清华大学,深圳,中国)

AI总结 本文提出ReSeek框架,通过引入自我纠正机制和密集指导性奖励函数,提升搜索代理在复杂任务中的表现和路径忠实度。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26272 2026-05-11 cs.CV cs.LG

PRPO: Paragraph-level Policy Optimization for Vision-Language Deepfake Detection

PRPO:用于视觉-语言深度伪造检测的段级策略优化

Tuan Nguyen, Naseem Khan, Khang Tran, NhatHai Phan, Issa Khalil

机构 * Qatar Computing Research Institute, Hamad Bin Khalifa University, Doha, Qatar(卡塔尔计算研究所,哈马德·本·哈利法大学,多哈) New Jersey Institute of Technology, NJ, USA(新泽西理工学院)

AI总结 本文提出PRPO算法,通过段级相对策略优化提升深度伪造检测的准确性与推理能力,实验显示其在检测准确率和推理评分上均显著优于现有方法。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07414 2026-05-11 cs.MA cs.AI cs.CR

OrchJail: Jailbreaking Tool-Calling Text-to-Image Agents by Orchestration-Guided Fuzzing

OrchJail:通过协调引导的模糊测试对工具调用文本到图像代理进行劫持

Jianming Chen, Yawen Wang, Junjie Wang, Zhe Liu, Qing Wang, Fanjiang Xu

机构 * Institute of Software, Chinese Academy of Sciences, Beijing, China Science \& Technology on Integrated Information System Laboratory, Beijing, China State Key Laboratory of Complex System Modeling University of Chinese Academy of Sciences, Beijing, China

AI总结 研究提出OrchJail框架,通过协调引导的模糊测试方法提升对工具调用文本到图像代理的劫持效果,实现更高的攻击成功率和图像质量,同时降低查询成本。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07345 2026-05-11 cs.CL cs.LG

Mean-Pooled Cosine Similarity is Not Length-Invariant: Theory and Cross-Domain Evidence for a Length-Invariant Alternative

均值池化余弦相似度并非长度不变:理论和跨领域证据支持一种长度不变的替代方案

Sibayan Mitra, Dhruv Kumar

机构 * Birla Institute of Technology(比拉理工学院)

AI总结 研究指出均值池化余弦相似度在现代Transformer表示中并非长度不变,通过实验验证了其在跨语言Python接近性中的解释力,并提出中心核对齐(CKA)作为更优的替代方法。

Comments 9 pages, 6 figures. Submitted to the Mechanistic Interpretability Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07091 2026-05-11 cs.DS

Estimating Correlation Clustering Cost in Node-Arrival Stream

在节点到达流中估计相关聚类成本

Kaiwen Liu, Seba Daniela Villalobos, Qin Zhang

AI总结 本文研究了节点到达流模型中的相关聚类问题,提出C$^4$Approx算法,在子线性空间和常数遍历次数下近似计算相关聚类成本,并通过实验验证其在稀疏图上的性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06977 2026-05-11 cs.LG cs.AI cs.IT math.IT stat.ML

$f$-Divergence Regularized RLHF: Two Tales of Sampling and Unified Analyses

$f$-Divergence Regularized RLHF:采样两则与统一分析

Di Wu, Chengshuai Shi, Jing Yang, Cong Shen

机构 * Department of Electrical and Computer Engineering, University of Virginia, Virginia, United States(弗吉尼亚大学电气与计算机工程系) Princeton Language and Intelligence, Princeton University, New Jersey, United States(普林斯顿大学语言与智能)

AI总结 本文提出基于一般$f$-散度正则化的在线RLHF框架,通过两种采样策略实现统一理论分析,证明了算法在$O(\log T)$ regret和$O(1/T)$ sub-optimality gap下的效率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06623 2026-05-11 cs.AI cs.CL cs.LG cs.MA

MASPO: Joint Prompt Optimization for LLM-based Multi-Agent Systems

MASPO:基于大语言模型的多智能体系统的联合提示优化

Zhexuan Wang, Xuebo Liu, Li Wang, Zifei Shan, Yutong Wang, Zhenxi Song, Min Zhang

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳研究院)

AI总结 本文提出MASPO框架,通过联合评估机制和数据驱动的进化束搜索,优化多智能体系统中的提示,提升整体性能,实验显示在6个任务中平均准确率提升2.9。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05995 2026-05-11 cs.CR cs.AI cs.CL

Safety Anchor: Defending Harmful Fine-tuning via Geometric Bottlenecks

安全锚:通过几何瓶颈防御有害微调

Guoxin Lu, Letian Sha, Qing Wang, Peijie Sun, Hao Zhou, Hua Dai, Fu Xiao

机构 * Nanjing University of Posts and Telecommunications(南京邮电大学)

AI总结 本文提出安全瓶颈正则化(SBR),通过几何瓶颈层限制有害查询的隐藏状态,以对抗有害微调攻击,实验表明单个安全锚即可显著降低有害分数。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01862 2026-05-11 cs.LG

QHyer: Q-conditioned Hybrid Attention-mamba Transformer for Offline Goal-conditioned RL

QHyer: 用于离线目标条件强化学习的Q-条件混合注意力-门控Transformer

Xing Lei, Jincheng Wang, Xuetao Zhang, Donglin Wang

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家重点实验室) Institute of Artificial Intelligence(人工智能研究院) Robotics, Xi'an Jiaotong University(机器人技术,西安交通大学) Computer Science, University College London(计算机科学,伦敦大学学院) School of Engineering, Westlake University(工程学院,西湖大学)

AI总结 本文提出QHyer,通过引入状态条件化的Q估计器和混合注意力-门控架构,解决离线目标条件强化学习中长期依赖建模和稀疏奖励下的行为拼接问题,验证了其在非马尔可夫和马尔可夫数据集上的优越性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18636 2026-05-11 cs.CV

Attention Sparsity is Input-Stable: Training-Free Sparse Attention for Video Generation via Offline Sparsity Profiling and Online QK Co-Clustering

注意力稀疏性是输入稳定的:通过离线稀疏性分析和在线QK共聚类实现训练自由的视频生成稀疏注意力

Jiayi Luo, Jiayu Chen, Jiankun Wang, Cong Wang, Hanxin Zhu, Qingyun Sun, Chen Gao, Zhibo Chen, Jianxin Li

机构 * SKLCCSE, School of Computer Science and Engineering, Beihang University(软件学院,北京航空航天大学) Beihang University(北京航空航天大学) School of Computer Science, Peking University(北京大学计算机学院) the State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,中国科学院自动化研究所) School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学) BNRist, Tsinghua University(北京理工大学,清华大学) Zhongguancun Academy(中关村学院)

AI总结 本文提出SVOO框架,通过离线层间稀疏性分析和在线双向共聚类实现训练自由的视频生成稀疏注意力,解决传统方法中层异质性和查询-键耦合问题,提升生成质量与速度的平衡。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20816 2026-05-11 cs.CL cs.LG

Don't Ignore the Tail: Decoupling top-K Probabilities for Efficient Language Model Distillation

不要忽视尾部:为高效语言模型蒸馏解耦top-K概率

Sayantan Dasgupta, Trevor Cohn, Timothy Baldwin

机构 * School of Computing and Information Systems, University of Melbourne, Melbourne, Australia(计算与信息系统学院,墨尔本大学,澳大利亚墨尔本)

AI总结 本文提出一种尾部意识的分歧度,解耦教师模型top-K预测概率与低概率预测的贡献,提升分布尾部信息在语言模型蒸馏中的作用。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01166 2026-05-11 cs.RO

Latent Reasoning VLA: Latent Thinking and Prediction for Vision-Language-Action Models

隐式推理VLA:面向视觉-语言-动作模型的隐式思考与预测

Shuanghao Bai, Jing Lyu, Wanqi Zhou, Zhe Li, Dakai Wang, Lei Xing, Xiaoguang Zhao, Pengwei Wang, Zhongyuan Wang, Cheng Chi, Badong Chen, Shanghang Zhang

机构 * Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Institute of Automation, University of Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

AI总结 本文提出LaRA-VLA框架,通过连续潜在表示实现多模态推理,减少推理开销,提升机器人实时控制效率。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18744 2026-05-11 cs.AI cs.LG

TSRBench: A Comprehensive Multi-task Multi-modal Time Series Reasoning Benchmark for Generalist Models

TSRBench: 一个全面的多任务多模态时间序列推理基准,用于通用模型

Fangxu Yu, Xingang Guo, Lingzhi Yuan, Haoqiang Kang, Hongyu Zhao, Lianhui Qin, Furong Huang, Bin Hu, Tianyi Zhou

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Illinois at Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Maryland, College Park(马里兰大学学院公园分校) University of California, San Diego(加州大学圣地亚哥分校)

AI总结 TSRBench通过4125个问题和15个任务评估通用模型的时间序列推理能力,揭示了感知和推理中的缩放定律失效以及多模态融合的不足。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24736 2026-05-11 q-bio.QM cs.LG q-bio.BM

RNAGenScape: Property-Guided, Optimized Generation of mRNA Sequences with Manifold Langevin Dynamics

RNAGenScape:基于属性的优化mRNA序列生成方法,结合流形拉格朗日动力学

Danqi Liao, Chen Liu, Xingzhi Sun, Dié Tang, Haochen Wang, Scott Youlten, Srikar Krishna Gopinath, Haejeong Lee, Ethan C. Strayer, Antonio J. Giraldez, Smita Krishnaswamy

机构 * Yale University(耶鲁大学)

AI总结 本文提出RNAGenScape方法,通过流形拉格朗日动力学生成生物可行的mRNA序列,提升属性优化和成功率,适用于疫苗设计和蛋白质替代疗法。

Comments ICML 2025 Generative AI and Biology (GenBio) Workshop, Oral presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14399 2026-05-11 cs.CV cs.AI

Factored Classifier-Free Guidance

因子分类器无关引导

Tian Xia, Fabio De Sousa Ribeiro, Rajat R Rasal, Avinash Kori, Raghav Mehta, Ben Glocker

机构 * Department of Computing, Imperial College London, UK(伦敦帝国理工学院计算系)

AI总结 本文提出因子分类器无关引导方法,通过因果图实现属性级控制,提升反事实推理的严谨性和可逆性。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09929 2026-05-11 cs.LG cs.CV

Data Augmentation of Contrastive Learning is Estimating Positive-incentive Noise

对比学习中的数据增强是估计正激励噪声

Hongyuan Zhang, Yanchen Xu, Sida Huang, Xuelong Li

机构 * The University of Hong Kong(香港大学) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院) Fudan University(复旦大学) School of Artificial Intelligence, OPtics(人工智能学院) ElectroNics (iOPEN), Northwestern Polytechnical University(西北工业大学电子学院)

AI总结 本文研究对比学习与正激励噪声的联系,定义了任务熵并提出正激励噪声生成器,通过可视化证明所提方法有效。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏