arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Learning Representations · 会议 · Machine Learning

共收录 9454
2509.21778 2026-01-28 cond-mat.mtrl-sci cs.AI

Beyond Structure: Invariant Crystal Property Prediction with Pseudo-Particle Ray Diffraction

超越结构:基于伪粒子射线衍射的不变晶体性质预测

Bin Cao, Yang Liu, Longhan Zhang, Yifan Wu, Zhixun Li, Yuyu Luo, Hong Cheng, Yang Ren, Tong-Yi Zhang

机构 * Guangzhou Municipal Key Laboratory of Materials Informatics, Advanced Materials Thrust, The Hong Kong University of Science and Technology (Guangzhou)(广州材料信息重点实验室,先进材料方向,香港科技大学(广州)) The Chinese University of Hong Kong(香港中文大学) Data Science and Analytics Thrust, The Hong Kong University of Science and Technology (Guangzhou)(数据科学与分析方向,香港科技大学(广州)) Department of physics, The City University of Hong Kong(香港城市大学物理系) Materials Genome Institute, Shanghai University(材料基因组研究所,上海大学)

AI总结 PRDNet通过结合伪粒子射线衍射与图表示,实现了对晶体性质的不变预测,展示了在材料科学中的高效性能。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20829 2026-01-28 cs.LG

Explaining Grokking and Information Bottleneck through Neural Collapse Emergence

通过神经坍缩涌现解释Grokking和信息瓶颈

Keitaro Sakamoto, Issei Sato

机构 * Department of Computer Science(计算机科学系) The University of Tokyo(东京大学)

AI总结 本文通过神经坍缩理论解释了深度学习中Grokking和信息瓶颈现象,揭示了训练后期性能提升的机制。

Comments Accepted at ICLR 2026. Code is available at https://github.com/keitaroskmt/collapse-dynamics

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10530 2026-01-28 cs.AI cs.CL

Is On-Policy Data always the Best Choice for Direct Preference Optimization-based LM Alignment?

基于直接偏好优化的LM对齐中,策略数据是否总是最佳选择?

Zetian Sun, Dongfang Li, Xuhui Chen, Baotian Hu, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

AI总结 本文提出对齐阶段假设,通过理论和实证分析,揭示了静态与策略偏好数据在LM对齐中的效果差异,并提出算法识别对齐阶段边界。

Comments Accepted by ICLR-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07981 2026-01-28 cs.CL cs.AI cs.LG stat.ML

Why is Your Language Model a Poor Implicit Reward Model?

为什么你的语言模型是一个差的隐式奖励模型?

Noam Razin, Yong Lin, Jiarui Yao, Sanjeev Arora

机构 * Some Institute(某些研究所)

AI总结 研究发现隐式奖励模型(IM-RM)在泛化能力上劣于显式奖励模型(EX-RM),因其更依赖表面token级线索,而设计选择对模型泛化行为有显著影响。

Comments Accepted to ICLR 2026; Code available at https://github.com/princeton-pli/exrm-vs-imrm

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22506 2026-01-28 cs.CR cs.AI

SABRE-FL: Selective and Accurate Backdoor Rejection for Federated Prompt Learning

SABRE-FL:面向联邦提示学习的选样和准确后门拒绝

Momin Ahmad Khan, Yasra Chandio, Fatima Muhammad Anwar

机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)

AI总结 SABRE-FL通过嵌入空间异常检测器有效识别并过滤联邦提示学习中的恶意客户端,显著降低后门攻击效果,提升系统鲁棒性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05059 2026-01-28 cs.LG stat.ML

NIMO: a Nonlinear Interpretable MOdel

NIMO:一种非线性可解释模型

Shijian Xu, Marcello Massimo Negri, Volker Roth

机构 * University of Basel(巴塞尔大学)

AI总结 NIMO是一种结合内在可解释性和神经网络表达能力的模型,通过参数消除优化方法提供灵活且可理解的特征影响,同时保持良好的预测性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01943 2026-01-28 cs.CV

Learning Video Generation for Robotic Manipulation with Collaborative Trajectory Control

基于协作轨迹控制的机器人操作视频生成学习

Xiao Fu, Xintao Wang, Xian Liu, Jianhong Bai, Runsen Xu, Pengfei Wan, Di Zhang, Dahua Lin

机构 * The Chinese University of Hong Kong(香港中文大学) Kuaishou Technology(快手科技) Zhejiang University(浙江大学)

AI总结 RoboMaster通过协作轨迹控制方法,解决多物体交互建模问题,实现机器人操作视频生成的高保真度与多物体交互建模。

Comments ICLR 2026. Project Page: https://fuxiao0719.github.io/projects/robomaster/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22338 2026-01-28 cs.CL cs.AI

Text2Grad: Reinforcement Learning from Natural Language Feedback

Text2Grad:从自然语言反馈中强化学习

Hanyang Wang, Lu Wang, Chaoyun Zhang, Tianjun Mao, Si Qin, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

AI总结 Text2Grad通过将自然语言反馈转化为跨度级梯度,提升语言模型的细粒度对齐和可解释性。

Comments The code for our method is available at https://github.com/microsoft/Text2Grad

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12344 2026-01-28 cs.CL

Propaganda AI: An Analysis of Semantic Divergence in Large Language Models

宣传AI:大型语言模型中语义分歧的分析

Nay Myat Min, Long H. Pham, Yige Li, Jun Sun

机构 * Singapore Management University(新加坡国立管理学院)

AI总结 本文提出RAVEN方法,用于检测大型语言模型中因概念提示引发的语义分歧,通过结合语义熵与跨模型分歧,揭示模型在特定主题上的异常响应,以提高对宣传影响的防范能力。

Comments Accepted at ICLR 2026, 22 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23530 2026-01-28 cs.CV cs.AI

There and Back Again: On the relation between Noise and Image Inversions in Diffusion Models

往返之间:关于扩散模型中噪声与图像逆向之间的关系

Łukasz Staniszewski, Łukasz Kuciński, Kamil Deja

机构 * Warsaw University of Technology(华沙技术大学) IDEAS Research Institute(IDEAS研究机构) University of Warsaw(华沙大学) Institute of Mathematics, Polish Academy of Sciences(波兰科学院数学研究所) IDEAS NCBR

AI总结 本文研究了扩散模型中噪声与图像逆向之间的关系,通过替换DDIM逆向步骤为正向扩散过程,解相关潜在编码并提升编辑与插值质量。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11234 2026-01-28 cs.LG cs.AI

Bayes Adaptive Monte Carlo Tree Search for Offline Model-based Reinforcement Learning

贝叶斯自适应蒙特卡洛树搜索用于离线模型驱动强化学习

Jiayu Chen, Le Xu, Wentse Chen, Jeff Schneider

机构 * The University of Hong Kong(香港大学) Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出贝叶斯自适应蒙特卡洛树搜索算法,用于提升离线模型驱动强化学习的性能,显著优于现有方法。

Comments This paper is accepted in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00718 2026-01-28 cs.LG

Pseudo-Nonlinear Data Augmentation: A Constrained Energy Minimization Viewpoint

伪非线性数据增强:一种约束能量最小化视角

Pingbang Hu, Mahito Sugiyama

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) National Institute of Informatics(日本信息处理研究所) SOKENDAI

AI总结 本文提出了一种基于约束能量最小化视角的伪非线性数据增强方法,通过构建几何感知的潜在空间,实现了高效的数据增强与细粒度可控性。

Comments Accepted at the 14th International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04254 2026-01-28 cs.CR cs.AI cs.CL cs.CV cs.LG

Watermark-based Attribution of AI-Generated Content

基于水印的AI生成内容归属

Zhengyuan Jiang, Moyang Guo, Yuepeng Hu, Yupu Wang, Neil Zhenqiang Gong

AI总结 本文提出基于水印的AI生成内容归属方法,通过为每个用户分配唯一水印并嵌入生成内容中,实现对生成内容来源的准确追溯。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.12344 2026-01-28 cs.LG cs.DS stat.ML

An efficient, provably optimal algorithm for the 0-1 loss linear classification problem

一个高效的、可证明最优的0-1损失线性分类问题算法

Xi He, Max A. Little

机构 * Xi He School of Computer Science Peking University(何西 北京大学计算机科学学院) Max A. Little School of Computational Neuroscience University of Birmingham(马克斯·A·利特 布里斯托大学计算神经科学学院)

AI总结 本文提出了一种高效的、可证明最优的0-1损失线性分类算法ICE,能够在O(N^{D+1})时间内精确求解该问题,并将其推广到多项式超曲面分类问题。

Comments Published in ICLR 2026, The Fourteenth International Conference on Learning Representations. 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23593 2026-01-28 cs.LG

Avoid Catastrophic Forgetting with Rank-1 Fisher from Diffusion Models

通过扩散模型的秩1 Fisher避免灾难性遗忘

Zekun Wang, Anant Gupta, Zihan Dong, Christopher J. MacLellan

机构 * College of Computing(计算学院) Georgia Institute of Technology(佐治亚理工学院)

AI总结 本文提出基于扩散模型的秩1 EWC 方法,通过改进 Fisher 估计减少持续学习中的灾难性遗忘,提升图像生成任务的 FID 指标。

Comments 19 pages, 14 figures

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18735 2026-01-27 cs.AI cs.LG

Why Keep Your Doubts to Yourself? Trading Visual Uncertainties in Multi-Agent Bandit Systems

为何保留你的怀疑?多智能体老虎机系统中的视觉不确定性交易

Jusheng Zhang, Yijia Fan, Kaitong Cai, Jing Yang, Jiawei Yao, Jian Wang, Guanlong Qu, Ziliang Chen, Keze Wang

机构 * Sun Yat-sen University(中山大学) University of Washington(华盛顿大学) Snap Inc.(Snap公司) Syracuse University(雪城大学)

AI总结 Agora通过去中心化市场交易机制提升多智能体系统在视觉任务中的协调效率与经济性。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18533 2026-01-27 cs.CL

From Verifiable Dot to Reward Chain: Harnessing Verifiable Reference-based Rewards for Reinforcement Learning of Open-ended Generation

从可验证点到奖励链:利用基于可验证参考的奖励进行开放生成的强化学习

Yuxin Jiang, Yufei Wang, Qiyuan Zhang, Xingshan Zeng, Liangyou Li, Jierun Chen, Chaofan Tao, Haoli Bai, Lifeng Shang

机构 * Huawei Technologies Co.,Ltd(华为技术有限公司) City University of Hong Kong(香港城市大学)

AI总结 本文提出基于可验证参考的强化学习方法,通过提取奖励链提升开放生成任务的效率和可靠性。

Comments 19 pages, 8 figures, 12 tables. Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18525 2026-01-27 cs.LG cs.CV

Closing the Modality Gap Aligns Group-Wise Semantics

弥合模态差距以对齐群体语义

Eleonora Grassucci, Giordano Cicchetti, Emanuele Frasca, Aurelio Uncini, Danilo Comminiello

机构 * Department of Information Engineering, Electronics, and Telecommunications(信息工程、电子与电信系)

AI总结 本文提出了一种方法,证明模态差距在群体级任务中显著影响性能,而非实例级任务。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18513 2026-01-27 cs.LG

LipNeXt: Scaling up Lipschitz-based Certified Robustness to Billion-parameter Models

LipNeXt: 将基于Lipschitz的认证鲁棒性扩展到十亿参数模型

Kai Hu, Haoqi Hu, Matt Fredrikson

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 LipNeXt通过无约束和无卷积的1-Lipschitz架构,在大规模模型中实现高效的认证鲁棒性提升。

Comments ICLR 2026. 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16912 2026-01-27 cs.LG cs.AI cs.CL

Exploration vs Exploitation: Rethinking RLVR through Clipping, Entropy, and Spurious Reward

探索与利用:通过截断、熵和虚假奖励重新思考RLVR

Peter Chen, Xiaopeng Li, Ziniu Li, Wotao Yin, Xi Chen, Tianyi Lin

机构 * Columbia(哥伦比亚大学) CUHK SZ(香港大学) DAMO, Alibaba US(阿里云实验室) NYU Stern(纽约大学 Stern 学院)

AI总结 本文通过截断、熵和虚假奖励机制,重新审视RLVR框架,揭示了探索与利用权衡对大语言模型推理能力提升的影响。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26441 2026-01-27 cs.CV

A-TPT: Angular Diversity Calibration Properties for Test-Time Prompt Tuning of Vision-Language Models

A-TPT:面向视觉语言模型测试时提示微调的角多样性校准特性

Shihab Aaqil Ahamed, Udaya S. K. P. Miriya Thanthrige, Ranga Rodrigo, Muhammad Haris Khan

机构 * Dept. of Electronic and Telecommunication Engineering, University of Moratuwa(摩图瓦大学电子与电信工程系) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

AI总结 A-TPT通过引入角度多样性提升视觉语言模型测试时提示微调的校准性能,有效减少校准误差并提升适应能力。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06913 2026-01-27 cs.LG cs.AI cs.RO

DecompGAIL: Learning Realistic Traffic Behaviors with Decomposed Multi-Agent Generative Adversarial Imitation Learning

DecompGAIL: 通过分解多智能体生成对抗模仿学习学习真实交通行为

Ke Guo, Haochen Liu, Xiaojun Wu, Chen Lv

机构 * Nanyang Technological University(南洋理工大学) Desay SV Automotive(德赛西威汽车)

AI总结 DecompGAIL通过分解多智能体生成对抗模仿学习方法,解决多智能体设置中GAIL的不稳定性问题,提升交通行为的真实性和整体性能。

Comments accepted by ICLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04182 2026-01-27 cs.CL cs.AI

Thinking on the Fly: Test-Time Reasoning Enhancement via Latent Thought Policy Optimization

飞行中的思考:通过潜在思维策略优化提升测试时推理

Wengao Ye, Yan Liang, Lianlei Shan

AI总结 LTPO通过在测试时优化潜在思维向量,提升LLM在复杂推理任务中的鲁棒性和准确性。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22500 2026-01-27 cs.LG math.OC

Dual Optimistic Ascent (PI Control) is the Augmented Lagrangian Method in Disguise

双乐观上升(PI控制)是惩罚拉格朗日方法的伪装

Juan Ramirez, Simon Lacoste-Julien

机构 * Mila - Quebec AI Institute(魁北克AI研究所) DIRO, Université de Montréal(蒙特利尔大学DIRO) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

AI总结 本文揭示了双乐观上升方法与惩罚拉格朗日方法的等价性,为该方法提供了理论保障并指导超参数调整。

Comments Published at ICLR 2026. Code available at https://github.com/juan43ramirez/pi-control-is-alm

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00555 2026-01-27 cs.LG cs.AI cs.CL cs.CV

MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning

MMedAgent-RL: 优化多智能体协作以实现多模态医疗推理

Peng Xia, Jinglu Wang, Yibo Peng, Kaide Zeng, Zihan Dong, Xian Wu, Xiangru Tang, Hongtu Zhu, Yun Li, Linjun Zhang, Shujie Liu, Yan Lu, Huaxiu Yao

机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校) Microsoft Research(微软研究院) CMU(卡内基梅隆大学) Rutgers University(罗格斯大学) Yale University(耶鲁大学)

AI总结 MMedAgent-RL通过强化学习优化多智能体协作,提升多模态医疗推理性能,实现23.6%的性能提升。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02831 2026-01-27 cs.CV

No Other Representation Component Is Needed: Diffusion Transformers Can Provide Representation Guidance by Themselves

无需其他表示组件:扩散变换器本身可以提供表示指导

Dengyang Jiang, Mengmeng Wang, Liuzhuozheng Li, Lei Zhang, Haoyu Wang, Wei Wei, Guang Dai, Yanning Zhang, Jingdong Wang

机构 * Northwestern Polytechnical University(西北工业大学) SGIT AI Lab, State Grid Corporation of China(国网SGIT人工智能实验室) Zhejiang University of Technology(浙江工业大学) Baidu Inc.(百度公司)

AI总结 本文提出SRA方法,利用扩散变换器自身内部表示进行对齐,无需外部组件即可提升生成模型性能。

Comments ICLR 2026. Self-Representation Alignment for Diffusion Transformers. Code: https://github.com/vvvvvjdy/SRA

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18712 2026-01-27 cs.CV

LLaVAction: evaluating and training multi-modal large language models for action understanding

LLaVAction:评估和训练多模态大语言模型进行动作理解

Haozhe Qi, Shaokai Ye, Alexander Mathis, Mackenzie W. Mathis

AI总结 LLaVAction通过引入动作标记和两阶段流程提升多模态大语言模型的动作理解能力,显著提升基准测试性能。

Comments https://github.com/AdaptiveMotorControlLab/LLaVAction

Journal ref International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17507 2026-01-27 cs.RO

MetaWorld: Skill Transfer and Composition in a Hierarchical World Model for Grounding High-Level Instructions

MetaWorld: 一个用于地面指令基础的分层世界模型中的技能迁移与组合

Yutong Shen, Hangxu Liu, Kailin Pei, Ruizhe Xia, Tongtong Feng

机构 * Beijing University of Technology(北京理工大学) Fudan University(复旦大学) Tsinghua University(清华大学)

AI总结 MetaWorld通过整合语义规划与物理控制,利用专家策略迁移提升人形机器人在定位-操作任务中的性能。

Comments 8 pages, 4 figures, Submitted to ICLR 2026 World Model Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17069 2026-01-27 cs.LG cs.AI

Multi-Agent Deep Reinforcement Learning Under Constrained Communications

在受限通信下多智能体深度强化学习

Shahil Shaik, Jonathon M. Smereka, Yue Wang

机构 * US Army CCDC Ground Vehicle Systems Center(美国陆军地面车辆系统中心)

AI总结 本文提出了一种无需集中信息的分布式多智能体强化学习框架DG-MAPPO,通过多跳通信实现全局状态推断,有效提升了协作任务的鲁棒性和可扩展性。

Comments 21 pages, 8 figures, Under review at ICLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02997 2026-01-21 cs.LG

Residual Connections and Normalization Can Provably Prevent Oversmoothing in GNNs

残差连接和归一化可以证明性地防止GNNs中的过平滑

Michael Scholkemper, Xinyi Wu, Ali Jadbabaie, Michael T. Schaub

AI总结 本文提出GraphNormv2,通过理论分析证明残差连接和归一化层能防止GNNs中的过平滑问题,并通过实验验证其有效性。

Journal ref International Conference on Learning Representations (ICLR) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏