arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Learning Representations · 会议 · Machine Learning

2026-06-04 至 2026-06-04 共收录 15
2606.04275 2026-06-04 cs.LG cs.AI

From Ticks to Flows: Dynamics of Neural Reinforcement Learning in Continuous Environments

从蜱虫到流:连续环境中神经强化学习的动力学

Saket Tiwari, Tejas Kotwal, George Konidaris

机构 * Brown University(布朗大学)

AI总结 本文通过将深度强化学习建模为连续时间随机过程,利用随机控制理论,首次推导了连续环境下过参数化神经演员-评论家算法在无限宽度极限下的状态分布演化方程。

Comments Presented at ICLR 2026: https://openreview.net/forum?id=TdiRLe3rPA

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11194 2026-06-04 cs.AI

Aligning Deep Implicit Preferences by Learning to Reason Defensively

通过防御性推理对齐深度隐式偏好

Peiming Li, Zhiyuan Hu, Yang Tang, Shiyu Li, Xi Chen

机构 * Basic Algorithm Center, PCG, Tencent(腾讯基本算法中心) School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院)

AI总结 提出基于批判驱动推理对齐(CDRA)的方法,通过DeepPref基准和个性化生成过程奖励模型(Pers-GenPRM),将偏好对齐转化为结构化推理过程,以推断用户深层隐式偏好并实现防御性推理。

Journal ref ICLR 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03799 2026-06-04 cs.CL cs.SY eess.SY

Enhancing Hallucination Detection through Noise Injection

通过噪声注入增强幻觉检测

Litian Liu, Reza Pourreza, Sunny Panchal, Apratim Bhattacharyya, Yubing Jian, Yao Qin, Roland Memisevic

机构 * Qualcomm AI Research(高通人工智能研究)

AI总结 提出一种基于贝叶斯模型不确定性的无训练噪声注入方法,通过扰动模型参数或隐藏单元激活来改进采样过程,显著提升大语言模型幻觉检测性能。

Comments ICLR 2026 main conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01658 2026-06-04 cs.LG cs.AI

Efficient Adversarial Attacks on High-dimensional Offline Bandits

高维离线Bandits的高效对抗攻击

Seyed Mohammad Hadi Hosseini, Amir Najafi, Mahdieh Soleymani Baghshah

机构 * Department of Computer Engineering, Sharif University of Technology(技术学院计算机工程系)

AI总结 研究离线bandit训练在奖励模型被对抗扰动时的脆弱性,提出高维威胁模型,证明维度增加时攻击所需扰动范数减小,实验验证了针对性攻击的高成功率。

Comments Published at ICLR 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01619 2026-06-04 cs.LG cs.AI

SUSD: Structured Unsupervised Skill Discovery through State Factorization

SUSD: 通过状态分解的结构化无监督技能发现

Seyed Mohammad Hadi Hosseini, Mahdieh Soleymani Baghshah

机构 * Department of Computer Engineering(计算机工程系)

AI总结 提出SUSD框架,通过将状态空间分解为独立组件并分配不同技能变量,结合动态模型自适应引导探索,实现更丰富多样的无监督技能发现,并在分解环境中显著优于现有方法。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11166 2026-06-04 cs.CL cs.AI

SoLoPO: Unlocking Long-Context Capabilities in LLMs via Short-to-Long Preference Optimization

SoLoPO: 通过短到长偏好优化解锁大语言模型的长上下文能力

Huashan Sun, Shengyi Liao, Yansen Han, Yu Bai, Yang Gao, Cheng Fu, Weizhou Shen, Fanqi Wan, Ming Yan, Ji Zhang, Fei Huang

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

AI总结 提出SoLoPO框架,将长上下文偏好优化解耦为短上下文偏好优化和短到长奖励对齐,以提升大语言模型的长上下文利用能力。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05233 2026-06-04 cs.LG cs.AI cs.CL

MesaNet: Sequence Modeling by Locally Optimal Test-Time Training

MesaNet: 通过局部最优测试时训练进行序列建模

Johannes von Oswald, Nino Scherrer, Seijin Kobayashi, Luca Versari, Songlin Yang, Sarthak Mittal, Maximilian Schlegel, Kaitlin Maile, Yanick Schimpf, Oliver Sieberling, Alexander Meulemans, Rif A. Saurous, Guillaume Lajoie, Charlotte Frenkel, Razvan Pascanu, Blaise Agüera y Arcas, João Sacramento

机构 * Google(谷歌) Paradigms of Intelligence Team(智能范式团队) Google DeepMind(谷歌DeepMind) MIT CSAIL(麻省理工学院CSAIL)

AI总结 提出一种基于共轭梯度求解器实现局部最优测试时训练的Mesa层,在保持常数推理成本的同时,在语言建模困惑度和下游基准性能上超越现有RNN模型。

Comments Published at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.08036 2026-06-04 cs.LG cs.AI

Potentially Optimal Joint Actions Recognition for Cooperative Multi-Agent Reinforcement Learning

合作多智能体强化学习中潜在最优联合动作识别

Chang Huang, Shatong Zhu, Junqiao Zhao, Hongtu Zhou, Di Zhang, Hai Zhang, Chen Ye, Ziqiao Wang, Guang Chen

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) Stanford University(斯坦福大学) MOE Key Lab of Embedded System and Service Computing, Tongji University, Shanghai, China(同济大学嵌入式系统与服务计算教育部重点实验室,上海,中国) The University of Hong Kong(香港大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 针对值函数分解中单调性约束限制表达能力的问题,提出潜在最优联合动作加权方法,通过迭代加权训练保证最优策略恢复,在多个任务上超越现有方法。

Comments ICLR 2026

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01711 2026-06-04 cs.MA

Expected Return Symmetries

期望回报对称性

Darius Muglich, Johannes Forkel, Elise van der Pol, Jakob Foerster

AI总结 本文提出期望回报对称性,一种比环境对称性更广泛的对称性群,用于改进多智能体零样本协调,无需先验环境结构知识。

Comments Published at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.00846 2026-06-04 cs.LG cs.CV cs.SY eess.SY stat.ML

Towards Understanding Regularization in Batch Normalization

向批量归一化中的正则化理解迈进

Ping Luo, Xinjiang Wang, Wenqi Shao, Zhanglin Peng

机构 * The Chinese University of Hong Kong(香港中文大学) SenseTime Research(商汤科技研究院) The University of Hong Kong(香港大学)

AI总结 本文通过理论分析探讨了批量归一化在神经网络训练中的收敛性和泛化能力,揭示了批量归一化作为隐式正则化的作用,并通过实验验证了其在卷积神经网络中的正则化特性。

Comments International Conference on Learning Representations (ICLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
1805.11706 2026-06-04 cs.LG cs.AI cs.RO cs.SY eess.SY stat.ML

Supervised Policy Update for Deep Reinforcement Learning

深度强化学习中的监督策略更新

Quan Vuong, Yiming Zhang, Keith W. Ross

机构 * University of California, San Diego(加州大学圣地亚哥分校) New York University(纽约大学)

AI总结 本文提出了一种新的样本效率高的方法,称为监督策略更新(SPU),用于深度强化学习。该方法通过当前策略生成的数据,在非参数化的近端策略空间中构建并求解一个约束优化问题,然后利用监督回归将最优的非参数化策略转换为参数化策略,从而生成新的样本。该方法适用于离散和连续动作空间,并能处理多种接近约束。本文展示了如何通过该方法解决自然策略梯度和信任区域策略优化(NPG/TRPO)以及近端策略优化(PPO)问题。SPU的实现比TRPO更简单,在样本效率方面,实验表明SPU在Mujoco模拟机器人任务中优于TRPO,在Atari视频游戏任务中优于PPO。

Comments Accepted as a conference paper at ICLR 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1803.07661 2026-06-04 cs.LG cs.NA math.NA stat.ML

Efficient Recurrent Neural Networks using Structured Matrices in FPGAs

在FPGA上使用结构化矩阵实现高效的循环神经网络

Zhe Li, Shuo Wang, Caiwen Ding, Qinru Qiu, Yanzhi Wang, Yun Liang

机构 * Department of Electrical Engineering and Computer Science, Syracuse University, USA(Syracuse大学电气工程与计算机科学系) Center for Energy-efficient Computing and Applications (CECA), Peking University, China(北京大学能源高效计算与应用中心)

AI总结 本文提出在FPGA上使用块循环矩阵实现RNN,以提高模型压缩和加速,实验显示比ESE提升35.7倍的能效。

Comments To appear in International Conference on Learning Representations 2018 Workshop Track

详情

展开后加载摘要…

URL PDF HTML 收藏
1802.00930 2026-06-04 cs.NE cs.LG cs.NA math.NA

Mixed Precision Training of Convolutional Neural Networks using Integer Operations

使用整数运算进行卷积神经网络的混合精度训练

Dipankar Das, Naveen Mellempudi, Dheevatsa Mudigere, Dhiraj Kalamkar, Sasikanth Avancha, Kunal Banerjee, Srinivas Sridharan, Karthik Vaidyanathan, Bharat Kaul, Evangelos Georganas, Alexander Heinecke, Pradeep Dubey, Jesus Corbal, Nikita Shustrov, Roma Dubtsov, Evarist Fomenko, Vadim Pirogov

机构 * Parallel Computing Lab(并行计算实验室) Intel Labs, India(英特尔实验室,印度) Product Architecture Group(产品架构组) Intel Labs, SC Intel, OR(英特尔实验室,SC英特尔,美国) Software Services Group(软件服务组) Intel, OR(英特尔,美国)

AI总结 本文提出了一种基于整数运算的混合精度训练方法,在ImageNet-1K数据集上训练了ResNet-50、GoogLeNet-v1等SOTA网络,实现了比FP32更高的训练吞吐量和相同精度下的最高准确率。

Comments Published as a conference paper at ICLR 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1705.07364 2026-06-04 cs.LG cs.CV cs.NA math.NA

Stabilizing Adversarial Nets With Prediction Methods

用预测方法稳定对抗网络

Abhay Yadav, Sohil Shah, Zheng Xu, David Jacobs, Tom Goldstein

机构 * University of Maryland, College Park(马里兰大学 College Park 分校)

AI总结 本文提出一种改进的随机梯度下降方法,通过稳定对抗网络的训练过程,使其更可靠地收敛到鞍点,提高训练稳定性与效率。

Comments Accepted at ICLR 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1605.06432 2026-06-04 stat.ML cs.LG cs.SY eess.SY

Deep Variational Bayes Filters: Unsupervised Learning of State Space Models from Raw Data

深度变分贝叶斯滤波器:从原始数据中无监督学习状态空间模型

Maximilian Karl, Maximilian Soelch, Justin Bayer, Patrick van der Smagt

AI总结 本文提出深度变分贝叶斯滤波器,通过变分推断处理非解析性推理,实现从原始数据中无监督学习状态空间模型,提升长期预测能力。

Comments Published as a conference paper at ICLR 2017

详情

展开后加载摘要…

URL PDF HTML 收藏