arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Learning Representations · 会议 · Machine Learning

2026-07-24 至 2026-07-24 共收录 5
2607.21120 2026-07-24 cs.LG cs.AI 新提交

Relative Value Learning

相对价值学习

Marc Höftmann, Jan Robine, Stefan Harmeling

AI总结 研究提出相对价值学习框架,通过反对称函数学习价值差异,引入成对贝尔曼算子并推导相关目标及估计器,将其与PPO集成,在Atari基准测试中取得有竞争力性能,证明相对价值估计可替代绝对评论家。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21090 2026-07-24 cs.LG cs.AI cs.CL 新提交

Training Large Language Models for Self-Explanation Faithfulness

训练用于自解释忠实性的大语言模型

Yeoktatt Cheah, María Pérez-Ortiz, Noah Y. Siegel, Oana-Maria Camburu

机构 * Imperial College London(帝国理工学院)

AI总结 提出强化学习方法,将忠实性度量改为训练目标,研究模型能否检测及优化影响决策因素以提高自解释忠实性。实验用随机词和用户偏差插入,微调模型在忠实性度量上显著改进,交叉干预泛化有模型依赖等情况,为减少不忠实推理提供路径。

Comments To appear at the ICLR 2026 Workshop on Representational Alignment (Re-Align), 10 pages (long paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22216 2026-07-24 cs.CL cs.LG 版本更新

Gumbel Distillation for Parallel Text Generation

Gumbel Distillation用于并行文本生成

Chi Zhang, Xixi Hu, Bo Liu, Qiang Liu

机构 * Department of Computer Science(计算机科学系)

AI总结 本文提出Gumbel Distillation技术,通过Gumbel-Max技巧使并行解码器有效学习token序列的联合分布,提升生成质量,在LM1B和OpenWebText数据集上取得显著改进。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04330 2026-07-24 math.OC

Fast Frank--Wolfe Algorithms with Adaptive Bregman Step-Size for Weakly Convex Functions

具有自适应Bregman步长的快速Frank-Wolfe算法用于弱凸函数

Shota Takahashi, Sebastian Pokutta, Akiko Takeda

AI总结 本文提出了一种适用于弱凸函数的快速Frank-Wolfe算法,通过自适应Bregman步长策略实现更宽松的收敛保证和更快的收敛速度。

Comments ICLR2026 camera-ready version; 38 pages, 10 figures

Journal ref Proceedings of the Fourteenth International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19619 2026-07-24 cs.LG cond-mat.str-el hep-lat physics.comp-ph 版本更新

SESaMo: Symmetry-Enforcing Stochastic Modulation for Normalizing Flows

SESaMo:用于归一化流的对称强制随机调制

Janik Kreit, Dominic Schuh, Kim A. Nicoli, Lena Funcke

AI总结 研究聚焦深度生成模型中从未归一化类玻尔兹曼分布采样的挑战。核心方法是引入SESaMo,通过随机调制将对称性等归纳偏差纳入归一化流。主要贡献是增强生成模型灵活性,能学习多种对称性,并在多场景下进行了数值实验验证。

Comments 29 pages, 14 figures

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏