arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

International Conference on Learning Representations · 会议 · Machine Learning

2026-04-03 至 2026-04-03 共收录 11
2604.01913 2026-04-03 cs.LG

The Rank and Gradient Lost in Non-stationarity: Sample Weight Decay for Mitigating Plasticity Loss in Reinforcement Learning

在非平稳性中排名和梯度的丧失:用于缓解强化学习中塑性丧失的样本权重衰减

Zihao Wu, Hongyao Tang, Yi Ma, Jiashun Liu, Yan Zheng, Jianye Hao

机构 * School of Computer Software, Tianjin University(天津大学计算机软件学院) International Joint Institute of Tianjin University, Fuzhou(天津大学福州国际联合学院) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文从网络优化的理论视角研究了非平稳性导致的塑性丧失问题,通过分析数据分布和目标非平稳性,提出样本权重衰减方法以缓解梯度衰减,提升强化学习性能。

Comments ICLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01789 2026-04-03 stat.ML cs.LG

Learning in Prophet Inequalities with Noisy Observations

在有噪声观测下的先知不等式学习

Jung-hun Kim, Vianney Perchet

机构 * CREST, ENSAE, IP Paris(CREST, ENSAE, 巴黎综合理工学院) Criteo AI Lab(Criteo AI实验室) FairPlay joint team(FairPlay联合团队)

AI总结 研究在有噪声观测和未知奖励分布的环境下,通过LCB阈值结合学习与决策,实现在线决策中的最优停止,取得1-1/e的竞争比和1/2的非独立分布竞争比。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01764 2026-04-03 cs.CV

Hidden Meanings in Plain Sight: RebusBench for Evaluating Cognitive Visual Reasoning

显而易见的隐含意义:RebusBench用于评估认知视觉推理

Seyed Amir Kasaei, Arash Marioriyad, Mahbod Khaleti, MohammadAmin Fazli, Mahdieh Soleymani Baghshah, Mohammad Hossein Rohban

AI总结 本文提出RebusBench基准,用于评估模型在需要多步推理的隐含意义理解能力,发现现有模型在认知连接方面存在缺陷。

Comments Accepted at ICLR 2026 Workshop: From Human Cognition to AI Reasoning (HCAIR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01709 2026-04-03 cs.CV

Bias mitigation in graph diffusion models

图扩散模型中的偏差缓解

Meng Yu, Kun Zhan

机构 * School of Information Science & Engineering, Lanzhou University(兰州大学信息科学与工程学院)

AI总结 本文提出方法缓解图扩散模型中的反向起始偏差和暴露偏差,通过改进的Levin采样算法和新的得分修正机制,无需修改网络即可在多个模型和任务中取得最佳效果。

Comments Accepted to ICLR 2025!

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20673 2026-04-03 cs.CL cs.AI

PAVE: Premise-Aware Validation and Editing for Retrieval-Augmented LLMs

PAVE:基于前提的验证与编辑用于检索增强的大语言模型

Tianyi Huang, Caden Yang, Emily Yin, Eric Wang, Michael Zhang

机构 * Ryquo App-In Club

AI总结 PAVE通过在推理阶段验证和编辑检索到的证据,提高检索增强大语言模型的回答一致性。在两个证据基础问答任务中,PAVE在跨度基础基准上提升了32.7个准确率点。

Comments Accepted at the ICLR 2026 Workshop on Logical Reasoning of Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12372 2026-04-03 cs.AI cs.CL cs.LG

Efficient Reasoning with Balanced Thinking

高效平衡思考推理

Yulin Li, Tengyao Tu, Li Ding, Junjie Wang, Huiling Zhen, Yixin Chen, Yong Li, Zhuotao Tian

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Huawei Noah’s Ark Lab(华为诺亚方舟实验室) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Zhongguancun Academy(中关村学院) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 本文提出ReBalance框架,通过平衡思考提升推理效率,减少冗余并提高准确性,适用于多种推理任务。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02788 2026-04-03 cs.AI

Agentified Assessment of Logical Reasoning Agents

具有代理特性的逻辑推理代理评估

Zhiyu Ni, Yifeng Xiao, Zheng Liang

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出一种评估和基准测试逻辑推理代理的框架,通过代理评估实现可重复、可审计和抗执行失败的评估。案例研究中,自动形式化代理在FOLIO验证集上以86.70%的准确率超越了基线方法。

Comments Accepted at ICLR 2026 Agents in the Wild (AIWILD) Workshop. 5 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06810 2026-04-03 cs.LG cs.AI math-ph math.MP

WFR-FM: Simulation-Free Dynamic Unbalanced Optimal Transport

WFR-FM:无模拟动态不平衡最优传输

Qiangwei Peng, Zihan Wang, Junda Ying, Yuhao Sun, Qing Nie, Lei Zhang, Tiejun Li, Peijie Zhou

机构 * LMAM and School of Mathematical Sciences, Peking University(北京大学数学科学学院及数学及其应用实验室) Center for Quantitative Biology, Peking University(北京大学定量生物学中心) Beijing International Center for Mathematical Research, Peking University(北京大学北京国际数学研究中心) Center for Machine Learning Research, Peking University(北京大学机器学习研究中心) NSF-Simons Center for Multiscale Cell Fate Research, University of California, Irvine(加州大学尔湾分校NSF-Simons多尺度细胞命运研究中心) Department of Developmental and Cell Biology, University of California, Irvine(加州大学尔湾分校发育与细胞生物学系) Department of Mathematics, University of California, Irvine(加州大学尔湾分校数学系) National Engineering Laboratory for Big Data Analysis and Applications, Beijing(北京大数据分析与应用技术国家工程实验室) AI for Science Institute, Beijing(北京科学智能研究院)

AI总结 WFR-FM通过结合位移与质量变化,统一了流匹配与动态不平衡最优传输,解决了传统方法不稳定、计算成本高和难以扩展的问题,提升了单细胞生物学中轨迹推断的准确性和鲁棒性。

Journal ref International Conference on Learning Representations (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01375 2026-04-03 cs.AI

Align to Misalign: Automatic LLM Jailbreak with Meta-Optimized LLM Judges

对齐以错位:基于元优化LLM评判者的自动LLM劫持

Hamin Koo, Minseon Kim, Jaehyung Kim

机构 * Yonsei University(延世大学) Microsoft Research(微软研究院)

AI总结 本文提出AMIS框架,通过双层结构联合优化劫持提示和评分模板,提升LLM劫持效果,实测在AdvBench和JBB-Behaviors上取得最佳性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20755 2026-04-03 cs.LG cs.AI stat.ML

Provable Benefits of In-Tool Learning for Large Language Models

大语言模型中工具学习的可证明优势

Sam Houliston, Ambroise Odonnat, Charles Arnal, Vivien Cabannes

机构 * ETH Zürich(苏黎世联邦理工学院) Inria, Univ. Rennes 2(法国国家信息与自动化研究所,雷恩第二大学) FAIR at Meta(Meta FAIR实验室)

AI总结 本文探讨了工具学习在事实回忆中的优势,证明通过工具可实现无限制的事实回忆,优于单纯记忆。

Journal ref ICLR 2026 MemAgents Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12864 2026-04-03 cs.CL cs.AI cs.LG

LEXam: Benchmarking Legal Reasoning on 340 Law Exams

LEXam:基于340法律考试的法律推理基准测试

Yu Fan, Jingwei Ni, Jakob Merane, Yang Tian, Yoan Hermstrüwer, Yinya Huang, Mubashara Akhtar, Etienne Salimbeni, Florian Geering, Oliver Dreyer, Daniel Brunner, Markus Leippold, Mrinmaya Sachan, Alexander Stremitzer, Christoph Engel, Elliott Ash, Joel Niklaus

机构 * ETH Zurich(苏黎世联邦理工学院) University of Zurich(苏黎世大学) University of Lausanne(洛桑大学) Max Planck Institute for Research on Collective Goods(马克斯·普朗克集体物品研究所) Omnilex University of St. Gallen(圣加仑大学) Swiss Federal Supreme Court(瑞士联邦最高法院)

AI总结 LEXam基准测试通过340法律考试数据,包含7537道英语和德语法律考试题目,涵盖多种法律课程和学位级别,旨在评估大语言模型在长文本法律推理中的挑战与性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏