arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

International Conference on Learning Representations · 会议 · Machine Learning

2026-03-19 至 2026-03-19 共收录 18
2603.17946 2026-03-19 cs.LG cs.AI

CARE: Covariance-Aware and Rank-Enhanced Decomposition for Enabling Multi-Head Latent Attention

CARE: 一种考虑协方差和增强秩的分解方法,以实现多头潜在注意力

Zhongzhu Zhou, Fengxiang Bie, Ziyan Chen, Zhenyu Zhang, Yibo Yang, Junxiong Wang, Ben Athiwaratkun, Xiaoxia Wu, Shuaiwen Leon Song

机构 * University of Sydney(悉尼大学) King Abdullah University of Science and Technology(卡布斯大学) Together AI University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 CARE通过考虑激活协方差和增强秩,改进了多头潜在注意力的转换,减少了KV缓存成本并提升了表达能力,实验表明其在多个模型上表现更优。

Comments Accepted at ICLR 2026. Conference paper. 10 pages main text; 34 pages total including references and appendix. 11 figures and 20 tables in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17692 2026-03-19 cs.LG cs.AI q-fin.CP q-fin.PM

Can Blindfolded LLMs Still Trade? An Anonymization-First Framework for Portfolio Optimization

盲folded LLMs仍能进行交易吗?一个以匿名化优先的资产组合优化框架

Joohyoung Jeon, Hongchul Lee

机构 * Korea University(韩国大学) Mirae Asset Securities(美亚证券)

AI总结 本文提出一种以匿名化为核心的资产组合优化框架,通过盲fold LLMs来验证市场信号的合法性,实验显示在2025年期间实现了1.40的夏普比率,并通过负控实验验证信号的有效性。

Comments Accepted at the ICLR 2026 Workshop on Advances in Financial AI (FinAI). 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05089 2026-03-19 cs.CR cs.LG cs.RO

Beware Untrusted Simulators -- Reward-Free Backdoor Attacks in Reinforcement Learning

警惕不可信的模拟器 -- 强化学习中的无奖励后门攻击

Ethan Rathbun, Wo Wei Lin, Alina Oprea, Christopher Amato

机构 * Khoury College of Computer Sciences(计算机科学学院)

AI总结 本文提出一种新型攻击'Daze',通过模拟器动态在强化学习代理中隐秘植入动作级后门,无需修改或观察奖励,证明其在通用RL任务中的有效性,并展示其在机器人硬件上的迁移。

Comments 10 pages main body, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22621 2026-03-19 cs.LG cs.AI cs.CL

IA2: Alignment with ICL Activations Improves Supervised Fine-Tuning

IA2: 通过ICL激活实现对监督微调的改进

Aayush Mishra, Daniel Khashabi, Anqi Liu

机构 * Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系)

AI总结 本文提出IA2方法,通过利用ICL的激活模式提升监督微调的准确性和校准性,在12个基准和两个模型家族中验证了其有效性。

Comments International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08460 2026-03-19 cs.LG cs.AI cs.RO

MOBODY: Model Based Off-Dynamics Offline Reinforcement Learning

MOBODY:基于模型的非动态离线强化学习

Yihong Guo, Yu Yang, Pan Xu, Anqi Liu

机构 * Johns Hopkins University(约翰霍普金斯大学) Duke University(杜克大学)

AI总结 MOBODY通过学习目标动态过渡探索目标领域,优化策略以避免仅依赖低动态位移过渡,提升在显著动态位移或最优轨迹不在低位移区域的场景中的性能。

Comments Published at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11611 2026-03-19 cs.AI cs.CL cs.CR

Signal in the Noise: Polysemantic Interference Transfers and Predicts Cross-Model Influence

噪声中的信号:多义干扰转移和跨模型影响预测

Bofan Gong, Shiyang Lai, James Evans, Dawn Song

机构 * Independent Scholar(独立学者) University of Chicago(芝加哥大学) UC Berkeley(伯克利大学)

AI总结 研究通过稀疏自编码器揭示语言模型中的多义性结构,并发现干预措施在不同模型间可转移,挑战了多义性仅为随机现象的观点。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17172 2026-03-19 cs.LG

Noise-Response Calibration: A Causal Intervention Protocol for LLM-Judges

噪声响应校准:一种用于LLM判官的因果干预协议

Maxim Khomiakov, Jes Frellsen

机构 * Technical University of Denmark(丹麦技术大学) Normal Computing Corporation(Normal Computing公司) Pioneer Centre for Artificial Intelligence(人工智能先锋中心)

AI总结 本文提出基于受控输入干预的校准协议,通过信号噪声比扰动和词法扰动评估LLM判官在不同模态下的表现,揭示了文本与表格数据在噪声下的差异行为。

Comments Published as a conference paper at CAO Workshop at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17075 2026-03-19 cs.LG cs.AI cs.CC

CircuitBuilder: From Polynomials to Circuits via Reinforcement Learning

CircuitBuilder: 通过强化学习从多项式到电路

Weikun K. Zhang, Rohan Pandey, Bhaumik Mehta, Kaijie Jin, Naomi Morato, Archit Ganapule, Michael Ruofan Zeng, Jarod Alper

机构 * University of Washington(华盛顿大学)

AI总结 研究通过强化学习发现高效算术电路计算多项式的问题,比较PPO+MCTS和SAC方法,SAC在双变量目标上表现最佳,PPO+MCTS能扩展到三变量并提升更难实例性能。

Comments ICLR 2026 Workshop on AI with Recursive Self-Improvement

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10489 2026-03-19 cs.LG cs.AI

Learning Adaptive Distribution Alignment with Neural Characteristic Function for Graph Domain Adaptation

基于神经特征函数的自适应分布对齐用于图域适应

Wei Chen, Xingyu Guo, Shuang Li, Zhao Zhang, Yan Zhong, Fuzhen Zhuang, Deqing wang

机构 * School of Artificial Intelligence, Beihang University(北航人工智能学院) School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) School of Mathematical Sciences, Peking University(北大数学系) Zhongguancun Laboratory(中关村实验室)

AI总结 本文提出ADAlign框架,通过自适应分布对齐解决图域适应中的分布偏移问题,利用神经谱差异衡量跨图偏移,实现灵活且鲁棒的域适应。

Comments Accepted by ICLR 2026, 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05960 2026-03-19 cs.CL

Distilling Feedback into Memory-as-a-Tool

将反馈转化为记忆-as-a-工具

Víctor Gallego

机构 * Komorebi AI Technologies(Komorebi人工智能技术)

AI总结 本文提出通过文件式记忆系统和智能体控制的工具调用来将临时批评转化为可检索的指导方针,从而降低推理时间的推理成本。在Rubric Feedback Bench数据集上实验表明,增强型LLM在测试时能快速匹配精炼管道性能,同时大幅降低推理成本。

Comments Code: https://github.com/vicgalle/feedback-memory-as-a-tool Data: https://huggingface.co/datasets/vicgalle/rubric-feedback-bench

Journal ref ICLR 2026 Workshop on Memory for LLM-Based Agentic Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01419 2026-03-19 cs.CV

Towards One-step Causal Video Generation via Adversarial Self-Distillation

基于对抗自蒸馏的单步因果视频生成

Yongqi Yang, Huayang Huang, Xu Peng, Xiaobin Hu, Donghao Luo, Jiangning Zhang, Chengjie Wang, Yu Wu

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Tencent YouTu Lab(腾讯优图实验室) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)

AI总结 本文提出基于蒸馏的高效因果视频生成框架,通过对抗自蒸馏策略提升生成质量,结合首帧增强策略减少误差传播,实验表明在单步和双步视频生成中优于现有方法。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13872 2026-03-19 cs.LG cs.AI

Scalable Energy-Based Models via Adversarial Training: Unifying Discrimination and Generation

通过对抗训练实现可扩展的能量模型:统一判别与生成

Xuwang Yin, Claire Zhang, Julie Steele, Nir Shavit, Tony T. Wang

机构 * MIT(麻省理工学院)

AI总结 本文提出一种结合对抗训练的框架,解决传统能量模型在稳定性与生成质量上的不足,实现高分辨率数据集上的高效判别与生成性能。

Comments Published at ICLR 2026. Code: https://github.com/xuwangyin/DAT

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09259 2026-03-19 cs.CL cs.AI cs.LG

Detecting Data Contamination from Reinforcement Learning Post-training for Large Language Models

在大型语言模型后训练强化学习中检测数据污染

Yongding Tao, Tian Wang, Yihong Dong, Huanyu Liu, Kechi Zhang, Xiaolong Hu, Ge Li

机构 * School of Computer Science, Peking University(北京大学计算机学院) New H3C Technologies Co., Ltd(新华H3C技术有限公司)

AI总结 本文提出Self-Critique方法,通过分析LLM后强化学习阶段输出熵分布的变化来检测数据污染,实验表明其在多个模型和污染任务中显著优于基线方法,AUC提升达30%。

Comments Accepted to ICLR 2026. Code is available at https://github.com/yongding-tao/RL-Data-Contamination

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04072 2026-03-19 cs.LG cs.AI cs.CL stat.ML

Slow-Fast Policy Optimization: Reposition-Before-Update for LLM Reasoning

慢-快策略优化:在更新前重新定位用于大语言模型推理

Ziyan Wang, Zheng Wang, Xingwei Qu, Qi Cheng, Jie Fu, Shengpu Tang, Minjia Zhang, Xiaoming Huo

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Manchester(曼彻斯特大学) NVIDIA Independent(独立) Emory University(埃默里大学)

AI总结 本文提出慢-快策略优化框架,通过分解步骤为三个阶段,解决RL在早期训练中的稳定性与效率问题,实验表明其在推理任务中提升稳定性、减少rollouts数量并加速收敛。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24067 2026-03-19 cs.LG cs.AI

In-Context Compositional Q-Learning for Offline Reinforcement Learning

上下文组合Q学习用于离线强化学习

Qiushui Xu, Yuhao Huang, Yushu Jiang, Lei Song, Jinyu Wang, Wenliang Zheng, Jiang Bian

机构 * Penn State University(宾夕法尼亚州立大学) Nanjing University(南京大学) University of Toronto(多伦多大学) Microsoft Research(微软研究院)

AI总结 本文提出ICQL框架,通过上下文推理问题建模Q学习,利用线性Transformer适应性推断局部Q函数,实现有界近似误差和近优策略提取,实验显示在厨房任务中性能提升达16.4%。

Comments Accepted by The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21240 2026-03-19 cs.LG cs.AI

Tree Search for LLM Agent Reinforcement Learning

基于树搜索的LLM代理强化学习

Yuxiang Ji, Ziyu Ma, Yong Wang, Guanhua Chen, Xiangxiang Chu, Liaoni Wu

机构 * Xiamen University(厦门大学) AMAP, Alibaba Group(阿里集团AMAP实验室) Southern University of Science and Technology(南方科技大学)

AI总结 本文提出Tree-GRPO方法,通过树结构提升LLM代理在长期任务中的表现,利用树搜索共享前缀以增加rollout数量,并通过理论分析证明其与直接偏好学习等效。

Comments ICLR 2026, Code: https://github.com/AMAP-ML/Tree-GRPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14576 2026-03-19 cs.LG cs.AI

SocialJax: An Evaluation Suite for Multi-agent Reinforcement Learning in Sequential Social Dilemmas

SocialJax: 多智能体强化学习中序列社会困境的评估套件

Zihao Guo, Shuqing Shi, Richard Willis, Tristan Tomilin, Joel Z. Leibo, Yali Du

机构 * King’s College London(伦敦国王学院) Eindhoven University of Technology(埃因霍温理工大学) The Alan Turing Institute(艾伦·图灵研究所) Google DeepMind(谷歌DeepMind)

AI总结 本文提出SocialJax,一个用于多智能体强化学习中序列社会困境的评估套件,通过JAX实现高效环境与算法,实验显示其在实时性能上比Melting Pot RLlib快50倍,并验证了基线算法的有效性及环境的社会困境特性。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07147 2026-03-19 cs.CL cs.LG

QFT: Quantized Full-parameter Tuning of LLMs with Affordable Resources

量子化全参数微调:在低成本资源下对大语言模型的全参数微调

Zhikai Li, Xiaoxuan Liu, Banghua Zhu, Zhen Dong, Qingyi Gu, Kurt Keutzer

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出QFT框架,通过将训练状态量化为INT8格式,减少内存占用,实现低成本全参数微调。采用Lion优化器和混合特征量化器,确保训练性能,使LLaMA-7B模型在A6000 GPU上仅需<30GB内存。

Comments ICLR 2026 Workshop on Scaling Post-training for LLMs (SPOT)

详情

展开后加载摘要…

URL PDF HTML 收藏