Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?
在线RL微调真的需要预训练Q函数吗?
机构 * Stanford University(斯坦福大学)
AI总结 本文针对在线RL微调是否需预训练Q函数的问题,发现预训练Q函数增益有限,提出IPE方法,在连续控制基准中使微调性能平均提升1.26倍。
Comments Fixed typo in author name
高校专区
在线RL微调真的需要预训练Q函数吗?
机构 * Stanford University(斯坦福大学)
AI总结 本文针对在线RL微调是否需预训练Q函数的问题,发现预训练Q函数增益有限,提出IPE方法,在连续控制基准中使微调性能平均提升1.26倍。
Comments Fixed typo in author name
当行为安全评估失败时:表征层面的视角
机构 * Stanford University(斯坦福大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Technical University of Denmark(丹麦技术大学)
AI总结 本文提出行为安全与干预鲁棒性之间的“审计差距”,通过构建解离模型和引入潜在脆弱性评分(LVS),证明行为安全指标不足以衡量表征层面的鲁棒性。
Comments Preprint
门控记忆策略
机构 * Stanford University(斯坦福大学)
AI总结 本文提出门控记忆策略,通过学习记忆回溯时机与内容,提升机器人操作任务中对历史信息的利用效率,实现在非马尔可夫任务中性能提升30.1%。
在连续空间中进行纯探索的上下文学习
机构 * Boston University(波士顿大学) ; Stanford University(斯坦福大学) ; Boston University Broad Institute of MIT and Harvard(波士顿大学MIT和哈佛大学Broad研究所)
AI总结 本文提出C-ICPE-TS算法,通过元训练深度神经网络,在连续空间中实现纯探索,直接从数据学习可转移的序列测试策略,无需参数更新或显式信息模型。
Comments Accepted as an oral presentation at ICML 2026 Workshop on Hypothesis Testing, Seoul, South Korea, 2026
不要走线:边界引导用于过滤生成
机构 * Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ; Stanford University, Department of Computer Science, Stanford, California, USA(斯坦福大学计算机科学系)
AI总结 本文提出边界引导方法,通过强化学习微调生成模型,使其远离分类器边缘,从而提升生成输出的安全性和实用性。
Comments Accepted at ICML 2026
SimulRAG:基于模拟器的检索增强生成(RAG)框架,用于将大型语言模型(LLMs)落地到长篇科学问答任务中
机构 * University of California San Diego(加州大学圣迭戈分校) ; Stanford University(斯坦福大学) ; Northeastern University(东北大学)
AI总结 针对LLMs在长篇科学问答中易幻觉的问题,本文提出SimulRAG框架,引入UE+SBA机制,发布相关基准,实验表明其信息量与事实性较基线分别提升30.4%、16.3%
Comments Haozhou Xu and Dongxia Wu are co-first authors