Spectral Filtering for Complex Linear Dynamical Systems
复线性动力系统中的谱滤波
机构 * Princeton University(普林斯顿大学) ; Google(谷歌) ; DeepMind(深度Mind)
AI总结 本文研究了具有扇形谱的复线性动力系统学习问题,引入基于Slepian基的谱滤波方法,证明了有效维度与状态维度无关,从而获得无维度后悔界。
高校专区
复线性动力系统中的谱滤波
机构 * Princeton University(普林斯顿大学) ; Google(谷歌) ; DeepMind(深度Mind)
AI总结 本文研究了具有扇形谱的复线性动力系统学习问题,引入基于Slepian基的谱滤波方法,证明了有效维度与状态维度无关,从而获得无维度后悔界。
位置:智能体应仅在知识上必要时调用外部工具
机构 * University of Edinburgh(爱丁堡大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Northwestern University(西北大学) ; Princeton University(普林斯顿大学) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 本文探讨智能体在何种情况下应调用外部工具,提出应仅在内部推理无法可靠完成任务时才调用。引入了理论框架,强调决策中的不确定性管理,指出不必要的委托会降低效率并阻碍内部推理能力的发展。
从早期经验学习代理路由
机构 * AI Lab, Princeton University(普林斯顿大学人工智能实验室) ; University of Michigan(密歇根大学) ; Institute for Interdisciplinary Information Sciences (IIIS), Tsinghua University(清华大学交叉信息学院) ; Shanghai Jiao Tong University(上海交通大学) ; University of Edinburgh(爱丁堡大学) ; King’s College London(伦敦国王学院)
AI总结 本文研究在冷启动条件下如何在轻量级LLM推理与完整代理执行间进行路由,提出无需训练的BoundaryRouter框架,通过早期行为经验和指导性推理决定是否直接使用LLM还是升级至代理,实验显示其在降低推理时间与提升性能方面优于其他方法。
Comments 17 pages
$f$-Divergence Regularized RLHF:采样两则与统一分析
机构 * Department of Electrical and Computer Engineering, University of Virginia, Virginia, United States(弗吉尼亚大学电气与计算机工程系) ; Princeton Language and Intelligence, Princeton University, New Jersey, United States(普林斯顿大学语言与智能)
AI总结 本文提出基于一般$f$-散度正则化的在线RLHF框架,通过两种采样策略实现统一理论分析,证明了算法在$O(\log T)$ regret和$O(1/T)$ sub-optimality gap下的效率。
Comments ICML 2026
小批量噪声对Adam中隐式偏差的影响
机构 * Princeton University(普林斯顿大学)
AI总结 本文研究了小批量噪声如何影响Adam优化器中记忆的隐式偏差,发现大批次时高β₂会降低泛化能力,而小批次时需调整β₁和β₂以提升验证精度。