arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Cornell University(康奈尔大学)

2026-07-27 至 2026-07-27 共收录 4
2607.21843 2026-07-27 stat.ML cs.LG 新提交

Simulation-Based Empirical Bayes

基于模拟的经验贝叶斯

Xinwei Shen, Diana Cai, Cheng Zhang, David M. Blei

机构 * Department of Statistics University of Washington(统计学系华盛顿大学) Department of Computer Science Cornell University(计算机科学系康奈尔大学) School of Mathematical Sciences and Center for Statistical Science Peking University(数学科学学院与统计科学中心北京大学) Departments of Computer Science and Statistics Columbia University(计算机科学与统计学系哥伦比亚大学)

AI总结 研究针对似然只能通过模拟器获得的情况开发经验贝叶斯方法,引入基于模拟的经验贝叶斯(SBEB),通过观测数据、模拟器样本和推断网络计算估计,迭代细化先验,经实验证明其比固定先验的SBI提高了准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22012 2026-07-27 cs.LG 新提交

Cross-Domain Off-Policy Evaluation and Learning for Contextual Bandits

上下文博弈的跨域离策略评估与学习

Yuta Natsubori, Masataka Ushiku, Yuta Saito

机构 * Hakuhodo DY Holdings, Inc.(博报堂DY控股公司) Cornell University(康奈尔大学)

AI总结 研究上下文博弈中离策略评估与学习问题,提出跨域OPE/L新设置,可利用目标域和其他域日志数据,开发新估计器和策略梯度方法,有效解决现有方法面临的挑战,增强离策略评估与学习能力。

Comments 21 pages, 10 figures, accepted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21635 2026-07-27 cs.LG 新提交

Toward User-Conditioned Evaluation of Personal LLM Agents under Temporal Interventions

面向时间干预下个人语言模型代理的用户条件评估

Pin Qian, Su Wang, Yihang Chen, Qiaolin Yu, Xiaoyuan Wang, Zhitong Guo, Zhicheng Wang, Junxian You

机构 * Carnegie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院) Cornell University(康奈尔大学) University of Glasgow(格拉斯哥大学)

AI总结 研究个人语言模型代理在时间干预下的用户条件评估,提出需在不同用户条件状态下重放时间干预并测量故障传播的协议,形式化四个条件,审查发现无满足条件的公开协议,进而提出最小基准设计和候选报告指标。

Comments 9 pages, 2 figures, and 8 tables. Accepted for oral presentation at the ACM SIGKDD KDD 2026 Workshop on Personal Intelligence in the Agentic AI Era (PILA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12238 2026-07-27 stat.ML cs.LG math.OC 版本更新

On the Provable Suboptimality of Momentum SGD in Nonstationary Stochastic Optimization

关于动量SGD在非平稳随机优化中的可证明次优性的研究

Sharan Sahu, Cameron J. Hogan, Martin T. Wells

机构 * Cornell University(康奈尔大学)

AI总结 本文研究了在强凸性和光滑性条件下,随机梯度下降及其动量变体(Polyak重球和Nesterov)在跟踪时间变化最优解时的性能,揭示了动量方法在分布偏移下导致的显式漂移放大惩罚,并证明了这种惩罚并非分析伪影,而是信息论障碍,为动量方法在动态环境中的经验不稳定性提供了理论依据。

Comments Accepted to ICML 2026. 76 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏