arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Oxford(牛津大学)

2026-07-13 至 2026-07-13 共收录 3
2604.17502 2026-07-13 cs.AI 版本更新

Towards Shutdownable Agents: Generalizing Stochastic Choice in RL Agents and LLMs

迈向可关闭的智能体:在强化学习智能体和大语言模型中推广随机选择

Carissa Cullen, Harry Garland, Alexander Roman, Louis Thomson, Christos Ziakas, Elliott Thornley

机构 * University of Oxford(牛津大学) University College London(伦敦大学学院) New College of Florida(佛罗里达新学院) Imperial College London(伦敦帝国学院) MIT(麻省理工学院)

AI总结 本文提出DReST奖励函数,通过惩罚重复选择相同长度轨迹来训练智能体在不同轨迹长度间随机选择并有效追求目标,实验表明DReST训练的智能体在未见过的场景中表现出更高的有用性和中立性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20388 2026-07-13 math.ST cs.LG econ.EM stat.ML stat.TH 版本更新

From Cross-Validation to SURE: Asymptotic Risk of Tuned Regularized Estimators

从交叉验证到SURE:调节估计器的渐近风险

Karun Adusumilli, Maximilian Kasy, Ashia Wilson

机构 * Department of Economics, University of Pennsylvania(宾夕法尼亚大学经济学系) Department of Economics, University of Oxford(牛津大学经济学系) Department of Electrical Engineering and Computer Science, MIT(麻省理工学院电气工程与计算机科学系)

AI总结 本文推导了通过n折交叉验证调节的正则化经验风险最小化估计器的渐近风险函数,展示了其在正常均值模型中的预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14300 2026-07-13 cs.AI cs.CL cs.LG 版本更新

Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors

超越黑盒混淆:白盒监测器的机制分析与防御

Maheep Chaudhary, Fazl Barez

机构 * University of Oxford(牛津大学)

AI总结 研究针对大语言模型白盒监测器可被规避且缺乏防御措施的问题,通过红队实验揭示几何转移和协方差操纵两种逃避策略,引入SafetyNet集成方法,在多模型家族实验中取得高AUROC分数,为稳健潜在空间监测提供了实证和起点。

详情

展开后加载摘要…

URL PDF HTML 收藏