arXivDaily arXiv每日学术速递 周一至周五更新

作者

Michael I. Jordan

Machine Learning

共收录 5
2607.26358 2026-07-30 cs.LG cs.AI cs.GT 新提交

Post-Training at the Edge of Detectability: A Game-Theoretic Approach to Fine-Tuning

可检测边界处的后训练:一种用于微调的博弈论方法

Keegan Harris, Brian W. Lee, Ian Waudby-Smith, Philip Amortila, Nika Haghtalab, Michael I. Jordan

机构 * University of California, Berkeley(加州大学伯克利分校) Inria(法国国家信息与自动化研究所) École Normale Supérieure(巴黎高等师范学院)

AI总结 该研究提出博弈论框架解决RL微调中KL正则化系数设置问题,将均衡系数归约为KL正则化RL目标,在Qwen3-8B等模型实验中实现良好奖励-保留权衡,可用于审计开源模型API提供商。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23254 2026-07-28 stat.AP econ.EM stat.ME 新提交

Towards Optimal Estimators for Randomized Control Trials

迈向随机对照试验的最优估计器

Harsh Parikh, Gabriel Levin-Konigsberg, Nilesh Tripuraneni, Dhruv Madeka, Michael I. Jordan, Dean Foster, Dominique Perrault-Joncas, Alexander Volfovsky

AI总结 针对随机对照试验中标准估计器精度不足问题,提出基于特定分析目标在RCT族中识别最优估计器的框架,用样本分割估计评估指标分布,通过亚马逊和相关数据集验证,表明最优估计器因目标而异,为估计器选择提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08012 2026-07-10 cs.LG cs.AI cs.GT 新提交

Provably Optimal Learning Algorithms for Assistance Games

辅助博弈的可证明最优学习算法

Nivasini Ananthakrishnan, Mark Bedaywi, Michael I. Jordan, Stuart Russell, Nika Haghtalab

AI总结 研究辅助博弈在线变体中信息完备与不完备智能体交互优化奖励函数的问题,提出人类和助手的分散算法,实现(1 - 1/e)近似辅助遗憾率为O(T^(3/4)),证明更好因子难处理,还展示算法在伪分散设置下达O(T^(1/2))速率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27315 2026-06-26 cs.LG 新提交

Blackwell Approachability and Gradient Equilibrium are Equivalent

Blackwell可逼近性与梯度均衡等价

Brian W. Lee, Nika Haghtalab, Michael I. Jordan, Ryan J. Tibshirani

机构 * University of California, Berkeley(加州大学伯克利分校) Inria & École Normale Supérieure(法国国家信息与自动化研究所 & 巴黎高等师范学院)

AI总结 本文证明梯度均衡(GEQ)与Blackwell可逼近性在算法上等价,从而将GEQ纳入在线学习主流框架,并建立了与遗憾最小化、校准等框架的等价关系。

Comments 30 pages, 1 figure, accepted for presentation at COLT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18867 2026-06-18 cs.LG cs.CY stat.ML 新提交

Strategic Feature Selection

战略特征选择

Jivat Neet Kaur, Pratik Patil, Divya Shanmugam, Emma Pierson, Michael I. Jordan, Nika Haghtalab, Meena Jagadeesan, Ahmed Alaa, Serena Wang

机构 * University of California, Berkeley(加州大学伯克利分校) University of Texas, Austin(德克萨斯大学奥斯汀分校) Cornell Tech(康奈尔科技) Stanford University(斯坦福大学) University of Pennsylvania(宾夕法尼亚大学) Harvard University(哈佛大学) Inria, Paris(巴黎Inria)

AI总结 研究通过特征选择和岭正则化应对战略操纵的分类问题,发现仅基于可操纵性排除特征通常次优,提出联合优化特征集与正则化水平的算法,并在医疗支付基准上验证。

详情

展开后加载摘要…

URL PDF HTML 收藏