Dynamic Programming for Epistemic Uncertainty in Markov Decision Processes
马尔可夫决策过程中的信念不确定性动态规划
AI总结 本文提出了一种模糊厌恶MDP理论,通过风险度量评估策略,统一了多种具有信念不确定性的MDP模型,并刻画了与动态规划兼容的风险度量。
作者
Machine Learning
马尔可夫决策过程中的信念不确定性动态规划
AI总结 本文提出了一种模糊厌恶MDP理论,通过风险度量评估策略,统一了多种具有信念不确定性的MDP模型,并刻画了与动态规划兼容的风险度量。
可检测边界处的后训练:一种用于微调的博弈论方法
机构 * University of California, Berkeley(加州大学伯克利分校) ; Inria(法国国家信息与自动化研究所) ; École Normale Supérieure(巴黎高等师范学院)
AI总结 该研究提出博弈论框架解决RL微调中KL正则化系数设置问题,将均衡系数归约为KL正则化RL目标,在Qwen3-8B等模型实验中实现良好奖励-保留权衡,可用于审计开源模型API提供商。
迈向随机对照试验的最优估计器
AI总结 针对随机对照试验中标准估计器精度不足问题,提出基于特定分析目标在RCT族中识别最优估计器的框架,用样本分割估计评估指标分布,通过亚马逊和相关数据集验证,表明最优估计器因目标而异,为估计器选择提供指导。
局部交换性
AI总结 本文研究了局部交换性,证明局部交换过程对应于独立观测的测度值随机过程,并应用于贝叶斯非参数模型和协变量依赖的排列检验。
Journal ref Bernoulli 29(3): 2084-2100
辅助博弈的可证明最优学习算法
AI总结 研究辅助博弈在线变体中信息完备与不完备智能体交互优化奖励函数的问题,提出人类和助手的分散算法,实现(1 - 1/e)近似辅助遗憾率为O(T^(3/4)),证明更好因子难处理,还展示算法在伪分散设置下达O(T^(1/2))速率。
Blackwell可逼近性与梯度均衡等价
机构 * University of California, Berkeley(加州大学伯克利分校) ; Inria & École Normale Supérieure(法国国家信息与自动化研究所 & 巴黎高等师范学院)
AI总结 本文证明梯度均衡(GEQ)与Blackwell可逼近性在算法上等价,从而将GEQ纳入在线学习主流框架,并建立了与遗憾最小化、校准等框架的等价关系。
Comments 30 pages, 1 figure, accepted for presentation at COLT 2026
图上的扩散鲁棒优化
AI总结 提出一种基于扩散的不确定性模型用于有向图上的鲁棒优化,其中边权扰动沿相邻边传播并满足节点守恒约束,分析了该拓扑感知不确定性对凸网络问题和组合图问题计算复杂度的影响。
Comments 46 pages, 6 figures
战略特征选择
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Texas, Austin(德克萨斯大学奥斯汀分校) ; Cornell Tech(康奈尔科技) ; Stanford University(斯坦福大学) ; University of Pennsylvania(宾夕法尼亚大学) ; Harvard University(哈佛大学) ; Inria, Paris(巴黎Inria)
AI总结 研究通过特征选择和岭正则化应对战略操纵的分类问题,发现仅基于可操纵性排除特征通常次优,提出联合优化特征集与正则化水平的算法,并在医疗支付基准上验证。
通过赌注进行多臂顺序假设检验
机构 * University of California Berkeley(加州大学伯克利分校) ; École Normale Supérieure & Inria Paris(法国国家科学研究中心巴黎分校 & 巴黎研究所)
AI总结 本文研究了通过赌注进行多臂顺序检验的问题,提出了一种在多个数据源(臂)中选择以获取数据的统计学家的变体,旨在拒绝全局空假设P(所有臂在某种意义上无效)并支持复合替代假设Q(至少有一个臂非空)。通过推广对数最优性和期望拒绝时间最优性的概念,得到了匹配的上下界,并提出了一个修改的上置信界算法来处理不可观测但足够可估计的奖励。
面向深度无监督域适应的精确模型选择
机构 * University of California, Berkeley(加州大学伯克利分校) ; UC Berkeley(加州大学伯克利分校)
AI总结 针对深度无监督域适应中缺乏准确模型选择方法的问题,提出Deep Embedded Validation (DEV)方法,通过嵌入适应特征表示到验证过程中,获得目标风险的无偏估计,并利用控制变量技术降低方差,理论和实验证明了其有效性。
Comments upload to arxiv for record
从动力系统角度看待Nesterov加速法
机构 * Electrical Engineering and Computer Science Department, UC Berkeley, Berkeley, California, USA(加州大学伯克利分校电子工程与计算机科学系)
AI总结 本文提出一个动力系统框架来理解Nesterov加速梯度方法,通过分析连续时间动力学和离散化过程,揭示了曲率依赖的阻尼项是加速现象的核心,并建立了离散和连续时间动力学之间的联系。
Comments 11 pages, 4 figures, to appear in the Proceedings of the 36th International Conference on Machine Learning
通过高分辨率微分方程理解加速现象
机构 * Florida International University(佛罗里达国际大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of California, Berkeley(加州大学伯克利分校) ; University of Pennsylvania(宾夕法尼亚大学)
AI总结 本文通过高分辨率微分方程研究优化算法的加速现象,提出了一种新的极限过程,能够区分Nesterov加速梯度法和Polyak重力球方法,并揭示了NAG-C在非强凸函数下的收敛特性。
Comments 82 pages, 11 figures
打破局部性加速块高斯-塞德尔
AI总结 本文研究了在随机坐标采样下块高斯-塞德尔算法的加速效果,发现非加速的高斯-塞德尔在随机坐标采样下表现优于固定分块的加速版本,提出了新的数据依赖参数并验证了其在大规模机器学习中的有效性。
Comments Presented at the 34th International Conference on Machine Learning (ICML 2017)
一种线性收敛的随机L-BFGS算法
AI总结 本文提出一种新的随机L-BFGS算法,证明了其在强凸和光滑函数上的线性收敛性,并展示了其在大规模凸优化问题中的高效性能。
Comments 10 pages, 3 figures in International Conference on Artificial Intelligence and Statistics, 2016
ADMM收敛性的通用分析
AI总结 本文基于Lessard等人(2014)提出的框架,证明了当目标函数中一项强凸时ADMM的线性收敛性,并给出了参数选择的实用方法及收敛率的上下界。
Comments 10 pages, 6 figures
Journal ref International Conference on Machine Learning 32, 2015
可分解亚模函数最小化的收敛速度研究
AI总结 本文研究了可分解亚模函数最小化算法的收敛速度,通过几何和谱图理论分析,给出了收敛速率的上界和下界。
Comments 17 pages, 3 figures
Journal ref Neural Information Processing Systems 27, 2014
CalArena:大规模事后校准基准
机构 * Inria - Ecole Normale Supérieure PSL Research University(法国国家科学研究中心-巴黎高等师范学院-巴黎-萨克雷大学)
AI总结 提出CalArena大规模标准化基准,涵盖近2000个实验,通过事后改进(PHI)原则比较多种校准方法,发现平滑校准函数优于分箱方法,专用多类方法在高维场景中至关重要。
Comments 30 pages, 9 figures
显式二阶极小极大优化:实用算法与复杂度分析
机构 * Department of Electrical Engineering and Computer Sciences(电气工程与计算机科学系) ; Department of Statistics(统计学系) ; University of California, Berkeley(加州大学伯克利分校) ; Department of Industrial Engineering and Operations Research(工业工程与运作研究系) ; Columbia University(哥伦比亚大学) ; Univ. Grenoble Alpes, CNRS, Inria, Grenoble INP, LIG(格勒诺布尔阿尔卑斯大学、CNRS、Inria、格勒诺布尔INP、LIG)
AI总结 针对凸-凹无约束极小极大优化问题,提出并分析了几种不精确正则化牛顿型方法,证明其迭代在界集内且平均迭代在O(ε^{-2/3})次内收敛到ε-鞍点,并通过Schur分解和线性系统求解器高效求解子问题,在合成基准和AUC最大化实际应用中优于一阶方法。
Comments Accepted by TMLR; Adding funding information; 35 pages
AutoEval 的正确做法:使用合成数据进行模型评估
机构 * Department of Electrical Engineering and Computer Sciences, University of California, Berkeley, USA(电子工程与计算机科学系,加州大学伯克利分校) ; Department of Systems Immunology, Weizmann Institute of Science, Rehovot, Israel(系统免疫学系,魏茨曼科学研究所) ; Inria, Ecole Normale Supérieure, Paris, France(法国国家信息与自动化技术研究所,巴黎高等师范学院)
AI总结 本文提出高效且统计上无偏的算法,利用AI标记的合成数据减少模型评估所需的人工标注量,在GPT-4实验中有效样本量提升高达50%。
Comments camera-ready paper version
条件覆盖诊断用于共形预测
机构 * Sierra team, Inria Paris, France(Inria巴黎研究院法国团队) ; Ecole Normale Supérieure, PSL Research University, Paris(巴黎高等师范学院PSL研究大学) ; Soda team, Inria Paris-Saclay, France(Inria巴黎-萨克雷分校法国团队) ; Departments of EECS(电子工程与计算机科学系)
AI总结 提出将条件覆盖估计转化为分类问题,通过超额风险度量(ERT)来诊断共形预测的条件覆盖偏差,实验表明使用现代分类器比传统指标具有更高的统计功效。
多智能体系统中策略性偏差的任意时刻检测
AI总结 提出基于e值框架的序贯检验方法,通过构造测试超鞅实时检测多智能体系统行为是否偏离均衡基准,统一处理纳什、相关和粗相关均衡,并扩展至随机博弈。
Comments Code at: https://github.com/GauthierE/anytime-detection-deviation
响应时间增强异质偏好对齐
机构 * Department of Economics, University of California, Berkeley(加州大学伯克利分校经济系) ; Department of Computer Science and Ken Kennedy Institute, Rice University(休斯敦大学计算机科学系和肯尼迪研究所) ; Departments of Electrical Engineering and Computer Sciences, University of California, Berkeley(加州大学伯克利分校电子工程与计算机科学系) ; Departments of Electrical Engineering and Computer Sciences and Statistics, University of California, Berkeley(加州大学伯克利分校电子工程与计算机科学系和统计学系;巴黎Inria) ; Inria Paris
AI总结 本文提出通过引入用户响应时间信号来纠正传统偏好数据中对异质偏好的估计偏差,证明该方法能准确识别群体平均偏好,提升大型语言模型对人类偏好的对齐效果。
超水平集回归:通过体积最小化实现条件分位数
机构 * Sierra team, Inria Paris, France(Inria巴黎研究所)
AI总结 本文提出超水平集回归,通过直接优化几何边界,解决多变量回归中构造满足条件覆盖的最小体积预测区域的挑战,替代传统密度估计方法。
多元标准化残差用于置信预测
机构 * Sierra team, Inria Paris, France(Inria巴黎分部)
AI总结 本文提出多元标准化残差方法,通过白化残差解耦输出相关性并标准化局部方差,从而提升置信预测的条件覆盖性能。
适应性覆盖策略在符合预测中的应用
机构 * Inria, Ecole Normale Supérieure, PSL Research University(法国国家信息与自动化研究所,巴黎高等师范学院,PSL研究大学) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 本文提出基于e值和事后符合推断的适应性覆盖策略,通过神经网络训练优化覆盖水平,提高预测集的灵活性和效率。
Comments Code at: https://github.com/GauthierE/adaptive-coverage-policies
简化版的校准问题
机构 * Inria École Normale Supérieure PSL Research University(Inria 法国国家科学研究中心巴黎高等师范学院) ; The University of Hong Kong(香港大学) ; University of California Berkeley(加州大学伯克利分校) ; University of Southern California(南加州大学)
AI总结 本文研究了校准问题,通过将校准问题转化为在线学习技术,获得了通用合适损失函数的校准结果,并提出了新的多校准率和校准同时优化方法。
多元回归中的最小体积共形集
机构 * Sierra team, Inria Paris, France(Inria巴黎分部) ; Department of Electrical Engineering and Computer Sciences, UC Berkeley, USA(加州大学伯克利分校电子工程与计算机科学系)
AI总结 本文提出一种基于新损失函数的优化框架,用于学习最小体积覆盖集,同时保证覆盖有效性。该方法通过任意范数球定义预测集,并联合优化预测模型和不确定性,实现紧致、信息丰富且高效的预测集。
数据驱动的影响函数用于基于优化的因果推断
机构 * Department of EECS and Statistics(电气工程与计算机科学系和统计学系) ; University of California, Berkeley(加州大学伯克利分校) ; Department of Statistics(统计学系) ; University of Michigan(密歇根大学) ; Department of Data Sciences and Operations(数据科学与运营系) ; University of Southern California, Marshall School of Business(南加州大学马歇尔商学院)
AI总结 本文研究了一种构造性算法,通过有限差分近似统计函数的Gâteaux导数,重点在于因果推断中出现的函数。研究概率分布未知但需从数据估计的情况,并探讨经验、数值和分析Gâteaux导数之间的关系。
Comments Revision
多类校准的结构矩阵缩放
AI总结 本文提出了一种基于结构化正则化和高效优化的多类校准方法,通过改进的校准技术在概率估计上取得显著提升。
事后大样本统计推断
AI总结 本文提出渐近事后推断理论,开发出更弱假设和更精确的渐近事后置信集与p值,解决传统非渐近推断的局限性。
Comments 61 pages, 7 figures