arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of California, Berkeley(加州大学伯克利分校)

2026-06-04 至 2026-06-04 共收录 63
2601.22450 2026-06-04 cs.LG cs.AI

Tuning the Implicit Regularizer of Masked Diffusion Language Models: Enhancing Generalization via Insights from $k$-Parity

调整掩码扩散语言模型的隐式正则化器:通过$k$-奇偶问题的见解增强泛化能力

Jianhao Huang, Baharan Mirzasoleiman

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

AI总结 本文通过$k$-奇偶问题研究掩码扩散语言模型的泛化特性,理论分解其目标函数为信号和噪声两部分,并利用噪声作为隐式正则化器,通过优化掩码概率分布显著提升模型性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05277 2026-06-04 cs.CV cs.AI

From Segments to Scenes: Temporal Understanding for Agentic Autonomous Driving via Vision-Language Models

从片段到场景:自动驾驶中基于视觉语言模型的时间理解

Kevin Cannons, Saeed Ranjbar Alvar, Mohammad Asiful Hossain, Ahmad Rezaei, Mohsen Gholami, Alireza Heidarikhazaei, Zhou Weimin, Yong Zhang, Mohammad Akbari

机构 * University of California, Berkeley(加州大学伯克利分校) University of Cambridge(剑桥大学) University of Toronto(多伦多大学) ETH Zurich(苏黎世联邦理工学院) University of Washington(华盛顿大学) University of Southern California(南加州大学)

AI总结 提出自动驾驶时间理解基准TAD,通过场景思维链和轨迹认知图两种无训练方法提升视觉语言模型的时间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03511 2026-06-04 cs.CV cs.AI cs.LG eess.IV

Platonic Transformers: A Solid Choice For Equivariance

柏拉图式Transformer:等变性的坚实选择

Mohammad Mohaiminul Islam, Rishabh Anand, David R. Wessels, Friso de Kruiff, Thijs P. Kuipers, Rex Ying, Clara I. Sánchez, Sharvaree Vadgama, Georg Bökman, Erik J. Bekkers

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 提出Platonic Transformer,通过基于柏拉图立体对称群参考帧的注意力机制实现等变性,在不增加计算成本的前提下提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01902 2026-06-04 cs.AI cs.CL cs.LG

Constrained Adaptive Rejection Sampling

约束自适应拒绝采样

Paweł Parys, Sairam Vaidya, Taylor Berg-Kirkpatrick, Loris D'Antoni

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 提出约束自适应拒绝采样(CARS),通过自适应剪枝无效前缀来提高拒绝采样的样本效率,同时保持无分布扭曲,在程序模糊测试和分子生成等任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22454 2026-06-04 cs.LG

Overclocking Electrostatic Generative Models

超频静电生成模型

Daniil Shlenskii, Alexander Korotin

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 提出逆泊松流匹配(IPFM)蒸馏框架,加速所有维度D下的静电生成模型,实现少步采样且质量接近甚至超越教师模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.08472 2026-06-04 cs.NE cs.LG cs.NA math.NA

AutoNumerics-Zero: Automated Discovery of State-of-the-Art Mathematical Functions

AutoNumerics-Zero:自动发现最先进的数学函数

Esteban Real, Mirko Rossini, Connal de Souza, Manav Garg, Moritz Firsching, Quoc V. Le, Yao Chen, Akhil Verghese, Ekin Dogus Cubuk, David H. Park

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 本文通过符号回归的进化方法,在不依赖任意精度的情况下,自动发现比传统方法更高效的数学函数近似程序,例如一个10操作的程序逼近指数函数达到14位有效数字。

Comments v2: Accepted to the International Conference on Machine Learning (ICML 2026); added results, clarified framing, and added proofs

详情

展开后加载摘要…

URL PDF HTML 收藏
1710.05465 2026-06-04 cs.AI cs.RO cs.SY eess.SY

Flow: A Modular Learning Framework for Mixed Autonomy Traffic

Flow: 一种用于混合自主性的模块化学习框架

Cathy Wu, Aboudy Kreidieh, Kanaad Parvate, Eugene Vinitsky, Alexandre M Bayen

机构 * Laboratory for Information and Decision Systems, Massachusetts Institute of Technology(信息与决策实验室,麻省理工学院) Institute of Data, Systems, and Society, Massachusetts Institute of Technology(数据、系统与社会研究所,麻省理工学院) Department of Mechanical Engineering, University of California, Berkeley(机械工程系,加州大学伯克利分校)

AI总结 本文提出了一种模块化学习框架,利用深度强化学习解决复杂交通动态问题,通过提高系统层面的速度,使学习到的控制法则在仅有4-7%的自动驾驶汽车参与度下,相比人类驾驶性能提升高达57%。此外,在单车道交通中,一个仅使用局部观测的小型神经网络控制法则能够消除拥堵现象,达到近最优性能。

Comments 17 pages, 8 figures, 5 tables. 2021 IEEE Transactions on Robotics (T-RO)

详情

展开后加载摘要…

URL PDF HTML 收藏
1711.01526 2026-06-04 cs.LG cs.SY eess.SY math.OC

On Identification of Distribution Grids

配电网络的识别

Omid Ardakanian, Vincent W. S. Wong, Roel Dobbe, Steven H. Low, Alexandra von Meier, Claire Tomlin, Ye Yuan

机构 * Department of Electrical Engineering and Computer Sciences, UC Berkeley, USA(伯克利大学电气工程与计算机科学系,美国)

AI总结 本文研究了如何通过遥测数据联合估计配电网络的模型参数和运行结构,利用lasso方法进行回归收缩和选择,提出可处理配电系统低秩结构的可行凸优化程序,并开发了用于早期检测和定位引起电导矩阵变化的关键事件的在线算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
1808.08252 2026-06-04 cs.RO cs.SY eess.SY

Inverse Statics Optimization for Compound Tensegrity Robots

复合张力结构机器人的逆静态优化

Andrew P. Sabelhaus, Albert H. Li, Kimberly A. Sover, Jacob Madden, Andrew Barkan, Adrian K. Agogino, Alice M. Agogino

机构 * Department of Mechanical Engineering, University of California Berkeley(加州大学伯克利分校机械工程系) Intelligent Systems Division, NASA Ames Research Center(NASA阿姆斯研究中心智能系统部)

AI总结 本文提出了一种方法,用于计算复合张力结构机器人的电缆张力,以实现静态平衡。该方法基于改进的力密度法,通过二次优化问题解决电缆张力计算,并通过仿真和硬件实验验证了其在脊柱机器人和四足机器人设计与控制中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
1603.07421 2026-06-04 eess.SY cs.LG cs.SY math.OC

On the Powerball Method for Optimization

关于优化的Powerball方法

Ye Yuan, Mu Li, Jun Liu, Claire J. Tomlin

机构 * School of Automation, Huazhong University of Science and Technology(华中科技大学自动化学院) Department of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学系) Department of Applied Mathematics, University of Waterloo(滑铁卢大学应用数学系) Department of Electrical Engineering and Computer Sciences, University of California, Berkeley(加州大学伯克利分校电气工程与计算机科学系)

AI总结 本文提出了一种新的方法来加速优化算法的收敛,通过在优化过程中添加一个功率系数γ∈[0,1),称为Powerball方法,并分析了该方法在强凸函数中的收敛率。尽管理论上Powerball方法与梯度方法有相同的线性收敛率,但实验证明其在初始迭代中显著优于梯度下降和牛顿方法,尤其在多个真实数据集上提供了10倍的收敛加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.02531 2026-06-04 cs.RO cs.AI cs.CV cs.LG cs.SY eess.SY

Combining Optimal Control and Learning for Visual Navigation in Novel Environments

将最优控制与学习相结合用于新环境中的视觉导航

Somil Bansal, Varun Tolani, Saurabh Gupta, Jitendra Malik, Claire Tomlin

机构 * University of California, Berkeley(加州大学伯克利分校) Facebook AI Research(脸书人工智能研究)

AI总结 本文提出了一种结合模型控制与学习感知的方法,用于在新环境中实现可靠的视觉导航,通过生成无碰撞路径的 waypoints,使机器人能够高效地到达目标位置,同时在低帧率和仿真到现实的迁移中表现良好。

Comments Project website: https://vtolani95.github.io/WayPtNav/

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.13428 2026-06-04 cs.LG cs.MA cs.SY eess.SY stat.ML

Attentional Policies for Cross-Context Multi-Agent Reinforcement Learning

面向跨上下文多智能体强化学习的注意力策略

Matthew A. Wright, Roberto Horowitz

机构 * University of California Berkeley(加州大学伯克利分校)

AI总结 本文提出了一种新的神经策略架构,用于解决多智能体问题,通过在策略层面学习多智能体关系,利用注意力机制实现智能体间的协作,优于传统方法并在大规模智能体场景中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.07436 2026-06-04 math.OC cs.LG cs.SY eess.SY stat.ML

A Dynamical Systems Perspective on Nesterov Acceleration

从动力系统角度看待Nesterov加速法

Michael Muehlebach, Michael I. Jordan

机构 * Electrical Engineering and Computer Science Department, UC Berkeley, Berkeley, California, USA(加州大学伯克利分校电子工程与计算机科学系)

AI总结 本文提出一个动力系统框架来理解Nesterov加速梯度方法,通过分析连续时间动力学和离散化过程,揭示了曲率依赖的阻尼项是加速现象的核心,并建立了离散和连续时间动力学之间的联系。

Comments 11 pages, 4 figures, to appear in the Proceedings of the 36th International Conference on Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
1808.07921 2026-06-04 cs.RO cs.AI cs.PL cs.SE cs.SY eess.SY

SOTER: A Runtime Assurance Framework for Programming Safe Robotics Systems

SOTER:一种用于安全机器人系统编程的运行时保证框架

Ankush Desai, Shromona Ghosh, Sanjit A. Seshia, Natarajan Shankar, Ashish Tiwari

机构 * University of California at Berkeley, CA, USA(加州大学伯克利分校) SRI International(SRI国际) Microsoft(微软)

AI总结 本文提出SOTER框架,通过一种编程语言和集成的运行时保证系统,为安全机器人系统提供保障,确保在使用未经认证组件时仍能满足安全要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
1708.01945 2026-06-04 stat.ML cs.LG cs.NA math.NA

A Bootstrap Method for Error Estimation in Randomized Matrix Multiplication

一种用于随机矩阵乘法误差估计的自助法

Miles E. Lopes, Shusen Wang, Michael W. Mahoney

机构 * Department of Statistics University of California at Davis(加州大学戴维斯分校统计学系) Department of Computer Science Stevens Institute of Technology(史蒂文斯理工学院计算机科学系) International Computer Science Institute and Department of Statistics University of California at Berkeley(伯克利大学国际计算机科学研究所和统计学系)

AI总结 本文提出了一种自助方法,用于直接估计随机矩阵乘法(降维)的准确性,作为解决一般问题的原型设置。该方法在计算上不显著增加标准降维方法的成本,并通过插值技术实现,同时提供了理论和实证结果以证明其有效性。

Journal ref Journal of Machine Learning Research, 20(39): 1-40, 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1902.10320 2026-06-04 cs.RO cs.SY eess.SY

A New Simulation Metric to Determine Safe Environments and Controllers for Systems with Unknown Dynamics

一种新的仿真度量用于确定具有未知动态系统的安全环境和控制器

Shromona Ghosh, Somil Bansal, Alberto Sangiovanni-Vincentelli, Sanjit A. Seshia, Claire J. Tomlin

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出了一种基于规范的仿真度量(SPEC),用于在系统动态未知的情况下,通过更严格的规范修改来合成安全控制器,从而扩大安全环境集。

Comments 22nd ACM International Conference on Hybrid Systems: Computation and Control (2019)

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.06120 2026-06-04 eess.SY cs.AI cs.RO cs.SY

Simulation to Scaled City: Zero-Shot Policy Transfer for Traffic Control via Autonomous Vehicles

模拟到缩放城市:通过自动驾驶车辆实现交通控制的零样本策略迁移

Kathy Jang, Eugene Vinitsky, Behdad Chalaki, Ben Remer, Logan Beaver, Andreas Malikopoulos, Alexandre Bayen

机构 * University of California, Berkeley(加州大学伯克利分校) University of Delaware(德克萨斯大学)

AI总结 本文通过深度强化学习训练自动驾驶车辆在环形交叉口的控制策略,并将训练好的策略迁移至缩放智能城市进行测试,发现注入噪声的策略在迁移后表现更佳,实现了交通流的优化。

Comments To be published at the International Conference on Cyber Physical Systems (ICCPS) 2019. 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1902.08594 2026-06-04 eess.SY cs.LG cs.MA cs.SY stat.ML

Regression-based Inverter Control for Decentralized Optimal Power Flow and Voltage Regulation

基于回归的逆变器控制用于分布式最优功率流和电压调节

Oscar Sondermeijer, Roel Dobbe, Daniel Arnold, Claire Tomlin, Tamás Keviczky

机构 * 2 Department of Electrical Engineering \& Computer Sciences, UC Berkeley, Berkeley, USA 3 Department of Mechanical Engineering, UC Berkeley, Berkeley, USA 4 Delft Center for Systems Control, Delft University of Technology, Delft, The Netherlands

AI总结 本文提出了一种系统化的数据驱动方法,通过本地测量确定逆变器输出无功功率,以实现接近最优的结果,该方法通过网络模型和历史负荷和发电数据进行最优功率流计算,然后利用回归找到每个逆变器的函数,将本地历史数据映射到其最优无功功率注入的近似值,从而实现分布式控制,以在电压和容量约束下最小化损耗并实现电压平坦化,同时允许高效的电压-无功优化(VVO)方案,使传统控制设备与现有逆变器协同工作,以安全运行高分布式发电水平的配电网。

Comments Cite as: Oscar Sondermeijer, Roel Dobbe, Daniel Arnold, Claire Tomlin and Tamás Keviczky, "Regression-based Inverter Control for Decentralized Optimal Power Flow and Voltage Regulation", IEEE Power & Energy Society General Meeting, Boston, July 2016

详情

展开后加载摘要…

URL PDF HTML 收藏
1902.06366 2026-06-04 cs.LG cs.SY eess.SY stat.ML

Detecting and Diagnosing Incipient Building Faults Using Uncertainty Information from Deep Neural Networks

利用深度神经网络的不确定性信息检测和诊断建筑初期故障

Baihong Jin, Dan Li, Seshadhri Srinivasan, See-Kiong Ng, Kameshwar Poolla, Alberto~Sangiovanni-Vincentelli

机构 * Department of EECS, University of California, Berkeley(加州大学伯克利分校电子工程与计算机科学系) Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所) The Berkeley Education Alliance for Research in Singapore(新加坡伯克利教育联盟)

AI总结 本文提出利用蒙特卡洛dropout方法增强监督学习流程,以检测和诊断未见过的初期故障,并在RP-1043数据集上验证其在指示最可能的初期故障类型方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
1902.06361 2026-06-04 cs.LG cs.NE cs.SY eess.SY stat.ML

A One-Class Support Vector Machine Calibration Method for Time Series Change Point Detection

一种用于时间序列变化点检测的一类支持向量机校准方法

Baihong Jin, Yuxin Chen, Dan Li, Kameshwar Poolla, Alberto Sangiovanni-Vincentelli

机构 * Department of EECS, University of California, Berkeley(加州大学伯克利分校电子工程与计算机科学系) California Institute of Technology(加州理工学院) Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所)

AI总结 本文提出了一种校准一类支持向量机(OC-SVM)的方法,用于时间序列变化点检测,通过启发式搜索方法找到输入数据和超参数的最优组合,实验表明OC-SVM在少量训练数据下也能有效检测变化点,优于现有深度学习方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
1703.00978 2026-06-04 eess.SY cs.LG cs.SE cs.SY

Compositional Falsification of Cyber-Physical Systems with Machine Learning Components

包含机器学习组件的网络物理系统组合性验证

Tommaso Dreossi, Alexandre Donzé, Sanjit A. Seshia

机构 * University of California, Berkeley(加州大学伯克利分校) Decyphir, Inc.(Decyphir公司)

AI总结 本文研究了包含机器学习组件的网络物理系统(CPS)的正确性问题,提出了一种组合性验证框架,通过时间逻辑 falsifier 和机器学习分析器合作寻找违反规范的执行,以验证 CPS 的正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.03216 2026-06-04 cs.LG cs.RO cs.SY eess.SY

Zero-shot Deep Reinforcement Learning Driving Policy Transfer for Autonomous Vehicles based on Robust Control

基于鲁棒控制的零样本深度强化学习驾驶策略迁移用于自动驾驶车辆

Zhuo Xu, Chen Tang, Masayoshi Tomizuka

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出了一种基于鲁棒控制的零样本深度强化学习驾驶策略迁移方法,通过转移具体的运动学量来解决自动驾驶中源域与目标域之间的建模差距问题,采用可转移的分层强化学习轨迹规划器和基于扰动观测器的鲁棒跟踪控制器,验证了该方法在多个驾驶场景中的零样本迁移能力。

Comments Published at IEEE ITSC 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.08907 2026-06-04 math.OC cs.LG cs.NA math.CA math.NA stat.ML

Understanding the Acceleration Phenomenon via High-Resolution Differential Equations

通过高分辨率微分方程理解加速现象

Bin Shi, Simon S. Du, Michael I. Jordan, Weijie J. Su

机构 * Florida International University(佛罗里达国际大学) Carnegie Mellon University(卡内基梅隆大学) University of California, Berkeley(加州大学伯克利分校) University of Pennsylvania(宾夕法尼亚大学)

AI总结 本文通过高分辨率微分方程研究优化算法的加速现象,提出了一种新的极限过程,能够区分Nesterov加速梯度法和Polyak重力球方法,并揭示了NAG-C在非强凸函数下的收敛特性。

Comments 82 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.11505 2026-06-04 eess.SY cs.LG cs.SY

Stability-certified reinforcement learning: A control-theoretic perspective

具有稳定性认证的强化学习:控制论视角

Ming Jin, Javad Lavaei

机构 * Department of Industrial Engineering and Operations Research, University of California, Berkeley(工业工程与运营管理系,加州大学伯克利分校) Department of Industrial Engineering and Operations Research, and the Tsinghua-Berkeley Shenzhen Institute, University of California, Berkeley(工业工程与运营管理系,以及清华-伯克利深圳研究院,加州大学伯克利分校)

AI总结 本文从控制论角度研究强化学习策略与非线性动力系统连接时的稳定性认证问题,提出了一种基于半定规划可行性的方法,通过调节策略的输入输出梯度来获得鲁棒稳定性保证,并通过实验验证了该方法在多飞行编队和电力系统频率调节任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
1506.02438 2026-06-04 cs.LG cs.RO cs.SY eess.SY

High-Dimensional Continuous Control Using Generalized Advantage Estimation

利用广义优势估计进行高维连续控制

John Schulman, Philipp Moritz, Sergey Levine, Michael Jordan, Pieter Abbeel

机构 * Department of Electrical Engineering and Computer Science(电气工程与计算机科学系) University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出了一种基于广义优势估计的方法,通过减少策略梯度估计的方差来解决高维连续控制中的样本需求问题,并通过信任区域优化提高稳定性和收敛性,从而在复杂的3D运动任务中实现了高效的政策学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
1808.03983 2026-06-04 cs.RO cs.SY eess.SY

Robot Safe Interaction System for Intelligent Industrial Co-Robots

智能工业协作机器人安全交互系统

Changliu Liu, Masayoshi Tomizuka

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出一种安全交互系统,通过并行规划与控制架构提升协作机器人在动态不确定环境中的效率与安全性,实验验证了方法的有效性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1807.00553 2026-06-04 cs.LG cs.AI cs.SY eess.SY math.DS stat.ML

A Broader View on Bias in Automated Decision-Making: Reflecting on Epistemology and Dynamics

对自动化决策中偏见的更广泛视角:反思认识论与动态性

Roel Dobbe, Sarah Dean, Thomas Gilbert, Nitin Kohli

机构 * Department of Electrical Engineering and Computer Sciences, University of California Berkeley, USA(加州大学伯克利分校电气工程与计算机科学系) Department of Rhetoric, University of California Berkeley, USA(加州大学伯克利分校修辞学系) School of Information, University of California Berkeley, USA(加州大学伯克利分校信息学院)

AI总结 本文探讨自动化决策中偏见的根源,将技术偏见视为认识论问题,新兴偏见视为动态反馈现象,强调需反思认识论并采用价值敏感设计方法改进决策系统。

Comments Presented at the 2018 Workshop on Fairness, Accountability and Transparency in Machine Learning during ICML 2018, Stockholm, Sweden

详情

展开后加载摘要…

URL PDF HTML 收藏
1711.03449 2026-06-04 math.OC cs.RO cs.SY eess.SY

Optimization-Based Collision Avoidance

基于优化的避障方法

Xiaojing Zhang, Alexander Liniger, Francesco Borrelli

机构 * Model Predictive Control Laboratory, Department of Mechanical Engineering, University of California, Berkeley, USA(加州大学伯克利分校机械工程系模型预测控制实验室) Automatic Control Laboratory, Department of Information Technology and Electrical Engineering, ETH Zurich, Switzerland(苏黎世联邦理工学院信息科技与电气工程系自动控制实验室)

AI总结 本文提出一种将非光滑避障约束转化为光滑非线性约束的方法,利用凸优化的强对偶性。该方法适用于在n维空间中移动的受控物体,能处理一般障碍物和可表示为有限凸集并集的受控物体,并结合了传统轨迹生成算法中常用的有号距离概念。

Comments 27 pages, 9 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
1702.04837 2026-06-04 stat.ML cs.LG cs.NA math.NA

Sketched Ridge Regression: Optimization Perspective, Statistical Perspective, and Model Averaging

草图岭回归:优化视角、统计视角和模型平均

Shusen Wang, Alex Gittens, Michael W. Mahoney

机构 * International Computer Science Institute and Department of Statistics University of California at Berkeley(国际计算机科学研究所和统计学系加州大学伯克利分校) Computer Science Department Rensselaer Polytechnic Institute(计算机科学系拉特格斯理工学院)

AI总结 本文从优化和统计角度研究了草图和Hessian草图在矩阵岭回归中的影响,发现经典草图能近似最优解,而Hessian草图则不同。通过理论和实验表明,模型平均可显著降低真实与草图解间的风险差距。

Comments To appear in Journal of Machine Learning Research, 2018. A short version has appeared in International Conference on Machine Learning (ICML), 2017

Journal ref Journal of Machine Learning Research, 19, pp1-50, 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1707.03770 2026-06-04 eess.SY cs.LG cs.SY math.OC

Fastest Convergence for Q-learning

Q-learning 最快收敛算法

Adithya M. Devraj, Sean P. Meyn

机构 * University of Florida(佛罗里达大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出Zap Q-learning算法,通过矩阵增益设计实现渐近方差最优,并通过ODE分析证明其瞬态行为接近确定性牛顿-拉夫森法,实验验证其在非理想参数化设置下的快速收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏