Weak Convergence Analysis of Online Neural Actor-Critic Algorithms
在线神经演员-评论家算法的弱收敛分析
机构 * Mathematical Institute, University of Oxford(牛津大学数学研究所)
AI总结 本文证明单层神经网络在线演员-评论家算法在隐藏单元数和训练步数趋于无穷时分布收敛到随机常微分方程,并利用泊松方程和弱收敛技术分析极限行为。
高校专区
在线神经演员-评论家算法的弱收敛分析
机构 * Mathematical Institute, University of Oxford(牛津大学数学研究所)
AI总结 本文证明单层神经网络在线演员-评论家算法在隐藏单元数和训练步数趋于无穷时分布收敛到随机常微分方程,并利用泊松方程和弱收敛技术分析极限行为。
BASIS: 基于单次采样信息共享的批量优势估计用于LLM推理
机构 * University of Science and Technology of China(中国科学技术大学) ; London School of Economics and Political Science(伦敦政治经济学院) ; University of Oxford(牛津大学)
AI总结 提出BASIS算法,通过单次采样和批次内信息共享改进价值函数估计,在减少计算开销的同时提升策略优化性能。
Comments 17 pages, 7 figures
将文本嵌入与利益相关者关联对齐
机构 * University of Oxford(牛津大学) ; Institute for Wicked Problems(复杂问题研究所) ; The Chinese University of Hong Kong(香港中文大学) ; Danish Technical University(丹麦技术大学) ; Aarhus University(奥胡斯大学)
AI总结 提出利益相关者对齐练习方法,通过评估嵌入模型与人类专家的语义距离一致性,发现神经文本嵌入在丹麦政策案例中可靠性显著低于专家(差距19-26个百分点),且该差距在美国联邦AI用例中复现(16个百分点)。
学习在不确定性下编排智能体
机构 * Department of Applied Mathematics and Theoretical Physics, University of Cambridge(应用数学与理论物理系,剑桥大学) ; Centre for Human-Inspired Artificial Intelligence, University of Cambridge(启发式人工智能中心,剑桥大学) ; African Institute for Mathematical Sciences, South Africa(南非数学科学研究所) ; Department of Engineering Science, University of Oxford(工程科学系,牛津大学)
AI总结 提出BOT-Orch框架,将编排问题转化为带正则化的多臂赌博机问题,在不确定性下实现异构智能体的自适应编排,理论保证遗憾界为O(√T)并优于基线。
后训练使大型语言模型更不像人类
机构 * Helmholtz Munich(海德堡-慕尼黑亥姆霍兹中心) ; Massachusetts Institute of Technology(麻省理工学院) ; University of Tübingen(图宾根大学) ; University of Oxford(牛津大学) ; Stanford(斯坦福大学)
AI总结 通过引入Psych-201数据集,发现后训练(将基础模型转化为有用助手的过程)一致地降低了模型与人类行为的对齐度,且这种错位在新模型世代中加剧,而人物诱导技术无法改善个体层面的预测。
使用 SAE 对抗体语言模型的机制可解释性研究
机构 * Department of Statistics, University of Oxford, UK(英国牛津大学统计系) ; Reticular, San Francisco, USA(美国旧金山Reticular公司) ; EECS, MIT, Cambridge MA, USA(美国麻省理工学院电子工程与计算机科学系) ; Leyden Laboratories BV, Leiden, The Netherlands(荷兰莱顿实验室)
AI总结 本研究采用 TopK 和 Ordered 稀疏自编码器(SAE)对抗体语言模型进行机制可解释性分析,发现 TopK SAE 能揭示有意义的生物学潜在特征但无法保证生成控制,而 Ordered SAE 通过层次结构可靠识别可操控特征但激活模式更复杂。
Comments v3: 15 pages; corrected author list and affiliations in the main text; minor text changes; updated steering results following minor code changes; conclusions and findings remain unchanged; included link to data and code in the Data Availability section
稳定图神经网络策略空间中的网络系统分布式控制
机构 * Department of Engineering Science, University of Oxford(牛津大学工程科学系)
AI总结 通过将图神经网络嵌入Youla-like幅度-方向参数化,提出一种保证闭环稳定性的分布式随机控制器,并证明其对图拓扑和模型参数扰动的鲁棒性。
$D^2$-Monitor: 通过犹豫感知路由实现扩散LLM的动态安全监控
机构 * Torr Vision Group, University of Oxford(奥克斯大学托尔视觉组) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
AI总结 针对扩散大语言模型的安全监控问题,提出基于犹豫感知路由的双层动态监控框架$D^2$-Monitor,通过轻量级探针实时估计犹豫度并触发高容量探针,在3个数据集上以0.85M参数达到最优性能与效率平衡。
Strat-Reasoner:在多智能体游戏中增强大语言模型的战略推理能力
机构 * School of Software Engineering, South China University of Technology(华南理工大学软件学院) ; Department of Computer Science, University of Oxford(牛津大学计算机科学系)
AI总结 提出Strat-Reasoner框架,通过递归推理范式和集中式思维链比较模块,结合混合优势与组相对强化学习,提升大语言模型在多智能体游戏中的战略推理能力。
PolySAE: 通过多项式解码建模稀疏自编码器中的特征交互
机构 * The Cyprus Institute(塞浦路斯研究所) ; University of Athens(雅典大学) ; University of Oxford(牛津大学) ; Archimedes AI/Athena Research Center(阿基米德AI/雅典娜研究中心) ; University of Cyprus(塞浦路斯大学)
AI总结 提出PolySAE,在稀疏自编码器解码器中引入高阶项以建模特征交互,通过低秩张量分解在共享投影子空间上捕获成对和三元特征交互,在保持可解释性的同时提升探测F1约8%,并产生与共现频率无关的组合结构。
Comments 43rd International Conference on Machine Learning (ICML 2026); Code: https://github.com/pakoromilas/PolySAE
通过稀疏后训练实现内在可解释的注意力机制
机构 * MPI-IS(马克斯·普朗克研究所) ; University of Oxford(牛津大学) ; ETH Zürich(苏黎世联邦理工学院)
AI总结 提出一种后训练方法,通过约束损失下的灵活稀疏正则化,在不牺牲性能的前提下将Transformer注意力连接稀疏至约0.4%,从而简化全局电路并提升可解释性。
接下来会发生什么?通过生成点轨迹预测未来运动
机构 * Visual Geometry Group, University of Oxford(牛津大学视觉几何组)
AI总结 提出一种基于单张图像预测未来运动的方法,通过生成密集轨迹网格来捕捉场景动态和不确定性,相比现有方法更准确多样,并验证其在机器人等下游任务中的有效性。
Journal ref ICLR 2026
PCSP元问题的搜索无效性和不可判定性
机构 * University of Oxford(牛津大学) ; Durham University(杜伦大学) ; University of Zaragoza(阿拉瓦大学)
AI总结 本文研究承诺约束满足问题(PCSP)的搜索版本与决策版本是否等价,证明BLP、AIP等算法在搜索版本中无效,并基于代数方法给出搜索无效的充分条件,进而证明相关元问题的不可判定性。
路径很重要:学习扩散语言模型的令牌提交策略
机构 * Department of Computer Science and Technology, University of Cambridge(计算机科学与技术系,剑桥大学) ; Department of Engineering Science, University of Oxford(工程科学系,牛津大学)
AI总结 本文提出TraceLock,一种轻量级可插拔控制器,通过学习可复用的轨迹状态策略来优化扩散语言模型中的令牌提交决策,从而改善质量与步数之间的权衡。
AI驱动的自适应对手与公钥系统中密码学信任的侵蚀
机构 * Department of Computer Sciences, University of Oxford(牛津大学计算机科学系) ; The Alan Turing Institute(艾伦·图灵研究所) ; British Library(大英图书馆)
AI总结 本文研究人工智能驱动的自适应对手如何利用实现层面的可观测性侵蚀公钥密码学的安全性,提出了一种新的安全评估框架。
Journal ref J Anal Sci Technol 17, 26 (2026)
去中心化AI是否可治理?从规制政策到构成性协议
机构 * University of Oxford(牛津大学) ; New York University Shanghai(纽约大学上海校区)
AI总结 本文分析去中心化AI的六层堆栈,揭示其导致的治理真空(责任缺口和无力化缺口),并提出从基于政策的规范性治理转向基于协议的构成性治理,同时确立合法性、可争议性、透明性和非支配性四个伦理条件。
Comments Submitted for Ethics and Information Technology
思维链劫持
机构 * Independent(独立) ; University of Oxford(牛津大学) ; Stanford University(斯坦福大学) ; Anthropic ; Martian Core
AI总结 提出思维链劫持攻击,通过诱导大型推理模型进行长时间良性推理来削弱其拒绝有害请求的能力,实现高成功率越狱。
Agent-X:评估视觉中心智能体任务中的深度多模态推理
机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) ; University of Central Florida(中央佛罗里达大学) ; University of Oxford(牛津大学)
AI总结 提出Agent-X基准,通过828个真实视觉任务和细粒度步骤评估框架,揭示当前模型在多步视觉推理中全链成功率低于50%的瓶颈。
Comments Accepted in International Conference of Learning Representations (ICLR 2026)
PACT:人机协作中持续任务辅助的主动询问
机构 * University of Science and Technology Beijing(北京科技大学) ; University of Oxford(牛津大学) ; Tsinghua University(清华大学)
AI总结 提出PACT框架,通过强化学习在部分观测下决定何时主动询问用户以澄清任务,从而在跨日人机协作中逐步提高辅助准确性和澄清效用。
算法度量:算法反馈下的预测
机构 * University of Oxford(牛津大学)
AI总结 提出算法度量框架,研究预测算法影响自身评估数据的反馈机制,证明部署风险不可仅由历史数据识别,并给出估计方法。
分类问题的神经正切核
机构 * Mathematical Institute, University of Oxford(牛津大学数学研究所) ; Oxford-Man Institute of Quantitative Finance, University of Oxford(牛津大学量化金融研究所) ; OATML, University of Oxford(牛津大学OATML研究中心) ; Department of Computer Science, University of Oxford(牛津大学计算机科学系) ; Spotify
AI总结 本文通过识别宽神经网络在分类损失下保持懒惰训练的条件,将神经正切核理论扩展到分类问题,并分析了参数正则化对核常数性的影响以及预测器分布与贝叶斯方法的关系。
Comments Preprint
线性系统求解器中后向误差的通用收敛性
机构 * University of Michigan(密歇根大学) ; University of Oxford(牛津大学) ; Princeton University(普林斯顿大学)
AI总结 本文证明经典Richardson迭代在半正定线性系统上具有与条件数无关的1/k后向误差收敛率,并基于Krylov子空间最小化后向误差提出MINBERR算法,实现O(n^2/√ε)复杂度。
Comments Added convergence analysis of MINBERR-NE for general linear systems (Theorems 5.1 and 5.3)
随机到达的在线非质心聚类中的延迟分配
机构 * Bar Ilan University(巴伊兰大学) ; University of Oxford(牛津大学)
AI总结 针对随机到达模型,提出一种常数竞争比的在线非质心聚类算法,允许延迟分配以平衡聚类距离成本和延迟成本。
Comments To Appear in the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS), 2026
Ceci n'est pas une explication: 评估语言学习系统中作为可解释性陷阱的解释失败
机构 * Oxford University Press(牛津大学出版社) ; Oxford Internet Institute(牛津互联网研究所) ; University of Oxford(牛津大学)
AI总结 本文通过L2-Bench基准评估AI语言学习工具在六个关键维度上的反馈质量,指出表面有用但本质有缺陷的解释会导致可解释性陷阱,并分析语言学习环境如何放大这些风险。
Comments Accepted to Misleading Impacts Resulting from AI Generated Explanations (MIRAGE) Workshop @ IUI 2026
SUDP: 面向智能体系统的秘密使用委托协议
机构 * Imperial College London(伦敦帝国学院) ; University of Oxford(牛津大学) ; Stanford University(斯坦福大学)
AI总结 针对智能体系统中用户秘密被滥用的问题,提出秘密使用委托协议(SUDP),通过授权、委托和兑现机制实现一次性秘密使用,满足七项安全属性。
目标条件智能体一次性学习所有内容
机构 * University of Oxford(牛津大学) ; McGill University(麦吉尔大学) ; MIT(麻省理工学院) ; Inria(法国国家信息与自动化研究所)
AI总结 提出LEO方法,通过联合输出所有目标的值和动作,实现高效并行全目标学习,在Craftax上显著优于其他方法,在连续控制任务上与基线相当,速度提升超过250倍。
深度的隐式偏差:从神经坍缩到Softmax编码
机构 * Mathematical Institute, University of Oxford(牛津大学数学研究所) ; Department of Electrical and Computer Engineering, University of British Columbia(不列颠哥伦比亚大学电气与计算机工程系)
AI总结 研究深度无约束特征模型在无正则化训练下,梯度下降和深度如何诱导低秩隐式偏差,从而从神经坍缩转向softmax编码,并分析训练动态和宽度的影响。
Comments 46 pages, 11 figures, accepted at the International Conference on Machine Learning 2026
通过神经后验估计在广义贝叶斯中进行摊销的基于模拟的推理
机构 * Department of Statistics, University of Oxford, Oxford, United Kingdom(英国牛津大学统计系) ; Department of Statistics, University of Auckland, Auckland, New Zealand(新西兰奥克兰大学统计系)
AI总结 提出一种通过训练单一数据与β条件神经后验估计器来摊销广义贝叶斯推理中温度参数β的方法,无需模拟器调用或推理时MCMC,实现单次前向传播采样。
Comments Accepted at ICML 2026
当更强的触发器反噬:高维背景下后门攻击的理论
机构 * Mathematical Institute, University of Oxford(牛津大学数学研究所) ; School of Mathematical Science, Tel Aviv University(特拉维夫大学数学科学学院) ; School of Mathematical Science and Computer Science, Tel Aviv University(特拉维夫大学数学科学与计算机科学学院)
AI总结 本文研究了在高维情况下后门毒化攻击的行为,发现更强的训练触发器有助于防御者,并通过高维理论分析了后门攻击的核心机制和影响因素。
黎曼几何与fMRI的结合:建模相关流形和特征向量子空间的优势
机构 * Department of Information Engineering, University of Padova(信息工程系,帕多瓦大学) ; Department of Neuroimaging, Institute of Psychiatry, Psychology and Neuroscience (IoPPN), King’s College London(神经影像系,精神病学、心理学与神经科学研究所(IoPPN),伦敦国王学院) ; Department of Psychiatry, University of Oxford(精神病学系,牛津大学) ; Oxford Health NHS Foundation Trust, Warneford Hospital(牛津健康国家卫生信托基金,沃内福德医院) ; Department of Psychosis Studies, Institute of Psychiatry, Psychology and Neuroscience, King’s College London(精神病学研究系,精神病学、心理学与神经科学研究所,伦敦国王学院)
AI总结 本文提出了一种可扩展的几何框架,通过Off-log度量和Grassmannian子空间判别方法,改进了fMRI数据的分析,提高了敏感性和预测性能。