Action-Factored Multi-Agent Reinforcement Learning for Scalable Quantum Device Tuning
用于可扩展量子器件调谐的动作分解多智能体强化学习
机构 * University of Oxford(牛津大学)
AI总结 针对量子器件调谐中参数串扰致学习不稳定问题,提出用在线学习动作空间分解表示的方法,框架QADAPT借此高效学习共享策略,实现零样本泛化及收敛步骤数恒定,为大规模量子处理器快速校准提供可扩展途径。
高校专区
用于可扩展量子器件调谐的动作分解多智能体强化学习
机构 * University of Oxford(牛津大学)
AI总结 针对量子器件调谐中参数串扰致学习不稳定问题,提出用在线学习动作空间分解表示的方法,框架QADAPT借此高效学习共享策略,实现零样本泛化及收敛步骤数恒定,为大规模量子处理器快速校准提供可扩展途径。
迈向可关闭的智能体:在强化学习智能体和大语言模型中推广随机选择
机构 * University of Oxford(牛津大学) ; University College London(伦敦大学学院) ; New College of Florida(佛罗里达新学院) ; Imperial College London(伦敦帝国学院) ; MIT(麻省理工学院)
AI总结 本文提出DReST奖励函数,通过惩罚重复选择相同长度轨迹来训练智能体在不同轨迹长度间随机选择并有效追求目标,实验表明DReST训练的智能体在未见过的场景中表现出更高的有用性和中立性。
从交叉验证到SURE:调节估计器的渐近风险
机构 * Department of Economics, University of Pennsylvania(宾夕法尼亚大学经济学系) ; Department of Economics, University of Oxford(牛津大学经济学系) ; Department of Electrical Engineering and Computer Science, MIT(麻省理工学院电气工程与计算机科学系)
AI总结 本文推导了通过n折交叉验证调节的正则化经验风险最小化估计器的渐近风险函数,展示了其在正常均值模型中的预测性能。
超越黑盒混淆:白盒监测器的机制分析与防御
机构 * University of Oxford(牛津大学)
AI总结 研究针对大语言模型白盒监测器可被规避且缺乏防御措施的问题,通过红队实验揭示几何转移和协方差操纵两种逃避策略,引入SafetyNet集成方法,在多模型家族实验中取得高AUROC分数,为稳健潜在空间监测提供了实证和起点。
预测驱动的主动测试
机构 * Department of Statistics, University of Oxford(牛津大学统计学系) ; Department of Computer Science, Aalto University(艾尔沃斯大学计算机科学系)
AI总结 针对现有主动测试估计器未利用黑盒模型预测信息的问题,提出预测驱动的主动测试(PPAT)框架。它结合无偏估计器与控制变量,通过使损失残差化降低方差,推导获取规则,建立渐近正态性,在风险估计上优于现有方法。
通过得分匹配进行贝叶斯实验设计
机构 * Department of Statistics University of Oxford(统计系牛津大学)
AI总结 研究贝叶斯实验设计中预期信息增益双重难处理性问题,提出先解决得分匹配问题分离其与策略学习,再用学到的得分近似单难处理训练策略,减轻计算负担,实验验证该方法可训练竞争策略并提升性能。
Comments Accepted for the 42nd Conference on Uncertainty in Artificial Intelligence (UAI 2026)
增强KidSat模型:整合地理编码和数据质量评估用于儿童贫困预测
机构 * School of Mathematics University of Bristol(布里斯托大学数学学院) ; Department of Computer Science University of Oxford(牛津大学计算机科学系)
AI总结 该研究基于KidSat框架,通过精细数据预处理、图像质量评估和地理编码改进儿童贫困预测。具体包括细化目标矩阵、筛选数据及融合特征。实验表明这些改进有效降低MAE,为基于卫星的社会经济预测提供了可扩展方法。
阈值差分注意力:用于无汇、超稀疏和非分散语言建模
机构 * University of Oxford(牛津大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Snap Inc
AI总结 本文提出阈值差分注意力机制,解决长上下文下的注意力汇问题,实现超稀疏和鲁棒性提升,无需投影方法或标准注意力的噪声积累。
Journal ref ACL 2026
具有不断变化的客户端和标签空间的异步联邦持续分割
机构 * University of Oxford(牛津大学) ; University of Bristol(布里斯托大学)
AI总结 研究现实中联邦学习客户端组成和标签空间会变化的问题,提出CA-MMDS框架,通过基于代理的蒸馏更新全局模型,减少通信和计算成本,以多类3D腹部CT分割任务验证其能有效整合客户端知识并获良好分割性能。
基于生物信息神经网络的可靠机械算子恢复:架构与优化设计原理
机构 * Mathematical Institute, University of Oxford(牛津大学数学研究所)
AI总结 研究生物信息神经网络用于机械算子恢复时网络架构、优化策略等因素对其的影响,通过对典型偏微分方程模型实证研究,发现成功推理依赖平衡目标,给出架构、参数设置建议及失败模式诊断方法,为生物模型发现提供指导。
Comments 63 pages, 27 figures
通过深度原生结构推理实现准确、跨学科和透明的结构-属性理解
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; The Chinese University of Hong Kong(香港中文大学) ; Shanghai Jiao Tong University(上海交通大学) ; Fudan University(复旦大学) ; University of Sydney(悉尼大学) ; Nanjing University(南京大学) ; University of Oxford(牛津大学) ; The University of Science and Technology of China(中国科学技术大学) ; Drug Discovery and Design Center, State Key Laboratory of Drug Research, Shanghai Institute of Materia Medica, Chinese Academy of Sciences(药物发现与设计中心、国家药物研究重点实验室、上海中医药材料医学研究所、中国科学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Stanford University(斯坦福大学)
AI总结 研究聚焦利用人工智能解释结构-属性关系的挑战,提出多模态科学基础模型SciReasoner,通过离散化结构信息为可寻址单元进行推理,在多领域基准测试中表现出色,实现准确预测与可解释科学推理的结合。
PRoVeFL:联邦学习中的隐私保护、健壮且可验证的聚合
机构 * Indian Institute of Technology (BHU)(印度理工学院(博帕尔)) ; Vaulttree ; University of Warwick(沃里克大学) ; University of Oxford(牛津大学) ; Abdullah Gul University(阿卜杜勒·加勒大学)
AI总结 研究针对联邦学习中传统框架的安全问题,提出PRoVeFL框架,利用多服务器和多密钥全同态加密,兼容多种拜占庭健壮聚合算法并增强其可验证性,通过实验验证了该框架的可扩展性及相比现有工作在运行时的显著提升。
Comments 18 pages
MMDiff: 扩展扩散变换器用于多模态生成
机构 * University of Oxford, Visual Geometry Group(牛津大学视觉几何组)
AI总结 提出MMDiff框架,利用冻结的扩散变换器通过轻量解码器联合生成图像及多种密集感知模态,发现多时间步特征融合与空间变化聚合权重是关键,在语义分割等任务上取得优异性能。
EgoExoMem: 跨视角记忆推理 over 同步的自身视角和外部视角视频
机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) ; ETH Zurich(苏黎世联邦理工学院) ; University of Oxford(牛津大学) ; Hunan University(湖南大学)
AI总结 本文提出EgoExoMem,首个跨视角记忆推理基准,通过同步自身视角和外部视角视频进行跨视角记忆推理,利用E$^2$-Select方法实现高效的帧选择,实验表明自身和外部视角提供互补的记忆线索,但现有模型在基准测试中表现有限。
Comments The source code and dataset can be found at https://github.com/RuipingL/EgoExoMem
GrandTour: 一种用于多模态感知与状态估计的野外腿式机器人数据集
机构 * ETH Zurich(苏黎世联邦理工学院) ; Stanford University(斯坦福大学) ; UC Berkeley(伯克利大学) ; Oxford University(牛津大学)
AI总结 GrandTour数据集为多模态感知与状态估计提供了大规模野外腿式机器人数据,支持SLAM和高精度状态估计的研究与开发。
Comments Turcan Tuna, and Jonas Frey contributed equally. Submitted to Sage The International Journal of Robotics Research
ROAD-Waymo:一个用于自动驾驶的大规模动作感知数据集
机构 * Oxford Brookes University(奥克斯福德布鲁克斯大学) ; MAZUST ; University of Oxford(牛津大学) ; Imperial College London(伦敦帝国学院) ; ETH Zurich(苏黎世联邦理工学院)
AI总结 本文提出ROAD-Waymo数据集,用于道路场景中代理、动作等检测技术开发与基准测试,比现有数据集更大更具挑战性,含大量标注数据,通过新注释管道增强完整性,还能解决不同国家道路场景的域适应问题。
Hilti-Trimble-牛津数据集:用于SLAM和定位的带有平面图先验的360视觉惯性基准测试
机构 * Hilti AG(喜利得集团) ; University of Oxford(牛津大学) ; ETH Zürich(苏黎世联邦理工学院) ; Vision & Robotics GmbH(视觉与机器人有限公司) ; Trimble Inc.(天宝公司)
AI总结 本文介绍了Hilti-Trimble-牛津数据集,用于支持建筑工地的视觉SLAM和定位。它收集于活跃建筑工地,包含30个视觉惯性序列及地面真值轨迹。通过开放研究挑战评估相关系统,反映出SLAM方法更成熟,凸显定位任务难度,为持续研究提供支持,数据集公开可用。
Pluralis v0.1:迈向用于人工智能风险与可靠性的多元文化、多模态、多语言基准测试
机构 * Google DeepMind(谷歌DeepMind) ; University of Alabama in Huntsville(阿拉巴马大学亨茨维尔分校) ; Google(谷歌) ; University of Missouri Columbia(密苏里大学哥伦比亚分校) ; Chunghwa Telecom Laboratories(春木电信实验室) ; University of Southern California(南加州大学) ; Polytechnique Montreal(蒙特利尔理工学院) ; Nutanix ; ThinkEvolve Labs(ThinkEvolve实验室) ; UCL(伦敦大学学院) ; Infocomm Media Development Authority(信息通信媒体发展局) ; Monark Health(Monark健康) ; Seoul National University(首尔国立大学) ; Microsoft(微软) ; Centre for Responsible AI (CeRAI), Wadhwani School of Data Science and AI (WSAI), Indian Institute of Technology Madras(负责任人工智能中心(CeRAI)、瓦达威人工智能学校(WSAI)、印度理工学院马德拉斯分校) ; University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) ; Microsoft Research India(微软印度研究院) ; Stanford University(斯坦福大学) ; Argonne National Laboratory(阿贡国家实验室) ; University of Oxford(牛津大学) ; KAIST(韩国科学技术院) ; Yonsei University(延世大学) ; Amazon(亚马逊) ; UIUC(伊利诺伊大学香槟分校) ; Rochester Institute of Technology(罗切斯特理工学院) ; Xenoscube Inc.(Xenoscube公司) ; Korea AI Safety Institute (K-AISI)(韩国人工智能安全研究所(K-AISI)) ; MLCommons ; CommonGround ; Artifex Labs(Artifex实验室)
AI总结 研究针对现有AI安全评估框架忽视文化差异问题,构建多语言多模态数据集Pluralis v0.1,从文化优先视角引入新评估范式,提出Judge - Pluralis集成,揭示特定地区失败模式,为多语言多元文化评估提供基础和创新起点。
超越排行榜:大语言模型智能体中工具使用、规划和推理失败的综合分析
机构 * University of Oxford(牛津大学)
AI总结 本文综合多篇论文形成大语言模型智能体局限性交叉分类法,识别出六个失败集群,通过迭代分组得出分类法,发现失败与任务长度非线性相关,单个子任务性能不能保证端到端成功,额外脚手架效果不佳,同时在部分任务上有进展。
Comments 16 pages, 3 tables, 1 figure
生成式人工智能工作流程中的特权与保密性
机构 * University of Bristol Law School(布里斯托大学法学院) ; University of Oxford(牛津大学) ; Department of Computer Science(计算机科学系)
AI总结 研究生成式人工智能系统三种数据存储和处理模式带来的保密性与法律专业特权风险,结合英美判决、权威及研究进行分析,置于监管框架和专业疏忽原则中探讨,助法律服务人员理解风险,推动GenAI更负责任部署。
高斯过程潜在因子回归用于低数据高维输出问题
机构 * University of Cambridge(剑桥大学) ; University of Colorado Boulder(科罗拉多大学博尔德分校) ; University of Oxford(牛津大学) ; University of Exeter(埃克塞特大学)
AI总结 提出高斯过程潜在因子回归(GPLFR)模型,通过将输出表示为低维潜在状态的线性高斯解码,联合优化压缩与预测,解决低数据高维输出回归问题,并首次构建岩石系外行星全球气候模型的空间分辨仿真器。
Comments 9 pages content + 23 pages appendix/references. Supporting code at https://github.com/edstevenson/GPLFR
ZeroBench:当代大型多模态模型的一个不可能的视觉基准测试
机构 * University of Cambridge(剑桥大学) ; University of Alberta(阿尔伯塔大学) ; The University of Hong Kong(香港大学) ; University of Oxford(牛津大学) ; Northeastern University(东北大学) ; Astadeus ; College of Southern Maryland(马里兰州南部学院) ; University of Geneva(日内瓦大学) ; University of Oregon(俄勒冈大学)
AI总结 针对大型多模态模型在图像解释方面不足但在现有视觉基准测试中优势易逝的问题,引入通过对抗过滤策划的ZeroBench基准测试,评估多个模型,展现其潜力并公开测试内容,为模型视觉能力评估提供长期有效的新基准。
Comments Accepted at ICML 2026
Syn4D:多视图合成4D数据集
机构 * VGG ; University of Oxford(牛津大学) ; Nanyang Technological University(南洋理工大学) ; Naver Labs Europe(Naver欧洲实验室)
AI总结 针对动态场景稠密3D重建跟踪缺高质量标注数据集的问题,构建含多类真值标注的Syn4D数据集,支撑多下游任务,助力相关研究。
Comments 33 pages, 11 figures, project page: https://jzr99.github.io/Syn4D/
SynCity 3000:引导式构建场景级3D扩散模型
机构 * Visual Geometry Group, University of Oxford(牛津大学视觉几何组)
AI总结 针对3D场景训练数据稀缺问题,该框架将图像转3D生成器改造为卷积算子,依托新合成数据引擎微调,可生成全局连贯、支持细粒度布局控制的任意规模3D场景。
Comments Project Page: https://research.paulengstler.com/syncity-3k/
基于机器学习的早产儿呼吸暂停视频检测方法研究
机构 * Institute of Biomedical Engineering, Department of Engineering Science, University of Oxford(牛津大学工程科学系生物医学工程研究所)
AI总结 针对NICU接触式呼吸监测易受干扰的问题,该研究用ResNet从视频提取胸壁运动信号检测呼吸暂停,融合常规生理信号将平衡准确率提至90.6%,提升了监测鲁棒性。
Comments Paper submitted to Computer Methods and Programs in Biomedicine (CMPB)
保持离散:学习连续脊柱退变严重程度评分的益处
机构 * Biomedical Data Science Lab, Dept. D-HEST, ETH Zurich(生物医学数据科学实验室,D-HEST系,苏黎世联邦理工学院) ; Swiss Institute of Bioinformatics (SIB)(瑞士生物信息学研究所) ; Visual Geometry Group, Dept. of Engineering Science, University of Oxford(视觉几何组,工程科学系,牛津大学)
AI总结 研究将脊柱退变建模为连续严重程度排序问题,介绍SpineRankNet框架从腰椎MRI学习标量严重程度分数,与多类分类和序数回归对比,表明排序损失训练的模型可实现MRI扫描细粒度排序,分数能恢复分级且提升类间区分度。
预训练课程实现选择性微调
机构 * University of Oxford(牛津大学)
AI总结 研究预训练课程如何影响学习、泛化和微调选择性,对比平衡与不平衡预训练方式,发现不平衡预训练促进上下文学习并提高拒绝微调选择性,还扩展到合成语言学习任务。
KinEMbed:通过跨模态对比学习从肌电图中解码运动学
机构 * Department of Statistics, University of Oxford(牛津大学统计学系) ; School of Informatics, University of Edinburgh(爱丁堡大学信息学院)
AI总结 研究从表面肌电图解码手部运动学这一挑战,提出跨模态对比学习框架KinEMbed训练双编码器,用于手部运动学回归,在NinaPro DB8数据集上优于基线方法。
Comments ICML 2026 Workshop on Structured Data for Health, Seoul, South Korea
一种基于视频的非侵入性野生动物个体识别方法:利用步态动力学
机构 * Department of Computer Science, University of Oxford(牛津大学计算机科学系) ; Wildlife Conservation Research Unit, Department of Biology, University of Oxford(牛津大学生物系野生动物保护研究组)
AI总结 研究针对野生动物个体识别难题,提出基于视频的全自动方法。用深度时空表征学习,结合SAM3、ResNet18和VideoPrism模型,经微调提取特征,以余弦相似度比较步态特征实现识别,多物种实验验证了方法有效性。
Comments This article is under review in "Methods in Ecology and Evalution"
因果游戏:在游戏中对大语言模型智能体的因果思维进行基准测试
机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Hong Kong Baptist University(香港浸会大学) ; University of Oxford(牛津大学) ; New York University, Abu Dhabi(纽约大学阿布扎比分校)
AI总结 研究旨在通过因果游戏基准测试大语言模型智能体的因果思维能力,让智能体设计实验、收集数据并给出解决方案。设计含多种挑战的场景,发现当前智能体因果思维能力欠佳,为评估提供了测试平台。
Comments Zhenhao, Yongqiang, and Chenxi contributed equally to the project. A short version is accepted at the Forty-Third International Conference on Machine Learning (ICML) 2026 as an Oral presentation. Project website https://causalgame.github.io/