arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Cambridge(剑桥大学)

共收录 1283
2606.13608 2026-06-16 cs.AI cs.LG 新提交

AgentBeats: Agentifying Agent Assessment for Openness, Standardization, and Reproducibility

AgentBeats:面向开放性、标准化和可复现性的智能体评估代理化

Xiaoyuan Liu, Jianhong Tu, Yuqi Chen, Siyuan Xie, Sihan Ren, Tianneng Shi, Gal Gantar, Evan Sandoval, Donghyun Lee, Daniel Miao, Peter J. Gilbert, Nick Hynes, Mauro Staver, Warren He, David Marn, Andrew Low, Xi Zhang, Elron Bandel, Michal Shmueli-Scheuer, Siva Reddy, Alexandre Drouin, Alexandre Lacoste, Ramayya Krishnan, Elham Tabassi, Yu Su, Victor Barres, Chenguang Wang, Wenbo Guo, Dawn Song

机构 * University of California, Berkeley(加州大学伯克利分校) Purdue University(普渡大学) University of Ljubljana(卢布尔雅那大学) University of Washington(华盛顿大学) Oasis Labs University of Maryland(马里兰大学) IBM Research(IBM研究院) Mila McGill University(麦吉尔大学) ServiceNow Research(ServiceNow研究院) Carnegie Mellon University(卡内基梅隆大学) National Institute of Standards and Technology(美国国家标准与技术研究院) The Ohio State University(俄亥俄州立大学) University of Cambridge(剑桥大学) University of California, Santa Barbara(加州大学圣塔芭芭拉分校)

AI总结 提出代理化智能体评估(AAA)框架,通过标准化协议(A2A和MCP)统一评估接口,实现开放、可复现的多智能体评估,并基于AgentBeats系统通过大规模竞赛和案例研究验证其覆盖性、实用性和保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04145 2026-06-16 cs.LG cs.AI cs.DC 版本更新

EvalStop: Using World Feedback to Detect and Correct Reward Overoptimization in Multi-Tenant RLHF Platforms

EvalStop:利用世界反馈检测和纠正多租户RLHF平台中的奖励过度优化

Guilin Zhang, Chuanyi Sun, Kai Zhao, Xu Chu, Shahryar Sarkani, John M. Fossaceca

机构 * DeepMind, London, UK(深度Mind, 英国伦敦) University of Cambridge, UK(英国剑桥大学) University of Washington, USA(美国华盛顿大学)

AI总结 提出EvalStop调度原语,通过检测评估分数连续下降来终止作业、释放GPU并保留最佳检查点,以纠正奖励过度优化,在RLHF负载上实现高精度检测并提升JCT。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07013 2026-06-16 cs.CL 版本更新

CoBit: Language Modeling with Bitstream Diffusion

CoBit: 基于比特流扩散的语言建模

Georgios Batzolis, Mark Girolami, Luca Ambrogioni

机构 * University of Cambridge(剑桥大学)

AI总结 提出CoBit模型,将文本建模为固定宽度二进制比特流上的连续扩散过程,采用匹配滤波残差参数化和基于熵率门控的朗之万校正采样器,在LM1B和OpenWebText上达到接近自回归模型的生成困惑度,并消除词汇表缩放瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06184 2026-06-16 cs.SE cs.LG cs.LO cs.PL

Teaching LLMs Program Semantics via Symbolic Execution Traces

通过符号执行轨迹教学LLM程序语义

Jonas Bayer, Stefan Zetzsche, Olivier Bouissou, Remi Delmas, Michael Tautschnig, Soonho Kong

机构 * University of Cambridge(剑桥大学) Amazon Web Services(亚马逊网络服务)

AI总结 本文通过符号执行轨迹训练提升LLM对程序语义的理解,发现结合推理的训练显著提升了漏洞检测能力,且在不同属性类型上均有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05859 2026-06-16 cs.AI 版本更新

When Do We Need LLMs? A Diagnostic for Language-Driven Bandits

何时需要大语言模型?语言驱动型老虎机的诊断方法

Uljad Berdica, Fernando Acero, Anton Ipsen, Parisa Zehtabi, Michael Cashmore, Manuela Veloso

机构 * University of Cambridge(剑桥大学)

AI总结 提出LLMP-UCB算法从LLM中获取不确定性估计,实验表明轻量数值老虎机在文本嵌入上匹配或超越LLM方案且成本更低,并给出基于臂嵌入的几何诊断指导何时使用LLM。

Comments The Reinforcement Learning Conference, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02343 2026-06-16 cs.LG cs.AI cs.IT math.IT 版本更新

Haiku to Opus in Just 10 bits: LLMs Unlock Large Compression Gains

仅用10比特从俳句到巨作:LLMs解锁巨大压缩增益

Roy Rinberg, Annabelle Michael Carrell, Simon Henniger, Nicholas Carlini, Keri Warr

机构 * Harvard University(哈佛大学) University of Cambridge(剑桥大学) Anthropic

AI总结 研究LLM生成文本的无损和有损压缩,提出问答压缩(QA)交互协议,用少量二进制问题实现超100倍压缩比,高效传递知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20043 2026-06-16 cs.AI 版本更新

Discovering Symmetry Groups with Flow Matching

通过流匹配发现对称群

Yuxuan Chen, Jung Yeon Park, Floor Eijkelboom, Jianke Yang, Jan-Willem van de Meent, Lawson L. S. Wong, Robin Walters

机构 * University of Cambridge(剑桥大学)

AI总结 提出LieFlow框架,将对称发现转化为李群上的分布学习问题,无需固定基或分布假设,能统一发现连续和离散对称,实验优于LieGAN。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07442 2026-06-16 cs.SD 版本更新

INFER : Learning Implicit Neural Frequency Response Fields for Confined Car Cabin

INFER:学习受限汽车座舱的隐式神经频率响应场

Harshvardhan C. Takawale, Nirupam Roy, Phil Brown

机构 * Harvard University(哈佛大学) University of Cambridge(剑桥大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 提出INFER框架,通过频域神经隐式模型联合学习源和接收器位置、方向下的复值频率响应场,引入端到端前向模型、感知谱监督和Kramers-Kronig约束,在汽车座舱数据上显著降低幅度和相位重建误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02908 2026-06-16 cs.LG cs.DC 版本更新

Photon: Federated LLM Pre-Training

Photon: 联邦大语言模型预训练

Lorenzo Sani, Alex Iacob, Zeyu Cao, Royson Lee, Bill Marino, Yan Gao, Dongqi Cai, Zexi Li, Wanru Zhao, Xinchi Qiu, Nicholas D. Lane

机构 * University of Cambridge(剑桥大学) Flower Labs(Flower实验室) Zhejiang University(浙江大学)

AI总结 提出Photon系统,首次实现联邦端到端LLM预训练,通过跨孤岛联邦学习在弱连接GPU上训练高达7B参数模型,通信量减少64-512倍,收敛速度比DiLoCo快2倍。

Comments 18 pages, 9 appendix pages, 12 figures, 3 algorithms, 12 tables

Journal ref Proceedings of Machine Learning and Systems 7 (MLSys 2025), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13796 2026-06-15 stat.ML cs.LG 新提交

Recursively Trained Diffusion Models: Limiting Collapse Distribution and Spectral Characterization

递归训练的扩散模型:限制崩溃分布与谱特征

Naïl B. Khelifa, Richard E. Turner, Ramji Venkataramanan

机构 * University of Cambridge(剑桥大学)

AI总结 研究递归训练扩散模型时的分布崩溃问题,证明即使完美学习也会因早期停止导致漂移,并收敛到唯一极限分布,该分布具有低通滤波谱特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14699 2026-06-15 cs.CV cs.GR cs.RO 新提交

Instruct-Particulate: Scaling Feed-Forward 3D Object Articulation with Kinematic Control

Instruct-Particulate: 基于运动学控制的可扩展前馈式3D物体关节化

Ruining Li, Yuxin Yao, Matt Zhou, Chuanxia Zheng, Christian Rupprecht, Joan Lasenby, Shangzhe Wu, Andrea Vedaldi

机构 * University of Oxford(牛津大学) University of Cambridge(剑桥大学) Nanyang Technological University(南洋理工大学)

AI总结 提出Instruct-Particulate模型,通过运动学规范(部件描述、连接性、关节类型等)指导3D网格的关节分割和运动参数预测,利用异构数据集(15万+物体)训练,实现跨类别和AI生成网格的泛化。

Comments Project page: https://instruct-particulate.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14688 2026-06-15 cs.LG cs.AI cs.CL cs.DS 新提交

Flood and Harvest: The Provable Necessity of Trivia for Generating Valuable Mathematics via the Lens of Language Generation in the Limit

洪流与收获:通过极限语言生成视角证明琐碎知识对于生成有价值数学的必要性

Xiaoyu Li, Andi Han, Dai Shi, Zheng Gao, Jiaojiao Jiang, Junbin Gao

机构 * University of New South Wales(新南威尔士大学) University of Sydney(悉尼大学) University of Cambridge(剑桥大学)

AI总结 本文通过极限语言生成模型证明,在形式化数学生成中,验证器无法替代品味:覆盖未记录的有价值数学必须产生无限但渐近可忽略的琐碎语句,这是理论上的必然。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14388 2026-06-15 cs.LG 新提交

A Low-Rank Subspace Analysis of LLM Interventions

LLM干预的低秩子空间分析

Angira Sharma, Christian Schroeder de Witt, Philip Torr, Anisoara Calinescu, Jialin Yu

机构 * University of Cambridge(剑桥大学)

AI总结 提出诊断框架,将行为建模为激活空间中的低秩子空间,发现干预一个行为会不对称地影响其他行为,效果与子空间重叠和决策子空间角度相关。

Comments Mechanistic Interpretability Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14209 2026-06-15 cs.CL 新提交

Detecting undisclosed LLM-generated content in parliamentary texts

检测议会文本中未披露的LLM生成内容

Minerva Suvanto, Andrea McGlinchey, Peter J. Barclay, Mattias Wahde

机构 * Chalmers University of Technology(查尔姆斯理工大学) University of Cambridge(剑桥大学)

AI总结 本研究训练可解释文本分类器,检测英国和瑞典议会文本中未披露的LLM使用情况,发现自2022年起两国议会中未披露的LLM使用持续增加。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13944 2026-06-15 cs.CL 新提交

LLMs Contain Multitudes: How Deployment Context Reshapes Model-Level Preferences and Values

LLM 蕴含多重性:部署上下文如何重塑模型层面的偏好与价值观

Filip Trhlik, Aoife O'Flynn, Angela Yu, Arduin Findeis, Paula Buttery

机构 * University of Cambridge(剑桥大学) ALTA Institute(ALTA研究所) Leverhulme Centre for the Future of Intelligence(勒沃霍姆未来智能中心) Microsoft UK(微软英国)

AI总结 本研究通过两个成对比较范式(国家偏好排序和效用判断)发现,部署上下文(如撰写Reddit帖子或新闻文章)对LLM偏好和价值观的影响远大于提示改写和温度控制,表明模型层面的偏好是上下文依赖的。

Comments 68 pages, 54 figures, 54 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14334 2026-06-15 cs.LG math.DG 新提交

Riemannian Metric Matching for Scalable Geometric Modeling of Distributions

黎曼度量匹配:面向分布的可扩展几何建模

Jacob Bamberger, Adam Gosztolai, Pierre Vandergheynst, Michael Bronstein, Iolo Jones

机构 * University of Cambridge(剑桥大学)

AI总结 提出黎曼度量匹配框架,通过神经网络学习数据的黎曼几何,利用carré du champ算子的条件期望形式实现样本级训练和恒定成本推理,在精度相当或更优下速度提升400倍。

Comments ICML 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14570 2026-06-15 physics.ao-ph cs.AI cs.LG 新提交

Regional Climate Model Emulation with Diffusion Approaches: What is the Added Value of Generative Machine Learning?

基于扩散方法的区域气候模型模拟:生成式机器学习的附加价值是什么?

Mikel N. Legasa, Antoine Doury, Achille Gellens, Redouane Lguensat, Clara Naldesi, Soulivanh Thao, Mathieu Vrac

机构 * University of Cambridge(剑桥大学) CNRS(法国国家科学研究中心) Institut Pierre Simon Laplace(皮埃尔·西蒙·拉普拉斯研究所)

AI总结 本文提出ParamDiffusion,一种两阶段扩散框架,与确定性方法对比,评估生成式机器学习在区域气候模型模拟中的附加价值,发现扩散方法能高技巧地再现气候统计特征,但极端事件模拟仍有不足。

Comments Submitted to Journal of Advances in Modeling Earth Systems (JAMES)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00593 2026-06-15 cs.CV cs.LG 版本更新

Pix2Fact: When Vision Is Not Enough -- Benchmarking Fine-Grained VQA with Web Verification on High-Resolution Real-World Scenes

Pix2Fact: 当视觉不够时——基于网络验证的细粒度VQA基准测试

Yifan Jiang, Cong Zhang, Bofei Zhang, Qiaofeng Zheng, Yifan Yang, Bingzhang Wang, Yew-Soon Ong

机构 * GADE Union (Global AI Data Experts Union)(GADE联盟(全球人工智能数据专家联盟)) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) New York University(纽约大学) Cambridge University(剑桥大学) The University of Hong Kong(香港大学)

AI总结 本文提出Pix2Fact基准测试,通过高分辨率真实场景中的网络验证,评估细粒度视觉问答中的专家级视觉感知和知识搜索能力,发现现有模型在复杂任务中存在显著不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07075 2026-06-15 cs.SD 版本更新

Metric Analysis for Spatial Semantic Segmentation of Sound Scenes

声场景空间语义分割的度量分析

Mayank Mishra, Paul Magron, Romain Serizel

机构 * University of Cambridge(剑桥大学) Inria(法国国家信息与自动化技术研究院)

AI总结 针对声场景空间语义分割(S5)的评估,提出一种新的度量CASA-SDR,通过置换不变源匹配分离分类与分离误差,提供更可解释的分离中心评估。

Comments 5 pages; content+bibliography

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09161 2026-06-15 stat.ML cs.LG 版本更新

Minimum Distance Summaries for Robust Neural Posterior Estimation

最小距离摘要用于鲁棒神经后验估计

Sherman Khoo, Dennis Prangle, Song Liu, Mark Beaumont

机构 * University of Cambridge(剑桥大学)

AI总结 提出最小距离摘要方法,通过最大均值差异(MMD)在测试时自适应调整摘要统计量,在不修改预训练神经后验估计器的情况下实现鲁棒推断,理论保证鲁棒性并实验验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12913 2026-06-15 cs.AI cs.LG cs.NE 版本更新

Actionable Interpretability Must Be Defined in Terms of Symmetries

可操作的可解释性必须根据对称性来定义

Pietro Barbiero, Mateo Espinosa Zarlenga, Francesco Giannini, Alberto Termine, Filippo Bonchi, Mateja Jamnik, Giuseppe Marra

机构 * University of Oxford(牛津大学) ETH Zurich(苏黎世联邦理工学院) University of Cambridge(剑桥大学)

AI总结 本文论证AI可解释性研究存在根本性问题,提出可操作的可解释性应基于四种对称性来定义,以形式化可解释模型并统一可解释推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14366 2026-06-15 cs.CV 版本更新

Optimizing Rank for High-Fidelity Implicit Neural Representations

优化秩以实现高保真隐式神经表示

Julian McGinnis, Florian A. Hölzl, Suprosanna Shit, Florentin Bieder, Paul Friedrich, Mark Mühlau, Bjoern Menze, Daniel Rueckert, Benedikt Wiestler

机构 * University of Cambridge(剑桥大学)

AI总结 本文通过训练中稳定秩的调控,证明简单MLP也能实现高保真隐式神经表示,使用Muon优化器可显著提升性能,在多种任务上PSNR提升高达9 dB。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13277 2026-06-12 stat.ML cs.LG 新提交

ProtoX-AD: Self-Explainable Time Series Anomaly Detection and Characterization

ProtoX-AD:自解释的时间序列异常检测与特征描述

Aitor Sánchez-Ferrera, Elisabeth Wetzer, Kristoffer Wickstrøm, Michael Kampffmeyer, Robert Jenssen

机构 * Euskal Herriko Unibertsitatea(巴斯克大学) University of Cambridge(剑桥大学) University of Copenhagen(哥本哈根大学) University of Oslo(奥斯陆大学)

AI总结 提出ProtoX-AD框架,通过原型学习实现自监督时间序列异常检测的可解释性,在保持检测性能的同时提供语义一致的异常特征解释。

Comments 26 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13649 2026-06-12 cs.CL cs.LG 新提交

Operadic consistency: a label-free signal for compositional reasoning failures in LLMs

Operadic一致性:LLM中组合推理失败的无标签信号

Nathaniel Bottman, Yinhong Liu, Kyle Richardson

机构 * Incubilate University of Cambridge(剑桥大学) Allen Institute for Artificial Intelligence(艾伦人工智能研究所)

AI总结 提出Operadic一致性(OC)作为检测大语言模型组合推理失败的无标签信号,在四个多跳QA数据集上与准确率强相关(Pearson r≥0.86),优于自一致性等方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13220 2026-06-12 cs.AI cs.CE cs.ET cs.LG cs.MA 新提交

LLM-as-an-Investigator: Evidence-First Reasoning for Robust Interactive Problem Diagnosis

LLM作为调查员:基于证据优先的鲁棒交互式问题诊断

Fabrizio Marozzo, Pietro Liò

机构 * University of Calabria(卡拉布里亚大学) University of Cambridge(剑桥大学)

AI总结 提出证据优先的AI方法LLM-as-an-Investigator,通过估计问题歧义、生成假设、提问澄清并更新概率,避免过早接受用户假设,提升诊断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13106 2026-06-12 cs.LG cs.CL 新提交

Demystifying Hidden-State Recurrence: Switchable Latent Reasoning with On-Policy Reinforcement Learning

揭秘隐状态循环:基于在线强化学习的可切换潜在推理

Jiayu Yang, Chao Chen, Shengen Wu, Yinhong Liu, Yuxuan Fan, Lujundong Li, Songning Lai, Chengwei Qin, Zhijiang Guo

机构 * HKUST(GZ)(香港科技大学(广州)) University of Cambridge(剑桥大学) NTU(南洋理工大学) JoinQuant(聚宽) HKUST(香港科技大学)

AI总结 提出SWITCH框架,通过离散边界令牌使隐状态循环推理兼容在线强化学习,并支持因果机制分析,实验表明其优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12848 2026-06-12 cs.AI econ.GN q-fin.EC 新提交

(Human) Attention Is (Still) All You Need: Human oversight makes AI-assisted social science reliable

(人类的)注意力(仍然)就是一切:人类监督使AI辅助的社会科学变得可靠

Chen Zhu, Xiaolu Wang, Weilong Zhang

机构 * China Agricultural University(中国农业大学) University of Cambridge(剑桥大学)

AI总结 提出人机协同决策架构HLER,通过预承诺、决策排序、问责和注意力分配,将AI辅助研究的失败率从72%降至16%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12754 2026-06-12 cs.CL cs.AI 新提交

LLMs Can Better Capture Human Judgments--With the Right Prompts

LLMs 能更好地捕捉人类判断——使用合适的提示

Danica Dillion, Chen Cecilia Liu, Baihui Wang, Daniele Barolo, Tanmay Rajore, Niket Tandon, Pranathi Ravikumar, Kurt Gray

机构 * Complexity Science Hub, Vienna(维也纳复杂科学中心) The Ohio State University(俄亥俄州立大学) University of Cambridge(剑桥大学) University of Chicago(芝加哥大学) Microsoft Research(微软研究院)

AI总结 通过简单提示策略,LLMs 能恢复人类反应的完整分布,并减少对措辞变化的敏感性,提升 AI-人类对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12730 2026-06-12 cs.AI cs.CL cs.CY cs.LG 新提交

Rethinking Psychometric Evaluation of LLMs: When and Why Self-Reports Predict Behavior

重新思考LLMs的心理测量评估:自我报告何时以及为何能预测行为

Rafal Kocielnik, Pengrui Han, Peiyang Song, Myrl G. Marmarelis, Ramit Debnath, Dean Mobbs, Anima Anandkumar, R. Michael Alvarez

机构 * Caltech(加州理工学院) UIUC(伊利诺伊大学厄巴纳-香槟分校) University of Cambridge(剑桥大学)

AI总结 研究对比大五人格与计划行为理论,发现LLMs的自我报告-行为一致性存在选择性:在共享对话中TPB达到人类水平,跨对话仅对锚定于训练的行为保持一致性,且角色提示不能使行为对齐。

Comments Accepted as an Oral (Contributed Talk) at the ICML 2026 Workshop on Combining Theory and Benchmarks (CTB)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12646 2026-06-12 stat.ML cs.IT cs.LG math.IT 新提交

Epistemic Uncertainty Is Not the Reducible Kind

认知不确定性并非可约简的那种

Robin Young

机构 * University of Cambridge(剑桥大学)

AI总结 证明标准定义中认知不确定性为可被更多数据移除的部分,与互信息度量在扩展上不一致,并提出三部分分解:偶然、样本可约简认知和机制可约简认知不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏