arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Cambridge(剑桥大学)

2026-06-16 至 2026-06-16 共收录 7
2606.04145 2026-06-16 cs.LG cs.AI cs.DC 版本更新

EvalStop: Using World Feedback to Detect and Correct Reward Overoptimization in Multi-Tenant RLHF Platforms

EvalStop:利用世界反馈检测和纠正多租户RLHF平台中的奖励过度优化

Guilin Zhang, Chuanyi Sun, Kai Zhao, Xu Chu, Shahryar Sarkani, John M. Fossaceca

机构 * DeepMind, London, UK(深度Mind, 英国伦敦) University of Cambridge, UK(英国剑桥大学) University of Washington, USA(美国华盛顿大学)

AI总结 提出EvalStop调度原语,通过检测评估分数连续下降来终止作业、释放GPU并保留最佳检查点,以纠正奖励过度优化,在RLHF负载上实现高精度检测并提升JCT。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07013 2026-06-16 cs.CL 版本更新

CoBit: Language Modeling with Bitstream Diffusion

CoBit: 基于比特流扩散的语言建模

Georgios Batzolis, Mark Girolami, Luca Ambrogioni

机构 * University of Cambridge(剑桥大学)

AI总结 提出CoBit模型,将文本建模为固定宽度二进制比特流上的连续扩散过程,采用匹配滤波残差参数化和基于熵率门控的朗之万校正采样器,在LM1B和OpenWebText上达到接近自回归模型的生成困惑度,并消除词汇表缩放瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05859 2026-06-16 cs.AI 版本更新

When Do We Need LLMs? A Diagnostic for Language-Driven Bandits

何时需要大语言模型?语言驱动型老虎机的诊断方法

Uljad Berdica, Fernando Acero, Anton Ipsen, Parisa Zehtabi, Michael Cashmore, Manuela Veloso

机构 * University of Cambridge(剑桥大学)

AI总结 提出LLMP-UCB算法从LLM中获取不确定性估计,实验表明轻量数值老虎机在文本嵌入上匹配或超越LLM方案且成本更低,并给出基于臂嵌入的几何诊断指导何时使用LLM。

Comments The Reinforcement Learning Conference, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02343 2026-06-16 cs.LG cs.AI cs.IT math.IT 版本更新

Haiku to Opus in Just 10 bits: LLMs Unlock Large Compression Gains

仅用10比特从俳句到巨作:LLMs解锁巨大压缩增益

Roy Rinberg, Annabelle Michael Carrell, Simon Henniger, Nicholas Carlini, Keri Warr

机构 * Harvard University(哈佛大学) University of Cambridge(剑桥大学) Anthropic

AI总结 研究LLM生成文本的无损和有损压缩,提出问答压缩(QA)交互协议,用少量二进制问题实现超100倍压缩比,高效传递知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20043 2026-06-16 cs.AI 版本更新

Discovering Symmetry Groups with Flow Matching

通过流匹配发现对称群

Yuxuan Chen, Jung Yeon Park, Floor Eijkelboom, Jianke Yang, Jan-Willem van de Meent, Lawson L. S. Wong, Robin Walters

机构 * University of Cambridge(剑桥大学)

AI总结 提出LieFlow框架,将对称发现转化为李群上的分布学习问题,无需固定基或分布假设,能统一发现连续和离散对称,实验优于LieGAN。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07442 2026-06-16 cs.SD 版本更新

INFER : Learning Implicit Neural Frequency Response Fields for Confined Car Cabin

INFER:学习受限汽车座舱的隐式神经频率响应场

Harshvardhan C. Takawale, Nirupam Roy, Phil Brown

机构 * Harvard University(哈佛大学) University of Cambridge(剑桥大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 提出INFER框架,通过频域神经隐式模型联合学习源和接收器位置、方向下的复值频率响应场,引入端到端前向模型、感知谱监督和Kramers-Kronig约束,在汽车座舱数据上显著降低幅度和相位重建误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02908 2026-06-16 cs.LG cs.DC 版本更新

Photon: Federated LLM Pre-Training

Photon: 联邦大语言模型预训练

Lorenzo Sani, Alex Iacob, Zeyu Cao, Royson Lee, Bill Marino, Yan Gao, Dongqi Cai, Zexi Li, Wanru Zhao, Xinchi Qiu, Nicholas D. Lane

机构 * University of Cambridge(剑桥大学) Flower Labs(Flower实验室) Zhejiang University(浙江大学)

AI总结 提出Photon系统,首次实现联邦端到端LLM预训练,通过跨孤岛联邦学习在弱连接GPU上训练高达7B参数模型,通信量减少64-512倍,收敛速度比DiLoCo快2倍。

Comments 18 pages, 9 appendix pages, 12 figures, 3 algorithms, 12 tables

Journal ref Proceedings of Machine Learning and Systems 7 (MLSys 2025), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏