arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Cambridge(剑桥大学)

共收录 133
2510.17426 2026-07-03 cs.CL cs.AI cs.LG 版本更新

Navigating the Alignment-Calibration Trade-off: A Pareto-Superior Frontier via Model Merging

导航对齐-校准权衡:通过模型合并实现帕累托更优前沿

Tiancheng Hu, Benjamin Minixhofer, Nigel Collier

机构 * University of Cambridge(剑桥大学)

AI总结 本文发现后训练对齐不仅降低任务准确率,还严重损失校准性能,导致模型过度自信且输出多样性下降。通过简单地在对齐前后模型权重间进行插值,可以持续获得帕累托最优模型,同时提升准确率和恢复校准。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04198 2026-07-02 cs.CV cs.RO 版本更新

DriveVA: Video Action Models are Zero-Shot Drivers

DriveVA: 视频动作模型是零样本驱动器

Mengmeng Liu, Diankun Zhang, Jiuming Liu, Jianfeng Cui, Hongwei Xie, Guang Chen, Hangjun Ye, Michael Ying Yang, Francesco Nex, Hao Cheng

机构 * University of Twente(特温特大学) Xiaomi EV(小米电动汽车) University of Cambridge(剑桥大学) University of Bath(巴斯大学)

AI总结 DriveVA提出了一种新的自动驾驶世界模型,通过共享潜在生成过程联合解码未来视觉预测和动作序列,提升跨数据集和传感器配置的泛化能力,减少碰撞率和误差。

Comments Accepted to ECCV 2026. 30 pages, 12 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04988 2026-07-02 cs.MA cs.AI 版本更新

When AI Agents Compete for Jobs: Strategic Capabilities and Economic Dynamics of AI Labour Markets

当AI代理竞争工作岗位:AI劳动力市场的战略能力与经济动态

Christopher Chiu, Simpson Zhang, Mihaela van der Schaar

机构 * DAMTP, University of Cambridge(剑桥大学应用数学与理论物理系)

AI总结 本文提出AI-Work模拟平台,研究AI代理在劳动力市场中的竞争行为,发现元认知、竞争意识和长期战略规划能力使代理获得更高利润和市场份额。

Comments Accepted at ICML 2026, Code available at https://github.com/chy-chiu/ai-work

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15388 2026-07-02 stat.ME cs.LG math.ST stat.ML stat.TH 版本更新

Deep learning with missing data

缺失数据下的深度学习

Tianyi Ma, Tengyao Wang, Richard J. Samworth

机构 * Statistical Laboratory, University of Cambridge(剑桥大学统计实验室) Department of Statistics, London School of Economics(伦敦政治经济学院统计系)

AI总结 提出模式嵌入神经网络(PENNs),结合任意插补技术处理缺失协变量,通过双重神经网络学习观测模式,理论证明其达到极小化最优收敛速率,实验验证性能显著提升。

Comments 57 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11001 2026-07-01 cs.CY cs.AI 版本更新

RCTs for Frontier AI Governance: Methodological Challenges and Solutions for Human Uplift Studies

随机对照试验与人类提升研究:前沿AI评估的方法论挑战与实践解决方案

Patricia Paskov, Kevin Wei, Shen Zhou Hong, Dan Bateyko, Xavier Roberts-Gaal, Carson Ezell, Gailius Praninskas, Valerie Chen, Umang Bhatt, Ella Guest

机构 * RAND Johns Hopkins University(约翰霍普金斯大学) Cornell University(康奈尔大学) Harvard University(哈佛大学) University of Cambridge(剑桥大学) London School of Economics(伦敦经济学院)

AI总结 本文通过访谈16位专家,系统梳理了人类提升研究(测量AI对人类绩效影响)在随机对照试验中面临的方法论挑战,包括内部效度、外部效度和构念效度问题,并提出了相应的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24575 2026-07-01 cs.RO cs.LG cs.MA 版本更新

Prompting Robot Teams with Natural Language

用自然语言提示机器人团队

Eduardo Sebastián, Nicolas Pfitzer, Ajay Shankar, Amanda Prorok

机构 * Department of Computer Science and Technology, University of Cambridge(剑桥大学计算机科学与技术系) Department of Mechanical and Process Engineering, ETH Zurich(苏黎世联邦理工学院机械与过程工程系)

AI总结 提出利用语言模型将高层任务分解为子任务,并蒸馏为循环神经网络(RNN)以支持多机器人团队的去中心化实时执行,通过图神经网络控制策略实现协作。

Comments This paper has been accepted for publication at IEEE Robotics and Automation Letters. Please, when citing the paper, refer to the official version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14972 2026-06-26 cs.LG 版本更新

Use What You Know: Causal Foundation Models with Partial Graphs

利用已知信息:带有部分图结构的因果基础模型

Arik Reuter, Anish Dhir, Cristiana Diaconu, Jake Robertson, Ole Ossen, Frank Hutter, Adrian Weller, Mark van der Wilk, Bernhard Schölkopf

机构 * University of Cambridge(剑桥大学) Gatsby Computational Neuroscience Unit(加布特计算神经科学单位) Prior Labs(Prior实验室) University of Freiburg(弗赖堡大学) The Alan Turing Institute(艾伦·图灵研究所) University of Oxford(牛津大学)

AI总结 提出在因果基础模型中注入因果图或祖先信息的方法,利用图卷积编码器和注意力机制有效利用部分因果信息,使通用模型匹配专用模型性能。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10187 2026-06-25 cs.LG 版本更新

MINIF2F-DAFNY: LLM-Guided Mathematical Theorem Proving via Auto-Active Verification

MINIF2F-DAFNY: 通过自动主动验证的LLM引导数学定理证明

Mantas Baksys, Stefan Zetzsche, Olivier Bouissou, Sean B. Holden

机构 * University of Cambridge, Cambridge, UK(剑桥大学) Amazon Web Services, London, UK(亚马逊网络服务(伦敦)) Amazon Web Services, Boston, USA(亚马逊网络服务(波士顿))

AI总结 提出首个将数学基准miniF2F翻译到自动主动验证器Dafny的数据集,评估8个LLM的证明生成能力,最佳模型Claude Opus 4.6达到62.7%的累积通过率,比空证明基线提升23.8个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15245 2026-06-24 cs.HC cs.AI 版本更新

MyoInteract: A Framework for Fast Prototyping of Biomechanical HCI Tasks using Reinforcement Learning

MyoInteract:一种使用强化学习快速原型设计生物力学人机交互任务的框架

Ankit Bhattarai, Hannah Selder, Florian Fischer, Arthur Fleig, Per Ola Kristensson

机构 * University of Cambridge(剑桥大学) Center for Scalable Data Analytics and Artificial Intelligence (ScaDS.AI) Dresden/Leipzig, Leipzig University(可扩展数据与人工智能分析中心(ScaDS.AI)德累斯顿/莱比锡,莱比锡大学)

AI总结 提出MyoInteract框架,通过强化学习生物力学模拟,将设置和训练时间从数天缩短至数分钟,使非专家也能快速原型化人机交互任务。

Comments Published at Designing Interactive Systems (DIS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18371 2026-06-24 eess.SY cs.MA cs.RO cs.SY 版本更新

Policy Gradient with Self-Attention for Model-Free Distributed Nonlinear Multi-Agent Games

基于自注意力的策略梯度用于无模型分布式非线性多智能体博弈

Eduardo Sebastián, Maitrayee Keskar, Eeman Iqbal, Eduardo Montijano, Carlos Sagüés, Nikolay Atanasov

机构 * Department of Computer Science and Technology, University of Cambridge(计算机科学与技术系,剑桥大学) Department of Electrical and Computer Engineering, University of California San Diego(电气与计算机工程系,加州大学圣地亚哥分校) RoPeRt group, at DIIS - I3A, Universidad de Zaragoza(RoPeRt组,DIIS - I3A,阿拉贡大学)

AI总结 提出一种分布式策略结构,通过策略梯度学习,利用自注意力层处理时变通信拓扑,解决无模型非线性多智能体博弈问题,在多种场景中表现优异。

Comments The paper has been accepted and will be presented at IEEE/RSJ IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00069 2026-06-24 cs.CY cs.AI cs.CL 版本更新

Societal Alignment Frameworks Can Improve LLM Alignment

社会对齐框架可以改进大语言模型对齐

Karolina Stańczak, Nicholas Meade, Mehar Bhatia, Hattie Zhou, Konstantin Böttinger, Jeremy Barnes, Jason Stanley, Jessica Montgomery, Richard Zemel, Nicolas Papernot, Nicolas Chapados, Denis Therien, Timothy P. Lillicrap, Ana Marasović, Sylvie Delacroix, Gillian K. Hadfield, Siva Reddy

机构 * ETH Zurich(苏黎世联邦理工学院) Mila, McGill University(麦吉尔大学米尔人工智能实验室) University of Cambridge(剑桥大学) Columbia University(哥伦比亚大学) University of Toronto, Google DeepMind(多伦多大学与DeepMind) McGill University, ServiceNow(麦吉尔大学与ServiceNow) Google DeepMind(谷歌DeepMind) University of Utah(犹他大学) King's College London(伦敦国王学院) Johns Hopkins University(约翰霍普金斯大学) Mila, McGill University, ServiceNow(麦吉尔大学米尔人工智能实验室与ServiceNow)

AI总结 本文提出借鉴社会、经济和契约对齐框架来改进大语言模型对齐,探讨不确定性在其中的作用,并将目标未指定性视为机遇而非缺陷,同时强调参与式对齐界面设计的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.06312 2026-06-24 math.DS cs.LG cs.NA math.NA math.OC math.SP 版本更新

Adversarial dynamical systems characterize when data-driven learning succeeds or fails

对抗动力系统刻画数据驱动学习何时成功或失败

Matthew J. Colbrook, Igor Mezić, Alexei Stepanenko

机构 * DAMTP, University of Cambridge(剑桥大学DAMTP)

AI总结 通过对抗动力系统界定数据驱动学习的可行性边界,在Koopman算子学习中给出收敛性与不可能性结果,并在北极海冰预测中超越现有模型。

Comments 16 pages + SM Appendix, final version accepted in Nature Communications

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02751 2026-06-23 cs.MA cs.AI cs.CL 版本更新

Scaling Small Agents Through Strategy Auctions

通过策略拍卖扩展小型智能体

Lisa Alazraki, William F. Shen, Yoram Bachrach, Akhil Mathur

机构 * Meta Superintelligence Labs(Meta超智能实验室) Imperial College London(帝国理工学院伦敦分校) University of Cambridge(剑桥大学)

AI总结 针对小型语言模型在复杂任务中性能不足的问题,提出受自由职业市场启发的SALE框架,通过策略拍卖实现任务分配与测试时自我改进,在降低对大型模型依赖和成本的同时提升性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21563 2026-06-23 cs.LG 版本更新

Embedding-Based Federated Learning with Runtime Governance for Iron Deficiency Prediction

基于运行时治理的嵌入式联邦学习用于缺铁预测

Fan Zhang, Simon Deltadahl, Majid Lotfian Delouee, Daniel Kreuter, Joseph Taylor, Allerdien Visser, BloodCounts Consortium, James H. F. Rudd, Nicholas S. Gleadall, Suthesh Sivapalaratnam, Folkert Asselbergs, Martijn C. Schut, Michael Roberts

机构 * Theoretical Physics University of Cambridge Cambridge, UK Translational AI Laboratory, Dept. of Laboratory Medicine Amsterdam UMC Amsterdam, The Netherlands Precision Health University Research Institute Queen Mary Univ. of London London, UK Department of Medicine University of Cambridge Cambridge Biomedical Campus Cambridge, UK Transplant Cambridge Biomedical Campus Cambridge, UK Dept. of Cardiology Amsterdam Cardiovascular Sciences Amsterdam UMC Amsterdam, The Netherlands

AI总结 本文提出了一种基于嵌入的联邦学习框架,用于从常规全血计数数据中预测缺铁,并在两个临床环境中部署,展示了个性化聚合方法在处理不同样本量和任务相关性时的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27259 2026-06-23 cs.CV 版本更新

Seeing the Scene Matters: Revealing Forgetting in Video Understanding Models with a Scene-Aware Long-Video Benchmark

看到场景才重要:通过场景感知的长视频基准揭示视频理解模型中的遗忘现象

Seng Nam Chen, Hao Chen, Chenglam Ho, Xinyu Mao, Jinping Wang, Yu Zhang, Chao Li

机构 * CUHK (SZ)(香港中文大学(深圳)) University of Cambridge(剑桥大学) UESTC(电子科技大学) CUHK(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出SceneBench基准,揭示视频理解模型在长场景上下文中的遗忘问题,并提出Scene-RAG方法提升性能2.50%。

Comments Accepted to CVPR 2026 (Highlight)

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18471 2026-06-23 cs.CV 版本更新

Jacobian-Aware Posterior Sampling for Inverse Problems

Jacobian-Aware 后验采样用于逆问题

Liav Hen, Tom Tirer, Raja Giryes, Shady Abu-Hussein

机构 * Tel Aviv University, Israel(特拉维夫大学,以色列) Bar-Ilan University, Israel(巴伊兰大学,以色列) University of Cambridge, UK(剑桥大学,英国)

AI总结 提出 Jacobian-Aware 后验采样器 (JAPS),通过结合扩散去噪器的 Jacobian 先验与近端解,在无额外计算成本下提升逆问题重建质量。

Comments Accepted by TMLR 2026; Code at https://github.com/liavhen/JAPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01949 2026-06-23 cs.LG cs.AI cs.CE 版本更新

Probabilistic Retrofitting of Learned Simulators

学习模拟器的概率性改造

Cristiana Diaconu, Miles Cranmer, Richard E. Turner, Tanya Marwah, Payel Mukhopadhyay

机构 * The Polymathic AI Collaboration(多智AI协作体) University of Cambridge(剑桥大学) Alan Turing Institute(艾伦·图灵研究所)

AI总结 提出一种训练高效的策略,通过连续排序概率得分(CRPS)将预训练的确定性模型改造为概率模型,无需从头训练,适用于多种架构,在多个动力系统上显著提升预测性能。

Comments Code provided at https://github.com/cddcam/lola_crps

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17655 2026-06-23 cs.CL 版本更新

What Language is This? Ask Your Tokenizer

这是什么语言?问你的分词器

Clara Meister, Ahmetcan Yavuz, Pietro Lesci, Tiago Pimentel

机构 * EPFL(苏黎世联邦理工学院) University of Cambridge(剑桥大学)

AI总结 提出基于UnigramLM分词算法的UniLID方法,通过比较字符串在各语言单字分布下的似然进行语言识别,在低资源和细粒度方言场景下显著提升样本效率。

Comments In Proceedings of ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14600 2026-06-23 cs.LG eess.SP 版本更新

Energy Injection Identification enabled Disaggregation with Deep Multi-Task Learning

基于深度多任务学习的能量注入识别辅助分解

Xudong Wang, Guoming Tang, Junyu Xue, Srinivasan Keshav, Tongxin Li, Chris Ding

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The Hong Kong University of Science(香港科学大学) Southern University of Science(南方科技大学) University of Cambridge(剑桥大学)

AI总结 提出DualNILM框架,通过深度多任务学习同时实现电器状态识别和注入能量识别,解决分布式能源对非侵入式负荷监测的干扰问题。

Comments Accepted to The 17th ACM International Conference on Future and Sustainable Energy Systems (ACM e-Energy 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11061 2026-06-23 cs.CV 版本更新

VDAWorld: World Modelling via VLM-Directed Abstraction and Simulation

VDAWorld: 通过VLM导向的抽象与模拟进行世界建模

Felix O'Mahony, Roberto Cipolla, Ayush Tewari

机构 * University of Cambridge(剑桥大学)

AI总结 提出VDAWorld框架,利用视觉语言模型自主构建场景表示并选择物理模拟器,通过抽象与自适应模拟实现高质量世界建模,在交互控制、反事实生成和物理逻辑推理任务上取得最优结果。

Comments Website: https://felixomahony.github.io/vdaworld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04018 2026-06-23 cs.AI cs.CL cs.CY cs.LG 版本更新

AgentMisalignment: Measuring the Propensity for Misaligned Behaviour in LLM-Based Agents

AgentMisalignment:衡量基于LLM的代理中失调行为的倾向性

Akshat Naik, Emma Gouné, Patrick Quinn, Guillermo Bosch, Francisco Javier Campos Zabala, Jason Ross Brown, Edward James Young

机构 * Department of Computer Science(计算机科学系) University of Oxford(牛津大学) Institute of Intelligent Systems and Robotics(智能系统与机器人研究所) Sorbonne Université(索邦大学) The Leverhulme Centre for the Future of Intelligence(未来智能中心) University of Cambridge(剑桥大学) Independent Researcher(独立研究者) Department of Computer Science and Technology(计算机科学与技术系) Department of Engineering(工程系)

AI总结 提出AgentMisalignment基准,评估LLM代理在真实场景中自发追求非预期目标的倾向,发现更强大的代理平均表现出更高的失调倾向,且个性特征对失调影响显著。

Comments Prepint, under review for NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04396 2026-06-19 cs.LG cs.AI 版本更新

LoRDO: Distributed Low-Rank Optimization with Infrequent Communication

LoRDO: 分布式低秩优化与低频通信

Andrej Jovanović, Alex Iacob, Mher Safaryan, Ionut-Vlad Modoranu, Lorenzo Sani, William F. Shen, Xinchi Qiu, Dan Alistarh, Nicholas D. Lane

机构 * University of Cambridge(剑桥大学) Institute of Science and Technology Austria(奥地利科学与技术研究院) Lancaster University(兰卡斯特大学) Flower Labs(Flower实验室)

AI总结 提出LoRDO框架,统一低秩优化与低频同步,通过全秩准双曲更新恢复子空间探索,在125M-720M模型规模下实现与低秩DDP近似的性能,通信量减少约10倍。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02604 2026-06-19 cs.RO cs.SY eess.SY 版本更新

Periodic robust robotic rock chop via virtual model control

基于虚拟模型控制的周期性鲁棒机器人砍切

Yi Zhang, Fumiya Iida, Fulvio Forni

机构 * University of Cambridge(剑桥大学) University of Tokyo(东京大学)

AI总结 提出一种物理结构化的虚拟模型控制器,通过切换虚拟机构生成鲁棒的周期性砍切运动,无需预规划轨迹,在Franka机械臂上实现多种蔬菜的亚毫米级精确切割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26557 2026-06-18 cs.CL 版本更新

MemBoost: A Memory-Boosted Framework for Cost-Aware LLM Inference

MemBoost:一种面向成本感知的LLM推理的内存增强框架

Joris Köster, Zixuan Liu, Siavash Khajavi, Zizhan Zheng

机构 * University of Cambridge(剑桥大学) ETH Zurich(苏黎世联邦理工学院)

AI总结 提出MemBoost框架,通过轻量模型重用历史答案和检索支持信息,并选择性将困难查询路由到强模型,以降低LLM推理成本,同时保持回答质量。

Comments ICML MemFM 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09185 2026-06-18 cs.CV cs.AI 版本更新

Learning Patient-Specific Disease Dynamics with Latent Flow Matching for Longitudinal Imaging Generation

学习患者特异性疾病动态:基于潜在流匹配的纵向影像生成

Hao Chen, Rui Yin, Yifan Chen, Qi Chen, Chao Li

机构 * University of Cambridge(剑桥大学) Nanjing First Hospital(南京第一医院) Nanjing Medical University(南京医科大学) Johns Hopkins University(约翰霍普金斯大学) University of Dundee(邓迪大学)

AI总结 提出Δ-LFM框架,利用流匹配对齐患者潜在轨迹,通过患者特异性潜在对齐实现单调疾病进展建模,在三个纵向MRI基准上验证了可解释性和性能。

Comments ICLR 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12729 2026-06-17 cs.NI cs.AI cs.CR 版本更新

Large Language Models for Agentic NetOps and AIOps: Architectures, Evaluation, and Safety

用于代理网络运维和AI运维的大型语言模型:架构、评估与安全

Muhammad Bilal, Jon Crowcroft, Ruizhi Wang, Xiaolong Xu, Schahram Dustdar

机构 * School of Computing and Communications(计算与通信学院) University of Cambridge(剑桥大学) School of Software(软件学院) Nanjing University of Information Science and Technology(南京信息科技大學) TU Wien(维也纳技术大学) ICREA

AI总结 本文探讨了大型语言模型在网络运维和AI运维中的应用,分析了代理架构、评估方法及安全挑战,强调系统可靠性依赖于模型周边机制,而非模型本身。

Comments 49 pages, 15 figures, 6 tables; survey article

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22748 2026-06-17 cs.AI 版本更新

Agentic World Modeling: Foundations, Capabilities, Laws, and Beyond

代理世界建模:基础、能力、定律及更远

Meng Chu, Xuan Billy Zhang, Kevin Qinghong Lin, Lingdong Kong, Jize Zhang, Teng Tu, Weijian Ma, Ziqi Huang, Senqiao Yang, Wei Huang, Yeying Jin, Zhefan Rao, Jinhui Ye, Xinyu Lin, Xichen Zhang, Qisheng Hu, Shuai Yang, Leyang Shen, Wei Chow, Yifei Dong, Fengyi Wu, Quanyu Long, Bin Xia, Shaozuo Yu, Mingkang Zhu, Wenhu Zhang, Jiehui Huang, Haokun Gui, Runyi Li, Chenyu Tang, Dong Huang, Xuhang Chen, Rui Liu, Chengzu Li, Shiyi Du, Xu Huang, Haoxuan Che, Long Chen, Qifeng Chen, Wenya Wang, Wenxuan Zhang, Xiaojuan Qi, Yang Deng, Yanwei Li, Mike Zheng Shou, Zhi-Qi Cheng, See-Kiong Ng, Ziwei Liu, Philip Torr, Jiaya Jia

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) National University of Singapore(新加坡国立大学) University of Oxford(牛津大学) Nanyang Technological University(南洋理工大学) Chinese University of Hong Kong(香港中文大学) University of Hong Kong(香港大学) University of Washington(华盛顿大学) University of Tokyo(东京大学) Carnegie Mellon University(卡内基梅隆大学) University of California, Berkeley(加州大学伯克利分校) University of Cambridge(剑桥大学) Singapore University of Technology and Design(新加坡科技设计大学) Singapore Management University(新加坡管理学院) XGEN Labs(XGEN实验室)

AI总结 本文提出'层次x定律'分类法,定义三个能力层级和四个约束领域,综合400余篇文献总结100余系统,分析方法、失败模式和评估实践,提出决策导向的评估原则和可复现评估包,展望从被动预测到重塑环境的代理世界建模路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00986 2026-06-17 cs.LG cs.CV 版本更新

EmbodiTTA: Resource-Efficient Test-Time Adaptation for Embodied Visual Systems

EmbodiTTA:面向具身视觉系统的资源高效测试时自适应

Xiao Ma, Young D. Kwon, Dong Ma

机构 * Singapore Management University(新加坡管理大学) Samsung AI Center–Cambridge(三星AI中心-剑桥) University of Cambridge(剑桥大学)

AI总结 提出按需测试时自适应范式OD-TTA,通过轻量域移检测、源域选择和分离批归一化更新,在边缘设备上实现高效准确的自适应,显著降低计算和能耗开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04145 2026-06-16 cs.LG cs.AI cs.DC 版本更新

EvalStop: Using World Feedback to Detect and Correct Reward Overoptimization in Multi-Tenant RLHF Platforms

EvalStop:利用世界反馈检测和纠正多租户RLHF平台中的奖励过度优化

Guilin Zhang, Chuanyi Sun, Kai Zhao, Xu Chu, Shahryar Sarkani, John M. Fossaceca

机构 * DeepMind, London, UK(深度Mind, 英国伦敦) University of Cambridge, UK(英国剑桥大学) University of Washington, USA(美国华盛顿大学)

AI总结 提出EvalStop调度原语,通过检测评估分数连续下降来终止作业、释放GPU并保留最佳检查点,以纠正奖励过度优化,在RLHF负载上实现高精度检测并提升JCT。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07013 2026-06-16 cs.CL 版本更新

CoBit: Language Modeling with Bitstream Diffusion

CoBit: 基于比特流扩散的语言建模

Georgios Batzolis, Mark Girolami, Luca Ambrogioni

机构 * University of Cambridge(剑桥大学)

AI总结 提出CoBit模型,将文本建模为固定宽度二进制比特流上的连续扩散过程,采用匹配滤波残差参数化和基于熵率门控的朗之万校正采样器,在LM1B和OpenWebText上达到接近自回归模型的生成困惑度,并消除词汇表缩放瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏