Constitutional Black-Box Monitoring for Scheming in LLM Agents
LLM Agent 中阴谋行为的宪法黑盒监控
机构 * University of Cambridge(剑桥大学)
AI总结 研究使用基于宪法黑盒的监控器,通过仅观察外部输入和输出检测LLM Agent的阴谋行为,并在合成数据上优化后泛化到更真实环境。
Comments Accepted at ICML 2026. Camera-ready version
高校专区
LLM Agent 中阴谋行为的宪法黑盒监控
机构 * University of Cambridge(剑桥大学)
AI总结 研究使用基于宪法黑盒的监控器,通过仅观察外部输入和输出检测LLM Agent的阴谋行为,并在合成数据上优化后泛化到更真实环境。
Comments Accepted at ICML 2026. Camera-ready version
基于流的难解分布密度比估计及其在基因组学中的应用
机构 * ETH Zurich(苏黎世联邦理工学院) ; University of Cambridge(剑桥大学) ; Max Planck Institute for Informatics(马克斯·普朗克信息研究所)
AI总结 提出利用条件感知流匹配推导单一动力学公式,沿生成轨迹追踪密度比,以高效估计难解分布间的密度比,并在单细胞基因组学数据分析中展示竞争力。
立场:超越敏感属性,机器学习公平性应通过社会决定因素量化结构性不公正
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Cambridge(剑桥大学) ; University of Washington(华盛顿大学) ; University of Michigan(密歇根大学) ; University of Toronto(多伦多大学)
AI总结 本文主张算法公平性研究应超越敏感属性,通过社会决定因素量化结构性不公正,并通过理论模型和实证研究证明仅关注敏感属性的缓解策略可能引入新的结构性不公正。
Comments Accepted to ICML 2026 Position Paper Track
原型Transformer:迈向可解释设计的语言模型架构
机构 * University of Cambridge(剑桥大学) ; ETH Zurich(苏黎世联邦理工学院)
AI总结 提出原型Transformer(ProtoT),一种用线性代价原型模块替代二次代价自注意力的自回归语言模型架构,原型自动捕获可命名概念,提升可解释性并支持行为编辑。
Comments Accepted at ICML 2026. Equal contribution: Yordan Yordanov and Matteo Forasassi. 40 pages, 28 figures, 22 tables
WildCat: 理论与实践中近乎线性的注意力机制
机构 * University of Cambridge(剑桥大学)
AI总结 提出WildCat方法,通过随机枢轴Cholesky算法选择加权核心集,在近线性时间内以超多项式误差衰减近似精确注意力,并应用于图像生成、分类和语言模型KV缓存压缩。
迈向物理基础模型
机构 * University of Cambridge(剑桥大学)
AI总结 提出通用物理变换器(GPhyT),通过在大规模多样化模拟数据上训练,实现单一模型在多个物理领域(如流固耦合、冲击波、热对流和多相流)的零样本泛化与长期稳定预测,性能超越专用架构7倍以上。
Comments ICML-AI4Physics 2026
面向临床神经科学中基于Transformer的语言模型的稳定可解释性的单语义归因框架
机构 * Department of Computer Science and Technology(计算机科学与技术系) ; Cancer Research UK(癌症研究英国公司) ; Cambridge Institute(剑桥研究所) ; University of Cambridge(剑桥大学) ; United Kingdom(英国) ; DIMES(迪梅斯) ; University of Calabria(卡拉布里亚大学) ; Italy(意大利) ; Department of Computer Automatic and Management Engineering (DIAG)(计算机自动与管理工程系) ; Sapienza Università di Roma(罗马大学萨皮恩扎) ; Department of Psychiatry(精神病学系) ; School of Computing(计算学院) ; University of Kent(肯特大学) ; Department of Psychology(心理学系)
AI总结 提出一种通过单语义特征提取整合归因与机制视角的统一可解释性框架,生成稳定的输入级重要性分数,促进语言模型在认知健康和神经退行性疾病中的安全应用。
立场:当前基准测试阻碍了时间序列预测深度学习的真正进展
机构 * University of Cambridge(剑桥大学)
AI总结 本文指出当前基准测试实践未能识别影响性能的关键设计因素,尤其是全局性与局部性等被忽视的方面对预测方法类别和实验结果有重大影响,并提出辅助预测模型卡以改进架构比较。
Comments ICML 2026
符号神经生成及其在药物设计先导发现中的应用
机构 * Dept. of Computer Science & Information Systems and APPCAIR BITS Pilani, K K Birla Goa Campus, India(计算机科学与信息系统系及APPCAIR比特纳学院,K K Birl拉果阿校区,印度) ; Dept. of Computer Science & Information Systems BITS Pilani, K K Birla Goa Campus, India(计算机科学与信息系统系比特纳学院,K K Birl拉果阿校区,印度) ; Department of Biochemistry, University of Cambridge, Cambridge, UK(生物化学系,剑桥大学,剑桥,英国) ; School of Computer Science and Engineering University of New South Wales, Sydney(计算机科学与工程学院新南威尔士大学,悉尼) ; Dr. B.R. Ambedkar Center for Biomedical Research University of Delhi, New Delhi, India(B.R.阿姆贝卡尔生物医学研究中心,德里大学,新德里,印度) ; Department of Chemistry BITS Pilani, K.K. Birla Goa Campus, India(化学系比特纳学院,K.K. Birl拉果阿校区,印度)
AI总结 提出符号神经生成器(SNG)框架,结合归纳逻辑编程与大语言模型,通过符号约束指导神经生成,在药物设计中生成满足形式规范的候选分子,性能与现有方法相当,并在探索性问题上产生与临床候选分子相当的结合亲和力。
Comments 37 pages, submitted to the Machine Learning journal; partial overlap of experimental results with https://doi.org/10.1101/2025.02.14.634875
多智能体强化学习中的广义意图建模
机构 * Department of Computer Science and Technology, University of Cambridge, UK(计算机科学与技术系,剑桥大学,英国)
AI总结 提出一种任务自适应的对手建模框架,通过性能驱动的多意图表示混合及最大化与自我智能体未来回报的互信息的新意图表示,提升非合作多智能体环境中的决策性能。
任意状态空间上的自由能估计
机构 * University of Cambridge(剑桥大学) ; Imperial College London(伦敦帝国理工学院) ; Xaira Therapeutics(Xaira制药) ; Microsoft Research New England(微软研究院新英格兰分部)
AI总结 提出一种基于广义神经传输学习的框架,将自由能估计推广到任意状态空间,并揭示时间反演与Doob h-变换的群论结构。
CellBRIDGE:通过交互感知对齐学习细胞轨迹
机构 * DAMTP, University of Cambridge(剑桥大学应用数学与理论物理系) ; Francis Crick Institute(弗朗西斯·克里克研究所) ; University of Colorado Anschutz Medical Campus(科罗拉多大学安舒茨医学校区)
AI总结 提出CellBRIDGE方法,通过将配体-受体介导的细胞间通信成本融入最优传输框架,改进了单细胞RNA测序数据中的轨迹推断和跨快照耦合。
Journal ref ICML 2026
学习测度值轨迹的主动时间点选择
机构 * DAMTP, University of Cambridge(剑桥大学 DAMTP 实验室)
AI总结 针对高成本破坏性数据获取场景,提出基于线性化最优传输的主动学习框架,通过高斯过程建模概率路径并迭代选择最优测量时间点以最小化不确定性。
Comments ICML 2026
ELAN4D:以具身为中心的4D监督用于视觉-语言-动作模型的即插即用适配
机构 * Torr Vision Group, University of Oxford(托尔视觉组,牛津大学) ; The Chinese University of Hong Kong, Shenzhen(香港大学(深圳)) ; Tsinghua University(清华大学) ; Shanghai Jiao Tong University(上海交通大学) ; University College London(伦敦大学学院) ; University of Cambridge(剑桥大学)
AI总结 提出ELAN4D框架,通过未来机器人关键点轨迹作为预测性时空监督,以即插即用方式增强VLA策略的鲁棒性和泛化能力。
GraphCSVAE: 面向可持续灾后风险降低的物理脆弱性时空审计的图类别结构化变分自编码器
机构 * University of Cambridge(剑桥大学) ; Cambridge University Centre for Risk in the Built Environment(剑桥大学建筑环境风险中心) ; Earth Observation Center(地球观测中心) ; Institute of Geography(地理研究所)
AI总结 提出GraphCSVAE框架,通过整合深度学习、图表示和类别概率推断,利用时间序列卫星数据和专家先验,对物理脆弱性进行建模,并在两个灾后地区验证其时空审计能力。
Comments Accepted for publication in Progress in Disaster Science (on May 20, 2026) and at the 8th International Disaster and Risk Conference, IDRC 2025 | Keywords: weakly supervised, graph, categorical, vulnerability, remote sensing, spatiotemporal | The data and code are respectively available at https://doi.org/10.5281/zenodo.16656471 and https://github.com/riskaudit/GraphCSVAE
LaCy: 小型语言模型能学且应学的不仅仅是损失问题
机构 * Apple(苹果公司) ; University of Cambridge(剑桥大学)
AI总结 研究在预训练中,小型语言模型(SLM)应学习哪些token以及应通过<CALL>委托哪些token,提出结合损失和事实性信号的LaCy方法,提升SLM在级联生成中的事实准确性。
Comments 40 pages, 26 figures, 10 tables, preprint. v3-v4: new results for RAG, ablations and additional analysis
3D-Belief:通过生成式3D世界建模实现具身信念推断
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Lambda ; University of Cambridge(剑桥大学)
AI总结 提出3D-Belief,一种生成式3D世界模型,通过在线更新显式3D信念,使具身智能体能够在部分可观测环境中想象场景补全并推理,在2D/3D想象质量和下游物体导航任务上优于现有方法。
基于EEG的多模态学习:曲率混合专家双曲空间方法
机构 * Nanyang Technological University, Singapore(新加坡南洋理工大学) ; BIFOLD, Berlin Institute for the Foundations of Learning(柏林学习与数据基础研究所) ; University of Cambridge, Cambridge, UK(剑桥大学)
AI总结 提出EEG-MoCE框架,通过可学习曲率的双曲空间为每个模态分配专家,并采用曲率感知融合策略,实现层次结构建模,在情绪识别、睡眠分期和认知评估任务上达到最优性能。
Comments Accepted at the Forty-third International Conference on Machine Learning (ICML 2026)
KernelCraft: 面向新兴硬件的近底层内核生成的智能体基准测试
机构 * Department of Computer Science and Technology, University of Cambridge, Cambridge, United Kingdom(计算机科学与技术系,剑桥大学,剑桥,英国) ; Department of Electrical and Electronic Engineering, Imperial College London, London, United Kingdom(电气与电子工程系,伦敦帝国理工学院,伦敦,英国) ; School of Informatics, University of Edinburgh, Edinburgh, United Kingdom(信息学院,爱丁堡大学,爱丁堡,英国)
AI总结 提出KernelCraft基准,通过函数调用和反馈驱动的工作流评估LLM智能体为新兴加速器生成和优化底层内核的能力,在多个任务上验证其能快速生成正确且高效的内核。
量化扩散模型中的误差传播与模型崩溃
机构 * University of Cambridge, Cambridge, United Kingdom(剑桥大学)
AI总结 本文理论分析了基于分数的扩散模型中递归训练导致模型崩溃的误差传播机制,给出了生成分布与目标分布之间累积散度的上下界,并刻画了不同漂移区域。
Comments Accepted at ICML 2026
基于扩散模型的多智能体环境协同设计扩展
机构 * Department of Computer Science, University of Cambridge, Cambridge, United Kingdom(剑桥大学计算机科学系,剑桥,英国)
AI总结 提出扩散协同设计(DiCoDe)框架,通过投影通用引导(PUG)和评论家蒸馏机制,实现高维环境设计空间下的可扩展、样本高效的智能体-环境协同优化。
UniMedVL: 通过观察-知识-分析统一医学多模态理解与生成
机构 * Shanghai Artificial Intelligence Laboratory ; Shanghai Innovation Institute ; Shanghai Jiao Tong University ; Shanghai Institute of Optics ; Fudan University ; University of Cambridge ; Monash University ; DAMO Academy, Alibaba Group ; Imperial College London ; The University of Hong Kong ; The Hong Kong University of Science ; Hupan Lab ; The Chinese University of Hong Kong
AI总结 提出首个统一医学模型UniMedVL,通过渐进式训练流水线融合多模态理解与生成能力,并在8种影像模态的5.6M实例数据集上验证其性能。
Comments This submission has been converted to the ICML template
超越听觉:通过生理学启发的标记化从耳机学习任务无关的ExG表示
机构 * KAIST(韩国科学技术院) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Cambridge(剑桥大学) ; Shanghai Jiao Tong University(上海交通大学) ; Pennsylvania State University(宾夕法尼亚州立大学) ; UCLA(加州大学洛杉矶分校) ; Northwest University(北华大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Microsoft Research(微软研究院)
AI总结 提出一种基于耳机的生理学启发的多频带标记化方法(PiMT),通过无干扰的日常ExG数据采集和重建任务学习鲁棒表示,实现跨多种任务(包括五种人类感官)的通用ExG监测。
Comments Accepted to ICLR 2026
NeuROK:生成式4D神经物体运动学
机构 * Stanford University(斯坦福大学) ; University of Cambridge(剑桥大学) ; Cornell University(康奈尔大学)
AI总结 提出基于Transformer的编码器-解码器模型NeuROK,通过学习物体潜在运动学参数化,实现从静态3D物体生成逼真的4D动态变形,克服了传统方法对预定义物理模型和特定类别的依赖。
Comments CVPR 2026
CCS:放射学报告生成的临床共识选择
机构 * School of Computing Science, University of Glasgow(格拉斯哥大学计算机科学学院) ; School of Electrical and Computer Engineering, University of Sydney(悉尼大学电气与计算机工程学院) ; Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室)
AI总结 提出CCS框架,通过采样多个候选报告并选择临床共识最高的一个,以改进放射学报告生成在推理时的质量。
Comments 17 pages, 6 figures
Dial HEALTHDIAL for Advice: 一个用于知识驱动信息检索的多语言多平行口语对话数据集
机构 * Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室) ; School of Computation, Information and Technology, Technical University of Munich(慕尼黑技术大学计算、信息与技术学院) ; Independent Researcher(独立研究员)
AI总结 本文构建了HEALTHDIAL,一个大规模多语言多平行口语对话数据集,用于开发基于检索增强生成的口语对话系统,并揭示了不同语言间的性能差异。
Comments Accepted to Findings of ACL 2026
CB-SLICE: 基于概念的可解释错误切片发现
机构 * Department of Computer Science and Technology, University of Cambridge, Cambridge, UK(计算机科学与技术系,剑桥大学,剑桥,英国) ; Trinity College, University of Oxford, Oxford, UK(牛津大学三一学院,牛津,英国) ; Cambridge Institute for Technology and Humanity, Cambridge, UK(剑桥技术与人类研究所,剑桥,英国)
AI总结 提出CB-SLICE方法,利用概念瓶颈模型的概念预测失败来发现错误切片,并通过关键词概念解释失败模式,优于现有方法。
Comments 20 pages, 7 figures, 12 tables, to be published at Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)
我们该信任谁?LLM作为陪审团进行比较评估
机构 * Department of Engineering, University of Cambridge, UK(剑桥大学工程系)
AI总结 针对LLM作为评估者时判断不一致和可靠性差异的问题,提出BT-sigma模型,通过引入判别参数联合推断项目排名和法官可靠性,优于平均聚合方法。
Comments Accepted to ICML 2026
兴趣问题:理解人类与语言模型对数学问题的兴趣度
机构 * KTH Royal Institute of Technology(皇家理工学院) ; Stanford University(斯坦福大学) ; Massachusetts Institute of Technology(麻省理工学院) ; University of Cambridge(剑桥大学) ; Kempner Institute at Harvard University(哈佛大学肯普尼研究所) ; Mistral AI
AI总结 通过比较大型语言模型与不同数学背景人群对数学问题的兴趣度评分,研究LLM在兴趣判断上与人类的一致性,并评估其生成有趣问题的能力。
Comments Published at the Math-AI Workshop, NeurIPS 2025
面向LLM人格模拟的自适应访谈:基于证据的推理提升决策对齐
机构 * University of Cambridge(剑桥大学) ; Independent Researcher(独立研究员)
AI总结 提出自适应访谈框架,通过结构化三阶段对话收集人格相关信息,并基于访谈记录评估LLM在道德困境场景中模拟个体决策的能力,发现基于后续追问的证据推理能显著提升预测准确性。
Comments 20 pages, 2 figures, 12 tables