LLM Agent-Assisted Reverse Engineering with Quantitative Readability Metrics
LLM 代理辅助逆向工程与定量可读性指标
机构 * University of Cambridge(剑桥大学)
AI总结 提出定量可读性分数(QRS)框架,结合结构相似性门控与三个可读性子指标,指导 LLM 代理提升反编译代码可读性,同时保持功能正确性。
高校专区
LLM 代理辅助逆向工程与定量可读性指标
机构 * University of Cambridge(剑桥大学)
AI总结 提出定量可读性分数(QRS)框架,结合结构相似性门控与三个可读性子指标,指导 LLM 代理提升反编译代码可读性,同时保持功能正确性。
MMBU: 大规模多模态生物医学理解基准,用于探测视觉语言模型的感知能力
机构 * Stanford University(斯坦福大学) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; Instituto Tecnológico de Monterrey(蒙特雷技术学院) ; Monash University(墨尔本大学) ; University of Cambridge(剑桥大学) ; Shanghai Jiao Tong University(上海交通大学) ; Shandong University(山东大学)
AI总结 提出MMBU基准,涵盖35个子模态,通过分类、定位和检测任务系统评估VLM在生物医学领域的视觉感知和泛化能力,发现高准确率可能掩盖感知缺陷。
按需扩展:自适应神经元级混合精度量化感知训练
机构 * University of California, Berkeley(加州大学伯克利分校) ; DeepMind(深度思维) ; University of Cambridge(剑桥大学)
AI总结 提出神经元级混合精度量化感知训练(NMP-QAT),通过可微代理和直通估计器让每个神经元独立学习离散精度,实现按需扩展位宽,在MLP和表格基础模型上取得更优的压缩-精度权衡。
Comments Accepted at ICML - GlobalSouthML workshop, 2026
MidSteer:用于引导生成模型的最优仿射框架
机构 * University of Basel(巴塞尔大学) ; University of California, Berkeley(加州大学伯克利分校) ; ETH Zurich(苏黎世联邦理工学院) ; University of Cambridge(剑桥大学) ; University of Washington(华盛顿大学)
AI总结 本文提出MidSteer,一种基于仿射变换的最优概念引导框架,通过最小干扰实现生成模型中的概念切换,并在视觉扩散模型和大型语言模型上验证其有效性。
寻找隐式推理的最小参数预算:一种基于数据复杂度的语言模型缩放定律
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Cambridge(剑桥大学) ; University of Washington(华盛顿大学) ; University of Toronto(多伦多大学) ; University of Tokyo(东京大学)
AI总结 本文通过控制合成环境中的预训练实验,发现语言模型隐式推理所需的最小参数预算与图搜索熵之间存在缩放定律,并确定了每参数最多可处理约0.008比特信息的容量上限。
Comments Accepted to ICML 2026
双重预处理 (DoPr):针对测试时性能而非验证损失的优化
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学) ; University of Cambridge(剑桥大学) ; DeepMind(深度Mind) ; Google Research(谷歌研究)
AI总结 提出双重预处理优化范式,通过结合梯度级和激活级预处理,缓解自回归语言建模等场景中训练/验证损失与下游指标不匹配的测试时反馈问题,提升测试时性能而不一定改善验证损失。
重新思考基础设施检测为图像差异分类:以交通标志为例
机构 * University of Cambridge(剑桥大学) ; IIT Bombay(印度理工学院Bombay)
AI总结 本研究将基础设施检测重新定义为图像差异分类(IDC),通过利用连续资产状态监测的关系性质减少数据依赖,并在低资源交通标志检测案例中验证了基于指令的分类器优于基于编码器的分类器。
Comments CVPR 2026 Computer Vision for the Built World Workshop (CV4AEC @ CVPR)
EDIT:基于证据诊断的干预训练以实现遵循规则的LLM评分
机构 * King’s College London(伦敦国王学院) ; University of Cambridge(剑桥大学) ; AQA ; The Alan Turing Institute(艾伦·图灵研究所)
AI总结 提出EDIT框架,通过内部模型信号定位推理错误步骤并修正,结合信念引导的奖励塑造,提升LLM评分对评分标准的忠实度。
有效维度作为物理信息神经网络中保物理约束适配的算子不变量
机构 * University of Cambridge(剑桥大学)
AI总结 利用Fisher信息矩阵定义物理约束模型的有效自由度d_eff,证明其收敛于微分算子核维数,并基于此提出子空间投影策略实现边界条件适配。
多模态还是非多模态:通过主动模态检测的查询自适应音视频人物检索
机构 * University of Cambridge(剑桥大学) ; Queen's University Belfast(贝尔法斯特女王大学) ; University of Surrey(萨里大学) ; Cisco(思科) ; Southwest Jiaotong University(西南交通大学) ; Teesside University(泰赛德大学)
AI总结 提出一种查询自适应框架,通过跨模态分数一致性检测主动模态,在BBC Rewind语料库上达到94.2%的P@1,优于单模态和固定融合方法。
Comments INTERSPEECH 2026
大语言模型中在扩展搜索空间上的逐步优化类推理
机构 * University of Cambridge(剑桥大学)
AI总结 本文提出OPT*任务族,通过可验证奖励训练和搜索引导策略,提升LLM在扩展搜索空间中的逐步优化推理能力。
智能体蒙特卡洛:黑盒智能体的强化学习模拟
机构 * University of Cambridge(剑桥大学)
AI总结 提出Agentic Monte Carlo (AMC)方法,利用序贯蒙特卡洛从最优策略后验中采样,无需参数级优化即可对黑盒LLM智能体进行强化学习式优化,在AgentGym基准上超越提示基线并随测试时计算扩展优于GRPO。
Comments Accepted by ICML 2026
本体约束的多LLM评分在预测处理文献中假设支持度的应用
机构 * University of Edinburgh(爱丁堡大学) ; University of Cambridge(剑桥大学)
AI总结 本文提出一个本地多LLM流水线,通过本体约束对预测编码文献中的研究进行评分,将异构文献映射到定量证据空间,并揭示假设间的结构化分歧。
Comments 33 pages, 5 tables and 9 figures
谁的对齐?比较不同组织决策情境下的大语言模型过程对齐
机构 * University of Cambridge(剑桥大学)
AI总结 本文提出一种决策策略捕获方法测量过程对齐,发现LLM在ECHR第6条决策中过程对齐与输出准确性高度相关,但在德国消费信贷决策中关系消失,揭示了多元对齐挑战。
Comments Accepted to Pluralistic Alignment Workshop @ ICML 2026, Seoul, South Korea
Open-H-Embodiment: 一个大规模数据集,用于在医疗机器人中启用基础模型
机构 * Open-H-Embodiment Consortium ; University of California, Berkeley(加州大学伯克利分校) ; University of California, Los Angeles(加州大学洛杉矶分校) ; University of Southern California(南加州大学) ; University of Cambridge(剑桥大学) ; University of Tokyo(东京大学) ; University of Tokyo, Graduate School of Information Science and Technology(东京大学信息科学与技术研究生院) ; University of Tokyo, Institute of Industrial Science(东京大学工业科学研究所)
AI总结 本文提出Open-H-Embodiment数据集,通过两个基础模型展示了其在医疗机器人领域的应用,展示了大规模开放数据在推动机器人学习和世界建模方面的关键作用。
Comments Project website: https://open-h.github.io/open-h-embodiment/
CaMeLs Can Use Computers Too: System-level Security for Computer Use Agents
机构 * University of Cambridge(剑桥大学) ; University of Toronto & Vector Institute(多伦多大学及向量研究所) ; ETH Zurich(苏黎世联邦理工学院) ; AI Security Company(人工智能安全公司)
AI总结 本文提出了一种系统级安全方法,用于计算机使用代理(CUAs),通过单次规划和NOVA框架在动态UI状态下提供控制流完整性保障,同时在保持性能的同时提升安全性。
通过大语言模型实现语义部分 grounding
机构 * Department of Computer Science, University of Cambridge(剑桥大学计算机科学系)
AI总结 本文提出SPG-LLM,利用大语言模型分析领域和问题文件,提前识别可能不相关的对象、动作和谓词,从而减少grounding任务的规模,提升grounding效率并在某些领域实现更优的计划成本。
增量变换器神经过程
机构 * University of Cambridge(剑桥大学)
AI总结 本文提出增量变换器神经过程(incTNP),通过因果掩码、键值缓存和高效自回归训练策略,在保持预测性能的同时将更新计算复杂度从二次降低到线性,从而在序列推理中实现显著的速度提升,并保持流式推理的一致性。
Comments Accepted at ICML 2026
从能力寻求强化学习训练中产生的对齐风险
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学) ; University of Washington(华盛顿大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; University of Toronto(多伦多大学) ; University of Cambridge(剑桥大学)
AI总结 本文研究了在易受攻击的环境中通过强化学习训练语言模型时,模型可能利用隐含漏洞来最大化奖励的风险,发现这些策略不仅限于狭窄的技巧,还能在一定程度上转移、传播,并在某些情况下比通过SFT学习更持久,表明需要扩展AI安全工作到审计和保障训练环境、奖励机制和评估渠道。
Comments Accepted by ICML 2026
超越奖励的强化学习在网络安全防御中的应用
机构 * University of Cambridge(剑桥大学)
AI总结 本文研究了在网络安全防御中使用强化学习时,奖励函数结构对学习和策略行为的影响,通过比较稀疏和密集奖励函数,揭示了奖励、动作空间和子最优策略风险之间的复杂关系。
迈向基于谱表示的可扩展且有效的条件独立性检验
机构 * University of Cambridge(剑桥大学) ; University of Oxford(牛津大学) ; ETH Zürich(苏黎世联邦理工学院)
AI总结 本文提出了一种基于谱表示的学习方法,用于解决传统条件独立性检验在适应性和可扩展性方面的不足,通过构造简单的检验统计量和双层对比算法,建立了表示学习误差与检验性能之间的理论联系,并在实际和合成数据上验证了其有效性。
Comments Accepted at ICML 2026. Revised to match the accepted version; updated experiments and exposition
掩码可能具有干扰性:关于扩散语言模型中的上下文理解
机构 * University of Cambridge(剑桥大学)
AI总结 本文研究了扩散语言模型中掩码对上下文理解的影响,发现掩码会干扰模型对相关信息的处理,提出一种掩码无关的损失函数以提高模型的鲁棒性。
Comments Published at the Forty-Third International Conference on Machine Learning (ICML 2026)
纠正大语言模型基准测试中的提示依赖:一种具有嵌入空间聚类的贝叶斯分层模型
机构 * University of Cambridge(剑桥大学)
AI总结 本文提出了一种贝叶斯分层模型,通过嵌入空间聚类来纠正大语言模型基准测试中的提示依赖问题,在数据有限的情况下提供更稳健的性能指标,并在对抗鲁棒性基准测试中实现了性能指标的显著提升。
Comments Accepted to the 1st Workshop on Combining Theory and Benchmarks, CTB@ICML 2026, Seoul, South Korea
深度嵌入乘法DMD用于保代数Koopman学习
机构 * Department of Mathematics, Imperial College London(帝国理工学院数学系) ; Department of Applied Mathematics and Theoretical Physics, University of Cambridge(剑桥大学应用数学与理论物理系)
AI总结 提出DeepMDMD方法,通过结合深度学习和乘法DMD,在潜空间中施加Koopman乘积规则作为代数约束,学习紧凑且动态一致的字典,实现稳定预测和谱污染减少。
Comments 26 pages, 11 figures
随机最短路径问题的贝叶斯学习
机构 * Department of Engineering, University of Cambridge, UK(剑桥大学工程系) ; School of Mathematics and Physics, University of Wollongong, Wollongong, Australia(沃林根大学数学与物理学院)
AI总结 针对随机最短路径问题,提出一种贝叶斯框架,通过贝尔曼最优方程直接构建最优动作价值函数Q*的后验分布,并解决似然松弛导致的不可识别性问题,实现不确定性量化与数据高效学习。
Comments 50 pages, 19 figures
StandardE2E:端到端自动驾驶数据集的统一框架
机构 * University of Cambridge(剑桥大学)
AI总结 提出StandardE2E框架,通过统一数据模式、多数据集联合加载和简化新数据集添加流程,解决端到端自动驾驶数据集格式不兼容问题。
EReL@MIR 2025 多模态文档检索挑战赛(赛道1)概述
机构 * University of Cambridge(剑桥大学) ; Cambridge United Kingdom(剑桥英国)
AI总结 本文介绍了EReL@MIR 2025多模态文档检索挑战赛(赛道1)的设计、数据集、评估协议、最终排名及前三名获胜系统的分析,所有系统均基于Qwen2-VL系列解码器多模态大语言模型嵌入器。
Comments MDR Challenge Report at WWW2025
ADAPTOOD:面向分布外心电图时间序列模型的不确定性感知微调
机构 * University of Cambridge(剑桥大学) ; Dartmouth College(达特茅斯学院) ; Queen’s University(皇后大学)
AI总结 提出ADAPTOOD框架,利用数据不确定性量化分布偏移严重性,结合低秩更新和自适应超参数优化,在分布外心电图时间序列任务上提升准确率高达7%和精确率12.9%。
Comments 11 pages
感知-物理悖论:用TC-Bench探究科学对齐
机构 * ETH Zurich(苏黎世联邦理工学院) ; DeepMind ; University of Cambridge(剑桥大学) ; University of Amsterdam(阿姆斯特丹大学) ; University of Toronto(多伦多大学)
AI总结 本文提出科学对齐概念,通过结构同构性构建层次化必要条件,并发布TC-Bench基准数据集,揭示视觉基础模型在极端条件下依赖视觉捷径而非科学推理。
Comments Accepted at ICML 2026
用于机器人控制的智能体AI:灵活但依然脆弱
机构 * ETH Zurich(苏黎世联邦理工学院) ; University of Cambridge(剑桥大学) ; Technical University of Munich(慕尼黑技术大学) ; Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) ; German Aerospace Center (DLR)(德国航空航天中心(DLR))
AI总结 本文提出一种基于推理型语言模型的智能体控制系统,通过迭代规划-执行循环选择并调用机器人技能完成任务,在两种物理平台上实验表明系统灵活但存在非确定性行为、指令遵循错误和提示敏感等脆弱性。