arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Imperial College London(帝国理工学院)

共收录 1182
2511.20697 2026-04-24 cs.SD cs.AI

Musical Score Understanding Benchmark: Evaluating Large Language Models' Comprehension of Complete Musical Scores

音乐乐谱理解基准:评估大型语言模型对完整乐谱的理解能力

Congren Dai, Yue Yang, Krinos Li, Huichi Zhou, Shijie Liang, Bo Zhang, Enyang Liu, Ge Jin, Hongran An, Haosen Zhang, Peiyuan Jing, Kinhei Lee, Z henxuan Zhang, Xiaobing Li, Maosong Sun

机构 * Central Conservatory of Music(中央音乐学院) Imperial College London(帝国理工学院) Tsinghua University(清华大学)

AI总结 本文提出MSU-Bench基准,评估大型语言模型和视觉-语言模型对完整乐谱的理解能力,发现模型在模态间存在显著差距,通过微调可提升多层级正确性,为多模态推理研究提供基础。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20409 2026-04-23 cs.LG stat.ML

Calibrating conditional risk

校准条件风险

Andrey Vasilyev, Yikai Wang, Xiaocheng Li, Guanting Chen

机构 * Imperial College Business School(帝国理工学院商学院) Department of Statistics and Operations Research(统计与运筹学系) Imperial College London(伦敦帝国理工学院) UNC-Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 本文研究了校准条件风险问题,揭示其与标准回归任务的等价性,并在分类和回归中提出理论分析与实验验证,为不确定性量化提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20313 2026-04-23 cs.LG cs.AI

Formalising the Logit Shift Induced by LoRA: A Technical Note

对LoRA引起的对数几率偏移进行形式化:技术说明

Xiang Shi, Shuaizhi Cheng, Mingwei Li

机构 * Imperial College London(帝国学院伦敦) Harbin Institute of Technology(哈尔滨工业大学) KigLand Machine Learning Lab(KigLand机器学习实验室)

AI总结 本文首次形式化LoRA引起的对数几率偏移及事实边际变化,通过一阶Fréchet近似证明多层LoRA效应可分解为层间贡献的线性求和及高阶余项。

Comments 7 pages, technical note

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19993 2026-04-23 cs.AR cs.LG

Algorithm and Hardware Co-Design for Efficient Complex-Valued Uncertainty Estimation

用于高效复值不确定性估计的算法与硬件协同设计

Zehuan Zhang, Mark Chen, He Li, Wayne Luk

机构 * Department of Computing, Imperial College London(帝国理工学院计算机系) Southeast University(东南大学)

AI总结 本文提出基于dropout的贝叶斯复值神经网络,实现复值应用的不确定性量化,并通过自动化搜索方法优化配置,生成定制FPGA加速器,实现更高的性能与更低的硬件成本。

Comments Accepted to 63rd ACM/IEEE Design Automation Conference (DAC '26). 7 pages, 6 figures

Journal ref 63rd ACM/IEEE Design Automation Conference (DAC '26), July 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19763 2026-04-23 eess.AS cs.AI cs.CL

Explainable Speech Emotion Recognition: Weighted Attribute Fairness to Model Demographic Contributions to Social Bias

可解释的语音情绪识别:基于加权属性公平性的模型对社会偏见的贡献

Tomisin Ogunnubi, Yupei Li, Björn Schuller

机构 * Imperial College London(伦敦帝国学院)

AI总结 本文提出一种新的公平性模型,用于评估语音情绪识别中 demographic 属性与模型偏见之间的相互信息,并验证了其在 HuBERT 和 WavLM 模型上的有效性,揭示了性别偏见的存在。

Comments 5 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08465 2026-04-23 stat.ML cs.LG

Accumulated Aggregated D-Optimal Designs for Estimating Main Effects in Black-Box Models

累积聚合D-最优设计用于黑盒模型中主效应的估计

Chih-Yu Chang, Ming-Chung Chang

机构 * Department of Mathematics(数学系) Institute of Statistical Science(统计科学研究所) Imperial College London(伦敦帝国学院) Academia Sinica(台湾“中央研究院”)

AI总结 本文提出A2D2E方法,通过累积聚合D-最优设计减少主效应估计方差,解决黑盒模型中主效应估计的OOD敏感性和特征相关性不稳定性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20723 2026-04-23 cs.LG cs.AI

Tokenised Flow Matching for Hierarchical Simulation Based Inference

基于分层模拟的推理中令牌化流匹配

Giovanni Charles, Cosmo Santoni, Seth Flaxman, Elizaveta Semenova

机构 * Imperial College London(帝国理工学院伦敦分校) University of Oxford(牛津大学)

AI总结 本文提出基于似然因子分解的令牌化流匹配方法,通过单站点模拟训练以提升分层模拟推理效率,并在真实传染病和计算流体动力学模型中验证其效果。

Comments 31 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19740 2026-04-22 cs.LG cs.AI cs.CV stat.ML

Generalization at the Edge of Stability

在稳定性边缘的泛化

Mario Tuci, Caner Korkmaz, Umut Şimşekli, Tolga Birdal

机构 * INRIA, CNRS, Département d’Informatique de l’Ecole Normale Supérieure / PSL, France(法国国家信息与自动化技术研究院(INRIA)、法国国家科学研究中心(CNRS)、巴黎综合理工学院计算机系 / PSL研究院) Department of Computing, Imperial College London, United Kingdom(伦敦帝国理工学院计算机系,英国)

AI总结 本文研究了在稳定性边缘训练神经网络的泛化机制,引入了'尖锐度维度'并证明了基于该维度的泛化界,揭示了混沌 regime 中泛化依赖于Hessian谱和部分行列式结构。

Comments Project page: https://circle-group.github.io/research/GATES

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16893 2026-04-22 math.OC cs.LG

Global Optimization of Gaussian Process Acquisition Functions Using a Piecewise-Linear Kernel Approximation

利用分段线性核近似进行高斯过程获取函数的全局优化

Yilin Xie, Shiqiang Zhang, Joel A. Paulson, Calvin Tsay

机构 * Imperial College London(帝国理工学院伦敦分校) The Ohio State University(俄亥俄州立大学)

AI总结 本文提出基于混合整数规划的分段线性核混合整数二次规划方法,用于解决高斯过程获取函数的全局优化问题,通过理论分析和实验验证了该方法在不确定性基础上的获取函数优化效果。

Comments 17 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18912 2026-04-22 cs.LG stat.ME

Collaborative Contextual Bayesian Optimization

协同上下文贝叶斯优化

Chih-Yu Chang, Qiyuan Chen, Tianhan Gao, David Fenning, Chinedum Okwudire, Neil Dasgupta, Wei Lu, Raed Al Kontar

机构 * Department of Mathematics, Imperial College London, London, United Kingdom Department of Mechanical Engineering, University of Michigan, Ann Arbor, MI, USA. Department of Industrial \& Operations Engineering, University of Michigan, Ann Arbor, MI, USA. Department of Chemical Nano Engineering, University of California, San Diego, CA, USA

AI总结 本文提出CCBO框架,实现多客户端协同进行上下文贝叶斯优化,支持在线协作和离线初始化,并通过模拟和实际应用证明其在客户端异质性下的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18874 2026-04-22 cs.AI

How Adversarial Environments Mislead Agentic AI?

对抗性环境如何误导代理AI?

Zhonghao Zhan, Huichi Zhou, Zhenhao Li, Peiyuan Jing, Krinos Li, Hamed Haddadi

机构 * Imperial College London(伦敦帝国学院)

AI总结 研究指出代理AI在依赖外部工具时存在信任缺口,提出对抗性环境注入威胁模型,通过POTEMKIN协议测试发现,对抗性攻击导致代理在知识和导航鲁棒性上存在差异。

Comments Accepted to Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18067 2026-04-22 cs.LG

Towards Real-Time ECG and EMG Modeling on $μ$NPUs

面向μNPUs的实时ECG和EMG建模

Josh Millar, Ashok Samraj Thangarajan, Soumyajit Chatterjee, Hamed Haddadi

机构 * Imperial College London London United Kingdom Nokia Bell Labs London United Kingdom Brave Software \& University of Cambridge London United Kingdom Imperial College London Nokia Bell Labs Brave Software \& University of Cambridge

AI总结 本文提出PhysioLite模型,通过轻量架构和硬件优化,在μNPUs上实现ECG/EMG信号分析,性能媲美最新Transformer模型,且体积仅为10%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18085 2026-04-21 cs.LG

Predicting LLM Compression Degradation from Spectral Statistics

从谱统计预测大语言模型压缩退化

Mingxue Xu

机构 * Department of Electrical and Electronic Engineering, Imperial College London(帝国理工学院伦敦分校电子与电气工程系)

AI总结 本文通过分析四种低秩压缩方法,发现稳定秩和信息密度主导性能退化,提出γ·ρ_s交互项作为准确度退化的预测指标,实现了高相关性验证。

Comments Profoundly assisted by agentic AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18310 2026-04-21 stat.ML cs.LG

Symmetry Guarantees Statistic Recovery in Variational Inference

对称性在变分推断中保证统计量的恢复

Daniel Marks, Dario Paccagnan, Mark van der Wilk

机构 * Department of Computer Science(计算机科学系) Department of Computing(计算科学系) University of Oxford(牛津大学) Imperial College London(伦敦帝国理工学院)

AI总结 本文提出了一种通用理论,探讨对称性如何在变分推断中促进统计量的恢复,统一了现有结果,并应用于球面分布以获得新的方向统计量保证。

Comments 19 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17919 2026-04-21 cs.LG cs.RO

Fisher Decorator: Refining Flow Policy via A Local Transport Map

Fisher Decorator:通过局部传输映射细化流策略

Xiaoyuan Cheng, Haoyu Wang, Wenxuan Yuan, Ziyan Wang, Zonghao Chen, Li Zeng, Zhuo Sun

机构 * University College London(伦敦大学学院) Shanghai Jiao Tong University(上海交通大学) King’s College London(伦敦国王学院) Peking University(北京大学) Shanghai University of Finance and Economics(上海财经大学) Imperial College London(伦敦帝国学院)

AI总结 本文提出Fisher Decorator方法,通过局部传输映射细化流策略,解决离线强化学习中流策略在表达性、最优性和效率之间的权衡问题,通过几何视角分析并改进优化方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06987 2026-04-21 cs.LG cond-mat.mtrl-sci

OXtal: An All-Atom Diffusion Model for Organic Crystal Structure Prediction

OXtal:一种用于有机晶体结构预测的全原子扩散模型

Emily Jin, Andrei Cristian Nica, Mikhail Galkin, Jarrid Rector-Brooks, Kin Long Kelvin Lee, Santiago Miret, Frances H. Arnold, Michael Bronstein, Avishek Joey Bose, Alexander Tong, Cheng-Hao Liu

机构 * University of Oxford(牛津大学) Synteny Google(谷歌) Mila Université de Montréal(蒙特利尔大学) Caltech(加州理工学院) NVIDIA(英伟达) Lila AITHYRA FutureHouse Imperial College London(伦敦帝国学院)

AI总结 OXtal通过全原子扩散模型直接学习分子构象与周期性排列的联合分布,利用数据增强策略提升效率,实现对晶体结构的高精度预测,显著优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07809 2026-04-21 cs.LG

EvoCoT: Overcoming the Exploration Bottleneck in Reinforcement Learning

EvoCoT:克服强化学习中的探索瓶颈

Huanyu Liu, Jia Li, Yihong Dong, Chang Yu, Taozhi Chen, Lecheng Wang, Yongding Tao, Bin Gu, Ge Li

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) College of AI, Tsinghua University(清华大学人工智能学院) Imperial College London(伦敦帝国理工学院) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

AI总结 EvoCoT通过两阶段链式思维优化框架,解决强化学习中稀疏奖励下的探索瓶颈问题,提升大语言模型的推理能力。

Comments Camera-ready version for ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02972 2026-04-21 cs.CV cs.RO

TagaVLM: Topology-Aware Global Action Reasoning for Vision-Language Navigation

TagaVLM:面向视觉语言导航的拓扑感知全局动作推理

Jiaxing Liu, Zexi Zhang, Xiaoyan Li, Boyue Wang, Yongli Hu, Baocai Yin

机构 * School of Information Science and Technology, Beijing University of Technology, China(信息科学与技术学院,北京理工大学,中国) Imperial College London, U.K.(伦敦帝国理工学院,英国)

AI总结 TagaVLM通过引入拓扑结构增强视觉语言模型,提升空间推理能力,在R2R基准中取得最佳性能,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20033 2026-04-21 cs.CV

FlashLips: 100-FPS Mask-Free Latent Lip-Sync using Reconstruction Instead of Diffusion or GANs

FlashLips: 100-FPS 无掩码的潜在唇部同步使用重建而非扩散或GANs

Andreas Zinonos, Michał Stypułkowski, Antoni Bigata, Stavros Petridis, Maja Pantic, Nikita Drobyshev

机构 * Imperial College London(帝国理工学院伦敦分校) Cantina Labs(Cantina实验室) NatWest AI Research(NatWest人工智能研究)

AI总结 FlashLips是一种无掩码的唇部同步系统,通过重建而非扩散或GANs实现实时性能,其U-Net变体在单GPU上达100FPS,视觉质量媲美先进模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17408 2026-04-21 cs.AI cs.LG

The Impact of Off-Policy Training Data on Probe Generalisation

偏离策略训练数据对探测泛化的影响

Nathalie Kirch, Samuel Dower, Adrians Skapars, Helen Yannakoudakis, Ekdeep Singh Lubana, Dmitrii Krasheninnikov

机构 * King’s College London(伦敦国王学院) Imperial College London(伦敦帝国学院) LASR Labs(LASR实验室) University of Manchester(曼彻斯特大学) Goodfire AI University of Cambridge(剑桥大学)

AI总结 本文研究了偏离策略训练数据对八个不同LLM行为探测泛化的影响,发现训练策略显著影响探测性能,尤其在涉及响应意图的行为上表现更差,并提出预测泛化失败的测试方法。

Comments 10 pages, ACL 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17067 2026-04-21 math.OC cs.LG math.ST stat.TH

Trajectory-Restricted Optimization Conditions and Geometry-Aware Linear Convergence

轨迹受限优化条件与几何感知的线性收敛

Faris Chaudhry, Anthea Monod, Keisuke Yano

机构 * Imperial College London(帝国理工学院伦敦分校) Institute of Statistical Mathematics(统计数学研究所)

AI总结 本文提出轨迹受限框架,通过局部几何正则性条件,改进高维或结构化问题的线性收敛分析,揭示算法轨迹所经区域的几何特性对收敛速度的影响。

Comments 37 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17066 2026-04-21 cs.LG math.PR

Reference-state System Reliability method for scalable uncertainty quantification of coherent systems

参考态系统可靠性方法用于可扩展的不确定性量化方法

Ji-Eun Byun, Hyeuk Ryu, Junho Song

机构 * Department of Civil and Environmental Engineering, Imperial College London, United Kingdom(帝国理工学院伦敦分校土木与环境工程系) Department of Civil, Urban, and Environmental Engineering, Seoul National University, South Korea(首尔国立大学土木、城市与环境工程系)

AI总结 本文提出参考态系统可靠性方法,通过高效分类蒙特卡洛样本降低计算成本,适用于大规模系统的实时风险评估,并能处理大量参考态的扩展问题。

Comments 36 pages, 13 figures, under review at a peer-reviewed journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16729 2026-04-21 cs.CV cs.AI

Agentic Large Language Models for Training-Free Neuro-Radiological Image Analysis

基于代理的大型语言模型用于无训练神经放射学图像分析

Ayhan Can Erdur, Daniel Scholz, Jiazhen Pan, Benedikt Wiestler, Daniel Rueckert, Jan C. Peeken

机构 * Department of Radiation Oncology, TUM University Hospital, Munich, Germany(放射肿瘤科,慕尼黑技术大学医院,德国) Chair for AI in Healthcare and Medicine, Technical University of Munich (TUM)(人工智能在医疗和健康领域的主任,慕尼黑技术大学) Chair for AI for Image-Guided Diagnosis and Therapy, Technical University of Munich (TUM)(人工智能在影像引导诊断和治疗领域的主任,慕尼黑技术大学) Munich Center for Machine Learning (MCML), Munich, Germany(慕尼黑机器学习中心(MCML),德国慕尼黑) Department of Computing, Imperial College London, London, UK(计算系,伦敦帝国学院,英国伦敦) Deutsches Konsortium für Translationale Krebsforschung (DKTK), Partner Site Munich, Munich, Germany(德国转化癌症研究联盟(DKTK),慕尼黑分部,德国慕尼黑)

AI总结 本文提出一种无训练代理框架,利用外部工具实现脑MRI分析,涵盖预处理、病灶分割和体积分析,并通过公开BraTS数据集评估代理AI在神经放射学任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16541 2026-04-21 cs.CV

BOOKAGENT: Orchestrating Safety-Aware Visual Narratives via Multi-Agent Cognitive Calibration

BOOKAGENT:通过多智能体认知校准 orchestrate 安全意识的视觉叙述

Bo Gao, Chang Liu, Yuyang Miao, Siyuan Ma, Ser-Nam Lim

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Science and Technology of China(中国科学技术大学) Imperial College London(伦敦帝国理工学院) Nanyang Technological University(南洋理工大学) University of Central Florida(佛罗里达中央大学)

AI总结 本文提出BOOKAGENT,一种安全意识的多智能体协作框架,用于高质量的视觉叙述生成,通过联合规划、脚本、插图和全局修复不一致,提升叙述连贯性和视觉一致性。

Comments 18 pages, Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02547 2026-04-21 cs.AI cs.CL

The Landscape of Agentic Reinforcement Learning for LLMs: A Survey

代理强化学习用于大语言模型的景观:综述

Guibin Zhang, Hejia Geng, Xiaohang Yu, Zhenfei Yin, Zaibin Zhang, Zelin Tan, Heng Zhou, Zhongzhi Li, Xiangyuan Xue, Yijiang Li, Yifan Zhou, Yang Chen, Chen Zhang, Yutao Fan, Zihu Wang, Songtao Huang, Francisco Piedrahita-Velez, Yue Liao, Hongru Wang, Mengyue Yang, Heng Ji, Jun Wang, Shuicheng Yan, Philip Torr, Lei Bai

机构 * University of Oxford(牛津大学) Shanghai AI Laboratory(上海人工智能实验室) National University of Singapore(新加坡国立大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Brown University(布朗大学) University College London(伦敦大学学院) University of Science and Technology of China(中国科学技术大学) Imperial College London(伦敦帝国学院) Dalian University of Technology(大连理工大学) Chinese Academy of Sciences(中国科学院) The Chinese University of Hong Kong(香港中文大学) University of Georgia(佐治亚大学) University of California, San Diego(加州大学圣地亚哥分校) University of California, Santa Barbara(加州大学圣塔芭芭拉分校) University of Bristol(布里斯托大学)

AI总结 本文综述了代理强化学习在大语言模型中的应用,提出双分类体系,探讨其核心能力与应用领域,并强调强化学习在使能力转化为适应性行为中的关键作用。

Comments Published on Transactions on Machine Learning Research: https://openreview.net/forum?id=RY19y2RI1O

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14410 2026-04-21 cs.AI

ORThought: Benchmarking and Automating Logistics Optimization Modeling

ORThought: 物流优化建模的基准测试与自动化

Beinuo Yang, Qishen Zhou, Junyi Li, Chenxing Su, Panagiotis Angeloudis, Simon Hu

机构 * ZJU-UIUC Institute, Zhejiang University(浙江大学浙大-伊利诺伊大学联合学院) School of Transportation, Jilin University(吉林大学交通运输学院) Singapore-MIT Alliance for Research and Technology(新加坡-麻省理工联合研究所) Department of Civil and Environmental Engineering, Imperial College London(伦敦帝国理工学院土木与环境工程系)

AI总结 本文提出ORThought框架,通过引入专家级建模原理,解决物流优化建模中的基准不足、多智能体框架不稳定及评估深度不足等问题,实验证明其在复杂约束下表现优异。

Comments The paper has been accepted by Artificial Intelligence for Transportation

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16217 2026-04-20 cs.CL cs.AI

Beyond Surface Statistics: Robust Conformal Prediction for LLMs via Internal Representations

超越表面统计:通过内部表示实现LLM的鲁棒置信预测

Yanli Wang, Peng Kuang, Xiaoyu Han, Kaidi Xu, Haohan Wang

机构 * Imperial College London(伦敦帝国学院) Zhejiang University(浙江大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) City University of Hong Kong(香港城市大学)

AI总结 本文提出一种基于内部表示的置信预测框架,通过层间信息评分提升LLM在分布偏移下的鲁棒性,优于文本层面基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16108 2026-04-20 cs.CV

Polyglot: Multilingual Style Preserving Speech-Driven Facial Animation

Polyglot:多语言风格保留的语音驱动面部动画

Federico Nocentini, Kwanggyoon Seo, Qingju Liu, Claudio Ferrari, Stefano Berretti, David Ferman, Hyeongwoo Kim, Pablo Garrido, Akin Caliskan

机构 * University of Florence(佛罗伦萨大学) Flawless AI Imperial College London(伦敦帝国学院)

AI总结 本文提出Polyglot,一种统一的扩散架构,用于多语言语音驱动面部动画,通过结合语言和风格信息,提升动画的真实性和一致性。

Comments The project website is available at https://fedenoce.github.io/polyglot/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05523 2026-04-20 cs.SE cs.AI

Capture the Flags: Family-Based Evaluation of Agentic LLMs via Semantics-Preserving Transformations

捕获旗帜:通过语义保持变换进行基于家庭的代理LLM评估

Shahin Honarvar, Amber Gorzynski, James Lee-Jones, Harry Coppock, Marek Rei, Joseph Ryan, Alastair F. Donaldson

机构 * Department of Computing, Imperial College London(帝国理工学院伦敦计算机系) AI Security Institute(人工智能安全研究所) Royal Grammar School Guildford(格里菲斯皇家文法学校)

AI总结 本文提出CTF挑战家族,通过语义保持的程序变换生成等效挑战,评估代理鲁棒性和泛化能力,展示了Evolve-CTF工具及13种代理LLM配置的评估结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25300 2026-04-20 cs.LG cs.AI

Scaling Behaviors of LLM Reinforcement Learning Post-Training: An Empirical Study in Mathematical Reasoning

LLM强化学习后训练的扩展行为:数学推理中的实证研究

Zelin Tan, Hejia Geng, Xiaohang Yu, Mulei Zhang, Guancheng Wan, Yifan Zhou, Qiang He, Xiangyuan Xue, Heng Zhou, Yutao Fan, Zhongzhi Li, Zaibin Zhang, Guibin Zhang, Chen Zhang, Zhenfei Yin, Philip Torr, Lei Bai

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) University of Oxford(牛津大学) Imperial College London(伦敦帝国学院) University of Georgia(佐治亚大学) The Chinese University of Hong Kong(香港中文大学) Chinese Academy of Sciences(中国科学院) Dalian University of Technology(大连理工大学) National University of Singapore(新加坡国立大学) Wuhan University(武汉大学)

AI总结 本文通过实证研究探讨了LLM后训练强化学习中的扩展行为,重点分析了模型规模、数据量和计算预算对数学推理性能的影响,揭示了学习效率的饱和趋势及高质量数据重复利用的有效性。

Comments V4 version:This Paper has been accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏