arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Cambridge(剑桥大学)

共收录 1282
2605.31244 2026-08-04 cs.LG physics.comp-ph 版本更新

Spectral Reach: Understanding Neural Scaling as Progress into the Spectral Tail

谱范围:理解神经缩放作为进入谱尾的进展

Konstantin Nikolaou, Jonas Scheunemann, Sven Krippendorf, Samuel Tovey, Christian Holm

机构 * Institute for Computational Physics, University of Stuttgart, Stuttgart, Germany(斯图加特大学计算物理研究所) Department of Applied Mathematics(应用数学系) Department of Physics, University of Cambridge, Cambridge, UK(剑桥大学物理系)

AI总结 本文提出“谱位置”度量,通过经验神经正切核的特征值分析神经缩放定律,发现大模型通过“谱范围”进入更深的谱尾从而降低损失,并指出特征学习是关键机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27681 2026-08-04 cs.AI cs.LG 版本更新

Behavioural Analysis of Alignment Faking

对齐伪造的行为分析

Nathaniel Mitrani Hadida, Rhea Karty, David Williams-King, Alan Cooney

机构 * University of Cambridge(剑桥大学) Harvard University(哈佛大学) ERA UK AISI(英国人工智能学会)

AI总结 通过可控最小设置研究对齐伪造,发现其驱动因素包括价值观、目标保护和谄媚,且比先前报告更普遍,可从情境线索和模型倾向预测。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01669 2026-08-04 cs.LG stat.ML 版本更新

Sparse Covariance Neural Networks

稀疏协方差神经网络

Andrea Cavallo, Zhan Gao, Elvin Isufi

机构 * Delft University of Technology(代尔夫特理工大学) University of Cambridge(剑桥大学)

AI总结 针对协方差神经网络的经验协方差矩阵含虚假相关性的问题,提出稀疏协方差神经网络,分真实协方差矩阵稀疏、稠密情形设计对应稀疏化方法,在多应用场景上实现性能、稳定性与计算效率的提升。

Journal ref IEEE Transactions on Signal Processing ( Volume: 74), Page(s): 3077 - 3091, Date of Publication: 17 July 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00075 2026-08-04 cs.SI cs.LG stat.ML

Optimizing Treatment Allocation in the Presence of Interference

Daan Caljon, Jente Van Belle, Jeroen Berrevoets, Wouter Verbeke

机构 * KU Leuven(卢森堡大学) University of Cambridge(剑桥大学)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24532 2026-07-31 cs.LG 版本更新

From Machine Learning to Large-Scale EO Products: Best Practices for Making Maps

从机器学习到大规模地球观测产品:制作地图的最佳实践

Ghjulia Sialelli, Robin Young, Yuchang Jiang, Cesar Aybar, Linus Scheibenreif, Damien Robert, Clemens Mosig, Adam J. Stewart, Jan D. Wegner, Aleksis Pirinen, Olof Mogren, Konrad Schindler

机构 * ETH Zurich(苏黎世联邦理工学院) ETH AI Center(苏黎世联邦理工学院人工智能中心) University of Cambridge(剑桥大学) Swiss Federal Research Institute WSL(瑞士联邦森林、雪和景观研究所) Asterisk Labs(星号实验室) EcoVision Lab, University of Zurich(苏黎世大学生态视觉实验室) Leipzig University(莱比锡大学) TU Munich(慕尼黑工业大学) RISE Research Institutes of Sweden(瑞典皇家理工学院)

AI总结 本文探讨从机器学习到大规模EO产品制作地图的最佳实践,围绕EO数据基础设施、数据处理、模型训练、不确定性量化、地图制作与分发及验证等六个主题,给出从卫星数据到运营地图产品整个流程的推荐做法。

Comments ECCV 2026 TerraBytes II Workshop paper, non-archival

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17041 2026-07-31 cs.CV 版本更新

Towards Generalized Synapse Detection Across Invertebrate Species

面向无脊椎动物物种的广义突触检测

Samia Mohinta, Daniel Franco-Barranco, Shi Yan Lee, Albert Cardona

机构 * MRC Laboratory of Molecular Biology, University of Cambridge, UK(英国剑桥大学分子生物学实验室(MRC)) Department of Physiology, Development and Neuroscience, University of Cambridge, UK(英国剑桥大学生理学、发育与神经科学系) Donostia International Physics Center (DIPC), San Sebastian, Spain(西班牙桑塞班的Donostia国际物理中心(DIPC))

AI总结 该研究针对无脊椎动物突触检测难题,构建含四个数据集的EM基准,提出轻量模型SimpSyn,其在突触位点检测F1分数上优于最先进模型Synful,为大规模连接组学流程提供实用方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26326 2026-07-30 cs.CV 新提交

Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models

视觉还是认知?多模态大语言模型的视觉上下文敏感性

Jiaang Li, Chengzu Li, Zhaochong An, Yifei Yuan, Xi Liu, Serge Belongie, Vésteinn Snæbjarnarson

机构 * University of Copenhagen(哥本哈根大学) University of Cambridge(剑桥大学) ETH Zürich(苏黎世联邦理工学院) Clemson University(克莱姆森大学)

AI总结 该研究探究多模态大语言模型在视觉证据与先验冲突任务上的失效原因,引入WhatIfVis基准,发现其能编码视觉证据但难以控制对其的依赖,监督微调等方法可提升可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25933 2026-07-29 cs.CL cs.AI 新提交

Evaluating Multi-Turn Multimodal Diagnostic Reasoning on Challenging Real-World Clinical Cases

评估具有挑战性的真实世界临床病例中的多轮多模态诊断推理

Rui Yang, Weihao Xuan, Yi Lin, Zhuhan Bao, Jonathan Chong Kai Liew, Matthew Yu Heng Wong, Nicolás Lescano, Nikita R. Paripati, Emily Ling-Lin Pai, Jiarui Liu, Heli Qi, Heng-Jui Chang, Benny Kai Guo Loo, Huitao Li, Kunyu Yu, Yufan Wang, Chuan Hong, Shijian Lu, Douglas Teodoro, Naoto Yokoya, Ross Koppel, Mona Diab, Hua Xu, David W. Bates, Nan Liu, Yifan Peng

机构 * Center for Biomedical Data Science, Duke-NUS Medical School(生物医学数据科学中心,杜克 - 新加坡国立大学医学院) Duke-NUS AI + Medical Sciences Initiative, Duke-NUS Medical School(杜克 - 新加坡国立大学人工智能与医学科学计划,杜克 - 新加坡国立大学医学院) Department of Population Health Sciences, Weill Cornell Medicine(人口健康科学系,威尔康奈尔医学院) System Engineering, College of Engineering, Cornell University(系统工程,康奈尔大学工程学院) Graduate School of Frontier Sciences, The University of Tokyo(前沿科学研究生院,东京大学) RIKEN Center for Advanced Intelligence Project(理化学研究所先进智能项目中心) Department of Biostatistics and Bioinformatics, Duke University(生物统计学与生物信息学系,杜克大学) Perelman School of Medicine, University of Pennsylvania(佩雷尔曼医学院,宾夕法尼亚大学) School of Clinical Medicine, University of Cambridge(临床医学学院,剑桥大学) Hospital of the University of Pennsylvania(宾夕法尼亚大学医院) Children’s Hospital of Philadelphia (CHOP)(费城儿童医院) Department of Anatomic Pathology and Laboratory Medicine, Hospital of the University of Pennsylvania(解剖病理学与检验医学系,宾夕法尼亚大学医院) Department of Pathology and Laboratory Medicine, University of California, San Francisco(病理学与检验医学系,加州大学旧金山分校) Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)

AI总结 研究针对现有多模态大语言模型评估难以捕捉现实临床诊断复杂性的问题,开发ClinMM-Bench基准,用两级框架评估15个模型,发现专有模型诊断准确性最高,但各模型完全正确诊断比例有限,当前模型诊断推理有局限并明确了失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18902 2026-07-29 cs.CL 版本更新

SAGE: Stochastic Prompt Optimization via Agent-Guided Exploration

SAGE: 基于智能体引导探索的随机提示优化

Ziyi Zhu, Luka Smyth, Saki Shinoda, Jinghong Chen

机构 * Slingshot AI Department of Engineering, University of Cambridge(剑桥大学工程系)

AI总结 提出随机提示优化框架SPO,其中SAGE方法通过多智能体诊断代码执行实现黑盒搜索,在多个基准测试中表现依赖于错误类型,并在心理健康聊天机器人中通过连续优化显著提升次日留存率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02295 2026-07-29 cs.RO 版本更新

CycleVLA: Proactive Self-Correcting Vision-Language-Action Models via Subtask Backtracking and Minimum Bayes Risk Decoding

CycleVLA: 通过子任务回溯和最小贝叶斯风险解码实现的前瞻性自修正视觉-语言-动作模型

Chenyang Ma, Kai Lu, Guangyu Yang, Jiuming Liu, Shitong Xu, Bill Byrne, Ioannis Havoutis, Niki Trigoni, Andrew Markham

机构 * Department of Computer Science, University of Oxford(牛津大学计算机科学系) Department of Engineering, University of Cambridge(剑桥大学工程系)

AI总结 CycleVLA通过子任务回溯和最小贝叶斯风险解码实现前瞻性自修正,提升视觉-语言-动作模型的故障预测与恢复能力

Comments Project Page: https://dannymcy.github.io/cyclevla/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23447 2026-07-28 cs.LG 新提交

PerturbPFN: Probing the Limits of Synthetic Priors in Drug Perturbation Modelling

PerturbPFN:探索药物扰动建模中合成先验的极限

Yuche Gao, José Miguel Hernández-Lobato, Siyuan Guo

机构 * University of Cambridge(剑桥大学) Prior Labs(普瑞尔实验室)

AI总结 针对预测细胞对未知化学扰动反应的挑战,提出PerturbPFN模型,通过推断潜在系统图等并经SCM解码器传播效果,基于合成情节训练,在真实和合成数据上评估,实现低推理成本且具可解释性的扰动预测。

Comments 19 pages. Accepted at the 2nd ICML Workshop on Foundation Models for Structured Data (FMSD 2026), Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22676 2026-07-28 cs.AI cs.CL 新提交

How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift

大语言模型任务适应如何重塑对齐:行为和表征漂移的多维研究

James Elcock, William F. Shen, Xinchi Qiu, Nicholas D. Lane

机构 * University of Cambridge(剑桥大学)

AI总结 研究大语言模型任务适应对对齐的影响,通过系统评估监督微调、KL正则化SFT和可验证奖励强化学习等方法,发现训练后调整非均匀重塑对齐,不同方法影响各异,强调任务适应是对齐干预,应进行多维对齐评估。

Comments 21 pages, 7 figures (includes references and appendices)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04520 2026-07-28 cs.LG 版本更新

Beyond travel mode: urban context shapes active mobility's mental health effects over time

超越出行方式:城市环境随时间塑造主动出行对心理健康的影响

Shujuan Chen, Yue Li, Ying Jin

机构 * Martin Centre for Architectural and Urban Studies, University of Cambridge(剑桥大学马丁建筑与城市研究中心) Cambridge Public Health, University of Cambridge(剑桥大学剑桥公共卫生)

AI总结 研究主动出行对心理健康的影响,用因果机器学习等方法分析英国成年人数据,发现主动出行对焦虑等的个体影响有不平等,且随时间扩大,受城市环境强烈影响,未考虑个体和环境差异会加剧健康不平等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08728 2026-07-28 cs.AI cs.CL cs.CV cs.LG 版本更新

Artificial Intelligence for Mathematical Reasoning: An Integrated Survey of Language Models, Neuro-symbolic Systems, and Verified Discovery

人工智能数学推理:语言模型、神经符号系统与验证发现的综合综述

Syed Rifat Raiyan, Mohsinul Kabir, Hasan Mahmud, Md Kamrul Hasan, Sophia Ananiadou

机构 * University of California, Berkeley(加州大学伯克利分校) University of Cambridge(剑桥大学) University of Toronto(多伦多大学)

AI总结 本文综述了数学推理领域从早期规则系统到当代推理模型、多智能体系统及验证发现工作流的演变,沿非正式推理、形式推理、数学发现及推理技术四轴组织,并评估了基准测试、失败模式及未来方向。

Comments Under review, 47 pages, 14 figures, 22 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14021 2026-07-28 cs.CV 版本更新

Flow4R: Unifying 4D Reconstruction and Tracking with Scene Flow

Flow4R: 用场景流统一4D重建与跟踪

Shenhan Qian, Ganlin Zhang, Shangzhe Wu, Daniel Cremers

机构 * Technical University of Munich(慕尼黑技术大学) MCML University of Cambridge(剑桥大学)

AI总结 Flow4R通过统一的场景流表示,在4D重建与跟踪任务中实现最先进的性能。

Comments Project Page: https://shenhanqian.github.io/flow4r

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22408 2026-07-27 cs.LG 新提交

LunarFM: A Shared Multimodal Representation of the Moon's Surface

LunarFM:月球表面的共享多模态表示

Marc Girona-Mata, Jakob Gawlikowski, Sumit Goski, Gautier Bardi de Fourtou, Valentin T. Bickel, Ben Moseley, Abigail Calzada-Diaz, Sylvester Kaczmarek, Raúl Ramos-Pollán

机构 * University of Cambridge(剑桥大学) German Aerospace Center (DLR)(德国航空航天中心) SPAIDER SPACE(斯派德太空公司) Mines Paris - PSL University(巴黎矿业学院 - 巴黎文理研究大学) University of Bern(伯尔尼大学) Imperial College London(伦敦帝国理工学院) European Space Resources Innovation Center (ESRIC)(欧洲空间资源创新中心) Universidad de Antioquia(安蒂奥基亚大学)

AI总结 因月球探索需求,针对多源观测致月球表面分析碎片化问题,提出LunarFM多模态基础模型,融合多仪器观测学习通用表示,支持多种下游应用,还提供相关数据集、预训练模型等,助力月球表面高效分析。

Comments 19 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21802 2026-07-27 cs.RO cs.IR 新提交

StARS: Socially Appropriate Robot Actions via a Recommender System-Driven Approach

StARS:通过推荐系统驱动的方法实现社交适宜的机器人动作

Erencem Ozbey, Fethiye Irmak Dogan, Jin Huang, Hatice Gunes

机构 * Bogazici University(博阿齐奇大学) University of Cambridge(剑桥大学)

AI总结 研究人机交互中社交适宜动作生成问题,提出模型无关框架StARS,结合协同过滤与可学习场景表示生成用户特定适宜性得分,在多数据集评估中提升性能与一致性,支持个性化动作选择。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04268 2026-07-27 cs.LG physics.ao-ph 版本更新

Replacing Tunable Parameters in Weather and Climate Models with State-Dependent Functions using Reinforcement Learning

用强化学习替代天气和气候模型中的可调参数以状态依赖函数

Pritthijit Nath, Sebastian Schemm, Henry Moss, Peter Haynes, Emily Shuckburgh, Mark J. Webb

机构 * Department of Applied Mathematics and Theoretical Physics, University of Cambridge(剑桥大学应用数学与理论物理系) School of Mathematical Sciences, Lancaster University(兰卡斯特大学数学科学学院) Department of Computer Science and Technology, University of Cambridge(剑桥大学计算机科学与技术系) Met Office Hadley Centre(英国气象局哈德利中心)

AI总结 本文通过强化学习在线学习天气和气候模型中的参数方案,展示了在简化测试环境中,强化学习在气候偏差校正、辐射-对流平衡和纬向平均能量平衡模型中的应用,证明了强化学习在改进模型性能方面的有效性。

Comments 79 pages, 24 figures

Journal ref Journal of Advances in Modeling Earth Systems (JAMES) 18 (8), e2026MS005745

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21268 2026-07-24 cs.MA cs.AI econ.GN q-fin.EC 新提交

pAI-Econ-claude: A Gated Human-in-the-Loop Multi-Agent Architecture for AI-Assisted Economic Theory Development

pAI-Econ-claude:用于人工智能辅助经济理论发展的门控人在回路多智能体架构

Chen Zhu, Xiaolu Wang, Weilong Zhang

机构 * China Agricultural University(中国农业大学) University of Cambridge(剑桥大学)

AI总结 研究针对经济学等领域中基于大语言模型智能体输出缺乏正确性信号的可靠性问题,提出pAI-Econ-claude门控人在回路多智能体架构,经实验评估,该架构能提高可审计性,证明不可逆人类判断分配比纯智能体自主性更具信息性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20540 2026-07-24 cs.LG cs.AI 新提交

From Atoms to Entropy: Optimal Noise Allocation for Diffusion Training in the Convex Regime

从原子到熵:凸域中扩散训练的最优噪声分配

Luca Ambrogioni, Giulio Franzese, Alberto Foresti, Gabriel Raya, Bac Nguyen, Georgios Batzolis, Yuhta Takida, Naoki Murata, Chieh-Hsin Lai, Yuki Mitsufuji

机构 * Radboud University(拉德堡德大学) EURECOM(欧洲电信系统研究所) Tilburg University(蒂尔堡大学) Sony AI(索尼人工智能公司) University of Cambridge(剑桥大学) Sony Group Corporation(索尼集团公司)

AI总结 研究扩散模型训练时噪声水平分配问题,开发通用统计框架,在不同 regime 下得出最优分配结论,并通过实验验证,平方根熵调度能提升离散域训练效率且在连续图像上有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20519 2026-07-24 cs.LG 新提交

Adaptive Depth in Looped Transformers: Diagnosing Learned Halting Gates and Trajectory Readouts

循环变换器中的自适应深度:诊断学习到的停止门和轨迹读出

Andrei Cristian Popescu, Haitz Sáez de Ocáriz Borde, Pietro Liò

机构 * University of Cambridge(剑桥大学)

AI总结 研究循环变换器中自适应深度,通过轨迹——读出视角,涵盖合成任务与大规模检查点。发现固定先验深度监督可产生有益轨迹,简单读出表现良好,拟合冻结轨迹定位失败原因,Ouro评估有类似情况,重新定义自适应深度为联合问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19352 2026-07-23 cs.HC cs.CY cs.MM cs.SD 新提交

Validating the Single Item Kawaii Measure

验证单项卡哇伊度量

Katie Seaborn, Yijia Wang

机构 * University of Cambridge(剑桥大学) Institute of Science(科学研究院) Tokyo Institute of Technology(东京技术大学)

AI总结 研究测量用户对卡哇伊感知的问题,通过九个数据集对单项度量进行收敛、已知群体和跨情境效度及信度检验,证明了其在声音和视觉卡哇伊感知方面效度的初步证据,并指出可进一步提高严谨性。

Comments Accepted at CUI '26 (Short Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19750 2026-07-23 hep-ex cs.LG 新提交

Machine Can Automatically Discover Parametric Functions to Model HEP Data

机器可自动发现参数函数以对高能物理数据建模

Ho Fung Tsoi, Dylan Rankin, Cecile Caillol, Miles Cranmer, Sridhara Dasu, Javier Duarte, Philip Harris, Elliot Lipeles

机构 * University of Pennsylvania, USA(宾夕法尼亚大学) European Organization for Nuclear Research (CERN), Switzerland(欧洲核子研究中心) University of Cambridge, UK(剑桥大学) University of Wisconsin-Madison, USA(威斯康星大学麦迪逊分校) University of California San Diego, USA(加州大学圣地亚哥分校) Massachusetts Institute of Technology, USA(麻省理工学院) Institute for Artificial Intelligence(人工智能研究所)

AI总结 研究高能物理数据分析中为分箱数据找合适函数建模的问题,核心方法是用符号回归实现自动化,主要贡献是展示SymbolFit软件包,在双喷注谱演示中取得良好效果,如生成众多拟合函数,部分运行重新发现已用函数。

Comments 6 pages. to be presented at ICHEP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10216 2026-07-23 cs.CL 版本更新

The Impact of Editorial Intervention on Detecting Native Language Traces

编辑干预对检测母语痕迹的影响

Ahmet Yavuz Uluslu, Mark Gales, Kate Knill, Gerold Schneider

机构 * University of Cambridge(剑桥大学) University of Zurich(苏黎世大学)

AI总结 本文研究了编辑干预对母语识别鲁棒性的影响,发现深层母语特征在轻微编辑中仍能保持,而流畅性编辑和改写会显著降低识别性能。

Comments KONVENS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00462 2026-07-23 cs.CV cs.AI 版本更新

LatentLens: Revealing Highly Interpretable Visual Tokens in LLMs

LatentLens: 揭示大语言模型中高度可解释的视觉标记

Benno Krojer, Shravan Nayak, Oscar Mañas, Vaibhav Adlakha, Desmond Elliott, Siva Reddy, Marius Mosbach

机构 * University of Cambridge(剑桥大学)

AI总结 提出 LatentLens 方法,通过将视觉标记与文本语料库中的上下文标记表示进行最近邻匹配,实现视觉标记的可解释性,发现大多数视觉标记在各层均具有可解释性。

Comments ICML 2026 (Camera Ready)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04539 2026-07-23 q-bio.NC cs.LG 版本更新

Geometry-Guided Generative Representation for Functional Brain Graphs

功能脑图的几何引导生成表示

Subati Abulikemu, Tiago Azevedo, Michail Mamalakis, John Suckling

机构 * University of Cambridge(剑桥大学)

AI总结 研究针对网络神经科学中功能脑图表征问题,用图变换器自动编码器,结合特定领域功能梯度几何,无监督学习紧凑脑图表示,能分离认知状态、解码视觉刺激,还可生成合成脑图。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19237 2026-07-22 cs.LG 新提交

DBMol: Design of High-Affinity, Target-Specific Small Molecules through Structure Prediction Models

DBMol:通过结构预测模型设计高亲和力、靶向特异性小分子

Yiming Qin, Kai Yi, Miruna Cretu, Sjors H. W. Scheres, Pietro Liò, Pascal Frossard

机构 * EPFL(洛桑联邦理工学院) MRC-LMB(医学研究委员会分子生物学实验室) University of Cambridge(剑桥大学)

AI总结 研究旨在利用结构预测模型设计高亲和力小分子。核心方法是引入DBMol框架,经交替优化和投影过程,结合结构预测模型优化分子。主要贡献是有效优化亲和力代理,提高口袋覆盖率,保持分子多样性,在无参考配体监督下有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18877 2026-07-22 cs.LG 新提交

Physics-Informed Super-Resolution of Atmospheric Data

大气数据的物理信息超分辨率

Chang Xu, Gencer Sumbul, Hugo Porta, Manon Béchaz, Sebastian Schemm, Devis Tuia

机构 * EPFL(洛桑联邦理工学院) University of Cambridge(剑桥大学)

AI总结 针对全球变暖下大气数据超分辨率问题,提出基于原始方程的PISR方法及NPC度量,通过约束SR模型遵循物理方程,实验表明该方法能提升重建保真度,增强极端事件检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18239 2026-07-22 cs.AI 新提交

SysAdmin: Measuring Instrumental Power-Seeking in Frontier AI

SysAdmin:衡量前沿人工智能中工具性权力寻求行为

Mana Azarm, Qiyao Wei, Rahul Nambiar

机构 * University of San Francisco(旧金山大学) University of Cambridge(剑桥大学) Propensity Labs(倾向实验室)

AI总结 该研究引入SysAdmin基准,把前沿语言模型设为Linux沙盒中的系统管理员,从五个维度衡量其权力寻求倾向,评估七个前沿模型,发现当前模型自发权力寻求行为少,但有其他失败模式,阳性对照验证了测量敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14480 2026-07-22 cs.CL 版本更新

Lower-Resource, Higher Scores: Language Bias in LLM Evaluators

语言模型评估器在不同语言间存在偏差

Ej Zhou, Lucas Resck, Zheng Hui, Anna Korhonen

机构 * University of Cambridge(剑桥大学) Language Technology Lab(语言技术实验室)

AI总结 研究发现语言模型评估器在多语言环境中存在偏差,不同语言评分差异显著,与语言资源水平相关,成对准确率无法检测到这些偏差,还探究了资源少的语言得分高的原因,揭示了语言层面的结构错位。

详情

展开后加载摘要…

URL PDF HTML 收藏