A Mechanistic Analysis of Looped Reasoning Language Models
循环推理语言模型的机理分析
机构 * University of Oxford(牛津大学) ; Mila – Quebec AI Institute(魁北克AI研究所)
AI总结 本文分析了循环推理语言模型中潜在状态的机理,揭示了循环块在潜在空间中的稳定轨迹及注意力头行为的稳定特性。
Comments 39 pages, 63 figures
高校专区
循环推理语言模型的机理分析
机构 * University of Oxford(牛津大学) ; Mila – Quebec AI Institute(魁北克AI研究所)
AI总结 本文分析了循环推理语言模型中潜在状态的机理,揭示了循环块在潜在空间中的稳定轨迹及注意力头行为的稳定特性。
Comments 39 pages, 63 figures
由视觉强化学习实现的自主衍射测量
机构 * Jeremiah Horrocks Institute for Mathematics, Physics and Astronomy, University of Central Lancashire(中央兰开夏大学杰里迈亚·霍罗克斯数学、物理与天文研究所) ; Department of Physics, Clarendon Laboratory, University of Oxford(牛津大学克拉伦登实验室物理系) ; State Key Laboratory of Surface Physics and Department of Physics, Fudan University(复旦大学表面物理国家重点实验室和物理系) ; Department of Physics, The Chinese University of Hong Kong(香港中文大学物理系) ; State Key Laboratory of Quantum Information Technologies and Materials, The Chinese University of Hong Kong(香港中文大学量子信息与材料国家重点实验室)
AI总结 本文提出一种无需晶体学知识的自主系统,利用强化学习从劳厄衍射图中自动对齐单晶体,提升材料科学自动化实验流程的能力。
Comments 20 pages, 16 figures
双控频率感知扩散模型用于深度依赖光学微机器人显微图像生成
机构 * Department of Bioengineering, Imperial-X AI Initiative, Imperial College London(帝国理工学院生物工程系、Imperial-X人工智能计划) ; CAMS-Oxford Institute, University of Oxford(牛津大学CAMS-Oxford研究所)
AI总结 本文提出Du-FreqNet,通过双控频率感知扩散模型生成物理一致的显微图像,提升微机器人自主操作的3D感知能力,改进SSIM并增强下游任务性能。
微调如你预训练:提升视觉语言模型零样本对抗鲁棒性
机构 * University of Trento(特伦托大学) ; Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会) ; Xi’an Jiaotong University(西安交通大学) ; University of Oxford(牛津大学)
AI总结 本文提出AdvFLYP方法,通过遵循CLIP预训练过程的训练配方,利用网络上收集的图像-文本对生成对抗样本,并通过对比损失匹配文本,提升视觉语言模型的零样本对抗鲁棒性。
Comments Accepted to CVPR Findings Track 2026
ComSim:通过组合模拟构建可扩展的现实世界机器人数据生成
机构 * CUHK-Shenzhen(香港中文大学(深圳)) ; Sun Yat-sen University(中山大学) ; Shanghai Jiao Tong University(上海交通大学) ; USTC(中国科学技术大学) ; The University of Hong Kong(香港大学) ; University of Oxford(牛津大学) ; Harvard University(哈佛大学)
AI总结 本文提出Compositional Simulation方法,结合经典模拟与神经模拟生成准确的动作-视频对,通过闭环数据增强管道生成大规模高质量训练数据,减少仿真到现实的域差距,提升现实环境中的政策模型性能。
Comments 14 pages, 8 figures, 4 tables; supplementary material included; Project page: https://faceong.github.io/ComSim/
仲裁失败,而非感知失明:视觉-语言模型如何解决视觉-语言冲突
机构 * Institute of Computer Science, Zurich University of Applied Sciences(苏黎世应用科技大学计算机科学研究所) ; University of Oxford(牛津大学)
AI总结 研究探讨视觉-语言模型在视觉与语言冲突中的仲裁机制,发现编码与基础的脱节,通过多模态仲裁交叉分析揭示视觉属性在早期层可线性解码,最终层logit与基础结果相关性达0.847,表明需针对性干预提升视觉基础能力。
AIRA_2:克服人工智能研究代理中的瓶颈
机构 * FAIR at Meta(Meta FAIR) ; University College London(伦敦大学学院) ; University of Oxford(牛津大学)
AI总结 AIRA_2通过异步多GPU工作池、隐藏一致性评估协议和ReAct代理解决AI研究代理的三个性能瓶颈,提升搜索性能。
SimBench:大型语言模型模拟人类行为能力的基准测试
机构 * University of Cambridge(剑桥大学) ; Stanford University(斯坦福大学) ; Bocconi University(博科尼大学) ; University of Oxford(牛津大学)
AI总结 SimBench通过统一20个多样化的数据集,评估大型语言模型模拟人类行为的 fidelity,发现模型性能与模型大小呈对数线性关系,但与计算资源无关,且存在指令微调与模拟准确性之间的权衡。
Comments Accepted at ICLR 2026. Project Website: http://simbench.tiancheng.hu/ Data: https://huggingface.co/datasets/pitehu/SimBench
WBCBench 2026:在类别不平衡下的白血球分类挑战
机构 * University of Oxford(牛津大学) ; University College London(伦敦大学学院) ; University of Bristol(布里斯托大学) ; Chulalongkorn University(朱拉隆功大学)
AI总结 本文提出WBCBench 2026挑战,旨在测试算法在13种细粒度白血球类别严重不平衡、患者级数据分离和合成域偏移下的鲁棒性,采用标准化数据集和评估指标。
Comments IEEE International Symposium on Biomedical Imaging (ISBI)
代理业务流程管理:一项研究宣言
机构 * Free University of Bozen-Bolzano(博尔扎诺自由大学) ; University of Oxford(牛津大学) ; University of Tartu(塔尔图大学) ; IBM Research(IBM研究院) ; Umeå University(于默奥大学) ; paluno (Ruhr Institute for Software Technology), University of Duisburg Essen(帕卢诺(鲁尔软件技术研究所),杜伊斯堡-埃森大学) ; University of Ottawa(渥太华大学) ; German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) ; Saarland University(萨尔大学) ; The University of Melbourne(墨尔本大学) ; TUM School of Computation, Information, and Technology, TU Munich(慕尼黑工业大学计算、信息与技术学院) ; RMIT University(皇家墨尔本理工大学) ; Meta ; University of St. Gallen(圣加仑大学)
AI总结 本文提出了一项宣言,阐述了代理业务流程管理(APM)的概念基础,即一种扩展业务流程管理(BPM)以管理组织中自主代理执行流程的框架。APM代表了一种管理范式转变,从传统的业务流程视角转向以代理为导向的抽象,其中软件和人类代理作为主要功能实体,在显式流程框架内感知、推理和行动。
Comments 34 pages, 1 figure
从视频基础模型推断动态物理性质
机构 * VGG, University of Oxford(牛津大学VGG实验室) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 本文研究通过视频预测动态物理性质,提出新数据集和三种推断方法,展示视频基础模型与多模态大语言模型的性能对比。
学习颜色等变表示
机构 * Princeton University(普林斯顿大学) ; University of Oxford(牛津大学)
AI总结 本文提出颜色等变图卷积神经网络,解决颜色变化下的等变问题,通过提升等变性并扩展到饱和度和亮度变化,提升模型泛化能力和样本效率。
Comments Accept to The 13th International Conference on Learning Representations (ICLR 2025)
CircuitSynth:可靠的合成数据生成
机构 * University of Oxford(牛津大学) ; TU Wien(维也纳工业大学)
AI总结 CircuitSynth提出了一种新的神经符号框架,通过将语义推理与表层实现解耦,结合概率句法决策图和凸优化机制,实现高保真合成数据生成,确保逻辑约束和分布目标。
Comments 11 Pages
Jamendo-MT-QA:多轨比较音乐问答基准测试
机构 * Yonsei University(延世大学) ; KRAFTON ; University of Oxford(牛津大学) ; George Mason University(乔治梅森大学) ; Sungkyul University(圣洁大学) ; MODULABS MAAP ; Onoma AI
AI总结 本文提出Jamendo-MT-QA基准测试,用于评估多轨比较音乐问答能力,基于Jamendo-QA数据集构建36519个比较问答项,采用LLM辅助生成和过滤问题,并通过自动指标和LLM-as-a-Judge评估模型性能。
Comments ACL 2026 Findings