ErrorMap and ErrorAtlas: Charting the Failure Landscape of Large Language Models
误差图与误差图谱:大型语言模型失败景观的绘制
机构 * IBM Research(IBM研究院) ; Stanford University(斯坦福大学) ; MIT(麻省理工学院)
AI总结 ErrorMap和ErrorAtlas通过分析LLM失败原因,揭示模型弱点,为模型改进和评估提供更深入的洞察。
高校专区
误差图与误差图谱:大型语言模型失败景观的绘制
机构 * IBM Research(IBM研究院) ; Stanford University(斯坦福大学) ; MIT(麻省理工学院)
AI总结 ErrorMap和ErrorAtlas通过分析LLM失败原因,揭示模型弱点,为模型改进和评估提供更深入的洞察。
通过分子集体变量增强扩散采样
机构 * FAIR at Meta(Meta的FAIR) ; MIT(麻省理工学院) ; University of Geneva(日内瓦大学) ; ETH Zurich(苏黎世联邦理工学院)
AI总结 通过引入集体变量的偏置,提升扩散采样在分子采样中的效率和模式发现能力,首次实现反应采样的高精度模拟。
尺度不变的遗憾匹配与最优收敛的在线学习:在零和博弈中弥合理论与实践的鸿沟
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文提出了一种新的尺度不变且参数无关的PRM+变体IREG-PRM+,实现了最优收敛并优于现有方法,同时扩展了零和博弈到更广泛的变分不等式问题。
Comments Compared to the previous version, this version includes new results on harmonic games and extensive-form games. Abstract abridged due to arXiv length constraints
从几何先验中学习可转移的反应路径
机构 * Department of Materials Science and Engineering, Massachusetts Institute of Technology, Cambridge, Massachusetts 02139, United States(材料科学与工程系,麻省理工学院) ; Department of Mathematics, Massachusetts Institute of Technology, Cambridge, Massachusetts 02139, United States(数学系,麻省理工学院) ; Computational and Systems Biology Program, Massachusetts Institute of Technology, Cambridge, Massachusetts 02139, United States(计算与系统生物学计划,麻省理工学院)
AI总结 本文提出MEPIN方法,通过几何先验和对称性破缺神经网络,高效预测化学反应路径,适用于多种化学反应。
Comments 14 pages, 6 figures; Supporting Information in ancillary files
强大的ToRR:表格推理与鲁棒性基准
机构 * IBM Research(IBM研究院) ; Bar-Ilan University(巴伊兰大学) ; Stanford University(斯坦福大学) ; MIT(麻省理工学院)
AI总结 ToRR基准通过评估模型在不同表格格式和提示下的表现,揭示了表格推理任务中模型的鲁棒性问题,强调多格式测试对评估模型能力的重要性。
自动发现奖励模型偏差
机构 * Massachusetts Institute of Technology(麻省理工学院)
AI总结 本文提出了一种利用LLM自动发现奖励模型偏差的方法,揭示了已知和新型偏差,并展示了进化迭代优于传统搜索方法。
NeuroChat: 一种基于神经适应的AI聊天机器人,用于定制学习体验
机构 * MIT Media Lab(麻省理工学院媒体实验室) ; Brown University(布朗大学)
AI总结 NeuroChat通过整合实时EEG反馈与生成式AI,实现学习者认知状态的动态适应,提升学习参与度。
Comments 21 pages, 7 figures, 2 tables
Journal ref CUI '25: Proceedings of the 7th ACM Conference on Conversational User Interfaces, July 8-10, 2025
通过规范化的扩散模型重新思考对称性:应用于分子图生成
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Zhejiang University(浙江大学) ; Peking University(北京大学) ; Georgia Institute of Technology(佐治亚理工学院) ; Princeton University(普林斯顿大学) ; University of California, San Diego(加州大学圣地亚哥分校)
AI总结 本文提出通过规范化的扩散模型生成分子图,利用几何谱和位置编码提升生成效果,优于等变基线方法。
Comments 32 pages
PhyScensis: 基于物理的LLM代理用于复杂物理场景布置
机构 * UMass Amherst(马萨诸塞大学阿姆赫斯特分校) ; Genesis AI ; MIT(麻省理工学院) ; MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)
AI总结 PhyScensis通过物理引擎驱动的LLM代理框架,生成复杂物理场景布局,提升机器人操作中的场景复杂性和物理准确性。
Comments ICLR 2026
通过自我蒸馏进行强化学习
机构 * ETH Zurich(苏黎世联邦理工学院) ; Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ; MIT(麻省理工学院) ; Stanford(斯坦福大学)
AI总结 通过自我蒸馏策略优化(SDPO)提升强化学习在可验证环境中的样本效率和准确性,利用自身反馈改进策略。
超越显而易见:一种无梯度框架,揭示视觉不变性的隐藏景观
机构 * Neuroscience Area, International School for Advanced Studies (SISSA), Trieste (Italy)(国际先进研究学院(SISSA)神经科学部门,特里埃斯蒂(意大利)) ; Boston Children’s Hospital, Harvard Medical School, Boston (USA)(哈佛医学院波士顿儿童医院,波士顿(美国)) ; Center for Brains, Minds, and Machines, MIT, Cambridge (USA)(麻省理工学院大脑、心智与机器中心,剑桥(美国)) ; Harvard-MIT Program in Health Sciences and Technology, MIT, Cambridge (USA)(哈佛-麻省理工学院健康科学与技术项目,麻省理工学院,剑桥(美国))
AI总结 本文提出SnS框架,通过无梯度方法揭示视觉单元的不变性及对抗敏感性,发现深层表示的伸展会降低模型可解释性。
Comments 33 pages, 15 figures, Accepted as a conference paper at ICLR 2026
构建用于科学领域异常检测的机器学习挑战
机构 * The Ohio State University(俄亥俄州立大学) ; University of Washington(华盛顿大学) ; MIT(麻省理工学院) ; Lawrence Berkeley National Laboratory(伯克利国家实验室) ; Duke University(杜克大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Maryland Baltimore County(马里兰大学巴尔的摩县分校) ; University of Colorado, Boulder(科罗拉多大学博尔德分校) ; University of Minnesota(明尼苏达大学) ; Princeton University(普林斯顿大学) ; University of Arkansas for Medical Sciences(亚拉巴马医学科学大学) ; University of Zürich(苏黎世大学)
AI总结 本文提出三个跨学科数据集,旨在开发基于机器学习的异常检测方法,以推动科学发现。
Comments 17 pages 6 figures to be submitted to Nature Communications
迈向基于空间转录组的病理基础模型
机构 * Department of Pathology, Mass General Brigham, Harvard Medical School, Boston, MA, USA(病理学系,马萨诸塞州总医院与哈佛医学院,波士顿,马萨诸塞州,美国) ; Department of Computer Science & Technology, University of Cambridge, Cambridge, UK(计算机科学与技术系,剑桥大学,剑桥,英国) ; Cancer Program, Broad Institute of Harvard and MIT, Cambridge, MA, USA(癌症计划,哈佛与麻省理工联合学院,剑桥,马萨诸塞州,美国) ; Data Science Program, Dana-Farber Cancer Institute, Boston, MA, USA(数据科学计划,达纳-法伯癌症研究所,波士顿,马萨诸塞州,美国) ; Harvard-MIT Division of Health Sciences and Technology, Massachusetts Institute of Technology, Cambridge, MA, USA(哈佛-麻省理工健康科学与技术 division,麻省理工学院,剑桥,马萨诸塞州,美国) ; Télécom Paris, Institut Polytechnique de Paris, Paris, France(巴黎电信学院,巴黎理工学院,巴黎,法国) ; Harvard Data Science Initiative, Harvard University, Cambridge, MA, USA(哈佛大学数据科学倡议,哈佛大学,剑桥,马萨诸塞州,美国)
AI总结 SEAL通过整合局部分子信息提升病理基础模型性能,实现跨模态应用与领域泛化。
GSRM:生成式语音奖励模型用于语音强化学习反馈机制
机构 * Meta Superintelligence Labs(Meta超智能实验室) ; Massachusetts Institute of Technology(麻省理工学院) ; Arizona State University(亚利桑那州立大学) ; University of Southern California(南加州大学)
AI总结 GSRM通过生成式语音奖励模型提升语音生成的自然度,利用可解释的推理链实现更准确的自然度评估。
环境物理:通过部分观测训练神经PDE求解器
机构 * The University of Edinburgh, Edinburgh, Scotland(爱丁堡大学) ; Massachusetts Institute of Technology, Cambridge, Massachusetts, United States(麻省理工学院)
AI总结 环境物理通过部分观测直接学习PDE系数-解对的联合分布,显著提升重建性能并减少计算成本。
基于条件高斯过程的集成方法(Ens-CGP):表示、几何与推断
机构 * Earth Signals and Systems Group(地球信号与系统组) ; Earth, Atmospheric and Planetary Sciences(地球、大气与行星科学) ; Massachusetts Institute of Technology(麻省理工学院)
AI总结 本文提出Ens-CGP,一种基于集成的条件高斯过程方法,通过将经验集成矩作为高斯先验进行精确条件化,为卡尔曼滤波等方法提供概率基础,并明确其与变分和集成视角的关系。
Comments 20 pages. Technical manuscrupt on representational equivalence between conditional Gaussian inference, quadratic optimization, and RKHS geometry in finite dimensions
离散共轭匹配
机构 * Massachusetts Institute of Technology(麻省理工学院) ; FAIR at Meta(Meta 的 FAIR)
AI总结 本文提出离散共轭匹配方法,用于微调离散生成模型,通过离散域上的共轭估计器解决熵正则化奖励优化问题。
Comments ICLR 2026
PRISMM-Bench: 一种基于同行评审的多模态不一致基准
机构 * Johannes Kepler University Linz(约翰内斯·开普勒大学林茨分校) ; Interdisciplinary Transformation University Austria(跨学科转型大学奥地利) ; MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) ; Stanford University(斯坦福大学) ; MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)
AI总结 PRISMM-Bench是首个基于同行评审标记的多模态不一致基准,通过整理384个不一致点,设计三个任务评估模型跨模态检测和推理能力,揭示了多模态科学推理的挑战。
Comments Accepted at ICLR 2026. Project page https://da-luggas.github.io/prismm-bench/
潜在去噪使分词器更有效
机构 * USC(美国南加州大学) ; MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) ; Google DeepMind(谷歌DeepMind) ; OpenAI
AI总结 本文提出通过潜在去噪目标优化分词器,提升生成模型的生成质量。
Comments Code is available at: https://github.com/Jiawei-Yang/DeTok
想法才是关键:评估前沿大语言模型在有害话题上的说服尝试
机构 * Université de Montréal, MILA(蒙特利尔大学,MILA) ; Carnegie Mellon University(卡内基梅隆大学) ; MIT, Center for Research and Teaching in Economics(麻省理工学院,经济研究与教学中心) ; Cornell University, University of Regina(康奈尔大学, Regina大学) ; Cornell University, MIT(康奈尔大学,麻省理工学院)
AI总结 本文提出APE基准测试,评估前沿大语言模型在有害话题上的说服意愿,揭示模型在有害情境下尝试说服的倾向及风险。
RAVENEA:多模态检索增强视觉文化理解的基准
机构 * University of Copenhagen(哥本哈根大学) ; ETH Zürich(苏黎世联邦理工学院) ; University of Amsterdam(阿姆斯特丹大学) ; University of Cambridge(剑桥大学) ; Massachusetts Institute of Technology(麻省理工学院) ; Singapore University of Technology and Design(新加坡科技设计大学) ; Singapore Management University(新加坡管理大学)
AI总结 RAVENEA通过多模态检索增强方法提升视觉文化理解,验证了文化注释对多模态检索和下游任务的增强效果,并揭示了不同国家间性能差异。
Comments ICLR 2026; Project page: https://jiaangli.github.io/ravenea/
少即是多:通过偏好数据选择改进大语言模型对齐
机构 * University of Science and Technology of China(中国科学技术大学) ; Peking University(北京大学) ; Massachusetts Institute of Technology(麻省理工学院) ; Alibaba Cloud Computing(阿里云计算) ; MoE Key Lab of BIPC, University of Science and Technology of China(中国科学技术大学MoE关键实验室)
AI总结 通过改进偏好数据选择策略,提升大语言模型对齐效果,实验显示在较少数据下实现显著性能提升。
人工智能监管中的内部部署缺口
机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)
AI总结 本文研究了人工智能监管在内部部署中的缺口,指出监管框架在处理内部系统时存在的三个关键问题,并提出解决方法及权衡。
ParoQuant: 基于成对旋转的量化方法用于高效推理大语言模型推理
机构 * NVIDIA ; MIT(麻省理工学院) ; UC San Diego(加州大学圣地亚哥分校)
AI总结 ParoQuant通过结合硬件高效旋转与通道缩放,有效解决推理LLMs中的异常值问题,实现更高的准确性和更低的开销。
Comments ICLR 2026 | Project page: https://paroquant.z-lab.ai | GitHub: https://github.com/z-lab/paroquant
使用镜像映射组合改进在线镜像下降的后悔保证
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Carnegie Mellon University(卡内基梅隆大学) ; Georgia Institute of Technology(佐治亚理工学院)
AI总结 本文提出通过组合镜像映射改进在线镜像下降的后悔保证,展示基于块范数的镜像映射在稀疏损失函数中取得多项式级别的后悔改进。
ForeAct: 通过高效的视觉前瞻性规划控制您的VLA
机构 * MIT(麻省理工学院) ; NVIDIA(英伟达) ; Caltech(加州理工学院)
AI总结 ForeAct通过高效的视觉前瞻性规划提升VLA在开放环境中的执行精度与泛化能力。
MaskInversion: 通过可解释性图的优化生成局部嵌入
机构 * Tuebingen AI Center University of Tuebingen(图宾根人工智能中心 图宾根大学) ; University of Oxford(牛津大学) ; Meta ; MIT-IBM Watson AI Lab(麻省理工-IBM Watson人工智能实验室)
AI总结 MaskInversion通过优化可解释性图生成特定图像区域的嵌入,适用于多种视觉-语言任务。
Comments Project page: https://walidbousselham.com/MaskInversion
突破维度诅咒:现代向量检索的稳定性研究
机构 * MIT CSAIL, USA(麻省理工学院计算机科学与人工智能实验室) ; Argmax, Inc., USA(Argmax公司) ; Google DeepMind, USA(谷歌深Mind)
AI总结 本研究通过稳定性理论分析,揭示了现代向量检索在高维空间中克服维度诅咒的机制,并提出了三种检索场景下的稳定性条件与实验验证。
Comments 21 pages
LieAugmenter: 通过可学习的增强发现对称性实现等变学习
机构 * Technical University of Munich (School of CIT)(慕尼黑技术大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心) ; Munich Data Science Institute(慕尼黑数据科学研究所) ; MIT (Department of EECS and CSAIL)(麻省理工学院)
AI总结 LieAugmenter通过可学习增强发现任务相关连续对称性,实现等变学习,提升图像分类、N体动力学和分子性质预测性能,并提供对称性缺失的可解释签名。
人工智能在粒子、核物理和天体粒子物理中的战略白皮书:来自JENA和EuCAIF的洞察
机构 * IMAPP, Radboud University, Nijmegen, The Netherlands ; Nikhef, Science Park, Amsterdam, The Netherlands ; Institute for Theoretical Physics, TU Wien, Wiedner Hauptstraße 8-10, 1040 Vienna, Austria ; Department of Physics, Swansea University, SA2 8PP, Swansea, United Kingdom ; HUN-REN Wigner Research Centre for Physics, 29--33 Konkoly--Thege Mikl\'os \'ut, H-1121 Budapest, Hungary ; University, Institute of Physics ; Astronomy Department (DIFA), Alma Mater Studiorum- Università di Bologna ,Italy ; University of Manchester, Oxford Road, M13 9PL, Manchester, United Kingdom ; Lule \, University of Technology, Laboratoriev\"agen 14, Lule , Sweden ; Laboratory for Nuclear Science, Massachusetts Institute of Technology (MIT), 77 Massachusetts Ave, Cambridge, MA 02139, USA ; Department of Physics, Sapienza Universit\`a di Roma ; Département de Physique Nucléaire et Corpusculaire, Université de Genève, Genève, Switzerland ; Physics Department, Technical University of Munich, 80233 Munich, Germany ; School of Physics ; Astronomy, University of Glasgow, G12 8QQ, United Kingdom ; Institute of Space Science - INFLPR Subsidiary, Atomistilor 409, 077125 Magurele, Ilfov county, Romania ; Physics Department, University of Warwick, Coventry CV4 7AL, United Kingdom ; Brunel University of London, Kingston Lane, UB8 3PH, Uxbridge, United Kingdon ; GRAPPA, Institute of Physics, University of Amsterdam, Science Park, Amsterdam, The Netherlands
AI总结 本白皮书探讨了AI在粒子、核物理和天体粒子物理中的应用挑战,提出关键基础设施需求、培训计划和资金策略,以推动AI在基础物理领域的应用发展。
Comments 19 pages, 5 figures
Journal ref Mach. Learn.: Sci. Technol. 7 013002 (2026)