Equilibrium Reasoners: Learning Attractors Enables Scalable Reasoning
平衡推理器:学习吸引子使推理可扩展
机构 * CMU(卡内基梅隆大学)
AI总结 本文提出平衡推理器(EqR),通过学习任务条件的吸引子来实现可扩展推理,该方法在测试时无需外部验证器或任务特定先验,通过增加深度和广度实现推理能力的提升,从而在Sudoku-Extreme上将准确率从2.6%提升至超过99%。
Comments ICML 2026
高校专区
平衡推理器:学习吸引子使推理可扩展
机构 * CMU(卡内基梅隆大学)
AI总结 本文提出平衡推理器(EqR),通过学习任务条件的吸引子来实现可扩展推理,该方法在测试时无需外部验证器或任务特定先验,通过增加深度和广度实现推理能力的提升,从而在Sudoku-Extreme上将准确率从2.6%提升至超过99%。
Comments ICML 2026
流映射语言模型:通过连续去噪实现一步语言建模
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文提出了一种基于连续流的流映射语言模型,通过在one-hot token嵌入上构建连续流,实现了在质量和速度上优于离散扩散模型的性能,展示了连续流在离散模态生成建模中的潜力。
Comments 58 pages, 40 figures
检索增强的代码生成:聚焦于仓库级方法的综述
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Chinese University of Hong Kong(香港中文大学) ; Southern University of Science and Technology(南方科技大学)
AI总结 本文综述了检索增强的代码生成方法,重点探讨仓库级方法,分析了其在大规模代码生成中的挑战与解决方案,总结了现有方法的分类框架及关键挑战。
基于成对模态的多模态大语言模型
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文提出了一种基于成对模态训练多模态大语言模型的方法,通过理论分析和表示学习框架,实现了跨模态对齐和重构,提升了模型的跨模态性能。
因果与传统表征学习之间的对话:在统一框架中实现相互受益
机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎伊德·本·扎耶德人工智能大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文探讨了因果表征学习与传统表征学习之间的对话,提出统一框架,通过任务组件和约束组件相互促进发展,实验表明因果约束的有效性依赖于所配的任务。
JobArabi: 一个阿拉伯语语料库及来自社交媒体的招聘公告分析
机构 * Northwestern University in Qatar(卡塔尔诺维克大学) ; Carnegie Mellon University in Qatar(卡塔尔卡内基梅隆大学)
AI总结 本文介绍了JobArabi,一个从2024年1月至2025年10月期间收集的阿拉伯语招聘公告语料库,包含20,528条来自X平台的公开帖子,旨在分析阿拉伯语在线社区中的就业相关话语,揭示社交媒体在劳动力市场沟通和语言变化研究中的潜力。
Comments Accepted at LREC 2026 Main Conference
干预的幻觉:你的LLM模拟实验实际上是一个观察性研究
机构 * Google DeepMind(谷歌DeepMind) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文探讨了大型语言模型在模拟人类行为中的潜在作用,指出在LLM模拟的合成用户中进行干预可能引起潜在用户属性的意外变化,从而导致用户漂移,影响效果估计。本文提出了使用负对照结果来检测分布变化的方法,并通过调整角色描述以减少偏倚来缓解漂移问题。
基于潜在类比的组合转导用于离线目标条件强化学习
机构 * Department of Electrical and Computer Engineering and ASRI, Seoul National University(电气与计算机工程系和首尔国立大学ASRI) ; Independent researcher(独立研究者) ; Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)
AI总结 本文提出了一种基于潜在类比的组合转导方法,用于解决离线目标条件强化学习中面对新情境时的目标泛化问题,通过引入新的类比表示方法,提升了在不同情境下的目标达到能力。
Comments ICML 2026
MoRe:模块化表示用于序列数据的原理化持续表示学习
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
AI总结 本文提出MoRe框架,通过模块化表示方法实现序列数据的原理化持续学习,其核心贡献是通过分解知识为可识别的模块层级,实现模块的重用、对齐和扩展,从而在保持旧模块的同时提升模型的可塑性和稳定性。
何时重新承诺:为长时间视觉-语言推理发现时间抽象
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文提出了一种可学习的状态条件化承诺深度方法,用于长时间视觉-语言推理任务,通过动态调整承诺深度,提高了求解率并减少了基本动作数量,优于固定深度基线和现有模型。
WestWorld: 一种知识编码的可扩展轨迹世界模型用于多样化机器人系统
机构 * Georgia Institute of Technology(佐治亚理工学院) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Carnegie Mellon University(卡内基梅隆大学) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
AI总结 本文提出WestWorld,一种知识编码的可扩展轨迹世界模型,用于多样化机器人系统,通过引入系统感知的混合专家(Sys-MoE)和结构嵌入来提升可扩展性和零样本泛化能力,实现了在多种机器人环境中的高效轨迹预测和控制。
Comments ICML 2026 spotlight
JanusCoder: 向代码智能的视觉-程序化界面迈进
机构 * The University of Hong Kong(香港大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Nanjing University(南京大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Shanghai Innovation Institute(上海创新研究院)
AI总结 本文提出JanusCoder,一种面向代码智能的视觉-程序化界面,通过构建大规模多模态代码数据集和统一模型,实现从文本指令、视觉输入或两者结合生成代码,展示了其在文本和视觉编程任务中的优越性能。
Comments ICLR 2026 Camera Ready Version, with code and data available
InteractScience: 交互式科学演示代码生成的程序化与视觉导向评估
机构 * State Key Laboratory for Novel Software Technology, Nanjing University, Nanjing, China(新型软件技术国家重点实验室,南京大学,中国南京) ; Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,中国上海) ; Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学,美国匹兹堡)
AI总结 本文提出InteractScience基准,用于评估大语言模型在生成交互式科学演示代码时结合科学知识与前端交互能力的综合表现,通过程序化测试和视觉测试相结合的方法,评估30种开源和闭源LLM的表现,揭示了在整合领域知识与交互前端编码方面的持续不足。
Comments 27 pages, 17 figures
通过言语反馈强化人类行为模拟
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Microsoft(微软)
AI总结 本文提出DITTO模型,通过将言语反馈作为强化学习中的首要信号来提升LLM模拟人类行为的能力,并引入SOUL基准测试平台,展示了在多个任务中显著提升性能的成果。
AgentCo-op: 基于检索的互操作多智能体工作流合成
机构 * Ray and Stephanie Lane Computational Biology Department, School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院雷和斯蒂芬妮·兰德计算生物学系) ; Machine Learning Department, School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院机器学习系)
AI总结 本文提出AgentCo-op,一种基于检索的多智能体工作流合成框架,通过类型化任务传递合成可执行工作流,并在执行证据表明失败时应用有界自引导局部修复。在两个开放世界基因组学案例研究中,AgentCo-op在不重设计或运行全局拓扑搜索的情况下,将独立开发的科学智能体和外部工具库整合到可审计的工作流中。
基于得分的潜在变量因果模型因果发现
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of California, San Diego(加州大学圣地亚哥分校) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
AI总结 本文提出了一种基于得分的方法,用于识别包含因果相关潜在变量的因果结构,并提供了可识别性保证,同时通过实验验证了方法的有效性。
Comments ICML 2024
反思式X训练:反馈条件化提升跨所有LLM训练阶段的扩展性
机构 * NVIDIA ; University of Washington(华盛顿大学) ; Carnegie Mellon University(卡内基梅隆大学) ; UC San Diego(南加州大学)
AI总结 本文提出反思式训练(IXT),通过利用后续阶段的动态来改进早期阶段,从而提高LLM训练的扩展效率,实验表明该方法在计算效率和性能上均有显著提升。
TorchUMM: 一个用于评估、分析和训练后处理的统一多模态模型代码库
机构 * Carnegie Mellon University(卡内基梅隆大学) ; William & Mary(威廉与玛丽学院) ; Auburn University(阿肯色大学欧文分校) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
AI总结 本文提出TorchUMM,一个统一的多模态模型代码库,用于评估、分析和训练后处理,涵盖多种多模态模型架构、任务和数据集,通过统一接口和标准化评估协议,促进异构模型的公平比较和深入理解,推动更强大的统一多模态系统的发展。
Comments Technical Report