Self-Improving Language Models with Bidirectional Evolutionary Search
具有双向进化搜索的自我改进语言模型
机构 * Harvard University(哈佛大学) ; MIT(麻省理工学院)
AI总结 提出双向进化搜索(BES)框架,通过前向候选进化与后向目标分解相结合,克服了传统搜索方法中稀疏验证信号和自回归扩展的局限,在训练后和推理时均显著提升语言模型性能。
高校专区
具有双向进化搜索的自我改进语言模型
机构 * Harvard University(哈佛大学) ; MIT(麻省理工学院)
AI总结 提出双向进化搜索(BES)框架,通过前向候选进化与后向目标分解相结合,克服了传统搜索方法中稀疏验证信号和自回归扩展的局限,在训练后和推理时均显著提升语言模型性能。
KT4EQG: 通过知识追踪实现个性化习题生成
机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校) ; University of South Alabama(南方大学) ; University of Michigan(密歇根大学) ; MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) ; Harvard University(哈佛大学)
AI总结 提出KT4EQG框架,利用知识追踪模型选择最合适的概念,并训练基于LLM的题目生成器,以生成个性化习题,实验证明其有效性。
基于Transformer的测度到测度回归
机构 * University of Alberta(阿尔伯塔大学) ; Alberta Machine Intelligence Institute(阿尔伯塔机器智能研究所) ; MIT(麻省理工学院) ; The Broad Institute of MIT and Harvard(MIT和哈佛大学Broad研究所)
AI总结 针对概率测度之间的映射学习问题,提出利用Transformer的测度依赖和平均场结构,实现静态和动态两种非线性测度到测度回归方法,并在合成实验、粒子系统和癌症治疗反应预测中验证其泛化能力。
将视频模型转化为通用机器人策略
机构 * MIT(麻省理工学院) ; CMU(卡内基梅隆大学) ; Amazon FAR(亚马逊公司)
AI总结 提出一种解耦的视频到动作策略VERA,利用无动作视频世界模型和基于机器人雅可比矩阵的逆动力学模型,实现跨本体的零样本机器人控制。
Comments project page: https://vera.csail.mit.edu
张量记忆:用于长程Transformer的固定大小循环状态
机构 * Massachusetts Institute of Technology, Cambridge, MA, USA(麻省理工学院) ; IBM Research, Cambridge, MA, USA(IBM研究院) ; University of Toronto, Toronto, Canada(多伦多大学)
AI总结 提出张量记忆模块,通过固定大小的3D循环张量状态增强Transformer,以解耦状态容量与输入长度,并保持空间归纳偏置,适用于长程视频理解。
Hurwitz四元数乘法量化用于KV缓存压缩
机构 * Massachusetts Institute of Technology, Cambridge, MA, USA(麻省理工学院) ; IBM Research, Cambridge, MA, USA(IBM研究院) ; University of Toronto, Toronto, Canada(多伦多大学)
AI总结 提出一种免校准的Hurwitz四元数乘法量化方法,通过将K/V的4元素块视为四元数并用量化乘积编码,在约5比特下匹配fp16困惑度,实现高达5.05倍KV缓存压缩。
基于信息论的心电图信号多模态表示学习
机构 * KU Leuven(库勒芬大学) ; University Hospitals Leuven(鲁文大学医院) ; MIT(麻省理工学院) ; DFKI(德国达姆施塔特研究所)
AI总结 提出MERIT框架,通过信息论视角结合掩码心电图建模与心电图-文本对比对齐,学习保留信号结构并整合临床语义的心电图表示,在分类、零样本和文本生成任务中取得一致提升。
利用智能体引导的树搜索自动化形式验证
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Department of Electrical Engineering and Computer Science(电气工程与计算机科学系)
AI总结 本文提出智能体引导的树搜索方法,通过状态和上下文两种编排器改进基于大语言模型的Lean形式验证代码生成性能,在基准测试中达到95.0%的通过率。
Comments 78 pages, 8 figures
MerLean-Prover:用于 Lean 4 定理证明的递归循环框架
机构 * Northeastern University(东北大学) ; Stony Brook University(石溪大学) ; Massachusetts Institute of Technology(麻省理工学院)
AI总结 提出一种基于递归循环框架的端到端 Lean4 定理证明器 MerLean-Prover,通过规划、检查与证明三种智能体协作,无需微调或定制强化学习,在 FormalQualBench 和 Putnam2025 上超越现有开源基线。
MathlibLemma: 形式化数学中的民间引理生成与基准测试
机构 * Department of Computer Science, University of Virginia(弗吉尼亚大学计算机科学系) ; Astronomy , California Institute of Technology(加州理工学院天文学系) ; Purdue University(普渡大学) ; Massachusetts Institute of Technology(麻省理工学院)
AI总结 提出基于LLM的模块化流水线MathlibLemma,自动挖掘、形式化并证明数学中缺失的民间引理,生成包含4028个类型检查的Lean语句的基准测试集。
HardNet++: 神经网络中的非线性约束强制执行
机构 * Massachusetts Institute of Technology(麻省理工学院)
AI总结 提出一种通过阻尼局部线性化迭代调整网络输出来强制执行线性和非线性等式与不等式约束的方法,并证明在正则条件下可达到任意精度,应用于非线性模型预测控制问题中实现紧约束满足且不损失最优性。
大型语言模型的结构化智能体蒸馏
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Harvard University(哈佛大学) ; MIT(麻省理工学院) ; Northeastern University(东北大学) ; Adobe Research(Adobe研究) ; National University of Singapore(新加坡国立大学) ; University of Georgia(佐治亚大学) ; Florida International University(佛罗里达国际大学)
AI总结 提出结构化智能体蒸馏框架,通过分段对齐推理和动作跨度,将大型语言模型智能体压缩为小型学生模型,在保持决策性能的同时降低推理成本。
Journal ref The 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)
重新评估不完美信息博弈的策略梯度方法
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) ; University of California, Berkeley(加州大学伯克利分校) ; Massachusetts Institute of Technology(麻省理工学院) ; Carnegie Mellon University(卡内基梅隆大学) ; NYU Tandon School of Engineering(纽约大学坦顿工程学院)
AI总结 通过实现五种大型博弈的精确可剥削性计算,对比发现基于虚构博弈、双预言机和反事实遗憾最小化的深度强化学习算法未能超越通用策略梯度方法(如PPO)。
Comments International Conference on Learning Representations (ICLR) 2026
通过注意力匹配实现快速KV压缩
机构 * Massachusetts Institute of Technology(麻省理工学院)
AI总结 提出通过注意力匹配在潜在空间快速压缩键值缓存的方法,以保持注意力输出并实现高达50倍压缩且质量损失小。
论口语语言模型评估中全局令牌困惑度的谬误
机构 * Carnegie Mellon University(卡内基梅隆大学) ; National Taiwan University(国立台湾大学) ; Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) ; Massachusetts Institute of Technology(麻省理工学院)
AI总结 针对口语语言模型评估中直接使用文本困惑度公式计算语音令牌困惑度的问题,提出基于似然和生成的新型评估方法,更忠实反映生成质量,并缩小了最佳模型与人类基线之间的差距。
扩散增强马尔可夫决策过程用于最大熵强化学习
机构 * Munich Institute of Robotics and Machine Intelligence (MIRMI), Technical University Munich(慕尼黑机器人与机器智能研究所(MIRMI),技术大学慕尼黑) ; Practical Project Student Exchange Program, Technical University Munich(技术大学慕尼黑实践项目学生交换计划) ; MIT World Peace University(MIT和平大学)
AI总结 本文通过将最大熵强化学习扩展到扩散过程,提出扩散增强马尔可夫决策过程(DA-MDPs),以最小化反向KL散度的上界来学习最优策略轨迹分布,并成功将PPO、WPO和REPPO适配为扩散变体,在连续控制和多模态基准上取得与基线相当或更优的性能。
Comments Preprint
扩散模型的原理
机构 * MIT Press(MIT出版社) ; Sony AI(索尼人工智能) ; OpenAI(开放人工智能) ; Stanford University(斯坦福大学) ; Sony Group Corporation(索尼集团)
AI总结 本文从变分、基于分数和基于流三种视角统一阐述扩散模型的数学原理,并讨论可控生成、高效求解器和流映射模型等扩展。
Comments Supplementary materials for the book are available at the book website: https://the-principles-of-diffusion-models.github.io/
学习相关奖励模型:统计障碍与机遇
机构 * MIT(麻省理工学院)
AI总结 本文研究了避免IIA假设的相关probit模型的统计与计算挑战,证明了成对偏好数据不足以学习相关性,而三选一偏好数据可实现近最优估计。
Comments International Conference on Learning Representations (ICLR) 2026
MetaboT:基于LLM的多智能体框架,用于质谱代谢组学知识图谱的交互式分析
机构 * Department of Computer Science, University of Antwerp(安特卫普大学计算机科学系) ; Massachusetts Institute of Technology(麻省理工学院) ; Department of Computer Science, Tufts University(塔夫茨大学计算机科学系) ; Swiss Institute of Bioinformatics (SIB), Lausanne, Switzerland(瑞士生物信息学研究所(SIB),洛桑,瑞士) ; Department of Chemical and Biological Engineering, Tufts University(塔夫茨大学化学与生物工程系)
AI总结 提出MetaboT,一个基于大语言模型的多智能体框架,通过模块化架构将自然语言问题转化为SPARQL查询,降低代谢组学知识图谱的使用门槛。
Journal ref 33rd annual international conference on Intelligent Systems for Molecular Biology (ISMB 2025) / 24th Annual Conference of the European Conference on Computational Biology (ECCB 2025), Jul 2025, Liverpool, United Kingdom
实现统一流体-机器人多物理场的水下机器人游泳
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Massachusetts Institute of Technology(麻省理工学院)
AI总结 提出一个可微分的统一流体-机器人多物理场仿真框架,通过最小作用量原理联合推导耦合的机械臂和不可压缩Navier-Stokes方程,并利用离散变分力学和隐函数定理实现稳定、准确的联合仿真与梯度计算,成功优化仿生鳗鱼机器人的波动游泳和高动态C形逃逸动作,并验证了从仿真到实物的迁移。
Comments 9 pages, 10 figures, accepted to Robotics: Science and Systems 2026