Thought-Level Beam Search for Reasoning
用于推理的思维级束搜索
机构 * Princeton University(普林斯顿大学) ; MIT(麻省理工学院) ; Meta AI
AI总结 针对大型推理模型测试时计算分配的低效问题,提出执行思维级束搜索的Gambit算法,在固定硬件预算下,其在准确率、吞吐量、token消耗等指标上均优于现有基线方法。
Comments Add the author Jiawei Zhao in Meta Data
高校专区
用于推理的思维级束搜索
机构 * Princeton University(普林斯顿大学) ; MIT(麻省理工学院) ; Meta AI
AI总结 针对大型推理模型测试时计算分配的低效问题,提出执行思维级束搜索的Gambit算法,在固定硬件预算下,其在准确率、吞吐量、token消耗等指标上均优于现有基线方法。
Comments Add the author Jiawei Zhao in Meta Data
人工智能的市场设计:超越版权二元论
机构 * MIT Operations Research Center(麻省理工学院运筹学中心) ; MIT Sloan School of Management(麻省理工学院斯隆管理学院) ; Washington University School of Law(华盛顿大学法学院)
AI总结 本文通过静态和动态博弈模型,分析AI训练数据市场中“自由使用”与“强知识产权”两种模式的失败,提出通过数据中介内部化外部性并补贴创新贡献的市场设计。
Infra-Bayesian 强化学习智能体在最坏情况鲁棒性上优于经典强化学习
机构 * Purdue University(普渡大学) ; Carnegie Mellon University(卡内基梅隆大学) ; WorldQuant University(WorldQuant大学) ; UC Berkeley(加州大学伯克利分校) ; Aix-Marseille University(阿维尼翁-马赛大学) ; MIT(麻省理工学院) ; University of Zurich(苏黎世大学) ; University of British Columbia(不列颠哥伦比亚大学) ; University of Stuttgart(斯图加特大学) ; University of Buenos Aires(布宜诺斯艾利斯大学) ; California State University, Fresno(弗雷斯诺加州州立大学) ; University of Chicago(芝加哥大学)
AI总结 针对经典强化学习在模型误设和策略依赖不确定性下的失败,提出 Infra-Bayesian 框架,通过区分概率不确定性和 Knightian 不确定性并采用最坏情况决策,在有限状态无状态决策问题中实现更低的最坏情况遗憾。
Comments RLC 2026: Accepted to Finding the Frame Workshop
TimePre: 联合精度、效率与稳定性在概率时间序列预测中的应用
机构 * Tohoku University(东京大学) ; WPI ; Texas A&M University(德克萨斯大学) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; UIUC(伊利诺伊大学香槟分校) ; Georgia Tech(佐治亚理工学院) ; MIT(麻省理工学院) ; University of Southern California(南加州大学) ; San Diego State University(圣地亚哥州立大学)
AI总结 TimePre结合MLP模型的高效性与MCL方法的分布灵活性,通过SIN层解决精度、效率与稳定性之间的平衡问题,实现在概率时间序列预测中的高精度与高速度。
Comments 25 pages, 6 figures, 16 tables
双温度的故事:从扩散语言模型中实现简单、高效且多样的采样
机构 * Massachusetts Institute of Technology(麻省理工学院) ; UvA-Bosch Delta Lab, University of Amsterdam(阿姆斯特丹大学UvA-Bosch Delta实验室) ; Johns Hopkins University(约翰霍普金斯大学) ; University of California, Irvine(加州大学尔湾分校)
AI总结 本文提出通过温和的温度化方法提升扩散语言模型采样多样性,实现高效且多样化的样本生成,优于现有方法。
Comments V2: accepted as a full conference paper at COLM
更快的超词 tokenization
机构 * Kensho Technologies ; MIT(麻省理工学院)
AI总结 本文提出改进的 BoundlessBPE 和 SuperBPE 算法,通过聚合超词候选提升训练速度,实现超词生成并优化超参数选择,使训练时间显著缩短。
Comments Accepted for COLM 2026
跨基准的低成本能力估计
机构 * Kensho Technologies ; MIT(麻省理工学院)
AI总结 本文提出通过改进的多维项目反应理论模型与自适应项目选择方法,以低成本预测模型在未见任务上的性能,实现高效基准评估。
无免费标签:缺乏人类基准的LLM作为评判的局限性
机构 * Kensho Technologies ; MIT(麻省理工学院)
AI总结 本文提出BFF-Bench基准测试,通过专家评估LLM响应的正确性,揭示LLM作为评判在无人类基准时的局限性,显示当无正确参考时,LLM评判与人类专家的高一致性仅限于LLM能正确回答的问题。
隐藏的提线人:预测操纵性大语言模型对话中的人类信念变化
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文提出PUPPET框架,通过分析1035个人类与LLM交互数据,揭示当前安全范式在检测操纵策略与信念变化幅度之间的关键断层,证明先进LLM对人类信念易感性的系统低估。
Comments Accepted to COLM 2026
基于扩散的阻抗学习用于接触丰富的操作任务
机构 * Institute for Anthropomatics and Robotics, Karlsruhe Institute of Technology(人机动力学与机器人研究所,卡尔斯鲁厄技术大学) ; Department of Mechanical Engineering, Massachusetts Institute of Technology(机械工程系,麻省理工学院) ; Department of Brain and Cognitive Sciences, Massachusetts Institute of Technology(脑与认知科学系,麻省理工学院)
AI总结 本文提出基于扩散的阻抗学习框架,结合生成建模与能量一致的阻抗控制,实现接触丰富的操作任务中的高精度动态控制与任务泛化能力。
Comments 15 pages, 12 figures
大型语言模型是否受益于自身话语?
机构 * Department of Electrical Engineering and Computer Science, Massachusetts Institute of Technology(麻省理工学院电子工程与计算机科学系) ; MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) ; IBM Research(IBM研究院)
AI总结 研究发现,省略大型语言模型自身历史上下文可提高响应质量并减少内存消耗。
从不完整电子健康记录数据中学习表示的双掩码自编码
机构 * Massachusetts Institute of Technology(麻省理工学院) ; EPFL(苏黎世联邦理工学院) ; Harvard University(哈佛大学) ; Beth Israel Deaconess Medical Center(贝塞斯达医院)
AI总结 AID-MAE通过双掩码技术直接从不完整EHR时间序列中学习表示,有效提升临床任务性能并实现患者群体的自然分层。
Comments MLHC 2026 camera-ready. Spotlight at NeurIPS TS4H 2025
情境图预测:用户建模的结构化视角推断
机构 * Flybits Labs, Creative AI Hub(Flybits实验室、创意人工智能中心) ; University of Toronto(多伦多大学) ; Toronto Metropolitan University(多伦多 Metropolitan 大学) ; MIT Media Lab(MIT媒体实验室)
AI总结 情境图预测通过结构化视角推断提升用户建模能力,揭示潜在状态推断比表层提取更困难。
Comments Accepted to PILA 2026: Workshop on Personal Intelligence in the Agentic AI Era, at KDD 2026, 5 pages