The Generalized Turing Test: A Foundation for Comparing Intelligence
通用图灵测试:比较智能的基础
机构 * MIT(麻省理工学院) ; ETH Zurich(苏黎世联邦理工学院) ; EPFL(苏黎世联邦理工学院)
AI总结 本文提出通用图灵测试框架,通过不可区分性比较任意智能体的能力,研究其性质并实证分析现代模型的智能层次。
高校专区
通用图灵测试:比较智能的基础
机构 * MIT(麻省理工学院) ; ETH Zurich(苏黎世联邦理工学院) ; EPFL(苏黎世联邦理工学院)
AI总结 本文提出通用图灵测试框架,通过不可区分性比较任意智能体的能力,研究其性质并实证分析现代模型的智能层次。
CLEF:用于学习临床语义的EEG基础模型
机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) ; Brigham and Women’s Hospital, Harvard Medical School(哈佛医学院布里奇沃特医院) ; Massachusetts General Hospital, Harvard Medical School(哈佛医学院麻省总医院)
AI总结 本文提出CLEF,一种基于临床场景的长上下文EEG基础模型,通过对比学习将EEG会话与神经科报告和结构化电子健康记录对齐,提升了EEG解读的临床相关性。
时序相关性的益处:SGD 通过随机游走高效学习 k-联合
机构 * Bocconi University(博科尼大学) ; University of Washington(华盛顿大学) ; Massachusetts Institute of Technology(麻省理工学院)
AI总结 研究时序相关性如何使稀疏学习问题更高效地被梯度方法解决,展示在超立方体上懒惰随机游走生成样本时,两层ReLU网络能高效学习k-联合。
Comments 10 pages main body, 3 figures
通用智能体评估
机构 * IBM Research(IBM研究院) ; MIT(麻省理工学院)
AI总结 本文系统评估了通用智能体在不同协议和环境下的性能,提出统一协议和评估框架,揭示了智能体架构和基础模型对性能的影响,发现通用智能体无需定制即可适应多种领域。
Comments Presented at the ICLR 2026 Workshop on Agents in the Wild
递归语言模型
机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)
AI总结 本文提出递归语言模型(RLMs),通过将长提示视为外部环境的一部分,使大语言模型能够递归调用自身处理长输入,从而在多个长上下文任务中显著提升性能。
Comments 9 pages, 43 with Appendix
将策略梯度与提示优化组合用于语言模型程序
机构 * University of Notre Dame(诺特大学) ; Stanford University(斯坦福大学) ; UC Berkeley(伯克利大学) ; Anyscale ; CMU(卡内基梅隆大学) ; Zoom, Inc.(Zoom公司) ; Contextual AI ; MIT(麻省理工学院)
AI总结 本文研究了如何将GRPO与自动提示优化结合,以提升多提示程序的性能,实验表明这种组合在分类、多跳搜索和隐私保护委托任务中平均提升准确率11%。
Comments ACM CAIS 2026. Lakshya*, Dilara*, and Noah* contributed equally to this work
评估:停止用人类测试评估AI,改而开发基于AI的原理性测试
机构 * Max Planck Institute for Intelligent Systems, Tübingen(马克斯·普朗克智能系统研究所,图宾根) ; ETH Zurich, Zurich(苏黎世联邦理工学院,苏黎世) ; University of Tübingen, Methods Center, Tübingen(图宾根大学,方法中心,图宾根) ; Massachusetts Institute of Technology, Cambridge(麻省理工学院,剑桥)
AI总结 本文指出,将AI性能评估等同于人类心理特质是理论和实证上的错误,呼吁开发专门针对AI的评估框架。
分层强化交易员(HRT):一种用于优化股票选择和执行的双层方法
机构 * Massachusetts Institute of Technology(麻省理工学院)
AI总结 本文提出HRT,一种双层强化学习框架,用于多资产股票市场中的文本感知投资组合管理。HRT将交易分为两个协调决策:高层控制器选择资产层面的增仓、减仓或持有方向,低层控制器则在考虑风险和交易成本的情况下调整投资组合权重。
Holmes:一个评估语言模型语言能力的基准
机构 * Ubiquitous Knowledge Processing Lab (UKP Lab)(通用知识处理实验室) ; Technical University of Darmstadt(达姆施塔特技术大学) ; Information Systems Research Lab(信息系统研究实验室) ; Lucerne University of Applied Sciences and Arts(卢塞恩应用科学与艺术大学) ; IBM Research AI(IBM AI研究部) ; MIT CSAIL(MIT CSAIL实验室) ; MIT-IBM Watson AI Lab(MIT-IBM沃森AI实验室) ; IBM Research Europe - Ireland(IBM欧洲爱尔兰研究部)
AI总结 Holmes基准通过分类器探测方法评估语言模型对语法、形态学等语言现象的理解,发现模型大小、架构和指令微调显著影响性能,提出FlashHolmes提升效率。
前瞻性压缩在人类抽象学习中的作用
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Dalhousie University(达尔豪斯大学) ; Nanyang Technological University(南洋理工大学)
AI总结 本文研究了非平稳环境下人类如何前瞻性压缩未来任务,通过模式构建任务发现人类抽象学习与现有回顾性压缩算法存在差异。
Comments under review at neurips 2026
生成标记中的真相位于中间
机构 * MIT(麻省理工学院)
AI总结 本文探讨了如何将自回归生成的隐藏状态汇总为反映语言模型内部状态的表示。通过核对齐发现,对生成标记的均池化比单个标记更有效,且生成标记的表示优于提示标记。
医学模型合成架构:一种案例研究
机构 * MIT(麻省理工学院) ; University of Cambridge(剑桥大学) ; Princeton University(普林斯顿大学) ; Duke University(杜克大学) ; The Alan Turing Institute(艾伦·图灵研究所) ; Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)
AI总结 本文提出一种框架,使AI系统能在不确定性下进行实用且形式透明的临床预测。通过语言模型检索知识并构建概率模型,实现校准和可验证的推理,用于鉴别诊断并讨论未来应用方向。
Comments Working paper
神经聚类先,路径后:通过可微最优传输实现的一次性有容量车辆路径问题
机构 * MIT(麻省理工学院) ; TUM(塔尔博特大学)
AI总结 本文提出神经CFRS框架,通过可微最优传输层实现一次性非自回归解决有容量车辆路径问题,理论保证了对空间对称性的抽象,并在实际应用中表现出鲁棒性和高效性。
Comments 30 pages, 9 figures
生成对抗式后训练缓解实时人机音乐交互中的奖励黑客
机构 * Mila, Quebec Artificial Intelligence Institute, Université de Montréal(蒙特利尔大学人工智能研究所,魁北克机器学习研究院) ; Canada CIFAR AI Chair(加拿大CIFAR人工智能主席) ; Massachusetts Institute of Technology(麻省理工学院) ; Georgia Institute of Technology(佐治亚理工学院) ; University of Washington(华盛顿大学) ; McGill University(麦吉尔大学) ; Independent Researcher(独立研究者)
AI总结 本文提出一种对抗训练方法,通过政策生成轨迹缓解生成序列模型后训练中的奖励黑客问题,提升音乐伴奏的多样性与和谐性。
Comments v3: fix the Figure numbering bugs
Neuroprobe:评估自然刺激下的颅内脑响应
机构 * MIT CSAIL, CBMM(MIT CSAIL,CBMM) ; MIT McGovern Institute(MIT McGovern研究所) ; Caltech(加州理工学院) ; Columbia University(哥伦比亚大学) ; ETH Zurich(苏黎世联邦理工学院)
AI总结 Neuroprobe通过高分辨率颅内EEG数据研究多模态语言处理,提供评估框架比较不同模型架构,揭示语言处理在大脑中的时间与空间动态。
Comments 38 pages, 7 main figures, 16 supplementary figures, 13 tables
MINGLE:用于城市场景中语义复杂区域检测的视觉语言模型
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Hasso Plattner Institute(于尔克·平特纳研究所)
AI总结 本文提出MINGLE模型,通过整合人类检测、视觉语言推理和轻量级空间聚合算法,实现城市场景中社交群体区域的检测,贡献包括新数据集和语义丰富的标注方法。
Comments 13 pages, 4 figures Updated with the camera-ready version after acceptance
DexWrist:一种用于受限和动态操作的机械腕
机构 * Improbable AI Lab, Massachusetts Institute of Technology(Improbable AI实验室,麻省理工学院)
AI总结 DexWrist通过结合准直接驱动和解耦并行运动机制,在紧凑设计中实现高扭矩和动态接触任务,提升了受限环境中的操作性能。
Comments 9 pages, 8 figures. Submitted to RA-L 2026
RigidFormer:基于变换器学习刚体动力学
机构 * MIT(麻省理工学院) ; Meta
AI总结 RigidFormer通过对象中心的变换器模型,高效建模无网格表示的高保真刚体动力学,采用可控积分步长和锚点池化技术,实现对点云等无网格输入的高精度模拟。
Comments Project Page: https://people.csail.mit.edu/frankzydou/projects/RigidFormer/index.html
WavesFM:纵向可穿戴传感器波形的分层表示学习
机构 * Google Research(谷歌研究) ; MIT(麻省理工学院) ; University of Washington(华盛顿大学)
AI总结 WavesFM通过分层自监督学习框架,解决长序列生理数据处理中的高采样频率、多模态依赖和长序列长度问题,实现对局部信号语义和复杂昼夜及跨日变化的建模。
Octopus Protocol:通过基础设施即提示实现AI代理的一次性硬件发现与控制
机构 * MIT(麻省理工学院)
AI总结 Octopus Protocol通过五阶段流程实现硬件发现与控制,利用语言模型API生成MCP协议服务器,使AI代理能自主完成硬件集成与闭环视觉-运动控制。
评估大语言模型的发展认知能力
机构 * De Vinci Research Center(德文西研究中心) ; MIT Media Lab(MIT媒体实验室) ; University of Oxford(牛津大学) ; Google(谷歌)
AI总结 本文提出DSCT测试,通过自述文本评估发展认知阶段,发现LLM在模拟角色和真实人类响应中表现出不同的阶段特征,表明发展信号在合成响应中更清晰。
Comments 9 pages, 3 figures, (10 pages appendix)
长上下文变换器的缩放极限
机构 * Departement Mathematik und Statistik, University of Bern(伯尔尼大学数学与统计学系) ; Department of Mathematics, Massachusetts Institute of Technology(麻省理工学院数学系) ; Department of Electrical Engineering and Computer Science, Massachusetts Institute of Technology(麻省理工学院电气工程与计算机科学系)
AI总结 研究softmax自注意力在长上下文极限下的行为,分析逆温度参数对注意力选择性的影响,揭示不同尺度下注意力权重和输出的极限分布。
Comments 40 pages, 4 figures
NARRA-Gym用于评估交互叙事代理
机构 * University of Notre Dame(诺丁汉大学) ; LMU Munich(慕尼黑大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心) ; University of Pennsylvania(宾夕法尼亚大学) ; Lehigh University(莱恩大学) ; Massachusetts Institute of Technology(麻省理工学院) ; Bake AI UC Santa Barbara(加州大学圣芭芭拉分校) ; University of Washington(华盛顿大学)
AI总结 本文提出NARRA-Gym,一个可执行评估环境,用于评估LLM在多轮交互中生成连贯故事的能力,通过模拟情感种子生成完整故事并记录完整模型在环轨迹,验证了不同模型在故事质量、鲁棒性和用户适应性上的差异。
一种多功能AI代理用于罕见病诊断和风险基因优先级排序
机构 * Interdepartmental Program in Computational Biology and Bioinformatics, Yale University(耶鲁大学计算生物学与生物信息学联合计划) ; Department of Biostatistics, Yale University(耶鲁大学生物统计学系) ; Broad Institute of MIT and Harvard(哈佛大学与麻省理工学院联合Broad研究所) ; Center for Biomedical Data Science, Duke-NUS Medical School(杜克-新加坡医学学校生物医学数据科学中心) ; Sport and Exercise Medicine Service, KK Women’s and Children’s Hospital Training Program, Duke-NUS Medical School(杜克-新加坡医学学校KK妇女儿童医院运动与医学服务培训项目) ; Training Program, Duke-NUS Medical School(杜克-新加坡医学学校培训项目) ; Department of Computer Science and Engineering, The Ohio State University(俄亥俄州立大学计算机科学与工程系) ; Department of Complexity Science and Engineering, The University of Tokyo(东京大学复杂科学与工程系) ; Center for Advanced Intelligence Project, RIKEN(日本理化学研究所高级智能项目中心) ; NUS Artificial Intelligence Institute, National University of Singapore(新加坡国立大学人工智能研究所) ; Department of Biostatistics and Bioinformatics, Duke University(杜克大学生物统计学与生物信息学系) ; Department of Biomedical Data Science, Stanford University(斯坦福大学生物医学数据科学系) ; Department of Genetics, Yale University(耶鲁大学遗传学系) ; Wu Tsai Institute, Yale University(耶鲁大学吴天教授研究所) ; Department of Biomedical Informatics and Data Science, Yale University(耶鲁大学生物医学信息学与数据科学系)
AI总结 本文提出Hygieia系统,通过整合多源数据提升罕见病诊断准确性与风险基因优先级排序能力,实验表明其在多个诊断基准上表现优异,有效减轻临床工作负担。
Comments 32 pages, 6 figures
为何不变性不足以实现生物医学领域泛化以及如何修复它
机构 * MIT(麻省理工学院) ; MGH(麻省总医院) ; HMS(哈佛医学院)
AI总结 MaskGen通过结合源域图像强度和领域稳定的基模型表示,提出了一种简单有效的领域泛化策略,在生物医学图像分割中实现了更强的泛化能力。
Comments Project GitHub https://github.com/sebodiaz/MaskGen
廉价快感:利用廉价标签进行有效的摊还优化
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Technical University of Denmark(丹麦技术大学)
AI总结 本文提出一种利用廉价不完美标签的框架,通过监督预训练和自监督学习提升模型性能,在非凸约束优化、电网操作和刚性动力系统中实现更快收敛和更低计算成本。
Comments in submission
无需潜在变量的一步图像生成:像素均值流
机构 * MIT(麻省理工学院)
AI总结 本文提出像素均值流(pMF),通过分离网络输出空间与损失空间,实现无需潜在变量的一步图像生成,在ImageNet上取得优异结果。
Comments Tech report. Code at https://github.com/Lyy-iiis/pMF
改进的均值流:关于快速前向生成模型挑战的研究
机构 * CMU(卡内基梅隆大学) ; MIT(麻省理工学院) ; Adobe(Adobe公司) ; THU(清华大学)
AI总结 本文改进了MeanFlow框架,通过重新参数化训练目标和指导机制,提升了训练稳定性与灵活性,实现了在ImageNet上的1.72 FID成绩。
Comments Technical report. Code at https://github.com/Lyy-iiis/imeanflow
六分之四:更准确的NVFP4量化方法通过自适应块缩放
机构 * Massachusetts Institute of Technology(麻省理工学院) ; NVIDIA(英伟达)
AI总结 本文提出4/6方法,通过自适应块缩放改进NVFP4量化,减少量化误差,提升模型性能。
Comments 10 pages, 4 figures
共识采样用于更安全的生成式AI
机构 * OpenAI ; MIT(麻省理工学院) ; Tel Aviv University(特拉维夫大学)
AI总结 本文提出共识采样算法,通过聚合多个概率分布提升生成模型安全性,其在保证安全性的前提下有效避免分歧,通过R-鲁棒性理论保障信息泄露和对抗影响的界限,实验验证了其在合成分布和图像生成中的有效性。