Learning with Simulators: No Regret in a Computationally Bounded World
与模拟器学习:计算受限世界中的无悔学习
机构 * MIT(麻省理工学院) ; Microsoft Research(微软研究院)
AI总结 提出可模拟过程框架,利用模拟器近似任意复杂依赖的数据分布,恢复VC维误差界,并展示条件采样的统计与计算优势。
Comments To appear at COLT 2026
高校专区
与模拟器学习:计算受限世界中的无悔学习
机构 * MIT(麻省理工学院) ; Microsoft Research(微软研究院)
AI总结 提出可模拟过程框架,利用模拟器近似任意复杂依赖的数据分布,恢复VC维误差界,并展示条件采样的统计与计算优势。
Comments To appear at COLT 2026
学会适应:基于表示的多任务技能迁移强化学习
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Harvard School of Engineering and Applied Sciences(哈佛大学工程与应用科学学院)
AI总结 提出RepMT-SAC框架,通过谱MDP分解捕获可迁移动力学,实现任务无关核心与最小任务特定调整的价值函数结构,在四旋翼轨迹跟踪任务上零样本性能提升30%。
Comments 8 pages, 4 figures, 1 table
探索智能体口音如何影响K-12小组学习中的人机协作
机构 * Massachusetts Institute of Technology(麻省理工学院)
AI总结 研究通过33名教师的实验,发现GenAI语音智能体的不同口音(英式、印度式、非裔美式)影响其被感知为工具或同伴,进而影响信任、参与和依赖。
跨尺度科学挑战的AI智能体基准测试
机构 * Yale University(耶鲁大学) ; Broad Institute of MIT and Harvard(布罗德研究所) ; The Pennsylvania State University(宾夕法尼亚州立大学) ; Northeastern University(东北大学) ; Northwestern University(西北大学)
AI总结 提出SciAgentArena基准,含约200个交互式任务,评估AI智能体在真实科研场景中的能力,发现其在数据分析中有效,但在创新探索和开放问题上表现不均。
Comments 6 figures
学习辅助:面向隐式人机协作的协作式VLA模型
机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; Massachusetts Institute of Technology(麻省理工学院)
AI总结 本文研究利用视觉-语言-动作(VLA)模型通过模仿学习实现人机协作,发现动作分块策略在隐式协作中存在演示动作泄漏问题,提出推理时引导方法缓解过早辅助行为,并通过用户研究验证其有效性。
推理模型知道什么重要,并在其激活中编码
机构 * Technion(技术离子大学) ; University of Zagreb, FER(扎格雷布大学,FER) ; MIT(麻省理工学院) ; Kempner Institute, Harvard(哈佛大学凯普纳研究所)
AI总结 通过分析模型激活而非仅依赖推理链文本,发现激活能更有效识别关键推理步骤,且模型在生成后续步骤前已内部编码步骤重要性。
解析句法:语言建模与语法的子结构
机构 * Massachusetts Institute of Technology(麻省理工学院)
AI总结 本文研究语言模型在上下文无关语法子结构上的学习行为,证明损失函数在顶层子语法上线性递归,并发现参数化模型并行学习子语法,子语法预训练能提升小模型性能并改善内部表征。
Comments Equal contribution by LYS and DM. Accepted to the 43rd International Conference on Machine Learning (ICML 2026)
MoReBench:评估语言模型中的程序性和多元道德推理,超越结果
机构 * University of Washington(华盛顿大学) ; New York University(纽约大学) ; Scale AI ; Harvard University(哈佛大学) ; University of Michigan(密歇根大学) ; UNC Chapel Hill(北卡罗来纳大学教堂山分校) ; Center for AI Safety(人工智能安全中心) ; Stanford University(斯坦福大学) ; MIT(麻省理工学院) ; University of Oxford(牛津大学)
AI总结 提出MoReBench基准,包含1000个道德场景和超过2.3万条标准,用于评估语言模型在道德推理中的程序性推理能力,发现现有基准无法预测模型表现,且模型对特定道德框架存在偏好。
Comments 46 pages, 8 figures, 10 tables. Published in ICLR 2026. Accepted at CHAI workshop and SPP 2026 (non-archival)
生成式人工智能中的竞争与多样性
机构 * MIT Sloan School of Management & Department of Electrical Engineering and Computer Science(麻省理工学院斯隆管理学院及电气工程与计算机科学系)
AI总结 通过博弈论模型和Scattergories游戏实验,研究竞争如何促使生成式AI模型多样化,缓解同质化,并提升社会福利。