A Systematic Evaluation of Molecular Mixture Behavior Prediction
分子混合物行为预测的系统评估
机构 * KU Leuven(卢森堡大学) ; MIT(麻省理工学院) ; RWTH Aachen University(亚琛工业大学)
AI总结 提出一个将混合物性质误差分解为纯组分和相互作用成分的评估框架,并基于七个匹配数据集发现绝对精度可能掩盖非理想混合行为的恢复能力。
高校专区
分子混合物行为预测的系统评估
机构 * KU Leuven(卢森堡大学) ; MIT(麻省理工学院) ; RWTH Aachen University(亚琛工业大学)
AI总结 提出一个将混合物性质误差分解为纯组分和相互作用成分的评估框架,并基于七个匹配数据集发现绝对精度可能掩盖非理想混合行为的恢复能力。
多类别和稀疏上下文赌博机的样本复杂度
机构 * Tel Aviv University(特拉维夫大学) ; Massachusetts Institute of Technology(麻省理工学院) ; Google Research Tel Aviv(谷歌研究特拉维夫) ; Technion—Israel Institute of Technology(技术学院—以色列理工学院)
AI总结 针对随机i.i.d.上下文赌博机,提出基于决策估计系数和低方差探索的算法,在稀疏奖励下实现接近最优的样本复杂度,并匹配下界。
大型语言模型的越狱缩放定律:多项式-指数交叉
机构 * John A. Paulson School of Engineering And Applied Sciences, Harvard University(哈佛大学约翰·A·保罗森工程与应用科学学院) ; Department of Brain and Cognitive Sciences, Massachusetts Institute of Technology(麻省理工学院脑科学与认知科学系) ; Speech and Hearing Bioscience and Technology, Harvard Medical School(哈佛医学院语音与听力生物科学与技术系) ; Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究学院) ; Center for Brain Science, Harvard University(哈佛大学脑科学中心)
AI总结 研究发现对抗性提示注入攻击可使攻击成功率从无注入时的缓慢多项式增长变为随推理样本数指数增长,并通过自旋玻璃模型从理论上解释了这一现象。
E3AD:面向以人为中心的端到端自动驾驶的情感感知视觉-语言-动作模型
机构 * McGill University(麦吉尔大学) ; University of Macau(澳门大学) ; The Hong Kong Polytechnic University(香港理工大学) ; Massachusetts Institute of Technology(麻省理工学院) ; University of Washington(华盛顿大学)
AI总结 提出E3AD框架,通过连续VAD情感模型和双路径空间推理模块,将情感理解融入视觉-语言-动作模型,实现开放域端到端自动驾驶中的情感感知轨迹规划,在真实数据集上达到SOTA性能。
E-valuator: 基于序贯假设检验的可靠智能体验证器
机构 * Genentech(基因泰克) ; MIT(麻省理工学院) ; Johns Hopkins(约翰霍普金斯大学) ; Stanford(斯坦福大学)
AI总结 提出E-valuator方法,将任意黑盒验证器分数转化为具有可控虚警率的决策规则,通过序贯假设检验实现对智能体轨迹的在线监控,提升统计功效并节省令牌。
兴趣问题:理解人类与语言模型对数学问题的兴趣度
机构 * KTH Royal Institute of Technology(皇家理工学院) ; Stanford University(斯坦福大学) ; Massachusetts Institute of Technology(麻省理工学院) ; University of Cambridge(剑桥大学) ; Kempner Institute at Harvard University(哈佛大学肯普尼研究所) ; Mistral AI
AI总结 通过比较大型语言模型与不同数学背景人群对数学问题的兴趣度评分,研究LLM在兴趣判断上与人类的一致性,并评估其生成有趣问题的能力。
Comments Published at the Math-AI Workshop, NeurIPS 2025
估计语言模型代理的赋权能力
机构 * Massachusetts Institute of Technology(麻省理工学院) ; University of Washington(华盛顿大学)
AI总结 提出基于信息论中赋权概念的评估框架EELMA,通过多轮文本交互近似有效赋权,实验表明赋权与任务性能强相关,可作为与任务成功度量互补的通用评估指标。
Comments Published at the International Conference on Machine Learning (ICML) 2026. 9 pages, 9 figures; camera-ready version
跨任务预测驱动推理在AI评估与社会科学研究中的应用
机构 * MIT(麻省理工学院)
AI总结 提出多任务预测驱动推理框架,通过跨任务重校准利用共享结构,在标签稀缺时提升统计推断效率,并证明非线性结构是跨任务增益的必要条件。
运动引导的稀疏校正实现跨不同显微镜体制的专家级点跟踪
机构 * Department of Computer Science, Old Dominion University(奥德赛大学计算机科学系) ; Department of Biology, Massachusetts Institute of Technology(麻省理工学院生物学系) ; The Picower Institute for Learning and Memory, Massachusetts Institute of Technology(麻省理工学院学习与记忆研究所) ; Department of Physics and Technology, UiT--The Arctic University of Norway(挪威北极大学物理与技术系) ; Department of Physics, University of Oslo(奥斯陆大学物理系) ; School of Data Science, Old Dominion University(奥德赛大学数据科学学院) ; Department of Physics, Old Dominion University(奥德赛大学物理系)
AI总结 提出RIPPLE方法,通过运动引导的稀疏校正,在多种显微镜视频中实现专家级点跟踪,将手动标注工作量减少3至25倍。
PROTOCOL: 用于蛋白质同源搜索的延迟交互检索
机构 * MIT(麻省理工学院) ; Princeton University(普林斯顿大学)
AI总结 提出ProtoCol模型,利用ColBERT风格的延迟交互机制对残基嵌入进行最大相似度评分,以提升远程同源搜索的灵敏度,在SCOPe超家族和Pfam clan基准上优于多种基线方法。
深度网络会忘记初始化吗?实用归纳偏见的遗忘时间视角
机构 * MIT(麻省理工学院) ; Northwestern University(西北大学)
AI总结 通过引入初始化记忆度量,研究随机初始化对训练后预测器的影响,发现低学习率SGD保留初始化记忆而Adam族方法遗忘,且遗忘动力学与泛化正则化相关。
Comments 39 pages, 9 figures
高维稀疏更新下随机动量的动力学
机构 * Google DeepMind & MIT(谷歌DeepMind及麻省理工学院) ; McGill University & Mila(麦吉尔大学及MILA)
AI总结 本文通过最小二乘和逻辑回归模型,理论分析了稀疏更新下动量的动力学,揭示了由动量保留时间尺度与学习时间尺度之比决定的相结构,并发现不同令牌稀疏度下的振荡动力学存在谱冲突。
表示对齐依赖于线性结构
机构 * Massachusetts Institute of Technology(麻省理工学院)
AI总结 本文通过信号、偏差和噪声的三部分统计框架研究柏拉图表示假说,提出对齐源于对象与属性的线性关系,并通过稀疏自编码器提取线性特征、中心化和归一化减少偏差、以及数据稀缺导致噪声等证据支持该框架。
面向计算机使用代理的人类引导式危害恢复
机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)
AI总结 针对LM代理在计算机系统中执行操作后的危害恢复问题,通过用户研究定义偏好对齐的恢复维度,提出基于奖励模型对候选恢复计划重排序的方法,并构建BackBench基准测试,实验表明该方法优于基线代理。
用于检测和描述卫星图像中新闻事件的多智能体反馈系统
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Planet Labs
AI总结 提出一种迭代多智能体工作流SkyScraper,通过地理编码新闻文章并合成卫星图像序列描述,有效发现多时相事件并构建5000序列数据集。
机器人何时应该思考?基于强化学习的资源感知推理在具身机器人决策中的应用
机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) ; Northeastern University(东北大学) ; Harvard University(哈佛大学) ; Cornell University(康奈尔大学) ; MIT(麻省理工学院) ; Fujitsu Research of America(美国富士通研究) ; Tsinghua University(清华大学) ; Peking University(北京大学) ; University of Georgia(佐治亚大学) ; Florida International University(佛罗里达国际大学) ; EmbodyX Inc(EmbodyX公司) ; Cisco Systems(思科系统)
AI总结 提出RARRL框架,通过强化学习学习高层编排策略,使具身代理能自适应决定是否调用LLM推理、选择推理角色及分配计算预算,以平衡推理开销与任务成功率。
神经波函数中的拓扑序
机构 * Department of Physics, Massachusetts Institute of Technology, Cambridge, MA-02139, USA(麻省理工学院物理系)
AI总结 本文利用基于注意力的深度神经网络变分波函数,通过能量最小化发现分数量子霍尔效应基态,并引入一种从单一实空间波函数提取拓扑简并度的方法,展示了神经网络变分蒙特卡洛在强关联拓扑相研究中的潜力。
Comments Published version
Journal ref Phys. Rev. B 113, 205119 (2026)
先规定后选择:面向情境随机优化的自适应策略选择
机构 * Sloan School of Management(斯隆管理学院) ; Massachusetts Institute of Technology(麻省理工学院) ; Tandon School of Engineering(坦多工程学院) ; New York University(纽约大学)
AI总结 针对情境随机优化中候选策略在协变量空间表现异质的问题,提出Prescribe-then-Select模块化框架,通过构建可行策略库并基于最优策略树集成学习元策略实现数据驱动的自适应选择,在单阶段报童和两阶段运输规划问题中优于单一最优策略。
具有双向进化搜索的自我改进语言模型
机构 * Harvard University(哈佛大学) ; MIT(麻省理工学院)
AI总结 提出双向进化搜索(BES)框架,通过前向候选进化与后向目标分解相结合,克服了传统搜索方法中稀疏验证信号和自回归扩展的局限,在训练后和推理时均显著提升语言模型性能。
KT4EQG: 通过知识追踪实现个性化习题生成
机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校) ; University of South Alabama(南方大学) ; University of Michigan(密歇根大学) ; MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) ; Harvard University(哈佛大学)
AI总结 提出KT4EQG框架,利用知识追踪模型选择最合适的概念,并训练基于LLM的题目生成器,以生成个性化习题,实验证明其有效性。
基于Transformer的测度到测度回归
机构 * University of Alberta(阿尔伯塔大学) ; Alberta Machine Intelligence Institute(阿尔伯塔机器智能研究所) ; MIT(麻省理工学院) ; The Broad Institute of MIT and Harvard(MIT和哈佛大学Broad研究所)
AI总结 针对概率测度之间的映射学习问题,提出利用Transformer的测度依赖和平均场结构,实现静态和动态两种非线性测度到测度回归方法,并在合成实验、粒子系统和癌症治疗反应预测中验证其泛化能力。
将视频模型转化为通用机器人策略
机构 * MIT(麻省理工学院) ; CMU(卡内基梅隆大学) ; Amazon FAR(亚马逊公司)
AI总结 提出一种解耦的视频到动作策略VERA,利用无动作视频世界模型和基于机器人雅可比矩阵的逆动力学模型,实现跨本体的零样本机器人控制。
Comments project page: https://vera.csail.mit.edu
张量记忆:用于长程Transformer的固定大小循环状态
机构 * Massachusetts Institute of Technology, Cambridge, MA, USA(麻省理工学院) ; IBM Research, Cambridge, MA, USA(IBM研究院) ; University of Toronto, Toronto, Canada(多伦多大学)
AI总结 提出张量记忆模块,通过固定大小的3D循环张量状态增强Transformer,以解耦状态容量与输入长度,并保持空间归纳偏置,适用于长程视频理解。
Hurwitz四元数乘法量化用于KV缓存压缩
机构 * Massachusetts Institute of Technology, Cambridge, MA, USA(麻省理工学院) ; IBM Research, Cambridge, MA, USA(IBM研究院) ; University of Toronto, Toronto, Canada(多伦多大学)
AI总结 提出一种免校准的Hurwitz四元数乘法量化方法,通过将K/V的4元素块视为四元数并用量化乘积编码,在约5比特下匹配fp16困惑度,实现高达5.05倍KV缓存压缩。
基于信息论的心电图信号多模态表示学习
机构 * KU Leuven(库勒芬大学) ; University Hospitals Leuven(鲁文大学医院) ; MIT(麻省理工学院) ; DFKI(德国达姆施塔特研究所)
AI总结 提出MERIT框架,通过信息论视角结合掩码心电图建模与心电图-文本对比对齐,学习保留信号结构并整合临床语义的心电图表示,在分类、零样本和文本生成任务中取得一致提升。
利用智能体引导的树搜索自动化形式验证
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Department of Electrical Engineering and Computer Science(电气工程与计算机科学系)
AI总结 本文提出智能体引导的树搜索方法,通过状态和上下文两种编排器改进基于大语言模型的Lean形式验证代码生成性能,在基准测试中达到95.0%的通过率。
Comments 78 pages, 8 figures
MerLean-Prover:用于 Lean 4 定理证明的递归循环框架
机构 * Northeastern University(东北大学) ; Stony Brook University(石溪大学) ; Massachusetts Institute of Technology(麻省理工学院)
AI总结 提出一种基于递归循环框架的端到端 Lean4 定理证明器 MerLean-Prover,通过规划、检查与证明三种智能体协作,无需微调或定制强化学习,在 FormalQualBench 和 Putnam2025 上超越现有开源基线。
MathlibLemma: 形式化数学中的民间引理生成与基准测试
机构 * Department of Computer Science, University of Virginia(弗吉尼亚大学计算机科学系) ; Astronomy , California Institute of Technology(加州理工学院天文学系) ; Purdue University(普渡大学) ; Massachusetts Institute of Technology(麻省理工学院)
AI总结 提出基于LLM的模块化流水线MathlibLemma,自动挖掘、形式化并证明数学中缺失的民间引理,生成包含4028个类型检查的Lean语句的基准测试集。
HardNet++: 神经网络中的非线性约束强制执行
机构 * Massachusetts Institute of Technology(麻省理工学院)
AI总结 提出一种通过阻尼局部线性化迭代调整网络输出来强制执行线性和非线性等式与不等式约束的方法,并证明在正则条件下可达到任意精度,应用于非线性模型预测控制问题中实现紧约束满足且不损失最优性。
大型语言模型的结构化智能体蒸馏
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Harvard University(哈佛大学) ; MIT(麻省理工学院) ; Northeastern University(东北大学) ; Adobe Research(Adobe研究) ; National University of Singapore(新加坡国立大学) ; University of Georgia(佐治亚大学) ; Florida International University(佛罗里达国际大学)
AI总结 提出结构化智能体蒸馏框架,通过分段对齐推理和动作跨度,将大型语言模型智能体压缩为小型学生模型,在保持决策性能的同时降低推理成本。
Journal ref The 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)