Is there "Secret Sauce'' in Large Language Model Development?
大型语言模型开发中是否存在'秘密配方'?
机构 * Massachusetts Institute of Technology(麻省理工学院)
AI总结 研究发现大型语言模型的前沿进展主要由计算量驱动,而非专有技术,但非前沿领域中专有技术可显著降低计算需求。
高校专区
大型语言模型开发中是否存在'秘密配方'?
机构 * Massachusetts Institute of Technology(麻省理工学院)
AI总结 研究发现大型语言模型的前沿进展主要由计算量驱动,而非专有技术,但非前沿领域中专有技术可显著降低计算需求。
通过Koopman谱分析生成建模:一个算子理论的观点
机构 * Center for Science Adventure ; Collaborative Research Advancement, Graduate School of Science, Kyoto University, Kyoto, Japan ; Massachusetts Institute of Technology, Cambridge, MA ; LinkedIn Corporation, Sunnyvale, CA ; Dynamic Systems Lab, University College London, London, UK ; Graduate School of Information Science ; Technology, The University of Osaka, Osaka, Japan ; RIKEN Center for Advanced Intelligence Project, Tokyo, Japan
AI总结 KSWGD通过Koopman理论和Wasserstein梯度下降结合,实现高效生成建模,克服梯度消失问题,提升收敛速度和样本质量。
打破尺度锚定:用于从低分辨率训练准确进行高分辨率推断的频率表示学习
机构 * School of Future Technology, South China University of Technology, China(未来技术学院,华南理工大学,中国) ; State Key Laboratory of Ocean Sensing & Ocean College, Zhejiang University, China(海洋感知国家重点实验室,浙江大学,中国) ; Kavli Institute for Astrophysics and Space Research, Massachusetts Institute of Technology, USA(天体物理与空间研究所,麻省理工学院,美国)
AI总结 本文提出了一种架构无关的频率表示学习方法,通过分辨率对齐的频率表示和频谱一致性训练,解决尺度锚定问题,提升高分辨率推断的准确性。
Comments Accepted as a poster paper at ICLR 2026
深度集成用于知识不确定性:一个频数视角
机构 * EECS, MIT, Cambridge MA, USA(麻省理工学院电子工程与计算机科学系)
AI总结 本文从频数视角探讨深度集成在量化epistemic不确定性中的有效性,通过bootstrap估计器和数据变异性的分解,揭示了深度集成捕捉训练随机性成分的机制。
广义流映射用于黎曼流形上的少步生成建模
机构 * University of Oxford(牛津大学) ; Harvard University(哈佛大学) ; Kempner Institute(凯普纳研究所) ; Institute for Artificial Intelligence and Fundamental Interactions, MIT(人工智能与基本相互作用研究所,MIT) ; Carnegie Mellon University(卡内基梅隆大学) ; AITHYRA(AITHYRA研究所) ; Mila(Mila研究所) ; Imperial College London(伦敦帝国学院)
AI总结 本文提出广义流映射(GFM)用于黎曼流形上的少步生成建模,通过自蒸馏方法提升现有生成模型性能。
Comments Under review
你的强化学习奖励函数是你的最佳搜索PRM:统一强化学习与基于搜索的文本生成
机构 * Rutgers University(新泽西州立大学) ; Nanyang Technological University(南洋理工大学) ; University of Connecticut(康涅狄格大学) ; Fudan University(复旦大学) ; NVIDIA Research(NVIDIA研究) ; Red Hat AI Innovation(红帽AI创新) ; MIT-IBM Watson AI Lab(MIT-IBM沃森AI实验室) ; Massachusetts Institute of Technology(麻省理工学院)
AI总结 本文提出AIRL-S,通过强化学习与搜索技术的统一,利用奖励函数直接学习动态PRM,提升推理链扩展和跨任务泛化能力,实验显示性能提升9%并优于基线PRM。
déjà vu?通过眼动模式解码重复阅读
机构 * Faculty of Data and Decision Sciences, Technion - Israel Institute of Technology(数据与决策科学学院,特拉维夫大学-以色列理工学院) ; Department of Brain and Cognitive Sciences, Massachusetts Institute of Technology(脑与认知科学系,麻省理工学院)
AI总结 通过分析眼动模式,研究自动判断读者是否曾接触过同一文本,并探索记忆效应在重复阅读中的作用。
Journal ref https://aclanthology.org/2025.acl-long.956/
XAI-CLIP: 通过区域感兴趣引导扰动框架实现多模态视觉-语言模型中可解释的医学图像分割
机构 * King Fahd University of Petroleum and Minerals(国王法赫德石油和矿物大学) ; Massachusetts Institute of Technology(麻省理工学院) ; Imperial College London(伦敦帝国学院) ; KFUPM-SDAIA Joint Research Centre for Artificial Intelligence(KFUPM-SDAIA联合人工智能研究中心)
AI总结 XAI-CLIP通过多模态视觉-语言模型嵌入实现医学图像分割的可解释性和效率提升,减少计算开销并提高分割精度。
主动概念学习中的大胆猜测与温和猜测
机构 * Massachusetts Institute of Technology(麻省理工学院) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 本文研究了主动概念学习中EIG与PTS策略的权衡,发现EIG在复杂规则中有效但对简单规则表现欠佳,而PTS通过安全查询维持提案有效性,提升收敛速度。
通过质量感知的分词解锁噪声真实世界语料用于基础模型预训练
机构 * Broad Institute of MIT and Harvard, Cambridge, MA, USA(麻省理工学院与哈佛大学Broad研究所) ; Massachusetts Institute of Technology, Cambridge, MA, USA(麻省理工学院) ; Koch Institute for Integrative Cancer Research, MIT, Cambridge, MA, USA(麻省理工学院Koch整合癌症研究 institute) ; Department of Neurology and Neurosurgery, McGill University, Montreal, Canada(麦吉尔大学神经学与神经外科系) ; The Montreal Neurological Hospital-Institute, Montreal, Canada(蒙特利尔神经科学医院-研究所)
AI总结 本研究提出质量感知分词方法,通过双层优化、强化学习和自适应参数学习机制,提升基础模型在基因组和金融领域的预训练效果。
通过漂移进行生成建模
机构 * MIT(麻省理工学院) ; Harvard University(哈佛大学)
AI总结 本文提出漂移模型,通过在训练过程中演进化分布实现一步生成,取得ImageNet上优异的生成效果。
Comments Project page: https://lambertae.github.io/projects/drifting/
在函数空间中编码语法对象和Merge操作
机构 * Department of Mathematics(数学系) ; Department of Computing(计算系) ; Mathematical Sciences, California Institute of Technology, CA 91125, USA(数学科学,加州理工学院) ; Institute for Data Systems(数据系统研究所) ; Society, Massachusetts Institute of Technology, Cambridge, MA 02139, USA(社会研究所,麻省理工学院)
AI总结 该研究在函数空间中通过构造半环结构和霍普夫代数马尔可夫链,实现了语法对象和Merge操作的神经计算实现。
Comments 48 pages, LaTeX, 4 png figures; v2: expository changes
利用人工智能进行需求分析的冒险
机构 * Freie Universität Berlin(柏林自由大学) ; Massachusetts Institute of Technology(麻省理工学院) ; University of Hamburg(汉堡大学) ; UC San Diego(圣地亚哥大学)
AI总结 本文利用AI生成多模态产品表示,提升需求分析的预测准确性与因果推断的可信度。
Comments 35 pages, 8 figures
VowelPrompt:通过元音层面的语调增强从文本中听出语音情感
机构 * Meta Superintelligence Labs(Meta超智能实验室) ; Arizona State University(亚利桑那州立大学) ; Massachusetts Institute of Technology(麻省理工学院)
AI总结 VowelPrompt通过元音层面的语调增强,提升LLM在语音情感识别中的表现并生成可解释的解释。
Comments Accepted to ICLR 2026
好奇心是知识:基于主动推断的自洽学习与无遗憾优化
机构 * Department of Aeronautics and Astronautics, Massachusetts Institute of Technology, Cambridge, MA 02139, USA(航空与宇航系,麻省理工学院) ; School of Industrial and Systems Engineering, Georgia Institute of Technology, Atlanta, GA 30332, USA(工业与系统工程学院,佐治亚理工学院)
AI总结 本文提出基于主动推断的自洽学习与无遗憾优化理论,证明足够的好奇心可同时确保学习一致性与优化无遗憾,并通过实验验证其有效性。
LOBSTgER-enhance: 一种水下图像增强流水线
机构 * Massachusetts Institute of Technology(麻省理工学院)
AI总结 LOBSTgER-enhance通过合成破坏流水线和扩散生成技术,实现了水下图像的高质量增强,提升了图像的视觉一致性和泛化能力。
Comments 12 pages, 30 figures, work done as part of LOBSTgER
一种结合基于优化和解析逆运动学的方法框架
机构 * Computer Science and Artificial Intelligence Laboratory (CSAIL), Massachusetts Institute of Technology(计算机科学与人工智能实验室(CSAIL),麻省理工学院)
AI总结 本文提出了一种结合解析和优化方法的逆运动学框架,通过变量替换提升求解效率,实验表明在碰撞避免等复杂任务中表现更优。
Comments 19 pages, 5 figures, 6 tables. Under submission
ReFORM:通过噪声操控实现支持下的离线强化学习
机构 * MIT(麻省理工学院) ; Boston University(波士顿大学) ; MIT Lincoln Laboratory(麻省理工学院林伍德实验室)
AI总结 ReFORM通过反射流策略和噪声操控,在离线强化学习中实现更宽松的支持约束,从而在多模态分布下提升策略性能。
Comments 24 pages, 17 figures; Accepted by the fourteenth International Conference on Learning Representations (ICLR 2026)
与AI代理合作:关于团队合作、生产率和表现的实地实验
机构 * Johns Hopkins Carey Business School(约翰霍普金斯 Carey 商学院) ; MIT Sloan School of Management(麻省理工 Sloan 管理学院)
AI总结 本研究通过实地实验发现,人类与AI合作能提升广告生产率和质量,通过任务导向沟通、委托工作和识别AI合作者三种机制实现。
Comments 59 pages, 3 figures, 14 tables
数据中的潜意识效应:通过对数线性性的一般机制
机构 * University of California, Berkeley(加州大学伯克利分校) ; Microsoft Research(微软研究院) ; Courant Institute, New York University(纽约大学Courant研究所) ; Massachusetts Institute of Technology(麻省理工学院)
AI总结 本文提出Logit-Linear-Selection方法,揭示数据集中的隐藏效应机制,通过选择特定子集使模型表现出多样化行为。
Comments Code available at https://github.com/ishaqadenali/logit-linear-selection
忘却以泛化:用于联邦学习中泛化的迭代适应
机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) ; Harvard College(哈佛大学) ; Imperial College London(帝国理工学院伦敦分校)
AI总结 本文提出迭代联邦适应方法,通过生成层面的忘却和进化策略提升联邦学习在非iid数据下的泛化能力,实验表明在多个数据集上平均提升21.5%。
从原理出发的AI发现分数量子霍尔液体的结晶
机构 * Department of Physics, Massachusetts Institute of Technology, Cambridge, MA-02139, USA(麻省理工学院物理系)
AI总结 MagNet 通过从原理出发的 AI 方法,在强朗德-勒夫混合 regime 中发现分数量子霍尔液体和电子晶体的基态。
Comments 5 pages + SM
通过测试时间缩放解码模糊情绪在音频-语言模型中
机构 * University of Melbourne(墨尔本大学) ; University of Auckland(奥克兰大学) ; South China Normal University(华南师范大学) ; MIT(麻省理工学院) ; University of Cambridge(剑桥大学) ; RMIT(皇家墨尔本理工大学)
AI总结 本文提出首个基于测试时间缩放的音频语言模型模糊情绪识别基准,系统比较了八种ALMs和五种TTS策略,揭示了模型容量与情感模糊性之间的交互挑战。
PaTH Attention: 通过累积Householder变换实现位置编码
机构 * Massachusetts Institute of Technology(麻省理工学院) ; MIT-IBM Watson AI Lab(MIT-IBM Watson人工智能实验室) ; Stanford University(斯坦福大学) ; Microsoft(微软公司)
AI总结 PaTH Attention通过累积Householder变换实现数据依赖的位置编码,提升Transformer模型的表达能力。
Comments NeurIPS 2025 camera ready
超越猜测:测量大型语言模型生成文本在多语言虚假信息中的增长
机构 * Kempelen Institute of Intelligent Technologies(智能技术研究所) ; The Pennsylvania State University(宾夕法尼亚州立大学) ; MIT Lincoln Laboratory(麻省理工学院林赛实验室)
AI总结 本研究通过实证数据证明了LLM在多语言虚假信息中的增长,揭示了不同语言、平台和时间周期中的关键模式。
Comments accepted to Computer magazine
Journal ref Computer (Volume: 59, Issue: 2, February 2026)
在多项式时间内学习精确不变性
机构 * School of CIT, MCML(信息科技学院、微系统实验室) ; MDSI, Technical University of Munich (TUM)(慕尼黑工业大学微系统研究所) ; MIT EECS(麻省理工学院电子工程与计算机科学系) ; MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) ; MIT LIDS(麻省理工学院媒体实验室)
AI总结 本文提出了一种在多项式时间内实现精确不变性的算法,通过利用输入空间的几何属性,达到与核回归相同的泛化误差,是该领域首个实现精确不变性的多项式时间方法。
Journal ref International Conference on Machine Learning (ICML) 2025
一种通用的锐度感知最小化算法类
机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) ; MIT LIDS(麻省理工学院领导力与决策科学研究所) ; MIT(麻省理工学院) ; TU Munich(慕尼黑技术大学) ; Google DeepMind(谷歌DeepMind)
AI总结 本文提出了一种通用的锐度感知最小化算法类,通过引入新的锐度度量,解决了神经网络中参数不变性问题,并展示了Frob-SAM和Det-SAM等实例。
Comments ICML 2024. Code is available at http://github.com/dbahri/universal_sam
Journal ref International Conference on Machine Learning (ICML) 2024
具有语言瓶颈的策略学习
机构 * Stanford University(斯坦福大学) ; Massachusetts Institute of Technology(麻省理工学院) ; Inria(法国国家信息与自动化技术研究院)
AI总结 通过语言瓶颈框架,AI代理能生成可解释的策略规则,提升与人类的协作效率。
Comments Accepted to TMLR (2026)
在不变性下估计概率分歧的样本复杂度界限
机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) ; TU Munich(慕尼黑工业大学)
AI总结 本文研究了在不变性下估计概率分歧的样本复杂度,发现群不变性可减少样本复杂度并提高收敛率。
Comments ICML 2024
Journal ref International Conference on Machine Learning (ICML) 2024
Abacus:一种基于成本的语义运算系统优化器
机构 * MIT(麻省理工学院)
AI总结 Abacus是一种基于成本的优化器,用于优化语义运算系统,通过评估运算符性能并优化系统质量、成本和延迟,实现更高效的文档处理任务。
Comments To be published in VLDB'26, 14 pages, 8 figures
Journal ref PVLDB, 19(5): 1060 - 1073, 2026