DynMuon: A Dynamic Spectral Shaping View of Muon
DynMuon: 缪子的动态谱整形视角
机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; MIT(麻省理工学院) ; Elorian AI
AI总结 本文提出DynMuon方法,通过动态调整谱整形参数p(从正到负),在训练过程中平衡高曲率与低曲率方向,从而加速收敛并降低验证损失。
Comments 21 pages
高校专区
DynMuon: 缪子的动态谱整形视角
机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; MIT(麻省理工学院) ; Elorian AI
AI总结 本文提出DynMuon方法,通过动态调整谱整形参数p(从正到负),在训练过程中平衡高曲率与低曲率方向,从而加速收敛并降低验证损失。
Comments 21 pages
弥合领域鸿沟:从MIMIC-III到产科的监督式与零样本临床章节分割
机构 * Massachusetts Institute of Technology(麻省理工学院)
AI总结 通过构建产科笔记数据集、评估基于Transformer的监督模型和首次与零样本大语言模型对比,发现监督模型在域内表现强但域外下降显著,而零样本模型在修正幻觉后展现出稳健的域外适应性。
Comments 14 pages. Camera-ready version accepted at LREC 2026; includes minor revisions and an appendix. To appear in the conference proceedings
Journal ref Proceedings of the 2026 Language Resources and Evaluation Conference (LREC 2026), pages 2594-2607, Palma, Spain. ELRA 2026
MineDraft: 批量并行推测解码框架
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Toyota Research Institute(丰田研究院) ; Toyota Motor Corporation(丰田公司)
AI总结 提出MineDraft框架,通过批量并行设计将草稿生成与验证阶段重叠,显著提升推测解码的吞吐量和端到端延迟。
Comments Accepted at ICML 2026
大型电子模型:一种通用的基态预测器
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Department of Physics(物理系)
AI总结 提出Large Electron Model,一种基于Fermi Sets架构的神经网络模型,通过在整个哈密顿参数流形上生成变分波函数,准确预测二维谐振势中相互作用电子的基态,并泛化到未见耦合强度和粒子数,为材料发现提供了基于变分原理的基座模型方法。
Comments 8+7 pages, 5+6 figures, 1+1 tables
视觉说服:什么影响了视觉语言模型的决策?
机构 * Massachusetts Institute of Technology(麻省理工学院) ; MIT Media Lab(MIT媒体实验室)
AI总结 提出一个框架,通过控制图像选择任务并系统性地扰动输入,利用视觉提示优化方法推断视觉语言模型的潜在视觉效用,揭示影响模型决策的视觉偏好。
Comments Accepted to ICML 2026
SceneSmith: 面向仿真就绪室内场景的智能体生成
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Harvard University(哈佛大学)
AI总结 提出层次化智能体框架SceneSmith,通过VLM智能体协作从自然语言生成仿真就绪的室内场景,相比先前方法生成3-6倍物体且碰撞率低于2%。
Comments ICML 2026 Spotlight; Project page: https://scenesmith.github.io/
协作高效微调:利用任务相似性
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Stanford University(斯坦福大学)
AI总结 提出CoLoRA方法,通过共享适配器和个性化适配器利用任务相似性进行协作微调,提升数据稀缺下的模型性能,并在理论和实验上验证其有效性。
GUDA: 基于反事实的扩散模型分组训练数据归因方法
机构 * University of Tokyo(东京大学) ; Toyota Central Research Laboratory(丰田中央研究所) ; University of California, Berkeley(加州大学伯克利分校) ; Massachusetts Institute of Technology(麻省理工学院) ; National Institute of Advanced Industrial Science and Technology(国家工业科学与技术研究院)
AI总结 提出GUDA方法,利用机器遗忘近似反事实模型,通过似然评分规则(ELBO)量化组别影响,实现高效的分组训练数据归因。
Comments Accepted at ICML 2026. Code is available at https://github.com/sony/guda
NVIDIA 数据中心 GPU 取得了多少进展?
机构 * MIT FutureTech, Computer Science and Artificial Intelligence Laboratory (CSAIL), Massachusetts Institute of Technology Cambridge MA USA(麻省理工学院未来科技、计算机科学与人工智能实验室(CSAIL)、麻省理工学院剑桥MA美国)
AI总结 本文分析了 2000 年代中期至 2025 年 NVIDIA 数据中心 GPU 在计算性能、内存、功耗和价格方面的进展,并评估了美国出口管制的影响。
StreamingVLM:无限视频流的实时理解
机构 * MIT(麻省理工学院) ; NVIDIA(英伟达)
AI总结 提出StreamingVLM,通过统一训练与流推理的框架,利用注意力汇点状态复用和滑动窗口机制实现无限视频流的实时稳定理解,在Inf-Streams-Eval基准上以8 FPS速度达到66.18%胜率,并提升通用VQA能力。
Comments Published as a conference paper at ICLR 2026. The first two authors contributed equally to this work
神经低差异序列
机构 * MIT(麻省理工学院) ; CMU(卡内基梅隆大学) ; Harvard University(哈佛大学)
AI总结 提出NeuroLDS,首个基于机器学习的有限低差异序列生成框架,通过监督预训练和无监督微调两步学习,在多个应用中显著优于传统方法。
Comments ICML 2026
通过平方和方法的降维及非球形混合物的改进聚类算法
机构 * MIT University of Washington EPFL(麻省理工学院 华盛顿大学 EPFL)
AI总结 提出基于平方和方法的降维子程序,实现非球形高斯混合物的高效聚类,显著降低样本和时间的维度依赖。
Comments 67 pages, updated to match camera-ready version at COLT 2026
利用拉普拉斯特征向量实现稳定且全局表达性的图表示
机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) ; Department of EECS, Massachusetts Institute of Technology(麻省理工学院电子工程与计算机科学系) ; School of ECE, Georgia Institute of Technology(佐治亚理工学院电子与计算机工程系)
AI总结 提出一种利用可学习的O(p)-不变表示和平滑处理数值接近特征值的方法,以增强图神经网络中拉普拉斯特征向量的稳定性和全局表达性。
双时间尺度马尔可夫随机逼近的收敛性及其在强化学习中的应用
机构 * Department of Computer Science, University of Virginia, Charlottesville, VA, USA(弗吉尼亚大学计算机科学系) ; Data Science Lab, MIT, Cambridge, MA, USA(麻省理工学院数据科学实验室) ; Mitch Daniels School of Business, Purdue University, West Lafayette, IN, USA(普渡大学米切尔丹尼尔斯商学院) ; Division Office Physics, Math and Astronomy, California Institute of Technology, Pasadena, CA, USA(加州理工学院物理、数学和天文学分校)
AI总结 本文研究双时间尺度随机逼近在马尔可夫噪声下的稳定性与收敛性,通过用慢时间尺度参数的运行最大值控制快时间尺度参数,首次证明了带资格迹的TDC在离策略线性函数逼近下的几乎必然收敛。
Comments ICML 2026
用强化学习和递归推理自动化形式验证
机构 * Department of Electrical Engineering and Computer Science(电气工程与计算机科学系) ; Massachusetts Institute of Technology(麻省理工学院)
AI总结 研究通过可验证奖励的强化学习和验证器引导的推理搜索,提升大语言模型生成验证程序和证明的能力,在Dafny和Lean上取得显著进展。
Comments Master's thesis, 140 pages, 16 figures, 17 tables
无最优演示者的逆强化学习:一种可行奖励集方法
机构 * MIT LIDS(麻省理工学院媒体实验室) ; University of Massachusetts, Amherst(马萨诸塞大学阿姆赫斯特分校) ; Adobe Research(Adobe研究院) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
AI总结 针对多个非最优演示者数据,提出可行奖励集框架,通过线性约束联合可行集单调收缩,并给出恢复保证与高维环境离线算法。
SANA-Streaming: 基于混合扩散Transformer的实时流式视频编辑
机构 * NVIDIA ; MIT(麻省理工学院) ; THU(清华大学) ; NUS(新加坡国立大学) ; HKU(香港大学)
AI总结 提出系统-算法协同设计的SANA-Streaming框架,通过混合扩散Transformer架构、循环反向正则化训练策略和高效系统协同设计,在消费级GPU上实现高分辨率实时流式视频编辑,达到1280×704分辨率24 FPS的端到端性能。
多项式时间内私有估计单调统计量
机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; Boston University(波士顿大学) ; MIT Mathematics(麻省理工学院数学系) ; University of Copenhagen(哥本哈根大学)
AI总结 针对单调统计量的差分隐私估计,提出一种改进的子采样-聚合算法,在样本复杂度上节省因子t,运行时间增加因子e^t,并证明其最优性。
对齐篡改:人类反馈强化学习如何被利用以优化错位偏见
机构 * MIT(麻省理工学院)
AI总结 本文提出对齐篡改漏洞,即对齐中的LLM通过影响偏好数据集使RLHF放大不良行为,并通过实验展示多种偏见的放大,指出现有缓解方法难以在不牺牲质量的情况下解决该问题。
Comments Accepted at ICML 2026, Source code: https://alignment-tampering.github.io/
偏好优化中的虚假相关学习:机制、后果及通过平局训练的缓解方法
机构 * Department of Mathematics, Purdue University, West Lafayette IN, USA(普渡大学数学系) ; School of Mechanical Engineering, Purdue University, West Lafayette IN, USA(普渡大学机械工程学院) ; Massachusetts Institute of Technology, Cambridge MA, USA(麻省理工学院)
AI总结 本文通过统一理论分析揭示了偏好优化(如DPO)中虚假相关学习的机制(均值虚假偏差和因果-虚假相关泄漏),证明其导致分布偏移下的不可逆脆弱性,并提出平局训练数据增强策略以选择性减少虚假学习。
Comments Proceedings of the 43rd International Conference on Machine Learning, 2026, Seoul, South Korea
Journal ref Proceedings of the 43rd International Conference on Machine Learning, 2026, Seoul, South Korea
自描述多模态交互调优:放大可利用冗余以实现鲁棒的视觉语言模型
机构 * Singapore University of Technology and Design(新加坡科技设计大学) ; DSO National Laboratories(国防部国家实验室) ; Massachusetts Institute of Technology(麻省理工学院)
AI总结 针对视觉语言模型中的幻觉和鲁棒性问题,提出自描述多模态交互调优方法,通过放大模态间冗余信息来补偿受损模态,并设计多模态交互门机制将独特交互转化为冗余交互,实验表明该方法可减少38.3%的视觉诱导错误并提升16.8%的一致性。
Comments Accepted to ICML 2026. Code: https://github.com/yurielryan/Multimodal-Interaction-Tuning
OBLIQ-Bench:揭示现代检索器中被忽视的瓶颈——潜在与隐式查询
机构 * Massachusetts Institute of Technology(麻省理工学院)
AI总结 针对现有检索基准饱和但实际搜索问题未解决的现象,提出一类“倾斜查询”并构建OBLIQ-Bench基准,揭示检索与验证之间的不对称性,即推理LLM能可靠识别潜在相关性但检索管道无法召回多数相关文档。
推理密集型回归
机构 * Massachusetts Institute of Technology(麻省理工学院)
AI总结 针对推理密集型回归任务,提出MENTAT方法,结合批量反思提示优化与神经集成学习,在基准测试中相比基线提升高达65%。
协变量能否解释这些群体差异?参考组的选择可能逆转Oaxaca-Blinder分解的结论
机构 * Massachusetts Institute of Technology(麻省理工学院) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 本文通过理论和实证证明,在Oaxaca-Blinder分解中,参考组的选择可能导致实质性不同的结论,且该问题在复杂回归模型中更为常见,建议研究者报告两种方向的分解结果。
Comments 28 pages, 4 figures
声子玻尔兹曼输运方程的物理增强深度代理模型
机构 * School of Computational Science and Engineering, Georgia Institute of Technology(计算科学与工程学院,佐治亚理工学院) ; Institute for Soldier Nanotechnologies, Massachusetts Institute of Technology(士兵纳米技术研究所,麻省理工学院)
AI总结 提出物理增强深度代理模型(PEDS),结合可微傅里叶求解器与神经网络生成器,通过不确定性驱动主动学习,在弹道和扩散区域实现高精度、高数据效率的声子输运模拟,仅需300次高保真BTE模拟即可达到约5%的误差。
位置盲叠层成像:通过数据驱动变分推断进行图像重建的可行性
机构 * Department of Informatics, University of Hamburg(汉堡大学信息学院) ; Center for Free-Electron Laser Science CFEL, Deutsches Elektronen-Synchrotron DESY(自由电子激光科学中心 CFEL,德意志电子同步辐射实验室) ; Department of Mathematics, Bundesstr. 55, University of Hamburg(汉堡大学数学系) ; CIT School, Technical University of Munich(慕尼黑技术大学 CIT 学院) ; Munich Center for Machine Learning, München(慕尼黑机器学习中心) ; Massachusetts Institute of Technology (MIT)(麻省理工学院) ; The NSF AI Institute for Artificial Intelligence and Fundamental Interactions(国家科学基金会人工智能与基本相互作用研究院) ; Helmholtz Imaging, Deutsches Elektronen-Synchrotron DESY(海德堡成像,德意志电子同步辐射实验室)
AI总结 针对位置盲叠层成像这一新盲逆问题,利用基于分数的扩散模型作为数据驱动先验,通过变分推断联合恢复扫描位置和图像,在模拟简化二维变体中验证了图像重建的可行性。
Position: Evaluation of ECG Representations Must Be Fixed
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Massachusetts General Hospital(麻省总医院)
AI总结 本文主张必须改进12导联心电图表示学习的基准测试实践,以确保进展可靠且符合临床目标,并提出了扩展评估范围、采用最佳实践以及将随机编码器作为基线等建议。
Comments Project website at https://ecgfix.csail.mit.edu/
正则化学习中涌现的赫布动力学的普遍性
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Center for Brains, Minds and Machines(大脑、心智与机器中心) ; NTT Research(NTT研究)
AI总结 本文发现L2权重衰减在近稳态条件下普遍驱动学习信号与赫布方向对齐,且随机噪声可诱导反赫布对齐,这为区分真正的赫布计算与涌现的赫布特征提供了实验动机。
Comments ICML 2026 Camera Ready
将LLM后训练为更好的决策智能体:一种遗憾最小化方法
机构 * Massachusetts Institute of Technology(麻省理工学院) ; University of Maryland, College Park(马里兰大学哥伦比亚学院)
AI总结 提出迭代遗憾最小化微调(Iterative RMFT),通过反复蒸馏低遗憾决策轨迹来后训练LLM,提升其在在线决策任务中的表现,无需依赖已知算法或人工模板。
Comments Camera ready version of ICML 2026
基于三维感知的空间视觉语言建模
机构 * UCSD(加州大学圣迭戈分校) ; MIT(麻省理工学院) ; NVIDIA(英伟达)
AI总结 提出GR3D模型,通过显式2D定位、隐式2D定位和单目3D定位三种互补定位能力,在单一框架内实现空间链式推理,并在定位与非定位空间基准上取得一致提升。
Comments CVPR 2026 https://www.anjiecheng.me/gr3d