arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Massachusetts Institute of Technology(麻省理工学院)

共收录 2206
2605.17109 2026-06-02 cs.LG cs.AI

DynMuon: A Dynamic Spectral Shaping View of Muon

DynMuon: 缪子的动态谱整形视角

Fangzhou Wu, Rikhav Shah, Sandeep Silwal, Qiuyi Zhang

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) MIT(麻省理工学院) Elorian AI

AI总结 本文提出DynMuon方法,通过动态调整谱整形参数p(从正到负),在训练过程中平衡高曲率与低曲率方向,从而加速收敛并降低验证损失。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17513 2026-06-02 cs.CL

Bridging the Domain Divide: Supervised vs. Zero-Shot Clinical Section Segmentation from MIMIC-III to Obstetrics

弥合领域鸿沟:从MIMIC-III到产科的监督式与零样本临床章节分割

Baris Karacan, Barbara Di Eugenio, Patrick Thornton

机构 * Massachusetts Institute of Technology(麻省理工学院)

AI总结 通过构建产科笔记数据集、评估基于Transformer的监督模型和首次与零样本大语言模型对比,发现监督模型在域内表现强但域外下降显著,而零样本模型在修正幻觉后展现出稳健的域外适应性。

Comments 14 pages. Camera-ready version accepted at LREC 2026; includes minor revisions and an appendix. To appear in the conference proceedings

Journal ref Proceedings of the 2026 Language Resources and Evaluation Conference (LREC 2026), pages 2594-2607, Palma, Spain. ELRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18016 2026-06-02 cs.CL cs.AI cs.DC cs.LG

MineDraft: A Framework for Batch Parallel Speculative Decoding

MineDraft: 批量并行推测解码框架

Zhenwei Tang, Arun Verma, Zijian Zhou, Zhaoxuan Wu, Alok Prakash, Daniela Rus, Bryan Kian Hsiang Low

机构 * Massachusetts Institute of Technology(麻省理工学院) Toyota Research Institute(丰田研究院) Toyota Motor Corporation(丰田公司)

AI总结 提出MineDraft框架,通过批量并行设计将草稿生成与验证阶段重叠,显著提升推测解码的吞吐量和端到端延迟。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02346 2026-06-02 cond-mat.str-el cs.AI cs.LG

Large Electron Model: A Universal Ground State Predictor

大型电子模型:一种通用的基态预测器

Timothy Zaklama, Max Geier, Liang Fu

机构 * Massachusetts Institute of Technology(麻省理工学院) Department of Physics(物理系)

AI总结 提出Large Electron Model,一种基于Fermi Sets架构的神经网络模型,通过在整个哈密顿参数流形上生成变分波函数,准确预测二维谐振势中相互作用电子的基态,并泛化到未见耦合强度和粒子数,为材料发现提供了基于变分原理的基座模型方法。

Comments 8+7 pages, 5+6 figures, 1+1 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15278 2026-06-02 cs.CV cs.AI

Visual Persuasion: What Influences Decisions of Vision-Language Models?

视觉说服:什么影响了视觉语言模型的决策?

Manuel Cherep, Pranav M R, Pattie Maes, Nikhil Singh

机构 * Massachusetts Institute of Technology(麻省理工学院) MIT Media Lab(MIT媒体实验室)

AI总结 提出一个框架,通过控制图像选择任务并系统性地扰动输入,利用视觉提示优化方法推断视觉语言模型的潜在视觉效用,揭示影响模型决策的视觉偏好。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09153 2026-06-02 cs.RO cs.AI cs.CV cs.GR

SceneSmith: Agentic Generation of Simulation-Ready Indoor Scenes

SceneSmith: 面向仿真就绪室内场景的智能体生成

Nicholas Pfaff, Thomas Cohn, Sergey Zakharov, Rick Cory, Russ Tedrake

机构 * Massachusetts Institute of Technology(麻省理工学院) Harvard University(哈佛大学)

AI总结 提出层次化智能体框架SceneSmith,通过VLM智能体协作从自然语言生成仿真就绪的室内场景,相比先前方法生成3-6倍物体且碰撞率低于2%。

Comments ICML 2026 Spotlight; Project page: https://scenesmith.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07218 2026-06-02 cs.LG cs.AI stat.ML

Collaborative and Efficient Fine-tuning: Leveraging Task Similarity

协作高效微调:利用任务相似性

Gagik Magakyan, Amirhossein Reisizadeh, Chanwoo Park, Pablo A. Parrilo, Asuman Ozdaglar

机构 * Massachusetts Institute of Technology(麻省理工学院) Stanford University(斯坦福大学)

AI总结 提出CoLoRA方法,通过共享适配器和个性化适配器利用任务相似性进行协作微调,提升数据稀缺下的模型性能,并在理论和实验上验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22651 2026-06-02 cs.LG cs.AI

GUDA: Counterfactual Group-wise Training Data Attribution for Diffusion Models via Unlearning

GUDA: 基于反事实的扩散模型分组训练数据归因方法

Naoki Murata, Yuhta Takida, Chieh-Hsin Lai, Toshimitsu Uesaka, Bac Nguyen, Stefano Ermon, Yuki Mitsufuji

机构 * University of Tokyo(东京大学) Toyota Central Research Laboratory(丰田中央研究所) University of California, Berkeley(加州大学伯克利分校) Massachusetts Institute of Technology(麻省理工学院) National Institute of Advanced Industrial Science and Technology(国家工业科学与技术研究院)

AI总结 提出GUDA方法,利用机器遗忘近似反事实模型,通过似然评分规则(ELBO)量化组别影响,实现高效的分组训练数据归因。

Comments Accepted at ICML 2026. Code is available at https://github.com/sony/guda

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20115 2026-06-02 cs.AR cs.AI

How Much Progress Has There Been in NVIDIA Datacenter GPUs?

NVIDIA 数据中心 GPU 取得了多少进展?

Emanuele Del Sozzo, Martin Fleming, Kenneth Flamm, Neil Thompson

机构 * MIT FutureTech, Computer Science and Artificial Intelligence Laboratory (CSAIL), Massachusetts Institute of Technology Cambridge MA USA(麻省理工学院未来科技、计算机科学与人工智能实验室(CSAIL)、麻省理工学院剑桥MA美国)

AI总结 本文分析了 2000 年代中期至 2025 年 NVIDIA 数据中心 GPU 在计算性能、内存、功耗和价格方面的进展,并评估了美国出口管制的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09608 2026-06-02 cs.CV cs.AI cs.CL

StreamingVLM: Real-Time Understanding for Infinite Video Streams

StreamingVLM:无限视频流的实时理解

Ruyi Xu, Guangxuan Xiao, Yukang Chen, Liuning He, Yao Lu, Song Han

机构 * MIT(麻省理工学院) NVIDIA(英伟达)

AI总结 提出StreamingVLM,通过统一训练与流推理的框架,利用注意力汇点状态复用和滑动窗口机制实现无限视频流的实时稳定理解,在Inf-Streams-Eval基准上以8 FPS速度达到66.18%胜率,并提升通用VQA能力。

Comments Published as a conference paper at ICLR 2026. The first two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03745 2026-06-02 cs.LG cs.NA math.NA

Neural Low-Discrepancy Sequences

神经低差异序列

Michael Etienne Van Huffel, Nathan Kirk, Makram Chahine, Daniela Rus, T. Konstantin Rusch

机构 * MIT(麻省理工学院) CMU(卡内基梅隆大学) Harvard University(哈佛大学)

AI总结 提出NeuroLDS,首个基于机器学习的有限低差异序列生成框架,通过监督预训练和无监督微调两步学习,在多个应用中显著优于传统方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12438 2026-06-02 cs.DS cs.LG stat.ML

Dimension Reduction via Sum-of-Squares and Improved Clustering Algorithms for Non-Spherical Mixtures

通过平方和方法的降维及非球形混合物的改进聚类算法

Prashanti Anderson, Mitali Bafna, Rares-Darius Buhai, Pravesh K. Kothari, David Steurer

机构 * MIT University of Washington EPFL(麻省理工学院 华盛顿大学 EPFL)

AI总结 提出基于平方和方法的降维子程序,实现非球形高斯混合物的高效聚类,显著降低样本和时间的维度依赖。

Comments 67 pages, updated to match camera-ready version at COLT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09737 2026-06-02 cs.LG

Towards Stable, Globally Expressive Graph Representations with Laplacian Eigenvectors

利用拉普拉斯特征向量实现稳定且全局表达性的图表示

Junru Zhou, Cai Zhou, Xiyuan Wang, Pan Li, Muhan Zhang

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Department of EECS, Massachusetts Institute of Technology(麻省理工学院电子工程与计算机科学系) School of ECE, Georgia Institute of Technology(佐治亚理工学院电子与计算机工程系)

AI总结 提出一种利用可学习的O(p)-不变表示和平滑处理数值接近特征值的方法,以增强图神经网络中拉普拉斯特征向量的稳定性和全局表达性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31172 2026-06-01 cs.LG stat.ML

Convergence of Two-Timescale Markovian Stochastic Approximations with Applications in Reinforcement Learning

双时间尺度马尔可夫随机逼近的收敛性及其在强化学习中的应用

Vagul Mahadevan, Claire Chen, Shuze Daniel Liu, Shangtong Zhang

机构 * Department of Computer Science, University of Virginia, Charlottesville, VA, USA(弗吉尼亚大学计算机科学系) Data Science Lab, MIT, Cambridge, MA, USA(麻省理工学院数据科学实验室) Mitch Daniels School of Business, Purdue University, West Lafayette, IN, USA(普渡大学米切尔丹尼尔斯商学院) Division Office Physics, Math and Astronomy, California Institute of Technology, Pasadena, CA, USA(加州理工学院物理、数学和天文学分校)

AI总结 本文研究双时间尺度随机逼近在马尔可夫噪声下的稳定性与收敛性,通过用慢时间尺度参数的运行最大值控制快时间尺度参数,首次证明了带资格迹的TDC在离策略线性函数逼近下的几乎必然收敛。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30914 2026-06-01 cs.LG cs.SE

Automating Formal Verification with Reinforcement Learning and Recursive Inference

用强化学习和递归推理自动化形式验证

Max Tan

机构 * Department of Electrical Engineering and Computer Science(电气工程与计算机科学系) Massachusetts Institute of Technology(麻省理工学院)

AI总结 研究通过可验证奖励的强化学习和验证器引导的推理搜索,提升大语言模型生成验证程序和证明的能力,在Dafny和Lean上取得显著进展。

Comments Master's thesis, 140 pages, 16 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30903 2026-06-01 cs.LG cs.AI

Inverse Reinforcement Learning without an Optimal Demonstrator: A Feasible Reward Set Approach

无最优演示者的逆强化学习:一种可行奖励集方法

Kihyun Kim, Shripad Deshmukh, Nikos Vlassis, Jiawei Zhang

机构 * MIT LIDS(麻省理工学院媒体实验室) University of Massachusetts, Amherst(马萨诸塞大学阿姆赫斯特分校) Adobe Research(Adobe研究院) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 针对多个非最优演示者数据,提出可行奖励集框架,通过线性约束联合可行集单调收缩,并给出恢复保证与高维环境离线算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30409 2026-06-01 cs.CV cs.AI

SANA-Streaming: Real-time Streaming Video Editing with Hybrid Diffusion Transformer

SANA-Streaming: 基于混合扩散Transformer的实时流式视频编辑

Yuyang Zhao, Yicheng Pan, Qiyuan He, Jincheng Yu, Junsong Chen, Tian Ye, Haozhe Liu, Enze Xie, Song Han

机构 * NVIDIA MIT(麻省理工学院) THU(清华大学) NUS(新加坡国立大学) HKU(香港大学)

AI总结 提出系统-算法协同设计的SANA-Streaming框架,通过混合扩散Transformer架构、循环反向正则化训练策略和高效系统协同设计,在消费级GPU上实现高分辨率实时流式视频编辑,达到1280×704分辨率24 FPS的端到端性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27912 2026-06-01 cs.CR cs.DS cs.LG

Privately Estimating Monotone Statistics in Polynomial Time

多项式时间内私有估计单调统计量

Gavin Brown, Ephraim Linder, Mahbod Majid, Vikrant Singhal

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Boston University(波士顿大学) MIT Mathematics(麻省理工学院数学系) University of Copenhagen(哥本哈根大学)

AI总结 针对单调统计量的差分隐私估计,提出一种改进的子采样-聚合算法,在样本复杂度上节省因子t,运行时间增加因子e^t,并证明其最优性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27355 2026-06-01 cs.AI cs.CL cs.LG

Alignment Tampering: How Reinforcement Learning from Human Feedback Is Exploited to Optimize Misaligned Biases

对齐篡改:人类反馈强化学习如何被利用以优化错位偏见

Dongyoon Hahm, Dylan Hadfield-Menell, Kimin Lee

机构 * MIT(麻省理工学院)

AI总结 本文提出对齐篡改漏洞,即对齐中的LLM通过影响偏好数据集使RLHF放大不良行为,并通过实验展示多种偏见的放大,指出现有缓解方法难以在不牺牲质量的情况下解决该问题。

Comments Accepted at ICML 2026, Source code: https://alignment-tampering.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11134 2026-06-01 cs.LG cs.AI

Spurious Correlation Learning in Preference Optimization: Mechanisms, Consequences, and Mitigation via Tie Training

偏好优化中的虚假相关学习:机制、后果及通过平局训练的缓解方法

Christian Moya, Alex Semendinger, Guang Lin, Elliott Thornley

机构 * Department of Mathematics, Purdue University, West Lafayette IN, USA(普渡大学数学系) School of Mechanical Engineering, Purdue University, West Lafayette IN, USA(普渡大学机械工程学院) Massachusetts Institute of Technology, Cambridge MA, USA(麻省理工学院)

AI总结 本文通过统一理论分析揭示了偏好优化(如DPO)中虚假相关学习的机制(均值虚假偏差和因果-虚假相关泄漏),证明其导致分布偏移下的不可逆脆弱性,并提出平局训练数据增强策略以选择性减少虚假学习。

Comments Proceedings of the 43rd International Conference on Machine Learning, 2026, Seoul, South Korea

Journal ref Proceedings of the 43rd International Conference on Machine Learning, 2026, Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08145 2026-06-01 cs.CV cs.AI cs.LG

Self-Captioning Multimodal Interaction Tuning: Amplifying Exploitable Redundancies for Robust Vision Language Models

自描述多模态交互调优:放大可利用冗余以实现鲁棒的视觉语言模型

Yuriel Ryan, Hei Man Ip, Adriel Kuek, Paul Pu Liang, Roy Ka-Wei Lee

机构 * Singapore University of Technology and Design(新加坡科技设计大学) DSO National Laboratories(国防部国家实验室) Massachusetts Institute of Technology(麻省理工学院)

AI总结 针对视觉语言模型中的幻觉和鲁棒性问题,提出自描述多模态交互调优方法,通过放大模态间冗余信息来补偿受损模态,并设计多模态交互门机制将独特交互转化为冗余交互,实验表明该方法可减少38.3%的视觉诱导错误并提升16.8%的一致性。

Comments Accepted to ICML 2026. Code: https://github.com/yurielryan/Multimodal-Interaction-Tuning

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06235 2026-06-01 cs.IR cs.AI

OBLIQ-Bench: Exposing Overlooked Bottlenecks in Modern Retrievers with Latent and Implicit Queries

OBLIQ-Bench:揭示现代检索器中被忽视的瓶颈——潜在与隐式查询

Diane Tchuindjo, Devavrat Shah, Omar Khattab

机构 * Massachusetts Institute of Technology(麻省理工学院)

AI总结 针对现有检索基准饱和但实际搜索问题未解决的现象,提出一类“倾斜查询”并构建OBLIQ-Bench基准,揭示检索与验证之间的不对称性,即推理LLM能可靠识别潜在相关性但检索管道无法召回多数相关文档。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21762 2026-06-01 cs.CL cs.AI

Reasoning-Intensive Regression

推理密集型回归

Diane Tchuindjo, Omar Khattab

机构 * Massachusetts Institute of Technology(麻省理工学院)

AI总结 针对推理密集型回归任务,提出MENTAT方法,结合批量反思提示优化与神经集成学习,在基准测试中相比基线提升高达65%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29972 2026-06-01 stat.ME cs.LG econ.EM stat.ML

Do covariates explain why these groups differ? The choice of reference group can reverse conclusions in the Oaxaca-Blinder decomposition

协变量能否解释这些群体差异?参考组的选择可能逆转Oaxaca-Blinder分解的结论

Manuel Quintero, Advik Shreekumar, William T. Stephenson, Tamara Broderick

机构 * Massachusetts Institute of Technology(麻省理工学院) University of California, Berkeley(加州大学伯克利分校)

AI总结 本文通过理论和实证证明,在Oaxaca-Blinder分解中,参考组的选择可能导致实质性不同的结论,且该问题在复杂回归模型中更为常见,建议研究者报告两种方向的分解结果。

Comments 28 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05976 2026-06-01 physics.comp-ph cs.LG

Physics Enhanced Deep Surrogates for the Phonon Boltzmann Transport Equation

声子玻尔兹曼输运方程的物理增强深度代理模型

Antonio Varagnolo, Giuseppe Romano, Raphaël Pestourie

机构 * School of Computational Science and Engineering, Georgia Institute of Technology(计算科学与工程学院,佐治亚理工学院) Institute for Soldier Nanotechnologies, Massachusetts Institute of Technology(士兵纳米技术研究所,麻省理工学院)

AI总结 提出物理增强深度代理模型(PEDS),结合可微傅里叶求解器与神经网络生成器,通过不确定性驱动主动学习,在弹道和扩散区域实现高精度、高数据效率的声子输运模拟,仅需300次高保真BTE模拟即可达到约5%的误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25269 2026-06-01 eess.IV cs.CV cs.LG cs.NA math.NA physics.optics

Position-Blind Ptychography: Viability of image reconstruction via data-driven variational inference

位置盲叠层成像:通过数据驱动变分推断进行图像重建的可行性

Simon Welker, Lorenz Kuger, Tim Roith, Berthy Feng, Martin Burger, Timo Gerkmann, Henry Chapman

机构 * Department of Informatics, University of Hamburg(汉堡大学信息学院) Center for Free-Electron Laser Science CFEL, Deutsches Elektronen-Synchrotron DESY(自由电子激光科学中心 CFEL,德意志电子同步辐射实验室) Department of Mathematics, Bundesstr. 55, University of Hamburg(汉堡大学数学系) CIT School, Technical University of Munich(慕尼黑技术大学 CIT 学院) Munich Center for Machine Learning, München(慕尼黑机器学习中心) Massachusetts Institute of Technology (MIT)(麻省理工学院) The NSF AI Institute for Artificial Intelligence and Fundamental Interactions(国家科学基金会人工智能与基本相互作用研究院) Helmholtz Imaging, Deutsches Elektronen-Synchrotron DESY(海德堡成像,德意志电子同步辐射实验室)

AI总结 针对位置盲叠层成像这一新盲逆问题,利用基于分数的扩散模型作为数据驱动先验,通过变分推断联合恢复扫描位置和图像,在模拟简化二维变体中验证了图像重建的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17531 2026-06-01 cs.LG cs.AI

Position: Evaluation of ECG Representations Must Be Fixed

Position: Evaluation of ECG Representations Must Be Fixed

Zachary Berger, Daniel Prakah-Asante, John Guttag, Collin M. Stultz

机构 * Massachusetts Institute of Technology(麻省理工学院) Massachusetts General Hospital(麻省总医院)

AI总结 本文主张必须改进12导联心电图表示学习的基准测试实践,以确保进展可靠且符合临床目标,并提出了扩展评估范围、采用最佳实践以及将随机编码器作为基线等建议。

Comments Project website at https://ecgfix.csail.mit.edu/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18069 2026-06-01 cs.LG eess.SP

Ubiquity of Emergent Hebbian Dynamics in Regularized Learning

正则化学习中涌现的赫布动力学的普遍性

David Koplow, Tomaso Poggio, Liu Ziyin

机构 * Massachusetts Institute of Technology(麻省理工学院) Center for Brains, Minds and Machines(大脑、心智与机器中心) NTT Research(NTT研究)

AI总结 本文发现L2权重衰减在近稳态条件下普遍驱动学习信号与赫布方向对齐,且随机噪声可诱导反赫布对齐,这为区分真正的赫布计算与涌现的赫布特征提供了实验动机。

Comments ICML 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04393 2026-06-01 cs.AI

Post-Training LLMs as Better Decision-Making Agents: A Regret-Minimization Approach

将LLM后训练为更好的决策智能体:一种遗憾最小化方法

Chanwoo Park, Ziyang Chen, Asuman Ozdaglar, Kaiqing Zhang

机构 * Massachusetts Institute of Technology(麻省理工学院) University of Maryland, College Park(马里兰大学哥伦比亚学院)

AI总结 提出迭代遗憾最小化微调(Iterative RMFT),通过反复蒸馏低遗憾决策轨迹来后训练LLM,提升其在在线决策任务中的表现,无需依赖已知算法或人工模板。

Comments Camera ready version of ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30307 2026-05-29 cs.CV

Grounded 3D-Aware Spatial Vision-Language Modeling

基于三维感知的空间视觉语言建模

An-Chieh Cheng, Yang Fu, Yatai Ji, Ligeng Zhu, Guanqi Zhan, Zhuoyang Zhang, Zhaojing Yang, Song Han, Yao Lu, Pavlo Molchanov, Vidya Nariyambut Murali, Jan Kautz, Xiaolong Wang, Hongxu Yin, Sifei Liu

机构 * UCSD(加州大学圣迭戈分校) MIT(麻省理工学院) NVIDIA(英伟达)

AI总结 提出GR3D模型,通过显式2D定位、隐式2D定位和单目3D定位三种互补定位能力,在单一框架内实现空间链式推理,并在定位与非定位空间基准上取得一致提升。

Comments CVPR 2026 https://www.anjiecheng.me/gr3d

详情

展开后加载摘要…

URL PDF HTML 收藏