arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Massachusetts Institute of Technology(麻省理工学院)

2026-05-29 至 2026-05-29 共收录 19
2605.30307 2026-05-29 cs.CV

Grounded 3D-Aware Spatial Vision-Language Modeling

基于三维感知的空间视觉语言建模

An-Chieh Cheng, Yang Fu, Yatai Ji, Ligeng Zhu, Guanqi Zhan, Zhuoyang Zhang, Zhaojing Yang, Song Han, Yao Lu, Pavlo Molchanov, Vidya Nariyambut Murali, Jan Kautz, Xiaolong Wang, Hongxu Yin, Sifei Liu

机构 * UCSD(加州大学圣迭戈分校) MIT(麻省理工学院) NVIDIA(英伟达)

AI总结 提出GR3D模型,通过显式2D定位、隐式2D定位和单目3D定位三种互补定位能力,在单一框架内实现空间链式推理,并在定位与非定位空间基准上取得一致提升。

Comments CVPR 2026 https://www.anjiecheng.me/gr3d

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29698 2026-05-29 cs.LG physics.chem-ph

A Systematic Evaluation of Molecular Mixture Behavior Prediction

分子混合物行为预测的系统评估

Roel J. Leenhouts, Nathan K. Morgan, William Green, Jan G. Rittig, Florence H. Vermeire

机构 * KU Leuven(卢森堡大学) MIT(麻省理工学院) RWTH Aachen University(亚琛工业大学)

AI总结 提出一个将混合物性质误差分解为纯组分和相互作用成分的评估框架,并基于七个匹配数据集发现绝对精度可能掩盖非理想混合行为的恢复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29645 2026-05-29 cs.LG cs.AI stat.ML

The Sample Complexity of Multiclass and Sparse Contextual Bandits

多类别和稀疏上下文赌博机的样本复杂度

Liad Erez, Fan Chen, Alon Cohen, Tomer Koren, Yishay Mansour, Shay Moran, Alexander Rakhlin

机构 * Tel Aviv University(特拉维夫大学) Massachusetts Institute of Technology(麻省理工学院) Google Research Tel Aviv(谷歌研究特拉维夫) Technion—Israel Institute of Technology(技术学院—以色列理工学院)

AI总结 针对随机i.i.d.上下文赌博机,提出基于决策估计系数和低方差探索的算法,在稀疏奖励下实现接近最优的样本复杂度,并匹配下界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11331 2026-05-29 cs.LG cs.AI

Jailbreak Scaling Laws for Large Language Models: Polynomial-Exponential Crossover

大型语言模型的越狱缩放定律:多项式-指数交叉

Indranil Halder, Annesya Banerjee, Cengiz Pehlevan

机构 * John A. Paulson School of Engineering And Applied Sciences, Harvard University(哈佛大学约翰·A·保罗森工程与应用科学学院) Department of Brain and Cognitive Sciences, Massachusetts Institute of Technology(麻省理工学院脑科学与认知科学系) Speech and Hearing Bioscience and Technology, Harvard Medical School(哈佛医学院语音与听力生物科学与技术系) Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究学院) Center for Brain Science, Harvard University(哈佛大学脑科学中心)

AI总结 研究发现对抗性提示注入攻击可使攻击成功率从无注入时的缓慢多项式增长变为随推理样本数指数增长,并通过自旋玻璃模型从理论上解释了这一现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04733 2026-05-29 cs.CV cs.AI

E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving

E3AD:面向以人为中心的端到端自动驾驶的情感感知视觉-语言-动作模型

Yihong Tang, Haicheng Liao, Tong Nie, Junlin He, Ao Qu, Kehua Chen, Wei Ma, Zhenning Li, Lijun Sun, Chengzhong Xu

机构 * McGill University(麦吉尔大学) University of Macau(澳门大学) The Hong Kong Polytechnic University(香港理工大学) Massachusetts Institute of Technology(麻省理工学院) University of Washington(华盛顿大学)

AI总结 提出E3AD框架,通过连续VAD情感模型和双路径空间推理模块,将情感理解融入视觉-语言-动作模型,实现开放域端到端自动驾驶中的情感感知轨迹规划,在真实数据集上达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03109 2026-05-29 cs.LG cs.AI stat.AP stat.ML

E-valuator: Reliable Agent Verifiers with Sequential Hypothesis Testing

E-valuator: 基于序贯假设检验的可靠智能体验证器

Shuvom Sadhuka, Drew Prinster, Clara Fannjiang, Gabriele Scalia, Bonnie Berger, Aviv Regev, Hanchen Wang

机构 * Genentech(基因泰克) MIT(麻省理工学院) Johns Hopkins(约翰霍普金斯大学) Stanford(斯坦福大学)

AI总结 提出E-valuator方法,将任意黑盒验证器分数转化为具有可控虚警率的决策规则,通过序贯假设检验实现对智能体轨迹的在线监控,提升统计功效并节省令牌。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08548 2026-05-29 cs.AI

A Matter of Interest: Understanding Interestingness of Math Problems in Humans and Language Models

兴趣问题:理解人类与语言模型对数学问题的兴趣度

Shubhra Mishra, Yuka Machino, Gabriel Poesia, Albert Jiang, Joy Hsu, Adrian Weller, Challenger Mishra, David Broman, Joshua B. Tenenbaum, Mateja Jamnik, Cedegao E. Zhang, Katherine M. Collins

机构 * KTH Royal Institute of Technology(皇家理工学院) Stanford University(斯坦福大学) Massachusetts Institute of Technology(麻省理工学院) University of Cambridge(剑桥大学) Kempner Institute at Harvard University(哈佛大学肯普尼研究所) Mistral AI

AI总结 通过比较大型语言模型与不同数学背景人群对数学问题的兴趣度评分,研究LLM在兴趣判断上与人类的一致性,并评估其生成有趣问题的能力。

Comments Published at the Math-AI Workshop, NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22504 2026-05-29 cs.AI cs.LG

Estimating the Empowerment of Language Model Agents

估计语言模型代理的赋权能力

Jinyeop Song, Jeff Gore, Max Kleiman-Weiner

机构 * Massachusetts Institute of Technology(麻省理工学院) University of Washington(华盛顿大学)

AI总结 提出基于信息论中赋权概念的评估框架EELMA,通过多轮文本交互近似有效赋权,实验表明赋权与任务性能强相关,可作为与任务成功度量互补的通用评估指标。

Comments Published at the International Conference on Machine Learning (ICML) 2026. 9 pages, 9 figures; camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29249 2026-05-29 stat.ML cs.LG

Prediction-Powered Inference Across Many Tasks for AI Evaluation & Social Science Research

跨任务预测驱动推理在AI评估与社会科学研究中的应用

Nicolas Emmenegger, Ellery Stahler, Chara Podimata

机构 * MIT(麻省理工学院)

AI总结 提出多任务预测驱动推理框架,通过跨任务重校准利用共享结构,在标签稀缺时提升统计推断效率,并证明非线性结构是跨任务增益的必要条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29220 2026-05-29 cs.CV

Motion-guided sparse correction enables expert-quality point tracking across diverse microscopy regimes

运动引导的稀疏校正实现跨不同显微镜体制的专家级点跟踪

Leonidas Zimianitis, Pasindu Thenahandi, Kai Buckhalter, Dineth Jayakody, Julian O. Kimura, Xinyue Liang, Karen Cunningham, Azeem Ahmad, Balpreet S. Ahluwalia, Sampath Jayarathna, Nikos Chrisochoides, Brandon Weissbourd, Dushan N. Wadduwage

机构 * Department of Computer Science, Old Dominion University(奥德赛大学计算机科学系) Department of Biology, Massachusetts Institute of Technology(麻省理工学院生物学系) The Picower Institute for Learning and Memory, Massachusetts Institute of Technology(麻省理工学院学习与记忆研究所) Department of Physics and Technology, UiT--The Arctic University of Norway(挪威北极大学物理与技术系) Department of Physics, University of Oslo(奥斯陆大学物理系) School of Data Science, Old Dominion University(奥德赛大学数据科学学院) Department of Physics, Old Dominion University(奥德赛大学物理系)

AI总结 提出RIPPLE方法,通过运动引导的稀疏校正,在多种显微镜视频中实现专家级点跟踪,将手动标注工作量减少3至25倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29158 2026-05-29 cs.LG cs.IR q-bio.BM

PROTOCOL: Late Interaction Retrieval for Protein Homolog Search

PROTOCOL: 用于蛋白质同源搜索的延迟交互检索

Gabrielle Cohn, Rohan Gumaste, Minh Hoang, Vihan Lakshman

机构 * MIT(麻省理工学院) Princeton University(普林斯顿大学)

AI总结 提出ProtoCol模型,利用ColBERT风格的延迟交互机制对残基嵌入进行最大相似度评分,以提升远程同源搜索的灵敏度,在SCOPe超家族和Pfam clan基准上优于多种基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29152 2026-05-29 cs.LG math.OC stat.ML

Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias

深度网络会忘记初始化吗?实用归纳偏见的遗忘时间视角

Mohua Das, Pierfrancesco Beneventano, Shibshankar Dey, Gareth H. McKinkey, Tomaso Poggio

机构 * MIT(麻省理工学院) Northwestern University(西北大学)

AI总结 通过引入初始化记忆度量,研究随机初始化对训练后预测器的影响,发现低学习率SGD保留初始化记忆而Adam族方法遗忘,且遗忘动力学与泛化正则化相关。

Comments 39 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28961 2026-05-29 stat.ML cs.LG math.OC

Dynamics of Stochastic Momentum with Sparse Updates in High Dimensions

高维稀疏更新下随机动量的动力学

Katie Everett, Elliot Paquette

机构 * Google DeepMind & MIT(谷歌DeepMind及麻省理工学院) McGill University & Mila(麦吉尔大学及MILA)

AI总结 本文通过最小二乘和逻辑回归模型,理论分析了稀疏更新下动量的动力学,揭示了由动量保留时间尺度与学习时间尺度之比决定的相结构,并发现不同令牌稀疏度下的振荡动力学存在谱冲突。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28870 2026-05-29 cs.LG cs.AI

Representation Alignment Rests on Linear Structure

表示对齐依赖于线性结构

Kiril Bangachev, Guy Bresler, Yury Polyanskiy

机构 * Massachusetts Institute of Technology(麻省理工学院)

AI总结 本文通过信号、偏差和噪声的三部分统计框架研究柏拉图表示假说,提出对齐源于对象与属性的线性关系,并通过稀疏自编码器提取线性特征、中心化和归一化减少偏差、以及数据稀缺导致噪声等证据支持该框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18847 2026-05-29 cs.AI cs.CL

Human-Guided Harm Recovery for Computer Use Agents

面向计算机使用代理的人类引导式危害恢复

Christy Li, Sky CH-Wang, Andi Peng, Andreea Bobu

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

AI总结 针对LM代理在计算机系统中执行操作后的危害恢复问题,通过用户研究定义偏好对齐的恢复维度,提出基于奖励模型对候选恢复计划重排序的方法,并构建BackBench基准测试,实验表明该方法优于基线代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12772 2026-05-29 cs.CV cs.MA

A Multi-Agent Feedback System for Detecting and Describing News Events in Satellite Imagery

用于检测和描述卫星图像中新闻事件的多智能体反馈系统

Madeline Anderson, Mikhail Klassen, Ash Hoover, Kerri Cahoy

机构 * Massachusetts Institute of Technology(麻省理工学院) Planet Labs

AI总结 提出一种迭代多智能体工作流SkyScraper,通过地理编码新闻文章并合成卫星图像序列描述,有效发现多时相事件并构建5000序列数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16673 2026-05-29 cs.RO cs.AI cs.LG

When Should a Robot Think? Resource-Aware Reasoning via Reinforcement Learning for Embodied Robotic Decision-Making

机器人何时应该思考?基于强化学习的资源感知推理在具身机器人决策中的应用

Jun Liu, Pu Zhao, Zhenglun Kong, Xuan Shen, Peiyan Dong, Fan Yang, Lin Cui, Hao Tang, Geng Yuan, Wei Niu, Wenbin Zhang, Xue Lin, Gaowen Liu, Yanzhi Wang, Dong Huang

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Northeastern University(东北大学) Harvard University(哈佛大学) Cornell University(康奈尔大学) MIT(麻省理工学院) Fujitsu Research of America(美国富士通研究) Tsinghua University(清华大学) Peking University(北京大学) University of Georgia(佐治亚大学) Florida International University(佛罗里达国际大学) EmbodyX Inc(EmbodyX公司) Cisco Systems(思科系统)

AI总结 提出RARRL框架,通过强化学习学习高层编排策略,使具身代理能自适应决定是否调用LLM推理、选择推理角色及分配计算预算,以平衡推理开销与任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01863 2026-05-29 cond-mat.mes-hall cond-mat.str-el cs.AI

Topological Order in Neural Wavefunctions

神经波函数中的拓扑序

Ahmed Abouelkomsan, Max Geier, Liang Fu

机构 * Department of Physics, Massachusetts Institute of Technology, Cambridge, MA-02139, USA(麻省理工学院物理系)

AI总结 本文利用基于注意力的深度神经网络变分波函数,通过能量最小化发现分数量子霍尔效应基态,并引入一种从单一实空间波函数提取拓扑简并度的方法,展示了神经网络变分蒙特卡洛在强关联拓扑相研究中的潜力。

Comments Published version

Journal ref Phys. Rev. B 113, 205119 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08194 2026-05-29 cs.LG stat.ML

Prescribe-then-Select: Adaptive Policy Selection for Contextual Stochastic Optimization

先规定后选择:面向情境随机优化的自适应策略选择

Caio de Prospero Iglesias, Kimberly Villalobos Carballo, Dimitris Bertsimas

机构 * Sloan School of Management(斯隆管理学院) Massachusetts Institute of Technology(麻省理工学院) Tandon School of Engineering(坦多工程学院) New York University(纽约大学)

AI总结 针对情境随机优化中候选策略在协变量空间表现异质的问题,提出Prescribe-then-Select模块化框架,通过构建可行策略库并基于最优策略树集成学习元策略实现数据驱动的自适应选择,在单阶段报童和两阶段运输规划问题中优于单一最优策略。

详情

展开后加载摘要…

URL PDF HTML 收藏