arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Massachusetts Institute of Technology(麻省理工学院)

2026-06-02 至 2026-06-02 共收录 27
2606.02553 2026-06-02 cs.CV

LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation

LongLive-RAG: 一种用于长视频生成的通用检索增强框架

Qixin Hu, Shuai Yang, Wei Huang, Song Han, Yukang Chen

机构 * NVIDIA USC(美国大学) MIT(麻省理工学院)

AI总结 提出LongLive-RAG框架,通过将自回归视频生成中的历史潜变量作为可检索记忆,利用查询嵌入检索相关历史潜变量并引入窗口时间增量损失,以减轻滑动窗口注意力导致的误差累积,提升长视频生成质量。

Comments 20 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02302 2026-06-02 cs.CR cs.AI

SeClaw: Spec-Driven Security Task Synthesis for Evaluating Autonomous Agents

SeClaw: 面向自主代理评估的规范驱动安全任务合成

Hao Cheng, Changtao Miao, Tianle Song, Yin Wu, He Liu, Erjia Xiao, Junchi Chen, Xiaoyu Shi, Yichi Wang, Jing Yang, Taowen Wang, Jinhao Duan, Mengshu Sun, Peiyan Dong, Xuan Shen, Yang Cao, Renjing Xu, Kaidi Xu, Jindong Gu, Bo Zhang, Jize Zhang, Chenhao Lin, Philip Torr, Chao Shen

机构 * The Hong Kong University of Science and Technology(香港科技大学) Ant Digital Technologies, Ant Group(蚂蚁集团数字技术部) Xi’an Jiaotong University(西安交通大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Oxford(牛津大学) City University of Hong Kong(香港城市大学) Institute of Science Tokyo(东京科学研究所) Zhejiang University(浙江大学) Massachusetts Institute of Technology(麻省理工学院) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Beijing University of Technology(北京理工大学)

AI总结 提出SeClaw框架,通过规范驱动的安全任务合成与基于执行的安全评估,实现对自主LLM代理在状态化环境中的安全风险的可扩展、可复现评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01640 2026-06-02 cs.AI cs.CL

MobEvolve: An Agentic Self-Evolving Heuristic System for Interpretable Human Mobility Generation

MobEvolve:用于可解释人类移动性生成的智能体自进化启发式系统

Junlin He, Yihong Tang, Tong Nie, Ao Qu, Yuebing Liang, Hamzeh Alizadeh, Bang Liu, Wei Ma, Lijun Sun

机构 * The Hong Kong Polytechnic University(香港理工大学) McGill University(麦吉尔大学) MIT(麻省理工学院) Tsinghua University(清华大学) Autorité régionale de transport métropolitain(大都会交通地区管理局) Université de Montréal(蒙特利尔大学) Mila – Quebec AI Institute(魁北克人工智能研究所)

AI总结 提出MobEvolve,首个智能体自进化启发式框架,通过LLM代理迭代演化内部逻辑,在保持可解释性和推理效率的同时,在个体轨迹保真度、群体分布对齐和行为合理性上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01462 2026-06-02 cs.AI cs.CL cs.LG

An Enigma of Artificial Reason: Investigating the Production-Evaluation Gap in Large Reasoning Models

人工推理之谜:探究大型推理模型中的生成-评估差距

Mingzhong Sun, Teresa Yeo, Armando Solar-Lezama, Tan Zhi-Xuan

机构 * NUS Department of Computer Science(国立新加坡大学计算机科学系) MIT EECS(麻省理工学院电子工程与计算机科学系) A*STAR(新加坡科技研究局) Singapore-MIT Alliance for Research and Technology (SMART)(新加坡-麻省理工联合研究技术机构(SMART))

AI总结 本文通过VAIR数据集发现大型推理模型在评估推理时存在显著缺陷,表现为答案确认偏差,即模型倾向于验证答案正确性而非仔细检查推理步骤。

Comments 10 pages, 8 figures, 2 tables (Appendix: 19 pages, 13 figures, 3 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01444 2026-06-02 cs.AI cond-mat.mtrl-sci cs.CL cs.LG math.CT

Self-Revising Discovery Systems for Science: A Categorical Framework for Agentic Artificial Intelligence

科学中的自我修正发现系统:面向主体人工智能的范畴论框架

Fiona Y. Wang, Markus J. Buehler

机构 * Laboratory for Atomistic and Molecular Mechanics(原子分子力学实验室) Department of Biological Engineering(生物工程系) Massachusetts Institute of Technology(麻省理工学院) Department of Civil and Environmental Engineering(土木与环境工程系) Department of Mechanical Engineering(机械工程系) Center for Computational Science and Engineering(计算科学与工程中心) Schwarzman College of Computing(施瓦茨曼计算学院)

AI总结 本文提出一个基于范畴论的框架,通过左Kan扩展实现科学发现中的表征体制转换,并应用于材料科学中的蛋白质力学和纤维网络建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01414 2026-06-02 cs.CV

Agent Skills Should Go Beyond Text: The Case for Visual Skills

Agent技能应超越文本:视觉技能的必要性

Binxiao Xu, Ruichuan An, Bocheng Zou, Hang Hua

机构 * Peking University(北京大学) University of Wisconsin(威斯康星大学) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

AI总结 针对现有技能学习方法仅存储文本经验导致视觉任务瓶颈的问题,提出多模态技能范式,结合文本逻辑与视觉支持,通过自动系统将经验转化为可复用的视觉技能,在GUI等视觉任务中显著优于纯文本技能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01398 2026-06-02 cs.RO

A Sonar-Visual Dataset for Cross-Modal Underwater Robot Perception

用于跨模态水下机器人感知的声纳-视觉数据集

Weitung Chen, Phil Tinn, Per Gunnar Auran, Martin Ludvigsen, Peter Halland Haro

机构 * Massachusetts Institute of Technology(麻省理工学院) SINTEF(斯蒂纳夫) Norwegian University of Science and Technology(挪威科技大学)

AI总结 提出SOVIS数据集,包含76,000多对声纳-视觉帧,通过端到端管道同步和清洗数据,并利用交互式标注工具加速标注,在跨模态鱼类检测任务中实现mAP@0.10提升7倍。

Comments 6 pages, 7 figures, 3 tables. Accepted to IEEE ICRA 2026 S2S Workshop (From Sea to Space: Advancing Perception in Harsh Domains)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01393 2026-06-02 cs.CL cs.AI cs.CV

Dr. DocBench: A Comprehensive Benchmark for Expert-Level and Difficult Document Parsing

Dr. DocBench:专家级与困难文档解析的综合基准

Minglai Yang, Xinyan Velocity Yu, Pengyuan Li, Xinyu Guo, Zhenting Qi, Konwoo Kim, Longtian Ye, Xiaolong Luo, Jinhe Bi, Henry Zhang, Haris Riaz, Xuan Zhang, Yunze Xiao, Bangya Liu, Tom Tang, Yunfei Zhao, Qunshu Lin, Zihan Wang, Minghao Liu, Michael Lingzhi Li, Yilun Du, Jesse Thomason, Rogerio Feris, Alex Pentland, Zexue He

机构 * Stanford University(斯坦福大学) MIT(麻省理工学院) Carnegie Mellon University(卡内基梅隆大学) University of Southern California(南加州大学) Harvard University(哈佛大学) IBM Research(IBM研究院) University of Arizona(亚利桑那大学) Duke University(杜克大学) UC Berkeley(加州大学伯克利分校) LMU Munich(慕尼黑路德维希-马克西米利安大学)

AI总结 提出Dr. DocBench基准,通过基于解析器失败的采样从多语言书籍语料库中选取挑战性文档,包含52个BISAC主题领域和65k高质量标注,用于评估专家级文档解析能力。

Comments 27 pages, 13 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00890 2026-06-02 cs.CV

Cohort-Scale Neural Atlases of Ultrasound Video

超声视频的队列级神经图谱

Zhuorui Zhang, Roger Pallarès-López, Xuan Wu, Praneeth Namburi, Brian W. Anthony

机构 * Department of Mechanical Engineering, MIT(麻省理工学院机械工程系) Institute for Medical Engineering and Science, MIT(麻省理工学院医学工程与科学研究所) MIT.nano Immersion Lab, MIT(麻省理工学院MIT.nano沉浸实验室)

AI总结 提出一种基于DINOv3特征空间、联合训练数千帧的队列级神经图谱方法,通过每视频生成潜在优化嵌入实现准确注释迁移,在五个心脏和肌肉骨骼数据集上达到与强基线相当的精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00880 2026-06-02 cs.LG cs.AI

Task diversity produces systematic transfer but inhibits continual reinforcement learning

任务多样性产生系统性迁移但抑制持续强化学习

Purab Seth, Neil Shah, Kunal Jha, Samuel J. Gershman, Max Kleiman-Weiner, Wilka Carvalho

机构 * MIT(麻省理工学院) University of California, Berkeley(加州大学伯克利分校) Princeton University(普林斯顿大学) Harvard University(哈佛大学)

AI总结 通过引入GPU加速的持续强化学习领域Banyan,研究任务多样性(地图布局、交互对象、子目标层次结构)对智能体在分布变化下持续学习能力的影响,发现多样性促进局部迁移但导致长期任务性能停滞和遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00318 2026-06-02 cs.RO cs.CV

Belief Consistency Between Foundation-Model Evidence and Geometric Perception in Persistent Robotic Maps

持久机器人地图中基础模型证据与几何感知之间的信念一致性

Christoffer Heckman, Harel Biggie, Brendan Crowe, Nicholas Roy

机构 * Department of Computer Science, University of Colorado, Boulder(科罗拉多大学博尔德分校计算机科学系) Computer Science and Artificial Intelligence Lab, Massachusetts Institute of Technology(麻省理工学院计算机科学与人工智能实验室)

AI总结 提出一种更新算子,通过每类校准提交门和每事件冲突丢弃窗口,解决基础模型语义通道与几何感知通道在持久地图中的矛盾,显著提升地图精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00261 2026-06-02 cs.CV physics.soc-ph

The Harsh Truth: Segment-Level Analysis of Harsh Driving Events in Milan Using Large-Scale Telematics, Street Networks, and Google Street View

残酷真相:基于大规模远程信息处理、街道网络和谷歌街景的米兰激烈驾驶事件路段级分析

Andrea La Grotteria, Paolo Santi, Titus Venverloo, Umberto Fugiglando, Carlo Ratti

机构 * Massachusetts Institute of Technology(麻省理工学院)

AI总结 本研究结合大规模远程信息处理、交通指标、街道网络属性和谷歌街景视觉特征,通过非参数检验和机器学习回归分析米兰城市道路网络中激烈驾驶事件的路段级特征,发现更宽的车道、交叉口和公交站以及更开阔的视野与更高激烈事件强度相关,而密集建筑正面与较低强度相关,并针对自行车基础设施案例揭示了不同设施类型间的强度梯度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25246 2026-06-02 cs.AI

FrontierOR: Benchmarking LLMs' Capacity for Efficient Algorithm Design in Large-Scale Optimization

FrontierOR:基准测试大语言模型在大规模优化中高效算法设计的能力

Minwei Kong, Chonghe Jiang, Ao Qu, Wenbin Ouyang, Zhaoming Zeng, Xiaotong Guo, Zhekai Li, Junyi Li, Yi Fan, Xinshou Zheng, Xi Jing, Yikai Zhang, Zhiwei Liang, Seonghoo Kim, Runqing Yang, Zijian Zhou, Sirui Li, Han Zheng, Wangyang Ying, Ou Zheng, Chonghuan Wang, Jinglong Zhao, Hanzhang Qin, Cathy Wu, Paul Pu Liang, Jinhua Zhao, Hai Wang

机构 * Singapore-MIT Alliance for Research and Technology(新加坡-麻省理工联盟研究技术) Massachusetts Institute of Technology(麻省理工学院) Northeastern University(东北大学) Uber Shanghai Jiaotong University(上海交通大学) Boston University(波士顿大学) Emory University(埃默里大学) Northwestern University(西北大学) National University of Singapore(国立新加坡大学) Microsoft(微软) University of Texas at Dallas(德克萨斯大学达拉斯分校) Singapore Management University(新加坡管理学院)

AI总结 提出FrontierOR基准,系统评估大语言模型在现实大规模优化问题中设计可扩展算法(而非仅生成求解器代码)的能力,发现最强模型仅在31%案例中优于Gurobi。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29548 2026-06-02 cs.LG

Why Larger Models Learn More: Effects of Capacity, Interference, and Rare-Task Retention

为什么更大的模型学习得更多:容量、干扰和稀有任务保留的影响

Jing Huang, Daniel Wurgaft, Rachit Bansal, Laura Ruis, Naomi Saphra, David Alvarez-Melis, Andrew Kyle Lampinen, Christopher Potts, Ekdeep Singh Lubana

机构 * Stanford University(斯坦福大学) Kempner Institute at Harvard University(哈佛大学凯普纳研究所) MIT(麻省理工学院) Anthropic

AI总结 通过理论分析和合成实验,研究模型规模对学习能力的影响,发现更大模型通过减少梯度干扰来学习稀有和复杂任务,并在OLMo模型上验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17109 2026-06-02 cs.LG cs.AI

DynMuon: A Dynamic Spectral Shaping View of Muon

DynMuon: 缪子的动态谱整形视角

Fangzhou Wu, Rikhav Shah, Sandeep Silwal, Qiuyi Zhang

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) MIT(麻省理工学院) Elorian AI

AI总结 本文提出DynMuon方法,通过动态调整谱整形参数p(从正到负),在训练过程中平衡高曲率与低曲率方向,从而加速收敛并降低验证损失。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17513 2026-06-02 cs.CL

Bridging the Domain Divide: Supervised vs. Zero-Shot Clinical Section Segmentation from MIMIC-III to Obstetrics

弥合领域鸿沟:从MIMIC-III到产科的监督式与零样本临床章节分割

Baris Karacan, Barbara Di Eugenio, Patrick Thornton

机构 * Massachusetts Institute of Technology(麻省理工学院)

AI总结 通过构建产科笔记数据集、评估基于Transformer的监督模型和首次与零样本大语言模型对比,发现监督模型在域内表现强但域外下降显著,而零样本模型在修正幻觉后展现出稳健的域外适应性。

Comments 14 pages. Camera-ready version accepted at LREC 2026; includes minor revisions and an appendix. To appear in the conference proceedings

Journal ref Proceedings of the 2026 Language Resources and Evaluation Conference (LREC 2026), pages 2594-2607, Palma, Spain. ELRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18016 2026-06-02 cs.CL cs.AI cs.DC cs.LG

MineDraft: A Framework for Batch Parallel Speculative Decoding

MineDraft: 批量并行推测解码框架

Zhenwei Tang, Arun Verma, Zijian Zhou, Zhaoxuan Wu, Alok Prakash, Daniela Rus, Bryan Kian Hsiang Low

机构 * Massachusetts Institute of Technology(麻省理工学院) Toyota Research Institute(丰田研究院) Toyota Motor Corporation(丰田公司)

AI总结 提出MineDraft框架,通过批量并行设计将草稿生成与验证阶段重叠,显著提升推测解码的吞吐量和端到端延迟。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02346 2026-06-02 cond-mat.str-el cs.AI cs.LG

Large Electron Model: A Universal Ground State Predictor

大型电子模型:一种通用的基态预测器

Timothy Zaklama, Max Geier, Liang Fu

机构 * Massachusetts Institute of Technology(麻省理工学院) Department of Physics(物理系)

AI总结 提出Large Electron Model,一种基于Fermi Sets架构的神经网络模型,通过在整个哈密顿参数流形上生成变分波函数,准确预测二维谐振势中相互作用电子的基态,并泛化到未见耦合强度和粒子数,为材料发现提供了基于变分原理的基座模型方法。

Comments 8+7 pages, 5+6 figures, 1+1 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15278 2026-06-02 cs.CV cs.AI

Visual Persuasion: What Influences Decisions of Vision-Language Models?

视觉说服:什么影响了视觉语言模型的决策?

Manuel Cherep, Pranav M R, Pattie Maes, Nikhil Singh

机构 * Massachusetts Institute of Technology(麻省理工学院) MIT Media Lab(MIT媒体实验室)

AI总结 提出一个框架,通过控制图像选择任务并系统性地扰动输入,利用视觉提示优化方法推断视觉语言模型的潜在视觉效用,揭示影响模型决策的视觉偏好。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09153 2026-06-02 cs.RO cs.AI cs.CV cs.GR

SceneSmith: Agentic Generation of Simulation-Ready Indoor Scenes

SceneSmith: 面向仿真就绪室内场景的智能体生成

Nicholas Pfaff, Thomas Cohn, Sergey Zakharov, Rick Cory, Russ Tedrake

机构 * Massachusetts Institute of Technology(麻省理工学院) Harvard University(哈佛大学)

AI总结 提出层次化智能体框架SceneSmith,通过VLM智能体协作从自然语言生成仿真就绪的室内场景,相比先前方法生成3-6倍物体且碰撞率低于2%。

Comments ICML 2026 Spotlight; Project page: https://scenesmith.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07218 2026-06-02 cs.LG cs.AI stat.ML

Collaborative and Efficient Fine-tuning: Leveraging Task Similarity

协作高效微调:利用任务相似性

Gagik Magakyan, Amirhossein Reisizadeh, Chanwoo Park, Pablo A. Parrilo, Asuman Ozdaglar

机构 * Massachusetts Institute of Technology(麻省理工学院) Stanford University(斯坦福大学)

AI总结 提出CoLoRA方法,通过共享适配器和个性化适配器利用任务相似性进行协作微调,提升数据稀缺下的模型性能,并在理论和实验上验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22651 2026-06-02 cs.LG cs.AI

GUDA: Counterfactual Group-wise Training Data Attribution for Diffusion Models via Unlearning

GUDA: 基于反事实的扩散模型分组训练数据归因方法

Naoki Murata, Yuhta Takida, Chieh-Hsin Lai, Toshimitsu Uesaka, Bac Nguyen, Stefano Ermon, Yuki Mitsufuji

机构 * University of Tokyo(东京大学) Toyota Central Research Laboratory(丰田中央研究所) University of California, Berkeley(加州大学伯克利分校) Massachusetts Institute of Technology(麻省理工学院) National Institute of Advanced Industrial Science and Technology(国家工业科学与技术研究院)

AI总结 提出GUDA方法,利用机器遗忘近似反事实模型,通过似然评分规则(ELBO)量化组别影响,实现高效的分组训练数据归因。

Comments Accepted at ICML 2026. Code is available at https://github.com/sony/guda

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20115 2026-06-02 cs.AR cs.AI

How Much Progress Has There Been in NVIDIA Datacenter GPUs?

NVIDIA 数据中心 GPU 取得了多少进展?

Emanuele Del Sozzo, Martin Fleming, Kenneth Flamm, Neil Thompson

机构 * MIT FutureTech, Computer Science and Artificial Intelligence Laboratory (CSAIL), Massachusetts Institute of Technology Cambridge MA USA(麻省理工学院未来科技、计算机科学与人工智能实验室(CSAIL)、麻省理工学院剑桥MA美国)

AI总结 本文分析了 2000 年代中期至 2025 年 NVIDIA 数据中心 GPU 在计算性能、内存、功耗和价格方面的进展,并评估了美国出口管制的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09608 2026-06-02 cs.CV cs.AI cs.CL

StreamingVLM: Real-Time Understanding for Infinite Video Streams

StreamingVLM:无限视频流的实时理解

Ruyi Xu, Guangxuan Xiao, Yukang Chen, Liuning He, Yao Lu, Song Han

机构 * MIT(麻省理工学院) NVIDIA(英伟达)

AI总结 提出StreamingVLM,通过统一训练与流推理的框架,利用注意力汇点状态复用和滑动窗口机制实现无限视频流的实时稳定理解,在Inf-Streams-Eval基准上以8 FPS速度达到66.18%胜率,并提升通用VQA能力。

Comments Published as a conference paper at ICLR 2026. The first two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03745 2026-06-02 cs.LG cs.NA math.NA

Neural Low-Discrepancy Sequences

神经低差异序列

Michael Etienne Van Huffel, Nathan Kirk, Makram Chahine, Daniela Rus, T. Konstantin Rusch

机构 * MIT(麻省理工学院) CMU(卡内基梅隆大学) Harvard University(哈佛大学)

AI总结 提出NeuroLDS,首个基于机器学习的有限低差异序列生成框架,通过监督预训练和无监督微调两步学习,在多个应用中显著优于传统方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12438 2026-06-02 cs.DS cs.LG stat.ML

Dimension Reduction via Sum-of-Squares and Improved Clustering Algorithms for Non-Spherical Mixtures

通过平方和方法的降维及非球形混合物的改进聚类算法

Prashanti Anderson, Mitali Bafna, Rares-Darius Buhai, Pravesh K. Kothari, David Steurer

机构 * MIT University of Washington EPFL(麻省理工学院 华盛顿大学 EPFL)

AI总结 提出基于平方和方法的降维子程序,实现非球形高斯混合物的高效聚类,显著降低样本和时间的维度依赖。

Comments 67 pages, updated to match camera-ready version at COLT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09737 2026-06-02 cs.LG

Towards Stable, Globally Expressive Graph Representations with Laplacian Eigenvectors

利用拉普拉斯特征向量实现稳定且全局表达性的图表示

Junru Zhou, Cai Zhou, Xiyuan Wang, Pan Li, Muhan Zhang

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Department of EECS, Massachusetts Institute of Technology(麻省理工学院电子工程与计算机科学系) School of ECE, Georgia Institute of Technology(佐治亚理工学院电子与计算机工程系)

AI总结 提出一种利用可学习的O(p)-不变表示和平滑处理数值接近特征值的方法,以增强图神经网络中拉普拉斯特征向量的稳定性和全局表达性。

详情

展开后加载摘要…

URL PDF HTML 收藏