arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Massachusetts Institute of Technology(麻省理工学院)

共收录 2206
2502.08938 2026-05-28 cs.LG

Reevaluating Policy Gradient Methods for Imperfect-Information Games

重新评估不完美信息博弈的策略梯度方法

Max Rudolph, Nathan Lichtle, Sobhan Mohammadpour, Alexandre Bayen, J. Zico Kolter, Amy Zhang, Gabriele Farina, Eugene Vinitsky, Samuel Sokota

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) University of California, Berkeley(加州大学伯克利分校) Massachusetts Institute of Technology(麻省理工学院) Carnegie Mellon University(卡内基梅隆大学) NYU Tandon School of Engineering(纽约大学坦顿工程学院)

AI总结 通过实现五种大型博弈的精确可剥削性计算,对比发现基于虚构博弈、双预言机和反事实遗憾最小化的深度强化学习算法未能超越通用策略梯度方法(如PPO)。

Comments International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16284 2026-05-28 cs.LG

Fast KV Compaction via Attention Matching

通过注意力匹配实现快速KV压缩

Adam Zweiger, Xinghong Fu, Han Guo, Yoon Kim

机构 * Massachusetts Institute of Technology(麻省理工学院)

AI总结 提出通过注意力匹配在潜在空间快速压缩键值缓存的方法,以保持注意力输出并实现高达50倍压缩且质量损失小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06329 2026-05-28 cs.CL cs.AI

On the Fallacy of Global Token Perplexity in Spoken Language Model Evaluation

论口语语言模型评估中全局令牌困惑度的谬误

Chan-Jan Hsu, Liang-Hsuan Tseng, Yi-Cheng Lin, Yen-Chun Kuo, Ju-Chieh Chou, Kai-Wei Chang, Hung-yi Lee, Carlos Busso

机构 * Carnegie Mellon University(卡内基梅隆大学) National Taiwan University(国立台湾大学) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) Massachusetts Institute of Technology(麻省理工学院)

AI总结 针对口语语言模型评估中直接使用文本困惑度公式计算语音令牌困惑度的问题,提出基于似然和生成的新型评估方法,更忠实反映生成质量,并缩小了最佳模型与人类基线之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02019 2026-05-28 cs.LG cs.AI stat.ML

Diffusion-Augmented Markov Decision Processes for Maximum Entropy Reinforcement Learning

扩散增强马尔可夫决策过程用于最大熵强化学习

Sebastian Sanokowski, Kaustubh Patil

机构 * Munich Institute of Robotics and Machine Intelligence (MIRMI), Technical University Munich(慕尼黑机器人与机器智能研究所(MIRMI),技术大学慕尼黑) Practical Project Student Exchange Program, Technical University Munich(技术大学慕尼黑实践项目学生交换计划) MIT World Peace University(MIT和平大学)

AI总结 本文通过将最大熵强化学习扩展到扩散过程,提出扩散增强马尔可夫决策过程(DA-MDPs),以最小化反向KL散度的上界来学习最优策略轨迹分布,并成功将PPO、WPO和REPPO适配为扩散变体,在连续控制和多模态基准上取得与基线相当或更优的性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21890 2026-05-28 cs.LG cs.AI cs.GR

The Principles of Diffusion Models

扩散模型的原理

Chieh-Hsin Lai, Yang Song, Dongjun Kim, Yuki Mitsufuji, Stefano Ermon

机构 * MIT Press(MIT出版社) Sony AI(索尼人工智能) OpenAI(开放人工智能) Stanford University(斯坦福大学) Sony Group Corporation(索尼集团)

AI总结 本文从变分、基于分数和基于流三种视角统一阐述扩散模型的数学原理,并讨论可控生成、高效求解器和流映射模型等扩展。

Comments Supplementary materials for the book are available at the book website: https://the-principles-of-diffusion-models.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15839 2026-05-28 cs.LG econ.EM stat.ML

Learning Correlated Reward Models: Statistical Barriers and Opportunities

学习相关奖励模型:统计障碍与机遇

Yeshwanth Cherapanamjeri, Constantinos Daskalakis, Gabriele Farina, Sobhan Mohammadpour

机构 * MIT(麻省理工学院)

AI总结 本文研究了避免IIA假设的相关probit模型的统计与计算挑战,证明了成对偏好数据不足以学习相关性,而三选一偏好数据可实现近最优估计。

Comments International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01724 2026-05-28 cs.AI

MetaboT: An LLM-based Multi-Agent Frameworkfor Interactive Analysis of Mass SpectrometryMetabolomics Knowledge Graphs

MetaboT:基于LLM的多智能体框架,用于质谱代谢组学知识图谱的交互式分析

Madina Bekbergenova, Lucas Pradi, Benjamin Navet, Emma Tysinger, Franck Michel, Matthieu Feraud, Yousouf Taghzouti, Yan Zhou Chen, Olivier Kirchhoffer, Florence Mehl, Martin Legrand, Tao Jiang, Marco Pagni, Soha Hassoun, Jean-Luc Wolfender, Wout Bittremieux, Fabien Gandon, Louis-Félix Nothias

机构 * Department of Computer Science, University of Antwerp(安特卫普大学计算机科学系) Massachusetts Institute of Technology(麻省理工学院) Department of Computer Science, Tufts University(塔夫茨大学计算机科学系) Swiss Institute of Bioinformatics (SIB), Lausanne, Switzerland(瑞士生物信息学研究所(SIB),洛桑,瑞士) Department of Chemical and Biological Engineering, Tufts University(塔夫茨大学化学与生物工程系)

AI总结 提出MetaboT,一个基于大语言模型的多智能体框架,通过模块化架构将自然语言问题转化为SPARQL查询,降低代谢组学知识图谱的使用门槛。

Journal ref 33rd annual international conference on Intelligent Systems for Molecular Biology (ISMB 2025) / 24th Annual Conference of the European Conference on Computational Biology (ECCB 2025), Jul 2025, Liverpool, United Kingdom

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05012 2026-05-28 cs.RO physics.comp-ph physics.flu-dyn

Realizing Robotic Swimming with Unified Fluid-Robot Multiphysics

实现统一流体-机器人多物理场的水下机器人游泳

Jeong Hun Lee, Junzhe Hu, Sofia Kwok, Carmel Majidi, Zachary Manchester

机构 * Carnegie Mellon University(卡内基梅隆大学) Massachusetts Institute of Technology(麻省理工学院)

AI总结 提出一个可微分的统一流体-机器人多物理场仿真框架,通过最小作用量原理联合推导耦合的机械臂和不可压缩Navier-Stokes方程,并利用离散变分力学和隐函数定理实现稳定、准确的联合仿真与梯度计算,成功优化仿生鳗鱼机器人的波动游泳和高动态C形逃逸动作,并验证了从仿真到实物的迁移。

Comments 9 pages, 10 figures, accepted to Robotics: Science and Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20530 2026-05-27 cs.AI cs.CL cs.LG cs.SE

AgentAtlas: Beyond Outcome Leaderboards for LLM Agents

AgentAtlas:超越LLM智能体的结果排行榜

Parsa Mazaheri, Kasra Mazaheri

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) Massachusetts Institute of Technology(麻省理工学院)

AI总结 提出AgentAtlas框架,通过控制决策分类法和轨迹故障词汇表,将智能体评估从结果成功分离为控制决策质量和轨迹质量,并揭示仅依赖结果排行榜的测量风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26662 2026-05-27 cs.CL cs.AI econ.GN q-fin.EC

AI evaluation may bias perceptions: The importance of context in interpreting academic writing

AI评估可能扭曲认知:语境在解读学术写作中的重要性

Shang Wu, Randol Yao

机构 * UC Irvine(加州大学欧文分校) MIT(麻省理工学院)

AI总结 本文通过构建AI相似度基准,发现忽略国家和领域差异的评估方法会系统性高估或低估某些群体中的AI使用,提出基于具体语境的基准以更准确评估科学写作中的AI使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26636 2026-05-27 cs.CV cs.AI

JetViT: Efficient High-Resolution Vision Transformer with Post-Training Attention Search

JetViT: 高效高分辨率视觉Transformer与训练后注意力搜索

Dongyun Zou, Zhuoyang Zhang, Junyu Chen, Wenkun He, Qinhe Peng, Hanrong Ye, Yao Lu, Hongxu Yin, Yu Wang, Song Han, Han Cai

机构 * MIT(麻省理工学院) University of Pennsylvania(宾夕法尼亚大学) NVIDIA(NVIDIA公司) Physical Intelligence(物理智能)

AI总结 提出JetViT混合架构视觉Transformer,通过训练后注意力搜索将预训练全注意力ViT转换为高效混合注意力变体,在高分辨率图像上实现更高推理效率且不损失精度。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26329 2026-05-27 cs.AI

JobBench: Aligning Agent Work With Human Will

JobBench:使智能体工作符合人类意愿

Yuetai Li, Yichen Feng, Zhangchen Xu, Zixian Ma, Kaiyuan Zheng, Fengqing Jiang, Xinghua Sun, Rulin Shao, Zichen Chen, Yue Huang, Xinyang Han, Brian Lee, Kayla Xu, Shenglai Zeng, Hang Hua, Xiangliang Zhang, Basel Alomair, Ranjay Krishna, Luke Zettlemoyer, Pang Wei Koh, Bhaskar Ramasubramanian, Luyao Niu, Xiang Yue, Radha Poovendran

机构 * University of Washington(华盛顿大学) University of California, Santa Barbara(加州大学圣芭芭拉分校) Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学) Northwestern University(西北大学) University of Notre Dame(圣母大学) University of California, Berkeley(加州大学伯克利分校) Michigan State University(密歇根州立大学) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) Bake AI King Abdulaziz City for Science and Technology(国王阿卜杜勒阿齐兹科技城) Western Washington University(西雅图华盛顿大学) University of Chicago(芝加哥大学)

AI总结 提出JobBench基准,通过专家识别的高优先级工作流程评估AI智能体,以人类需求为中心而非经济价值,覆盖35个职业的130个任务,使用事实锚定的评分链评估,最强模型仅达45.9%,旨在推动从替代到增强的劳动力市场影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17036 2026-05-27 cs.AI cs.LG cs.MA cs.SY eess.SY

Reliability and Effectiveness of Autonomous AI Agents in Supply Chain Management

自主AI代理在供应链管理中的可靠性与有效性

Carol Xuan Long, David Simchi-Levi, Feng Zhu, Huangyuan Su, Andre P. Calmon, Flavio P. Calmon

机构 * Harvard University(哈佛大学) MIT/Purdue(麻省理工学院/普渡大学) MIT(麻省理工学院) Harvard University/Kempner Institute(哈佛大学/凯普勒研究所) Georgia Tech(佐治亚理工学院)

AI总结 本文通过MIT啤酒游戏研究多级供应链中的自主生成式AI代理,发现模型能力是性能主导因素,但平均性能掩盖可靠性风险,并引入代理牛鞭效应,提出基于GRPO的后训练框架以提高可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07632 2026-05-27 cs.CL cs.AI cs.LG

Post-training makes large language models less human-like

后训练使大型语言模型更不像人类

Marcel Binz, Elif Akata, Abdullah Almaatouq, Mohammed Alsobay, Oleksii Ariasov, Franziska Brändle, David Broska, Jason W. Burton, Nuno Busch, Frederick Callaway, Vanessa Cheung, Brian Christian, Julian Coda-Forno, Can Demircan, Vittoria Dentella, Maria K. Eckstein, Noémi Éltető, Michael Franke, Thomas L. Griffiths, Fritz Günther, Susanne Haridi, Sebastian Hellmann, Stefan Herytash, Linus Hof, Eleanor Holton, Isabelle Hoxha, Zak Hussain, Akshay Jagadish, Elif Kara, Valentin Kriegmair, Evelina Leivada, Li Ji-An, Tobias Ludwig, Maximilian Maier, Marcelo G. Mattar, Marvin Mathony, Alireza Modirshanechi, Robin Na, Mariia Nadverniuk, Antonios Nasioulas, Surabhi S. Nath, Helen Niemeyer, Kate Nussenbaum, Sebastian Olschewski, Thorsten Pachur, Stefano Palminteri, Aliona Petrenco, Camille V. Phaneuf-Hadd, Angelo Pirrone, Manuel Rausch, Laura Raveling, Shashank Reddy, Milena Rmus, Evan M. Russek, Tankred Saanum, Kai Sandbrink, Louis Schiekiera, Johannes A. Schubert, Luca M. Schulze Buschoff, Nishad Singhi, Leah H. Somerville, Mikhail S. Spektor, Xin Sui, Christopher Summerfield, Mirko Thalmann, Anna I. Thoma, Taisiia Tikhomirova, Vuong Truong, Polina Tsvilodub, Konstantinos Voudouris, Kristin Witte, Shuchen Wu, Dirk U. Wulff, Hua-Dong Xiong, Songlin Xu, Lance Ying, Xinyu Zhang, Jian-Qiao Zhu, Eric Schulz

机构 * Helmholtz Munich(海德堡-慕尼黑亥姆霍兹中心) Massachusetts Institute of Technology(麻省理工学院) University of Tübingen(图宾根大学) University of Oxford(牛津大学) Stanford(斯坦福大学)

AI总结 通过引入Psych-201数据集,发现后训练(将基础模型转化为有用助手的过程)一致地降低了模型与人类行为的对齐度,且这种错位在新模型世代中加剧,而人物诱导技术无法改善个体层面的预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05794 2026-05-27 cs.LG cs.AI q-bio.QM

Mechanistic Interpretability of Antibody Language Models Using SAEs

使用 SAE 对抗体语言模型的机制可解释性研究

Rebonto Haque, Oliver M. Turnbull, Anisha Parsan, Nithin Parsan, John J. Yang, Anna L. Beukenhorst, Charlotte M. Deane

机构 * Department of Statistics, University of Oxford, UK(英国牛津大学统计系) Reticular, San Francisco, USA(美国旧金山Reticular公司) EECS, MIT, Cambridge MA, USA(美国麻省理工学院电子工程与计算机科学系) Leyden Laboratories BV, Leiden, The Netherlands(荷兰莱顿实验室)

AI总结 本研究采用 TopK 和 Ordered 稀疏自编码器(SAE)对抗体语言模型进行机制可解释性分析,发现 TopK SAE 能揭示有意义的生物学潜在特征但无法保证生成控制,而 Ordered SAE 通过层次结构可靠识别可操控特征但激活模式更复杂。

Comments v3: 15 pages; corrected author list and affiliations in the main text; minor text changes; updated steering results following minor code changes; conclusions and findings remain unchanged; included link to data and code in the Data Availability section

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28730 2026-05-27 cs.RO cs.CL cs.CV

SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning

SOLE-R1:视频语言推理作为机器人强化学习的唯一奖励

Philip Schroeder, Thomas Weng, Karl Schmeckpeper, Eric Rosen, Stephen Hart, Ondrej Biza

机构 * MIT(麻省理工学院) RAI Institute(机器人智能研究所)

AI总结 提出SOLE-R1模型,通过视频语言时空推理生成密集任务进度估计作为唯一奖励信号,实现在无真实奖励、演示或任务特定调优下的零样本在线强化学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16870 2026-05-27 cs.CV cs.LG

Align & Invert: Solving Inverse Problems with Diffusion and Flow-based Models via Representation Alignment

对齐与反转:通过表示对齐解决扩散和流模型中的逆问题

Loukas Sfountouris, Giannis Daras, Paris Giampouras

机构 * Massachusetts Institute of Technology(麻省理工学院)

AI总结 提出将扩散或流模型的内部表示与预训练自监督编码器(DINOv2)对齐(REPA),在推理时引导逆问题重建,显著提升重建质量和感知真实感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02993 2026-05-27 eess.SY cs.LG cs.SY

Route Recommendations for Traffic Management Under Learned Partial Driver Compliance

基于学习部分驾驶员遵从性的交通管理路线推荐

Heeseung Bang, Jung-Hoon Cho, Cathy Wu, Andreas A. Malikopoulos

机构 * School of Civil and Environmental Engineering, Cornell University(康奈尔大学土木与环境工程学院) Department of Civil and Environmental Engineering, Massachusetts Institute of Technology(麻省理工学院土木与环境工程系)

AI总结 提出一种学习驾驶员部分遵从性的路线推荐框架,通过随机优化最小化系统最优流量与实际流量差距,在网格网络仿真中显著减少旅行时间。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.09344 2026-05-27 cs.CV cs.LG

DreamSim: Learning New Dimensions of Human Visual Similarity using Synthetic Data

DreamSim: 使用合成数据学习人类视觉相似性的新维度

Stephanie Fu, Netanel Tamir, Shobhita Sundaram, Lucy Chai, Richard Zhang, Tali Dekel, Phillip Isola

机构 * MIT(麻省理工学院) Weizmann Institute of Science(魏茨曼科学研究所) Adobe Research(Adobe研究)

AI总结 本文提出DreamSim指标,通过合成数据训练,在图像布局、对象姿态和语义内容等中高层面上对齐人类感知,并在检索和重建任务中优于现有指标。

Comments Website: https://dreamsim-nights.github.io/ Code: https://github.com/ssundaram21/dreamsim

Journal ref Advances in Neural Information Processing Systems 36 (NeurIPS 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26032 2026-05-26 cs.CV cond-mat.stat-mech cs.AI cs.LG

Everything at Every Scale: Scale-Invariant Diffusion with Continuous Super-Resolution

一切尺度:具有连续超分辨率的尺度不变扩散

Zixin Jessie Chen, Zhuo Chen, Archer Wang, Jeff Gore, William T. Freeman, Congyue Deng, Marin Soljačić

机构 * Department of Physics, Massachusetts Institute of Technology(麻省理工学院物理系) Department of EECS, Massachusetts Institute of Technology(麻省理工学院电子工程与计算机科学系) NSF AI Institute for Artificial Intelligence and Fundamental Interactions(国家科学基金会人工智能与基础相互作用研究所) Institute for Data, Systems and Society, Massachusetts Institute of Technology(麻省理工学院数据、系统与社会研究所)

AI总结 提出SKILD模型,通过尺度不变扩散统一图像生成与连续超分辨率,仅改变起始时间步即可实现不同任务。

Comments 29 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25717 2026-05-26 cs.AI cs.CE cs.LG

FLOATBench: A Dataset and Benchmark for Floating Offshore Wind Turbine Tower Fatigue

FLOATBench:浮式海上风力发电机塔架疲劳数据集与基准

João Alves Ribeiro, Bruno Alves Ribeiro, Francisco Pimenta, Sérgio M. O. Tavares, Faez Ahmed

机构 * Department of Mechanical Engineering(机械工程系) Massachusetts Institute of Technology(麻省理工学院) School of Engineering(工程学院) Brown University(布朗大学) CONSTRUCT, Faculty of Engineering University of Porto(CONSTRUCT,工程学院,葡萄牙波尔图大学) University of Aveiro(阿维罗大学)

AI总结 提出FLOATBench,一个包含582,120个疲劳损伤标签的表格基准,基于22 MW浮式风机塔架的高保真仿真,并引入工况感知的评估协议以检测随机划分无法发现的性能排名变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25608 2026-05-26 stat.ML cs.LG

Learning Sparse Compositional Functions with Norm-Constrained Neural Networks

学习具有范数约束神经网络的稀疏组合函数

Shuo Huang, Lorenzo Fiorito, Lorenzo Rosasco, Tomaso Poggio

机构 * Istituto Italiano di Tecnologia(意大利技术研究院) Università degli Studi di Genova(热那亚大学) MaLGa(MaLGa实验室) DIBRIS(迪布里兹实验室) CBMM(生物医学工程与机器人实验室) Massachusetts Institute of Technology(麻省理工学院)

AI总结 本文通过范数约束的深度神经网络,建立了学习稀疏组合函数的逼近率和过风险界,证明了深度网络能够利用层次表示避免维数灾难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25346 2026-05-26 cs.RO cs.AI cs.LG cs.SY eess.SY math.OC

Parallel Differentiable Reachability for Learning and Planning with Certified Neural Dynamics and Controllers

用于学习和规划的并行可微可达性:带认证的神经动力学与控制器

Keyi Shen, Glen Chou

机构 * MIT(麻省理工学院)

AI总结 提出一种基于JAX的并行可微可达性框架,结合泰勒模型流形构建与CROWN线性界传播,支持GPU批处理和自动微分,并用于认证训练和可达性感知的MPC,在非抓取操作和四旋翼任务中实现在线规划与有界不确定性下的认证可达集过近似。

Comments Robotics: Science and Systems XXII (RSS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23163 2026-05-26 cs.CL

Fast-dDrive: Efficient Block-Diffusion VLM for Autonomous Driving

Fast-dDrive:面向自动驾驶的高效块扩散视觉语言模型

Kewei Zhang, Jin Wang, Sensen Gao, Chengyue Wu, Yulong Cao, Songyang Han, Boris Ivanovic, Langechuan Liu, Marco Pavone, Song Han, Daquan Zhou, Enze Xie

机构 * Peking University(北京大学) NVIDIA The University of Hong Kong(香港大学) MIT(麻省理工学院)

AI总结 提出Fast-dDrive,一种块扩散视觉语言动作模型,通过语义单元内双向细化与跨单元因果约束,结合结构化令牌冻结、分段感知训练和推测解码,实现高保真轨迹规划与高效推理,在WOD-E2E和nuScenes上达到最优性能,推理速度提升12倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07233 2026-05-26 cs.LG cs.CR stat.ML

Modulated learning for private and distributed regression with just a single sample per client device

调制学习:每个客户端设备仅有一个样本的私有分布式回归

Praneeth Vepakomma, Amirhossein Reisizadeh, Samuel Horváth, Munther A. Dahleh

机构 * MIT(麻省理工学院)

AI总结 针对每个客户端仅有一个样本的分布式学习场景,提出一种通过注入校准噪声并共享后处理表示来实现隐私保护的全局模型学习方法,在期望上匹配非私有中心化梯度更新。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25216 2026-05-26 cs.RO

InvariantCloud: A Globally Invariant, Uniquely Indexed Point Cloud Framework for Robust 6-DoF Tactile Pose Tracking

InvariantCloud:一种全局不变、唯一索引的点云框架,用于鲁棒的6自由度触觉姿态跟踪

Pengfei Ye, Yuxiang Ma, Yi Zhou, Wei Chen, Wenzhen Dong, Molong Duan

机构 * Department of Mechanical and Aerospace Engineering, The Hong Kong University of Science and Technology(香港科学与技术大学机械与航空航天工程系) Department of Mechanical Engineering, Massachusetts Institute of Technology(麻省理工学院机械工程系) Department of Mechanical and Automation Engineering, The Chinese University of Hong Kong(香港中文大学机械与自动化工程系)

AI总结 提出InvariantCloud框架,利用视觉触觉传感器上表面标记星座的全局不变性,通过一次性全局不变点云配准实现6自由度物体姿态估计,抑制累积漂移并准确估计偏航旋转,在长序列操作任务中展现出高精度和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25198 2026-05-26 cs.LG cs.AI

Hide to Guide: Learning via Semantic Masking

隐藏以引导:通过语义掩码学习

Ruitao Liu, Qinghao Hu, Alex Hu, Yecheng Wu, Shang Yang, Luke J. Huang, Zhuoyang Zhang, Han Cai, Song Han

机构 * MIT(麻省理工学院) NVIDIA(英伟达)

AI总结 提出语义掩码专家策略优化(SMEPO),通过掩码专家轨迹中与奖励相关的语义片段,将困难问题转化为填空过程,提升强化学习在推理密集型任务中的探索效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24763 2026-05-26 cs.LG physics.flu-dyn

High-fidelity Modeling of Full-scale Pressurized Water Reactor Flow Fields for Machine Learning Applications

面向机器学习应用的全尺寸压水堆流场高保真建模

Logan A. Burnett, Hyungjun Kim, Hsien-Cheng Chou, Arsha Witoelar, Robert A. Brewster, Benoit Forget, Emilio Baglietto, Majdi I. Radaideh

机构 * Department of Nuclear Engineering and Radiological Sciences, University of Michigan(密歇根大学核工程与辐射科学系) Department of Nuclear Science and Engineering, Massachusetts Institute of Technology(麻省理工学院核科学与工程系) Korea Atomic Energy Research Institute(韩国原子能研究所) Department of Mechanical Engineering, University of Michigan(密歇根大学机械工程系) Department of Computer Science and Engineering, University of Michigan(密歇根大学计算机科学与工程系)

AI总结 本研究利用高保真CFD模拟和机器学习模型,对四环路压水堆组件级流场进行表征,揭示了冷腿旋流和下腔室输运导致的入口流量分布不均匀性,并验证了ConvLSTM等空间感知架构在流场重建与预测中的优越性。

Comments 30 pages, 10 figures, and 6 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24642 2026-05-26 cs.CV cs.RO

Understanding the Impact of Geometric Foundation Models on Vision-Language-Action Models

理解几何基础模型对视觉-语言-动作模型的影响

Yurou Yang, Muyuan Lin, Roberto Martin-Martin, Martin Labrie, Shreekant Gayaka, Cheng-Hao Kuo, Luca Carlone

机构 * Amazon Personal Robotics Group(亚马逊个人机器人小组) University of Texas at Austin(德克萨斯大学奥斯汀分校) Massachusetts Institute of Technology(麻省理工学院)

AI总结 本文通过线性探测分析量化了视觉-语言-动作模型(VLA)与几何基础模型(GFM)之间的“几何差距”,比较了三种注入几何信息的架构,并研究了非架构因素对几何VLA性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24624 2026-05-26 cs.CV

Vision-Language Binding in In-Context Image Generation

上下文图像生成中的视觉-语言绑定

Chris Ge, Rohit Gandikota, Antonio Torralba, Tamar Rott Shaham

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Northeastern University(东北大学)

AI总结 本文通过因果干预方法揭示FLUX.2模型中文本令牌与参考图像之间的隐式跨模态绑定机制,并定位绑定发生在文本序列的填充令牌上。

Comments 35 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏