arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Massachusetts Institute of Technology(麻省理工学院)

2026-08-05 至 2026-08-05 共收录 15
2608.02834 2026-08-05 cs.RO cs.SY eess.SY 新提交

Biconvex Optimization for Smooth Minimum-Time Trajectories around Convex Obstacles

凸障碍物周围平滑最小时间轨迹的双凸优化

Peter Werner, Tobia Marcucci, Daniela Rus

机构 * Massachusetts Institute of Technology(麻省理工学院) University of California Santa Barbara(加州大学圣巴巴拉分校)

AI总结 本研究提出一种双凸优化方法,用于凸障碍物周围的最小时间运动规划,可保证收敛、支持任意阶导数约束,实验表明其轨迹质量高、鲁棒性强且计算效率与现有方法相当。

Comments 18 pages, 9 figures, 4 tables. Submitted to IEEE Transactions on Robotics. Project page: https://wernerpe.github.io/bmtp-website/ Code: https://github.com/wernerpe/pybmtp

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15065 2026-08-05 cs.RO cs.CV cs.LG 版本更新

DriftWorld: Fast World Modeling through Drifting

DriftWorld:通过漂移实现快速世界建模

Susie Lu, Haonan Chen, Weirui Ye, Yilun Du

机构 * Massachusetts Institute of Technology(麻省理工学院) Harvard University(哈佛大学)

AI总结 研究针对预测性世界模型生成展开慢的问题,提出基于漂移生成模型的DriftWorld,训练时学习动作条件漂移以快速生成未来帧,在机器人操作基准测试中实现快速准确决策,还能作离线模拟器,性能优于基于扩散的基线。

Comments Website at https://susie-lu.github.io/driftworld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07157 2026-08-05 cs.AI 版本更新

Think Fast: Estimating No-CoT Task-Completion Time Horizons of Frontier AI Models

快速思考:估计前沿AI模型的无思维链任务完成时间范围

Dewi Gould, Francis Rhys Ward, Anders Cairns Woodruff, Rauno Arike, Josh Hills, Alex Serrano, Ida Caspary, Jason Ross Brown, Jo J. Jiao, Patrick Leask, Twm Stone, Ram Potham, Ionut Gabriel Stan, Harry Mayne, Simeon Hellsten, Shubhorup Biswas, Ariana Azarbal, William L. Anderson, Elle Najt, Ryan Greenblatt, Julian Stastny

机构 * Redwood Research(红木研究) Astra Fellows Program(Astra 后援计划) Aether Research(Aether 研究) MATS Research(MATS 研究) Polytechnic University of Catalonia(加泰罗尼亚理工大学) Imperial College London(伦敦帝国理工学院) University of Cambridge(剑桥大学) University of Chicago(芝加哥大学) Durham University(杜伦大学) MIT(麻省理工学院) University of Oxford(牛津大学) University of Glasgow(格拉斯哥大学) Constellation(星座)

AI总结 本研究通过超过3万个问题测试前沿AI模型在无思维链推理下的表现,估计其50%任务完成时间范围,发现该时间每约两年翻一番,GPT-5.5已达3分钟以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28818 2026-08-05 cs.CL q-bio.NC 版本更新

Do VLMs Align Better with Humans than LLMs during Natural Reading?

VLMs 在自然阅读中可能不会全局性地增强与人类的对齐性优于 LLMs

Jinzhou Wu, Zhengwu Ma, Jixing Li, Baoping Tang, Zitong Lu

机构 * Department of Mechanical and Vehicle Engineering, Chongqing University(重庆大学机械与车辆工程学院) Department of Linguistics and Translation, City University of Hong Kong(香港城市大学语言学与翻译系) McGovern Institute for Brain Research, Massachusetts Institute of Technology(麻省理工学院麦戈文脑科学研究所)

AI总结 通过严格文本设置比较LLM和VLM,发现多模态预训练在自然阅读中未带来全局性人类对齐优势,但视觉语义内容强的句子中VLM有选择性优势。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25303 2026-08-05 cs.DS cs.LG math.ST stat.ML stat.TH 版本更新

Algorithms with Polynomially-Improved Approximation Factors for the $2 \rightarrow q$ Norm, and Applications

具有多项式改进近似因子的 $2 \rightarrow q$ 范数算法及其应用

Samuel B. Hopkins, Stefan Tiegel

机构 * MIT(麻省理工学院)

AI总结 本文针对 $q>2$ 时的 $2 \rightarrow q$ 范数,提出了首个多项式时间近似算法,其近似因子在多项式级别上优于基线 $d^{1/4}$,例如 $q=4$ 时达到 $d^{1/8}$,并构造了平方和证书,从而改进了鲁棒均值估计、协方差估计、回归和聚类等问题的算法。

Comments v3 added that sparsification can be used to reduce to n roughly d^q/2

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15219 2026-08-05 cs.AI cs.IT math.IT 版本更新

NOVA: Fundamental Limits of Knowledge Discovery Through AI

NOVA:通过人工智能进行知识发现的基本限制

Salman Avestimehr, Ken Duffy, Muriel Médard

机构 * University of Southern California(南加州大学) Northeastern University(东北大学) Massachusetts Institute of Technology(麻省理工学院)

AI总结 本文提出NOVA框架,将“生成-验证-积累-再训练”循环建模为知识空间上的自适应采样过程,识别了知识覆盖有限域的条件及失败模式,并证明了发现成本与Zipf定律相关的标度律。

Comments Added an explicit recursive retraining model showing how accepted outputs reshape future generation. New results characterize when repeated retraining suppresses undiscovered artifacts and when mixing updates with a fixed base distribution preserves exposure. Corrected the Zipf discovery-cost proof and expanded the analysis. Main results and implications remain unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22882 2026-08-05 cs.CV cs.RO 版本更新

GEM-4D: Geometry-Enhanced Video World Models for Robot Manipulation

GEM-4D:用于机器人操作的几何增强视频世界模型

Kaichen Zhou, Yuzhen Chen, Fangneng Zhan, Hang Hua, Grace Chen, Xinhai Chang, Ao Qu, Yilun Du, Zhuang Liu, Paul Pu Liang, Mengyu Wang

机构 * Harvard AI and Robotics Lab(哈佛人工智能与机器人实验室) Harvard University(哈佛大学) Media Lab and EECS(媒体实验室和电子工程与计算机科学系) MIT(麻省理工学院) Princeton University(普林斯顿大学) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

AI总结 提出GEM-4D,通过注入从预训练几何基础模型蒸馏的密集4D对应监督,增强视频世界模型的几何一致性,并引入逆动力学模块将视频滚动转换为可执行机器人轨迹,提升操作成功率。

Comments Robotic World Model, Video Generative Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21472 2026-08-05 cs.CV 版本更新

Stream3D: Sequential Multi-View 3D Generation via Evidential Memory

Stream3D: 基于证据记忆的序列多视角3D生成

Kaichen Zhou, Zeyang Bai, Xinhai Chang, Mengyu Wang, Paul Liang, Fangneng Zhan

机构 * World Mind Lab, HKUST(世界心智实验室,香港科技大学) Media Lab and EECS, MIT(媒体实验室和电子工程与计算机科学系,麻省理工学院) Kempner Institute, Harvard University(凯普纳研究所,哈佛大学)

AI总结 提出Stream3D,一种无需训练的流式机制,通过维护紧凑的证据记忆缓存关键历史帧,将冻结的视角条件3D生成器转换为流式生成器,解决单目视频流中3D生成的时间不一致问题。

Comments Multi-view 3D Generation, Streaming 3D Generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17568 2026-08-05 cs.CV

PAGE-4D: Disentangled pose and geometry estimation for vggt-4d perception

PAGE-4D: 通过解耦姿态与几何估计实现VGGT-4D感知

Kaichen Zhou, Yuhan Wang, Grace Chen, Xinhai Chang, Gaspard Beaudouin, Fangneng Zhan, Paul Pu Liang, Mengyu Wang

机构 * Harvard AI and Robotics Lab, Harvard University(哈佛人工智能与机器人实验室,哈佛大学) Media Lab and Electrical Engineering and Computer Science, Massachusetts Institute of Technology(媒体实验室和电气工程与计算机科学,麻省理工学院) Department of Computing, Imperial College London(计算系,帝国理工学院) Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究学院)

AI总结 提出PAGE-4D,扩展VGGT到动态场景,通过动态感知聚合器解耦静态与动态信息,同时提升相机姿态估计、深度预测和点云重建性能。

Comments ICLR 2026, VGGT-4D, Dynamic VGGT

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19592 2026-08-05 cs.LG cs.GT 版本更新

An Efficient Black-Box Reduction from Online Learning to Multicalibration, and a New Route to $Φ$-Regret Minimization

从在线学习到多校准的高效黑盒还原,以及到Φ-后悔最小化的新型途径

Gabriele Farina, Juan Carlos Perdomo

机构 * MIT EECS(麻省理工学院电子工程与计算机科学系) New York University(纽约大学)

AI总结 本文提出从在线学习到在线多校准的黑盒还原方法,并展示了如何通过结合无悔学习器和期望变分不等式求解器实现高维多校准。同时,通过将高维在线多校准还原为Φ-后悔最小化,为外部后悔到Φ-后悔的转换提供了新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04301 2026-08-05 cs.CV 版本更新

Neural Surface Reconstruction from Sparse Views Using Epipolar Geometry

基于稀疏视角的神经表面重建与极几何

Xinhai Chang, Kaichen Zhou

机构 * Yuanpei College, Peking University(北京大学元培学院) MIT Media Lab and EECS, MIT(麻省理工学院媒体实验室和电子工程与计算机科学系)

AI总结 本文提出EpiS框架,利用极几何改进稀疏视角下的表面重建,通过epipolar transformer和射线聚合生成SDF-aware特征,结合几何正则化策略提升重建精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14019 2026-08-05 cs.CV 版本更新

RISE: Single Static Radar-based Indoor Scene Understanding

RISE:基于单静态雷达的室内场景理解

Kaichen Zhou, Laura Dodds, Sayed Saad Afzal, Fadel Adib

机构 * Massachusetts Institute of Technology(麻省理工学院) Cartesian Systems

AI总结 提出RISE系统,利用毫米波雷达的多径反射(传统视为噪声)编码几何线索,通过双角度多径增强和模拟到现实的分层扩散框架,实现布局重建和物体检测,在50,000帧数据集上布局重建倒角距离降低60%,首次实现基于毫米波雷达的物体检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17976 2026-08-05 cs.LG cs.AI 版本更新

In-Context Pure Exploration in Continuous Decision Spaces

在连续空间中进行纯探索的上下文学习

Alessio Russo, Yin-Ching Lee, Ryan Welch, Aldo Pacchiano

机构 * Boston University(波士顿大学) Stanford University(斯坦福大学) Boston University Broad Institute of MIT and Harvard(波士顿大学MIT和哈佛大学Broad研究所)

AI总结 本文提出C-ICPE-TS算法,通过元训练深度神经网络,在连续空间中实现纯探索,直接从数据学习可转移的序列测试策略,无需参数更新或显式信息模型。

Comments Accepted as an oral presentation at ICML 2026 Workshop on Hypothesis Testing, Seoul, South Korea, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20532 2026-08-05 q-bio.NC cs.AI cs.RO 版本更新

MIMIC-MJX: Neuromechanical Emulation of Animal Behavior

MIMIC-MJX:动物行为的神经机械模拟

Charles Y. Zhang, Yuanjia Yang, Aidan Sirbu, Elliott T. T. Abe, Emil Wärnberg, Eric J. Leonardis, Diego E. Aldarondo, Adam Lee, Aaditya Prasad, Jason Foat, Kaiwen Bian, Joshua Park, Rusham Bhatt, Vyom N. Patel, Hutton Saunders, Austin O. Barbano, Akira Nagamori, Ayesha R. Thanawalla, Kee Wui Huang, Fabian Plum, Hendrik K. Beck, Steven W. Flavell, David Labonte, Blake A. Richards, Bingni W. Brunton, Eiman Azim, Bence P. Ölveczky, Talmo D. Pereira

机构 * Department of Organismic and Evolutionary Biology(有机与进化生物学系) Harvard University(哈佛大学) Computational Neurobiology Laboratory(计算神经生物学实验室) Salk Institute for Biological Studies(生物研究 institute) Neurosciences Graduate Program(神经科学研究生项目) University of California San Diego(加州大学圣地亚哥分校) Mila School of Computer Science(计算机科学学院) McGill University(麦吉尔大学) University of Washington(华盛顿大学) eScience Institute(eScience 院) Computational Neuroscience Center(计算神经科学中心) Department of Brain and Cognitive Sciences(脑与认知科学系) Massachusetts Institute of Technology(麻省理工学院) Picower Institute for Learning and Memory(记忆学习研究所) Molecular Neurobiology Laboratory(分子神经生物学实验室) Department of Bioengineering(生物工程系) Imperial College London(帝国理工学院) Howard Hughes Medical Institute(霍华德·休斯医学研究所)

AI总结 MIMIC-MJX通过学习生物合理的神经控制策略,实现了对动物行为的神经机械模拟,具有高准确性和广泛适用性。

Comments Project page available at https://mimic-mjx.talmolab.org

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03942 2026-08-05 cs.SD cs.CL cs.MM 版本更新

MIDI-LLM: Improving Text-to-MIDI Music Generation via Adapting Large Language Models

MIDI-LLM:通过适配大语言模型改进文本到MIDI的音乐生成

Shih-Lun Wu, Dave Carlton, Ryan Miyakawa, Yoon Kim, Chris Donahue, Cheng-Zhi Anna Huang

机构 * Massachusetts Institute of Technology(麻省理工学院)

AI总结 该研究提出MIDI-LLM,通过适配Llama 3.2(1B)采用两阶段训练改进文本到MIDI生成,在用户研究中证实其在人机音乐协同创作中的有效性。

Comments Accepted to International Society for Music Information Retrieval (ISMIR) Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏