arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Massachusetts Institute of Technology(麻省理工学院)

共收录 2205
2605.28818 2026-08-05 cs.CL q-bio.NC 版本更新

Do VLMs Align Better with Humans than LLMs during Natural Reading?

VLMs 在自然阅读中可能不会全局性地增强与人类的对齐性优于 LLMs

Jinzhou Wu, Zhengwu Ma, Jixing Li, Baoping Tang, Zitong Lu

机构 * Department of Mechanical and Vehicle Engineering, Chongqing University(重庆大学机械与车辆工程学院) Department of Linguistics and Translation, City University of Hong Kong(香港城市大学语言学与翻译系) McGovern Institute for Brain Research, Massachusetts Institute of Technology(麻省理工学院麦戈文脑科学研究所)

AI总结 通过严格文本设置比较LLM和VLM,发现多模态预训练在自然阅读中未带来全局性人类对齐优势,但视觉语义内容强的句子中VLM有选择性优势。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25303 2026-08-05 cs.DS cs.LG math.ST stat.ML stat.TH 版本更新

Algorithms with Polynomially-Improved Approximation Factors for the $2 \rightarrow q$ Norm, and Applications

具有多项式改进近似因子的 $2 \rightarrow q$ 范数算法及其应用

Samuel B. Hopkins, Stefan Tiegel

机构 * MIT(麻省理工学院)

AI总结 本文针对 $q>2$ 时的 $2 \rightarrow q$ 范数,提出了首个多项式时间近似算法,其近似因子在多项式级别上优于基线 $d^{1/4}$,例如 $q=4$ 时达到 $d^{1/8}$,并构造了平方和证书,从而改进了鲁棒均值估计、协方差估计、回归和聚类等问题的算法。

Comments v3 added that sparsification can be used to reduce to n roughly d^q/2

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15219 2026-08-05 cs.AI cs.IT math.IT 版本更新

NOVA: Fundamental Limits of Knowledge Discovery Through AI

NOVA:通过人工智能进行知识发现的基本限制

Salman Avestimehr, Ken Duffy, Muriel Médard

机构 * University of Southern California(南加州大学) Northeastern University(东北大学) Massachusetts Institute of Technology(麻省理工学院)

AI总结 本文提出NOVA框架,将“生成-验证-积累-再训练”循环建模为知识空间上的自适应采样过程,识别了知识覆盖有限域的条件及失败模式,并证明了发现成本与Zipf定律相关的标度律。

Comments Added an explicit recursive retraining model showing how accepted outputs reshape future generation. New results characterize when repeated retraining suppresses undiscovered artifacts and when mixing updates with a fixed base distribution preserves exposure. Corrected the Zipf discovery-cost proof and expanded the analysis. Main results and implications remain unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22882 2026-08-05 cs.CV cs.RO 版本更新

GEM-4D: Geometry-Enhanced Video World Models for Robot Manipulation

GEM-4D:用于机器人操作的几何增强视频世界模型

Kaichen Zhou, Yuzhen Chen, Fangneng Zhan, Hang Hua, Grace Chen, Xinhai Chang, Ao Qu, Yilun Du, Zhuang Liu, Paul Pu Liang, Mengyu Wang

机构 * Harvard AI and Robotics Lab(哈佛人工智能与机器人实验室) Harvard University(哈佛大学) Media Lab and EECS(媒体实验室和电子工程与计算机科学系) MIT(麻省理工学院) Princeton University(普林斯顿大学) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

AI总结 提出GEM-4D,通过注入从预训练几何基础模型蒸馏的密集4D对应监督,增强视频世界模型的几何一致性,并引入逆动力学模块将视频滚动转换为可执行机器人轨迹,提升操作成功率。

Comments Robotic World Model, Video Generative Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21472 2026-08-05 cs.CV 版本更新

Stream3D: Sequential Multi-View 3D Generation via Evidential Memory

Stream3D: 基于证据记忆的序列多视角3D生成

Kaichen Zhou, Zeyang Bai, Xinhai Chang, Mengyu Wang, Paul Liang, Fangneng Zhan

机构 * World Mind Lab, HKUST(世界心智实验室,香港科技大学) Media Lab and EECS, MIT(媒体实验室和电子工程与计算机科学系,麻省理工学院) Kempner Institute, Harvard University(凯普纳研究所,哈佛大学)

AI总结 提出Stream3D,一种无需训练的流式机制,通过维护紧凑的证据记忆缓存关键历史帧,将冻结的视角条件3D生成器转换为流式生成器,解决单目视频流中3D生成的时间不一致问题。

Comments Multi-view 3D Generation, Streaming 3D Generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17568 2026-08-05 cs.CV

PAGE-4D: Disentangled pose and geometry estimation for vggt-4d perception

PAGE-4D: 通过解耦姿态与几何估计实现VGGT-4D感知

Kaichen Zhou, Yuhan Wang, Grace Chen, Xinhai Chang, Gaspard Beaudouin, Fangneng Zhan, Paul Pu Liang, Mengyu Wang

机构 * Harvard AI and Robotics Lab, Harvard University(哈佛人工智能与机器人实验室,哈佛大学) Media Lab and Electrical Engineering and Computer Science, Massachusetts Institute of Technology(媒体实验室和电气工程与计算机科学,麻省理工学院) Department of Computing, Imperial College London(计算系,帝国理工学院) Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究学院)

AI总结 提出PAGE-4D,扩展VGGT到动态场景,通过动态感知聚合器解耦静态与动态信息,同时提升相机姿态估计、深度预测和点云重建性能。

Comments ICLR 2026, VGGT-4D, Dynamic VGGT

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19592 2026-08-05 cs.LG cs.GT 版本更新

An Efficient Black-Box Reduction from Online Learning to Multicalibration, and a New Route to $Φ$-Regret Minimization

从在线学习到多校准的高效黑盒还原,以及到Φ-后悔最小化的新型途径

Gabriele Farina, Juan Carlos Perdomo

机构 * MIT EECS(麻省理工学院电子工程与计算机科学系) New York University(纽约大学)

AI总结 本文提出从在线学习到在线多校准的黑盒还原方法,并展示了如何通过结合无悔学习器和期望变分不等式求解器实现高维多校准。同时,通过将高维在线多校准还原为Φ-后悔最小化,为外部后悔到Φ-后悔的转换提供了新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04301 2026-08-05 cs.CV 版本更新

Neural Surface Reconstruction from Sparse Views Using Epipolar Geometry

基于稀疏视角的神经表面重建与极几何

Xinhai Chang, Kaichen Zhou

机构 * Yuanpei College, Peking University(北京大学元培学院) MIT Media Lab and EECS, MIT(麻省理工学院媒体实验室和电子工程与计算机科学系)

AI总结 本文提出EpiS框架,利用极几何改进稀疏视角下的表面重建,通过epipolar transformer和射线聚合生成SDF-aware特征,结合几何正则化策略提升重建精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14019 2026-08-05 cs.CV 版本更新

RISE: Single Static Radar-based Indoor Scene Understanding

RISE:基于单静态雷达的室内场景理解

Kaichen Zhou, Laura Dodds, Sayed Saad Afzal, Fadel Adib

机构 * Massachusetts Institute of Technology(麻省理工学院) Cartesian Systems

AI总结 提出RISE系统,利用毫米波雷达的多径反射(传统视为噪声)编码几何线索,通过双角度多径增强和模拟到现实的分层扩散框架,实现布局重建和物体检测,在50,000帧数据集上布局重建倒角距离降低60%,首次实现基于毫米波雷达的物体检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17976 2026-08-05 cs.LG cs.AI 版本更新

In-Context Pure Exploration in Continuous Decision Spaces

在连续空间中进行纯探索的上下文学习

Alessio Russo, Yin-Ching Lee, Ryan Welch, Aldo Pacchiano

机构 * Boston University(波士顿大学) Stanford University(斯坦福大学) Boston University Broad Institute of MIT and Harvard(波士顿大学MIT和哈佛大学Broad研究所)

AI总结 本文提出C-ICPE-TS算法,通过元训练深度神经网络,在连续空间中实现纯探索,直接从数据学习可转移的序列测试策略,无需参数更新或显式信息模型。

Comments Accepted as an oral presentation at ICML 2026 Workshop on Hypothesis Testing, Seoul, South Korea, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20532 2026-08-05 q-bio.NC cs.AI cs.RO 版本更新

MIMIC-MJX: Neuromechanical Emulation of Animal Behavior

MIMIC-MJX:动物行为的神经机械模拟

Charles Y. Zhang, Yuanjia Yang, Aidan Sirbu, Elliott T. T. Abe, Emil Wärnberg, Eric J. Leonardis, Diego E. Aldarondo, Adam Lee, Aaditya Prasad, Jason Foat, Kaiwen Bian, Joshua Park, Rusham Bhatt, Vyom N. Patel, Hutton Saunders, Austin O. Barbano, Akira Nagamori, Ayesha R. Thanawalla, Kee Wui Huang, Fabian Plum, Hendrik K. Beck, Steven W. Flavell, David Labonte, Blake A. Richards, Bingni W. Brunton, Eiman Azim, Bence P. Ölveczky, Talmo D. Pereira

机构 * Department of Organismic and Evolutionary Biology(有机与进化生物学系) Harvard University(哈佛大学) Computational Neurobiology Laboratory(计算神经生物学实验室) Salk Institute for Biological Studies(生物研究 institute) Neurosciences Graduate Program(神经科学研究生项目) University of California San Diego(加州大学圣地亚哥分校) Mila School of Computer Science(计算机科学学院) McGill University(麦吉尔大学) University of Washington(华盛顿大学) eScience Institute(eScience 院) Computational Neuroscience Center(计算神经科学中心) Department of Brain and Cognitive Sciences(脑与认知科学系) Massachusetts Institute of Technology(麻省理工学院) Picower Institute for Learning and Memory(记忆学习研究所) Molecular Neurobiology Laboratory(分子神经生物学实验室) Department of Bioengineering(生物工程系) Imperial College London(帝国理工学院) Howard Hughes Medical Institute(霍华德·休斯医学研究所)

AI总结 MIMIC-MJX通过学习生物合理的神经控制策略,实现了对动物行为的神经机械模拟,具有高准确性和广泛适用性。

Comments Project page available at https://mimic-mjx.talmolab.org

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03942 2026-08-05 cs.SD cs.CL cs.MM 版本更新

MIDI-LLM: Improving Text-to-MIDI Music Generation via Adapting Large Language Models

MIDI-LLM:通过适配大语言模型改进文本到MIDI的音乐生成

Shih-Lun Wu, Dave Carlton, Ryan Miyakawa, Yoon Kim, Chris Donahue, Cheng-Zhi Anna Huang

机构 * Massachusetts Institute of Technology(麻省理工学院)

AI总结 该研究提出MIDI-LLM,通过适配Llama 3.2(1B)采用两阶段训练改进文本到MIDI生成,在用户研究中证实其在人机音乐协同创作中的有效性。

Comments Accepted to International Society for Music Information Retrieval (ISMIR) Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01462 2026-08-04 cs.AI 新提交

Loud or Silent? A Reusable Framework for Per-Modality Failure Analysis in Multimodal Clinical AI

大声还是沉默?一种用于多模态临床AI中模态级失败分析的可复用框架

Quang Bui, Shlok Jaiswal, Samuel Paik-Heintz, Kevin Zhou, Kaushik Madapati, Krittaphas Chaisutyakorn, Noah Dane Hebdon, Dimitrios Proios, Sebastián Andrés Cajas Ordóñez, Kacper Dobek, Boya Zhang, Aly Dhedhi, Ahram Han, Kushul Reddy Palakala, Rahul Gorijavolu, Jacques Kpodonu, Leo Anthony Celi

机构 * Massachusetts Institute of Technology(麻省理工学院) American International School Vienna(维也纳美国国际学校) Neuqua Valley High School(纽夸谷高中) North Hollywood High School(北好莱坞高中) Hopewell Valley Central High School(霍普韦尔谷中央高中) University of California, Berkeley(加州大学伯克利分校) Siriraj Hospital(诗里拉吉医院) Harvard University(哈佛大学) Agency for Science, Technology and Research(新加坡科技研究局) Johns Hopkins University(约翰斯·霍普金斯大学) University of Geneva(日内瓦大学) Poznan University of Technology(波兹南理工大学)

AI总结 该研究提出一种模型无关的多模态临床AI模态级失败分析框架,可复用且仅用部署可观测信号,经植入真实值和MIMIC-IV队列验证,能定位失败模态、区分失败类型,为心脏基础模型部署提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00355 2026-08-04 cs.CL cs.LG 新提交

CurveShift: Is Agent Progress Scalar? Separating Level from Shape

CurveShift:智能体的进展是标量吗?区分水平与形态

Hanwen Xing, Pengyun Wang, BingXu Meng, Kumail Alhamoud, Xiang Li, Jicheng Wang, Xin Yu, Xinyang Han, Xiaomin Li, Philip Torr, Yuexing Hao

机构 * University of Southern California(南加利福尼亚大学) University of Chicago(芝加哥大学) University of California, Berkeley(加利福尼亚大学伯克利分校) Massachusetts Institute of Technology(麻省理工学院) Stanford University(斯坦福大学) University of California, Davis(加利福尼亚大学戴维斯分校) Pennsylvania State University(宾夕法尼亚州立大学) Harvard University(哈佛大学) University of Oxford(牛津大学)

AI总结 该研究针对大型语言模型进展的标量总结问题,通过LiveCodeBench基准分离混淆,发现2024年9月后发布的模型在竞赛编程难任务上有超出预期的增益,发布了相关数据集与代码。

Comments 25 pages, 4 figures, 7 tables. Data and code: https://github.com/harvenstar/CurveShift

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00084 2026-08-04 cs.CV physics.optics 新提交

From Pixels to PCells: A Neurosymbolic Approach to Photonic Component Creation

从像素到光子单元(PCells):一种用于光子组件创建的神经符号方法

Aadarsh Agarwal, Kenaish Al Qubaisi, Dirk Englund

机构 * Massachusetts Institute of Technology(麻省理工学院) Research Laboratory of Electronics(电子学研究实验室) University of Chicago(芝加哥大学) The College(学院)

AI总结 该研究提出神经符号系统PixCell,用多模态智能体将视觉呈现的光子组件转为参数化程序,经验证器引导修正的模型在光子组件设计任务上IoU显著提升,建立了相关设计的受控框架。

Comments 16 pages, 13 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20349 2026-08-04 cs.CL cs.AI cs.CY 版本更新

Generative AI floods and dilutes the market for books

生成式人工智能充斥并稀释了图书市场

Tuhin Chakrabarty, Xinyue Liu, Jane C. Ginsburg, Paramveer Dhillon

机构 * Stony Brook University(纽约州立大学石溪分校) Columbia Law School(哥伦比亚法学院) University of Michigan(密歇根大学) MIT Initiative on the Digital Economy(麻省理工学院数字经济倡议)

AI总结 研究通过对亚马逊上自出版小说检测,发现含大量AI文本书籍占书目比重大但销售占比小,其达商业规模且重塑市场,单本销售收入下降,还影响不同类型书籍及畅销书语言借鉴情况,结果关乎版权侵权合理使用抗辩的市场效应问题。

Comments Working Paper Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04452 2026-08-04 physics.ao-ph cs.AI cs.LG physics.comp-ph physics.flu-dyn 版本更新

NORi: An ML-Augmented Ocean Boundary Layer Parameterization

NORi:一种融合机器学习的海洋边界层参数化方法

Xin Kai Lee, Ali Ramadhan, Andre Souza, Gregory LeClaire Wagner, Simone Silvestri, John Marshall, Raffaele Ferrari

机构 * Department of Earth, Atmospheric and Planetary Sciences, Massachusetts Institute of Technology(麻省理工学院地球、大气与行星科学系) Center for Computational Science and Engineering, Massachusetts Institute of Technology(麻省理工学院计算科学与工程中心) Department of Physics, Imperial College London(伦敦帝国学院物理系) atdepth Aeolus Labs(Aeolus实验室) Department of Environment, Land and Infrastructure Engineering, Politecnico di Torino(托里诺理工学院环境、土地与基础设施工程系)

AI总结 NORi是一种基于物理并结合神经网络的机器学习海洋边界层湍流参数化方法,通过训练大规模涡旋模拟来捕捉边界层底部的混合过程,展示了在不同对流强度、背景层结、旋转和风力作用下的预测和泛化能力。

Comments 59 pages, 20 figures, submitted to Journal of Advances in Modeling Earth Systems (JAMES). This is version 3, updated based on reviews from 3 anonymous reviewers after initial submission to JAMES

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27269 2026-08-04 cs.AI 版本更新

Unifying biomedical knowledge in a modern multimodal graph

OptimusKG:统一生物医学知识的现代多模态图

Lucas Vittor, Ayush Noori, Iñaki Arango, Joaquín Polonuer, Sam Rodriques, Andrew White, David A. Clifton, Marinka Zitnik

机构 * Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) Department of Engineering Science, University of Oxford(牛津大学工程科学系) Edison Scientific Inc.(Edison科学公司) Oxford Suzhou Centre for Advanced Research, University of Oxford(牛津大学苏格兰研究中心) Broad Institute of MIT and Harvard(MIT与哈佛大学Broad研究所) Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究所) Harvard Data Science Initiative(哈佛大学数据科学计划)

AI总结 OptimusKG通过整合结构化和半结构化资源,构建了多模态生物医学标记属性图,统一了分子、解剖、临床和环境领域的知识,验证了其在生物医学领域的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01275 2026-08-04 hep-th cs.LG hep-ph 版本更新

Descending into the Modular Bootstrap

模形式Bootstrap的深入探索

Nathan Benjamin, A. Liam Fitzpatrick, Wei Li, Jesse Thaler

机构 * University of Southern California(南加州大学) Boston University(波士顿大学) Massachusetts Institute of Technology(麻省理工学院) The NSF Institute for Artificial Intelligence and Fundamental Interactions(美国国家科学基金会人工智能与基本相互作用研究所)

AI总结 本文通过机器学习优化高效搜索二维共形场论的模形式Bootstrap解,发现中央荷在1到8/7之间的候选CFT,并提出更严格的谱间隙约束。

Comments 57 pages, 21 figures, 4 tables; v2: updated references, acknowledgments, and formatting; v3: additional discussions, bug fixed in Figure 1a, conclusions unchanged, approximate version to appear in JHEP; code available at http://github.com/jdthaler/modular-bootstrap

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15656 2026-08-04 cs.CV

INQUIRE-Search: Interactive Discovery in Large-Scale Biodiversity Databases

INQUIRE-Search:在大规模生物多样性数据库中进行交互式发现

Edward Vendrow, Julia Chae, Rupa Kurinchi-Vendhan, Isaac Eckert, Jazlynn Hall, Marta Jarzyna, Reymond Miyajima, Ruth Oliver, Laura Pollock, Lauren Shrack, Scott Yanco, Oisin Mac Aodha, Sara Beery

机构 * Massachusetts Institute of Technology(麻省理工学院) McGill University(麦吉尔大学) Cary Institute of Ecosystem Studies(生态系统研究所) The Ohio State University(俄亥俄州立大学) University of California Santa Barbara(加州大学圣塔芭芭拉分校) Smithsonian’s National Zoo & Conservation Biology Institute(史密森尼国家动物园与保护生物学研究所) University of Edinburgh(爱丁堡大学)

AI总结 INQUIRE-Search通过自然语言搜索功能,高效提取生物多样性数据库中的关键信息,提升生态研究的交互性和可扩展性。

Comments EV, JC, RKV contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21666 2026-08-04 cs.RO cs.CV 版本更新

Uncertainty Quantification for Visual Object Pose Estimation: S-Lemma Ellipsoidal Bounds

视觉目标姿态估计的不确定性量化

Lorenzo Shaikewitz, Charis Georgiou, Luca Carlone

机构 * Massachusetts Institute of Technology(麻省理工学院)

AI总结 SLUE通过凸优化方法为视觉目标姿态估计提供高概率的椭球不确定性界,有效缩小平移界限并保持方向精度。

Comments 18 pages, 9 figures. Code available: https://github.com/MIT-SPARK/PoseUncertaintySets. Published in IEEE Transactions on Robotics

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02235 2026-08-04 eess.SY cs.AI cs.SY eess.SP math.OC 版本更新

Partial Excitation in Parameter Learning

参数学习中的部分激励

Ganghui Cao, Shimin Wang, Martin Guay, Jinzhi Wang, Zhisheng Duan, Marios M. Polycarpou

机构 * State Key Laboratory for Turbulence and Complex Systems, Department of Mechanics and Engineering Science, College of Engineering, Peking University(湍流与复杂系统国家重点实验室,力学与工程科学系,工程学院,北京大学) Massachusetts Institute of Technology(麻省理工学院) Queen’s University(皇后大学) KIOS Research and Innovation Center of Excellence and the Department of Electrical and Computer Engineering, University of Cyprus(科斯卓越研究中心与创新中心,塞浦路斯大学电气与计算机工程系)

AI总结 本文针对部分持续激励(PPE)条件下的参数学习问题,提出在线算法与协同学习协议,实现分布式最优参数估计,通过系统辨识实例验证了理论结果的有效性。

Comments 16 pages,9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15751 2026-08-03 hep-ex cs.LG 版本更新

Enabling Low-Latency Machine learning on Radiation-Hard FPGAs with hls4ml

利用hls4ml在抗辐射FPGA上实现低延迟机器学习

Katya Govorkova, Julian Garcia Pardinas, Vladimir Loncar, Victoria Nguyen, Sebastian Schmitt, Marco Pizzichemi, Loris Martinazzoli, Eluned Anne Smith

机构 * Massachusetts Institute of Technology (MIT)(麻省理工学院) Department of Experimental Physics, European Organization for Nuclear Research (CERN)(欧洲核子研究中心(CERN)实验物理系) University of Milano-Bicocca (Italy)(米兰-布雷拉大学)

AI总结 本文提出利用hls4ml在抗辐射FPGA上实现低延迟机器学习,通过轻量级自编码器和量化策略,展示在PolarFire FPGA上达到25ns延迟的可行性。

Journal ref Machine Learning: Science and Technology 7 (2026) 045024

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05131 2026-08-03 cs.CV cs.AI cs.RO 版本更新

AREA3D: Active Reconstruction Agent with Unified Feed-Forward 3D Perception and Vision-Language Guidance

AREA3D: 带有统一前馈3D感知和视觉-语言引导的主动重建代理

Tianling Xu, Shengzhe Gan, Leslie Gu, Yuelei Li, Fangneng Zhan, Hanspeter Pfister

机构 * Southern University of Science and Technology(南方科技大学) Harvard University(哈佛大学) California Institute of Technology(加州理工学院) Massachusetts Institute of Technology(麻省理工学院)

AI总结 AREA3D通过统一前馈3D感知与视觉-语言引导,实现高效主动3D重建,尤其在稀疏视角下提升重建精度。

Journal ref Tianling Xu, Shengzhe Gan, Leslie Gu, Yuelei Li, Fangneng Zhan, Hanspeter Pfister. The IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (The IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21799 2026-08-03 cs.LG cs.AI 版本更新

Towards White-Box Deep Wireless Sensing

迈向白盒深度无线感知

Xie Zhang, Yina Wang, Chenshu Wu

机构 * The University of Hong Kong(香港大学) MIT(麻省理工学院)

AI总结 该研究针对现有深度无线感知模型为黑盒的问题,提出基于复稀疏率降维原理的全复值Transformer模型RF-CRATE,引入子空间正则化解决数据稀缺问题,在五项数据集的多类任务中验证其性能优于黑盒模型且具备可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28608 2026-07-31 cs.LG q-bio.QM 新提交

KAISEN: Reproducible Subgroup Fairness Auditing for Clinical Risk Models

KAISEN:临床风险模型可复现的子群体公平性审计

Sparsh Roy, Samuel Girmachew, Nishita Chavan

机构 * Massachusetts Institute of Technology(麻省理工学院) Hopewell Valley Central High School(霍普韦尔谷中央高中) East Brunswick High School(东布伦瑞克高中)

AI总结 KAISEN是一个五阶段临床风险模型子群体公平性审计流程,经合成基准测试揭示了审计各环节的特性与局限性,相关复现资源已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05554 2026-07-31 cs.LG cs.AI cs.DM math.CA 版本更新

Critical attention scaling in long-context transformers

长上下文Transformer中的关键注意力缩放

Shi Chen, Zhengjiang Lin, Yury Polyanskiy, Philippe Rigollet

机构 * Department of Mathematics, Massachusetts Institute of Technology(数学系,麻省理工学院) Department of Electrical Engineering and Computer Science, Massachusetts Institute of Technology(电气工程与计算机科学系,麻省理工学院)

AI总结 该研究针对长上下文Transformer的注意力秩崩溃问题,通过分析简化模型确定关键缩放因子$\beta_n \backsim \text{log} n$,为YaRN和Qwen的注意力缩放提供理论依据,阐明对数缩放可维持长上下文下的稀疏内容自适应注意力。

Comments 31 pages, 2 figures

Journal ref Proceedings of the Fourteenth International Conference on Learning Representations (ICLR 2026), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26571 2026-07-30 cs.LG cs.SE 新提交

From Tokens to Watt-hours: Analytical Energy Estimation for LLM Inference on Modern GPUs

从Token到瓦时:现代GPU上大语言模型(LLM)推理的分析式能耗估算

Tina Vartziotis, Rodopi Kosteli, Elli Vartziotis, George Dasoulas, Michael Keckeisen, Konstantinos Skianis, Sotirios Kotsopoulos, Francesca Dominici

机构 * National Technical University of Athens(雅典国家技术大学) Harvard University(哈佛大学) TWT GmbH Science & Innovation(TWT有限责任公司科学与创新部) NIKI Ltd Digital Engineering(尼基数字工程有限公司) University of Ioannina(约阿尼纳大学) National and Kapodistrian University of Athens(雅典国立卡波迪斯特里亚大学) Massachusetts Institute of Technology(麻省理工学院)

AI总结 该研究提出一种无需直接测量的GPU级LLM推理能耗分析估算方法,适用于模型比较、绿色编码分析及设计时评估。

Comments 20 pages, 3 figures, 6 tables. Accepted for oral presentation at the GREEN-AI Workshop, co-located with ECML-PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26279 2026-07-30 cs.RO 新提交

Multi-Objective Compliance-Integrated Coevolution For Simulated And Real-World Deployment Of Multi-Robot Marine Autonomy

面向多机器人海洋自主系统仿真与实际部署的多目标合规性集成协同进化算法

Everardo Gonzalez, Tyler M. Paine, Manuel Agraz Vallejo, Gaurav Dixit, Michael R. Benjamin, Kagan Tumer

机构 * Oregon State University(俄勒冈州立大学) MIT(麻省理工学院)

AI总结 本文提出MMOCIC框架,将协同进化与合规性行为解耦,在多机器人海洋任务中平衡团队进展与规范遵守,硬件部署8个、仿真12个机器人时均实现高性能且无碰撞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18584 2026-07-30 cs.AI cs.DL cs.IR cs.LG 版本更新

MathNet: a Global Multimodal Benchmark for Mathematical Reasoning and Retrieval

MathNet:数学推理与检索的全球多模态基准

Shaden Alshammari, Kevin Wen, Abrar Zainal, Mark Hamilton, Navid Safaei, Sultan Albarakati, William T. Freeman, Antonio Torralba

机构 * MIT(麻省理工学院) KAUST(卡塔尔人工智能研究 institute) HUMAIN Individual Researcher(独立研究者)

AI总结 MathNet是一个大规模多模态数学问题基准,包含47个国家、17种语言、20年竞赛的30676道专家级数学问题,支持问题解决、数学检索和检索增强生成三个任务,实验表明先进模型在推理和检索任务上仍面临挑战。

Comments ICLR 2026; Website: http://mathnet.mit.edu

Journal ref Proceedings of the International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏