Grounded 3D-Aware Spatial Vision-Language Modeling
基于三维感知的空间视觉语言建模
机构 * UCSD(加州大学圣迭戈分校) ; MIT(麻省理工学院) ; NVIDIA(英伟达)
AI总结 提出GR3D模型,通过显式2D定位、隐式2D定位和单目3D定位三种互补定位能力,在单一框架内实现空间链式推理,并在定位与非定位空间基准上取得一致提升。
Comments CVPR 2026 https://www.anjiecheng.me/gr3d
高校专区
基于三维感知的空间视觉语言建模
机构 * UCSD(加州大学圣迭戈分校) ; MIT(麻省理工学院) ; NVIDIA(英伟达)
AI总结 提出GR3D模型,通过显式2D定位、隐式2D定位和单目3D定位三种互补定位能力,在单一框架内实现空间链式推理,并在定位与非定位空间基准上取得一致提升。
Comments CVPR 2026 https://www.anjiecheng.me/gr3d
分子混合物行为预测的系统评估
机构 * KU Leuven(卢森堡大学) ; MIT(麻省理工学院) ; RWTH Aachen University(亚琛工业大学)
AI总结 提出一个将混合物性质误差分解为纯组分和相互作用成分的评估框架,并基于七个匹配数据集发现绝对精度可能掩盖非理想混合行为的恢复能力。
多类别和稀疏上下文赌博机的样本复杂度
机构 * Tel Aviv University(特拉维夫大学) ; Massachusetts Institute of Technology(麻省理工学院) ; Google Research Tel Aviv(谷歌研究特拉维夫) ; Technion—Israel Institute of Technology(技术学院—以色列理工学院)
AI总结 针对随机i.i.d.上下文赌博机,提出基于决策估计系数和低方差探索的算法,在稀疏奖励下实现接近最优的样本复杂度,并匹配下界。
大型语言模型的越狱缩放定律:多项式-指数交叉
机构 * John A. Paulson School of Engineering And Applied Sciences, Harvard University(哈佛大学约翰·A·保罗森工程与应用科学学院) ; Department of Brain and Cognitive Sciences, Massachusetts Institute of Technology(麻省理工学院脑科学与认知科学系) ; Speech and Hearing Bioscience and Technology, Harvard Medical School(哈佛医学院语音与听力生物科学与技术系) ; Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究学院) ; Center for Brain Science, Harvard University(哈佛大学脑科学中心)
AI总结 研究发现对抗性提示注入攻击可使攻击成功率从无注入时的缓慢多项式增长变为随推理样本数指数增长,并通过自旋玻璃模型从理论上解释了这一现象。
E3AD:面向以人为中心的端到端自动驾驶的情感感知视觉-语言-动作模型
机构 * McGill University(麦吉尔大学) ; University of Macau(澳门大学) ; The Hong Kong Polytechnic University(香港理工大学) ; Massachusetts Institute of Technology(麻省理工学院) ; University of Washington(华盛顿大学)
AI总结 提出E3AD框架,通过连续VAD情感模型和双路径空间推理模块,将情感理解融入视觉-语言-动作模型,实现开放域端到端自动驾驶中的情感感知轨迹规划,在真实数据集上达到SOTA性能。
E-valuator: 基于序贯假设检验的可靠智能体验证器
机构 * Genentech(基因泰克) ; MIT(麻省理工学院) ; Johns Hopkins(约翰霍普金斯大学) ; Stanford(斯坦福大学)
AI总结 提出E-valuator方法,将任意黑盒验证器分数转化为具有可控虚警率的决策规则,通过序贯假设检验实现对智能体轨迹的在线监控,提升统计功效并节省令牌。
兴趣问题:理解人类与语言模型对数学问题的兴趣度
机构 * KTH Royal Institute of Technology(皇家理工学院) ; Stanford University(斯坦福大学) ; Massachusetts Institute of Technology(麻省理工学院) ; University of Cambridge(剑桥大学) ; Kempner Institute at Harvard University(哈佛大学肯普尼研究所) ; Mistral AI
AI总结 通过比较大型语言模型与不同数学背景人群对数学问题的兴趣度评分,研究LLM在兴趣判断上与人类的一致性,并评估其生成有趣问题的能力。
Comments Published at the Math-AI Workshop, NeurIPS 2025
估计语言模型代理的赋权能力
机构 * Massachusetts Institute of Technology(麻省理工学院) ; University of Washington(华盛顿大学)
AI总结 提出基于信息论中赋权概念的评估框架EELMA,通过多轮文本交互近似有效赋权,实验表明赋权与任务性能强相关,可作为与任务成功度量互补的通用评估指标。
Comments Published at the International Conference on Machine Learning (ICML) 2026. 9 pages, 9 figures; camera-ready version
跨任务预测驱动推理在AI评估与社会科学研究中的应用
机构 * MIT(麻省理工学院)
AI总结 提出多任务预测驱动推理框架,通过跨任务重校准利用共享结构,在标签稀缺时提升统计推断效率,并证明非线性结构是跨任务增益的必要条件。
运动引导的稀疏校正实现跨不同显微镜体制的专家级点跟踪
机构 * Department of Computer Science, Old Dominion University(奥德赛大学计算机科学系) ; Department of Biology, Massachusetts Institute of Technology(麻省理工学院生物学系) ; The Picower Institute for Learning and Memory, Massachusetts Institute of Technology(麻省理工学院学习与记忆研究所) ; Department of Physics and Technology, UiT--The Arctic University of Norway(挪威北极大学物理与技术系) ; Department of Physics, University of Oslo(奥斯陆大学物理系) ; School of Data Science, Old Dominion University(奥德赛大学数据科学学院) ; Department of Physics, Old Dominion University(奥德赛大学物理系)
AI总结 提出RIPPLE方法,通过运动引导的稀疏校正,在多种显微镜视频中实现专家级点跟踪,将手动标注工作量减少3至25倍。
PROTOCOL: 用于蛋白质同源搜索的延迟交互检索
机构 * MIT(麻省理工学院) ; Princeton University(普林斯顿大学)
AI总结 提出ProtoCol模型,利用ColBERT风格的延迟交互机制对残基嵌入进行最大相似度评分,以提升远程同源搜索的灵敏度,在SCOPe超家族和Pfam clan基准上优于多种基线方法。
深度网络会忘记初始化吗?实用归纳偏见的遗忘时间视角
机构 * MIT(麻省理工学院) ; Northwestern University(西北大学)
AI总结 通过引入初始化记忆度量,研究随机初始化对训练后预测器的影响,发现低学习率SGD保留初始化记忆而Adam族方法遗忘,且遗忘动力学与泛化正则化相关。
Comments 39 pages, 9 figures
高维稀疏更新下随机动量的动力学
机构 * Google DeepMind & MIT(谷歌DeepMind及麻省理工学院) ; McGill University & Mila(麦吉尔大学及MILA)
AI总结 本文通过最小二乘和逻辑回归模型,理论分析了稀疏更新下动量的动力学,揭示了由动量保留时间尺度与学习时间尺度之比决定的相结构,并发现不同令牌稀疏度下的振荡动力学存在谱冲突。
表示对齐依赖于线性结构
机构 * Massachusetts Institute of Technology(麻省理工学院)
AI总结 本文通过信号、偏差和噪声的三部分统计框架研究柏拉图表示假说,提出对齐源于对象与属性的线性关系,并通过稀疏自编码器提取线性特征、中心化和归一化减少偏差、以及数据稀缺导致噪声等证据支持该框架。
面向计算机使用代理的人类引导式危害恢复
机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)
AI总结 针对LM代理在计算机系统中执行操作后的危害恢复问题,通过用户研究定义偏好对齐的恢复维度,提出基于奖励模型对候选恢复计划重排序的方法,并构建BackBench基准测试,实验表明该方法优于基线代理。
用于检测和描述卫星图像中新闻事件的多智能体反馈系统
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Planet Labs
AI总结 提出一种迭代多智能体工作流SkyScraper,通过地理编码新闻文章并合成卫星图像序列描述,有效发现多时相事件并构建5000序列数据集。
机器人何时应该思考?基于强化学习的资源感知推理在具身机器人决策中的应用
机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) ; Northeastern University(东北大学) ; Harvard University(哈佛大学) ; Cornell University(康奈尔大学) ; MIT(麻省理工学院) ; Fujitsu Research of America(美国富士通研究) ; Tsinghua University(清华大学) ; Peking University(北京大学) ; University of Georgia(佐治亚大学) ; Florida International University(佛罗里达国际大学) ; EmbodyX Inc(EmbodyX公司) ; Cisco Systems(思科系统)
AI总结 提出RARRL框架,通过强化学习学习高层编排策略,使具身代理能自适应决定是否调用LLM推理、选择推理角色及分配计算预算,以平衡推理开销与任务成功率。
神经波函数中的拓扑序
机构 * Department of Physics, Massachusetts Institute of Technology, Cambridge, MA-02139, USA(麻省理工学院物理系)
AI总结 本文利用基于注意力的深度神经网络变分波函数,通过能量最小化发现分数量子霍尔效应基态,并引入一种从单一实空间波函数提取拓扑简并度的方法,展示了神经网络变分蒙特卡洛在强关联拓扑相研究中的潜力。
Comments Published version
Journal ref Phys. Rev. B 113, 205119 (2026)
先规定后选择:面向情境随机优化的自适应策略选择
机构 * Sloan School of Management(斯隆管理学院) ; Massachusetts Institute of Technology(麻省理工学院) ; Tandon School of Engineering(坦多工程学院) ; New York University(纽约大学)
AI总结 针对情境随机优化中候选策略在协变量空间表现异质的问题,提出Prescribe-then-Select模块化框架,通过构建可行策略库并基于最优策略树集成学习元策略实现数据驱动的自适应选择,在单阶段报童和两阶段运输规划问题中优于单一最优策略。