Variable-Width Transformers
变宽Transformer
机构 * MIT(麻省理工学院) ; MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)
AI总结 提出一种中间窄、两端宽的变宽Transformer架构,通过无参数残差缩放机制实现非均匀容量分配,在语言模型困惑度、FLOPs和KV缓存上优于均匀宽度基线。
高校专区
变宽Transformer
机构 * MIT(麻省理工学院) ; MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)
AI总结 提出一种中间窄、两端宽的变宽Transformer架构,通过无参数残差缩放机制实现非均匀容量分配,在语言模型困惑度、FLOPs和KV缓存上优于均匀宽度基线。
首次证明第二批
机构 * Stanford University(斯坦福大学) ; University of California, Berkeley(加州大学伯克利分校) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Harvard University(哈佛大学) ; Polish Academy of Sciences(波兰科学院) ; UC Berkeley(加州大学伯克利分校) ; Brown University(布朗大学) ; ETH Zürich(苏黎世联邦理工学院) ; MIT(麻省理工学院) ; Weierstrass Institute(魏尔斯特拉斯研究所) ; Duke University(杜克大学) ; Sorbonne Université(索邦大学) ; Boston College(波士顿学院) ; Université du Québec à Montréal(魁北克大学蒙特利尔分校) ; UCLA(加州大学洛杉矶分校) ; University of Michigan(密歇根大学) ; University of Maryland(马里兰大学)
AI总结 测试多个AI系统在十个数学研究问题上的解题能力,评估当前AI解决研究级数学问题的水平。
用于对抗性航天器接近操作中自适应安全关键控制的内存高效元强化学习
机构 * MIT(麻省理工学院) ; University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 本文研究利用元强化学习调整输入约束控制屏障函数的类K函数,比较三种循环网络架构和两种训练算法,发现Mamba与PPO组合在合作与非合作场景中均能提升任务完成率、安全性和燃料效率。
基于确定性积分时间的哈密顿动力学的加速凸优化
机构 * Department of Computer Science, Yale University(耶鲁大学计算机科学系) ; Department of EECS, Massachusetts Institute of Technology(麻省理工学院电子工程与计算机科学系)
AI总结 提出基于哈密顿动力学的平滑凸优化算法,通过利用平均哈密顿流轨迹的收缩而非端点收缩,实现确定性加速收敛,并推导出具有最优一阶复杂度的离散实现。
Comments 51 pages, 7 figures. Accepted to the 39th Annual Conference on Learning Theory (COLT 2026)
纽约市拥堵收费后公共交通增益与空间不均的出行需求变化
机构 * Department of Civil and Environmental Engineering, Massachusetts Institute of Technology(麻省理工学院土木与环境工程系) ; Department of Urban Studies and Planning, Massachusetts Institute of Technology(麻省理工学院城市研究与规划系) ; Mathematical Institute, University of Oxford(牛津大学数学院) ; Department of Mechanical Engineering, Massachusetts Institute of Technology(麻省理工学院机械工程系) ; College of Urban and Environmental Sciences, Peking University(北京大学城市与环境科学学院) ; Department of Urban and Regional Planning, University of Florida(佛罗里达大学城市与区域规划系) ; Center for Computational Science and Engineering, Massachusetts Institute of Technology(麻省理工学院计算科学与工程中心)
AI总结 利用时间序列基础模型生成概率反事实预测,评估纽约市2025年实施的拥堵收费政策,发现公交和地铁客流量显著增加,但总体出行需求略有下降,且影响存在空间异质性。
OmniSapiens: 一种通过异质性感知相对策略优化进行社会行为处理的基础模型
机构 * Massachusetts Institute of Technology(麻省理工学院) ; National University of Singapore(新加坡国立大学) ; Nanyang Technological University(南洋理工大学) ; Prince Sattam bin Abdulaziz University(普森·萨塔姆·本·阿卜杜勒阿齐兹大学) ; University of Rochester(罗切斯特大学)
AI总结 针对行为数据异质性导致的训练不平衡问题,提出Omnisapiens-7B 2.0基础模型,采用异质性感知相对策略优化(HARPO)方法,在10个行为任务和5个零样本泛化基准上取得最佳性能。
Comments Accepted to ICML 2026 Main Conference
SPATIA: 空间细胞表型的多模态生成与预测
机构 * Department of Biomedical Informatics, Harvard Medical School(哈佛医学学校生物医学信息学系) ; Department of Computer Science, University of North Carolina(北卡罗来纳大学计算机科学系) ; Department of Computer Science, Massachusetts Institute of Technology(麻省理工学院计算机科学系)
AI总结 提出SPATIA模型,融合细胞形态、基因表达和空间上下文,通过置信感知流匹配和形态-谱对齐实现多尺度生成与预测,在12项任务中优于18个基线模型。
Comments ICML 2026
向量量化中度量普适性的代价至多为0.11比特
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Hebrew University of Jerusalem(耶路撒冷希伯来大学) ; University of California, San Diego(加州大学圣地亚哥分校)
AI总结 本文证明存在一个通用码本,对于所有可能的X统计量,在W为高斯时,其性能至少与速率每维度降低0.11比特的X自适应水填充码本相当。
Comments 41 page, 1 figure
OmniRetarget:面向人形全身运动操控与场景交互的交互保持数据生成
机构 * Amazon FAR (Frontier AI & Robotics)(亚马逊前沿人工智能与机器人实验室) ; MIT(麻省理工学院) ; UC Berkeley(伯克利大学) ; Stanford University(斯坦福大学) ; CMU(卡内基梅隆大学)
AI总结 提出OmniRetarget引擎,通过交互网格显式建模并保持智能体、地形和物体间的空间与接触关系,将人类运动重定向为机器人运动,生成高质量轨迹以训练强化学习策略,实现长时间跑酷和操控技能。
Comments Project website: https://omniretarget.github.io