SPIRAL: Learning to Search and Aggregate
SPIRAL: 学习搜索与聚合
机构 * Stanford University(斯坦福大学)
AI总结 提出SPIRAL框架,通过强化学习联合训练语言模型在推理时使用顺序推理、并行采样和聚合三种原语,实现端到端优化,显著提升推理计算扩展效率。
Comments Ongoing Work
高校专区
SPIRAL: 学习搜索与聚合
机构 * Stanford University(斯坦福大学)
AI总结 提出SPIRAL框架,通过强化学习联合训练语言模型在推理时使用顺序推理、并行采样和聚合三种原语,实现端到端优化,显著提升推理计算扩展效率。
Comments Ongoing Work
MeshFlow: 基于等变流匹配的网格生成
机构 * City University of Hong Kong(香港城市大学) ; Stanford University(斯坦福大学) ; The University of Texas, Austin(德克萨斯大学奥斯汀分校)
AI总结 提出MeshFlow,利用等变最优传输流匹配模型直接生成三角网格,避免序列化,通过改进扩散变压器架构实现等变性,推理速度提升约18倍。
Comments SIGGRAPH 2026
Cloak: 通过遮蔽末端执行器实现零样本跨本体操作
机构 * Stanford University(斯坦福大学)
AI总结 提出Cloak训练方法,通过遮蔽腕部相机中的末端执行器,使VLA模型实现零样本跨本体迁移,无需新本体数据。
VISTA Architect:一种面向图数据库的健康AI系统,在多学科肿瘤委员会中展示
机构 * Department of Biomedical Data Science, Stanford University School of Medicine(斯坦福大学医学院生物医学数据科学系) ; Department of Medicine, Stanford University School of Medicine(斯坦福大学医学院医学系)
AI总结 提出VISTA Architect架构,通过图数据库和LLM将EHR转化为持久知识图谱,解决长上下文提示和RAG的时序缺失与高成本问题,在胸科肿瘤委员会中实现96.4%准确率。
Comments 22 pages, 4 figures, 6 tables; includes Supplementary Information. Code: https://github.com/VISTA-Stanford/vista-architect (tag v0.1.0-preprint, commit 8837d44)
基于能量的组合扩散规划
机构 * Stanford University(斯坦福大学) ; Georgia Institute of Technology(佐治亚理工学院) ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 提出能量基组合扩散器(ECD),将全局轨迹建模为局部桥势之和的最小化,通过保守修正场和边界反应项改进启发式拼接,实现线性时间复杂度的马尔可夫分数近似,在OGBench任务中达到最优成功率。
Comments ICML 2026
通过观测-动作规范化实现姿态无关的机器人功能性抓取
机构 * Tsinghua University(清华大学) ; Amazon(亚马逊) ; Stanford University(斯坦福大学) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 提出AnyMug框架,通过观测-动作规范化将深度观测和末端执行器动作转换到物体中心坐标系,训练单一闭环策略实现零样本迁移的功能性抓取,在模拟和真实机器人上均取得高成功率。
准确率和梯度余弦遗漏了什么:通过尺度稳定性、参考有效性和深度效用评估反馈对齐
机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Stanford University(斯坦福大学)
AI总结 针对反馈对齐方法评估中准确率和余弦相似度无法检测的两种隐性失效模式,提出包含尺度稳定性、参考有效性和深度效用三项检查的诊断协议,并采用逐层余弦报告。
Comments 12+10 pages
音素救援:基于国际音标的多语言分词
机构 * University of Amsterdam(阿姆斯特丹大学) ; Stanford University(斯坦福大学)
AI总结 提出使用国际音标(IPA)作为多语言分词的语言无关输入表示,通过更平衡的字节-字符分布和跨语言字符重叠,显著提升分词质量,尤其对非拉丁文字和未见语言更有效。
Duet: 通过高效教学实现双机器人理解
机构 * University of Southern California(南加州大学) ; Toyota Research Institute(丰田研究所) ; Stanford University(斯坦福大学)
AI总结 提出DUET框架,利用VR遥操作和人类协作先验,通过预训练与微调结合,实现双机器人移动操作的高效学习,显著降低数据采集成本。
将推理时控制转化为放射学视觉语言模型:针对胸部X光片肺炎分类的激活引导
机构 * Universidade Federal de São Paulo (UNIFESP)(圣保罗联邦大学) ; Hospital Israelita Albert Einstein(以色列阿尔伯特·爱因斯坦医院) ; Stanford University School of Medicine(斯坦福大学医学院) ; DASA ; University of Texas Southwestern Medical Center (UTSW)(德克萨斯大学西南医学中心) ; Eden
AI总结 研究评估对比激活添加(CAA)能否在不微调模型权重的情况下改善胸部X光片视觉语言模型(VLM)的肺炎分类性能,在三个冻结模型上测试,发现对其中一个模型有显著提升。
关于共适应神经接口中用户适应性的可识别性研究
机构 * Stanford University(斯坦福大学)
AI总结 分析共适应人机系统的可识别性,证明闭环编码器估计不能唯一识别用户适应性,而反映联合系统特性,讨论行为适应解释的含义并提出识别条件。
Comments 4 pages, 6 equations, 1 theorem, 1 proof
一种用于定向耦合器设计的LLM编排智能体,具有自洽本征模和FDTD验证
机构 * Department of Mechanical Engineering, University of Maryland, College Park(马里兰大学学院市机械工程系) ; Apsidal LLC ; Department of Radiation Oncology, Stanford University(斯坦福大学放射肿瘤科)
AI总结 提出一种由大语言模型编排的智能体,结合本征模求解器和FDTD验证,自动设计SOI 2×2定向耦合器,实现高精度50/50分束。
微调视觉-语言-动作模型所需的层数比你想象的少
机构 * Center for AI Research, VinUniversity(VinUniversity人工智能研究中心) ; VinRobotics ; University of Arkansas(阿肯色大学) ; Technical University of Denmark(丹麦技术大学) ; Hanoi University of Science and Technology(河内科技大学) ; KAIST(韩国科学技术院) ; Monash University(莫纳什大学) ; Oldenburg University(奥尔登堡大学) ; DFKI(德国人工智能研究中心) ; University of Stuttgart(斯图加特大学) ; IMPRS-IS(国际马克斯·普朗克智能系统研究学院) ; Stanford University(斯坦福大学) ; Technische Universität Darmstadt(达姆施塔特工业大学)
AI总结 本文发现VLA模型存在层间表示冗余,提出无需训练的压缩方法,通过去除冗余层将模型深度减少50%,实现40-50%训练加速和30%推理加速,性能不变。
SFT 过训练通过熵崩溃预测 RLVR 下的排名反转
机构 * Stanford University(斯坦福大学)
AI总结 研究发现 SFT 过度训练导致 rollout 分布熵降低,使 GRPO 中优势信号消失,从而引发排名反转;提出基于熵的两阶段诊断方法可预警高风险检查点。
Comments Accepted at the Deep Learning for Code (DL4C) Workshop at ICML 2026
了解你的局限:LLM在法律推理中作为求解器和自动形式化工具的忠实性
机构 * UC Santa Cruz(加州大学圣克鲁兹分校) ; Univ. Helsinki(赫尔辛基大学) ; CodeX, Stanford(斯坦福大学CodeX中心) ; Stanford University(斯坦福大学) ; Canyon Crest Academy(峡谷峰学院) ; Monta Vista High School(蒙塔维斯塔高中) ; Los Altos High School(洛斯阿尔托斯高中)
AI总结 研究LLM在法律推理中是否忠实执行逻辑推理,发现LLM基于形式推理的高性能掩盖了范围清洗等不忠实模式,揭示基准准确性与逻辑忠实性之间的根本差距。
Comments 10 pages, submitted to COLM 2026 (under review, average score of 6.25 across 4 reviewers) and accepted by the AI4Law and AI4Math workshops at ICML. This is the version where we already addressed most of the reviews from the COLM & AI4Law & AI4Math reviewers
基于LMO方法的零阶无参数优化:高效微调的新方法
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
AI总结 针对大模型微调中反向传播内存开销大、零阶优化对步长和平滑参数敏感的问题,提出统一无梯度训练、自适应调参和非欧几里得更新几何的AdaNAGED方法,并在OPT-1.3B模型上验证有效性。
Comments 29 pages, 1 table
自生成:一种自我进化代理协议
机构 * Nanyang Technological University(南洋理工大学) ; Stanford University(斯坦福大学) ; Princeton University(普林斯顿大学) ; City University of Hong Kong(香港城市大学) ; University of Science and Technology of China(中国科学技术大学)
AI总结 本文提出了一种自生成协议(AGP),该协议通过分离进化内容与进化过程,解决了现有代理协议在跨实体生命周期管理、版本追踪和安全更新接口方面的不足。基于AGP,作者展示了自生成系统(AGS),该系统能够动态实例化、检索和优化协议注册的资源,通过多个具有长视界规划和工具使用的挑战性基准测试,验证了代理资源管理和闭环自我进化的有效性。
积极对齐:人工智能促进人类繁荣
机构 * Department of Psychiatry, University of Oxford(牛津大学精神病学系) ; Flourishing Intelligence Program, Centre for Eudaimonia and Human Flourishing, Linacre College, University of Oxford(牛津大学幸福智能计划、幸福与人类繁荣中心、林acre学院) ; Google DeepMind(谷歌DeepMind) ; LIFE ; OpenAI ; Anthropic ; University of California, Los Angeles(加州大学洛杉矶分校) ; Aily Labs(Aily实验室) ; Stanford University(斯坦福大学) ; Tufts University(塔夫茨大学) ; Positive AI Labs(积极AI实验室) ; Department of Informatics, University of Sussex(Sussex大学信息学系) ; Department of Brain Sciences, Imperial College London(伦敦帝国理工学院脑科学系)
AI总结 本文提出积极对齐,旨在通过支持人类和生态繁荣,同时确保安全与合作,推动AI发展。研究指出传统对齐关注安全,而积极对齐强调促进人类福祉,提出多项技术挑战与设计原则。
谄媚型AI使人类互动感觉更加费力且满意度降低
机构 * University of Oxford(牛津大学) ; Stanford University(斯坦福大学) ; UK AI Security Institute(英国人工智能安全研究所)
AI总结 研究显示,谄媚型AI会改变用户对亲密关系的处理方式,长期使用导致用户更倾向于寻求AI建议而非真实人际关系,且满意度下降。
UMI-on-Air:面向无躯体感知的具身化视觉-运动策略的具身感知引导
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Stanford University(斯坦福大学)
AI总结 本文提出UMI-on-Air框架,通过手握夹具收集的多样化无约束人类示范训练通用视觉-运动策略,结合高阶UMI策略与低阶具身特定控制器,在推理时实现具身感知的轨迹自适应,提升在复杂环境中的执行效率与鲁棒性。
Comments Result videos can be found at umi-on-air.github.io
Journal ref 2026 IEEE International Conference on Robotics and Automation (ICRA)
TinyHistory: 通过两阶段上下文学习实现轻量级视频历史嵌入
机构 * Stanford University(斯坦福大学) ; MIT(麻省理工学院) ; Carnegie Mellon University(卡内基梅隆大学) ; HKUST(香港科技大学)
AI总结 本文提出TinyHistory,通过两阶段上下文学习实现轻量级视频历史嵌入,在有限计算和内存下实现与更重模型相当的一致性。
Comments Additional Results: https://lllyasviel.github.io/TinyHistory_gitpage/
StructSAM: 面向分割一切模型的结构与谱保持令牌合并
机构 * University of Stuttgart(斯图加特大学) ; DFKI ; Max Planck Research School(马克斯·普朗克研究学校) ; University of Oldenburg(奥尔登堡大学) ; Technical University of Darmstadt(达姆施塔特技术大学) ; VinRobotics ; VinUniversity(Vin大学) ; Aalto University(阿莱大学) ; Queensland University of Technology(昆士兰技术大学) ; HUST(华中科技大学) ; Technical University of Denmark(丹麦技术大学) ; University of Arkansas(阿肯色大学) ; UC San Diego(圣地亚哥大学) ; Stanford University(斯坦福大学)
AI总结 针对SAM系列模型,提出StructSAM框架,通过基于梯度能量的令牌评分、网格平坦度筛选和合并-恢复机制,在保持边界和提示信息的同时减少计算量,实现25-30% FLOPs降低且性能损失极小。
Comments Second version
Oracle-RLAIF:一种利用排名反馈强化学习改进多模态视频模型微调框架的方法
机构 * Stanford University(斯坦福大学) ; Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) ; Microsoft(微软公司)
AI总结 提出Oracle-RLAIF框架,用通用排序器替代奖励模型,结合基于GRPO的排名损失函数GRPO_rank,实现更高效的多模态视频模型微调,在多个基准上优于现有方法。
Comments Proceedings of the 39th Annual Conference on Neural Information Processing Systems, ARLET Workshop (Aligning Reinforcement Learning Experimentalists and Theorists)
Journal ref Transactions on Machine Learning Research, Vol. 2026, June 2026
DataMIL: 使用数据模型为机器人模仿学习选择数据
机构 * UT Austin(得克萨斯大学) ; MIT(麻省理工学院) ; Stanford University(斯坦福大学)
AI总结 提出DataMIL框架,基于数据模型端到端选择对任务性能提升最大的数据点,避免基于人类质量标准的过滤,通过替代损失函数避免环境交互,在60+模拟和真实操作任务中验证了有效性。