Multisensory Continual Learning: Adapting Pretrained Visuomotor Policies to Force
多感官持续学习:将预训练的视觉运动策略适应到力觉
机构 * Stanford University(斯坦福大学)
AI总结 提出MuSe方法,通过多阶段融合、多感官未来预测和预训练数据经验回放,将有限的多感官数据融入预训练的纯视觉策略,在保持原始任务性能的同时适应新任务。
高校专区
多感官持续学习:将预训练的视觉运动策略适应到力觉
机构 * Stanford University(斯坦福大学)
AI总结 提出MuSe方法,通过多阶段融合、多感官未来预测和预训练数据经验回放,将有限的多感官数据融入预训练的纯视觉策略,在保持原始任务性能的同时适应新任务。
何时学习停止有帮助?推理模型中早期退出的成本感知研究
机构 * University of Maine at Presque Isle(缅因大学普雷斯克岛分校) ; Stanford University(斯坦福大学) ; Independent Researcher(独立研究员)
AI总结 研究推理语言模型中学习停止规则相对于简单置信度或收敛阈值的优势,提出LearnStop方法,发现其效果取决于任务类型,在自由形式数学任务中表现优于标量退出。
Comments 23 pages, 5 figures
无高斯假设的可识别性:符号世界模型与近无限时间一致性
机构 * Department of Computer Science, Stanford University(1 计算机科学系,斯坦福大学)
AI总结 本文提出物理基础符号架构(PGSA),证明其在非高斯动态系统中实现精确线性可识别性和近无限时间一致性,克服了统计世界模型的高斯边界限制。
Comments Pre-print
泛化的搭便车假说:解释和缓解涌现的错位
机构 * Northeastern University(东北大学) ; Stanford University(斯坦福大学) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 提出搭便车假说,认为聊天模板标记导致微调行为泛化到无关领域,并设计TReFT方法通过正则化标记表示缓解涌现错位,在多个数据集上有效。
游戏共识:众包事实核查中的协调操纵
机构 * Stanford University(斯坦福大学) ; X Community Notes(X社区笔记) ; xAI
AI总结 研究众包事实核查系统中矩阵分解桥接机制对协调操纵的脆弱性,发现通过少于10个评分即可操纵低质量笔记达到共识阈值,并提出了缓解措施。
Comments ICML 2026
KV缓存压缩的风险
机构 * RWTH Aachen University(亚琛工业大学) ; Stanford University(斯坦福大学)
AI总结 针对长序列Transformer推理中KV缓存压缩的瓶颈,本文通过最小化最大风险理论,揭示了缓存内在可压缩性决定准确压缩的边界,并设计出在因果掩码下达到最优风险的实用算法,在LongBench上取得良好效果。
FaithMed: 训练大语言模型进行忠实于证据的医学推理
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Stanford University School of Medicine(斯坦福大学医学院) ; Xlue
AI总结 提出FaithMed框架,通过过程级奖励和优势分组强化学习,监督LLM在医学推理中忠实评估和应用检索证据,在7个基准上平均提升9%。
Comments 15 pages, 5 figures
离散扩散语言模型用于交互式放射报告草稿生成
机构 * Stanford University School of Medicine(斯坦福大学医学院) ; Ghent University(根特大学) ; Stanford University(斯坦福大学)
AI总结 提出将离散扩散语言模型用于放射报告草稿生成,利用其任意顺序填充能力实现交互式编辑,在医学VQA任务上达到或超越自回归模型,解码速度快3.5-4.4倍。
DarkVGGT: 利用热几何在黑暗中透视,无需日光代价
机构 * University of Minnesota(明尼苏达大学) ; Texas A&M University(德克萨斯农工大学) ; Stanford University(斯坦福大学)
AI总结 提出DarkVGGT,一种RGB-T前馈几何框架,通过物理感知热建模实现低光照场景下的鲁棒3D估计,引入热分解和几何共享路由模块,在退化RGB条件下保持精度。
Comments Project Page: https://darkvggt.github.io
世界源于运动:从单目视频生成动态高斯重建
机构 * Stanford University(斯坦福大学) ; NVIDIA(英伟达)
AI总结 提出World from Motion方法,利用视频模型从单目视频生成可自由渲染的动态3D高斯表示,通过像素对齐渲染校正伪影并填充缺失区域,实现4D重建新高度。
Comments Project page: https://research.nvidia.com/labs/amri/projects/world-from-motion/
ROSA: 面向机器人工厂的基础模型服务系统
机构 * NVIDIA Research(英伟达研究院) ; Stanford University(斯坦福大学)
AI总结 提出ROSA系统,通过共享GPU池服务、多模型流水线支持和工厂目标驱动调度,将机器人工厂的RFM推理性能提升12倍以上。
SuperFlex: 用于点云分解的可变形超二次曲面
机构 * ETH Zurich(苏黎世联邦理工学院) ; Stanford University(斯坦福大学) ; IMPA(巴西国家纯数学与应用数学研究所) ; USI Lugano(卢加诺大学)
AI总结 提出SuperFlex框架,通过新损失函数、弯曲和锥形变形提升超二次曲面分解精度,并利用高质量分解训练模型以鲁棒处理部分点云。
Comments Project page: https://superflex3d.github.io
Active-GRPO:用于分子优化的自适应模仿与自我改进推理
机构 * School of Medicine, Stanford University(斯坦福大学医学院) ; Data Science Institute, University of Chicago(芝加哥大学数据科学研究所) ; Pritzker School of Molecular Engineering, University of Chicago(芝加哥大学普利兹克分子工程学院) ; Department of Computer Science, University of Chicago(芝加哥大学计算机科学系) ; Argonne National Laboratory(阿贡国家实验室)
AI总结 提出Active-GRPO方法,通过主动模仿-强化和主动参考机制,在分子优化中自适应平衡模仿与自我改进,显著提升性能。
建构性对齐:人机交互中的偏好动态治理
机构 * Stanford University(斯坦福大学) ; Northwestern University(西北大学)
AI总结 提出建构性对齐范式,将对齐问题重构为控制人类偏好轨迹演化的控制问题,而非静态偏好满足,通过控制论框架确保价值轨迹的连贯性与反思性。
Comments 23 pages, 1 figure; Proceedings of the AAAI-26 Workshop on Machine Ethics
AutoMem:自动化学习记忆作为认知技能
机构 * Stanford University(斯坦福大学)
AI总结 提出AutoMem框架,通过双循环自动优化LLM的记忆管理结构和使用能力,在长时域任务中提升性能约2-4倍。
Comments Project Website: https://autolearnmem.github.io/
QuasiMoTTo: 准蒙特卡洛测试时扩展
机构 * Stanford University(斯坦福大学)
AI总结 提出QuasiMoTTo方法,利用准蒙特卡洛相关采样替代独立同分布采样,在推理和强化学习中减少冗余,以更少样本达到相同性能。
蒸馏检测:通过弹药筒蒸馏揭露大语言模型中的隐蔽偏见
机构 * Stanford University(斯坦福大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Foundation AI–Cisco Systems Inc.(Foundation AI–思科系统公司)
AI总结 提出Distill to Detect (D2D)方法,通过蒸馏模型与基座之间的分布偏移到KV缓存前缀适配器中,放大隐蔽偏见信号至可检测程度,并基于Fisher加权投影理论解释其有效性。
Comments Accepted to the ICML 2026 Workshops on TAIGR, AI4GOOD, Mechanistic Interpretability, and CoLoRAI
超越专家用户:智能体应帮助用户构建偏好,而不仅仅是引出偏好
机构 * Stanford University(斯坦福大学)
AI总结 本文提出用户通常不具备完整偏好,智能体应通过示例或解释帮助用户学习领域知识以构建偏好,并基于信息经济学引入CoPref模型,在推荐系统中通过CoShop基准测试发现现有智能体表现不佳。
Comments Update URLs
使用旋转视图EPI和高斯原型的联合场图/图像估计的畸变校正扩散MRI
机构 * Chair for AI in Healthcare and Medicine, Technical University of Munich (TUM) and TUM University Hospital, and the School of Computation, Information and Technology, TUM(慕尼黑工业大学(TUM)医疗与医学人工智能教席、TUM大学医院、计算信息与技术学院) ; Neuroimaging Technology Research Center, Department of Radiology and Biomedical Imaging, University of California, San Francisco(加州大学旧金山分校放射与生物医学影像系神经影像技术研究中心) ; Innovation Academy for Precision Measurement Science and Technology, Chinese Academy of Sciences(中国科学院精密测量科学与技术创新研究院) ; Department of Radiology, Stanford University(斯坦福大学放射学系) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML)) ; Department of Computing, Imperial College London(伦敦帝国理工学院计算系)
AI总结 提出一种物理信息框架,直接从k空间联合估计B0场和无畸变图像,避免中间并行成像重建,通过高斯原型的连续参数化表示图像和场,支持旋转视图EPI,在高b值和高加速下显著改善畸变校正质量。
动态认知逻辑中的信念收缩
机构 * Stanford University(斯坦福大学) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 针对动态认知逻辑无法建模事实命题信念收缩的问题,提出直接在标准Kripke模型上定义信念收缩机制,满足部分收缩性质,并给出公理化及扩展逻辑。
Comments In Proceedings AiML 2026, arXiv:2606.29444
Journal ref EPTCS 447, 2026, pp. 137-157
机器人操作的鲁棒性:基础与前沿
机构 * Duke University(杜克大学) ; KTH Royal Institute of Technology(瑞典皇家理工学院) ; Stanford University(斯坦福大学) ; Massachusetts Institute of Technology(麻省理工学院) ; Organifarms
AI总结 本文系统研究机器人操作鲁棒性,提出正式定义、概率与控制理论框架,并综述感知、规划、控制、策略学习和硬件中的鲁棒性机制及评估方法,展望实现人类级鲁棒性的未来方向。
从失败中学习:计算机使用代理的推理时自我改进
机构 * Stanford University(斯坦福大学) ; Tsinghua University(清华大学)
AI总结 提出失败驱动的自我改进循环,利用LLM诊断失败模式并生成代码补丁,在OSWorld基准上将OpenCUA-72B模型成功率从42.3%提升至48.9%,无需额外训练成本。
Comments Published in ECCV 2026
自然语言解释中的判断质量测量:来自预测锦标赛的证据
机构 * Forecasting Research Institute(预测研究所) ; Good Judgment Inc(Good Judgment公司) ; University of Toronto(多伦多大学) ; Vector Institute for Artificial Intelligence(向量人工智能研究所) ; Stanford University(斯坦福大学) ; School of Arts and Sciences & Wharton, University of Pennsylvania(宾夕法尼亚大学文理学院与沃顿商学院) ; Federal Reserve Bank of Chicago(芝加哥联邦储备银行) ; Federal Reserve System(联邦储备系统)
AI总结 提出解释质量标记(EQMs),用大语言模型评分60种理论驱动的推理模式,在超过55,000个预测-理由对中预测准确性,优于传统方法。
代理浏览器的同源策略
机构 * Duke University(杜克大学) ; Stanford University(斯坦福大学) ; UC Berkeley(加州大学伯克利分校)
AI总结 研究代理浏览器中同源策略的有效性,构建SOPBench评估基准,发现现有代理浏览器频繁违反SOP,并提出SOPGuard机制来强制执行SOP,同时保持效用和低开销。
INFUSER: 影响力引导的自我进化提升推理能力
机构 * Yale University(耶鲁大学) ; Stanford University(斯坦福大学) ; University of Chicago(芝加哥大学) ; Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) ; University of California, San Diego(圣地亚哥大学)
AI总结 提出INFUSER框架,通过生成器与求解器的协同进化,利用影响力分数和DuGRPO优化,从文档池中自适应生成训练数据,显著提升模型推理性能。
Comments 67 pages, 17 figures
PerturbCellRL:用于单细胞扰动预测的验证器引导强化学习
机构 * Stanford University(斯坦福大学) ; Peking University(北京大学)
AI总结 提出PerturbCellRL框架,通过强化学习后训练预训练的单细胞转录组生成器,利用细胞级验证器奖励确保生物一致性,在多个基准上提升预测性能。
基于物理世界建模的感知3D仿真
机构 * Stanford University(斯坦福大学)
AI总结 提出P3Sim系统,结合学习型物理世界模型、几何条件模块和持久场景记忆,在部分观测和不完整3D变换信号下模拟未来场景状态,实现多任务泛化。
Comments Published as a conference paper at CVPR 2026
微调多模态大语言模型用于从短视频中对自闭症行为进行临床级评分
机构 * Stanford University(斯坦福大学) ; University of Hawaii at Manoa(夏威夷大学马诺阿分校) ; University of California San Francisco(加利福尼亚大学旧金山分校)
AI总结 微调Gemini 2.5 Pro模型,从400个临床评分的家庭视频中提取30个行为特征,在99名儿童上实现与临床医生评分的一致性提升40%,并零样本达到53%的自闭症诊断F1提升。
纯正样本学习中的意外
机构 * University of Waterloo and Vector Institute(滑铁卢大学和向量研究所) ; Stanford University(斯坦福大学) ; Yale University(耶鲁大学)
AI总结 本文研究了纯正样本二分类问题,提出了“均匀外部可分离性”这一新组合条件,并证明概念类可被恰当学习当且仅当VC维有限且满足该条件,揭示了与标准PAC学习截然不同的丰富图景。
拓扑信息神经网络用于光学和合成孔径雷达影像的洪水检测
机构 * US Naval Research Laboratory(美国海军研究实验室) ; Stanford University(斯坦福大学)
AI总结 针对云遮挡导致光学卫星图像难以检测洪水的问题,提出将拓扑数据分析(TDA)提取的拓扑特征融入神经网络,在SEN12-FLOOD数据集上实现更鲁棒和可解释的洪水检测。