How Global Calibration Strengthens Multiaccuracy
如何全局校准增强多准确性
机构 * University of Oxford(牛津大学) ; Apple(苹果公司) ; Stanford University(斯坦福大学)
AI总结 本文研究了多准确性作为学习原语的威力,发现其本身较弱,但结合全局校准后能显著提升,恢复了多校准下的推论。
Comments Presented at FOCS 2025
高校专区
如何全局校准增强多准确性
机构 * University of Oxford(牛津大学) ; Apple(苹果公司) ; Stanford University(斯坦福大学)
AI总结 本文研究了多准确性作为学习原语的威力,发现其本身较弱,但结合全局校准后能显著提升,恢复了多校准下的推论。
Comments Presented at FOCS 2025
超越医学考试:一个由临床专家标注的现实任务及精神卫生领域模糊性公平性数据集
机构 * Stanford University(斯坦福大学) ; University of Colorado(科罗拉多大学) ; Northwestern University(西北大学) ; University of Wisconsin(威斯康星大学) ; Yale School of Medicine(耶鲁医学院) ; University of Chicago(芝加哥大学) ; Ohio State University(俄亥俄州立大学)
AI总结 本文提出一个由临床专家标注的现实任务公平性数据集,用于评估模型在精神卫生领域决策中的性能和偏见问题。
Comments Camera-ready version for ICLR 2026
DiffusionNFT: 在线扩散强化学习与正向过程
机构 * Tsinghua University(清华大学) ; NVIDIA ; Stanford University(斯坦福大学)
AI总结 DiffusionNFT通过正向过程优化扩散模型,结合正负生成对比提升强化学习效率,无需CFG且比FlowGRPO更高效。
Comments ICLR 2026 Oral
将非结构化文本整合到因果推理中:来自真实数据的实证证据
机构 * Amazon(亚马逊公司) ; Stanford University(斯坦福大学)
AI总结 本文提出利用变压器语言模型从非结构化文本中进行因果推理,通过实证研究验证了非结构化文本在因果推断中的有效性,拓展了因果推理在数据稀缺场景下的应用。
Comments 10 pages, 5 figures
VLAW: 视觉-语言-动作策略与世界模型的迭代共改进
机构 * Stanford University(斯坦福大学) ; Tsinghua University(清华大学)
AI总结 本文提出通过迭代改进视觉-语言-动作策略与世界模型,提升真实机器人任务的性能和可靠性。
Comments Project Page: https://sites.google.com/view/vlaw-arxiv
无偏单次查询梯度用于组合目标
机构 * Graduate School of Business, Stanford University, California, USA(斯坦福大学商学院)
AI总结 本文提出一种无偏单次查询梯度方法,用于解决组合优化问题,涵盖REINFORCE方法及新类随机梯度。
Comments 23 pages
PRISMM-Bench: 一种基于同行评审的多模态不一致基准
机构 * Johannes Kepler University Linz(约翰内斯·开普勒大学林茨分校) ; Interdisciplinary Transformation University Austria(跨学科转型大学奥地利) ; MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) ; Stanford University(斯坦福大学) ; MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)
AI总结 PRISMM-Bench是首个基于同行评审标记的多模态不一致基准,通过整理384个不一致点,设计三个任务评估模型跨模态检测和推理能力,揭示了多模态科学推理的挑战。
Comments Accepted at ICLR 2026. Project page https://da-luggas.github.io/prismm-bench/
OpenTSLM:用于多变量医学文本和时间序列数据推理的时间序列语言模型
机构 * Stanford Mussallem Center for Biodesign(斯坦福 Mussallem 生物设计中心) ; Centre for Digital Health Interventions(数字健康干预中心) ; Agentic Systems Lab(代理系统实验室) ; National University of Singapore(新加坡国立大学) ; Microsoft(微软) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Google Research(谷歌研究) ; Stanford University(斯坦福大学) ; Amazon(亚马逊) ; Division of Cardiovascular Medicine(心血管医学部) ; Division of Cardiology(心内科部) ; Pediatric Cardiology(儿童心内科) ; University of Washington(华盛顿大学)
AI总结 OpenTSLM通过整合时间序列作为原生模态,提升对多变量医学文本和时间序列数据的推理能力,其模型在多个任务中均优于基线模型。
BiasFreeBench: 一个用于减轻大型语言模型响应偏见的基准测试
机构 * UC San Diego(加州大学圣地亚哥分校) ; Columbia University(哥伦比亚大学) ; Zhejiang University(浙江大学) ; Stanford University(斯坦福大学)
AI总结 BiasFreeBench通过统一测试平台评估八种主流偏见缓解方法,提供响应层面的偏见自由分数,旨在提升大型语言模型的公平性和安全性。
Comments Accepted by ICLR 2026
有限数据、少样本和零样本生成建模综述
机构 * Singapore University of Technology and Design(新加坡科技设计大学) ; SAP, Singapore(新加坡SAP公司) ; Stanford University(斯坦福大学)
AI总结 本文综述了在有限数据、少样本和零样本条件下生成建模的挑战与方法,提出了新的分类体系,并探讨了未来研究方向。
Comments Accepted to Transactions on Machine Learning Research (TMLR)
Journal ref Transactions on Machine Learning Research (TMLR), 2025
LLMs注意力头熵预测答案正确性
机构 * Stanford University(斯坦福大学) ; University Hospital Zurich(苏黎世大学医院) ; Microsoft AI(微软人工智能)
AI总结 LLMs注意力头熵预测答案正确性,通过注意力熵模式提升跨领域泛化能力,平均提升AUROC 8.5%。
ALMo:交互式目标-限制定义的多目标系统,用于宫颈癌高剂量率近距离治疗计划与可视化
机构 * Stanford University(斯坦福大学) ; University of Washington(华盛顿大学) ; Stanford University School of Medicine(斯坦福大学医学院) ; Paul G. Allen School of Computer Science & Engineering(保罗·G·艾伦计算机科学与工程学院)
AI总结 ALMo是一种用于宫颈癌高剂量率近距离治疗的交互式多目标系统,通过自动化参数设置和直观的剂量学权衡控制,提高治疗计划质量和效率。
Comments Abstract accepted at Symposium on Artificial Intelligence in Learning Health Systems (SAIL) 2025
自适应时间步长流匹配用于自动驾驶运动规划
机构 * HRI ; Honda Research Institute(本田研究院) ; Northeastern University(东北大学) ; Princeton University(普林斯顿大学) ; University of Maryland(马里兰大学) ; Stanford University(斯坦福大学)
AI总结 本文提出了一种基于条件流匹配的自适应时间步长框架,用于实时自动驾驶轨迹规划,通过在线调整推理步骤数和轨迹后处理提升性能。
Comments Accepted to Intelligent Vehicles Symposium 2026
无尽终端:为终端智能体扩展强化学习环境
机构 * Stanford University(斯坦福大学) ; Microsoft Research(微软研究院) ; UW-Madison(威斯康星大学麦迪逊分校)
AI总结 Endless Terminals 通过自动化生成终端任务并训练智能体,显著提升了在终端基准测试和人工整理基准测试上的性能。
通过细胞和基因组相互作用的跨尺度分析揭示空间组织域和细胞类型
机构 * Institute for Computational and Mathematical Engineering, Stanford University(计算与数学工程研究所,斯坦福大学) ; Department of Radiation Oncology, Stanford University(放射肿瘤学系,斯坦福大学) ; Gladstone Institute of Cardiovascular Disease, San Francisco, CA(心血管疾病 Gladstone 研究所,旧金山,CA)
AI总结 CellScape通过跨尺度分析细胞和基因组相互作用,揭示空间组织域和细胞类型,提升空间转录组学数据的分析能力与解释精度。
为适应性效用加权基准评估构建的理论框架
机构 * Stanford University(斯坦福大学)
AI总结 本文提出了一种理论框架,通过多层次适应性网络连接评估指标、模型组件和利益相关者,以更全面地理解评估应代表什么,并通过人参与的更新规则实现动态演变的基准结构。
Comments 10 page, no figures, 40 equations
SteerVLA:在长尾驾驶场景中引导视觉-语言-动作模型
机构 * Stanford University(斯坦福大学) ; University of California, Berkeley(加州大学伯克利分校) ; Microsoft(微软公司)
AI总结 SteerVLA通过结合视觉-语言模型的推理能力,生成细粒度语言指令以提升驾驶策略的稳健性和长尾场景下的性能。
视觉概念排名揭示大型多模态模型使用的医学捷径
机构 * Stanford University(斯坦福大学) ; University of California Berkeley(加州大学伯克利分校)
AI总结 本文提出视觉概念排名方法,用于揭示大型多模态模型在医疗任务中表现的潜在视觉特征依赖性。
多智能体分阶段保守线性老虎机
机构 * Stanford University(斯坦福大学) ; University of California, Santa Barbara(加州大学圣巴巴拉分校)
AI总结 本文提出MA-SCLUCB算法,通过分阶段保守约束实现多智能体在安全保证下的高效分布式学习。
Olmix: 一种用于大型语言模型开发中数据混合的框架
机构 * Allen Institute for AI(艾伦人工智能研究所) ; Stanford University(斯坦福大学) ; University of Washington(华盛顿大学)
AI总结 Olmix通过混合重用机制,在LM开发中高效处理动态变化的领域集合,减少计算量并提升下游任务性能。
分割学习:大规模多目标组合优化
机构 * Department of Computer Science & Engineering UC San Diego(计算机科学与工程系,圣地亚哥大学) ; Department of Statistics Stanford University(统计学系,斯坦福大学) ; Halıcıoğlu Data Science Institute UC San Diego(Halıcıoğlu数据科学研究所,圣地亚哥大学)
AI总结 本文提出一种基于在线学习的多目标组合优化方法,通过分解决策空间和自适应专家引导,实现高效的样本和计算效率,优于现有方法。
Comments Tech report. Code URL coming soon
评估LLM在近期开放领域问题上的可靠性
机构 * University of Alabama Huntsville(阿拉巴马大学亨茨维尔分校) ; University of North Alabama(北阿拉巴马大学) ; Stanford University(斯坦福大学) ; Google(谷歌) ; Apple(苹果公司)
AI总结 RECOM研究通过分析15000个Reddit问题,发现LLM在语义对齐上表现优异,但词汇重合度低,揭示模型通过改写保留意义,挑战传统词汇度量的可靠性。
通过3D手-物体轨迹重建从RGB人类视频中学习灵巧操作策略
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Georgia Institute of Technology(佐治亚理工学院) ; Stanford University(斯坦福大学)
AI总结 VIDEOMANIP通过3D手-物体轨迹重建从RGB视频直接学习灵巧操作策略,实现无需设备的高效训练和高成功率抓取
Transformer中对称破缺以实现高效且可解释的训练
机构 * Stanford University(斯坦福大学) ; Zyphra Technologies(Zyphra技术公司)
AI总结 通过引入对称破缺协议,Transformer模型在提升性能的同时增强了可解释性。
Comments 22 pages, 3 figures
任务算术的公平性:任务向量的作用
机构 * Stanford University(斯坦福大学) ; Mila(Mila研究所) ; Université de Montréal(蒙特利尔大学) ; Institute of Science Tokyo(东京科学研究所) ; Kyoto University(京都大学) ; ZOZO Research(ZOZO研究所)
AI总结 本研究首次系统探讨了任务算术中群体公平性,通过任务向量调整实现公平性与准确性的平衡,为大语言模型的负责任部署提供理论支持。
在分布偏移下稳定性最小最大最优估计
机构 * Decision, Risk, and Operations Division(决策、风险与运营部门) ; Department of Industrial Engineering and Operations Research(工业工程与运筹学系) ; Management Science and Engineering(管理科学与工程) ; Columbia University(哥伦比亚大学) ; Stanford University(斯坦福大学)
AI总结 本文提出了一种最小最大最优稳定性估计器,用于评估系统在分布偏移下的稳定性,通过分析收敛速率和实证验证,展示了其在鲁棒性问题中的应用价值。
Journal ref Operations Research 2026 74:1, 464-483
SurfPhase:从稀疏视频中重建两相流三维界面动力学
机构 * Computer Science Department, Stanford University(斯坦福大学计算机科学系) ; Aerospace Engineering, University of California, Irvine(加州大学伊藤分校航空航天工程系) ; School of Interactive Computing, Georgia Institute of Technology(佐治亚理工学院交互计算学院)
AI总结 SurfPhase通过动态高斯surfels和视频扩散模型,从稀疏视频中重建两相流的三维界面动力学,实现高质量视角合成和速度估计。
Comments The first two authors contributed equally. Project website: https://yuegao.me/SurfPhase
SHAP的统计推断与学习
机构 * Management Science and Engineering, Stanford University(管理科学与工程,斯坦福大学)
AI总结 本文提出了一种半参数方法,用于对SHAP的p次幂进行统计推断,通过去偏差估计器和平滑技术提升特征重要性分析的可靠性。
Comments 48 pages, 1 figure
Flash-SD-KDE: 通过张量核心加速SD-KDE
机构 * Institute for Computational and Mathematical Engineering, Stanford University(计算与数学工程研究所,斯坦福大学)
AI总结 Flash-SD-KDE通过张量核心加速SD-KDE,实现32k样本16维问题47倍提速,1M样本任务2.3秒完成,使高维密度估计变得可行。
Comments 11 pages
基于神经元的配置到性能缩放定律
机构 * IIIS, Tsinghua University(清华大学信息科学技术学院) ; Stanford University(斯坦福大学)
AI总结 本文提出基于神经元的配置到性能缩放定律,通过大规模预训练日志训练模型,实现对训练配置与性能之间关系的准确预测,并支持多超参数联合优化。