arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Stanford University(斯坦福大学)

共收录 2246
2504.15206 2026-02-18 cs.LG cs.CC

How Global Calibration Strengthens Multiaccuracy

如何全局校准增强多准确性

Sílvia Casacuberta, Parikshit Gopalan, Varun Kanade, Omer Reingold

机构 * University of Oxford(牛津大学) Apple(苹果公司) Stanford University(斯坦福大学)

AI总结 本文研究了多准确性作为学习原语的威力,发现其本身较弱,但结合全局校准后能显著提升,恢复了多校准下的推论。

Comments Presented at FOCS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16051 2026-02-18 cs.CL

Moving Beyond Medical Exams: A Clinician-Annotated Fairness Dataset of Real-World Tasks and Ambiguity in Mental Healthcare

超越医学考试:一个由临床专家标注的现实任务及精神卫生领域模糊性公平性数据集

Max Lamparth, Declan Grabb, Amy Franks, Scott Gershan, Kaitlyn N. Kunstman, Aaron Lulla, Monika Drummond Roots, Manu Sharma, Aryan Shrivastava, Nina Vasan, Colleen Waickman

机构 * Stanford University(斯坦福大学) University of Colorado(科罗拉多大学) Northwestern University(西北大学) University of Wisconsin(威斯康星大学) Yale School of Medicine(耶鲁医学院) University of Chicago(芝加哥大学) Ohio State University(俄亥俄州立大学)

AI总结 本文提出一个由临床专家标注的现实任务公平性数据集,用于评估模型在精神卫生领域决策中的性能和偏见问题。

Comments Camera-ready version for ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16117 2026-02-17 cs.LG cs.AI cs.CV

DiffusionNFT: Online Diffusion Reinforcement with Forward Process

DiffusionNFT: 在线扩散强化学习与正向过程

Kaiwen Zheng, Huayu Chen, Haotian Ye, Haoxiang Wang, Qinsheng Zhang, Kai Jiang, Hang Su, Stefano Ermon, Jun Zhu, Ming-Yu Liu

机构 * Tsinghua University(清华大学) NVIDIA Stanford University(斯坦福大学)

AI总结 DiffusionNFT通过正向过程优化扩散模型,结合正负生成对比提升强化学习效率,无需CFG且比FlowGRPO更高效。

Comments ICLR 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14274 2026-02-17 cs.LG cs.AI

Integrating Unstructured Text into Causal Inference: Empirical Evidence from Real Data

将非结构化文本整合到因果推理中:来自真实数据的实证证据

Boning Zhou, Ziyu Wang, Han Hong, Haoqi Hu

机构 * Amazon(亚马逊公司) Stanford University(斯坦福大学)

AI总结 本文提出利用变压器语言模型从非结构化文本中进行因果推理,通过实证研究验证了非结构化文本在因果推断中的有效性,拓展了因果推理在数据稀缺场景下的应用。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12063 2026-02-17 cs.RO

VLAW: Iterative Co-Improvement of Vision-Language-Action Policy and World Model

VLAW: 视觉-语言-动作策略与世界模型的迭代共改进

Yanjiang Guo, Tony Lee, Lucy Xiaoyang Shi, Jianyu Chen, Percy Liang, Chelsea Finn

机构 * Stanford University(斯坦福大学) Tsinghua University(清华大学)

AI总结 本文提出通过迭代改进视觉-语言-动作策略与世界模型,提升真实机器人任务的性能和可靠性。

Comments Project Page: https://sites.google.com/view/vlaw-arxiv

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05119 2026-02-17 cs.LG math.OC

Unbiased Single-Queried Gradient for Combinatorial Objective

无偏单次查询梯度用于组合目标

Thanawat Sornwanee

机构 * Graduate School of Business, Stanford University, California, USA(斯坦福大学商学院)

AI总结 本文提出一种无偏单次查询梯度方法,用于解决组合优化问题,涵盖REINFORCE方法及新类随机梯度。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16505 2026-02-17 cs.CV

PRISMM-Bench: A Benchmark of Peer-Review Grounded Multimodal Inconsistencies

PRISMM-Bench: 一种基于同行评审的多模态不一致基准

Lukas Selch, Yufang Hou, M. Jehanzeb Mirza, Sivan Doveh, James Glass, Rogerio Feris, Wei Lin

机构 * Johannes Kepler University Linz(约翰内斯·开普勒大学林茨分校) Interdisciplinary Transformation University Austria(跨学科转型大学奥地利) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Stanford University(斯坦福大学) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

AI总结 PRISMM-Bench是首个基于同行评审标记的多模态不一致基准,通过整理384个不一致点,设计三个任务评估模型跨模态检测和推理能力,揭示了多模态科学推理的挑战。

Comments Accepted at ICLR 2026. Project page https://da-luggas.github.io/prismm-bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02410 2026-02-17 cs.LG

OpenTSLM: Time-Series Language Models for Reasoning over Multivariate Medical Text- and Time-Series Data

OpenTSLM:用于多变量医学文本和时间序列数据推理的时间序列语言模型

Patrick Langer, Thomas Kaar, Max Rosenblattl, Maxwell A. Xu, Winnie Chow, Martin Maritsch, Robert Jakob, Ning Wang, Juncheng Liu, Aradhana Verma, Brian Han, Daniel Seung Kim, Henry Chubb, Scott Ceresnak, Aydin Zahedivash, Alexander Tarlochan Singh Sandhu, Fatima Rodriguez, Daniel McDuff, Elgar Fleisch, Oliver Aalami, Filipe Barata, Paul Schmiedmayer

机构 * Stanford Mussallem Center for Biodesign(斯坦福 Mussallem 生物设计中心) Centre for Digital Health Interventions(数字健康干预中心) Agentic Systems Lab(代理系统实验室) National University of Singapore(新加坡国立大学) Microsoft(微软) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google Research(谷歌研究) Stanford University(斯坦福大学) Amazon(亚马逊) Division of Cardiovascular Medicine(心血管医学部) Division of Cardiology(心内科部) Pediatric Cardiology(儿童心内科) University of Washington(华盛顿大学)

AI总结 OpenTSLM通过整合时间序列作为原生模态,提升对多变量医学文本和时间序列数据的推理能力,其模型在多个任务中均优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00232 2026-02-17 cs.CL cs.AI cs.CY cs.LG

BiasFreeBench: a Benchmark for Mitigating Bias in Large Language Model Responses

BiasFreeBench: 一个用于减轻大型语言模型响应偏见的基准测试

Xin Xu, Xunzhi He, Churan Zhi, Ruizhe Chen, Julian McAuley, Zexue He

机构 * UC San Diego(加州大学圣地亚哥分校) Columbia University(哥伦比亚大学) Zhejiang University(浙江大学) Stanford University(斯坦福大学)

AI总结 BiasFreeBench通过统一测试平台评估八种主流偏见缓解方法,提供响应层面的偏见自由分数,旨在提升大型语言模型的公平性和安全性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.14397 2026-02-17 cs.CV cs.LG

A Survey on Generative Modeling with Limited Data, Few Shots, and Zero Shot

有限数据、少样本和零样本生成建模综述

Milad Abdollahzadeh, Guimeng Liu, Touba Malekzadeh, Christopher T. H. Teo, Keshigeyan Chandrasegaran, Ngai-Man Cheung

机构 * Singapore University of Technology and Design(新加坡科技设计大学) SAP, Singapore(新加坡SAP公司) Stanford University(斯坦福大学)

AI总结 本文综述了在有限数据、少样本和零样本条件下生成建模的挑战与方法,提出了新的分类体系,并探讨了未来研究方向。

Comments Accepted to Transactions on Machine Learning Research (TMLR)

Journal ref Transactions on Machine Learning Research (TMLR), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13699 2026-02-17 cs.LG

Attention Head Entropy of LLMs Predicts Answer Correctness

LLMs注意力头熵预测答案正确性

Sophie Ostmeier, Brian Axelrod, Maya Varma, Asad Aali, Yabin Zhang, Magdalini Paschali, Sanmi Koyejo, Curtis Langlotz, Akshay Chaudhari

机构 * Stanford University(斯坦福大学) University Hospital Zurich(苏黎世大学医院) Microsoft AI(微软人工智能)

AI总结 LLMs注意力头熵预测答案正确性,通过注意力熵模式提升跨领域泛化能力,平均提升AUROC 8.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13666 2026-02-17 cs.LG cs.AI

ALMo: Interactive Aim-Limit-Defined, Multi-Objective System for Personalized High-Dose-Rate Brachytherapy Treatment Planning and Visualization for Cervical Cancer

ALMo:交互式目标-限制定义的多目标系统,用于宫颈癌高剂量率近距离治疗计划与可视化

Edward Chen, Natalie Dullerud, Pang Wei Koh, Thomas Niedermayr, Elizabeth Kidd, Sanmi Koyejo, Carlos Guestrin

机构 * Stanford University(斯坦福大学) University of Washington(华盛顿大学) Stanford University School of Medicine(斯坦福大学医学院) Paul G. Allen School of Computer Science & Engineering(保罗·G·艾伦计算机科学与工程学院)

AI总结 ALMo是一种用于宫颈癌高剂量率近距离治疗的交互式多目标系统,通过自动化参数设置和直观的剂量学权衡控制,提高治疗计划质量和效率。

Comments Abstract accepted at Symposium on Artificial Intelligence in Learning Health Systems (SAIL) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10285 2026-02-17 cs.RO

Adaptive Time Step Flow Matching for Autonomous Driving Motion Planning

自适应时间步长流匹配用于自动驾驶运动规划

Ananya Trivedi, Anjian Li, Mohamed Elnoor, Yusuf Umut Ciftci, Avinash Singh, Jovin D'sa, Sangjae Bae, David Isele, Taskin Padir, Faizan M. Tariq

机构 * HRI Honda Research Institute(本田研究院) Northeastern University(东北大学) Princeton University(普林斯顿大学) University of Maryland(马里兰大学) Stanford University(斯坦福大学)

AI总结 本文提出了一种基于条件流匹配的自适应时间步长框架,用于实时自动驾驶轨迹规划,通过在线调整推理步骤数和轨迹后处理提升性能。

Comments Accepted to Intelligent Vehicles Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16443 2026-02-17 cs.LG cs.CL

Endless Terminals: Scaling RL Environments for Terminal Agents

无尽终端:为终端智能体扩展强化学习环境

Kanishk Gandhi, Shivam Garg, Noah D. Goodman, Dimitris Papailiopoulos

机构 * Stanford University(斯坦福大学) Microsoft Research(微软研究院) UW-Madison(威斯康星大学麦迪逊分校)

AI总结 Endless Terminals 通过自动化生成终端任务并训练智能体,显著提升了在终端基准测试和人工整理基准测试上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12651 2026-02-16 cs.LG

Uncovering spatial tissue domains and cell types in spatial omics through cross-scale profiling of cellular and genomic interactions

通过细胞和基因组相互作用的跨尺度分析揭示空间组织域和细胞类型

Rui Yan, Xiaohan Xing, Xun Wang, Zixia Zhou, Md Tauhidul Islam, Lei Xing

机构 * Institute for Computational and Mathematical Engineering, Stanford University(计算与数学工程研究所,斯坦福大学) Department of Radiation Oncology, Stanford University(放射肿瘤学系,斯坦福大学) Gladstone Institute of Cardiovascular Disease, San Francisco, CA(心血管疾病 Gladstone 研究所,旧金山,CA)

AI总结 CellScape通过跨尺度分析细胞和基因组相互作用,揭示空间组织域和细胞类型,提升空间转录组学数据的分析能力与解释精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12356 2026-02-16 cs.AI

A Theoretical Framework for Adaptive Utility-Weighted Benchmarking

为适应性效用加权基准评估构建的理论框架

Philip Waggoner

机构 * Stanford University(斯坦福大学)

AI总结 本文提出了一种理论框架,通过多层次适应性网络连接评估指标、模型组件和利益相关者,以更全面地理解评估应代表什么,并通过人参与的更新规则实现动态演变的基准结构。

Comments 10 page, no figures, 40 equations

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08440 2026-02-16 cs.RO

SteerVLA: Steering Vision-Language-Action Models in Long-Tail Driving Scenarios

SteerVLA:在长尾驾驶场景中引导视觉-语言-动作模型

Tian Gao, Celine Tan, Catherine Glossop, Timothy Gao, Jiankai Sun, Kyle Stachowicz, Shirley Wu, Oier Mees, Dorsa Sadigh, Sergey Levine, Chelsea Finn

机构 * Stanford University(斯坦福大学) University of California, Berkeley(加州大学伯克利分校) Microsoft(微软公司)

AI总结 SteerVLA通过结合视觉-语言模型的推理能力,生成细粒度语言指令以提升驾驶策略的稳健性和长尾场景下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05096 2026-02-16 cs.CV cs.LG

Visual concept ranking uncovers medical shortcuts used by large multimodal models

视觉概念排名揭示大型多模态模型使用的医学捷径

Joseph D. Janizek, Sonnet Xu, Junayd Lateef, Roxana Daneshjou

机构 * Stanford University(斯坦福大学) University of California Berkeley(加州大学伯克利分校)

AI总结 本文提出视觉概念排名方法,用于揭示大型多模态模型在医疗任务中表现的潜在视觉特征依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00602 2026-02-16 cs.LG cs.SY eess.SY

Multi-Agent Stage-wise Conservative Linear Bandits

多智能体分阶段保守线性老虎机

Amirhossein Afsharrad, Ahmadreza Moradipari, Sanjay Lall

机构 * Stanford University(斯坦福大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

AI总结 本文提出MA-SCLUCB算法,通过分阶段保守约束实现多智能体在安全保证下的高效分布式学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12237 2026-02-13 cs.LG cs.AI cs.CL

Olmix: A Framework for Data Mixing Throughout LM Development

Olmix: 一种用于大型语言模型开发中数据混合的框架

Mayee F. Chen, Tyler Murray, David Heineman, Matt Jordan, Hannaneh Hajishirzi, Christopher Ré, Luca Soldaini, Kyle Lo

机构 * Allen Institute for AI(艾伦人工智能研究所) Stanford University(斯坦福大学) University of Washington(华盛顿大学)

AI总结 Olmix通过混合重用机制,在LM开发中高效处理动态变化的领域集合,减少计算量并提升下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11346 2026-02-13 cs.LG cs.AI

Divide and Learn: Multi-Objective Combinatorial Optimization at Scale

分割学习:大规模多目标组合优化

Esha Singh, Dongxia Wu, Chien-Yi Yang, Tajana Rosing, Rose Yu, Yi-An Ma

机构 * Department of Computer Science & Engineering UC San Diego(计算机科学与工程系,圣地亚哥大学) Department of Statistics Stanford University(统计学系,斯坦福大学) Halıcıoğlu Data Science Institute UC San Diego(Halıcıoğlu数据科学研究所,圣地亚哥大学)

AI总结 本文提出一种基于在线学习的多目标组合优化方法,通过分解决策空间和自适应专家引导,实现高效的样本和计算效率,优于现有方法。

Comments Tech report. Code URL coming soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11165 2026-02-13 cs.CL cs.AI

Assessing LLM Reliability on Temporally Recent Open-Domain Questions

评估LLM在近期开放领域问题上的可靠性

Pushwitha Krishnappa, Amit Das, Vinija Jain, Tathagata Mukherjee, Aman Chadha

机构 * University of Alabama Huntsville(阿拉巴马大学亨茨维尔分校) University of North Alabama(北阿拉巴马大学) Stanford University(斯坦福大学) Google(谷歌) Apple(苹果公司)

AI总结 RECOM研究通过分析15000个Reddit问题,发现LLM在语义对齐上表现优异,但词汇重合度低,揭示模型通过改写保留意义,挑战传统词汇度量的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09013 2026-02-13 cs.RO cs.CV

Dexterous Manipulation Policies from RGB Human Videos via 3D Hand-Object Trajectory Reconstruction

通过3D手-物体轨迹重建从RGB人类视频中学习灵巧操作策略

Hongyi Chen, Tony Dong, Tiancheng Wu, Liquan Wang, Yash Jangir, Yaru Niu, Yufei Ye, Homanga Bharadhwaj, Zackory Erickson, Jeffrey Ichnowski

机构 * Carnegie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院) Stanford University(斯坦福大学)

AI总结 VIDEOMANIP通过3D手-物体轨迹重建从RGB视频直接学习灵巧操作策略,实现无需设备的高效训练和高成功率抓取

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22257 2026-02-13 cs.LG hep-th

Symmetry Breaking in Transformers for Efficient and Interpretable Training

Transformer中对称破缺以实现高效且可解释的训练

Eva Silverstein, Daniel Kunin, Vasudev Shyam

机构 * Stanford University(斯坦福大学) Zyphra Technologies(Zyphra技术公司)

AI总结 通过引入对称破缺协议,Transformer模型在提升性能的同时增强了可解释性。

Comments 22 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24262 2026-02-13 cs.LG

On Fairness of Task Arithmetic: The Role of Task Vectors

任务算术的公平性:任务向量的作用

Hiroki Naganuma, Kotaro Yoshida, Laura Gomezjurado Gonzalez, Takafumi Horie, Yuji Naraki, Ryotaro Shimizu

机构 * Stanford University(斯坦福大学) Mila(Mila研究所) Université de Montréal(蒙特利尔大学) Institute of Science Tokyo(东京科学研究所) Kyoto University(京都大学) ZOZO Research(ZOZO研究所)

AI总结 本研究首次系统探讨了任务算术中群体公平性,通过任务向量调整实现公平性与准确性的平衡,为大语言模型的负责任部署提供理论支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.06338 2026-02-13 stat.ML cs.LG

Minimax Optimal Estimation of Stability Under Distribution Shift

在分布偏移下稳定性最小最大最优估计

Hongseok Namkoong, Yuanzhe Ma, Peter W. Glynn

机构 * Decision, Risk, and Operations Division(决策、风险与运营部门) Department of Industrial Engineering and Operations Research(工业工程与运筹学系) Management Science and Engineering(管理科学与工程) Columbia University(哥伦比亚大学) Stanford University(斯坦福大学)

AI总结 本文提出了一种最小最大最优稳定性估计器,用于评估系统在分布偏移下的稳定性,通过分析收敛速率和实证验证,展示了其在鲁棒性问题中的应用价值。

Journal ref Operations Research 2026 74:1, 464-483

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11154 2026-02-12 cs.CV

SurfPhase: 3D Interfacial Dynamics in Two-Phase Flows from Sparse Videos

SurfPhase:从稀疏视频中重建两相流三维界面动力学

Yue Gao, Hong-Xing Yu, Sanghyeon Chang, Qianxi Fu, Bo Zhu, Yoonjin Won, Juan Carlos Niebles, Jiajun Wu

机构 * Computer Science Department, Stanford University(斯坦福大学计算机科学系) Aerospace Engineering, University of California, Irvine(加州大学伊藤分校航空航天工程系) School of Interactive Computing, Georgia Institute of Technology(佐治亚理工学院交互计算学院)

AI总结 SurfPhase通过动态高斯surfels和视频扩散模型,从稀疏视频中重建两相流的三维界面动力学,实现高质量视角合成和速度估计。

Comments The first two authors contributed equally. Project website: https://yuegao.me/SurfPhase

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10532 2026-02-12 stat.ML cs.LG math.ST stat.TH

Statistical Inference and Learning for Shapley Additive Explanations (SHAP)

SHAP的统计推断与学习

Justin Whitehouse, Ayush Sawarni, Vasilis Syrgkanis

机构 * Management Science and Engineering, Stanford University(管理科学与工程,斯坦福大学)

AI总结 本文提出了一种半参数方法,用于对SHAP的p次幂进行统计推断,通过去偏差估计器和平滑技术提升特征重要性分析的可靠性。

Comments 48 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10378 2026-02-12 cs.DC cs.LG

Flash-SD-KDE: Accelerating SD-KDE with Tensor Cores

Flash-SD-KDE: 通过张量核心加速SD-KDE

Elliot L. Epstein, Rajat Vadiraj Dwaraknath, John Winnicki

机构 * Institute for Computational and Mathematical Engineering, Stanford University(计算与数学工程研究所,斯坦福大学)

AI总结 Flash-SD-KDE通过张量核心加速SD-KDE,实现32k样本16维问题47倍提速,1M样本任务2.3秒完成,使高维密度估计变得可行。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10300 2026-02-12 cs.LG

Configuration-to-Performance Scaling Law with Neural Ansatz

基于神经元的配置到性能缩放定律

Huaqing Zhang, Kaiyue Wen, Tengyu Ma

机构 * IIIS, Tsinghua University(清华大学信息科学技术学院) Stanford University(斯坦福大学)

AI总结 本文提出基于神经元的配置到性能缩放定律,通过大规模预训练日志训练模型,实现对训练配置与性能之间关系的准确预测,并支持多超参数联合优化。

详情

展开后加载摘要…

URL PDF HTML 收藏