arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Stanford University(斯坦福大学)

共收录 2246
2604.27309 2026-05-01 cs.AI

End-to-End Evaluation and Governance of an EHR-Embedded AI Agent for Clinicians

面向临床医生的嵌入式电子健康记录(EHR)AI代理的端到端评估与治理

Aaryan Shah, Andrew Hines, Alexia Downs, Denis Bajet, Paulius Mui, Fabiano Araujo, Laura Offutt, Aida Rutledge, Elizabeth Jimenez

机构 * Canvas Medical Department of Biomedical Data Science, Stanford University(斯坦福大学生物医学数据科学系) XPC (X Primary Care)(XPC(X初级医疗)) FCA Consulting(FCA咨询) Department of Pediatrics, University of Nevada(内华达大学儿科系)

AI总结 本文提出一个端到端治理框架,通过rubric验证、实时部署反馈、技术性能监控和成本追踪,持续优化临床AI系统性能,实验显示系统性能显著提升。

Comments 19 pages, 6 figures, 6 tables, submitted to npj Digital Medicine

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26965 2026-05-01 cs.CY cs.AI cs.SI

The Impact of AI-Generated Text on the Internet

人工智能生成文本对互联网的影响

Jonas Dolezal, Sawood Alam, Mark Graham, Maty Bohacek

机构 * Imperial College London(帝国理工学院伦敦分校) Internet Archive(互联网档案库) Stanford University(斯坦福大学)

AI总结 研究通过分析2022-2025年互联网上的网站样本,发现AI生成文本占比达35%,并探讨其对语义多样性、情感倾向等的影响,但未发现事实准确性下降的证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07986 2026-05-01 cs.LG cs.AI

EXPO: Stable Reinforcement Learning with Expressive Policies

EXPO: 通过表达性策略进行稳定的强化学习

Perry Dong, Qiyang Li, Dorsa Sadigh, Chelsea Finn

机构 * Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校)

AI总结 EXPO通过构建实时策略最大化Q值,提升样本效率,适用于基于离线数据的策略微调和在线训练。

Comments changed formatting, added code

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22750 2026-04-30 cs.CL cs.AI cs.CY cs.HC cs.SE

How Do AI Agents Spend Your Money? Analyzing and Predicting Token Consumption in Agentic Coding Tasks

AI代理如何花费你的钱?分析和预测代理编码任务中的令牌消耗

Longju Bai, Zhemin Huang, Xingyao Wang, Jiao Sun, Rada Mihalcea, Erik Brynjolfsson, Alex Pentland, Jiaxin Pei

机构 * University of Michigan(密歇根大学) Stanford University(斯坦福大学) All Hands AI Google Deepmind(谷歌DeepMind) Microsoft AI(微软AI) Massachusetts Institute of Technology(麻省理工学院)

AI总结 本文研究了代理编码任务中令牌消耗模式,发现代理任务消耗远高于代码推理和代码聊天,且模型在任务执行前难以准确预测自身令牌使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26479 2026-04-30 stat.ME cs.LG

Recipes for Calibration Checks in Safety-Critical Applications

安全关键应用中的校准检查配方

Romeo Valentin

机构 * Stanford University(斯坦福大学)

AI总结 本文提出了一种校准检查框架,用于验证预测系统分布特性,通过模块化流程支持多种应用场景,展示了在天气预测和机器人姿态估计中的应用。

Comments 36 pages, 22 figures. Manuscript prepared with Typst

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26211 2026-04-30 cs.AI cs.LG

OMEGA: Optimizing Machine Learning by Evaluating Generated Algorithms

OMEGA:通过评估生成算法优化机器学习

Jeremy Nixon, Annika Singh

机构 * Infinity Artificial Intelligence Institute(无限人工智能研究所) Stanford University(斯坦福大学)

AI总结 OMEGA框架结合结构化元提示工程与可执行代码生成,创建新型ML分类器,在20个基准数据集上超越scikit-learn基线。

Comments ICLR 2026: Workshop on AI with Recursive Self-Improvement

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25982 2026-04-30 cs.LG cs.AI cs.CY cs.ET

Open Problems in Frontier AI Risk Management

前沿人工智能风险管理中的开放问题

Marta Ziosi, Miro Plueckebaum, Stephen Casper, Henry Papadatos, Ze Shen Chin, Peter Slattery, James Gealy, Tim G. J. Rudner, Brian Tse, Ariel Gil, Patricia Paskov, Maximilian Negele, Rokas Gipiškis, Nada Madkour, Vera Lummis, Rupal Jain, Luise Eder, Kristina Fort, Malou C. van Draanen Glismann, Inès Belhadj, Amin Oueslati, Anna K. Wisakanto, Richard Mallah, Koen Holtman, Ranj Zuhdi, Daniel S. Schiff, Jessica Newman, Malcolm Murray, Robert Trager

机构 * Oxford Martin AI Governance Initiative, University of Oxford(牛津大学人工智能治理倡议) MIT Computer Science and Artificial Intelligence Laboratory, MIT(麻省理工学院计算机科学与人工智能实验室) MIT Future Tech(麻省理工学院未来技术) Stanford University(斯坦福大学) Governance and Responsible AI Lab, Purdue University(普渡大学治理与负责任的人工智能实验室) University of Toronto(多伦多大学) Mercatus Center, George Mason University(乔治·马歇尔大学麦卡锡中心) Vilnius University(维尔纽斯大学) Vijil SaferAI AI Standards Lab(人工智能标准实验室) The Future Society(未来社会) Concordia AI(康科德人工智能) Pivotal Research Center for AI Risk Management & Alignment(人工智能风险管理和对齐中心) UC Berkeley Center for Long-Term Cybersecurity(伯克利大学长期网络安全中心) Independent(独立)

AI总结 本文探讨前沿人工智能风险管理中的核心问题,通过文献综述识别未解决的挑战,并分类问题类型以指导未来研究与治理。

Comments 81 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23575 2026-04-30 cs.CY cs.CL cs.LG

The Collapse of Heterogeneity in Silicon Philosophers

硅哲学家中的异质性崩溃

Yuanming Shi, Andreas Haupt

机构 * Adobe Inc.(Adobe公司) Stanford University(斯坦福大学)

AI总结 研究发现硅样本在哲学领域系统性地压缩了异质性,语言模型过度相关哲学判断,产生人工共识,影响对齐、评估和硅样本替代人类判断的使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04325 2026-04-30 cs.CL cs.AI cs.CV cs.LG cs.MM

Beyond the Leaderboard: Rethinking Medical Benchmarks for Large Language Models

超越排行榜:重新思考大型语言模型的医疗基准

Wenting Chen, Guo Yu, Yiu-Fai Cheung, Meidan Ding, Jie Liu, Zizhan Ma, Wenxuan Wang, Linlin Shen

机构 * Stanford University(斯坦福大学) Shenzhen University(深圳大学) The Chinese University of Hong Kong(香港中文大学) City University of Hong Kong(香港城市大学) Renmin University of China(中国人民大学)

AI总结 本文提出MedCheck框架,用于评估医疗领域大型语言模型的基准,揭示现有基准在临床相关性、数据完整性及安全性方面的系统性问题。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01544 2026-04-30 cs.LG

MARVIS: Modality Adaptive Reasoning over VISualizations

MARVIS:基于可视化模态自适应推理

Benjamin Feuer, Lennart Purucker, Oussama Elachqar, Chinmay Hegde

机构 * Stanford University(斯坦福大学) Prior Labs(Prior实验室) New York University(纽约大学)

AI总结 MARVIS通过将潜在嵌入空间转换为可视化表示,并利用VLM的空间和细粒度推理能力,实现跨视觉、音频、生物和表格域的预测,以3B参数模型在多个领域超越Gemini 2.0。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20876 2026-04-30 cs.CL

Decide less, communicate more: On the construct validity of end-to-end fact-checking in medicine

少做决定,多进行沟通:关于医学领域端到端事实核查构建效度的探讨

Sebastian Joseph, Lily Chen, Barry Wei, Michael Mackert, Iain J. Marshall, Paul Pu Liang, Ramez Kouzy, Byron C. Wallace, Junyi Jessy Li

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Stanford University(斯坦福大学) Indiana University School of Medicine(印第安纳大学医学院) King’s College London(伦敦国王学院) Massachusetts Institute of Technology(麻省理工学院) The University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心) Northeastern University(东北大学)

AI总结 本文探讨医学领域端到端事实核查系统的构建效度,指出其在连接现实声明与科学证据、处理模糊声明及主观真实性标签方面的挑战,主张将其视为互动沟通问题。

Comments ACL 2026 Findings camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25905 2026-04-29 cs.CL

A paradox of AI fluency

AI流利度的悖论

Christopher Potts, Moritz Sudhof

机构 * Bigspin AI Stanford University(斯坦福大学)

AI总结 研究揭示AI流利用户与初学者在任务复杂度和交互模式上的差异,指出流利用户虽经历更多失败但失败更显性,而初学者常有隐性失败,强调主动参与对AI成功的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23829 2026-04-29 cs.AI

Domain-Filtered Knowledge Graphs from Sparse Autoencoder Features

从稀疏自编码器特征中提取领域过滤的知识图谱

John Winnicki, Abeynaya Gnanasekaran, Eric Darve

机构 * Institute for Computational and Mathematical Engineering, Stanford University(计算与数学工程研究所,斯坦福大学)

AI总结 本文提出通过对比激活和多阶段过滤构建领域特定概念集,并构建共现图和转换机制图,将稀疏自编码器特征转化为可读的知识图谱,揭示模型知识结构和推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25521 2026-04-29 cs.AI

Automated Adversarial Collaboration for Advancing Theory Building in the Cognitive Sciences

自动化对抗协作促进认知科学理论构建

Suyog Chandramouli, George Kachergis, Akshay Jagadish

机构 * Department of Psychology, Princeton University(普林斯顿大学心理学系) Department of Psychology, Stanford University(斯坦福大学心理学系) Princeton AI Lab, Princeton University(普林斯顿大学人工智能实验室)

AI总结 本文提出自动化对抗协作框架,通过闭环模拟验证认知科学理论 adjudication,展示了在噪声环境下恢复真实理论的可行性。

Comments 2 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25096 2026-04-29 cs.CL cs.HC

The Dynamics of Delusion: Modeling Bidirectional False Belief Amplification in Human-Chatbot Dialogue

妄想的动力学:人类-聊天机器人对话中双向虚假信念放大建模

Ashish Mehta, Jared Moore, Jacy Reese Anthis, William Agnew, Eric Lin, Peggy Yin, Desmond C. Ong, Nick Haber, Carol Dweck

机构 * Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 研究通过分析聊天记录数据,发现人类与聊天机器人之间存在双向影响,人类短期影响聊天机器人,而聊天机器人长期影响人类,并自我强化妄想,为AI安全提供新见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08567 2026-04-29 cs.CL cs.MA

Multi-User Large Language Model Agents

多用户大语言模型代理

Shu Yang, Shenzhe Zhu, Hao Zhu, José Ramón Enríquez, Di Wang, Alex Pentland, Michiel A. Bakker, Jiaxin Pei

机构 * Stanford University(斯坦福大学) KAUST UT Austin(得克萨斯大学奥斯汀分校) MIT(麻省理工学院)

AI总结 本文首次系统研究多用户LLM代理,提出统一交互协议并设计压力测试场景,揭示前沿模型在优先级维护、隐私保护和协调效率方面的系统性缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16877 2026-04-29 cs.CL

Enhancing Financial Report Question-Answering: A Retrieval-Augmented Generation System with Reranking Analysis

增强财务报告问答:一种带有重排序分析的检索增强生成系统

Zhiyuan Cheng, Longying Lai, Yue Liu, Kai Cheng, Xiaoxi Qi

机构 * School of Engineering Stanford University Stanford, CA, USA Simon Business School University of Rochester Rochester, NY, USA Accounting \& Information Systems Rutgers University Newark, NJ, USA Institute for Social Economic Research Policy Columbia University New York, NY, USA Department of Economics Northeastern University Boston, MA, USA

AI总结 本文提出一种检索增强生成系统,通过重排序提升财务报告问答性能,实验表明重排序显著提高答案质量,正确率提升15.5个百分点。

Comments 7 pages, 2 figures. Accepted to ICECET 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00793 2026-04-29 cs.MM cs.SD

Gesture2Music: A Low-Latency Real-Time Framework for Continuous Gesture-Driven Music Generation

Gesture2Music: 一种低延迟的实时框架,用于连续的手势驱动音乐生成

Rathinaraja Jeyaraj, Barathi Subramanian, Kapilya Gangadharan, Anand Paul

机构 * Stanford University(斯坦福大学) Saveetha Institute of Medical and Technical Sciences(Saveetha医学与技术科学学院) LSU Health Sciences Center New Orleans(路易斯安那州立大学健康科学中心新奥尔良分校)

AI总结 本文提出Gesture2Music框架,通过因果时间卷积网络预测音乐控制事件,结合合成流生成策略和时间一致性损失,实现低延迟的实时连续手势驱动音乐生成。

Comments 43rd The IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09034 2026-04-29 cs.LG cs.AI

Contrast-Enhanced Gating in GRUs for Robust Low-Data Sequence Learning

GRU中对比增强门控用于鲁棒低数据序列学习

Barathi Subramanian, Rathinaraja Jeyaraj, Anand Paul

机构 * Stanford University(斯坦福大学) LSU Health Sciences Center New Orleans(路易斯安那州立大学健康科学中心新奥尔良分校)

AI总结 本文提出SST激活函数提升GRU门控性能,尤其在低数据场景下表现更优,增强信息过滤能力,提升训练稳定性。

Comments 43rd The IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24710 2026-04-28 cs.AI cs.CL

Case-Specific Rubrics for Clinical AI Evaluation: Methodology, Validation, and LLM-Clinician Agreement Across 823 Encounters

针对具体病例的评估量表:方法、验证及LLM与医生一致性的823次病例研究

Aaryan Shah, Andrew Hines, Alexia Downs, Denis Bajet, Paulius Mui, Fabiano Araujo, Laura Offutt, Aida Rutledge, Elizabeth Jimenez

机构 * Canvas Medical Department of Biomedical Data Science, Stanford University(斯坦福大学生物医学数据科学系) XPC (X Primary Care)(XPC(X初级保健)) FCA Consulting(FCA咨询) Department of Pediatrics, University of Nevada, Reno, NV, USA(内华达大学拉斯维加斯分校儿科系)

AI总结 本文提出针对具体病例的评估量表方法,验证了LLM生成的量表在医生一致性上的有效性,展示了在823次病例中医生与LLM的一致性提升。

Comments 14 pages, 2 figures, 3 tables, submitted to JAMIA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23886 2026-04-28 cs.GR cs.AI

MUSIC: Learning Muscle-Driven Dexterous Hand Control

MUSIC: 学习肌肉驱动的灵巧手控制

Pei Xu, Yufei Ye, Shuchun Sun, Yu Ding, Elizabeth Schumann, C. Karen Liu

机构 * Stanford University(斯坦福大学) Clemson University(克莱姆森大学)

AI总结 本文提出一种数据驱动的方法,用于基于物理的肌肉驱动灵巧控制,使肌骨系统手部能精准演奏新音乐作品。通过结合高频肌肉层面控制与低频潜在空间协调,实现双臂动作的高精度合成。

Comments Website: https://pei-xu.github.io/music

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23863 2026-04-28 cs.RO cs.SY eess.SY

Cooptimizing Safety and Performance Using Safety Value-Constrained Model Predictive Control

通过安全价值约束模型预测控制优化安全与性能

Hao Wang, Nam Nguyen, Armand Jordana, Ludovic Righetti, Somil Bansal

机构 * Ming Hsieh Department of Electrical and Computer Engineering, University of Southern California(南加州大学明希德电气与计算机工程系) Department of Aeronautics and Astronautics, Stanford University(斯坦福大学航空与航天系) Electrical and Computer Engineering Department, New York University(纽约大学电气与计算机工程系)

AI总结 本文提出基于安全价值函数的终端约束MPC方法,实现安全与性能的协同优化,通过仿真和硬件实验验证了其在约束满足和鲁棒性方面的改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05621 2026-04-28 cs.CV

FunRec: Reconstructing Functional 3D Scenes from Egocentric Interaction Videos

FunRec:从第一人称交互视频重建功能3D场景

Alexandros Delitzas, Chenyangguang Zhang, Alexey Gavryushin, Tommaso Di Mario, Boyang Sun, Rishabh Dabral, Leonidas Guibas, Christian Theobalt, Marc Pollefeys, Francis Engelmann, Daniel Barath

机构 * ETH Zurich(苏黎世联邦理工学院) Max Planck Institute for Informatics(马克斯·普朗克研究所(信息学)) Stanford University(斯坦福大学) Microsoft(微软) USI Lugano(USI卢加诺)

AI总结 FunRec通过直接从第一人称RGB-D交互视频重建室内场景的3D数字双胞胎,实现了无需控制环境或多状态采集的交互式3D场景重建,提升了部分分割和重建精度。

Comments CVPR 2026. Project page: https://functionalscenes.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00417 2026-04-28 stat.ML cs.LG

Shuffle and Joint Differential Privacy for Generalized Linear Contextual Bandits

洗牌与联合差分隐私用于广义线性上下文老虎机

Sahasrajit Sarmasarkar

机构 * Stanford University(斯坦福大学)

AI总结 本文提出在洗牌差分隐私和联合差分隐私下,针对广义线性上下文老虎机的首个算法,解决了无闭式估计器、多变化设计矩阵隐私追踪及优化误差分析等挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07410 2026-04-28 cs.RO cs.AI

Using Language Models as Closed-Loop High-Level Planners for Robotics Applications: A Brief Overview and Benchmarks

利用语言模型作为闭环高层规划器用于机器人应用:简要概述与基准测试

Hao Wang, Sathwik Karnik, Bea Lim, Somil Bansal

机构 * Ming Hsieh Department of Electrical and Computer Engineering, University of Southern California(南加州大学明希德电气与计算机工程系) Department of Aeronautics and Astronautics, Stanford University(斯坦福大学航空航天工程系) Department of Mechanical Engineering, Stanford University(斯坦福大学机械工程系)

AI总结 本文研究了语言模型在机器人闭环高层规划中的应用,探讨了控制时间跨度和预热启动对性能的影响,并通过实验提供改进建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25424 2026-04-28 cs.LG cs.AI

Polychromic Objectives for Reinforcement Learning

多色目标用于强化学习

Jubayer Ibn Hamid, Ifdita Hasan Orney, Ellen Xu, Chelsea Finn, Dorsa Sadigh

机构 * Stanford University(斯坦福大学)

AI总结 本文提出多色目标用于强化学习,通过强制探索和多样化生成来改进预训练策略,实验表明在多个任务中提升了成功率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25358 2026-04-28 cs.RO

SARM: Stage-Aware Reward Modeling for Long Horizon Robot Manipulation

SARM:面向长时间 horizon 的机器人操控阶段感知奖励建模

Qianzhong Chen, Justin Yu, Mac Schwager, Pieter Abbeel, Yide Shentu, Philipp Wu

机构 * Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校)

AI总结 本文提出一种基于视频的阶段感知奖励建模框架,通过自然语言子任务标注实现一致标签,提升长horizon任务的鲁棒性和泛化能力,实验表明其在真实世界和人类验证中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09603 2026-04-28 cs.CL

The Surprising Effectiveness of Membership Inference with Simple N-Gram Coverage

基于简单n-gram覆盖的成员推断的惊人效果

Skyler Hallinan, Jaehun Jung, Melanie Sclar, Ximing Lu, Abhilasha Ravichander, Sahana Ramnath, Yejin Choi, Sai Praneeth Karimireddy, Niloofar Mireshghallah, Xiang Ren

机构 * University of Southern California(南加州大学) University of Washington(华盛顿大学) Stanford University(斯坦福大学)

AI总结 本文提出基于文本输出的成员推断攻击,通过n-gram重叠度评估模型生成文本与真实后缀的相似性,验证了其在黑盒模型上的有效性,并发现攻击成功率随计算预算增加而提升。

Comments CoLM 2025. v2: update citation

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23460 2026-04-28 cs.AI cs.CL cs.LG

Ulterior Motives: Detecting Misaligned Reasoning in Continuous Thought Models

隐秘动机:在连续思维模型中检测不一致的推理

Sharan Ramjee

机构 * Stanford University(斯坦福大学)

AI总结 本文研究了连续思维模型中如何检测不一致的推理,提出MoralChain基准测试,并通过双触发方法训练模型,揭示了潜在空间中不一致推理的存在及早期规划阶段的安全监控重要性。

Comments 15 pages with 2 figures

Journal ref International Conference on Learning Representations (ICLR) Latent & Implicit Thinking (LIT) Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23380 2026-04-28 cs.LG cs.CV

V-GRPO: Online Reinforcement Learning for Denoising Generative Models Is Easier than You Think

V-GRPO:去噪生成模型的在线强化学习比你想象的更容易

Bingda Tang, Yuhui Zhang, Xiaohan Wang, Jiayuan Mao, Ludwig Schmidt, Serena Yeung-Levy

机构 * Stanford University(斯坦福大学) Tsinghua University(清华大学) Amazon FAR(亚马逊FAR) University of Pennsylvania(宾夕法尼亚大学)

AI总结 本文提出V-GRPO方法,通过结合ELBO近似与GRPO算法,实现稳定高效的去噪生成模型在线强化学习,优于传统MDP方法,在文本到图像合成中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏