arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Stanford University(斯坦福大学)

共收录 2237
2507.02983 2026-06-02 cs.CL cs.AI

Truth, Trust, and Trouble: Medical AI on the Edge

真相、信任与麻烦:边缘上的医疗AI

Mohammad Anas Azeez, Rafiq Ali, Ebad Shabbir, Zohaib Hasan Siddiqui, Gautam Siddharth Kashyap, Jiechao Gao, Usman Naseem

机构 * Jamia Hamdard(贾迈亚哈姆达德大学) DSEU-Okhla Macquarie University(麦考瑞大学) Center for SDGC, Stanford University(SDGC中心,斯坦福大学)

AI总结 通过一个包含1000多个健康问题的基准测试框架,评估Mistral-7B、BioMistral-7B-DARE和AlpaCare-13B三个模型在诚实、有用性和无害性方面的表现,发现AlpaCare-13B准确率最高(91.7%)且无害性最佳(0.92),而领域微调可提升安全性,少样本提示能提高准确率,但复杂查询下有用性下降。

Comments Accepted at EMNLP 2025 (Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17630 2026-06-02 cs.CL cs.LG

Correcting Gradient-Based Circuit Localization via Interaction-Aware Backpropagation

通过交互感知反向传播修正基于梯度的电路定位

Joakim Edin, Casper L. Christensen, Róbert Csordás, Tuukka Ruotsalo, Zhengxuan Wu, Maria Maistro, Jing Huang, Lars Maaløe

机构 * Corti Stanford University(斯坦福大学) Copenhagen University(哥本哈根大学) LUT University(拉普兰大学)

AI总结 针对现有电路定位方法忽略组件交互导致重要性误估的问题,提出GIM技术,通过在反向传播中显式建模特征交互,在机械可解释性基准的电路定位任务上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08884 2026-06-02 cs.CV cs.AI cs.GR

ShapeLib: Designing a library of programmatic 3D shape abstractions with Large Language Models

ShapeLib: 利用大型语言模型设计程序化3D形状抽象库

R. Kenny Jones, Paul Guerrero, Niloy J. Mitra, Daniel Ritchie

机构 * Stanford University(斯坦福大学) Adobe Research(Adobe研究) University College London(伦敦大学学院) Brown University(布朗大学)

AI总结 提出ShapeLib方法,利用大型语言模型的先验知识,通过引导式工作流自动设计可泛化的程序化3D形状抽象库,并支持下游形状编辑与生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31598 2026-06-01 cs.CV

Linear Scaling Video VLMs for Long Video Understanding

面向长视频理解的线性缩放视频视觉语言模型

Cristobal Eyzaguirre, Jiajun Wu, Juan Carlos Niebles

机构 * Stanford University(斯坦福大学)

AI总结 提出StateKV方法,通过固定容量的重要性驱动循环状态实现线性时间视频预填充,在保持接近全自注意力性能的同时显著降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31518 2026-06-01 cs.LG

On the Relationship Between Activation Outliers and Feature Death in Sparse Autoencoders

关于稀疏自编码器中激活异常值与特征死亡之间关系的研究

Elana Simon, Etowah Adams, James Zou

机构 * Stanford University(斯坦福大学) Columbia University(哥伦比亚大学)

AI总结 本文通过理论分析和实验验证,揭示了稀疏自编码器中维度级激活异常值导致特征死亡的机制,并提出均值中心化预处理方法有效消除该问题。

Comments Accepted to ICML 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30780 2026-06-01 cs.RO

Two Degree-of-Freedom Vibratory Transport in a Grasp

抓取中的两自由度振动运输

C. L. Yako, Shenli Yuan, Kenneth Salisbury

机构 * Department of Mechanical Engineering, Stanford University(斯坦福大学机械工程系) Department of Computer Science, Stanford University(斯坦福大学计算机科学系)

AI总结 利用非对称振动实现抓取零件的两自由度(DoF)手内操作,通过闭环位置控制产生周期性粘滑波形,分析波形参数对平均速度的影响,并用实验验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30738 2026-06-01 cs.AI

MAVEN: Improving Generalization in Agentic Tool Calling

MAVEN:提升智能体工具调用的泛化能力

Omkar Ghugarkar, Vishvesh Bhat, Muhammad Ahmed Mohsin, Asad Aali

机构 * CoreThink AI, USA(CoreThink AI, 美国) Stanford University, Stanford, CA, USA(斯坦福大学, 加州斯坦福, 美国)

AI总结 提出MAVEN框架,通过轻量级符号推理脚手架实现结构化分解、自适应工具编排和中间验证,在多个基准测试中显著提升模型性能,且成本仅为前沿专有模型的约1/10。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30638 2026-06-01 cs.LG cs.AI

Score Broadcast and Decorrelation: A General Framework for Broadcast-Based Credit Assignment

分数广播与去相关:基于广播的信用分配通用框架

Mustafa Uzun, Mete Erdogan, Cengiz Pehlevan, Alper T. Erdogan

机构 * KUIS AI Center, Koc University, Turkey(科克大学KUIS人工智能中心,土耳其) Electrical and Electronics Engineering, Koc University, Turkey(科克大学电子与电气工程系,土耳其) Department of Electrical Engineering, Stanford University, USA(斯坦福大学电气工程系,美国) John A. Paulson School of Engineering & Applied Sciences, Harvard University, USA(哈佛大学约翰·A·保罗森工程与应用科学学院,美国) Kempner Institute, Harvard University, USA(哈佛大学凯姆纳研究所,美国) Center for Brain Science, Harvard University, USA(哈佛大学脑科学中心,美国)

AI总结 提出分数广播与去相关(SBD)框架,通过输出分数与隐藏层激活的正交性原理,统一了多种可微损失函数下的广播式信用分配,并理论支撑了三因子学习规则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30637 2026-06-01 cs.AI

EHRBench: An Automated and Reliable EHR-based Benchmark for Clinical Decision Making with LLMs

EHRBench: 基于电子健康记录的自动化可靠临床决策基准测试,用于大语言模型

Yuzhang Xie, Keqi Han, Yunpeng Xiao, Hejie Cui, Guanchen Wu, Ziyang Zhang, Kai Shu, Jiaying Lu, Xiao Hu, Carl Yang

机构 * Emory University(埃默里大学) Stanford University(斯坦福大学)

AI总结 提出EHRBench,通过EHR-LLM-KB交互流水线自动构建近百万问答对,涵盖诊断、治疗和预后三大临床决策任务,系统评估30余种LLM的性能与鲁棒性。

Comments Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026), Datasets and Benchmarks Track, Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30541 2026-06-01 cs.LG physics.geo-ph

SubsurfaceGen: Procedural Generation of Field-Scale Earth Models and Seismic Data

SubsurfaceGen: 野外尺度地球模型与地震数据的程序化生成

Joseph Stitt, Pratik Rathore, Madeleine Udell, Ching-Yao Lai

机构 * Stanford University(斯坦福大学)

AI总结 提出SubsurfaceGen,一个GPU加速的3D速度模型与地震数据生成器,并发布包含4276个2D速度切片、5秒波场和8秒炮集记录的数据集,用于评估机器学习在全波形反演中的表现。

Comments 38 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30514 2026-06-01 cs.LG cs.CL

MAAT: Multi-phase Adapter-Aware Targeted Unlearning

MAAT: 多阶段适配器感知的定向遗忘学习

Suryash Yagnik, Shubham Gaur, Saksham Thakur, Vinija Jain, Aman Chadha, Amitava Das

机构 * Indian Institute of Information Technology, Bhopal, India(印度比哈尔理工学院) University of California, Santa Cruz, USA(加州大学圣克鲁兹分校) Independent Researcher(独立研究者) Stanford University, USA(斯坦福大学) BITS Pilani Goa, India(比斯拉米印度学院)

AI总结 针对现有机器遗忘评估中因果知识(Why类)样本极少导致评估失衡的问题,提出5WBENCH平衡基准和MAAT多阶段框架,首次在Why类知识上同时实现高遗忘与高保留。

Comments 16 pages, 4 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27996 2026-06-01 cs.AI

Reward Bias Substitution: Single-Axis Bias Mitigations Redirect Optimization Pressure

奖励偏差替代:单轴偏差缓解措施重定向优化压力

Max Lamparth, Daniel Fein, Andreas Haupt, Marcel Hussing, Mykel J. Kochenderfer

机构 * Stanford University(斯坦福大学) University of Pennsylvania(宾夕法尼亚大学)

AI总结 本文提出奖励偏差替代现象,即单轴缓解奖励模型偏差(如减少对长度、谄媚或风格的依赖)会将优化压力转移到相关代理上而非消除,并通过理论证明和实验(如GRPO训练中的长度惩罚导致过度自信)揭示了该问题,建议在评估中纳入策略诱导分布并跟踪多偏差。

Comments Improved readability (mostly appendix D)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22737 2026-06-01 cs.LG cs.AI

The Distillation Game: Adaptive Attacks & Efficient Defenses

蒸馏博弈:自适应攻击与高效防御

Youssef Allouah, Mahdi Haghifam, Sanmi Koyejo, Reza Shokri

机构 * Stanford University(斯坦福大学) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) National University of Singapore(新加坡国立大学)

AI总结 通过最小化博弈框架研究蒸馏攻击中模型提供者的部署权衡,提出自适应评估规则和产品专家(PoE)防御方法,实验表明自适应学生能恢复更多能力,且PoE在成本和质量上具有优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22967 2026-06-01 cs.LG

Learned Relay Representations for Forward-Thinking Discrete Diffusion Models

学习的中继表示用于前向思考的离散扩散模型

Benjamin Rozonoyer, Jacopo Minniti, Dhruvesh Patel, Neil Band, Avishek Joey Bose, Tim G. J. Rudner, Andrew McCallum

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of Toronto(多伦多大学) Stanford University(斯坦福大学) Imperial College London(伦敦帝国学院) Mila Vijil

AI总结 提出Learned Relay Representations (Relay)方法,通过可微通道传递潜在信息,使掩码扩散模型在去噪步骤间前向思考,减少推理延迟并提升性能。

Comments 16 pages, 3 figures. Equal contribution: Benjamin Rozonoyer, Jacopo Minniti, and Dhruvesh Patel. Code: https://github.com/jacopo-minniti/relay

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21470 2026-06-01 cs.LG cs.AI

Agent JIT Compilation for Latency-Optimizing Web Agent Planning and Scheduling

面向延迟优化的Web Agent规划与调度的Agent即时编译

Caleb Winston, Ron Yifeng Wang, Azalia Mirhoseini, Christos Kozyrakis

机构 * Stanford University(斯坦福大学)

AI总结 提出Agent即时编译系统,通过JIT-Planner生成代码计划、JIT-Scheduler探索并行化策略及不变式工具协议,显著降低延迟并提高准确性。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01985 2026-06-01 cs.LG cs.AI cs.RO

World Action Verifier: Self-Improving World Models via Forward-Inverse Asymmetry

World Action Verifier: 通过前向-反向不对称性自我改进世界模型

Yuejiang Liu, Fan Feng, Lingjing Kong, Weifeng Lu, Jinzhou Tang, Kun Zhang, Kevin Murphy, Chelsea Finn, Yilun Du

机构 * Stanford University(斯坦福大学) UC San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学) Google DeepMind(谷歌DeepMind) Harvard University(哈佛大学)

AI总结 提出World Action Verifier (WAV)框架,利用状态合理性和动作可达性的独立验证以及前向-反向不对称性,通过视频语料库的多样子目标生成器和稀疏逆模型实现循环一致性,从而在欠探索区域自我改进世界模型,在多个任务中样本效率提升2倍且下游策略性能提升22%以上。

Comments Project Website: https://world-action-verifier.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25110 2026-06-01 cs.CL

DEBATE: A Large-Scale Benchmark for Evaluating Opinion Dynamics in Role-Playing LLM Agents

DEBATE:用于评估角色扮演LLM代理中观点动态的大规模基准

Yun-Shiuan Chuang, Ruixuan Tu, Chengtao Dai, You Li, Smit Vasani, Binwei Yao, Michael Henry Tessler, Sijia Yang, Dhavan Shah, Robert Hawkins, Junjie Hu, Timothy T. Rogers

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Google DeepMind(谷歌DeepMind) Stanford University(斯坦福大学)

AI总结 提出DEBATE基准,通过多轮公共消息和Likert量表信念数据,评估多代理角色扮演LLM模拟中观点动态的真实性,发现零样本设置下代理组过度收敛,而监督微调可改善立场对齐并减少组级收敛误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16682 2026-06-01 cs.CV

SAW-Bench: Learning Situated Awareness in the Real World

SAW-Bench:在现实世界中学习情境感知

Chuhan Li, Rilyn Han, Joy Hsu, Yongyuan Liang, Rajiv Dhawan, Jiajun Wu, Ming-Hsuan Yang, Xin Eric Wang

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) Yale University(耶鲁大学) Stanford University(斯坦福大学) University of Maryland, College Park(马里兰大学学院市分校) Amazon(亚马逊) University of California, Merced(加州大学默塞德分校)

AI总结 提出SAW-Bench基准,通过自录视频和问答对评估多模态基础模型的以观察者为中心的情境感知能力,揭示人类与模型间的显著性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11208 2026-06-01 cs.LG

Adaptive Physics Transformer with Fused Global-Local Attention for Subsurface Energy Systems

自适应物理Transformer融合全局-局部注意力用于地下能源系统

Xin Ju, Nok Hei, Fung, Yuyan Zhang, Carl Jacquemyn, Matthew Jackson, Randolph Settgast, Sally M. Benson, Gege Wen

机构 * Department of Energy Science and Engineering, Stanford University(斯坦福大学能源科学与工程系) Department of Earth Sciences and Engineering, Imperial College London(伦敦帝国理工学院地球科学与工程系) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) EarthFlow AI, Inc.(EarthFlow AI公司)

AI总结 提出自适应物理Transformer(APT),通过融合图编码器和全局注意力机制,高效处理地下能源系统中的异构网格和物理耦合问题,在规则与不规则网格上均优于现有架构,并首次直接从高分辨率自适应网格细化模拟中学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14190 2026-06-01 cs.AI

Inferring Events from Time Series using Language Models

利用语言模型从时间序列中推断事件

Mingtian Tan, Mike A. Merrill, Zack Gottesman, Tim Althoff, David Evans, Tom Hartvigsen

机构 * University of Virginia(弗吉尼亚大学) Stanford University(斯坦福大学) University of Washington(华盛顿大学)

AI总结 研究大型语言模型能否从时间序列数据中推断自然语言事件,提出自动化任务生成方法和新基准,并通过蒸馏与强化学习提升小模型性能。

Comments 21 pages, 15 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30347 2026-05-29 cs.CV cs.GR

NeuROK: Generative 4D Neural Object Kinematics

NeuROK:生成式4D神经物体运动学

Chen Geng, Guangzhao He, Yue Gao, Yunzhi Zhang, Shangzhe Wu, Jiajun Wu

机构 * Stanford University(斯坦福大学) University of Cambridge(剑桥大学) Cornell University(康奈尔大学)

AI总结 提出基于Transformer的编码器-解码器模型NeuROK,通过学习物体潜在运动学参数化,实现从静态3D物体生成逼真的4D动态变形,克服了传统方法对预定义物理模型和特定类别的依赖。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30341 2026-05-29 cs.CV cs.AI

GPIC: A Giant Permissive Image Corpus for Visual Generation

GPIC:用于视觉生成的大型许可图像数据集

Keshigeyan Chandrasegaran, Kyle Sargent, Suchir Agarwal, Michael Jang, Michael Poli, Juan Carlos Niebles, Justin Johnson, Jiajun Wu, Li Fei-Fei

机构 * Stanford University(斯坦福大学) Radical Numerics University of Michigan(密歇根大学) Salesforce Research(Salesforce研究)

AI总结 提出GPIC,一个约28万亿像素的大型许可图像数据集,包含1亿训练样本,通过最先进的视觉语言模型标注,用于视觉生成建模研究。

Comments 25 pages; Dataset: https://huggingface.co/datasets/stanford-vision-lab/giant-permissive-image-corpus; Project website: https://gpic.stanford.edu

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30327 2026-05-29 cs.LG cs.AI cs.CL math.ST stat.ML stat.TH

Reasoning with Sampling: Cutting at Decision Points

基于采样的推理:在决策点进行裁剪

Felix Zhou, Anay Mehrotra, Quanquan C. Liu

机构 * Yale University(耶鲁大学) Stanford University(斯坦福大学)

AI总结 提出Entropy-Cut Metropolis-Hastings算法,利用基础模型的下一词元熵作为代理识别关键决策点并重新采样,从而高效地从幂分布中采样以增强推理能力,在多个基准上超越基线和RL训练模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30326 2026-05-29 cs.RO cs.AI

RoboWits: Unexpected Challenges for Robotic Creative Problem Solving

RoboWits:机器人创造性问题解决中的意外挑战

Chunru Lin, Hongxin Zhang, Fenghao Yu, Zhehuan Chen, Thomas L. Griffiths, Yejin Choi, David Held, Chuang Gan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) Princeton University(普林斯顿大学) Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出RoboWits双臂机器人基准,通过多智能体协作的自动化任务生成流水线评估机器人在几何、材料和装配推理中的认知推理、创造性工具使用及鲁棒性,发现预训练VLA在突变任务中表现脆弱。

Comments The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30324 2026-05-29 cs.DS cs.AI cs.CL cs.LG stat.ML

On Language Generation in the Limit with Bounded Memory

有界记忆下的极限语言生成

Jon Kleinberg, Anay Mehrotra, Amin Saberi, Grigoris Velegkas

机构 * Cornell University(康奈尔大学) Stanford University(斯坦福大学) Google Research(谷歌研究)

AI总结 研究有界记忆下语言生成的极限问题,通过组合界和滑动窗口分析记忆约束对可生成性、密度和识别的影响。

Comments The abstract has been shortened to fit within the arXiv limit

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30319 2026-05-29 stat.ML cs.AI cs.DS cs.LG math.ST stat.TH

Improved Guarantees for Heterogeneous Treatment-Effect Estimation via Matrix Completion

通过矩阵补全改进异质性处理效应估计的保证

Anay Mehrotra, Phuc Tran, Van H. Vu, Manolis Zampetakis

机构 * Stanford University(斯坦福大学) Vin University(文大学) The University of Hong Kong(香港大学) Yale University(耶鲁大学)

AI总结 针对面板数据中的异质性处理效应估计问题,提出一种基于矩阵补全的简单高效估计器,在低秩假设下实现行向$\ell_2$误差$ ilde{O}(\sqrt{1/n + n/m^2})$,并首次建立了低秩逼近的行向$\ell_2$扰动界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08548 2026-05-29 cs.AI

A Matter of Interest: Understanding Interestingness of Math Problems in Humans and Language Models

兴趣问题:理解人类与语言模型对数学问题的兴趣度

Shubhra Mishra, Yuka Machino, Gabriel Poesia, Albert Jiang, Joy Hsu, Adrian Weller, Challenger Mishra, David Broman, Joshua B. Tenenbaum, Mateja Jamnik, Cedegao E. Zhang, Katherine M. Collins

机构 * KTH Royal Institute of Technology(皇家理工学院) Stanford University(斯坦福大学) Massachusetts Institute of Technology(麻省理工学院) University of Cambridge(剑桥大学) Kempner Institute at Harvard University(哈佛大学肯普尼研究所) Mistral AI

AI总结 通过比较大型语言模型与不同数学背景人群对数学问题的兴趣度评分,研究LLM在兴趣判断上与人类的一致性,并评估其生成有趣问题的能力。

Comments Published at the Math-AI Workshop, NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29505 2026-05-29 cs.CV

ESAM++: Efficient Online 3D Perception on the Edge

ESAM++:边缘上的高效在线3D感知

Qin Liu, Lavisha Aggarwal, Saptarashmi Bandyopadhyay, Vikas Bahirwani, Marc Niethammer, Ehsan Adeli, Andrea Colaco

机构 * Stanford University(斯坦福大学) Google(谷歌) UC San Diego(圣地亚哥大学)

AI总结 提出ESAM++,一种轻量级可扩展的在线3D场景感知方法,通过3D稀疏特征金字塔网络(SFPN)在边缘设备上实现高效、准确的3D实例分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29392 2026-05-29 cs.SE cs.CL cs.CY cs.HC

Offloading Score: Measuring AI Reliance Through Counterfactual Workflows

卸载分数:通过反事实工作流衡量AI依赖度

Vishakh Padmakumar, Lujain Ibrahim, Zora Zhiruo Wang, Jennifer Wang, Q. Vera Liao, Diyi Yang

机构 * Stanford University(斯坦福大学) University of Oxford(牛津大学) Carnegie Mellon University(卡内基梅隆大学) University of Michigan(密歇根大学)

AI总结 本文提出卸载分数(offloading score),一种通过构建反事实工作流量化用户向AI工具卸载认知努力比例的依赖度度量,并通过内在验证和用户实验证明其能检测时间压力下的依赖度变化。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29192 2026-05-29 cs.AI cs.CL

ReasonOps: Operator Segmentation for LLM Reasoning Traces

ReasonOps: 大语言模型推理轨迹的算子分割

Daniel Lee, Owen Queen, James Zou

机构 * Stanford University(斯坦福大学)

AI总结 提出无监督方法ReasonOps,从思维链轨迹中提取7种通用推理算子,揭示模型推理结构并用于模型识别与正确性预测。

详情

展开后加载摘要…

URL PDF HTML 收藏