arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Stanford University(斯坦福大学)

2026-06-02 至 2026-06-02 共收录 44
2603.03291 2026-06-02 cs.CL cs.AI

One Bias After Another: Mechanistic Reward Shaping and Persistent Biases in Language Reward Models

一个接一个的偏差:语言奖励模型中的机械奖励塑造与持续偏差

Daniel Fein, Max Lamparth, Violet Xiang, Mykel J. Kochenderfer, Nick Haber

机构 * Stanford University(斯坦福大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 本文通过系统测量五个高质量奖励模型中的偏差,发现长度、谄媚、过度自信等持续问题,并提出一种简单的后处理干预方法(机械奖励塑造)来减轻低复杂度偏差。

Comments ICML 2026 Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07650 2026-06-02 cs.LG cs.AI

Value Flows

Value Flows

Perry Dong, Chongyi Zheng, Chelsea Finn, Dorsa Sadigh, Benjamin Eysenbach

机构 * Stanford University(斯坦福大学) Princeton University(普林斯顿大学)

AI总结 本文利用基于流的生成模型估计完整未来回报分布,通过新的流匹配目标满足分布贝尔曼方程,并利用流导数ODE估计回报不确定性以优先学习,在离线与在线设置中平均成功率提升1.3倍。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18195 2026-06-02 cs.LG cs.AI

LERD: Latent Event-Relational Dynamics for Neurodegenerative Classification

LERD: 用于神经退行性疾病分类的潜在事件-关系动力学

Yicheng Feng, Hairong Chen, Ziyu Jia, Samir Bhatt, Hengguan Huang

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) University of Washington(华盛顿大学) University of California, San Diego(加州大学圣地亚哥分校) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 提出LERD,一种端到端贝叶斯潜在事件-关系动力系统,直接从多通道脑电图推断潜在神经事件及其关系结构,无需事件或交互标注,在阿尔茨海默病分类中优于基线方法并提供生理对齐的动力学摘要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16745 2026-06-02 cs.LG cs.AI

PETS: A Principled Framework Towards Optimal Trajectory Allocation for Efficient Test-Time Self-Consistency

PETS:一种面向高效测试时自一致性的最优轨迹分配原则性框架

Zhangyi Liu, Huaizhi Qu, Xiaowei Yin, He Sun, Yanjun Han, Tianlong Chen, Zhun Deng

机构 * Stanford University(斯坦福大学) UNC at Chapel Hill(Chapel Hill 大学) Yale University(耶鲁大学) New York University(纽约大学)

AI总结 提出PETS框架,通过将轨迹分配建模为优化问题并引入自一致性率度量,在离线(连接众包理论)和在线流式场景下实现样本高效的测试时自一致性,显著降低采样预算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05139 2026-06-02 cs.LG

Adaptive Exploration for Latent-State Bandits

潜在状态赌博机的自适应探索

Jikai Jin, Kenneth Hung, Sanath Kumar Krishnamurthy, Baoyi Shi, Congshan Zhang

机构 * The Institute for Computational and Mathematical Engineering(计算与数学工程研究所) Stanford University(斯坦福大学) Meta Platforms, Inc.(Meta平台公司) Ads Online Experimentation(广告在线实验部) Central Applied Science(应用科学中央研究所)

AI总结 针对奖励依赖于未观测马尔可夫状态的赌博机问题,提出基于LinUCB的自适应算法,通过滞后动作-奖励对和探针指纹两种摘要来区分状态,并采用残差、边际和过时测试动态更新指纹,在合成压力测试中相比标准、对抗和非平稳基线降低了动态遗憾。

Comments 12 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24069 2026-06-02 cs.LG cs.AI

Can LLMs Reason Structurally? Benchmarking via the Lens of Data Structures

LLM 能否进行结构性推理?通过数据结构视角进行基准测试

Yu He, Yingxi Li, Colin White, Ellen Vitercik

机构 * Stanford University(斯坦福大学)

AI总结 本文提出 DSR-Bench 基准,通过 20 种数据结构、35 种操作和 4140 个问题实例评估 LLM 的结构性推理能力,发现顶级模型在挑战性实例上仅得 0.46/1,且在空间数据、上下文丰富场景及自身代码推理上表现不佳。

Comments Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07218 2026-06-02 cs.LG cs.AI stat.ML

Collaborative and Efficient Fine-tuning: Leveraging Task Similarity

协作高效微调:利用任务相似性

Gagik Magakyan, Amirhossein Reisizadeh, Chanwoo Park, Pablo A. Parrilo, Asuman Ozdaglar

机构 * Massachusetts Institute of Technology(麻省理工学院) Stanford University(斯坦福大学)

AI总结 提出CoLoRA方法,通过共享适配器和个性化适配器利用任务相似性进行协作微调,提升数据稀缺下的模型性能,并在理论和实验上验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04861 2026-06-02 cs.LG cond-mat.mtrl-sci cs.AI physics.chem-ph

From Evaluation to Design: Using Potential Energy Surface Smoothness Metrics to Guide Machine Learning Interatomic Potential Architectures

从评估到设计:利用势能面平滑度指标指导机器学习原子间势架构

Ryan Liu, Eric Qu, Tobias Kreiman, Samuel M. Blau, Aditi S. Krishnapriyan

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

AI总结 提出键平滑度表征测试(BSCT)作为高效评估机器学习原子间势(MLIP)势能面平滑度的指标,并与分子动力学稳定性强相关,同时指导模型设计以减少伪影。

Comments Accepted at the International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04094 2026-06-02 cs.CV

VideoBrain: Learning Adaptive Frame Sampling for Long Video Understanding

VideoBrain: 学习自适应帧采样以理解长视频

Junbo Zou, Ziheng Huang, Shengjie Zhang, Liwen Zhang, Weining Shen

机构 * Stanford University(斯坦福大学)

AI总结 提出VideoBrain框架,通过CLIP和均匀采样双智能体策略,使视觉语言模型自适应获取关键帧,在减少30-40%帧数的同时提升长视频理解准确率3.5%-9.0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04791 2026-06-02 cs.LG

DuetServe: Harmonizing Prefill and Decode for LLM Serving via Adaptive GPU Multiplexing

DuetServe: 通过自适应GPU多路复用协调LLM服务的预填充与解码

Lei Gao, Chaoyi Jiang, Hossein Entezari Zarch, Daniel Wong, Mark Hill, Murali Annavaram

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) University of Toronto(多伦多大学) University of Washington(华盛顿大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 针对LLM服务中预填充与解码阶段的干扰问题,提出DuetServe框架,通过自适应SM级GPU空间多路复用实现单GPU内的阶段隔离,在保证低延迟的同时提升吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02086 2026-06-02 cs.CV

Markerless Augmented Reality Registration for Surgical Guidance: A Multi-Anatomy Clinical Accuracy Study

用于手术引导的无标记增强现实配准:一项多解剖结构临床精度研究

Yue Yang, Fabian Necker, Christoph Leuze, Michelle Chen, Andrey Finegersh, Jake Lee, Vasu Divi, Bruce Daniel, Brian Hargreaves, Jie Ying Wu, Fred M Baik

机构 * School of Medicine, Stanford University(斯坦福大学医学院) Vanderbilt Institute of Surgery and Engineering(范德比尔特手术与工程研究院)

AI总结 本文开发并临床评估了一种基于深度相机的无标记增强现实配准方法,在头戴式显示器上实现多解剖结构(足、耳、小腿)的手术引导,中位误差约3-4 mm,接近临床可接受阈值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02983 2026-06-02 cs.CL cs.AI

Truth, Trust, and Trouble: Medical AI on the Edge

真相、信任与麻烦:边缘上的医疗AI

Mohammad Anas Azeez, Rafiq Ali, Ebad Shabbir, Zohaib Hasan Siddiqui, Gautam Siddharth Kashyap, Jiechao Gao, Usman Naseem

机构 * Jamia Hamdard(贾迈亚哈姆达德大学) DSEU-Okhla Macquarie University(麦考瑞大学) Center for SDGC, Stanford University(SDGC中心,斯坦福大学)

AI总结 通过一个包含1000多个健康问题的基准测试框架,评估Mistral-7B、BioMistral-7B-DARE和AlpaCare-13B三个模型在诚实、有用性和无害性方面的表现,发现AlpaCare-13B准确率最高(91.7%)且无害性最佳(0.92),而领域微调可提升安全性,少样本提示能提高准确率,但复杂查询下有用性下降。

Comments Accepted at EMNLP 2025 (Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17630 2026-06-02 cs.CL cs.LG

Correcting Gradient-Based Circuit Localization via Interaction-Aware Backpropagation

通过交互感知反向传播修正基于梯度的电路定位

Joakim Edin, Casper L. Christensen, Róbert Csordás, Tuukka Ruotsalo, Zhengxuan Wu, Maria Maistro, Jing Huang, Lars Maaløe

机构 * Corti Stanford University(斯坦福大学) Copenhagen University(哥本哈根大学) LUT University(拉普兰大学)

AI总结 针对现有电路定位方法忽略组件交互导致重要性误估的问题,提出GIM技术,通过在反向传播中显式建模特征交互,在机械可解释性基准的电路定位任务上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08884 2026-06-02 cs.CV cs.AI cs.GR

ShapeLib: Designing a library of programmatic 3D shape abstractions with Large Language Models

ShapeLib: 利用大型语言模型设计程序化3D形状抽象库

R. Kenny Jones, Paul Guerrero, Niloy J. Mitra, Daniel Ritchie

机构 * Stanford University(斯坦福大学) Adobe Research(Adobe研究) University College London(伦敦大学学院) Brown University(布朗大学)

AI总结 提出ShapeLib方法,利用大型语言模型的先验知识,通过引导式工作流自动设计可泛化的程序化3D形状抽象库,并支持下游形状编辑与生成。

详情

展开后加载摘要…

URL PDF HTML 收藏