arXivDaily arXiv每日学术速递 周一至周五更新

作者

Percy Liang

Natural Language Processing

共收录 272
2608.05004 2026-08-06 cs.CL 新提交

DelusionEval: Measuring Delusion-Linked Behaviors in AI Chatbots

DelusionEval:评估AI聊天机器人中与妄想相关的行为

Jared Moore, Andrea Mock, Yifan Mai, Jacy Reese Anthis, Ryan Louie, William Agnew, Ashish Mehta, Kevin Klyman, Percy Liang, Nick Haber, Eric Lin, Desmond C. Ong

机构 * Stanford University(斯坦福大学) University of Chicago(芝加哥大学) Carnegie Mellon University(卡内基梅隆大学) Harvard University(哈佛大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本研究开发DelusionEval评估协议,发现LLM表现出与妄想相关行为的倾向与模型规模等无可靠关联,扩展上下文会提升此类行为发生率,所有模型家族均存在相关风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06932 2026-08-05 cs.LG 版本更新

When RL Meets Adaptive Speculative Training: A Unified Training-Serving System

当强化学习遇见自适应推测训练:一个统一的训练-服务系统

Junxiong Wang, Fengxiang Bie, Jisen Li, Zhongzhu Zhou, Zelei Shao, Yubo Wang, Yinghui Liu, Qingyang Wu, Avner May, Sri Yanamandra, Ce Zhang, Tri Dao, Percy Liang, Ben Athiwaratkun, Shuaiwen Leon Song, Chenfeng Xu, Xiaoxia Wu

AI总结 本文提出Aurora系统,通过强化学习实时学习推测器,解决传统方法中部署延迟和领域漂移问题,实验显示在多个模型上实现显著加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24917 2026-08-03 cs.CL cs.LG 版本更新

Estimating near-verbatim extraction risk in language models with decoding-constrained beam search

通过解码约束束搜索估计语言模型中的近原文提取风险

A. Feder Cooper, Mark A. Lemley, Christopher De Sa, Lea Duesterwald, Allison Casasola, Jamie Hayes, Katherine Lee, Daniel E. Ho, Percy Liang

机构 * AVERI Stanford(斯坦福大学) Cornell(康奈尔大学) Google DeepMind(谷歌DeepMind)

AI总结 本文提出解码约束束搜索方法,以有效估计语言模型中的近原文提取风险,揭示更多可提取序列及模型规模对风险的影响。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19375 2026-07-23 cs.CY cs.AI 新提交

Economic Evaluations of Language Models

语言模型的经济评估

Alexander Wan, Stephane Hatgis-Kessell, Tomás Aguirre, Percy Liang, Rishi Bommasani

机构 * Stanford University(斯坦福大学) University of São Paulo(圣保罗大学)

AI总结 研究语言模型在经济价值任务上的表现,通过EconEvals开源套件评估,结合真实用户查询与合成数据,成本低且覆盖度好,还引入暴露度量估计时间节省情况,发现当前模型有潜力但存在使用滞后及隐私等瓶颈,引入基础设施推断其对劳动力市场的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12546 2026-07-21 cs.CL cs.CY cs.LG

Extracting memorized pieces of (copyrighted) books from open-weight language models

从开放式语言模型中提取记忆中的(受版权保护)书籍

A. Feder Cooper, Mark A. Lemley, Allison Casasola, Ahmed Ahmed, Aaron Gokaslan, Amy B. Cyphert, Christopher De Sa, Daniel E. Ho, Percy Liang

机构 * Stanford University(斯坦福大学) Yale University(耶鲁大学) Cornell University(康奈尔大学) West Virginia University(西弗吉尼亚大学)

AI总结 研究通过测量书籍在语言模型中的记忆程度,发现大多数模型不完整记忆书籍,但部分模型如Llama 3.1 70B能完整记忆某些书籍,对版权案件有重要影响。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12649 2026-07-15 cs.LG cs.CL 新提交

Extractable Memorization From First Principles

从第一原理出发的可提取记忆

A. Feder Cooper, Marika Swanberg, Jamie Hayes, Lea Duesterwald, Christopher De Sa, Daniel E. Ho, Mark A. Lemley, Percy Liang

机构 * Yale(耶鲁大学) AVERI(AVERI(未提及常见中文名,可直译为“应用价值与伦理研究所”之类,具体需结合实际背景)) Stanford(斯坦福大学) Google Research(谷歌研究院) Google DeepMind(谷歌DeepMind) Cornell(康奈尔大学)

AI总结 研究大语言模型可提取记忆的有效性问题,提出通过匹配比较测量训练与非训练序列生成概率来判断记忆,形式化共形测试和普查两种匹配比较方式并揭示问题,完善可提取记忆定义,给出有效声明及现实预算下的生成要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31567 2026-07-01 cs.CY cs.AI 新提交

FLARE-AI: Flaw Reporting for AI

FLARE-AI:AI缺陷报告

Shayne Longpre, Elaine Zhu, Carson Ezell, Avijit Ghosh, Sean McGregor, Kevin Paeth, Kevin Klyman, Sayash Kapoor, Rishi Bommasani, Ruth Appel, Gregory Strom, Lauren McIlvenny, Mark M. Jaycox, Peter Slattery, Nathan Butters, Arvind Narayanan, Percy Liang, Alex Pentland

AI总结 针对AI系统缺陷报告生态碎片化问题,提出开源系统FLARE-AI,通过条件逻辑和早期分类简化报告创建,支持标准化机器可读报告分发,降低报告门槛并提升互操作性。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10109 2026-06-30 cs.AI cs.HC cs.LG

LLM Agents Grounded in Self-Reports Enable General-Purpose Simulation of Individuals

基于自我报告的LLM代理能够实现通用个体模拟

Joon Sung Park, Carolyn Q. Zou, Jonne Kamphorst, Niles Egan, Aaron Shaw, Benjamin Mako Hill, Carrie Cai, Meredith Ringel Morris, Percy Liang, Robb Willer, Michael S. Bernstein

机构 * Computer Science Department, Stanford University(斯坦福大学计算机科学系) Department of Communication Studies, Northwestern University(西北大学传播学系) Department of Communication, University of Washington(华盛顿大学传播学系) Google DeepMind(谷歌DeepMind) Department of Sociology, Stanford University(斯坦福大学社会学系) Sciences Po(巴黎政治学院)

AI总结 本文研究了基于自我报告数据的LLM代理在模拟个体行为方面的有效性,通过不同数据源构建代理并验证其在多种任务中的准确性和跨群体公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16899 2026-06-16 cs.LG 新提交

Fantastic Pretraining Optimizers and Where to Find Them II: Hyperball Optimization

奇妙预训练优化器及其发现之处 II:超球优化

Kaiyue Wen, Xingyu Dang, Kaifeng Lyu, Tengyu Ma, Percy Liang

机构 * Stanford University(斯坦福大学) Princeton University(普林斯顿大学) Tsinghua University(清华大学)

AI总结 针对Muon等优化器在大模型预训练中增益随规模增大而减弱的问题,提出Hyperball包装器,固定权重矩阵及其更新的Frobenius范数,在1.2B参数模型上实现20-30%的token等效加速,并改善学习率迁移。

Comments Corresponding blog post: https://psychedelic-sunstone-851.notion.site/Fantastic-Pretraining-Optimizers-and-Where-to-Find-Them-2-1-Hyperball-Optimization-2e924306e6f280e7a5ffee00eb40a0dd

详情

展开后加载摘要…

URL PDF HTML 收藏
1501.06318 2026-06-04 math.NA cs.NA

Simultaneous diagonalization: the asymmetric, low-rank, and noisy settings

同时对角化:非对称、低秩和噪声环境

Volodymyr Kuleshov, Arun Tesjavi Chaganty, Percy Liang

AI总结 本文扩展了联合对角化算法以处理低秩和非对称矩阵,并改进了这些方法的扰动分析,使联合对角化能应用于新的研究场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27371 2026-05-27 cs.CY cs.AI

Algorithmic Monocultures in Hiring

招聘中的算法同质化

Rishi Bommasani, Sarah H. Bana, Kathleen A. Creel, Dan Jurafsky, Percy Liang

机构 * Stanford University(斯坦福大学) Chapman University(查普曼大学) Northeastern University(东北大学)

AI总结 研究招聘算法同质化导致相同个体和种族群体被拒绝的问题,通过分析300万求职者的400万份申请数据,发现明显的种族差异和结果同质性。

Comments Published at FAccT 2026. Website: https://algorithmichiring.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26132 2026-05-27 cs.CL cs.LG

Self-Verified Distillation: Your Language Model Is Secretly Its Own Synthetic Data Pipeline

自验证蒸馏:你的语言模型秘密地就是它自己的合成数据管道

Tony Lee, Percy Liang

机构 * Stanford University(斯坦福大学)

AI总结 提出自验证蒸馏算法,让大语言模型仅用无标注种子问题,通过自生成、自验证和自训练提升推理能力,在数学、科学和编程任务上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02617 2026-04-21 cs.LG cs.AI cs.CV

Improving Dynamic Object Interactions in Text-to-Video Generation with AI Feedback

通过AI反馈提升文本到视频生成中动态物体交互

Hiroki Furuta, Heiga Zen, Dale Schuurmans, Aleksandra Faust, Yutaka Matsuo, Percy Liang, Sherry Yang

机构 * Google DeepMind(谷歌DeepMind) The University of Tokyo(东京大学) Stanford University(斯坦福大学)

AI总结 本文研究如何利用反馈提升文本到视频模型中动态物体交互的质量,提出利用视觉语言模型提供针对性反馈,实验表明该方法在视频交互场景质量上有显著提升。

Comments Website: https://sites.google.com/view/aif-dynamic-t2v/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18534 2026-03-20 cs.LG

Data-efficient pre-training by scaling synthetic megadocs

通过扩展合成巨文档实现数据高效的预训练

Konwoo Kim, Suhas Kotha, Yejin Choi, Tatsunori Hashimoto, Nick Haber, Percy Liang

机构 * Stanford University(斯坦福大学)

AI总结 本文研究如何通过生成更长的合成巨文档提升预训练效果,发现其在降低损失和提升基准准确率方面优于简单重述,数据效率从1.48倍提升至1.80倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04964 2026-03-06 cs.CL cs.LG

Replaying pre-training data improves fine-tuning

重放预训练数据提高微调

Suhas Kotha, Percy Liang

机构 * Stanford University(斯坦福大学)

AI总结 通过重放预训练数据提升微调效果,提高目标任务性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09882 2026-03-04 cs.AI cs.CR cs.CY

Comparing AI Agents to Cybersecurity Professionals in Real-World Penetration Testing

将AI代理与网络安全专家在真实世界渗透测试中进行比较

Justin W. Lin, Eliot Krzysztof Jones, Donovan Julian Jasper, Ethan Jun-shen Ho, Anna Wu, Arnold Tianyi Yang, Neil Perry, Andy Zou, Matt Fredrikson, J. Zico Kolter, Percy Liang, Dan Boneh, Daniel E. Ho

机构 * Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文比较了AI代理与网络安全专家在真实世界渗透测试中的表现,发现ARTEMIS在技术深度和提交质量上接近最强人类参与者,但在误报率和GUI任务上存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06966 2026-02-26 cs.LG cs.AI cs.CY

Machine Unlearning Doesn't Do What You Think: Lessons for Generative AI Policy and Research

机器去学习并不如你所想:生成式AI政策与研究的启示

A. Feder Cooper, Christopher A. Choquette-Choo, Miranda Bogen, Kevin Klyman, Matthew Jagielski, Katja Filippova, Ken Liu, Alexandra Chouldechova, Jamie Hayes, Yangsibo Huang, Eleni Triantafillou, Peter Kairouz, Nicole Elyse Mitchell, Niloofar Mireshghallah, Abigail Z. Jacobs, James Grimmelmann, Vitaly Shmatikov, Christopher De Sa, Ilia Shumailov, Andreas Terzis, Solon Barocas, Jennifer Wortman Vaughan, danah boyd, Yejin Choi, Sanmi Koyejo, Fernando Delgado, Percy Liang, Daniel E. Ho, Pamela Samuelson, Miles Brundage, David Bau, Seth Neel, Hanna Wallach, Amy B. Cyphert, Mark A. Lemley, Nicolas Papernot, Katherine Lee

机构 * The GenLaw Center(GenLaw中心) Microsoft Research(微软研究院) Stanford University(斯坦福大学) Google DeepMind(谷歌DeepMind) Center for Democracy & Technology(民主与科技中心) Princeton(普林斯顿) Google(谷歌) University of Washington(华盛顿大学) University of Michigan(密歇根大学) Cornell Tech(康奈尔科技) Cornell Law School(康奈尔法学院) Cornell University(康奈尔大学) Lighthouse Stanford Law School(斯坦福法学院) UC Berkeley(伯克利大学) Independent(独立研究者) Northeastern University(东北大学) Harvard Business School(哈佛商学院) W. Virginia University College of Law(维珍尼亚大学法学院)

AI总结 本文指出机器去学习并非通用解决方案,揭示其在生成式AI政策与研究中的局限性。

Comments NeurIPS 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19548 2026-02-24 cs.CL cs.LG

Beyond a Single Extractor: Re-thinking HTML-to-Text Extraction for LLM Pretraining

超越单一提取器:重新思考用于LLM预训练的HTML到文本提取

Jeffrey Li, Josh Gardner, Doug Kang, Fangping Shi, Karanjeet Singh, Chun-Liang Li, Herumb Shandilya, David Hall, Oncel Tuzel, Percy Liang, Ludwig Schmidt, Hadi Pour Ansari, Fartash Faghri

机构 * Apple(苹果公司) Stanford(斯坦福大学) University of Washington(华盛顿大学)

AI总结 本文提出通过结合多种提取器提升HTML到文本提取的效率与效果,显著提高LLM预训练数据的token产出并改善下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19412 2026-02-18 cs.CL

The Mighty ToRR: A Benchmark for Table Reasoning and Robustness

强大的ToRR:表格推理与鲁棒性基准

Shir Ashury-Tahan, Yifan Mai, Rajmohan C, Ariel Gera, Yotam Perlitz, Asaf Yehudai, Elron Bandel, Leshem Choshen, Eyal Shnarch, Percy Liang, Michal Shmueli-Scheuer

机构 * IBM Research(IBM研究院) Bar-Ilan University(巴伊兰大学) Stanford University(斯坦福大学) MIT(麻省理工学院)

AI总结 ToRR基准通过评估模型在不同表格格式和提示下的表现,揭示了表格推理任务中模型的鲁棒性问题,强调多格式测试对评估模型能力的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12063 2026-02-17 cs.RO

VLAW: Iterative Co-Improvement of Vision-Language-Action Policy and World Model

VLAW: 视觉-语言-动作策略与世界模型的迭代共改进

Yanjiang Guo, Tony Lee, Lucy Xiaoyang Shi, Jianyu Chen, Percy Liang, Chelsea Finn

机构 * Stanford University(斯坦福大学) Tsinghua University(清华大学)

AI总结 本文提出通过迭代改进视觉-语言-动作策略与世界模型,提升真实机器人任务的性能和可靠性。

Comments Project Page: https://sites.google.com/view/vlaw-arxiv

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16163 2026-01-23 cs.AI cs.RO

Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning

Cosmos Policy: 为视觉运动控制和规划微调视频模型

Moo Jin Kim, Yihuai Gao, Tsung-Yi Lin, Yen-Chen Lin, Yunhao Ge, Grace Lam, Percy Liang, Shuran Song, Ming-Yu Liu, Chelsea Finn, Jinwei Gu

机构 * NVIDIA Stanford University(斯坦福大学)

AI总结 Cosmos Policy通过单阶段后训练将预训练视频模型转化为高效机器人策略,实现视觉运动控制与规划的先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24626 2026-01-16 cs.CL

Relative Scaling Laws for LLMs

大语言模型的相对扩展定律

William Held, David Hall, Percy Liang, Diyi Yang

机构 * Stanford University(斯坦福大学) OpenAthena(开放阿塔纳) Georgia Institute of Technology(佐治亚理工学院)

AI总结 本研究提出相对扩展定律,通过分析不同测试分布在规模变化下的性能差异,揭示大语言模型在扩展过程中并非普遍均衡器,强调了鲁棒性挑战的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11966 2026-01-14 cs.CL cs.AI cs.LG stat.ML

On the Entropy Calibration of Language Models

对语言模型熵校准的研究

Steven Cao, Gregory Valiant, Percy Liang

机构 * Stanford University(斯坦福大学)

AI总结 本文研究了语言模型的熵校准问题,发现随着模型规模增大,校准误差缓慢改善,但截断方法会增加对数损失,理论证明在假设可预测文本熵的情况下,可以减少熵而不增加对数损失。

Comments Neurips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00675 2026-01-09 cs.RO

RoboReward: General-Purpose Vision-Language Reward Models for Robotics

RoboReward: 通用视觉-语言奖励模型用于机器人学

Tony Lee, Andrew Wagenmaker, Karl Pertsch, Percy Liang, Sergey Levine, Chelsea Finn

AI总结 RoboReward通过构建机器人奖励数据集和基准,训练视觉-语言奖励模型,验证了其在机器人学习中的有效性,并展示了改进策略学习和缩小与人工奖励差距的成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02671 2026-01-07 cs.CL cs.AI cs.LG

Extracting books from production language models

从生产语言模型中提取书籍

Ahmed Ahmed, A. Feder Cooper, Sanmi Koyejo, Percy Liang

机构 * Stanford University(斯坦福大学) Yale University(耶鲁大学)

AI总结 研究通过两阶段方法测试从生产LLM中提取书籍的可行性,发现部分模型可提取受版权保护文本,但需不同劫持策略,揭示生产LLM存在训练数据泄露风险。

Comments We ran experiments from mid-August to mid-September 2025, notified affected providers shortly after, and now make our findings public after a 90-day disclosure window

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10169 2025-12-12 cs.AI cs.CY cs.LG

The 2025 Foundation Model Transparency Index

2025基础模型透明度指数

Alexander Wan, Kevin Klyman, Sayash Kapoor, Nestor Maslej, Shayne Longpre, Betty Xiong, Percy Liang, Rishi Bommasani

机构 * UC Berkeley(伯克利大学) Stanford University(斯坦福大学) Princeton University(普林斯顿大学) Massachusetts Institute of Technology(麻省理工学院)

AI总结 2025基础模型透明度指数评估了基础模型开发者的透明度,发现整体透明度下降,IBM表现突出,而xAI和Midjourney得分极低,揭示了政策干预的必要性。

Comments Website: https://crfm.stanford.edu/fmti/December-2025/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15216 2025-12-03 cs.CR cs.AI cs.CL cs.LG

BountyBench: Dollar Impact of AI Agent Attackers and Defenders on Real-World Cybersecurity Systems

BountyBench: AI代理攻击者和防御者对现实世界网络安全系统的影响

Andy K. Zhang, Joey Ji, Celeste Menders, Riya Dulepet, Thomas Qin, Ron Y. Wang, Junrong Wu, Kyleen Liao, Jiliang Li, Jinghan Hu, Sara Hong, Nardos Demilew, Shivatmica Murgai, Jason Tran, Nishka Kacheria, Ethan Ho, Denis Liu, Lauren McLane, Olivia Bruvik, Dai-Rong Han, Seungwoo Kim, Akhil Vyas, Cuiyuanxiu Chen, Ryan Li, Weiran Xu, Jonathan Z. Ye, Prerit Choudhary, Siddharth M. Bhatia, Vikram Sivashankar, Yuxuan Bao, Dawn Song, Dan Boneh, Daniel E. Ho, Percy Liang

机构 * Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校)

AI总结 BountyBench通过评估AI代理在漏洞检测、利用和修补中的表现,揭示AI在网络安全中的影响。

Comments 113 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18123 2025-12-02 cs.RO cs.LG

RoboArena: Distributed Real-World Evaluation of Generalist Robot Policies

RoboArena: 分布式现实世界中通用机器人策略的评估

Pranav Atreya, Karl Pertsch, Tony Lee, Moo Jin Kim, Arhan Jain, Artur Kuramshin, Clemens Eppner, Cyrus Neary, Edward Hu, Fabio Ramos, Jonathan Tremblay, Kanav Arora, Kirsty Ellis, Luca Macesanu, Marcel Torne Villasevil, Matthew Leonard, Meedeum Cho, Ozgur Aslan, Shivin Dass, Jie Wang, William Reger, Xingfang Yuan, Xuning Yang, Abhishek Gupta, Dinesh Jayaraman, Glen Berseth, Kostas Daniilidis, Roberto Martin-Martin, Youngwoon Lee, Percy Liang, Chelsea Finn, Sergey Levine

AI总结 RoboArena通过分布式众包评估,实现了对通用机器人策略在现实世界中的可扩展、可靠评估,优于传统集中化方法。

Comments Website: https://robo-arena.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13841 2025-11-19 cs.LG

Beat the long tail: Distribution-Aware Speculative Decoding for RL Training

Zelei Shao, Vikranth Srivatsa, Sanjana Srivastava, Qingyang Wu, Alpay Ariyak, Xiaoxia Wu, Ameen Patel, Jue Wang, Percy Liang, Tri Dao, Ce Zhang, Yiying Zhang, Ben Athiwaratkun, Chenfeng Xu, Junxiong Wang

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02464 2025-10-24 cs.CL

SpecEval: Evaluating Model Adherence to Behavior Specifications

Ahmed Ahmed, Kevin Klyman, Yi Zeng, Sanmi Koyejo, Percy Liang

机构 * Department of Computer Science, Stanford University(计算机科学系,斯坦福大学) The Bradley Department of Electrical and Computer Engineering, Virginia Tech(电气与计算机工程系,弗吉尼亚理工学院)

详情

展开后加载摘要…

URL PDF HTML 收藏