arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of California, Berkeley(加州大学伯克利分校)

共收录 1892
2605.09808 2026-05-12 cs.CL

Quantifying the Utility of User Simulators for Building Collaborative LLM Assistants

量化用户模拟器在构建协作大语言模型助手中的效用

Joseph Suh, Ayush Raj, Minwoo Kang, Serina Chang

机构 * UC Berkeley(加州大学伯克利分校)

AI总结 本文通过实验评估用户模拟器的质量,发现基于细调模拟器训练的助手在真实人类交互中表现更优,且模拟器规模扩大对细调模拟器有效,但对角色扮演模拟器无帮助。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06663 2026-05-12 cs.CL

EMO: Pretraining Mixture of Experts for Emergent Modularity

EMO:用于涌现模块化的专家混合预训练

Ryan Wang, Akshita Bhagia, Sewon Min

机构 * University of California, Berkeley(加州大学伯克利分校) Allen Institute for AI(人工智能研究院)

AI总结 本文提出EMO,通过在预训练中利用文档边界实现专家模块化,使模型在内存受限下仍能保持高性能,同时实现专家的语义层面专业化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10356 2026-05-12 cs.CL

Autonomous Continual Learning for Environment Adaptation of Computer-Use Agents

自主持续学习用于计算机使用智能体的环境适应

Tianci Xue, Zeyi Liao, Tianneng Shi, Zilu Wang, Kai Zhang, Dawn Song, Yu Su, Huan Sun

机构 * The Ohio State University(俄亥俄州立大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出ACuRL框架,通过自主生成任务实现持续学习,无需人工标注数据,在不同环境中实现3-29%的性能提升,且避免灾难性遗忘。

Comments 28 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22919 2026-05-12 cs.CL

ER-Reason: A Benchmark Dataset for LLM Clinical Reasoning in the Emergency Room

ER-Reason:用于急诊科大型语言模型临床推理的基准数据集

Nikita Mehandru, Niloufar Golchini, Namrata Garg, Kathy T. LeSaint, Christopher J. Nash, Anu Ramachandran, Travis Zack, Liam G. McCoy, Adam Rodman, David Bamman, Melanie Molina, Ahmed Alaa

机构 * University of California, Berkeley(加州大学伯克利分校) University of California, San Francisco(加州大学旧金山分校) Duke University(杜克大学) University of Alberta(阿尔伯塔大学) Beth Israel Deaconess Medical Center(贝斯以色列德aconess医疗中心) UC Berkeley and UCSF(伯克利大学和旧金山分校)

AI总结 ER-Reason基准数据集通过真实患者病例评估LLM在急诊流程中逐步推理能力,包含25174份脱敏临床记录,采用Script Concordance Test风格问题测试模型在积累临床证据时的诊断信念更新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18091 2026-05-12 cs.LG cs.AI cs.CL

Data Mixing Can Induce Phase Transitions in Knowledge Acquisition

数据混合可在知识获取中引发相变

Xinran Gu, Kaifeng Lyu, Jiazheng Li, Jingzhao Zhang

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) College of AI, Tsinghua University(清华大学人工智能学院) Shanghai Qizhi Institute(上海启智研究院) Simons Institute for the Theory of Computing, UC Berkeley(伯克利理论计算研究所)

AI总结 本文研究了在数据混合训练中LLM的知识获取行为,发现混合比例和模型规模会影响知识获取的相变现象,揭示了容量分配机制与信息理论框架下的预测关系。

Comments NeurIPS'25 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.06576 2026-05-12 cs.CL cs.AI

Virtual Personas for Language Models via an Anthology of Backstories

通过背景区 anthology 为语言模型构建虚拟人物

Suhong Moon, Marwa Abdulhai, Minwoo Kang, Joseph Suh, Widyadewi Soedarmadji, Eran Kohen Behar, David M. Chan, John Canny

机构 * University of California, Berkeley(加州大学伯克利分校) Google LLC(谷歌公司)

AI总结 本文提出 anthology 方法,利用开放性生活叙述引导语言模型生成特定虚拟人物,提升实验结果的一致性和可靠性,通过三个人类调查发现其在匹配响应分布和一致性指标上分别提升18%和27%。

Comments EMNLP 2024 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09217 2026-05-12 cs.AI cs.LG cs.MA

Learning the Preferences of a Learning Agent

学习学习代理的偏好

Karim Abdel Sadek, Mark Bedaywi, Rhys Gould, Stuart Russell

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 本文研究学习代理偏好学习问题,通过分析在线学习者行为推断潜在奖励函数,探讨无 regrets 或收敛到最优 Boltzmann 策略的理论保证。

Comments Published at ICLR 2026, Workshop on Multi-Agent Learning and Its Opportunities in the Era of Generative AI. 9 pages main text

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09128 2026-05-12 cs.MA cs.AI

Internal vs. External: Comparing Deliberation and Evolution for Multi-Agent Constitutional Design

内部 vs. 外部:比较 deliberation 与 evolution 在多智能体宪法设计中的应用

Hershraj Niranjani, Ujwal Kumar, Phan Xuan Tan

机构 * College of Engineering, Shibaura Institute of Technology, Tokyo, Japan(东京工业大学工学院) Department of EECS, University of California, Berkeley, Berkeley, CA, USA(加州大学伯克利分校电子工程与计算机科学系)

AI总结 本文比较了多智能体系统中内部协商与外部进化在协调网格世界、公共物品游戏和双边交易市场中的表现,发现进化在集体行动中表现更优,但在双边交易中无明显优势,且进化在激励变化时可能产生负面效果。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08575 2026-05-12 cs.LG cs.AI

Uncovering Intra-expert Activation Sparsity for Efficient Mixture-of-Expert Model Execution

揭示专家内部激活稀疏性以实现高效的混合专家模型执行

Jongseok Park, Sunga Kim, Zhenyu Gu, Ion Stoica, Alvin Cheung

机构 * University of California, Berkeley(加州大学伯克利分校) Advanced Micro Devices, Inc.(先进微器件公司)

AI总结 本文研究了混合专家模型中专家内部激活稀疏性,通过利用这种未被探索的稀疏性维度,提高了模型执行效率,实现了2.5倍的层执行速度提升和1.2倍的端到端速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08545 2026-05-12 cs.AI

Log analysis is necessary for credible evaluation of AI agents

对AI代理的可信评估需要日志分析

Peter Kirgis, Sayash Kapoor, Stephan Rabanser, Nitya Nadgir, Cozmin Ududec, Magda Dubois, JJ Allaire, Conrad Stosz, Marius Hobbhahn, Jacob Steinhardt, Arvind Narayanan

机构 * Princeton University(普林斯顿大学) Independent(独立) UK AISI(英国AISI) Meridian Labs(梅里登实验室) Transluce Apollo Research(Apollo研究) UC Berkeley(伯克利大学)

AI总结 本文提出通过日志分析解决AI代理评估中的可信问题,揭示了日志分析在识别评估威胁和指导原则中的作用,并展示了tau-Bench Airline中日志分析发现的性能缺陷和部署失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08539 2026-05-12 cs.LG cs.AI

Continuity Laws for Sequential Models

序列模型的连续性法则

Annan Yu, Dongwei Lyu, N. Benjamin Erichson

机构 * Center for Applied Mathematics, Cornell University(康奈尔大学应用数学中心) University of California, Berkeley(加州大学伯克利分校) Lawrence Berkeley National Laboratory(伯克利国家实验室) International Computer Science Institute(国际计算机科学研究所)

AI总结 本文研究序列模型中未被探索的连续性诱导偏差,通过时间连续性分析S4和S6模型的连续行为,发现连续性与任务连续性及性能相关,提出时间连续性度量方法提升效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08451 2026-05-12 cs.LG

RubiConv -- Efficient Boundary-Respecting Convolutions

RubiConv -- 高效的边界尊重卷积

Linda Friso, Annie Marsden, Xinyi Chen, Arushi Gupta, Peter Bartlett, Mark Braverman, Elad Hazan

机构 * Google Deepmind(谷歌DeepMind) UC Berkeley(伯克利大学) Princeton University(普林斯顿大学)

AI总结 RubiConv通过高效处理打包序列中的边界尊重卷积,提升了长序列模型的理论效率,实验显示其在注意力和标准FFT基线上的显著加速。

Comments 19 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25926 2026-05-12 cs.CR cs.LG

Preventing Prompt Injection with Type-Directed Privilege Separation

通过类型引导的特权分离防止提示注入

Dennis Jacob, Emad Alghamdi, Zhanhao Hu, Basel Alomair, David Wagner

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出一种类型引导的特权分离技术,通过将不可信数据转换为受控的数据类型,有效防止提示注入攻击,同时保持系统的实用性和兼容性。

Comments Revised manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08441 2026-05-12 cs.LG cs.AI

DUET: Optimize Token-Budget Allocation for Reinforcement Learning with Verifiable Rewards

DUET:基于可验证奖励的强化学习中优化令牌预算分配

Haoyu Hu, Xuandong Zhao, Xuhai "Orson'' Xu, Nori Jacoby

机构 * Cornell University(康奈尔大学) University of California, Berkeley(加州大学伯克利分校) Columbia University(哥伦比亚大学)

AI总结 DUET通过联合调整令牌预算分配的两个维度,提升强化学习的推理质量和训练效率,同时在多个基准测试中表现优异,且在预算减少时性能优势扩大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08396 2026-05-12 cs.CV

Delivering Science as a Service: Sci-Orchestra's Cloud-Native Approach to HPC

作为服务交付科学:Sci-Orchestra的云原生方法用于HPC

Harinarayan Krishnan, Shubhabrata Mukerjee, Jeffrey Donatelli, Daniela Ushizima

机构 * Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室) Applied Math & Computational Research Division(应用数学与计算研究部) Bakar Comp. Health Sciences Institute(巴卡计算与健康科学研究所) UC San Francisco(旧金山大学) Berkeley Institute for Data Science(伯克利数据科学研究所) UC Berkeley(伯克利大学)

AI总结 Sci-Orchestra通过云原生方法自动化HPC实验流程,提供安全的执行环境,促进跨机构合作,加速实验室原型到工业应用的转化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08200 2026-05-12 cs.AI cs.CV cs.LG

Where Reliability Lives in Vision-Language Models: A Mechanistic Study of Attention, Hidden States, and Causal Circuits

在视觉-语言模型中可靠性在哪里存在:注意力、隐藏状态和因果回路的机制研究

Logan Mann, Ajit Saravanan, Ishan Dave, Shikhar Shiromani, Saadullah Ismail, Yi Xia, Emily Huang

机构 * UC Santa Barbara(加州大学圣巴巴拉分校) UC Berkeley(加州大学伯克利分校) NVIDIA(英伟达) Algoverse AI Research(Algoverse人工智能研究) Brown University(布朗大学)

AI总结 本文通过机制性研究发现,视觉-语言模型的可靠性主要体现在隐藏状态几何、分层边际形成和稀疏晚层回路,而非注意力图的锐度。

Comments 15 pages, 4 figures, 10 tables. Accepted at the ICLR 2026 Workshop on Multimodal Reasoning. Code and probe-training pipelines: https://github.com/itsloganmann/VLM-Reliability-Probe

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08064 2026-05-11 cs.CV

Proxy3D: Efficient 3D Representations for Vision-Language Models via Semantic Clustering and Alignment

Proxy3D: 通过语义聚类和对齐实现视觉-语言模型的高效3D表示

Jerry Jiang, Haowen Sun, Denis Gudovskiy, Yohei Nakata, Tomoyuki Okuno, Kurt Keutzer, Wenzhao Zheng

机构 * Tsinghua University(清华大学) Panasonic AI Lab(松下人工智能实验室) Panasonic DX-CPS(松下DX-CPS) UC Berkeley(伯克利大学)

AI总结 本文提出Proxy3D方法,通过语义和几何编码器提取场景特征并进行语义感知聚类,生成紧凑且全面的3D代理表示,提升视觉-语言模型在3D视觉问答、视觉定位和空间智能任务中的性能。

Comments Accepted by CVPR 2026. Project page: https://wzzheng.net/Proxy3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07847 2026-05-11 cs.CL

Measuring and Mitigating the Distributional Gap Between Real and Simulated User Behaviors

测量和缓解真实与模拟用户行为之间的分布差距

Shuhaib Mehri, Philippe Laban, Sumuk Shashidhar, Marwa Abdulhai, Sergey Levine, Michel Galley, Dilek Hakkani-Tür

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft Research(微软研究院) University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出了一种方法,系统评估24个基于LLM的用户模拟器在编程和写作任务中的表现,揭示了真实用户行为与模拟行为之间的显著分布差异,并通过组合互补的模拟器来缩小这一差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07723 2026-05-11 cs.DL cs.AI cs.CY physics.soc-ph

LLM hallucinations in the wild: Large-scale evidence from non-existent citations

在现实世界中大型语言模型的幻觉:来自不存在引用的大规模证据

Zhenyue Zhao, Yihe Wang, Toby Stuart, Mathijs De Vaan, Paul Ginsparg, Yian Yin

机构 * Department of Information Science, Cornell University(信息科学系,康奈尔大学) Department of Sociology, University of California Los Angeles(社会学系,加州大学洛杉矶分校) Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学) Haas School of Business, University of California Berkeley(哈斯商学院,加州大学伯克利分校)

AI总结 研究通过验证引用数据揭示LLM生成虚假引用的问题,发现2025年存在146932个虚假引用,且在AI应用快速发展的领域和语言特征显示AI辅助写作的论文中尤为严重,影响科学认可的公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06987 2026-05-11 cs.LG cs.GT econ.TH stat.ML

Response Time Enhances Alignment with Heterogeneous Preferences

响应时间增强异质偏好对齐

Federico Echenique, Alireza Fallah, Baihe Huang, Michael I. Jordan

机构 * Department of Economics, University of California, Berkeley(加州大学伯克利分校经济系) Department of Computer Science and Ken Kennedy Institute, Rice University(休斯敦大学计算机科学系和肯尼迪研究所) Departments of Electrical Engineering and Computer Sciences, University of California, Berkeley(加州大学伯克利分校电子工程与计算机科学系) Departments of Electrical Engineering and Computer Sciences and Statistics, University of California, Berkeley(加州大学伯克利分校电子工程与计算机科学系和统计学系;巴黎Inria) Inria Paris

AI总结 本文提出通过引入用户响应时间信号来纠正传统偏好数据中对异质偏好的估计偏差,证明该方法能准确识别群体平均偏好,提升大型语言模型对人类偏好的对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06920 2026-05-11 cs.GT cs.AI cs.LG

In-Context Credit Assignment via the Core

通过核心进行上下文内信用分配

Keegan Harris, Siddharth Prasad, Asher Trockman

机构 * UC Berkeley(伯克利大学) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) Google Research(谷歌研究)

AI总结 本文提出了一种激励对齐的上下文内信用分配机制,基于合作博弈理论中的核心解概念,通过算法近似核心解来稳定分配价值,实验显示其在网页检索任务中效率显著高于其他方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06686 2026-05-11 cs.LG econ.EM stat.AP stat.ML

Robustness of Refugee-Matching Gains to Off-Policy Evaluation Choices

难民匹配收益对离线评估选择的鲁棒性

Kirk Bansak, Elisabeth Paulson, Dominik Rothenhäusler, Jeremy Ferwerda, Jens Hainmueller, Michael Hotard

机构 * Immigration Policy Lab, Stanford University(斯坦福大学移民政策实验室) Department of Political Science, University of California, Berkeley(加州大学伯克利分校政治学系) Technology and Operations Management Unit, Harvard Business School(哈佛商学院技术与运营管理单位) Department of Statistics, Stanford University(斯坦福大学统计学系) Department of Government, Dartmouth College(达特茅斯学院政府系) Department of Political Science, Stanford University(斯坦福大学政治学系)

AI总结 本文研究难民匹配对难民结果的提升潜力,通过多种离线评估方法验证了因果影响评估结果的稳定性,发现估计值在多数情况下具有统计显著性且与Bansak等(2018)结果一致。

Comments 13 pages, 2 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05732 2026-05-11 cs.LG cs.AI

CRAFT: Forgetting-Aware Intervention-Based Adaptation for Continual Learning

CRAFT:面向持续学习的遗忘感知干预式适应

Md Anwar Hossen, Fatema Siddika, Juan Pablo Munoz, Tanya Roosta, Ali Jannesari

机构 * Iowa State University(爱荷华州立大学) Maro Systems(Maro系统) University of California, Berkeley(加州大学伯克利分校) AMD

AI总结 CRAFT通过在隐藏表示上学习低秩干预,避免更新模型权重,通过输出分布分歧路由任务、KL散度正则化和合并干预,减少遗忘并提升性能。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06283 2026-05-11 cs.LG

SOCKET: SOft Collision Kernel EsTimator for Sparse Attention

SOCKET: 用于稀疏注意力的软碰撞核估计器

Sahil Joshi, Agniva Chowdhury, Wyatt Bellinger, Amar Kanakamedala, Ekam Singh, Hoang Anh Duy Le, Aditya Desai, Anshumali Shrivastava

机构 * Department of Computer Science, Rice University(里士大学计算机科学系) Department of Electrical Engineering and Computer Sciences, UC Berkeley(伯克利大学电气工程与计算机科学系)

AI总结 SOCKET通过引入软碰撞核估计器改进稀疏注意力,利用概率性相似性聚合替代传统二元碰撞信号,提升长上下文推理效率和内存利用率。

Comments 7 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15840 2026-05-11 cs.RO cs.CV

Large Video Planner Enables Generalizable Robot Control

大视频规划器实现通用机器人控制

Boyuan Chen, Tianyuan Zhang, Haoran Geng, Caiyi Zhang, Peihao Li, Kiwhan Song, William T. Freeman, Jitendra Malik, Pieter Abbeel, Russ Tedrake, Vincent Sitzmann, Yilun Du

机构 * MIT(麻省理工学院) UC Berkeley(加州大学伯克利分校) Harvard(哈佛大学)

AI总结 本文提出利用大规模视频预训练构建通用机器人基础模型,通过生成视频计划实现跨任务和环境的泛化控制,并在真实机器人上验证了其可行性。

Comments 29 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00082 2026-05-11 quant-ph cs.DS cs.LG

Structure learning of Hamiltonians from real-time evolution

从实时演化中学习哈密顿量的结构

Ainesh Bakshi, Allen Liu, Ankur Moitra, Ewin Tang

机构 * MIT(麻省理工学院) UC Berkeley(加州大学伯克利分校)

AI总结 本文提出了一种新的哈密顿量学习方法,能够在不预先知道相互作用结构的情况下,以Heisenberg极限精度在O(log n/ε)时间内恢复哈密顿量,扩展到任意相互作用范围,并实现常数时间分辨率。

Comments 52 pages; v2 discussed more literature, qualified some claims; v3 minor correction discussing prior work; v4 strengthened main theorem

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.15288 2026-05-11 cs.AI cs.LG

Active teacher selection for reward learning

奖励学习中的主动教师选择

Rachel Freedman, Justin Svegliato, Kyle Wray, Stuart Russell

机构 * University of California, Berkeley(加州大学伯克利分校) Northeastern University(东北大学)

AI总结 本文提出HUB框架,通过主动选择教师来提升奖励学习效果,应用于推荐系统和疫苗测试领域,展示了教师异质性建模的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02243 2026-05-11 quant-ph cs.DS cs.LG

Learning quantum Hamiltonians at any temperature in polynomial time

在多项式时间内学习任意温度下的量子哈密顿量

Ainesh Bakshi, Allen Liu, Ankur Moitra, Ewin Tang

机构 * MIT(麻省理工学院) UC Berkeley(加州大学伯克利分校)

AI总结 本文提出在多项式时间内学习任意常数温度下量子哈密顿量的算法,通过多项式逼近和多项式系统松弛方法解决哈密顿量学习问题。

Comments 66 pages; v2 minor edits, clarification on locality

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06070 2026-05-08 cs.CV

Arena as Offline Reward: Efficient Fine-Grained Preference Optimization for Diffusion Models

竞技场作为离线奖励:用于扩散模型的高效细粒度偏好优化

Zhikai Li, Yue Zhao, Edward Zhongwei Zhang, Xuewen Liu, Jing Zhang, Qingyi Gu, Zhen Dong

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of California, Berkeley(加州大学伯克利分校) University of California, Santa Barbara(加州大学圣巴巴拉分校)

AI总结 本文提出ArenaPO,利用竞技场评分作为离线奖励,实现高效细粒度优化,无需奖励模型。通过构建能力分布模型,基于截断正态分布估计质量差距,提升扩散模型的偏好对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03482 2026-05-08 cs.CR cs.AI cs.LG

MEMSAD: Gradient-Coupled Anomaly Detection for Memory Poisoning in Retrieval-Augmented Agents

MEMSAD: 基于梯度耦合的内存污染异常检测用于检索增强型智能体

Ishrith Gowda

机构 * Department of Electrical Engineering and Computer Sciences(电气工程与计算机科学系) University of California, Berkeley(加州大学伯克利分校) Berkeley AI Research(伯克利人工智能研究)

AI总结 本文提出MEMSAD,通过梯度耦合定理实现内存污染攻击的检测,证明其在对抗策略下的正确分类保证,并通过实验验证复合防御在所有攻击下的高检测率和低误报率。

Comments 28 pages, 9 figures, 6 theorems. Submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏