arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of California, Berkeley(加州大学伯克利分校)

2026-05-12 至 2026-05-12 共收录 24
2605.10598 2026-05-12 cs.AI

Budget-Efficient Automatic Algorithm Design via Code Graph

通过代码图实现高效的预算自动算法设计

Maxime Bouscary, Manxi Wu, Saurabh Amin

机构 * Operations Research Center(运筹学研究中心) Department of Civil and Environmental Engineering(土木与环境工程系) University of California, Berkeley(加州大学伯克利分校) Laboratory for Information & Decision Systems(信息与决策系统实验室)

AI总结 本文提出基于代码图的高效自动算法设计方法,通过优化搜索策略和图结构分解算法,提升算法生成效率并验证其在组合优化问题中的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10585 2026-05-12 cs.LG

Controllability in preference-conditioned multi-objective reinforcement learning

偏好条件多目标强化学习中的可控性

Pau de las Heras Molins, Beyazit Yalcinkaya, Lasse Peters, David Fridovich-Keil, Georgios Bakirtzis

机构 * LTCI, Télécom Paris, Institut Polytechnique de Paris(LTCI,巴黎电信学院,巴黎理工学院) University of California, Berkeley(加州大学伯克利分校) TU Delft(代尔夫特理工大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出一种新的评估指标,用于衡量偏好条件多目标强化学习中控制能力的可靠性,以解决现有指标无法准确反映偏好变化对智能体行为影响的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10313 2026-05-12 cs.LG math.OC

Signature Approach for Contextual Bandits with Nonlinear and Path-dependent Rewards

基于签名的方法用于具有非线性和路径依赖奖励的上下文老虎机

Xin Guo, Grace He, Xinyu Li

机构 * University of California, Berkeley(加州大学伯克利分校) University of Oxford(牛津大学)

AI总结 本文提出DisSigUCB算法,通过签名变换将路径依赖奖励函数近似为线性函数,实现非线性和路径依赖场景下的子线性 regret 绑定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04660 2026-05-12 cs.CL

Composing Policy Gradients and Prompt Optimization for Language Model Programs

将策略梯度与提示优化组合用于语言模型程序

Noah Ziems, Dilara Soylu, Lakshya A Agrawal, Isaac Miller, Liheng Lai, Chen Qian, Kaiqiang Song, Meng Jiang, Dan Klein, Matei Zaharia, Karel D'Oosterlinck, Christopher Potts, Omar Khattab

机构 * University of Notre Dame(诺特大学) Stanford University(斯坦福大学) UC Berkeley(伯克利大学) Anyscale CMU(卡内基梅隆大学) Zoom, Inc.(Zoom公司) Contextual AI MIT(麻省理工学院)

AI总结 本文研究了如何将GRPO与自动提示优化结合,以提升多提示程序的性能,实验表明这种组合在分类、多跳搜索和隐私保护委托任务中平均提升准确率11%。

Comments ACM CAIS 2026. Lakshya*, Dilara*, and Noah* contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07969 2026-05-12 cs.LG cs.AI cs.RO stat.ML

Reinforcement Learning with Action Chunking

基于动作分块的强化学习

Qiyang Li, Zhiyuan Zhou, Sergey Levine

机构 * UC Berkeley(伯克利大学)

AI总结 本文提出Q-chunking方法,通过动作分块技术提升长周期稀疏奖励任务的强化学习效率,实现离线到在线学习的样本效率优化。

Comments The Thirty-Ninth Annual Conference on Neural Information Processing Systems (NeurIPS 2025); 29 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09971 2026-05-12 cs.HC cs.AI

HapticLDM: A Diffusion Model for Text-to-Vibrotactile Generation

HapticLDM:一种用于文本到触觉生成的扩散模型

Jiahao Xiong, Fei Wang, Anran Xu, Pinzhi Huang, Tao Wen, Lijia Pan, Cai Chen

机构 * Technology Development Center, Guangzhou Shiyuan Electronic Technology Company Limited(广州仕元电子技术有限公司技术发展中心) School of Automation and Intelligence, Beijing Jiaotong University(北京交通大学自动化与智能学院) Department of Architecture, University of California, Berkeley(加州大学伯克利分校建筑系) School of Electronic Science and Engineering, Nanjing University(南京大学电子科学与技术学院)

AI总结 本文提出HapticLDM,基于潜在扩散模型生成文本到触觉反馈,通过动态数据处理和全局去噪机制提升振动生成的准确性和一致性,经评估显示其在真实感和语义对齐方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09945 2026-05-12 cs.LG

Selection of the Best Policy under Fairness Constraints for Subpopulations

在公平性约束下为子群体选择最佳政策

Tingyu Zhu, Yuhang Wu, Zeyu Zheng

机构 * Department of Industrial Engineering and Operations Research(工业工程与运营管理系) Berkeley Artificial Intelligence Research Lab(伯克利人工智能研究实验室) University of California Berkeley(加州大学伯克利分校)

AI总结 本文提出在公平性约束下选择最佳政策的问题,设计了满足子群体阈值的算法,并通过实验验证了其效率优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09867 2026-05-12 cs.LG cs.AI

Continuous Latent Contexts Enable Efficient Online Learning in Transformers

连续潜在上下文使Transformer实现高效的在线学习

Emile Anand, Abdullah Ateyeh, Xinyuan Cao, Max Dabagia

机构 * Georgia Institute of Technology(佐治亚理工学院) University of California, Berkeley(加州大学伯克利分校) Columbia University(哥伦比亚大学)

AI总结 本文研究连续潜在上下文是否能提升Transformer的在线学习能力,通过构造常深Transformer实现加权多数算法和Q学习,并在合成数据上优于大模型。

Comments 37 pages, 15 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09808 2026-05-12 cs.CL

Quantifying the Utility of User Simulators for Building Collaborative LLM Assistants

量化用户模拟器在构建协作大语言模型助手中的效用

Joseph Suh, Ayush Raj, Minwoo Kang, Serina Chang

机构 * UC Berkeley(加州大学伯克利分校)

AI总结 本文通过实验评估用户模拟器的质量,发现基于细调模拟器训练的助手在真实人类交互中表现更优,且模拟器规模扩大对细调模拟器有效,但对角色扮演模拟器无帮助。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06663 2026-05-12 cs.CL

EMO: Pretraining Mixture of Experts for Emergent Modularity

EMO:用于涌现模块化的专家混合预训练

Ryan Wang, Akshita Bhagia, Sewon Min

机构 * University of California, Berkeley(加州大学伯克利分校) Allen Institute for AI(人工智能研究院)

AI总结 本文提出EMO,通过在预训练中利用文档边界实现专家模块化,使模型在内存受限下仍能保持高性能,同时实现专家的语义层面专业化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10356 2026-05-12 cs.CL

Autonomous Continual Learning for Environment Adaptation of Computer-Use Agents

自主持续学习用于计算机使用智能体的环境适应

Tianci Xue, Zeyi Liao, Tianneng Shi, Zilu Wang, Kai Zhang, Dawn Song, Yu Su, Huan Sun

机构 * The Ohio State University(俄亥俄州立大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出ACuRL框架,通过自主生成任务实现持续学习,无需人工标注数据,在不同环境中实现3-29%的性能提升,且避免灾难性遗忘。

Comments 28 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22919 2026-05-12 cs.CL

ER-Reason: A Benchmark Dataset for LLM Clinical Reasoning in the Emergency Room

ER-Reason:用于急诊科大型语言模型临床推理的基准数据集

Nikita Mehandru, Niloufar Golchini, Namrata Garg, Kathy T. LeSaint, Christopher J. Nash, Anu Ramachandran, Travis Zack, Liam G. McCoy, Adam Rodman, David Bamman, Melanie Molina, Ahmed Alaa

机构 * University of California, Berkeley(加州大学伯克利分校) University of California, San Francisco(加州大学旧金山分校) Duke University(杜克大学) University of Alberta(阿尔伯塔大学) Beth Israel Deaconess Medical Center(贝斯以色列德aconess医疗中心) UC Berkeley and UCSF(伯克利大学和旧金山分校)

AI总结 ER-Reason基准数据集通过真实患者病例评估LLM在急诊流程中逐步推理能力,包含25174份脱敏临床记录,采用Script Concordance Test风格问题测试模型在积累临床证据时的诊断信念更新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18091 2026-05-12 cs.LG cs.AI cs.CL

Data Mixing Can Induce Phase Transitions in Knowledge Acquisition

数据混合可在知识获取中引发相变

Xinran Gu, Kaifeng Lyu, Jiazheng Li, Jingzhao Zhang

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) College of AI, Tsinghua University(清华大学人工智能学院) Shanghai Qizhi Institute(上海启智研究院) Simons Institute for the Theory of Computing, UC Berkeley(伯克利理论计算研究所)

AI总结 本文研究了在数据混合训练中LLM的知识获取行为,发现混合比例和模型规模会影响知识获取的相变现象,揭示了容量分配机制与信息理论框架下的预测关系。

Comments NeurIPS'25 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.06576 2026-05-12 cs.CL cs.AI

Virtual Personas for Language Models via an Anthology of Backstories

通过背景区 anthology 为语言模型构建虚拟人物

Suhong Moon, Marwa Abdulhai, Minwoo Kang, Joseph Suh, Widyadewi Soedarmadji, Eran Kohen Behar, David M. Chan, John Canny

机构 * University of California, Berkeley(加州大学伯克利分校) Google LLC(谷歌公司)

AI总结 本文提出 anthology 方法,利用开放性生活叙述引导语言模型生成特定虚拟人物,提升实验结果的一致性和可靠性,通过三个人类调查发现其在匹配响应分布和一致性指标上分别提升18%和27%。

Comments EMNLP 2024 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09217 2026-05-12 cs.AI cs.LG cs.MA

Learning the Preferences of a Learning Agent

学习学习代理的偏好

Karim Abdel Sadek, Mark Bedaywi, Rhys Gould, Stuart Russell

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 本文研究学习代理偏好学习问题,通过分析在线学习者行为推断潜在奖励函数,探讨无 regrets 或收敛到最优 Boltzmann 策略的理论保证。

Comments Published at ICLR 2026, Workshop on Multi-Agent Learning and Its Opportunities in the Era of Generative AI. 9 pages main text

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09128 2026-05-12 cs.MA cs.AI

Internal vs. External: Comparing Deliberation and Evolution for Multi-Agent Constitutional Design

内部 vs. 外部:比较 deliberation 与 evolution 在多智能体宪法设计中的应用

Hershraj Niranjani, Ujwal Kumar, Phan Xuan Tan

机构 * College of Engineering, Shibaura Institute of Technology, Tokyo, Japan(东京工业大学工学院) Department of EECS, University of California, Berkeley, Berkeley, CA, USA(加州大学伯克利分校电子工程与计算机科学系)

AI总结 本文比较了多智能体系统中内部协商与外部进化在协调网格世界、公共物品游戏和双边交易市场中的表现,发现进化在集体行动中表现更优,但在双边交易中无明显优势,且进化在激励变化时可能产生负面效果。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08575 2026-05-12 cs.LG cs.AI

Uncovering Intra-expert Activation Sparsity for Efficient Mixture-of-Expert Model Execution

揭示专家内部激活稀疏性以实现高效的混合专家模型执行

Jongseok Park, Sunga Kim, Zhenyu Gu, Ion Stoica, Alvin Cheung

机构 * University of California, Berkeley(加州大学伯克利分校) Advanced Micro Devices, Inc.(先进微器件公司)

AI总结 本文研究了混合专家模型中专家内部激活稀疏性,通过利用这种未被探索的稀疏性维度,提高了模型执行效率,实现了2.5倍的层执行速度提升和1.2倍的端到端速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08545 2026-05-12 cs.AI

Log analysis is necessary for credible evaluation of AI agents

对AI代理的可信评估需要日志分析

Peter Kirgis, Sayash Kapoor, Stephan Rabanser, Nitya Nadgir, Cozmin Ududec, Magda Dubois, JJ Allaire, Conrad Stosz, Marius Hobbhahn, Jacob Steinhardt, Arvind Narayanan

机构 * Princeton University(普林斯顿大学) Independent(独立) UK AISI(英国AISI) Meridian Labs(梅里登实验室) Transluce Apollo Research(Apollo研究) UC Berkeley(伯克利大学)

AI总结 本文提出通过日志分析解决AI代理评估中的可信问题,揭示了日志分析在识别评估威胁和指导原则中的作用,并展示了tau-Bench Airline中日志分析发现的性能缺陷和部署失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08539 2026-05-12 cs.LG cs.AI

Continuity Laws for Sequential Models

序列模型的连续性法则

Annan Yu, Dongwei Lyu, N. Benjamin Erichson

机构 * Center for Applied Mathematics, Cornell University(康奈尔大学应用数学中心) University of California, Berkeley(加州大学伯克利分校) Lawrence Berkeley National Laboratory(伯克利国家实验室) International Computer Science Institute(国际计算机科学研究所)

AI总结 本文研究序列模型中未被探索的连续性诱导偏差,通过时间连续性分析S4和S6模型的连续行为,发现连续性与任务连续性及性能相关,提出时间连续性度量方法提升效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08451 2026-05-12 cs.LG

RubiConv -- Efficient Boundary-Respecting Convolutions

RubiConv -- 高效的边界尊重卷积

Linda Friso, Annie Marsden, Xinyi Chen, Arushi Gupta, Peter Bartlett, Mark Braverman, Elad Hazan

机构 * Google Deepmind(谷歌DeepMind) UC Berkeley(伯克利大学) Princeton University(普林斯顿大学)

AI总结 RubiConv通过高效处理打包序列中的边界尊重卷积,提升了长序列模型的理论效率,实验显示其在注意力和标准FFT基线上的显著加速。

Comments 19 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25926 2026-05-12 cs.CR cs.LG

Preventing Prompt Injection with Type-Directed Privilege Separation

通过类型引导的特权分离防止提示注入

Dennis Jacob, Emad Alghamdi, Zhanhao Hu, Basel Alomair, David Wagner

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出一种类型引导的特权分离技术,通过将不可信数据转换为受控的数据类型,有效防止提示注入攻击,同时保持系统的实用性和兼容性。

Comments Revised manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08441 2026-05-12 cs.LG cs.AI

DUET: Optimize Token-Budget Allocation for Reinforcement Learning with Verifiable Rewards

DUET:基于可验证奖励的强化学习中优化令牌预算分配

Haoyu Hu, Xuandong Zhao, Xuhai "Orson'' Xu, Nori Jacoby

机构 * Cornell University(康奈尔大学) University of California, Berkeley(加州大学伯克利分校) Columbia University(哥伦比亚大学)

AI总结 DUET通过联合调整令牌预算分配的两个维度,提升强化学习的推理质量和训练效率,同时在多个基准测试中表现优异,且在预算减少时性能优势扩大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08396 2026-05-12 cs.CV

Delivering Science as a Service: Sci-Orchestra's Cloud-Native Approach to HPC

作为服务交付科学:Sci-Orchestra的云原生方法用于HPC

Harinarayan Krishnan, Shubhabrata Mukerjee, Jeffrey Donatelli, Daniela Ushizima

机构 * Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室) Applied Math & Computational Research Division(应用数学与计算研究部) Bakar Comp. Health Sciences Institute(巴卡计算与健康科学研究所) UC San Francisco(旧金山大学) Berkeley Institute for Data Science(伯克利数据科学研究所) UC Berkeley(伯克利大学)

AI总结 Sci-Orchestra通过云原生方法自动化HPC实验流程,提供安全的执行环境,促进跨机构合作,加速实验室原型到工业应用的转化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08200 2026-05-12 cs.AI cs.CV cs.LG

Where Reliability Lives in Vision-Language Models: A Mechanistic Study of Attention, Hidden States, and Causal Circuits

在视觉-语言模型中可靠性在哪里存在:注意力、隐藏状态和因果回路的机制研究

Logan Mann, Ajit Saravanan, Ishan Dave, Shikhar Shiromani, Saadullah Ismail, Yi Xia, Emily Huang

机构 * UC Santa Barbara(加州大学圣巴巴拉分校) UC Berkeley(加州大学伯克利分校) NVIDIA(英伟达) Algoverse AI Research(Algoverse人工智能研究) Brown University(布朗大学)

AI总结 本文通过机制性研究发现,视觉-语言模型的可靠性主要体现在隐藏状态几何、分层边际形成和稀疏晚层回路,而非注意力图的锐度。

Comments 15 pages, 4 figures, 10 tables. Accepted at the ICLR 2026 Workshop on Multimodal Reasoning. Code and probe-training pipelines: https://github.com/itsloganmann/VLM-Reliability-Probe

详情

展开后加载摘要…

URL PDF HTML 收藏