arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of California, Berkeley(加州大学伯克利分校)

共收录 1892
2604.11978 2026-04-15 cs.AI

The Long-Horizon Task Mirage? Diagnosing Where and Why Agentic Systems Break

长远任务的幻觉?诊断代理系统何时及为何失效

Xinyu Jessica Wang, Haoyue Bai, Yiyou Sun, Haorui Wang, Shuibai Zhang, Wenjie Hu, Mya Schroder, Bilge Mutlu, Dawn Song, Robert D Nowak

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of California, Berkeley(加州大学伯克利分校) Georgia Institute of Technology(佐治亚理工学院)

AI总结 本文通过HORIZON基准测试分析LLM代理在长周期任务中的失效模式,提出轨迹驱动的评估方法,并通过人类标注验证其有效性,为构建更可靠的代理系统提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11954 2026-04-15 eess.SY cs.GT cs.RO cs.SY

Dynamic Multi-Robot Task Allocation under Uncertainty and Communication Constraints: A Game-Theoretic Approach

在不确定性和通信约束下动态多机器人任务分配:一种博弈论方法

Maria G. Mendoza, Pan-Yang Su, Bryce L. Ferguson, S. Shankar Sastry

机构 * Department of Mechanical Engineering, University of California, Berkeley(加州大学伯克利分校机械工程系) Department of Electrical Engineering and Computer Science, University of California, Berkeley(加州大学伯克利分校电气工程与计算机科学系) Thayer School of Engineering, Dartmouth College(达特茅斯学院泰勒工程学院)

AI总结 本文研究了在不确定任务完成、时间窗口约束和不完全信息下的动态多机器人任务分配问题,提出基于博弈论的迭代最佳响应算法,在城市级配送领域实现了高效的任务完成。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18899 2026-04-15 eess.AS cs.CL cs.LG cs.SD

[b]=[d]-[t]+[p]: Self-supervised Speech Models Discover Phonological Vector Arithmetic

[b]=[d]-[t]+[p]:自监督语音模型发现语音向量算术

Kwanghee Choi, Eunjung Yeo, Cheol Jun Cho, David Harwath, David R. Mortensen

机构 * UT Austin(得克萨斯大学奥斯汀分校) UC Berkeley(伯克利大学) CMU(卡内基梅隆大学)

AI总结 研究通过分析96种语言的自监督语音模型表示,发现语音特征可通过线性方向和向量运算表示,揭示了语音向量算术的结构。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09936 2026-04-15 cs.LG cs.NA math.NA

SciML Agents: Write the Solver, Not the Solution

SciML代理:编写求解器,而非解决方案

Saarth Gaonkar, Xiang Zheng, Haocheng Xi, Rishabh Tiwari, Kurt Keutzer, Dmitriy Morozov, Michael W. Mahoney, Amir Gholami

机构 * UC Berkeley(加州大学伯克利分校) LBNL(劳伦斯伯克利国家实验室) ICSI(国际计算机科学研究所)

AI总结 本文探讨利用LLM编写科学机器学习求解器,通过设计新数据集评估不同模型在ODE问题中的表现,发现引导提示和微调能有效提升求解准确性。

Journal ref NeurIPS 2025 Math-AI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12770 2026-04-15 quant-ph cs.AI physics.atom-ph

Solving tricky quantum optics problems with assistance from (artificial) intelligence

用人工智能(人工智能)解决量子光学难题

Manas Pandey, Bharath Hebbe Madhusudhana, Saikat Ghosh, Dmitry Budker

机构 * Indian Institute of Technology, Kanpur(印度理工学院,坎pur) MPA-Quantum, Los Alamos National Laboratory(MPA-量子,洛斯阿拉莫斯国家实验室) Johannes Gutenberg-Universität Mainz(美因茨约翰尼斯·古滕贝格大学) Helmholtz Institute Mainz(马因茨海德堡研究所) GSI Helmholtzzentrum für Schwerionenforschung GmbH(重离子研究海德堡中心 GmbH) Department of Physics, University of California, Berkeley(加州大学伯克利分校物理系)

AI总结 本文探讨人工智能作为科学合作者的能力,通过解决量子光学中的三个复杂问题,展示AI在推理和提供专家级指导方面的作用,推动科学研究方法的变革。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11003 2026-04-14 cs.AI cs.LG

Sanity Checks for Agentic Data Science

代理数据科学的合理性检查

Zachary T. Rewolinski, Austin V. Zane, Hao Huang, Chandan Singh, Chenglong Wang, Jianfeng Gao, Bin Yu

机构 * Dept. of Statistics UC Berkeley(加州大学伯克利分校统计系) Dept. of EECS UC Berkeley(加州大学伯克利分校电子工程与计算机科学系) Microsoft Research(微软研究院) Center for Computational Biology UC Berkeley(加州大学伯克利分校计算生物学中心)

AI总结 本文提出基于PCS框架的轻量级合理性检查,用于验证代理数据科学输出的可靠性,通过扰动检测信号与噪声区分,揭示不支持的结论,并在合成数据和真实数据集上验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10980 2026-04-14 cs.LG

Tracking High-order Evolutions via Cascading Low-rank Fitting

通过级联低秩拟合追踪高阶演化

Zhao Song

机构 * Simons Institute for Theory of Computing, UC Berkeley(加州大学伯克利分校西蒙斯理论计算研究所)

AI总结 本文提出级联低秩拟合方法,用于高效建模高阶动力学,通过共享基础函数和累积低秩组件,减少参数规模,理论分析证明高阶导数秩的非递增性及排列灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10875 2026-04-14 cs.CY cs.AI cs.HC cs.SE

Compliant But Unsatisfactory: The Gap Between Auditing Standards and Practices for Probabilistic Genotyping Software

合规却令人不满:概率分型软件审计标准与实践之间的差距

Angela Jin, Alexander Asemota, Dan E. Krane, Nathaniel D. Adams, Rediet Abebe

机构 * University of California, Berkeley(加州大学伯克利分校) Wright State University(莱特州立大学) Forensic Bioinformatic Services, Inc.(法医生物信息学服务公司) ELLIS Institute(ELLIS研究所) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所)

AI总结 本文通过案例研究探讨了审计标准设计对其实效性的影响,发现现有标准在实践中存在诸多不足,如模糊语言和未定义术语导致审计效果不佳。

Comments 20 pages, 2 figures, published at ACM CHI, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24503 2026-04-14 cs.LG cs.AI

Can Small Training Runs Reliably Guide Data Curation? Rethinking Proxy-Model Practice

小规模训练能否可靠地指导数据整理?重新审视代理模型实践

Jiachen T. Wang, Tong Wu, Kaifeng Lyu, James Zou, Dawn Song, Ruoxi Jia, Prateek Mittal

机构 * Princeton University(普林斯顿大学) Tsinghua University(清华大学) UC Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) Virginia Tech(弗吉尼亚理工大学)

AI总结 本文探讨了小规模代理模型训练在数据整理中的可靠性问题,指出固定配置协议与全规模模型开发流程的差异,并提出通过降低学习率提升小规模实验的可靠性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14884 2026-04-14 cs.LG cs.AI

Learning When Not to Learn: Risk-Sensitive Abstention in Bandits with Unbounded Rewards

学习何时不学习:具有无界奖励的老虎机中风险敏感的退避策略

Sarah Liaw, Benjamin Plaut

机构 * Harvard University(哈佛大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出一种风险敏感的退避算法,在无导师的情况下处理无界奖励的老虎机问题,通过确定性区域减少不可逆损害,理论证明了谨慎探索在高风险环境中的有效性。

Comments 19 pages, 3 figures; accepted to AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03306 2026-04-14 cs.IR cs.AI cs.CL

Reliable Evaluation Protocol for Low-Precision Retrieval

低精度检索的可靠评估协议

Kisu Yang, Yoonna Jang, Hwanseok Jang, Kenneth Choi, Isabelle Augenstein, Heuiseok Lim

机构 * VAIV Company(VAIV公司) University of Copenhagen(哥本哈根大学) Korea University(高丽大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出一种更稳健的检索评估协议,通过高精度评分和考虑 ties 的检索指标减少低精度检索中的评分波动,提高评估可靠性。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10058 2026-04-14 cs.RO cs.CG

A Ray Intersection Algorithm for Fast Growth Distance Computation Between Convex Sets

用于凸集之间快速生长距离计算的射线相交算法

Akshay Thirugnanam, Koushil Sreenath

机构 * UC Berkeley(加州大学伯克利分校)

AI总结 本文提出一种高效算法,通过迭代构造Minkowski差集的内外多面体近似,计算凸集之间的生长距离,该算法在运动规划和刚体模拟中具有广泛应用。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26202 2026-04-14 cs.CL cs.AI

What's In My Human Feedback? Learning Interpretable Descriptions of Preference Data

我的人类反馈中有什么?通过稀疏自编码器学习可解释的偏好数据描述

Rajiv Movva, Smitha Milli, Sewon Min, Emma Pierson

机构 * UC Berkeley(加州大学伯克利分校) FAIR at Meta(Meta AI研究院)

AI总结 本文提出WIMHF方法,通过稀疏自编码器解释人类反馈数据,揭示偏好数据中的人类可解释特征,发现不同数据集中的偏好差异及潜在不安全偏好,为数据筛选和个性化调整提供支持。

Comments ICLR 2026 (oral). v2 adds SAE ablations and robustness checks. Code: https://github.com/rmovva/wimhf; Demo: https://rajivmovva.com/demo-wimhf/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20868 2026-04-14 cs.LG cs.AI cs.CL

StyleBench: Evaluating thinking styles in Large Language Models

StyleBench: 评估大型语言模型中的思维风格

Junyu Guo, Shangding Gu, Ming Jin, Costas Spanos, Javad Lavaei

机构 * University of California, Berkeley(加州大学伯克利分校) Virginia Tech(弗吉尼亚理工大学)

AI总结 本文通过StyleBench评估不同推理风格在大型语言模型中的表现,发现结构复杂度在特定任务和模型容量下提升准确性,同时探讨了推理策略选择的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11019 2026-04-14 cs.LG

Relative Entropy Pathwise Policy Optimization

相对熵路径策略优化

Claas Voelcker, Axel Brunnbauer, Marcel Hussing, Michal Nauman, Pieter Abbeel, Eric Eaton, Radu Grosu, Amir-massoud Farahmand, Igor Gilitschenski

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) TU Wien(维也纳工业大学) University of Pennsylvania(宾夕法尼亚大学) University of Warsaw(华沙大学) UC Berkeley(加州大学伯克利分校) Polytechnique Montréal(蒙特利尔综合理工学院) Mila – Quebec AI Institute(Mila – 魁北克人工智能研究所)

AI总结 本文提出REPPO算法,通过路径策略梯度结合在线学习,提升训练稳定性与效率,展现优越的样本效率和内存表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07725 2026-04-13 cs.AI cs.CL

Squeeze Evolve: Unified Multi-Model Orchestration for Verifier-Free Evolution

Squeeze Evolve:无验证者演化的统一多模型协调

Monishwaran Maheswaran, Leon Lakhani, Zhongzhu Zhou, Shijia Yang, Junxiong Wang, Coleman Hooper, Yuezhou Hu, Rishabh Tiwari, Jue Wang, Harman Singh, Qingyang Wu, Yuqing Jian, Ce Zhang, Kurt Keutzer, Tri Dao, Xiaoxia Wu, Ben Athiwaratkun, James Zou, Chenfeng Xu

机构 * UC Berkeley(加州大学伯克利分校) UT Austin(德克萨斯大学奥斯汀分校) Stanford University(斯坦福大学) Princeton University(普林斯顿大学) Together AI

AI总结 本文提出Squeeze Evolve框架,通过动态分配模型能力提升无验证者演化的多样性与效率,实验证明其在多个基准测试中显著降低成本并提升性能。

Comments 40 Pages, Project Page: https://squeeze-evolve.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08719 2026-04-13 cs.CV cs.AI cs.RO

LMGenDrive: Bridging Multimodal Understanding and Generative World Modeling for End-to-End Driving

LMGenDrive: 联合多模态理解与生成世界建模以实现端到端驾驶

Hao Shao, Letian Wang, Yang Zhou, Yuxuan Hu, Zhuofan Zong, Steven L. Waslander, Wei Zhan, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多媒体实验室) University of Toronto(多伦多大学) UC Berkeley(加州大学伯克利分校)

AI总结 本文提出LMGenDrive框架,结合LLM多模态理解与生成世界模型,提升自动驾驶的闭环性能,通过视频预测和控制信号生成,增强时空场景建模和指令遵循能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08576 2026-04-13 cs.NI cs.AI cs.LG

GAN-Enhanced Deep Reinforcement Learning for Semantic-Aware Resource Allocation in 6G Network Slicing

基于GAN的深度强化学习用于6G网络切片中的语义感知资源分配

Daniel Benniah John

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出GAN-DDPG框架,结合条件GAN生成交通数据、连续动作DDPG和语义感知奖励优化,提升6G网络切片中URLLC、eMBB和mMTC的频谱效率。

Comments 15 pages, 8 figures. Under review. Simulation-based evaluation for 6G network slicing

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10603 2026-04-13 cs.LG

dnaHNet: A Scalable and Hierarchical Foundation Model for Genomic Sequence Learning

dnaHNet:一种可扩展且分层的基因组序列学习基础模型

Arnav Shah, Junzhe Li, Parsa Idehpour, Adibvafa Fallahpour, Brandon Wang, Sukjun Hwang, Bo Wang, Patrick D. Hsu, Hani Goodarzi, Albert Gu

机构 * University of Toronto(多伦多大学) University of California, San Francisco(加州大学旧金山分校) University of California, Berkeley(加州大学伯克利分校) University of Pennsylvania(宾夕法尼亚大学) Vector Institute(向量研究所) University Health Network(大学健康网络) Arc Institute(Arc研究所) Carnegie Mellon University(卡内基梅隆大学)

AI总结 dnaHNet提出一种无需分词的自回归模型,通过可微的动态分块机制压缩基因组序列,实现高效且可扩展的基因组学习,优于现有模型并在零样本任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24250 2026-04-13 cs.AI cs.HC cs.LG

Interactive Program Synthesis for Modeling Collaborative Physical Activities from Narrated Demonstrations

基于叙述演示的协作物理活动建模交互式程序合成

Edward Kim, Daniel He, Jorge Chao, Wiktor Rajca, Mohammed Amin, Nishant Malpani, Ruta Desai, Antti Oulasvirta, Bjoern Hartmann, Sanjit Seshia

机构 * University of California, Berkeley(加州大学伯克利分校) Meta Aalto University(阿尔托大学)

AI总结 本文提出通过交互式程序合成解决协作物理活动建模问题,利用叙述演示统一教学、检查和纠正系统逻辑,实验表明用户能有效修正程序以匹配意图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08532 2026-04-10 cs.CV

Self-Improving 4D Perception via Self-Distillation

通过自蒸馏实现自我改进的4D感知

Nan Huang, Pengcheng Yu, Weijia Zeng, James M. Rehg, Angjoo Kanazawa, Haiwen Feng, Qianqian Wang

机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) Impossible Research Harvard(哈佛大学) MPI for Intelligent Systems(马克斯·普朗克智能系统研究所) UC Berkeley(加州大学伯克利分校) UBC(不列颠哥伦比亚大学)

AI总结 本文提出SelfEvo框架,通过自蒸馏方案提升多视角重建模型性能,无需外部标注,在动态场景中实现显著改进,视频深度估计提升36.5%,相机估计提升20.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20179 2026-04-10 q-bio.NC cs.AI cs.HC

Human-computer interactions predict mental health

人机交互预测心理健康

Veith Weilnhammer, Jefferson Ortega, David Whitney

机构 * Helen Wills Neuroscience Institute, University of California Berkeley, USA(加州大学伯克利分校海伦·威尔斯神经科学研究所) Max Planck UCL Centre for Computational Psychiatry and Ageing Research, London, UK(马克斯·普朗克伦敦大学学院计算精神病学与衰老研究中心) Department of Psychology, University of California Berkeley, USA(加州大学伯克利分校心理学系) Vision Science Group, University of California Berkeley, USA(加州大学伯克利分校视觉科学组)

AI总结 研究通过 MAILA 框架利用日常人机交互数据预测心理健康状态,实现高精度的数字表型分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07797 2026-04-10 cs.RO

Characterizing the Resilience and Sensitivity of Polyurethane Vision-Based Tactile Sensors

表征聚氨酯视觉基于触觉传感器的韧性和敏感性

Benjamin Davis, Hannah Stuart

机构 * University of California Berkeley(加州大学伯克利分校)

AI总结 本文研究了聚氨酯与硅胶在触觉传感器中的韧性与敏感性差异,提出通过可重复的测试协议评估两种聚氨酯凝胶配方,发现聚氨酯在高负载应用中更耐用,尽管灵敏度有所下降,但有效力范围更大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06975 2026-04-10 cs.CR cs.AI cs.CL

Auditing Black-Box LLM APIs with a Rank-Based Uniformity Test

对黑盒LLM API进行基于排名的均匀性测试

Xiaoyuan Zhu, Yaowen Ye, Tianyi Qiu, Hanlin Zhu, Sijun Tan, Ajraf Mannan, Jonathan Michala, Raluca Ada Popa, Willie Neiswanger

机构 * University of Southern California(南加州大学) University of California, Berkeley(加州大学伯克利分校) Peking University(北京大学)

AI总结 本文提出一种基于排名的均匀性测试方法,用于验证黑盒LLM与本地部署的模型行为一致性,有效检测API提供者可能的模型替换或篡改行为,具有高准确性和低查询成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06664 2026-04-09 cs.DC cs.LG

Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start

Foundry:基于模板的CUDA图上下文材料化用于快速LLM服务冷启动

Xueshen Liu, Yongji Wu, Yuncheng Yao, Danyang Zhuo, Ion Stoica, Z. Morley Mao

机构 * University of Michigan(密歇根大学) UC Berkeley(加州大学伯克利分校) Duke(杜克大学)

AI总结 Foundry通过模板化CUDA图上下文材料化,减少LLM服务冷启动延迟,提升启动速度并保持吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06621 2026-04-09 cs.GL cs.LG stat.ML

The Theorems of Dr. David Blackwell and Their Contributions to Artificial Intelligence

大卫·布莱克韦尔定理及其对人工智能的贡献

Napoleon Paxton

机构 * School of Information, University of California, Berkeley(加州大学伯克利分校信息学院)

AI总结 本文综述了布莱克韦尔的三个重要定理及其对现代人工智能和机器学习的影响,包括马尔可夫链蒙特卡罗推断、自主机器人导航、生成模型训练等领域的应用。

Comments Survey article, 19 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06566 2026-04-09 cs.DB cs.AI

AI-Driven Research for Databases

基于人工智能的数据库研究

Audrey Cheng, Harald Ng, Aaron Kabcenell, Peter Bailis, Matei Zaharia, Lin Ma, Xiao Shi, Ion Stoica

机构 * UC Berkeley(加州大学伯克利分校) KTH Royal Institute of Technology(瑞典皇家理工学院) Meta Workday University of Michigan(密歇根大学) Maven AGI

AI总结 本文提出利用大语言模型自动化发现数据库性能优化方案,通过共进化设计评估器与解决方案,展示了在缓冲管理、查询重写和索引选择中的有效性,实现了优于现有方法的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06542 2026-04-09 cs.CL

Does a Global Perspective Help Prune Sparse MoEs Elegantly?

从全局视角帮助优雅地剪枝稀疏MoEs吗?

Zeliang Zhang, Nikhil Ghosh, Jiani Liu, Bin Yu, Xiaodong Liu

机构 * University of Rochester(罗切斯特大学) Flatiron Institute(熨斗研究所) University of California, Berkeley(加州大学伯克利分校) Microsoft Research(微软研究院)

AI总结 本文提出GRAPE方法,通过动态分配剪枝预算提升稀疏MoEs的效率,实验表明其在多个模型上均取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06366 2026-04-09 cs.LG stat.ML

Stochastic Gradient Descent in the Saddle-to-Saddle Regime of Deep Linear Networks

深度线性网络中鞍点到鞍点区域的随机梯度下降

Guillaume Corlouer, Avi Semler, Alexander Strang, Alexander Gietelink Oldenziel

机构 * Moirai University of Oxford(牛津大学) University of California, Berkeley(加州大学伯克利分校) Iliad

AI总结 研究深度线性网络中随机梯度下降在鞍点到鞍点区域的动力学,推导出各模式下的随机微分方程分解,并分析SGD噪声对特征学习的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19225 2026-04-09 cs.DC cs.LG

RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs

RLBoost: 为在大语言模型上高效强化学习利用可中断资源

Yongji Wu, Xueshen Liu, Haizhong Zheng, Juncheng Gu, Beidi Chen, Z. Morley Mao, Arvind Krishnamurthy, Ion Stoica

机构 * UC Berkeley(加州大学伯克利分校) University of Michigan(密歇根大学) Google(谷歌) CMU(卡内基梅隆大学) University of Washington(华盛顿大学)

AI总结 RLBoost通过高效利用可中断GPU资源提升大语言模型强化学习的效率和成本效益,采用混合架构和三种关键技术实现状态less和 embarrassingly parallel的rollout阶段与可中断资源的匹配。

详情

展开后加载摘要…

URL PDF HTML 收藏