arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of California, Berkeley(加州大学伯克利分校)

2026-07-07 至 2026-07-07 共收录 21
2607.05369 2026-07-07 cs.RO cs.AI cs.CL cs.LG 新提交

GaP: A Graph-as-Policy Multi-Agent Self-Learning Harness For Variational Automation Tasks

GaP:面向变分自动化任务的图即策略多智能体自学习框架

Kaiyuan Chen, Shuangyu Xie, Letian Fu, Justin Yu, William Pacini, Sandeep Bajamahal, Hudson Kim, Jaimyn Drake, Daehwa Kim, Haoru Xue, Jonathan Francis, Christian Juette, Peter Schaldenbrand, Muhammet Yunus Seker, Ruwan Wickramarachchi, Uksang Yoo, Guanzhi Wang, Adithyavairavan Murali, Balakumar Sundaralingam, S. Shankar Sastry, Spencer Huang, Yuke Zhu, Linxi "Jim" Fan, Ken Goldberg

机构 * University of California, Berkeley(加利福尼亚大学伯克利分校) NVIDIA(英伟达) Carnegie Mellon University(卡内基梅隆大学) Bosch(博世)

AI总结 针对变分自动化任务无模型策略可靠性不足问题,提出图即策略多智能体编码框架GaP,通过生成计算图并行迭代优化,在虚实8项基准上表现远超基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04686 2026-07-07 cs.CL cs.AI cs.SE 新提交

ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents

ToolFailBench:诊断大语言模型智能体中的工具使用失败

Harsh Soni

机构 * UC Berkeley(加州大学伯克利分校)

AI总结 介绍ToolFailBench诊断基准,用于衡量金融、医学等领域1000个任务中的工具使用失败情况。通过规则分类器和大语言模型裁判标注失败类型,发现模型工具使用存在差异,强调评估应考量多方面。

Comments 18 pages, 3 figures. Published at the Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD) and the Workshop on Failure Modes of Agentic AI (FAGEN) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04610 2026-07-07 cs.RO 新提交

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications

RoboVista:评估用于各种机器人应用的视觉语言模型

Shuangyu Xie, Kaiyuan Chen, Ziyang Chen, Simeon Adebola, Yixuan Huang, Zehan Ma, Tianshuang Qiu, Wentao Yuan, Dhruv Shah, Pannag R. Sanketi, Ken Goldberg

机构 * University of California, Berkeley(加州大学伯克利分校) Princeton University(普林斯顿大学) Google DeepMind(谷歌DeepMind)

AI总结 研究针对机器人多样应用,提出模块化评估框架Robot Question Answering及基准RoboVista,其源于真实机器人系统等,含多任务类型VQA实例,实验表明现有视觉语言模型有差距,且与现实任务执行相关。

Comments Accepted to RSS 2026. Project website: https://berkeleyautomation.github.io/robovista/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03903 2026-07-07 cs.LG 新提交

CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning

CDCP:用于多任务离线安全强化学习的带上下文提示的条件扩散模型

Jiayi Guan, Tianle Zhang, Li Shen, Ruiqi Zhang, Ao Zhou, Lusong Li, Guai Chen, Mengjie Li, Alois Knoll, Xiaodong He, Changjun Jiang

机构 * Tongji University(同济大学) JD Explore Academy(京东探索研究院) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络科学与技术学院) Berkeley AI Research Lab, University of California, Berkeley(加州大学伯克利分校伯克利人工智能研究实验室) Technical University of Munich(慕尼黑工业大学)

AI总结 针对多任务离线安全强化学习面临的挑战,提出CDCP模型。通过重新审视需求建立目标,用扩散模型转化问题,设计策略并引入新方法,提升性能与安全性,提供灵活成本约束解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03377 2026-07-07 cs.CL cs.AI 新提交

Spectral Signatures of Large Language Models

大语言模型的频谱特征

Zhuoying Zhang, Ishan V. Prasad, Yuanzhe Hu, Zihang Liu, Hengrui Luo, Pu Ren, Yaoqing Yang

机构 * Rice University(莱斯大学) Dartmouth College(达特茅斯学院) Georgia Institute of Technology(佐治亚理工学院) University of California, Berkeley(加州大学伯克利分校) Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室)

AI总结 针对大规模管理和量化大语言模型的挑战,采用基于重尾自正则化理论的频谱形状指标,以权重经验谱密度形状信息为模型频谱特征,可用于模型谱系追踪等,还构建语料库进行基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03513 2026-07-07 physics.chem-ph cs.LG 新提交

AquaGen: Scaling generative models to molecular dynamics precision on thousands of atoms

AquaGen:将生成模型扩展到数千个原子的分子动力学精度

Emmanuel Bengio, Sanjeev Raja, Yui Tik Pang, Kerstin Klaeser, Cristian Gabellini, Nikhil Shenoy, Francesco Di Giovanni, Prudencio Tossou

机构 * Valence Labs(Valence实验室) UC Berkeley(加州大学伯克利分校)

AI总结 介绍AquaGen,首个全原子、显式溶剂、周期边界条件感知生成模型,以低成本从玻尔兹曼分布生成分子构型,用于后处理和预测相关属性,在绝对水合自由能预测上展示效用。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06667 2026-07-07 cs.CL 新提交

The Piggyback Hypothesis of Generalization: Explaining and Mitigating Emergent Misalignment

泛化的搭便车假说:解释和缓解涌现的错位

Jiachen Zhao, Zhengxuan Wu, Aryaman Arora, Yiyou Sun, David Bau, Weiyan Shi

机构 * Northeastern University(东北大学) Stanford University(斯坦福大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 提出搭便车假说,认为聊天模板标记导致微调行为泛化到无关领域,并设计TReFT方法通过正则化标记表示缓解涌现错位,在多个数据集上有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01908 2026-07-07 cs.LG cs.CV 版本更新

Private and Stable Test-Time Adaptation with Differential Privacy

具有差分隐私的私有且稳定的测试时自适应

Zefeng Li, Qiaoyue Tang, Mathias Lecuyer, Evan Shelhamer

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 提出将多种测试时自适应方法转化为差分隐私形式,通过逐样本梯度裁剪和高斯噪声保护测试数据隐私,在ImageNet-C上实现隐私与精度的平衡,并发现裁剪机制能提升连续自适应的准确性和稳定性。

Comments ICML 2026. Code: https://github.com/van-hammerheads/private-stable-tta

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08678 2026-07-07 cs.LG 版本更新

MLS-Bench: A Holistic and Rigorous Assessment of AI Systems on Building Better AI

MLS-Bench:对构建更好AI的AI系统的全面且严格评估

Bohan Lyu, Yucheng Yang, Siqiao Huang, Jiaru Zhang, Qixin Xu, Xinghan Li, Xinyang Han, Yicheng Zhang, Huaqing Zhang, Runhan Huang, Kaicheng Yang, Zitao Chen, Wentao Guo, Junlin Yang, Xinyue Ai, Wenhao Chai, Yadi Cao, Ziran Yang, Kun Wang, Dapeng Jiang, Huan-ang Gao, Shange Tang, Chengshuai Shi, Simon S. Du, Max Simchowitz, Jiantao Jiao, Dawn Song, Chi Jin

机构 * UC Berkeley(伯克利大学) Princeton University(普林斯顿大学) Tsinghua University(清华大学) University of Washington(华盛顿大学) Purdue University(Purdue 大学) Harvard University(哈佛大学) University of Pennsylvania(宾夕法尼亚大学) Shanghai Jiao Tong University(上海交通大学) UC San Diego(圣地亚哥大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出MLS-Bench基准,包含12个领域140个任务,评估AI系统能否发明通用且可扩展的机器学习方法,发现当前智能体在方法发明上仍远逊于人类,瓶颈在于科学洞察而非单纯搜索或计算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19048 2026-07-07 cs.CV 版本更新

Measuring 3D Spatial Geometric Consistency in Dynamic Video Generation

动态生成视频中3D空间几何一致性的测量

Weijia Dou, Wenzhao Zheng, Weiliang Chen, Yu Zheng, Jie Zhou, Jiwen Lu

机构 * Tongji University(同济大学) Tsinghua University(清华大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出SGC指标,用于评估动态生成视频中的3D空间几何一致性,通过分析多个相机姿态的分歧度来量化几何不一致问题,实验证实其能有效识别现有方法遗漏的关键故障。

Comments Accepted at ECCV 2026. Code is available at https://github.com/tj12323/SGC

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13259 2026-07-07 cs.CL cs.AI 版本更新

How Transformers Reject Wrong Answers: Rotational Dynamics of Factual Constraint Processing

Transformer 如何拒绝错误答案:事实约束处理的旋转动力学

Javier Marín

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 研究揭示了Transformer在处理事实性问题时,隐藏状态空间中正确与错误延续路径的旋转分离现象,揭示了模型在深层结构中对错误延续的非局部化偏好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08982 2026-07-07 cs.CV 版本更新

SVG-EAR: Parameter-Free Linear Compensation for Sparse Video Generation via Error-aware Routing

SVG-EAR:通过误差感知路由实现稀疏视频生成的无参数线性补偿

Xuanyi Zhou, Qiuyang Mang, Shuo Yang, Haocheng Xi, Jintao Zhang, Huanzhi Mao, Joseph E. Gonzalez, Kurt Keutzer, Ion Stoica, Alvin Cheung

机构 * UC Berkeley(加州大学伯克利分校)

AI总结 研究视频生成中扩散变换器二次注意力成本瓶颈问题,提出SVG-EAR,利用语义聚类后块内键值相似性,通过质心近似跳过块,用误差感知路由计算需精确补偿块,提升质量效率权衡并提高吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08150 2026-07-07 stat.ML cs.LG stat.ME 版本更新

CLEAR: Calibrated Learning for Epistemic and Aleatoric Risk

CLEAR:认知风险和偶然风险的校准学习

Ilia Azizi, Juraj Bodik, Jakob Heiss, Bin Yu

机构 * Department of Operations, HEC, University of Lausanne(洛桑大学运营管理系) Department of Statistics, University of California, Berkeley(加州大学伯克利分校统计系) Department of Electrical Engineering and Computer Science, University of California, Berkeley(加州大学伯克利分校电气工程与计算机科学系) BegooAI

AI总结 提出校准方法CLEAR,用两个参数结合测量噪声偶然不确定性与数据有限认知不确定性,提升回归任务预测区间条件覆盖率,与多种估计器兼容,在多数据集上效果良好。

Comments Project page: https://unco3892.github.io/clear/

Journal ref Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09530 2026-07-07 cs.LG cs.AI cs.NA math.NA 版本更新

Learning to Discover Iterative Spectral Algorithms

学习发现迭代谱算法

Zihang Liu, Oleg Balabanov, Yaoqing Yang, Michael W. Mahoney

机构 * International Computer Science Institute(国际计算机科学研究所) University of California Berkeley(加州大学伯克利分校) Dartmouth College(达特茅斯学院) Lawrence Berkeley National Laboratory(伯克利国家实验室)

AI总结 介绍用于发现大规模数值线性代数和数值优化迭代谱算法的神经网络框架AutoSpec,用粗谱信息适应输入算子,预测递归系数,应用于代表性任务有显著改进,还与经典理论有联系。

Comments Code available at: https://github.com/zihanghliu/AutoSpec

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13680 2026-07-07 cs.LG stat.ME

Hybrid Meta-learners for Estimating Heterogeneous Treatment Effects

混合元学习器用于估计异质处理效应

Zhongyuan Liang, Lars van der Laan, Ahmed Alaa

机构 * UC Berkeley(伯克利大学) UCSF(旧金山加州大学) University of Washington(华盛顿大学)

AI总结 本文提出混合学习器,通过结合直接和间接正则化策略,改进异质处理效应估计的偏差-方差权衡,实验证明其在半合成和真实数据集上均处于帕累托前沿。

Journal ref Proceedings of the 29th International Conference on Artificial Intelligence and Statistics, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01251 2026-07-07 cs.RO 版本更新

Towards Data-Driven Metrics for Social Robot Navigation Benchmarking

迈向用于社交机器人导航基准测试的数据驱动指标

Pilar Bachiller-Burgos, Ulysses Bernardet, Luis V. Calderita, Pranup Chhetri, Anthony Francis, Noriaki Hirose, Noé Pérez, Dhruv Shah, Phani T. Singamaneni, Xuesu Xiao, Luis J. Manso

机构 * Aston University(阿斯顿大学) Logical Robotics(逻辑机器人公司) University of California Berkeley(加州大学伯克利分校) TOYOTA Motor North America(丰田北美公司) Princeton University(普林斯顿大学) LAAS-CNRS(LAAS-CNRS研究所) George Mason University(乔治·梅森大学)

AI总结 致力于开发数据驱动的社交机器人导航指标以促进地面机器人基准测试和策略优化,介绍方法动机、数据集格式等,给出首个全面的学习社交机器人导航指标及相关结果。

Comments This work was presented at the 18th International Conference on Social Robotics (ICSR'2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15061 2026-07-07 cs.RO cs.CV 版本更新

Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue

Ask-to-Clarify: 通过多轮对话解决指令歧义

Xingyao Lin, Xinghao Zhu, Tianyi Lu, Guojin Zhong, Sicheng Xie, Hui Zhang, Xipeng Qiu, Zuxuan Wu, Yu-Gang Jiang

机构 * College of Computer Science and Artificial Intelligence, Fudan University, Shanghai, China(复旦大学计算机科学与人工智能学院) Shanghai Innovation Institute, Shanghai, China(上海创新研究院) Mechanical Systems Control Lab, UC Berkeley, California, USA(伯克利机械系统控制实验室)

AI总结 本文提出Ask-to-Clarify框架,通过多轮对话解决指令歧义问题,结合视觉语言模型和扩散模型,采用两阶段知识绝缘策略训练,实现多任务中更高效的协作式具身代理。

Comments Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23845 2026-07-07 cs.LG cs.AI cs.CL cs.CY 版本更新

Position: Use Sparse Autoencoders to Discover Unknowns

定位:使用稀疏自编码器发现未知因素

Kenny Peng, Rajiv Movva, Jon Kleinberg, Emma Pierson, Nikhil Garg

机构 * Cornell University(康奈尔大学) UC Berkeley(伯克利大学)

AI总结 研究围绕稀疏自编码器(SAEs)的不同观点,指出其虽在作用于已知概念时效果欠佳,但在发现未知概念上很强大,还给出了在机器学习及社会健康科学等方面的应用案例。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08928 2026-07-07 cs.LG stat.ME stat.ML

Local MDI+: Local Feature Importances for Tree-Based Models

Local MDI+: 基于树的模型的局部特征重要性

Zhongyuan Liang, Zachary T. Rewolinski, Abhineet Agarwal, Tiffany M. Tang, Bin Yu

机构 * Department of Computational Precision Health(计算精准健康系) UC Berkeley(伯克利大学) UCSF(旧金山分校) Department of Statistics(统计系) Department of Applied and Computational Mathematics and Statistics(应用与计算数学和统计系) University of Notre Dame(诺特大学) Department of Statistics and EECS(统计系和电子工程与计算机科学系)

AI总结 提出Local MDI+ (LMDI+)方法,通过扩展MDI+框架到局部特征重要性,在12个基准数据集上平均提升10%的预测性能,并展现出更高的稳定性和可解释性。

Journal ref Transactions on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19625 2026-07-07 cs.LG

Revealing Treatment Non-Adherence Bias in Clinical Machine Learning Using Large Language Models

利用大语言模型揭示临床机器学习中的治疗不依从偏差

Zhongyuan Liang, Arvind Suresh, Irene Y. Chen

机构 * UC Berkeley and UCSF(伯克利大学和旧金山加州大学)

AI总结 本文研究了治疗不依从如何通过EHR数据引入隐性偏差,影响因果推断和预测模型。通过LLM提取临床笔记,发现21.7%患者存在药物不依从,揭示了与不依从相关的关键因素及患者报告的原因,强调了在开发负责任且公平的临床机器学习系统中考虑治疗不依从的重要性。

Journal ref Proceedings of the 5th Conference on Health, Inference, and Learning, PMLR 287:430-442, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09632 2026-07-07 stat.ML cs.LG math.ST stat.ME stat.TH 版本更新

Granger Causality in Extremes

极端情况下的格兰杰因果关系

Juraj Bodik, Olivier C. Pasche

机构 * Faculty of Business and Economics, University of Lausanne(洛桑大学商学院) Department of Statistics, UC Berkeley(伯克利大学统计学系) Research Institute for Statistics and Information Science, University of Geneva(日内瓦大学统计与信息科学研究所) Department of Industrial Engineering and Operations Research, Columbia University(哥伦比亚大学工业工程与运筹学系)

AI总结 介绍极端情况下格兰杰因果关系框架,利用因果尾系数从极端事件推断因果,建立与其他因果概念等价关系,证明关键性质,提出无模型新推断方法,性能和速度优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏