arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of California, Berkeley(加州大学伯克利分校)

共收录 272
2602.15829 2026-06-09 cs.LG 版本更新

Operationalising the Superficial Alignment Hypothesis via Task Complexity

通过任务复杂度操作化浅层对齐假设

Tomás Vergara-Browne, Darshan Patil, Ivan Titov, Siva Reddy, Tiago Pimentel, Marius Mosbach

机构 * University of Maryland(马里兰大学) University of California, Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学) University of Toronto(多伦多大学) University of Edinburgh(爱丁堡大学)

AI总结 提出任务复杂度指标(达到目标性能的最短程序长度)来量化浅层对齐假设,实验表明预训练大幅降低任务复杂度,而微调可将复杂度降低数个数量级。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08235 2026-06-09 cs.CL cs.AI cs.CR 版本更新

When Benign Inputs Lead to Severe Harms: Eliciting Unsafe Unintended Behaviors of Computer-Use Agents

当良性输入导致严重危害:引发计算机使用代理的不安全意外行为

Jaylen Jones, Zhehao Zhang, Yuting Ning, Eric Fosler-Lussier, Pierre-Luc St-Charles, Yoshua Bengio, Dawn Song, Yu Su, Huan Sun

机构 * DeepMind, London, UK(深度Mind,伦敦,英国) Stanford University, Stanford, CA, USA(斯坦福大学,斯坦福,加利福尼亚州,美国) UC Berkeley, Berkeley, CA, USA(加州大学伯克利分校,伯克利,加利福尼亚州,美国)

AI总结 提出AutoElicit框架,通过迭代扰动良性指令并利用CUA执行反馈,自动引发前沿CUAs(如Claude 4.5 Haiku等)的数百种有害意外行为,并验证其跨模型可迁移性。

Comments ICML 2026, Project Homepage: https://osu-nlp-group.github.io/AutoElicit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00797 2026-06-09 stat.ML cs.LG 版本更新

Zero-Flow Encoders

零流编码器

Yakun Wang, Leyang Wang, Song Liu, Taiji Suzuki

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出了一种基于流的表示学习框架,通过零流准则验证条件独立性,从而在生成模型中提取充分信息,并在图模型和自监督学习任务中学习近似马尔可夫毯和潜在表示。

Comments Yakun Wang and Leyang Wang contributed equally to this work; As published at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23221 2026-06-09 cs.LG 版本更新

Optimal Fair Aggregation of Crowdsourced Noisy Labels using Demographic Parity Constraints

使用人口统计平价约束的众包噪声标签的最优公平聚合

Gabriel Singer, Samuel Gruffaz, Olivier Vo Van, Nicolas Vayatis, Argyris Kalogeratos

机构 * University of California, Berkeley(加州大学伯克利分校) Université de Paris(巴黎大学) CNRS(国家科学研究中心)

AI总结 针对众包标签聚合中的公平性问题,提出在ε-公平框架下分析多数投票和最优贝叶斯聚合的公平性差距,并推广多类公平后处理算法以强制执行人口统计平价约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22211 2026-06-09 cs.LG 版本更新

Latent Spherical Flow Policy for Reinforcement Learning with Combinatorial Actions

面向组合动作强化学习的潜在球形流策略

Lingkai Kong, Anagha Satish, Hezi Jiang, Akseli Kangaslahti, Andrew Ma, Wenbo Chen, Mingxiao Song, Lily Xu, Milind Tambe

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 提出LSFlow方法,通过球形流匹配在紧凑连续潜在空间中学习随机策略,并利用组合优化求解器保证动作可行性,引入平滑贝尔曼算子解决不连续值函数问题,在多个组合RL任务上平均超越基线20.6%。

Comments ICML'26 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20845 2026-06-09 cs.AI cs.MA 版本更新

MAR:Multi-Agent Reflexion Improves Reasoning Abilities in LLMs

MAR:多智能体反思提升大语言模型的推理能力

Onat Ozer, Yuchen Wang, Grace Wu, Daniel Dosti, Honghao Zhang, Vivi De La Rue

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 提出多智能体反思框架,通过多角色辩论生成多样化反思,解决单模型反思中的思维退化问题,在HotPot QA和HumanEval上分别达到47% EM和82.7%准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01930 2026-06-09 cs.LG cs.AI 版本更新

SVRG and Beyond via Posterior Correction

SVRG及其后验校正扩展

Nico Daheim, Thomas Möllenhoff, Ming Liang Ang, Mohammad Emtiyaz Khan

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 本文揭示SVRG与后验校正方法的深层联系,证明SVRG是各向同性高斯后验校正的特例,并通过灵活指数族后验自动导出牛顿型和Adam型新变体。

Comments ICML 2026 (oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00239 2026-06-09 cs.LG stat.ML 版本更新

Self-Supervised Dynamical System Representations for Physiological Time-Series

生理时间序列的自监督动力系统表示

Yenho Chen, Maxwell A. Xu, James M. Rehg, Christopher J. Rozell

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

AI总结 提出PULSE框架,利用动力系统生成模型的信息结构,通过跨重建预训练目标提取共享系统参数信息,丢弃样本特异性噪声,提升生理时间序列的表示学习效果。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01052 2026-06-09 cs.LG math.OC stat.ML 版本更新

A Robust $\widetilde{\mathcal{O}}(1/\sqrt{T})$ Rate for Unprojected TD Learning with Linear Function Approximation

线性函数逼近的无投影TD学习的鲁棒 $\widetilde{\mathcal{O}}(1/\sqrt{T})$ 收敛率

Wei-Cheng Lee, Francesco Orabona

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 本文针对线性函数逼近的时序差分学习,在无投影条件下证明了期望收敛率为 $\widetilde{\mathcal{O}}(\\|\theta^*\\|^2_2/\sqrt{T})$,仅需对学习率进行轻微的对数修正,无需额外正则条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10341 2026-06-09 cs.LG cs.CL 版本更新

Formalizing Learning from Language Feedback with Provable Guarantees

从语言反馈中学习的形式化与可证明保证

Wanqiao Xu, Allen Nie, Ruijie Zheng, Aditya Modi, Adith Swaminathan, Ching-An Cheng

机构 * University of California, Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学) University of Toronto(多伦多大学)

AI总结 本文形式化语言反馈学习问题,提出转移埃尔泽维度刻画学习难度,并开发无遗憾算法HELiX,证明其性能保证,展示丰富语言反馈可指数级加速学习。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21457 2026-06-09 cs.CV cs.AI 版本更新

ACTIVE-o3: Empowering MLLMs with Active Perception via Pure Reinforcement Learning

ACTIVE-o3:通过纯强化学习赋予多模态大语言模型主动感知能力

Muzhi Zhu, Hao Zhong, Canyu Zhao, Zongze Du, Mingyu Liu, Zheng Huang, Anzhou Li, Hao Chen, Cheng Zou, Jingdong Chen, Ming Yang, Chunhua Shen

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 提出ACTIVE-o3框架,基于GRPO强化学习,通过模块化感知-动作设计和双形式奖励,使MLLM自主学会高效准确的区域选择策略,在开放世界和领域特定任务中显著提升主动感知能力。

Comments Accepted to ICML 2026. Project page: https://aim-uofa.github.io/ACTIVE-o3

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06659 2026-06-09 cs.DB cs.CV 版本更新

Visual Template Inference for Data Extraction from Documents

文档数据提取的视觉模板推断

Yiming Lin, Mawil Hasan, Rohan Kosalge, Alvin Cheung, Aditya G. Parameswaran

机构 * UC Berkeley(加州大学伯克利分校)

AI总结 提出TWIX工具,通过推断文档的视觉模板来高效、低成本地提取结构化数据,在精度和召回率上优于现有方法,并实现大规模数据集上的显著加速和降本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16102 2026-06-09 cs.LG 版本更新

BlendServe: Optimizing Offline Inference for Auto-regressive Large Models with Resource-aware Batching

BlendServe: 利用资源感知批处理优化自回归大模型的离线推理

Yilong Zhao, Shuo Yang, Kan Zhu, Lianmin Zheng, Baris Kasikci, Yang Zhou, Jiarong Xing, Ion Stoica

机构 * University of California, Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学) University of California, Davis(加州大学戴维斯分校) Rice University(里士满大学)

AI总结 针对离线批处理中资源重叠与前缀共享的冲突,提出资源感知前缀树来最大化资源利用率,相比vLLM和SGLang吞吐量提升1.44倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2009.10277 2026-06-09 cs.CL cs.LG cs.SI 版本更新

Measuring a hate speech spectrum with faceted Rasch item response theory and perspective-aware, explainable-by-design deep learning

使用分面Rasch项目反应理论和可解释性设计的深度学习测量仇恨言论谱系

Chris J. Kennedy, Geoff Bacon, Alexander Sahn, Claudia von Vacano

机构 * Center for Precision Psychiatry, Mass General Hospital Department of Psychiatry, Harvard Medical School(精准精神病学中心,麻省总医院精神病科,哈佛医学院) D-Lab University of California, Berkeley(加州大学伯克利分校D实验室)

AI总结 提出结合监督深度学习与分面Rasch项目反应理论的方法,将仇恨言论分解为10个有序标签,通过IRT模型转化为区间测量值并调整标注者视角,在RoBERTa模型上提升准确性,实现连续谱系测量与可解释性。

Comments 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06048 2026-06-08 cs.CV 版本更新

LLM-Conditioned Synthesis of Pathological Gaits via Structured Gait-Language Representations

基于结构化步态-语言表示的LLM条件病理步态合成

Mritula Chandrasekaran, Sanket Kachole, Jarek Francik, Dimitrios Makris

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) University of Toronto(多伦多大学) MIT Media Lab(麻省理工学院媒体实验室)

AI总结 提出一种多模态LLM引导框架,通过结构化文本描述合成病理步态3D数据,利用运动标记化、病理感知语言条件、LLM语义增强和语言到步态生成,改善下游分类性能。

Comments Accepted at CVPR MOMA Workshop 2026 and selected for spotlight presentation at the workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25054 2026-06-08 cs.LG cs.AI 版本更新

Scale When Needed: Adaptive Neuron-level Mixed Precision Quantization Aware Training

按需扩展:自适应神经元级混合精度量化感知训练

Ayush K. Varshney, Konstantinos Vandikas, Šarūnas Girdzijauskas, Adam Orucu, Aneta Vulgarakis Feljan

机构 * University of California, Berkeley(加州大学伯克利分校) DeepMind(深度思维) University of Cambridge(剑桥大学)

AI总结 提出神经元级混合精度量化感知训练(NMP-QAT),通过可微代理和直通估计器让每个神经元独立学习离散精度,实现按需扩展位宽,在MLP和表格基础模型上取得更优的压缩-精度权衡。

Comments Accepted at ICML - GlobalSouthML workshop, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14194 2026-06-08 cs.CL 版本更新

GradShield: Alignment Preserving Finetuning

GradShield: 保持对齐的微调

Zhanhao Hu, Xiao Huang, Patrick Mendoza, Emad A. Alghamdi, Basel Alomair, Raluca Ada Popa, David Wagner

机构 * University of California, Berkeley(加州大学伯克利分校) HUMAIN King Abdulaziz City for Science and Technology(国王阿卜杜勒阿齐兹科学与技术城) University of Washington, Seattle(华盛顿大学(西雅图))

AI总结 提出GradShield过滤方法,通过计算微调隐式危害分数并采用自适应阈值,在微调前移除有害数据,保持LLM安全对齐,攻击成功率低于6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05220 2026-06-08 cs.LG cs.AI 版本更新

MidSteer: Optimal Affine Framework for Steering Generative Models

MidSteer:用于引导生成模型的最优仿射框架

Tatiana Gaintseva, Andrew Stepanov, Ziquan Liu, Martin Benning, Gregory Slabaugh, Jiankang Deng, Ismail Elezi

机构 * University of Basel(巴塞尔大学) University of California, Berkeley(加州大学伯克利分校) ETH Zurich(苏黎世联邦理工学院) University of Cambridge(剑桥大学) University of Washington(华盛顿大学)

AI总结 本文提出MidSteer,一种基于仿射变换的最优概念引导框架,通过最小干扰实现生成模型中的概念切换,并在视觉扩散模型和大型语言模型上验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17948 2026-06-08 cs.CR cs.AI cs.MA 版本更新

RAVEN: Retrieval-Augmented Vulnerability Exploration Network for Memory Corruption Analysis in User Code and Binary Programs

RAVEN: 用于用户代码和二进制程序中内存损坏分析的检索增强漏洞探索网络

Parteek Jamwal, Minghao Shao, Boyuan Chen, Achyuta Muthuvelan, Asini Subanya, Boubacar Ballo, Kashish Satija, Mariam Shafey, Mohamed Mahmoud, Moncif Dahaji Bouffi, Pasindu Wickramasinghe, Siyona Goel, Yaakulya Sabbani, Hakim Hacid, Mthandazo Ndhlovu, Eleanna Kafeza, Sanjay Rawat, Muhammad Shafique

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 提出RAVEN框架,结合LLM代理与检索增强生成,自动生成遵循Google Project Zero模板的漏洞分析报告,在105个样本上平均质量得分54.21%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03779 2026-06-08 cs.LG cs.AI 版本更新

CountsDiff: A Diffusion Model on the Natural Numbers for Generation and Imputation of Count-Based Data

CountsDiff: 一种用于计数数据生成和插补的自然数扩散模型

Renzo G. Soatto, Anders Hoel, Greycen Ren, Shorna Alam, Stephen Bates, Nikolaos P. Daskalakis, Caroline Uhler, Maria Skoularidou

机构 * Princeton University(普林斯顿大学) Stanford University(斯坦福大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 提出CountsDiff扩散框架,通过生存概率调度和显式损失加权简化Blackout扩散,引入连续时间训练、无分类器引导和逆动态,在自然图像和单细胞RNA-seq插补任务中匹配或超越现有方法。

Comments 39 Pages, 11 figures. To appear in the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20967 2026-06-08 stat.ML cs.LG math.ST stat.TH 版本更新

Hard labels sampled from sparse targets mislead rotation invariant algorithms

从稀疏目标采样的硬标签误导旋转不变算法

Avrajit Ghosh, Bin Yu, Manfred Warmuth, Peter Bartlett

机构 * University of California, Berkeley(加州大学伯克利分校) University of Wisconsin, Madison(威斯康星大学麦迪逊分校)

AI总结 针对稀疏目标下的二分类问题,证明旋转不变算法(如逻辑损失梯度下降)的过风险下界为Ω((d-1)/n),而通过重参数化u_i v_i的非旋转不变算法可实现O(s log d / n)的上界。

Journal ref ICML-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11333 2026-06-08 cs.AI 版本更新

LLM-Augmented Digital Twin for Policy Evaluation in Short-Video Platforms

LLM增强的数字孪生用于短视频平台策略评估

Haoting Zhang, Yunduan Lin, Jinghai He, Denglin Jiang, Zuo-Jun Shen, Zeyu Zheng

机构 * University of California, Berkeley(加州大学伯克利分校) The Chinese University of Hong Kong(香港中文大学) New York University(纽约大学) The University of Hong Kong(香港大学)

AI总结 提出一种LLM增强的四模块数字孪生架构(用户、内容、交互、平台),通过事件驱动执行层和可插拔策略组件,支持在闭环动态下对平台策略(含AI策略)进行可复现的仿真评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16073 2026-06-08 cs.RO cs.AI cs.LO cs.SY eess.SY 版本更新

ScenicRules: An Autonomous Driving Benchmark with Multi-Objective Specifications and Abstract Scenarios

ScenicRules:具有多目标规范和抽象场景的自动驾驶基准测试

Kevin Kai-Chun Chang, Ekin Beyazit, Alberto Sangiovanni-Vincentelli, Tichakorn Wongpiromsarn, Sanjit A. Seshia

机构 * University of California, Berkeley(加州大学伯克利分校) Massachusetts Institute of Technology(麻省理工学院)

AI总结 提出ScenicRules基准,通过层次化规则框架和形式化场景模型,在随机环境下评估自动驾驶系统对优先级多目标规范的满足程度。

Comments v2: Minor numerical corrections for Table V. 16 pages, 14 figures, 7 tables. Extended version of paper accepted to 2026 IEEE Intelligent Vehicles Symposium (IV 2026). ScenicRules benchmark available at https://github.com/BerkeleyLearnVerify/ScenicRules

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00225 2026-06-08 cs.LG cs.AI cs.CL 版本更新

Should You Use Your Large Language Model to Explore or Exploit?

你应该使用你的大语言模型进行探索还是利用?

Keegan Harris, Aleksandrs Slivkins

机构 * UC Berkeley(伯克利大学) Microsoft Research(微软研究院)

AI总结 研究当前大语言模型在探索-利用权衡中的决策能力,通过分离探索和利用任务评估其表现,发现推理模型在利用任务上最有潜力但成本高,非推理模型通过工具使用和上下文总结可提升中等难度任务性能,但在所有任务中均不如简单线性回归,然而LLM在具有语义的大动作空间探索中有帮助。

Comments Accepted to UAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15287 2026-06-08 cs.CV 版本更新

Consistency-Preserving Diverse Video Generation

保持一致性的多样化视频生成

Xinshuang Liu, Runfa Blark Li, Truong Nguyen

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 提出一种联合采样框架,在保持时间一致性的同时提高文本到视频生成中批次内视频的多样性,通过轻量级潜在空间模型避免视频解码和反向传播。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04123 2026-06-08 cs.CY cs.AI cs.LG cs.SE 版本更新

Measuring Agents in Production

生产环境中的智能体测量

Melissa Z. Pan, Negar Arabzadeh, Riccardo Cogo, Yuxuan Zhu, Alexander Xiong, Lakshya A Agrawal, Huanzhi Mao, Emma Shen, Sid Pallerla, Liana Patel, Shu Liu, Tianneng Shi, Xiaoyuan Liu, Jared Quincy Davis, Emmanuele Lacavalla, Alessandro Basile, Shuyi Yang, Paul Castro, Daniel Kang, Koushik Sen, Dawn Song, Joseph E. Gonzalez, Ion Stoica, Matei Zaharia, Marquita Ellis

机构 * University of California at Berkeley(加州大学伯克利分校) IBM Research(IBM研究院) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学)

AI总结 通过对86个已部署系统的调查和20个案例研究,发现生产环境中的LLM智能体主要采用简单可控的方法,可靠性是首要挑战,并依赖系统级设计和人工评估。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026) as Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14380 2026-06-08 cs.RO 版本更新

CRAFT: Coaching Reinforcement Learning Autonomously using Foundation Models for Multi-Robot Coordination Tasks

CRAFT:利用基础模型自主教练强化学习以完成多机器人协调任务

Seoyeon Choi, Kanghyun Ryu, Jonghoon Ock, Negar Mehr

机构 * Department of Mechanical Engineering, University of California Berkeley(机械工程系,加州大学伯克利分校)

AI总结 提出CRAFT框架,利用大语言模型分解任务、生成奖励函数,并通过视觉语言模型优化,实现多机器人协调学习,在四足导航和双臂操作任务中验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03635 2026-06-08 cs.AI cs.CL 版本更新

Finding the Minimal Parameter Budget for Implicit Reasoning: A Data Complexity Driven Scaling Law for Language Models

寻找隐式推理的最小参数预算:一种基于数据复杂度的语言模型缩放定律

Xinyi Wang, Shawn Tan, Shenbo Xu, Mingyu Jin, William Yang Wang, Rameswar Panda, Yikang Shen

机构 * University of California, Berkeley(加州大学伯克利分校) University of Cambridge(剑桥大学) University of Washington(华盛顿大学) University of Toronto(多伦多大学) University of Tokyo(东京大学)

AI总结 本文通过控制合成环境中的预训练实验,发现语言模型隐式推理所需的最小参数预算与图搜索熵之间存在缩放定律,并确定了每参数最多可处理约0.008比特信息的容量上限。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17693 2026-06-08 cs.DB cs.AI cs.CL 版本更新

Database Normalization via Dual-LLM Self-Refinement

通过双LLM自精炼的数据库规范化

Eunjae Jo, Nakyung Lee, Gyuyeong Kim

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 提出Miffie框架,利用双模型自精炼架构和大语言模型实现数据库自动规范化,无需人工干预且保持高准确率。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05232 2026-06-08 cs.AI 版本更新

ChemQuests: A Curated Chemistry Question-Answer Database Extracted from ChemRxiv papers

ChemQuests: 从ChemRxiv论文中提取的精选化学问答数据库

Mahmoud Amiri, Thomas Bocklitz

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

AI总结 提出ChemQuests数据集,包含从155篇ChemRxiv论文中提取的952个高质量问答对,覆盖17个化学子领域,用于化学NLP研究。

详情

展开后加载摘要…

URL PDF HTML 收藏