Mean Flow Policy Optimization
平均流策略优化
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出使用平均流模型作为策略表示,通过最大熵强化学习框架进行软策略迭代,以提升在线强化学习中训练和推理效率,实验表明性能与扩散模型基线相当或更优且时间显著减少。
Comments ICML 2026
高校专区
平均流策略优化
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出使用平均流模型作为策略表示,通过最大熵强化学习框架进行软策略迭代,以提升在线强化学习中训练和推理效率,实验表明性能与扩散模型基线相当或更优且时间显著减少。
Comments ICML 2026
AffordGen: 通过可供性对应生成多样化演示以实现通用物体操作
机构 * Shanghai Qi Zhi Institute(上海启智研究院) ; Tsinghua University(清华大学) ; Fudan University(复旦大学) ; UC Berkeley(伯克利大学)
AI总结 提出AffordGen框架,利用3D生成模型和视觉基础模型在大规模3D网格上的语义对应生成多样化操作轨迹,训练鲁棒的闭环视觉运动策略,实现零样本泛化到未见物体。
CalM:一种用于钙成像数据中群体动力学的自监督基础模型
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出自监督基础模型CalM,通过双轴自回归Transformer和高效分词器,在钙成像数据上预训练后,可迁移至神经群体动力学预测和行为解码等下游任务,并取得竞争性或更优性能。
Comments ICML accepted version
AI如何失败:用于演示自动毒性模型中的方言偏见的交互式教学工具
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 本文通过定量基准测试和交互式教学工具,揭示了自动毒性模型对非裔美国人英语文本的系统性偏见,并强调人为设定的敏感度阈值才是歧视操作化的关键。
Comments 9 pages, 5 figures, 4 tables, 14 references. Preliminary abstract presented at the International Conference on Envisioning the Himalayan Future: Pathways to Sustainability and Development (PUiCON 2026) p. 105; abstract available online at: https://pufoe.edu.np/wp-content/uploads/2026/05/PUiCON_2026_Book_of-_Abstracts.pdf
基于Voronoi剖分的几何感知概率电路
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 针对概率电路因数据无关混合权重而无法捕捉数据流形局部几何结构的问题,提出通过Voronoi剖分将几何结构直接融入求和节点,并开发近似推理框架和精确推理条件,最后引入可微松弛实现梯度学习,在密度估计任务上验证了有效性。
Flowers: 神经PDE求解器的曲速引擎
机构 * ETH Zurich(苏黎世联邦理工学院) ; University of Helsinki(赫尔辛基大学) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 提出Flowers架构,通过多头扭曲场实现线性代价的自适应全局交互,在2D/3D时变PDE基准上超越傅里叶、卷积和注意力基线。
HALO:通过异质智能体李雅普诺夫策略优化学习人机协作
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
AI总结 针对人机协作中人类行为多样性和环境变化导致的泛化与鲁棒性问题,提出异质智能体李雅普诺夫策略优化(HALO)框架,通过李雅普诺夫收缩稳定去中心化多智能体强化学习,并利用最优二次投影修正梯度,实现理性差距的单调收缩,提升协作性能。
Comments https://HaoZhang-THU.github.io/HALO/
一个接一个的偏差:语言奖励模型中的机械奖励塑造与持续偏差
机构 * Stanford University(斯坦福大学) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 本文通过系统测量五个高质量奖励模型中的偏差,发现长度、谄媚、过度自信等持续问题,并提出一种简单的后处理干预方法(机械奖励塑造)来减轻低复杂度偏差。
Comments ICML 2026 Camera-ready
混合TD3:混合动作空间中的过估计偏差分析与稳定策略优化
机构 * Department of Computer Science, University of California, Berkeley(1. 加州大学伯克利分校计算机科学系)
AI总结 针对离散-连续混合动作空间中的强化学习挑战,提出Hybrid TD3算法,通过理论分析过估计偏差并引入加权裁剪Q学习目标,实现稳定策略优化。
通过Logits凸性稳定策略优化
机构 * National University of Singapore(新加坡国立大学) ; University of Science and Technology of China(中国科学技术大学) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 针对强化学习训练不稳定的问题,从梯度角度分析监督微调与强化学习的稳定性差距,提出Logits凸优化(LCO)框架,通过模拟logits级凸性来稳定策略优化,实验表明该方法能提升训练稳定性并在多个基准上优于传统方法。
立场:超越敏感属性,机器学习公平性应通过社会决定因素量化结构性不公正
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Cambridge(剑桥大学) ; University of Washington(华盛顿大学) ; University of Michigan(密歇根大学) ; University of Toronto(多伦多大学)
AI总结 本文主张算法公平性研究应超越敏感属性,通过社会决定因素量化结构性不公正,并通过理论模型和实证研究证明仅关注敏感属性的缓解策略可能引入新的结构性不公正。
Comments Accepted to ICML 2026 Position Paper Track
LERD: 用于神经退行性疾病分类的潜在事件-关系动力学
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学) ; University of Washington(华盛顿大学) ; University of California, San Diego(加州大学圣地亚哥分校) ; University of California, Los Angeles(加州大学洛杉矶分校)
AI总结 提出LERD,一种端到端贝叶斯潜在事件-关系动力系统,直接从多通道脑电图推断潜在神经事件及其关系结构,无需事件或交互标注,在阿尔茨海默病分类中优于基线方法并提供生理对齐的动力学摘要。
知道不等于理解:用认知与行为洞察重新奠定生成式主动性
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Toronto(多伦多大学) ; University of Waterloo(滑铁卢大学)
AI总结 针对用户无法明确表达需求时的认知不完整问题,提出生成式主动性需要基于认知和行为双重约束来设计负责任的主动代理。
Comments 43 rd International Conference on Machine Learning (ICML 2026)
大多数层相似时的逆深度缩放
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 通过分析大型语言模型和玩具残差网络,发现损失与深度成反比,归因于功能相似的层通过集成平均而非组合学习或平滑动力学离散化来减少误差,表明需要架构创新以鼓励深度组合使用。
Comments Camera-ready version, ICML 2026
Event2Vec: 通过向量空间表示直接处理神经形态事件
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出Event2Vec表示法,使Transformer能直接处理稀疏异步事件数据,在多个基准上实现高精度、低延迟和高吞吐量。
Comments Accepted at ICML 2026
从评估到设计:利用势能面平滑度指标指导机器学习原子间势架构
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
AI总结 提出键平滑度表征测试(BSCT)作为高效评估机器学习原子间势(MLIP)势能面平滑度的指标,并与分子动力学稳定性强相关,同时指导模型设计以减少伪影。
Comments Accepted at the International Conference on Machine Learning (ICML) 2026
通过身份桥打破自回归语言模型中的逆转诅咒
机构 * UC Berkeley(加州大学伯克利分校)
AI总结 提出一种名为“身份桥”的简单数据正则化方法(形式为“A→A”),通过理论分析和实验证明该方法能有效缓解自回归语言模型中的逆转诅咒,使模型从事实记忆转向规则学习。
GUDA: 基于反事实的扩散模型分组训练数据归因方法
机构 * University of Tokyo(东京大学) ; Toyota Central Research Laboratory(丰田中央研究所) ; University of California, Berkeley(加州大学伯克利分校) ; Massachusetts Institute of Technology(麻省理工学院) ; National Institute of Advanced Industrial Science and Technology(国家工业科学与技术研究院)
AI总结 提出GUDA方法,利用机器遗忘近似反事实模型,通过似然评分规则(ELBO)量化组别影响,实现高效的分组训练数据归因。
Comments Accepted at ICML 2026. Code is available at https://github.com/sony/guda
SurrogateSHAP:文本到图像(T2I)模型的无训练贡献者归因
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 针对文本到图像扩散模型中数据贡献者公平估值的高计算成本问题,提出基于预训练模型推理的无重训练框架SurrogateSHAP,利用梯度提升树近似效用函数并解析计算Shapley值,在多个任务上以更低开销超越现有方法。
Softplus注意力与重加权提升大语言模型的长度外推能力
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出一种两阶段注意力机制,用Softplus和l1归一化替代Softmax,并引入基于不变熵的动态缩放因子和重加权机制,以提升数值稳定性、缓解注意力下沉现象,并显著改善长度外推性能。
Comments Accepted by ICML 2026
PFT: 机器学习原子间势的声子微调
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出声子微调(PFT)方法,通过监督二阶力常数来优化机器学习原子间势(MLIP)的曲率,显著提升声子热力学性质预测精度。
Comments 17 pages, 11 figures, ICML 2026
显式二阶极小极大优化:实用算法与复杂度分析
机构 * Department of Electrical Engineering and Computer Sciences(电气工程与计算机科学系) ; Department of Statistics(统计学系) ; University of California, Berkeley(加州大学伯克利分校) ; Department of Industrial Engineering and Operations Research(工业工程与运作研究系) ; Columbia University(哥伦比亚大学) ; Univ. Grenoble Alpes, CNRS, Inria, Grenoble INP, LIG(格勒诺布尔阿尔卑斯大学、CNRS、Inria、格勒诺布尔INP、LIG)
AI总结 针对凸-凹无约束极小极大优化问题,提出并分析了几种不精确正则化牛顿型方法,证明其迭代在界集内且平均迭代在O(ε^{-2/3})次内收敛到ε-鞍点,并通过Schur分解和线性系统求解器高效求解子问题,在合成基准和AUC最大化实际应用中优于一阶方法。
Comments Accepted by TMLR; Adding funding information; 35 pages
保护自主AI系统——一种多层安全框架
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 针对自主AI系统的独特安全挑战,本文采用设计科学研究方法,提出了一种生命周期感知的安全框架MAAIS,并引入自主AI的CIAA概念,通过多层防御机制确保AI生命周期的机密性、完整性、可用性和问责性,最后利用MITRE ATLAS进行验证。
Comments 6 pages, 2 figures, 1 table
Journal ref 2025 IEEE 5th International Conference on Robotics, Automation, and Artificial Intelligence (RAAI)
VocSim:单源音频中零样本内容身份的无训练基准
机构 * University of California, Berkeley(加州大学伯克利分校) ; ETH Zurich(苏黎世联邦理工学院)
AI总结 提出VocSim,一个无需训练的无标签基准,通过冻结嵌入的几何对齐评估通用音频表示在零样本内容身份识别中的性能,并在多领域音频上取得强结果,同时揭示跨语言泛化差距。
Comments Accepted at ICML 2026. Code: https://github.com/vocsim/benchmark
DIPOLE:融合视觉与几何实现鲁棒的视觉运动泛化
机构 * University of California, Berkeley(加州大学伯克利分校) ; Nanyang Technological University(南洋理工大学)
AI总结 提出DIPOLE,通过训练时模态丢弃和轻量交叉注意力融合视觉与几何信息,实现跨光照、纹理、视角等变化的鲁棒策略泛化,在18个模拟和4个真实任务中平均性能提升39.1%。
谁在评估人工智能的社会影响?第一方和第三方评估的覆盖范围与差距分析
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 通过分析186份第一方发布报告和248份第三方评估来源,结合开发者访谈,揭示了第一方报告稀疏且流于表面,而第三方评估更广泛深入,但数据溯源、内容审核劳动等关键领域存在披露缺口,呼吁政策强制开发者透明化并加强独立评估生态。
Comments Accepted at the Forty-Third International Conference on Machine Learning (ICML), 2026, in Seoul, Korea
DuetServe: 通过自适应GPU多路复用协调LLM服务的预填充与解码
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学) ; University of Toronto(多伦多大学) ; University of Washington(华盛顿大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 针对LLM服务中预填充与解码阶段的干扰问题,提出DuetServe框架,通过自适应SM级GPU空间多路复用实现单GPU内的阶段隔离,在保证低延迟的同时提升吞吐量。
大型推理模型是否可中断?
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 研究大型推理模型在中断和动态上下文两种现实动态场景下的鲁棒性,发现静态评估高估了鲁棒性,并揭示了推理泄漏、恐慌和自我怀疑等新故障模式。
Comments ICML 2026; Project Page: http://dynamic-lm.github.io
视觉关系的多模态函数向量
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 通过因果中介分析提取多模态函数向量,操纵注意力头以改善视觉关系推理,并实现零样本和微调性能提升。
AutoEval 的正确做法:使用合成数据进行模型评估
机构 * Department of Electrical Engineering and Computer Sciences, University of California, Berkeley, USA(电子工程与计算机科学系,加州大学伯克利分校) ; Department of Systems Immunology, Weizmann Institute of Science, Rehovot, Israel(系统免疫学系,魏茨曼科学研究所) ; Inria, Ecole Normale Supérieure, Paris, France(法国国家信息与自动化技术研究所,巴黎高等师范学院)
AI总结 本文提出高效且统计上无偏的算法,利用AI标记的合成数据减少模型评估所需的人工标注量,在GPT-4实验中有效样本量提升高达50%。
Comments camera-ready paper version