Self-Mined Hardness for Safety Fine-Tuning
自我挖掘的难度用于安全微调
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出通过模型自身生成结果评估提示难度,对最难的提示进行安全微调,在Llama-3模型上将攻击成功率降至1-3%,但增加了拒绝率,通过混合良性提示可平衡性能。
高校专区
自我挖掘的难度用于安全微调
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出通过模型自身生成结果评估提示难度,对最难的提示进行安全微调,在Llama-3模型上将攻击成功率降至1-3%,但增加了拒绝率,通过混合良性提示可平衡性能。
Front-to-Attractors:修改双向搜索中的Front-to-Front启发式
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出Front-to-Attractors (F2A)启发式类,通过动态维护吸引子集替代完整前沿,在保持Front-to-Front信息性的同时大幅降低计算开销,实验显示相比F2F减少最多11.2倍成对评估,平均节点扩展比F2E少4.8倍。
因果纵向先验拟合网络用于反事实结果预测
机构 * Yale University(耶鲁大学) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 提出CausalLongPFN,一种基于先验拟合的上下文预测器,通过合成因果模型预训练实现无需梯度更新的纵向反事实结果预测,在多个基准上达到与领域训练模型竞争的性能。
Comments 31 pages, 10 tables
需求模型是否应包含竞争对手价格?无知学习与算法合谋
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Washington(华盛顿大学)
AI总结 研究在竞争市场中,定价算法是否应显式建模竞争对手价格,通过对比无知与知情学习策略,发现知情策略是纳什均衡且价格收敛至竞争结果,而合谋模式不稳健。
Comments Preliminary version "Oblivious Learning, Price Exploration and Collusive Dynamics" accepted at EC 2026
立场:部署的强化学习应该是持续的
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 本文主张部署的强化学习系统应持续学习,分析了部署后非平稳性的四个来源,并展示了持续RL的优势和实现方法。
Comments Accepted to the ICML 2026 Position Paper Track. See https://icml.cc/virtual/2026/poster/67195
ReSkill:在智能体强化学习中协调技能创建与策略优化
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
AI总结 提出ReSkill框架,通过GRPO的组结构嵌入断言驱动技能创建、组内轨迹采样和自适应汤普森采样,实现技能与策略的协同进化,在多个领域超越现有方法。
基于相似性匹配的灵活在线表示学习
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出一种基于相似性匹配的在线生物合理学习算法,能够学习稀疏移位不变表示,适用于聚类、流形平铺或稀疏编码。
Comments 6 pages, 3 figures. Originally accepted to IJCNN 2023 but not presented owing to visa issues
在不遗忘的情况下回溯:面向参数高效持续学习的选择性反向精炼
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出SABER框架,通过基于提示梯度几何和损失分布相似性的任务相关性准则,在提示型参数高效持续学习中实现受控的正向反向知识迁移,无需重放。
Comments Accepted at ICML 2026
鲁棒Koopman控制屏障滤波器用于安全演员-评论家强化学习
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出鲁棒Koopman-CBF SAC框架,通过数据驱动学习Koopman预测器、构建提升空间中的仿射CBF约束并利用二次规划安全层实施,同时通过投影残差裕度处理近似误差,实现零约束违反或减少违规。
Comments 17 pages, 7 figures
潜在缓存流:无需文本的模型间通信
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
AI总结 提出潜在缓存流(LCF)方法,通过联合翻译和压缩键值缓存实现高效模型间通信,在上下文不同场景下比基于文本的通信准确率提高23%、速度提升8.5倍。
Comments 6 pages, 5 figures
通过扩散强迫实现统一且稳健的数据同化:ForcingDAS
机构 * University of Michigan(密歇根大学) ; University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学) ; Massachusetts Institute of Technology(麻省理工学院) ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 本文提出ForcingDAS,一种基于扩散强迫的统一数据同化框架,能够捕捉长时序依赖并减少误差积累,同时在推理时无需重新训练即可实现滤波到平滑的全谱应用。
VideoGPA: 通过几何先验知识蒸馏实现3D一致的视频生成
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 VideoGPA通过几何先验知识蒸馏提升视频生成的3D一致性,利用数据高效的自监督框架引导视频扩散模型,显著增强时间稳定性、几何合理性与运动一致性。
Comments 8 pages, 5 figures, ICML 2026
扩散模型何时学会生成多个物体?
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Cambridge(剑桥大学) ; University of Washington(华盛顿大学) ; University of Toronto(多伦多大学)
AI总结 研究探讨了扩散模型在多物体生成中的局限性,发现场景复杂度比概念不平衡更关键,且低数据条件下计数任务更难学习。
Comments ICML2026
通过预训练分子嵌入距离推进基于配体的虚拟筛选和分子生成
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
AI总结 本文提出预训练嵌入距离作为高效替代方案,用于虚拟筛选和分子生成,展示其在结构信息捕捉和相似性测量方面的有效性。
Comments Accepted by ICML 2026 AI4Science (https://openreview.net/forum?id=HbfrCipfNl). Code and data are available
暗箱中的反射:在反射提示优化中揭示并逃离黑箱
机构 * University of California, Berkeley(加州大学伯克利分校) ; Huazhong University of Science and Technology(华中科技大学) ; Hefei University of Technology(合肥工业大学)
AI总结 本文提出VISTA框架,通过解耦假设生成与提示重写,实现可解释的提示优化,有效解决GEPA在缺陷种子下的性能下降问题。
Comments Accepted at ACL SRW 2026
ReTabSyn:通过强化学习实现真实表格数据合成
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 ReTabSyn通过强化学习优先学习条件分布,提升小数据下表格数据合成效率,优于现有基线方法。
移动性嵌入的POI:从人类移动中学习场所身份与使用方式
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
AI总结 提出ME-POIs框架,通过对比学习将大规模人类移动数据与语言模型嵌入结合,学习场所功能,并在五个地图丰富任务上超越文本或移动性单独基线。
CodeTaste:LLM能否生成人类级别的代码重构?
机构 * University of California, Berkeley(加州大学伯克利分校) ; ETH Zurich(苏黎世联邦理工学院)
AI总结 研究LLM代理在代码重构中的能力,通过CodeTaste基准测试发现,代理在详细指定重构时表现良好,但难以自主发现人类选择的重构,提出“先提议后实现”分解可改善对齐。
NoRD: 一种无需推理的高数据效率视觉-语言-动作模型
机构 * Applied Intuition ; Texas A&M University(德克萨斯大学A&M分校) ; UC Berkeley(伯克利加州大学)
AI总结 提出NoRD模型,通过无需推理标注和仅需<60%数据微调,结合Dr. GRPO算法克服难度偏差,实现与现有VLA模型相当的性能,显著降低数据与计算开销。
Comments Accepted to CVPR 2026. Code available at: https://github.com/Applied-Open-Source/nord
通过任务复杂度操作化浅层对齐假设
机构 * University of Maryland(马里兰大学) ; University of California, Berkeley(加州大学伯克利分校) ; University of Washington(华盛顿大学) ; University of Toronto(多伦多大学) ; University of Edinburgh(爱丁堡大学)
AI总结 提出任务复杂度指标(达到目标性能的最短程序长度)来量化浅层对齐假设,实验表明预训练大幅降低任务复杂度,而微调可将复杂度降低数个数量级。
Comments ICML 2026
当良性输入导致严重危害:引发计算机使用代理的不安全意外行为
机构 * DeepMind, London, UK(深度Mind,伦敦,英国) ; Stanford University, Stanford, CA, USA(斯坦福大学,斯坦福,加利福尼亚州,美国) ; UC Berkeley, Berkeley, CA, USA(加州大学伯克利分校,伯克利,加利福尼亚州,美国)
AI总结 提出AutoElicit框架,通过迭代扰动良性指令并利用CUA执行反馈,自动引发前沿CUAs(如Claude 4.5 Haiku等)的数百种有害意外行为,并验证其跨模型可迁移性。
Comments ICML 2026, Project Homepage: https://osu-nlp-group.github.io/AutoElicit/
零流编码器
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 本文提出了一种基于流的表示学习框架,通过零流准则验证条件独立性,从而在生成模型中提取充分信息,并在图模型和自监督学习任务中学习近似马尔可夫毯和潜在表示。
Comments Yakun Wang and Leyang Wang contributed equally to this work; As published at ICML 2026
使用人口统计平价约束的众包噪声标签的最优公平聚合
机构 * University of California, Berkeley(加州大学伯克利分校) ; Université de Paris(巴黎大学) ; CNRS(国家科学研究中心)
AI总结 针对众包标签聚合中的公平性问题,提出在ε-公平框架下分析多数投票和最优贝叶斯聚合的公平性差距,并推广多类公平后处理算法以强制执行人口统计平价约束。
面向组合动作强化学习的潜在球形流策略
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出LSFlow方法,通过球形流匹配在紧凑连续潜在空间中学习随机策略,并利用组合优化求解器保证动作可行性,引入平滑贝尔曼算子解决不连续值函数问题,在多个组合RL任务上平均超越基线20.6%。
Comments ICML'26 Spotlight
MAR:多智能体反思提升大语言模型的推理能力
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出多智能体反思框架,通过多角色辩论生成多样化反思,解决单模型反思中的思维退化问题,在HotPot QA和HumanEval上分别达到47% EM和82.7%准确率。
SVRG及其后验校正扩展
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 本文揭示SVRG与后验校正方法的深层联系,证明SVRG是各向同性高斯后验校正的特例,并通过灵活指数族后验自动导出牛顿型和Adam型新变体。
Comments ICML 2026 (oral)
生理时间序列的自监督动力系统表示
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
AI总结 提出PULSE框架,利用动力系统生成模型的信息结构,通过跨重建预训练目标提取共享系统参数信息,丢弃样本特异性噪声,提升生理时间序列的表示学习效果。
Comments Accepted to ICML 2026
线性函数逼近的无投影TD学习的鲁棒 $\widetilde{\mathcal{O}}(1/\sqrt{T})$ 收敛率
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 本文针对线性函数逼近的时序差分学习,在无投影条件下证明了期望收敛率为 $\widetilde{\mathcal{O}}(\\|\theta^*\\|^2_2/\sqrt{T})$,仅需对学习率进行轻微的对数修正,无需额外正则条件。
从语言反馈中学习的形式化与可证明保证
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Washington(华盛顿大学) ; University of Toronto(多伦多大学)
AI总结 本文形式化语言反馈学习问题,提出转移埃尔泽维度刻画学习难度,并开发无遗憾算法HELiX,证明其性能保证,展示丰富语言反馈可指数级加速学习。
Comments ICML 2026
ACTIVE-o3:通过纯强化学习赋予多模态大语言模型主动感知能力
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出ACTIVE-o3框架,基于GRPO强化学习,通过模块化感知-动作设计和双形式奖励,使MLLM自主学会高效准确的区域选择策略,在开放世界和领域特定任务中显著提升主动感知能力。
Comments Accepted to ICML 2026. Project page: https://aim-uofa.github.io/ACTIVE-o3