When Distance Distracts: Representation Distance Bias in BT-Loss for Reward Models
当距离干扰:BT损失中表示距离偏差对奖励模型的影响
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 分析BT损失中表示距离导致的梯度偏差,提出NormBT自适应归一化方案,提升奖励模型在细粒度区分上的性能。
Comments ICML 2026
高校专区
当距离干扰:BT损失中表示距离偏差对奖励模型的影响
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 分析BT损失中表示距离导致的梯度偏差,提出NormBT自适应归一化方案,提升奖励模型在细粒度区分上的性能。
Comments ICML 2026
MMD Guidance: 基于最大均值差异引导的无训练分布适应扩散模型
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出MMD Guidance,一种无训练方法,通过最大均值差异梯度引导扩散模型采样,实现与参考数据分布对齐,无需重新训练。
如何评估人机交互?软件代理设计案例研究
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出PULSE框架,通过用户反馈和模型预测结合评估人机交互,在15k用户实验中验证其能减少40%置信区间,并揭示基准测试与真实结果的差异。
Comments ICML 2026
TruthRL: 通过强化学习激励诚实的LLM
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出TruthRL框架,使用GRPO和三值奖励直接优化LLM的诚实性,减少幻觉并允许不确定时弃权,在知识密集型基准上显著提升诚实性。
Comments ICML 2026. Code: https://github.com/facebookresearch/TruthRL
对机器文本检测器的攻击保留风格指纹
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 研究机器文本检测器对抗攻击的局限性,提出一种同时优化不可检测性和特定人类风格的 paraphrasing 方法,发现单文档检测不可靠,需多文档分析。
线性回归中的风险比较:隐式正则化主导显式正则化
机构 * University of California, Berkeley(加州大学伯克利分校) ; Alphabetical order ; Harvard University(哈佛大学) ; Google DeepMind(谷歌DeepMind)
AI总结 本文通过实例比较线性回归中梯度下降、岭回归和随机梯度下降的有限样本风险,发现梯度下降优于岭回归,但与随机梯度下降不可比,且在某些问题中梯度下降可能更差。
Comments Accepted for presentation at the Conference on Learning Theory (COLT) 2026
FG-Attn:在视频扩散模型中利用细粒度稀疏注意力
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 针对视频扩散模型中注意力层计算开销大的问题,提出FG-Attn,一种低开销的细粒度稀疏注意力机制,在MxN块粒度上跳过分数计算,实现最高2.45倍加速。
CAST: 反事实标签提升视觉-语言-动作模型中的指令跟随能力
机构 * University of California Berkeley(加州大学伯克利分校) ; Princeton University(普林斯顿大学)
AI总结 针对VLA模型难以遵循细粒度指令的问题,提出利用视觉语言模型生成反事实标签增强数据集,提升语言基础多样性,实验表明该方法在导航和操作任务中显著提升指令跟随成功率。
基于SE(3)的机器人统一力-阻抗控制的几何公式化
机构 * University of California, Berkeley, USA(加州大学伯克利分校)
AI总结 提出一种在SE(3)流形上的阻抗控制框架,通过能量罐增强实现力跟踪与无源性,并解决非因果实现问题,继承SE(3)不变性以提高学习效率。
立场:机器学习社区必须构建AI增强的同行评审生态系统
机构 * University of Amsterdam(阿姆斯特丹大学) ; University of Cambridge(剑桥大学) ; ETH Zurich(苏黎世联邦理工学院) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 针对ML领域稿件激增导致同行评审危机,本文主张将AI辅助评审作为优先研究课题,提出利用大语言模型作为协作工具,增强事实核查、评审指导、作者改进和决策支持,并强调需要更细粒度的评审数据。
Comments 18 pages, 3 figures. Accepted (Oral) at the ICML 2026 Position Paper Track
AI生成语言中的标准语言意识形态
机构 * Stanford University(斯坦福大学) ; UC Berkeley(加州大学伯克利分校)
AI总结 本文提出一个分类法,揭示大型语言模型如何强化标准语言意识形态,导致语言变体的边缘化,并讨论其社会影响及应对建议。
Comments To appear in the 2026 ACM Conference on Fairness, Accountability, and Transparency (FAccT '26)
自我挖掘的难度用于安全微调
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出通过模型自身生成结果评估提示难度,对最难的提示进行安全微调,在Llama-3模型上将攻击成功率降至1-3%,但增加了拒绝率,通过混合良性提示可平衡性能。
Front-to-Attractors:修改双向搜索中的Front-to-Front启发式
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出Front-to-Attractors (F2A)启发式类,通过动态维护吸引子集替代完整前沿,在保持Front-to-Front信息性的同时大幅降低计算开销,实验显示相比F2F减少最多11.2倍成对评估,平均节点扩展比F2E少4.8倍。
因果纵向先验拟合网络用于反事实结果预测
机构 * Yale University(耶鲁大学) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 提出CausalLongPFN,一种基于先验拟合的上下文预测器,通过合成因果模型预训练实现无需梯度更新的纵向反事实结果预测,在多个基准上达到与领域训练模型竞争的性能。
Comments 31 pages, 10 tables
需求模型是否应包含竞争对手价格?无知学习与算法合谋
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Washington(华盛顿大学)
AI总结 研究在竞争市场中,定价算法是否应显式建模竞争对手价格,通过对比无知与知情学习策略,发现知情策略是纳什均衡且价格收敛至竞争结果,而合谋模式不稳健。
Comments Preliminary version "Oblivious Learning, Price Exploration and Collusive Dynamics" accepted at EC 2026
立场:部署的强化学习应该是持续的
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 本文主张部署的强化学习系统应持续学习,分析了部署后非平稳性的四个来源,并展示了持续RL的优势和实现方法。
Comments Accepted to the ICML 2026 Position Paper Track. See https://icml.cc/virtual/2026/poster/67195
ReSkill:在智能体强化学习中协调技能创建与策略优化
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
AI总结 提出ReSkill框架,通过GRPO的组结构嵌入断言驱动技能创建、组内轨迹采样和自适应汤普森采样,实现技能与策略的协同进化,在多个领域超越现有方法。
基于相似性匹配的灵活在线表示学习
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出一种基于相似性匹配的在线生物合理学习算法,能够学习稀疏移位不变表示,适用于聚类、流形平铺或稀疏编码。
Comments 6 pages, 3 figures. Originally accepted to IJCNN 2023 but not presented owing to visa issues
在不遗忘的情况下回溯:面向参数高效持续学习的选择性反向精炼
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出SABER框架,通过基于提示梯度几何和损失分布相似性的任务相关性准则,在提示型参数高效持续学习中实现受控的正向反向知识迁移,无需重放。
Comments Accepted at ICML 2026
鲁棒Koopman控制屏障滤波器用于安全演员-评论家强化学习
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出鲁棒Koopman-CBF SAC框架,通过数据驱动学习Koopman预测器、构建提升空间中的仿射CBF约束并利用二次规划安全层实施,同时通过投影残差裕度处理近似误差,实现零约束违反或减少违规。
Comments 17 pages, 7 figures
潜在缓存流:无需文本的模型间通信
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
AI总结 提出潜在缓存流(LCF)方法,通过联合翻译和压缩键值缓存实现高效模型间通信,在上下文不同场景下比基于文本的通信准确率提高23%、速度提升8.5倍。
Comments 6 pages, 5 figures
通过扩散强迫实现统一且稳健的数据同化:ForcingDAS
机构 * University of Michigan(密歇根大学) ; University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学) ; Massachusetts Institute of Technology(麻省理工学院) ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 本文提出ForcingDAS,一种基于扩散强迫的统一数据同化框架,能够捕捉长时序依赖并减少误差积累,同时在推理时无需重新训练即可实现滤波到平滑的全谱应用。
VideoGPA: 通过几何先验知识蒸馏实现3D一致的视频生成
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 VideoGPA通过几何先验知识蒸馏提升视频生成的3D一致性,利用数据高效的自监督框架引导视频扩散模型,显著增强时间稳定性、几何合理性与运动一致性。
Comments 8 pages, 5 figures, ICML 2026
扩散模型何时学会生成多个物体?
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Cambridge(剑桥大学) ; University of Washington(华盛顿大学) ; University of Toronto(多伦多大学)
AI总结 研究探讨了扩散模型在多物体生成中的局限性,发现场景复杂度比概念不平衡更关键,且低数据条件下计数任务更难学习。
Comments ICML2026
通过预训练分子嵌入距离推进基于配体的虚拟筛选和分子生成
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
AI总结 本文提出预训练嵌入距离作为高效替代方案,用于虚拟筛选和分子生成,展示其在结构信息捕捉和相似性测量方面的有效性。
Comments Accepted by ICML 2026 AI4Science (https://openreview.net/forum?id=HbfrCipfNl). Code and data are available
暗箱中的反射:在反射提示优化中揭示并逃离黑箱
机构 * University of California, Berkeley(加州大学伯克利分校) ; Huazhong University of Science and Technology(华中科技大学) ; Hefei University of Technology(合肥工业大学)
AI总结 本文提出VISTA框架,通过解耦假设生成与提示重写,实现可解释的提示优化,有效解决GEPA在缺陷种子下的性能下降问题。
Comments Accepted at ACL SRW 2026
ReTabSyn:通过强化学习实现真实表格数据合成
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 ReTabSyn通过强化学习优先学习条件分布,提升小数据下表格数据合成效率,优于现有基线方法。
移动性嵌入的POI:从人类移动中学习场所身份与使用方式
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
AI总结 提出ME-POIs框架,通过对比学习将大规模人类移动数据与语言模型嵌入结合,学习场所功能,并在五个地图丰富任务上超越文本或移动性单独基线。
CodeTaste:LLM能否生成人类级别的代码重构?
机构 * University of California, Berkeley(加州大学伯克利分校) ; ETH Zurich(苏黎世联邦理工学院)
AI总结 研究LLM代理在代码重构中的能力,通过CodeTaste基准测试发现,代理在详细指定重构时表现良好,但难以自主发现人类选择的重构,提出“先提议后实现”分解可改善对齐。
NoRD: 一种无需推理的高数据效率视觉-语言-动作模型
机构 * Applied Intuition ; Texas A&M University(德克萨斯大学A&M分校) ; UC Berkeley(伯克利加州大学)
AI总结 提出NoRD模型,通过无需推理标注和仅需<60%数据微调,结合Dr. GRPO算法克服难度偏差,实现与现有VLA模型相当的性能,显著降低数据与计算开销。
Comments Accepted to CVPR 2026. Code available at: https://github.com/Applied-Open-Source/nord