Self-Augmenting Retrieval for Diffusion Language Models
扩散语言模型的自增强检索
机构 * University of California, Berkeley(加州大学伯克利分校) ; Google Research(谷歌研究院)
AI总结 提出SARDI框架,利用扩散语言模型去噪过程中丢弃的低置信度标记作为前瞻信号指导检索,无需训练且与检索器无关,在多跳问答基准上以高达8倍吞吐量超越现有方法。
Comments ICML 2026
高校专区
扩散语言模型的自增强检索
机构 * University of California, Berkeley(加州大学伯克利分校) ; Google Research(谷歌研究院)
AI总结 提出SARDI框架,利用扩散语言模型去噪过程中丢弃的低置信度标记作为前瞻信号指导检索,无需训练且与检索器无关,在多跳问答基准上以高达8倍吞吐量超越现有方法。
Comments ICML 2026
Goedel-Architect: 通过蓝图生成与精炼简化形式定理证明
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学) ; University of Science and Technology of China(中国科学技术大学) ; University of Toronto(多伦多大学) ; National University of Singapore(新加坡国立大学) ; University of Tokyo(东京大学) ; University of Washington(华盛顿大学)
AI总结 提出Goedel-Architect框架,通过生成和精炼依赖图蓝图,结合Lean 4证明器并行证明引理,在多个基准测试上达到开源最优性能。
Agent记忆:有状态长时任务工作负载的表征与系统影响
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Stanford University(斯坦福大学) ; University of California, Berkeley(加州大学伯克利分校) ; MIT Media Lab(麻省理工学院媒体实验室)
AI总结 本文首次对LLM agent记忆系统进行系统级表征,提出四轴分类法,通过阶段感知分析框架评估10种代表性系统,并给出10条系统设计建议。
双重预处理 (DoPr):针对测试时性能而非验证损失的优化
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学) ; University of Cambridge(剑桥大学) ; DeepMind(深度Mind) ; Google Research(谷歌研究)
AI总结 提出双重预处理优化范式,通过结合梯度级和激活级预处理,缓解自回归语言建模等场景中训练/验证损失与下游指标不匹配的测试时反馈问题,提升测试时性能而不一定改善验证损失。
LLM 自我识别:引导与检索激活签名
机构 * University of California, Berkeley(加州大学伯克利分校) ; ETH Zurich(苏黎世联邦理工学院)
AI总结 通过随机稀疏向量引导内部残差流,在LLM生成文本中嵌入可检测指纹,实现高精度归属,同时保持文本质量。
Comments To appear in Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)
计算感知的基于选择性注意力的事件到帧重建
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出一种高效的事件到帧重建框架,通过循环编码器-解码器、选择性上下文融合和轻量级混合注意力机制,在保持重建质量的同时降低计算复杂度。
衡量对集合值AI建议适当依赖的框架
机构 * University of California, Berkeley(加州大学伯克利分校) ; ETH Zurich(苏黎世联邦理工学院)
AI总结 本文提出首个正式框架,用于在序列判断-顾问范式中衡量对集合值AI建议的适当依赖,涵盖分类和回归任务,并定义了新的度量指标以捕捉现有方法忽略的细微差别。
超越相似性:面向个人AI代理的可信记忆搜索
机构 * University of Science and Technology of China(中国科学技术大学) ; Tsinghua University(清华大学) ; National University of Singapore(新加坡国立大学) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 针对个人AI代理中基于语义相似性的记忆检索存在的信任漏洞,提出轻量级记忆插件MemGate,通过查询条件神经门控实现可信记忆搜索。
记忆是重建的,而非检索的:面向LLM智能体的图记忆
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
AI总结 提出MRAgent框架,通过关联记忆图和主动重建机制,使LLM智能体在推理过程中动态调整记忆访问,显著提升长程记忆推理性能。
Comments Accepted at ICML 2026
LadderMan: 学习人形机器人感知爬梯
机构 * Amazon FAR(亚马逊FAR) ; USC(美国南加州大学) ; UC Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学) ; CMU(卡内基梅隆大学)
AI总结 提出LadderMan系统,通过两阶段学习管道和视觉基础模型,使人形机器人能够鲁棒地攀爬多种梯子并在梯子上进行操控。
原谅或忘记:理解音频检索系统中仇恨的上下文
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出一种后门因果去偏框架,通过情感控制中介在保持语义相关性的同时抑制有害语音,实验表明在最小化检索精度损失下持续降低毒性。
莱比锡基准测试
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 49位数学家于2026年4月至5月编制了100个研究级数学问题数据集,通过多阶段评估大型语言模型的数学推理能力,最终仅剩2个问题未解决。
Comments 8 pages including 8 benchmark statistics tables + 20 pages appendix containing the 100 Leipzig Benchmark questions
ExpSpeech-Net: 表情与语音的多模态融合用于深度伪造检测
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
AI总结 提出轻量级ExpSpeech-Net模型,通过融合面部表情和语音模式,利用SqueezeNet和RNN骨干网络及智能特征选择,实现高效深度伪造检测,准确率达94.5%。
通过微调语言模型和引导树搜索自动证明香农型熵不等式
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 本文通过微调小规模语言模型并结合引导束搜索,自动化证明香农型熵不等式,在含10-15个变量的测试集上达到85%的证明成功率。
持续学习基准:评估现实世界有状态环境中的前沿AI系统
机构 * UC Berkeley(伯克利大学) ; Snorkel AI ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
AI总结 提出首个专家验证的持续学习基准CL-Bench,涵盖六个领域,通过增益指标隔离在线学习能力,发现现有系统存在过拟合和知识复用不足问题。
Agent编排的自适应RAG:结构化与多跳检索的比较研究
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Washington(华盛顿大学) ; University of California, Los Angeles(加州大学洛杉矶分校)
AI总结 提出Agent编排的自适应RAG框架,通过动态查询分解、迭代检索和自反思评估,在结构化领域(DevOps)和多跳推理基准(MuSiQue)上对比发现,查询分解在结构化领域提升性能但降低多跳排名精度,反思机制提高引用准确性但增加延迟,表明Agent增强需根据查询和领域特性选择性应用。
LLM在Lean中数学形式化的评估
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Washington(华盛顿大学)
AI总结 本研究通过pass@k和refine@k指标在miniF2F和miniCTX子集上比较了多种大语言模型在Lean 4中生成形式化证明的能力,发现Gemini 3.1 Pro和Claude Opus 4.7性能最佳,而NVIDIA Nemotron 3 Super和GPT-OSS 120B在考虑成本时效率最高。
Comments 15 pages, 13 figures, 10 tables. Comments welcome!
使用通用分类系统统一音效数据集
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出一个基于通用分类系统(UCS)的模块化数据集重新标注框架,通过规则驱动的多阶段流水线和冲突解决实现高自动转换率,并创建了包含58,057个音频片段的统一数据集EnvSound-UCS。
Comments DAFx 2026 camera-ready version
SoCRATES:跨领域和社会认知变异的前瞻性LLM调解的可靠自动化评估
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
AI总结 提出SoCRATES基准,通过多领域真实冲突场景和五维社会认知适应轴评估LLM调解员,使用主题定位评估器实现0.82的人类专家一致性,发现最强模型仅缩小约三分之一的未调解共识差距。
最小化缩放因子的隐藏成本:面向大语言模型的图引导超低位量化
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出SAGE-PTQ框架,通过图引导的显著性感知量化分离显著与非显著权重,实现超低位量化并最小化缩放开销,在LLaMA-3-8B上困惑度降至6.74且内存低于BiLLM的50%。
Comments Preprint. 18 pages, 10 figures, 7 tables, including appendix
LeanMarathon:通过长视界Lean自动形式化实现可靠的AI合作数学家
机构 * Department of Statistics, University of Warwick, UK(英国沃里克大学统计系) ; Center for Advanced Intelligence Project, RIKEN, Japan(日本理化学研究所高级智能项目) ; Department of Statistics, University of Michigan, USA(美国密歇根大学统计系) ; Department of Mathematical Informatics, The University of Tokyo(东京大学数学信息学系;日本理化学研究所高级智能项目) ; also Center for Advanced Intelligence Project, RIKEN, Japan(加州大学伯克利分校电气工程与计算机科学系;统计系) ; Department of Electrical Engineering and Computer Sciences, also Department of Statistics, University of California, Berkeley, USA(上海交通大学数学科学学院,自然科学院和MOE-LSC) ; School of Mathematical Sciences, Institute of Natural Sciences and MOE-LSC, Shanghai Jiao Tong University, China
AI总结 提出多智能体框架LeanMarathon,通过蓝图抽象和两阶段编排器实现长视界研究数学的可靠自动形式化,在四个Erdős问题上成功形式化七个定理。
Comments 26 pages, 9 figures. Comments are welcome
具有双重预测的学习增强在线最小化
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 针对度量任务系统和层状集合覆盖两类在线最小化问题,提出利用对偶线性规划最优解的机器学习预测来改进理论保证的学习增强算法。
学习流形与伊藤动力学:分支神经粗糙微分方程
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学) ; University of Toronto(多伦多大学)
AI总结 提出分支神经粗糙微分方程(B-NRDE),通过Hopf代数框架统一处理欧几里得伊藤动力学、流形上的有序协变导数及经典Stratonovich情形,实现精确的粗步流形约束动力学和伊藤一致律匹配。
Comments Accepted at ICML 2026
VideoKR:迈向知识和推理密集型视频理解
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学) ; University of Toronto(多伦多大学) ; University of Washington(华盛顿大学) ; University of Michigan(密歇根大学)
AI总结 提出VideoKR,首个大规模训练语料库,通过人工参与的技能导向生成管道构建315K视频推理示例,增强知识和推理密集型视频理解,并在专家标注基准上验证其有效性。
Comments ICML 2026 Spotlight
大步长梯度下降恢复多路径深度线性网络中的对称性
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 本文研究大步长离散梯度下降如何通过边缘稳定性振荡使多路径深度线性网络从对称性破坏转向信号重新分配,从而偏好共享表示而非单路径主导。
Comments ICML 2026
虚拟圆桌会议:模拟人类头脑风暴动态的多智能体角色
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出一种多智能体架构,通过发散与收敛两阶段模拟圆桌头脑风暴,利用多样化AI角色和智能引导者产生多样化创意并评估排名,案例研究表明其能产生多样相关创意并深化讨论质量。
Comments 10 pages, 10 figures, 2 tables
轨迹感知的节点贡献与静态可控性的极限
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 本文提出“涌现贡献”(EC)作为节点动态杠杆的有限时域度量,通过可微模型的雅可比矩阵计算,在线性时不变极限下退化为平均可控性,并构建相图刻画两者一致与分歧的条件。
Comments 11 pages, 1 figure
工业化预测驱动推断:用于可靠生成式AI与智能体系统评估的GLIDE库
机构 * University of California, Berkeley(加州大学伯克利分校) ; Google Research(谷歌研究院)
AI总结 提出GLIDE开源库,统一多种预测驱动推断方法,提供无偏估计与有效置信区间,显著降低人工标注成本。
Comments 8 pages, Accepted to the ICML 2026 Workshop on Statistical Frameworks for Uncertainty in Agentic Systems, Seoul, South Korea, 2026
频谱探测电路:识别预训练Transformer中注意力头电路的三步法
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出一种三步法,通过频谱信号排序、任务模式筛选和组消融因果验证,无需标签即可识别预训练Transformer中执行持续内容依赖计算的注意力头电路,并在多个模型上验证了其通用性和因果必要性。
Comments 35 pages, 4 figures
Open-H-Embodiment: 一个大规模数据集,用于在医疗机器人中启用基础模型
机构 * Open-H-Embodiment Consortium ; University of California, Berkeley(加州大学伯克利分校) ; University of California, Los Angeles(加州大学洛杉矶分校) ; University of Southern California(南加州大学) ; University of Cambridge(剑桥大学) ; University of Tokyo(东京大学) ; University of Tokyo, Graduate School of Information Science and Technology(东京大学信息科学与技术研究生院) ; University of Tokyo, Institute of Industrial Science(东京大学工业科学研究所)
AI总结 本文提出Open-H-Embodiment数据集,通过两个基础模型展示了其在医疗机器人领域的应用,展示了大规模开放数据在推动机器人学习和世界建模方面的关键作用。
Comments Project website: https://open-h.github.io/open-h-embodiment/