STABLEVAL: Disagreement-Aware and Stable Evaluation of AI Systems
STABLEVAL: 面向AI系统的分歧感知与稳定评估
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 针对多数投票法在标注者分歧下导致排名不稳定的问题,提出STABLEVAL框架,通过建模潜在正确性和标注者混淆模式,实现稳定且不确定性感知的系统评估。
高校专区
STABLEVAL: 面向AI系统的分歧感知与稳定评估
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 针对多数投票法在标注者分歧下导致排名不稳定的问题,提出STABLEVAL框架,通过建模潜在正确性和标注者混淆模式,实现稳定且不确定性感知的系统评估。
通过可处理提议缓解局部约束解码中的偏差
机构 * Stanford University(斯坦福大学) ; University of California, Berkeley(加州大学伯克利分校) ; Massachusetts Institute of Technology(麻省理工学院)
AI总结 针对局部约束解码中因短视掩码导致的采样偏差,提出基于张量化有限自动机的全局约束解码提议和概率全局约束解码提议,结合序贯蒙特卡洛方法实现无偏采样,在函数调用、关键词生成和SQL生成任务中显著减少所需粒子数并加速收敛。
Comments 13 pages, 5 figures
集合监督扩散策略:通过修正学习动作分块扩散
机构 * University of California, Berkeley(加州大学伯克利分校) ; ETH Zurich(苏黎世联邦理工学院)
AI总结 提出集合监督扩散策略(SDP),利用人类修正中的对比动作分块数据,通过构建期望动作分块集合来训练扩散策略,有效缓解分布偏移并提升鲁棒性。
Hist2Style: 基于双边网格的直方图引导风格化
机构 * Adobe Nextcam ; University of California, Berkeley(加州大学伯克利分校)
AI总结 提出Hist2Style,利用双边网格实现快速、边缘感知的逼真风格迁移,通过蒸馏大模型为轻量网络,并基于直方图嵌入提供可解释的用户控制。
Comments 10 pages, 8 figures. Extended results are at https://www.dekelgalor.com/hist2style
“我知道这会如何发展”:通过渐进条件惊奇度刻画多样性
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Cambridge(剑桥大学) ; Stanford University(斯坦福大学)
AI总结 提出一种基于上下文学习的多样性度量方法 Decan(D_{Ca_n}),通过单次前向传递计算每个字节的得分,无需嵌入模型、参考语料或人工标注,在多个基准上验证了其有效性。
Comments 28 pages, 18 figures, 9 tables. Accepted to the Workshop on Generative AI, Creativity, and Human-AI Co-Creation @ ICML 2026 (non-archival). Code and data: https://github.com/AMindToThink/icl-diversity
PillarDETR:基于YOLO骨干和RT-DETR头的实时3D目标检测
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出PillarDETR架构,结合YOLOv8的CSP骨干和RT-DETR解码器,实现无需NMS的端到端实时3D目标检测,在KITTI和nuScenes上取得精度与速度的良好平衡。
Comments 6 pages, 1 figures, 8 tables
敏感性是一把双刃剑:判别性与对抗鲁棒性之间的权衡
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 本文发现全连接分类器的高敏感性带来判别性但也导致脆弱性,而ℓ2距离分类器的不敏感性带来鲁棒性但限制性能,为此提出基于混合原型混合框架的ℓ2重分类器,通过融合稳定原型和动态原型实现判别性与鲁棒性的平衡,并设计混合替代攻击评估协议。
Comments 13 pages including reference, 4 figures
RDA:用于强化学习的奖励设计智能体
机构 * University of California, Berkeley(加州大学伯克利分校) ; DeepMind(深度Mind)
AI总结 提出基于视觉语言模型的奖励设计智能体RDA,通过任务分解、视觉轨迹评估和失败模式总结迭代优化奖励函数,在操作任务中生成更符合指令的策略。
Comments Accepted to RLC'26
DOT-MoE:用于MoE化的可微最优传输
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出DOT-MoE框架,通过可微最优传输将密集层分解为专家,联合学习神经元分配和路由策略,在减少50%活跃参数的同时保留90%原始性能。
Comments Accepted at ICML 2026
揭示具有内在测地耦合的多模态生物分子协同设计
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
AI总结 针对生物分子协同设计中模态间时间耦合被忽视的问题,提出GeoCoupling框架优化异构模态的时间耦合,在基于结构的药物设计和无条件蛋白质设计中提升物理有效性和多样性。
Comments Accepted to ICML 2026
用于文本到语音中可解释情感控制的稀疏自编码器
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 本文通过稀疏自编码器分析基于LLM的TTS模型中的情感相关潜在特征,提出特征级干预框架实现双向情感诱导与抑制,无需修改模型参数。
Comments Accepted by ICML 2026
基于模型选择的计算感知卡尔曼滤波用于神经动力学
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Washington(华盛顿大学) ; University of Texas at Austin(得克萨斯大学奥斯汀分校)
AI总结 提出计算感知状态空间模型(CASSM),通过新训练损失和优化方案实现模型选择,在试验数远少于神经元数的规模不平衡场景中,以可处理的计算复杂度提供竞争性预测和更优的不确定性校准。
Comments 24 pages, Proceedings of 2nd International Conference on Probabilistic Numerics (2026)
轻量级槽注意力框架用于多乐器多音高估计
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出一种轻量级槽注意力框架,通过匈牙利匹配和模块化扩展实现多乐器多音高估计,并验证了其在URMP上的乐器族分解效果。
Comments Preprint submitted to the IEEE 28th International Workshop on Multimedia Signal Processing (MMSP). This work has been submitted to the IEEE for possible publication. 6 pages, 2 figures
脉冲神经网络配置在网络入侵检测中的评估
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 通过消融实验评估9种神经元模型与3种脉冲编码方案的27种组合,发现延迟编码优于速率和增量编码,且LeakyParallel神经元结合延迟编码在四个基准数据集上平均准确率92.11%,宏F1 0.80,假阳性率2.01%,推理速度最快。
Comments 1 figure, 3 Tables, This manuscript is under review for IEEE MILCOM 2026. \c{opyright} 2026 IEEE. Personal use is permitted; all other uses require IEEE permission, including reprinting, republication, redistribution, resale, or reuse of copyrighted components
CEAR: 深度神经网络中的集成对抗鲁棒性认证
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出CEAR方法,通过混合经验与认证防御机制,利用高斯噪声和温度混淆梯度与logits,并扩展随机平滑以验证集成分类器的鲁棒性,在多个数据集上取得更优的认证准确率和鲁棒半径。
Comments This is the preprint of the work accepted for publication in the Proceedings of the 39th Canadian Conference on Artificial Intelligence (Canadian AI 2026); 19 Pages
Dr. DocBench:专家级与困难文档解析的综合基准
机构 * Stanford University(斯坦福大学) ; MIT(麻省理工学院) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Southern California(南加州大学) ; Harvard University(哈佛大学) ; IBM Research(IBM研究院) ; University of Arizona(亚利桑那大学) ; Duke University(杜克大学) ; UC Berkeley(加州大学伯克利分校) ; LMU Munich(慕尼黑路德维希-马克西米利安大学)
AI总结 提出Dr. DocBench基准,通过基于解析器失败的采样从多语言书籍语料库中选取挑战性文档,包含52个BISAC主题领域和65k高质量标注,用于评估专家级文档解析能力。
Comments 27 pages, 13 figures, 14 tables
大规模针尖:LLM辅助的Windows漏洞研究目标选择
机构 * Microsoft(微软) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 提出Symbolicate-Enrich-Sample流水线,通过符号恢复、结构特征提取和低成本语言模型排序,从Windows系统数千万函数中筛选出约2.2万个候选目标,解决漏洞研究中目标选择瓶颈问题。
Comments 9 pages, 3 figures, 2 tables
BenchEvolver: 通过以解决方案为中心的进化进行前沿任务合成
机构 * University of California, Berkeley(加州大学伯克利分校) ; Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院)
AI总结 提出BenchEvolver框架,通过进化参考解决方案自动生成更难的编程问题,以解决基准饱和问题,并在LiveCodeBench和SciCode上验证其有效性。
CA-BED:对话感知的贝叶斯实验设计
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Washington(华盛顿大学) ; University of Toronto(多伦多大学)
AI总结 提出对话感知的贝叶斯实验设计(CA-BED),一种推理时概率对话规划框架,通过结合贝叶斯实验设计与LLM似然估计,在多个对话轮次中优化问题选择,在结构化实体推断基准上平均成功率提升21.8%,仅增加1.8轮对话。
Comments Reliable Autonomy Workshop at ICLR 2026
迈向交互式视频世界建模:前沿、挑战、基准与未来趋势
机构 * Department of Engineering, University of Cambridge, U.K.(剑桥大学工程系) ; Peking University(北京大学) ; University of Twente(埃因霍温理工大学) ; Mechanical Systems Control Laboratory, University of California, Berkeley, USA(加州大学伯克利分校机械系统控制实验室) ; ETH Zurich(苏黎世联邦理工学院) ; Microsoft(微软公司) ; University of Oxford(牛津大学)
AI总结 本文系统综述了交互式世界建模的研究趋势、技术挑战、评估基准,并提出了未来方向,重点在于动作条件可控性、长程交互与记忆以及实时响应性。
Comments Under review. The GitHub repository is publicly available at: https://github.com/liujiuming123/Awesome-Interactive-World-Model
用于高效语音识别的脉冲与事件驱动神经形态Mamba模型
机构 * University of California, Berkeley(加州大学伯克利分校) ; Tsinghua University(清华大学)
AI总结 提出脉冲和事件驱动的神经形态Mamba模型,通过激活稀疏性提升语音识别效率,在LibriSpeech上实现超过60%的激活稀疏性且精度损失小于1%,并开发周期精确的事件驱动模拟器实现算法-硬件协同优化。
Comments Accepted at IJCNN2026
面向决策的在线策略学习用于部分反馈下的上下文线性优化
机构 * Department of Industrial Engineering and Operations Research, University of California, Berkeley(工业工程与运筹学系,加州大学伯克利分校) ; H. Milton Stewart School of Industrial and Systems Engineering, Georgia Institute of Technology(H.米尔顿·斯图尔特工业与系统工程学院,佐治亚理工学院)
AI总结 提出一种混合梯度估计方法,用于部分反馈下顺序上下文线性优化的在线策略学习,实现决策质量驱动的预测模型训练,并在多个基准上优于上下文多臂赌博机基线。
DAG-MoE:从简单混合到专家混合中的结构聚合
机构 * University of Science and Technology of China(中国科学技术大学) ; Tsinghua University(清华大学) ; Nanyang Technological University(南洋理工大学) ; University of California, Berkeley(加州大学伯克利分校) ; University of Washington(华盛顿大学)
AI总结 本文提出DAG-MoE框架,通过轻量级模块自动学习选定专家之间的最优聚合结构,以替代标准加权求和聚合,从而在不改变专家或路由器的情况下扩展专家组合空间并实现单层多步推理,在预训练和微调中均优于传统MoE基线。
Comments Accepted by ICML 2026
基于动态稀疏性的内存高效LLM训练:从稳定性到实际扩展
机构 * University of Waterloo(滑铁卢大学) ; University of California, Berkeley(加州大学伯克利分校) ; ETH Zurich(苏黎世联邦理工学院) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; University of Michigan(密歇根大学)
AI总结 提出SMET方法,通过优化器预热和密度感知学习率缩放解决动态稀疏训练中的优化不稳定问题,实现LLM的稳定、可扩展且内存高效的稀疏预训练。
Comments Accepted at ICML2026
深入波动:用于跨被试脑电情绪解码的Morlet谱变换器
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 针对脑电情绪识别中跨被试变异性问题,提出基于Morlet小波标记化、长上下文基线去除和频带特定空间投影的Morlet谱变换器(MST),无需预训练即可在SEED系列数据集上超越大型预训练模型和频域方法。
任务多样性产生系统性迁移但抑制持续强化学习
机构 * MIT(麻省理工学院) ; University of California, Berkeley(加州大学伯克利分校) ; Princeton University(普林斯顿大学) ; Harvard University(哈佛大学)
AI总结 通过引入GPU加速的持续强化学习领域Banyan,研究任务多样性(地图布局、交互对象、子目标层次结构)对智能体在分布变化下持续学习能力的影响,发现多样性促进局部迁移但导致长期任务性能停滞和遗忘。
模型动物园中的丘比特:在线匹配以选择你的梦想大语言模型
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出一种基于决斗老虎机算法的主动学习框架,通过迭代选择大语言模型对并收集用户反馈,高效匹配用户偏好与模型能力。
Comments 38 pages, 11 figures
晶体性质预测的潜在扩散预训练
机构 * University of California, Berkeley(加州大学伯克利分校) ; Indian Institute of Technology, Bombay(印度班加罗尔印度理工学院)
AI总结 提出基于潜在扩散的预训练框架CrysLDNet,结合变分自编码器和扩散模型,从无标注晶体结构中学习表示,微调后显著提升性质预测性能。
Comments Published in ICML 2026
DistMatch: 通过分布匹配的自适应分箱用于鲁棒序列共形预测
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Tokyo(东京大学)
AI总结 提出DistMatch方法,利用Kolmogorov-Smirnov统计量递归划分残差以实现近似可交换性,结合在线分位数回归进行局部自适应推理,提升序列共形预测对分布偏移的鲁棒性。
Comments ICML 2026 (34 pages, 12 figures, 16 tables)
隐藏的思考并非秘密:大型语言模型中的推理痕迹暴露
机构 * National Yang Ming Chiao Tung University(国家阳明交通大学) ; UC Berkeley(伯克利大学)
AI总结 本文提出推理暴露提示(REP)方法,通过影子模型生成的示范以辅助代码格式包装,从受害者模型中引出用户可见的推理痕迹,显著提高暴露痕迹与内部痕迹的相似性并保留有用推理信号。