Extreme Low-Bit Inference in Reasoning Models: Failure Modes and Targeted Recovery
推理模型中的极端低位推理:失败模式与针对性恢复
机构 * University of Washington(华盛顿大学)
AI总结 针对大型推理模型在2位量化推理中因生成不稳定导致总token数膨胀而无法实现端到端加速的问题,提出轻量级FP16规划和循环救援两种控制方法,显著恢复模型精度并保持实际速度。
高校专区
推理模型中的极端低位推理:失败模式与针对性恢复
机构 * University of Washington(华盛顿大学)
AI总结 针对大型推理模型在2位量化推理中因生成不稳定导致总token数膨胀而无法实现端到端加速的问题,提出轻量级FP16规划和循环救援两种控制方法,显著恢复模型精度并保持实际速度。
通过场景级一致性理解热视频中的身份连续性
机构 * Department of Electrical and Computer Engineering, Information Processing Lab, University of Washington, USA(电气与计算机工程系,信息处理实验室,华盛顿大学,美国)
AI总结 针对热行人多目标跟踪中身份碎片化问题,提出轻量级后处理方法,通过在线短间隙重映射和离线轨迹重链接恢复身份连续性,在PBVS热行人MOT基准上提升IDF1。
Comments Accepted to CVPR 2026 Workshop on SVC. Published in CVPR Workshops proceedings
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 1411-1419
TN-SHAP-G:用于Shapley值和交互的图结构张量网络代理
机构 * University of Washington(华盛顿大学) ; CNRS(法国国家科学研究中心)
AI总结 提出TN-SHAP-G框架,利用图结构输入通过张量网络代理高效计算Shapley值和高阶交互指数。
MURMUR:一种高效的长时间语音识别推理系统
机构 * University of Washington(华盛顿大学)
AI总结 提出MURMUR推理系统,通过块间和块内两级优化,在保持高精度的同时显著降低长时间语音识别的延迟。
基于模型选择的计算感知卡尔曼滤波用于神经动力学
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Washington(华盛顿大学) ; University of Texas at Austin(得克萨斯大学奥斯汀分校)
AI总结 提出计算感知状态空间模型(CASSM),通过新训练损失和优化方案实现模型选择,在试验数远少于神经元数的规模不平衡场景中,以可处理的计算复杂度提供竞争性预测和更优的不确定性校准。
Comments 24 pages, Proceedings of 2nd International Conference on Probabilistic Numerics (2026)
CA-BED:对话感知的贝叶斯实验设计
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Washington(华盛顿大学) ; University of Toronto(多伦多大学)
AI总结 提出对话感知的贝叶斯实验设计(CA-BED),一种推理时概率对话规划框架,通过结合贝叶斯实验设计与LLM似然估计,在多个对话轮次中优化问题选择,在结构化实体推断基准上平均成功率提升21.8%,仅增加1.8轮对话。
Comments Reliable Autonomy Workshop at ICLR 2026
DAG-MoE:从简单混合到专家混合中的结构聚合
机构 * University of Science and Technology of China(中国科学技术大学) ; Tsinghua University(清华大学) ; Nanyang Technological University(南洋理工大学) ; University of California, Berkeley(加州大学伯克利分校) ; University of Washington(华盛顿大学)
AI总结 本文提出DAG-MoE框架,通过轻量级模块自动学习选定专家之间的最优聚合结构,以替代标准加权求和聚合,从而在不改变专家或路由器的情况下扩展专家组合空间并实现单层多步推理,在预训练和微调中均优于传统MoE基线。
Comments Accepted by ICML 2026
信任函数:通过学习何时信任弱教师实现近乎无损的弱到强泛化
机构 * University of Washington(华盛顿大学)
AI总结 提出信任函数为弱标签分配信任分数并据此过滤弱监督,在多个领域实现近乎无损的弱到强泛化,且能通过迭代链放大收益。
Comments ICML 2026
文本编辑能否泛化到视觉生成?统一多模态模型中的跨模态知识编辑基准
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学) ; University of Toronto(多伦多大学) ; University of Washington(华盛顿大学)
AI总结 提出跨模态知识编辑基准UniKE,发现文本编辑在图像生成中效果显著下降(VQA准确率仅18.5%),并提出推理增强参数编辑方法提升跨模态迁移效果。
Comments Published at ICML 2026; Code and data available at https://github.com/gxx27/UniKE
论大语言模型适应性的局限:模型内化先验对标注任务性能的影响
机构 * University of Washington(华盛顿大学)
AI总结 通过毒性检测实验,研究大语言模型内化先验与指令交互的三个维度,发现近三分之二的零样本错误难以通过提示纠正,并引入定义特定熟悉度(DSF)指标,证明其与性能正相关,而文本记忆指标则无此关联。
Comments Accepted at ICML 2026 (Oral & Spotlight); PMLR vol. 306. 9 pages, 4 figures
Zamba2-VL 技术报告
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Cambridge(剑桥大学) ; University of Washington(华盛顿大学) ; University of Toronto(多伦多大学)
AI总结 提出基于混合架构Zamba2的视觉语言模型Zamba2-VL,在图像理解等基准上媲美Transformer模型,且首次令牌延迟降低约一个数量级。
Comments 16 pages, 2 figures
StressDream: 引导视频世界模型实现鲁棒的策略评估与改进
机构 * Carnegie Mellon University(卡内基梅隆大学) ; NVIDIA Research(NVIDIA研究) ; University of Washington(华盛顿大学) ; Stanford University(斯坦福大学)
AI总结 提出StressDream方法,通过优化扩散视频世界模型的初始噪声,在推理时引导生成高影响且合理的未来场景,以支持鲁棒的策略评估与改进。
Comments Project page: https://junwon.me/StressDream/
TIMEGATE: 资源约束下可持续的限时促销门控用于持续ML适应
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Washington(华盛顿大学)
AI总结 提出TIMEGATE策略层,通过预算时间、标注、训练和评估来管理持续ML适应,实现评估计算节省且无静默错误促销。
PBT-Bench:基于属性测试的AI智能体基准
机构 * Tsinghua University(清华大学) ; University of Washington(华盛顿大学) ; Beneficial AI Foundation(有益人工智能基金会)
AI总结 提出PBT-Bench基准,包含100个基于属性测试的问题,用于评估AI智能体从文档中推导语义不变量并生成输入策略的能力。
面向数据敏感检索增强生成的隐私策略执行护栏
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Washington(华盛顿大学) ; University of Toronto(多伦多大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; University of California, Los Angeles(加州大学洛杉矶分校)
AI总结 针对RAG系统中上下文数据泄露问题,提出基于双单类密度估计器与融合文本嵌入的隐私策略执行框架,在医学、金融和法律领域实现高AUROC和低误报率。
联合音视频生成模型是否理解物理?
机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) ; University of Washington(华盛顿大学) ; University of California, Los Angeles(加州大学洛杉矶分校)
AI总结 针对联合音视频生成模型,提出AV-Phys Bench基准测试其物理常识,发现所有模型在物理一致性上表现不足,尤其是事件驱动和环境驱动转换场景。
Comments Preprint. Project Page: https://zijuncui.com/AV-Phys/. Full abstract appears in the PDF
数学辅导中的效用保持去标识化:MathEd-PII基准数据集中的数值歧义研究
机构 * University of Washington(华盛顿大学)
AI总结 针对数学辅导对话中数值表达式与标识符相似导致过度去标识化的问题,提出MathEd-PII基准数据集,并采用领域感知提示策略(F1达0.821)在保持数据效用的同时有效检测PII。
视觉-语言模型将头部方向误认为注视方向:非语言对话线索
机构 * Brown University(布朗大学) ; Columbia University(哥伦比亚大学) ; Emory University(埃默里大学) ; Johns Hopkins University(约翰霍普金斯大学) ; University of Washington(华盛顿大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Michigan(密歇根大学) ; UC San Diego(圣地亚哥大学)
AI总结 本研究通过控制头部方向的实验发现,视觉-语言模型(VLMs)在推断注视目标时主要依赖头部方向而非眼睛外观,导致与人类存在显著性能差距,并指出数据偏差是主要原因。
Comments Accepted by ACL 2026. Project page at https://zoryzhang.github.io/gaze/
URDF-Anything+:面向仿真就绪铰接资产的端到端生成
机构 * Peking University(北京大学) ; Visual Geometry Group, University of Oxford(牛津大学视觉几何组) ; University of Washington(华盛顿大学)
AI总结 提出URDF-Anything+,一种端到端自回归扩散框架,从单张RGB图像直接生成仿真就绪的URDF模型,统一建模部件几何与铰接结构。
立场:超越敏感属性,机器学习公平性应通过社会决定因素量化结构性不公正
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Cambridge(剑桥大学) ; University of Washington(华盛顿大学) ; University of Michigan(密歇根大学) ; University of Toronto(多伦多大学)
AI总结 本文主张算法公平性研究应超越敏感属性,通过社会决定因素量化结构性不公正,并通过理论模型和实证研究证明仅关注敏感属性的缓解策略可能引入新的结构性不公正。
Comments Accepted to ICML 2026 Position Paper Track
LERD: 用于神经退行性疾病分类的潜在事件-关系动力学
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学) ; University of Washington(华盛顿大学) ; University of California, San Diego(加州大学圣地亚哥分校) ; University of California, Los Angeles(加州大学洛杉矶分校)
AI总结 提出LERD,一种端到端贝叶斯潜在事件-关系动力系统,直接从多通道脑电图推断潜在神经事件及其关系结构,无需事件或交互标注,在阿尔茨海默病分类中优于基线方法并提供生理对齐的动力学摘要。
DuetServe: 通过自适应GPU多路复用协调LLM服务的预填充与解码
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学) ; University of Toronto(多伦多大学) ; University of Washington(华盛顿大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 针对LLM服务中预填充与解码阶段的干扰问题,提出DuetServe框架,通过自适应SM级GPU空间多路复用实现单GPU内的阶段隔离,在保证低延迟的同时提升吞吐量。
ACON:面向长周期LLM智能体的上下文压缩优化
机构 * University of Washington(华盛顿大学)
AI总结 提出ACON框架,通过自然语言空间优化压缩策略,在不微调模型的情况下减少峰值token使用量26-54%并提升任务成功率,同时可蒸馏至小模型。
Comments ICML 2026
利用机器学习实现30天以上的大气可预报性
机构 * University of Washington(华盛顿大学) ; Air Force Institute of Technology(空军技术研究院)
AI总结 通过机器学习模型GraphCast优化初始条件,将确定性天气预报的时效从两周延长至30天以上,平均误差降低86%。