Perplexity Can Miss SAE Feature Damage Under Quantization
量化如何改变可解释特征:语言模型的稀疏自编码器分析
机构 * University of Michigan(密歇根大学)
AI总结 通过稀疏自编码器分析,发现量化导致语言模型中的可解释特征逐渐退化,且任务指标无法完全反映这种损伤,量化与幅度剪枝共享相似的损伤模式。
Comments 12 Pages of Content, Submitted to TMLR
高校专区
量化如何改变可解释特征:语言模型的稀疏自编码器分析
机构 * University of Michigan(密歇根大学)
AI总结 通过稀疏自编码器分析,发现量化导致语言模型中的可解释特征逐渐退化,且任务指标无法完全反映这种损伤,量化与幅度剪枝共享相似的损伤模式。
Comments 12 Pages of Content, Submitted to TMLR
利用场景图扩展机器人模仿学习的时空上下文
机构 * University of Pennsylvania(宾夕法尼亚大学) ; RAI Institute(RAI研究院) ; University of Michigan(密歇根大学)
AI总结 提出使用场景图作为显式结构化记忆机制,通过动态维护对象中心关系及其时间演化,解决机器人模仿学习中的部分可观测性和长时推理问题。
超越搜索的潜在几何:在世界模型中摊销规划
机构 * Department of Robotics, University of Michigan, Ann Arbor(密歇根大学机器人系,安阿伯)
AI总结 提出在正则化潜在几何下,将规划摊销为潜在逆动力学映射,以轻量级GC-IDM替代在线搜索,在七个环境协议中匹配或超越CEM,决策成本降低100-130倍。
Comments 31 pages
Transformer中的注意力汇聚:利用、解释与缓解综述
机构 * Tsinghua University(清华大学) ; Meituan LongCat Team(美团LongCat团队) ; The University of Hong Kong(香港大学) ; University of Michigan(密歇根大学) ; Xiamen University(厦门大学) ; The Ohio State University(俄亥俄州立大学) ; Columbia University(哥伦比亚大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; The Hong Kong Polytechnic University(香港理工大学)
AI总结 本文首次系统综述Transformer中的注意力汇聚现象,从基础利用、机制解释和策略缓解三个维度梳理研究现状,为未来研究提供指导。
MACD:基于反事实数据的模型感知对比解码
机构 * University of Michigan, Ann Arbor, MI, USA(密歇根大学,安娜堡分校) ; University of California San Diego, La Jolla, CA, USA(加州大学圣地亚哥分校)
AI总结 提出MACD方法,利用视频语言模型自身反馈识别导致幻觉的目标区域,生成目标级反事实输入,结合对比解码减少幻觉,提升多模型在复杂场景下的准确性。
基于无监督学习的焦堆相机深度估计
机构 * Center for Ultrafast Optical Science, University of Michigan(超快光学科学中心,密歇根大学) ; University of Michigan(密歇根大学)
AI总结 提出一种基于无监督深度学习的方法,从焦堆相机图像估计深度,在NYU-v2数据集上相比单图像方法显著提高精度。
Journal ref in Conference on Lasers and Electro-Optics, Technical Digest Series (Optica Publishing Group, 2022), paper JW3A.5