Long Context, Less Focus: A Scaling Gap in LLMs Revealed through Privacy and Personalization
长上下文,少关注:通过隐私和个性化揭示LLM中的缩放差距
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 本文通过PAPerBench基准测试揭示了LLM在长上下文情况下个性化和隐私保护性能下降的缩放差距,分析了注意力稀释的理论机制。
高校专区
长上下文,少关注:通过隐私和个性化揭示LLM中的缩放差距
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 本文通过PAPerBench基准测试揭示了LLM在长上下文情况下个性化和隐私保护性能下降的缩放差距,分析了注意力稀释的理论机制。
局部自适应多目标学习
机构 * University of California, Berkeley(加州大学伯克利分校) ; Inria(法国国家信息与自动化研究所)
AI总结 本文提出一种局部自适应多目标学习方法,通过替换部分算法提升预测的公平性和鲁棒性。
Comments Code is available at https://github.com/jivatneet/adaptive-multiobjective
KernelBlaster: 通过记忆增强的上下文强化学习实现持续的跨任务CUDA优化
机构 * NVIDIA ; University of California, Berkeley(加州大学伯克利分校)
AI总结 KernelBlaster通过记忆增强的上下文强化学习框架提升CUDA代码优化性能,实现跨多个GPU架构世代的高效优化。
Comments 15 pages, 33 pages with appendix
令牌隐藏奖励:在组相对深度强化学习中引导探索-利用
机构 * University of British Columbia(不列颠哥伦比亚大学) ; Vector Institute(向量研究所) ; Amii(阿米人工智能研究所) ; UC Berkeley(加州大学伯克利分校)
AI总结 令牌隐藏奖励通过调整组相对策略优化的学习信号,引导探索-利用平衡,提升大语言模型在推理任务中的表现。
Comments Full version of submission to 2nd AI for Math Workshop@ ICML 2025 (best paper)
Story-Iter: 一种无需训练的迭代方法用于长故事可视化
机构 * UC Santa Cruz(加州大学圣克鲁兹分校) ; Rice University(德克萨斯大学里士满分校) ; Singapore Institute of Technology(新加坡科技学院) ; UC Berkeley(加州大学伯克利分校) ; Apple(苹果公司)
AI总结 Story-Iter提出一种无需训练的迭代方法,通过全局参考交叉注意力模块实现长故事可视化中的语义一致性和细粒度交互优化。
Comments 31 pages, 33 figures, The project page and associated code can be accessed via https://jwmao1.github.io/storyiter/
当注意力崩溃:LLMs中的退化层如何使小型模型更强大
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; New York University(纽约大学) ; UC Berkeley(伯克利加州大学)
AI总结 Inheritune通过继承预训练模型的早期层来构建更小但更强的语言模型,实现模型压缩与性能的平衡。
Comments Published in Transactions on Machine Learning Research (TMLR)
AsyncVLA: 一种异步VLA用于边缘设备上的快速稳健导航
机构 * University of California, Berkeley(加州大学伯克利分校) ; Toyota Motor North America(丰田汽车北美公司) ; Princeton University(普林斯顿大学)
AI总结 AsyncVLA通过异步框架结合远程大模型与本地轻量级模块,实现边缘设备上的高效稳健导航,成功率达40%。
Comments 13 pages, 9 figures, 2 tables
为何偏好归一化?针对在重尾噪声下的随机预条件SGD的最坏情况复杂性理论
机构 * Department of Mathematics, University of California, Berkeley, CA, USA(加州大学伯克利分校数学系) ; Department of EECS, University of California, Berkeley, CA, USA(加州大学伯克利分校电子工程与计算机科学系) ; Department of IEOR, University of California, Berkeley, CA, USA(加州大学伯克利分校工业工程与运营研究系)
AI总结 本文提出针对重尾噪声下的随机预条件SGD的最坏情况复杂性理论,证明归一化在收敛速率上优于裁剪,解释了大规模训练中归一化的偏好。
如何训练你的电阻网络:通用平衡传播与解析学习
机构 * Ming Hsieh Department of Electrical and Computer Engineering, University of Southern California, Los Angeles, CA, USA(明希德电气与计算机工程系,南加州大学,洛杉矶,加利福尼亚州,美国) ; Center for Nonlinear Studies, Los Alamos National Laboratory, Los Alamos, New Mexico 87545, USA(非线性研究中心,洛斯阿拉莫斯国家实验室,洛斯阿拉莫斯,新墨西哥州,美国) ; Theoretical Division (T4), Los Alamos National Laboratory, Los Alamos, New Mexico 87545, USA(理论部(T4),洛斯阿拉莫斯国家实验室,洛斯阿拉莫斯,新墨西哥州,美国) ; CAI-3, Los Alamos National Laboratory, Los Alamos, New Mexico 87545, USA(CAI-3,洛斯阿拉莫斯国家实验室,洛斯阿拉莫斯,新墨西哥州,美国) ; University of California, Berkeley, Berkeley, CA, 94720, USA(加州大学伯克利分校,伯克利,加利福尼亚州,美国) ; Department of Physics, University of Pisa, Largo Bruno Pontecorvo 3, 56127 Pisa, Italy(物理学系,比萨大学,布鲁诺·蓬泰科罗夫大道3号,比萨,意大利)
AI总结 本文提出了一种基于图论和解析框架的算法,用于精确计算电阻网络的梯度,实现高效训练,无需复制或读出,且能局部更新电阻值以提升性能。
Comments 8 pages double column; plus 16 supp mat.;
ROMA:递归开放元代理框架用于长周期多代理系统
机构 * Sentient ; Virginia Tech(弗吉尼亚理工大学) ; UC Berkeley(加州大学伯克利分校) ; UC San Diego(加州大学圣地亚哥分校) ; University of Maryland(马里兰大学)
AI总结 ROMA通过递归任务分解和结构化聚合,实现长周期多代理系统的高效推理和生成性能。