Generating metamers of human scene understanding
生成人类场景理解的元物
机构 * Stony Brook University(史泰文布魯克大學) ; UC Berkeley(加州大學伯克利分校)
AI总结 本文提出MetamerGen,一种结合外围和注视信息生成与人类场景理解一致的图像的潜在扩散模型,通过双流表示实现视网膜输入的图像合成,并通过行为实验验证其对潜在场景表示的感知一致性。
高校专区
生成人类场景理解的元物
机构 * Stony Brook University(史泰文布魯克大學) ; UC Berkeley(加州大學伯克利分校)
AI总结 本文提出MetamerGen,一种结合外围和注视信息生成与人类场景理解一致的图像的潜在扩散模型,通过双流表示实现视网膜输入的图像合成,并通过行为实验验证其对潜在场景表示的感知一致性。
K-Function:儿童语言功能的联合发音转录与评估反馈
机构 * Zhejiang University(浙江大学) ; UC Berkeley(加州大学伯克利分校) ; Duke University(达特茅斯大学) ; SCUT(上海交通大学) ; TVT ; UCSF(加州大学旧金山分校)
AI总结 K-Function通过结合子词转录与LLM评分,提升儿童语音识别精度,实现高效的语言功能评估。
Comments Accepted to 2026 ICASSP
JUCAL: 在分类任务中联合校准偶然不确定性和本质不确定性
机构 * UC Berkeley(加州大学伯克利分校) ; ETH Zurich(苏黎世联邦理工学院) ; UBS Zurich(瑞士联合银行 Zurich 分部) ; Kaiju Worldwide(Kaiju 全球)
AI总结 JUCAL通过联合校准偶然和本质不确定性,提升分类任务中预测不确定性的准确性。
Comments 11 pages + appendix. Preliminary version of an ongoing project that will be expanded with furhter evaluations
AdaEvolve: 基于自适应LLM的零阶优化
机构 * University of California, Berkeley(加州大学伯克利分校) ; Bespoke Labs
AI总结 AdaEvolve通过自适应优化框架提升LLM驱动的零阶优化性能,有效解决搜索过程中的非平稳动态问题。
StyleStream: 实时零样本语音风格转换
机构 * UC Berkeley(伯克利大学)
AI总结 StyleStream通过Destylizer和Stylizer实现实时零样本语音风格转换,采用非自回归架构,端到端延迟仅1秒。
青少年能否欺骗AI?评估低成本的外貌攻击对年龄估计系统的影响
机构 * Reality Inc ; UC Berkeley(伯克利大学) ; Duke University(杜克大学) ; Georgia Tech(佐治亚理工学院) ; UNC Chapel Hill(北卡罗来纳大学教堂山分校) ; UC San Diego(南加州大学)
AI总结 研究评估了低成本外貌攻击对年龄估计系统的影响,发现合成胡须等修改可使AI将未成年人误判为成年人,视觉-语言模型的鲁棒性略低于专门模型。
Comments 13 pages, 6 figures
WildOS: 野外环境中的开放词汇物体搜索
机构 * Jet Propulsion Laboratory(喷气推进实验室) ; California Institute of Technology(加州理工学院) ; Swiss Federal Institute of Technology(瑞士联邦理工学院) ; ETH Zürich(苏黎世联邦理工学院) ; FieldAI Inc.(FieldAI公司) ; Stanford University(斯坦福大学) ; University of California Berkeley(加州大学伯克利分校)
AI总结 WildOS通过结合安全几何探索与语义视觉推理,实现野外环境中的开放词汇物体搜索,显著提升导航效率和自主性。
Comments 28 pages, 16 figures, 2 tables
TxRay:活区块链攻击的代理事后分析
机构 * Decentralized Intelligence AG(去中心化智能AG) ; The University of Sydney(悉尼大学) ; University of Warwick(沃里克大学) ; University of California, Berkeley(加州大学伯克利分校) ; University College London(伦敦大学学院)
AI总结 TxRay通过代理系统利用LLM和工具调用,从有限证据中重建活区块链攻击,生成可执行的PoC并验证根本原因,提升攻击分析效率和覆盖范围。
Comments 24 pages, 8 figures
基于ML代理的HPC驱动建模用于混合量子系统中磁子-光子动力学
机构 * Simon Fraser University(西蒙弗雷泽大学) ; Lawrence Berkeley National Laboratory(伯克利劳伦斯国家实验室) ; Konan University(konan大学) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; International Computer Science Institute(国际计算机科学研究所) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 本文提出基于ML代理的HPC驱动建模方法,用于高效模拟混合量子系统中的磁子-光子动力学,实现多尺度和多物理问题的高保真模拟与快速原型设计。
算子层面的非对数凹采样量子加速
机构 * Simons Institute for the Theory of Computing, University of California, Berkeley, USA(Simons理论计算研究所,加州大学伯克利分校) ; Department of Mathematics, University of California, Berkeley, USA(加州大学伯克利分校数学系) ; Department of Mathematics, University of Michigan, Ann Arbor, USA(密歇根大学安娜堡分校数学系) ; Applied Mathematics and Computational Research Division, Lawrence Berkeley National Laboratory, Berkeley, USA(伯克利国家实验室应用数学与计算研究部)
AI总结 该研究提出首个量子算法,通过算子层面的方法实现非对数凹采样任务的高效加速,显著提升了经典方法在复杂分布下的性能。
Comments 48 pages, 8 figures
Journal ref Proceedings of the National Academy of Sciences 123(8), e2512789123 (2026)
Landscaper:通过多维拓扑分析理解损失景观
机构 * Arizona State University(亚利桑那州立大学) ; University of California Berkeley(加州大学伯克利分校) ; Lawrence Berkeley National Laboratory(伯克利国家实验室) ; Dartmouth College(达特茅斯学院) ; International Computer Science Institute(国际计算机科学研究所)
AI总结 Landscaper通过多维拓扑分析揭示损失景观的几何结构,利用SMAD度量景观平滑度,提升模型诊断与架构设计能力。
具有类似冯·诺依曼架构的高维计算架构的自主学习
机构 * Redwood Center for Theoretical Neuroscience University of California at Berkeley(红木中心理论神经科学研究所 加州大学伯克利分校)
AI总结 本文提出了一种基于高维向量的计算架构,旨在模拟人类和动物的学习过程,结合心理学、生物学和传统计算,探索更高效、低能耗的计算方法。
Comments 20 pages including references, all contained in a single .tex file
vCache: 验证的语义提示缓存
机构 * University of California, Berkeley(加州大学伯克利分校) ; Technical University of Munich(慕尼黑技术大学) ; ETH Zurich(苏黎世联邦理工学院) ; Stanford University(斯坦福大学)
AI总结 vCache是一种具有用户定义误差率保证的验证语义缓存,通过在线学习算法动态优化阈值,实现更高的缓存命中率和更低的错误率。
Comments ICLR 2026 (accepted)
Robo-Saber:生成和模拟虚拟现实玩家
机构 * Aalto University(阿alto大学) ; University of California, Berkeley(加州大学伯克利分校) ; NVIDIA ; Simon Fraser University(西蒙弗雷泽大学)
AI总结 Robo-Saber通过生成和模拟虚拟现实玩家行为,为VR游戏测试提供了一种基于风格范例和数据集训练的运动生成系统。
Comments 13 pages, 15 figures. Accepted to Eurographics 2026. Project page: https://robo-saber.github.io/
MePoly:最大熵多项式策略优化
机构 * University of Michigan, Ann Arbor(密歇根大学,安阿伯分校) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 MePoly通过多项式能量模型实现最大熵策略优化,有效捕捉复杂非凸流形并在多种基准上优于基线方法。
逻辑回归中最大似然估计的有限样本性能
机构 * Department of Statistics, University of California, Berkeley, USA(加州大学伯克利分校统计学系) ; Department of Statistics, CREST/ENSAE Paris, Palaiseau, France(巴黎中央银行与应用经济学院统计学系)
AI总结 本文研究了逻辑回归中最大似然估计的有限样本性能,分析了其存在性和准确性,并在不同数据条件下提供了非渐近保证。
Comments Minor revision
线性与二次注意力模型中的上下文学习:在回归任务上的实证研究
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 本文通过实证研究比较了线性与二次注意力模型在回归任务中的上下文学习表现,分析了模型深度对性能的影响,并揭示了两者在ICL任务中的异同。
MolmoSpaces: 一个大规模的开放式生态系统用于机器人导航与操作
机构 * Allen Institute for AI(艾伦人工智能研究所) ; University of Washington(华盛顿大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 MolmoSpaces是一个大规模开放式生态系统,用于支持机器人导航与操作的大规模基准测试,包含230k多样化的室内环境和130k丰富标注的物体资产,通过8个任务的基准测试验证了其在仿真到现实中的强相关性。
EgoScale:利用多样化的视点人类数据进行规模化灵巧操作
机构 * NVIDIA ; University of California, Berkeley(加州大学伯克利分校) ; University of Maryland(马里兰大学)
AI总结 EgoScale通过大规模视点人类数据训练视觉语言动作模型,实现高效的灵巧操作转移,提升机器人任务成功率54%。
超宽频时间到达室内定位:从传感器布置到系统评估
机构 * University of Toronto(多伦多大学) ; University of California Berkeley(加州大学伯克利分校)
AI总结 本文提出从系统级视角构建UWB TDOA定位系统,通过现实实验验证其精度和鲁棒性,提供传感器布置优化和实际部署的完整流程。
赋予数据代理以部落知识
机构 * UC Berkeley(伯克利大学)
AI总结 Tk-Boost通过积累经验纠正NL2SQL代理的误解,提升其在大规模数据库中的查询准确性。
量化扩散模型的先验不确定性
机构 * Berkeley Lab & ICSI(伯克利实验室与ICS实验室) ; UC Berkeley & ICSI(加州大学伯克利分校与ICS实验室) ; Berkeley Lab(伯克利实验室) ; New York University(纽约大学)
AI总结 本文提出FLARE方法,通过基于信息量的随机近似技术,有效分离扩散模型的先验不确定性,提升生成数据的可信度评估。
Comments Will appear in the Proceedings of the 29th International Conference on Artificial Intelligence and Statistics (AISTATS) 2026
长上下文,少关注:通过隐私和个性化揭示LLM中的缩放差距
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 本文通过PAPerBench基准测试揭示了LLM在长上下文情况下个性化和隐私保护性能下降的缩放差距,分析了注意力稀释的理论机制。
局部自适应多目标学习
机构 * University of California, Berkeley(加州大学伯克利分校) ; Inria(法国国家信息与自动化研究所)
AI总结 本文提出一种局部自适应多目标学习方法,通过替换部分算法提升预测的公平性和鲁棒性。
Comments Code is available at https://github.com/jivatneet/adaptive-multiobjective
KernelBlaster: 通过记忆增强的上下文强化学习实现持续的跨任务CUDA优化
机构 * NVIDIA ; University of California, Berkeley(加州大学伯克利分校)
AI总结 KernelBlaster通过记忆增强的上下文强化学习框架提升CUDA代码优化性能,实现跨多个GPU架构世代的高效优化。
Comments 15 pages, 33 pages with appendix
令牌隐藏奖励:在组相对深度强化学习中引导探索-利用
机构 * University of British Columbia(不列颠哥伦比亚大学) ; Vector Institute(向量研究所) ; Amii(阿米人工智能研究所) ; UC Berkeley(加州大学伯克利分校)
AI总结 令牌隐藏奖励通过调整组相对策略优化的学习信号,引导探索-利用平衡,提升大语言模型在推理任务中的表现。
Comments Full version of submission to 2nd AI for Math Workshop@ ICML 2025 (best paper)
Story-Iter: 一种无需训练的迭代方法用于长故事可视化
机构 * UC Santa Cruz(加州大学圣克鲁兹分校) ; Rice University(德克萨斯大学里士满分校) ; Singapore Institute of Technology(新加坡科技学院) ; UC Berkeley(加州大学伯克利分校) ; Apple(苹果公司)
AI总结 Story-Iter提出一种无需训练的迭代方法,通过全局参考交叉注意力模块实现长故事可视化中的语义一致性和细粒度交互优化。
Comments 31 pages, 33 figures, The project page and associated code can be accessed via https://jwmao1.github.io/storyiter/
当注意力崩溃:LLMs中的退化层如何使小型模型更强大
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; New York University(纽约大学) ; UC Berkeley(伯克利加州大学)
AI总结 Inheritune通过继承预训练模型的早期层来构建更小但更强的语言模型,实现模型压缩与性能的平衡。
Comments Published in Transactions on Machine Learning Research (TMLR)
AsyncVLA: 一种异步VLA用于边缘设备上的快速稳健导航
机构 * University of California, Berkeley(加州大学伯克利分校) ; Toyota Motor North America(丰田汽车北美公司) ; Princeton University(普林斯顿大学)
AI总结 AsyncVLA通过异步框架结合远程大模型与本地轻量级模块,实现边缘设备上的高效稳健导航,成功率达40%。
Comments 13 pages, 9 figures, 2 tables
为何偏好归一化?针对在重尾噪声下的随机预条件SGD的最坏情况复杂性理论
机构 * Department of Mathematics, University of California, Berkeley, CA, USA(加州大学伯克利分校数学系) ; Department of EECS, University of California, Berkeley, CA, USA(加州大学伯克利分校电子工程与计算机科学系) ; Department of IEOR, University of California, Berkeley, CA, USA(加州大学伯克利分校工业工程与运营研究系)
AI总结 本文提出针对重尾噪声下的随机预条件SGD的最坏情况复杂性理论,证明归一化在收敛速率上优于裁剪,解释了大规模训练中归一化的偏好。