VERINA: Benchmarking Verifiable Code Generation
VERINA:可验证代码生成基准测试
机构 * University of California, Berkeley(加州大学伯克利分校) ; Meta FAIR
AI总结 本文提出VERINA基准测试,用于全面评估代码、规范及证明生成能力,揭示LLM在可验证代码生成中的挑战,特别是证明生成的困难。
高校专区
VERINA:可验证代码生成基准测试
机构 * University of California, Berkeley(加州大学伯克利分校) ; Meta FAIR
AI总结 本文提出VERINA基准测试,用于全面评估代码、规范及证明生成能力,揭示LLM在可验证代码生成中的挑战,特别是证明生成的困难。
Fillerbuster:用于随意捕获的统一生成场景补全模型
机构 * Meta Reality Labs ; UC Berkeley(加州大学伯克利分校) ; University of Toronto(多伦多大学)
AI总结 本文提出Fillerbuster,一种统一的生成模型,用于补全3D场景中未知区域。针对随意捕获中稀疏且缺失物体后方或上方内容的问题,模型通过多视图潜在扩散变换器处理大量输入帧,生成未知目标视图并恢复图像姿态。
Comments Project page at https://ethanweber.me/fillerbuster/
消除与救援:残差流超连接的因果分析
机构 * Stanford University(斯坦福大学) ; Georgia Institute of Technology(佐治亚理工学院) ; University of California, Berkeley(加州大学伯克利分校) ; Independent(独立) ; University of Oxford(牛津大学)
AI总结 本文提出首个开源mHC语言模型,通过代表层面指标和因果干预分析多流架构,揭示并行流的信息编码与利用机制,引入系统性的流消除-救援框架进行因果比较。
从梯度到里卡蒂几何:用于单次学习的卡尔曼世界模型
机构 * UC Berkeley School of Information(伯克利大学信息学院)
AI总结 本文提出卡尔曼世界模型(KWM),通过递归贝叶斯滤波而非反向传播优化动态系统,实现无梯度的训练与适应,适用于序列建模任务,展示出竞争性能和增强的鲁棒性与持续适应性。
DOVA:基于协商的多智能体协作以实现自主研究自动化
机构 * University of California, Berkeley, USA(加州大学伯克利分校) ; Amazon Web Services, USA(亚马逊网络服务)
AI总结 DOVA通过协商优先的协作机制、混合协同推理和自适应多层思考,提升多源信息整合与复杂任务处理能力,降低推理成本并提高回答准确性。
大语言模型在双用途生物任务中的新手提升
机构 * Scale AI ; SecureBio ; University of Oxford(牛津大学) ; UC Berkeley(加州大学伯克利分校)
AI总结 研究探讨大语言模型是否能提升新手在生物任务中的表现,通过多模型多基准测试发现LLM显著提升准确性,并指出单用途LLM可能超越辅助新手的表现。
Comments 59 pages, 33 figures
VLD:用于强化学习导航的视觉语言目标距离
机构 * ETH Zurich(苏黎世联邦理工学院) ; EPFL(瑞士联邦理工学院) ; Stanford University(斯坦福大学) ; UC Berkeley(伯克利大学)
AI总结 本文提出VLD学习框架,通过解耦感知学习与策略学习,利用大规模视频数据训练距离预测器,提升机器人导航性能与现实迁移能力。
数据驱动的影响函数用于基于优化的因果推断
机构 * Department of EECS and Statistics(电气工程与计算机科学系和统计学系) ; University of California, Berkeley(加州大学伯克利分校) ; Department of Statistics(统计学系) ; University of Michigan(密歇根大学) ; Department of Data Sciences and Operations(数据科学与运营系) ; University of Southern California, Marshall School of Business(南加州大学马歇尔商学院)
AI总结 本文研究了一种构造性算法,通过有限差分近似统计函数的Gâteaux导数,重点在于因果推断中出现的函数。研究概率分布未知但需从数据估计的情况,并探讨经验、数值和分析Gâteaux导数之间的关系。
Comments Revision
RIGID框架:研究集成、生成式AI介导的课程设计
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 本文提出RIGID框架,整合学习科学研究与课程设计流程,利用生成式AI实现研究与设计的系统集成,提升课程设计的实证性和情境适应性。
自监督语音模型通过位置依赖的正交子空间编码音素上下文
机构 * UT Austin(德克萨斯大学奥斯汀分校) ; UC Berkeley(加州大学伯克利分校) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文研究自监督语音模型如何在单帧层面编码音素及其上下文,提出通过位置依赖的正交子空间实现音素信息的组合编码,揭示了上下文依赖表示的结构特性。
Comments Submitted to Interspeech 2026
OpenVision 3: 一种用于理解和生成的统一视觉编码器家族
机构 * UC Santa Cruz(加州大学圣克ruz分校) ; JHU(约翰霍普金斯大学) ; UNC-Chapel Hill(北卡罗来纳大学教堂山分校) ; UC Berkeley(加州大学伯克利分校) ; NVIDIA(英伟达)
AI总结 本文提出OpenVision 3,通过统一视觉表示实现图像理解和生成。核心架构将VAE压缩的图像潜在特征输入ViT编码器,同时训练其输出以支持重建和语义学习,从而在共享潜在空间中实现良好泛化。
先关注再注意:通过自回归注视实现高效的可扩展视频理解
机构 * UC Berkeley(伯克利大学) ; MIT(麻省理工学院) ; Clarifai(Clarifai公司) ; NVIDIA(英伟达公司)
AI总结 AutoGaze通过自回归选择视频中的关键块,减少冗余并提升处理效率,使大语言模型能处理长视频并取得更优表现。
Comments CVPR 2026. Project page: https://autogaze.github.io/
多语言功能评估用于大语言模型
机构 * The Center for Tech Responsibility, Brown University(布朗大学技术责任中心) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 本文提出跨语言小学数学符号基准和跨语言指令跟随评估,通过多语言翻译功能基准模板,评估大语言模型在多语言环境中的性能和鲁棒性,发现CL-GSM Symbolic和CL-IFEval在多语言任务中表现更优。
Comments This is an updated version with details of the CL-GSM Symbolic and CL-IFEval datasets validation
分词使多模态大语言模型能够理解、生成和编辑建筑平面图
机构 * Tsinghua University(清华大学) ; UC Berkeley(伯克利大学)
AI总结 HouseMind通过引入离散房间实例标记,实现了建筑平面图的统一理解和生成,具备高效且可控的布局生成能力。
Comments 20 pages, 9 figures. Accepted to CVPR 2026
一种基于信任区域内点的随机序列二次规划方法
机构 * Department of Mathematics, University of California, Berkeley(加州大学伯克利分校数学系) ; Department of IEOR, University of California, Berkeley(加州大学伯克利分校工业工程与运营研究系) ; School of Industrial and Systems Engineering, Georgia Tech(佐治亚理工学院工业与系统工程学院) ; Department of EECS, University of California, Berkeley(加州大学伯克利分校电子工程与计算机科学系)
AI总结 本文提出了一种针对随机目标函数和确定性非线性约束的优化方法,结合信任区域内点和随机序列二次规划技术,实现全局收敛性保证。
部分等价强化学习在对称破坏环境中
机构 * School of Mechanical Engineering, Yonsei University, Seoul, South Korea(延世大学机械工程学院,首尔,韩国) ; Department of Artificial Intelligence, Yonsei University, Seoul, South Korea(延世大学人工智能系,首尔,韩国) ; Department of Mechanical Engineering, University of California, Berkeley, United States(加州大学伯克利分校机械工程系,美国)
AI总结 本文提出部分等价强化学习框架,通过选择性应用群不变或标准贝尔曼备份,提升样本效率和泛化能力,适用于对称破坏环境的离散和连续控制任务。
Comments ICLR 2026
链驱动、夹层腿四足机器人:设计与实验分析
机构 * Department of Cyber Physical Systems, Indian Institute of Science(印度科学研究院计算机物理系统系) ; University of Waterloo(滑铁卢大学) ; UC Berkeley(伯克利大学)
AI总结 本文提出了一种低成本、高性能的四足机器人,通过夹层腿结构和双电机配置实现敏捷运动,同时采用低成本制造方法和开源设计,为四足机器人研究提供了一个经济且实用的平台。
Comments 6 pages, 9 figures
设计概率性AI季风预报以指导农业决策
机构 * Development Innovation Lab, University of Chicago(芝加哥大学发展创新实验室) ; University of Chicago(芝加哥大学) ; Department of the Geophysical Sciences, University of Chicago(芝加哥大学地球科学系) ; Data Science Institute, University of Chicago(芝加哥大学数据科学研究所) ; Development Innovation Lab India, University of Chicago Trust(芝加哥大学印度发展创新实验室) ; University of Chicago Trust(芝加哥大学信托) ; Department of Earth and Planetary Science, University of California, Berkeley(加州大学伯克利分校地球与行星科学系) ; University of California, Berkeley(加州大学伯克利分校) ; Climate and Ecosystem Sciences Division, Lawrence Berkeley National Laboratory(伯克利国家实验室气候与生态系统科学部) ; Department of Economics, University of Chicago(芝加哥大学经济学系)
AI总结 本研究提出一种基于决策理论的框架,通过结合AI天气模型和演变农民期望模型,提升季风预报的准确性,以帮助印度农民做出更有效的农业决策。
通过自我反思 jailbreak 大型语言模型:JULI
机构 * University of Southern California(南加州大学) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 JULI 通过操纵令牌日志概率,利用微小插件块 BiasNet 实现对 API 调用 LLMs 的 jailbreak,无需模型权重或生成过程权限,且在黑盒环境下有效。
Comments Accepted to ICLR 2026
质量优于数量:通过影响函数进行演示数据的 curated
机构 * KAIST(韩国科学技术院) ; University of California, Berkeley(加州大学伯克利分校) ; New York University(纽约大学)
AI总结 本文提出 QoQ 方法,通过影响函数识别高质量演示数据,提升机器人学习性能。
Comments Accepted to ICRA 2026, 8 pages
EgoMI: 从第一人称人类演示中学习主动视觉和全身操作
机构 * UC Berkeley(伯克利大学)
AI总结 EgoMI通过同步捕捉头部和末端执行器轨迹,实现从第一人称人类演示中学习主动视觉与全身操作,有效弥合人机身体差距,提升半人形机器人模仿学习性能。
增强的组合结构生成:近似难度
机构 * University of California, Berkeley(加州大学伯克利分校) ; Google DeepMind(谷歌DeepMind) ; Google(谷歌)
AI总结 利用AI方法在复杂性理论中取得进展,改进MAX-CUT、MAX-3-CUT和TSP的近似难度结果。
控制你的转移:用于许多小数据集的聚类转移残差学习
机构 * Harvard University(哈佛大学) ; Stanford University(斯坦福大学) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 CTRL通过结合跨域残差学习和自适应聚类,提升多源小数据集的预测准确性和源异质性保持能力。
BioGait-VLM:一种多模态视觉-语言-生物力学框架用于可解释的临床步态评估
机构 * Department of Computer Science, Drexel University(德克萨斯大学计算机科学系) ; Department of Neurological Surgery, Washington University(华盛顿大学神经外科系) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 BioGait-VLM通过多模态框架提升临床步态评估的可解释性和准确性,结合生物力学标记与时间动态分析,实现更可靠的病理运动识别。
上下文强化学习用于大型语言模型中的工具使用
机构 * National University of Singapore(新加坡国立大学) ; Salesforce AI Research(Salesforce AI研究) ; University of California Berkeley(加州大学伯克利分校) ; University of California, Santa Cruz(加州大学圣克ruz分校)
AI总结 本文提出ICRL框架,通过强化学习无需微调即可实现大型语言模型的工具使用能力,实验显示其在推理和工具任务中表现优异。
HybridStitch: 像素和时间步级模型拼接用于扩散加速
机构 * University of Waterloo(多伦多大学) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 HybridStitch通过结合大模型和小模型,实现T2I生成的高效加速,提升Stable Diffusion 3的生成速度1.83倍。
为AI训练调度并行光电路交换机
机构 * UC San Diego(UC圣地亚哥大学) ; Technion(技术学院) ; UC Berkeley(伯克利大学)
AI总结 Spectra通过分解、负载感知调度和受控排列分割,有效调度AI训练流量矩阵,显著降低调度时间并接近理论下限。
具有瞬时速度约束的一步动作生成均流策略
机构 * School of Vehicle and Mobility & College of AI, Tsinghua University(车辆与移动学院及人工智能学院,清华大学) ; Berkeley AI Research (BAIR), UC Berkeley(伯克利人工智能研究(BAIR),加州大学伯克利分校) ; The University of Hong Kong(香港大学)
AI总结 本文提出均速度策略(MVP),通过引入瞬时速度约束来提升动作生成效率,实现高效的一步动作生成并在机器人操作任务中取得最佳性能。
Comments ICLR Oral Presentation
代理AI的适应:训练后、记忆和技能的综述
机构 * UIUC(伊利诺伊大学香槟分校) ; Stanford(斯坦福大学) ; Princeton(普林斯顿大学) ; Harvard(哈佛大学) ; UC Berkeley(加州大学伯克利分校) ; Caltech(加州理工学院) ; UCSD(加州大学圣地亚哥分校) ; Georgia Tech(佐治亚理工学院) ; Northwestern(西北大学) ; TAMU(德克萨斯大学奥斯汀分校) ; MGH(麻省总医院) ; Keiji AI ; Unity
AI总结 本文综述了代理AI在训练后、记忆和技能方面的适应方法,提出四范式框架,分析了代理与工具适应的技术细节及权衡,探讨了开放问题。
人形机器人接触规划的视角世界模型
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Michigan, Ann Arbor(密歇根大学安娜堡分校) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 本文提出了一种结合学习世界模型与MPC的框架,用于提升人形机器人在复杂环境中的接触规划能力,实现更高效和稳健的多任务执行。