arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of California, Berkeley(加州大学伯克利分校)

共收录 1884
2605.22814 2026-05-22 cs.LG

Remember to be Curious: Episodic Context and Persistent Worlds for 3D Exploration

记住保持好奇:用于3D探索的片段上下文和持久世界

Lily Goli, Justin Kerr, Daniele Reda, Alec Jacobson, Andrea Tagliasacchi, Angjoo Kanazawa

机构 * University of Toronto(多伦多大学) UC Berkeley(加州大学伯克利分校) Wayve Vector Institute(向量研究所) Simon Fraser University(西蒙 Fraser大学)

AI总结 本研究提出了一种基于好奇心驱动强化学习的方法,通过引入持久世界模型和片段上下文来解决3D环境中稀疏奖励长周期任务中的探索问题,实验表明该方法在HM3D数据集上优于基于强化学习的主动映射基线,并能泛化到Gibson和AI生成的世界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21680 2026-05-22 cs.RO

Flying Together: Human-Guided Immersive Shared Control for Aerial Robot Teams in Unknown Environments

Flying Together: Human-Guided Immersive Shared Control for Aerial Robot Teams in Unknown Environments

Lou De Bel-Air, Luca Morando, Ruitao Chen, Keru Wang, Benjamin Jarvis, Charbel Toumieh, Yang Zhou, Ken Perlin, Dario Floreano, Giuseppe Loianno

机构 * New York University(纽约大学) Ecole Polytechnique Federale de Lausanne(洛桑联邦理工学院) University of California Berkeley(加州大学伯克利分校)

AI总结 本文提出了一种基于虚拟现实的共享控制框架,用于在约束和未知环境中操作无人机团队,通过实时用户引导探索,提升在无结构环境中的自主导航能力。核心方法是一种基于用户引导的运动原语规划器,结合阻抗控制器,使操作员能够灵活影响团队行为并引导无人机前往自主规划器可能忽略的感兴趣区域。

Comments Accepted at IEEE International Conference in Robotics and Automation, Vienna 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21625 2026-05-22 cs.CV cs.AI cs.CL

Flat-Pack Bench: Evaluating Spatio-Temporal Understanding in Large Vision-Language Models through Furniture Assembly

Flat-Pack Bench: 通过家具组装评估大视觉-语言模型的时空理解

Aditya Chetan, Eric Cai, Peeyush Kushwaha, Bharath Raj Nagoor Kani, Utkarsh Mall, Qianqian Wang, Noah Snavely, Bharath Hariharan

机构 * Cornell University(康奈尔大学) Cornell Tech(康奈尔科技) MBZUAI(麦吉尔-伯克利-浙江大学人工智能研究院) UC Berkeley(伯克利大学)

AI总结 本文提出Flat-Pack Bench基准,用于评估大视觉-语言模型在复杂视频场景中的时空理解能力,发现当前模型在细粒度时空推理上存在显著不足。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06115 2026-05-22 stat.ML cs.IT cs.LG math.IT math.PR

On Statistical Estimation of Edge-Reinforced Random Walks

关于边缘增强随机游走的统计估计

Qinghua, Ding, Venkat Anantharam

机构 * Department of Electrical Engineering and Computer Sciences(电气工程与计算机科学系) University of California at Berkeley(加州大学伯克利分校)

AI总结 本文研究了边缘增强随机游走初始边权重的统计估计问题,利用随机环境中的超几何高斯结构来分析估计器的样本复杂性。

Comments This is the full version of the conference paper in submission to ISIT 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02776 2026-05-22 cs.LG stat.AP

Deep learning-based modularized loading protocol for parameter estimation of Bouc-Wen class models

基于深度学习的模块化加载协议用于Bouc-Wen类模型参数估计

Sebin Oh, Junho Song, Taeyong Kim

机构 * Department of Civil and Environmental Engineering, University of California, Berkeley, CA, United States(加州大学伯克利分校土木与环境工程系) Department of Civil Systems Engineering, Ajou University, Suwon, Republic of Korea(全州大学土木系统工程系)

AI总结 本文提出了一种基于深度学习的模块化加载协议,用于优化Bouc-Wen类模型的参数估计。该协议包含两个关键部分:最优加载历史构建和基于CNN的快速参数估计。每个部分被分解为独立的子模块,针对不同的滞回行为(基本滞回、结构退化和咬合效应),使协议能够适应多种滞回模型。三种独立的CNN架构被开发出来以捕捉这些滞回行为的路径依赖性。通过在多样化的加载历史上训练这些CNN架构,识别出最小的加载序列,称为加载历史模块,并将其组合以构建最优的加载历史。三种训练好的CNN模型用作快速参数估计器。协议的数值评估,包括三栋钢结构框架的非线性时间历史分析和三栋钢筋混凝土框架的脆弱性曲线构建,表明该协议显著减少了总分析时间,同时保持或提高了估计精度。该协议可扩展到其他滞回模型,表明了一种系统的方法来识别通用滞回模型。

Journal ref Engineering Structures 339, 120458 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14737 2026-05-21 cs.CV

Free-Grained Hierarchical Visual Recognition

自由粒度层次视觉识别

Seulki Park, Zilin Wang, Stella X. Yu

机构 * University of Michigan(密歇根大学) UC Berkeley(伯克利大学)

AI总结 本文研究了在现实世界中标签不完整且粒度混合的情况下,如何进行层次视觉识别。通过引入自由粒度训练方法,结合文本监督和半监督学习,改进了传统层次方法在不完整监督下的性能,并提出了自由粒度推理机制以适应不同预测深度的需求。

Comments Accepted to CVPR 2026. 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20625 2026-05-21 eess.SY cs.MA cs.RO cs.SY

Time-To-Reach Separation and Safety Filtering for Safe, Fair, and Efficient Multi-Agent Coordination

时间到达分离与安全过滤用于安全、公平和高效的多智能体协调

Matthew Low, Jasmine Jerry Aloor, Victoria Marie Tuck, Pierluigi Nuzzo, Jason J. Choi

机构 * Department of Electrical Engineering and Computer Sciences, University of California, Berkeley(加州大学伯克利分校电子工程与计算机科学系) Department of Aeronautics and Astronautics, Massachusetts Institute of Technology(麻省理工学院航空与航天系) GRASP Laboratory, University of Pennsylvania(宾夕法尼亚大学GRASP实验室) Department of Electrical and Computer Engineering, University of California, Los Angeles(加州大学洛杉矶分校电子与计算机工程系)

AI总结 本文提出了一种多智能体协调框架,利用最小时间到达(TTR)作为统一指标用于优先级分配、时间分离和安全过滤,以协调多个空中车辆进入空中走廊并保持车辆间安全分离。

Comments 9 pages, 3 figures. Extended version (including appendix) of a paper submitted to the 65th IEEE Conf. on Decision and Control (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19138 2026-05-21 cs.RO cs.AI cs.LG

COBALT: Crowdsourcing Robot Learning via Cloud-Based Teleoperation with Smartphones

COBALT: 通过基于云的远程操作利用智能手机进行机器人学习

Ayush Agarwal, Ansh Gandhi, Jeremy A. Collins, Omar Rayyan, Aryan Sarswat, Ranjani Koushik, Masoud Moghani, Ajay Mandlekar, Animesh Garg

机构 * Georgia Institute of Technology(佐治亚理工学院) University of California, Berkeley(加州大学伯克利分校) New York University Abu Dhabi (NYUAD)(纽约大学阿布扎克分校) University of Toronto(多伦多大学) NVIDIA(英伟达)

AI总结 本文提出COBALT平台,通过基于云的远程操作技术,利用智能手机等设备大规模收集高质量的机器人学习数据,提高仿真实验和现实世界中的机器人学习效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15691 2026-05-21 cs.LG

SEED: Targeted Data Selection by Weighted Independent Set

SEED:通过加权独立集实现目标数据选择

Yuan Zhang, Lifeng Guo, Junwen Pan, Wenzhao Zheng, Wen Zhou, Kuan Cheng, Kurt Keutzer, Shanghang Zhang

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) Beijing University of Posts and Telecommunications(北京邮电大学) Tianjin University(天津大学) EECS, UC Berkeley(伯克利大学电子工程与计算机科学系) Chinese Academy of Sciences(中国科学院)

AI总结 本文提出SEED方法,通过将数据选择问题建模为加权独立集(WIS)在相似性图上,解决样本质量与多样性之间的平衡问题,并引入节点价值校准和局部尺度归一化来提升数据选择的鲁棒性和可扩展性。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27747 2026-05-21 cs.CV cs.AI

AI-Powered Facial Mask Removal Is Not Suitable For Identification

基于AI的面部遮挡去除并不适合识别

Emily A Cooper, Hany Farid

机构 * Herbert Wertheim School of Optometry & Vision Science University of California, Berkeley(赫伯特·韦瑟姆视觉科学学院,加州大学伯克利分校) School of Information University of California, Berkeley(信息学院,加州大学伯克利分校)

AI总结 本文研究了基于AI的面部遮挡去除技术的有效性和风险,探讨其在真实身份匹配中的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06500 2026-05-21 cs.LG

Can Microcanonical Langevin Dynamics Leverage Mini-Batch Gradient Noise?

微 canonical 动力学能否利用小批量梯度噪声?

Emanuel Sommer, Kangning Diao, Jakob Robnik, Uros Seljak, David Rügamer

机构 * Department of Statistics, LMU Munich(统计系,慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Department of Physics, University of California, Berkeley(伯克利大学物理系) Department of Astronomy, Tsinghua University(清华大学天文系) Physics Division, Lawrence Berkeley National Lab(伯克利国家实验室物理部)

AI总结 本文研究了微 canonical 动力学能否有效利用小批量梯度噪声,提出了一种梯度噪声预条件化方案和能量方差基于的自适应调节器,从而开发出一种鲁棒且可扩展的微 canonical 采样器,实现了在高维推断任务中的最佳性能。

Comments In Proceedings of the 43rd International Conference on Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20187 2026-05-21 cs.LG cs.AI cs.IT math.IT

Neural Estimation of Pairwise Mutual Information in Masked Discrete Sequence Models

在遮蔽离散序列模型中神经估计成对互信息

Jai Sharma, Yifan Wang, Bryan Li

机构 * University of California, Berkeley, CA, USA(加州大学伯克利分校)

AI总结 本文提出了一种神经框架,直接从预训练的遮蔽扩散模型(MDMs)的隐藏状态中估计成对条件互信息(MI),利用模型自身条件分布计算的地面真实MI进行监督,从而捕捉模型内部对依赖结构的信念,并在单次前向传递中预测完整的MI矩阵,实现MI引导的并行解码。

Comments 6 pages, 3 figures; submitting to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17140 2026-05-21 cs.CV cs.AI cs.CL

UCSF-PDGM-VQA: Visual Question Answering dataset for brain tumor MRI interpretation

UCSF-PDGM-VQA: 用于脑肿瘤MRI解读的视觉问答数据集

Shiv Ghosh, Junayd Lateef, Chih-Hua Liu, Yannan Yu, Andreas M. Rauschecker, Madhumita Sushil

机构 * Fung Institute for Engineering Leadership(工程领导力基金会) University of California, Berkeley(加州大学伯克利分校) Department of Radiology(放射科) University of California, San Francisco(加州大学旧金山分校) Division of Clinical Informatics and Digital Transformation(临床信息学与数字转型部) Department of Neurological Surgery(神经外科部)

AI总结 本文提出一个临床相关的视觉问答基准数据集UCSF-PDGM-VQA,包含2387个问题-答案对,用于评估视觉语言模型在处理多序列3D MRI扫描中的能力,发现现有模型在多模态处理上存在缺陷。

Comments 10 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20174 2026-05-20 cs.CV cs.LG

Multi-axis Analysis of Image Manipulation Localization

多轴分析图像操纵定位

Keanu Nichols, Divya Appapogu, Giscard Biamby, Dina Bashkirova, Anna Rohrbach, Bryan A. Plummer

机构 * Boston University(波士顿大学) University of California, Berkeley(加州大学伯克利分校) Technical University of Darmstadt(德累斯顿技术大学)

AI总结 本文提出AUDITS基准,用于多轴分析图像操纵检测,通过不同领域转移类型评估现有方法的鲁棒性,以推动更可靠和通用的图像操纵检测方法的发展。

Comments 28 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20138 2026-05-20 cs.RO cs.SY eess.SY

Hamilton--Jacobi Reachability for Spacecraft Collision Avoidance

航天器碰撞避免的Hamilton-Jacobi可达性

Larry Hui, Jordan Kam, William Su, Jianshu Zhou

机构 * Department of Mechanical Engineering, University of California, Berkeley(加州大学伯克利分校机械工程系) Aerospace Engineering Program, University of California, Berkeley(加州大学伯克利分校航空航天工程项目) Department of Mechanical Engineering, National University of Singapore(新加坡国立大学机械工程系)

AI总结 本文提出了一种用于同轨道双卫星碰撞避免问题的Hamilton-Jacobi(HJ)可达性框架,通过平面Hill-Clohessy-Wiltshire(HCW)动力学在径向-切向-法向(RTN)框架中建模相对运动。定义目标状态空间为对应于联邦通信委员会(FCC)轨道标准的最小分离要求的不安全相对配置。将航天器之间的相互作用建模为零和微分博弈,其中玩家1是受控卫星,玩家2被建模为具有未知意图的有界对抗干扰。本文提出了HJ公式,并计算了后向可达集,这些集描述了在最坏情况下无法避免碰撞的相对状态,而集外的状态则允许证明安全的轨迹。这些可达集与监督混合控制逻辑相结合,以确定何时必须启动规避机动,从而为可扩展性提供数学基础的安全保证。

Comments Accepted to the 20th IEEE International Conference on Control & Automation (IEEE ICCA 2026). 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20075 2026-05-20 cs.CL cs.AI

CopT: Contrastive On-Policy Thinking with Continuous Spaces for General and Agentic Reasoning

CopT: 在连续空间中利用对比学习进行通用和代理推理的在线策略思考

Dachuan Shi, Hanlin Zhu, Xiangchi Yuan, Wanjia Zhao, Kejing Xia, Wen Xiao, Wenke Lee

机构 * Georgia Tech(佐治亚理工学院) UC Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) Microsoft(微软公司)

AI总结 本文提出CopT,一种改进的推理流程,通过反转传统思考和回答的顺序,首先生成草稿答案,再基于该答案进行在线策略思考以进行反思和修正。CopT利用连续嵌入作为推理时的对比验证器,通过对比离散令牌输入和连续嵌入输入下模型对相同生成令牌的支持,得到一个序列级的反KL估计器来评估答案的可靠性。在数学、编程和代理推理任务中,CopT在保持同等或更高准确性的情况下,将峰值准确率提高了高达23%,并将令牌使用量减少了高达57%。

Comments Code: https://github.com/sdc17/CopT, Website: https://copt-web.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05910 2026-05-20 cs.AI

The World Won't Stay Still: Programmable Evolution for Agent Benchmarks

世界不会静止:为智能体基准测试的可编程进化

Guangrui Li, Yaochen Xie, Yi Liu, Ziwei Dong, Xingyuan Pan, Tianqi Zheng, Jason Choi, Michael J. Morais, Binit Jha, Shaunak Mishra, Bingrou Zhou, Chen Luo, Monica Xiao Cheng, Dawn Song

机构 * Amazon(亚马逊公司) UC Berkeley(伯克利大学)

AI总结 本文研究了结构化环境进化作为智能体基准测试构建问题,提出了一种基于图的框架ProEvolve,使环境进化可编程,并在电商和航班预订领域验证了其在质量、实现有效性及失败模式方面的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05066 2026-05-20 cs.LG

Reward-Conditioned Reinforcement Learning

基于奖励的强化学习

Michal Nauman, Marek Cygan, Pieter Abbeel

机构 * University of Warsaw(华沙大学) Nomagic UC Berkeley, Amazon FAR(伯克利大学,亚马逊FAR)

AI总结 本文提出基于奖励的强化学习(RCRL),通过在收集经验时使用单一名义目标,使智能体在不额外交互的情况下暴露于多种奖励目标,从而提高样本效率并支持零样本行为调整。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19224 2026-05-20 cs.CL

Fine-tuning language encoding models on slow fMRI improves prediction for fast ECoG

在慢速fMRI上微调语言编码模型以提高对快速ECoG的预测

Aditya R. Vaidya, Richard J. Antonello, Alexander G. Huth

机构 * Department of Computer Science(计算机科学系) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Zuckerman Mind Brain Behavior Institute(祖克曼心智-脑-行为研究所) Columbia University(哥伦比亚大学) Departments of Neuroscience and Statistics(神经科学与统计学系) University of California, Berkeley(加州大学伯克利分校)

AI总结 该研究通过在慢速fMRI上微调语言编码模型,提高了对快速ECoG数据的预测性能,展示了慢速数据在构建快速脑数据模型中的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14234 2026-05-20 cs.LG cs.AI cs.RO stat.ML

Q-learning with Adjoint Matching

具有伴随匹配的Q学习

Qiyang Li, Sergey Levine

机构 * UC Berkeley(加州大学伯克利分校)

AI总结 本文提出了一种基于时序差分的强化学习算法QAM,解决了连续动作强化学习中的长期挑战:高效优化表达性强的扩散或流匹配策略相对于参数化的Q函数。通过利用批评者的首阶信息进行有效优化,但直接通过反向传播其多步去噪过程进行梯度优化在数值上不稳定。现有方法通过仅使用价值和丢弃梯度信息或依赖近似方法牺牲策略的表达性或偏置学习策略。QAM通过利用生成建模中最近提出的技术伴随匹配,将批评者的动作梯度转换为逐步目标函数,避免了不稳定反向传播,同时在最优时提供无偏且表达性强的策略。结合时序差分备份进行批评者学习,QAM在离线和离线到在线强化学习的硬稀疏奖励任务中一致优于先前方法。

Comments 32 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18915 2026-05-20 cs.CR cs.AI

DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs

DMN: 一种用于多图像输入多模态大语言模型的组合框架

Wenzhuo Xu, Zhipeng Wei, Zonghao Ying, Deyue Zhang, Dongdong Yang, Xiangzheng Zhang, Quanchen Zou

机构 * AI Security Lab(360人工智能安全实验室) International Computer Science Institute(国际计算机科学研究所) UC Berkeley(加州大学伯克利分校) Beihang University(北航大学)

AI总结 本文提出DMN框架,通过分布式指令、多模态证据和数字链任务,提升多图像输入多模态大语言模型的 jailbreak 性能,实验表明其在GPT-4o、Gemini-2.5-pro和Claude Sonnet 4上的攻击成功率超过90%。

Comments ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17851 2026-05-19 cs.RO

A Dexterous and Compliant Gripper With Soft Hydraulic Actuation for Microgravity Manipulation

一种具有软液压驱动的灵活机械手用于微重力操作

William Su, Jordan Kam, Yixiao Wang, Jianshu Zhou

机构 * Aerospace Engineering Program, University of California, Berkeley(加州大学伯克利分校航空航天工程系) Department of Mechanical Engineering, University of California, Berkeley(加州大学伯克利分校机械工程系) Department of Mechanical Engineering, National University of Singapore(新加坡国立大学机械工程系)

AI总结 本文提出将DexCoHand灵活的双指六自由度机械手与Astrobee自由飞行机器人集成,以实现微重力环境下的灵活操作,该机械手在保持稳定接触的同时减少了对自由飞行基底的干扰,提高了操作的连续性和适应性。

Comments Accepted to the IEEE ICRA 2026 Space Robotics Workshop (SRW). 4 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17830 2026-05-19 cs.AI cs.CL

Remembering More, Risking More: Longitudinal Safety Risks in Memory-Equipped LLM Agents

记住更多,风险更多:具有记忆能力的LLM代理的纵向安全风险

Ahmad Al-Tawaha, Shangding Gu, Peizhi Niu, Ruoxi Jia, Ming Jin

机构 * Virginia Tech(弗吉尼亚理工大学) University of California, Berkeley(加州大学伯克利分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本研究探讨了具有记忆能力的LLM代理在长期任务中因记忆积累导致的安全风险,提出了一种触发-探测协议来评估记忆污染的影响,并发现记忆安全应被视为一个纵向属性而非单一状态属性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15508 2026-05-19 cs.LG cs.CL

STS: Efficient Sparse Attention with Speculative Token Sparsity

STS: 高效稀疏注意力与推测性标记稀疏性

Ceyu Xu, Jiangnan Yu, Yongji Wu, Yuan Xie

机构 * The Hong Kong University of Science and Technology(香港科技大学) UC Berkeley(加州大学伯克利分校)

AI总结 本文提出STS,一种无需模型再训练的稀疏注意力机制,通过利用较小的草稿模型识别出的重要标记来预测更大目标模型的重要标记,从而在大规模语言模型推理中实现高效的稀疏注意力计算,显著提升速度并保持准确性。

Comments 14 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15177 2026-05-19 cs.AI

OpenDeepThink: Parallel Reasoning via Bradley-Terry Aggregation

OpenDeepThink: 通过布拉德利-蒂尔利聚合实现并行推理

Shang Zhou, Wenhao Chai, Kaiyuan Liu, Huanzhi Mao, Qiuyang Mang, Jingbo Shang

机构 * UC San Diego(UC圣地亚哥大学) Princeton University(普林斯顿大学) University of Washington(华盛顿大学) UC Berkeley(伯克利大学)

AI总结 该研究提出OpenDeepThink框架,通过布拉德利-蒂尔利聚合方法在测试时扩展计算资源,以提高大语言模型的推理能力,通过并行选择候选方案并消除选择瓶颈,从而提升模型在Codeforces等领域的表现。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14133 2026-05-19 cs.AI

ClawForge: Generating Executable Interactive Benchmarks for Command-Line Agents

ClawForge: 为命令行代理生成可执行的交互式基准测试

Yuxiang Lai, Peng Xia, Haonian Ji, Kaiwen Xiong, Kaide Zeng, Jiaqi Liu, Fang Wu, Jike Zhong, Zeyu Zheng, Cihang Xie, Huaxiu Yao

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学切里波因特分校) Stanford University(斯坦福大学) University of California, Berkeley(加州大学伯克利分校) University of Southern California(南加州大学) University of California, Santa Cruz(加州大学圣克鲁兹分校)

AI总结 ClawForge通过生成可执行的交互式基准测试,解决了可扩展性与真实工作流评估之间的矛盾,通过系统测试代理在存在状态冲突时的处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10236 2026-05-19 cs.LG cs.AI

When Does Non-Uniform Replay Matter in Reinforcement Learning?

在强化学习中非均匀回放何时起作用?

Michal Korniak, Mikołaj Czarnecki, Yarden As, Piotr Miłoś, Pieter Abbeel, Michal Nauman

机构 * ETH Zurich(苏黎世联邦理工学院) University of Warsaw(华沙大学) UC Berkeley(伯克利加州大学) Amazon FAR(亚马逊FAR)

AI总结 本文研究了非均匀回放在强化学习中的有效性,发现回放体积、预期近期性和回放分布熵是决定因素,并提出了一种简单有效的截断几何回放策略以提高样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21357 2026-05-19 cs.LG

Beyond Objective-Based Improvement: Stationarity-Aware Expected Improvement for Bayesian Optimization

超越基于目标的改进:面向站性的期望改进用于贝叶斯优化

Joshua Hang Sai Ip, Georgios Makrygiorgos, Ali Mesbah

机构 * Department of Chemical and Biomolecular Engineering, University of California, Berkeley, CA, USA(加州大学伯克利分校化学与生物分子工程系)

AI总结 本文提出了一种新的期望改进(EI-GN)获取函数,通过引入一阶站性条件来扩展改进原则,从而在高表现和接近站点的区域促进采样,通过在获取标准中嵌入向站性进展,提供更丰富的改进概念。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13977 2026-05-19 cs.CV

ROVR-Open-Dataset: A Large-Scale Depth Dataset for Autonomous Driving

ROVR-Open-Dataset: 一个大规模深度数据集用于自动驾驶

Xianda Guo, Ruijun Zhang, Yiqun Duan, Ruilin Wang, Matteo Poggi, Keyuan Zhou, Wenzhao Zheng, Wenke Huang, Gangwei Xu, Yanlun Peng, Yuan Si, Qin Zou

机构 * Wuhan University(武汉大学) Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) University of Technology Sydney(悉尼大学) University of Bologna(博洛尼亚大学) Zhejiang University(浙江大学) University of California, Berkeley(加州大学伯克利分校) Huazhong University of Science and Technology(华中科技大学) Great Wall Motor(长城汽车) ROVR Labs, Inc.(ROVR实验室)

AI总结 本文提出ROVR-Open-Dataset,一个大规模、多样化且成本效益高的深度数据集,用于提升自动驾驶中空间感知的能力,通过提供丰富的场景、光照和天气条件数据,以及经过验证的地面真实数据,支持鲁棒的模型训练,并识别出当前架构共享的三种失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01523 2026-05-19 cs.LG stat.ML

Beyond RLHF: A Unified Theoretical Framework of Alignment

超越RLHF:对齐的统一理论框架

Jihun Yun, Juno Kim, Jongho Park, Junhyuck Kim, Jongha Jon Ryu, Jaewoong Cho, Kwang-Sung Jun

机构 * KRAFTON UC Berkeley(加州大学伯克利分校) MIT(麻省理工学院) POSTECH

AI总结 本文提出了一种统一的对齐理论框架,通过将对齐视为基于成对偏好的分布学习,推导出三种新的对齐目标,并证明了它们在非渐近情况下具有O(1/n)的收敛性,为RLHF提供了理论支持。

详情

展开后加载摘要…

URL PDF HTML 收藏