arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

University of California, Berkeley(加州大学伯克利分校)

2026-03-04 至 2026-03-04 共收录 6
2603.03280 2026-03-04 cs.RO cs.AI cs.CV cs.LG cs.SY eess.SY

How to Peel with a Knife: Aligning Fine-Grained Manipulation with Human Preference

如何用刀剥皮:将细粒度操作与人类偏好对齐

Toru Lin, Shuying Deng, Zhao-Heng Yin, Pieter Abbeel, Jitendra Malik

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出了一种通过剥皮任务学习细粒度操作与人类偏好的对齐方法,通过两阶段策略优化实现高成功率和泛化能力。

Comments Project page can be found at https://toruowo.github.io/peel

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03278 2026-03-04 cs.RO cs.AI cs.CV

Tether: Autonomous Functional Play with Correspondence-Driven Trajectory Warping

Tether: 基于对应驱动轨迹扭曲的自主功能性玩耍

William Liang, Sam Wang, Hung-Ju Wang, Osbert Bastani, Yecheng Jason Ma, Dinesh Jayaraman

机构 * University of Pennsylvania(宾夕法尼亚大学) University of California, Berkeley(加州大学伯克利分校) Dyna Robotics(Dyna机器人技术)

AI总结 Tether通过基于对应驱动的轨迹扭曲,实现从少量演示开始的自主多任务玩耍,生成高质量数据集并提升模仿策略性能。

Comments International Conference on Learning Representations (ICLR), 2026. Project website and code: https://tether-research.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02229 2026-03-04 cs.LG cs.CL

Safety Training Persists Through Helpfulness Optimization in LLM Agents

在LLM代理中通过帮助性优化保持安全性训练

Benjamin Plaut

机构 * Department of Computer Science, University of California, Berkeley, USA(计算机科学系,加州大学伯克利分校)

AI总结 研究通过帮助性优化在LLM代理中保持安全性训练,发现单独训练或依次训练无法找到最佳策略,但所有配置接近帕累托前沿。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15165 2026-03-04 cs.LG math.OC

Policy Transfer for Continuous-Time Reinforcement Learning: A (Rough) Differential Equation Approach

连续时间强化学习中的策略迁移:一种(粗糙)微分方程方法

Xin Guo, Zijiu Lyu

机构 * UC Berkeley, IEOR(伯克利大学,工业工程与运筹学系)

AI总结 本文提出了一种基于粗糙路径理论的连续时间强化学习策略迁移方法,通过利用高斯结构和黎卡提方程的稳定性,实现了策略迁移的理论证明,并提出了新的策略学习算法,实现了全局和局部收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05334 2026-03-04 cs.CL cs.IR cs.LG

Search Arena: Analyzing Search-Augmented LLMs

Search Arena: 分析增强搜索的大型语言模型

Mihran Miroyan, Tsung-Han Wu, Logan King, Tianle Li, Jiayi Pan, Xinyan Hu, Wei-Lin Chiang, Anastasios N. Angelopoulos, Trevor Darrell, Narges Norouzi, Joseph E. Gonzalez

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 Search Arena 是一个大规模众包数据集,用于分析增强搜索的LLMs,揭示用户偏好受引用数量影响,并发现不同来源的可靠性差异。

Comments Accepted to ICLR 2026. Code: https://github.com/lmarena/search-arena. Dataset: https://huggingface.co/datasets/lmarena-ai/search-arena-24k

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.10278 2026-03-04 cs.LG cs.GT stat.ML

A Reinforcement Learning Approach in Multi-Phase Second-Price Auction Design

多阶段第二价格拍卖设计中的强化学习方法

Rui Ai, Boxiang Lyu, Zhaoran Wang, Zhuoran Yang, Michael I. Jordan

机构 * Institute for Data, Systems, and Society(数据、系统与社会研究所) Massachusetts Institute of Technology(麻省理工学院) Booth School of Business(博世商学院) The University of Chicago(芝加哥大学) Department of Industrial Engineering and Management Sciences(工业工程与管理科学系) Northwestern University(西北大学) Department of Statistics and Data Science(统计与数据科学系) Yale University(耶鲁大学) Department of EECS, Department of Statistics(电子工程与计算机科学系、统计学系) University of California Berkeley(加州大学伯克利分校)

AI总结 本文提出CLUB算法,通过缓冲期和LSVI-UCB扩展,解决多阶段拍卖中保留价优化的三个挑战,实现不同噪声条件下收入遗憾的最优控制。

详情

展开后加载摘要…

URL PDF HTML 收藏