arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of California, Berkeley(加州大学伯克利分校)

2026-06-24 至 2026-06-24 共收录 13
2606.24855 2026-06-24 cs.AI 新提交

OpenThoughts-Agent: Data Recipes for Agentic Models

OpenThoughts-Agent: 智能体模型的数据配方

Negin Raoof, Richard Zhuang, Marianna Nezhurina, Etash Guha, Atula Tejaswi, Ryan Marten, Charlie F. Ruan, Tyler Griggs, Alexander Glenn Shaw, Hritik Bansal, E. Kelly Buchanan, Artem Gazizov, Reinhard Heckel, Chinmay Hegde, Sankalp Jajee, Daanish Khazi, Emmanouil Koukoumidis, Xiangyi Li, Hange Liu, Shlok Natarajan, Harsh Raj, Nicholas Roberts, Ethan Shen, Nishad Singhi, Michael Siu, Ashima Suvarna, Hanwen Xing, Patrick Yubeaton, Robert Zhang, Leon Liangyu Chen, Xiaokun Chen, Steven Dillmann, Saadia Gabriel, Xunyi Jiang, Anurag Kashyap, Boxuan Li, Yein Park, Minh Pham, Sujay Sanghavi, Lin Shi, Ke Sun, Yixin Wang, Zhiwei Xu, Erica Zhang, Siyan Zhao, Wanjia Zhao, Jenia Jitsev, Alex Dimakis, Benjamin Feuer, Ludwig Schmidt

机构 * UC Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) JSC(于利希超级计算中心) LAION University of Texas at Austin(德克萨斯大学奥斯汀分校) Bespoke Labs Laude Institute UCLA(加州大学洛杉矶分校) Harvard University & Harvard Medical School(哈佛大学与哈佛医学院) TU Munich & Munich Center for Machine Learning(慕尼黑工业大学与慕尼黑机器学习中心) New York University(纽约大学) Medical University of South Carolina(南卡罗来纳医科大学) The LLM Data Company BenchFlow Independent Researcher(独立研究员) Northeastern University(东北大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Washington(华盛顿大学) TU Darmstadt(达姆施塔特工业大学) University of Southern California(南加州大学) UC San Diego(加州大学圣地亚哥分校) Amazon(亚马逊) Microsoft(微软) Korea University(高丽大学) Cornell Tech(康奈尔科技) University of Michigan(密歇根大学)

AI总结 提出全开放数据筛选流水线,通过100多次消融实验研究任务来源与多样性,构建10万样本训练集,在7个智能体基准上平均44.8%准确率,较最强开源模型提升3.9个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24194 2026-06-24 cs.IR cs.CL cs.HC 新提交

Dialogue to Discovery: Attribute-Aware Preference Elicitation for Conversational Product Search Assistants

对话到发现:面向对话式产品搜索助手的属性感知偏好引导

Sarthak Harne, Natwar Modani, Debabrata Mahapatra, Shubham Agarwal

机构 * Adobe Research(Adobe研究院) Microsoft Research(微软研究院) UC Berkeley(伯克利大学)

AI总结 提出属性导向的偏好引导框架D2D,动态利用产品属性结构高效引导对话,在模拟对话中目标发现准确率提升22.2-29.9%,放弃率降低6.6-16.1%,平均对话缩短27.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24143 2026-06-24 cs.LG 新提交

AsyncOPD: How Stale Can On-Policy Distillation Be?

AsyncOPD:同策略蒸馏可以有多陈旧?

Wonjun Kang, Kevin Galim, Seunghyuk Oh, Minjun Kang, Sanghyun Park, Donghoon Kim, Minjae Lee, Minseo Kim, Rishabh Tiwari, Yuchen Zeng, Hyung Il Koo, Kangwook Lee

机构 * FuriosaAI Ajou University(亚洲大学) UC Berkeley(加州大学伯克利分校) Microsoft Research(微软研究院) KRAFTON Ludo Robotics

AI总结 研究异步同策略蒸馏中陈旧数据的影响,发现前向KL对陈旧更鲁棒,反向KL脆弱但可通过重算信号缓解,并提出AsyncOPD框架实现1.6-3.8倍加速。

Comments Code: https://github.com/furiosa-ai/async-opd

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24010 2026-06-24 cs.AI 新提交

Safe and Generalizable Hierarchical Multi-Agent RL via Constraint Manifold Control

通过约束流形控制实现安全且可泛化的分层多智能体强化学习

Zihao Guo, Jianing Zhao, Ling Li, Hao Liang, Giuseppe Loianno, Yali Du

机构 * University of California, Berkeley(加州大学伯克利分校) The Alan Turing Institute(艾伦·图灵研究所)

AI总结 提出分层多智能体强化学习框架,低层通过约束流形强制执行硬安全约束,高层学习协调策略,实现理论安全保证、稳定训练和高效泛化。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23932 2026-06-24 cs.LG 新提交

KLip-PPO: A per-sample KL perspective on PPO-Clip

KLip-PPO:基于逐样本KL视角的PPO-Clip

Riccardo Colletti, Robin Holzinger

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 本文通过逐样本KL散度惩罚重新表述PPO-Clip,证明其梯度与KL惩罚等价,并揭示了裁剪替代目标中隐含的逐样本惩罚系数结构,为算法泛化提供了新设计方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23700 2026-06-24 cs.CL cs.AI cs.LG 新提交

Self-Recognition Finetuning can Prevent and Reverse Emergent Misalignment

自我识别微调可以预防和逆转突现性失调

Arush Tagade, Shaoheng Zhou, Jiaxin Wen, Shi Feng

机构 * George Washington University(乔治·华盛顿大学) Google(谷歌) UC Berkeley(伯克利大学)

AI总结 通过自我生成文本识别微调作为角色定向干预,在GPT-4.1等模型上实验发现,该方法能有效预防和逆转突现性失调,且预防效果优于其他干预。

Comments 18 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22998 2026-06-24 cs.RO 新提交

TEXEDO : Test Time Scaling for Controller-aware Language-conditioned Humanoid Motion Generation

TEXEDO:面向控制器感知的语言条件人形运动生成的测试时缩放

Jianuo Cao, Yuxin Chen, Yuzhen Song, Masayoshi Tomizuka, Chenran Li, Thomas Tian

机构 * Nanjing University(南京大学) University of California, Berkeley(加州大学伯克利分校) Southern University of Science and Technology(南方科技大学)

AI总结 提出TEXEDO框架,在测试时从预训练生成器中采样多个候选运动,通过动态可行性验证和语义对齐验证选择可执行且任务对齐的最佳运动,提升人形机器人运动生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04883 2026-06-24 cs.CL cs.LO 版本更新

Optimizing the Cost-Quality Tradeoff of Agentic Theorem Provers in Lean

优化 Lean 中智能定理证明器的成本-质量权衡

Kári Rögnvaldsson, Chenhao Sun, Jasper Dekoninck, Martin Vechev

机构 * University of Washington(华盛顿大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 提出一种包含数据平面和控制平面的动作路由智能体,通过观察失败轨迹并估计成功概率与成本来动态决定继续证明或重新分解,在 PutnamBench 子集上平均降低 25.8% 成本且保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00618 2026-06-24 cs.AI 版本更新

Efficient Test-time Inference for Generative Planning Models with OCL Search

生成式规划模型的高效测试时推理

Robert Gieselmann, Mihai Samson, Federico Pecora, Jeremy L. Wyatt

机构 * University of California, Berkeley(加州大学伯克利分校) ETH Zurich(苏黎世联邦理工学院)

AI总结 本文提出一种改进的开放-封闭列表搜索算法,结合生成模型和启发式模型,在测试时高效推理,提升生成式规划模型的解质量和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01288 2026-06-24 cs.LG cond-mat.dis-nn stat.ML 版本更新

A Theory of Saddle Escape in Deep Nonlinear Networks

深度非线性网络中的鞍点逃逸理论

Divit Rawal, Michael R. DeWeese

机构 * Department of Physics(物理系) University of California, Berkeley(加州大学伯克利分校) Department of Neuroscience(神经科学系) Redwood Center(红木中心)

AI总结 本文提出深度非线性网络中鞍点逃逸的理论,通过分析权重矩阵的Frobenius范数不平衡性,将激活函数分为四类,并推导出关键深度逃逸时间规律。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10807 2026-06-24 cs.RO

Bridging Language and Action: A Survey of Language-Conditioned Robot Manipulation

连接语言与行动:语言引导的机器人操作综述

Xiangtong Yao, Hongkuan Zhou, Oier Mees, Yuan Meng, Ted Xiao, Yonatan Bisk, Jean Oh, Edward Johns, Mohit Shridhar, Dhruv Shah, Jesse Thomason, Kai Huang, Joyce Chai, Zhenshan Bing, Alois Knoll

机构 * Technical University of Munich(慕尼黑技术大学) Corporate Research, Robert Bosch GmbH(罗伯特·博世集团企业研究部) University of California Berkeley(加州大学伯克利分校) Microsoft(微软) Google DeepMind(谷歌DeepMind) Carnegie Mellon University(卡内基梅隆大学) Imperial College London(伦敦帝国理工学院) Princeton University(普林斯顿大学) University of Southern California(南加州大学) Sun Yat-sen University(中山大学) University of Michigan(密歇根大学) Institute for Artificial Intelligence, University of Stuttgart(斯图加特大学人工智能研究所) The State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室)

AI总结 本文综述了语言引导的机器人操作领域,探讨了语言如何与机器人系统整合,分析了现有方法的分类及最新进展,指出关键争议和未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06351 2026-06-24 cs.LG cs.DM 版本更新

A Fast and Effective Method for Euclidean Anticlustering: The Assignment-Based-Anticlustering Algorithm

一种快速有效的欧几里得反聚类方法:基于分配的反聚类算法

Philipp Baumann, Olivier Goldschmidt, Dorit S. Hochbaum, Jason Yang

机构 * Department of Business Administration, University of Bern(伯尔尼大学商学院) Riverside County Office of Education(河滨县教育局) Industrial Engineering and Operations Research Department, University of California, Berkeley(加州大学伯克利分校工业工程与运筹学系)

AI总结 提出基于分配的反聚类算法(ABA),通过将反聚类转化为分配问题,实现百万级数据点、数十万反聚类的快速求解,在解质量和运行时间上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04767 2026-06-24 cs.LG 版本更新

ParallelBench: Understanding the Trade-offs of Parallel Decoding in Diffusion LLMs

ParallelBench: 理解扩散大语言模型中并行解码的权衡

Wonjun Kang, Kevin Galim, Seunghyuk Oh, Minjae Lee, Yuchen Zeng, Shuibai Zhang, Coleman Hooper, Yuezhou Hu, Hyung Il Koo, Nam Ik Cho, Kangwook Lee

机构 * FuriosaAI UW-Madison(威斯康星大学麦迪逊分校) Microsoft Research(微软研究院) UC Berkeley(加州大学伯克利分校) Seoul National University(首尔国立大学) KRAFTON Ludo Robotics Project(Ludo机器人项目)

AI总结 针对扩散LLM并行解码导致生成质量下降的问题,通过信息论分析和合成实验揭示其根本限制,并提出首个专门基准ParallelBench,系统评估发现并行解码在现实任务中质量损失严重,且现有策略无法根据任务难度调整并行度。

Comments Accepted at ICLR 2026. Project Page: https://parallelbench.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏