arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of California, Berkeley(加州大学伯克利分校)

2026-06-24 至 2026-06-24 共收录 7
2606.24855 2026-06-24 cs.AI 新提交

OpenThoughts-Agent: Data Recipes for Agentic Models

OpenThoughts-Agent: 智能体模型的数据配方

Negin Raoof, Richard Zhuang, Marianna Nezhurina, Etash Guha, Atula Tejaswi, Ryan Marten, Charlie F. Ruan, Tyler Griggs, Alexander Glenn Shaw, Hritik Bansal, E. Kelly Buchanan, Artem Gazizov, Reinhard Heckel, Chinmay Hegde, Sankalp Jajee, Daanish Khazi, Emmanouil Koukoumidis, Xiangyi Li, Hange Liu, Shlok Natarajan, Harsh Raj, Nicholas Roberts, Ethan Shen, Nishad Singhi, Michael Siu, Ashima Suvarna, Hanwen Xing, Patrick Yubeaton, Robert Zhang, Leon Liangyu Chen, Xiaokun Chen, Steven Dillmann, Saadia Gabriel, Xunyi Jiang, Anurag Kashyap, Boxuan Li, Yein Park, Minh Pham, Sujay Sanghavi, Lin Shi, Ke Sun, Yixin Wang, Zhiwei Xu, Erica Zhang, Siyan Zhao, Wanjia Zhao, Jenia Jitsev, Alex Dimakis, Benjamin Feuer, Ludwig Schmidt

机构 * UC Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) JSC(于利希超级计算中心) LAION University of Texas at Austin(德克萨斯大学奥斯汀分校) Bespoke Labs Laude Institute UCLA(加州大学洛杉矶分校) Harvard University & Harvard Medical School(哈佛大学与哈佛医学院) TU Munich & Munich Center for Machine Learning(慕尼黑工业大学与慕尼黑机器学习中心) New York University(纽约大学) Medical University of South Carolina(南卡罗来纳医科大学) The LLM Data Company BenchFlow Independent Researcher(独立研究员) Northeastern University(东北大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Washington(华盛顿大学) TU Darmstadt(达姆施塔特工业大学) University of Southern California(南加州大学) UC San Diego(加州大学圣地亚哥分校) Amazon(亚马逊) Microsoft(微软) Korea University(高丽大学) Cornell Tech(康奈尔科技) University of Michigan(密歇根大学)

AI总结 提出全开放数据筛选流水线,通过100多次消融实验研究任务来源与多样性,构建10万样本训练集,在7个智能体基准上平均44.8%准确率,较最强开源模型提升3.9个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24194 2026-06-24 cs.IR cs.CL cs.HC 新提交

Dialogue to Discovery: Attribute-Aware Preference Elicitation for Conversational Product Search Assistants

对话到发现:面向对话式产品搜索助手的属性感知偏好引导

Sarthak Harne, Natwar Modani, Debabrata Mahapatra, Shubham Agarwal

机构 * Adobe Research(Adobe研究院) Microsoft Research(微软研究院) UC Berkeley(伯克利大学)

AI总结 提出属性导向的偏好引导框架D2D,动态利用产品属性结构高效引导对话,在模拟对话中目标发现准确率提升22.2-29.9%,放弃率降低6.6-16.1%,平均对话缩短27.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24143 2026-06-24 cs.LG 新提交

AsyncOPD: How Stale Can On-Policy Distillation Be?

AsyncOPD:同策略蒸馏可以有多陈旧?

Wonjun Kang, Kevin Galim, Seunghyuk Oh, Minjun Kang, Sanghyun Park, Donghoon Kim, Minjae Lee, Minseo Kim, Rishabh Tiwari, Yuchen Zeng, Hyung Il Koo, Kangwook Lee

机构 * FuriosaAI Ajou University(亚洲大学) UC Berkeley(加州大学伯克利分校) Microsoft Research(微软研究院) KRAFTON Ludo Robotics

AI总结 研究异步同策略蒸馏中陈旧数据的影响,发现前向KL对陈旧更鲁棒,反向KL脆弱但可通过重算信号缓解,并提出AsyncOPD框架实现1.6-3.8倍加速。

Comments Code: https://github.com/furiosa-ai/async-opd

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24010 2026-06-24 cs.AI 新提交

Safe and Generalizable Hierarchical Multi-Agent RL via Constraint Manifold Control

通过约束流形控制实现安全且可泛化的分层多智能体强化学习

Zihao Guo, Jianing Zhao, Ling Li, Hao Liang, Giuseppe Loianno, Yali Du

机构 * University of California, Berkeley(加州大学伯克利分校) The Alan Turing Institute(艾伦·图灵研究所)

AI总结 提出分层多智能体强化学习框架,低层通过约束流形强制执行硬安全约束,高层学习协调策略,实现理论安全保证、稳定训练和高效泛化。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23932 2026-06-24 cs.LG 新提交

KLip-PPO: A per-sample KL perspective on PPO-Clip

KLip-PPO:基于逐样本KL视角的PPO-Clip

Riccardo Colletti, Robin Holzinger

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 本文通过逐样本KL散度惩罚重新表述PPO-Clip,证明其梯度与KL惩罚等价,并揭示了裁剪替代目标中隐含的逐样本惩罚系数结构,为算法泛化提供了新设计方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23700 2026-06-24 cs.CL cs.AI cs.LG 新提交

Self-Recognition Finetuning can Prevent and Reverse Emergent Misalignment

自我识别微调可以预防和逆转突现性失调

Arush Tagade, Shaoheng Zhou, Jiaxin Wen, Shi Feng

机构 * George Washington University(乔治·华盛顿大学) Google(谷歌) UC Berkeley(伯克利大学)

AI总结 通过自我生成文本识别微调作为角色定向干预,在GPT-4.1等模型上实验发现,该方法能有效预防和逆转突现性失调,且预防效果优于其他干预。

Comments 18 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22998 2026-06-24 cs.RO 新提交

TEXEDO : Test Time Scaling for Controller-aware Language-conditioned Humanoid Motion Generation

TEXEDO:面向控制器感知的语言条件人形运动生成的测试时缩放

Jianuo Cao, Yuxin Chen, Yuzhen Song, Masayoshi Tomizuka, Chenran Li, Thomas Tian

机构 * Nanjing University(南京大学) University of California, Berkeley(加州大学伯克利分校) Southern University of Science and Technology(南方科技大学)

AI总结 提出TEXEDO框架,在测试时从预训练生成器中采样多个候选运动,通过动态可行性验证和语义对齐验证选择可执行且任务对齐的最佳运动,提升人形机器人运动生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏