arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of California, San Diego(加州大学圣迭戈分校)

2026-05-12 至 2026-05-12 共收录 9
2605.10784 2026-05-12 cs.LG

MASS-DPO: Multi-negative Active Sample Selection for Direct Policy Optimization

MASS-DPO:多负样本主动采样用于直接策略优化

Rohan Surana, Xintong Li, Sheldon Yu, Yiran Jenny Shen, Chuhan Wang, Tong Yu, Prithviraj Ammanabrolu, Jingbo Shang, Julian McAuley, Junda Wu

机构 * UC San Diego(UC圣地亚哥大学) Adobe Research(Adobe研究院)

AI总结 MASS-DPO通过多负样本主动采样方法,在Plackett-Luce模型下扩展直接偏好优化,通过选择信息丰富的负样本子集提升策略更新效率,减少冗余梯度,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09359 2026-05-12 cs.LG cs.AI

Skill-R1: Agent Skill Evolution via Reinforcement Learning

Skill-R1:通过强化学习实现智能体技能进化

Yash Vishe, Rohan Surana, Xunyi Jiang, Zihan Huang, Xintong Li, Nikki Lijing Kuang, Tong Yu, Ryan A. Rossi, Jingbo Shang, Julian McAuley, Junda Wu

机构 * UC San Diego(UC圣地亚哥大学) Adobe Research(Adobe研究院)

AI总结 Skill-R1通过强化学习框架实现实例级递归技能优化,利用可验证奖励训练轻量级技能生成器,提升智能体在复杂多步骤任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09181 2026-05-12 cs.CV cs.ET eess.IV

Establishing Robust Retinal Eye Tracking: A Weakly Supervised Algorithmic Framework

建立稳健的视网膜眼追踪:一种弱监督的算法框架

Bo Wen, Dillon Lohr, Yatong An, Pushkar Anand, Alexander Fix, Ruobing Qian, Catherine A. Fromm, Yimin Ding, Truong Nguyen, Mohamed El-Haddad, Francesco La Rocca

机构 * Meta Reality Labs(Meta现实实验室) University of California, San Diego(加州大学圣地亚哥分校) Independent Researcher(独立研究员)

AI总结 本文提出一种弱监督学习框架,用于提高视网膜眼追踪的鲁棒性,实验显示在6名受试者中,眼位误差低于0.45度。

Comments 2026 IEEE International Conference on Image Processing (Accepted for Publication)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09120 2026-05-12 cs.IR cs.SD

Reddit2Deezer: A Scalable Dataset for Real-World Grounded Conversational Music Recommendation

Reddit2Deezer: 一个可扩展的现实世界基础对话音乐推荐数据集

Haven Kim, Julian McAuley

机构 * University of California San Diego(加州大学圣地亚哥分校)

AI总结 本文提出Reddit2Deezer数据集,基于19万独特的线程和叶子评论对,提供真实对话音乐推荐资源,包含原始和改写版本,链接音乐实体到Deezer标识符,支持未来内容基础对话推荐研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08904 2026-05-12 cs.AI

OPT-BENCH: Evaluating the Iterative Self-Optimization of LLM Agents in Large-Scale Search Spaces

OPT-BENCH:评估大搜索空间中LLM代理的迭代自我优化

Xiaozhe Li, Jixuan Chen, Xinyu Fang, Shengyuan Ding, Haodong Duan, Qingwen Liu, Kai Chen

机构 * Tongji University(同济大学) Shanghai AI Lab(上海人工智能实验室) Fudan University(复旦大学) Zhejiang University(浙江大学) University of California San Diego(加州大学圣地亚哥分校)

AI总结 OPT-BENCH通过结合20个机器学习任务和10个经典NP难问题,评估LLM代理在大规模搜索空间中通过内在自我反思而非机械工具应用进行适应的能力,揭示更强模型在反馈利用上的优势及基础能力的限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08526 2026-05-12 cs.LG

Skill-CMIB: Multimodal Agent Skill for Consistent Action via Conditional Multimodal Information Bottleneck

Skill-CMIB: 多模态代理技能用于通过条件多模态信息瓶颈实现一致行动

Zihan Huang, Junda Wu, Tong Yu, Qianqi Yan, Rohan Surana, Uttaran Bhattacharya, Lina Yao, Xin Eric Wang, Julian McAuley

机构 * UC San Diego(UC圣地亚哥大学) Adobe Research(Adobe研究院) UC Santa Barbara(UC圣芭芭拉大学) University of New South Wales(新南威尔士大学)

AI总结 本文提出Skill-CMIB方法,通过条件多模态信息瓶颈构建多模态技能,解决多模态环境下代理执行不一致的问题,提升执行稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08520 2026-05-12 cs.LG cs.DC

FlashEvolve: Accelerating Agent Self-Evolution with Asynchronous Stage Orchestration

FlashEvolve:通过异步阶段协调加速智能体自我进化

Zhengding Hu, Mingge Lu, Zhen Wang, Jixuan Ruan, Chang Chen, Zaifeng Pan, Yue Guan, Ruiyi Wang, Zhongkai Yu, Chao Zhang, Yufei Ding

机构 * University of California, San Diego(加州大学圣地亚哥分校) Georgia Institute of Technology(佐治亚理工学院)

AI总结 本文提出FlashEvolve框架,通过异步工作流和队列降低智能体自我进化的时间成本,提升吞吐量和token效率,在GEPA任务中实现3.5倍和4.9倍的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09096 2026-05-12 cs.RO cs.AI cs.LG

When a Robot is More Capable than a Human: Learning from Constrained Demonstrators

当机器人比人类更强大时:从受限演示中学习

Xinhu Li, Ayush Jain, Zhaojing Yang, Yigit Korkmaz, Erdem Bıyık

机构 * Thomas Lord Department of Computer Science, University of Southern California(汤姆·劳德计算机科学系,南加州大学) Meta AI Department of Computer Science & Engineering, University of California San Diego(计算机科学与工程系,加州大学圣地亚哥分校)

AI总结 本文探讨机器人能否超越受限专家的演示学习,通过探索更高效轨迹和自定义奖励信号,提升学习效率和任务完成速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21228 2026-05-12 cs.CR cs.AI

CachePrune: Teaching LLMs What Not to Follow via KV-Cache Editing

CachePrune: 通过KV缓存编辑教LLMs不遵循指令

Rui Wang, Junda Wu, Yu Xia, Tong Yu, Ruiyi Zhang, Ryan Rossi, Subrata Mitra, Lina Yao, Julian McAuley

机构 * Adobe Research(Adobe研究院) University of California San Diego(加州大学圣地亚哥分校) University of New South Wales(新南威尔士大学)

AI总结 CachePrune通过KV缓存编辑识别并修剪指令跟随相关神经元,降低间接提示注入攻击成功率,同时保持LLM执行用户指令的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏