arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Stanford University(斯坦福大学)

2026-07-13 至 2026-07-13 共收录 4
2607.09655 2026-07-13 cs.CV 新提交

OpenLongTail: Generative Scaling of Long-Tail Driving Data

OpenLongTail:长尾驾驶数据的生成式扩展

Lulin Liu, Nuo Chen, Yan Wang, Bangya Liu, Wenyan Cong, Hezhen Hu, Boris Ivanovic, Hao Wang, Ziyao Zeng, Xinyu Gong, Yang Zhou, Zixiang Xiong, Dilin Wang, Zhangyang Wang, Weisong Shi, Ruohan Zhang, Marco Pavone, Zhiwen Fan

机构 * Texas A&M University(德克萨斯农工大学) NVIDIA(英伟达) UW–Madison(威斯康星大学麦迪逊分校) UT Austin(德克萨斯大学奥斯汀分校) Yale University(耶鲁大学) Adobe(奥多比公司) Meta University of Delaware(特拉华大学) Stanford University(斯坦福大学)

AI总结 研究针对长尾驾驶数据稀缺影响策略扩展的问题,提出开源生成数据引擎OpenLongTail,通过姿态外推视图合成管道及普吕克射线几何增强,合成异构数据提升闭环驾驶稳健性,验证了其多方面有效性。

Comments Project page: https://openlongtail.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09366 2026-07-13 cs.SE cs.AI cs.LO 新提交

Diversifying to Verify: When Task-Equivalent Programs Differ in Verifiability

多样化以进行验证:当任务等效程序在可验证性上存在差异时

Shirley Yu, Ruben Martins

机构 * Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 研究任务等效程序的可验证性差异,提出基于大型语言模型的Diversify2Verify管道,通过推断契约、生成测试不同实现并修复注释来验证,构建基准测试,结果表明实现多样性有助于验证,提高了验证成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09042 2026-07-13 cs.LG 新提交

Learning More from Less: Reinforcement Learning from Hindsight

从更少中学习更多:事后诸葛亮式强化学习

Iris Xu, Sunshine Jiang, John Marangola, Nitish Dashora, Richard Li, Thomas Liu, Zexue He, Yuheng Zhi, Alex Pentland, Pulkit Agrawal, Zhang-Wei Hong

机构 * Massachusetts Institute of Technology(麻省理工学院) MIT-IBM Computing Research Lab(麻省理工学院-IBM计算研究实验室) Stanford University(斯坦福大学) University of California, San Diego(加利福尼亚大学圣地亚哥分校)

AI总结 研究针对强化学习用于视觉-语言-动作模型后期训练时样本效率低的问题,提出事后诸葛亮式学习方法,通过对失败轨迹重标记,让策略联合原始与重标记轨迹训练,在分布外任务上显著提升样本效率并优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28320 2026-07-13 cs.RO 新提交

WARP-RM: A Warp-Augmented Relative Progress Reward Model for Data Curation

WARP-RM: 一种用于数据筛选的扭曲增强相对进度奖励模型

Justin Yu, Andrew Goldberg, Kavish Kondap, Karim El-Refai, Ethan Ransing, Qianzhong Chen, Mac Schwager, Fred Shentu, Philipp Wu, Ken Goldberg

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) XDOF

AI总结 提出WARP-RM,通过时间扭曲增强从成功演示中自监督学习密集相对进度信号,用于行为克隆中加权高优势动作块,在机器人叠衣任务中显著提升数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏