Latent Wasserstein Adversarial Imitation Learning
潜在Wasserstein对抗模仿学习
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 本文提出LWAIL方法,通过动态感知潜在空间和ICVF训练,实现仅需少量状态示例即可达到专家级性能的模仿学习。
Comments 10 pages, accepted to ICLR 2026
高校专区
潜在Wasserstein对抗模仿学习
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 本文提出LWAIL方法,通过动态感知潜在空间和ICVF训练,实现仅需少量状态示例即可达到专家级性能的模仿学习。
Comments 10 pages, accepted to ICLR 2026
OPPO: 通过管道重叠加速基于PPO的RLHF
机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 OPPO通过管道重叠技术提升基于PPO的RLHF训练效率,加速训练过程并提高GPU利用率
并行扩散求解器 via 剩余狄利克雷策略优化
机构 * AGI lab, Westlake University(西溪大学AGI实验室) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Nanyang Technological University(南洋理工大学) ; Shanghai Jiao Tong University(上海交通大学) ; University of Science and Technology of China(中国科学技术大学)
AI总结 本文提出EPD-Solver,通过并行梯度评估和狄利克雷策略优化,提升扩散模型的低延迟采样性能。
Comments arXiv admin note: substantial text overlap with arXiv:2507.14797
从词到世界:大型语言模型能否作为隐式的基于文本的世界模型?
机构 * Southern University of Science and Technology(南方科技大学) ; Microsoft Research(微软研究院) ; University of Edinburgh(爱丁堡大学) ; Princeton University(普林斯顿大学) ; Oxford University(牛津大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学香槟分校) ; Fudan University(复旦大学) ; Mind Lab
AI总结 本文研究了大型语言模型在基于文本的环境中作为世界模型的可行性,通过三个评估层面验证了其在提升智能体性能方面的有效性,并明确了环境复杂性和行为覆盖对世界建模效果的影响。
VTool-R1: 通过在多模态工具使用上的强化学习使VLMs学会通过图像思考
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Michigan Ann Arbor(密歇根大学安娜堡分校) ; Independent Researcher(独立研究者)
AI总结 VTool-R1通过强化学习训练视觉语言模型生成多模态思考链,提升其通过图像进行推理的能力。
Comments ICLR 2026