arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

2026-03-06 至 2026-03-06 共收录 5
2603.05440 2026-03-06 cs.LG

Latent Wasserstein Adversarial Imitation Learning

潜在Wasserstein对抗模仿学习

Siqi Yang, Kai Yan, Alexander G. Schwing, Yu-Xiong Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文提出LWAIL方法,通过动态感知潜在空间和ICVF训练,实现仅需少量状态示例即可达到专家级性能的模仿学习。

Comments 10 pages, accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25762 2026-03-06 cs.LG

OPPO: Accelerating PPO-based RLHF via Pipeline Overlap

OPPO: 通过管道重叠加速基于PPO的RLHF

Kaizhuo Yan, Yingjie Yu, Yifan Yu, Haizhong Zheng, Fan Lai

机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学)

AI总结 OPPO通过管道重叠技术提升基于PPO的RLHF训练效率,加速训练过程并提高GPU利用率

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22796 2026-03-06 cs.CV

Parallel Diffusion Solver via Residual Dirichlet Policy Optimization

并行扩散求解器 via 剩余狄利克雷策略优化

Ruoyu Wang, Ziyu Li, Beier Zhu, Liangyu Yuan, Hanwang Zhang, Xun Yang, Xiaojun Chang, Chi Zhang

机构 * AGI lab, Westlake University(西溪大学AGI实验室) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出EPD-Solver,通过并行梯度评估和狄利克雷策略优化,提升扩散模型的低延迟采样性能。

Comments arXiv admin note: substantial text overlap with arXiv:2507.14797

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18832 2026-03-06 cs.CL

From Word to World: Can Large Language Models be Implicit Text-based World Models?

从词到世界:大型语言模型能否作为隐式的基于文本的世界模型?

Yixia Li, Hongru Wang, Jiahao Qiu, Zhenfei Yin, Dongdong Zhang, Cheng Qian, Zeping Li, Pony Ma, Guanhua Chen, Heng Ji

机构 * Southern University of Science and Technology(南方科技大学) Microsoft Research(微软研究院) University of Edinburgh(爱丁堡大学) Princeton University(普林斯顿大学) Oxford University(牛津大学) University of Illinois Urbana-Champaign(伊利诺伊大学香槟分校) Fudan University(复旦大学) Mind Lab

AI总结 本文研究了大型语言模型在基于文本的环境中作为世界模型的可行性,通过三个评估层面验证了其在提升智能体性能方面的有效性,并明确了环境复杂性和行为覆盖对世界建模效果的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19255 2026-03-06 cs.LG cs.AI

VTool-R1: VLMs Learn to Think with Images via Reinforcement Learning on Multimodal Tool Use

VTool-R1: 通过在多模态工具使用上的强化学习使VLMs学会通过图像思考

Mingyuan Wu, Jingcheng Yang, Jize Jiang, Meitang Li, Kaizhuo Yan, Hanchao Yu, Minjia Zhang, Chengxiang Zhai, Klara Nahrstedt

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Michigan Ann Arbor(密歇根大学安娜堡分校) Independent Researcher(独立研究者)

AI总结 VTool-R1通过强化学习训练视觉语言模型生成多模态思考链,提升其通过图像进行推理的能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏