LFPO: Likelihood-Free Policy Optimization for Masked Diffusion Models
LFPO:基于掩码扩散模型的似然自由策略优化
Chenxing Wei, Jiazhen Kang, Hong Wang, Jianqing Zhang, Hao Jiang, Xiaolong Xu, Ningyuan Sun, Ying He, F. Richard Yu, Yao Shu, Bo Jiang
机构
*
Shenzhen University(深圳大学)
;
Hong Kong University of Science(香港科学大学)
;
Guangdong Laboratory of Artificial Intelligence(广东省人工智能与数字经济实验室)
;
University of Science(科学技术大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Carleton University(卡尔顿大学)
;
Southeast University(东南大学)
机构
*
Institute of Science Tokyo, Department of Computer Science(东京科学研究所,计算机科学系)
;
National Institute of Advanced Industrial Science and Technology(国家先进工业科学与技术研究院)
;
Institute of Science Tokyo, Institute of Integrated Research, Supercomputing Research Center(东京科学研究所,整合研究所,超级计算研究中心)
Humans and LLMs Diverge on Probabilistic Inferences
人类与大语言模型在概率推断上存在分歧
Gaurav Kamath, Sreenath Madathil, Sebastian Schuster, Marie-Catherine de Marneffe, Siva Reddy
机构
*
McGill University(麦吉尔大学)
;
Mila – Quebec AI Institute(魁北克人工智能研究所)
;
University of Vienna(维也纳大学)
;
FNRS – UCLouvain(佛罗伦萨-鲁汶大学)
;
Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)
Spurious Rewards: Rethinking Training Signals in RLVR
虚假奖励:重新思考强化学习中的训练信号
Rulin Shao, Shuyue Stella Li, Rui Xin, Scott Geng, Yiping Wang, Sewoong Oh, Simon Shaolei Du, Nathan Lambert, Sewon Min, Ranjay Krishna, Yulia Tsvetkov, Hannaneh Hajishirzi, Pang Wei Koh, Luke Zettlemoyer
机构
*
University of Washington, Seattle, WA, USA(华盛顿大学)
;
Allen Institute for Artificial Intelligence, Seattle, WA, USA(人工智能研究院)
;
University of California, Berkeley, Berkeley, CA, USA(加州大学伯克利分校)
Bidipta Sarkar, Mattie Fellows, Juan Agustin Duque, Alistair Letcher, Antonio León Villares, Anya Sims, Clarisse Wibault, Dmitry Samsonov, Dylan Cope, Jarek Liesen, Kang Li, Lukas Seier, Theo Wolf, Uljad Berdica, Valentin Mohl, Alexander David Goldie, Aaron Courville, Karin Sevegnani, Shimon Whiteson, Jakob Nicolaus Foerster