Generalization of RLVR Using Causal Reasoning as a Testbed
使用因果推理作为测试平台的RLVR泛化
Brian Lu, Hongyu Zhao, Shuo Sun, Hao Peng, Rui Ding, Hongyuan Mei
机构
*
Johns Hopkins University(约翰霍普金斯大学)
;
University of Maryland, College Park(马里兰大学学院公园分校)
;
University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
Microsoft Research Asia(微软亚洲研究院)
;
Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)
Scalable Second-order Riemannian Optimization for $K$-means Clustering
可扩展的二次黎曼优化用于K均值聚类
Peng Xu, Chun-Ying Hou, Xiaohui Chen, Richard Y. Zhang
机构
*
Department of Statistics, University of Illinois Urbana-Champaign(统计系,伊利诺伊大学厄巴纳-香槟分校)
;
Department of Electrical and Computer Engineering, University of Illinois Urbana-Champaign(电气与计算机工程系,伊利诺伊大学厄巴纳-香槟分校)
;
Department of Mathematics, University of Southern California(数学系,南加州大学)
Implicit U-KAN2.0: Dynamic, Efficient and Interpretable Medical Image Segmentation
隐式U-KAN2.0:动态、高效且可解释的医学图像分割
Chun-Wun Cheng, Yining Zhao, Yanqi Cheng, Javier A. Montoya-Zegarra, Carola-Bibiane Schönlieb, Angelica I Aviles-Rivero
机构
*
Department of Applied Mathematics and Theoretical Physics, University of Cambridge, UK(应用数学与理论物理系,剑桥大学)
;
Siebel School of Computing and Data Science, University of Illinois Urbana-Champaign, USA(计算与数据科学学院,伊利诺伊大学厄巴纳-香槟分校)
;
Zurich University of Applied Sciences, Switzerland(苏黎世应用科学大学)
;
Lucerne Cantonal Hospital, Switzerland(卢塞恩州立医院)
;
Lucerne University of Applied Sciences and Arts, Switzerland(卢塞恩应用科学与艺术大学)
;
Yau Mathematical Sciences Center, Tsinghua University, China(尤太数学科学中心,清华大学)
Preference Leakage: A Contamination Problem in LLM-as-a-judge
偏好泄露:作为判断者的LLM中的污染问题
Dawei Li, Renliang Sun, Yue Huang, Ming Zhong, Bohan Jiang, Jiawei Han, Xiangliang Zhang, Wei Wang, Huan Liu
机构
*
Arizona State University(亚利桑那州立大学)
;
University of California, Los Angeles(加州大学洛杉矶分校)
;
University of Notre Dame(诺丁汉大学)
;
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
R1-Code-Interpreter: LLMs Reason with Code via Supervised and Multi-stage Reinforcement Learning
R1-Code-Interpreter: LLMs通过监督学习和多阶段强化学习进行代码推理
Yongchao Chen, Yueying Liu, Junwei Zhou, Yilun Hao, Jingquan Wang, Yang Zhang, Na Li, Chuchu Fan
机构
*
MIT / Harvard(麻省理工学院/哈佛大学)
;
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
University of Michigan(密歇根大学)
;
MIT(麻省理工学院)
;
University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
;
MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)
;
Harvard(哈佛大学)