REAL: Regression-Aware Reinforcement Learning for LLM-as-a-Judge
REAL: 面向LLM评判的回归感知强化学习
Yasi Zhang, Tianyu Chen, Mingyuan Zhou, Oscar Leong, Ying Nian Wu, Michal Lukasik
机构
*
University of California, Los Angeles(加州大学洛杉矶分校)
;
The University of Texas at Austin(得克萨斯大学奥斯汀分校)
;
Google Research Now at Google DeepMind(谷歌研究 现在在谷歌深Mind)
Who Gets Credit or Blame? Attributing Accountability in Modern AI Systems
谁获得功劳或责备?在现代AI系统中分配责任
Shichang Zhang, Hongzhe Du, Jiaqi W. Ma, Himabindu Lakkaraju
机构
*
Harvard University, Cambridge, MA, USA(哈佛大学)
;
University of California, Los Angeles, Los Angeles, CA, USA(加州大学洛杉矶分校)
;
University of Illinois Urbana-Champaign, Urbana-Champaign, IL, USA(伊利诺伊大学厄巴纳-香槟分校)
机构
*
KAIST(韩国科学技术院)
;
Carnegie Mellon University(卡内基梅隆大学)
;
University of Cambridge(剑桥大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Pennsylvania State University(宾夕法尼亚州立大学)
;
UCLA(加州大学洛杉矶分校)
;
Northwest University(北华大学)
;
University of Texas at Austin(德克萨斯大学奥斯汀分校)
;
Microsoft Research(微软研究院)