Task-Induced Representational Invariances Depend on Learning Objective in Deep RL
任务诱导的表征不变性依赖于深度强化学习中的学习目标
Manu Srinath Halvagal, Sebastian Lee, SueYeon Chung
机构
*
Department of Physics, Harvard University(哈佛大学物理系)
;
Kempner Institute, Harvard University(哈佛大学凯普纳研究所)
;
Center for Computational Neuroscience, Flatiron Institute(Flatiron研究所计算神经科学中心)
From Fragments to Facts: A Curriculum-Driven DPO Approach for Generating Hindi News Veracity Explanations
从碎片到事实:一种课程驱动的DPO方法用于生成印地语新闻真实性解释
Pulkit Bansal, Raghvendra Kumar, Shakti Singh, Adam Jatowt, Sriparna Saha
机构
*
TCS Research(TCS研究)
;
Department of Computer Science and Engineering, Indian Institute of Technology Patna(印度理工学院帕纳布计算机科学与工程系)
;
Indian Institute of Technology Patna(印度理工学院帕纳布)
;
University of Innsbruck(因斯布鲁克大学)
Mining or Synthesis? Rethinking Exploration Efficiency in Iterative Alignment of Mathematical Reasoning
挖掘还是合成?重新思考数学推理迭代对齐中的探索效率
Jun Rao, Zixiong Yu, Xuebo Liu, Guhan Chen, Jing Li, Hejin Wang, Jiansheng Wei, Xiaojun Meng, Min Zhang
机构
*
Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳研究院)
;
Huawei Large Model Data Technology Lab(华为大模型数据技术实验室)
;
Huawei Multimodal Model Lab(华为多模态模型实验室)
;
Department of Statistics and Data Science, Tsinghua University, Beijing, China(清华大学统计与数据科学系)
专题命中
后训练与偏好优化
:large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL
机构
*
University of Science and Technology of China(中国科学技术大学)
;
University of California, Los Angeles(加州大学洛杉矶分校)
;
The Chinese University of Hong Kong(香港中文大学)
;
Xiaohongshu Inc.(小红书公司)
专题命中
后训练与偏好优化
:large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI
机构
*
Carnegie Mellon University(卡内基梅隆大学)
;
Northwestern University(西北大学)
;
University of North Carolina, Chapel Hill(北卡罗来纳大学教堂山分校)
;
University of Pittsburgh(匹兹堡大学)
专题命中
后训练与偏好优化
:large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI
Enhancing Table Reasoning with Deterministic Table-State Rewards
通过确定性表格状态奖励增强表格推理
Tung Sum Thomas Kwok, Xinyu Wang, Hengzhi He, Xiaofeng Lin, Peng Lu, Liheng Ma, Chunhe Wang, Chun Ho Mak, Yuyu Luo, Ying Nian Wu, Lei Ding, Guang Cheng
机构
*
University of California, Los Angeles(加州大学洛杉矶分校)
;
McGill University(麦吉尔大学)
;
Université de Montréal(蒙特利尔大学)
;
University College London(伦敦大学学院)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
University of Manitoba(曼尼托巴大学)
专题命中
后训练与偏好优化
:large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI
Toward Stable Value Alignment: Introducing Independent Modules for Consistent Value Guidance
迈向稳定的值对齐:引入独立模块以实现一致的价值引导
Wenhao Chen, Sirui Sun, Shengyuan Bai, Guojie Song
机构
*
School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院)
;
Yuanpei College, Peking University(北京大学元培学院)
;
State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(北京大学通用人工智能国家重点实验室)
专题命中
后训练与偏好优化
:large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI
机构
*
Information Hub, The Hong Kong University of Science and Technology (Guangzhou), China(香港科学与技术大学(广州)信息中心,中国)
;
The Hong Kong University of Science and Technology, Hong Kong SAR(香港科学与技术大学,香港特别行政区)
专题命中
后训练与偏好优化
:large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL