Beyond Direct Answering: Aligning Educational LLMs as Socratic Guides via Heuristic Reinforcement Learning
超越直接回答:通过启发式强化学习将教育大语言模型调整为苏格拉底式引导者
Xiaokun Wang, Siyu Song, Wentao Liu, Xiaodong Zou
机构
*
East China Normal University(华东师范大学)
;
Shanghai Chuangjie Situo Information Technology Co., Ltd.(上海创杰思拓信息技术有限公司)
;
Shanghai Normal University(上海师范大学)
专题命中
后训练与偏好优化
:large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
Hanqing Zhu, Wenyan Cong, Zhizhou Sha, Sagnik Mukherjee, Xinyuan Song, David González-Martínez, Xiaoxia Wu, Yuandong Tian, Shiwei Liu, David Z. Pan, Zhangyang "Atlas" Wang
机构
*
The University of Texas at Austin(德克萨斯大学奥斯汀分校)
;
UIUC(伊利诺伊大学香槟分校)
;
Emory University(埃默里大学)
;
Together AI(联合人工智能公司)
;
Recursive Superintelligence Inc(递归超级智能公司)
;
ELLIS Institute Tübingen(图宾根埃利斯研究所)
ADAPT: Attention Dynamics Alignment with Preference Tuning for Faithful MLLMs
ADAPT: 通过偏好调优实现注意力动态对齐以增强多模态大模型的忠实性
Zhiyuan Yao, Zheren Fu, Zhixiao Zheng, Jiajun Li, Yi Tu, Zhendong Mao
机构
*
University of Science and Technology of China(中国科学技术大学)
;
Huawei Technologies Ltd.(华为技术有限公司)
;
State Key Laboratory of Communication Content Cognition, People’s Daily Online(人民网传播内容认知国家重点实验室)
专题命中
后训练与偏好优化
:large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
机构
*
University of Southern California(南加州大学)
;
Iowa State University(爱荷华州立大学)
;
University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
;
UT Austin(德克萨斯大学奥斯汀分校)
;
Independent Researcher(独立研究员)
;
University of Notre Dame(圣母大学)
专题命中
后训练与偏好优化
:large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
Baseline-Free Policy Optimization for Neural Combinatorial Optimization
无基线的神经组合优化策略优化
Carlos S. Sepúlveda, Gonzalo A. Ruz
机构
*
Facultad de Ingeniería y Ciencias, Universidad Adolfo Ibáñez(阿道夫·伊瓦涅斯大学工程与科学学院)
;
Dirección de Programas, Investigación y Desarrollo, Armada de Chile(智利海军计划、研究与发展局)
;
Millennium Nucleus for Social Data Science (SODAS)(千禧年社会数据科学核心(SODAS))
;
Millennium Nucleus in Data Science for Plant Resilience (PhytoLearning)(千禧年植物韧性数据科学核心(PhytoLearning))
专题命中
后训练与偏好优化
:large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
Towards Reasonable Molecular Structure Elucidation from Infrared Spectroscopy with Chemical Feedback
基于化学反馈的红外光谱合理分子结构解析研究
Yusen Tan, Hongyu Zhan, Hai-tao Yu, Changxi Chi, Wenjie Du, Jun Xia
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Westlake University(西湖大学)
;
University of Science and Technology of China(中国科学技术大学)
TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models
TrustRoboReward:面向多范式机器人奖励模型的偏好有序保序分数编辑方法
Yidong Wang, Yan Zhan, Ziteng Feng, Zhenyu Cui, Ziyi Zhou, Renzhao Liang, Jiaxuan Zhu, Zilei Yang, Yiran Zhao, Zhongkuan Mao, Bo Jia, Hanchu Ni, Chenggang Xie, Biao Liu, Yi Zhang, Yong Dai, Xiaozhu Ju, Wei Ye, Shikun Zhang
机构
*
Peking University(北京大学)
;
Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)
;
University of Science and Technology of China(中国科学技术大学)
;
Southeast University(东南大学)
;
Southern University of Science and Technology(南方科技大学)
;
Beijing University of Aeronautics and Astronautics(北京航空航天大学)
;
Beijing Language and Culture University(北京语言大学)
;
Sichuan University(四川大学)
;
Beijing University of Posts and Telecommunications(北京邮电大学)