PACT: Privileged Trace Co-Training for Multi-Turn Tool-Use Agents
PACT: 多轮工具使用智能体的特权轨迹协同训练
Zhenbang Du, Jun Luo, Zhiwei Zheng, Xiangchi Yuan, Kejing Xia, Dachuan Shi, Qirui Jin, Qijia He, Shaofeng Zou, Yingbin Liang, Wenke Lee
机构
*
Georgia Institute of Technology(佐治亚理工学院)
;
Ohio State University(俄亥俄州立大学)
;
University of Pennsylvania(宾夕法尼亚大学)
;
Arizona State University(亚利桑那州立大学)
CapRL++: Unified Reinforcement Learning with Verifiable Rewards for Dense Image and Video Captioning
CapRL++:基于可验证奖励的统一强化学习用于密集图像和视频描述生成
Penghui Yang, Long Xing, Xiaoyi Dong, Yuhang Zang, Yuhang Cao, Yibin Wang, Yujie Zhou, Jiazi Bu, Jianze Liang, Qidong Huang, Jiaqi Wang, Feng Wu, Dahua Lin
机构
*
Tsinghua University(清华大学)
;
University of Science and Technology of China(中国科学技术大学)
;
Microsoft(微软)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
Shanghai Innovation Institute(上海创新研究院)
;
Alibaba Cloud(阿里云)
;
The Chinese University of Hong Kong(香港中文大学)
Rethinking Heterogeneous LLM Merging: A Weighted Model Averaging Perspective
重新思考异构语言模型合并:加权模型平均视角
Jiahe Fan, Yinghao Hou, Si Chen, Aiyuan Zhang, Hong Xie, Defu Lian
机构
*
University of Science and Technology of China(中国科学技术大学)
;
School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院)
专题命中
指令微调
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
机构
*
Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)
;
Department of Data Science, City University of Hong Kong(香港城市大学数据科学系)
;
Meituan(美团)
;
WeChat, Tencent(腾讯微信)
;
Beijing Key Laboratory of Research on Large Models and Intelligent Governance(大型模型与智能治理北京市重点实验室)
专题命中
指令微调
:language model(title,abstract);large language model(abstract);post-training(abstract);分类 cs.CL