arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-23 至 2026-02-23 共收录 1 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 1 篇

2602.15854 2026-02-23 cs.CL cs.AI 86%

Decoupling Strategy and Execution in Task-Focused Dialogue via Goal-Oriented Preference Optimization

通过目标导向的偏好优化实现任务导向对话中的解耦策略与执行

Jingyi Xu, Xingyu Ren, Zhoupeng Shou, Yumeng Zhang, Zhiqiang You

机构 * School of Information Engineering, China Jiliang University, Hangzhou, China(信息工程学院,中国浙江大学,杭州,中国) College of Chemical and Biological Engineering, Zhejiang University, Hangzhou, China(化学与生物工程学院,浙江大学,杭州,中国)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出GOPO框架,通过解耦策略规划与响应生成,提升任务导向对话系统的长周期任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏