arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-09 至 2026-03-09 共收录 6 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 6 篇

2603.06424 2026-03-09 cs.CL 94%

From Prompting to Preference Optimization: A Comparative Study of LLM-based Automated Essay Scoring

从提示到偏好优化:基于LLM的自动作文评分方法比较研究

Minh Hoang Nguyen, Vu Hoang Pham, Xuan Thanh Huynh, Phuc Hong Mai, Vinh The Nguyen, Quang Nhut Huynh, Huy Tien Nguyen, Tung Le

机构 * Faculty of Information Technology, University of Science, Ho Chi Minh City, Vietnam(信息科技学院,科学大学,胡志明市,越南) Vietnam National University, Ho Chi Minh City, Vietnam(越南国家大学,胡志明市,越南)

专题命中 后训练与偏好优化 :LLM(title,abstract);preference optimization(title,abstract);prompting(title,abstract);large language model(abstract)

AI总结 本文比较了基于LLM的自动作文评分方法,发现结合k-SFT和RAG的配置在F1分数上表现最佳,为英语作为第二语言的自动评分提供了新的研究方向。

Comments 19 pages, 10 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06444 2026-03-09 cs.SD cs.AI 83%

Prosodic Boundary-Aware Streaming Generation for LLM-Based TTS with Streaming Text Input

面向流式文本输入的语调边界感知流式生成用于基于大语言模型的语音合成

Changsong Liu, Tianrui Wang, Ye Ni, Yizhou Peng, Eng Siong Chng

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Tianjin University, China(天津大学) Southeast University, China(东南大学)

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(abstract);分类 cs.AI

AI总结 本文提出一种面向语调边界的后训练策略,通过调整预训练模型以处理流式文本输入,从而提升语音合成的语调质量和长文本生成的稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17721 2026-03-09 cs.LG cs.AI cs.MA 82%

Aligning Compound AI Systems via System-level DPO

通过系统级DPO对复合AI系统进行对齐

Xiangwen Wang, Yibo Jacky Zhang, Zhoujie Ding, Katherine Tsai, Haolun Wu, Sanmi Koyejo

机构 * Stanford University(斯坦福大学) University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) Mila Quebec AI Institute(魁北克AI研究院)

专题命中 后训练与偏好优化 :LLM(abstract);language model(abstract);foundation model(abstract);preference optimization(abstract)

AI总结 本文提出SysDPO框架,通过系统级DPO实现复合AI系统的联合对齐,解决了组件间非可微分交互和系统偏好转换的问题。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06065 2026-03-09 cs.IR 80%

ChatShopBuddy: Towards Reliable Conversational Shopping Agents via Reinforcement Learning

ChatShopBuddy:通过强化学习实现可靠的对话购物代理

Yiruo Cheng, Kelong Mao, Tianhao Li, Jiejun Tan, Ji-Rong Wen, Zhicheng Dou

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 ChatShopBuddy通过强化学习优化对话购物代理,结合分层奖励建模和动态对比策略优化,提升购物代理的稳定性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15160 2026-03-09 cs.AI cs.CL 79%

Knowledge Graphs are Implicit Reward Models: Path-Derived Signals Enable Compositional Reasoning

知识图谱是隐式奖励模型:路径衍生信号促进组合推理

Yuval Kansal, Niraj K. Jha

机构 * Department of Electrical and Computer Engineering, Princeton University, New Jersey, USA(电气与计算机工程系,普林斯顿大学,新泽西州,美国)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用知识图谱作为隐式奖励模型,通过路径衍生信号提升模型在复杂推理任务中的组合推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15849 2026-03-09 cs.CL cs.AI 73%

IntelliAsk: Learning to Ask High-Quality Research Questions via RLVR

IntelliAsk: 通过RLVR学习生成高质量的研究问题

Karun Sharma, Vidushee Vats, Shengzhi Li, Yuxiang Wang, Zhongtian Sun, Prayag Tiwari

专题命中 后训练与偏好优化 :LLM(abstract);SFT(abstract);分类 cs.CL、cs.AI

AI总结 IntelliAsk通过RLVR技术提升生成问题的质量,生成更深入、基于证据的问题,优于现有基线模型。

Comments 24 Pages, v2, Abstract Modified

详情

展开后加载摘要…

URL PDF HTML 收藏