arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-13 至 2026-03-13 共收录 9 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 9 篇

2603.12246 2026-03-13 cs.AI cs.CL cs.LG 89%

Examining Reasoning LLMs-as-Judges in Non-Verifiable LLM Post-Training

检验推理LLM作为裁判在不可验证LLM后续训练中的表现

Yixin Liu, Yue Yu, DiJia Su, Sid Wang, Xuewei Wang, Song Jiang, Bo Liu, Arman Cohan, Yuandong Tian, Zhengxing Chen

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过受控合成设置检验推理LLM作为裁判在非验证LLM后续训练中的效果,发现推理裁判能生成高性能策略,但易受对抗性输出影响,揭示了其在实际政策训练中的潜力与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11661 2026-03-13 cs.SD 87%

Resonate: Reinforcing Text-to-Audio Generation via Online Feedback from Large Audio Language Models

Resonate:通过来自大音频语言模型的在线反馈强化文本到音频生成

Xiquan Li, Junxi Liu, Wenxi Chen, Haina Zhu, Ziyang Ma, Xie Chen

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);pretraining(abstract);preference optimization(abstract)

AI总结 Resonate通过整合在线GRPO和大音频语言模型奖励,提升文本到音频生成的音频质量和语义对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11901 2026-03-13 cs.LG 83%

FlexRec: Adapting LLM-based Recommenders for Flexible Needs via Reinforcement Learning

FlexRec: 通过强化学习适应LLM推荐系统以满足灵活需求

Yijun Pan, Weikang Qiu, Qiyao Ma, Mingxuan Ju, Tong Zhao, Neil Shah, Rex Ying

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(abstract);分类 cs.LG

AI总结 FlexRec通过强化学习框架解决LLM推荐系统在需求特定排序和泛化设置中的挑战,提升NDCG@5和Recall@5性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12163 2026-03-13 cs.LG cs.AI math.ST stat.ML stat.TH 81%

A Quantitative Characterization of Forgetting in Post-Training

后训练中遗忘的定量刻画

Krishnakumar Balasubramanian, Shiva Prasad Kasiviswanathan

机构 * Department of Statistics, University of California, Davis(加州大学戴维斯分校统计系) Amazon(亚马逊)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了后训练中遗忘的定量刻画,通过理论分析揭示了不同KL目标对遗忘形式的影响,并探讨了回放与这些目标的交互作用,最终提出了保留旧质量与控制漂移的条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11089 2026-03-13 cs.SD cs.MM eess.AS 78%

V2A-DPO: Omni-Preference Optimization for Video-to-Audio Generation

V2A-DPO:面向视频到音频生成的多偏好优化

Nolan Chan, Timmy Gang, Yongqian Wang, Yuzhe Liang, Dingdong Wang

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

AI总结 V2A-DPO通过多偏好优化提升视频到音频生成的质量,结合AudioScore评分系统和课程学习策略,在VGGSound数据集上实现了优于DDPO和预训练基线的性能。

Comments Accepted at ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11126 2026-03-13 cs.MA cs.CL 77%

Enhancing Value Alignment of LLMs with Multi-agent system and Combinatorial Fusion

通过多智能体系统和组合融合增强大语言模型的价值对齐

Yuanhong Wu, Djallel Bouneffouf, D. Frank Hsu

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL

AI总结 本文提出VAS-CFA框架,通过多智能体和组合融合提升大语言模型的价值对齐,实验证明其在标准度量上优于现有方法。

Comments 5 pages, 3 figures, accepted to 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12228 2026-03-13 cs.LG cs.AI 73%

Neural Thickets: Diverse Task Experts Are Dense Around Pretrained Weights

神经丛林:多样化的任务专家在预训练权重周围密集分布

Yulu Gan, Phillip Isola

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 后训练与偏好优化 :pretraining(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种简单并行的后训练方法,通过随机扰动和多数投票发现预训练权重周围密集分布的任务专家,提升大规模模型性能。

Comments codes are provided at https://github.com/sunrainyg/RandOpt

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11494 2026-03-13 cs.DB 67%

PRMB: Benchmarking Reward Models in Long-Horizon CBT-based Counseling Dialogue

PRMB:基于长期horizon认知行为疗法对话的奖励模型基准测试

Yougen Zhou, Qin Chen, Ningning Zhou, Jie Zhou, Liang He

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

AI总结 PRMB提出了一种用于评估奖励模型在多会话CBT咨询中长期效果的基准,揭示了现有方法的不足并展示了生成奖励模型的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24873 2026-03-13 cs.AI cs.CL 62%

Let It Flow: Agentic Crafting on Rock and Roll, Building the ROME Model within an Open Agentic Learning Ecosystem

让它流动:在摇滚与铁中进行代理创造,构建ROME模型于一个开放的代理学习生态系统中

Weixun Wang, XiaoXiao Xu, Wanhe An, Fangwen Dai, Wei Gao, Yancheng He, Ju Huang, Qiang Ji, Hanqi Jin, Xiaoyang Li, Yang Li, Zhongwen Li, Shirong Lin, Jiashun Liu, Zenan Liu, Tao Luo, Dilxat Muhtar, Yuanbin Qu, Jiaqiang Shi, Qinghui Sun, Yingshui Tan, Hao Tang, Runze Wang, Yi Wang, Zhaoguo Wang, Yanan Wu, Shaopan Xiong, Binchen Xu, Xander Xu, Yuchi Xu, Qipeng Zhang, Xixia Zhang, Haizhou Zhao, Jie Zhao, Shuaibing Zhao, Baihui Zheng, Jianhui Zheng, Suhang Zheng, Yanni Zhu, Mengze Cai, Kerui Cao, Xitong Chen, Yue Dai, Lifan Du, Tao Feng, Tao He, Jin Hu, Yijie Hu, Ziyu Jiang, Cheng Li, Xiang Li, Jing Liang, Xin Lin, Chonghuan Liu, ZhenDong Liu, Zhiqiang Lv, Haodong Mi, Yanhu Mo, Junjia Ni, Shixin Pei, Jingyu Shen, XiaoShuai Song, Cecilia Wang, Chaofan Wang, Kangyu Wang, Pei Wang, Tao Wang, Wei Wang, Ke Xiao, Mingyu Xu, Tiange Xu, Nan Ya, Siran Yang, Jianan Ye, Yaxing Zang, Duo Zhang, Junbo Zhang, Boren Zheng, Wanxi Deng, Ling Pan, Lin Qu, Wenbo Su, Jiamang Wang, Wei Wang, Hu Wei, Minggang Wu, Cheng Yu, Bing Zhao, Zhicheng Zheng, Bo Zheng

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于代理学习生态系统(ALE)的开源代理ROME,通过数据合成协议和交互感知策略优化算法,在多个基准测试中展现出优异性能,验证了ALE的有效性。

Comments 36 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏