arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4535 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4535 篇

2406.05927 2025-10-10 cs.CV cs.CR cs.LG 74%

MeanSparse: Post-Training Robustness Enhancement Through Mean-Centered Feature Sparsification

Sajjad Amini, Mohammadreza Teymoorianfard, Shiqing Ma, Amir Houmansadr

机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 后训练与偏好优化 :post-training(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09696 2025-09-23 cs.CL 74%

GRPO-LEAD: A Difficulty-Aware Reinforcement Learning Approach for Concise Mathematical Reasoning in Language Models

Jixiao Zhang, Chunsheng Zuo

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 后训练与偏好优化 :language model(title);分类 cs.CL

Comments Accepted to EMNLP 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01181 2025-09-03 cs.CV cs.AI 74%

FocusDPO: Dynamic Preference Optimization for Multi-Subject Personalized Image Generation via Adaptive Focus

Qiaoqiao Jin, Siming Fu, Dong She, Weinan Jia, Hualiang Wang, Mu Liu, Jidong Jiang

机构 * ByteDance FanQie(字节跳动FanQie)

专题命中 后训练与偏好优化 :preference optimization(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00794 2025-06-03 cs.AI 74%

Predicting Empirical AI Research Outcomes with Language Models

Jiaxin Wen, Chenglei Si, Yueh-han Chen, He He, Shi Feng

机构 * UC Berkeley(伯克利大学) Stanford(斯坦福大学) New York University(纽约大学) George Washington University(乔治华盛顿大学)

专题命中 后训练与偏好优化 :language model(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07086 2025-01-14 cs.CL 74%

Boosting Text-To-Image Generation via Multilingual Prompting in Large Multimodal Models

Yongyu Mu, Hengyu Li, Junxin Wang, Xiaoxuan Zhou, Chenglong Wang, Yingfeng Luo, Qiaozhi He, Tong Xiao, Guocheng Chen, Jingbo Zhu

专题命中 后训练与偏好优化 :prompting(title);分类 cs.CL

Comments Accepted to ICASSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.12440 2024-06-28 eess.AS cs.LG cs.SD 74%

Post-Training Embedding Alignment for Decoupling Enrollment and Runtime Speaker Recognition Models

Chenyang Gao, Brecht Desplanques, Chelsea J. -T. Ju, Aman Chadha, Andreas Stolcke

专题命中 后训练与偏好优化 :post-training(title);分类 cs.LG

Comments Accepted to ICASSP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02066 2024-06-05 cs.LG q-bio.BM 74%

Preference Optimization for Molecule Synthesis with Conditional Residual Energy-based Models

Songtao Liu, Hanjun Dai, Yue Zhao, Peng Liu

专题命中 后训练与偏好优化 :preference optimization(title);分类 cs.LG

Comments Accepted by ICML 2024(Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05782 2024-01-17 cs.CL 74%

Aligning Language Models with Human Preferences via a Bayesian Approach

Jiashuo Wang, Haozhao Wang, Shichao Sun, Wenjie Li

专题命中 后训练与偏好优化 :language model(title);分类 cs.CL

Comments NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.04269 2023-09-11 cs.CL 74%

From Sparse to Dense: GPT-4 Summarization with Chain of Density Prompting

Griffin Adams, Alexander Fabbri, Faisal Ladhak, Eric Lehman, Noémie Elhadad

专题命中 后训练与偏好优化 :prompting(title);分类 cs.CL

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.08474 2022-03-15 cs.CR cs.LG 74%

Post-Training Detection of Backdoor Attacks for Two-Class and Multi-Attack Scenarios

Zhen Xiang, David J. Miller, George Kesidis

专题命中 后训练与偏好优化 :post-training(title);分类 cs.LG

Comments Accepted to ICLR2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.08191 2021-11-29 cs.CV cs.LG 74%

Simple Post-Training Robustness Using Test Time Augmentations and Random Forest

Gilad Cohen, Raja Giryes

专题命中 后训练与偏好优化 :post-training(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16072 2026-08-18 cs.LG cs.AI 新提交 73%

Learn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization

学习剩余内容,而非已掌握内容:面向多奖励策略优化的饱和感知优势重加权方法

Yixuan Wang, Yifei Chen, Haichao Zhang, Haozheng Luo, Xander Wu, Jie Ni, Yun Fu, Nuno Vasconcelos, Yijiang Li

机构 * University of Florida(佛罗里达大学) UC San Diego(加州大学圣迭戈分校) Northeastern University(东北大学) Northwestern University(西北大学) Stanford University(斯坦福大学) Universität Innsbruck(因斯布鲁克大学)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 针对多奖励策略优化中现有方法的缺陷,提出SA-MRPO方法,动态分配优化资源,在数学推理、自适应推理、编码任务中均实现性能提升。

Comments 14 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09521 2026-08-18 cs.CL cs.AI 版本更新 73%

PEER: Unified Process-Outcome Reinforcement Learning for Structured Empathetic Reasoning

PEER:统一的过程-结果强化学习用于结构化共情推理

Yunxiao Wang, Meng Liu, Sicheng Zhao, Lizi Liao, Liqiang Nie

机构 * Shandong University(山东大学) Shandong Jianzhu University(山东建筑大学) Singapore Management University(新加坡管理大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PEER,通过结构化共情推理框架提升情感支持对话的 empathy、策略一致性及人性表现,采用GRPO与UnifiReward模型,结合数据增强减少重复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12062 2026-08-13 cs.CL cs.AI 新提交 73%

Preference Tree Optimization: Enhancing Goal-Oriented Dialogue with Look-Ahead Simulations

偏好树优化:通过前瞻模拟增强面向目标的对话

Lior Baruch, Moshe Butman, Kfir Bar, Doron Friedman

机构 * Reichman University(赖希曼大学) School of Computer Science(计算机科学学院) School of Communications(传播学院)

专题命中 后训练与偏好优化 :preference optimization(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本研究提出偏好树优化(PTO)框架,结合带前瞻的偏好树与直接偏好优化(DPO),在动机访谈领域通过虚拟患者等模拟对话生成偏好数据,训练的对话智能体在关键指标上优于基线。

Comments 13 pages, 4 figures. Accepted at an ICLR 2025 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11967 2026-08-13 cs.LG cs.AI 新提交 73%

LoongReflect: Boosting Long-Horizon Reflection in Search Agents via Global Perspective Distillation

LoongReflect:通过全局视角蒸馏提升搜索智能体的长程反思能力

Zhixin Zhang, Xinke Jiang, Zhibang Yang, Weixuan Xu, Guohong Qiu, Xu Chu, Junfeng Zhao, Yasha Wang

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 LoongReflect是将反思表述为记忆控制策略的训练框架,通过双信号通道结合全局视角蒸馏与结果导向GRPO优化,在多跳检索增强生成和数学推理任务上提升了搜索智能体的长程反思能力。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30345 2026-08-11 cs.LG cs.AI 版本更新 73%

DRIFT: Difficulty Routing Self-DIstillation with Rhythm-Gated Exploration and Success BuFfer Training

DRIFT: 基于难度路由的自我蒸馏与节奏门控探索及成功缓冲训练

Haisen Luo, Yiwei Liu, Haoning Wang, Dan Liu, Junxi Yin, Haotian Wang, Lei Zhang, Xiaoyu Tian, Shuaiting Chen, Yuansheng Song, Baoyan Guo, Xiongfei Yan, Bolan Yang, Chengwei Liu, Ming Cui, Jiong Chen

机构 * Tsinghua University(清华大学) ENS Paris-Saclay(巴黎-萨克雷大学) Beike Language and Intelligence(贝克语言与智能)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出DRIFT框架,通过难度路由和节奏门控动态分配自蒸馏与强化学习信号,结合成功缓冲和两阶段课程学习,提升大模型在复杂推理任务中的自我进化稳定性,在五个基准上平均得分79.5%,超越GRPO和SDPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17658 2026-08-07 cs.LG cs.AI cs.IT math.IT 版本更新 73%

MARS: Margin and Semantic-Aware Data Augmentation for Reward Modeling

MARS:面向奖励建模的边界与语义感知数据增强

Payel Bhattacharjee, Osvaldo Simeone, Ravi Tandon

机构 * University of Arizona(亚利桑那大学) Northeastern University London(伦敦东北大学)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出MARS框架,通过优先增强低边界偏好对并利用语义距离细化,提升奖励模型质量和对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01556 2026-08-04 cs.LG cs.AI 新提交 73%

Rethinking Personalized Reward Modeling for LLMs under Preference Heterogeneity via Group-Debiased Federated Learning

基于组去偏联邦学习的偏好异质性下大语言模型个性化奖励建模反思

Seongyoon Kim, Boryeong Cho, Jihwan Oh, Seokhyun Chung, Se-Young Yun

机构 * Institute of Engineering Research, Korea University(韩国大学工程研究所) Kim Jaechul Graduate School of AI, KAIST(韩国科学技术院金在哲人工智能研究生院) Industrial Management Engineering, Korea University(韩国大学产业管理工程学院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对大语言模型个性化奖励建模的偏好异质性问题,提出FedGD方法,通过组去偏的客户端采样抵消组不平衡影响,实现无需预先知晓潜在组的有效个性化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00584 2026-08-04 cs.CV cs.AI cs.LG 新提交 73%

Element-Aware Group Learning for E-Commerce Image Generation

面向电商图像生成的元素感知组学习

Jingtong Chen, Jiahui Wang, Xue Zhao, ShaoGuo Liu, Minghao Li

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 针对电商图像生成中GRPO仅在完整提示层面分配信用的缺陷,提出EAGLE-GRPO,通过分解奖励并推导闭式解实现元素级信用分配,提升提示质量与生成图像性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29363 2026-08-03 eess.AS cs.AI cs.LG cs.SD 新提交 73%

Stable Autoregressive Speech Generation with Low-Frame-Rate High-Dimensional Continuous Tokens

基于低帧率高维连续标记的稳定自回归语音生成

Yi Luo, Rongzhi Gu, Jixun Yao

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 针对自回归语音生成的序列长度、表征容量与长时稳定性平衡难题,本文提出Locodec编解码器与MP-ELD流匹配框架,实现高保真、高可预测性且稳定的长时语音合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28127 2026-07-31 cs.CL cs.LG q-fin.ST q-fin.TR 新提交 73%

FinSMART: Financial Sentiment Analysis for Algorithmic Trading through Market-Aligned Reinforcement Learning

FinSMART:基于市场对齐强化学习的算法交易金融情感分析

Giorgos Iacovides, Wuyang Zhou, Danilo Mandic

机构 * Imperial College London(帝国理工学院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 FinSMART是首个基于市场对齐强化学习的金融情感分析框架,通过市场感知数据过滤与非对称交易奖励优化情感信号,在交易回报等指标上较基线提升220%,可自适应市场动态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27631 2026-07-31 cs.AI cs.CL 新提交 73%

ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning

ReDiPPO:用于数学推理的参考引导值校准与差异感知标记重加权

Zhenrong Zhang, Fei Wu, Jun Du, Jianshu Zhang, Si Wei

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对数学推理中PPO的标记级信用分配难题,ReDiPPO引入参考引导评判器并通过值估计差异重加权标记优势,提升值估计精度且优于PPO、DAPO等基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26862 2026-07-30 cs.LG cs.AI 新提交 73%

ReCo: Reweighting GRPO Against Distributional Concentration

ReCo:针对分布集中问题的GRPO重加权方法

Junoh Park, Junseo Hwang, Wonguk Cho, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 针对GRPO过度关注高概率响应导致推理覆盖度下降的问题,提出ReCo重加权方法,在多个数学推理基准上提升了大k值下的Pass@k表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06194 2026-07-30 cs.CL cs.AI 版本更新 73%

MICA: Multi-granularity Intertemporal Credit Assignment for Long-Horizon Emotional Support Dialogue

MAPO:混合优势策略优化用于长时多轮对话

Naifan Zhang, Ruihan Sun, Jinwei Su, Hengjie Yang, Zhengyuan Pan, Zhaohan Chen, Xiaofan Zhang

机构 * NatureSelect Tsinghua University(清华大学) South China Normal University(华南师范大学) Xiamen University(厦门大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 MAPO通过混合优势策略优化,利用密集过程反馈和多级归一化,提升长时多轮对话的稳定性和性能,优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22996 2026-07-28 cs.CL cs.AI 新提交 73%

Beyond Direct Answering: Aligning Educational LLMs as Socratic Guides via Heuristic Reinforcement Learning

超越直接回答:通过启发式强化学习将教育大语言模型调整为苏格拉底式引导者

Xiaokun Wang, Siyu Song, Wentao Liu, Xiaodong Zou

机构 * East China Normal University(华东师范大学) Shanghai Chuangjie Situo Information Technology Co., Ltd.(上海创杰思拓信息技术有限公司) Shanghai Normal University(上海师范大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对教育场景中LLMs直接作答问题,提出HeuristicEdu两阶段管道,经监督热身和GRPO,利用特定对话及启发式奖励训练Qwen2.5 - 7B,提升了支架有效性,降低关键词泄漏,表明规模并非引发苏格拉底行为的唯一因素。

Comments 12 pages, 2 figures, 5 tables; includes an appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21619 2026-07-27 cs.CL cs.AI 新提交 73%

Adversarial Style Optimization: Enhancing VLM Jailbreaks by GRPO-based Stylistic Triggers Optimization

对抗风格优化:通过基于GRPO的风格触发优化增强VLM越狱

Bingjun Luo, Jialin Guo, Yue Yao, Xinpeng Ding

机构 * Tsinghua University(清华大学) Harbin Engineering University(哈尔滨工程大学) Shandong University(山东大学) Xidian University(西安电子科技大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究MLLMs安全对齐易受越狱攻击问题,提出基于GRPO的对抗风格优化(ASO)方法,通过优化风格触发增强视觉越狱,实验证明该方法显著提高攻击成功率,凸显风格偏差对MLLMs红队测试的作用。

Comments Accepted by CVPR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19331 2026-07-22 cs.LG cs.AI 新提交 73%

ISO: An RLVR-Native Optimization Stack

ISO:一种原生 RLVR 的优化栈

Hanqing Zhu, Wenyan Cong, Zhizhou Sha, Sagnik Mukherjee, Xinyuan Song, David González-Martínez, Xiaoxia Wu, Yuandong Tian, Shiwei Liu, David Z. Pan, Zhangyang "Atlas" Wang

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) UIUC(伊利诺伊大学香槟分校) Emory University(埃默里大学) Together AI(联合人工智能公司) Recursive Superintelligence Inc(递归超级智能公司) ELLIS Institute Tübingen(图宾根埃利斯研究所)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 研究 RLVR 中缺失的优化层,提出等谱优化(ISO)框架,包括离线的 ISO-Merger 和在线的 ISO-Optimizer。通过光谱继承,在推理和编码任务中,用更少训练步骤提高准确率,为 RLVR 优化层问题提供了具体解决方案。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19313 2026-07-22 cs.LG cs.AI 新提交 73%

Off-Context GRPO: Learning to Reason on Hard Problems using Privileged Information

脱离上下文的广义信赖域策略优化算法:利用特权信息学习解决难题

Priyank Agrawal, Ankur Samanta, Shervin Ghasemlou, Jalaj Bhandari, Kavosh Asadi, Daniel Jiang, Aditya Modi

机构 * Meta AI Columbia University(哥伦比亚大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究利用特权信息解决强化学习难题,提出脱离上下文的广义信赖域策略优化算法(OC - GRPO),通过引导展开和重要性校正目标避免训练不匹配,在标准数学推理基准上比普通GRPO有显著提升且成本低。

Comments 24 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18470 2026-07-22 cs.LG cs.AI 新提交 73%

RRPO: Reference-Relative Policy Optimization with Stratified Conditional Rollouts

RRPO:基于分层条件展开的参考相对策略优化

Yuxin Xiong, Xunyi Jiang, Rohan Surana, Xintong Li, Sheldon Yu, Nikki Lijing Kuang, Ryan A. Rossi, Jingbo Shang, Tong Yu, Julian McAuley, Junda Wu

机构 * University of California San Diego(加利福尼亚大学圣地亚哥分校) Adobe Research(Adobe研究院)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 研究提出RRPO,通过参考相对对比比较推广GRPO。用分层条件展开构建锚集,训练投影头定义对比优势,在策略优化中评估。不依赖任务真实验证器,在多种设置下有竞争力,优于弱监督基线,监督微调后有额外收益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09870 2026-07-17 cs.LG cs.AI 版本更新 73%

Relational Preference Encoding in Looped Transformer Internal States

循环变压器内部状态中的关系偏好编码

Jan Kirin

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 研究循环变压器如何编码人类偏好,通过提取内部迭代状态训练轻量评估头,发现偏好关系性编码优于非线性方法,提出翻转测试作为必要诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏