arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4507 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4507 篇

2503.07703 2025-03-12 cs.CV 89%

Seedream 2.0: A Native Chinese-English Bilingual Image Generation Foundation Model

Lixue Gong, Xiaoxia Hou, Fanshi Li, Liang Li, Xiaochen Lian, Fei Liu, Liyang Liu, Wei Liu, Wei Lu, Yichun Shi, Shiqi Sun, Yu Tian, Zhi Tian, Peng Wang, Xun Wang, Ye Wang, Guofeng Wu, Jie Wu, Xin Xia, Xuefeng Xiao, Linjie Yang, Zhonghua Zhai, Xinyu Zhang, Qi Zhang, Yuwei Zhang, Shijia Zhao, Jianchao Yang, Weilin Huang

专题命中 后训练与偏好优化 :foundation model(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments Official Page: https://team.doubao.com/tech/seedream

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05133 2024-12-10 cs.CL cs.AI cs.LG 89%

Personalized Language Modeling from Personalized Human Feedback

Xinyu Li, Ruiyang Zhou, Zachary C. Lipton, Liu Leqi

专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract);large language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02685 2024-12-04 cs.CL cs.AI cs.LG 89%

T-REG: Preference Optimization with Token-Level Reward Regularization

Wenxuan Zhou, Shujian Zhang, Lingxiao Zhao, Tao Meng

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07863 2024-11-13 cs.LG cs.AI cs.CL stat.ML 89%

RLHF Workflow: From Reward Modeling to Online RLHF

Hanze Dong, Wei Xiong, Bo Pang, Haoxiang Wang, Han Zhao, Yingbo Zhou, Nan Jiang, Doyen Sahoo, Caiming Xiong, Tong Zhang

专题命中 后训练与偏好优化 :RLHF(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments Published in Transactions on Machine Learning Research (09/2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.20370 2024-10-01 cs.LG cs.AI cs.CL 89%

The Perfect Blend: Redefining RLHF with Mixture of Judges

Tengyu Xu, Eryk Helenowski, Karthik Abinav Sankararaman, Di Jin, Kaiyan Peng, Eric Han, Shaoliang Nie, Chen Zhu, Hejia Zhang, Wenxuan Zhou, Zhouhao Zeng, Yun He, Karishma Mandyam, Arya Talabzadeh, Madian Khabsa, Gabriel Cohen, Yuandong Tian, Hao Ma, Sinong Wang, Han Fang

专题命中 后训练与偏好优化 :RLHF(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments submitted to conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04274 2024-06-07 cs.LG cs.AI cs.CL 89%

Self-Play with Adversarial Critic: Provable and Scalable Offline Alignment for Language Models

Xiang Ji, Sanjeev Kulkarni, Mengdi Wang, Tengyang Xie

专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract);large language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02263 2024-04-04 cs.CL cs.AI cs.LG 89%

Automatic Pair Construction for Contrastive Post-training

Canwen Xu, Corby Rosset, Ethan C. Chau, Luciano Del Corro, Shweti Mahajan, Julian McAuley, Jennifer Neville, Ahmed Hassan Awadallah, Nikhil Rao

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments NAACL 2024 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16177 2026-08-18 cs.CR cs.AI 新提交 89%

Measuring Obedience to Authority Across Large Language Models with the Milgram Paradigm

用米尔格拉姆范式测量大型语言模型对权威的服从性

Hidayet Aksu

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.AI

AI总结 该研究将米尔格拉姆服从范式迁移至LLMs,测量42个模型的服从性概况,发现服从性异质性高、具模型特异性,受情境因素影响,且反映检查点而非模型谱系。

Comments 10 pages, 7 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14498 2026-08-17 cs.LG cs.DC 新提交 89%

Rollplex: Cross-Phase GPU Spatial Sharing for Vision Language Model Post-Training

Rollplex:面向视觉语言模型后训练的跨阶段GPU空间共享

Hanfeng Lu, Tianyu Feng, Suyi Li, Yuheng Zhao, Wei Gao, Shaopan Xiong, Ju Huang, Siran Yang, Jiamang Wang, Lin Qu, Wei Wang

机构 * HKUST(香港科技大学) Alibaba Inc(阿里巴巴公司)

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(title,abstract);分类 cs.LG

AI总结 Rollplex是一种跨阶段GPU空间共享运行时,通过解耦RL后训练的参考与训练阶段、优化内存与并行度,提升VLMs后训练的GPU利用率与训练速度。

Comments 16 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00782 2026-08-04 cs.CL 新提交 89%

Distill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher Guidance

从自适应教师指导中恢复负强化学习组的学习信号:针对失败情况进行知识蒸馏

Zhuowen Han, Jinwei Xiao, Zhengxi Lu, Renren Jin, Zhiyuan Yao, Yuxin Liu, Hongyan Hao, Yueqing Sun, Yu Yang, Qi GU, Xunliang Cai, Deyi Xiong

机构 * Tianjin University(天津大学) Meituan(美团)

专题命中 后训练与偏好优化 :SFT(summary_cn,abstract);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对GRPO与OPD简单结合的性能缺陷,提出RSTG方法,通过选择性自适应蒸馏及补充SFT,使数学任务性能提升4.02%、代码任务提升3.05%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18747 2026-06-18 cs.RO cs.AI 新提交 89%

Generating Natural and Expressive Robot Gestures through Iterative Reinforcement Learning with Human Feedback using LLMs

通过基于人类反馈的迭代强化学习利用大语言模型生成自然且富有表现力的机器人手势

Chris Lee, Flora Salim, Benjamin Tag, Francisco Cruz

机构 * University of New South Wales(新南威尔士大学) Universidad Central de Chile(智利中央大学)

专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对社交机器人手势生成僵硬问题,提出将ChatGPT集成到Pepper机器人中生成共语手势,并引入基于人类反馈的迭代强化学习(RLHF)优化手势,实验表明RLHF提升了手势的表现力、相关性和流畅性。

Comments 8 Pages, 6 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10217 2026-06-10 cs.LG cs.CR 新提交 89%

Alignment Defends LLMs from Property Inference Attacks

对齐防御LLM免受属性推断攻击

Pengrun Huang, Chhavi Yadav, Ruihan Wu, Kamalika Chaudhuri

机构 * University of California, San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学) Simons Institute, UC Berkeley(伯克利大学Simons研究所)

专题命中 后训练与偏好优化 :LLM(title_cn);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出基于对齐的防御方法,通过后训练调整模型输出分布,在不修改训练数据的情况下缓解属性推断攻击,并保持效用与机密性的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07535 2026-06-09 cs.CL 新提交 89%

Multilingual Refusal Alignment for Safer Large Language Models

多语言拒绝对齐:构建更安全的大型语言模型

Aleksandra Krasnodębska, Wojciech Kusa, Aldo Lipani

机构 * NASK National Research Institute(国家研究 institute) University College London(伦敦大学学院)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(abstract);分类 cs.CL

AI总结 本研究系统探究多语言对齐动态,通过引入覆盖12种欧洲语言的RefusEU数据集和DPO实验,发现仅用英语对齐不足以保障跨语言安全,而多语言训练可在不降低通用性能的前提下提升安全性。

Comments Accepted to Findings ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22478 2026-05-20 cs.LG 89%

Transformation-Augmented GRPO for Enhancing Exploration in Reasoning of Large Language Models

增强推理探索的变换增强GRPO

Khiem Le, Phuc Nguyen, Youssef Mroueh, Chi-Heng Lin, Shangqian Gao, Ting Hua, Nitesh V. Chawla

机构 * University of Notre Dame(诺特大学) IBM Research(IBM研究院) Meta AI Florida State University(佛罗里达州立大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.LG

AI总结 本文提出变换增强GRPO(TA-GRPO)方法,通过问题重述解决大语言模型强化学习中梯度消失和多样性崩溃问题,提升模型在推理任务中的探索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25448 2026-05-20 cs.CR cs.CL 89%

Fingerprinting LLMs via Prompt Injection

通过提示注入指纹化LLM

Yuepeng Hu, Zhengyuan Jiang, Mengyuan Li, Osama Ahmed, Zhicong Huang, Cheng Hong, Neil Gong

机构 * Duke University(杜克大学) Ant Group(蚂蚁集团)

专题命中 后训练与偏好优化 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出LLMPrint框架,通过利用LLM对提示注入的固有脆弱性来构建指纹,以解决已发布模型的溯源问题,其核心方法是优化提示以获得唯一且抗后处理的指纹,实验显示其在高召回率下保持低误报率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22664 2026-05-19 cs.AI 89%

Real-Time Aligned Reward Model beyond Semantics

实时对齐奖励模型超越语义

Zixuan Huang, Xin Xia, Yuxi Ren, Jianbin Zheng, Xuefeng Xiao, Hongyan Xie, Li Huaqiu, Songshi Liang, Zhongxiang Dai, Fuzhen Zhuang, Jianxin Li, Yikun Ban, Deqing Wang

机构 * Beihang University(北京航空航天大学) Tsinghua University(清华大学) Renmin University of China(中国人民大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出R2M框架,通过实时利用策略模型反馈来对齐策略分布偏移,解决RLHF中奖励过拟合问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01123 2026-05-05 cs.AI 89%

PERSA: Reinforcement Learning for Professor-Style Personalized Feedback with LLMs

PERSA:利用强化学习生成教授风格的个性化反馈

Ravi Ranjan, Utkarsh Grover, Xiaomin Lin, Agoritsa Polyzou

机构 * Florida International University(佛罗里达国际大学) University of South Florida(佛罗里达州立大学)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 PERSA通过结合监督微调、奖励建模和PPO,利用LLM生成符合教授风格的编程反馈,提升反馈的风格匹配度和准确性。

Comments 18 pages, 6 figures, 7 tables, accepted to conference ACL-2026, BEA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05469 2026-04-08 stat.ME cs.LG stat.ML 89%

Task Ecologies and the Evolution of World-Tracking Representations in Large Language Models

任务生态与大语言模型中世界追踪表示的进化

Giulio Valentino Dalla Riva

机构 * Baffelan OÜ

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(title);small language model(abstract);post-training(abstract)

AI总结 研究语言模型作为演化的模型生物,探讨自回归下一个token学习何时选择世界追踪表示,提出生态真实性概念及最小复杂度零超额解,分析transformer家族中固定编码分析的应用条件及失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14347 2026-03-17 cs.CL cs.CY 89%

Motivation in Large Language Models

大语言模型中的动机

Omer Nahum, Asael Sklar, Ariel Goldstein, Roi Reichart

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 研究大语言模型是否表现出类似人类的动机特征,通过实验发现其动机报告与行为、任务类型及外部因素相关,揭示了动机在模型行为中的系统性关联。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13212 2026-03-17 cs.LG 89%

Towards Understanding Valuable Preference Data for Large Language Model Alignment

迈向理解大型语言模型对齐的有价值偏好数据

Zizhuo Zhang, Qizhou Wang, Shanshan Ye, Jianing Zhu, Jiangchao Yao, Bo Han, Masashi Sugiyama

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 本文研究了大型语言模型对齐中偏好数据的质量问题,提出截断影响函数(TIF)评估数据质量,并引入两种计算更简单的评分函数以提高偏好数据选择的准确性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00724 2026-03-03 cs.CL 89%

RLAR: An Agentic Reward System for Multi-task Reinforcement Learning on Large Language Models

RLAR:一种用于大型语言模型多任务强化学习的代理奖励系统

Andrew Zhuoer Feng, Cunxiang Wang, Bosi Wen, Yidong Wang, Yu Luo, Hongning Wang, Minlie Huang

机构 * Tsinghua Univeristy(清华大学) Peking University(北京大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 RLAR通过动态生成奖励函数提升大型语言模型在多任务强化学习中的性能和泛化能力。

Comments 25 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21728 2026-02-26 cs.CL 89%

Explore-on-Graph: Incentivizing Autonomous Exploration of Large Language Models on Knowledge Graphs with Path-refined Reward Modeling

在知识图谱上探索:通过路径细化奖励建模激励大语言模型自主探索

Shiqi Yan, Yubo Chen, Ruiqi Zhou, Zhengxi Yao, Shuai Chen, Tianyi Zhang, Shijie Zhang, Wei Qiang Zhang, Yongfeng Huang, Haixin Duan, Yunqi Zhang

机构 * Zhongguancun Laboratory, Beijing, China(中关村实验室,北京,中国) Department of Electronic Engineering, Tsinghua University, Beijing, China(电子工程系,清华大学,北京,中国) Institute for Network Sciences and Cyberspace, Tsinghua University, Beijing, China(网络科学与网络空间研究院,清华大学,北京,中国) Ant International, Ant Group, Hangzhou, Zhejiang, China(蚂蚁集团,杭州,浙江,中国)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出Explore-on-Graph框架,通过强化学习和路径细化奖励建模,使大语言模型在知识图谱上自主探索更广泛的推理空间,实现对分布外推理问题的高效泛化。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12158 2026-02-13 cs.LG 89%

SafeNeuron: Neuron-Level Safety Alignment for Large Language Models

SafeNeuron: 大语言模型的神经层面安全对齐

Zhaoxin Wang, Jiaming Liang, Fengbin Zhu, Weixiang Zhao, Junfeng Fang, Jiayi Ji, Handing Wang, Tat-Seng Chua

机构 * Xidian University, Xi'an, China(西安电子科技大学) Harbin Institute of Technology, Harbin, China(哈尔滨工业大学) National University of Singapore,Singapore(新加坡国立大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(abstract);分类 cs.LG

AI总结 SafeNeuron通过神经层面安全对齐框架提升模型鲁棒性,减少攻击风险并保持通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04493 2026-02-05 cs.CL cs.HC 89%

PersoDPO: Scalable Preference Optimization for Instruction-Adherent, Persona-Grounded Dialogue via Multi-LLM Evaluation

PersoDPO: 通过多LLM评估实现可扩展的偏好优化

Saleh Afzoon, MohammadHossein Ahmadi, Usman Naseem, Amin Beheshti

机构 * School of Computing, Macquarie University(计算机学院,麦考瑞大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(title);large language model(abstract);language model(abstract)

AI总结 PersoDPO通过多LLM评估实现可扩展的偏好优化,提升对话系统的人格导向和上下文连贯性。

Comments Accepted at WISE 2025 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05075 2026-01-09 cs.CL 89%

SemPA: Improving Sentence Embeddings of Large Language Models through Semantic Preference Alignment

SemPA:通过语义偏好对齐提升大语言模型的句子嵌入

Ziyang Chen, Zhenxuan Huang, Yile Wang, Weiqin Wang, Lu Yin, Hui Huang

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) School of Computer Science and Electronic Engineering, University of Surrey(Surrey大学计算机科学与电子工程学院)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(abstract);分类 cs.CL

AI总结 SemPA通过语义偏好对齐提升大语言模型的句子嵌入能力,同时保持其生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02764 2026-01-07 cs.IR cs.AI 89%

Netflix Artwork Personalization via LLM Post-training

通过LLM后训练实现Netflix作品个性化

Hyunji Nam, Sejoon Oh, Emma Kong, Yesu Feng, Moumita Bhattacharya

机构 * Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(title);large language model(abstract);language model(abstract)

AI总结 通过LLM后训练实现Netflix作品个性化推荐,提升用户满意度和参与度。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00647 2026-01-05 cs.CL cs.CE q-bio.QM 89%

Physio-DPO: Aligning Large Language Models with the Protein Energy Landscape to Eliminate Structural Hallucinations

Physio-DPO:将大型语言模型与蛋白质能量景观对齐以消除结构幻觉

QiWei Meng

机构 * Xi’an Jiaotong University(西安交通大学)

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(title);SFT(abstract);preference optimization(abstract)

AI总结 Physio-DPO通过引入物理感知的目标,将蛋白质语言模型与热力学稳定性对齐,有效减少结构幻觉并提升折叠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18541 2025-12-05 cs.AI 89%

Align$^2$LLaVA: Cascaded Human and Large Language Model Preference Alignment for Multi-modal Instruction Curation

Align$^2$LLaVA: 多模态指令编纂的级联人类与大语言模型偏好对齐

Hongzhe Huang, Jiang Liu, Zhewen Yu, Li Cai, Dian Jiao, Wenqiao Zhang, Siliang Tang, Juncheng Li, Hao Jiang, Haoyuan Li, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Alibaba(阿里巴巴)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 Align$^2$LLaVA通过级联人类与LLM偏好对齐方法,有效压缩多模态指令数据,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09385 2025-11-18 cs.CL 89%

AMaPO: Adaptive Margin-attached Preference Optimization for Language Model Alignment

Ruibo Deng, Duanyu Feng, Wenqiang Lei

专题命中 后训练与偏好优化 :language model(title,abstract);preference optimization(title,abstract);RLHF(abstract);分类 cs.CL

Comments AAAI 2026 AIA oral, our code is available at https://github.com/Shiroha-Offical/AMaPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06023 2025-11-11 cs.CL 89%

Multi-Reward GRPO Fine-Tuning for De-biasing Large Language Models: A Study Based on Chinese-Context Discrimination Data

Deng Yixuan, Ji Xiaoqiang

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)科学与工程学院) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)人工智能学院) Shenzhen Institute of Artificial Intelligence and Robotics for Society, China(深圳人工智能与机器人研究院)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);RLHF(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏