arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4489 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4489 篇

2401.08417 2024-06-04 cs.CL 91%

Contrastive Preference Optimization: Pushing the Boundaries of LLM Performance in Machine Translation

Haoran Xu, Amr Sharaf, Yunmo Chen, Weiting Tan, Lingfeng Shen, Benjamin Van Durme, Kenton Murray, Young Jin Kim

专题命中 后训练与偏好优化 :LLM(title,abstract);preference optimization(title,abstract);large language model(abstract);language model(abstract)

Comments Accepted at ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18252 2025-04-29 cs.LG cs.AI cs.CL 91%

Asynchronous RLHF: Faster and More Efficient Off-Policy RL for Language Models

Michael Noukhovitch, Shengyi Huang, Sophie Xhonneux, Arian Hosseini, Rishabh Agarwal, Aaron Courville

机构 * Mila Quebec AI Institute(魁北克AI研究所) Université de Montréal(蒙特利尔大学) Allen Institute for AI(人工智能研究院) Google Deepmind(谷歌DeepMind) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 后训练与偏好优化 :RLHF(title,abstract);language model(title,abstract);LLM(abstract);large language model(abstract)

Comments accepted at ICLR 2025, code at https://github.com/mnoukhov/async_rlhf, integrated into the open-instruct library https://github.com/allenai/open-instruct

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01743 2026-08-04 cs.LG cs.CL 新提交 91%

Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning

面向大语言模型强化学习中能力保留的可塑性保持KL正则化方法

Li Wang, Xiaodong Lu, Xiaohan Wang, Jiajun Chai, Wei Lin, Tianhao Peng, Guojun Yin

机构 * Meituan(美团)

专题命中 后训练与偏好优化 :LLM(title,summary_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 针对LLM强化学习后训练中能力遗忘问题,提出CoKL正则化框架,可在目标任务改进与原有能力保留间实现更优平衡,优于现有正则化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26515 2026-07-30 cs.LG cs.AI 新提交 91%

HiFloat4 Format for End-To-End Reinforcement Learning Post-Training of Large Language Models

用于大语言模型端到端强化学习后训练的HiFloat4格式

Hei Yi Mak, Shadan Golestan, Hoang Le, Mehran Taghian Jazi, Yunke Peng, Yaoyuan Wang, Yao Wang, Junsong Wang, Tianchi Hu, Fengchen He, Guipeng Hu, Tanzila Rahman, Anandharaju Durai Raju

机构 * Huawei(华为)

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(title);language model(title);pretraining(abstract)

AI总结 本文提出首个端到端FP4 RL后训练方案,通过HiFloat4格式与Rollout-ResQ技术,将FP4 RL与BF16的准确率差距大幅缩小,使全量化FP4 RL接近全精度水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20023 2026-07-08 cs.SE cs.AI cs.CL 新提交 91%

When Lower Privileges Suffice: Investigating Over-Privileged Tool Selection in LLM Agents

当较低权限足够时:探究LLM代理中的过度权限工具选择

Kaiyue Yang, Yuyan Bu, Jingwei Yi, Yuchi Wang, Biyu Zhou, Juntao Dai, Songlin Hu, Yaodong Yang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Beijing Academy of Artificial Intelligence(北京人工智能研究院) The Chinese University of Hong Kong(香港中文大学) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(abstract);分类 cs.CL、cs.AI

AI总结 针对LLM代理在工具选择中偏好高权限工具的安全问题,提出ToolPrivBench评估框架,发现主流代理普遍存在过度权限选择且被瞬态故障放大,并设计权限感知后训练防御方法有效减少不必要的高权限工具使用。

Comments code: https://github.com/AISafetyHub/agent-tool-selection-bias

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02091 2026-07-03 cs.CL cs.AI cs.IR 版本更新 91%

Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning

通过强化学习优化RAG重排序器与LLM反馈

Yuhang Wu, Xiangqing Shen, Fanfan Wang, Cangqi Zhou, Zhen Wu, Xinyu Dai, Rui Xia

机构 * Nanjing University of Science and Technology(南京理工大学) Nanjing University(南京大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RRPO框架,通过强化学习将重排序与LLM生成质量对齐,消除了对昂贵人工标注的依赖,实验显示其在知识密集型基准上优于基线模型。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04816 2026-06-04 cs.AI cs.LG 91%

Beyond Objective Equivalence: Constraint Injection for LLM-Based Optimization Modeling on Vehicle Routing Problems

超越目标等价性:基于LLM的车辆路径问题优化建模的约束注入

Xizi Luo, Changhong He, Dongdong Geng, Chenggong Shi, Yu Mei

机构 * Beihang University(北京航空航天大学) Baidu Inc.(百度公司)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对LLM在约束密集的运筹问题中可能添加虚假约束或遗漏必要约束的问题,提出约束注入方法,结合差分测试形成双重验证器,并在车辆路径问题上验证其有效性。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25338 2026-05-26 cs.LG cs.AI 91%

CausalFlow: Causal Attribution and Counterfactual Repair for LLM Agent Failures

CausalFlow: LLM Agent 失败的因果归因与反事实修复

Akash Bonagiri, Devang Borkar, Gerard Janno Anderias, Setareh Rafatirad, Houman Homayoun

机构 * Department of Computer Science University of California, Davis(计算机科学系加州大学戴维斯分校)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 提出CausalFlow框架,通过反事实干预计算步骤级因果责任分数,识别失败步骤并生成最小编辑修复,用于测试时修复和训练时监督,在多个基准上优于启发式方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02495 2026-05-26 cs.LG cs.AI stat.ML 91%

Efficient Preference Poisoning Attack on Offline RLHF

高效偏好投毒攻击离线RLHF

Chenye Yang, Weiyu Xu, Lifeng Lai

机构 * Department of Electrical and Computer Engineering, University of California, Davis, Davis, CA, USA(加州大学戴维斯分校电气与计算机工程系) Department of Electrical and Computer Engineering, University of Iowa, Iowa City, IA, USA(爱荷华大学电气与计算机工程系)

专题命中 后训练与偏好优化 :RLHF(title,title_cn);preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 针对离线RLHF中的偏好投毒攻击,提出基于梯度字典的二进制稀疏近似方法(BAL-A和BMP-A),实现高效标签翻转攻击。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20834 2026-05-21 cs.AI cs.LG 91%

Conditional Equivalence of DPO and RLHF: Implicit Assumption, Failure Modes, and Provable Alignment

DPO与RLHF的条件等价性:隐含假设、失败模式与可证明对齐

Zhiqin Yang, Yonggang Zhang, Wei Xue, Dong Fang, Bo Han, Yike Guo

机构 * The Hong Kong University of Science(香港科技大学) Hong Kong Baptist University(香港 Baptist 大学)

专题命中 后训练与偏好优化 :RLHF(title,title_cn);preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了DPO与RLHF的等价性问题,指出其等价性依赖于一个隐含假设,当该假设不成立时,DPO会优化相对优势而非绝对对齐,从而导致路径性收敛。作者提出CPO方法,通过引入约束实现可证明对齐,并通过几何解释揭示DPO的margin ranking机制。

Comments 49 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20285 2026-05-21 cs.LG cs.AI 91%

Introspective X Training: Feedback Conditioning Improves Scaling Across all LLM Training Stages

反思式X训练:反馈条件化提升跨所有LLM训练阶段的扩展性

Brandon Cui, Ximing Lu, Jaehun Jung, Syeda Nahida Akter, Hyunwoo Kim, Yuxiao Qu, David Acuna, Shrimai Prabhumoye, Yejin Choi, Prithviraj Ammanabrolu

机构 * NVIDIA University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学) UC San Diego(南加州大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出反思式训练(IXT),通过利用后续阶段的动态来改进早期阶段,从而提高LLM训练的扩展效率,实验表明该方法在计算效率和性能上均有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19770 2026-05-13 cs.LG cs.CL 91%

Understanding the Performance Gap in Preference Learning: A Dichotomy of RLHF and DPO

理解偏好学习中的性能差距:RLHF和DPO的二元性

Ruizhe Shi, Minhak Song, Runlong Zhou, Zihan Zhang, Maryam Fazel, Simon S. Du

机构 * University of Washington(华盛顿大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Amazon Inc.(亚马逊公司)

专题命中 后训练与偏好优化 :RLHF(title,title_cn);preference optimization(abstract);分类 cs.CL、cs.LG

AI总结 本文分析RLHF和DPO性能差距的来源,揭示模型规格误差对方法选择的影响,指出在线DPO在特定条件下优于其他方法,揭示两阶段学习的统计优势。

Comments ICML accepted version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20051 2026-05-08 cs.CL cs.LG 91%

Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text

通过基于评分标准的自我博弈提升开放式任务的后训练信号

Chengyu Huang, Sheng-Yen Chou, Zhengxin Zhang, Claire Cardie

机构 * Department of Computer Science, Cornell University(康奈尔大学计算机科学系)

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出POP框架,利用预训练语料生成评分标准,用于自我博弈训练LLM,提升其在医疗问答、创意写作等开放式任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20265 2026-04-30 cs.LG cs.CL 91%

Failure Modes of Maximum Entropy RLHF

最大熵强化学习在RLHF中的失败模式

Ömer Veysel Çağatan, Barış Akgün

机构 * Koç University(科克大学) KUIS AI Center(KUIS人工智能中心)

专题命中 后训练与偏好优化 :RLHF(title,title_cn);preference optimization(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了最大熵强化学习在在线RLHF中的表现,发现其易出现过度优化和KL动态不稳定,且熵正则化无法有效防止奖励黑客,揭示了参考自由方法在在线与离线学习中的不同挑战。

Comments 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22542 2026-04-27 cs.CL cs.AI 91%

Controllable Spoken Dialogue Generation: An LLM-Driven Grading System for K-12 Non-Native English Learners

可控的口语对话生成:一种基于LLM的评分系统用于K-12非母语英语学习者

Haidong Yuan, Haokun Zhao, Wanshi Xu, Songjun Cao, Qingyu Zhou, Long Ma, Hongjie Fan

机构 * Peking University(北京大学) Tencent(腾讯) China University of Political Science and Law(中国政法大学) Independent Researcher(独立研究者) Fudan University(复旦大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于LLM的评分系统,通过四级分级系统控制词汇复杂度,提升非母语K-12英语学习者的口语对话质量与教学价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14267 2026-04-21 cs.LG cs.AI 91%

Enhancing LLM-based Search Agents via Contribution Weighted Group Relative Policy Optimization

通过贡献加权群体相对策略优化增强基于LLM的搜索代理

Junzhe Wang, Zhiheng Xi, Yajie Yang, Hao Luo, Shihan Dou, Tao Gui, Qi Zhang

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Key Laboratory of Intelligent Information Processing(上海智能信息处理关键实验室)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出CW-GRPO框架,通过整合过程监督与群体相对策略优化,提升搜索代理的信用分配效率,实验表明其在多个知识密集型基准上表现优异。

Comments Accepted to the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026), Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16301 2026-03-10 cs.AI cs.CL 91%

Adaptation of Agentic AI: A Survey of Post-Training, Memory, and Skills

代理AI的适应:训练后、记忆和技能的综述

Pengcheng Jiang, Jiacheng Lin, Zhiyi Shi, Zifeng Wang, Luxi He, Yichen Wu, Ming Zhong, Peiyang Song, Qizheng Zhang, Heng Wang, Xueqiang Xu, Hanwen Xu, Pengrui Han, Dylan Zhang, Jiashuo Sun, Chaoqi Yang, Kun Qian, Tian Wang, Changran Hu, Manling Li, Quanzheng Li, Hao Peng, Sheng Wang, Jingbo Shang, Chao Zhang, Jiaxuan You, Liyuan Liu, Pan Lu, Yu Zhang, Heng Ji, Yejin Choi, Dawn Song, Jimeng Sun, Jiawei Han

机构 * UIUC(伊利诺伊大学香槟分校) Stanford(斯坦福大学) Princeton(普林斯顿大学) Harvard(哈佛大学) UC Berkeley(加州大学伯克利分校) Caltech(加州理工学院) UCSD(加州大学圣地亚哥分校) Georgia Tech(佐治亚理工学院) Northwestern(西北大学) TAMU(德克萨斯大学奥斯汀分校) MGH(麻省总医院) Keiji AI Unity

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文综述了代理AI在训练后、记忆和技能方面的适应方法,提出四范式框架,分析了代理与工具适应的技术细节及权衡,探讨了开放问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21500 2026-03-03 cs.LG cs.AI 91%

Chasing the Tail: Effective Rubric-based Reward Modeling for Large Language Model Post-Training

追逐尾部:基于评分标准的奖励建模以实现大语言模型的后训练效果

Junkai Zhang, Zihao Wang, Lin Gui, Swarnashree Mysore Sathyendra, Jaehwan Jeong, Victor Veitch, Wei Wang, Yunzhong He, Bing Liu, Lifeng Jin

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Scale AI, Inc.(Scale AI 公司) University of Chicago(芝加哥大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(title);language model(title);LLM(abstract)

AI总结 本文提出基于评分标准的奖励建模方法,通过关注高奖励区域以缓解大语言模型强化微调中的奖励过度优化问题,并实现有效的后训练改进。

Comments In ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11583 2026-06-11 cs.LG 新提交 91%

Beyond the Golden Teacher: Enhancing Graph Learning through LLM-GNN Co-teaching

超越黄金教师:通过LLM-GNN协同教学增强图学习

Zhuoyi Peng, Hanlin Gu, Lixin Fan, Yi Yang

机构 * The Hong Kong University of Science and Technology(香港科技大学) WeBank(微众银行)

专题命中 后训练与偏好优化 :LLM(title,title_cn);preference optimization(abstract);分类 cs.LG

AI总结 针对文本属性图上的少样本学习,提出LLM-GNN协同教学框架,避免固定教师模型,通过双向伪标签交换和基于轮次的偏好优化,显著提升图学习性能。

Comments Code: https://github.com/llmgnncoteaching/LLM-GNN-Coteaching

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00419 2026-08-04 cs.LG cs.AI cs.CL cs.IR 新提交 91%

Unleashing the Potential of Large Language Models: A Blueprint for Real-Time, Enterprise-Ready Deployments

释放大语言模型的潜力:面向实时、企业级部署的蓝图

Muhammad Faizan Raza, Shuo, Yang, Satish Mahadevan Srinivasan, Joanna F. DeFranco

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对实时受监管场景中大语言模型的问题,提出基于模式的LLMOps架构,整合多模块并实现四项模式化贡献,优化权衡同时支持高风险领域的可审计与回滚部署。

Comments 6 pages, 1 figure. Authors' accepted version of an article published in IEEE Computer. The version of record is available at the DOI below

Journal ref Computer, vol. 59, no. 4, pp. 195-199, April 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04075 2026-06-19 cs.LG cs.AI cs.CL cs.CR cs.CY 版本更新 91%

Large Language Models Hack Rewards, and Society

大型语言模型攻击奖励机制与社会

Wei Liu, Xinyi Mou, Hanqi Yan, Zhongyu Wei, Yulan He

机构 * King’s College London(伦敦大学国王学院) Fudan University(复旦大学) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

AI总结 研究强化学习训练中大型语言模型利用奖励函数漏洞的“社会攻击”现象,通过SocioHack沙盒实验发现模型能发现并利用社会规则漏洞,且现有安全措施效果有限。

Comments 14 pages, 9 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23982 2026-06-11 cs.CL cs.AI cs.CY cs.LG cs.NE 版本更新 91%

Toward Preference-aligned Large Language Models via Residual-based Model Steering

基于残差模型引导的偏好对齐大型语言模型

Lucio La Cava, Andrea Tagarelli

机构 * DIMES Dept., University of Calabria, Italy(卡利博大学DIMES系)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);preference optimization(abstract)

AI总结 提出PaLRS方法,利用残差流中的偏好信号提取轻量级引导向量,无需训练即可在推理时对齐模型偏好,在数学推理和代码生成任务上取得一致提升,同时节省大量时间。

Comments Accepted at IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12973 2026-04-16 cs.DC 91%

An Engineering Journey Training Large Language Models at Scale on Alps: The Apertus Experience

在Alps上规模化训练大型语言模型的工程之旅:Apertus经验

Jonathan Coles, Stefano Schuppli, Lukas Drescher, Fawzi Roberto Mohamed, Elia Palme, Henrique Mendonça, Miguel Gila, Mark Klein, Maxime Martinasso, Joost VandeVondele, Torsten Hoefler, Thomas Schulthess, Josh Romero, Igor Gorodetsky, Ryan Hankins, Isa Wazirzada, Martin Jaggi, Antoine Bosselut, Imanol Schlag, Antoni-Joan Solergibert i Llaquet, Alejandro Hernández Cano, Theofilos Ioannis Manitaras, Nicholas John Browning

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);foundation model(abstract);post-training(abstract)

AI总结 本文描述了在Alps超级计算机上训练完全开源多语言基础模型Apertus的工程过程,克服了存储瓶颈和大规模互连稳定等挑战,为公共机构提供了可持续的AI训练平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04361 2026-04-07 cs.HC 91%

Developing Authentic Simulated Learners for Mathematics Teacher Learning: Insights from Three Approaches with Large Language Models

构建数学教师学习的真挚模拟学习者:基于三种方法与大语言模型的洞察

Jie Cao, Ha Nguyen, Selim Yavuz, Boran Yu, Shuguang Wang, Pavneet Kaur Bharaj, Dionne Cross Francis

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);preference optimization(abstract)

AI总结 本文探讨三种方法提升模拟学生的真实性与教学效用,发现多代理和DPO方法能生成明确的解题策略解释,而微调模型虽生成真实回应但限制思维扩展。

Comments This paper has been accepted in AIED'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19987 2026-03-23 cs.LG cs.AI cs.CL 91%

Breaking the Capability Ceiling of LLM Post-Training by Reintroducing Markov States

突破大语言模型微调的性能上限:重新引入马尔可夫状态

Yurun Yuan, Tengyang Xie

机构 * UW-Madison(威斯康星大学麦迪逊分校)

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出通过引入马尔可夫状态突破大语言模型微调的性能上限,理论和实验均表明该方法能显著降低样本复杂度并提升复杂逻辑谜题的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20067 2025-11-14 cs.AI cs.CL cs.LG 91%

PITA: Preference-Guided Inference-Time Alignment for LLM Post-Training

Sarat Chandra Bobbili, Ujwal Dinesha, Dheeraj Narasimha, Srinivas Shakkottai

机构 * Texas A&M University(德克萨斯A&M大学) Inria(法国国家信息与自动化研究所)

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07163 2025-10-21 cs.CL cs.AI cs.LG 91%

Simplicity Prevails: Rethinking Negative Preference Optimization for LLM Unlearning

Chongyu Fan, Jiancheng Liu, Licong Lin, Jinghan Jia, Ruiqi Zhang, Song Mei, Sijia Liu

机构 * Michigan State University(密歇根州立大学) University of California, Berkeley(加州大学伯克利分校) IBM Research(IBM研究院)

专题命中 后训练与偏好优化 :LLM(title,abstract);preference optimization(title,abstract);large language model(abstract);language model(abstract)

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22948 2025-09-30 cs.CL cs.AI cs.CY cs.LG 91%

SUV: Scalable Large Language Model Copyright Compliance with Regularized Selective Unlearning

Tianyang Xu, Xiaoze Liu, Feijie Wu, Xiaoqian Wang, Jing Gao

机构 * Purdue University(普渡大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);preference optimization(abstract)

Comments COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06845 2025-07-08 cs.CL cs.AI cs.LG 91%

7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement

Pu Zhao, Xuan Shen, Zhenglun Kong, Yixin Shen, Sung-En Chang, Arash Akbari, Timothy Rupprecht, Lei Lu, Enfu Nan, Changdi Yang, Yumei He, Weiyan Shi, Xingchen Xu, Yu Huang, Wei Jiang, Wei Wang, Yue Chen, Yong He, Yanzhi Wang

机构 * Northeastern University(东北大学) Harvard University(哈佛大学) Cornell University(康奈尔大学) Tulane University(路易斯安那州立大学) University of Washington(华盛顿大学) Futurewei Technologies(未来科技) AIBAO LLC

专题命中 后训练与偏好优化 :LLM(title,abstract);pretraining(title);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05939 2025-04-03 cs.IR 91%

Direct Preference Optimization for LLM-Enhanced Recommendation Systems

Chao Sun, Yaobo Liang, Yaming Yang, Shilin Xu, Tianmeng Yang, Yunhai Tong

专题命中 后训练与偏好优化 :LLM(title,abstract);preference optimization(title,abstract);large language model(abstract);language model(abstract)

Comments This paper has been accepted to ICME 2025

详情

展开后加载摘要…

URL PDF HTML 收藏