arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4535 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4535 篇

2506.15498 2026-03-03 cs.CL cs.AI cs.LG 80%

SPARE: Single-Pass Annotation with Reference-Guided Evaluation for Automatic Process Supervision and Reward Modelling

SPARE:基于参考引导评估的单次标注用于自动过程监督与奖励建模

Md Imbesat Hassan Rizvi, Xiaodan Zhu, Iryna Gurevych

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SPARE通过单次生成与参考引导评估,实现高效过程标注,提升LLM多步推理中的奖励建模与微调效果。

Comments Accepted to AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01051 2026-03-03 cs.LG cs.AI cs.CL 80%

GEM: A Gym for Agentic LLMs

GEM:代理大语言模型的训练环境

Zichen Liu, Anya Sims, Keyu Duan, Changyu Chen, Simon Yu, Xiangxin Zhou, Haotian Xu, Shaopan Xiong, Bo Liu, Chenmien Tan, Chuen Yang Beh, Weixun Wang, Hao Zhu, Weiyan Shi, Diyi Yang, Michael Shieh, Yee Whye Teh, Wee Sun Lee, Min Lin

机构 * Sea AI Lab(海智实验室) NUS(国立大学新加坡) Oxford(牛津大学) SMU(南卫理安大学) Stanford(斯坦福大学) Northeastern(东北大学) OpenRLHF(开放强化学习基金会) ROLL RL2 absolute AI(绝对人工智能)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 GEM是一个为代理LLM设计的开源训练环境,提供标准化接口、多样化环境和基准测试功能,用于促进基于经验的学习和强化学习算法的评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24203 2026-03-03 cs.LG cs.AI cs.CL 80%

Group-Relative REINFORCE Is Secretly an Off-Policy Algorithm: Demystifying Some Myths About GRPO and Its Friends

组相对REINFORCE实际上是秘密的非策略算法:解开GRPO及其朋友的一些神话

Chaorui Yao, Yanxi Chen, Yuchang Sun, Yushuo Chen, Wenhao Zhang, Xuchen Pan, Yaliang Li, Bolin Ding

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Alibaba Group(阿里巴巴集团)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文揭示组相对REINFORCE本质上是非策略算法,通过理论分析和实验验证,解开了GRPO及相关算法的一些神话,为LLMs的非策略强化学习提供了新的设计思路。

Comments Accepted to ICLR 2026. arXiv v2 update: add references and experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19457 2026-02-17 cs.CL cs.AI cs.LG cs.SE 80%

GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning

GEPA:反思式提示进化可以超越强化学习

Lakshya A Agrawal, Shangyin Tan, Dilara Soylu, Noah Ziems, Rishi Khare, Krista Opsahl-Ong, Arnav Singhvi, Herumb Shandilya, Michael J Ryan, Meng Jiang, Christopher Potts, Koushik Sen, Alexandros G. Dimakis, Ion Stoica, Dan Klein, Matei Zaharia, Omar Khattab

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 GEPA通过自然语言反思优化提示,以更少的回放次数在多个任务中超越强化学习方法GRPO和MIPROv2。

Comments Accepted to ICLR 2026 (Oral). Code: https://github.com/gepa-ai/gepa

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08041 2026-02-10 cs.LG cs.AI cs.CL 80%

Implicit Strategic Optimization: Rethinking Long-Horizon Decision-Making in Adversarial Poker Environments

隐式策略优化:重新思考对抗扑克环境中的长 horizon 决策

Boyang Xia, Weiyou Tian, Qingnan Ren, Jiaqi Huang, Jie Xiao, Shuo Lu, Kai Wang, Lynn Ai, Eric Yang, Bill Shi

机构 * Gradient

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出隐式策略优化(ISO)框架,通过预测战略环境和结合战略奖励模型与乐观学习规则,提升对抗性扑克环境中的长 horizon 决策性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03806 2026-02-04 cs.LG cs.AI cs.CL cs.SE 80%

Bridging Online and Offline RL: Contextual Bandit Learning for Multi-Turn Code Generation

弥合在线与离线强化学习:多轮代码生成的上下文老虎机学习

Ziru Chen, Dongdong Chen, Ruinan Jin, Yingbin Liang, Yujia Xie, Huan Sun

机构 * The Ohio State University(俄亥俄州立大学) Microsoft(微软)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Cobalt通过结合在线和离线强化学习,提出一种新的上下文老虎机学习方法,用于多轮代码生成任务,显著提升了模型性能并缓解了奖励黑客问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20534 2026-02-04 cs.LG cs.AI cs.CL 80%

Kimi K2: Open Agentic Intelligence

Kimi K2:开放代理智能

Kimi Team, Yifan Bai, Yiping Bao, Y. Charles, Cheng Chen, Guanduo Chen, Haiting Chen, Huarong Chen, Jiahao Chen, Ningxin Chen, Ruijue Chen, Yanru Chen, Yuankun Chen, Yutian Chen, Zhuofu Chen, Jialei Cui, Hao Ding, Mengnan Dong, Angang Du, Chenzhuang Du, Dikang Du, Yulun Du, Yu Fan, Yichen Feng, Kelin Fu, Bofei Gao, Chenxiao Gao, Hongcheng Gao, Peizhong Gao, Tong Gao, Yuyao Ge, Shangyi Geng, Qizheng Gu, Xinran Gu, Longyu Guan, Haiqing Guo, Jianhang Guo, Xiaoru Hao, Tianhong He, Weiran He, Wenyang He, Yunjia He, Chao Hong, Hao Hu, Yangyang Hu, Zhenxing Hu, Weixiao Huang, Zhiqi Huang, Zihao Huang, Tao Jiang, Zhejun Jiang, Xinyi Jin, Yongsheng Kang, Guokun Lai, Cheng Li, Fang Li, Haoyang Li, Ming Li, Wentao Li, Yang Li, Yanhao Li, Yiwei Li, Zhaowei Li, Zheming Li, Hongzhan Lin, Xiaohan Lin, Zongyu Lin, Chengyin Liu, Chenyu Liu, Hongzhang Liu, Jingyuan Liu, Junqi Liu, Liang Liu, Shaowei Liu, T. Y. Liu, Tianwei Liu, Weizhou Liu, Yangyang Liu, Yibo Liu, Yiping Liu, Yue Liu, Zhengying Liu, Enzhe Lu, Haoyu Lu, Lijun Lu, Yashuo Luo, Shengling Ma, Xinyu Ma, Yingwei Ma, Shaoguang Mao, Jie Mei, Xin Men, Yibo Miao, Siyuan Pan, Yebo Peng, Ruoyu Qin, Zeyu Qin, Bowen Qu, Zeyu Shang, Lidong Shi, Shengyuan Shi, Feifan Song, Jianlin Su, Zhengyuan Su, Lin Sui, Xinjie Sun, Flood Sung, Yunpeng Tai, Heyi Tang, Jiawen Tao, Qifeng Teng, Chaoran Tian, Chensi Wang, Dinglu Wang, Feng Wang, Hailong Wang, Haiming Wang, Jianzhou Wang, Jiaxing Wang, Jinhong Wang, Shengjie Wang, Shuyi Wang, Si Wang, Xinyuan Wang, Yao Wang, Yejie Wang, Yiqin Wang, Yuxin Wang, Yuzhi Wang, Zhaoji Wang, Zhengtao Wang, Zhengtao Wang, Zhexu Wang, Chu Wei, Qianqian Wei, Haoning Wu, Wenhao Wu, Xingzhe Wu, Yuxin Wu, Chenjun Xiao, Jin Xie, Xiaotong Xie, Weimin Xiong, Boyu Xu, Jinjing Xu, L. H. Xu, Lin Xu, Suting Xu, Weixin Xu, Xinran Xu, Yangchuan Xu, Ziyao Xu, Jing Xu, Jing Xu, Junjie Yan, Yuzi Yan, Hao Yang, Xiaofei Yang, Yi Yang, Ying Yang, Zhen Yang, Zhilin Yang, Zonghan Yang, Haotian Yao, Xingcheng Yao, Wenjie Ye, Zhuorui Ye, Bohong Yin, Longhui Yu, Enming Yuan, Hongbang Yuan, Mengjie Yuan, Siyu Yuan, Haobing Zhan, Dehao Zhang, Hao Zhang, Wanlu Zhang, Xiaobin Zhang, Yadong Zhang, Yangkun Zhang, Yichi Zhang, Yizhi Zhang, Yongting Zhang, Yu Zhang, Yutao Zhang, Yutong Zhang, Zheng Zhang, Haotian Zhao, Yikai Zhao, Zijia Zhao, Huabin Zheng, Shaojie Zheng, Longguang Zhong, Jianren Zhou, Xinyu Zhou, Zaida Zhou, Jinguo Zhu, Zhen Zhu, Weiyu Zhuang, Xinxing Zu

机构 * Kimi Team(Kimi 团队)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Kimi K2是一款开源大语言模型,通过混合专家架构和MuonClip优化器实现先进代理能力,表现优于现有非思考模型。

Comments tech report of Kimi K2, with minor updates

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16483 2026-01-26 eess.AS 80%

FlowSE-GRPO: Training Flow Matching Speech Enhancement via Online Reinforcement Learning

FlowSE-GRPO:通过在线强化学习训练流匹配语音增强

Haoxu Wang, Biao Tian, Yiheng Jiang, Zexu Pan, Shengkui Zhao, Bin Ma, Daren Chen, Xiangang Li

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);preference optimization(abstract)

AI总结 本文提出FlowSE-GRPO,通过在线强化学习优化语音增强,平衡多指标以提升音频质量与任务性能。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08777 2026-01-14 cs.LG cs.AI cs.CL cs.GT 80%

Asymptotic Universal Alignment: A New Alignment Framework via Test-Time Scaling

渐近通用对齐:通过测试时间缩放实现的新对齐框架

Yang Cai, Weiqiang Zheng

机构 * Yale University(耶鲁大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种基于测试时间缩放的通用对齐框架,通过多玩家对齐游戏实现最优鲁棒性,解决了现有方法在输出多样性上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06970 2026-01-01 cs.CV 80%

Guiding Cross-Modal Representations with MLLM Priors via Preference Alignment

通过偏好对齐引导跨模态表示

Pengfei Zhao, Rongbo Luan, Wei Zhang, Peng Wu, Sifeng He

机构 * Apple(苹果公司)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);pretraining(abstract);preference optimization(abstract)

AI总结 MAPLE通过利用多模态大语言模型的细粒度对齐先验,引导跨模态表示学习,提升细粒度检索性能。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18630 2025-11-25 cs.LG cs.AI cs.CL stat.ME stat.ML 80%

Majority of the Bests: Improving Best-of-N via Bootstrapping

多数最佳:通过Bootstrap改进最佳-N

Amin Rakhsha, Kanika Madan, Tianyu Zhang, Amir-massoud Farahmand, Amir Khasahmadi

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) Autodesk(Autodesk公司) Polytechnique Montréal(蒙特利尔理工学院) Mila - Quebec AI Institute(魁北克人工智能研究所)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MoB方法,通过Bootstrap估计最佳-N的输出分布并选择其模式,以提高在不完美奖励下的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08394 2025-11-12 cs.CL cs.AI cs.HC cs.LG 80%

Interaction Dynamics as a Reward Signal for LLMs

Sian Gooding, Edward Grefenstette

机构 * Google DeepMind(谷歌DeepMind)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06618 2025-11-11 cs.AI cs.CL cs.LG cs.SE 80%

GRAPH-GRPO-LEX: Contract Graph Modeling and Reinforcement Learning with Group Relative Policy Optimization

Moriya Dechtiar, Daniel Martin Katz, Mari Sundaresan, Sylvain Jaume, Hongming Wang

机构 * Harvard University(哈佛大学) Illinois Tech - Chicago Kent College of Law(伊利诺伊理工学院-芝加哥肯特法学院) CLTDS, Bucerius Law School(CLTDS,布塞里乌斯法学院) Yong Pung How School of Law, Singapore Management University(永丰何法学院,新加坡管理大学) CodeX - The Stanford Center for Legal Informatics, Stanford University(CodeX-斯坦福法律信息中心,斯坦福大学) Georgetown University(乔治城大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11475 2025-10-27 cs.CL cs.AI cs.LG 80%

HelpSteer3-Preference: Open Human-Annotated Preference Data across Diverse Tasks and Languages

Zhilin Wang, Jiaqi Zeng, Olivier Delalleau, Hoo-Chang Shin, Felipe Soares, Alexander Bukharin, Ellie Evans, Yi Dong, Oleksii Kuchaiev

机构 * NVIDIA

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2025 Datasets and Benchmarks Track Camera Ready, 46 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04501 2025-10-22 cs.CL cs.AI cs.LG 80%

Understanding Reinforcement Learning for Model Training, and future directions with GRAPE

Rohit Patel

机构 * Rohit Patel(独立研究者)

专题命中 后训练与偏好优化 :instruction tuning(abstract);SFT(abstract);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 35 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23223 2025-10-15 cs.LG cs.AI cs.CL cs.GT 80%

COMAL: A Convergent Meta-Algorithm for Aligning LLMs with General Preferences

Yixin Liu, Argyris Oikonomou, Weiqiang Zheng, Yang Cai, Arman Cohan

机构 * Yale University(耶鲁大学) Allen Institute for AI(人工智能研究院)

专题命中 后训练与偏好优化 :language model(abstract);RLHF(abstract);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02611 2025-10-06 cs.AI cs.CL cs.LG 80%

On the Role of Temperature Sampling in Test-Time Scaling

Yuheng Wu, Azalia Mirhoseini, Thierry Tambe

机构 * Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02495 2025-09-26 cs.CL cs.AI cs.LG 80%

Inference-Time Scaling for Generalist Reward Modeling

Zijun Liu, Peiyi Wang, Runxin Xu, Shirong Ma, Chong Ruan, Peng Li, Yang Liu, Yu Wu

机构 * DeepSeek-AI Dept. of Computer Sci. & Tech., Tsinghua University(计算机科学与技术系,清华大学) Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Preprint, under review. 44 pages. Models are available at https://huggingface.co/collections/BBQGOD/deepseek-grm-68b4681169dbb97fd30614b5 and https://www.modelscope.cn/collections/DeepSeek-GRM-ff6a2d8babdd4a

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15074 2025-09-25 cs.CL cs.AI cs.LG 80%

DISCO Balances the Scales: Adaptive Domain- and Difficulty-Aware Reinforcement Learning on Imbalanced Data

Yuhang Zhou, Jing Zhu, Shengyi Qian, Zhuokai Zhao, Xiyao Wang, Xiaoyu Liu, Ming Li, Paiheng Xu, Wei Ai, Furong Huang

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15495 2025-09-18 cs.SE 80%

SynthCoder: A Synthetical Strategy to Tune LLMs for Code Completion

Dongjun Yu, Xiao Yan, Zhenrui Li, Jipeng Xiao, Haochuan He, Yongda Yu, Hao Zhang, Guoping Rong, Xiaobo Huang

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);preference optimization(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12790 2025-08-19 cs.AI cs.CL cs.LG 80%

Reinforcement Learning with Rubric Anchors

Zenan Huang, Yihong Zhuang, Guoshan Lu, Zeyu Qin, Haokai Xu, Tianyu Zhao, Ru Peng, Jiaqi Hu, Zhanming Shen, Xiaomeng Hu, Xijun Gu, Peiyi Tu, Jiaxin Liu, Wenyu Chen, Yuzhuo Fu, Zhiting Fan, Yanmei Gu, Yuanyuan Wang, Zhengkai Yang, Jianguo Li, Junbo Zhao

机构 * Inclusion AI Ant Group(蚂蚁集团) Zhejiang University(浙江大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03637 2025-07-08 cs.CL cs.AI cs.LG 80%

RewardAnything: Generalizable Principle-Following Reward Models

Zhuohao Yu, Jiali Zeng, Weizheng Gu, Yidong Wang, Jindong Wang, Fandong Meng, Jie Zhou, Yue Zhang, Shikun Zhang, Wei Ye

机构 * Peking University(北京大学) WeChat AI(微信AI) William & Mary(威廉与玛丽学院) Westlake University(西交利物浦大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 25 pages, 9 figures, Code & model weights available at: https://zhuohaoyu.github.io/RewardAnything

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17828 2025-07-04 cs.LG cs.AI cs.CL 80%

Aligning Frozen LLMs by Reinforcement Learning: An Iterative Reweight-then-Optimize Approach

Xinnan Zhang, Chenliang Li, Siliang Zeng, Jiaxiang Li, Zhongruo Wang, Kaixiang Lin, Songtao Lu, Alfredo Garcia, Mingyi Hong

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16141 2025-06-23 cs.CV cs.AI cs.CL cs.LG 80%

GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning

Yi Chen, Yuying Ge, Rui Wang, Yixiao Ge, Junhao Cheng, Ying Shan, Xihui Liu

机构 * The University of Hong Kong(香港大学) ARC Lab, Tencent PCG(腾讯PCG ARC实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Code released at: https://github.com/TencentARC/GRPO-CARE

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02553 2025-06-04 cs.LG cs.AI cs.CL 80%

Response-Level Rewards Are All You Need for Online Reinforcement Learning in LLMs: A Mathematical Perspective

Shenghua He, Tian Xia, Xuan Zhou, Hui Wei

机构 * Amazon(亚马逊公司) PAII Inc.(PAII公司) UC Merced(加州大学默塞德分校)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18025 2025-06-03 cs.LG cs.AI cs.CL cs.CR 80%

An Adversarial Perspective on Machine Unlearning for AI Safety

Jakub Łucki, Boyi Wei, Yangsibo Huang, Peter Henderson, Florian Tramèr, Javier Rando

机构 * ETH Zurich(苏黎世联邦理工学院) Princeton University(普林斯顿大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Published in Transactions on Machine Learning Research (TMLR); Best technical paper at Neurips 2024 SoLaR workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16282 2025-05-23 cs.CV 80%

ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay

Fanbin Lu, Zhisheng Zhong, Shu Liu, Chi-Wing Fu, Jiaya Jia

机构 * The Chinese University of Hong Kong(香港中文大学) SmartMore Hong Kong University of Science and Technology(香港理工大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03618 2025-05-06 cs.CL cs.AI cs.LG 80%

A Logical Fallacy-Informed Framework for Argument Generation

Luca Mouchel, Debjit Paul, Shaobo Cui, Robert West, Antoine Bosselut, Boi Faltings

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14439 2025-04-22 cs.LG cs.AI cs.CL 80%

LoRe: Personalizing LLMs via Low-Rank Reward Modeling

Avinandan Bose, Zhihan Xiong, Yuejie Chi, Simon Shaolei Du, Lin Xiao, Maryam Fazel

机构 * FAIR at Meta(Meta 的 FAIR 部门) University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05810 2025-04-16 cs.CV 80%

PaMi-VDPO: Mitigating Video Hallucinations by Prompt-Aware Multi-Instance Video Preference Learning

Xinpeng Ding, Kui Zhang, Jianhua Han, Lanqing Hong, Hang Xu, Xiaomeng Li

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);SFT(abstract);preference optimization(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏