arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-25 至 2026-03-25 共收录 8 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 8 篇

2603.22829 2026-03-25 cs.AI 87%

Improving Safety Alignment via Balanced Direct Preference Optimization

通过平衡直接偏好优化提升安全性对齐

Shiji Zhao, Mengyang Wang, Shukun Xiong, Fangzhou Chen, Qihui Zhu, Shouwei Ruan, Yisong Xiao, Ranjie Duan, Xun Chen, XingXing Wei

机构 * Institute of Artificial Intelligence, Beihang University, Beijing, China(北京航空航天大学人工智能研究院)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 本文提出B-DPO方法,通过平衡偏好与非偏好响应的优化强度,缓解偏好对齐中的过拟合问题,提升模型安全性同时保持竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23184 2026-03-25 cs.CL cs.AI stat.AP 84%

ImplicitRM: Unbiased Reward Modeling from Implicit Preference Data for LLM alignment

ImplicitRM: 从隐式偏好数据中无偏奖励建模以实现语言模型对齐

Hao Wang, Haocheng Yang, Licheng Pan, Lei Shen, Xiaoxi Li, Yinuo Wang, Zhichao Chen, Yuan Lu, Haoxuan Li, Zhouchen Lin

机构 * Peking University(北京大学) Xiaohongshu Inc.(小红书公司) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

专题命中 后训练与偏好优化 :LLM(title);language model(abstract);RLHF(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ImplicitRM,通过隐式反馈数据学习无偏奖励模型,解决隐式偏好数据中缺乏明确负样本和用户偏好偏差的问题,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22944 2026-03-25 cs.HC 80%

From Morality Installation in LLMs to LLMs in Morality-as-a-System

从LLM中的道德安装到道德作为系统中的LLM

Gunter Bombaerts

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 本文提出道德作为系统框架,重新定义道德行为的动态性与系统耦合问题,探讨道德属性在生命周期中的监测与跨组件一致性。

Comments 22pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14967 2026-03-25 cs.CL cs.AI cs.LG 80%

Information Gain-based Policy Optimization: A Simple and Effective Approach for Multi-Turn Search Agents

基于信息增益的策略优化:一种用于多轮搜索代理的简单而有效的方法

Guoqing Wang, Sunhao Dai, Guangze Ye, Zeyu Gan, Wei Yao, Yong Deng, Xiaofeng Wu, Zhenzhe Ying

机构 * Venus Team, Ant Group(蚂蚁集团 Venus 团队) Renmin University of China(中国人民大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于信息增益的策略优化框架,通过密集内在监督提升多轮代理训练效果,实验表明其在多轮场景中优于现有方法,准确性和数据效率更高。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22293 2026-03-25 cs.CL cs.AI cs.LG 80%

TIPS: Turn-Level Information-Potential Reward Shaping for Search-Augmented LLMs

TIPS: 用于搜索增强的大语言模型的回合级信息潜力奖励塑造

Yutao Xie, Nathaniel Thomas, Nicklas Hansen, Yang Fu, Li Erran Li, Xiaolong Wang

机构 * UC San Diego(加州大学圣地亚哥分校) AWS AI(亚马逊人工智能)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出TIPS方法,通过回合级信息潜力奖励塑造提升搜索增强LLM的训练稳定性与性能,优于GRPO/PPO基线,在多个问答基准上取得显著提升。

Comments Code: https://github.com/ucsd-wang-lab-lm/tips

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22563 2026-03-25 stat.ML cs.LG 77%

Privacy-Preserving Reinforcement Learning from Human Feedback via Decoupled Reward Modeling

通过解耦奖励建模实现隐私保护的人类反馈强化学习

Young Hyun Cho, Will Wei Sun

机构 * Purdue University(普渡大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.LG

AI总结 本文提出一种隐私保护框架,仅在奖励学习中施加差分隐私,通过私有奖励模型生成最终策略。理论分析显示隐私引入额外的误差项,且样本量和隐私水平影响主导项,实验验证了理论预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17808 2026-03-25 cs.RO cs.AI 57%

EVA: Aligning Video World Models with Executable Robot Actions via Inverse Dynamics Rewards

EVA:通过逆动力学奖励对齐视频世界模型与可执行机器人动作

Ruixiang Wang, Qingming Liu, Yueci Deng, Guiliang Liu, Zhen Liu, Kui Jia

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) DexForce Technology Co., Ltd.(DexForce技术有限公司)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 本文提出EVA框架,通过逆动力学奖励对齐视频世界模型与可执行动作,减少生成动作中的体感约束违规,提升下游任务执行成功率。

Comments Project page: https://eva-project-page.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23007 2026-03-25 cs.CR cs.AI 57%

AgentRAE: Remote Action Execution through Notification-based Visual Backdoors against Screenshots-based Mobile GUI Agents

AgentRAE: 通过基于通知的视觉后门实现远程动作执行以对抗基于截图的移动GUI代理

Yutao Luo, Haotian Zhu, Shuchao Pang, Zhigang Lu, Tian Dong, Yongbin Zhou, Minhui Xue

机构 * Nanjing University of Science and Technology(南京理工大学) Macquarie University(麦考瑞大学) Western Sydney University(西澳大学) University of Hong Kong(香港大学) CSIRO’s Data61(澳大利亚CSIRO Data61)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 针对基于截图的移动GUI代理,提出AgentRAE通过自然视觉触发器诱导远程动作执行,采用两阶段管道提升代理对细微图标差异的敏感度,并通过后训练关联触发器与特定动作,实现高攻击成功率和隐蔽性。

详情

展开后加载摘要…

URL PDF HTML 收藏