arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-21 至 2026-08-21 共收录 10 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 10 篇

2608.11922 2026-08-21 cs.CL cs.IR cs.LG 版本更新 90%

LODESTAR: Robust Entropy-Based Answer Selection in Retrieval-Augmented Generation for Question Answering -- Directing Frozen-LLM Entropy with a Reinforcement-Learned Prompt Polarizer under Misleading Passages

LODESTAR:可信赖熵是被引导的,而非仅被测量——强化偏振器防止冻结型大语言模型(LLM)被错误证据误导而自信出错

Hung-Chun Hsu, Po-Jen Ko, Che-Cheng Wu, Li-Yang Chang, Chuan-Ju Wang

专题命中 后训练与偏好优化 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 LODESTAR是首个通过强化学习训练偏振器、依据第三方冻结型LLM的不确定性评分文本干预的方法,可提升检索增强问答的F1值等指标,减少模型读取误导性段落的概率。

Comments 28 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20099 2026-08-21 cs.MA cs.CL cs.LG 新提交 87%

Reward-Guided Autoregressive Graph Generation for Efficient Multi-Agent Communication Topology Design

奖励引导自回归图生成的高效多智能体通信拓扑设计

Poomphob Suwannapichat, Boonyarit Changaival, Caesar Wu, Pascal Bouvry

专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 针对多智能体系统通信拓扑设计中 token 消耗过高的问题,本文提出 RGA-Designer 方法,通过结合 RLHF 训练奖励模型微调图生成器,在保持任务准确率的同时降低了 token 消耗。

Comments Full version of extended abstract accepted at ICONIP 2026 (poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19598 2026-08-21 cs.CV cs.AI cs.CL cs.MM 新提交 86%

PEA-DPO: Perception-Enhanced Alignment Direct Preference Optimization for MLLMs Alignment

PEA-DPO:用于多模态大语言模型对齐的感知增强型直接偏好优化

Jiawei Feng, Jiancan Wu, Xingyu Zhu, Junkang Wu, Xiang Wang, Xiangnan He

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对多模态大语言模型偏好优化存在的视觉不敏感性问题,提出PEA-DPO框架,利用视觉偏好信号缓解该问题,提升多模态对齐效果并减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19808 2026-08-21 cs.LG 新提交 83%

FAR-DPO: Feasibility-Aware and Robust Direct Preference Optimization for Cyclic Peptide Design

FAR-DPO:用于环肽设计的可行性感知与鲁棒直接偏好优化

Guofeng Zhang, Rong Han, Xiaoyu Wang, Zhiyun Li, Zongbo Han, Xiaohong Liu, Guangyu Wang

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.LG

AI总结 FAR-DPO是一种架构无关的环肽设计框架,通过可行性感知偏好构建与难度感知分组鲁棒优化,在CPSea LNR基准测试中提升了环肽设计的可行性与结合性能。

Comments 16 pages, 6 figures, and 7 tables. Includes supplementary materials

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19842 2026-08-21 cs.AI 新提交 81%

SAPO: Single-Rollout Autoregressive Policy Optimization for Agentic Reinforcement Learning

SAPO:用于智能体强化学习的单回滚自回归策略优化

Dayang Liang, Lang Feng, Bo An, Yunlong Liu

机构 * Xiamen University(厦门大学) Nanyang Technological University(南洋理工大学)

专题命中 后训练与偏好优化 :LLM(abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本研究针对智能体强化学习现有方法的三大局限,提出SAPO框架,其共享策略与价值函数的自回归主干,结合广义优势估计器,在ALFWorld、WebShop任务上性能优于PPO和GRPO,内存与计算效率更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20011 2026-08-21 cs.AI cs.CV 新提交 79%

Manifold Drift in Flow Preference Optimization: A Root Cause of Reward Hacking

流偏好优化中的流形漂移:奖励黑客的根本原因

Yansen Han, Shengyi Liao, Yuanxing Zhang, Pengfei Wan, Tao Lin

机构 * Zhejiang University(浙江大学) Kuaishou Technology(快手科技) Westlake University(西湖大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI

AI总结 本文针对流偏好优化中流形漂移导致奖励黑客的问题,提出ThermoDPO及其加权变体,在玩具基准和SD3.5-M数据集上均取得优于FlowDPO等方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19982 2026-08-21 cs.CR 新提交 78%

COPA: Continual Preference Optimization for Adaptive Prompt Injection Defense

COPA:用于自适应提示注入防御的持续偏好优化

Roshan Sood, Onat Gungor, Tajana Rosing

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

AI总结 该研究提出COPA框架,将提示注入防御视为终身学习问题,通过GRPO优化和边际加权经验回放实现持续防御,使攻击成功率最高降低6.3倍、平均降低4.4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19595 2026-08-21 cs.IR 新提交 75%

SSR-GRPO: Integrating Supervision and Semantic IDs into Reinforcement Learning for Dense Retrieval in E-commerce

SSR-GRPO:将监督与语义标识符集成到强化学习中用于电商领域的密集检索

Guangxin Song, Xing Fang, Mingmin Jin, Jing Wang, Bokang Wang, Zhentao Song, Junjie Bai, Jianbo Zhu

专题命中 后训练与偏好优化 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对电商嵌入检索的语义处理难题,提出SSR-GRPO模型,通过双视角相关性评估、难负样本挖掘等策略优化R-GRPO,经实验验证有效并已部署于大规模电商平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19540 2026-08-21 cs.LG cs.CV 新提交 57%

Continuous Adversarial MeanFlow Transfer

Yara Bahram, Zahra Dehghani, Mélodie Desbos, Eric Granger, Pablo Piantanida, Mohammadhadi Shateri

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

Comments Paper under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18607 2026-08-21 cs.CV 版本更新 50%

VA-Judger: Reward Modeling from Human Preference Feedback for Joint Video-Audio Generation

VA-Judger:用于联合视频-音频生成的人类偏好反馈奖励建模

Yinming Huang, Shuyuan Tu, Xi Yan, Zihan Yang, Jianhua Han, Xu Hang, Yu-Gang Jiang, Zuxuan Wu

机构 * Shanghai Innovation Institution(上海创新研究院) Fudan University(复旦大学) Yinwang Intelligent Technology Co., Ltd(音网智能科技有限公司)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本研究针对联合视频-音频生成的奖励信号问题,构建了VAPref-10K数据集与VA-Judger-Bench基准,提出思维链全奖励模型VA-Judger,其在预测人类偏好及提升生成质量上均优于基线方法。

Comments 19 pages, 7 figures, 8 tables. Code: this https URL (https://github.com/ShareLab-SII/VA-Judger)

详情

展开后加载摘要…

URL PDF HTML 收藏