arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-24 至 2026-06-24 共收录 9 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 9 篇

2604.01127 2026-06-24 cs.CR 版本更新 91%

Multi-Agent LLM Governance for Safe Two-Timescale Reinforcement Learning in SDN-IoT Defense

多智能体LLM治理:SDN-IoT防御中安全的两时间尺度强化学习

Saeid Jamshidi, Negar Shahabi, Foutse Khomh, Carol Fung, Mohammad Hamdaqa

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出两时间尺度SDN-IoT防御方案,快时间尺度使用PPO智能体进行控制器感知的缓解,慢时间尺度使用多智能体LLM治理引擎生成可审计的策略更新,在保证安全约束下提升防御性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24004 2026-06-24 cs.CL cs.AI 新提交 88%

Towards Spec Learning: Inference-Time Alignment from Preference Pairs

面向规范学习:从偏好对进行推理时对齐

Dhriti Krishnan, Tejas Goyal, Jaromir Savelka

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 提出规范学习框架,利用少量用户指令和偏好判断生成自然语言规范,在推理时引导LLM行为,无需参数更新,在密集偏好信号领域优于DPO,且规范可解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03070 2026-06-24 cs.LG cs.AI 版本更新 87%

ASymPO: Asymmetric-Scale Policy Optimization for Asynchronous LLM Post-Training Without Behavior Information

ASymPO: 用于异步大语言模型后训练的非对称尺度策略优化(无需行为信息)

Zehua Liu, Yuxuan Yao, Xiaojin Fu, Tao Zhong, Mingxuan Yuan

机构 * Huawei Technologies(华为技术)

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(title);分类 cs.AI、cs.LG

AI总结 针对异步强化学习中陈旧响应导致的分布漂移问题,提出非对称尺度策略优化(ASymPO),通过归一化每个响应的令牌损失来恢复零和平衡,无需行为策略概率。

Comments incorrect proofs in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24669 2026-06-24 cs.AI 新提交 83%

LaGO: Latent Action Guidance for Online Reinforcement Learning

LaGO:面向在线强化学习的潜在动作引导

Kuan-Yen Liu, Ren-Jyun Huang, Ti-Rong Wu

机构 * Siebel School of Computing(计算科学系) Data Science, University of Illinois Urbana-Champaign, USA(数据科学,伊利诺伊大学厄巴纳-香槟分校,美国) Department of Computer Science, National Yang Ming Chiao Tung University, Taiwan(计算机科学系,National Yang Ming Chiao Tung大学,台湾) Institute of Information Science, Academia Sinica, Taiwan(信息科学研究所, Academia Sinica,台湾)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract,comments);language model(abstract,comments);分类 cs.AI

AI总结 提出LaGO框架,利用预训练大语言模型作为潜在动作先验,软引导在线策略优化,在离散和连续控制基准上显著提升奖励与成功率。

Comments 9 pages, 2 figures. Accepted at the ICML 2026 Workshop on Large Language Models for Planning (LM4Plan)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23740 2026-06-24 cs.LG cs.AI 新提交 82%

Weight-Space Geometry of Offline Reasoning Training

离线推理训练的权重空间几何

Aleksandr Nikolich, Igor Kiselev, Vladimir Platonov, Karina Romanova

专题命中 后训练与偏好优化 :SFT(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 通过余弦相似度、主角度子空间分析等方法,研究六种离线强化学习方法在数学推理任务中的权重更新几何,发现SFT、RFT、RIFT几乎共线,DFT方向偏离,Offline GRPO添加正交分量,DPO位于近正交子空间且准确率最高。

Comments accepted for ICML 2026 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23835 2026-06-24 cs.CV eess.IV 新提交 82%

ABACUS: Adapting Unified Foundation Model for Bridging Image Count Understanding and Generation

ABACUS: 自适应统一基础模型,桥接图像计数理解与生成

Anindya Mondal, Sauradip Nag, Anjan Dutta

机构 * University of Surrey(萨里大学) Simon Fraser University(西蒙菲莎大学)

专题命中 后训练与偏好优化 :foundation model(title,abstract);language model(abstract)

AI总结 提出ABACUS统一视觉语言模型,通过密度感知自适应缩放、边界感知计数策略和循环一致性GRPO,无需特定训练即可处理多种计数任务并生成计数忠实图像,在七个基准上达到最优。

Comments Under review, webpage: https://mondalanindya.github.io/ABACUS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12796 2026-06-24 cs.HC cs.AI 81%

Maximizing the efficiency of human feedback in AI alignment: a comparative analysis

最大化人类反馈在AI对齐中的效率:比较分析

Andreas Chouliaras, Dimitris Chatzopoulos

机构 * University College Dublin, Ireland(都柏林大学学院)

专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);分类 cs.AI

AI总结 本文探讨了RLHF中偏好推断的替代采样与评估策略,提出Swiss InfoGain方法在受限标注预算下表现更优,且更节省样本,提升了偏好学习的效率与鲁棒性。

Comments 17 pages, 6 figures, 6 algorithms. AICS2025

Journal ref 33rd International Conference on Artificial Intelligence and Cognitive Science (AICS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14659 2026-06-24 eess.AS cs.LG cs.SD 版本更新 77%

Aligning Audio Captions with Human Preferences

对齐音频字幕与人类偏好

Kartik Hegde, Rehana Mahfuz, Yinyi Guo, Erik Visser

机构 * Qualcomm Technologies, Inc.(高通技术公司)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);pretraining(abstract);分类 cs.LG

AI总结 提出基于人类反馈强化学习的音频字幕生成框架,通过CLAP奖励模型微调基线系统,无需真实标注即可生成更符合人类偏好的字幕。

Comments This paper has been accepted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23950 2026-06-24 cs.CV 新提交 50%

DivRL: Disentangled Self-Similarity Rewards for Diverse Subject-Driven Generation

DivRL: 解耦自相似性奖励用于多样化主题驱动生成

Qian Wang, Zhenyu Li, Abdelrahman Eldesokey, Peter Wonka

机构 * KAUST(阿卜杜拉国王科技大学)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 提出DivRL框架,通过解耦视觉特征中的负自相似性度量(nSSM)和视觉语义匹配(VSM),采用“探索-抑制”策略联合优化身份一致性与结构多样性,解决主题驱动生成中的身份-多样性悖论。

Comments Accepted to ECCV 2026. Project page: https://qianwangx.github.io/DivRL/

详情

展开后加载摘要…

URL PDF HTML 收藏