arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-10 至 2026-06-10 共收录 24 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 24 篇

2606.11050 2026-06-10 cs.MA cs.GT cs.SY eess.SY 新提交 93%

LLM-Mediated Demand Response Coordination in Smart Microgrids

LLM介导的智能微电网需求响应协调

J. de Curtò, I. de Zarzà

专题命中 后训练与偏好优化 :LLM(title,title_cn);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对智能微电网中产消者自愿合作的需求响应协调问题,提出一种结合博弈论与LLM叙事评估的混合决策架构,通过结构化指令实现33.3%的需求削减合作率,优于非结构化消息和基线。

Comments Accepted for publication in 18th International Conference on Sustainability in Energy and Buildings (SEB-26), to appear in Springer Nature proceedings (KES Smart Innovation Systems and Technologies). The final authenticated version will be available online at Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11082 2026-06-10 cs.CL cs.CY 新提交 92%

The Shibboleth Effect: Auditing the Cross-Lingual Distributional Skew of Large Language Models

示播列效应:审计大型语言模型的跨语言分布偏斜

Hakan Mehmetcik

机构 * Kellogg Institute for International Studies, University of Notre Dame(凯洛格国际研究学院,圣约翰大学) Marmara University(马尔马拉大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);RLHF(abstract,abstract_cn)

AI总结 本研究通过多智能体地缘政治兵棋推演,发现前沿LLM在跨语言条件下存在行为偏斜,且该效应依赖于模型架构与训练机制,而非西方起源模型的普遍属性。

Comments 25 pages, 2 figures, 6 tables, Research Article

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10078 2026-06-10 cs.IR 新提交 90%

Mult-DPO: Multinomial Direct Preference Optimization for Recommender Systems

Mult-DPO:用于推荐系统的多项直接偏好优化

Yaochen Zhu, Harald Steck, James McInerney, Aditya Sinha, Yinhan He, Nathan Kallus, Jundong Li

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);preference optimization(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对推荐系统中集合级偏好(多个正项)的LLM对齐问题,提出Mult-DPO,通过可计算的多项式替代似然实现直接偏好优化,并证明其是边际化Plackett-Luce DPO损失的可计算上界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10217 2026-06-10 cs.LG cs.CR 新提交 89%

Alignment Defends LLMs from Property Inference Attacks

对齐防御LLM免受属性推断攻击

Pengrun Huang, Chhavi Yadav, Ruihan Wu, Kamalika Chaudhuri

机构 * University of California, San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学) Simons Institute, UC Berkeley(伯克利大学Simons研究所)

专题命中 后训练与偏好优化 :LLM(title_cn);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出基于对齐的防御方法,通过后训练调整模型输出分布,在不修改训练数据的情况下缓解属性推断攻击,并保持效用与机密性的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09961 2026-06-10 cs.LG cs.AI 新提交 89%

3SPO: State-Score-Supervised Policy Optimization for LLM Agents

3SPO: 面向LLM智能体的状态分数监督策略优化

Yu Han, Kailing Li, Yang Jiao, Yulin Dai, Yuqian Fu, Linhai Zhuo, Tianwen Qian

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Fudan University(复旦大学) KAUST(卡塔尔人工智能研究学院) Fuzhou University(福州大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出3SPO算法,通过动态状态分数监督实现逐步骤策略优化,解决多轮智能体任务中奖励稀疏和信用分配问题,在ALFWorld和WebShop上分别比GRPO提升22.6%和15.6个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25760 2026-06-10 cs.CL cs.AI cs.LG 版本更新 89%

TruthRL: Incentivizing Truthful LLMs via Reinforcement Learning

TruthRL: 通过强化学习激励诚实的LLM

Zhepei Wei, Xiao Yang, Kai Sun, Jiaqi Wang, Rulin Shao, Jingxiang Chen, Mohammad Kachuee, Teja Gollapudi, Yiwei Liao, Nicolas Scheffer, Rakesh Wanga, Anuj Kumar, Yu Meng, Wen-tau Yih, Xin Luna Dong

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 后训练与偏好优化 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出TruthRL框架,使用GRPO和三值奖励直接优化LLM的诚实性,减少幻觉并允许不确定时弃权,在知识密集型基准上显著提升诚实性。

Comments ICML 2026. Code: https://github.com/facebookresearch/TruthRL

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06343 2026-06-10 cs.LG cs.AI cs.CL 版本更新 88%

When Distance Distracts: Representation Distance Bias in BT-Loss for Reward Models

当距离干扰:BT损失中表示距离偏差对奖励模型的影响

Tong Xie, Andrew Bai, Yuanhao Ban, Yunqi Hong, Haoyu Li, Cho-Jui Hsieh

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 分析BT损失中表示距离导致的梯度偏差,提出NormBT自适应归一化方案,提升奖励模型在细粒度区分上的性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10346 2026-06-10 cs.AI 新提交 87%

Reasoning or Memorization? Direction-Aware Diversity Exploration in LLM Reinforcement Learning

推理还是记忆?LLM强化学习中的方向感知多样性探索

Jiangnan Xia, Yucheng Shi, Yu Yang, Kishan Panaganti, Zhenwen Liang, Ninghao Liu

机构 * University of Georgia(佐治亚大学) Tencent AI Lab(腾讯AI实验室) The Education University of Hong Kong(香港教育大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出DiRL框架,通过方向感知奖励区分推理与记忆驱动的探索,在GRPO中集成方向加权梯度特征,显著提升数学与通用推理性能。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10890 2026-06-10 cs.LG cs.AI 新提交 86%

Optimal Post-Training Quantization Scales and Where to Find Them

最优后训练量化尺度及其寻找方法

Juan Amboage, Pablo Monteagudo-Lago, Ian Colbert, Giuseppe Franco, Nicholas Fraser

机构 * AMD

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出PiSO算法,利用校准数据精确高效地计算逐通道最优量化尺度,并扩展到分组量化,在Llama和Qwen模型上显著提升困惑度和零样本准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10860 2026-06-10 cs.CR cs.CL 新提交 85%

Training LLMs to Enforce Multi-Level Instruction Hierarchies via Gravity-Weighted Direct Preference Optimization

训练LLM通过重力加权直接偏好优化强制执行多级指令层次结构

Lena S. Bolliger, Lena A. Jäger

机构 * Department of Computational Linguistics, University of Zurich, Switzerland(计算语言学系,苏黎世大学,瑞士)

专题命中 后训练与偏好优化 :LLM(title_cn,abstract_cn);preference optimization(title);分类 cs.CL

AI总结 提出重力加权DPO(GW-DPO)方法,通过线性或双边调度加权冲突级别间的结构距离,结合层次分隔符和指令段嵌入,在Llama-3.1-8B-Instruct上提升多级指令优先级遵守率并降低过度拒绝率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01023 2026-06-10 cs.IR cs.AI cs.LG 85%

Unifying Ranking and Generation in Query Auto-Completion via Retrieval-Augmented Generation and Multi-Objective Alignment

通过检索增强生成和多目标对齐统一查询自动补全中的排序与生成

Kai Yuan, Anthony Zheng, Jia Hu, Divyanshu Sheth, Hemanth Velaga, Kylee Kim, Matteo Guarrera, Besim Avci, Jianhua Li, Xuetao Yin, Rajyashree Mukherjee, Sean Suchter

机构 * Apple(苹果公司) UC Berkeley(加州大学伯克利分校)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 提出一个统一框架,通过检索增强生成(RAG)和多目标直接偏好优化(DPO)将查询自动补全重构为端到端列表生成,解决传统流水线长尾覆盖不足和生成方法幻觉风险的问题,并在大规模商业搜索平台上验证了有效性。

Comments 11 pages, 4 figures

Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 (KDD '26), August 09--13, 2026, Jeju Island, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11167 2026-06-10 cs.CL eess.AS 新提交 84%

Multi-Faceted Interactivity Alignment in Full-Duplex Speech Models

全双工语音模型中的多面交互对齐

Atsumoto Ohashi, Neil Zeghidour, Alexandre Défossez, Eugene Kharitonov

机构 * Kyutai Gradium

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);post-training(abstract);分类 cs.CL

AI总结 针对全双工对话模型交互性问题,提出基于强化学习的后训练对齐方法,从暂停处理、话轮转换、回馈和用户打断四个维度优化,并加入LLM奖励防止语义退化,在Moshi和PersonaPlex上取得一致改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09850 2026-06-10 cs.LG cs.CL 新提交 84%

Mechanistic Analysis of Alignment Algorithms in Language Models

语言模型中对齐算法的机制分析

Aarush Sinha, Ishan Garg, Veeraraju Elluru, Arth Singh, Kushal Garg

机构 * University of Copenhagen(哥本哈根大学) Independent(独立研究者) IIT Jodhpur(印度理工学院焦特布尔分校) NIT Agartala(印度国立理工学院阿加尔塔拉分校) Narris

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 本文通过层间线性探针、稀疏自编码器和交叉编码器,系统分析了六种偏好优化方法在语言模型中的内部机制,发现不同目标函数导致不同的表示几何变换,并揭示了行为对齐与内部结构变化的不一致性。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10569 2026-06-10 cs.CL cs.AI 新提交 82%

Hidden Consensus:Preference-Validity Compression in Human Feedback

隐藏共识:人类反馈中的偏好有效性压缩

Dorcas Chia Ern Chua, Karen Myn Hui Lee, Jia Yue Tan, Zhen Xue Gue, Norzalena Abdul Hamid, Azima Binti Azmi, Keat Mei Yeong, Aizat Izyani binti Mujab, Hafsah Noor Azam, Chee Guo Khoo, Han Ying Lim, Chee Seng Chan

机构 * YTL AI Labs Universiti Malaya(马来亚大学) Monash University Malaysia(莫纳什大学马来西亚校区) Universiti Malaysia Sarawak(马来西亚沙捞越大学)

专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本文提出偏好有效性压缩问题,即RLHF将多元有效反馈压缩为单一奖励目标,导致对齐测量偏差。通过马来西亚语料分析,79%的提示存在多个多数支持响应,表明多数聚合测量的是argmax可接受性而非多元对齐。

Comments 28 pages. When AI learns from human feedback, it forces a single "correct" answer, but sometimes multiple answers are all genuinely valid, and that nuance gets thrown away

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10528 2026-06-10 cs.LG cs.CL 新提交 82%

Representation-Aware Advantage Estimation: Your Reward Model Provides More Than A Scalar Output

表示感知优势估计:你的奖励模型提供的不仅仅是标量输出

Guozheng Li, Xiyan Fu, Yiwen Guo

机构 * Southeast University(东南大学) Nanyang Technological University(南洋理工大学) Independent Researcher(独立研究员)

专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);分类 cs.CL、cs.LG

AI总结 提出表示感知优势估计方法,利用奖励模型隐藏状态作为辅助信号,通过图传播计算优势值,提升RLHF的样本效率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08561 2026-06-10 cs.AI 81%

RetroAgent: From Solving to Evolving via Retrospective Dual Intrinsic Feedback

RetroAgent: 从解决到进化 via 逆向双重内在反馈

Xiaoying Zhang, Zichen Liu, Yipeng Zhang, Xia Hu, Wenqi Shao

机构 * Shanghai AI Lab(上海人工智能实验室) National University of Singapore(新加坡国立大学) Independent Researcher(独立研究者)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 RetroAgent通过逆向双重内在反馈机制,使大语言模型代理在交互环境中通过持续进化而非单纯完成任务来提升性能,实现更强的适应与泛化能力。

Comments updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11702 2026-06-10 cs.LG stat.ML 版本更新 79%

Post-Training Augmentation Invariance

训练后增强不变性

Keenan Eikenberry, Lizuo Liu, Yoonsang Lee

机构 * Department of Mathematics, Dartmouth College(达特茅斯学院数学系)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG

AI总结 提出训练后增强不变性框架,通过轻量级MLP适配器网络在预训练模型潜空间上实现近似不变性,无需微调且保持原始特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09883 2026-06-10 cs.LG cs.AI 新提交 79%

TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition

TD-Grokking:通过训练时分解从零奖励问题中学习

Ningyuan Xi, Hao Xu, Hongsheng Xin, Ning Miao

机构 * Ningyuan Xi 1,2(西宁元 1,2) Hao Xu 3(许浩 3) Hongsheng Xin 3(辛红生 3) Ning Miao 1,2, †(苗宁 1,2, †)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 针对强化学习在零奖励问题上无法提供优化信号的问题,提出训练时分解框架TD-Grokking,将难解问题递归分解为可验证子问题,在数学和医疗任务上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09871 2026-06-10 cs.CV cs.AI cs.LG 新提交 79%

SD-GRPO: Verifiable Segment Decomposition for Long-Form Vision-Language Generation

SD-GRPO:面向长格式视觉-语言生成的可验证片段分解

Hyunwoong Kim, Seongeun Lee, Hannah Yun, Junhyun Park, Jonggwon Park

机构 * DEEPNOID Inc.(DEEPNOID公司)

专题命中 后训练与偏好优化 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出SD-GRPO方法,通过将长格式输出分解为片段并计算逐片段优势,解决GRPO在视觉-语言任务中粗粒度信用分配不足的问题,实验证明其在多种长格式生成任务中优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10275 2026-06-10 cs.CV 新提交 78%

FoA-SR: Faithful or Aesthetic? Profile-Aware Preference Optimization for Real-World Image Super-Resolution

FoA-SR: 忠实还是美观?面向真实世界图像超分辨率的轮廓感知偏好优化

Amjad Mahdi Alqarni, Peizhong Ju

机构 * Department of Computer Science(计算机科学系) University of Kentucky(肯塔基大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

AI总结 提出FoA-SR,基于偏好优化实现真实世界图像超分辨率,通过忠实和美观两种轮廓分别优化适配器,在RealSR和DIV2K上验证了可分离的恢复策略。

Comments 17 pages, 6 figures, 9 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10768 2026-06-10 cs.LG cs.CL 新提交 73%

N-GRPO: Embedding-Level Neighbor Mixing for Enhanced Policy Optimization

N-GRPO:嵌入级邻居混合增强策略优化

Xukun Zhu, Hang Yu, Peng Di, Linchao Zhu

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 针对大语言模型数学推理中探索策略的折衷问题,提出N-GRPO方法,通过语义邻居混合机制在嵌入层注入多样性,在保持语义一致性的同时提升策略优化效果。

Comments ACL 2026 Findings. 16 pages, 3 figures. Code: https://github.com/ZJUSCL/N-GRPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10184 2026-06-10 cs.LG cs.AI 新提交 73%

Dropout-GRPO: Variational Stochasticity for Continuous Latent Reasoning

Dropout-GRPO: 用于连续潜在推理的变分随机性

Wooil Jung

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 后训练与偏好优化 :LLM(abstract_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 针对GRPO在连续潜在推理模型中因确定性轨迹导致优势为零的问题,提出通过结构化Dropout引入随机性,使GRPO能优化贝叶斯模型平均策略,在GSM8K上提升Coconut基线准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10321 2026-06-10 cs.LG cs.AI cs.RO math.OC 新提交 73%

Baseline-Free Policy Optimization for Neural Combinatorial Optimization

无基线的神经组合优化策略优化

Carlos S. Sepúlveda, Gonzalo A. Ruz

机构 * Facultad de Ingeniería y Ciencias, Universidad Adolfo Ibáñez(阿道夫·伊瓦涅斯大学工程与科学学院) Dirección de Programas, Investigación y Desarrollo, Armada de Chile(智利海军计划、研究与发展局) Millennium Nucleus for Social Data Science (SODAS)(千禧年社会数据科学核心(SODAS)) Millennium Nucleus in Data Science for Plant Resilience (PhytoLearning)(千禧年植物韧性数据科学核心(PhytoLearning))

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出使用GRPO算法消除神经组合优化中的基线依赖,避免训练崩溃,在TSP和CVRP上达到接近POMO的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10709 2026-06-10 cs.IR cs.AI 新提交 70%

Effective Reinforcement Learning for Agentic Search by Recycling Zero-Variance Queries During Training

通过训练期间回收零方差查询实现智能体搜索的有效强化学习

João Coelho, João Magalhães, Bruno Martins, Chenyan Xiong

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Instituto Superior Técnico and INESC-ID, University of Lisbon(里斯本大学理工学院和INESC-ID) NOVA LINCS, NOVA School of Science and Technology(NOVA科学与技术学院LINCS)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出查询回收方法,将训练中零方差查询重新投入采样池,使有效训练分布随策略演化,1.7B模型在7个多跳QA基准上平均Pass@1达66.0,匹配或超越7B模型。

详情

展开后加载摘要…

URL PDF HTML 收藏