arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-20 至 2026-07-20 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 11 篇

2605.04539 2026-07-20 cs.CL cs.AI 版本更新 95%

RLearner-LLM: Balancing Logical Grounding and Fluency in Large Language Models via Hybrid Direct Preference Optimization

RLearner-LLM: 通过混合直接偏好优化平衡大语言模型中的逻辑性与流畅性

Qiming Bao, Juho Leinonen, Paul Denny, Michael J. Witbrock

机构 * University of Auckland(奥克兰大学) Aalto University(阿alto大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);preference optimization(title,abstract);large language model(title);language model(title)

AI总结 本文提出RLearner-LLM,通过融合DeBERTa-v3 NLI信号与验证器LLM评分,解决直接偏好优化在知识密集型生成中的逻辑对齐问题,实现NLI指标显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15095 2026-07-20 cs.CL cs.AI cs.MA 版本更新 89%

Digital Pantheon: Simulating and Auditing Coalition Formation with LLM Agents

数字万神殿:使用大语言模型智能体模拟和审计联盟形成

Dylan Van Mulders, Matthias Bogaert, Dirk Van den Poel

机构 * Ghent University(根特大学)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 该研究针对政治联盟形成谈判,提出结合多种技术的多智能体框架,在弗拉芒选举中实施,通过引入相关拓扑、分数和检验使其可解释,模拟产生稳定结果,能可靠预测现实,提供了探索政党兼容性等的测试平台。

Comments 11 pages, 2 figures, 5 tables, To be published in the AIDEM Workshop proceedings of the ECML PKDD 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15495 2026-07-20 cs.CL cs.AI cs.LG 新提交 87%

Verbalizable Representations Form a Global Workspace in Language Models

语言模型中的可言语化表征形成全局工作空间

Wes Gurnee, Nicholas Sofroniew, Adam Pearce, Mateusz Piotrowski, Isaac Kauvar, Runjin Chen, Anna Soligo, Paul Bogdan, Euan Ong, Rowan Wang, Ben Thompson, David Abrahams, Subhash Kantamneni, Emmanuel Ameisen, Joshua Batson, Jack Lindsey

机构 * Anthropic(A÷)

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨语言模型中可言语化表征,用雅可比透镜识别出J空间,其具有全局工作空间功能特性与结构特征,能揭示模型未显思考,发现训练后助手观点在工作空间,引入反事实反思训练,解码表征助于了解认知过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16074 2026-07-20 cs.DC cs.AI cs.SE 新提交 79%

JoyNexus: Service-Oriented Multi-Tenant Post-Training for VLA Models

JoyNexus:面向服务的视觉语言动作模型多租户训练后处理

Haoran Sun, Wentao Zhang, Junyang Hua, Hedan Yang, Yongjian Guo, Yifei Zhang, Xiaolong Xiang, Mingxi Luo, Jing Long, Chen Zhao, Chen Zhou, Wanting Xu, Qiming Yang, Hui Zhang, Song Wang, Xiaodong Bai, Shuai Di, Xu Chu, Xiaotie Deng, Yicheng Gong, Junwu Xiong

机构 * Peking University(北京大学) Beihang University(北航) Beijing Institute of Technology(北京理工大学) Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI

AI总结 针对VLA模型训练后处理问题,提出JoyNexus统一服务,解耦相关服务,多租户可通过API调用,引入组批处理提高效率,经评估能减少GPU时间,提升服务利用率。

Comments 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13162 2026-07-20 cs.CL cs.AI 版本更新 79%

What Models Express, Suppress, and Resist: Auditing Open-Weight LLMs with Persona Vectors

模型表达、抑制和抗拒的内容:使用角色向量审计开放权重语言模型

Winston Zeng, Ali Emami, Jinho D. Choi

机构 * Emory University(埃默里大学)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究通过大规模系统应用角色向量审计开放权重语言模型,编制特征清单并标记其性质,发现模型默认行为特点,引导在默认外特征效果好,且角色向量可探测行为组织。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00319 2026-07-20 cs.AI cs.LG 版本更新 79%

RL-Struct: A Lightweight Reinforcement Learning Framework for Reliable Structured Output in LLMs

RL-Struct:用于大语言模型中可靠结构化输出的轻量级强化学习框架

Ruike Hu, Shulei Wu

机构 * School of Information Science and Technology(信息科学与技术学院) Hainan Normal University(海南师范大学)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);LLM(abstract);分类 cs.AI、cs.LG

AI总结 针对大语言模型输出与结构化需求的差距问题,提出RL-Struct轻量级框架,运用GRPO及分层奖励函数,消除评论家网络,减少显存。在复杂JSON任务中表现出色,实现高准确率和有效性,还呈现新兴课程学习过程,模型可公开获取。

Comments Withdrawn by the authors due to substantial errors in the references, terminology, and experimental reporting, which affect the reliability and reproducibility of the manuscript. The authors are conducting a comprehensive re-evaluation and do not consider the current version suitable for citation

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10931 2026-07-20 cs.CL 版本更新 77%

It Takes One to Bias Them All: Breaking Bad with One-Shot GRPO

一个样本就能带偏所有:单次GRPO打破对齐

Naihao Deng, Yilun Zhu, Naichen Shi, Clayton Scott, Rada Mihalcea

机构 * University of Michigan(密歇根大学) Northwestern University(西北大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 研究发现,仅用单个有偏样本进行一步GRPO训练就能诱导大语言模型产生系统性偏见,且刻板印象推理泛化到多种属性、类别和基准测试,揭示了对齐机制的关键脆弱性。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13669 2026-07-20 cs.AI 版本更新 70%

Agents-K1: Towards Agent-native Knowledge Orchestration

Agents-K1:迈向智能体原生的知识编排

Zongsheng Cao, Bihao Zhan, Jinxin Shi, Jiong Wang, Fangchen Yu, Zhijie Zhong, Yingnan Han, Zijie Guo, Tianshuo Peng, Zhuo Liu, Yi Xie, Xiang Zhuang, Shengji Tang, Yue Fan, Runmin Ma, Shiyang Feng, Xiangchao Yan, Anran Liu, Peng Ye, Wenlong Zhang, Xiaosong Wang, Shufei Zhang, Chunfeng Song, Fenghua Ling, Jie Zhou, Liang He, Bo Zhang, Lei Bai

机构 * PJLab(上海人工智能实验室)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出Agents-K1管道,将原始文档转化为智能体原生科学知识图谱,通过多模态解析器、GRPO训练的4B信息抽取骨干和三源智能体接口,实现科学信息抽取、知识图谱构建和多跳推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15610 2026-07-20 cs.CL cs.AI cs.LG 新提交 67%

Process Reward Informed Tree Rollout for Effective Multi-Turn RL

用于有效多轮强化学习的过程奖励引导树展开

Xintong Li, Sha Li, Yuwei Zhang, Changlong Yu, Rongmei Lin, Hongye Jin, Shuyi Guan, Xin Liu, Linwei Li, Qingyu Yin, Jingbo Shang

机构 * UC San Diego(加州大学圣地亚哥分校) Amazon(亚马逊) MIT Alumni(麻省理工学院校友)

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究多轮强化学习中有效探索问题,提出过程评分器引导的自适应树展开框架PATR,利用过程反馈评分轨迹、选择性分支等,在FrozenLake和SWE - Bench实验中提升性能,是可扩展多轮强化学习的有效策略。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15374 2026-07-20 cs.CV 新提交 67%

Reasoning-Guided Part-Level Visual Grounding via Reinforcement Learning

通过强化学习进行推理引导的部件级视觉定位

Kazi Sajeed Mehrab, Hani Alomari, Najibul Haque Sarker, Chia-Wei Tang, Zaber Ibn Abdul Hakim, Anuj Karpatne, Chris Thomas

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

AI总结 研究部件级视觉定位难题,提出OP - HRG粗到细推理引导定位策略,先定位父物体再定位部件,经自我检查反思结果,引入部件感知GRPO框架训练,训练的4B模型性能优异且可迁移到推理分割。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19356 2026-07-20 cs.CV 版本更新 50%

Rethinking Reward Signals in Video GRPO: When Scores Become Targets

重新思考视频GRPO中的奖励信号:当分数成为目标

Rui Li, Yuanzhi Liang, Ziqi Ni, Haibin Huang, Chi Zhang, Xuelong Li

机构 * University of Science and Technology of China(中国科学技术大学) Southeast University(东南大学) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文提出TaRoS框架,通过组件级评估和组内稀疏性解决GRPO中奖励信号失真问题,提升视频生成的视觉质量和对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏