arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-10 至 2026-08-10 共收录 8 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 8 篇

2606.06586 2026-08-10 cs.CL 版本更新 90%

PolyFact: Comparing Consistency-Driven Post-training Methods for Cross-Lingual Factual Recall

通过一致性驱动的强化学习改进跨语言事实回忆

Jonathan von Rad, Louis Arts, George Burgess, Eleftheria Kolokytha, Harry O'Donnell, Ektor Oikonomidis Doumpas, Eduardo Sanchez, Yao Lu, Pontus Stenetorp

机构 * University College London(伦敦大学学院) Centre for Artificial Intelligence(人工智能中心)

专题命中 后训练与偏好优化 :post-training(title,abstract);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出PolyFact数据集,利用GRPO强化学习方法提升大语言模型的跨语言事实回忆一致性,优于监督微调,并揭示其通过减少语言专用表示实现跨语言共享的机制。

Comments Under Review at EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07460 2026-08-10 cs.CL cs.AI 新提交 90%

CreativeInstruct: Scalably Teaching LLMs to Balance Quality, Creativity, and Diversity

CreativeInstruct:规模化教导大型语言模型(LLM)平衡质量、创造性与多样性

Ananya Sahu, Mohit Bansal, Elias Stengel-Eskin

机构 * Columbia(哥伦比亚大学) UNC Chapel Hill(北卡罗来纳大学教堂山分校) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 后训练与偏好优化 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 该研究提出CreativeInstruct指令调优方法,通过注入[StartCreativity]跨度平衡LLM的质量、创造性与多样性,其在叙事生成中表现更优,还能提升强化学习任务性能。

Comments Code: https://github.com/ananya-sahu/CreativeInstruct

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06789 2026-08-10 cs.NI 新提交 89%

EvoRIC: Reinforcement Learning Fine-Tuned LLM-empowered RAN Intelligent Control Toward Autonomous O-RAN

EvoRIC:面向自主O-RAN的、由强化学习微调大语言模型赋能的RAN智能控制器

Lingyan Bao, Jemin Lee, Tony Q. S. Quek

专题命中 后训练与偏好优化 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 针对传统RAN智能算法泛化差、通用LLM算力高且缺领域知识的问题,提出EvoRIC分层框架,结合RLFT与PPO优化LLM,在IAB网络中验证其泛化性与效能,为自主O-RAN提供新方案。

Comments Manuscript submitted 23 April 2026; revised 7 August 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06526 2026-08-10 cs.CL 新提交 89%

GRASP: Reinforcing Language Model Anonymizers with Group Relative Policy Optimization

GRASP:用组相对策略优化增强语言模型匿名化器

Sajjad Ghiasvand, Nader Sehatbakhsh

机构 * UC Santa Barbara(加州大学圣巴巴拉分校) UC Los Angeles(加州大学洛杉矶分校)

专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);preference optimization(abstract)

AI总结 该研究提出GRASP方法,用组相对策略优化增强设备端小型语言模型匿名化器,在隐私-效用权衡、对抗匿名化防御及运行成本上均优于DPO蒸馏基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07019 2026-08-10 cs.AI 新提交 85%

ReQuant: Fixed-Grid Discrete Refinement for Post-Training Quantization

ReQuant:用于训练后量化的固定网格离散细化

Yongge Ma, Guoan Wang, Feiyu Wang, Yaoming Li, Qian Zhang, Zihan Yan, Yinjun Han, Tong Yang

机构 * School of Computer Science, Peking University(北京大学计算机学院) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) School of Physics, Peking University(北京大学物理学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Central Research Institute, ZTE Corporation(中兴公司中央研究院)

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ReQuant是用于训练后量化(PTQ)的无反向传播固定网格细化方法,可作为即插即用后处理阶段,提升各类PTQ初始化器生成的量化模型性能,在低位宽下增益显著。

Comments 10 pages, 3 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06582 2026-08-10 cs.LG 新提交 57%

CrystalGRPO: Target-Aligned and Coverage-Preserving Reinforcement Learning for Flow-Based Crystal Structure Prediction

CrystalGRPO:面向基于流模型的晶体结构预测的目标对齐且保持覆盖率的强化学习

Kaixiang Su, Hongfei Xue, Qiang Zhu

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) North Carolina Battery Complexity, Autonomous Vehicle and Electrification (BATT CAVE) Research Center(北卡罗来纳州电池复杂性、自动驾驶与电气化(BATT CAVE)研究中心)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 该研究提出CrystalGRPO框架,通过强化学习后训练优化基于流模型的晶体结构预测,两种模式在多数据集骨干组合中提升了恢复性能与覆盖率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07409 2026-08-10 cs.CV 新提交 50%

UniJEPA: A Unified Joint-Embedding Predictive Architecture for Task-Agnostic Visual World Modeling

UniJEPA:面向任务无关视觉世界建模的统一联合嵌入预测架构

An Lanji, Dawei Liu, Jin Li, Haoran Xu, Mei Chen, Yu Tian

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 UniJEPA是统一JEPAs,共享潜在空间联合学习图像级与视频级预测,抗坍塌,经后训练可零样本规划,在多基准上性能相当或更优,规划速度更快。

Comments 10 pages, 7 figures; Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06768 2026-08-10 cs.CV 新提交 50%

Explore or Converge? Stage-Guided Per-Step Optimization for Diffusion Models

探索还是收敛?面向扩散模型的阶段引导式逐步优化方法

Renye Yan, Jikang Cheng, You Wu, Wei Peng, Zongwei Wang, Ling Liang, Yimao Cai

机构 * Peking University(北京大学) Nanjing University(南京大学) Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 针对扩散模型RL偏好对齐的奖励不匹配问题,提出SGPO方法,通过分阶段分配目标,使生成质量提升26.7%、收敛速度提高36.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏