arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-14 至 2026-08-14 共收录 10 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 10 篇

2605.03799 2026-08-14 cs.CL 版本更新 89%

Natural Language Processing: A Comprehensive Practical Guide from Tokenisation to RLHF

自然语言处理:从分词到RLHF的全面实用指南

Mullosharaf K. Arabov

机构 * KAZAN (VOLGA REGION) FEDERAL UNIVERSITY INSTITUTE OF COMPUTATIONAL MATHEMATICS AND INFORMATION TECHNOLOGIES(卡赞(伏尔加地区)联邦大学计算数学与信息科技学院)

专题命中 后训练与偏好优化 :RLHF(title,title_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文系统指导现代NLP全流程,涵盖分词、向量化、大语言模型微调、检索增强生成及人类反馈强化学习,强调低资源语言处理与开源模型应用。

Comments 136 pages, 12 practical works, preprint. Textbook for senior undergraduates and graduate students. Original contributions on low-resource languages (Tajik, Tatar and other). Companion repository available

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17299 2026-08-14 cs.CL cs.AI 版本更新 82%

Cat-DPO: Category-Adaptive Safety Alignment

Cat-DPO:基于类别的安全对齐

Tiankai Yang, Yi Nian, Xinyuan Li, Ruiyao Xu, Henry Peng Zou, Kaize Ding, Xiyang Hu, Yan Liu, Yue Zhao

机构 * University of Southern California(南加州大学) Northwestern University(西北大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Cat-DPO通过将安全对齐转化为类别约束优化问题,为每个有害类别设置独立的适应性安全边际,提升整体帮助性和无害性,减少类别间的安全方差和最佳至最差差距。

Comments 23 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12443 2026-08-14 stat.ML cs.AI cs.LG math.OC 新提交 81%

SSPO: Structure-Aware Similarity-Weighted Preference Optimization for Neural Combinatorial Optimization

SSPO:面向神经组合优化的结构感知相似度加权偏好优化

Yuanyu Li, Jintao Xu, Zijiang Liu, Yongzhi Qi, Ningxuan Kang, Jianshen Zhang, Wei Qi, Chen Xie, Zuo-Jun Max Shen

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究针对神经组合优化训练中的梯度信号极化与基线冗余问题,提出SSPO方法,通过结构感知相似度加权的留一法基线解决问题,其训练的EFL策略已在京东设施选址系统中实现实际应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05466 2026-08-14 cs.AI cs.LG 版本更新 79%

Recursive Synthesis for Long-Horizon Terminal Tasks

长视界终端任务的递归合成

Zhongzhi Li, Yucheng Shi, Zongxia Li, Ruhan Wang, Anhao Li, Zixun Huang, Junyao Yang, Lei Ke, Ninghao Liu, Haitao Mi, Leowei Liang

机构 * Tencent HY LLM Frontier(腾讯HY大模型前沿团队) University of Georgia(佐治亚大学) University of Maryland, College Park(马里兰大学帕克分校) University of Pennsylvania(宾夕法尼亚大学) University of Minnesota, Twin Cities(明尼苏达大学双城分校) Indiana University(印第安纳大学) National University of Singapore(新加坡国立大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 后训练与偏好优化 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RST递归合成框架,低成本规模化生成3.7万余个长视界终端任务,经微调或PPO优化后,多款Qwen模型在多个终端基准任务上性能显著提升,且递归过程无明显上限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13345 2026-08-14 cs.AI 新提交 70%

Rules or Character? Scaling Laws for AI Safety Design

规则还是特性?AI安全设计的缩放定律

Satoshi Takahashi, Nobuji Kouno, Masaaki Komatsu, Ryuji Hamamoto

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);分类 cs.AI

AI总结 该研究构建模型分析AI安全的特性塑造与规则执行的资源分配,发现部署规模对最优分配影响较小,特性脆弱率才是主导因素,二者的最优值在大规模部署下会收敛。

Comments Accepted at AIES 2026 (9th AAAI/ACM Conference on AI, Ethics, and Society). 10 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12564 2026-08-14 cs.LG 新提交 70%

Scaling Automatic Research Agents via World Models

通过世界模型扩展自动研究智能体

Xiyuan Yang, Sheikh Sarwar, Jingru Cheng, Zhan Shi, Duanshun Li, Huiyuan Chen, Haiyang Zhang, Chenlei Guo, Jingrui He, Zhenyu Liao

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊公司)

专题命中 后训练与偏好优化 :LLM(abstract_cn);post-training(abstract);分类 cs.LG

AI总结 针对自动研究智能体扩展时的训练瓶颈,提出WMRL方法,结合两种缓解措施提升收敛性,训练加速3-4倍且性能优于更大规模智能体,还可迁移至多类任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13395 2026-08-14 cs.RO 新提交 67%

FIRE-VLA: Failure-Informed Self-Evolution for Vision-Language-Action Models in Autonomous Driving

FIRE-VLA:面向自动驾驶的视觉-语言-动作模型的故障感知自演化

Hao Dou

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn)

AI总结 该研究针对自动驾驶VLA模型,提出FIRE-VLA故障感知自演化框架,结合GRPO与自蒸馏,在nuScenes数据集上降低了规划误差与故障流行率,提升了模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12330 2026-08-14 cs.CL 新提交 57%

Reliability-Aware Sexism Detection: Combining DPO with Annotator Agreement and Token-Level Confidence Scoring

感知可靠性的性别歧视检测:将DPO与标注者一致性及词元级置信度评分相结合

Hadi Mohammadi, Shihan Wang, Masoume M. Raeissi, Anastasia Giachanou

机构 * Utrecht University(乌得勒支大学) Wageningen University & Research(瓦赫宁根大学及研究中心)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.CL

AI总结 该研究针对在线性别歧视检测的主观性问题,提出RA-DPO方法,结合标注者一致性等信号,在EXIST 2023数据集上验证其可降低训练成本并提升推理准确率。

Comments 11 pages, 4 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01615 2026-08-14 cs.ET cs.LG 版本更新 57%

Thermalizing Stochastic Programs

热化随机程序

Mirko Amico, Andraž Jelinčič, Colin Oscar Nancarrow, Leo Tyrpak, David Roberts, Seth Morton, Dalton Sakthivadivel, Ashwin Gopal, Guillaume Verdon

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 该研究提出一套工具,将通用随机程序映射到热力学硬件,通过thermalizers框架编译随机程序并优化误差,在市场模拟器等多个应用中验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13026 2026-08-14 cs.RO 新提交 50%

Temporal GRPO: Beyond Trajectory-Level Credit in Vision-Language-Action Reinforcement Learning

时间差分GRPO:超越视觉-语言-动作强化学习中的轨迹级信用分配

Yao Zhou, Hang Gao, Fengge Wu, Changwen Zheng, Wenwen Qiang

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 针对视觉-语言-动作强化学习中轨迹级信用混叠问题,提出时间差分GRPO方法,在RoboTwin 2.0和LIBERO-Long上提升了任务性能与样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏