arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-04 至 2026-08-04 共收录 725 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 58 篇

2608.01904 2026-08-04 cs.AI 新提交 70%

CoEvoKG: Co-Evolving Knowledge Graphs with Self-Evolving Search Agents

CoEvoKG:用自演进搜索智能体协同演进知识图谱

Zhaoyang Li, Zenghuang Fu, Qiuyuan Ai, Ping Jiang, Haoyu Wu, Minghui Wu, Chenxu Zhao, Jie Song, Guannan He

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CoEvoKG框架将知识图谱作为训练任务源与智能体演进的持久证据记忆,联合训练任务生成器与搜索智能体,形成自演进与知识积累闭环,在六个问答基准上提升了三款骨干模型的准确率。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09757 2026-08-04 cs.CL cs.AI 版本更新 70%

RSRA: Training-Free Probing of Representation Sensitivity for Efficient LoRA Rank Allocation

RSLoRA:通过表示敏感性探测实现LoRA的无训练秩分配

Jiaqi Liu, Haidong Kang, Qihui Zhao, Guo Yu, Jingchao Wang

机构 * Dalian University of Technology(大连理工大学) Northeastern University(东北大学) Hebei Key Laboratory of Marine Perception Network and Data Processing(河北省海洋感知网络与数据处理重点实验室) Nanjing Tech University(南京工业大学) Institute of Intelligent Manufacturing(智能制造研究院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对LoRA传统秩分配问题,提出RSLoRA,通过激活空间几何及虚拟表示探测机制确定高敏感性模块,无需训练调整和反向梯度,在主流基准测试中优于现有方法,为模型自适应提供高效方案。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02068 2026-08-04 cs.CV 新提交 67%

GIFT: Geometry-Invariant Fine-Tuning for Non-Lambertian Monocular Depth Estimation

GIFT:面向非朗伯单目深度估计的几何不变微调方法

Xianghui Fan, Zhaoyu Chen, Bingqian Wu, Dayu Li, Xin Zeng, Huanran Cui, Guangzhen Xu, Xiangru Huang, Hang Yang

专题命中 指令微调 :foundation model(abstract);post-training(abstract)

AI总结 针对单目深度基础模型在非朗伯表面易产生深度幻觉的问题,提出无需深度标签的参数高效微调框架 GIFT,通过几何不变性抑制幻觉,在提升镜子与透明物体深度预测的同时保留基础模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00473 2026-08-04 cs.CV cs.AI cs.CL 新提交 62%

CrossProjection: Geometric Grounding Beyond Viewpoint Change in Architectural Drawings

CrossProjection:建筑图纸中超越视角变化的几何定位

Kaho Li, Pengyu Zeng, Yuqin Dai, Jun Yin, Tianjing Feng, Shuai Lu

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) University College London(伦敦大学学院)

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出CrossProjection方法评估视觉语言模型在异构建筑视图间的几何定位能力,发现模型在自由几何定位上性能脆弱,仅封闭选择成功不代表具备可靠几何定位能力。

Comments Initial controlled diagnostic study on 23 natural drawing sets and three VLMs; broader model, building, repeated-inference, and human coverage is planned for a subsequent version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05872 2026-08-04 cs.LG cs.AI math.CO 62%

Adaptation and Fine-tuning with TabPFN for Travelling Salesman Problem

Nguyen Gia Hien Vu, Yifan Tang, Rey Lim, Yifan Yang, Hang Ma, Ke Wang, G. Gary Wang

专题命中 指令微调 :foundation model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01521 2026-08-04 cs.AI 新提交 57%

MineGrad: Gradient Inversion Attacks on LoRA Fine-Tuning

MineGrad:针对LoRA微调的梯度反演攻击

Hasin Us Sami, Swapneel Sen, Basak Guler

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 指令微调 :pretraining(abstract);分类 cs.AI

AI总结 本研究提出MineGrad攻击,可利用中毒预训练模型和微调参数从LoRA微调的共享梯度中分析性恢复用户数据,适用于语言和视觉任务,在多基准上实现高保真数据恢复,揭示了联邦微调的关键隐私漏洞。

Comments 2026 Annual Conference on Artificial Intelligence and Statistics (AISTATS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01471 2026-08-04 cs.CL 新提交 57%

Two-Stage Bengali Sentiment Classification: Domain Adaptation Through Continual Learning and Parameter-Efficient Fine-Tuning

两阶段孟加拉语情感分类:通过持续学习和参数高效微调实现领域自适应

MD Shaikh Rahman, Syed Maudud E Rabbi, Muhammad Mahbubur Rashid

专题命中 指令微调 :pretraining(abstract);分类 cs.CL

AI总结 针对低资源语言情感分析难题,提出结合领域自适应持续预训练与LoRA参数高效微调的SentiBanglaBERT框架,集成SHAP可解释性,实现高效且可解释的孟加拉语情感分类,性能可媲美强基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29462 2026-08-04 eess.IV cs.CV cs.LG 版本更新 57%

MoPET: Parameter-Efficient Mixture-of-Experts for Unified Medical Image Classification

MoPET:面向统一医学图像分类的参数高效混合专家模型

Sebastian Doerrich, Daniel Würtinger, Francesco Di Salvo, Shyam Nandan Rai, Christian Ledig

专题命中 指令微调 :foundation model(abstract);分类 cs.LG

AI总结 MoPET作为参数高效混合专家模型,通过稀疏路由整合多任务PEFT专家,在MedMNIST基准上实现了医学图像分类准确率提升,缓解了跨域梯度冲突与负迁移问题。

Comments Accepted to EMA4MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17244 2026-08-04 cs.LG 版本更新 57%

DynImmune-BERT: Dynamic Immune Repertoire Modeling with Neural ODE Driven Continuous Transformers

DynImmune-BERT:基于神经常微分方程驱动的连续变换器的动态免疫组库建模

Rong Fu, Yongtai Liu, Xiaowen Ma, Haoyu Zhao, Shuo Yin, Yiqing Lyu, Long Zhang, Wangyu Wu

机构 * University of Macau(澳门大学) Hanyang University(汉阳大学) Zhejiang University(浙江大学) Wuhan University(武汉大学) Tsinghua University(清华大学) South China University of Technology(华南理工大学) University of Liverpool(利物浦大学)

专题命中 指令微调 :language model(abstract);分类 cs.LG

AI总结 研究针对纵向T细胞受体组库建模问题,提出DynImmune-BERT模型,结合多种方法,能在有纵向组库结构时补充静态编码器,通过特定评估方式得出结果,对小外部队列和协议差异需谨慎解读。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01530 2026-08-04 cs.CV 新提交 50%

ST-LoRA: Single Trajectory LoRA Ensemble for Uncertainty Aware Agricultural Segmentation

ST-LoRA:用于不确定性感知农业分割的单轨迹LoRA集成

Mohamed Farag, Genc Hoxha, Yahia Maleki, Chris McCool, Ribana Roscher

机构 * University of Bonn(波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence, University of Bonn(波恩大学拉马尔机器学习与人工智能研究所) Commonwealth Scientific and Industrial Research Organisation (CSIRO)(英联邦科学与工业研究组织(CSIRO))

专题命中 指令微调 :language model(abstract)

AI总结 ST-LoRA结合LoRA与快照集成,从单轨迹构建高效集成,在农业分割任务中,其性能优于多种基线方法,能高效实现不确定性感知。

Comments Submitted to Computers and Electronics in Agriculture (Elsevier). Currently under review (first revision round)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00678 2026-08-04 cs.CV 新提交 50%

Breaking the Horizontal Prior: From Long-Tailed Orientation Bias to Roll-Robust Monocular Depth Estimation

打破水平先验:从长尾方向偏差到抗翻滚单目深度估计

Kaihua Tang, Ziqing Xia, Xiaoxu Zheng, Xiaoxue Zhang, Michael Bi Mi, Zhan Xu, Dave Zhenyu Chen

专题命中 指令微调 :foundation model(abstract)

AI总结 该研究针对单目深度估计中受水平先验(长尾方向偏差)导致的相机翻滚鲁棒性差问题,提出训练时监督策略ID-Constraint,经多基准数据集实验验证了方法的有效性。

Comments The code is publicly available on GitHub: https://github.com/KaihuaTang/Horizontal-Prior

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14435 2026-08-04 math.DS math.GN 版本更新 50%

Shadowing in Dynamical Systems: Zero-dimensional Extensions and Inverse Limits

动力系统中的跟踪性:零维扩张与逆极限

Dekui Peng

专题命中 指令微调 :SFT(abstract)

AI总结 本文证明每个紧致豪斯多夫动力系统都是有限型转移的逆极限的因子,并识别了度量情形下跟踪性提供的额外稳定性,即具有跟踪性的紧致度量系统是满射粘合映射的有限型转移逆极限的因子。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12027 2026-08-04 cs.CV 版本更新 50%

4DVGGT-D: 4D Visual Geometry Transformer with Improved Dynamic Depth Estimation

4DVGGT-D: 具有改进动态深度估计的4D视觉几何变换器

Ying Zang, Xuanyi Liu, Yidong Han, Deyi Ji, Chaotao Ding, Yuanqi Hu, Qi Zhu, Xuanfu Li, Jin Ma, Lingyun Sun, Tianrun Chen, Lanyun Zhu

机构 * Peking University(北京大学) Zhejiang University(浙江大学) Huzhou University(湖州大学) Huawei(华为) Tongji University(同济大学)

专题命中 指令微调 :foundation model(abstract)

AI总结 本文提出一种无需训练的渐进解耦框架,通过稳定相机姿态和几何细化,解决动态与静态的分离问题,提升4D场景重建性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 37 篇

2608.02391 2026-08-04 cs.AI cs.LG 新提交 93%

Cooperative Coevolution for Resource-Constrained Agentic LLM Post-Training

资源受限智能体大语言模型后训练的协同协同进化方法

Zhiyuan Wang, Shengcai Liu, Jiahao Wu, Ning Lu, Hui Ouyang, Shaofeng Zhang, Haoze Lv, Ke Tang

专题命中 后训练与偏好优化 :LLM(title,summary_cn);post-training(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对资源受限智能体LLM后训练的高内存、长耗时问题,提出CoPES方法,在GPU小时预算下,其验证准确率恢复率、内存效率均优于标准ES和LoRA-GRPO,在多任务基准上表现更优。

Comments 14 pages,9 figures, submit to AAAI 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02031 2026-08-04 cs.DC cs.LG cs.NI 新提交 92%

Learning-Based Collaborative MEC for LLM Inference with Soft-Deadline Awareness via Transformer-Enhanced PPO

基于学习的、感知软截止期限的Transformer增强PPO用于LLM推理的协作式移动边缘计算(MEC)

Ngoc Hung Nguyen, Bjorn Landfeldt

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文针对软截止期限下LLM推理的协作MEC问题,提出Transformer增强PPO框架,通过捕捉时间与跨服务器交互优化任务迁移,在任务完成率和系统效率上优于传统方法。

Comments 7 pages, 5 pages

Journal ref 2026 IEEE GLOBECOM SELECTED AREAS IN COMMUNICATIONS: CLOUD/EDGE COMPUTING AND NETWORKING

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01743 2026-08-04 cs.LG cs.CL 新提交 91%

Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning

面向大语言模型强化学习中能力保留的可塑性保持KL正则化方法

Li Wang, Xiaodong Lu, Xiaohan Wang, Jiajun Chai, Wei Lin, Tianhao Peng, Guojun Yin

机构 * Meituan(美团)

专题命中 后训练与偏好优化 :LLM(title,summary_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 针对LLM强化学习后训练中能力遗忘问题,提出CoKL正则化框架,可在目标任务改进与原有能力保留间实现更优平衡,优于现有正则化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00419 2026-08-04 cs.LG cs.AI cs.CL cs.IR 新提交 91%

Unleashing the Potential of Large Language Models: A Blueprint for Real-Time, Enterprise-Ready Deployments

释放大语言模型的潜力:面向实时、企业级部署的蓝图

Muhammad Faizan Raza, Shuo, Yang, Satish Mahadevan Srinivasan, Joanna F. DeFranco

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对实时受监管场景中大语言模型的问题,提出基于模式的LLMOps架构,整合多模块并实现四项模式化贡献,优化权衡同时支持高风险领域的可审计与回滚部署。

Comments 6 pages, 1 figure. Authors' accepted version of an article published in IEEE Computer. The version of record is available at the DOI below

Journal ref Computer, vol. 59, no. 4, pp. 195-199, April 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01925 2026-08-04 cs.CL 版本更新 90%

Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey

用奖励模型增强大语言模型推理能力:一项分析性综述

Qiyuan Liu, Hao Xu, Xuhong Chen, Wei Chen, Yee Whye Teh, Ning Miao

机构 * Department of Data Science and Hong Kong Institute of AI for Science, City University of Hong Kong(数据科学系和香港人工智能科学研究所,香港城市大学) Li Auto Inc., China(中国利汽车公司) Department of Statistics, University of Oxford(统计系,牛津大学)

专题命中 后训练与偏好优化 :large language model(title,abstract_cn);language model(title,abstract_cn);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 该综述系统介绍奖励模型(RMs)的概念、训练与评估方法,梳理其在大语言模型(LLMs)推理中的三类核心应用,并探讨RMs相关开放问题,为其有效部署提供见解。

Comments Accepted for publication in Artificial Intelligence Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10727 2026-08-04 stat.ML cs.AI cs.LG math.PR math.ST stat.TH 版本更新 90%

Tail-Aware Information-Theoretic Bounds for LLM Alignment under Heavy-Tailed Rewards

尾感知信息论泛化用于RLHF和SGLD

Huiming Zhang, Binghan Li, Wan Tian, Qiang Sun

机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院) Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(北京未来区块链与隐私计算高精尖创新中心) Advanced Institute of Information Technology, Peking University(北京大学信息技术高等研究院) Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所) Computer and Mathematical Sciences, Computer Science, and Statistics, University of Toronto(多伦多大学计算机与数学科学、计算机科学和统计学系) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 后训练与偏好优化 :RLHF(title_cn,abstract);LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出一种尾依赖信息论框架,用于处理亚韦尔bull数据,通过移位对数f_θ-分歧来界定制换测度期望,从而在重尾数据下获得更精确的泛化界限。

Comments 47 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00782 2026-08-04 cs.CL 新提交 89%

Distill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher Guidance

从自适应教师指导中恢复负强化学习组的学习信号:针对失败情况进行知识蒸馏

Zhuowen Han, Jinwei Xiao, Zhengxi Lu, Renren Jin, Zhiyuan Yao, Yuxin Liu, Hongyan Hao, Yueqing Sun, Yu Yang, Qi GU, Xunliang Cai, Deyi Xiong

机构 * Tianjin University(天津大学) Meituan(美团)

专题命中 后训练与偏好优化 :SFT(summary_cn,abstract);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对GRPO与OPD简单结合的性能缺陷,提出RSTG方法,通过选择性自适应蒸馏及补充SFT,使数学任务性能提升4.02%、代码任务提升3.05%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01879 2026-08-04 cs.LG cs.AI 新提交 88%

LAB-Tab: LLM-Augmented Bayesian Network Adaptation for Few-Shot Tabular Generation

LAB-Tab:面向小样本表格生成的大语言模型增强型贝叶斯网络适配方法

Zijian Shen, Taijie Chen, Bin Zhou, Ziyang Jiang, Jintao Ke

专题命中 后训练与偏好优化 :LLM(title,summary_cn);分类 cs.AI、cs.LG

AI总结 针对小样本表格生成的分布偏移问题,提出LLM增强的贝叶斯网络适配框架LAB-Tab,在六个ACS分布偏移场景中表现优于基准方法,性能提升显著。

Comments 21 pages, 6 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06133 2026-08-04 cs.SE cs.AI cs.LG cs.LO 版本更新 87%

TLA-Prover: Verifiable TLA+ Specification Synthesis via Preference-Optimized Low-Rank Adaptation

TLA-Prover: 通过偏好优化低秩适配实现可验证的 TLA+ 规范合成

Eric Spencer, Arslan Bisharat, Brian Ortiz, Khushboo Bhadauria, Mujtaba Nazari, TaiNing Wang, George K. Thiruvathukal, Konstantin Laufer, Mohammed Abuhamad

机构 * Department of Computer Science, Loyola University Chicago(洛约拉芝加哥大学计算机科学系)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出 TLA-Prover 模型,结合监督微调和基于修复的组相对策略优化,在 TLC 模型检查器上实现 TLA+ 规范合成,Gold/Diamond 级别通过率达 30%,约为未调优基线的 3.5 倍。

Comments 12 pages, 5 tables, 3 figures. In Proceedings at the 21st International Conference on Software Technologies (ICSOFT 2026)

Journal ref ICSOFT 2026, pp. 627-636, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00382 2026-08-04 cs.CR 新提交 87%

TI-StegoAlign: Channel-Guided Post-Training for Generative Text Steganography under Tokenization Inconsistency

TI-StegoAlign:面向分词不一致场景的生成式文本隐写的通道导向后训练方法

Jiuan Zhou, Yuhao Xue, Yu Cheng, Yuan Xie, Zhaoxia Yin

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract,abstract_cn);preference optimization(abstract)

AI总结 TI-StegoAlign是一种仅更新LoRA参数的通道导向后训练框架,通过BCSO和CCPO优化,在分词不一致场景下实现100%接收方比特准确率,同时降低归一化困惑度偏差并提升抗隐写分析性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01715 2026-08-04 cs.AI 版本更新 85%

Distributionally Robust Listwise Preference Optimization

分布鲁棒列表偏好优化

Xudong Wu, Jian Qian, Pangpang Liu, Vaneet Aggarwal, Jiayu Chen

机构 * The University of Hong Kong(香港大学) Yale University(耶鲁大学) Purdue University(普渡大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对列表偏好排序标签不确定性,提出点态全变差鲁棒Plackett-Luce目标,将内层最大化简化为排序,在离线和在线设置中均具有理论保证,实验表明能保持干净标签性能并提升噪声鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00025 2026-08-04 cs.CL 版本更新 85%

TAB-PO: Preference Optimization with a Token-Level Adaptive Barrier for Token-Critical Structured Generation

TAB-PO:面向Token关键结构化生成的具有Token级自适应障碍的偏好优化

Samah Fodeh, Linhai Ma, Ganesh Puthiaraju, Srivani Talakokkul, Afshan Khan, Sreeraj Ramachandran, Elyas Irankhah, Aimee Kendall Roundtree

机构 * Yale University(耶鲁大学) Texas State University(德克萨斯州立大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);SFT(abstract,abstract_cn);分类 cs.CL

AI总结 针对结构化预测中偏好与拒绝对象仅少数token不同导致的梯度稀释和token侵蚀问题,提出基于混淆感知偏好构建和Token级自适应障碍的TAB-PO方法,在SciERC任务上显著提升关键指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21337 2026-08-04 cs.LG cs.AI 版本更新 85%

DataClaw0: Agentic Tailoring Multimodal Data from Raw Streams

DataClaw0: 从原始流中智能定制多模态数据

Cong Wan, Zeyu Guo, Zijian Cai, Jiangyang Li, SongLin Dong, Lin Peng, Xiangyang Luo, Zhiheng Ma, Yihong Gong

机构 * University of Chinese Academy of Sciences(中国科学院大学) Shenzhen University of Advanced Technology(深圳理工大学) Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :SFT(summary_cn,abstract_cn);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 提出DataClaw0模型,通过两阶段流水线将生成语义合成锚定于确定性事实锚点,结合SFT与GRPO实现复杂数据精炼意图的对齐,首个数据精炼基准验证其高效性。

Comments add base model: Qwen3.5-27B

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01130 2026-08-04 cs.LG 新提交 84%

When Do Surrogate Updates Improve Decisions? A Local Theory of Trajectory-Wise Transfer

替代更新何时能改进决策?轨迹式迁移的局部理论

Yuyang Shen

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);post-training(abstract);分类 cs.LG

AI总结 该研究提出轨迹式迁移的局部理论,探究替代更新改进决策的条件,推导相关梯度、校准等理论结果,通过网格世界和LLM后训练实验验证结论。

Comments 22 pages in total, including references and appendices; 3 composite figures (9 panels) and 4 tables. Code is available at https://github.com/Ethan-Shen-Individual-Lab/surrogate-to-decision-transfer

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12501 2026-08-04 cs.LG 84%

Reinforcement Learning from Human Feedback

基于人类反馈的强化学习

Nathan Lambert

机构 * Nathan Lambert(纳瑟恩·拉姆伯特)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);language model(abstract);instruction tuning(abstract);post-training(abstract)

AI总结 本书系统介绍强化学习从人类反馈的核心方法,涵盖指令微调、奖励模型训练及拒绝采样等关键技术,探讨合成数据与评估中的前沿问题。

Comments 239 pages. Web-native version at https://rlhfbook.com/ Continually improving, latest version at website

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02181 2026-08-04 cs.LG 新提交 83%

Start Classifying: Categorical Critics for LLM Reinforcement Learning

开始分类:用于大语言模型强化学习的分类式评判器

Zhijian Zhou, Long Li, Xuan Zhang, Zongkai Liu, Yulei Qin, Ke Li, Xing Sun, Xiaoyu Tan, Chao Qu, Yuan Qi

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Tencent YoutuLab(腾讯优图实验室) Griffith University(格里菲斯大学) Shanghai Academy of Artificial Intelligence for Science(上海科学人工智能研究院)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究提出HL-Gauss PPO,将PPO的标量评判器改为分类式预测器,在多任务及Qwen2.5、Qwen3主干上均优于PPO、DAPO基线,可改进评判器信号与优势估计。

Comments Accepted at COLM 2026. 26 pages, 9 figures. Code: https://github.com/ZhijianZhou/HL-guass-ppo

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01350 2026-08-04 cs.CL 版本更新 83%

LLM Output Detectability and Task Performance Can be Jointly Optimized

大语言模型输出可检测性与任务性能可以联合优化

Koshiro Saito, Ryuto Koike, Masahiro Kaneko, Naoaki Okazaki

机构 * Institute of Science Tokyo(东京科学研究所) MBZUAI National Institute of Advanced Industrial Science and Technology(国家先进工业科学与技术研究院) NII LLMC(日本信息基础设施中心LLMC)

专题命中 后训练与偏好优化 :LLM(title,abstract);分类 cs.CL

AI总结 本文提出PUPPET框架,通过强化学习优化大语言模型,使其输出更易检测且在下游任务中表现更优,实验表明其在长文问答、摘要和作文写作中均优于传统水印方法。

Comments 15 pages, 9 figures, 20 tables. Code: https://github.com/pakapaka333/PUPPET

详情

展开后加载摘要…

URL PDF HTML 收藏