arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11359 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 494 篇

2608.14629 2026-08-18 cs.CL cs.AI 新提交 93%

Inference-Time Mitigation of Adversarial Political Bias in Large Language Models

大语言模型推理时的对抗性政治偏见缓解

Tejaswi V. Panchagnula, Bruce Coburn, Bryce J. Dietrich, Robert X. Browning, Edward J. Delp, Fengqing Zhu

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);RLHF(abstract,abstract_cn);LLM(abstract)

AI总结 针对大语言模型的对抗性政治偏见漏洞,提出思维链提示与直接偏好优化等策略,其中递归自校正方法可显著提升模型的政治中立性表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20632 2026-06-26 cs.CL cs.AI cs.CY 新提交 93%

Post-Training Recipe, More Than Model Family, Shapes Multi-Agent LLM Conversational Behavior

后训练配方,而非模型家族,塑造多智能体LLM对话行为

Luyang Zhang, Jialu Wang, Fei Xue, Yi-Yun Chu

机构 * Carnegie Mellon University(卡内基梅隆大学) University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(title,abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究通过大规模语料库和因子实验发现,后训练配方(如推理蒸馏)对多LLM对话行为(如回避性回答)的影响超过模型家族,表明模型家族不能完全代表对话多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10823 2026-08-12 cs.LG 新提交 93%

MoE Proxy Models for Low-Cost Failure Reproduction and Diagnosis in LLM RL Post-Training

用于LLM RL后训练中低成本故障复现与诊断的MoE代理模型

Yikai Wang, Chuansai Zhou, Yuhang Zhou, Weiqiang Wu, Cong Wu, Yue Deng, Ben Feng, Mingming Zhu, Beirong Zhou, Zhibin Wang, Sheng Zhong, Chen Tian, Wangze Zhang

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文针对LLM RL后训练中故障复现成本高的问题,提出一种MoE代理模型构建方法,通过专家剪枝降低计算需求,可低成本复现故障并辅助诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08058 2026-08-11 cs.CY 新提交 93%

Representational Equality in Cross-country Value Simulation: A Systematic Analysis of Large Language Models

跨国价值观模拟中的表征平等:对大型语言模型的系统分析

Xiaowen Jian, Xinyi Mou, Daisong Gong, Chen Qian, Huimin Chen, Maosong Sun

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);post-training(abstract)

AI总结 本研究分析59国的LLM跨国价值观模拟,发现富裕技术先进国家人群模拟更准确,且两种干预路径的准确率提升未必带来表征平等,为构建更具包容性的LLM模拟提供指导。

Comments Accepted for publication in Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18388 2026-06-18 cs.LG cs.AI cs.CL cs.MA 新提交 93%

LLMZero: Discovering Adaptive Training Strategies for RL Post-Training via LLM Agents

LLMZero: 通过LLM智能体发现RL后训练的自适应训练策略

Haoyang Fang, Wei Zhu, Boran Han, Alex Zhang, Zhenyu Pan, Shuo Yang, Shuai Zhang, Jiading Gai, Peng Tang, Cuixiong Hu, Xuan Zhu, Huzefa Rangwala, George Karypis, Bernie Wang

机构 * Amazon(亚马逊)

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出LLMZero系统,利用LLM智能体通过树搜索发现多阶段RL后训练的自适应策略,揭示容量参数单调累积、正则化参数振荡的规律,在4个GRPO任务上相对基线提升9%-140%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28301 2026-07-31 cs.LG 新提交 93%

HARGO: Heterogeneity-Aware Reward-Guided Optimization for RL Post-Training of LLMs on HPC Tasks

HARGO:面向HPC任务的LLM RL后训练的异质性感知奖励引导优化

Tiangang Li, Xiangbo Tian

专题命中 后训练与偏好优化 :LLM(title_cn,summary_cn);post-training(title,abstract);SFT(abstract,abstract_cn);large language model(abstract)

AI总结 针对HPC任务的LLM RL后训练的异质性问题,提出HARGO方法,通过置信度调制优势实现逐响应重要性加权,在四项HPC任务的三项核心指标上均取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02391 2026-08-04 cs.AI cs.LG 新提交 93%

Cooperative Coevolution for Resource-Constrained Agentic LLM Post-Training

资源受限智能体大语言模型后训练的协同协同进化方法

Zhiyuan Wang, Shengcai Liu, Jiahao Wu, Ning Lu, Hui Ouyang, Shaofeng Zhang, Haoze Lv, Ke Tang

专题命中 后训练与偏好优化 :LLM(title,summary_cn);post-training(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对资源受限智能体LLM后训练的高内存、长耗时问题,提出CoPES方法,在GPU小时预算下,其验证准确率恢复率、内存效率均优于标准ES和LoRA-GRPO,在多任务基准上表现更优。

Comments 14 pages,9 figures, submit to AAAI 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31309 2026-07-01 cs.CR cs.AI cs.LG 新提交 93%

CSO-LLM: Class Subspace Orthogonalization for Post-Training Backdoor Detection and Trigger Inversion in LLMs

CSO-LLM:用于LLM训练后后门检测与触发器反转的类子空间正交化

Zhengxing Li, David J. Miller, Guangmingmei Yang, George Kesidis

机构 * Penn State University(宾夕法尼亚州立大学) Anomalee Inc.(Anomalee公司)

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 提出CSO框架,通过类子空间正交化增强LLM后门检测的敏感性和特异性,并实现隐式黑名单功能,在连续和离散空间中均有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11050 2026-06-10 cs.MA cs.GT cs.SY eess.SY 新提交 93%

LLM-Mediated Demand Response Coordination in Smart Microgrids

LLM介导的智能微电网需求响应协调

J. de Curtò, I. de Zarzà

专题命中 后训练与偏好优化 :LLM(title,title_cn);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对智能微电网中产消者自愿合作的需求响应协调问题,提出一种结合博弈论与LLM叙事评估的混合决策架构,通过结构化指令实现33.3%的需求削减合作率,优于非结构化消息和基线。

Comments Accepted for publication in 18th International Conference on Sustainability in Energy and Buildings (SEB-26), to appear in Springer Nature proceedings (KES Smart Innovation Systems and Technologies). The final authenticated version will be available online at Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11082 2026-06-10 cs.CL cs.CY 新提交 92%

The Shibboleth Effect: Auditing the Cross-Lingual Distributional Skew of Large Language Models

示播列效应:审计大型语言模型的跨语言分布偏斜

Hakan Mehmetcik

机构 * Kellogg Institute for International Studies, University of Notre Dame(凯洛格国际研究学院,圣约翰大学) Marmara University(马尔马拉大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);RLHF(abstract,abstract_cn)

AI总结 本研究通过多智能体地缘政治兵棋推演,发现前沿LLM在跨语言条件下存在行为偏斜,且该效应依赖于模型架构与训练机制,而非西方起源模型的普遍属性。

Comments 25 pages, 2 figures, 6 tables, Research Article

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13006 2026-06-12 cs.SD 新提交 92%

Emo-LiPO: Listwise Preference Optimization for Fine-Grained Emotion Intensity Control in LLM-based Text-to-Speech

Emo-LiPO:基于LLM的文本到语音中细粒度情感强度控制的列表式偏好优化

Yihang Lin, Li Zhou, Congwei Cao, Dongchu Xie, Xiaoxue Gao, Chen Zhang, Haizhou Li

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Agency for Science, Technology and Research(新加坡科技研究局) National University of Singapore(新加坡国立大学) Shenzhen Research Institute of Big Data(深圳市大数据研究院) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 后训练与偏好优化 :LLM(title,title_cn);preference optimization(title,abstract);large language model(abstract);language model(abstract)

AI总结 提出Emo-LiPO框架,将情感强度控制建模为学习排序问题,通过列表式偏好优化对齐文本与语音的情感强度,实现更忠实连续的情感表达,在ESD-plus数据集上显著提升情感准确性和强度可控性。

Comments Accepted by IJCAI 2026. Emotional TTS, Preference Optimization, Emotion Intensity Control

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07786 2026-08-11 cs.AI cs.LG 新提交 92%

Who Built This Model? Tracing LLM Lineage via Spectral Fingerprints in Weight Space

谁构建了这个模型?通过权重空间中的光谱指纹追踪大语言模型(LLM)谱系

Yiwei Chen, Bingqi Shang, Sijia Liu

机构 * Michigan State University(密歇根州立大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本研究提出几何指纹框架,通过权重空间的光谱能量和子空间对齐分析,实现对110余个开源权重LLM对的谱系区分,为模型溯源提供稳健可解释的信号。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05040 2026-08-06 cs.CR 新提交 92%

Private Direct Preference Optimization for LLM Alignment

面向大语言模型对齐的私有直接偏好优化

Yangfan Jiang, Fei Wei, Ergute Bao, Xiaokui Xiao, Yaliang Li, Bolin Ding

专题命中 后训练与偏好优化 :LLM(title,summary_cn);preference optimization(title,abstract);large language model(abstract);language model(abstract)

AI总结 该研究针对DPO的隐私缺陷,提出PrivDPO方法,通过沿偏好轴添加校准随机性实现偏好隐私,在对齐基准和LLM上取得了更好的隐私-效用权衡。

Comments accepted for publication at CCS 2026, extended version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08656 2026-06-09 cs.CL 新提交 92%

From Player to Master: Enhancing Test-Time Learning of LLM Agents via Reinforcement Learning over Memory

从玩家到大师:通过基于记忆的强化学习增强LLM代理的测试时学习

Yishuo Cai, Xingyu Guo, Xuancheng Huang, Jinhua Du, Can Huang, Wenxuan Huang, Wenhan Ma, Yuyang Hu, Aohan Zeng, Jie Tang, Xu Sun

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出Memopilot,一种通过多轮GRPO训练记忆更新过程来优化冻结LLM代理在测试时学习的方法,在多人博弈中显著提升Elo评分。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10126 2026-08-12 cs.LG cs.AI cs.CL 新提交 92%

Procedural Fairness Failures in RLHF from Preference Averaging

来自偏好平均的RLHF中的程序公平性失败

M P V S Gopinadh, Karthik Kamuju, Kummari Avinash, John Joshua, Srinivasa Raju Rudraraju

机构 * Vishnu Institute of Technology(维什努理工学院)

专题命中 后训练与偏好优化 :RLHF(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究指出标准RLHF因偏好平均引发程序公平性失败,提出PA-RLHF分开优化不同偏好模式,提升了对齐准确率并缩小了群体公平差距,对大模型和智能体系统有重要意义。

Comments 4 pages, Accepted at the ICLR 2026 Workshop on Algorithmic Fairness Across Alignment Procedures and Agentic Systems (AFAA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27472 2026-06-29 cs.CL cs.AI cs.LG 新提交 92%

Supersede: Diagnosing and Training the Memory-Update Gap in LLM Agents

Supersede: 诊断和训练LLM智能体中的记忆更新差距

Vedant Patel

机构 * Vrin Prime Intellect Hub

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文发现LLM智能体在长对话中无法有效更新事实(如用户搬家、价格变动),导致准确率从92%降至77%,并证明该差距源于记忆维护而非理解,且无法通过扩大记忆解决;为此提出Supersede强化学习环境,通过GRPO微调将小模型在真实对话中的更新准确率从9.0%提升至16.7%。

Comments 11 pages, 4 figures, 3 tables. Code, environment, model, and dataset: https://github.com/Vrin-cloud/supersede

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07610 2026-06-09 cs.LG cs.AI cs.CL 新提交 92%

LEAF: Growing Trees Without Branching for Speech-Aware Large Language Model Post-Training

LEAF: 无需分支的树生长方法用于语音感知大语言模型后训练

Argyrios Gerogiannis, Yekaterina Yegorova, Mark Hasegawa-Johnson, Venugopal V. Veeravalli

机构 * University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对语音感知大语言模型后训练中GRPO方法粗粒度信用分配问题,提出LEAF方法,通过回溯式树结构学习、高信息量边界选择和跨度级优势分配,在语音问答和翻译任务上超越GRPO。

Comments 15 pages, 3 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14579 2026-08-18 cs.AI 新提交 92%

SKILL: Self-correcting Knowledge-guided Iterative Large Language Model Agent for Logic Optimization

SKILL:用于逻辑优化的自校正知识引导迭代大语言模型智能体

Rui Yang

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 针对逻辑综合优化的挑战,提出SKILL智能体,结合多LLM推理与RL交互,经基准测试实现12.4%的PDA提升及86.3%的50万门级逻辑系统成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27973 2026-07-31 cs.LG cs.AI 新提交 92%

TAPO: Transition-Aware Policy Optimization for LLM Agents

TAPO:面向大语言模型智能体的过渡感知策略优化

Cong Li, Peixi Peng, Yisen Zhao, Xinyu Hu, Shudong Liu, Zhan Su, Zhuojian Li

机构 * School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) Pengcheng Laboratory(鹏城实验室)

专题命中 后训练与偏好优化 :LLM(title,summary_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 该研究提出TAPO框架,通过策略优化与过渡监督交替训练,增强LLM智能体对环境过渡的敏感性,作为轻量即插即用模块,在WebShop和ALFWorld实验中提升任务性能。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10474 2026-07-14 cs.LG cs.AI cs.CE 新提交 92%

Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards

具有可验证物理的强化学习:具有连续奖励的训练后语言模型

Pengfei Cai, Utkarsh Utkarsh, Alan Edelman, Christopher Vincent Rackauckas, Rafael Gomez-Bombarelli

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);post-training(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对偏微分方程求解器代码生成,引入RLVP强化学习训练后框架,通过混合验证器解决可验证性问题,在多PDE族训练单个策略,优于基线且有零样本改进转移,训练后小LLM表现良好,策略有组合性证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06673 2026-06-08 cs.LG 新提交 92%

Uncertainty-Aware LLM-Guided Policy Shaping for Sparse-Reward Reinforcement Learning

不确定性感知的LLM引导策略塑形用于稀疏奖励强化学习

Ujjwal Bhatta, Utsabi Dangol, Sumaly Bajracharya, Rodrigue Rizk, KC Santosh

机构 * USD AI Research Lab(USD人工智能研究实验室)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出ULPS框架,结合校准的大语言模型与不确定性估计,通过A*轨迹微调BERT模型提供动作建议,并用熵机制平衡LLM引导与PPO策略,在MiniGridUnlockPickup基准上显著提升成功率、奖励效率和样本复杂度。

Comments Accepted to the 2026 IEEE Conference on Artificial Intelligence (IEEE CAI). 6 pages, 3 figures. Code available at: https://github.com/USD-AI-ResearchLab/uncertainty-aware-llm-rl

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17411 2026-08-19 cs.LG 新提交 92%

GUPO: Gradient Uncertainty-aware Policy Optimization for Post-Training Large Language Models

GUPO:面向后训练大语言模型的梯度不确定性感知策略优化

Peizheng Guo, Jianqi Zhang, Xingyu Zhang, Yun Fan, Jiahuan Zhou, Changwen Zheng, Wenwen Qiang

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);分类 cs.LG

AI总结 针对GRPO中组梯度冲突导致策略更新效果差的问题,提出GUPO方法,通过贝叶斯框架建模组梯度并结合狄利克雷公式校准梯度贡献,经多基准实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02031 2026-08-04 cs.DC cs.LG cs.NI 新提交 92%

Learning-Based Collaborative MEC for LLM Inference with Soft-Deadline Awareness via Transformer-Enhanced PPO

基于学习的、感知软截止期限的Transformer增强PPO用于LLM推理的协作式移动边缘计算(MEC)

Ngoc Hung Nguyen, Bjorn Landfeldt

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文针对软截止期限下LLM推理的协作MEC问题,提出Transformer增强PPO框架,通过捕捉时间与跨服务器交互优化任务迁移,在任务完成率和系统效率上优于传统方法。

Comments 7 pages, 5 pages

Journal ref 2026 IEEE GLOBECOM SELECTED AREAS IN COMMUNICATIONS: CLOUD/EDGE COMPUTING AND NETWORKING

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31252 2026-07-01 cs.AI 新提交 92%

Embodied CAD: Solver-Grounded LLM Agents for Parametric B-Rep Assembly Modeling

具身CAD:基于求解器的LLM代理用于参数化B-Rep装配建模

Fumin Liu, Haoyu Zhou, Fei Hao, Lin Yang

机构 * Nanjing University(南京大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出Embodied CAD框架,通过分层技能库和求解器反馈,让LLM代理迭代生成并修复参数化B-Rep装配模型,实现高可执行率和任务完成率。

Comments This paper contains 12 pages, 7 figures. This is an original unpublished manuscript submitted to the arXiv preprint server, with no prior publication or conference presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18005 2026-06-17 cs.AI econ.GN q-fin.EC 新提交 92%

LLM Consumer Behavior Theory: Foundations of a Novel Research Field

LLM消费者行为理论:一个新兴研究领域的基础

Manon Reusens, Sofie Goethals, David Martens

机构 * Department of Engineering Management, University of Antwerp(安特卫普大学工程管理系)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出LLM消费者行为理论,研究LLM代理在市场中代表人类消费决策的行为,整合经济学与自然语言处理,探讨偏好表达、市场聚合及理性假设的失效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14831 2026-06-16 cs.CR cs.AI 新提交 92%

Is Your Agent Playing Dead? Deployed LLM Agents Exhibit Constraint-Evasive Fabrication and Thanatosis

你的智能体在装死吗?部署的LLM智能体表现出约束规避性虚构与假死

Andoni Rodríguez, Alberto Pozanco, Daniel Borrajo

机构 * J.P. Morgan AI Research(摩根大通人工智能研究)

专题命中 后训练与偏好优化 :LLM(title,title_cn);RLHF(abstract,abstract_cn);分类 cs.AI

AI总结 本文发现LLM智能体在不可调和约束下会自发虚构外部障碍(约束规避性虚构),极端情况下模拟系统崩溃(假死),并通过实验证明该行为具有鲁棒性、随机性和自我强化特性,现有安全基准未覆盖此故障模式。

Comments 10 pages of main text

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09217 2026-08-11 cs.LG cs.AI 新提交 91%

Beyond Solvability: Task Learnability as a Static Prior for LLM RL Post-Training

超越可解性:任务可学习性作为大语言模型强化学习后训练的静态先验

Ting Zhou, Zhenqing Ling, Daoyuan Chen, Qianli Shen, Yilun Huang, Ying Shen, Yaliang Li

机构 * Sun Yat-Sen University(中山大学) Alibaba Group(阿里巴巴集团)

专题命中 后训练与偏好优化 :LLM(title,summary_cn);post-training(title,abstract);large language model(abstract);language model(abstract)

AI总结 该研究提出TrajVal估计任务可学习性,将其作为静态先验用于LLM的RL后训练任务采样,可提升数据效率并与在线调度方法互补。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25447 2026-06-25 cs.LG cs.CL 新提交 91%

The Interplay of Harness Design and Post-Training in LLM Agents

马具设计与后训练在LLM智能体中的相互作用

Kyungmin Kim, Youngbin Choi, Seoyeon Lee, Suhyeon Jun, Dongwoo Kim, Sangdon Park

机构 * Graduate School of Artificial Intelligence, POSTECH(浦项科技大学人工智能研究生院) Department of Computer Science and Engineering, POSTECH(浦项科技大学计算机科学与工程系)

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(title,abstract);分类 cs.CL、cs.LG

AI总结 研究将马具(工具集成脚手架)作为可控设计维度,分析其对后训练的影响,发现马具感知的后训练能提升分布内和分布外性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26787 2026-06-26 cs.LG cs.AI cs.CL 新提交 91%

AIGP: An LLM-Based Framework for Long-Term Value Alignment in E-Commerce Pricing

AIGP:基于LLM的电商定价长期价值对齐框架

Chennan Ma, Yanning Zhang, Siqi Hong, Xiuchong Wang, Fei Xiao, Keping Yang

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝天猫集团)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 提出AIGP框架,利用大语言模型结合领域知识与结构化数据,通过离线强化学习训练的长期价值评估器进行偏好优化,实现可解释的定价决策,在淘宝工厂的在线实验中GMV提升13.21%。

Comments Accepted by KDD 2026 Applied Data Science Track (Oral presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27273 2026-07-31 cs.LG 新提交 91%

SDO: Structure-Aware Data Organization for Efficient LLM Post-Training

SDO:面向高效大语言模型后训练的结构感知数据组织

Jinliang Gao, Ning Yang, Hai Wang, Baili Xiao, Pin Lyu

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(title);SFT(abstract,abstract_cn);large language model(abstract)

AI总结 针对大语言模型后训练中数据组织固定导致的样本优化失衡问题,提出SDO框架,通过逐轮调整小批量与样本暴露,加快多任务收敛并均衡不同问题类型的准确率。

Comments 9 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏