arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-14 至 2026-04-14 共收录 13 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 13 篇

2603.18806 2026-04-14 cs.AI 88%

dTRPO: Trajectory Reduction in Policy Optimization of Diffusion Large Language Models

dTRPO:扩散大语言模型策略优化中的轨迹缩减

Wenxuan Zhang, Lemeng Wu, Changsheng Zhao, Ernie Chang, Mingchen Zhuge, Zechun Liu, Andy Su, Hanxian Huang, Jun Chen, Chong Zhou, Raghuraman Krishnamoorthi, Vikas Chandra, Mohamed Elhoseiny, Wei Wen

机构 * Meta AI

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出dTRPO,通过减少轨迹概率计算成本提升扩散大语言模型的策略优化效果,实验显示在STEM、编程和指令遵循任务中性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10480 2026-04-14 cs.AI 87%

Tracing the Roots: A Multi-Agent Framework for Uncovering Data Lineage in Post-Training LLMs

追溯根源:一种多智能体框架,用于揭示训练后LLM的数据血缘

Yu Li, Xiaoran Shang, Qizhi Pei, Yun Zhu, Xin Gao, Honglin Lin, Zhanping Zhong, Zhuoshi Pan, Zheng Liu, Xiaoyang Wang, Conghui He, Dahua Lin, Feng Zhao, Lijun Wu

机构 * Shanghai Artificial Intelligence Laboratory, OpenDataLab(上海人工智能实验室,OpenDataLab) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出多智能体框架,用于揭示训练后LLM的数据血缘,识别数据集演化图谱中的结构模式与系统问题,构建血缘感知的多样化数据集。

Comments 27 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24251 2026-04-14 cs.SI 87%

GRAPHIA: Harnessing Social Graph Data to Enhance LLM-Based Social Simulation

GRAPHIA:利用社交图数据增强基于LLM的社会模拟

Jiarui Ji, Zehua Zhang, Zhewei Wei, Bin Tong, Guan Wang, Bo Zheng

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 GRAPHIA通过强化学习利用社交图数据作为LLM训练的监督信号,提升社会模拟的微观和宏观对齐效果,实验显示其在多个真实网络中显著提高预测精度和社会现象复制能力。

Comments accepted by ACL26 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10996 2026-04-14 cs.CL cs.AI cs.CE 86%

When Valid Signals Fail: Regime Boundaries Between LLM Features and RL Trading Policies

当有效信号失效时:LLM特征与强化学习交易策略之间的制度边界

Zhengzhe Yang

机构 * Independent Researcher(独立研究员)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究LLM生成连续数值特征是否能提升强化学习交易代理性能,发现有效特征在分布偏移时会引入噪声,影响策略鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11259 2026-04-14 cs.AI cs.CR 85%

Mobile GUI Agent Privacy Personalization with Trajectory Induced Preference Optimization

基于轨迹诱导的偏好优化的移动GUI代理隐私个性化

Zhixin Lin, Jungang Li, Dongliang Xu, Shidong Pan, Yibo Shi, Yuchi Liu, Yuecong Min, Yue Yao

机构 * Shandong University(山东大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) New York University(纽约大学) Xi'an Jiaotong University(西安交通大学) Australian National University(澳大利亚国立大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究移动GUI代理的隐私个性化问题,提出轨迹诱导偏好优化方法,通过偏好强度加权和填充门机制提升隐私保护与任务执行效率。

Comments 10 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06416 2026-04-14 cs.LG cs.AI cs.HC 81%

Influencing Humans to Conform to Preference Models for RLHF

影响人类以符合偏好模型的强化学习从人类反馈

Stephane Hatgis-Kessell, W. Bradley Knox, Serena Booth, Peter Stone

机构 * Stanford University(斯坦福大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Brown University(布朗大学) Sony AI(索尼AI)

专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.AI、cs.LG

AI总结 本文通过三项人类研究,探讨如何通过干预使人类偏好更符合预期模型,提升RLHF奖励函数对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11477 2026-04-14 cs.AI cs.SE q-fin.TR 79%

OOM-RL: Out-of-Money Reinforcement Learning Market-Driven Alignment for LLM-Based Multi-Agent Systems

OOM-RL:基于大语言模型多智能体系统的出钱强化学习市场驱动对齐

Kun Liu, Liqun Chen

专题命中 后训练与偏好优化 :LLM(title);RLHF(abstract);分类 cs.AI

AI总结 本文提出OOM-RL方法,通过将智能体部署到金融市场中,利用资本耗尽作为不可篡改的负梯度,使多智能体系统从过度迎合的基线进化为稳健的流动性感知架构,最终实现稳定均衡。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09855 2026-04-14 cs.AI cs.CL cs.GT econ.GN q-fin.EC 79%

Instructing LLMs to Negotiate using Reinforcement Learning with Verifiable Rewards

通过可验证奖励的强化学习指导大语言模型进行谈判

Shuze Daniel Liu, Claire Chen, Jiabao Sean Xiao, Lei Lei, Yuheng Zhang, Yisong Yue, David Simchi-Levi

机构 * Purdue University(普渡大学) California Institute of Technology(加州理工学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了通过可验证奖励的强化学习训练大语言模型进行谈判的有效性,揭示了四阶段战略演化,展示了训练后的模型在谈判中提取剩余价值的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10604 2026-04-14 cs.IR cs.AI cs.CL cs.LG 78%

NSFL: A Post-Training Neuro-Symbolic Fuzzy Logic Framework for Boolean Operators in Neural Embeddings

NSFL:一种用于神经嵌入中布尔运算的后训练神经符号模糊逻辑框架

Vladi Vexler, Ofer Idan, Gil Lederman, Dima Sivov

机构 * Huawei Tel-Aviv Research Center(华为特拉维夫研究中心)

专题命中 后训练与偏好优化 :post-training(title);分类 cs.CL、cs.AI、cs.LG

AI总结 NSFL框架通过适应形式t-范数和t-余范数,为神经嵌入空间提供多原子逻辑约束的计算方法,提升检索性能,实现高达81%的mAP提升。

Comments 23 pages (16 main + 7 appendix), 2 figures, 10 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19731 2026-04-14 cs.CL 77%

Preference Learning Unlocks LLMs' Psycho-Counseling Skills

偏好学习解锁大语言模型的心理咨询技能

Mian Zhang, Shaun M. Eack, Zhiyu Zoey Chen

机构 * Department of Computer Science, University of Texas at Dallas(德克萨斯大学达拉斯分校计算机科学系) School of Social Work, University of Pittsburgh(匹兹堡大学社会工作学院)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出专业评估原则构建偏好数据集,用于提升LLM在心理咨询中的响应能力,实验表明该数据集能有效提升模型表现,最佳模型在对比中胜率高达87%。

Comments ACL 2026 Camera-Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10918 2026-04-14 cs.AI 77%

CSPO: Alleviating Reward Ambiguity for Structured Table-to-LaTeX Generation

CSPO:缓解结构化表格到LaTeX生成中的奖励模糊性

Yunfan Yang, Cuiling Lan, Jitao Sang, Yan Lu

机构 * Beijing Jiaotong University(北京交通大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 本文提出CSPO框架,通过分离LaTeX表格组件的优化,缓解奖励模糊性,提升结构化生成的可靠性。

Comments Accepted by ACL2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07972 2026-04-14 cs.AI 70%

SHE: Stepwise Hybrid Examination Reinforcement Learning Framework for E-commerce Search Relevance

SHE:面向电商搜索相关性的分步混合检验强化学习框架

Pengkun Jiao, Yiming Jin, Jianhui Yang, Chenhe Dong, Zerui Huang, Shaowei Yao, Xiaojiang Zhou, Dan Ou, Haihong Tang

机构 * Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :LLM(abstract);SFT(abstract);分类 cs.AI

AI总结 本文提出SHE框架,通过分步奖励策略优化提升电商搜索相关性预测的逻辑一致性与准确性,优于SFT、DPO等基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11521 2026-04-14 cs.LG cs.CV 57%

Continuous Adversarial Flow Models

连续对抗流模型

Shanchuan Lin, Ceyuan Yang, Zhijie Lin, Hao Chen, Haoqi Fan

机构 * ByteDance Seed(字节跳动Seed)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 本文提出连续对抗流模型,通过对抗目标训练,改进了流匹配的均方误差准则,提升样本与目标分布的对齐性,适用于现有流匹配模型的后训练,显著降低FID分数并提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏