arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-19 至 2026-03-19 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 11 篇

2510.09259 2026-03-19 cs.CL cs.AI cs.LG 93%

Detecting Data Contamination from Reinforcement Learning Post-training for Large Language Models

在大型语言模型后训练强化学习中检测数据污染

Yongding Tao, Tian Wang, Yihong Dong, Huanyu Liu, Kechi Zhang, Xiaolong Hu, Ge Li

机构 * School of Computer Science, Peking University(北京大学计算机学院) New H3C Technologies Co., Ltd(新华H3C技术有限公司)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);LLM(abstract)

AI总结 本文提出Self-Critique方法,通过分析LLM后强化学习阶段输出熵分布的变化来检测数据污染,实验表明其在多个模型和污染任务中显著优于基线方法,AUC提升达30%。

Comments Accepted to ICLR 2026. Code is available at https://github.com/yongding-tao/RL-Data-Contamination

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16897 2026-03-19 eess.SP cs.CL cs.HC cs.LG q-bio.NC 86%

EEG-Based Brain-LLM Interface for Human Preference Aligned Generation

基于EEG的脑-大语言模型接口用于人类偏好对齐生成

Junzi Zhang, Jianing Shen, Weijie Tu, Yi Zhang, Hailin Zhang, Tom Gedeon, Bin Jiang, Yue Yao

机构 * Shandong University, China(山东大学) Australian National University, Australia(澳大利亚国立大学) Curtin University, Australia(Curtin大学)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出基于EEG的脑-大语言模型接口,通过EEG信号引导图像生成模型,利用神经信号反馈实现模型动态适应,为适应性语言模型推理提供新思路。

Comments 15 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09233 2026-03-19 cs.LG cs.AI cs.CL 85%

GIFT: Reconciling Post-Training Objectives via Finite-Temperature Gibbs Initialization

GIFT:通过有限温度吉布斯初始化调和后训练目标

Zhengyang Zhao, Lu Ma, Yizhen Jiang, Xiaochen Ma, Zimo Meng, Chengyu Shen, Lexiang Tang, Haoze Sun, Peng Pei, Wentao Zhang

机构 * Peking University(北京大学) Meituan(美团)

专题命中 后训练与偏好优化 :post-training(title,abstract);SFT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出GIFT方法,通过将监督视为有限温度能量势,解决后训练阶段目标不一致问题,实验表明其在强化学习初始化中优于传统SFT及其他基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21240 2026-03-19 cs.LG cs.AI 84%

Tree Search for LLM Agent Reinforcement Learning

基于树搜索的LLM代理强化学习

Yuxiang Ji, Ziyu Ma, Yong Wang, Guanhua Chen, Xiangxiang Chu, Liaoni Wu

机构 * Xiamen University(厦门大学) AMAP, Alibaba Group(阿里集团AMAP实验室) Southern University of Science and Technology(南方科技大学)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Tree-GRPO方法,通过树结构提升LLM代理在长期任务中的表现,利用树搜索共享前缀以增加rollout数量,并通过理论分析证明其与直接偏好学习等效。

Comments ICLR 2026, Code: https://github.com/AMAP-ML/Tree-GRPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17694 2026-03-19 cs.AI 81%

MALLES: A Multi-agent LLMs-based Economic Sandbox with Consumer Preference Alignment

MALLES:基于多智能体LLM的经济沙盒与消费者偏好对齐

Yusen Wu, Yiran Liu, Xiaotie Deng

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出MALLES,通过大规模模型的泛化能力构建统一模拟框架,利用偏好学习对齐LLM,解决高维环境下的数据稀疏问题,提升经济模拟的准确性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16600 2026-03-19 cs.CV 80%

Rationale Matters: Learning Transferable Rubrics via Proxy-Guided Critique for VLM Reward Models

原因至关重要:通过代理引导的批评学习可转移的评分标准用于视觉语言模型奖励模型

Weijie Qiu, Dai Guan, Junxin Wang, Zhihang Li, Yongbo Gai, Mengyu Zhou, Erchao Zhao, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(阿里云大模型应用团队) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 后训练与偏好优化 :LLM(abstract);language model(abstract);SFT(abstract);RLHF(abstract)

AI总结 本文提出Proxy-GRM,通过代理引导的评分标准验证提升视觉语言模型奖励模型的评分质量,利用轻量级代理代理进行评分标准验证,实现评分标准的可转移性和一致性,实验表明其在多个基准测试中表现优异。

Comments 25 pages, 10 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17662 2026-03-19 cs.CV cs.AI 77%

FINER: MLLMs Hallucinate under Fine-grained Negative Queries

FINER:MLLMs在细粒度负查询下产生幻觉

Rui Xiao, Sanghwan Kim, Yongqin Xian, Zeynep Akata, Stephan Alaniz

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Helmholtz Munich(海德堡-慕尼黑亥姆霍尔茨中心) Google(谷歌) LTCI, Télécom Paris, Institut Polytechnique de Paris(LTCI,巴黎电信学院,巴黎理工学院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.AI

AI总结 本文提出FINER基准测试,分析MLLMs在细粒度不匹配与真实元素共存时的幻觉问题,并通过FINER-Tuning提升模型性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16978 2026-03-19 cs.RO cs.LG 74%

Rewarding DINO: Predicting Dense Rewards with Vision Foundation Models

奖励DINO:基于视觉基础模型预测密集奖励

Pierre Krack, Tobias Jülg, Wolfram Burgard, Florian Walter

机构 * Department of Computer Science & Artificial Intelligence, University of Technology Nuremberg(技术大学纽伦堡计算机科学与人工智能系) TUM School of Computation, Information and Technology, Technical University of Munich(慕尼黑技术大学计算、信息与技术学院)

专题命中 后训练与偏好优化 :foundation model(title);分类 cs.LG

AI总结 本文提出Rewarding DINO,一种基于语言条件的奖励模型,通过学习实际奖励函数而非特定轨迹,实现机器人操作任务的密集奖励预测,具有紧凑结构和低计算开销,能有效泛化至新场景。

Comments 10 pages, 5 figures, submitted to IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17692 2026-03-19 cs.LG cs.AI q-fin.CP q-fin.PM 62%

Can Blindfolded LLMs Still Trade? An Anonymization-First Framework for Portfolio Optimization

盲folded LLMs仍能进行交易吗?一个以匿名化优先的资产组合优化框架

Joohyoung Jeon, Hongchul Lee

机构 * Korea University(韩国大学) Mirae Asset Securities(美亚证券)

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种以匿名化为核心的资产组合优化框架,通过盲fold LLMs来验证市场信号的合法性,实验显示在2025年期间实现了1.40的夏普比率,并通过负控实验验证信号的有效性。

Comments Accepted at the ICLR 2026 Workshop on Advances in Financial AI (FinAI). 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17295 2026-03-19 cs.CV cs.AI 57%

Directing the Narrative: A Finetuning Method for Controlling Coherence and Style in Story Generation

引导叙述:一种用于故事生成中控制连贯性和风格的微调方法

Jianzhang Zhang, Yijing Tian, Jiwang Qu, Chuang Liu

机构 * Department of Management Science and Engineering, Hangzhou Normal University(管理科学与工程系,杭州师范大学)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.AI

AI总结 本文提出一种两阶段框架,通过Group-Shared Attention和Direct Preference Optimization提升故事生成的连贯性和风格一致性,实验表明在ViStoryBench基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22179 2026-03-19 cs.CV 50%

High-Fidelity Diffusion Face Swapping with ID-Constrained Facial Conditioning

高保真扩散面部交换与ID约束面部条件化

Dailan He, Xiahong Wang, Shulun Wang, Guanglu Song, Bingqi Ma, Hao Shao, Yu Liu, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多模态实验室) Vivix Group Limited(Vivix集团有限公司) Shenzhen Loop Area Institute(深圳河套学院) CPII under InnoHK(创新香港下的CPII)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文提出了一种ID约束的面部条件化框架,通过解耦条件注入确保身份保持并优化属性对齐,结合身份和对抗损失提升生成质量,在定性和定量评估中均优于现有方法。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏