arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-07 至 2026-04-07 共收录 12 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 12 篇

2604.04361 2026-04-07 cs.HC 91%

Developing Authentic Simulated Learners for Mathematics Teacher Learning: Insights from Three Approaches with Large Language Models

构建数学教师学习的真挚模拟学习者:基于三种方法与大语言模型的洞察

Jie Cao, Ha Nguyen, Selim Yavuz, Boran Yu, Shuguang Wang, Pavneet Kaur Bharaj, Dionne Cross Francis

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);preference optimization(abstract)

AI总结 本文探讨三种方法提升模拟学生的真实性与教学效用,发现多代理和DPO方法能生成明确的解题策略解释,而微调模型虽生成真实回应但限制思维扩展。

Comments This paper has been accepted in AIED'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03671 2026-04-07 cs.IR 89%

User Simulator-Guided Multi-Turn Preference Optimization for Reasoning LLM-based Conversational Recommendation

基于用户模拟器的多轮偏好优化推理LLM对话推荐

Xingyuan Xiang, Xiangchen Pan, Wei Wei

专题命中 后训练与偏好优化 :LLM(title,abstract);preference optimization(title,abstract);SFT(abstract)

AI总结 本文提出SMTPO框架,通过多任务监督微调和强化学习优化多轮对话推荐,提升推荐准确性与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04497 2026-04-07 cs.LG cs.AI cs.CL 88%

One Model for All: Multi-Objective Controllable Language Models

一个模型解决所有问题:多目标可控语言模型

Qiang He, Yucheng Yang, Tianyi Zhou, Meng Fang, Mykola Pechenizkiy, Setareh Maghsudi

机构 * Ruhr University Bochum(波鸿鲁尔大学) Eindhoven University of Technology(埃因霍温理工大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Liverpool(利物浦大学)

专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract);large language model(abstract);RLHF(abstract)

AI总结 本文提出多目标控制(MOC),通过引入多目标优化原理训练单个语言模型,使其能根据用户偏好在帕累托前沿生成个性化输出,提升模型可控性、输出质量和泛化能力。

Comments Published in Transactions on Machine Learning Research (03/2026): https://openreview.net/forum?id=qAM5PmvFYY

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04261 2026-04-07 cs.LG cs.AI 84%

APPA: Adaptive Preference Pluralistic Alignment for Fair Federated RLHF of LLMs

APPA:自适应偏好多元对齐用于大语言模型公平联邦强化学习从人类反馈

Mahmoud Srewa, Tianyu Zhao, Salma Elmalaki

机构 * University of California, Irvine(加利福尼亚大学尔湾分校)

专题命中 后训练与偏好优化 :RLHF(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出APPA框架,通过动态调整群体奖励权重,提升联邦强化学习中多群体公平对齐效果,实验显示其在保持整体对齐性的同时,显著提升最差群体对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04855 2026-04-07 cs.LG 79%

The Role of Generator Access in Autoregressive Post-Training

生成器访问在自回归后训练中的作用

Amit Kiran Rege

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG

AI总结 研究生成器访问对自回归后训练的限制,探讨学习者是否能返回已有前缀查询下一个词规则,分析不同控制方式对训练效果的影响。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03417 2026-04-07 cs.LG 77%

Beauty in the Eye of AI: Aligning LLMs and Vision Models with Human Aesthetics in Network Visualization

人工智能之眼中的美感:通过LLMs和视觉模型对网络可视化的人类美学对齐

Peng Zhang, Xuefeng Li, Xiaoqi Wang, Han-Wei Shen, Yifan Hu

机构 * Northeastern University(东北大学) Bosch AI Research(博世人工智能研究院) The Ohio State University(俄亥俄州立大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文探讨利用LLMs和视觉模型作为人类判断的代理,通过用户研究收集人类偏好标签,提升网络可视化的人类美学对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22776 2026-04-07 cs.AI 70%

TSPO: Breaking the Double Homogenization Dilemma in Multi-turn Search Policy Optimization

TSPO:突破多轮搜索策略优化中的双重均质化困境

Shichao Ma, Zhiyuan Ma, Ming Yang, Xiaofan Li, Xing Wu, Jintao Du, Yu Cheng, Weiqiang Wang, Qiliang Liu, Zhengyang Zhou, Yang Wang

机构 * University of Science and Technology of China(中国科学技术大学) Tiansuan Lab, Ant Group Co., Ltd.(天算实验室,蚂蚁集团) Fudan University(复旦大学) East China Normal University(华东师范大学) Central South University(中南大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出TSPO方法,通过引入首次出现潜在奖励机制,解决多轮搜索策略优化中的过程均质化和组内均质化问题,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04410 2026-04-07 cs.LG cs.AI cs.CL stat.ML 67%

Relative Density Ratio Optimization for Stable and Statistically Consistent Model Alignment

相对密度比优化用于稳定且统计一致的模型对齐

Hiroshi Takahashi, Tomoharu Iwata, Atsutoshi Kumagai, Sekitoshi Kanai, Masanori Yamada, Kosuke Nishida, Kazutoshi Shinoda

机构 * NTT, Inc.(日本电信电话株式会社) NTT DOCOMO, INC.(NTT DOCOMO公司)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种稳定且统计一致的模型对齐方法,通过相对密度比优化,改进了直接密度比优化的稳定性与收敛性。

Comments Code is available at https://github.com/takahashihiroshi/rdro

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11321 2026-04-07 cs.LG cs.AI cs.CL 67%

Hindsight-Anchored Policy Optimization: Turning Failure into Feedback in Sparse Reward Settings

回顾锚定策略优化:在稀疏奖励设置中将失败转化为反馈

Yuning Wu, Ke Wang, Devin Chen, Kai Wei

机构 * Amazon(亚马逊)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出HAPO策略优化方法,通过合成成功注入机制和 Thompson 采样启发的门控机制,解决稀疏奖励下策略优化的分布偏置问题,实现渐近一致性。

Comments Published as a conference paper ICLR 2026 CAO Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24936 2026-04-07 cs.CV cs.AI 57%

TIGFlow-GRPO: Trajectory Forecasting via Interaction-Aware Flow Matching and Reward-Guided Optimization

TIGFlow-GRPO:通过交互感知的流匹配和奖励引导优化进行轨迹预测

Xuepeng Jing, Wenhuan Lu, Hao Meng, Zhizhi Yu, Jianguo Wei

机构 * Tianjin University(天津大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 本文提出TIGFlow-GRPO,通过交互感知的流匹配和奖励引导优化,提升复杂环境下的轨迹预测准确性与稳定性,生成更符合社会规范和物理可行的轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22647 2026-04-07 cs.CV 50%

FinPercep-RM: A Fine-grained Reward Model and Co-evolutionary Curriculum for RL-based Real-world Super-Resolution

FinPercep-RM:一种细粒度奖励模型和协同进化课程用于基于强化学习的现实世界超分辨率

Yidi Liu, Zihao Fan, Jie Huang, Jie Xiao, Dong Li, Wenlong Zhang, Lei Bai, Xueyang Fu, Zheng-Jun Zha

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 后训练与偏好优化 :RLHF(abstract)

AI总结 本文提出FinPercep-RM细粒度奖励模型和协同进化课程学习机制,通过生成感知退化图提升超分辨率模型的感知质量,解决传统IQA模型对局部细粒度失真不敏感的问题。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03941 2026-04-07 cs.CV 50%

SafeCtrl: Region-Aware Safety Control for Text-to-Image Diffusion via Detect-Then-Suppress

SafeCtrl: 通过检测-然后抑制方法实现区域感知的安全控制

Lingyun Zhang, Yu Xie, Zhongli Fang, Yu Liu, Ping Chen

机构 * School of Computer Science and Technology, Fudan University(复旦大学计算机科学技术学院) Institute of Big Data, Fudan University(复旦大学大数据研究院) Nanjing University of Information Science and Technology(南京信息工程大学)

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 SafeCtrl通过检测-然后抑制方法实现区域感知的安全控制,精准定位风险区域并局部抑制有害内容,提升安全性与生成质量。

Comments 6 pages, 5 figures, accepted to 2026 IEEE International Conference on Multimedia and Expo (ICME)

详情

展开后加载摘要…

URL PDF HTML 收藏