arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-26 至 2026-03-26 共收录 8 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 8 篇

2603.01853 2026-03-26 cs.CL 81%

Let the Agent Search: Autonomous Exploration Beats Rigid Workflows in Temporal Question Answering

让代理搜索:在时间问题回答中自主探索胜过固定工作流

Xufei Lv, Jiahui Yang, Haoyuan Sun, Xialin Su, Zhiliang Tian, Yifu Gao, Linbo Qiao, Houde Liu

机构 * National University of Defense Technology(国防科技大学) Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出AT2QA代理,通过自主探索和动态自我纠正提升时间知识图谱问题回答性能,实验表明其在三个基准测试中超越现有最佳基线。

Comments Revised version with three added authors and additional experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23951 2026-03-26 cs.CL 79%

From AI Assistant to AI Scientist: Autonomous Discovery of LLM-RL Algorithms with LLM Agents

从AI助手到AI科学家:利用LLM代理自主发现LLM-RL算法

Sirui Xia, Yikai Zhang, Aili Chen, Siye Wu, Siyu Yuan, Yanghua Xiao

机构 * Shanghai Key Laboratory of Data Science, School of Computer Science, Fudan University(上海数据科学关键实验室,计算机科学学院,复旦大学) School of Data Science, Fudan University(数据科学学院,复旦大学)

专题命中 后训练与偏好优化 :LLM(title);language model(abstract);分类 cs.CL

AI总结 本文提出POISE框架,通过自动化发现语言模型的策略优化算法,改进了政策优化算法,提高了性能指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23550 2026-03-26 cs.LG 74%

Implicit Turn-Wise Policy Optimization for Proactive User-LLM Interaction

隐式回合式策略优化用于主动用户-大语言模型交互

Haoyu Wang, Yuxin Chen, Liang Luo, Buyun Zhang, Ellie Dingqiao Wen, Pan Li

机构 * Georgia Institute of Technology(佐治亚理工学院) Meta AI

专题命中 后训练与偏好优化 :LLM(title);分类 cs.LG

AI总结 本文提出隐式回合式策略优化方法,通过隐式过程奖励模型从稀疏结果信号中提取细粒度回合级奖励,提升多轮协作任务的训练稳定性与收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24093 2026-03-26 cs.LG cs.AI 73%

Towards Effective Experiential Learning: Dual Guidance for Utilization and Internalization

迈向有效的经验学习:利用与内化双指导

Fei Bai, Zhipeng Chen, Chuan Hao, Ming Yang, Ran Tao, Bryan Dai, Wayne Xin Zhao, Jian Yang, Hongteng Xu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学首都人工智能学院) IQuest Research(IQuest研究) Beihang University(北京航空航天大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DGO框架,通过外部和内部经验指导强化学习,提升大语言模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24034 2026-03-26 cs.CL cs.AI 73%

From Oracle to Noisy Context: Mitigating Contextual Exposure Bias in Speech-LLMs

从 oracle 到噪声上下文:缓解语音大语言模型中的上下文暴露偏差

Xiaoyong Guo, Nanjie Li, Zijie Zeng, Kai Wang, Hao Huang, Haihua Xu, Wei Shi

机构 * School of Computer Science and Technology, Xinjiang University, Urumqi, China(新疆大学计算机科学与技术学院,乌鲁木齐,中国) Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing, Urumqi, China(丝绸之路多语种认知计算联合国际研究实验室,乌鲁木齐,中国) Timekettle

专题命中 后训练与偏好优化 :SFT(abstract);preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 本文提出统一训练框架,通过教师错误知识、上下文dropout和直接偏好优化提升语音大语言模型在真实历史下的鲁棒性,实验表明在预测历史解码中性能提升,且在无关上下文攻击下表现更稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19311 2026-03-26 cs.CL 70%

PrefPO: Pairwise Preference Prompt Optimization

PrefPO:基于配对偏好的提示优化

Rahul Singhal, Pradyumna Tambwekar, Karime Maamari

机构 * Distyl AI

专题命中 后训练与偏好优化 :LLM(abstract);RLHF(abstract);分类 cs.CL

AI总结 PrefPO通过强化学习反馈机制优化提示,无需标注数据即可提升模型性能,在多个基准测试中表现优异,同时改善提示质量并减少提示黑客问题。

Comments Code and data available at https://github.com/DistylAI/prefpo and https://huggingface.co/datasets/rahul-singhal/IFEval-Hard

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24580 2026-03-26 cs.CL cs.AI cs.CY cs.IR cs.LG 67%

Retrieval Improvements Do Not Guarantee Better Answers: A Study of RAG for AI Policy QA

检索改进并不保证更好的答案:RAG在人工智能政策问答中的研究

Saahil Mathur, Ryan David Rittner, Vedant Ajit Thakur, Daniel Stuart Schiff, Tunazzina Islam

机构 * Department of Computer Science, Purdue University(计算机科学系,普渡大学) Department of Political Science, Purdue University(政治学系,普渡大学)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了RAG在人工智能治理中的应用,发现领域特定微调虽提升检索指标,但未必改善问答性能,尤其在相关文档缺失时可能导致更自信的幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24198 2026-03-26 cs.CV 67%

RefReward-SR: LR-Conditioned Reward Modeling for Preference-Aligned Super-Resolution

RefReward-SR: 基于低分辨率参考的偏好对齐超分辨率奖励建模

Yushuai Song, Weize Quan, Weining Wang, Jiahui Sun, Jing Liu, Meng Li, Pengbin Yu, Zhentao Chen, Wei Shen, Lunxi Yuan, Dong-ming Yan

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) OPPO AI Center, OPPO Inc.(OPPO人工智能中心)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

AI总结 本文提出RefReward-SR,通过低分辨率参考意识奖励模型实现偏好对齐的超分辨率,利用多模态大语言模型评估语义一致性,构建首个大规模低分辨率条件偏好数据集,实验表明其在人类判断对齐方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏