arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-27 至 2026-04-27 共收录 4 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4 篇

2604.22504 2026-04-27 cs.IR 91%

Objective Shaping with Hard Negatives: Windowed Partial AUC Optimization for RL-based LLM Recommenders

通过硬负样本进行目标塑造:基于RL的LLM推荐系统中的窗口化部分AUC优化

Wentao Shi, Qifan Wang, Chen Chen, Fei Liu, Dongfang Liu, Xu Liu, Wanli Ma, Junfeng Pan, Linhong Zhu, Fuli Feng

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出窗口化部分AUC优化方法,通过约束假阳性率提升与Top-K指标的一致性,改进基于RL的LLM推荐系统性能。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22542 2026-04-27 cs.CL cs.AI 91%

Controllable Spoken Dialogue Generation: An LLM-Driven Grading System for K-12 Non-Native English Learners

可控的口语对话生成:一种基于LLM的评分系统用于K-12非母语英语学习者

Haidong Yuan, Haokun Zhao, Wanshi Xu, Songjun Cao, Qingyu Zhou, Long Ma, Hongjie Fan

机构 * Peking University(北京大学) Tencent(腾讯) China University of Political Science and Law(中国政法大学) Independent Researcher(独立研究者) Fudan University(复旦大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于LLM的评分系统,通过四级分级系统控制词汇复杂度,提升非母语K-12英语学习者的口语对话质量与教学价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22630 2026-04-27 cs.CL cs.AI cs.LG 82%

StateX: Enhancing RNN Recall via Post-training State Expansion

StateX:通过后训练状态扩展增强RNN回忆能力

Xingyu Shen, Yingfa Chen, Zhen Leng Thai, Xu Han, Zhiyuan Liu, Maosong Sun

机构 * Department of Science and Technology, Tsinghua University(清华大学科学技术部)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 StateX通过后训练方法扩展RNN状态,提升长上下文回忆与上下文学习性能,无需显著增加参数量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22519 2026-04-27 cs.RO 67%

Clutter-Robust Vision-Language-Action Models through Object-Centric and Geometry Grounding

通过对象中心和几何约束实现抗杂波的视觉-语言-动作模型

Khoa Vo, Taisei Hanyu, Yuki Ikebe, Trong Thang Pham, Nhat Chung, Minh Nhat Vu, Duy Nguyen Ho Minh, Anh Nguyen, Anthony Gunderman, Chase Rainwater, Ngan Le

机构 * University of Arkansas(阿拉巴马大学) National University of Singapore(新加坡国立大学) TU Wien(维也纳技术大学) Max Planck Research School for Intelligent Systems(智能系统马克斯·普朗克研究学校) University of Stuttgart(斯图加特大学) University of Liverpool(利物浦大学)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract)

AI总结 本文提出OBEYED-VLA框架,通过分离感知接地与动作推理提升视觉-语言-动作模型在现实环境中的鲁棒性,特别是在存在干扰物、目标缺失和背景变化等挑战性场景中表现优异。

Comments Under review. Project website: https://uark-aicv.github.io/OBEYED_VLA

详情

展开后加载摘要…

URL PDF HTML 收藏