arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-27 至 2026-02-27 共收录 8 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 8 篇

2602.22718 2026-02-27 cs.AI cs.DC 89%

RLHFless: Serverless Computing for Efficient RLHF

RLHFless:用于高效RLHF的无服务器计算

Rui Wei, Hanfei Yu, Shubham Jain, Yogarajan Sivakumar, Devesh Tiwari, Jian Li, Seung-Jong Park, Hao Wang

机构 * Stevens Institute of Technology Northeastern University Stony Brook University Missouri University of Science \& Technology

专题命中 后训练与偏好优化 :RLHF(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 RLHFless通过无服务器计算环境实现高效同步RLHF训练,预计算共享前缀并采用成本感知的演员扩展策略,提升训练速度并降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21189 2026-02-27 cs.LG cs.AI 88%

Why Pass@k Optimization Can Degrade Pass@1: Prompt Interference in LLM Post-training

为何Pass@k优化会损害Pass@1:LLM微调中的提示干扰

Anas Barakat, Souradip Chakraborty, Khushbu Pahwa, Amrit Singh Bedi

机构 * Singapore University of Technology and Design(新加坡科技设计大学) University of Maryland, College Park(马里兰大学学院公园分校) University of Central Florida(佛罗里达中央大学)

专题命中 后训练与偏好优化 :LLM(title);post-training(title);large language model(abstract);language model(abstract)

AI总结 该研究揭示了在LLM微调中,pass@k优化可能损害pass@1的原因,通过梯度冲突和提示干扰机制,提出了理论解释并验证了实验结果。

Comments updated related work discussion

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12522 2026-02-27 cs.CL cs.AI 88%

Evaluating the Diversity and Quality of LLM Generated Content

评估大型语言模型生成内容的多样性和质量

Alexander Shypula, Shuo Li, Botong Zhang, Vishakh Padmakumar, Kayo Yin, Osbert Bastani

机构 * University of Pennsylvania(宾夕法尼亚大学) New York University(纽约大学) UC Berkeley(伯克利大学)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出有效语义多样性测量框架,发现偏好微调模型在质量阈值下具有更高多样性,且小模型在固定预算内更高效生成独特内容。

Comments Published at COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21585 2026-02-27 cs.LG cs.AI cs.CL stat.ML 82%

Duel-Evolve: Reward-Free Test-Time Scaling via LLM Self-Preferences

Duel-Evolve:通过LLM自我偏好实现无奖励的测试时间扩展

Sweta Karlekar, Carolina Zheng, Magnus Saebo, Nicolas Beltran-Velez, Shuyang Yu, John Bowlan, Michal Kucer, David Blei

机构 * Columbia University(哥伦比亚大学) Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

专题命中 后训练与偏好优化 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Duel-Evolve通过LLM自我偏好实现无奖励的测试时间优化,提升MathBench和LiveCodeBench的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02088 2026-02-27 cs.CV cs.AI 79%

Dual-IPO: Dual-Iterative Preference Optimization for Text-to-Video Generation

Dual-IPO: 双迭代偏好优化用于文本到视频生成

Xiaomeng Yang, Mengping Yang, Jia Gong, Luozheng Qin, Zhiyu Tan, Hao Li

机构 * Fudan University(复旦大学) Shanghai Academy of AI for Science(上海人工智能科学研究院)

专题命中 后训练与偏好优化 :preference optimization(title);foundation model(abstract);分类 cs.AI

AI总结 Dual-IPO通过迭代优化奖励模型和视频生成模型,提升文本到视频生成的质量和人类偏好对齐,无需手动标注即可提高合成效果。

Comments To appear in ICLR 2026, GitHub Code: https://github.com/SAIS-FUXI/IPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16434 2026-02-27 cs.RO 78%

From Prompts to Printable Models: Support-Effective 3D Generation via Offset Direct Preference Optimization

从提示到可打印模型:通过偏移直接偏好优化实现支持有效的3D生成

Chenming Wu, Xiaofan Li, Chengkai Dai

机构 * Axiswise Ltd.(Axiswise有限公司) Centre for Perceptual and Interactive Intelligence(感知与交互智能中心)

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

AI总结 SEG通过偏移直接偏好优化实现支持有效的3D生成,显著减少支撑材料使用并提升打印可制造性。

Comments Accepted by IEEE Robotics and Automation Letters 2026, preprint version by authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22426 2026-02-27 cs.CV cs.LG 70%

SimpleOCR: Rendering Visualized Questions to Teach MLLMs to Read

SimpleOCR: 将可视化问题呈现以教导大语言模型阅读

Yibo Peng, Peng Xia, Ding Zhong, Kaide Zeng, Siwei Han, Yiyang Zhou, Jiaqi Liu, Ruiyi Zhang, Huaxiu Yao

机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校) Carnegie Mellon University(卡内基梅隆大学) University of Michigan(密歇根大学) Adobe Research(Adobe研究)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 SimpleOCR通过强制模型视觉参与,解决多模态大语言模型在图像中阅读文本的性能问题,提升模型的视觉文本提取能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22226 2026-02-27 cs.IR cs.LG 57%

SEGB: Self-Evolved Generative Bidding with Local Autoregressive Diffusion

SEGB: 自适应生成性竞价与局部自回归扩散

Yulong Gao, Wan Jiang, Mingzhe Cao, Xuepu Wang, Zeyu Pan, Haonan Yang, Ye Liu, Xin Yang

机构 * Beijing China(中国北京)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 SEGB通过自适应生成性竞价与局部自回归扩散,实现动态市场中的高效竞价策略,显著提升广告效果与商业价值。

详情

展开后加载摘要…

URL PDF HTML 收藏