arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-13 至 2026-04-13 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 7 篇

2604.08757 2026-04-13 cs.CL cs.AI 90%

Cards Against LLMs: Benchmarking Humor Alignment in Large Language Models

卡牌对战大语言模型:大型语言模型幽默对齐的基准测试

Yousra Fettach, Guillaume Bied, Hannu Toivonen, Tijl De Bie

机构 * Ghent University(根特大学) University of Helsinki(赫尔辛基大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过让五种前沿语言模型与人类玩家玩卡牌对战游戏,评估大语言模型在幽默对齐方面的表现,发现模型在幽默判断上与人类偏好不一致,可能受系统性偏差影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04256 2026-04-13 cs.CL 81%

SSPO: Subsentence-level Policy Optimization

SSPO:子短语级策略优化

Kun Yang, Zikang chen, Yanmeng Wang, Zhigen Li, Ning Cheng, Shaojun Wang, Jing Xiao

机构 * Ping An Technology(平安科技) TJUNLP Lab, Tianjin University(天津大学TJUNLP实验室)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 SSPO在子短语层面计算重要性比率,平衡GRPO与GSPO的优劣,缓解训练崩溃和方差问题,同时避免整个响应被保留导致的不稳定更新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09515 2026-04-13 cs.SE 80%

When LLMs Lag Behind: Knowledge Conflicts from Evolving APIs in Code Generation

当LLM落后时:来自演进API的代码生成中的知识冲突

Ahmed Nusayer Ashik, Shaowei Wang, Tse-Hsun Chen, Muhammad Asaduzzaman, Yuan Tian

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文研究了API演变对LLM代码生成的影响,发现缺乏全面文档时LLM难以优先处理外部上下文,执行率仅42.55%,而结构化文档和大模型规模可提升至66.36%,但推理策略如Self-Reflection可进一步提升11%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08723 2026-04-13 cs.CL cs.AI 79%

Decomposing the Delta: What Do Models Actually Learn from Preference Pairs?

分解Delta:模型实际上从偏好对中学习了什么?

Chia-Hsuan Lee, Mingyang Zhou, Renkun Ni, Zelei Cheng, Sihui Dai, Supriyo Chakraborty, Shixiong Zhang, Sambit Sahu, William Campbell

机构 * Capital One(第一资本)

专题命中 后训练与偏好优化 :LLM(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨偏好对中生成器级和样本级Delta对推理性能的影响,发现提高生成器级Delta能提升跨领域推理性能,利用样本级Delta可提高训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18600 2026-04-13 cs.CV cs.AI cs.LG 62%

Chain-of-Zoom: Extreme Super-Resolution via Scale Autoregression and Preference Alignment

链式放大:通过尺度自回归和偏好对齐实现极端超分辨率

Bryan Sangwoo Kim, Jeongsol Kim, Jong Chul Ye

机构 * KAIST AI(韩国科学技术院人工智能系)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Chain-of-Zoom框架,通过自回归链和多尺度提示实现极端超分辨率,利用GRPO优化文本提示对齐人类偏好,实验显示标准4x扩散模型在CoZ下可实现256倍以上高质量放大。

Comments NeurIPS 2025 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09386 2026-04-13 cs.CV 50%

Region-Constrained Group Relative Policy Optimization for Flow-Based Image Editing

区域约束的群相对策略优化用于基于流的图像编辑

Zhuohan Ouyang, Zhe Qian, Wenhuo Cui, Chaoqun Wang

机构 * South China Normal University(华南师范大学) South China Agricultural University(华南农业大学) Monash University(莫纳什大学)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文提出RC-GRPO-Editing框架,通过区域约束的GRPO后训练提升流基图像编辑中目标区域指令遵循和非目标区域保留。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22437 2026-04-13 cs.CV 50%

EmoCtrl: Controllable Emotional Image Content Generation

EmoCtrl:可控的情感图像内容生成

Jingyuan Yang, Weibin Luo, Hui Huang

机构 * CSSE, Shenzhen University(深圳大学计算机科学与软件工程学院)

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 EmoCtrl通过结合内容描述与目标情绪生成图像,实现内容忠实与情绪表达的平衡,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏