arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-13 至 2026-04-13 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 5 篇

2604.08797 2026-04-13 cs.CL cs.AI 81%

Lessons Without Borders? Evaluating Cultural Alignment of LLMs Using Multilingual Story Moral Generation

国界之外的教训?利用多语言故事道德生成评估语言模型的文化契合度

Sophie Wu, Andrew Piper

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过多语言故事道德生成任务评估语言模型的文化契合度,发现前沿模型在道德生成上与人类响应相似但缺乏跨语言多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08757 2026-04-13 cs.CL cs.AI 81%

Cards Against LLMs: Benchmarking Humor Alignment in Large Language Models

卡牌对战大语言模型:大型语言模型幽默对齐的基准测试

Yousra Fettach, Guillaume Bied, Hannu Toivonen, Tijl De Bie

机构 * Ghent University(根特大学) University of Helsinki(赫尔辛基大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究通过让五种前沿语言模型与人类玩家玩卡牌对战游戏,评估大语言模型在幽默对齐方面的表现,发现模型在幽默判断上与人类偏好不一致,可能受系统性偏差影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08844 2026-04-13 cs.LG 77%

Spectral Geometry of LoRA Adapters Encodes Training Objective and Predicts Harmful Compliance

LoRA适配器的谱几何编码了训练目标并预测了有害合规性

Roi Paul

机构 * Independent Researcher(独立研究员)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);harmlessness(abstract);分类 cs.LG

AI总结 研究LoRA适配器的谱几何能否识别语言模型的微调目标,并预测下游行为危害。通过实验发现,LoRA权重空间几何能反映训练目标和危害合规性,但跨方法监控需单独校准。

Comments 15 pages, 8 figures, pre-registered experiment, data at https://github.com/roip/task-geometry-experiment-results

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18600 2026-04-13 cs.CV cs.AI cs.LG 76%

Chain-of-Zoom: Extreme Super-Resolution via Scale Autoregression and Preference Alignment

链式放大:通过尺度自回归和偏好对齐实现极端超分辨率

Bryan Sangwoo Kim, Jeongsol Kim, Jong Chul Ye

机构 * KAIST AI(韩国科学技术院人工智能系)

专题命中 偏好对齐 :alignment(title);分类 cs.AI、cs.LG

AI总结 本文提出Chain-of-Zoom框架,通过自回归链和多尺度提示实现极端超分辨率,利用GRPO优化文本提示对齐人类偏好,实验显示标准4x扩散模型在CoZ下可实现256倍以上高质量放大。

Comments NeurIPS 2025 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08723 2026-04-13 cs.CL cs.AI 62%

Decomposing the Delta: What Do Models Actually Learn from Preference Pairs?

分解Delta:模型实际上从偏好对中学习了什么?

Chia-Hsuan Lee, Mingyang Zhou, Renkun Ni, Zelei Cheng, Sihui Dai, Supriyo Chakraborty, Shixiong Zhang, Sambit Sahu, William Campbell

机构 * Capital One(第一资本)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨偏好对中生成器级和样本级Delta对推理性能的影响,发现提高生成器级Delta能提升跨领域推理性能,利用样本级Delta可提高训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏