arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-27 至 2026-03-27 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 2 篇

2603.25145 2026-03-27 cs.CV cs.LG 83%

Learning to Rank Caption Chains for Video-Text Alignment

学习排名图注链以实现视频-文本对齐

Ansel Blume, Burak Uzkent, Shalini Chaudhuri, Garin Kessler

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon Prime Video(亚马逊Prime Video)

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.LG

AI总结 本文提出通过重复图注退化生成大规模挑战性图注链,改进视频-文本对齐的排名优化方法,优于二元DPO并在长形式内容生成中表现更优,需对视觉编码器进行微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24849 2026-03-27 cs.HC cs.AI cs.CV cs.CY 73%

Gaze patterns predict preference and confidence in pairwise AI image evaluation

注视模式预测成对AI图像评估中的偏好和信心

Nikolas Papadopoulos, Shreenithi Navaneethan, Sheng Bai, Ankur Samanta, Paul Sajda

机构 * Columbia University(哥伦比亚大学)

专题命中 偏好对齐 :RLHF(abstract);DPO(abstract);分类 cs.AI、cs.CY

AI总结 研究通过眼动追踪揭示成对AI图像评估中的偏好形成过程,发现注视模式能预测二元选择和信心,表明眼动数据能提供与偏好注释质量相关的隐含信号。

Comments This paper has been accepted to ACM ETRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏