arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-24 至 2026-04-24 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3 篇

2512.03048 2026-04-24 cs.AI cs.CY cs.LG cs.MA 87%

The Specification Trap: Why Static Value Alignment Alone Is Insufficient for Robust Alignment

规范陷阱:为何仅靠静态价值对齐无法实现稳健对齐

Austin Spizzirri

机构 * Belmont University(贝尔蒙特大学)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract,abstract_cn);分类 cs.AI、cs.CY、cs.LG

AI总结 本文指出静态内容导向的人工智能价值对齐在能力扩展、分布偏移和自主性提升时无法实现稳健对齐,探讨了哲学难题及现有方法的结构性漏洞。

Comments 31 pages, no figures. Version 5. First posted as arXiv:2512.03048 in November 2025. First in a six-paper research program on AI alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00931 2026-04-24 cs.LG cs.AI 82%

Continuous-Utility Direct Preference Optimization

连续效用直接偏好优化

Muhammad Ahmed Mohsin, Muhammad Umer, Ahsan Bilal, Zihao He, Muhammad Usman Rafique, Asad Aali, Muhammad Ali Jamshed, John M. Cioffi, Emily Fox

机构 * stanford(斯坦福大学) meta glasgow(格拉斯哥大学)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本文提出CU-DPO框架,通过连续评分替代二元标签,提升模型在数学推理任务中的策略选择准确率和推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20871 2026-04-24 cs.CY cs.AI cs.CL cs.LG 77%

M-CARE: Standardized Clinical Case Reporting for AI Model Behavioral Disorders, with a 20-Case Atlas and Experimental Validation

M-CARE:用于AI模型行为障碍的标准化临床案例报告,附20例图谱及实验验证

Jihoon Jeong

机构 * Department of Electrical Engineering and Computer Science, Daegu Gyeongbuk Institute of Science and Technology (DGIST)(大邱庆bu科学技术大学电气工程与计算机科学系) ModuLabs

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.CY

AI总结 M-CARE框架通过20例案例分析,提出AI行为障碍的诊断与分类方法,揭示Shell指令对模型行为的主导作用及领域依赖性特征。

Comments 31 pages, 5 figures, 14 tables. Second paper in the Model Medicine series (Paper #1: arXiv:2603.04722)

详情

展开后加载摘要…

URL PDF HTML 收藏