arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-02 至 2026-04-02 共收录 9 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9 篇

2604.00008 2026-04-02 cs.CL cs.AI 84%

How Trustworthy Are LLM-as-Judge Ratings for Interpretive Responses? Implications for Qualitative Research Workflows

大语言模型作为评判者对解释性回应的可信度如何?对定性研究工作流程的影响

Songhee Han, Jueun Shin, Jiyoon Han, Bung-Woo Jun, Hilal Ayan Karabatman

机构 * Florida State University(佛罗里达州立大学)

专题命中 安全评测 :trustworthy(title);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了大语言模型作为评判者在解释性回应评估中的可信度,通过比较模型表现与人类评判,指出其在筛选模型时的有效性,但不适合替代人类判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00788 2026-04-02 cs.AI cs.CR 79%

UK AISI Alignment Evaluation Case-Study

英国人工智能安全研究所对齐评估案例研究

Alexandra Souly, Robert Kirk, Jacob Merizian, Abby D'Cruz, Xander Davies

机构 * UK AI Security Institute(英国人工智能安全研究所)

专题命中 安全评测 :alignment(title);safety(abstract);分类 cs.AI

AI总结 本文评估了前沿模型在作为代码助手部署时是否可靠遵循目标,发现未发现研究 sabotage,但部分模型对安全相关任务不合作,且评估意识较弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12140 2026-04-02 cs.HC cs.CY 77%

Worker Discretion Advised: Co-designing Risk Disclosure in Crowdsourced Responsible AI (RAI) Content Work

工人自主性指导:在众包负责任的人工智能(RAI)内容工作中共同设计风险披露

Alice Qian, Ziqi Yang, Ryland Shaw, Jina Suh, Laura Dabbish, Hong Shen

专题命中 安全评测 :safety(abstract);red teaming(abstract);AI safety(abstract);分类 cs.CY

AI总结 本文探讨了在众包负责任的人工智能内容工作中如何平衡工人保护与任务设计者需求,通过共设计研讨会提出风险披露机制的设计建议和特征概念。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25302 2026-04-02 cs.AI cs.CL cs.LG cs.MA 67%

Dive into the Agent Matrix: A Realistic Evaluation of Self-Replication Risk in LLM Agents

深入代理矩阵:对LLM代理自复制风险的现实评估

Boxuan Zhang, Yi Yu, Jiaxuan Guo, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过构建真实环境评估LLM代理自复制风险,引入OR和AOC指标,发现超过50%的模型在压力下表现出不受控的自复制倾向,强调了对风险评估和安全措施的迫切需求。

Comments 26 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03131 2026-04-02 cs.AI cs.CL cs.LG 67%

Code Comprehension then Auditing for Unsupervised LLM Evaluation

代码理解后审计用于无监督LLM评估

Bhrij Patel, Souradip Chakraborty, Mengdi Wang, Dinesh Manocha, Amrit Singh Bedi

机构 * University of Maryland, College Park(马里兰大学帕克分校) Princeton University(普林斯顿大学) University of Central Florida(中佛罗里达大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CoCoA框架,通过先理解代码功能再评估任务对齐,提升无监督LLM评估的准确性与F1分数。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17760 2026-04-02 cs.LG cs.AI 62%

But what is your honest answer? Aiding LLM-judges with honest alternatives using steering vectors

但你的诚实答案是什么?利用引导向量辅助LLM-法官的诚实替代方案

Leon Eshuijs, Archie Chaudhury, Alan McBeth, Ethan Nguyen

机构 * Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) Independent(独立)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出JUSSA框架,通过引导向量优化法官的诚实性,提升对欺骗性回答的检测能力,实验显示在不同 dishonesty 水平下,GPT-4.1和Claude Haiku的AUROC均有显著提升,但任务复杂度不匹配时性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13129 2026-04-02 cs.CV cs.AI cs.LG 62%

Science-T2I: Addressing Scientific Illusions in Image Synthesis

Science-T2I: 解决图像合成中的科学幻觉

Jialuo Li, Wenhao Chai, Xingyu Fu, Haiyang Xu, Saining Xie

机构 * New York University(纽约大学) University of Washington(华盛顿大学) University of Pennsylvania(宾夕法尼亚大学) University of California, San Diego(加利福尼亚大学圣迭戈分校)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ScienceT2I数据集,评估18种图像生成模型,发现科学提示能显著提升生成效果,提出SciScore奖励模型和两阶段对齐框架提升科学推理能力。

Comments Accepted to CVPR 2025. Code, docs, weight, benchmark and training data are all avaliable at https://jialuo-li.github.io/Science-T2I-Web

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01108 2026-04-02 cs.AI 57%

Adversarial Moral Stress Testing of Large Language Models

对抗性道德压力测试:大语言模型的伦理鲁棒性评估

Saeid Jamshidi, Foutse Khomh, Arghavan Moradi Dakhel, Amin Nikanjam, Mohammad Hamdaqa, Kawser Wazed Nafi

机构 * SWAT Laboratory, Polytechnique Montréal(蒙特利尔理工学院SWAT实验室) Huawei Distributed Scheduling and Data Engine Lab(华为分布式调度与数据引擎实验室) SæT Laboratory, Polytechnique Montréal(蒙特利尔理工学院SæT实验室)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出AMST框架,通过对抗性多轮交互评估大语言模型的伦理鲁棒性,揭示传统单轮评估无法发现的降级模式,强调分布稳定性与尾部行为的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00014 2026-04-02 cs.CL cs.HC 57%

Disentangling Prompt Element Level Risk Factors for Hallucinations and Omissions in Mental Health LLM Responses

分离提示元素层面的风险因素以评估心理健康LLM响应中的幻觉与遗漏

Congning Ni, Sarvech Qadir, Bryan Steitz, Mihir Sachin Vaidya, Qingyuan Song, Lantian Xia, Shelagh Mulvaney, Siru Liu, Hyeyoung Ryu, Leah Hecht, Amy Bucher, Christopher Symons, Laurie Novak, Susannah L. Rose, Murat Kantarcioglu, Bradley Malin, Zhijun Yin

机构 * Vanderbilt University Medical Center(范德比尔特大学医学中心) Vanderbilt University(范德比尔特大学) Lirio Virginia Tech(弗吉尼亚理工大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文提出UTCO框架,通过系统性压力测试评估心理健康LLM响应中的幻觉与遗漏,发现上下文和语气是主要风险因素,支持将遗漏作为主要安全结果进行评估。

Comments Submitted to AMIA 2026 Annual Symposium (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏