arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-18 至 2026-05-18 共收录 20 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 20 篇

2603.04459 2026-05-18 cs.CR cs.AI cs.SE 85%

Benchmark of Benchmarks: Unpacking Influence and Code Repository Quality in LLM Safety Benchmarks

基准的基准:解构影响与代码仓库质量在LLM安全基准中的作用

Junjie Chu, Xinyue Shen, Ye Leng, Michael Backes, Yun Shen, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全研究中心) University of Waterloo(滑铁卢大学) Flexera(Flexera公司)

专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);prompt injection(abstract);分类 cs.AI

AI总结 本文通过系统研究31个LLM安全基准及382篇非基准论文,发现仅39%的基准仓库可直接运行,且缺乏伦理考量。研究揭示社区采用基准与作者声望和代码运行性相关,但与代码质量无关,指出安全基准可能存在安全隐患和不可比性问题。

Comments 24 pages. 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21251 2026-05-18 cs.LG cs.AI 84%

CAP: Controllable Alignment Prompting for Unlearning in LLMs

CAP:用于大语言模型中去学习的可控对齐提示

Zhaokun Wang, Jinyu Guo, Jingwen Pu, Hongli Pu, Meng Yang, Xunlei Chen, Jie Ou, Wenyi Li, Guangchun Luo, Wenhong Tian

机构 * School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件学院)

专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CAP框架,通过强化学习将去学习过程转化为可学习的提示优化,实现可控的去学习,无需更新模型参数,解决了现有方法的计算成本高、遗忘边界不可控等问题。

Comments Accpeted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17915 2026-05-18 cs.CL cs.AI 84%

IndicSafe: A Benchmark for Evaluating Multilingual LLM Safety in South Asia

IndicSafe:评估南亚多语言大语言模型安全性的基准

Priyaranjan Pattnayak, Sanchari Chowdhuri

机构 * Oracle America Inc.(Oracle美洲公司)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出IndicSafe基准,评估12种南亚语言中LLM的安全性,发现跨语言一致性仅12.8%,安全率波动超17%,揭示多语言LLM安全泛化缺口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06390 2026-05-18 cs.AI 83%

Automated alignment is harder than you think

自动化对齐比你想象的更困难

Aleksandr Bowkis, Marie Davidsen Buhl, Jacob Pfau, Geoffrey Irving

机构 * AI Security Institute(人工智能安全研究所)

专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.AI

AI总结 论文指出,即使研究代理不故意破坏对齐工作,自动化对齐研究也可能导致误导性的安全评估,因模糊任务难以监督且人类判断有误。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10100 2026-05-18 cs.AI 79%

Robust AI Security and Alignment: A Sisyphean Endeavor?

稳健的AI安全与对齐:一项西西弗斯式的努力?

Apostol Vassilev

机构 * CSD/ITL(计算机科学与技术实验室)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本文通过扩展哥德尔不完全性定理,探讨了AI安全与对齐的理论极限,并提出应对挑战的实践方法,揭示了AI系统认知推理的局限性。

Comments 17 pages, 1 figure. This version will appear in IEEE Security $ Privacy in June 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19115 2026-05-18 cs.AI cs.CY 79%

AI Consciousness and Existential Risk

人工智能意识与存在风险

Rufin VanRullen

机构 * Frontier AI companies(前沿AI公司) independent foundations(独立基金会)

专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY

AI总结 本文探讨人工智能意识与存在风险的区别,指出意识并非直接预测存在风险,但可能在某些情况下影响风险,强调区分两者对AI安全研究的重要性。

Comments Updated for clarity and completeness following peer-review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14087 2026-05-18 cs.CL cs.LG 73%

Measuring and Mitigating Toxicity in Large Language Models: A Comprehensive Replication Study

对大语言模型毒性进行测量与缓解:一项全面的复制研究

Mokshit Surana, Archit Rathod, Akshaj Satishkumar

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.LG

AI总结 本文通过复制研究评估DExperts在缓解显性毒性中的有效性,发现其在显性毒性基准上安全性接近完美,但对隐性仇恨言论存在脆性,并引入了10倍的延迟惩罚。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16198 2026-05-18 cs.AI cs.CY cs.LG cs.LO 67%

Formal Methods Meet LLMs: Auditing, Monitoring, and Intervention for Compliance of Advanced AI Systems

形式方法与大语言模型交汇:面向高级AI系统合规性的审计、监控与干预

Parand A. Alamdari, Toryn Q. Klassen, Sheila A. McIlraith

机构 * University of Toronto, Vector Institute(多伦多大学,向量研究所)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文提出结合形式方法与机器学习的审计和监控技术,用于检测AI系统中时间扩展行为约束的违规,实验表明其在检测违规方面优于LLM基方法,且能有效降低LLM代理的违规率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24366 2026-05-18 cs.IR 67%

On the Factual Consistency of Text-based Explainable Recommendation Models

基于文本的可解释推荐模型的事实一致性研究

Ben Kabongo, Vincent Guigue

专题命中 安全评测 :alignment(abstract);trustworthy(abstract)

AI总结 本文研究基于文本的可解释推荐模型的事实一致性,提出评估框架和指标,发现尽管模型在语义相似度上表现良好,但事实一致性指标表现不佳,凸显了事实意识评估的重要性。

Comments 13 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21173 2026-05-18 cs.CV cs.AI cs.LG 62%

Less Precise Can Be More Reliable: A Systematic Evaluation of Quantization's Impact on VLMs Beyond Accuracy

精度降低可能更可靠:对VLMs量化影响的系统评估

Aymen Bouguerra, Daniel Montoya, Alexandra Gomez-Villa, Chokri Mraidha, Fabio Arnez

机构 * Computer Vision Center(计算机视觉中心)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文系统评估了量化对VLMs可靠性的影响,发现量化能提升准确率、校准、异常检测和抗噪能力,但不改善协变量偏移或虚假相关性。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15680 2026-05-18 cs.CL cs.LG q-bio.QM 62%

Few-Shot Large Language Models for Actionable Triage Categorization of Online Patient Inquiries

少样本大语言模型在在线患者咨询可操作分诊中的应用

Liqi Zhou, Jiafu Li

机构 * seas.upenn.edu(宾夕法尼亚大学塞as学院)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.LG

AI总结 本文研究少样本条件下大语言模型在在线患者咨询分诊中的应用,通过构建不同数据集比较TF-IDF和BioBERT与六个LLM在0-shot、4-shot和12-shot条件下的表现,发现Claude Haiku 4.5在12-shot条件下达到0.475的宏F1值,优于监督基线模型。

Comments 4 figures, 19 tables, 23 pages (including appendix and reference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08464 2026-05-18 cs.LG 57%

The Geometric Structure of Models Learning Sparse Data

学习稀疏数据的模型几何结构

Thomas Walker, T. Mitchell Roddenberry, Ahmed Imtiaz Humayun, Randall Balestriero, Richard Baraniuk

机构 * Rice University(里士大学) Brown University(布朗大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文研究了在稀疏条件下模型通过局部几何结构实现成功学习的机制,提出正常对齐概念,并引入GrokAlign正则化策略提升深度网络训练效率,同时改进递归特征机以增强对抗鲁棒性。

Comments 27 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15736 2026-05-18 cs.CV cs.AI 57%

BiomedAP: A Vision-Informed Dual-Anchor Framework with Gated Cross-Modal Fusion for Robust Medical Vision-Language Adaptation

BiomedAP: 一种基于视觉的双锚框架与门控跨模态融合用于鲁棒的医学视觉-语言适应

Huanyang Tong, Kai Liu, Fangjun Kuang, Huiling Chen

机构 * Wenzhou University(温州大学) Wenzhou Business College(温州商务学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 BiomedAP通过门控跨模态融合和双锚约束机制,提升医学视觉-语言模型在提示变化下的鲁棒性,实验显示其在多个基准上均优于基线方法。

Comments CVPR2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15589 2026-05-18 cs.CL 57%

MHGraphBench: Knowledge Graph-Grounded Benchmarking of Mental Health Knowledge in Large Language Models

MHGraphBench: 用于评估大语言模型中心理健康知识的图知识基准

Weixin Liu, Congning Ni, Shelagh A. Mulvaney, Susannah L. Rose, Murat Kantarcioglu, Bradley A. Malin, Zhijun Yin

机构 * Vanderbilt University(范德比大学) Vanderbilt University Medical Center(范德比大学医学院) Virginia Tech(弗吉尼亚理工学院)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文提出MHGraphBench基准,评估大语言模型在心理健康实体识别、关系判断及双跳推理能力,发现模型在实体类型识别和小关系类型判断上表现优异,但在关系预测和双跳推理上仍有不足,且输出格式可靠性对性能有显著影响。

Comments Accepted to GEM 2026, ACL 2026 Workshop; 9 pages main text plus references and appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15473 2026-05-18 cs.CY 57%

Validated Hypotheses as a Lens for Human-Likeness Evaluation in AI Agents

以验证假设为视角评估AI代理的人性化程度

Xuan Liu, HaoYang Shang, Zizhang Liu, Yuanjun Feng, Guankai Zhai, Yunze Xiao, Yiwen Tu, Haojian Jin

专题命中 安全评测 :alignment(abstract);分类 cs.CY

AI总结 本文提出利用验证过的行为假设作为评估AI代理人性化的视角,通过HumanStudy-Bench平台对12个研究进行评估,发现代理响应在完全复制与彻底失败间极化,代理设计比模型规模对齐影响更大但效果非单调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15235 2026-05-18 cs.LG 57%

MuteBench: Modality Unavailability Tolerance Evaluation for Incomplete Multimodal Fusion

MuteBench: 多模态融合不完整性容忍性评估

Wugeng Zheng, Ziwen Kan, Tianlong Chen, Chen Chen, Song Wang

机构 * University of Central Florida(中央佛罗里达大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 MuteBench评估多模态融合在模态缺失和内模态缺失下的鲁棒性,发现架构类型是预测鲁棒性的最强因素,且通道独立模型对模态缺失容忍性高但对内模态缺失敏感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15918 2026-05-18 q-bio.QM 50%

The Impact of Heatwaves on Population Health: A Large Language Model-Enhanced Agent-Based Simulation

热浪对人口健康的影响:一种增强型大语言模型的群体模拟

Yuanhao Liu, Yuanfei Liu, Tian Lu, Hengyang Zhang, Zuowei Wang, Ying Dai

专题命中 安全评测 :safety(abstract)

AI总结 本文通过增强型大语言模型进行群体模拟,研究热浪对人口健康的影响,发现心理社会因素在社区韧性中的作用,并提出针对脆弱群体的干预措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15792 2026-05-18 cs.CV 50%

Reversing the Flow: Generation-to-Understanding Synergy in Large Multimodal Models

反向流动:大型多模态模型中的生成到理解协同效应

Yujun Tong, Dongliang Chang, Zijin Yin, Xintong Liu, Yuanchen Fang, Zhanyu Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Beijing Key Laboratory of Multimodal Data Intelligent Perception and Governance(北京多模态数据智能感知与治理重点实验室)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出生成到理解协同效应,通过生成过程作为中间推理步骤提升多模态理解,揭示生成与理解的双向关系及模型自我反思的不足。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14852 2026-05-18 cs.SE 50%

UntrustVul: An Automated Approach for Identifying Untrustworthy Alerts in Vulnerability Detection Models

UntrustVul: 一种自动识别漏洞检测模型中不可信警报的方法

Lam Nguyen Tung, Xiaoning Du, Neelofar Neelofar, Aldeida Aleti

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出UntrustVul方法,通过识别与漏洞无关的代码行来自动检测不可信的漏洞预测,实验表明其在AUC和F1-score上优于现有方法。

Comments Preprints, Accepted to IEEE Transactions on Software Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15654 2026-05-18 cs.RO 50%

PCASim: Promptable Closed-loop Adversarial Simulation for Urban Traffic Environment

PCASim:可提示的闭环对抗模拟用于城市交通环境

Chuancheng Zhang, Zhenhao Wang, Kaizheng Li, Yaran Lin, Qiang Guo, Bin Jiang

机构 * Shenzhen Research Institute of Shandong University(山东大学深圳研究院) School of Airspace Science and Engineering(空天科学与工程学院) School of Computer Science and Technology(计算机科学与技术学院)

专题命中 安全评测 :safety(abstract)

AI总结 本文提出PCASim框架,通过结合对抗场景生成与安全代理训练,提升城市交通环境中的安全性和鲁棒性,实验表明其在领域特定语言生成准确率、场景转换成功率和避障能力方面均有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏