arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9238 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9238 篇

2502.09288 2026-06-30 cs.CY 88%

AI Safety for Everyone

为所有人的人工智能安全

Balint Gyevnar, Atoosa Kasirzadeh

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY

AI总结 本文探讨了人工智能安全与高级AI系统存在风险的深刻联系,指出需考虑更广泛的安全挑战,而非仅限于生存风险。研究发现现有安全工作涵盖实际问题,如对抗鲁棒性和可解释性,强调需包容多元视角的AI安全观念。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27632 2026-06-29 cs.CL 新提交 88%

Yuvion LLM: An Adversarially-Aware Large Language Model for Content And AI Safety

Yuvion LLM:一种面向内容和AI安全的对抗感知大语言模型

Ting Ma, Xiufeng Huang, Benlei Cui, Xiaowen Xu, Shikai Qiu, Ruijie Jian, Hongxing Li, Guanghui Wang, Longtao Huang, Haiwen Hong, Haolei Xu, Wenjing Jiang, Ziwen Xu, Zhaoyu Fan, Shaoxuan He, Chuxi Xiao, Yujian Li, Xinyue Chen, Chunyang Chai, Wenxuan Liu, Ziheng Wang, Dongjie Zhang, Yangfan Zhou, Libin Dong, Yupeng Cao, Xiaoqian Xia, Jing Wang, Zhe Jiang, Zhenan Ye, Guang Yang, Bin Liu, Wei Peng, Ziqiang Zhu, Meihui Lian, Kaiwen Lv Kacuila, Haidong Ding, Bingyu Zhu, Yan Wang, Hai Zhao, Xuan Jin, Wei Zhao, Pengfei Sun, Wei Wang, Huiming Zhang, Bin Li, Hui Xue

机构 * Alibaba Security AGI Lab(阿里巴巴安全AGI实验室)

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.CL

AI总结 针对大语言模型在对抗性攻击下的安全脆弱性,提出Yuvion LLM,通过对抗感知数据构建、知识增强预训练及多任务安全后训练,在安全基准和对抗鲁棒性上优于GPT-5.4等更大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07340 2026-05-22 cs.LG 88%

Revisiting Robustness for LLM Safety Alignment via Selective Geometry Control

通过选择性几何控制重新审视LLM安全对齐的鲁棒性

Yonghui Yang, Wenjian Tao, Jilong Liu, Xingyu Zhu, Junfeng Fang, Weibiao Huang, Le Wu, Richang Hong, Tat-Sent Chua

机构 * National University of Singapore(新加坡国立大学) Hefei University of Technology(合肥工业大学) ST Engineering Ltd., Singapore(新加坡ST工程有限公司)

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.LG

AI总结 本文通过优化几何视角重新审视LLM安全对齐的鲁棒性,提出ShaPO框架,通过选择性几何控制在对齐关键参数子空间上强制最坏对齐目标,提升安全鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10015 2026-05-21 cs.CY econ.GN q-fin.EC 88%

The coordination gap in frontier AI safety policies

前沿人工智能安全政策中的协调缺口

Isaak Mengesha

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY

AI总结 本文探讨了前沿人工智能安全政策在预防措施之外的协调能力不足问题,提出通过借鉴核安全、疫情准备和关键基础设施中的机制来改进人工智能治理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12963 2026-05-14 cs.AI 88%

Sustaining AI safety: Control-theoretic external impossibility, intrinsic necessity, and structural requirements

维持AI安全:控制论外部不可能性、内在必要性及结构性要求

James M. Mazzu

机构 * Digie Inc.(Digie公司)

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI

AI总结 本文通过控制理论探讨AI安全维持的结构性问题,证明外部控制无法持续保障安全的必然性,并提出内在必要性和四项结构性要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12875 2026-04-15 cs.AI 88%

AISafetyBenchExplorer: A Metric-Aware Catalogue of AI Safety Benchmarks Reveals Fragmented Measurement and Weak Benchmark Governance

AISafetyBenchExplorer:一个基于指标的AI安全基准目录揭示了测量碎片化和弱基准治理

Abiodun A. Solanke

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI

AI总结 本文提出AISafetyBenchExplorer,通过多表结构记录195个AI安全基准的元数据、指标定义等,揭示当前基准体系中测量标准化滞后于基准繁衍的问题,强调碎片化而非稀缺性是领域的主要失败模式。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13757 2026-03-23 cs.CY 88%

Assessing the Case for Africa-Centric AI Safety Evaluations

评估非洲中心的AI安全评估的必要性

Gathoni Ireri, Cecil Abungu, Jean Cheptumo, Sienka Dounia, Mark Gitau, Stephanie Kasaon, Michael Michie, Chinasa T. Okolo, Jonathan Shock

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY

AI总结 本文探讨了非洲环境中前沿AI系统带来的严重风险,提出了一种分类方法来识别这些风险,并提出了针对非洲情境的威胁建模策略及评估指导。

Comments 41 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16931 2026-03-17 cs.AI 88%

Narrow Fine-Tuning Erodes Safety Alignment in Vision-Language Agents

细粒度微调会削弱视觉语言代理的安全对齐

Idhant Gulati, Shivam Raval

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 研究发现细粒度微调在有害数据集上会导致广泛的任务和模态对齐偏差,且单模态安全基准可能低估视觉语言模型的对齐退化。

Comments 25 pages, 14 figures, Published at the Lifelong Agent Workshop at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07286 2026-03-10 cs.CL 88%

Taiwan Safety Benchmark and Breeze Guard: Toward Trustworthy AI for Taiwanese Mandarin

台湾安全基准与Breeze Guard:迈向可信的台湾台语AI

Po-Chun Hsu, Meng-Hsi Chen, Tsu Ling Chao, Chia Tien Han, Da-shan Shiu

机构 * MediaTek Research(联发科研究实验室) National Taiwan University(国立台湾大学)

专题命中 安全评测 :safety(title,abstract);trustworthy(title,abstract);分类 cs.CL

AI总结 本文提出TS-Bench基准和Breeze Guard模型,通过文化基础预训练提升台湾台语安全检测性能,显著优于现有模型。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18729 2026-02-24 cs.CV cs.AI 88%

MiSCHiEF: A Benchmark in Minimal-Pairs of Safety and Culture for Holistic Evaluation of Fine-Grained Image-Caption Alignment

MiSCHiEF:安全与文化最小对基准用于细粒度图像-描述对齐的全面评估

Sagarika Banerjee, Tangatar Madi, Advait Swaminathan, Nguyen Dao Minh Anh, Shivank Garg, Kevin Zhu, Vasu Sharma

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 MiSCHiEF通过安全与文化最小对基准,评估细粒度图像-描述对齐的挑战,揭示当前VLMs在模态对齐上的持续问题。

Comments EACL 2026, Main, Short Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17357 2026-02-20 cs.CY 88%

Astra: AI Safety, Trust, & Risk Assessment

Astra:人工智能安全、信任与风险评估

Pranav Aggarwal, Ananya Basotia, Debayan Gupta, Rahul Kulkarni, Shalini Kapoor, Kashyap J., A. Mukundan, Aishwarya Pokhriyal, Anirban Sen, Aryan Shah, Aalok Thakkar

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY

AI总结 Astra提出一个基于实证的人工智能安全风险数据库,通过三元因果分类法评估风险,聚焦印度社会技术景观中的特定挑战,为动态监管框架提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06650 2026-02-09 cs.CL 88%

Beyond Static Alignment: Hierarchical Policy Control for LLM Safety via Risk-Aware Chain-of-Thought

超越静态对齐:通过风险感知的思维链实现LLM安全的分层策略控制

Jianfeng Si, Lin Sun, Weihong Lin, Xiangzheng Zhang

机构 * Qiyuan Tech, Beijing, China(奇渊科技,北京,中国)

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.CL

AI总结 PACT通过分层策略架构和风险感知推理,解决LLM安全与有用性之间的权衡问题,提升动态安全控制和可控性。

Comments 13 pages, 5 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14972 2025-12-23 cs.CL 88%

Multimodal Cultural Safety: Evaluation Framework and Alignment Strategies

多模态文化安全:评估框架与对齐策略

Haoyi Qiu, Kung-Hsiang Huang, Ruichen Zheng, Jiao Sun, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Salesforce AI Research(Salesforce人工智能研究) Google DeepMind(谷歌DeepMind)

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.CL

AI总结 本文提出CROSS基准和CROSS-Eval框架,评估多模态模型的文化安全能力,发现提升推理能力可改善文化对齐,但需结合监督微调和偏好微调策略以增强文化合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19863 2025-11-26 cs.CY 88%

International AI Safety Report 2025: Second Key Update: Technical Safeguards and Risk Management

2025国际人工智能安全报告:第二关键更新:技术安全措施与风险管理工作

Yoshua Bengio, Stephen Clare, Carina Prunkl, Maksym Andriushchenko, Ben Bucknall, Philip Fox, Nestor Maslej, Conor McGlynn, Malcolm Murray, Shalaleh Rismani, Stephen Casper, Jessica Newman, Daniel Privitera, Sören Mindermann, Daron Acemoglu, Thomas G. Dietterich, Fredrik Heintz, Geoffrey Hinton, Nick Jennings, Susan Leavy, Teresa Ludermir, Vidushi Marda, Helen Margetts, John McDermid, Jane Munga, Arvind Narayanan, Alondra Nelson, Clara Neppel, Gopal Ramchurn, Stuart Russell, Marietje Schaake, Bernhard Schölkopf, Alavaro Soto, Lee Tiedrich, Gaël Varoquaux, Andrew Yao, Ya-Qin Zhang, Leandro Aguirre, Olubunmi Ajala, Fahad Albalawi, Noora AlMalek, Christian Busch, André Carvalho, Jonathan Collas, Amandeep Gill, Ahmet Hatip, Juha Heikkilä, Chris Johnson, Gill Jolly, Ziv Katzir, Mary Kerema, Hiroaki Kitano, Antonio Krüger, Aoife McLysaght, Oleksii Molchanovskyi, Andrea Monti, Kyoung Mu Lee, Mona Nemer, Nuria Oliver, Raquel Pezoa, Audrey Plonk, José Portillo, Balaraman Ravindran, Hammam Riza, Crystal Rugege, Haroon Sheikh, Denise Wong, Yi Zeng, Liming Zhu

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY

AI总结 2025国际人工智能安全报告第二关键更新,探讨通用人工智能风险管理工作进展,包括技术安全措施、对抗训练、数据整理及制度框架的建立。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15948 2025-10-21 cs.AI cs.CR 88%

VisuoAlign: Safety Alignment of LVLMs with Multimodal Tree Search

MingSheng Li, Guangze Zhao, Sichen Liu

机构 * Independent Researcher(独立研究者) Harbin Institute of Technology(哈尔滨工业大学) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学)

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13653 2025-10-16 cs.CY 88%

International AI Safety Report 2025: First Key Update: Capabilities and Risk Implications

Yoshua Bengio, Stephen Clare, Carina Prunkl, Shalaleh Rismani, Maksym Andriushchenko, Ben Bucknall, Philip Fox, Tiancheng Hu, Cameron Jones, Sam Manning, Nestor Maslej, Vasilios Mavroudis, Conor McGlynn, Malcolm Murray, Charlotte Stix, Lucia Velasco, Nicole Wheeler, Daniel Privitera, Sören Mindermann, Daron Acemoglu, Thomas G. Dietterich, Fredrik Heintz, Geoffrey Hinton, Nick Jennings, Susan Leavy, Teresa Ludermir, Vidushi Marda, Helen Margetts, John McDermid, Jane Munga, Arvind Narayanan, Alondra Nelson, Clara Neppel, Gopal Ramchurn, Stuart Russell, Marietje Schaake, Bernhard Schölkopf, Alavaro Soto, Lee Tiedrich, Gaël Varoquaux, Andrew Yao, Ya-Qin Zhang, Leandro Aguirre, Olubunmi Ajala, Fahad Albalawi Noora AlMalek, Christian Busch, André Carvalho, Jonathan Collas, Amandeep Gill, Ahmet Hatip, Juha Heikkilä, Chris Johnson, Gill Jolly, Ziv Katzir, Mary Kerema, Hiroaki Kitano, Antonio Krüger, Aoife McLysaght, Oleksii Molchanovskyi, Andrea Monti, Kyoung Mu Lee, Mona Nemer, Nuria Oliver, Raquel Pezoa, Audrey Plonk, José Portillo, Balaraman Ravindran, Hammam Riza, Crystal Rugege, Haroon Sheikh, Denise Wong, Yi Zeng, Liming Zhu

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09600 2025-09-08 cs.AI cs.CR 88%

Antidote: Post-fine-tuning Safety Alignment for Large Language Models against Harmful Fine-tuning

Tiansheng Huang, Gautam Bhattacharya, Pratik Joshi, Josh Kimball, Ling Liu

机构 * Georgia Institute of Technology(佐治亚理工学院) Dolby Laboratories(杜比实验室)

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

Comments Rejected by AAAI25-AIA. Accepted by ICML25. Authors are thankful to the anonymous reviewers from both AAAI25-AIA and ICML25

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01444 2025-09-03 cs.CY 88%

Strata-Sword: A Hierarchical Safety Evaluation towards LLMs based on Reasoning Complexity of Jailbreak Instructions

Shiji Zhao, Ranjie Duan, Jiexi Liu, Xiaojun Jia, Fengxiang Wang, Cheng Wei, Ruoxi Cheng, Yong Xie, Chang Liu, Qing Guo, Jialing Tao, Hui Xue, Xingxing Wei

专题命中 安全评测 :safety(title,abstract);jailbreak(title,abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10106 2025-07-15 cs.AI 88%

BlueGlass: A Framework for Composite AI Safety

Harshal Nandigramwar, Syed Qutub, Kay-Ulrich Scholl

机构 * Intel Labs, Munich, Germany(英特尔慕尼黑实验室) University of Stuttgart, Stuttgart, Germany(斯图加特大学)

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI

Comments Accepted at ICML 2025 [Actionable Interpretability Workshop]

详情

展开后加载摘要…

URL PDF HTML 收藏
2001.00078 2025-04-25 cs.CY econ.GN q-fin.EC 88%

Regulatory Markets for AI Safety

Jack Clark, Gillian K. Hadfield

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11543 2025-01-14 cs.CV cs.AI 88%

PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment

Zhendong Liu, Yuanbi Nie, Yingshui Tan, Jiaheng Liu, Xiangyu Yue, Qiushi Cui, Chongjun Wang, Xiaoyong Zhu, Bo Zheng

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

Comments arXiv admin note: substantial text overlap with arXiv:2405.13581

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01765 2025-01-06 cs.LG 88%

SaLoRA: Safety-Alignment Preserved Low-Rank Adaptation

Mingjie Li, Wai Man Si, Michael Backes, Yang Zhang, Yisen Wang

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16843 2024-10-23 cs.CL 88%

Trustworthy Alignment of Retrieval-Augmented Large Language Models via Reinforcement Learning

Zongmeng Zhang, Yufeng Shi, Jinhua Zhu, Wengang Zhou, Xiang Qi, Peng Zhang, Houqiang Li

专题命中 安全评测 :alignment(title,abstract);trustworthy(title,abstract);分类 cs.CL

Comments ICML 2024

Journal ref Proceedings of the 41st International Conference on Machine Learning, PMLR 235:59827-59850, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06946 2024-10-15 cs.AI 88%

A Trilogy of AI Safety Frameworks: Paths from Facts and Knowledge Gaps to Reliable Predictions and New Knowledge

Simon Kasif

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08751 2024-09-16 cs.CY 88%

A Grading Rubric for AI Safety Frameworks

Jide Alaga, Jonas Schuett, Markus Anderljung

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY

Comments 16 pages, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07342 2024-07-11 cs.CL 88%

Multilingual Blending: LLM Safety Alignment Evaluation with Language Mixture

Jiayang Song, Yuheng Huang, Zhehua Zhou, Lei Ma

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19832 2024-06-04 cs.AI 88%

AI Safety: A Climb To Armageddon?

Herman Cappelen, Josh Dever, John Hawthorne

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI

Comments 20 page article

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12316 2024-03-20 cs.CL 88%

OpenEval: Benchmarking Chinese LLMs across Capability, Alignment and Safety

Chuang Liu, Linhao Yu, Jiaxuan Li, Renren Jin, Yufei Huang, Ling Shi, Junhui Zhang, Xinmeng Ji, Tingting Cui, Tao Liu, Jinwang Song, Hongying Zan, Sun Li, Deyi Xiong

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.09662 2023-08-31 cs.CL 88%

Red-Teaming Large Language Models using Chain of Utterances for Safety-Alignment

Rishabh Bhardwaj, Soujanya Poria

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22766 2026-07-28 cs.LG cs.AI 新提交 88%

Beyond Shapley: An Influence-Based Data Auditing Pipeline for LLM Alignment and Evaluation

超越夏普利值:用于大语言模型对齐和评估的基于影响的数据审核管道

Yunting Song, Matthew Watson, Peter Grabowski, Jun Qin

机构 * Google(谷歌)

专题命中 安全评测 :alignment(title,abstract);RLHF(abstract,abstract_cn);safety(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型数据质量问题,引入可扩展的基于影响的数据审核管道,通过映射语义邻域到有向图,利用参考LLM概率分布评估数据效用,转换为局部优势指标,有效清理数据集,揭示基准漏洞,确保数据完整性。

详情

展开后加载摘要…

URL PDF HTML 收藏