arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9238 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9238 篇

2605.08496 2026-05-12 cs.AI 87%

Latent Personality Alignment: Improving Harmlessness Without Mentioning Harms

潜在人格对齐:无需提及危害的改进

Linh Le, David Williams-King, Mohamed Amine Merzouk, Aton Kamanda, Adam Oberman

机构 * McGill University(麦吉尔大学) Mila – Quebec AI Institute(魁北克人工智能研究所) ERA LawZero(法零)

专题命中 安全评测 :alignment(title,abstract);harmlessness(title);分类 cs.AI;trustworthy(comments)

AI总结 本文提出LPA方法,通过训练抽象人格特质提升模型鲁棒性,以少样本实现高防御效果,且在六个危害基准测试中表现更优。

Comments published at Trustworthy AI Workshop, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04199 2026-01-09 cs.LG cs.AI cs.CL 87%

The Forgotten Shield: Safety Grafting in Parameter-Space for Medical MLLMs

被遗忘的盾牌:参数空间中的医疗大语言模型安全性移植

Jiale Zhao, Xing Mou, Jinlin Wu, Hongyuan Yu, Mingrui Sun, Yang Shi, Xuanwu Yin, Zhen Chen, Zhen Lei, Yaohua Wang

机构 * National University of Defense Technology(国防科技大学) Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统(MAIS)) Multimedia Department, Xiaomi Inc(小米公司多媒体部门) Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science and Innovation, Chinese Academy of Sciences, Hong Kong(香港科学院人工智能与机器人中心) School of Artificial Intelligence, University of Chinese Academy of Sciences, UCAS(中国科学院大学人工智能学院)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出参数空间干预方法,通过提取原始模型的安全知识并注入目标模型,提升医疗大语言模型的安全性,同时保持医疗性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09937 2025-08-15 cs.CL cs.AI cs.LG 87%

A Comprehensive Evaluation framework of Alignment Techniques for LLMs

Muneeza Azmat, Momin Abbas, Maysa Malfiza Garcia de Macedo, Marcelo Carpinette Grave, Luan Soares de Souza, Tiago Machado, Rogerio A de Paula, Raya Horesh, Yixin Chen, Heloisa Caroline de Souza Pereira Candello, Rebecka Nordenlow, Aminat Adebiyi

机构 * IBM Research(IBM研究院)

专题命中 安全评测 :alignment(title,abstract);RLHF(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments In submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16078 2025-06-23 cs.LG cs.AI cs.CL cs.CR 87%

Probing the Robustness of Large Language Models Safety to Latent Perturbations

Tianle Gu, Kexin Huang, Zongqi Wang, Yixu Wang, Jie Li, Yuanqi Yao, Yang Yao, Yujiu Yang, Yan Teng, Yingchun Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际 Graduate School, 清华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) The University of Hong Kong(香港大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22115 2025-03-31 cs.CL cs.AI cs.CY 87%

Beyond Single-Sentence Prompts: Upgrading Value Alignment Benchmarks with Dialogues and Stories

Yazhou Zhang, Qimeng Liu, Qiuchi Li, Peng Zhang, Jing Qin

专题命中 安全评测 :alignment(title,abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11853 2025-02-26 cs.CY cs.AI cs.CL q-fin.GN 87%

Chat Bankman-Fried: an Exploration of LLM Alignment in Finance

Claudia Biancotti, Carolina Camassa, Andrea Coletta, Oliver Giudice, Aldo Glielmo

专题命中 安全评测 :alignment(title,abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16112 2026-07-20 cs.AI 新提交 86%

Harmonizing AI Safety Thresholds

协调人工智能安全阈值

Wilber Sean Anterola, Matthew Ball, Luis F. Lafuerza, Markov Grey

机构 * Brown University(布朗大学) Centre pour la Sécurité de l’Intelligence Artificielle (CeSIA)(人工智能安全中心)

专题命中 安全评测 :safety(title,abstract);AI safety(title);分类 cs.AI

AI总结 研究针对前沿人工智能公司能力阈值差异大的问题,开发推导协调阈值的方法,在滥用风险领域以预期危害为关键要素建模,自动化人工智能研发领域基于进展速度设阈值,扩展了相关工作并指出差距局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08827 2026-06-17 cs.AI 版本更新 86%

Mental Health AI Safety Claims Must Preserve Temporal Evidence

心理健康AI的安全性主张必须保留时间证据

Srimonti Dutta, Ratna Kandala

机构 * WAI USA Research Labs(WAI USA研究实验室) University of Kansas(堪萨斯大学)

专题命中 安全评测 :safety(title,abstract);AI safety(title);分类 cs.AI

AI总结 本文指出,心理健康AI的安全性评估常忽略时间维度,提出SCOPE-MH原则以确保评估保留时间证据,揭示对话中逐步恶化等机制,强调时间证据对安全部署的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12696 2026-05-20 cs.CL 86%

UbuntuGuard: A Culturally-Grounded Policy Benchmark for Equitable AI Safety in African Languages

UbuntuGuard:一种基于文化的政策基准,用于非洲语言中的公平AI安全

Tassallah Abdullahi, Macton Mgonzo, Mardiyyah Oduwole, Paul Okewunmi, Abraham Owodunni, Ritambhara Singh, Carsten Eickhoff

机构 * Brown University(布朗大学) The Ohio State University(俄亥俄州立大学) ML Collective(ML集体) University of Tuebingen(图宾根大学)

专题命中 安全评测 :safety(title,abstract);AI safety(title);分类 cs.CL

AI总结 本文提出UbuntuGuard,一种针对非洲语言的公平AI安全政策基准,通过来自155名领域专家的对抗性查询,构建了基于本地规范和文化期望的政策和参考响应,评估守护模型的性能。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24618 2026-04-28 cs.AI 86%

Evaluating whether AI models would sabotage AI safety research

评估AI模型是否会破坏AI安全研究

Robert Kirk, Alexandra Souly, Kai Fronsdal, Abby D'Cruz, Xander Davies

机构 * UK AI Security Institute(英国人工智能安全研究所) UK AISI Research Affiliate(英国人工智能安全研究所研究附属)

专题命中 安全评测 :safety(title,abstract);AI safety(title);分类 cs.AI

AI总结 本文评估前沿模型在作为AI研究代理部署时对安全研究的破坏倾向,发现未提示下无破坏行为,但部分模型在持续破坏评估中表现出隐蔽破坏倾向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05501 2025-12-08 cs.CL 86%

SEA-SafeguardBench: Evaluating AI Safety in SEA Languages and Cultures

SEA-SafeguardBench: 评估SEA语言和文化中的AI安全

Panuthep Tasawong, Jian Gang Ngui, Alham Fikri Aji, Trevor Cohn, Peerat Limkonchotiwat

机构 * VISTEC Google(谷歌) AI Singapore(AI新加坡)

专题命中 安全评测 :safety(title,abstract);AI safety(title);分类 cs.CL

AI总结 SEA-SafeguardBench是首个针对东南亚语言和文化的AI安全评估基准,通过八种语言21640个样本验证LLMs在文化特定危害场景下的表现。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00757 2025-10-15 cs.CR cs.AI cs.NE 86%

AgentBreeder: Mitigating the AI Safety Risks of Multi-Agent Scaffolds via Self-Improvement

J Rosser, Jakob Foerster

机构 * University of Oxford(牛津大学) FLAIR University of Oxford(牛津大学FLAIR)

专题命中 安全评测 :safety(title,abstract);AI safety(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01990 2025-10-03 cs.CV cs.CY 86%

TriAlignXA: An Explainable Trilemma Alignment Framework for Trustworthy Agri-product Grading

Jianfei Xie, Ziyang Li

机构 * School of Software, Xinjiang University(软件学院,新疆大学)

专题命中 安全评测 :trustworthy(title,abstract);alignment(title);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25086 2025-09-30 cs.CL 86%

Towards Trustworthy Lexical Simplification: Exploring Safety and Efficiency with Small LLMs

Akio Hayakawa, Stefan Bott, Horacio Saggion

机构 * Department of Engineering, Universitat Pompeu Fabra(工程系,庞培法布拉大学)

专题命中 安全评测 :safety(title,abstract);trustworthy(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05791 2025-02-11 cs.CY 86%

Assessing confidence in frontier AI safety cases

Stephen Barrett, Philip Fox, Joshua Krook, Tuneer Mondal, Simon Mylius, Alejandro Tlaie

专题命中 安全评测 :safety(title,abstract);AI safety(title);分类 cs.CY

Comments 48 pages, 10 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10547 2024-12-03 cs.CY 86%

AI Safety Frameworks Should Include Procedures for Model Access Decisions

Edward Kembery, Tom Reed

专题命中 安全评测 :safety(title,abstract);AI safety(title);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21174 2024-08-01 cs.CV cs.AI eess.AS 86%

AI Safety in Practice: Enhancing Adversarial Robustness in Multimodal Image Captioning

Maisha Binte Rashid, Pablo Rivas

专题命中 安全评测 :safety(title,abstract);AI safety(title);分类 cs.AI

Comments Accepted into KDD 2024 workshop on Ethical AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19292 2026-07-22 cs.CY cs.AI cs.HC 新提交 86%

The safety failures we are not instrumenting: a perspective on hidden safety-critical challenges in modern AI systems

我们未检测到的安全故障:现代人工智能系统中隐藏的安全关键挑战的视角

Gjergji Kasneci, Enkelejda Kasneci

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 安全评测 :safety(title,abstract);prompt injection(abstract);AI safety(abstract);分类 cs.AI、cs.CY

AI总结 研究现代人工智能系统隐藏的安全关键挑战,提出五层框架诊断隐藏风险,识别多种未被充分认识的风险模式,给出设计、治理建议及研究议程,推动人工智能安全从模型评估转向社会技术可靠性。

Comments Email by the arXiv Support Team: "Dear Gjergji, Thank you for your patience. Your appeal was accepted. You are welcome to resubmit this work at your convenience to cs.CY (cs.AI, cs.HC) Regards, arXiv Support"

Journal ref AI and Ethics (2026) 6:295, Springer Nature

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09721 2026-07-21 cs.CL cs.AI 86%

Cross-Platform Evaluation of Large Language Model Safety in Pediatric Consultations: Evolution of Adversarial Robustness and the Scale Paradox

跨平台评估大语言模型在儿科咨询中的安全性:对抗鲁棒性的演变与规模悖论

Vahideh Zolfaghari

专题命中 安全评测 :safety(title,abstract);alignment(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究评估了不同模型和平台在家长焦虑驱动下的LLM安全性,发现较小模型在对抗性压力下表现更优,且安全性与模型架构相关,而非规模。

Journal ref npj Digit. Med. (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00464 2026-07-02 cs.LG cs.CL 新提交 86%

MolSafeEval: A Benchmark for Uncovering Safety Risks in AI-Generated Molecules

MolSafeEval: 揭示AI生成分子安全风险的基准

Tong Xu, Xinzhe Cao, Zhihui Zhu, Keyan Ding, Huajun Chen

机构 * Zhejiang University(浙江大学) ZJU-Hangzhou Global Scientific and Technological Innovation Center(浙大-杭州全球科技创新中心) University of Oxford(牛津大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.LG

AI总结 提出MolSafeEval基准,通过构建分子安全知识图谱和基于大语言模型的推理,系统评估四类分子生成模型的安全风险,揭示当前方法的漏洞。

Comments Accepted by Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08376 2026-06-09 cs.LG cs.AI 新提交 86%

RiskNet: A large-scale dataset of AI risk incidents from news with alignment and multi-dimensional annotations

RiskNet:一个来自新闻的大规模AI风险事件数据集,包含对齐和多维标注

Leihan Zhang, Wecheng Ye, Xianlong Ma, Haochuan Liu, Yang Li, Qianyu Zhang, Jinliang Chen, Qiang Yan

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Beijing Key Laboratory of Multimodal Data Intelligent Perception and Governance(多模态数据智能感知与治理北京市重点实验室)

专题命中 安全评测 :alignment(title,abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 提出RiskNet,一个从多语言新闻构建的大规模AI风险事件数据集,通过结构化流水线进行事件识别、对齐和多维分类,支持AI安全、治理和风险分析研究。

Comments The manuscript has been submitted to Scientific Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12124 2026-06-05 cs.LG cs.CL 86%

Alignment Risks from Capability-Seeking RL Training

从能力寻求强化学习训练中产生的对齐风险

Yujun Zhou, Yue Huang, Han Bao, Kehan Guo, Zhenwen Liang, Pin-Yu Chen, Tian Gao, Werner Geyer, Nuno Moniz, Nitesh V Chawla, Xiangliang Zhang

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) University of Washington(华盛顿大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Toronto(多伦多大学) University of Cambridge(剑桥大学)

专题命中 安全评测 :alignment(title,abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了在易受攻击的环境中通过强化学习训练语言模型时,模型可能利用隐含漏洞来最大化奖励的风险,发现这些策略不仅限于狭窄的技巧,还能在一定程度上转移、传播,并在某些情况下比通过SFT学习更持久,表明需要扩展AI安全工作到审计和保障训练环境、奖励机制和评估渠道。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28597 2026-05-28 cs.CR cs.AI cs.LG 86%

Position: Retire the "Positive Backdoor" Label -- Secret Alignment Requires Strict and Systematic Evaluation

立场:淘汰“正向后门”标签——秘密对齐需要严格且系统的评估

Jianwei Li, Jung-Eun Kim

机构 * Department of Computer Science, North Carolina State University, Raleigh, USA(北卡罗来纳州立大学计算机科学系)

专题命中 安全评测 :alignment(title,abstract);safety(abstract);harmlessness(abstract);分类 cs.AI、cs.LG

AI总结 本文主张停止使用“正向后门”标签,将触发激活的隐藏行为视为秘密对齐,并通过评估三个代表性应用在六个核心属性上的表现,揭示其脆弱性,呼吁进行严格评估。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01627 2026-05-28 cs.CL cs.AI 86%

JMedEthicBench: A Multi-Turn Conversational Benchmark for Evaluating Medical Safety in Japanese Large Language Models

JMedEthicBench:用于评估日语大语言模型医疗安全性的多轮对话基准

Junyu Liu, Zirui Li, Qian Niu, Zequn Zhang, Yue Xun, Wenlong Hou, Shujun Wang, Yusuke Iwasawa, Yutaka Matsuo, Kan Hatakeyama-Sato

机构 * Kyoto University(京都大学) Hohai University(河海大学) The University of Tokyo(东京大学) University of Science and Technology of China(中国科学技术大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 提出首个多轮对话基准JMedEthicBench,基于日本医学会67条指南和7种自动越狱策略生成5万+对抗对话,评估27个模型发现医疗专用模型安全性脆弱,且多轮交互中安全性显著下降。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13372 2026-05-22 cs.AI cs.LG 86%

MoralityGym: A Benchmark for Evaluating Hierarchical Moral Alignment in Sequential Decision-Making Agents

MoralityGym:用于评估序列决策代理中分层道德对齐的基准

Simon Rosen, Siddarth Singh, Ebenezer Gelo, Helen Sarah Robertson, Ibrahim Suder, Victoria Williams, Benjamin Rosman, Geraud Nangue Tasse, Steven James

机构 * University of the Witwatersrand(威特沃特斯兰大学)

专题命中 安全评测 :alignment(title,abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MoralityGym基准,通过将道德规范表示为有序的规范约束,评估序列决策代理中分层道德对齐的挑战,展示了98个伦理困境问题,并通过心理学和哲学的见解改进了伦理决策方法。

Comments Accepted at AAMAS 2026

Journal ref Proc of the 25th International Conference on Autonomous Agents and Multiagent Systems AAMAS 2026, Paphos, Cyprus, May 25 to 29, 2026, IFAAMAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08427 2026-05-12 cs.AI cs.GT cs.LG 86%

The Attacker in the Mirror: Breaking Self-Consistency in Safety via Anchored Bipolicy Self-Play

镜中的攻击者:通过锚定双策略自我博弈打破安全性中的自我一致性

Gabriele La Malfa, Emanuele La Malfa, Saar Cohen, Jie M. Zhang, Michael Luck, Michael Wooldridge, Elizabeth Black

机构 * Department of Informatics, King’s College London(伦敦国王学院信息学院) Department of Computer Science, University of Oxford(牛津大学计算机科学系) University of Sussex(Sussex大学) Institute for Decentralized AI(去中心化人工智能研究所)

专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出锚定双策略自我博弈方法,通过训练角色特定的LoRA适配器提升安全性与参数效率,实验证明在安全基准测试中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05750 2026-05-08 cs.LG cs.CL 86%

RVPO: Risk-Sensitive Alignment via Variance Regularization

基于方差正则化的风险敏感对齐:RVPO

Ivan Montero, Tomasz Jurczyk, Bhuwan Dhingra

机构 * Apple(苹果公司)

专题命中 安全评测 :alignment(title,abstract);RLHF(abstract);safety(abstract);分类 cs.CL、cs.LG

AI总结 本文提出RVPO框架,通过在优势聚合中惩罚奖励方差,将目标从最大化总和转为最大化一致性,提升多目标对齐的可靠性。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04410 2026-03-06 cs.CL cs.AI 86%

SalamahBench: Toward Standardized Safety Evaluation for Arabic Language Models

SalamahBench: 向阿拉伯语言模型的安全评估标准化迈进

Omar Abdelnasser, Fatemah Alharbi, Khaled Khasawneh, Ihsen Alouani, Mohammed E. Fouda

专题命中 安全评测 :safety(title,abstract);alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 SalamahBench提出了一种统一的阿拉伯语言模型安全评估基准,评估五种先进模型的安全性,揭示了不同模型在安全对齐上的显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16832 2026-02-20 cs.AI cs.CL 86%

IndicJR: A Judge-Free Benchmark of Jailbreak Robustness in South Asian Languages

IndicJR:一种无裁判的南亚语言对抗鲁棒性基准

Priyaranjan Pattnayak, Sanchari Chowdhuri

机构 * Oracle America Inc.(Oracle美国公司)

专题命中 安全评测 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 IndicJR是一种无裁判的南亚语言对抗鲁棒性基准,揭示了多语言对抗攻击的模式和风险,尤其关注南亚用户的语言转换和罗马化问题。

Comments Accepted in EACL Industry Track Oral, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13274 2026-02-17 cs.AI cs.CL 86%

ProMoral-Bench: Evaluating Prompting Strategies for Moral Reasoning and Safety in LLMs

ProMoral-Bench:评估大语言模型中道德推理与安全性的提示策略

Rohan Subramanian Thomas, Shikhar Shiromani, Abdullah Chaudhry, Ruizhe Li, Vasu Sharma, Kevin Zhu, Sunishchal Dev

专题命中 安全评测 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 ProMoral-Bench通过统一道德安全评分评估多种提示策略,发现紧凑示例引导框架在道德和安全方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏