arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9248 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9248 篇

2506.03659 2025-11-04 cs.CL 85%

Trustworthy Medical Question Answering: An Evaluation-Centric Survey

Yinuo Wang, Baiyang Wang, Robert E. Mercer, Frank Rudzicz, Sudipta Singha Roy, Pengjie Ren, Zhumin Chen, Xindi Wang

机构 * Shandong University(山东大学) University of Western Ontario(西方大学) Dalhousie University(达尔豪斯大学) University of Toronto(多伦多大学)

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL

Comments accepted to EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27077 2025-11-03 cs.CL 85%

Contrastive Knowledge Transfer and Robust Optimization for Secure Alignment of Large Language Models

Jiasen Zheng, Huajun Zhang, Xu Yan, Ran Hao, Chong Peng

专题命中 安全评测 :alignment(title,abstract);safety(abstract);trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00973 2025-06-03 cs.CL 85%

XGUARD: A Graded Benchmark for Evaluating Safety Failures of Large Language Models on Extremist Content

Vadivel Abishethvarman, Bhavik Chandna, Pratik Jalan, Usman Naseem

机构 * Sabaragamuwa University of Sri Lanka(斯里兰卡萨巴拉加穆瓦大学) UC San Diego(圣地亚哥大学) Macquarie University(麦考瑞大学)

专题命中 安全评测 :safety(title,abstract);red teaming(abstract);trustworthy(abstract);分类 cs.CL

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11413 2025-05-19 cs.CL 85%

CARES: Comprehensive Evaluation of Safety and Adversarial Robustness in Medical LLMs

Sijia Chen, Xiaomin Li, Mengxue Zhang, Eric Hanchen Jiang, Qingcheng Zeng, Chen-Hsiang Yu

专题命中 安全评测 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15088 2025-04-22 cs.CY 85%

Safety Co-Option and Compromised National Security: The Self-Fulfilling Prophecy of Weakened AI Risk Thresholds

Heidy Khlaaf, Sarah Myers West

专题命中 安全评测 :safety(title,abstract);alignment(abstract);AI safety(abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12553 2025-04-18 cs.CL 85%

ELAB: Extensive LLM Alignment Benchmark in Persian Language

Zahra Pourbahman, Fatemeh Rajabi, Mohammadhossein Sadeghi, Omid Ghahroodi, Somaye Bakhshaei, Arash Amini, Reza Kazemi, Mahdieh Soleymani Baghshah

专题命中 安全评测 :alignment(title,abstract);safety(abstract);red teaming(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13006 2025-04-01 cs.CL 85%

Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates

Hui Wei, Shenghua He, Tian Xia, Fei Liu, Andy Wong, Jingyang Lin, Mei Han

专题命中 安全评测 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL

Comments Accepted by Building Trust in LLMs and LLM Applications workshop at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18422 2025-03-24 cs.AI cs.LG 85%

A Black Swan Hypothesis: The Role of Human Irrationality in AI Safety

Hyunin Lee, Chanwoo Park, David Abel, Ming Jin

专题命中 安全评测 :safety(title);AI safety(title);分类 cs.AI、cs.LG

Comments The title was changed and acknowledgment was included

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17173 2026-08-12 cs.CL cs.AI cs.LG 版本更新 85%

Why Do Safety Guardrails Degrade Across Languages?

为何安全护栏在不同语言中会退化?

Max Zhang, Ameen Patel, Sang T. Truong, Sanmi Koyejo

机构 * Stanford University(斯坦福大学)

专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究通过引入多组项目反应理论框架,揭示了语言无关的安全鲁棒性、提示内在难度、全球语言处理难度和提示特定的跨语言安全差距等因素,发现安全退化并非仅在低资源语言中发生,且文化与概念不匹配也会影响安全性能。

Comments Poster at Conference on Language Modeling (COLM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04626 2026-08-06 cs.CR 新提交 85%

Blockchain Empowered Trustworthy Agent Networks: Foundations, Taxonomy, and Future Directions

区块链赋能的可信智能体网络:基础、分类与未来方向

Liehuang Zhu, Yuhang Li, Tianxing Wang, Zhihao Chen, Ke Li, Hongyi Liu, Yajie Wang, Lei Xu, Peng Jiang, Zijian Zhang

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);safety(abstract)

AI总结 本文综述从经典多智能体系统到开放智能体网络的演化,构建五维信任分类,明确区块链作为共享信任层为可信智能体网络提供多类支撑机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01538 2026-08-04 cs.NI cs.SY eess.SY 新提交 85%

From Network Automation to Trustworthy Autonomous Networking in the LLM Era: A Network Control Intelligence Perspective

从网络自动化到大语言模型(LLM)时代的可信自主网络:网络控制智能视角

Tianzhu Zhang, Changgang Zheng, Shanshan Wang, Yarui Zhang, Lina Shi, Yue Jin, Xiaofei Wang, Meikang Qiu

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);safety(abstract)

AI总结 本文以网络控制智能(NCI)为框架,梳理网络控制系统三阶段演进,提出可信自主网络定义及参考架构,明确LLM赋能运营的集成模式与相关研究议程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02317 2026-07-16 cs.LG cs.AI cs.CY 85%

Defining and Evaluating Physical Safety for Large Language Models

定义和评估大语言模型的物理安全性

Yung-Chen Tang, Pin-Yu Chen, Tsung-Yi Ho

机构 * The Chinese University of Hong Kong(香港中文大学) IBM Research(IBM研究院)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文提出了一种无人机控制的全面基准,评估大语言模型在物理安全方面的风险与权衡,揭示了模型在安全性和实用性之间的不理想平衡。

Journal ref Communications of the ACM, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06327 2026-05-08 cs.CL cs.AI cs.LG 85%

Measuring Evaluation-Context Divergence in Open-Weight LLMs: A Paired-Prompt Protocol with Pilot Evidence of Alignment-Pipeline-Specific Heterogeneity

在开放权重大语言模型中测量评估-情境差异:一种配对提示协议及其初步证据表明对齐-流水线特定异质性

Florian A. D. Burnat, Brittany I. Davidson

机构 * University of Bath(巴斯大学)

专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种配对提示协议,用于测量开放权重大语言模型中因任务框架不同而引起的评估-情境差异,发现不同模型在评估和部署情境下的行为存在显著异质性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01444 2026-04-06 cs.CR 85%

Cooking Up Risks: Benchmarking and Reducing Food Safety Risks in Large Language Models

制造风险:在大型语言模型中基准测试和降低食品安全风险

Weidi Luo, Xiaofei Wen, Tenghao Huang, Hongyi Wang, Zhen Xiang, Chaowei Xiao, Kristina Gligorić, Muhao Chen

专题命中 安全评测 :safety(title,abstract);alignment(abstract);jailbreak(abstract)

AI总结 本文提出FoodGuardBench基准,用于评估大型语言模型在食品安全领域的安全性和鲁棒性,发现现有模型存在对食品相关领域安全对齐不足、生成有害指令及防护措施失效等问题,并提出FoodGuard-4B作为改进方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03273 2026-03-23 cs.CL cs.AI cs.HC cs.LG 85%

A Multi-Perspective Benchmark and Moderation Model for Evaluating Safety and Adversarial Robustness

一种多视角基准和评估模型用于评估安全性和对抗鲁棒性

Naseem Machlovi, Maryam Saleki, Ruhul Amin, Mohamed Rahouti, Shawqi Al-Maliki, Junaid Qadir, Mohamed M. Abdallah, Ala Al-Fuqaha

机构 * Department of Computer and Information Science, Fordham University(福德汉大学计算机与信息科学系) College of Science and Engineering, Hamad Bin Khalifa University(哈马德·本·卡西姆大学科学与工程学院) Department of Computer Science and Engineering, Qatar University(卡塔尔大学计算机科学与工程系)

专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出GuardEval多视角基准和GGuard模型,通过细粒度标签提升内容审核的准确性和对抗鲁棒性,实验显示GGuard在宏平均F1得分上优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01600 2026-02-03 cs.CR cs.CL cs.CY cs.LG 85%

Expected Harm: Rethinking Safety Evaluation of (Mis)Aligned LLMs

预期危害:重新思考对(误)对齐大语言模型的安全性评估

Yen-Shan Chen, Zhi Rui Tam, Cheng-Kuang Wu, Yun-Nung Chen

专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.CY、cs.LG

AI总结 本文提出预期危害指标,通过分析发现模型对高成本低可能性威胁的拒绝行为与高可能性低成本威胁的易受攻击现象,揭示模型对执行成本的

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15714 2026-01-23 cs.LG cs.AI cs.CL 85%

Even GPT-5.2 Can't Count to Five: The Case for Zero-Error Horizons in Trustworthy LLMs

即使GPT-5.2也无法数到五:可信大语言模型中的零误差视野案例

Ryoma Sato

机构 * National Institute of Informatics(国家信息研究所)

专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出零误差视野(ZEH)用于评估可信大语言模型的无错误解决范围,通过分析GPT-5.2和Qwen2.5发现其在简单任务上的错误,揭示算法能力的涌现特性,并提出降低计算成本的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10527 2026-01-19 cs.AI cs.CL cs.CV cs.LG 85%

A Safety Report on GPT-5.2, Gemini 3 Pro, Qwen3-VL, Grok 4.1 Fast, Nano Banana Pro, and Seedream 4.5

GPT-5.2、Gemini 3 Pro、Qwen3-VL、Grok 4.1 Fast、Nano Banana Pro 和 Seedream 4.5 的安全报告

Xingjun Ma, Yixu Wang, Hengyuan Xu, Yutao Wu, Yifan Ding, Yunhan Zhao, Zilong Wang, Jiabin Hua, Ming Wen, Jianan Liu, Ranjie Duan, Yifeng Gao, Yingshui Tan, Yunhao Chen, Hui Xue, Xin Wang, Wei Cheng, Jingjing Chen, Zuxuan Wu, Bo Li, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation institute(上海创新研究院) Deakin University(德克萨斯大学) UIUC(伊利诺伊大学香槟分校)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本报告对六个前沿模型进行综合安全性评估,揭示其在安全性和鲁棒性方面的差异,强调需要标准化评估以指导负责任的部署。

Comments 41 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00590 2026-01-05 cs.CV 85%

SafeMo: Linguistically Grounded Unlearning for Trustworthy Text-to-Motion Generation

SafeMo: 语言引导的去学习用于可信的文本到运动生成

Yiling Wang, Zeyu Zhang, Yiran Wang, Hao Tang

机构 * The Australian National University(澳大利亚国立大学) Peking University(北京大学)

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);safety(abstract)

AI总结 SafeMo通过整合MMU策略,实现安全的人类运动生成,提升安全性和实用性平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19177 2025-08-06 cs.LG cs.CL cs.CY 85%

Evidence Is All You Need: Ordering Imaging Studies via Language Model Alignment with the ACR Appropriateness Criteria

Michael S. Yao, Allison Chae, Charles E. Kahn, Walter R. Witschey, James C. Gee, Hersh Sagreiya, Osbert Bastani

专题命中 安全评测 :alignment(title,abstract);trustworthy(abstract);分类 cs.CL、cs.CY、cs.LG

Comments 15 pages main text, 4 figures, 1 table

Journal ref Commun Med 5, 332 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11365 2025-05-27 cs.CY cs.AI cs.CL cs.CR 85%

Phare: A Safety Probe for Large Language Models

Pierre Le Jeune, Benoît Malézieux, Weixuan Xiao, Matteo Dora

机构 * Giskard AI

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17636 2025-05-26 cs.LG cs.AI cs.CL 85%

Surfacing Semantic Orthogonality Across Model Safety Benchmarks: A Multi-Dimensional Analysis

Jonathan Bennion, Shaona Ghosh, Mantek Singh, Nouha Dziri

专题命中 安全评测 :safety(title,abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 6th International Conference on Advanced Natural Language Processing (AdNLP 2025), May 17 ~ 18, 2025, Zurich, Switzerland

Journal ref Computer Science & Information Technology 15 (2025) 27 - 39

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15792 2025-05-22 cs.CL cs.AI cs.LG 85%

Long-Form Information Alignment Evaluation Beyond Atomic Facts

Danna Zheng, Mirella Lapata, Jeff Z. Pan

机构 * School of Informatics, University of Edinburgh, UK(爱丁堡大学信息学院) Huawei Edinburgh Research Centre, CSI, UK(华为爱丁堡研究中心)

专题命中 安全评测 :alignment(title,abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02848 2025-05-07 cs.CY cs.AI cs.CL 85%

Aligning Large Language Models with Healthcare Stakeholders: A Pathway to Trustworthy AI Integration

Kexin Ding, Mu Zhou, Akshay Chaudhari, Shaoting Zhang, Dimitris N. Metaxas

机构 * Rutgers University(罗格斯大学) Stanford University(斯坦福大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02189 2025-04-08 cs.CV cs.AI cs.CL cs.LG cs.RO 85%

A Survey of State of the Art Large Vision Language Models: Alignment, Benchmark, Evaluations and Challenges

Zongxia Li, Xiyang Wu, Hongyang Du, Fuxiao Liu, Huy Nghiem, Guangyao Shi

专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 22 pages, 3 figures

Journal ref Navigating the Future: Ensuring Trustworthiness in Multi-Modal Open-World Intelligence @ CVPR, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04957 2025-03-10 cs.LG cs.AI cs.CL 85%

SafeArena: Evaluating the Safety of Autonomous Web Agents

Ada Defne Tur, Nicholas Meade, Xing Han Lù, Alejandra Zambrano, Arkil Patel, Esin Durmus, Spandana Gella, Karolina Stańczak, Siva Reddy

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04650 2025-03-04 cs.CL cs.AI cs.HC cs.LG 85%

Building Trust in Mental Health Chatbots: Safety Metrics and LLM-Based Evaluation Tools

Jung In Park, Mahyar Abbasian, Iman Azimi, Dawn T. Bounds, Angela Jun, Jaesu Han, Robert M. McCarron, Jessica Borelli, Parmida Safavi, Sanaz Mirbaha, Jia Li, Mona Mahmoudi, Carmen Wiedenhoeft, Amir M. Rahmani

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07057 2024-12-09 cs.CL cs.AI cs.CV cs.LG 85%

MultiTrust: A Comprehensive Benchmark Towards Trustworthy Multimodal Large Language Models

Yichi Zhang, Yao Huang, Yitong Sun, Chang Liu, Zhe Zhao, Zhengwei Fang, Yifan Wang, Huanran Chen, Xiao Yang, Xingxing Wei, Hang Su, Yinpeng Dong, Jun Zhu

专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 100 pages, 84 figures, 33 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05965 2024-09-10 cs.CV cs.AI cs.CL cs.CR cs.LG 85%

T2VSafetyBench: Evaluating the Safety of Text-to-Video Generative Models

Yibo Miao, Yifan Zhu, Yinpeng Dong, Lijia Yu, Jun Zhu, Xiao-Shan Gao

专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.08517 2024-04-15 cs.SE cs.AI cs.CL cs.CR cs.LG 85%

Online Safety Analysis for LLMs: a Benchmark, an Assessment, and a Path Forward

Xuan Xie, Jiayang Song, Zhehua Zhou, Yuheng Huang, Da Song, Lei Ma

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏