arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9248 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9248 篇

2510.00857 2026-03-04 cs.CL 83%

ManagerBench: Evaluating the Safety-Pragmatism Trade-off in Autonomous LLMs

ManagerBench: 评估自主大语言模型中的安全与务实之间的权衡

Adi Simhi, Jonathan Herzig, Martin Tutek, Itay Itzhak, Idan Szpektor, Yonatan Belinkov

机构 * Technion – Israel Institute of Technology(技术学院–以色列理工学院) Google Research(谷歌研究) University of Zagreb(Zagreb大学) Kempner Institute, Harvard University(哈佛大学凯普勒研究所)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL

AI总结 ManagerBench评估自主大语言模型在安全与务实权衡中的表现,揭示模型在冲突目标下的决策缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01938 2026-03-03 cs.AI cs.CL cs.CY cs.LG 83%

EigenBench: A Comparative Behavioral Measure of Value Alignment

EigenBench: 一种价值对齐的比较行为度量

Jonathn Chang, Leonhard Piff, Suvadip Sana, Jasmine X. Li, Lionel Levine

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 EigenBench通过黑盒方法比较语言模型的价值对齐,利用人类判断验证其在无真实标签情况下评估主观价值观的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22973 2026-02-27 cs.AI 83%

Modeling Expert AI Diagnostic Alignment via Immutable Inference Snapshots

通过不可变推理快照建模专家AI诊断对齐

Dimitrios P. Panagoulias, Evangelia-Aikaterini Tsichrintzi, Georgios Savvidis, Evridiki Tsoureli-Nikita

机构 * organization= Department of Informatics, University of Piraeus , addressline= Karaoli ke Dimitriou 80 , city= Piraeus , postcode= 18534 , country= Greece organization= Department of Research \& Development, Noetiv PC , addressline= Valaoritou 18 , city= Athens , postcode= 10671 , country= Greece organization= Department of Dermatology, Dermacen SA , addressline= Valaoritou 18 , city= Athens , postcode= 10671 , country= Greece

专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.AI

AI总结 通过不可变推理快照建模专家AI诊断对齐,提升临床决策支持系统评估的准确性与可追溯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20813 2026-02-25 cs.AI 83%

Pressure Reveals Character: Behavioural Alignment Evaluation at Depth

压力揭示特性:深度下的行为对齐评估

Nora Petrova, John Burden

机构 * Prolific

专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.AI

AI总结 本文提出一个深度行为对齐评估基准,通过多轮场景揭示模型行为倾向,发现多数模型在多个类别存在弱点,且对齐行为呈现统一构念特性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17127 2026-02-20 cs.CL 83%

The Emergence of Lab-Driven Alignment Signatures: A Psychometric Framework for Auditing Latent Bias and Compounding Risk in Generative AI

实验室驱动的对齐签名的出现:一种心理测量框架,用于审计生成AI中的潜在偏见和叠加风险

Dusan Bosnjakovic

机构 * AI Researcher(人工智能研究员)

专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.CL

AI总结 本文提出了一种心理测量框架,用于审计生成AI中的潜在偏见和叠加风险,通过分析九个领先模型的实验室信号,揭示了持续行为聚类的成因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14364 2026-02-17 cs.CR cs.AI 83%

A Trajectory-Based Safety Audit of Clawdbot (OpenClaw)

基于轨迹的安全性审计:Clawdbot(OpenClaw)

Tianyu Chen, Dongrui Liu, Xia Hu, Jingyi Yu, Wenjie Wang

专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.AI

AI总结 Clawdbot的安全性审计通过轨迹评估发现其在不同任务中的安全表现不均,尤其在意图不明确时易出现高影响工具操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13207 2026-02-17 cs.NI cs.AI 83%

A Safety-Constrained Reinforcement Learning Framework for Reliable Wireless Autonomy

面向可靠无线自主性的安全约束强化学习框架

Abdikarim Mohamed Ibrahim, Rosdiadee Nordin

机构 * Faculty of Engineering and Technology(工程与技术学院) Sunway University(Sunway大学) Future Cities Research Institute(未来城市研究 institutes)

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出一种主动安全约束强化学习框架,通过整合证明携带控制与赋能预算,以确保无线自主性中的安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22620 2026-02-16 cs.CL 83%

Layer-wise Swapping for Generalizable Multilingual Safety

分层交换以实现通用多语言安全

Hyunseo Shin, Wonseok Hwang

机构 * University of Seoul(首尔大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL

AI总结 本文提出分层交换方法,通过将英语安全专家的安全对齐转移到低资源语言专家,提升多语言安全性能,同时保持通用任务性能。

Comments EACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07376 2026-02-10 cs.CL 83%

Do Large Language Models Reflect Demographic Pluralism in Safety?

大语言模型在安全领域是否反映了人口多样性?

Usman Naseem, Gautam Siddharth Kashyap, Sushant Kumar Ray, Rafiq Ali, Ebad Shabbir, Abdullah Mohammad

机构 * Macquarie University(麦考瑞大学) University of Delhi(德里大学) DSEU-Okhla

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL

AI总结 Demo-SafetyBench通过在提示级别建模人口多样性,实现了在安全评估中兼顾可扩展性和人口鲁棒性。

Comments Accepted at EACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06443 2026-02-09 cs.CR cs.AI 83%

TrajAD: Trajectory Anomaly Detection for Trustworthy LLM Agents

TrajAD:用于可信大语言模型代理的轨迹异常检测

Yibing Liu, Chong Zhang, Zhongyi Han, Hansong Liu, Yong Wang, Yang Yu, Xiaoyan Wang, Yilong Yin

机构 * School of Software, Shandong University(山东大学软件学院) Sonli Holding Group Co., Ltd.(山东利集团有限公司) Shandong Huazhi Talent Technology Co., Ltd.(山东华智人才科技有限公司) Information Technology Service Center of People’s Court(人民法院信息技术服务中心)

专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.AI

AI总结 TrajAD通过细粒度过程监督训练的专用验证器,解决大语言模型代理轨迹异常检测问题,提升过程可靠性。

Comments 9 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05633 2026-02-06 cs.CL 83%

CASTLE: A Comprehensive Benchmark for Evaluating Student-Tailored Personalized Safety in Large Language Models

CASTLE:一个评估大语言模型学生定制个性化安全性的综合基准

Rui Jia, Ruiyi Lan, Fengrui Liu, Zhongxiang Dai, Bo Jiang, Jing Shao, Jingyuan Chen, Guandong Xu, Fei Wu, Min Zhang

机构 * East China Normal University(华东师范大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Education University of Hong Kong(香港教育大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL

AI总结 CASTLE基准通过评估学生定制个性化安全性,揭示大语言模型在不同学生属性下的安全缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18533 2026-02-04 cs.CV cs.CL cs.CR 83%

Rethinking Bottlenecks in Safety Fine-Tuning of Vision Language Models

重新审视视觉语言模型安全微调中的瓶颈

Yi Ding, Lijun Li, Bing Cao, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Purdue University(普渡大学) Tianjin University(天津大学)

专题命中 安全评测 :safety(title,abstract);harmlessness(abstract);分类 cs.CL

AI总结 本文提出多图像安全数据集,通过增强视觉推理能力,提升模型在安全关键任务中的性能与通用能力。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03263 2026-02-04 cs.AI 83%

CSR-Bench: A Benchmark for Evaluating the Cross-modal Safety and Reliability of MLLMs

CSR-Bench: 一种评估多模态大语言模型跨模态安全性和可靠性的基准

Yuxuan Liu, Yuntian Shi, Kun Wang, Haoting Shen, Kun Yang

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Nanyang Technological University(南洋理工大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 CSR-Bench通过四个压力测试模式评估多模态大语言模型的跨模态安全性和可靠性,发现模型在多模态输入下表现下降,且安全提升可能源于拒绝导向的启发式方法。

Comments 25 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15169 2026-01-27 cs.AI 83%

SafeRBench: Dissecting the Reasoning Safety of Large Language Models

SafeRBench: 解析大语言模型推理安全性的本质

Xin Gao, Shaohan Yu, Zerui Chen, Yueming Lyu, Weichen Yu, Guanghao Li, Jiyao Liu, Jianxiong Gao, Jian Liang, Ziwei Liu, Chenyang Si

机构 * Nanjing University(南京大学) Fudan University(复旦大学) Carnegie Mellon University(卡内基梅隆大学) Chinese Academy of Sciences(中国科学院) Nanyang Technological University(南洋理工大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 SafeRBench通过端到端评估方法解析大语言模型推理过程中的安全性问题,提出风险分层探测、微思维分析和10项细粒度指标,揭示大模型在增强安全性的同时可能增加可操作风险的悖论。

Comments 29 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13876 2026-01-21 cs.CL 83%

Pedagogical Alignment for Vision-Language-Action Models: A Comprehensive Framework for Data, Architecture, and Evaluation in Education

为视觉-语言-动作模型的教育对齐:一个全面的框架,用于数据、架构和教育中的评估

Unggi Lee, Jahyun Jeong, Sunyoung Shin, Haeun Park, Jeongsu Moon, Youngchang Song, Jaechang Shim, JaeHwan Lee, Yunju Noh, Seungwon Choi, Ahhyun Kim, TaeHyeon Kim, Kyungtae Joo, Taeyeong Kim, Gyeonggeon Lee

机构 * Chosun University(全州大学) Seoul National University(首尔国立大学) Korea Institute for Curriculum and Evaluation(韩国课程评价院) Nanyang Technological University(南洋理工大学)

专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.CL

AI总结 本文提出教育VLA框架,通过四个组件实现轻量级模型的教育对齐,提升科学教育中的任务表现和解释生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05484 2026-01-21 cs.CY 83%

Evaluating LLM Safety Across Child Development Stages: A Simulated Agent Approach

评估大语言模型在儿童发展阶段的安全性:一种模拟代理方法

Abhejay Murali, Saleh Afroogh, Kevin Chen, David Atkinson, Amit Dhurandhar, Junfeng Jiao

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CY

AI总结 本文提出ChildSafe基准,通过模拟不同儿童发展阶段的认知变化,评估大语言模型在面对认知多样性时的安全性与对齐鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09112 2026-01-15 cs.CY 83%

Seeking Human Security Consensus: A Unified Value Scale for Generative AI Value Safety

寻求人类安全共识:面向生成式AI价值安全的统一价值尺度

Ying He, Baiyang Li, Yule Cao, Huirun Xu, Qiuxian Chen, Shu Chen, Shangsheng Ren

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CY

AI总结 本文提出生成式AI价值安全尺度,通过生命周期视角构建价值安全风险分类和事件库,并通过基准测试揭示模型间价值安全性能差异,强调建立共享安全基础的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06663 2026-01-14 cs.AI 83%

SafePro: Evaluating the Safety of Professional-Level AI Agents

SafePro:评估专业级AI代理的安全性

Kaiwen Zhou, Shreedhar Jangam, Ashwin Nagarajan, Tejas Polu, Suhas Oruganti, Chengzhi Liu, Ching-Chen Kuo, Yuting Zheng, Sravana Narayanaraju, Xin Eric Wang

机构 * UCSC(加州大学圣塔 Cruz 分校) UCSB(加州大学圣塔 Barbara 分校) eBay(eBay 公司)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 SafePro通过高复杂度专业任务数据集评估专业级AI代理的安全性,揭示了现有模型在安全判断和对齐方面的不足,并提出了改进安全性的策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18882 2026-01-14 cs.CY 83%

Personalized Safety in LLMs: A Benchmark and A Planning-Based Agent Approach

大语言模型中的个性化安全:一个基准和基于规划的代理方法

Yuchen Wu, Edward Sun, Kaijie Zhu, Jianxun Lian, Jose Hernandez-Orallo, Aylin Caliskan, Jindong Wang

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CY

AI总结 本文提出个性化安全框架PENGUIN和RAISE,通过获取用户背景信息提升LLM的安全性,实验显示安全评分提升达31.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21354 2025-12-29 cs.CR cs.AI cs.SE 83%

Reflection-Driven Control for Trustworthy Code Agents

基于反射的可信代码代理控制

Bin Wang, Jiazheng Quan, Xingrui Yu, Hansen Hu, Yuhao, Ivor Tsang

专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.AI

AI总结 本文提出反射驱动控制方法,通过内部反思循环提升代码生成的安全性和合规性,实现自主、安全且可审计的AI代码代理。

Comments Accepted to AAAI 2026 Workshop on Trust and Control in Agentic AI (TrustAgent)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02366 2025-12-23 cs.CL 83%

LiveSecBench: A Dynamic and Event-Driven Safety Benchmark for Chinese Language Model Applications

LiveSecBench: 一种动态且事件驱动的安全基准,用于中文语言模型应用

Yudong Li, Peiru Yang, Feng Huang, Zhongliang Yang, Kecheng Wang, Haitian Li, Baocheng Chen, Xingyu An, Ziyu Liu, Youdan Yang, Kejiang Chen, Sifang Wan, Xu Wang, Yufei Sun, Liyan Wu, Ruiqi Zhou, Wenya Wen, Xingchi Gu, Tianxin Zhang, Yue Gao, Yongfeng Huang

机构 * Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) University of Science and Technology of China(中国科学技术大学) IntokenTech

专题命中 安全评测 :safety(title,abstract);AI safety(abstract);分类 cs.CL

AI总结 LiveSecBench通过动态更新和多维度评估,为中文大模型的安全性提供持续改进的标准和排行榜。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11979 2025-12-16 cs.HC cs.AI 83%

Designing The Internet of Agents: A Framework for Trustworthy, Transparent, and Collaborative Human-Agent Interaction (HAX)

设计智能体互联网:信任、透明和协作人机交互的框架

Marc Scibelli, Krystelle Gonzalez Papaux, Julia Valenti, Srishti Kush

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);分类 cs.AI

AI总结 HAX框架通过整合行为启发式、模式驱动SDK和行为代理概念,为信任、透明和协作的人机交互提供端到端解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02530 2025-12-10 cs.AI 83%

Aetheria: A multimodal interpretable content safety framework based on multi-agent debate and collaboration

Aetheria:基于多智能体辩论与协作的多模态可解释内容安全框架

Yuxiang He, Jian Zhao, Yuchen Yuan, Tianle Zhang, Wei Cai, Haojie Cheng, Ziyan Shi, Ming Zhu, Haichuan Tang, Chi Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) Sichuan University(四川大学) Peking University(北京大学) Beijing Jiaotong University(北京交通大学) Harbin Institute of Technology(哈尔滨工业大学) China Railway Rolling Stock Corporation Limited(中国铁路滚动股票有限公司)

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.AI

AI总结 Aetheria通过多智能体辩论与协作机制,实现多模态内容安全的可解释性与高准确性,提升可信AI审查水平。

Comments https://github.com/Herrieson/Aetheria

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02282 2025-12-03 cs.AI cs.HC cs.MA 83%

DialogGuard: Multi-Agent Psychosocial Safety Evaluation of Sensitive LLM Responses

DialogGuard: 多智能体心理社会安全评估框架用于敏感LLM响应

Han Luo, Guy Laban

机构 * University of Leeds(利兹大学) Southwest Jiaotong University(西南交通大学) Department of Industrial Engineering and Management(工业工程与管理系) Ben-Gurion University of the Negev(贝内尔·加隆大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 DialogGuard通过多智能体框架评估LLM响应的心理社会风险,提供高准确性的风险检测与可解释的评估结果,支持安全提示设计和脆弱用户应用的监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17947 2025-11-25 cs.AI cs.IR 83%

Leveraging Evidence-Guided LLMs to Enhance Trustworthy Depression Diagnosis

利用证据引导的LLM提升可信的抑郁症诊断

Yining Yuan, J. Ben Tamo, Micky C. Nnamdi, Yifei Wang, May D. Wang

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);分类 cs.AI

AI总结 本文提出EGDR框架,通过证据引导推理和置信度评分提升抑郁症诊断的准确性和可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03138 2025-11-18 cs.AI 83%

DeepKnown-Guard: A Proprietary Model-Based Safety Response Framework for AI Agents

Qi Li, Jianjun Xu, Pingtao Wei, Jiu Li, Peiqiang Zhao, Jiwei Shi, Xuan Zhang, Yanhui Yang, Xiaodong Hui, Peng Xu, Wenqin Shao

机构 * Beijing Caizhi Tech(北京彩智科技)

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12155 2025-11-18 cs.LG 83%

Rethinking Deep Alignment Through The Lens Of Incomplete Learning

Thong Bach, Dung Nguyen, Thao Minh Le, Truyen Tran

专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.LG

Comments AAAI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08487 2025-11-12 cs.MA cs.CL 83%

How Brittle is Agent Safety? Rethinking Agent Risk under Intent Concealment and Task Complexity

Zihan Ma, Dongsheng Zhu, Shudong Liu, Taolin Zhang, Junnan Liu, Qingqiu Li, Minnan Luo, Songyang Zhang, Kai Chen

机构 * School of Computer Science and Technology Xi’an Jiaotong University China(西安交通大学计算机科学与技术学院) Shanghai AI Laboratory(上海人工智能实验室) MOE KLINNS Lab Xi’an Jiaotong University China(西安交通大学教育部KLINNS实验室)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04328 2025-11-07 cs.AI 83%

RxSafeBench: Identifying Medication Safety Issues of Large Language Models in Simulated Consultation

Jiahao Zhao, Luxin Xu, Minghuan Tan, Lichao Zhang, Ahmadreza Argha, Hamid Alinejad-Rokny, Min Yang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) University of Electronic Science and Technology of China(电子科技大学) Shenzhen University of Advanced Technology(深圳大学) School of Biomedical Engineering, UNSW Sydney(生物医学工程学院,UNSW悉尼)

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.AI

Comments To appear in BIBM2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02602 2025-11-05 quant-ph cs.AI 83%

Trustworthy Quantum Machine Learning: A Roadmap for Reliability, Robustness, and Security in the NISQ Era

Ferhat Ozgur Catak, Jungwon Seo, Umit Cali

机构 * Department of Electrical Engineering and Computer Science, University of Stavanger, Norway(斯瓦尔巴大学电气工程与计算机科学系) School of Physics, Engineering and Technology, University of York, UK(约克大学物理、工程与技术学院)

专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.AI

Comments 22 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏