arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9238 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9238 篇

2602.19021 2026-07-21 cs.CR 版本更新 91%

Trustworthy AI LLM Scalability Risk Index (LSRI): A Cybersecurity Framework Assessing Agentic-AI Security & Software Model Supply Chain Safety Boosting AI-Generated Malware Defense & Explainability Mitigating Emerging Risks of Generative AI

大语言模型在代理AI中的可扩展性风险与模型供应链安全

Kiarash Ahi, Vaibhav Agrawal, Saeed Valizadeh

专题命中 安全评测 :safety(title,abstract);trustworthy(title);alignment(abstract);RLHF(abstract)

AI总结 本文研究了大语言模型在代理AI中的可扩展性风险及模型供应链安全问题,提出LSRI指数和模型供应链框架,以提升安全关键环境下的LLM部署安全性。

Comments Accepted for publication in Journal of Computer Information Systems (2026). DOI: 10.1080/08874417.2026.2624670

Journal ref Journal of Computer Information Systems (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12316 2026-05-25 cs.AI cs.CL cs.CY cs.GT cs.MA 90%

GT-HarmBench: Benchmarking AI Safety Risks Through the Lens of Game Theory

GT-HarmBench:通过博弈论视角评估AI安全风险

Pepijn Cobben, Xuanqiang Angelo Huang, Thao Amelia Pham, Isabel Dahlgren, Terry Jingchen Zhang, Zhijing Jin

机构 * ETH Zürich(苏黎世联邦理工学院) Berea College(贝雷学院) University of Toronto(多伦多大学) Vector Institute(向量研究所) Max Planck Institute for Intelligent Systems, Tübingen, Germany(图宾根德国智能系统马克斯·普朗克研究所)

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 提出GT-HarmBench基准,包含1535个高风险场景,基于博弈论结构(如囚徒困境、猎鹿博弈、斗鸡博弈)评估前沿AI模型在多智能体环境中的安全风险,发现模型在38%的高风险案例中未能选择对社会有益的行为,并验证了博弈论干预可提升18%的社会有益结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04952 2025-01-10 cs.LG cs.AI cs.CY 90%

Open Problems in Machine Unlearning for AI Safety

Fazl Barez, Tingchen Fu, Ameya Prabhu, Stephen Casper, Amartya Sanyal, Adel Bibi, Aidan O'Gara, Robert Kirk, Ben Bucknall, Tim Fist, Luke Ong, Philip Torr, Kwok-Yan Lam, Robert Trager, David Krueger, Sören Mindermann, José Hernandez-Orallo, Mor Geva, Yarin Gal

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);alignment(abstract);分类 cs.AI、cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23989 2026-05-26 cs.AI cs.CL cs.CR 90%

Towards trustworthy agentic AI: a comprehensive survey of safety, robustness, privacy, and system security

迈向可信的自主AI:安全性、鲁棒性、隐私与系统安全的全面综述

Jinhu Qi, Muzhi Li, Jiahong Liu, Yuqin Shu, Dianzhi Yu, Shicheng Ma, Wenqian Cui, Yiyang Zhao, Yiyi Chen, Ruoxi Jiang, Irwin King, Zenglin Xu

机构 * Faculty of Engineering, Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学工程学院、计算机科学与工程系) Artificial Intelligence Innovation and Incubation Institute, Fudan University(复旦大学人工智能创新与孵化院) Shanghai Academy of AI for Science(上海人工智能科学研究院)

专题命中 安全评测 :trustworthy(title,abstract);safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了自主AI系统在安全鲁棒性与隐私系统安全两个核心维度的风险来源、阶段缓解策略及统一评估指标,并讨论了开放挑战。

Comments 36 pages, 4 figures. Survey/review article on trustworthy agentic AI. Published in Academia AI and Applications, 2026

Journal ref Academia AI and Applications, vol. 2, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09004 2025-01-16 cs.CL 90%

Aegis2.0: A Diverse AI Safety Dataset and Risks Taxonomy for Alignment of LLM Guardrails

Shaona Ghosh, Prasoon Varshney, Makesh Narsimhan Sreedhar, Aishwarya Padmakumar, Traian Rebedea, Jibin Rajan Varghese, Christopher Parisien

专题命中 安全评测 :safety(title,abstract);alignment(title);AI safety(title);分类 cs.CL

Comments arXiv admin note: text overlap with arXiv:2404.05993

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12936 2025-09-17 cs.LG cs.CL 90%

Rethinking the Evaluation of Alignment Methods: Insights into Diversity, Generalisation, and Safety

Denis Janiak, Julia Moska, Dawid Motyka, Karolina Seweryn, Paweł Walkowiak, Bartosz Żuk, Arkadiusz Janz

机构 * Wroclaw University of Science and Technology (WUST)(沃拉布大学科学与技术学院) National Research Institute (NASK)(国家研究 institute) Institute of Computer Science, Polish Academy of Sciences (IPI PAN)(波兰科学院计算机科学研究所)

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);DPO(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23020 2025-05-30 cs.CR cs.AI cs.CL 90%

AgentAlign: Navigating Safety Alignment in the Shift from Informative to Agentic Large Language Models

Jinchuan Zhang, Lu Yin, Yan Zhou, Songlin Hu

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);harmlessness(abstract);分类 cs.CL、cs.AI

Comments Submitted to ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03769 2024-12-17 cs.CL cs.AI cs.CR 90%

SciSafeEval: A Comprehensive Benchmark for Safety Alignment of Large Language Models in Scientific Tasks

Tianhao Li, Jingyu Lu, Chuangxin Chu, Tianyu Zeng, Yujia Zheng, Mei Li, Haotian Huang, Bin Wu, Zuoxian Liu, Kai Ma, Xuejing Yuan, Xingkai Wang, Keyan Ding, Huajun Chen, Qiang Zhang

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24962 2026-05-26 cs.CV 89%

Tempered Self-Similarity Alignment for Physically Plausible Video Generation

Tempered Self-Similarity Alignment for Physically Plausible Video Generation

Manjin Kim, Suha Kwak, Minsu Cho

机构 * Pohang University of Science and Technology (POSTECH)(浦项科学技术大学)

专题命中 安全评测 :alignment(title,title_cn)

AI总结 提出Tempered Self-Similarity Alignment (TSA)损失函数,通过将视觉基础模型中的时空自相似性关系知识迁移到视频生成模型中,以改善视频的物理合理性。

Comments Accepted to the CVPR 2026 Workshop on Video Generative Models: Benchmarks and Evaluation (VGBE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08542 2026-08-11 cs.LG 新提交 89%

When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs

当技能与安全相遇:对技能合并大语言模型的自适应越狱鲁棒性进行基准测试与表征

Yu Ma, Hongli Shi, Jing Li, Xinran Xu, Weiwei Hou

机构 * Google(谷歌公司) University of New South Wales(新南威尔士大学) University of Technology Sydney(悉尼科技大学) Zhejiang University(浙江大学) Australian National University(澳大利亚国立大学)

专题命中 安全评测 :safety(title,abstract);jailbreak(title,abstract);alignment(abstract);分类 cs.LG

AI总结 本研究针对技能合并大语言模型,构建SkillSafe-Bench基准,发现静态安全无法预测其自适应越狱鲁棒性,提出SubSafe-Merge方法可在保留能力的同时消除安全侵蚀。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29759 2026-07-17 cs.CV cs.AI 版本更新 89%

TSHA: A Benchmark for Visual Language Models in Trustworthy Safety Hazard Assessment Scenarios

TSHA:用于可信安全危害评估场景的视觉语言模型基准

Qiucheng Yu, Ruijie Xu, Mingang Chen, Jianfeng Dong, Xin Tan

机构 * City University of Hong Kong(香港城市大学) East China Normal University(华东师范大学) University of Western Australia(西澳大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Development Center of Computer Software Technology(上海计算机软件技术开发中心) Zhejiang Gongshang University(浙江工商大学)

专题命中 安全评测 :safety(title,abstract);trustworthy(title,abstract_cn);分类 cs.AI

AI总结 本文提出TSHA基准,通过81809个精心挑选的训练样本和1707个挑战性测试样本,评估视觉语言模型在复杂家庭安全场景中的鲁棒性和泛化能力,发现现有模型在安全危害评估中存在显著不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25034 2026-06-29 cs.CV cs.AI 新提交 89%

Yuvion VL: A Multimodal Foundation Model for Adversarial Content and AI Safety

Yuvion VL:面向对抗性内容和AI安全的多模态基础模型

Shikai Qiu, Xiaowen Xu, Benlei Cui, Ting Ma, Xiufeng Huang, Wenjing Jiang, Shaoxuan He, Haolei Xu, Chunyang Chai, Yujian Li, Yiliang Zhang, Guanghui Wang, Ziheng Wang, Ziwen Xu, Zhaoyu Fan, Jinhao Chen, Ruijie Jian, Hongxing Li, Chuxi Xiao, Xinyue Chen, Wenxuan Liu, Libin Dong, Yupeng Cao, Xiaoqian Xia, Jing Wang, Zhe Jiang, Zhenan Ye, Guang Yang, Bin Liu, Wei Peng, Ziqiang Zhu, Meihui Lian, Kaiwen Lv Kacuila, Haidong Ding, Dongjie Zhang, Yangfan Zhou, Bingyu Zhu, Yan Wang, Hai Zhao, Xuan Jin, Wei Zhao, Pengfei Sun, Huiming Zhang, Wei Wang, Xipeng Cao, Jialun Chen, Xiao Chen, Shaola Ren, Yunqing Hu, Bin Li, Chengwen Yao, Meng Huang, Xianfeng Li, Bin Tang, Chao Liu, Hui Xue, Longtao Huang, Haiwen Hong

机构 * Alibaba Security AGI Lab(阿里巴巴安全AGI实验室)

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 提出Yuvion VL系列多模态大语言模型,通过对抗性感知数据合成、三阶段训练和混淆对比微调,在内容和AI安全任务上达到行业领先性能,同时保持通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07259 2026-02-10 cs.AI 89%

Incentive-Aware AI Safety via Strategic Resource Allocation: A Stackelberg Security Games Perspective

通过战略资源分配实现激励感知的AI安全:从Stackelberg安全游戏视角出发

Cheol Woo Kim, Davin Choo, Tzeh Yuan Neoh, Milind Tambe

机构 * Harvard University(哈佛大学)

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 本文提出基于Stackelberg安全游戏的AI安全框架,通过战略资源分配设计激励机制,提升AI监管的主动性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16506 2026-01-26 cs.CR cs.AI 89%

SafeThinker: Reasoning about Risk to Deepen Safety Beyond Shallow Alignment

SafeThinker: 通过风险推理深化安全对齐

Xianya Fang, Xianying Luo, Yadong Wang, Xiang Chen, Yu Tian, Zequn Sun, Rui Liu, Jun Fang, Naiqiang Tan, Yuanning Cui, Sheng-Jun Huang

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Didi International Business Group(滴滴国际商务集团) Institute for AI, Tsinghua University(清华大学人工智能研究院) Nanjing University of Information Science & Technology(南京信息科学技术大学)

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.AI

AI总结 SafeThinker通过动态分配防御资源,有效提升模型对伪装攻击的防御能力,同时保持实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00081 2025-12-01 cs.MA cs.AI 89%

From homeostasis to resource sharing: Biologically and economically aligned multi-objective multi-agent gridworld-based AI safety benchmarks

从稳态到资源共享:生物和经济对齐的多目标多智能体网格世界基于AI安全基准

Roland Pihlakas

机构 * Independent researcher(独立研究者)

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 本文提出生物和经济对齐的多目标多智能体网格世界基准,用于评估AI安全中的稳态、 diminishing returns、可持续性和资源共享等关键问题。

Comments 21 pages, 13 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11235 2025-10-14 cs.AI 89%

AI Alignment Strategies from a Risk Perspective: Independent Safety Mechanisms or Shared Failures?

Leonard Dung, Florian Mai

机构 * Ruhr-Universität Bochum(博尔塔伦大学) Rheinische Friedrich-Wilhelms-Universität Bonn(波恩莱茵-斐迪南-威廉大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔人工智能与机器学习研究所)

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);AI safety(abstract);分类 cs.AI

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13339 2025-09-18 cs.AI 89%

Position: AI Safety Must Embrace an Antifragile Perspective

Ming Jin, Hyunin Lee

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);alignment(abstract);分类 cs.AI

Journal ref Proceedings of the 42nd International Conference on Machine Learning, Vancouver, Canada. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05541 2025-05-12 cs.AI 89%

Safety by Measurement: A Systematic Literature Review of AI Safety Evaluation Methods

Markov Grey, Charbel-Raphaël Segerie

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);red teaming(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21792 2024-12-30 cs.LG cs.AI cs.CL cs.CY 89%

Safetywashing: Do AI Safety Benchmarks Actually Measure Safety Progress?

Richard Ren, Steven Basart, Adam Khoja, Alice Gatti, Long Phan, Xuwang Yin, Mantas Mazeika, Alexander Pan, Gabriel Mukobi, Ryan H. Kim, Stephen Fitz, Dan Hendrycks

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.CL、cs.AI、cs.CY

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03919 2026-08-03 cs.CR 版本更新 89%

When Safety Becomes a Vulnerability: Exploiting LLM Alignment Homogeneity for Transferable Blocking in RAG

当安全成为漏洞:利用LLM对齐同质性进行可转移阻塞在RAG中

Junchen Li, Liang Xu, Qizhi Chen, Rongzheng Wang, Chao Qi, Shihao He, Di Liang, Haibo Shi, Shuang Liang

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);prompt injection(abstract)

AI总结 TabooRAG通过利用LLM对齐同质性,在黑盒环境下实现跨模型的可转移阻塞攻击,针对安全对齐机制提出新型攻击框架。

Comments Expanded the scale of the experimental evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16660 2026-02-19 cs.CL cs.AI cs.LG 89%

Align Once, Benefit Multilingually: Enforcing Multilingual Consistency for LLM Safety Alignment

一次对齐,多语言受益:为LLM安全对齐强制多语言一致性

Yuyan Bu, Xiaohao Liu, ZhaoXing Ren, Yaodong Yang, Juntao Dai

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) National University of Singapore(新加坡国立大学) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种资源高效的多语言一致性对齐方法,通过多语言一致性损失实现多语言同时对齐,提升跨语言安全性和泛化能力。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18214 2025-12-04 cs.CV cs.AI cs.CL cs.LG 89%

VLSU: Mapping the Limits of Joint Multimodal Understanding for AI Safety

VLSU:联合多模态理解在AI安全中的极限映射

Shruti Palaskar, Leon Gatys, Mona Abdelrahman, Mar Jacobo, Larry Lindsey, Rutika Moharir, Gunnar Lund, Yang Xu, Navid Shiee, Jeffrey Bigham, Charles Maalouf, Joseph Yitan Cheng

机构 * Apple(苹果公司)

专题命中 安全评测 :safety(title,abstract);AI safety(title);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 VLSU通过细粒度分类和组合分析,揭示了多模态安全评估中联合理解的缺陷,为改进AI安全研究提供关键测试平台。

Comments 10 pages, 5 figures, 4 tables, detailed appendix. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16637 2024-10-29 cs.CL cs.AI cs.LG 89%

Course-Correction: Safety Alignment Using Synthetic Preferences

Rongwu Xu, Yishuo Cai, Zhenhong Zhou, Renjie Gu, Haiqin Weng, Yan Liu, Tianwei Zhang, Wei Xu, Han Qiu

专题命中 安全评测 :safety(title,abstract);alignment(title);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Paper accepted to EMNLP 2024. Camera-ready version. We have released our dataset and scripts at https://github.com/pillowsofwind/Course-Correction

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05388 2024-05-17 cs.SE cs.AI cs.CY cs.LG 89%

An AI System Evaluation Framework for Advancing AI Safety: Terminology, Taxonomy, Lifecycle Mapping

Boming Xia, Qinghua Lu, Liming Zhu, Zhenchang Xing

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI、cs.CY、cs.LG

Comments 1st ACM International Conference on AI-powered Software (AIware)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14186 2024-12-24 cs.CY cs.AI cs.CL cs.LG 89%

Towards AI-$45^{\circ}$ Law: A Roadmap to Trustworthy AGI

Chao Yang, Chaochao Lu, Yingchun Wang, Bowen Zhou

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);safety(abstract);AI safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17003 2026-08-05 cs.CY cs.CL 版本更新 88%

Beyond Simulations: What 20,000 Real Conversations Reveal About Mental Health AI Safety

超越模拟:20000次真实对话揭示心理健康AI安全

Caitlin A. Stamatis, Jonah Meyerhoff, Richard Zhang, Olivier Tieleman, Matteo Malgaroli, Thomas D. Hull

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.CL、cs.CY

AI总结 本研究通过分析20000次真实对话,揭示心理健康AI在现实应用中的安全性能差异,指出专门设计的AI在减少有害内容生成方面表现更优,但测试集失败率高于实际部署,强调需转向持续的安全保障而非有限的基准认证。

Comments 43 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29581 2026-07-16 cs.LG cs.AI 版本更新 88%

The Joint Effect of Quantization and Sampling Temperature on LLM Safety Alignment: A Factorial Analysis

量化和采样温度对LLM安全对齐的联合效应:一项因子分析

Hari Prasad, Ritam Pal

机构 * Conscious Engines(意识引擎)

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG

AI总结 通过因子分析评估9个模型在3种精度和6种温度下的安全对齐,发现量化通常安全中性,而高温增加决策不稳定性,且两者无系统性叠加效应。

Comments 11 pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28332 2026-06-30 cs.CY cs.AI 88%

When Medical Safety Alignment Fails: A Benchmark for Evaluating LLMs on High-Risk Medical Queries

当医疗安全对齐失败:评估LLMs在高风险医疗查询上的基准

Yige Li, Jun Sun, Wei Zhao, Zhe Li, Yutao Wu, Hanxun Huang, Xiang Zheng, Xingjun Ma

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.CY

AI总结 提出MedHarm基准,包含1100个高风险医疗查询,评估15个LLM在毒理学、药理学等10个安全关键类别上的表现,发现对齐模型仍可能产生不安全响应,医疗微调会加剧危害,外部护栏存在脆弱性。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23858 2026-06-24 cs.LG cs.AI cs.CR 新提交 88%

Are Safety Guarantees in Neural Networks Safe? How to Compute Trustworthy Robustness Certifications

神经网络中的安全保障真的安全吗?如何计算可信的鲁棒性认证

Merkouris Papamichail, Konstantinos Varsos, Giorgos Flouris, João Marques-Silva

机构 * University of Crete(克里特大学) Catalan Institution for Research and Advanced Studies(加泰罗尼亚研究与高等研究院) University of Lleida(莱里达大学)

专题命中 安全评测 :safety(title,abstract);trustworthy(title);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 针对神经网络对抗样本问题,提出apothem度量以线性时间计算最优鲁棒性认证,并证明体积最优认证的不可行性,引入双重认证和ParallelepipedoNN系统,在MNIST等基准上实现至少两倍的最小边长改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29224 2026-05-29 cs.CL cs.AI cs.CR 88%

Relevance as a Vulnerability: How Web Retrieval Degrades Safety Alignment in LLM Agents

相关性即漏洞:网络检索如何削弱LLM智能体的安全对齐

Aditya Nawal, Manit Baser, Mohan Gurusamy

机构 * Department of Electrical and Computer Engineering(电子与计算机工程系) National University of Singapore(新加坡国立大学)

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出AgentREVEAL框架,分析检索集成方式和内容属性如何导致LLM智能体安全退化,发现相关性是共同激活条件,并引入HarmURLBench基准。

详情

展开后加载摘要…

URL PDF HTML 收藏