arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9238 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9238 篇

2505.21605 2026-04-07 cs.LG cs.AI cs.CR 88%

SoSBench: Benchmarking Safety Alignment on Six Scientific Domains

SoSBench:在六个科学领域中对安全对齐进行基准测试

Fengqing Jiang, Fengbo Ma, Zhangchen Xu, Yuetai Li, Zixin Rao, Bhaskar Ramasubramanian, Luyao Niu, Bo Li, Xianyan Chen, Zhen Xiang, Radha Poovendran

机构 * University of Washington(华盛顿大学) University of Georgia(佐治亚大学) WWU(西华盛顿大学) UIUC(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG

AI总结 SoSBench针对高风险科学领域设计,通过3000个基于真实法规的提示评估大模型的安全性,揭示了先进模型在处理危险场景时存在严重的安全对齐缺陷。

Comments Project Page: https://sosbench.github.io/; ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26676 2026-03-31 cs.CY cs.AI cs.HC 88%

Evaluating Human-AI Safety: A Framework for Measuring Harmful Capability Uplift

评估人机安全:衡量有害能力提升的框架

Michelle Vaccaro, Jaeyoon Song, Abdullah Almaatouq, Michiel A. Bakker

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI、cs.CY

AI总结 本文提出通过测量前沿模型带来的有害能力提升,推动人中心的AI安全评估,提供系统性测量方法和行动步骤。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08723 2026-03-12 cs.CY cs.AI 88%

Alignment as Iatrogenesis: Pastoral Power, Collective Pathology, and the Structural Limits of Monolingual Safety Evaluation

对齐作为医源性:牧师权力、集体病理学以及单语安全评估的结构性限制

Hiroki Fukui

机构 * Research Institute of Criminal Psychiatry(刑事精神病研究所以) Sex Offender Medical Center(性犯罪医疗中心) Department of Neuropsychiatry, Graduate School of Medicine, Kyoto University(京都大学医学研究生院神经精神病学系)

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.CY

AI总结 本文通过多语言实验揭示,单语安全评估无法捕捉对齐设计导致的集体病理效应,指出语言切换影响病理模式的定性与幅度。

Comments 30 pages, 1 figure, 24-page supplementary. Preprint v3. Companion paper: arXiv:2603.04904. Previous versions: Zenodo DOI 10.5281/zenodo.18646998

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04904 2026-03-06 cs.AI cs.CL 88%

Alignment Backfire: Language-Dependent Reversal of Safety Interventions Across 16 Languages in LLM Multi-Agent Systems

对齐反噬:在16种语言的LLM多智能体系统中语言依赖性的安全干预逆转

Hiroki Fukui

机构 * Research Institute of Criminal Psychiatry / Sex Offender Medical Center(犯罪精神病研究所以及性犯罪医疗中心) Department of Neuropsychiatry, Kyoto University(京都大学神经精神病学系)

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究发现,在不同语言的LLM多智能体系统中,对齐干预可能导致安全措施的逆转,揭示了语言空间对对齐效果的决定性影响。

Comments 89 pages, 4 figures, 4 supplementary figures, 12 supplementary tables; preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08236 2026-02-16 cs.CL cs.CY 88%

Exploring Safety Alignment Evaluation of LLMs in Chinese Mental Health Dialogues via LLM-as-Judge

通过LLM-as-Judge探索LLM在中文心理健康对话中的安全对齐评估

Yunna Cai, Fan Wang, Haowei Wang, Kun Wang, Kailai Yang, Sophia Ananiadou, Moyan Li, Mingming Fan

机构 * HKUST(GZ)(香港科技大学(广州)) Wuhan Univ.(武汉大学) Univ. of Iowa(爱荷华大学) Univ. of Manchester(曼彻斯特大学)

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.CY

AI总结 本文提出PsyCrisis-Bench,通过LLM-as-Judge方法评估LLM在中文心理健康对话中的安全对齐性,提供高质量数据集和可解释的评估工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11090 2026-02-10 cs.CL cs.AI 88%

SafeDialBench: A Fine-Grained Safety Evaluation Benchmark for Large Language Models in Multi-Turn Dialogues with Diverse Jailbreak Attacks

SafeDialBench: 一种用于多轮对话中大型语言模型安全评估的细粒度基准,针对多样化对抗攻击

Hongye Cao, Sijia Jing, Yanming Wang, Ziyue Peng, Zhixin Bai, Zhe Cao, Meng Fang, Fan Feng, Boyan Wang, Jiaheng Liu, Tianpei Yang, Jing Huo, Yang Gao, Fanyu Meng, Xi Yang, Chao Deng, Junlan Feng

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) University of Liverpool(利物浦大学) City University of Hong Kong(香港城市大学) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) China Mobile Research Institute(中国移动研究院) China Mobile (Suzhou) Software Technology Co., Ltd(中国移动苏州软件技术有限公司)

专题命中 安全评测 :safety(title,abstract);jailbreak(title,abstract);分类 cs.CL、cs.AI

AI总结 SafeDialBench提出了一种细粒度基准,用于评估大型语言模型在多轮对话中面对多样化对抗攻击时的安全性,通过多维度分类和对抗攻击策略提升评估精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06268 2026-02-09 cs.CL cs.LG 88%

MPIB: A Benchmark for Medical Prompt Injection Attacks and Clinical Safety in LLMs

MPIB:用于医疗提示注入攻击和大语言模型临床安全性的基准

Junhyeok Lee, Han Jang, Kyu Sung Choi

机构 * Seoul National University College of Medicine(首尔国立大学医学院) Seoul National University(首尔国立大学) Seoul National University College of Medicine, Seoul National University Hospital(首尔国立大学医学院、首尔国立大学医院)

专题命中 安全评测 :safety(title,abstract);prompt injection(title,abstract);分类 cs.CL、cs.LG

AI总结 MPIB是一个用于评估医疗提示注入攻击和大语言模型临床安全性的基准,通过测量临床危害事件率和攻击成功率来评估模型的安全性。

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00061 2026-02-03 cs.CY cs.AI 88%

Simple Role Assignment is Extraordinarily Effective for Safety Alignment

简单的角色分配在安全对齐中表现尤为有效

Zhou Ziheng, Jiakun Ding, Zhaowei Zhang, Ruosen Gao, Yingnian Wu, Demetri Terzopoulos, Yipeng Kang, Fangwei Zhong, Junqi Wang

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Tianjin University(天津大学) Peking University(北京大学) Zhejiang University(浙江大学) Beijing Institute of General Artificial Intelligence(北京一般人工智能研究院)

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.CY

AI总结 本研究提出基于角色条件化的安全对齐方法,通过角色隐含编码价值观和认知模式,有效降低不安全输出,适用于多种AI对齐任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21552 2025-12-29 cs.CY cs.AI cs.HC 88%

Bidirectional Human-AI Alignment in Education for Trustworthy Learning Environments

教育中的人机双向对齐以实现可信学习环境

Hua Shen

专题命中 安全评测 :alignment(title,abstract);trustworthy(title,abstract);分类 cs.AI、cs.CY

AI总结 本文探讨教育中人机双向对齐,旨在通过培养教师、学生和机构的技术素养,实现可信学习环境,促进公平性、透明度和人类发展。

Comments Book Chapter

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10085 2025-10-14 cs.CR cs.AI cs.LG 88%

Pharmacist: Safety Alignment Data Curation for Large Language Models against Harmful Fine-tuning

Guozhi Liu, Qi Mu, Tiansheng Huang, Xinhua Wang, Li Shen, Weiwei Lin, Zhang Li

机构 * School of Computer Science and Engineering, South China University of Technology(华南理工大学计算机科学与工程学院) School of Computer Science at Georgia Institute of Technology(佐治亚理工学院计算机科学系) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络科学与技术学院) Second Affiliated Hospital of Guangzhou University of Chinese Medicine(广州中医药大学第二附属医院) China and Pengcheng Laboratory(中 Pengcheng 实验室)

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13179 2025-08-20 cs.CY cs.AI 88%

Toward an African Agenda for AI Safety

Samuel T. Segun, Rachel Adams, Ana Florido, Scott Timcke, Jonathan Shock, Leah Junck, Fola Adeleke, Nicolas Grossman, Ayantola Alayande, Jerry John Kponyo, Matthew Smith, Dickson Marfo Fosu, Prince Dawson Tetteh, Juliet Arthur, Stephanie Kasaon, Odilile Ayodele, Laetitia Badolo, Paul Plantinga, Michael Gastrow, Sumaya Nur Adan, Joanna Wiaterek, Cecil Abungu, Kojo Apeagyei, Luise Eder, Tegawende Bissyande

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI、cs.CY

Comments 28 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13383 2025-07-21 cs.LG cs.AI cs.CV 88%

Whose View of Safety? A Deep DIVE Dataset for Pluralistic Alignment of Text-to-Image Models

Charvi Rastogi, Tian Huey Teh, Pushkar Mishra, Roma Patel, Ding Wang, Mark Díaz, Alicia Parrish, Aida Mostafazadeh Davani, Zoe Ashwood, Michela Paganini, Vinodkumar Prabhakaran, Verena Rieser, Lora Aroyo

机构 * Google DeepMind(谷歌DeepMind) Google Research(谷歌研究)

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG

Comments 28 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07735 2025-07-11 cs.LG cs.CL cs.CR 88%

GuardVal: Dynamic Large Language Model Jailbreak Evaluation for Comprehensive Safety Testing

Peiyan Zhang, Haibo Jin, Liying Kang, Haohan Wang

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Hong Kong Polytechnic University(香港理工大学)

专题命中 安全评测 :safety(title,abstract);jailbreak(title,abstract);分类 cs.CL、cs.LG

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20949 2025-06-27 cs.AI cs.CL 88%

Beyond Reactive Safety: Risk-Aware LLM Alignment via Long-Horizon Simulation

Chenkai Sun, Denghui Zhang, ChengXiang Zhai, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00555 2025-06-06 cs.CR cs.AI cs.LG 88%

Safety Tax: Safety Alignment Makes Your Large Reasoning Models Less Reasonable

Tiansheng Huang, Sihao Hu, Fatih Ilhan, Selim Furkan Tekin, Zachary Yahn, Yichang Xu, Ling Liu

机构 * School of Computer Science(计算机科学学院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00676 2025-06-03 cs.LG cs.AI 88%

SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning

Saad Hossain, Samanvay Vajpayee, Sirisha Rambhatla

机构 * Critical ML Lab(关键机器学习实验室) University of Toronto(多伦多大学) University of Waterloo(滑铁卢大学)

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18956 2025-03-26 cs.CY cs.AI 88%

International Agreements on AI Safety: Review and Recommendations for a Conditional AI Safety Treaty

Rebecca Scholefield, Samuel Martin, Otto Barten

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI、cs.CY

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04746 2025-03-10 cs.CY cs.AI 88%

Emerging Practices in Frontier AI Safety Frameworks

Marie Davidsen Buhl, Ben Bucknall, Tammy Masterson

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI、cs.CY

Comments 38 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08968 2025-03-05 cs.CL cs.AI 88%

Controllable Safety Alignment: Inference-Time Adaptation to Diverse Safety Requirements

Jingyu Zhang, Ahmed Elgohary, Ahmed Magooda, Daniel Khashabi, Benjamin Van Durme

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI

Comments ICLR 2025 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16776 2025-02-25 cs.CL cs.AI 88%

AISafetyLab: A Comprehensive Framework for AI Safety Evaluation and Improvement

Zhexin Zhang, Leqi Lei, Junxiao Yang, Xijie Huang, Yida Lu, Shiyao Cui, Renmiao Chen, Qinglin Zhang, Xinyuan Wang, Hao Wang, Hao Li, Xianqi Lei, Chengwei Pan, Lei Sha, Hongning Wang, Minlie Huang

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.CL、cs.AI

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12241 2024-05-15 cs.CL cs.AI 88%

Introducing v0.5 of the AI Safety Benchmark from MLCommons

Bertie Vidgen, Adarsh Agrawal, Ahmed M. Ahmed, Victor Akinwande, Namir Al-Nuaimi, Najla Alfaraj, Elie Alhajjar, Lora Aroyo, Trupti Bavalatti, Max Bartolo, Borhane Blili-Hamelin, Kurt Bollacker, Rishi Bomassani, Marisa Ferrara Boston, Siméon Campos, Kal Chakra, Canyu Chen, Cody Coleman, Zacharie Delpierre Coudert, Leon Derczynski, Debojyoti Dutta, Ian Eisenberg, James Ezick, Heather Frase, Brian Fuller, Ram Gandikota, Agasthya Gangavarapu, Ananya Gangavarapu, James Gealy, Rajat Ghosh, James Goel, Usman Gohar, Sujata Goswami, Scott A. Hale, Wiebke Hutiri, Joseph Marvin Imperial, Surgan Jandial, Nick Judd, Felix Juefei-Xu, Foutse Khomh, Bhavya Kailkhura, Hannah Rose Kirk, Kevin Klyman, Chris Knotz, Michael Kuchnik, Shachi H. Kumar, Srijan Kumar, Chris Lengerich, Bo Li, Zeyi Liao, Eileen Peters Long, Victor Lu, Sarah Luger, Yifan Mai, Priyanka Mary Mammen, Kelvin Manyeki, Sean McGregor, Virendra Mehta, Shafee Mohammed, Emanuel Moss, Lama Nachman, Dinesh Jinenhally Naganna, Amin Nikanjam, Besmira Nushi, Luis Oala, Iftach Orr, Alicia Parrish, Cigdem Patlak, William Pietri, Forough Poursabzi-Sangdeh, Eleonora Presani, Fabrizio Puletti, Paul Röttger, Saurav Sahay, Tim Santos, Nino Scherrer, Alice Schoenauer Sebag, Patrick Schramowski, Abolfazl Shahbazi, Vin Sharma, Xudong Shen, Vamsi Sistla, Leonard Tang, Davide Testuggine, Vithursan Thangarasa, Elizabeth Anne Watkins, Rebecca Weiss, Chris Welty, Tyler Wilbers, Adina Williams, Carole-Jean Wu, Poonam Yadav, Xianjun Yang, Yi Zeng, Wenhui Zhang, Fedor Zhdanov, Jiacheng Zhu, Percy Liang, Peter Mattson, Joaquin Vanschoren

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.05374 2024-03-22 cs.AI cs.LG 88%

Trustworthy LLMs: a Survey and Guideline for Evaluating Large Language Models' Alignment

Yang Liu, Yuanshun Yao, Jean-Francois Ton, Xiaoying Zhang, Ruocheng Guo, Hao Cheng, Yegor Klochkov, Muhammad Faaiz Taufiq, Hang Li

专题命中 安全评测 :alignment(title,abstract);trustworthy(title);safety(abstract);分类 cs.AI、cs.LG

Comments Fixed several typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22037 2025-05-29 cs.CL cs.CR cs.SE 88%

Jailbreak Distillation: Renewable Safety Benchmarking

Jingyu Zhang, Ahmed Elgohary, Xiawei Wang, A S M Iftekhar, Ahmed Magooda, Benjamin Van Durme, Daniel Khashabi, Kyle Jackson

机构 * Microsoft Responsible AI Research(微软负责任人工智能研究) Johns Hopkins University(约翰霍普金斯大学)

专题命中 安全评测 :jailbreak(title,abstract);safety(title,abstract);分类 cs.CL

Comments Project page: https://aka.ms/jailbreak-distillation

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.08487 2023-08-29 cs.CL 88%

Latent Jailbreak: A Benchmark for Evaluating Text Safety and Output Robustness of Large Language Models

Huachuan Qiu, Shuai Zhang, Anqi Li, Hongliang He, Zhenzhong Lan

专题命中 安全评测 :jailbreak(title,abstract);safety(title,abstract);分类 cs.CL

Comments Code and data are available at https://github.com/qiuhuachuan/latent-jailbreak

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14487 2024-11-25 cs.CL cs.AI cs.CY 88%

Ensuring Safety and Trust: Analyzing the Risks of Large Language Models in Medicine

Yifan Yang, Qiao Jin, Robert Leaman, Xiaoyu Liu, Guangzhi Xiong, Maame Sarfo-Gyamfi, Changlin Gong, Santiago Ferrière-Steinert, W. John Wilbur, Xiaojun Li, Jiaxin Yuan, Bang An, Kelvin S. Castro, Francisco Erramuspe Álvarez, Matías Stockle, Aidong Zhang, Furong Huang, Zhiyong Lu

专题命中 安全评测 :safety(title,abstract);alignment(abstract);trustworthy(abstract);AI safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03793 2026-08-12 cs.CL cs.CV 版本更新 88%

Exploring Adversarial Robustness and Safety Alignment in Multilingual Multi-Modal Large Language Models

探索多语言多模态大语言模型的对抗鲁棒性与安全对齐

Hashmat Shadab Malik, Muzammal Naseer, Salman Khan

机构 * Mohamed Bin Zayed University of AI, UAE(穆罕默德·本·扎耶德人工智能大学,阿联酋) Khalifa University, UAE(卡比拉大学,阿联酋) Australian National University, Australia(澳大利亚国立大学,澳大利亚)

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.CL

AI总结 本研究通过梯度攻击和跨语言评估,发现多语言多模态大语言模型存在可迁移的对抗脆弱性,并揭示低资源语言因理解失败而呈现的虚假安全现象,提出深层训练整合才能实现真正的多语言安全对齐。

Journal ref The 37th British Machine Vision Conference (BMVC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23112 2026-08-06 cs.CY 版本更新 88%

How Should AI Safety Benchmarks Benchmark Safety?

AI安全基准应该如何进行基准测试?

Cheng Yu, Severin Engelmann, Ruoxuan Cao, Dalia Ali, Orestis Papakyriakopoulos

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY

AI总结 本文提出改进AI安全基准的方法,通过系统回顾210个基准,指出其技术、知识论和社会技术缺陷,并提出稳健度量和风险管理原则以提升基准有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27917 2026-07-31 cs.AI 新提交 88%

One Anchor for All: Unified Multilingual and Multimodal Safety Alignment for LVLMs

统一多语言多模态的LVLM安全对齐:一个通用锚点

Enyi Shi, Fei Shen, Chuancheng Shi, Linxia Zhu, Shuyi Miao, Jinhui Tang, Tat-Seng Chua

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 针对LVLM面临的多语言多模态复合攻击防御难题,提出MLS-Neurons驱动的跨维度安全对齐框架,仅更新约0.03%参数实现安全监督迁移,在多语言多模态安全基准上性能优于SOTA且保留通用实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23365 2026-07-28 cs.SE cs.AI cs.CR 新提交 88%

On AI Safety and Security Technical Debt in Engineering AI-Enabled Systems

关于人工智能系统工程中的人工智能安全与保障技术债务

Muhammad Tukur, Hayatullahi B. Adeyemo, Tao Chen, Nour Ali, Anis Zarrad, Rick Kazman, Marco Agus, Rami Bahsoon

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI

AI总结 研究人工智能系统工程中的安全与保障技术债务,通过系统综述识别31种AITD并分类,分析其与信任问题的关联,合成34条指南,引入AITD - MAP框架,助工程师应对AITDs。

Comments 64 pages, 7 figures, 8 tables, submitted to ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07229 2026-07-09 cs.AI 新提交 88%

Reasoning Consistency Scanning: A Framework for Auditing Chain-of-Thought Validity in AI Safety Evaluations

推理一致性扫描:人工智能安全评估中思维链有效性审计的框架

Silvia Santano

机构 * Meridian Labs(子午线实验室) UK AI Safety Institute(英国人工智能安全研究所)

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI

AI总结 研究人工智能安全评估中思维链推理的可靠性问题,提出推理一致性扫描方法,将其与可靠性区分并形式化,构建基准、实现扫描器,通过实验表明推理不一致存在且可检测,在模型和任务类型中有系统变化。

详情

展开后加载摘要…

URL PDF HTML 收藏