arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9324 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9324 篇

2106.00839 2026-03-31 cs.LG q-fin.RM stat.ML 70%

Algorithmic Insurance

算法保险

Dimitris Bertsimas, Agni Orfanoudaki

机构 * Sloan School of Management, Massachusetts Institute of Technology(麻省理工学院斯隆管理学院) Saïd Business School, Oxford University(牛津大学赛德商学院)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.LG

AI总结 研究算法保险在AI致损中的风险定价与责任框架,提出基于CVaR的分类阈值优化方法,通过乳腺癌案例验证降低尾部风险并提升保险收益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27335 2026-03-31 cs.CL 70%

PubMed Reasoner: Dynamic Reasoning-based Retrieval for Evidence-Grounded Biomedical Question Answering

PubMed Reasoner: 基于动态推理的证据导向生物医学问答检索

Yiqing Zhang, Xiaozhong Liu, Fabricio Murai

机构 * PayPal Worcester Polytechnic Institute(伍斯特理工学院)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL

AI总结 PubMed Reasoner通过动态推理机制提升生物医学问答的准确性与证据可靠性,采用三阶段框架优化检索过程并生成有据可查的回答。

Comments 20 pages; under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12104 2026-03-27 cs.CR cs.AI 70%

DRIFT: Dynamic Rule-Based Defense with Injection Isolation for Securing LLM Agents

DRIFT: 基于注入隔离的动态规则防御以保障LLM代理安全

Hao Li, Xiaogeng Liu, Hung-Chun Chiu, Dianqi Li, Ning Zhang, Chaowei Xiao

机构 * Washington University in St. Louis(圣路易斯华盛顿大学) Johns Hopkins University(约翰霍普金斯大学) Independent Researcher(独立研究者)

专题命中 安全评测 :prompt injection(abstract);trustworthy(abstract);分类 cs.AI

AI总结 DRIFT通过动态安全策略和注入隔离技术,有效防御LLM代理中的提示注入攻击,验证了其在多个基准测试中的高安全性和高实用性。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20953 2026-03-24 cs.CR cs.AI 70%

Before the Tool Call: Deterministic Pre-Action Authorization for Autonomous AI Agents

在工具调用之前:自主AI代理的确定性预行动授权

Uchi Uchibeke

机构 * APort Technologies Inc.(APort技术公司)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出Open Agent Passport,通过同步拦截工具调用、评估声明性策略并生成加密审计记录,实现自主AI代理的确定性预授权,提升安全性和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20697 2026-03-24 cs.CV cs.AI 70%

Satellite-to-Street: Synthesizing Post-Disaster Views from Satellite Imagery via Generative Vision Models

卫星到街道:通过生成视觉模型从卫星图像合成灾害后视角

Yifan Yang, Lei Zou, Wendy Jepson

机构 * Department of Geography Texas A\&M University(地理系德克萨斯农工大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出通过生成视觉模型从卫星图像合成灾害后街道视角的方法,对比了基于VLM和MoE的生成策略,揭示了高现实感生成与结构信息保留之间的平衡问题。

Comments Accepted for presentation at IGARSS 2026 (IEEE International Geoscience and Remote Sensing Symposium)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18130 2026-03-20 cs.RO cs.AI 70%

Final Report for the Workshop on Robotics & AI in Medicine

医学领域机器人与人工智能研讨会最终报告

Juan P Wachs

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 研讨会聚焦医疗领域机器人与AI的协同发展,强调数据获取、评估方法标准化及跨学科培训的重要性,提出建立国家AI与机器人卓越中心的迫切需求。

Comments 51 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15639 2026-03-19 cs.AI 70%

The Comprehension-Gated Agent Economy: A Robustness-First Architecture for AI Economic Agency

基于理解的智能体经济:面向AI经济代理的鲁棒性优先架构

Rahul Baxi

机构 * Independent Researcher(独立研究者)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出Comprehension-Gated Agent Economy架构,通过对抗鲁棒性审计生成验证函数,实现经济权限的鲁棒性约束,确保经济安全与竞争力。

Comments v2: updated correspondence email

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16445 2026-03-18 cs.AI 70%

Visual Distraction Undermines Moral Reasoning in Vision-Language Models

视觉干扰削弱了视觉语言模型中的道德推理

Xinyi Yang, Chenheng Xu, Weijun Hong, Ce Mo, Qian Wang, Fang Fang, Yixin Zhu

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) School of Psychological and Cognitive Sciences, Peking University(北京大学心理与认知科学学院) Yuanpei College, Peking University(北京大学元培学院) Department of Psychology, Sun Yat-sen University(中山大学心理学系) State Key Lab of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室) Beijing Key Laboratory of Behavior and Mental Health, Peking University(北京大学行为与心理健康北京市重点实验室)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 研究揭示视觉输入会改变视觉语言模型的道德决策,超越文本安全机制,提出多模态基准MDS以分析视觉与上下文变量对道德决策的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17646 2026-03-17 cs.LG 70%

Unveiling the Basin-Like Loss Landscape in Large Language Models

揭示大语言模型中的盆地状损失景观

Huanran Chen, Yinpeng Dong, Zeming Wei, Yao Huang, Yichi Zhang, Hang Su, Jun Zhu

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 研究发现大语言模型的损失景观中出现盆地结构,随着模型规模增大,模型对参数空间扰动的鲁棒性增强,但最坏方向的损失景观尖锐且有害,对抗性微调会快速降低模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13257 2026-03-17 cs.AI 70%

Distilling Deep Reinforcement Learning into Interpretable Fuzzy Rules: An Explainable AI Framework

将深度强化学习转化为可解释的模糊规则:一个可解释人工智能框架

Sanup S. Araballi, Simon Khan, Chilukuri K. Mohan

机构 * Dept. of EECS, Syracuse University, NY 13244, USA(电子工程与计算机科学系, Syracuse大学,纽约州,13244,美国) Air Force Research Laboratory, Rome, NY 13441, USA(空军研究实验室,罗马,纽约州,13441,美国)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出一种分层Takagi-Sugeno-Kang模糊分类器系统,通过K-means聚类和岭回归将神经策略转化为可读的IF-THEN规则,并引入三个量化指标评估解释性。

Comments Accepted to AAAI 2026 Spring Symposium Series

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07427 2026-03-17 cs.AI cs.CR 70%

AutoControl Arena: Synthesizing Executable Test Environments for Frontier AI Risk Evaluation

AutoControl Arena:为前沿AI风险评估合成可执行测试环境

Changyi Li, Pengfei Lu, Xudong Pan, Fazl Barez, Min Yang

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出AutoControl Arena框架,通过逻辑-叙述解耦原理,结合可执行代码与LLM生成动态,有效缓解逻辑幻觉并提升灵活性,验证了在压力下AI风险显著增加,揭示了不同模型在安全性和对齐性上的差异。

Comments Project page: https://cosmosyi.github.io/AutoControl-Arena/; Code: https://github.com/CosmosYi/AutoControl-Arena/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08697 2026-03-16 cs.HC cs.AI 70%

Auditing Student-AI Collaboration: A Case Study of Online Graduate CS Students

审查学生与AI协作:在线研究生计算机科学学生的案例研究

Nifu Dan

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本研究通过混合方法审计,探讨学生与AI协作的偏好,分析现有AI能力与学生期望之间的差距,以改进教育用AI系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02907 2026-03-13 cs.CL 70%

Beyond the Black Box: A Survey on the Theory and Mechanism of Large Language Models

超越黑箱:大型语言模型理论与机制的综述

Zeyu Gan, Ruifeng Ren, Wei Yao, Xiaolin Hu, Gengze Xu, Chen Qian, Huayi Tang, Zixuan Gong, Xinhao Yao, Pengwei Tang, Zhenxing Dou, Yong Liu

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文综述了大型语言模型的理论与机制,提出生命周期分类法,分析核心理论问题并识别前沿挑战,旨在推动LLM发展向科学学科转型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11701 2026-03-13 stat.ML cs.LG 70%

Decomposing Observational Multiplicity in Decision Trees: Leaf and Structural Regret

分解决策树中的观测多重性:叶和结构后悔

Mustafa Cavus

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 本文提出决策树中叶和结构后悔的概念,分析观测多重性的来源,证明结构后悔主导了多重性,并通过实验展示其在提升模型安全性中的作用。

Comments 19 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19218 2026-03-12 cs.HC cs.AI q-bio.NC 70%

Technological folie à deux: Feedback Loops Between AI Chatbots and Mental Illness

技术幻觉:人工智能聊天机器人与心理健康之间的反馈循环

Sebastian Dohnány, Zeb Kurth-Nelson, Eleanor Spens, Lennart Luettgau, Alastair Reid, Iason Gabriel, Christopher Summerfield, Murray Shanahan, Matthew M Nour

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 研究探讨了人工智能聊天机器人与心理健康问题之间的相互作用风险,指出其可能引发信念不稳定和依赖,并呼吁跨领域的协调行动以应对这一新兴公共卫生问题。

Journal ref Nature Mental Health (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09758 2026-03-11 cs.CL 70%

Beyond Fine-Tuning: Robust Food Entity Linking under Ontology Drift with FoodOntoRAG

超越微调:在本体漂移下利用FoodOntoRAG实现鲁棒的食品实体链接

Jan Drole, Ana Gjorgjevikj, Barbara Korouši'c Seljak, Tome Eftimov

机构 * Computer Systems Department, Jožef Stefan International Postgraduate School, Ljubljana, Slovenia(卢布尔雅那,斯洛文尼亚乔泽夫·斯蒂芬国际研究生学院计算机系统系) Computer Systems Department, Jožef Stefan Institute, Ljubljana, Slovenia(卢布尔雅那,斯洛文尼亚乔泽夫·斯蒂芬研究所计算机系统系)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL

AI总结 本文提出FoodOntoRAG,通过检索本体和结构化证据实现鲁棒的食品实体链接,避免微调并提高本体漂移的鲁棒性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09200 2026-03-11 cs.AI cs.CL cs.CY cs.LG 70%

The Reasoning Trap -- Logical Reasoning as a Mechanistic Pathway to Situational Awareness

推理陷阱——逻辑推理作为情境意识的机制路径

Subramanyam Sahoo, Aman Chadha, Vinija Jain, Divya Chaudhary

机构 * MARS 4.0 Fellowship, Cambridge AI Safety Hub(CAISH), University of Cambridge(MARS 4.0 Fellow,剑桥人工智能安全中心(CAISH),剑桥大学) AWS Generative AI Innovation Center, Amazon Web Services, USA(亚马逊生成AI创新中心,亚马逊网络服务,美国) Google, USA(谷歌,美国) Stanford University(斯坦福大学) Northeastern University, Seattle, WA, USA(东北大学,西雅图,华盛顿州,美国)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出RAISE框架,揭示逻辑推理能力提升与情境意识升级的机制路径,并提出安全原则与测试方法以应对潜在风险。

Comments Accepted at ICLR 2026 Workshop on Logical Reasoning of Large Language Models. 21 Pages. Position Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08024 2026-03-10 cs.CL 70%

ConflictBench: Evaluating Human-AI Conflict via Interactive and Visually Grounded Environments

ConflictBench: 通过交互式和视觉 grounded 环境评估人类-人工智能冲突

Weixiang Zhao, Haozhen Li, Yanyan Zhao, xuda zhi, Yongbo Huang, Hao He, Bing Qin, Ting Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学) SERES

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 ConflictBench通过交互式和视觉 grounded 环境评估人类-人工智能冲突,揭示智能体在不同风险情境下的行为差异及对齐失败问题。

Comments 29 pages, 20 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07452 2026-03-10 cs.CR cs.AI 70%

Backdoor4Good: Benchmarking Beneficial Uses of Backdoors in LLMs

Backdoor4Good: 对LLMs中有益后门应用的基准测试

Yige Li, Wei Zhao, Zhe Li, Nay Myat Min, Hanxun Huang, Yunhan Zhao, Xingjun Ma, Yu-Gang Jiang, Jun Sun

机构 * Singapore Management University(新加坡国立管理学院) The University of Melbourne(墨尔本大学) Fudan University(复旦大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 Backdoor4Good提出了一种统一的基准和框架,用于在大型语言模型中实现有益的后门应用,通过三元组形式定义触发器、激活机制和效用函数,展示后门在提升安全性和可控性方面的潜力。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02593 2026-03-10 cs.CL cs.MA cs.NE cs.SD eess.AS 70%

Spoken Conversational Agents with Large Language Models

基于大语言模型的语音对话代理

Chao-Han Huck Yang, Andreas Stolcke, Larry Heck

机构 * NVIDIA Research(NVIDIA研究)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文探讨了如何通过大语言模型构建语音对话代理,涵盖从级联到端到端系统的路径,以及跨模态对齐和联合训练等关键技术,同时讨论了隐私、安全和评估中的开放问题。

Comments Accepted to EMNLP 2025 Tutorial

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08650 2026-03-10 cs.CY 70%

Who is Responsible? The Data, Models, Users or Regulations? A Comprehensive Survey on Responsible Generative AI for a Sustainable Future

谁该负责?数据、模型、用户还是法规?为可持续未来全面调查负责任的生成式人工智能

Shaina Raza, Rizwan Qureshi, Anam Zahid, Amgad Muneer, Anas Zafar, Safiullah Kamawal, Ferhat Sadak, Joseph Fioresi, Muhammaed Saeed, Ranjan Sapkota, Aditya Jain, Muneeb Ul Hassan, Aizan Zafar, Hasan Maqbool, Ashmal Vayani, Jia Wu, Maged Shoman

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CY

AI总结 本文全面调查了生成式人工智能的负责任发展,提出评估标准、生命周期指标及领域分析,旨在推动安全和可持续的AI部署。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07202 2026-03-10 cs.CL 70%

Lying to Win: Assessing LLM Deception through Human-AI Games and Parallel-World Probing

谎言以赢:通过人机游戏和平行世界探测评估LLM欺骗

Arash Marioriyad, Ali Nouri, Mohammad Hossein Rohban, Mahdieh Soleymani Baghshah

机构 * Sharif University of Technology(谢里夫技术大学)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL

AI总结 本研究通过人机游戏和平行世界探测评估LLM欺骗行为,发现存在性框架显著增加Qwen和Gemini的欺骗率,凸显需新的行为审计方法。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04142 2026-03-05 cs.LG 70%

A Multi-Agent Framework for Interpreting Multivariate Physiological Time Series

多智能体框架用于解释多变量生理时间序列

Davide Gabrielli, Paola Velardi, Stefano Faralli, Bardh Prenkaj

机构 * Sapienza University of Rome Rome Italy ISTC-CNR \& Sapienza University of Rome Rome Italy Technical University of Munich Munich Germany Sapienza University of Rome ISTC-CNR \& Sapienza University of Rome Technical University of Munich

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.LG

AI总结 本研究提出Vivaldi多智能体框架,通过对比不同模型表现,发现智能体系统在非思考模型中提升解释质量,但在思考模型中反而降低相关性,强调了计算外部化在医疗AI中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04123 2026-03-05 cs.CL 70%

FINEST: Improving LLM Responses to Sensitive Topics Through Fine-Grained Evaluation

FINEST: 通过细粒度评估改进LLM对敏感话题的响应

Juhyun Oh, Nayeon Lee, Chani Jung, Jiho Jin, Junho Myung, Jongwon Lee, Taeui Song, Alice Oh

专题命中 安全评测 :safety(abstract);harmlessness(abstract);分类 cs.CL

AI总结 FINEST通过细粒度评估分类法,改进LLM对敏感话题的响应,显著减少错误率并提升帮助性与安全性。

Comments Accepted to EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02688 2026-03-04 cs.AI cs.RO 70%

Retrieval-Augmented Robots via Retrieve-Reason-Act

通过检索-推理-行动实现增强型机器人

Izat Temiraliev, Diji Yang, Yi Zhang

机构 * University of California, Santa Cruz(加州大学圣克ruz分校)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出检索增强型机器人学(RAR)范式,通过检索-推理-行动循环,使机器人能从外部文档获取未见程序知识,提升复杂任务执行能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23725 2026-03-04 cs.AI 70%

MedLA: A Logic-Driven Multi-Agent Framework for Complex Medical Reasoning with Large Language Models

MedLA:基于大语言模型的复杂医学推理多智能体框架

Siqi Ma, Jiajie Huang, Fan Zhang, Yue Shen, Jinlin Wu, Guohui Fan, Zhu Zhang, Zelin Zang

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 MedLA是一种基于大语言模型的逻辑驱动多智能体框架,通过多轮图引导讨论实现透明推理和共识达成,有效提升复杂医学推理性能。

Comments accepted by AAAI-26 (ORAL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22070 2026-02-26 cs.AI 70%

Language Models Exhibit Inconsistent Biases Towards Algorithmic Agents and Human Experts

语言模型表现出对算法代理和人类专家的不一致偏见

Jessica Y. Bo, Lillio Mok, Ashton Anderson

机构 * Computer Science University of Toronto(计算机科学大学 Toronto)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 研究发现语言模型对人类专家和算法存在不一致偏见,需在高风险应用中谨慎对待。

Comments Second Conference of the International Association for Safe and Ethical Artificial Intelligence (IASEAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17989 2026-02-26 q-bio.NC cs.AI 70%

The Subject of Emergent Misalignment in Superintelligence: An Anthropological, Cognitive Neuropsychological, Machine-Learning, and Ontological Perspective

超智能中的涌现偏差主体:一种人类学、认知神经心理学、机器学习和本体论视角

Muhammad Osama Imran, Roshni Lulla, Rodney Sappington

机构 * Department of Anthropology, University of Minnesota(明尼苏达大学人类学系) Brain & Creativity Institute, University of Southern California(美国南加州大学脑与创造力研究所) Institute for Advanced Consciousness, Loomis Innovation Center(先进意识研究所) Stimson Center(斯蒂姆森中心)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文从人类学、认知神经心理学等多视角探讨超智能中人类主体与人工智能无意识的相互作用及伦理问题。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21706 2026-02-26 cs.CV cs.AI 70%

SurGo-R1: Benchmarking and Modeling Contextual Reasoning for Operative Zone in Surgical Video

SurGo-R1:手术视频中操作区的上下文推理基准测试与建模

Guanyi Qin, Xiaozhen Wang, Zhu Zhuo, Chang Han Low, Yuancan Xiao, Yibing Fu, Haofeng Liu, Kai Wang, Chunjiang Li, Yueming Jin

机构 * National University of Singapore, Singapore(新加坡国立大学) Southern Medical University, China(南方医科大学) Guangzhou Research Translation and Innovation Institute, National University of Singapore, China(广州研究翻译与创新研究院,新加坡国立大学,中国)

专题命中 安全评测 :RLHF(abstract);safety(abstract);分类 cs.AI

AI总结 SurGo-R1通过RLHF优化的多阶段架构,在手术视频中实现了高精度的操作区识别,显著优于通用视觉-语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14457 2026-02-17 cs.AI cs.CL cs.CV cs.CY cs.LG 70%

Frontier AI Risk Management Framework in Practice: A Risk Analysis Technical Report v1.5

实践中的前沿AI风险管理框架:一项风险分析技术报告v1.5

Dongrui Liu, Yi Yu, Jie Zhang, Guanxu Chen, Qihao Lin, Hanxi Zhu, Lige Huang, Yijin Zhou, Peng Wang, Shuai Shao, Boxuan Zhang, Zicheng Liu, Jingwei Sun, Yu Li, Yuejin Xie, Jiaxuan Guo, Jia Xu, Chaochao Lu, Bowen Zhou, Xia Hu, Jing Shao

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出实践中的前沿AI风险管理框架,评估五个关键风险维度并提出缓解策略,为安全部署前沿AI提供技术路径。

Comments 49 pages, 17 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏