arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-14 至 2026-04-14 共收录 162 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 7 篇

2604.10326 2026-04-14 cs.CR cs.AI 77%

Jailbreaking the Matrix: Nullspace Steering for Controlled Model Subversion

矩阵劫持:用于受控模型反制的空域操控

Vishal Pramanik, Maisha Maliha, Susmit Jha, Sumit Kumar Jha

机构 * Department of Computer & Information Science & Engineering, University of Florida(佛罗里达大学计算机与信息科学与工程系) School of Computer Science, University of Oklahoma(俄克拉荷马大学计算机科学学院) Computer Science Laboratory, SRI International(SRI国际计算机科学实验室)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文提出HMNS方法,通过识别并抑制注意力头,注入受限于正交补集的扰动,实现对模型的受控反制,展示了新的安全防御范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11309 2026-04-14 cs.CR cs.AI cs.CL cs.CV cs.LG 75%

The Salami Slicing Threat: Exploiting Cumulative Risks in LLM Systems

切肉威胁:在LLM系统中利用累积风险

Yihao Zhang, Kai Wang, Jiangrong Wu, Haolin Wu, Yuxuan Zhou, Zeming Wei, Dongxian Wu, Xun Chen, Jun Sun, Meng Sun

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) Sun Yat-sen University(中山大学) Wuhan University(武汉大学) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ByteDance(字节跳动) Singapore Management University(新加坡管理大学)

专题命中 越狱攻击 :alignment(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Salami Slicing Risk,通过链式低风险输入累积有害意图,以触发高风险行为,提出Salami Attack框架并验证其有效性,同时提出防御策略以缓解多轮 jailbreak 风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09750 2026-04-14 cs.CR cs.AI 70%

Conflicts Make Large Reasoning Models Vulnerable to Attacks

冲突使大型推理模型容易受到攻击

Honghao Liu, Chengjin Xu, Xuhui Jiang, Cehao Yang, Shengming Yin, Zhengwu Ma, Lionel Ni, Jian Guo

机构 * International Digital Economy Academy(国际数字经济学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The City University of Hong Kong(香港城市大学) DataArc Tech

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 研究探讨了冲突如何影响大型推理模型的安全性,发现冲突显著增加攻击成功率,揭示了安全表示在冲突下的变化,强调需更深入的对齐策略以确保模型的鲁棒性和可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06840 2026-04-14 cs.CR 50%

MirageBackdoor: A Stealthy Attack that Induces Think-Well-Answer-Wrong Reasoning

MirageBackdoor: 一种诱导“思考良好但回答错误”推理的隐蔽攻击

Yizhe Zeng, Wei Zhang, Yunpeng Li, Juxin Xiao, Xiao Wang, Yuling Liu

专题命中 越狱攻击 :safety(abstract)

AI总结 本文提出MirageBackdoor攻击,通过解锁模型后输出空间和定制训练流程,使模型在保持清洁推理过程的同时,选择性地将最终答案导向特定目标,显著提升攻击隐蔽性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 提示注入 4 篇

2604.11806 2026-04-14 cs.AI cs.CL 84%

Detecting Safety Violations Across Many Agent Traces

在大量智能体轨迹中检测安全违规

Adam Stein, Davis Brown, Hamed Hassani, Mayur Naik, Eric Wong

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 提示注入 :safety(title,abstract);prompt injection(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Meerkat方法,通过聚类与智能体搜索结合,有效发现自然语言指定的安全违规,提升检测效率并发现广泛开发者作弊和奖励黑客行为。

Comments 35 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22830 2026-04-14 cs.CL 79%

ChatInject: Abusing Chat Templates for Prompt Injection in LLM Agents

ChatInject: 利用聊天模板对LLM代理进行提示注入

Hwan Chang, Yonghyun Jun, Hwanhee Lee

机构 * Department of Artificial Intelligence, Chung-Ang University(中央大学人工智能系)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL

AI总结 研究提出ChatInject攻击,通过模拟聊天模板诱导LLM代理执行恶意指令,实验显示其攻击成功率显著高于传统方法,且现有防御措施对多轮对话变种效果有限。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06436 2026-04-14 cs.CR cs.AI 79%

The Defense Trilemma: Why Prompt Injection Defense Wrappers Fail?

防御三重困境:为何提示注入防御包装失效?

Manish Bhatt, Sarthak Munshi, Vineeth Sai Narajala, Idan Habler, Ammar Al-Kahfah, Ken Huang, Joel Webb, Blake Gatto, Md Tamjidul Hoque

机构 * OWASP Amazon Leo UNO Amazon Web Services(亚马逊云服务) Cisco(思科) Shrewd Security

专题命中 提示注入 :prompt injection(title);alignment(abstract);分类 cs.AI

AI总结 研究证明连续且保持效用的防御包装无法使语言模型的所有输出严格安全,并揭示了防御必须失败的精确位置。通过三个逐步加强的假设,证明了连续性、效用保持性和完整性无法共存。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10134 2026-04-14 cs.CR 78%

PlanGuard: Defending Agents against Indirect Prompt Injection via Planning-based Consistency Verification

PlanGuard:通过基于规划的一致性验证防御代理 against 间接提示注入

Guangyu Gong, Zizhuang Deng

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 本文提出PlanGuard,一种基于上下文隔离的无训练防御框架,通过规划器生成有效动作集和分层验证机制,有效防御间接提示注入攻击,实验显示攻击成功率从72.8%降至0%。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 幻觉与事实性 12 篇

2604.10189 2026-04-14 cs.CL 79%

FAITH: Factuality Alignment through Integrating Trustworthiness and Honestness

FAITH:通过整合可信度和诚实度实现事实一致性

Xiaoning Dong, Chengyan Wu, Yajie Wen, Yu Chen, Yun Xue, Jing Zhang, Wei Xu, Bolei Ma

机构 * Tsinghua University, Institute for Interdisciplinary Information Sciences(清华大学,交叉信息研究院) Shanghai Qi Zhi Institute(上海期智研究院) South China Normal University, School of Electronic Science and Engineering(华南师范大学,电子科学与工程学院) Guangzhou Richstone Data Technologies Co., Ltd.(广州瑞驰数据技术有限公司) LMU Munich & Munich Center for Machine Learning(慕尼黑大学 & 慕尼黑机器学习中心)

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.CL

AI总结 FAITH通过整合可信度和诚实度信号,提升大语言模型的事实准确性。采用PPO算法优化奖励函数,并结合检索增强模块增强内外知识一致性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15481 2026-04-14 cs.LG 77%

LLM-as-Judge on a Budget

在预算限制下的人工智能语言模型作为裁判

Aadirupa Saha, Aniket Wagde, Branislav Kveton

机构 * UIC(伊利诺伊大学芝加哥分校) Adobe

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.LG

AI总结 本文提出一种基于多臂老虎机理论的变异性自适应方法,用于在有限预算下优化对提示-响应对的查询分配,以最小化评估误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07382 2026-04-14 cs.LG cs.AI 73%

Latent Structure of Affective Representations in Large Language Models

大型语言模型中情感表征的潜在结构

Benjamin J. Choi, Melanie Weber

机构 * Harvard University(哈佛大学)

专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 研究大型语言模型中情感表征的潜在几何结构,发现其与心理学中的valence-arousal模型一致,并展示了其在不确定性量化中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09749 2026-04-14 cs.CV 71%

See Fair, Speak Truth: Equitable Attention Improves Grounding and Reduces Hallucination in Vision-Language Alignment

看清真相:公平关注提升 groundedness 并减少 hallucination 在视觉语言对齐中

Mohammad Anas Azeez, Ankan Deria, Zohaib Hasan Siddiqui, Adinath Madhavrao Dukre, Rafiq Ali, Sara Atito, Yutong Xie, Imran Razzak

机构 * Mohamed bin Zayed University of Artificial Intelligence, Abu Dhabi, UAE(穆罕默德·本·扎耶德人工智能大学,阿布扎比,阿联酋) King Fahd University of Petroleum and Minerals, Dhahran, Saudi Arabia(法赫德国王石油矿产大学,达兰,沙特阿拉伯) Macquarie University, Sydney, Australia(麦考瑞大学,悉尼,澳大利亚) University of Surrey, Guildford, United Kingdom(萨里大学,吉尔福德,英国) University of New South Wales, Sydney, Australia(新南威尔士大学,悉尼,澳大利亚)

专题命中 幻觉与事实性 :alignment(title)

AI总结 本文提出DOP-OBC方法,通过公平分配注意力减少视觉语言对齐中的幻觉问题,提升生成的准确性与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10585 2026-04-14 cs.LG cs.AI cs.CL 69%

Calibration Collapse Under Sycophancy Fine-Tuning: How Reward Hacking Breaks Uncertainty Quantification in LLMs

在奉承式微调下校准崩溃:奖励黑客如何破坏大语言模型的不确定性量化

Subramanyam Sahoo

机构 * Cambridge AI Safety Hub (CAISH)(剑桥人工智能安全中心)

专题命中 幻觉与事实性 :RLHF(abstract);分类 cs.CL、cs.AI、cs.LG;trustworthy(comments)

AI总结 研究探讨了在强化学习从人类反馈(RLHF)等方案中,奉承式微调对校准的影响,发现GRPO微调导致校准退化,尽管效果不显著,但经矩阵缩放后仍保留较高校准误差。

Comments Accepted at the AISTATS 2026 Workshop on Towards Trustworthy Predictions: Theory and Applications of Calibration for Modern AI. 14 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11737 2026-04-14 cs.LG cs.AI cs.CL 67%

TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning

TokUR:用于大语言模型推理的令牌级不确定性估计

Tunyu Zhang, Haizhou Shi, Yibin Wang, Hengyi Wang, Xiaoxiao He, Zhuowei Li, Haoxian Chen, Ligong Han, Kai Xu, Huan Zhang, Dimitris Metaxas, Hao Wang

机构 * Rutgers University(罗格斯大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊) Red Hat AI Innovation(红帽AI创新)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出TokUR框架,通过引入低秩随机权重扰动生成令牌级不确定性分布,提升大语言模型在数学推理中的可靠性和可解释性。

Comments Accepted to International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10535 2026-04-14 cs.IR cs.CL 57%

Evaluating Small Open LLMs for Medical Question Answering: A Practical Framework

评估小型开放语言模型用于医疗问答:一种实用框架

Avi-ad Avraam Buskila

机构 * Bar-Ilan University(巴伊兰大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL

AI总结 本文提出评估小型本地部署开放权重语言模型在医疗问答中的实用框架,强调可重复性与准确性的平衡,通过八个质量指标和重复推理评估发现模型输出一致性不足,且领域微调影响评估结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10420 2026-04-14 cs.LG 57%

CARE-ECG: Causal Agent-based Reasoning for Explainable and Counterfactual ECG Interpretation

CARE-ECG:基于因果代理的可解释与反事实ECG解读

Elahe Khatibi, Ziyu Wang, Ankita Sharma, Krishnendu Chakrabarty, Sanaz Rahimi Moosavi, Farshad Firouzi, Amir Rahmani

机构 * University of California, Irvine(加州大学尔湾分校) Arizona State University(亚利桑那州立大学) California State University, Dominguez Hills(加州州立大学多明格斯山分校)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 CARE-ECG通过统一的表示学习、诊断和解释流程,提升ECG解读的准确性与可信度,减少幻觉,适用于多基准和专家问答场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10332 2026-04-14 cs.AI 57%

From GPT-3 to GPT-5: Mapping their capabilities, scope, limitations, and consequences

从GPT-3到GPT-5:映射其能力、范围、限制及后果

Hina Afridi, Habib Ullah, Sultan Daud Khan, Mohib Ullah

机构 * University of Bergen(卑尔根大学) Norwegian University of Life Sciences(挪威生命科学大学) Sohar University(苏哈尔大学) Norwegian University of Science and Technology(挪威科技大学) Kristiania University of Applied Sciences(克里斯蒂安尼亚应用科学大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 本文比较分析GPT系列从GPT-3到GPT-5的发展,探讨技术演进、能力变化、部署转变、持续限制及下游影响,强调后续版本不仅是更大更准的模型,而是更复杂的系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24778 2026-04-14 cs.CL 57%

Revisiting Epistemic Markers in Confidence Estimation: Can Markers Accurately Reflect Large Language Models' Uncertainty?

重新审视置信度标记在置信度估计中的作用:标记能否准确反映大语言模型的不确定性?

Jiayu Liu, Qing Zong, Weiqi Wang, Yangqiu Song

机构 * Department of Computer Science and Engineering, HKUST(香港科技大学计算机科学与工程系)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 研究探讨了大语言模型中置信度标记是否能准确反映其不确定性,通过多数据集评估发现标记在同分布下表现稳定,但异分布下存在不一致,质疑了置信度标记的可靠性。

Comments ACL 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10896 2026-04-14 quant-ph 50%

Quantum Measurement Statistics as Bayesian Uncertainty Estimators for Physics-Constrained Learning

量子测量统计作为物理约束学习中的贝叶斯不确定性估计器

Prasad Nimantha Madusanka Ukwatta Hewage, Midhun Chakkravarthy, Ruvan Kumara Abeysekara

专题命中 幻觉与事实性 :safety(abstract)

AI总结 本文提出利用量子测量统计作为贝叶斯不确定性估计器,通过物理约束变分量子电路在PDE残差上训练,展示量子不确定性量化在安全关键系统中的有效性,相比MC Dropout和Deep Ensemble方法,量子方法在覆盖概率和区间宽度上表现更优。

Comments 14 pages, 6 figures, 5 tables. Code available at https://github.com/nimanpra/quantum_state_uq

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09805 2026-04-14 cs.SE 50%

Building an Internal Coding Agent at Zup: Lessons and Open Questions

在Zup构建内部编码代理:经验与开放问题

Gustavo Pinto, Pedro Eduardo de Paula Naves, Ana Paula Camargo, Marselle Silva

专题命中 幻觉与事实性 :safety(abstract)

AI总结 研究探讨了构建内部编码代理时原型性能与生产准备之间的差距,指出工具设计、安全控制等工程决策比模型质量更重要,通过CodeGen案例展示改进方法和人类监督模式对代理可靠性和采用的影响。

Comments 9 Paginas

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 隐私与版权 3 篇

2603.14968 2026-04-14 cs.CR cs.CL 57%

Rethinking LLM Watermark Detection in Black-Box Settings: A Non-Intrusive Third-Party Framework

重新思考黑盒环境下的LLM水印检测:一种非侵入性的第三方框架

Zhuoshang Wang, Yubing Ren, Yanan Cao, Fang Fang, Xiaoxue Li, Li Guo

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) National Computer Network Emergency Response Technical Team, Coordination Center of China (CNCERT/CC)(国家计算机网络应急技术处理协调中心)

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL

AI总结 本文提出TTP-Detect框架,通过解耦检测与注入,实现非侵入性的第三方水印验证,提升检测性能和抗攻击能力。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11772 2026-04-14 cs.CR 50%

Towards Automated Pentesting with Large Language Models

向大型语言模型迈进的自动化渗透测试

Ricardo Bessa, Rui Claro, João Trindade, João Lourenço

专题命中 隐私与版权 :alignment(abstract)

AI总结 本文提出RedShell框架,利用微调的LLM生成针对Windows漏洞的恶意PowerShell代码,实现高效隐私保护的渗透测试自动化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10052 2026-04-14 cs.CR cs.NI 50%

Impact of Intelligent Technologies on IoV Security: Integrating Edge Computing and AI

智能技术对车联网安全的影响:整合边缘计算和人工智能

Awais Bilal, Kashif Sharif, Liehuang Zhu, Chang Xu, Fan Li, Sadaf Bukhari, Sujit Biswas

专题命中 隐私与版权 :safety(abstract)

AI总结 本文探讨智能技术在车联网安全中的作用,分析边缘计算、机器学习和深度学习的协同效应,展示其在威胁检测、响应时间和适应性安全方面的贡献,并指出未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 安全评测 62 篇

2604.11033 2026-04-14 cs.CY 85%

An ontological approach to foster the convergence, interoperability and operationalization of frameworks for Trustworthy AI

一种本体方法用于促进可信人工智能框架的收敛、互操作性和可操作性

Salvatore Flavio Pileggi

专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);AI safety(abstract);分类 cs.CY

AI总结 本文提出AI伦理本体(AI-EO),利用语义技术促进可信人工智能框架的收敛、互操作性和可操作性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03402 2026-04-14 cs.AI cs.LG 84%

Risk Awareness Injection: Calibrating Vision-Language Models for Safety without Compromising Utility

风险感知注入:为安全校准视觉-语言模型而不牺牲实用性

Mengxuan Wang, Yuxin Chen, Gang Xu, Tao He, Hongjie Jiang, Ming Li

机构 * Shien-Ming Wu School of Intelligent Engineering, South China University of Technology(华南理工大学吴贤铭智能工程学院) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系) University of Electronic Science and Technology of China(电子科技大学)

专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RAI框架,通过增强不安全信号恢复视觉-语言模型的安全识别能力,同时保持语义完整性,实验显示有效降低攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07462 2026-04-14 cs.AI 83%

Do Machines Fail Like Humans? A Human-Centred Out-of-Distribution Spectrum for Mapping Error Alignment

机器是否像人类一样失败?一种以人为中心的分布外谱系用于映射误差对齐

Binxia Xu, Xiaoliang Luo, Luke Dickens, Robert M. Mok

专题命中 安全评测 :alignment(title,abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出以人为中心的分布外谱系,通过量化刺激偏离参考集的程度,揭示不同深度学习架构在近分布外和远分布外条件下的模型-人类对齐差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10800 2026-04-14 cs.SE cs.AI cs.CR cs.LG cs.PL 81%

Verify Before You Fix: Agentic Execution Grounding for Trustworthy Cross-Language Code Analysis

在修复前验证:面向可信跨语言代码分析的代理执行 grounding

Jugal Gajjar

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出统一的跨语言漏洞生命周期框架,通过LLM驱动的三个阶段:混合结构-语义检测、执行 grounding 的代理验证和验证-aware 的迭代修复,确保修复前有执行验证。框架利用uAST和图神经网络融合,实现高准确率的漏洞检测与跨语言修复。

Comments 20 pages (13 main + 7 appendices), 9 figures, 10 tables. Submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11174 2026-04-14 cs.RO cs.AI 79%

EmbodiedGovBench: A Benchmark for Governance, Recovery, and Upgrade Safety in Embodied Agent Systems

EmbodiedGovBench: 一种用于具身代理系统治理、恢复和升级安全性的基准

Xue Qin, Simin Luan, John See, Cong Yang, Zhijun Li

机构 * School of Software, Harbin Institute of Technology(哈尔滨工业大学软件学院) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) School of Mathematical and Computer Sciences, Heriot-Watt University, Malaysia Campus(赫瑞-瓦特大学马来西亚校区数学与计算机科学学院) School of Future Science and Engineering, Soochow University(苏州大学未来科学与工程学院)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出EmbodiedGovBench基准,用于评估具身代理系统的治理能力,包括可控性、政策边界、安全恢复和审计完整性等,填补了传统任务成功率指标的不足。

Comments 34 pages, 7 tables. Code: https://github.com/s20sc/embodied-gov-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10286 2026-04-14 cs.AI 79%

STARS: Skill-Triggered Audit for Request-Conditioned Invocation Safety in Agent Systems

STARS:基于技能触发的请求条件调用安全性审计

Guijia Zhang, Shu Yang, Xilin Gong, Di Wang

机构 * Shenzhen University(深圳大学) King Abdullah University of Science & Technology(阿卜杜拉国王科技大学) PRADA Lab(PRADA实验室) University of Georgia(佐治亚大学)

专题命中 安全评测 :safety(title);prompt injection(abstract);分类 cs.AI

AI总结 STARS通过结合静态能力先验、请求条件调用风险模型和校准风险融合策略,提升代理系统调用时的风险评估与优先级排序能力,优于静态筛查和上下文评分方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09682 2026-04-14 cs.NI cs.AI 79%

Decision-Theoretic Safety Assessment of Persona-Driven Multi-Agent Systems in O-RAN

基于决策理论的面向角色驱动的多智能体系统在O-RAN中的安全性评估

Zeinab Nezami, Syed Ali Raza Zaidi, Maryam Hafeez, Louis Powell, Vara Prasad Talari, Mallik Tatipamula

机构 * GSMA(全球移动通信系统协会) University of Leeds(利兹大学) AWS(亚马逊云服务) Ericsson(爱立信)

专题命中 安全评测 :safety(title);alignment(abstract);分类 cs.AI

AI总结 本文提出一种基于角色驱动的多智能体框架,通过角色行为规范影响五个专业智能体,结合决策理论构建三维评估框架,验证486种角色配置在O-RAN优化挑战中的性能与协调效果。

详情

展开后加载摘要…

URL PDF HTML 收藏