arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-06 至 2026-03-06 共收录 18 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 18 篇

2603.04904 2026-03-06 cs.AI cs.CL 88%

Alignment Backfire: Language-Dependent Reversal of Safety Interventions Across 16 Languages in LLM Multi-Agent Systems

对齐反噬:在16种语言的LLM多智能体系统中语言依赖性的安全干预逆转

Hiroki Fukui

机构 * Research Institute of Criminal Psychiatry / Sex Offender Medical Center(犯罪精神病研究所以及性犯罪医疗中心) Department of Neuropsychiatry, Kyoto University(京都大学神经精神病学系)

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究发现,在不同语言的LLM多智能体系统中,对齐干预可能导致安全措施的逆转,揭示了语言空间对对齐效果的决定性影响。

Comments 89 pages, 4 figures, 4 supplementary figures, 12 supplementary tables; preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04410 2026-03-06 cs.CL cs.AI 86%

SalamahBench: Toward Standardized Safety Evaluation for Arabic Language Models

SalamahBench: 向阿拉伯语言模型的安全评估标准化迈进

Omar Abdelnasser, Fatemah Alharbi, Khaled Khasawneh, Ihsen Alouani, Mohammed E. Fouda

专题命中 安全评测 :safety(title,abstract);alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 SalamahBench提出了一种统一的阿拉伯语言模型安全评估基准,评估五种先进模型的安全性,揭示了不同模型在安全对齐上的显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21033 2026-03-06 cs.AI 83%

Towards Trustworthy Legal AI through LLM Agents and Formal Reasoning

通过LLM代理和形式推理实现可信的法律AI

Linze Chen, Yufan Cai, Zhe Hou, Jin Song Dong

机构 * National University of Singapore(国立新加坡大学) Griffith University(格里菲斯大学)

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);分类 cs.AI

AI总结 L4L通过LLM代理与形式推理实现法律AI的可信性,通过四个阶段确保法律推理的逻辑性和可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04837 2026-03-06 cs.AI 81%

Design Behaviour Codes (DBCs): A Taxonomy-Driven Layered Governance Benchmark for Large Language Models

设计行为代码(DBCs):一种以分类为导向的分层治理基准用于大型语言模型

G. Madan Mohan, Veena Kiran Nambiar, Kiranmayee Janardhan

专题命中 安全评测 :alignment(abstract);RLHF(abstract);DPO(abstract);safety(abstract)

AI总结 本文提出DBC基准,用于评估大型语言模型中的行为治理层,通过三臂实验展示DBC在降低风险暴露率和提升合规性方面的效果。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15163 2026-03-06 cs.CL cs.AI 81%

MCP-SafetyBench: A Benchmark for Safety Evaluation of Large Language Models with Real-World MCP Servers

MCP-SafetyBench:一种用于评估大型语言模型在真实MCP服务器安全性的大规模基准

Xuanjun Zong, Zhiqi Shen, Lei Wang, Yunshi Lan, Chao Yang

机构 * East China Normal University(东华师范大学) Salesforce AI Research(Salesforce人工智能研究) Singapore Management University(新加坡国立大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 MCP-SafetyBench通过真实MCP服务器评估大型语言模型的安全性,揭示了模型在面对MCP攻击时的脆弱性及安全与实用性的权衡问题。

Comments Our benchmark is available at https://github.com/xjzzzzzzzz/MCPSafety

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03098 2026-03-06 q-bio.QM cs.LG 79%

An AI Implementation Science Study to Improve Trustworthy Data in a Large Healthcare System

一项提升大型医疗系统中可信数据的AI实施科学研究

Benoit L. Marteau, Andrew Hornback, Shaun Q. Tan, Christian Lowson, Jason Woloff, May D. Wang

机构 * Georgia Institute of Technology(佐治亚理工学院) Shriners Hospitals for Children(夏皮罗儿童医院)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG

AI总结 本研究通过在大型医疗系统中实施AI技术,提升数据质量并整合可信AI原则,探索混合实施策略以促进医疗AI的发展。

Comments 10 pages, 7 figures. Preprint version. This manuscript has been accepted at IEEE BHI 2025. This is the author-prepared version and not the final published IEEE version. The final version will appear in IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05255 2026-03-06 cs.CV 78%

CATNet: Collaborative Alignment and Transformation Network for Cooperative Perception

CATNet:用于协作感知的协同对齐与变换网络

Gong Chen, Chaokun Zhang, Tao Tang, Pengcheng Lv, Feng Li, Xin Xie

机构 * School of Computer Science and Technology, Tianjin University(计算机科学与技术学院,天津大学) School of Cybersecurity, Tianjin University(网络安全学院,天津大学) School of Future Technology, Tianjin University(未来技术学院,天津大学)

专题命中 安全评测 :alignment(title,abstract)

AI总结 CATNet通过时空同步、小波去噪和自适应选择器提升多代理协作感知的鲁棒性和适应性。

Comments Accepted by CVPR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04423 2026-03-06 cs.CL cs.AI 62%

Generating Realistic, Protocol-Compliant Maritime Radio Dialogues using Self-Instruct and Low-Rank Adaptation

利用自指导和低秩适应生成符合协议的海上无线电对话

Gürsel Akdeniz, Emin Cagatay Nakilcioglu

机构 * Fraunhofer Center for Maritime Logistics and Services(弗劳恩霍夫海洋物流与服务研究中心)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出一种自指导和低秩适应方法,生成符合IMO SMCP协议的海上无线电对话,通过整合验证流程和高效微调技术,提升对话生成的准确性和合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04407 2026-03-06 cs.CL cs.AI 62%

Semantic Containment as a Fundamental Property of Emergent Misalignment

语义包容作为涌现偏差的根本属性

Rohan Saxena

机构 * Department of XXX, University of YYY, Location, Country(YYY大学XXX系) School of ZZZ, Institute of WWW, Location, Country(WWW研究所ZZZ学院)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究发现语义触发器可自发诱导模型限制,无需混合无害和有害训练数据,揭示有害微调的潜在安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04405 2026-03-06 cs.CV cs.AI cs.LG 62%

Lost in Translation: How Language Re-Aligns Vision for Cross-Species Pathology

迷失在翻译中:语言如何重新对齐视觉以实现跨物种病理学

Ekansh Arora

机构 * Thomas Jefferson High School for Science and Technology(泰勒斯·杰弗里斯高中科学与技术学校)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过引入语义锚定机制,利用语言对齐解决跨物种病理学中的视觉-语言对齐问题,提升模型在跨物种任务中的性能。

Comments 27 pages, 6 figures, 7 tables. Code and data available at https://github.com/ekansh-arora0/cross-species-pathology

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05399 2026-03-06 cs.AI 61%

Judge Reliability Harness: Stress Testing the Reliability of LLM Judges

LLM裁判可靠性检测工具:检验LLM裁判的可靠性

Sunishchal Dev, Andrew Sloan, Joshua Kavner, Nicholas Kong, Morgan Sandler

机构 * RAND Corporation(RAND公司)

专题命中 安全评测 :safety(abstract,comments);分类 cs.AI

AI总结 本研究提出了一种开源工具,用于评估LLM裁判在不同基准中的可靠性,发现模型和扰动类型对性能有显著影响。

Comments Accepted at Agents in the Wild: Safety, Security, and Beyond Workshop at ICLR 2026 - April 26, 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05423 2026-03-06 cs.LG 57%

An interpretable prototype parts-based neural network for medical tabular data

可解释的原型部件基于神经网络用于医疗表格数据

Jacek Karolczak, Jerzy Stefanowski

机构 * Poznan University of Technology, Institute of Computing Science(波兹南技术大学计算科学学院)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出了一种可解释的原型部件基于神经网络,用于医疗表格数据,通过可训练的特征片段学习有意义的原型部件,实现可解释的预测和临床决策支持。

Comments Proc. of EXPLIMED at ECAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05184 2026-03-06 cs.CV cs.AI 57%

Logi-PAR: Logic-Infused Patient Activity Recognition via Differentiable Rule

Logi-PAR: 通过可微规则融合的逻辑患者活动识别

Muhammad Zarar, MingZheng Zhang, Xiaowang Zhang, Zhiyong Feng, Sofonias Yitagesu, Kawsar Farooq

机构 * School of Computer Software, Tianjin University, China(天津大学软件学院)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 Logi-PAR通过可微规则融合实现患者活动识别,首次将逻辑推理融入模型以生成可解释的活动分析和反事实干预。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04815 2026-03-06 cs.AI 57%

EchoGuard: An Agentic Framework with Knowledge-Graph Memory for Detecting Manipulative Communication in Longitudinal Dialogue

EchoGuard: 一种基于知识图谱记忆的代理框架,用于检测纵向对话中的操纵性沟通

Ratna Kandala, Niva Manchanda, Akshata Kishore Moharir, Ananth Kandala

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 EchoGuard通过知识图谱记忆和结构化循环检测纵向对话中的操纵性沟通,提升个体识别能力与自主性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01919 2026-03-06 cs.CR cs.AI cs.SE 57%

Real Money, Fake Models: Deceptive Model Claims in Shadow APIs

真实的钱,假的模型:影子API中的欺骗性模型声明

Yage Zhang, Yukun Jiang, Zeyuan Chen, Michael Backes, Xinyue Shen, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全研究中心)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文首次系统审计官方LLM API与影子API,揭示了影子API在性能、安全性和身份验证方面的欺骗行为,影响科研可重复性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05386 2026-03-06 cs.CV 50%

Fusion-CAM: Integrating Gradient and Region-Based Class Activation Maps for Robust Visual Explanations

融合-CAM:整合梯度和基于区域的类别激活图以实现稳健的视觉解释

Hajar Dekdegue, Moncef Garouani, Josiane Mothe, Jordan Bernigaud

机构 * IRIT, UMR5505 CNRS Université de Toulouse(IRIT,CNRS,Université de Toulouse) INRAE, Centre Occitanie-Toulouse Unité Expérimentale APC(INRAE,Centre Occitanie-Toulouse,Unité Expérimentale APC)

专题命中 安全评测 :trustworthy(abstract)

AI总结 Fusion-CAM通过整合梯度和基于区域的类别激活图,提供更稳健和判别的视觉解释,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03037 2026-03-06 cs.RO 50%

A Bi-directional Adaptive Framework for Agile UAV Landing

双向自适应框架用于敏捷无人机着陆

Chunhui Zhao, Xirui Kao, Yilin Lu, Yang Lyu

机构 * School of Automation, Northwestern Polytechnical University(自动化学院,西北工业大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出双向自适应框架,通过重新定义车辆与平台的角色,实现敏捷无人机着陆的高效、精确与鲁棒性提升。

Comments This work has been submitted to the IEEE Robotics and Automation Letters (RA-L) for possible publication

Journal ref IEEE Robotics and Automation Letters, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03621 2026-03-06 cs.CV 50%

PhysLLM: Harnessing Large Language Models for Cross-Modal Remote Physiological Sensing

PhysLLM:利用大语言模型进行跨模态远程生理传感

Yiping Xie, Bo Zhao, Mingtong Dai, Jian-Ping Zhou, Yue Sun, Tao Tan, Weicheng Xie, Linlin Shen, Zitong Yu

机构 * Shenzhen University(深圳大学) Great Bay University(大鹏大学) National Engineering Laboratory for Big Data System Computing Technology(大数据系统计算技术国家工程实验室) Dongguan Key Laboratory for Intelligence and Information Technology(东莞智能与信息技术重点实验室) Guangdong Medical University(广东医科大学) Southern Medical University (Dongguan People’s Hospital)(南方医科大学(东莞人民医院)) Macao Polytechnic University(澳门理工学院)

专题命中 安全评测 :alignment(abstract)

AI总结 PhysLLM通过结合大语言模型与领域特定的rPPG组件,利用跨模态学习提升远程生理传感的准确性和鲁棒性。

Comments Accepted by International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏