arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-21 至 2026-05-21 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 6 篇

2605.20625 2026-05-21 eess.SY cs.MA cs.RO cs.SY 78%

Time-To-Reach Separation and Safety Filtering for Safe, Fair, and Efficient Multi-Agent Coordination

时间到达分离与安全过滤用于安全、公平和高效的多智能体协调

Matthew Low, Jasmine Jerry Aloor, Victoria Marie Tuck, Pierluigi Nuzzo, Jason J. Choi

机构 * Department of Electrical Engineering and Computer Sciences, University of California, Berkeley(加州大学伯克利分校电子工程与计算机科学系) Department of Aeronautics and Astronautics, Massachusetts Institute of Technology(麻省理工学院航空与航天系) GRASP Laboratory, University of Pennsylvania(宾夕法尼亚大学GRASP实验室) Department of Electrical and Computer Engineering, University of California, Los Angeles(加州大学洛杉矶分校电子与计算机工程系)

专题命中 安全训练 :safety(title,abstract)

AI总结 本文提出了一种多智能体协调框架,利用最小时间到达(TTR)作为统一指标用于优先级分配、时间分离和安全过滤,以协调多个空中车辆进入空中走廊并保持车辆间安全分离。

Comments 9 pages, 3 figures. Extended version (including appendix) of a paper submitted to the 65th IEEE Conf. on Decision and Control (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07021 2026-05-21 cs.AI 74%

Behavior Cue Reasoning: Monitorable Reasoning Improves Efficiency and Safety through Oversight

行为线索推理:通过监督提高推理的效率和安全性

Christopher Z. Cui, Taylor W. Killian, Prithviraj Ammanabrolu

机构 * University of California, San Diego(加州大学圣地亚哥分校) Brigham Young University

专题命中 安全训练 :safety(title);分类 cs.AI

AI总结 该研究提出行为线索推理方法,通过引入行为线索来增强大语言模型的可控性和可监控性,从而在复杂数学问题解决中减少50%的无效推理token,并在安全行动恢复方面将成功率从46%提升至96%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20351 2026-05-21 cs.CR 67%

Refusal Evaluation in Coding LLMs and Code Agents: A Systematic Review of Thirteen Malicious-Code Prompt Corpora (2023-2025)

对编码LLM和代码代理的拒绝评估:十三个恶意代码提示语料库的系统综述(2023-2025)

Richard J. Young, Gregory D. Moody

专题命中 安全训练 :jailbreak(abstract,abstract_cn)

AI总结 本文系统综述了十三个恶意代码提示语料库,分析了其构建方法、提示构造分类、可重复性和许可条款,并指出了方法学上的三个主要缺口。

Comments 30 pages, 6 figures, 2 tables. PRISMA-style systematic review covering thirteen publicly released refusal corpora (AdvBench, CyberSecEval family, RMCBench, RedCode, MCGMark, JailbreakBench, CySecBench, MalwareBench, CIRCLE, MOCHA, ASTRA, Scam2Prompt, JAWS-Bench)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20258 2026-05-21 cs.LG cs.AI cs.CR 62%

It Takes Two: Complementary Self-Distillation for Contextual Integrity in LLMs

需要两人:互补的自我蒸馏用于大语言模型中的上下文完整性

Sangwoo Park, Woongyeong Yeo, Seanie Lee, Yumin Choi, Hyomin Lee, Kangsan Kim, Jinheon Baek, Seong Joon Oh, Sung Ju Hwang

机构 * KAIST(韩国科学技术院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SELFCI框架,通过分离信息抑制与任务解决,解决大语言模型中隐私与效用的权衡问题,通过互补的自我蒸馏方法提升上下文完整性。

Comments 28 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20809 2026-05-21 cs.CL 57%

Refining and Reusing Annotation Guidelines for LLM Annotation

对LLM注释的注释指南进行细化和重用

Kon Woo Kim, Jin-Dong Kim, Akiko Aizawa

机构 * The Graduate University for Advanced Studies, SOKENDAI(Graduate University for Advanced Studies, SOKENDAI) National Institute of Informatics (NII)(National Institute of Informatics) BioData Science Initiative (BSI), National Institute of Genetics (NIG)(BioData Science Initiative (BSI), National Institute of Genetics)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 本文提出了一种系统性的注释指南重用和细化方法,通过迭代审核框架来对LLM注释进行改进,并在生物医学NER任务中验证了指南整合的有效性、推理优化模型的优势以及在最小监督下的审核可行性。

Comments 14 pages, 7 figures. Accepted to the ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20742 2026-05-21 cs.AI 57%

VBFDD-Agent for Electric Vehicle Battery Fault Detection and Diagnosis: Descriptive Text Modeling of Battery Digital Signals

VBFDD-Agent 用于电动汽车电池故障检测与诊断:电池数字信号的描述性文本建模

Joey Chan, Zhen Chen, Ershun Pan

机构 * Department of Industrial Engineering and Management, School of Mechanical Engineering, Shanghai Jiao Tong University, Shanghai 200240, China(工业工程与管理系,机械工程学院,上海交通大学,上海200240,中国)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本研究提出了一种基于描述性文本建模的电池信号报告方法,用于解决开放源代码电池故障报告数据集稀缺和缺乏统一维护知识表示的问题,通过构建语言语料库来改进电池健康诊断和维护,提出了VBFDD-Agent,整合了描述性电池状态文本、历史案例检索、本地维护手册和大语言模型推理,生成结构化的诊断结果和维护建议。

详情

展开后加载摘要…

URL PDF HTML 收藏