arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-26 至 2026-05-26 共收录 28 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 28 篇

2605.24154 2026-05-26 cs.AI cs.SE 88%

Palette: A Modular, Controllable, and Efficient Framework for On-demand Authorized Safety Alignment Relaxation in LLMs

Palette: 一种模块化、可控且高效的框架,用于按需授权安全对齐放松的LLMs

Qitao Tan, Xiaoying Song, Arman Akbari, Arash Akbari, Yanzhi Wang, Xiaoming Zhai, Lingzi Hong, Zhen Xiang, Jin Lu, Geng Yuan

机构 * University of Georgia(佐治亚大学) University of North Texas(北卡罗来纳州立大学) Northeastern University(东北大学)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 提出Palette框架,通过多目标搜索识别拒绝方向并轻量级适配模型,实现按需放松授权领域的安全拒绝行为,同时保持其他区域的标准安全,支持模块化组合多领域授权。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13510 2026-05-26 cs.CY 85%

Safe-Child-LLM: A Developmental Benchmark for Evaluating LLM Safety in Child-LLM Interactions

Safe-Child-LLM:评估儿童与LLM交互安全性的发展基准

Junfeng Jiao, Saleh Afroogh, Kevin Chen, Abhejay Murali, David Atkinson, Amit Dhurandhar

专题命中 安全训练 :safety(title,abstract);jailbreak(abstract);AI safety(abstract);分类 cs.CY

AI总结 提出Safe-Child-LLM基准,通过200个对抗性提示和伦理拒绝量表,系统评估LLM在儿童(7-12岁)和青少年(13-17岁)交互中的安全性,发现主流模型存在严重安全缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11242 2026-05-26 cs.CY 85%

LLMs and Childhood Safety: Identifying Risks and Proposing a Protection Framework for Safe Child-LLM Interaction

大语言模型与儿童安全:识别风险并提出安全的儿童-大语言模型交互保护框架

Junfeng Jiao, Saleh Afroogh, Kevin Chen, Abhejay Murali, David Atkinson, Amit Dhurandhar

专题命中 安全训练 :safety(title,abstract);jailbreak(abstract);prompt injection(abstract);分类 cs.CY

AI总结 通过系统文献综述识别儿童与大语言模型交互的风险,并基于不同证据流比较提出包含内容安全、发展敏感性和对抗性滥用控制的保护框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24883 2026-05-26 cs.AI cs.CR cs.SE 83%

Inverting the Shield: Systematically Generating Safety Tests from Policy Specifications

反转盾牌:从策略规范中系统生成安全测试

Xiaoyue Lu, Xianglin Yang, Haijun Liu, Jiahao Liu, Kuntai Cai, Yan Xiao, Jin Song Dong

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) National University of Singapore(新加坡国立大学) Independent Researcher(独立研究者)

专题命中 安全训练 :safety(title,abstract);AI safety(abstract);分类 cs.AI

AI总结 提出POLARIS框架,通过将非结构化自然语言策略编译为一阶逻辑表示并构建语义策略图,实现覆盖驱动的可重复安全测试,相比基线方法提高了策略覆盖率和攻击成功次数。

Comments Accepted to the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23954 2026-05-26 cs.CL cs.AI cs.SD 81%

EchoDistill:Alignment Noisy-to-Clean Self-Distillation for Robust Audio LLMs

EchoDistill:面向鲁棒音频大语言模型的噪声到干净自蒸馏对齐

Liang Lin, Chunxi Luo, Kaiwen Luo, Jie Zhang, Jin Wang, Yuanhe Zhang, Cai Yuchen, Qiankun Li, Gongli Xi, Zhenhong Zhou, Kun Wang, Junhao Dong

机构 * NTU(国立台湾大学) SHU(上海大学) ICT, CAS(中国科学院信息科技研究院) HDU(华中科技大学) BUPT(北京邮电大学) USTC(中国科学技术大学) SKL-NST, BUPT(北京邮电大学国家智能计算研究中心)

专题命中 安全训练 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 提出EchoDistill框架,通过冻结的干净音频教师模型指导噪声学生模型进行组相对策略优化,实现噪声到干净的自蒸馏对齐,提升音频大语言模型在复杂噪声下的语义可靠性和任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25893 2026-05-26 cs.AI 79%

$D^2$-Monitor: Dynamic Safety Monitoring for Diffusion LLMs via Hesitation-Aware Routing

$D^2$-Monitor: 通过犹豫感知路由实现扩散LLM的动态安全监控

Aoxi Liu, Yupeng Chen, James Oldfield, Guanzhe Hong, Junchi Yu, Baoyuan Wu, Philip Torr, Adel Bibi

机构 * Torr Vision Group, University of Oxford(奥克斯大学托尔视觉组) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 针对扩散大语言模型的安全监控问题,提出基于犹豫感知路由的双层动态监控框架$D^2$-Monitor,通过轻量级探针实时估计犹豫度并触发高容量探针,在3个数据集上以0.85M参数达到最优性能与效率平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24862 2026-05-26 cs.LG 79%

Unifying Value Alignment and Assignment in Cross-Domain Offline Reinforcement Learning with Heterogeneous Datasets

统一跨域离线强化学习中异构数据集的价值对齐与价值分配

Zhongjian Qiao, Jiafei Lyu, Chenjia Bai, Peisong Wang, Siyang Gao, Shuang Qiu

机构 * City University of Hong Kong Tencent Institute of Artificial Intelligence (TeleAI), China Telecom Institute of Automation, Chinese Academy of Sciences. Corresponding Author

专题命中 安全训练 :alignment(title,abstract);分类 cs.LG

AI总结 针对异构跨域离线强化学习中价值误分配问题,提出V2A方法,通过时间一致模态表示学习和模态感知优势学习统一动力学对齐、价值对齐与价值分配,显著提升策略性能。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24414 2026-05-26 cs.AI 79%

JT-SAFE-V2: Safety-by-Design Foundation Model with World-Context Data

JT-SAFE-V2:具有世界上下文数据的安全设计基础模型

Junlan Feng, Fanyu Meng, Chong Long, Pengyu Cong, Duqing Wang, Yan Zheng, Yuyao Zhang, Xuanchang Gao, Ye Yuan, Yunfei Ma, Zhijie Ren, Fan Yang, Na Wu, Di Jin, Chao Deng

机构 * JIUTIAN Research(九天研究院)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 提出JT-Safe-V2大语言模型,通过世界知识预训练、高确定性训练和安全强化后训练实现通用智能与安全设计的联合优化,并引入Safe-MoMA框架降低推理成本,在通用智能和安全基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12116 2026-05-26 cs.AI cs.SE 70%

The A-R Behavioral Space: Execution-Level Profiling of Tool-Using Language Model Agents in Organizational Deployment

A-R行为空间:组织部署中工具使用语言模型代理的执行层剖析

Shasha Yu, Fiona Carroll, Barry L. Bentley

机构 * Cardiff School of Technologies, Cardiff Metropolitan University(卡迪夫技术学院,卡迪夫市政大学) School of Professional Studies, Clark University(专业研究学院,克拉克大学) Harvard Medical School, Harvard University(哈佛医学院,哈佛大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 提出基于动作率(A)和拒绝信号(R)的二维A-R空间及散度(D)来测量执行层行为,评估不同规范制度和自主性配置下语言模型代理的执行与拒绝分布模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25454 2026-05-26 cs.HC cs.AI cs.CL cs.CY cs.SI 67%

AI Content Moderation in Therapy Conversations

AI在治疗对话中的内容审核

Jiwon Kim, Claire Wang, Taeung Yoon, Sabelle Huang, Koustuv Saha

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究审计三种主流内容审核系统(OpenAI、Meta、Google)在真实治疗对话中的标记行为,揭示其限制LLM作为治疗师的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24216 2026-05-26 cs.LG cs.AI cs.CL cs.CR 67%

Agent-ToM: Learning to Monitor Autonomous LLM Agents via Theory-of-Mind Reasoning

Agent-ToM: 通过心智理论推理学习监控自主LLM智能体

Nesreen K. Ahmed, Nima Nafisi

机构 * Cisco Outshift(思科Outshift)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对自主LLM智能体的隐蔽恶意行为监控难题,提出基于心智理论推理的Agent-ToM框架,通过信念推断、意图假设与验证实现结构化轨迹分析,在监控基准上取得优于集成方法的性能。

Comments 23 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25984 2026-05-26 cs.CL cs.AI 62%

SafeCtrl-RL: Inference-Time Adaptive Behaviour Control for LLM Dialogue via RL-Driven Prompt Optimisation

SafeCtrl-RL: 通过RL驱动的提示优化的LLM对话推理时自适应行为控制

Michael Orme, Yanchao Yu, Zhiyuan Tan

机构 * School of Computing, Engineering and Building Environment(计算、工程与建筑环境学院)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 提出SafeCtrl-RL框架,利用强化学习在推理时动态选择提示调整策略,无需重新训练即可抑制不安全行为,提升LLM对话的安全性和响应质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15732 2026-05-26 cs.CY cs.AI 62%

Just Asking Questions: Doing Our Own Research on Conspiratorial Ideation by Generative AI Chatbots

只是提问:关于生成式AI聊天机器人阴谋论思维的自主研究

Katherine M. FitzGerald, Michelle Riedlinger, Axel Bruns, Stephen Harrington, Timothy Graham, Daniel Angus

机构 * Digital Media Research Centre, Queensland University of Technology(昆士兰理工大学数字媒体研究中心)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本研究通过系统评估六种主流AI聊天机器人对阴谋论问题的回应,发现安全护栏在不同模型和阴谋论主题上存在显著差异,且设计具有选择性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24247 2026-05-26 cs.CL cs.AI 62%

Improving Labeling Consistency with Detailed Constitutional Definitions and AI-Driven Evaluation

通过详细的宪法定义和AI驱动的评估提高标注一致性

Konstantin Berlin, Adam Swanda

机构 * Cisco AI Defense(思科AI防御)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 提出一种AI驱动的工作流,通过为每个类别编写详细的宪法定义并由前沿LLM解释,以比人类更一致和准确地生成黄金标签,在三个内容审核类别上将跨模型不一致性降低高达57倍。

Comments Under review at ACL Rolling Review (ARR), May 2026 cycle. Also available at https://doi.org/10.5281/zenodo.20125267

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23997 2026-05-26 cs.CV cs.AI cs.LG 62%

IVR-R1: Refining Trajectories through Iterative Visual-Grounded Reasoning in Reinforcement Learning

IVR-R1:通过强化学习中的迭代视觉基础推理优化轨迹

Chenghao Li, Fusheng Hao, Xikai Zhang, Likang Xiao, Yanwei Ren, Fuxiang Wu, Quan Chen, Liu Liu

机构 * Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) Kuaishou Technology(快手科技) Shenzhen Institute of Advanced Integration Technology, Shenzhen(深圳先进集成技术研究院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出IVR-R1框架,利用奖励驱动的筛选机制和迭代再推理循环,在强化学习中动态校正多模态推理轨迹,以解决视觉幻觉和逻辑错误问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25511 2026-05-26 cs.CL 57%

CRPO: Character-centric Group Relative Policy Optimization for Role-aware Reasoning in Role-playing Agents

CRPO:以角色为中心的群体相对策略优化用于角色扮演代理中的角色感知推理

Yihong Tang, Kehai Chen, Liang Yue, Benyou Wang, Min Zhang

机构 * Institute of Computing and Intelligence(计算与智能研究院) Harbin Institute of Technology(哈尔滨工业大学) Shenzhen Loop Area Institute (SLAI)(深圳Loop区研究院) The Chinese University of Hong Kong(香港中文大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 提出CRPO框架,通过解耦任务逻辑与风格奖励、动态调整优化约束和利用通用响应作为负基线,解决强化学习在角色扮演中角色保真度下降和风格崩溃问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07039 2026-05-26 cs.RO cs.AI 57%

AEROS: A Single-Agent Operating Architecture with Embodied Capability Modules

AEROS:一种具有具身能力模块的单智能体操作架构

Xue Qin, Simin Luan, John See, Cong Yang, Zhijun Li

机构 * School of Software, Harbin Institute of Technology(哈尔滨工业大学软件学院) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) School of Mathematical and Computer Sciences, Heriot-Watt University, Malaysia Campus(赫瑞-沃森大学马来西亚分校数学与计算机科学学院) School of Future Science and Engineering, Soochow University(苏州大学未来科学与工程学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 提出AEROS架构,将机器人建模为单一持久智能主体,通过可安装的具身能力模块扩展能力,实现模块化可扩展性、可组合能力执行和一致的系统级安全。

Comments Submitted to Engineering Applications of Artificial Intelligence (EAAI). 48 pages, 5 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05483 2026-05-26 cs.AI 57%

MMUEChange: A Generalized LLM Agent Framework for Intelligent Multi-Modal Urban Environment Change Analysis

MMUEChange:面向智能多模态城市环境变化分析的通用LLM智能体框架

Zixuan Xiao, Jun Ma, Siwei Zhang

机构 * Department of Urban Planning and Design, The University of Hong Kong(香港大学城市规划与设计系)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 提出MMUEChange多模态智能体框架,通过模块化工具包和模态控制器实现异构城市数据灵活集成与跨模态对齐,在三个城市案例中任务成功率提升46.7%并有效缓解幻觉。

Journal ref Applied Soft Computing 190 (2026) 114576

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15605 2026-05-26 cs.LG stat.ML 57%

Autoregressive Language Models are Secretly Energy-Based Models: Insights into the Lookahead Capabilities of Next-Token Prediction

自回归语言模型实际上是能量模型:对下一个词元预测的预见能力的洞察

Mathieu Blondel, Michael E. Sander, Germain Vivier-Ardisson, Tianlin Liu, Vincent Roulet

机构 * Google DeepMind(谷歌DeepMind)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 本文通过建立自回归模型与能量模型之间的双射,揭示了自回归模型在下一个词元预测范式下具备预见能力,并提供了理论误差界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25250 2026-05-26 cs.AI 57%

LipoAgent: Coordinating Fine-Tuned LLM Agents for Safer Lipid Design

LipoAgent: 协调微调的大语言模型智能体以实现更安全的脂质设计

Leshu Li, An Lu, Haiyu Wang, Zhibin Feng, Conghui Duan, Qing Bao, Zongmin Zhao, Sai Qian Zhang

机构 * New York University(纽约大学) University of Illinois Chicago(伊利诺伊大学香槟分校)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 提出LipoAgent,一种安全感知的多智能体大语言模型框架,通过条件预测目标强制毒性作为效率预测的前提,并结合多智能体验证,在mRNA转染效率预测上平均相对提升32%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24812 2026-05-26 cs.AI 57%

CoRe-Code: Collaborative Reinforcement Learning for Code Generation

CoRe-Code:面向代码生成的协作式强化学习

Zhihao Dou, Qinjian Zhao, Zhongwei Wan, Xiaoyu Xia, Sumon Biswas

机构 * The Ohio State University(俄亥俄州立大学) Royal Melbourne Institute of Technology(皇家墨尔本理工学院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 提出CoRe-Code框架,通过规划器-编码器范式和基于GRPO的协作感知强化学习,增强多智能体间的协调与专业化,提升代码生成的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11182 2026-05-26 cs.AI 57%

The Many Faces of On-Policy Distillation: Pitfalls, Mechanisms, and Fixes

在线策略蒸馏的多种面貌:陷阱、机制与修复

Siqi Zhu, Xuyan Ye, Hongyu Lu, Weiye Shi, Ge Liu

机构 * UIUC(伊利诺伊大学香槟分校) Renmin University of China(中国人民大学) Peking University(北京大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 本文通过实证研究分析了在线策略蒸馏(OPD)和在线策略自蒸馏(OPSD)在大语言模型后训练中的有效性、失败机制及修复方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08063 2026-05-26 cs.CV cs.AI 57%

Flow-OPD: On-Policy Distillation for Flow Matching Models

Flow-OPD:面向流匹配模型的在线策略蒸馏

Zhen Fang, Wenxuan Huang, Yu Zeng, Yiming Zhao, Shuang Chen, Kaituo Feng, Yunlong Lin, Lin Chen, Zehui Chen, Shaosheng Cao, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) University of California, Los Angeles(加州大学洛杉矶分校) The Chinese University of Hong Kong(香港中文大学) Xiaohongshu Inc.(小红书公司)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 提出Flow-OPD框架,通过两阶段对齐策略(单奖励GRPO微调专家+流式冷启动与在线策略蒸馏)解决流匹配模型在多任务对齐中的奖励稀疏和梯度干扰问题,并引入流形锚点正则化抑制美学退化,在GenEval和OCR指标上显著提升。

Comments Project Page: https://costaliya.github.io/Flow-OPD/ , Code: https://github.com/CostaliyA/Flow-OPD

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25411 2026-05-26 cs.CR cs.SC 50%

Heimdall: Formally Verified Automated Migration of Legacy eBPF Programs to Rust

Heimdall: 形式化验证的遗留 eBPF 程序到 Rust 的自动迁移

Vishnu Asutosh Dasu, Monika Santra, Md Rafi Ur Rashid, Ashish Kumar, Saeid Tizpaz-Niari, Gang Tan

专题命中 安全训练 :safety(abstract)

AI总结 本文提出 Heimdall,一个利用大语言模型将遗留 libbpf C 程序自动翻译为 Aya Rust 的管道,通过静态分析和符号执行确保迁移后程序行为等价,并修复了 eBPF 程序中六类源级漏洞,包括未报告的信息泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25362 2026-05-26 cs.RO 50%

Prior Policy Guided Dual-Agent Coordinated Manipulation Planning of Spacecraft-Manipulator System

先验策略引导的航天器-机械臂系统双智能体协同操控规划

Yuhui Hu, Dong Zhou, Kaihong Ouyang, Zhongliang Yu, Jianfeng Lv, Xiangyu Shao

机构 * School of Astronautics(航天学院) School of Automation(自动化学院) School of Information Science and Engineering(信息科学与工程学院)

专题命中 安全训练 :safety(abstract)

AI总结 针对空间机械臂与基座强耦合导致的姿态稳定问题,提出先验策略引导的双智能体协同操控规划框架,通过时间步级专家切换机制提升深度强化学习效率,实现末端执行器高精度到达与基座姿态稳定。

Comments 36 pages, 13 figures, 6 tables. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24972 2026-05-26 cs.IT math.IT 50%

Integrated Sensing, Communication, and Computing for NR-V2X: A Cross-Layer Resource Allocation Framework Using Multi-Agent Reinforcement Learning

面向NR-V2X的集成感知、通信与计算:基于多智能体强化学习的跨层资源分配框架

Indulekha K. P., T. G. Venkatesh

专题命中 安全训练 :safety(abstract)

AI总结 提出一种基于多智能体近端策略优化的跨层调度器MAPPO-SPS,联合优化SB-SPS预留、无线资源划分和计算卸载决策,以平衡感知精度、通信可靠性和计算延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10439 2026-05-26 cs.CE 50%

HypeR Adaptivity: Joint $hr$-Adaptive Meshing via Hypergraph Multi-Agent Deep Reinforcement Learning

HypeR 自适应:通过超图多智能体深度强化学习实现联合 $hr$ 自适应网格划分

Niccolò Grillo, James Rowbottom, Pietro Liò, Carola Bibiane Schönlieb, Stefania Fresca

专题命中 安全训练 :alignment(abstract)

AI总结 提出 HypeR 框架,利用超图神经网络和多智能体强化学习联合优化网格重定位与细化,在有限元方法中实现 $hr$ 自适应,相比纯 $h$ 自适应方法将近似误差降低 6-10 倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24309 2026-05-26 cs.CR 50%

Reframing LLM Agent Security as an Agent-Human Interaction Problem

将LLM智能体安全重新定义为智能体-人类交互问题

Peiran Wang, Ying Li, Yuan Tian

专题命中 安全训练 :alignment(abstract)

AI总结 本文通过系统分析59篇学术论文、21个生产智能体系统和26个安全插件,论证LLM智能体安全本质上是智能体-人类交互问题,而非纯算法问题,并提出了三方向研究议程。

详情

展开后加载摘要…

URL PDF HTML 收藏