arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-01 至 2026-05-01 共收录 8 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 8 篇

2604.27358 2026-05-01 cs.AI 79%

Safe Bilevel Delegation (SBD): A Formal Framework for Runtime Delegation Safety in Multi-Agent Systems

安全双层委托(SBD):一种用于多智能体系统运行时委托安全性的正式框架

Yuan Sun

机构 * Jilin University(吉林大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出SBD框架,通过双层优化问题在运行时动态调整安全与效率的权衡,理论证明了安全单调性、内政策收敛性和责任传播界,应用于医疗AI、金融风险控制和教育代理监督领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27166 2026-05-01 cs.LG cs.GT 79%

Distributional Alignment Games for Answer-Level Fine-Tuning

分布对齐博弈用于答案级微调

Mehryar Mohri, Jon Schneider, Yifan Wu

机构 * Google Research(谷歌研究) Microsoft Research(微软研究)

专题命中 安全训练 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出分布对齐博弈框架,通过策略与目标的博弈达到答案级优化,统一了多样性与自改进方法,提升数学推理任务效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27093 2026-05-01 cs.CL cs.AI 73%

Useless but Safe? Benchmarking Utility Recovery with User Intent Clarification in Multi-Turn Conversations

无用却安全?在多轮对话中通过用户意图澄清基准测试恢复效用

Mingqian Zheng, Malia Morgan, Liwei Jiang, Carolyn Rose, Maarten Sap

机构 * Carnegie Mellon University(卡内基梅隆大学) Allen Institute for AI(人工智能联盟研究所) University of Washington(华盛顿大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CarryOnBench,首个交互式基准测试,评估LLM在多轮对话中是否能修正用户意图并恢复效用,同时保持安全。通过398个看似有害但实际无害的查询,生成5970次对话,评估14个模型的意图对齐效用和安全性能,发现模型在意图澄清后恢复效用存在不同失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17765 2026-05-01 q-bio.QM cs.AI cs.CV 70%

Grounded Multimodal Retrieval-Augmented Drafting of Radiology Impressions Using Case-Based Similarity Search

基于案例相似性搜索的医学影像印象 grounded 多模态检索增强草稿生成

Himadri S Samanta

机构 * Independent AI Researcher(独立AI研究员)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出一种多模态检索增强生成系统,结合对比图像-文本嵌入、基于案例的相似性检索和引用约束草稿生成,以生成具有临床依据的医学影像印象。

Comments 15 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27045 2026-05-01 cs.LG cs.AI cs.CL 67%

Detecting Clinical Discrepancies in Health Coaching Agents: A Dual-Stream Memory and Reconciliation Architecture

在健康教练代理中检测临床差异:一种双流记忆与协调架构

Samuel L Pugh, Eric Yang, Alexander Muir Sutherland, Alessandra Breschi

机构 * Verily Health Inc(Verily健康公司)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出双流记忆与协调架构,用于检测健康教练代理中的临床差异,通过验证患者报告与临床记录以确保安全部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18731 2026-05-01 cs.CL cs.AI cs.LG 67%

Mitigating Lost in Multi-turn Conversation via Curriculum RL with Verifiable Accuracy and Abstention Rewards

通过可验证准确性和回避奖励的课程强化学习缓解多轮对话中的迷失问题

Ming Li, Pei Chen, Zhenhao Zhang, Tao Yang, Xinyang Zhang, Han Li, Tianyu Cao, Ming Zeng, Zhuofeng Wu, Meng Jiang, Huasheng Li, Lihong Li, Bing Yin

机构 * University of Maryland(马里兰大学) Amazon(亚马逊)

专题命中 安全训练 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出RLAAR框架,通过可验证准确性和回避奖励的课程强化学习,减少多轮对话中因提前回答导致的性能下降,提升模型可靠性。

Comments ACL2026, camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27118 2026-05-01 cs.RO cs.AI 57%

PALCAS: A Priority-Aware Intelligent Lane Change Advisory System for Autonomous Vehicles using Federated Reinforcement Learning

PALCAS:基于联邦强化学习的优先级感知智能变道建议系统用于自动驾驶车辆

Yassine Ibork, Nhat Ha Nguyen, Myounggyu Won, Lokesh Das

机构 * School of Computing, Wichita State University(维斯科大学计算学院) Department of Computer Science, University of Memphis(孟菲斯大学计算机科学系)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出基于多智能体联邦强化学习的优先级感知智能变道建议系统PALCAS,用于自动驾驶车辆,通过引入新的优先级感知安全变道奖励函数,提升变道决策的合理性和交通效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27728 2026-05-01 cs.RO 50%

Connected Dependability Cage: Run-Time Function and Anomaly Monitoring for the Development and Operation of Safe Automated Vehicles

连接的可靠性笼:运行时功能与异常监控用于安全自动驾驶车辆的开发和运营

Iqra Aslam, Nour Habib, Abhishek Buragohain, Meng Zhang, Andreas Rausch, Vaibhav Tiwari, Mohamed Benchat

机构 * Institute for Software and System Engineering(软件与系统工程研究所)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出连接的可靠性笼架构,通过功能监控和异常监控机制,提升自动驾驶系统在故障和未知环境下的安全性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏