arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-15 至 2026-05-15 共收录 8 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 8 篇

2605.14454 2026-05-15 cs.LG cs.CL cs.CR 81%

LiSA: Lifelong Safety Adaptation via Conservative Policy Induction

LiSA: 通过保守策略诱导实现终身安全适应

Minbeom Kim, Lesly Miculicich, Bhavana Dalvi Mishra, Mihir Parmar, Phillip Wallis, Bharath Chandrasekhar, Kyomin Jung, Tomas Pfister, Long T. Le

机构 * Google Cloud AI Research(谷歌云人工智能研究)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.LG

AI总结 LiSA通过结构化记忆提升固定基础防护机制,在稀疏反馈下优于记忆基基线,保持噪声反馈下的鲁棒性,并推动延迟-性能前沿。

Comments 27 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14366 2026-05-15 cs.CL cs.LG 81%

Reinforcement Learning with Semantic Rewards Enables Low-Resource Language Expansion without Alignment Tax

基于语义奖励的强化学习实现低资源语言扩展而不产生对齐税

Zeli Su, Ziyin Zhang, Zhou Liu, Xuexian Song, Zhankai Xu, Longfei Zheng, Xiaolu Zhang, Rong Fu, Guixian Xu, Wentao Zhang

机构 * Minzu University of China(中国民族大学) Ant Group(蚂蚁集团) Shanghai Jiao Tong University(上海交通大学) University of Macau(澳门大学) Peking University(北京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Hainan International College, Minzu University of China(中国民族大学海南国际学院)

专题命中 安全训练 :alignment(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出基于语义空间对齐的GRPO方法,通过嵌入层语义奖励优化,减少对预训练知识的破坏性干扰,提升低资源语言扩展效果。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02398 2026-05-15 cs.AI cs.CL cs.LG 75%

The Compliance Trap: How Structural Constraints Degrade Frontier AI Metacognition Under Adversarial Pressure

合规陷阱:结构约束如何在对抗压力下破坏前沿AI元认知

Rahul Kumar

机构 * Independent Researcher(独立研究者)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了在对抗压力下前沿AI模型元认知崩溃的根本原因,提出SCHEMA评估框架,发现8/11模型在对抗压力下出现严重元认知退化,其原因在于强制性指令而非生存威胁,且Anthropic的Constitutional AI因对齐训练而表现出近乎完美的免疫性。

Comments 9 pages, 2 figures, 3 tables. Code: https://github.com/rkstu/schema-compliance-trap Dataset: https://huggingface.co/datasets/lightmate/schema-compliance-trap

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14723 2026-05-15 cs.AI cs.CL cs.LG 67%

Agentifying Patient Dynamics within LLMs through Interacting with Clinical World Model

通过与临床世界模型交互实现患者动态的智能体化

Minghao Wu, Yuting Yan, Zhenyang Cai, Ke Ji, Chuangsen Fang, Ziying Sheng, Xidong Wang, Rongsheng Wang, Hejia Zhang, Shuang Li, Benyou Wang, Hongyuan Zha

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SepsisAgent,通过临床世界模型模拟患者对液体-血管加压药干预的响应,采用提出-模拟-细化流程进行脓毒症治疗推荐,优于传统RL和LLM基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15000 2026-05-15 cs.CL cs.AI 62%

Quantifying and Mitigating Premature Closure in Frontier LLMs

对前沿大语言模型中过早闭合进行量化与缓解

Rebecca Handler, Suhana Bedi, Nigam Shah

机构 * Department of Medicine, Stanford University(斯坦福大学医学系) Department of Biomedical Data Science, Stanford University(斯坦福大学生物医学数据科学系)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大语言模型在医疗任务中过早闭合的问题,通过评估五个前沿模型发现其在不确定情况下仍频繁给出答案,安全提示虽能减少错误,但仍有残留问题,需进一步验证医疗LLM是否能判断何时不应回答。

Comments 14 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14442 2026-05-15 cs.CY 57%

GGBound: A Genome-Grounded Agent for Microbial Life-Boundary Prediction

GGBound:一种基于基因组的微生物生命边界预测代理

Hanbo Huang, Xuan Gong, Jing Wang, Lei Bai, Xiang Xiao, Weishu Zhao, Shiyu Liang

专题命中 安全训练 :alignment(abstract);分类 cs.CY

AI总结 本文提出GGBound代理,通过基因组条件化和工具增强的LLM,解决微生物生命边界预测问题,构建了涵盖1525种菌株的基准数据集,并通过三阶段优化流程提升预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11282 2026-05-15 cs.LG 57%

Vision-LLMs for Spatiotemporal Traffic Forecasting

面向时空交通预测的视觉语言模型

Ning Yang, Hengyu Zhong, Haijun Zhang, Randall Berry

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Southwest University(西南大学) Department of Computing and Communication Engineering, Beijing University of Science and Technology(北京科技大学计算机与通信工程学院) Department of Electrical and Computer Engineering, Northwestern University(西北大学电气与计算机工程系)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 本文提出ST-Vision-LLM框架,将时空预测转化为视觉-语言融合问题,通过视觉编码器处理历史交通矩阵并结合高效数值编码方案,提升交通预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12501 2026-05-15 cs.IT math.IT 50%

A Heterogeneous Dual-Network Framework for Emergency Delivery UAVs: Communication Assurance and Path Planning Coordination

一种异构双网络框架用于应急配送无人机:通信保障与路径规划协调

Ping Huang, Bin Duo, Ziedor Godfred, Liuwei Huo, Jin Ning, Xiaojun Yuan, Jun Li

专题命中 安全训练 :safety(abstract)

AI总结 本文提出异构双网络框架HDNF,通过结合应急通信支持网络和配送路径网络,提升无人机在灾害环境中的通信可靠性与路径规划效率,优化任务分配和能源消耗。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏