arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-04 至 2026-03-04 共收录 8 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 8 篇

2603.02635 2026-03-04 cs.LG 85%

SaFeR-ToolKit: Structured Reasoning via Virtual Tool Calling for Multimodal Safety

SaFeR-ToolKit: 通过虚拟工具调用实现多模态安全的结构化推理

Zixuan Xu, Tiancheng He, Huahui Yi, Kun Wang, Xi Chen, Gongli Xi, Qiankun Li, Kang Li, Yang Liu, Zhigang Zeng

机构 * Huazhong University of Science and Technology(华中科技大学) Beijing University of Posts and Telecommunications(北京邮电大学) West China Hospital, Sichuan University(四川大学华西医院) Nanyang Technological University(南洋理工大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);DPO(abstract);分类 cs.LG

AI总结 SaFeR-ToolKit通过虚拟工具调用实现多模态安全的结构化推理,提升安全性、帮助性和推理严谨性,同时保持通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02229 2026-03-04 cs.LG cs.CL 84%

Safety Training Persists Through Helpfulness Optimization in LLM Agents

在LLM代理中通过帮助性优化保持安全性训练

Benjamin Plaut

机构 * Department of Computer Science, University of California, Berkeley, USA(计算机科学系,加州大学伯克利分校)

专题命中 安全训练 :safety(title,abstract);DPO(abstract);分类 cs.CL、cs.LG

AI总结 研究通过帮助性优化在LLM代理中保持安全性训练,发现单独训练或依次训练无法找到最佳策略,但所有配置接近帕累托前沿。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08646 2026-03-04 cs.LG cs.AI cs.CL stat.ML 80%

Mitigating Over-Refusal in Aligned Large Language Models via Inference-Time Activation Energy

通过推理时间激活能量缓解对齐大语言模型中的过度拒绝

Eric Hanchen Jiang, Weixuan Ou, Run Liu, Shengyuan Pang, Guancheng Wan, Ranjie Duan, Wei Dong, Kai-Wei Chang, XiaoFeng Wang, Ying Nian Wu, Xinfeng Li

机构 * UCLA(加州大学洛杉矶分校) Alibaba Cloud Computing(阿里云计算) SJTU(上海交通大学) Alibaba Group(阿里巴巴集团) NTU(国立科技大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过能量景观引导框架,提升大语言模型的安全性并减少虚假拒绝,实验显示在ORB-H基准上合规性显著提高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02675 2026-03-04 cs.LG 77%

From Shallow to Deep: Pinning Semantic Intent via Causal GRPO

从浅层到深层:通过因果GRPO固定语义意图

Shuyi Zhou, Zeen Song, Wenwen Qiang, Jiyan Sun, Yao Zhou, Yinlong Liu, Wei Ma

专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.LG

AI总结 通过因果GRPO框架,解决大型语言模型对对抗性前缀攻击的脆弱性问题,实现意图固定以提升安全性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21831 2026-03-04 cs.CY 57%

A Multi-Turn Framework for Evaluating AI Misuse in Fraud and Cybercrime Scenarios

针对欺诈和网络犯罪场景的多轮评估框架

Kimberly T. Mai, Anna Gausen, Magda Dubois, Mona Murad, Bessie O'Dell, Nadine Staes-Polet, Christopher Summerfield, Andrew Strait

专题命中 安全训练 :safety(abstract);分类 cs.CY

AI总结 本文提出了一种针对欺诈和网络犯罪场景的多轮评估框架,评估了当前大型语言模型在提供可操作信息方面的局限性,并揭示了安全措施和请求分解对信息提供的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02680 2026-03-04 cs.AI 57%

LLMs for High-Frequency Decision-Making: Normalized Action Reward-Guided Consistency Policy Optimization

基于大语言模型的高频决策:归一化动作奖励引导的一致性策略优化

Yang Zhao, Zihao Li, Zhiyu Jiang, Dandan Ma, Ganchao Liu, Wenzhe Zhao

机构 * School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University(人工智能学院、光学和电子学(iOPEN)、西北工业大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 本文提出NAR-CP方法,通过归一化动作奖励和一致性损失优化,提升高频决策任务中的策略一致性与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02588 2026-03-04 cs.CL 57%

ExpGuard: LLM Content Moderation in Specialized Domains

ExpGuard: 专门领域中的大语言模型内容审核

Minseok Choi, Dongjin Kim, Seungbin Yang, Subin Kim, Youngjun Kwak, Juyoung Oh, Jaegul Choo, Jungmin Son

机构 * KAIST AI(韩国科学技术院人工智能研究所) Financial Tech Lab, KakaoBank Corp(Kakao银行金融科技实验室)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 ExpGuard通过专门领域的大语言模型内容审核模型,有效提升对金融、医疗和法律领域有害内容的防御能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02555 2026-03-04 cs.IR 50%

Relevance Matters: A Multi-Task and Multi-Stage Large Language Model Approach for E-commerce Query Rewriting

相关性至关重要:一种多任务和多阶段大型语言模型方法用于电子商务查询重写

Aijun Dai, Jixiang Zhang, Haiqing Hu, Guoyu Tang, Lin Liu, Ziguang Cheng

专题命中 安全训练 :alignment(abstract)

AI总结 本文提出一种基于多任务和多阶段的大型语言模型方法,用于提升电子商务查询重写的相关性和用户转化效果。

Comments Accepted for publication at ICDE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏