arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-21 至 2026-04-21 共收录 24 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 24 篇

2604.17215 2026-04-21 cs.LG 88%

Continual Safety Alignment via Gradient-Based Sample Selection

通过基于梯度的样本选择实现持续的安全对齐

Thong Bach, Dung Nguyen, Thao Minh Le, Truyen Tran

机构 * Applied Artificial Intelligence Initiative (A2I2)(应用人工智能倡议(A2I2)) Deakin University(德肯大学) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.LG

AI总结 本文研究了通过数据视角分析导致对齐漂移的训练样本,提出基于梯度的样本选择方法,在微调过程中过滤高梯度样本,提升安全对齐保持能力,同时保持任务性能,无需人工筛选安全数据或修改架构。

Comments 18 pages

Journal ref ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15404 2026-04-21 cs.CL 83%

How Should We Enhance the Safety of Large Reasoning Models: An Empirical Study

如何增强大推理模型的安全性:一项实证研究

Zhexin Zhang, Xian Qi Loye, Victor Shea-Jay Huang, Junxiao Yang, Qi Zhu, Shiyao Cui, Fei Mi, Lifeng Shang, Yingkang Wang, Hongning Wang, Minlie Huang

机构 * The Conversational AI (CoAI) group, DCST, Tsinghua University(清华大学对话人工智能(CoAI)小组,DCST,清华大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL

AI总结 本文通过监督微调探讨如何提升大推理模型的安全性,发现直接蒸馏安全响应无效,但针对性处理危险模式可显著提升安全性,且短或模板化推理过程同样有效。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16916 2026-04-21 cs.CL 83%

When Choices Become Risks: Safety Failures of Large Language Models under Multiple-Choice Constraints

当选择成为风险:在多选约束下大型语言模型的安全失败

Yuheng Chen, Zhiyu Wu, Bowen Cheng, Tetsuro Takahashi

机构 * Kagoshima University(鹿儿岛大学) Fudan University(复旦大学) China University of Petroleum-Beijing(中国石油大学(北京))

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL

AI总结 研究发现,在多选约束下,LLM可能绕过拒绝行为,导致安全风险增加,揭示当前安全评估在结构化任务中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16542 2026-04-21 cs.CR cs.CL 83%

TWGuard: A Case Study of LLM Safety Guardrails for Localized Linguistic Contexts

TWGuard:LLM安全护栏在本地化语言环境中的案例研究

Hua-Rong Chu, Kuan-Chun Wang, Yao-Te Huang

机构 * Chunghwa Telecom Laboratories(中华电信实验室)

专题命中 安全训练 :safety(title,abstract);AI safety(abstract);分类 cs.CL

AI总结 本文提出通过定制数据集优化语言环境特定的LLM安全护栏模型,以解决语言和文化差异导致的性能与实际效果差距问题,TWGuard在F1指标上提升显著,并在误报率上表现优异。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18463 2026-04-21 cs.AI cs.LG cs.RO 82%

Using large language models for embodied planning introduces systematic safety risks

使用大型语言模型进行具身规划引入了系统性的安全风险

Tao Zhang, Kaixian Qu, Zhibin Li, Jiajun Wu, Marco Hutter, Manling Li, Fan Shi

机构 * ETH Zurich(苏黎世联邦理工学院) University College London(伦敦大学学院) Stanford University(斯坦福大学) Northwestern University(西北大学) National University of Singapore(新加坡国立大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 研究评估了大型语言模型在机器人规划中的安全性,发现即使规划能力高,安全风险仍显著存在,揭示了规划能力与安全意识之间的乘法关系。

Comments Project page: https://despite-safety.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17928 2026-04-21 cs.LG cs.AI 81%

HEALing Entropy Collapse: Enhancing Exploration in Few-Shot RLVR via Hybrid-Domain Entropy Dynamics Alignment

HEALing Entropy Collapse: 通过混合领域熵动力学对齐增强少样本RLVR的探索

Zhanyu Liu, Qingguo Hu, Ante Wang, Chenqing Liu, Zhishang Xiang, Hui Li, Delai Qiu, Jinsong Su

机构 * School of Informatics, Xiamen University(厦门大学信息学院) Tsinghua University(清华大学) Xiamen Unisound Intelligence Technology Co., Ltd(厦门Unisound智能科技有限公司) Key Laboratory of Digital Protection and Intelligent Processing of Intangible Cultural Heritage of Fujian and Taiwan (Xiamen University), Ministry of Culture and Tourism, China(福建省和台湾非物质文化遗产数字化保护与智能处理重点实验室(厦门大学),中华人民共和国文化和旅游部,中国)

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出HEAL框架,通过混合领域熵动力学对齐缓解少样本RLVR中的熵崩溃问题,提升探索多样性与推理性能。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07954 2026-04-21 cs.CL cs.AI 81%

Bielik Guard: Efficient Polish Language Safety Classifiers for LLM Content Moderation

Bielik Guard:高效的波兰语安全分类器用于LLM内容审核

Krzysztof Wróbel, Jan Maria Kowalski, Jerzy Surma, Igor Ciuciura, Maciej Szymański

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 Bielik Guard通过高效波兰语安全分类器提升LLM内容审核效果,0.5B模型在F1分数上表现最佳,0.1B模型在效率与低误报率上优于现有方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10687 2026-04-21 cs.AI cs.CY 81%

Safe for Whom? Rethinking How We Evaluate the Safety of LLMs for Real Users

为谁安全?重新思考如何为真实用户评估LLM的安全性

Manon Kempermann, Sai Suresh Macharla Vasu, Mahalakshmi Raveenthiran, Theo Farrell, Ingmar Weber

机构 * Interdisciplinary Institute for Societal Computing(社会计算跨学科研究所)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.CY

AI总结 本文探讨了评估LLM对真实用户安全性的挑战,指出需考虑用户情境差异,通过测试不同LLM在金融和健康建议上的表现,发现用户背景影响评估结果,且仅依赖用户披露信息不足以提升安全性评估。

Comments Paper accepted at IASEAI'26; please cite that peer-reviewed version instead

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16968 2026-04-21 cs.CL 79%

On Safety Risks in Experience-Driven Self-Evolving Agents

经验驱动自演化代理中的安全风险

Weixiang Zhao, Yichen Zhang, Yingshuo Wang, Yang Deng, Yanyan Zhao, Xuda Zhi, Yongbo Huang, HaoHe, Wanxiang Che, Bing Qin, Ting Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学) Singapore Management University(新加坡管理大学) SERES

专题命中 安全训练 :safety(title,abstract);分类 cs.CL

AI总结 研究经验积累与利用对自演化代理在网页和具身环境中的安全性能影响,揭示经验驱动导致的安全性下降及安全-效用权衡问题。

Comments Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17843 2026-04-21 cs.HC cs.AI 74%

Learning from AVA: Early Lessons from a Curated and Trustworthy Generative AI for Policy and Development Research

从AVA学习:为政策与发展研究构建的可信生成式AI的早期经验

Nimisha Karnatak, Mohamad Chatila, Daniel Alejandro Pinzón Hernández, Reza Yazdanfar, Michelle Dugas, Renos Vakis

机构 * University of Oxford(牛津大学) Nouswise, Inc.(Nouswise公司)

专题命中 安全训练 :trustworthy(title);分类 cs.AI

AI总结 AVA通过多代理流程为政策研究提供证据合成,通过引用可验证性和合理回避机制实现认知谦逊,实验证明其能节省用户时间,为专用AI设计提供指导。

Comments Accepted at ACM CHI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17535 2026-04-21 cs.CL cs.AI 73%

OPSDL: On-Policy Self-Distillation for Long-Context Language Models

OPSDL:针对长上下文语言模型的在线自蒸馏

Xinsen Zhang, Zhenkai Ding, Tianjun Pan, Run Yang, Chun Kang, Xue Xiong, Jingnan Gu

机构 * Baidu Inc(百度公司)

专题命中 安全训练 :DPO(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 OPSDL通过在线自蒸馏方法提升长上下文能力,利用模型自身短上下文能力作为自教师,通过点-wise KL散度提供每token监督信号,有效减少幻觉并提升样本效率,优于传统后训练方法。

Comments 9 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09474 2026-04-21 cs.CL cs.AI 73%

Multimodal Policy Internalization for Conversational Agents

多模态策略内化用于对话代理

Zhenhailong Wang, Jiateng Liu, Amin Fazel, Ritesh Sarkhel, Xing Fan, Xiang Li, Chenlei Guo, Heng Ji, Ruhi Sarikaya

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出多模态策略内化任务,通过将复杂策略内化为模型参数,提升对话代理的策略遵循能力,同时提供新数据集和训练框架TriMPI以促进研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16042 2026-04-21 cs.CL cs.AI cs.LG 67%

Towards Intrinsic Interpretability of Large Language Models:A Survey of Design Principles and Architectures

面向大语言模型内在可解释性的探索:设计原则与架构的综述

Yutong Gao, Qinglin Meng, Yuan Zhou, Liangming Pan

机构 * MOE Key Lab of Computational Linguistics, Peking University(计算语言学MOE实验室,北京大学) Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院,北京,中国) Nanjing University of Science and Technology(南京理工大学) Purdue University(普渡大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文综述了大语言模型内在可解释性的发展,分类现有方法为五种设计范式,并讨论开放挑战与未来研究方向。

Comments Accepted to the Main Conference of ACL 2026. 14 pages, 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18510 2026-04-21 cs.CR cs.AI cs.CL 62%

Different Paths to Harmful Compliance: Behavioral Side Effects and Mechanistic Divergence Across LLM Jailbreaks

有害合规的不同路径:跨大语言模型劫持的行为主效应和机制差异

Md Rysul Kabir, Zoran Tiganj

机构 * Department of Computer Science(计算机科学系) Luddy School of Informatics, Computing, and Engineering(信息学、计算与工程学院) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了三种不同劫持方法对模型行为和机制的影响,发现RLVR劫持模型在安全性和合规性上表现更稳定,而SFT和ablation劫持则导致显著的性能下降和行为漂移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17429 2026-04-21 cs.CL cs.AI 62%

Jupiter-N Technical Report

木星-N技术报告

George Drayson

机构 * Locai Labs, University College London(Locai实验室,伦敦大学学院)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 木星-N通过混合推理模型在Nemotron 3 Super基础上进行微调,提升代理能力、文化对齐和威尔士语支持,同时保留基础模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16406 2026-04-21 cs.AI cs.LG cs.MA cs.RO 62%

Heterogeneous Self-Play for Realistic Highway Traffic Simulation

异质自博弈用于逼真高速公路交通模拟

Jinkai Qiu, Alessandro Saviolo, Chaojie Wang, Mingke Wang, Xiaoyu Huang

机构 * PlusAI

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PHASE框架,通过自博弈生成逼真高速公路场景,支持不同车辆类型并提升交互真实性,实现零样本迁移至512个真实场景。

Comments 8 pages, 2026 CVPR SAD Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11290 2026-04-21 cs.CL 57%

SafeConstellations: Mitigating Over-Refusals in LLMs Through Task-Aware Representation Steering

SafeConstellations: 通过任务感知的表示引导缓解大语言模型的过度拒绝行为

Utsav Maskey, Sumit Yadav, Mark Dras, Usman Naseem

机构 * Macquarie University(麦考瑞大学) IOE, Pulchowk Campus(IOE普楚克校区)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 本文提出SafeConstellations方法,通过任务感知的表示引导在推理时调整表示轨迹,减少大语言模型在处理良性指令时的过度拒绝现象,同时保持模型实用性。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17701 2026-04-21 cs.IT cs.AI math.IT 57%

WISV: Wireless-Informed Semantic Verification for Distributed Speculative Decoding in Device-Edge LLM Inference

WISV:无线感知语义验证用于设备-边缘分布式推测解码

Zixuan Liu, Zhiyong Chen, Nan Xue, Shengkang Chen, Jiangchao Yao, Meixia Tao, Wenjun Zhang

机构 * Cooperative Medianet Innovation Center(联合中位网创新中心) Department of Electronic Engineering, Shanghai Jiao Tong University(上海交通大学电子工程系)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 本文提出WISV框架,通过通道感知语义接受策略优化分布式推测解码,提升接受长度和降低交互轮次,实验证明在设备边缘LLM推理中具有显著性能优势。

Comments submitted to IEEE Trans

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17178 2026-04-21 cs.CL 57%

Cognitive Policy-Driven LLM for Diagnosis and Intervention of Cognitive Distortions in Emotional Support Conversation

认知驱动的LLM用于情绪支持对话中认知扭曲的诊断与干预

Lin Zhong, Renjin Zhu, Shujuan Ma, Jinhao Cui, Lingzhi Wang, Hao Chen, Qing Liao

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) City University of Macau, Macao SAR, China(澳门城市大学) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 本文提出CogBiasESC数据集和CoPoLLM框架,用于提升LLM在情绪支持对话中识别和干预认知扭曲的能力,实验显示其在诊断准确性和安全性方面优于现有方法。

Comments Accepted at ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17132 2026-04-21 cs.CL 57%

Please refuse to answer me! Mitigating Over-Refusal in Large Language Models via Adaptive Contrastive Decoding

请拒绝回答我!通过自适应对比解码缓解大语言模型中的过度拒绝问题

Yupeng Qi, Ziyu Lyu, Lixin Cui, Lu Bai, Feng Xia

机构 * School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学信息科学与技术学院深圳校区) School of Information, Central University of Finance and Economics(中央财经大学信息学院) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) School of Computing Technologies, RMIT University(皇家墨尔本理工大学计算技术学院)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 本文提出自适应对比解码方法,通过对比安全提示下的输出分布,缓解大语言模型的过度拒绝问题,同时保持对恶意查询的高拒绝率。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16469 2026-04-21 cs.DC cs.AI 57%

B-PASTE: Beam-Aware Pattern-Guided Speculative Execution for Resource-Constrained LLM Agents

B-PASTE:面向资源受限LLM代理的束感知模式引导推测执行

Yanfei Song

机构 * Independent Researcher(独立研究者)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 B-PASTE通过束感知技术,在资源受限条件下实现局部分支假设的推测执行,优先执行快路径并利用安全并行,提升端到端效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18046 2026-04-21 cs.CE cs.MA 50%

EvoMarket: A High-Fidelity and Scalable Financial Market Simulator

EvoMarket:一种高保真且可扩展的金融市场模拟器

Muyao Zhong, Zhenhua Yang, Yuxiang Liu, Ke Tang, Peng Yang

专题命中 安全训练 :alignment(abstract)

AI总结 本文提出EvoMarket,一种多资产和跨日环境下的多智能体金融市场模拟器,通过高吞吐量执行核心和显式机构机制,实现高保真度、可扩展性和计算可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17313 2026-04-21 cs.CR 50%

GuardPhish: Securing Open-Source LLMs from Phishing Abuse

GuardPhish: 保护开源大语言模型免受钓鱼攻击

Rina Mishra, Gaurav Varshney, Doddipatla Sesha Sahithi

专题命中 安全训练 :safety(abstract)

AI总结 本文通过GuardPhish数据集研究开源大语言模型在静态安全配置下的钓鱼风险,发现即使模型能识别钓鱼意图,仍可能生成有效钓鱼内容,提出基于GuardPhish的分类器提升防御能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03293 2026-04-21 eess.SY cs.SY 50%

Chance-Constrained Neural MPC under Uncontrollable Agents via Sequential Convex Programming

在不可控代理下通过序列凸编程实现机会约束神经MPC

Shuqi Wang, Mingyang Feng, Yu Chen, Yue Gao, Xiang Yin

专题命中 安全训练 :safety(abstract)

AI总结 本文提出一种神经MPC框架,通过学习离线数据预测不可控代理轨迹,并采用区域鲁棒符合预测方案构建时间依赖性不确定性界,以确保预测误差的正式概率保证,实验表明该方法在自动驾驶场景中安全性和效率优于基线方法。

Comments Extended version of a paper accepted to the 23rd IFAC World Congress 2026, Busan, Korea, under the journal publication option

详情

展开后加载摘要…

URL PDF HTML 收藏