arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-15 至 2026-04-15 共收录 8 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 8 篇

2604.12384 2026-04-15 cs.AI 83%

Preventing Safety Drift in Large Language Models via Coupled Weight and Activation Constraints

通过耦合权重和激活约束防止大语言模型中的安全漂移

Songping Peng, Zhiheng Zhang, Daojian Zeng, Lincheng Jiang, Xieping Gao

机构 * Hunan Normal University(湖南师范大学) The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(认知与决策智能复杂系统重点实验室,中国科学院自动化研究所) National University of Defense Technology(国防科技大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 本文提出耦合权重和激活约束方法,通过同时约束权重更新和关键特征正则化,有效提升大语言模型的安全性,实验显示其在多种任务中表现优于现有方法。

Comments 17 pages, 6 figures, 6 tables, The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12500 2026-04-15 cs.LG cs.CR 79%

Safety Training Modulates Harmful Misalignment Under On-Policy RL, But Direction Depends on Environment Design

安全训练调节策略下在策略强化学习中的有害对齐问题,但方向取决于环境设计

Leon Eshuijs, Shihan Wang, Antske Fokkens

机构 * Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) Utrecht University(埃因霍温大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 研究探讨了在策略强化学习中安全训练如何调节有害对齐问题,发现模型大小在不同环境中起到安全缓冲作用,且环境设计特征影响方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08439 2026-04-15 cs.AI 79%

Dataset Safety in Autonomous Driving: Requirements, Risks, and Assurance

自动驾驶中的数据集安全:要求、风险与保证

Alireza Abbaspour, Tejaskumar Balgonda Patil, B Ravi Kiran, Russel Mohr, Senthil Yogamani

机构 * Qualcomm Inc(高通公司)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出了一种结构化框架,用于开发符合ISO/PAS 8800指南的安全生产数据集,通过AI感知系统案例,介绍AI数据飞轮和数据集生命周期,涵盖数据收集、标注、整理与维护,并定义安全要求和验证策略以确保符合安全标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12545 2026-04-15 cs.AI cs.CY 62%

Cross-Cultural Simulation of Citizen Emotional Responses to Bureaucratic Red Tape Using LLM Agents

跨文化模拟公民对官僚繁文缛节的情感反应使用LLM代理

Wanchun Ni, Jiugeng Sun, Yixian Liu, Mennatallah El-Assady

机构 * ETH Zurich(苏黎世联邦理工学院) City University of Hong Kong(香港城市大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文通过LLM代理模拟不同文化背景下公民对官僚繁文缛节的情感反应,发现模型在东方文化中表现较弱,提出RAMO交互界面以改进模型性能。

Comments To appear in the CHI 2026 Workshop on PoliSim

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12986 2026-04-15 cs.CR cs.AI 57%

Parallax: Why AI Agents That Think Must Never Act

Parallax:为什么具有思考能力的AI代理必须永不行动

Joel Fokou

机构 * Independent Researcher(独立研究者)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出Parallax框架,通过认知-执行分离、对抗验证与渐进确定性、信息流控制和可逆执行四大原则,解决具有执行能力的AI代理安全问题,实验显示其在98.9%的攻击中有效阻止。

Comments 20 pages, 1 figure, 5 tables. Open-source reference implementation: https://github.com/openparallax/openparallax. Documentation: https://docs.openparallax.dev. Feedback welcome via email or GitHub issues

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10398 2026-04-15 cs.AI 57%

LatentRefusal: Latent-Signal Refusal for Unanswerable Text-to-SQL Queries

LatentRefusal:用于无法回答的文本到SQL查询的潜在信号拒绝

Xuancheng Ren, Shijing Hu, Zhihui Lu, Jiangqi Huang, Qiang Duan

机构 * Fudan University(复旦大学) Pennsylvania State University(宾夕法尼亚州立大学) Abington College(阿宾顿学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出LatentRefusal方法,通过分析大语言模型的中间隐藏激活来预测查询可回答性,从而在文本到SQL系统中实现安全拒绝,提升系统安全性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05914 2026-04-15 cs.CY 57%

Designing Incident Reporting Systems for Harms from General-Purpose AI

为通用人工智能造成的伤害设计事件报告系统

Kevin Wei, Lennart Heim

专题命中 安全训练 :safety(abstract);分类 cs.CY

AI总结 本文提出一个概念框架,探讨AI事件报告系统的制度设计,分析九个安全关键行业案例,提出美国AI事件报告的设计考量。

Comments Published in AAAI 2026. V2: Added Executive Summary, fixed hyperref line breaking issues

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence. 40, 44 (Mar. 2026), 38016-38029

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10026 2026-04-15 cs.CV 50%

LaV-CoT: Language-Aware Visual CoT with Multi-Aspect Reward Optimization for Real-World Multilingual VQA

LaV-CoT:具有多方面奖励优化的语言感知视觉CoT

Jing Huang, Zhiya Tan, Shutao Gong, Fanwei Zeng, Joey Tianyi Zhou, Changtao Miao, Huazhe Tan, Weibin Yao, Jianshu Li

机构 * Ant Digital Technologies, Ant Group(蚂蚁集团数字技术部) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) CFAR, Agency for Science, Technology and Research(科技研究局CFAR)

专题命中 安全训练 :alignment(abstract)

AI总结 LaV-CoT通过多阶段推理流程和多方面奖励优化,提升多语言视觉问答的准确性和泛化能力,实现在公开数据集上的9.5%准确率提升。

Comments Accepted by WWW 2026 Industry Track - Oral

详情

展开后加载摘要…

URL PDF HTML 收藏