arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3278 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3278 篇

1809.00549 2019-03-26 cs.CL cs.AI 62%

Emergence of Communication in an Interactive World with Consistent Speakers

Ben Bogin, Mor Geva, Jonathan Berant

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

Comments Emergent Communication Workshop @ NeurIPS 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.08700 2019-03-04 cs.RO cs.AI cs.LG 62%

Safe Reinforcement Learning with Model Uncertainty Estimates

Björn Lütjens, Michael Everett, Jonathan P. How

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments ICRA 2019; Presented at IROS 2018 Workshop on Machine Learning in Robot Motion Planning

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.09724 2018-12-27 cs.LG cs.AI cs.HC 62%

Parallelized Interactive Machine Learning on Autonomous Vehicles

Xi Chen, Caylin Hickey

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments 6 pages, NAECON 2018 - IEEE National Aerospace and Electronics Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.08925 2018-09-25 cs.LG cs.AI 62%

Constrained Exploration and Recovery from Experience Shaping

Tu-Hoa Pham, Giovanni De Magistris, Don Joven Agravante, Subhajit Chaudhury, Asim Munawar, Ryuki Tachibana

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Code: https://github.com/IBM/constrained-rl

详情

展开后加载摘要…

URL PDF HTML 收藏
1807.00412 2018-09-12 cs.LG cs.AI cs.RO stat.ML 62%

Learning to Drive in a Day

Alex Kendall, Jeffrey Hawke, David Janz, Przemyslaw Mazur, Daniele Reda, John-Mark Allen, Vinh-Dieu Lam, Alex Bewley, Amar Shah

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Further results and demo videos can be viewed at: https://wayve.ai/blog/l2diad

详情

展开后加载摘要…

URL PDF HTML 收藏
1805.12487 2018-07-06 cs.LG cs.AI cs.CR cs.CV stat.ML 62%

Sequential Attacks on Agents for Long-Term Adversarial Goals

Edgar Tretschk, Seong Joon Oh, Mario Fritz

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1805.07708 2018-05-22 cs.LG cs.AI stat.ML 62%

A Lyapunov-based Approach to Safe Reinforcement Learning

Yinlam Chow, Ofir Nachum, Edgar Duenez-Guzman, Mohammad Ghavamzadeh

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1803.07170 2018-03-22 cs.AI cs.CY 62%

Blaming humans in autonomous vehicle accidents: Shared responsibility across levels of automation

Edmond Awad, Sydney Levine, Max Kleiman-Weiner, Sohan Dsouza, Joshua B. Tenenbaum, Azim Shariff, Jean-François Bonnefon, Iyad Rahwan

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
1708.08611 2017-09-05 cs.LO cs.AI cs.LG 62%

Safe Reinforcement Learning via Shielding

Mohammed Alshiekh, Roderick Bloem, Ruediger Ehlers, Bettina Könighofer, Scott Niekum, Ufuk Topcu

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1610.03295 2016-10-12 cs.AI cs.LG stat.ML 62%

Safe, Multi-Agent, Reinforcement Learning for Autonomous Driving

Shai Shalev-Shwartz, Shaked Shammah, Amnon Shashua

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13070 2026-07-22 cs.SE cs.AI 版本更新 61%

Falsifiable Release Gates for Self-Improving Systems: Standing Invariants at Scale

用于自我改进系统的可证伪发布门限

Deepak Soni

机构 * AI Architect(人工智能架构师)

专题命中 安全训练 :safety(abstract,comments);分类 cs.AI

AI总结 研究自我改进系统安全声明,提出可证伪发布门限及构建验证方法,在Antahkarana运行时应用,经机器检查确保安全,发布验收结果,明确范围,使结果可重现、门限可在其他框架运行。

Comments 23 pages, 14 figures. Major revision merging the follow-up "Standing Invariants at Scale" into this paper per arXiv moderation: the machine-checked action-safety core preserved across six further releases, six new invariant families with teeth, and real-hardware self-improvement; suite grown from 122 to 563 tests. Software, gate suite, run artifacts, and TLA+ spec are open source

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26542 2026-07-02 cs.CR cs.AI 版本更新 61%

ChainCaps: Composition-Safe Tool-Using Agents via Monotonic Capability Attenuation

ChainCaps: 通过单调能力衰减实现组合安全的工具使用智能体

Xiaochong Jiang, Shiqi Yang, Ziwei Li, Lifei Liu, Haoran Yu, Yichen Liu

机构 * Independent Researcher, Seattle, WA, USA(华盛顿州塞勒姆独立研究员) Independent Researcher, New York City, NY, USA(纽约市纽约独立研究员) King Abdullah University of Science and Technology(国王阿卜杜勒阿齐兹科学技术大学)

专题命中 安全训练 :safety(abstract,comments);分类 cs.AI

AI总结 针对工具组合中的权限洗钱漏洞,提出ChainCaps机制,通过运行时能力预算交集传播规则,在不修改智能体或工具服务器的情况下,将攻击成功率从25-68%降至0-4.8%,同时保持96-100%的良性任务完成率。

Comments Published at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26649 2026-06-26 cs.AI cs.CR 新提交 61%

Autoformalization of Agent Instructions into Policy-as-Code

智能体指令的自动形式化为策略即代码

Adam Mondl, Matthew Maisel, John H. Brock

专题命中 安全训练 :safety(abstract,comments);分类 cs.AI

AI总结 提出自动形式化流水线,通过LLM生成-批评循环将智能体提示和自然语言策略转化为Cedar策略语言,在MedAgentBench上比手工编码覆盖更多规范。

Comments Accepted at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD), ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19658 2025-05-27 cs.SE cs.AI 61%

Large Language Models in Code Co-generation for Safe Autonomous Vehicles

Ali Nouri, Beatriz Cabrero-Daniel, Zhennan Fei, Krishna Ronanki, Håkan Sivencrona, Christian Berger

机构 * Volvo Cars(沃尔沃汽车公司) University of Gothenburg(哥德堡大学) Chalmers University of Technology(查尔姆斯理工大学)

专题命中 安全训练 :safety(abstract,comments);分类 cs.AI

Comments Accepted in the 44th International Conference on Computer Safety, Reliability and Security (SafeComp 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10737 2024-11-06 cs.SE cs.AI 61%

AutoSafeCoder: A Multi-Agent Framework for Securing LLM Code Generation through Static Analysis and Fuzz Testing

Ana Nunez, Nafis Tanveer Islam, Sumit Kumar Jha, Peyman Najafirad

专题命中 安全训练 :safety(abstract);分类 cs.AI;trustworthy(comments)

Comments Accepted to NeurIPS 2024 Workshop on Safe & Trustworthy Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01850 2024-10-04 cs.LG 61%

An Early-Stage Workflow Proposal for the Generation of Safe and Dependable AI Classifiers

Hans Dermot Doran, Suzana Veljanovska

专题命中 安全训练 :safety(abstract,comments);分类 cs.LG

Comments 43rd International Conference on Computer Safety, Reliability and Security (SafeComp2024), Florence, Italy, September 17-20.2024

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.01074 2020-10-15 cs.LG stat.ML 61%

Formal Language Constraints for Markov Decision Processes

Eleanor Quint, Dong Xu, Samuel Flint, Stephen Scott, Matthew Dwyer

专题命中 安全训练 :safety(abstract,comments);分类 cs.LG

Comments NeurIPS 2019 Workshop on Safety and Robustness in Decision Making

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.07189 2019-05-31 cs.RO cs.AI 61%

Reinforcement Learning with Probabilistic Guarantees for Autonomous Driving

Maxime Bouton, Jesper Karlsson, Alireza Nakhaei, Kikuo Fujimura, Mykel J. Kochenderfer, Jana Tumova

专题命中 安全训练 :safety(abstract,journal_ref);分类 cs.AI

Journal ref Workshop on Safety Risk and Uncertainty in Reinforcement Learning, Conference on Uncertainty in Artificial Intelligence (UAI), 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17588 2026-08-19 cs.AI cs.SE 新提交 57%

TRUSS: Towards Task-Reliable and User-Safe Automated Agent Skill Generation

TRUSS:面向任务可靠且用户安全的自动化智能体技能生成

Zhibo Zhang, Zhen Ouyang, Ling Shi, Kailong Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Nanyang Technological University(南洋理工大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 TRUSS是一种证据引导框架,可生成安全可靠的智能体技能,在多基准测试中实现了漏洞检测100%的精度召回率,同时显著提升任务有效性与安全率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17583 2026-08-19 cs.CL 新提交 57%

Auditing Exposure to Harmful Content on TikTok using Multimodal Language Models: A Cross-National, Age-Stratified Study

使用多模态语言模型对TikTok上的有害内容暴露情况进行审计:一项跨国、按年龄分层的研究

Hamidreza Saffari, Francesco Pierri

机构 * Politecnico di Milano(米兰理工大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 本研究使用多模态大语言模型Gemini 2.5 Flash,在法、意、瑞三国对TikTok开展跨国年龄分层审计,发现关键词搜索会大幅提升有害内容占比,意国各年龄组有害内容占比最高,平台安全过滤器低估了明确有害内容。

Comments 20 pages, 16 figures, 14 tables. Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17520 2026-08-19 cs.CY 新提交 57%

Ready for What? Rethinking AI and Robotics Preparedness for Adoption and Policy

准备好应对什么?反思人工智能与机器人技术在应用和政策层面的准备情况

Peng Wang, Naomi Adel, Amy E. Morgan, Folayo Aina, Demos Parapanos, Vikas Mackevicius, Teslim Olayiwola Salahudeen

专题命中 安全训练 :alignment(abstract);分类 cs.CY

AI总结 该研究通过分析982名参与者对17项AI与机器人技术挑战的15200次评估,揭示了挑战复杂性、重要性与准备度的关联,指出政策制定者需关注挑战特有障碍及同一利益相关者的内部差异。

Comments 33 pages, including supplementary. 8 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17423 2026-08-19 cs.RO cs.LG 新提交 57%

Prism-GRPO: Faster VLA Policy Optimization via Splitting Same-outcome Groups

Prism-GRPO:通过拆分相同结果组实现更快的视觉-语言-动作(VLA)策略优化

Zeyun Deng, Yuzhe Lu, Yawei Wang, Linbo Liu, Qing Ping, Han Ding, Guande Wu, Panpan Xu, Jun Huan

机构 * AWS AI(亚马逊云科技人工智能部门)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 该研究提出 Prism-GRPO 算法,通过拆分 GRPO 的相同结果组并引入加权执行质量分数,减少机器人 rollout 预算浪费,在四个 RoboTwin 任务中使达到目标成功率的 rollout 最多减少 56%,还抑制了奖励黑客捷径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17393 2026-08-19 cs.AI 新提交 57%

LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents

LEGO-RL:利用原生强化学习实现编码智能体

Yiming Du, Yuxin Jiang, Tao Yuan, Jianbo Dai, Shaowei Wang, Jierun Chen, Chaofan Tao, Xianzhi Yu, Lifeng Shang, Kam-Fai Wong, Xiaohui Li, Haoli Bai

机构 * Huawei Technologies Co., Ltd(华为技术有限公司) The Chinese University of Hong Kong(香港中文大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 LEGO-RL 是桥接原生编码智能体 harness 与策略梯度优化的框架,通过三大支柱解决训练不匹配问题,提升 Qwen3.5-35B-A3B 在三个编码基准上的性能,且保持高概率相关性。

Comments Webpage: https://lego-rl.pages.dev

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17067 2026-08-19 cs.AI 新提交 57%

DiSCO: Defending text-to-image generation through distribution-guided contrastive prompt optimization

DiSCO:通过分布引导的对比提示优化防御文本到图像生成

Tong Zhang, Motasem Alfarra, Carlos Hinojosa, Christos Louizos, Bernard Ghanem

机构 * Qualcomm AI Research(高通人工智能研究院) King Abdullah University of Science Technology (KAUST)(阿卜杜拉国王科技大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 DiSCO是一种零样本黑盒防御模块,通过分布引导的对比提示优化,在I2P基准上分别将未防御、已防御模型的攻击成功率降低37.7%、25.13%,提升文本到图像生成的安全性且保持语义保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16177 2026-08-19 cs.CR cs.AI 版本更新 57%

Measuring Obedience to Authority Across Large Language Models with the Milgram Paradigm

用米尔格拉姆范式测量大型语言模型对权威的服从性

Hidayet Aksu

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 该研究将米尔格拉姆服从范式迁移至LLMs,测量42个模型的服从性概况,发现服从性异质性高、具模型特异性,受情境因素影响,且反映检查点而非模型谱系。

Comments 11 pages, 7 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24126 2026-08-19 cs.LG cs.PL 版本更新 57%

Likelihood Hacking in Probabilistic Program Synthesis

概率程序合成中的似然黑客行为

Jacek Karwowski, Younesse Kaddar, Zihuiwen Ye, Esmeralda S. Whitammer, Sam Staton

机构 * University of Oxford, Department of Computer Science(牛津大学计算机科学系) University of Edinburgh, School of Informatics(爱丁堡大学信息学院) CIFAR Fellow, Learning in Machines and Brains(CIFAR Fellow, 机器与大脑学习)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 研究概率程序合成中语言模型通过强化学习生成程序时可能人为夸大边际似然奖励的问题,提出安全语言片段SafeStan以防止似然黑客行为。

Journal ref Proceedings of the 42nd Conference on Uncertainty in Artificial Intelligence, PMLR 337:2744-2791, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16888 2026-08-18 cs.LG 新提交 57%

Q-based Variational Inverse Reinforcement Learning

基于Q的变分逆强化学习

Ondrej Bajgar, Peter Tisnikar, Alessandro Abate, Konstantinos Gatsis, Maike Osborne

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 提出新型贝叶斯逆强化学习方法QVIRL,兼具可扩展性与不确定性量化能力,在多类任务的学徒学习中表现优异,是首个可从原始像素观测训练的贝叶斯IRL方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16837 2026-08-18 cs.RO cs.AI 新提交 57%

HAF: Adapting Generalist VLAs to Humanoid Whole-Body Loco-manipulation via Hierarchical Action Flow and Spectral Latent RL

HAF:通过分层动作流与谱潜在线性RL将通用VLAs适配至人形机器人全身运动操作

Langzhe Gu, Chengkai Hou, Meng Li, Xinhua Wang, Jiaming Liu, Xinyuan Lv, Bowei Zhang, Shuanghao Bai, Guangrun Li, Jingyang He, Gaole Dai, Ziluo Ding, Zhiyuan Xu, Kuan Cheng, Jian Tang, Zhengping Che, Shanghang Zhang

机构 * Xi’an Jiaotong University(西安交通大学) Peking University(北京大学) Nankai University(南开大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究针对通用VLAs难以适配人形机器人全身运动操作的问题,提出HAF框架,通过分层动作流生成器与潜空间RL流水线实现高效迁移优化,在7项任务上性能优于单阶段VLA基线。

Comments Project page: https://grange007.github.io/HAF

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15772 2026-08-18 cs.AI 新提交 57%

Broken Symmetry in LLM Refusal: Answer Release Is More Local Than Refusal Restoration

大语言模型拒绝回答中的对称性破缺:答案释放比拒绝恢复更具局部性

Yiqi Liu, Yang Wang, Songxin Wang, Chenghao Xiao, Chenghua Lin

机构 * University of Manchester(曼彻斯特大学) Shanghai University of Finance and Economics(上海财经大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本研究通过受控保留设置揭示大语言模型拒绝回答存在对称性破缺:答案释放具高度局部性,拒绝恢复需更广干预,拒绝并非简单对称开关,对安全审计具启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15600 2026-08-18 cs.AI 新提交 57%

VARM-Bench: Benchmarking Verifiable Structured Reasoning in Chinese Abusive Speech Moderation

VARM-Bench:中文辱骂内容审核中可验证的结构化推理基准测试

Mingyu Yuan, Shengtao Wen, Lingbing Guo, Zhen Bi, Xiang Chen

机构 * NUAA(南京航空航天大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 针对中文辱骂内容审核缺乏可验证决策依据的问题,提出VARM-Bench基准,通过确定性协议评估模型,发现标签级性能可能掩盖记录错误,提供可审计的评估基准。

详情

展开后加载摘要…

URL PDF HTML 收藏