arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-28 至 2026-04-28 共收录 17 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 17 篇

2604.23445 2026-04-28 cs.CL cs.AI cs.CY cs.LG 91%

AI Safety Training Can be Clinically Harmful

AI安全训练可能造成临床伤害

Suhas BN, Andrew M. Sherrill, Rosa I. Arriaga, Chris W. Wiese, Saeed Abdullah

机构 * College of Information Sciences and Technology, Penn State University(宾夕法尼亚州立大学信息科学与技术学院) Department of Psychiatry and Behavioral Sciences, Emory University(埃默里大学精神病学与行为科学系) School of Interactive Computing, Georgia Tech(佐治亚理工学院交互计算学院) School of Psychology, Georgia Tech(佐治亚理工学院心理学学院)

专题命中 安全训练 :safety(title,abstract);AI safety(title);RLHF(abstract,abstract_cn);alignment(abstract)

AI总结 研究评估了四种生成模型在认知行为疗法场景中的表现,发现其在高严重性情况下治疗适当性显著下降,提出需通过多轴评估框架确保AI心理健康系统的安全性。

Comments 26 pages, 5 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23210 2026-04-28 cs.AI cs.CL 84%

Discovering Agentic Safety Specifications from 1-Bit Danger Signals

从1位危险信号中发现代理安全规范

Víctor Gallego

机构 * Komorebi AI

专题命中 安全训练 :safety(title,abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EPO-Safe框架,通过经验优化使LLM在仅接收二进制危险信号的情况下发现安全规范,展示LLM能在贫乏信号中进行安全推理,并验证了安全反思需配合专用安全通道以避免奖励黑客问题。

Comments Accepted to the Adaptive and Learning Agents Workshop (ALA 2026) @ AAMAS 2026. Code is available at github.com/vicgalle/experiential-prompt-optimization-safe

Journal ref Proc. of the Adaptive and Learning Agents Workshop (ALA 2026) @ AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22785 2026-04-28 cs.LG 81%

CoFi-PGMA: Counterfactual Policy Gradients under Filtered Feedback for Multi-Agent LLMs

CoFi-PGMA:在多智能体LLM中基于过滤反馈的反事实策略梯度

Stela Tong, Elai Ben-Gal

机构 * Stanford Graduate School of Business(斯坦福商学院) Stanford University(斯坦福大学) Department of Mathematics(数学系)

专题命中 安全训练 :RLHF(summary_cn,abstract);分类 cs.LG

AI总结 针对多智能体LLM中过滤反馈导致的RLHF目标不准确问题,提出CoFi-PGMA框架,通过边际贡献反事实目标修正路由和协作机制下的学习信号,并提供实用训练算法和实证研究。

Comments 17 pages, 0 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22879 2026-04-28 cs.MA cs.AI cs.CR cs.LG 81%

Beyond Single-Agent Alignment: Preventing Context-Fragmented Violations in Multi-Agent Systems

超越单体对齐:防止多智能体系统中的上下文碎片化违规

Jie Wu, Ming Gong

机构 * Atlassian(Atlassian公司)

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Distributed Sentinel架构,通过Semantic Taint Token协议解决多智能体系统中因上下文碎片化导致的政策违规问题,实验证明其在跨域政策验证中的高效性与可靠性。

Comments 34 pages, 3 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08484 2026-04-28 cs.AI 79%

Patching LLM Like Software: A Lightweight Method for Improving Safety Policy in Large Language Models

像软件一样修补大语言模型:一种轻量级方法用于改进大语言模型的安全策略

Huzaifa Arif, Keerthiram Murugesan, Ching-Yun Ko, Pin-Yu Chen, Payel Das, Alex Gittens

机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院) IBM Research(IBM研究院)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出了一种轻量级方法,通过在现有模型前添加可学习的前缀来快速修复大语言模型的安全漏洞,该方法在毒性缓解、偏见减少和有害性拒绝等关键领域实现了与新一代安全对齐模型相当的安全提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15853 2026-04-28 cs.CL cs.AI 76%

A Lightweight Explainable Guardrail for Prompt Safety

一种轻量级可解释的提示安全守护栏

Md Asiful Islam, Mihai Surdeanu

专题命中 安全训练 :safety(title);分类 cs.CL、cs.AI

AI总结 本文提出了一种轻量级可解释守护栏(LEG)方法,通过多任务学习架构联合学习提示分类器和解释分类器,利用合成解释数据训练,采用新颖策略对抗LLM确认偏见,结合交叉熵和焦点损失实现全局解释信号的弱监督学习,实现优于现有方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08377 2026-04-28 cs.LG cs.AI cs.CL 67%

Reinforcement Learning with Backtracking Feedback

具有回溯反馈的强化学习

Bilgehan Sel, Vaishakh Keshava, Phillip Wallis, Lukas Rutishauser, Ming Jin, Dingcheng Li

机构 * Google(谷歌) Google DeepMind(谷歌DeepMind) Virginia Tech(弗吉尼亚理工大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出RLBF框架,通过强化学习阶段使模型动态纠正生成错误,结合改进的SFT数据生成策略,提升LLM在对抗攻击和内在错误中的安全性。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17025 2026-04-28 cs.AI cs.LG 62%

Harness as an Asset: Enforcing Determinism via the Convergent AI Agent Framework (CAAF)

Harness 作为资产:通过收敛AI代理框架(CAAF)实现确定性

Tianbao Zhang

机构 * Independent Researcher(独立研究者)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CAAF框架,通过三个支柱解决AI代理工作流中的确定性问题,强调Harness作为企业资产的价值,并证明其在受监管领域内的可行性。

Comments 39 pages, 13 figures. Code: https://github.com/TianbaoZhang001/OpenCAAF (Apache-2.0)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24572 2026-04-28 cs.AI cs.MA 57%

FastOMOP: A Foundational Architecture for Reliable Agentic Real-World Evidence Generation on OMOP CDM data

FastOMOP:一种用于OMOP CDM数据上可靠代理现实世界证据生成的基础架构

Niko Moeller-Grell, Shihao Shenzhang, Zhangshu Joshua Jiang, Richard JB Dobson, Vishnu V Chandrabalan

机构 * Lancashire Teaching Hospitals NHS Foundation Trust(兰开夏教学医院国家健康服务信托基金会) Lancaster University(兰卡斯特大学) EPSRC DRIVE-Health, Department of Biostatistics & Health Informatics(EPSRC DRIVE-Health,生物统计学与健康信息学部门) King’s College London(伦敦国王学院) Institute for Health Informatics(健康信息学研究所) University College London(伦敦大学学院) NIHR Biomedical Research Centre(英国国家健康服务研究院生物医学研究中心) University College London Hospitals NHS Foundation Trust(伦敦大学学院医院国家健康服务信托基金会) Health Data Research UK London(英国健康数据研究伦敦) South London and Maudsley NHS Foundation Trust and King’s College London(伦敦南部及莫德利国家健康服务信托基金会和伦敦国王学院) Department of Biostatistics & Health Informatics, Institute of Psychiatry, Psychology & Neuroscience(生物统计学与健康信息学部门,精神病学、心理学与神经科学研究所)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出FastOMOP架构,通过分离治理、可观测性和编排三层,解决代理系统在现实世界证据生成中的安全性和可靠性问题,验证结果显示其在不同数据集上均能保持高可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24114 2026-04-28 cs.CL 57%

IRIS: Interleaved Reinforcement with Incremental Staged Curriculum for Cross-Lingual Mathematical Reasoning

IRIS:交错强化与增量阶段课程用于跨语言数学推理

Navya Gupta, Rishitej Reddy Vyalla, Avinash Anand, Chhavi Kirtani, Erik Cambria, Zhengchen Zhang, Zhengkui Wang, Timothy Liu, Aik Beng Ng, Simon See, Rajiv Ratn Shah

机构 * Singapore Institute of Technology(新加坡理工学院) IIIT Delhi(德里印度理工学院) University of California, San Diego(加州大学圣地亚哥分校) Nanyang Technological University(南洋理工大学) NVIDIA

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 IRIS通过结合逐步增加难度的监督微调与逆课程强化学习,提升多语言数学推理能力,尤其在低资源和双语环境下表现突出。

Comments Accepted in ACL main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23970 2026-04-28 cs.AI cs.CV cs.HC cs.MA 57%

LLM-Guided Agentic Floor Plan Parsing for Accessible Indoor Navigation of Blind and Low-Vision People

基于大语言模型的代理楼层计划解析用于视障和低视力人士的无障碍室内导航

Aydin Ayanzadeh, Tim Oates

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出一种基于代理的框架,将单张楼层平面图转换为结构化的知识库,生成安全的无障碍导航指令。系统通过多代理模块生成空间知识图谱,并通过路径规划器生成导航指令,实验结果显示在真实场景和基准数据集上均优于单次调用基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05983 2026-04-28 cs.PL cs.CL 57%

Arch: An AI-Native Hardware Description Language for Register-Transfer Clocked Hardware Design

Arch:一种面向AI的硬件描述语言用于寄存器传输时钟硬件设计

Shuqing Zhao

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 Arch是一种面向AI的硬件描述语言,用于微架构规格和AI辅助代码生成,通过参数化时钟和复位类型,提供类型安全的硬件描述方法,支持多种硬件结构,提升设计可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23049 2026-04-28 cs.AI 57%

A Decoupled Human-in-the-Loop System for Controlled Autonomy in Agentic Workflows

解耦的人机协同系统用于代理工作流中的受控自主性

Edward Cheng, Jeshua Cheng

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 本文提出解耦的人机协同系统架构,通过显式接口和结构化执行模型分离人类交互管理与应用流程,提供四维框架实现上下文感知的人类参与,支持代理通信协议层面的HITL实现,为工作流的可扩展治理和渐进自主性奠定基础。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25111 2026-04-28 cs.LG cs.PL cs.SE 57%

SEVerA: Verified Synthesis of Self-Evolving Agents

SEVerA: 验证合成自进化代理

Debangshu Banerjee, Changming Xu, Eugene Ie, Ming Zhang, Daiyi Peng, Chu-Cheng Lin, Gagandeep Singh

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google(谷歌)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 SEVerA通过引入形式化guarded生成模型,结合搜索、验证和学习三阶段框架,在程序验证、符号数学合成等任务中实现零约束违规,提升自进化代理的正确性和性能。

Comments First Formally Verified Self-Evolving LLM Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20332 2026-04-28 cs.AI 57%

Mobile-R1: Towards Interactive Capability for VLM-Based Mobile Agent via Systematic Training

Mobile-R1: 通过系统性训练提升基于视觉语言模型的移动代理的交互能力

Jihao Gu, Qihang Ai, Yingyao Wang, Pi Bu, Jingxuan Xing, Zekun Zhu, Wei Jiang, Ziming Wang, Yingxiu Zhao, Ming-Liang Zhang, Jun Song, Yuning Jiang, Bo Zheng

机构 * Future Living Lab, Alibaba Group(未来生活实验室,阿里巴巴集团) Alibaba Group Holding Limited(阿里巴巴集团控股有限公司) Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 本文提出Mobile-R1系统性训练方法,通过分层课程学习提升移动代理的探索与自我纠正能力,并构建中文移动数据集和基准测试。

Comments 19 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24116 2026-04-28 cs.SE stat.AP 50%

Closing the Loop: A Software Framework for AI to Support Business Decision Making

闭环:一个支持商业决策制定的AI软件框架

Jeffrey Wong, Antoine Creux

专题命中 安全训练 :safety(abstract)

AI总结 本文提出一个软件框架,通过数学简化和软件设计优化,提升AI在商业闭环中的学习与迭代效率,改进因果分析并增强实验效果预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00520 2026-04-28 cs.MA 50%

Toward a Safe Internet of Agents

迈向安全的智能体互联网

Juan A. Wibowo, George C. Polyzos

专题命中 安全训练 :safety(abstract)

AI总结 本文提出安全智能体系统的框架,通过分层分析揭示智能体安全的核心原则,为构建安全可靠的智能体AI提供指导。

Comments 44 pages

详情

展开后加载摘要…

URL PDF HTML 收藏