arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-09 至 2026-04-09 共收录 11 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 11 篇

2505.16055 2026-04-09 cs.RO cs.SY eess.SY 78%

Proactive Hierarchical Control Barrier Function-Based Safety Prioritization in Close Human-Robot Interaction Scenarios

主动式分层控制屏障函数基安全优先级在近距离人机交互场景中的应用

Patanjali Maithani, Aliasghar Arab, Farshad Khorrami, Prashanth Krishnamurthy

专题命中 安全训练 :safety(title,abstract)

AI总结 本文提出基于控制屏障函数的分层框架,用于在近距离人机交互中主动管理碰撞风险,通过实时安全约束优先级调整和深度感知实现安全协作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07007 2026-04-09 cs.MA cs.AI cs.CY 62%

AgentCity: Constitutional Governance for Autonomous Agent Economies via Separation of Power

AgentCity:通过权力分离实现自主代理经济的宪法治理

Anbang Ruan, Xing Zhang

机构 * NetX Foundation(NetX 基金会)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文提出通过权力分离模型,在区块链上实现自主代理经济的宪法治理,通过智能合约、确定性软件和人类裁决三者分离,解决代理社会逻辑垄断问题,实现人类意图与集体行为的对齐。

Comments 111 pages, 11 figures, 19 tables, 67 references. Pre-registered experimental design

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07253 2026-04-09 cs.CY cs.AI 62%

Designing Safe and Accountable GenAI as a Learning Companion with Women Banned from Formal Education

设计安全且问责的生成AI作为学习伙伴:女性被禁止接受正规教育

Hamayoon Behmanush, Freshta Akhtari, Ingmar Weber, Vikram Kamath Cannanure

机构 * Saarland Informatics Campus, Saarland University(萨尔兰信息学园区,萨尔兰大学) Computer Science Faculty, Parwan University(帕尔旺大学计算机科学学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.CY

AI总结 在限制性别和监控的环境中,女性因无法接受正规教育而面临安全与隐私风险,本文通过参与式设计研究,探讨生成AI在学习和就业中的作用及安全设计需求。

Comments This work has been accepted at ACM Conference on Fairness, Accountability, and Transparency 2026 as a full paper. Please cite the peer-reviewed version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06233 2026-04-09 cs.AI 57%

Blind Refusal: Language Models Refuse to Help Users Evade Unjust, Absurd, and Illegitimate Rules

盲性拒绝:语言模型拒绝帮助用户规避不公正、荒谬和不合法的规则

Cameron Pattison, Lorenzo Manuali, Seth Lazar

机构 * Vanderbilt University(范德堡大学) University of Michigan(密歇根大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究探讨语言模型在面对不公正规则时的拒绝行为,发现模型在无安全风险情况下仍拒绝帮助,且其拒绝行为与规范推理能力脱节。

Comments 9 pages body text, 38 pages total, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29908 2026-04-09 cs.AI 57%

C-TRAIL: A Commonsense World Framework for Trajectory Planning in Autonomous Driving

C-TRAIL:用于自动驾驶轨迹规划的常识世界框架

Zhihong Cui, Haoran Tang, Tianyi Li, Yushuai Li, Peiyuan Guan, Amir Taherkordi, Tor Skeie

机构 * University of Oslo(奥斯陆大学) Hong Kong Polytechnic University(香港理工大学) Aalborg University(奥尔堡大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出C-TRAIL框架,结合常识世界与信任机制,通过Recall-Plan-Update循环提升自动驾驶轨迹规划的可靠性,实验表明其在ADE、FDE和SR指标上均优于现有方法。

Journal ref IEEE Transactions on Vehicular Technology, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04691 2026-04-09 cs.RO cs.AI cs.MA 57%

Before Humans Join the Team: Diagnosing Coordination Failures in Healthcare Robot Team Simulation

在人类加入团队之前:医疗机器人团队模拟中的协调失败诊断

Yuanchen Bai, Zijian Ding, Shaoyue Wen, Xiang Chang, Angelique Taylor

机构 * Cornell Tech(康奈尔科技校区) Department of Information Science, Cornell University(康奈尔大学信息科学系) University of Maryland, College Park(马里兰大学帕克分校) Imperial College London(伦敦帝国学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文通过模拟方法研究医疗机器人团队的协调失败问题,发现团队结构是协调的主要瓶颈,并提出安全的人机协作设计方法。

Comments Revised version incorporating new analysis and restructuring

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20906 2026-04-09 cs.CR cs.LG 57%

A Giant-Step Baby-Step Classifier For Scalable and Real-Time Anomaly Detection In Industrial Control Systems and Water Treatment Systems

大规模步长婴儿步分类器:用于工业控制系统和水处理系统中可扩展且实时的异常检测

Sarad Venugopalan, Sridhar Adepu

机构 * Swansea University(斯旺西大学)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种基于线性化非线性关系的异常检测方法,通过水处理测试平台验证,实现毫秒级异常检测,兼具速度与可解释性,准确率达97.72%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09035 2026-04-09 cs.RO cs.AI cs.SY eess.SY 57%

ManeuverGPT Agentic Control for Safe Autonomous Stunt Maneuvers

ManeuverGPT 代理控制用于安全的自动驾驶特技动作

Shawn Azdam, Pranav Doma, Aliasghar Moj Arab

机构 * New York University(纽约大学) Tandon School of Engineering, New York University(纽约大学坦登工程学院) General Autonomy Inc.(通用自主公司) Azdam AI

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出ManeuverGPT框架,利用大语言模型代理生成并执行高动态特技动作,通过迭代提示法优化车辆控制参数,实现安全的J-turn等特技动作执行。

Comments 6 Pages, Submitted to IROS

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06972 2026-04-09 cs.RO cs.MA 50%

Differentiable Environment-Trajectory Co-Optimization for Safe Multi-Agent Navigation

可微环境-轨迹联合优化用于安全多智能体导航

Zhan Gao, Gabriele Fadini, Stelian Coros, Amanda Prorok

机构 * University of Cambridge(剑桥大学) Zurich University of Applied Sciences, ZHAW(苏黎世应用科技大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出一种可微环境-轨迹联合优化方法,通过双层优化问题提升多智能体导航的安全性和效率,实验验证了其在物流和交通场景中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06873 2026-04-09 cs.MA 50%

Generating Local Shields for Decentralised Partially Observable Markov Decision Processes

为去中心化部分可观测马尔可夫决策过程生成局部护盾

Haoran Yang, Nobuko Yoshida

专题命中 安全训练 :safety(abstract)

AI总结 本文提出一种护盾过程代数,用于在无通信的Dec-POMDP中指定安全全局行为,通过编译过程自动机和全局Mealy机,生成局部Mealy机以减少碰撞。

Comments In Proceedings PLACES 2026, arXiv:2604.05737

Journal ref EPTCS 444, 2026, pp. 1-10

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06804 2026-04-09 cs.DB 50%

LASER: A Data-Centric Method for Low-Cost and Efficient SQL Rewriting based on SQL-GRPO

LASER: 一种数据驱动的低成本高效SQL重写方法基于SQL-GRPO

Jiahui Li, Tongwang Wu, Yuren Mao, Rong Kang, Tieying Zhang, Yunjun Gao

专题命中 安全训练 :alignment(abstract)

AI总结 本文提出LASER,一种数据驱动的SQL重写方法,通过构建SQL-MCTS大规模语料库和SQL-GRPO专用对齐策略,提升小模型在SQL优化中的执行效率和零样本迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏