arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-08 至 2026-04-08 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 6 篇

2604.05179 2026-04-08 cs.CL 85%

Gradient-Controlled Decoding: A Safety Guardrail for LLMs with Dual-Anchor Steering

梯度控制解码:一种用于LLMs的安全防护机制,具有双锚点引导

Purva Chiniya, Kevin Scaria, Sagar Chaturvedi

专题命中 安全训练 :safety(title,abstract);jailbreak(abstract);prompt injection(abstract);分类 cs.CL

AI总结 本文提出梯度控制解码(GCD),通过双锚点令牌提升安全性,降低误报率,同时在多个基准测试中有效抑制攻击,且对计算资源要求低。

Comments Accepted at LREC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05427 2026-04-08 cs.RO 78%

Pre-Execution Safety Gate & Task Safety Contracts for LLM-Controlled Robot Systems

预执行安全闸门与任务安全合同用于LLM控制的机器人系统

Ike Obi, Vishnunandan L. N. Venkatesh, Weizheng Wang, Ruiqi Wang, Dayoon Suh, Temitope I. Amosa, Wonse Jo, Byung-Cheol Min

机构 * SMART Laboratory, Department of Computer and Information Technology, Purdue University(普渡大学计算机与信息技术系SMART实验室) Department of Information and Telecommunication Engineering, Incheon National University(仁川国立大学信息与通信工程系)

专题命中 安全训练 :safety(title,abstract)

AI总结 本文提出SafeGate和Task Safety Contracts,通过神经符号安全架构和约束检查,提升LLM控制机器人系统的安全性,减少缺陷命令的执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05125 2026-04-08 cs.IR cs.AI cs.CL cs.LG 67%

Offline RL for Adaptive Policy Retrieval in Prior Authorization

离线强化学习在先决授权政策适应性检索中的应用

Ruslan Sharifullin, Maxim Gorshkov, Hannah Clay

机构 * Stanford University(斯坦福大学)

专题命中 安全训练 :DPO(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种基于离线强化学习的适应性政策检索方法,通过将检索过程建模为马尔可夫决策过程,提升了检索效率和准确性。

Comments 9 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06093 2026-04-08 eess.SY cs.LG cs.RO cs.SY 57%

eVTOL Aircraft Energy Overhead Estimation under Conflict Resolution in High-Density Airspaces

在高密度空域中,eVTOL飞行器在冲突解决中的能量开销估计

Alex Zongo, Peng Wei

机构 * George Washington University(乔治华盛顿大学)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文研究了在高密度空域中,基于修改电压势算法的冲突解决对eVTOL能量消耗的影响,发现该算法在不同密度下能量开销较低,但存在右偏分布,最高密度下尾部案例开销可达44%。

Comments Accepted for presentation at the Integrated Communications, Navigation and Surveillance Conference (ICNS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05448 2026-04-08 cs.HC 50%

Foreign Domestic Workers' Perspectives on an LLM-Based Emotional Support tool for Caregiving Burden

外国家庭佣工对基于大语言模型的情感支持工具在照护负担中的看法

Shin Shoon Nicholas Teng, Kenny Tsu Wei Choo

专题命中 安全训练 :safety(abstract)

AI总结 研究探讨了新加坡外国家庭佣工使用基于大语言模型的聊天机器人作为日常非临床情感支持工具的体验,发现其在心理安全、语言无障碍和多功能资源方面的设计启示。

Comments 5 pages, Accepted at CHI 2026 Posters

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04479 2026-04-08 cs.HC 50%

How can LLMs Support Policy Researchers? Evaluating an LLM-Assisted Workflow for Large-Scale Unstructured Data

大型语言模型如何支持政策研究?评估一个用于大规模非结构化数据的LLM辅助工作流

Yuhan Liu, Shuyao Zhou, Jakob Kaiser, Ella Colby, Jennifer Okwara, Maggie Wang, Varun Nagaraj Rao, Andrés Monroy-Hernández

专题命中 安全训练 :alignment(abstract)

AI总结 本文评估了LLM辅助工作流在处理大规模非结构化数据中的应用,探讨了其在政策研究中的可行性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏