arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-08 至 2026-05-08 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 6 篇

2605.05329 2026-05-08 cs.AI cs.LG 81%

Understanding Annotator Safety Policy with Interpretability

通过可解释性理解标注者安全政策

Alex Oesterling, Donghao Ren, Yannick Assogba, Dominik Moritz, Sunnie S. Y. Kim, Leon Gatys, Fred Hohman

机构 * Harvard University(哈佛大学) Apple(苹果公司)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Annotator Policy Models,通过学习标注行为揭示安全政策差异,解决标注分歧根源问题,提升安全政策设计的透明性和包容性。

Comments 38 pages, 13 figures, ACM FAccT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01669 2026-05-08 stat.ML cs.LG stat.ME 70%

PRCD-MAP: Learning How Much to Trust Imperfect Priors in Causal Discovery

PRCD-MAP:学习如何信任不完美的先验信息在因果发现中

Xihang Shan, Da Zhou

机构 * School of Mathematical Sciences(数学科学学院) Xiamen University(厦门大学)

专题命中 安全训练 :safety(abstract);trustworthy(abstract);分类 cs.LG

AI总结 PRCD-MAP通过为每个边分配信任度,结合先验信息和正则化项,提供了一种安全的因果发现方法,实验证明其在多个数据集上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21877 2026-05-08 cs.LG cs.AI 62%

P^2O: Joint Policy and Prompt Optimization

P²O:联合策略和提示优化

Xinyu Lu, Kaiqi Zhang, Jinglin Yang, Boxi Cao, Yaojie Lu, Hongyu Lin, Min He, Xianpei Han, Le Sun

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) University of Chinese Academy of Sciences(中国科学院大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) National Computer Network Emergency Response Technical Team/Coordination Center of China(中国国家计算机网络应急技术协调中心)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出P²O方法,通过交替更新连续策略与离散提示,解决RLVR在难样本上的优势崩溃问题,提升模型泛化能力并提升性能9.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05402 2026-05-08 cs.AI cs.CV eess.IV 57%

Intelligent CCTV for Urban Design: AI-Based Analysis of Soft Infrastructure at Intersections

智能监控摄像头用于城市设计:基于AI的交叉口软基础设施分析

Vinit Katariya, Seungjin Kim, Curtis Craig, Nichole Morris, Hamed Tabkhi

机构 * University of Wyoming(怀俄明大学) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) University of Minnesota(明尼苏达大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出基于AI的分析框架,利用现有监控摄像头评估软干预措施对车速和安全的影响,通过深度学习和视角基速度估计,发现软基础设施能有效降低车速,为交通政策评估提供低成本证据。

Comments 16 pages, 6 figures, 7 tables, Submitted/Under Review at the International Journal of Transportation Research (Submitted on 12 Jan 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05260 2026-05-08 cs.CR 50%

SecureMCP: A Policy-Enforced LLM Data Access Framework for AIoT Systems via Model Context Protocol

SecureMCP: 一种通过模型上下文协议实现的基于策略的LLM数据访问框架,用于AIoT系统

Wonbae Kim, Hee-Kyong Yoo

专题命中 安全训练 :prompt injection(abstract)

AI总结 本文提出SecureMCP框架,结合RBAC与MCP服务器,通过五种防御模块实现多层防护,提升LLM生成SQL的安全性,实验显示其在保护数据安全和执行准确率方面表现优异。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28129 2026-05-08 cs.RO 50%

A Position Statement on Endovascular Models and Effectiveness Metrics for Mechanical Thrombectomy Navigation, on behalf of the Stakeholder Taskforce for AI-assisted Robotic Thrombectomy (START)

关于内血管模型和机械取栓导航的有效性指标的立场声明,代表人工智能辅助机器人取栓利益相关者工作组(START)

Harry Robertshaw, Anna Barnes, Phil Blakelock, Raphael Blanc, Robert Crossley, Rebecca Fahrig, Ameer E. Hassan, Benjamin Jackson, Lennart Karstensen, Neelam Kaur, Markus Kowarschik, Jeremy Lynch, Franziska Mathis-Ullrich, Dwight Meglan, Vitor Mendes Pereira, Mouloud Ourak, Matteo Pantano, S. M. Hadi Sadati, Alice Taylor-Gee, Tom Vercauteren, Phil White, Alejandro Granados, Thomas C. Booth

机构 * on behalf of the Stakeholder Taskforce for AI-assisted Robotic Thrombectomy (START)(人工智能辅助机器人取栓任务组成员)

专题命中 安全训练 :safety(abstract)

AI总结 本文旨在建立共识框架,开发和验证人工智能辅助机器人用于取栓,标准化有效性指标并定义参考测试环境,以提升地理多样性人群的及时取栓访问。

Comments Published in Journal of the American Heart Association

Journal ref J Am Heart Assoc. 2026;15:e044931

详情

展开后加载摘要…

URL PDF HTML 收藏