arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-19 至 2026-08-19 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 隐私与版权 3 篇

2608.17051 2026-08-19 cs.CL cs.AI 新提交 62%

Institution-Specific LLM Prompting Recovers PHI That De-identification Systems and Their Gold Standards Both Miss

基于机构特定的大语言模型提示工程恢复去标识化系统及其黄金标准均遗漏的受保护健康信息

Daniel Palacios, Matthew Brady Neeley, Angel Adetomike Otto, Shalini Dhamodharan, John P. Woodhouse, Chi-fan Lin, Mark Zobeck, Zhandong Liu, Hyun-Hwan Jeong

机构 * Baylor College of Medicine(贝勒医学院) Jan and Dan Duncan Neurological Research Institute(简与丹·邓肯神经学研究所)

专题命中 隐私与版权 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出校准良好的上下文学习(ICL)的大语言模型(LLM),可通过机构特定提示恢复去标识化系统遗漏的受保护健康信息(PHI),平衡精确率与召回率,是专用去标识化系统的有效替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04772 2026-08-19 cs.CL cs.AI 版本更新 62%

Guideline-as-Oracle: Zero-Annotation Training of an Ophthalmic Telephone Triage Agent

以指南为神谕:眼科电话分诊智能体的零标注训练

Chenyu Wang, Yi Liu, Baoqing Li, Min Tu, Diping Song

专题命中 隐私与版权 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出以指南为神谕(GAO)方法,将美国眼科学会指南转化为训练监督信号,零标注训练出GAO-Triage智能体,大幅提升眼科电话分诊的一致性与紧急案例召回率,且性能优于7个通用系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16660 2026-08-19 cs.SE cs.AI cs.CR cs.IR cs.LG 版本更新 62%

From Adoption to Deployment: A Qualitative Study on AI Integration in Software Development Practice

你如何选择人工智能组件?关于安全人工智能集成实践的访谈研究

Mahzabin Tamanna, Elizabeth Lin, Sparsha Gowda, Laurie Williams, Dominik Wermke

机构 * North Carolina State University(北卡罗来纳州立大学)

专题命中 隐私与版权 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究通过访谈了解从业者选择和集成人工智能组件的决策及安全考量,发现其选模型多受功能标准驱动,安全常被忽视,集成过程缺安全关注,行业重蹈早期软件依赖管理覆辙,为此给出相关建议倡导安全设计方法。

Comments 18 pages, 3 figures/tables

详情

展开后加载摘要…

URL PDF HTML 收藏