arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-21 至 2026-05-21 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 4 篇

2605.20591 2026-05-21 cs.CL cs.CY 73%

Do No Harm? Hallucination and Actor-Level Abuse in Web-Deployed Medical Large Language Models

有害吗?网络部署医疗大语言模型中的幻觉与作用层面滥用

Sunday Oyinlola Ogundoyin, Muhammad Ikram, Rahat Masood

机构 * The University of New South Wales, Sydney, Australia(新南威尔士大学,悉尼,澳大利亚)

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.CL、cs.CY

AI总结 本文研究了网络部署的医疗大语言模型中的幻觉和作用层面滥用问题,通过评估6233个MedGPT和10个开源LLM,发现25-30%的MedGPT事实准确性较低,33.6-54.3%违反操作阈值,57.06%的Action-enabled模型缺乏充分的隐私披露,揭示了系统性漏洞,强调了多指标评估和更强的安全保障的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03296 2026-05-21 cs.CL cs.AI 66%

A Systematic Comparison between Extractive Self-Explanations and Human Rationales in Text Classification

抽取式自我解释与人类推理在文本分类中的系统比较

Stephanie Brandl, Oliver Eberle

机构 * Center for Social Data Science(社会科学数据科学中心) University of Copenhagen(哥本哈根大学) Machine Learning Group(机器学习小组) Technische Universität Berlin(柏林技术大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI;trustworthy(comments)

AI总结 本文比较了抽取式自我解释与人类推理在文本分类任务中的有效性,通过分析不同任务和语言的解释质量,发现自我解释在文本长度和任务复杂度上与人类推理存在显著差异。

Comments accepted to the Trustworthy NLP Workshop, co-located with ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21434 2026-05-21 cs.SE 50%

Agentic Model Checking

代理模型检查

Youcheng Sun, Jiawen Liu, Daniel Kroening, Jason Xue

专题命中 幻觉与事实性 :safety(abstract)

AI总结 本文提出了一种代理模型检查方法,结合LLM代理与受限模型检查后端,通过代理提出任务并由求解器验证,以解决LLM生成系统代码的验证难题,包括规范缺失和安全合同隐式编码的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21309 2026-05-21 cs.CV cs.RO 50%

Hyper-V2X: Hypernetworks for Estimating Epistemic and Aleatoric Uncertainty in Cooperative Bird's-Eye-View Semantic Segmentation

Hyper-V2X: 基于超网络的协作鸟瞰图语义分割中epistemic和aleatoric不确定性的估计

Abhishek Dinkar Jagtap, Sanath Tiptur Sadashivaiah, Andreas Festag

机构 * CARISSMA Institute for Electric, COnnected, and Secure Mobility (C-ECOS), Technische Hochschule Ingolstadt(CARISSMA电动、连接与安全移动研究所(C-ECOS)、因戈尔施塔特技术大学) University of Applied Sciences Aschaffenburg(阿施发堡应用科学大学)

专题命中 幻觉与事实性 :safety(abstract)

AI总结 本文提出Hyper-V2X框架,通过超网络估计协作V2X感知中的epistemic和aleatoric不确定性,采用部分权重生成方案和V2X上下文嵌入模块,条件化贝叶斯超网络生成随机鸟瞰图分割的权重分布,提升感知可靠性。

Comments Accepted for IEEE Intelligent Vehicle Symposium (IV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏