arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-30 至 2026-04-30 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 4 篇

2604.26857 2026-04-30 cs.CV cs.LG cs.RO eess.IV 79%

Edge AI for Automotive Vulnerable Road User Safety: Deployable Detection via Knowledge Distillation

边缘AI用于汽车易损道路使用者安全:通过知识蒸馏实现可部署检测

Akshay Karjol, Darrin M. Hanna

机构 * Department of Electrical and Computer Engineering, Oakland University(奥克兰大学电气与计算机工程系)

专题命中 幻觉与事实性 :safety(title,abstract);分类 cs.LG

AI总结 本文提出通过知识蒸馏方法,在边缘硬件上部署准确的易损道路使用者检测,通过压缩模型并保持量化鲁棒性,提升检测性能。

Comments 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25934 2026-04-30 cs.CY cs.AI 62%

LLM Psychosis: A Theoretical and Diagnostic Framework for Reality-Boundary Failures in Large Language Models

LLM精神病:一种理论和诊断框架,用于大语言模型中现实边界失败

Ashutosh Raj

机构 * NeuraCare AI IIT Ropar(罗帕理工学院)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出LLM精神病理论框架,用于描述大语言模型认知崩溃现象,通过五个特征定义诊断工具LCIS,分析不同严重等级的失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17548 2026-04-30 cs.CL 57%

When Annotators Disagree, Topology Explains: Mapper, a Topological Tool for Exploring Text Embedding Geometry and Ambiguity

当标注者意见不一致时,拓扑解释:Mapper,一种用于探索文本嵌入几何和模糊性的拓扑工具

Nisrine Rair, Alban Goupil, Valeriu Vrabie, Emmanuel Chochoy

机构 * CReSTIC, Université de Reims Champagne-Ardenne(里摩日大学CReSTIC研究所) Chochoy Conseil(Chochoy咨询公司)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 本文提出用拓扑方法分析模型如何编码模糊性,通过Mapper工具揭示微调后嵌入空间的模块化结构,并探讨结构自信与标签不确定性的矛盾。

Comments Accepted to appear in the Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025, Main Conference)

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, pages 8457--8480, Suzhou, China. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16742 2026-04-30 cs.CV 50%

Uncertainty-Aware Information Pursuit for Interpretable and Reliable Medical Image Analysis

面向可解释和可靠医疗图像分析的不确定性感知信息追求

Md Nahiduzzaman, Steven Korevaar, Zongyuan Ge, Feng Xia, Alireza Bab-Hadiashar, Ruwan Tennakoon

机构 * School of Computing Technologies(计算技术学院) RMIT University(皇家墨尔本理工大学) Faculty of Engineering(工程学院) Monash University(莫纳什大学) School of Engineering(工程学院)

专题命中 幻觉与事实性 :safety(abstract)

AI总结 本文提出一种可解释且考虑不确定性的框架,通过整合不确定性估计到V-IP查询过程中,优先选择每个样本更可靠的特征,提升医疗图像分析的可靠性与临床相关性。

Comments Accepted to IEEE Transactions on Medical Imaging (IEEE TMI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏