arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-01 至 2026-05-01 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 4 篇

2604.26959 2026-05-01 cs.CY cs.AI cs.MA 81%

CareGuardAI: Context-Aware Multi-Agent Guardrails for Clinical Safety & Hallucination Mitigation in Patient-Facing LLMs

CareGuardAI:面向临床安全与幻觉抑制的上下文感知多智能体守卫机制

Elham Nasarian, Abhilash Neog, Kwok-Leung Tsui, Niyousha HosseiniChimeh

机构 * Grado Department of Industrial & Systems Engineering, Virginia Tech, Blacksburg, VA 24061, USA(弗吉尼亚理工大学格拉多工业与系统工程系,弗吉尼亚理工大学,布莱克斯堡,VA 24061,美国) Department of Computer Science, Virginia Tech, Blacksburg, VA 24061, USA(弗吉尼亚理工大学计算机科学系,弗吉尼亚理工大学,布莱克斯堡,VA 24061,美国) Dept of Industrial, Manufacturing, and Systems Engineering at University of Texas at Arlington, Arlington, TX 76019, USA(德克萨斯理工大学阿灵顿分校工业、制造与系统工程系,阿灵顿,TX 76019,美国)

专题命中 幻觉与事实性 :safety(title,abstract);分类 cs.AI、cs.CY

AI总结 CareGuardAI通过引入临床安全风险评估和幻觉风险评估,结合多阶段管道和迭代优化,提升患者面对LLM的可靠性与安全性,优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11653 2026-05-01 cs.IR cs.AI cs.LG 62%

GroupRank: A Groupwise Paradigm for Effective and Efficient Passage Reranking with LLMs

GroupRank: 一种用于基于LLM的高效有效段落重排序的组内方法

Meixiu Long, Duolin Sun, Dan Yang, Yihan Jiao, Lei Liu, Jiahai Wang, BinBin Hu, Yue Shen, Jie Feng, Zhehao Tan, Junjie Wang, Lianzhen Zhong, Jian Wang, Peng Wei, Jinjie Gu

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Ant Group(蚂蚁集团)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 GroupRank提出一种组内方法平衡灵活性和上下文感知,通过合成数据融合局部点状信号与全局列表排名,提升重排序效果和效率,实验显示在BRIGHT上达到65.2 NDCG@10,且推理速度提升6.4倍。

Comments Accepted by ACL-Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.14352 2026-05-01 cs.CY cs.AI cs.LO 62%

Epistemic reflections on AI answering our questions: overwatch, erudite, logician, interlocutor

关于AI回答问题的认知反思:监视、博学、逻辑学家、对话者

Johan F. Hoorn, Ella-Jenna Oosterglorenwoud

机构 * The Hong Kong Polytechnic University(香港理工大学) Eindhoven University of Technology (TU/e)(埃因霍温理工大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.CY

AI总结 本文探讨AI在金融、法律等领域被广泛依赖的问题,指出其缺乏逻辑验证和实证验证,可能导致误判和剽窃。提出需了解推理系统以使AI成为可信的对话伙伴。

Comments 22 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20577 2026-05-01 cs.SE cs.LG 57%

Evaluating Assurance Cases as Text-Attributed Graphs for Structure and Provenance Analysis

评估作为文本属性图的保证案例用于结构和来源分析

Fariz Ikhwantri, Dusica Marijan

机构 * Simula Research Laboratory(Simula研究实验室)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 本文提出基于图诊断框架分析保证案例的结构和来源,通过链接预测和图分类检测偏见,实验表明GNN在链接预测和来源检测中表现优异。

Comments 10 pages, 4 figures, 8 tables. Accepted to EASE 2026 AI Models / Data track, Glasgow, United Kingdom Fix the captions of tables 7 and 8

详情

展开后加载摘要…

URL PDF HTML 收藏