arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-17 至 2026-06-17 共收录 7 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 7 篇

2606.18021 2026-06-17 cs.AI cs.CL cs.LG cs.MA 新提交 83%

LegalHalluLens: Typed Hallucination Auditing and Calibrated Multi-Agent Debate for Trustworthy Legal AI

LegalHalluLens: 类型化幻觉审计与校准的多智能体辩论以实现可信赖的法律AI

Lalit Yadav, Akshaj Gurugubelli

机构 * Independent Researcher, Sunnyvale, CA, USA(独立研究者,美国加州太阳谷) Independent Researcher, San Diego, CA, USA(独立研究者,美国加州圣地亚哥)

专题命中 幻觉与事实性 :trustworthy(title,abstract);分类 cs.CL、cs.AI、cs.LG;safety(comments)

AI总结 针对法律AI中聚合指标掩盖的错误集中性和方向性问题,提出LegalHalluLens审计框架,通过类型化幻觉画像、风险方向指数(RDI)和校准辩论管道,将幻觉检测减少45%,并揭示聚合指标隐藏的失败模式。

Comments 15 pages, 5 figures; Published at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17791 2026-06-17 cs.CL cs.CV 新提交 79%

The Slop Paradox: How Synthetic Standardization Erodes Clinical Uncertainty and Cross-Modal Alignment in AI-Rewritten Radiology Reports

Slop悖论:合成标准化如何侵蚀AI重写放射学报告中的临床不确定性和跨模态对齐

Samar Ansari

机构 * School of Computing and Engineering Sciences, University of Chester(切斯特大学计算与工程科学学院)

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.CL

AI总结 本研究通过控制实验测量AI重写放射学报告导致的信息退化,发现电子健康记录摘要虽破坏内容但保留图像-文本对齐,而标准化重写和教学病例准备则相反,造成更大对齐损失,称为slop悖论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18068 2026-06-17 cs.AI 新提交 57%

Agentic AI-based Framework for Mitigating Premature Diagnostic Handoff and Silent Hallucination in Healthcare Applications

基于Agentic AI的框架:缓解医疗应用中的过早诊断交接和无声幻觉

Divyansh Srivastava, Shreya Ghosh, Anshul Verma, Rajkumar Buyya

机构 * Distributed Systems (qCLOUDS) Lab, School of Computing Information Systems, The University of Melbourne, Australia 2Department of Computer Science Engineering, School of Electrical Computer Sciences (SECS), Indian Institute of Technology Bhubaneswar, India 3Department of Computer Science Banaras Hindu University, Varanasi, India

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 提出多智能体框架,通过确定性编排约束和两个安全机制(神经符号状态跟踪门和语义熵不确定性量化门)解决LLM在医疗对话中的过早诊断交接和无声幻觉问题,诊断精度提升11.3个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17666 2026-06-17 cs.SE cs.AI 新提交 57%

FacProcessTwin: An LLM-Based System for Process Twin Development

FacProcessTwin: 一种基于LLM的流程孪生开发系统

Yash Pulse, Yong-Bin Kang, Abhik Banerjee, Prem Prakash Jayaraman

机构 * Swinburne University of Technology(斯winburne大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 提出FacProcessTwin系统,利用大语言模型从工厂文档和操作员自然语言输入中自动生成流程模型并绑定实时数据,通过交互式流程图实现人机协同治理,在食品制造案例中准确率达95.2%,开发时间缩短至人工的1/6。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17234 2026-06-17 cs.CL 新提交 57%

Speaking in Self-Assessing Tongues: On the Verbalized Confidence of LLMs in Machine Translation

自评之言:论大语言模型在机器翻译中的口头化置信度

Ali Marashian, Alexis Palmer, Katharina von der Wense

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校) Johannes Gutenberg University Mainz(美因茨约翰内斯·古腾堡大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 本研究设计了五种无需内部信号的口头化方法提取LLM逐词置信度,并与内部确定性信号比较,发现两者在细粒度错误检测和校准上表现相似但相关性低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17203 2026-06-17 cs.SE cs.AI 新提交 57%

Trust-Aware Multi-Agent Traceability: Confidence-Calibrated Knowledge Graphs for Consistent Software Artifact Management

信任感知的多智能体可追溯性:用于一致软件工件管理的置信度校准知识图谱

Mohamed Essam, Kareem Wael, Azza Hassan, Ahmed Haitham, Mahmoud Soliman, Samer Saber, Ibrahim Habib

机构 * CairoMotive Cairo, Egypt(开罗动力埃及)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 提出一种信任感知协调框架,通过共享知识图谱和校准置信度分数,结合嵌入检索与LLM多准则分析的两阶段可追溯性链接预测管道,解决多智能体系统中错误传播问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00330 2026-06-17 cs.LG 版本更新 57%

Conformalized Quantum DeepONet Ensembles for Scalable Operator Learning with Distribution-Free Uncertainty

conformalized 量子 deeponet 集团用于具有分布自由不确定性的可扩展操作学习

Purav Matlia, Christian Moya, Guang Lin

机构 * Department of Computer Science(计算机科学系) Purdue University(普渡大学) Department of Mathematics(数学系) Department of Mechanical Engineering(机械工程系)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 本文提出一种结合量子正交神经网络和适应性置信预测的框架,解决高维动态系统运算学习中的二次推断复杂度和不确定性量化问题,通过压缩多个模型到单个电路实现高效并行计算。

详情

展开后加载摘要…

URL PDF HTML 收藏