arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-24 至 2026-03-24 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 6 篇

2512.23743 2026-03-24 cs.SE cs.AI 70%

Hybrid-Code v2: Zero-Hallucination Clinical ICD-10 Coding via Neuro-Symbolic Verification and Automated Knowledge Base Expansion

Hybrid-Code v2:通过神经符号验证和自动知识库扩展实现零幻觉的临床ICD-10编码

Yunguo Yu

机构 * AI Innovation & Prototyping, Zyter(人工智能创新与原型开发,Zyter)

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 Hybrid-Code v2结合神经网络与符号验证,实现零类型I幻觉,同时保持高覆盖率和精度,通过自动知识库扩展解决规则系统扩展性问题。

Comments Version 2: Substantially extended version with (1) multi-layer verification framework (format, evidence, negation, temporal, exclusion), (2) automated knowledge base expansion from unlabeled clinical text, (3) formal zero Type-I hallucination guarantees, and (4) expanded experimental evaluation on 5,000 cases with detailed error analysis. 28 pages, 3 figure, original research paper;

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20246 2026-03-24 cs.CL cs.AI cs.NE q-bio.NC 62%

Decoding the decoder: Contextual sequence-to-sequence modeling for intracortical speech decoding

解码解码器:用于皮层语音解码的上下文序列到序列建模

Michal Olak, Tommaso Boccato, Matteo Ferrante

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于Transformer的多任务序列到序列模型,用于从皮层记录中解码语音,通过引入Neural Hammer Scalpel模块提升鲁棒性和可解释性,实验显示其在语音解码任务中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20921 2026-03-24 cs.LG 57%

Discriminative Representation Learning for Clinical Prediction

判别表示学习用于临床预测

Yang Zhang, Li Fan, Samuel Lawrence, Shi Li

机构 * The University of Hong Kong (HKU)(香港大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本文提出一种监督深度学习框架,通过最大化类间分离与类内方差比,提升临床预测性能,优于其他预训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20505 2026-03-24 cs.AI 57%

Efficient Counterfactual Reasoning in ProbLog via Single World Intervention Programs

通过单世界干预程序在ProbLog中实现高效的反事实推理

Saimun Habib, Vaishak Belle, Fengxiang He

机构 * University of Edinburgh(爱丁堡大学) The MITRE Corporation(MITRE公司)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出单世界干预程序(SWIPs)用于ProbLog中的反事实推理,通过将ProbLog子句分为观测和固定部分,减少计算复杂度并提升推理可靠性,实验表明在大规模数据上推理时间减少35%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22170 2026-03-24 cs.MA 50%

Human-Inspired Pavlovian and Instrumental Learning for Autonomous Agent Navigation

受人类启发的经典条件反射与工具性学习用于自主体导航

Jingfeng Shan, Francesco Guidi, Mehrdad Saeidi, Enrico Testi, Elia Favarelli, Andrea Giorgetti, Davide Dardari, Alberto Zanella, Giorgio Li Pira, Francesca Starita, Anna Guerra

专题命中 幻觉与事实性 :safety(abstract)

AI总结 本文提出一种融合经典条件反射、工具性MF和工具性MB组件的混合强化学习架构,通过地理参考环境特征塑造内在价值信号,提升自主体在不确定环境中的导航安全性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20668 2026-03-24 cs.RO 50%

ROI-Driven Foveated Attention for Unified Egocentric Representations in Vision-Language-Action Systems

以目标区域驱动的视网膜注视用于视觉-语言-动作系统中的统一自体表示

Xinhai Sun, Xiang Shi, Menglin Zou, Wenlong Huang

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本文提出了一种以目标区域驱动的数据表示方法,通过单个外部相机投影末端执行器姿态,实现手眼协调的区域划分,提升跨机器人系统的数据重用性和跨体征对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏