Operational Hallucination and Safety Drift in AI Agents
人工智能代理中的操作幻觉与安全漂移
专题命中 幻觉与事实性 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 研究大型语言模型在多轮执行中引发的可靠性风险,通过多轮评估量化安全漂移和操作幻觉现象,分析其根源,提出行动感知监督层,该层能拦截违规行为且无良性误报,提升了代理可靠性。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
人工智能代理中的操作幻觉与安全漂移
专题命中 幻觉与事实性 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 研究大型语言模型在多轮执行中引发的可靠性风险,通过多轮评估量化安全漂移和操作幻觉现象,分析其根源,提出行动感知监督层,该层能拦截违规行为且无良性误报,提升了代理可靠性。
在信息缺失情况下评估医疗人工智能:同提供者评判者和人类评分者会改变表面安全性
机构 * Kinvectum AB(金维图姆公司)
专题命中 幻觉与事实性 :safety(title,abstract);分类 cs.AI
AI总结 研究在信息缺失下评估医疗人工智能,通过删除对话部分对四个模型压力测试,发现评判者选择影响表面安全性,语言模型评判者更宽松,安全差距在于校准,还发布了相关测试工具等。
Comments GitHub https://github.com/KAVentures/health-ai-readiness-robustness
CASE:用于提高思维链忠实度的因果对齐和结构强化
专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.CL
AI总结 研究思维链推理中生成的推理无法忠实支持最终答案的问题,提出CASE框架,通过训练时因果对齐和推理时结构强化,结合构建多种数据集及选择性损失微调、屏蔽注意力等方法,提升CoT忠实度、跨数据集转移能力及平均准确率。
在微调之前进行评估:针对网络安全问答的小型语言模型诊断研究
机构 * The University of Alabama(阿拉巴马大学) ; Meharry Medical College(梅哈里医学院) ; Mississippi State University(密西西比州立大学) ; The University of Texas at El Paso(德克萨斯大学埃尔帕索分校)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 针对网络安全问答选择小型语言模型难的问题,提出FiT诊断框架,从三方面刻画模型。通过对五个模型在两种微调模式下研究发现微调利弊因模式而异,预微调FiT分数可预测变化,能筛选模型、避免不必要微调,支持安全部署。
Comments 8 pages, 5 figures, 4 tables, IEEE ICMLA
人工智能驱动的碰撞模拟代理的不确定性量化:基于开源保险杠梁基准的蒙特卡洛随机失活和深度集成的比较研究
专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG
AI总结 研究人工智能驱动碰撞模拟代理的不确定性量化,对蒙特卡洛随机失活和深度集成两种方法在开源管道上比较,用具体随机失活解决常见批评,经汽车碰撞模拟实验,揭示权衡,表明可低成本实现良好校准和无超参数的不确定性估计。
保留还是合并?语言智能体记忆中依赖预算的算子选择
专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI
AI总结 研究语言智能体记忆中预算依赖的算子选择问题,核心方法是将算子效用分解,用离线抽象安全机制实现,主要贡献是通过实验揭示在不同预算下保留和合并策略的适用情况及算子效果差异。
校准家族过拟合:为何可信破坏监测器不能跨谱系转移
机构 * Independent Researcher(独立研究者)
专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG
AI总结 研究可信监测器跨谱系转移问题,以不可信策略家族为受控轴,通过拟合和应用监测器分解跨家族AUROC,发现相互作用为正且差距几何,给出四步协议,指出控制评估应报告跨家族转移矩阵,单一配对准确性高估安全性。
Comments 28 pages, 11 figures