Self-Alignment for Factuality: Mitigating Hallucinations in LLMs via Self-Evaluation
专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.CL、cs.AI
Comments 20 pages
Journal ref ACL2024 Main
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.CL、cs.AI
Comments 20 pages
Journal ref ACL2024 Main
专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.CL、cs.AI
Comments ACL 2024
专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.CL、cs.AI
专题命中 幻觉与事实性 :safety(title,abstract);分类 cs.AI、cs.CY
Comments 22 pages, 7 figures, 2 tables
专题命中 幻觉与事实性 :safety(title,abstract);分类 cs.AI、cs.LG
Comments To appear at ECAI23 in October23
专题命中 幻觉与事实性 :safety(title,abstract);分类 cs.AI、cs.LG
专题命中 幻觉与事实性 :trustworthy(title,abstract);分类 cs.AI、cs.LG
Comments In Thirty-Fifth AAAI Conference on Artificial Intelligence (AAAI-2021). Code available at https://github.com/tochris/falcon
面向可信深度学习的不确定性量化:方法与度量
专题命中 幻觉与事实性 :trustworthy(title);safety(abstract);分类 cs.LG
AI总结 本综述针对深度学习的不确定性量化,梳理五大类方法及相关任务,整合评估框架,还探讨大语言模型不确定性与开放研究方向,为可信深度学习提供结构化批判性参考。
从基于摄像头的感知到推理:面向主动弱势道路使用者安全的全面综述
机构 * University of Washington(华盛顿大学) ; University of Utah(犹他大学)
专题命中 幻觉与事实性 :safety(title,abstract);分类 cs.AI
AI总结 综述基于摄像头的主动弱势道路使用者安全方法,将文献分为视觉感知、运动建模和行为理解三部分,构成统一分层管道实现早期风险预测和及时干预,纳入新兴AI范式,识别关键挑战并讨论研究方向,提供VRU安全系统开发基础。
Comments 18 pages, 4 figures, 5 tables
Journal ref IEEE Transactions on Intelligent Transportation Systems, 2026, pp. 1-17
在信息缺失情况下评估医疗人工智能:同提供者评判者和人类评分者会改变表面安全性
机构 * Kinvectum AB(金维图姆公司)
专题命中 幻觉与事实性 :safety(title,abstract);分类 cs.AI
AI总结 研究在信息缺失下评估医疗人工智能,通过删除对话部分对四个模型压力测试,发现评判者选择影响表面安全性,语言模型评判者更宽松,安全差距在于校准,还发布了相关测试工具等。
Comments GitHub https://github.com/KAVentures/health-ai-readiness-robustness
CASE:用于提高思维链忠实度的因果对齐和结构强化
专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.CL
AI总结 研究思维链推理中生成的推理无法忠实支持最终答案的问题,提出CASE框架,通过训练时因果对齐和推理时结构强化,结合构建多种数据集及选择性损失微调、屏蔽注意力等方法,提升CoT忠实度、跨数据集转移能力及平均准确率。
临床大语言模型中证据充分性提示的依赖判断的安全增益和特定模型的有用性成本
专题命中 幻觉与事实性 :safety(title,abstract);分类 cs.AI
AI总结 研究临床大语言模型中证据充分性提示的安全增益及有用性成本,通过在公共数据基准中让四个模型用标准提示和包装器回答问题,发现安全增益有方向和幅度差异且依赖评判者,同时存在模型特定的有用性成本。
Comments https://github.com/KAVentures/clinical-evidence-sufficiency-llm
作为部分可观测马尔可夫决策过程的交互式任务对齐
机构 * Stanford University(斯坦福大学)
专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.AI
AI总结 研究语言模型在面对模糊用户任务时的任务对齐问题,引入基于部分可观测马尔可夫决策过程的框架,通过用户研究验证,发现模型任务对齐困难,训练能改善但仍落后于人类,揭示其缺乏关键交互能力。
具有可证明对齐保证的大语言模型中的不确定性感知弃权
机构 * Ibaraki University(茨城大学)
专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.CL
AI总结 研究大语言模型在问答系统中无可靠置信估计的问题,提出基于置信区间的校准框架CIC,将任意不确定性分数转化为风险可控的选择性回答规则,保证所选阈值控制错误率,兼具风险控制和回答效率。
面向安全关键实时自主系统的硬件强制语义协调
机构 * Department of Computer Science University of the Bundeswehr Munich Neubiberg, Germany ; Department of Computer Science Sapienza University of Rome Rome, Italy ; STAKE Lab University of Molise Campobasso, Italy
专题命中 幻觉与事实性 :safety(title,abstract);分类 cs.AI
AI总结 针对异构组件并发运行下的协调问题,提出基于FPGA的硬件强制语义协调架构,将TB-CSPN协调机制映射到硬件原语,实现确定性协调和安全保障。
Comments 1 figure, 6 pages
超越激活对齐:任务感知的大语言模型量化中的对齐-多样性权衡
机构 * South China University of Technology(华南理工大学) ; Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) ; Ocean University of China(中国海洋大学) ; Center for AI Theoretical Foundation and Systems, Shenzhen Loop Area Institute(深圳环区研究所人工智能理论基础与系统中心)
专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.LG
AI总结 本文揭示混合精度量化中的困惑度幻觉和对齐-多样性权衡,提出TASA框架联合优化校准数据组成和比特分配,在3.5比特平均精度下匹配或超越4比特基线。
在自毁之前检查自己:选择性退出提升LLM智能体安全性
专题命中 幻觉与事实性 :safety(title,abstract);分类 cs.CL
AI总结 提出让LLM智能体在不确定时主动退出,通过ToolEmu框架在12个模型上评估,发现该方法在几乎不降低有用性的情况下显著提升安全性。
Comments Reliable ML and Regulatable ML workshops, Neurips 2025
Slop悖论:合成标准化如何侵蚀AI重写放射学报告中的临床不确定性和跨模态对齐
机构 * School of Computing and Engineering Sciences, University of Chester(切斯特大学计算与工程科学学院)
专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.CL
AI总结 本研究通过控制实验测量AI重写放射学报告导致的信息退化,发现电子健康记录摘要虽破坏内容但保留图像-文本对齐,而标准化重写和教学病例准备则相反,造成更大对齐损失,称为slop悖论。
伊斯兰大语言模型:从知识获取到可信且抗幻觉的人工智能
机构 * Paris Dauphine University(巴黎多芬纳大学)
专题命中 幻觉与事实性 :trustworthy(title,abstract);分类 cs.CL
AI总结 综述伊斯兰大语言模型领域,提出构建可信、抗幻觉的伊斯兰AI需结合阿拉伯语NLP、检索增强生成、教法学派推理及专家评估等关键技术。
CoRA: 面向可靠思维链推理的置信度-理由对齐
机构 * Vanderbilt University(范德比尔特大学) ; Vanderbilt University Medical Center(范德比尔特大学医学中心) ; Intuit AI Research(Intuit AI研究)
专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.CL
AI总结 提出GRPO强化学习框架,联合奖励答案正确性、置信度与理由支持度,减少置信度与理由对齐误差,提升推理可靠性。
SAGE: 面向言语不确定性对齐的答案条件不确定性目标
机构 * University of Notre Dame(圣母大学)
专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.CL
AI总结 提出SAGE目标,通过答案条件不确定性几何从模型采样响应中构建群组级不确定性目标,结合GUPO训练框架优化言语不确定性表达,在多项推理任务中提升不确定性排序、降低校准误差和过度自信。
大型语言模型在安全数据提取中的基准测试
机构 * SAP SE(SAP公司) ; Institute for Digital Transformation, Ravensburg-Weingarten University(拉文斯堡-魏恩加滕大学数字化转型研究所)
专题命中 幻觉与事实性 :safety(title,abstract);分类 cs.CL
AI总结 针对安全数据表(SDS)的异构格式,本研究基准测试了四种大型语言模型(LLM)在文本与多模态处理下的提取性能,发现文本结合思维链提示的Gemini 1.5 Pro准确率最高(84%),但均未达到90%的可靠部署阈值。
Comments 18 pages, 8 figures, submitted to Applied Intelligence
启发式访谈与需求之间的自动对齐
机构 * University of Bologna(博洛尼亚大学)
专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.CL
AI总结 提出将访谈转录与用户故事需求自动对齐的任务,定义忠实度和覆盖率两个度量,利用大语言模型和嵌入模型实现自动评估,在四个数据集上达到0.86 macro-F1。
Comments 8 pages
AlignFed: 异构边缘环境中大语言模型的对齐感知异步联邦微调
机构 * University of Science and Technology Beijing(北京科技大学)
专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.CL
AI总结 提出AlignFed框架,通过多阶段语义对齐机制(版本感知更新分组、跨版本语义对齐、公平性感知聚合)解决异步联邦微调中大语言模型在异构边缘环境中的模型漂移、客户端漂移和聚合不公平问题。
一种改进的深度信念网络模型用于道路安全分析
机构 * Intelligent Transportation Systems Research Center(智能交通系统研究中心) ; Wuhan University of Technology(武汉理工大学) ; University of Waterloo(滑铁卢大学) ; Department of Civil & Environmental Engineering(土木与环境工程系) ; Department of Electrical & Computer Engineering(电气与计算机工程系)
专题命中 幻觉与事实性 :safety(title,abstract);分类 cs.LG
AI总结 本文提出了一种改进的深度信念网络模型,用于提升道路安全分析中的碰撞预测能力,通过两个案例研究展示该模型在预测性能上的优势,并与其他传统模型进行比较。
Journal ref Transportation Research Board 97th Annual Meeting, 2018
边缘AI用于汽车易损道路使用者安全:通过知识蒸馏实现可部署检测
机构 * Department of Electrical and Computer Engineering, Oakland University(奥克兰大学电气与计算机工程系)
专题命中 幻觉与事实性 :safety(title,abstract);分类 cs.LG
AI总结 本文提出通过知识蒸馏方法,在边缘硬件上部署准确的易损道路使用者检测,通过压缩模型并保持量化鲁棒性,提升检测性能。
Comments 6 pages, 3 figures
可微的忠实对齐用于跨模型电路转移
机构 * University of Cambridge(剑桥大学) ; Kempner Institute, Harvard University(哈佛大学凯普勒研究所) ; University of Edinburgh(爱丁堡大学) ; Technion(技术学院)
专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.CL
AI总结 本文提出DFA框架,通过学习可微对齐将小模型的电路信息转移到大模型,实验证明在事实检索、多选推理和算术任务中,DFA在Llama-3 1B→3B任务中表现优异,且在某些情况下恢复的电路忠实度不低于直接归因。
Comments 10 pages, 5 figures
RADIANT-LLM:一种用于安全关键核工程中可靠决策支持的代理检索增强生成框架
机构 * Department of Nuclear Engineering, Texas A\&M University, College Station, TX, USA ; College of Performance, Visualization ; Fine Arts, Texas A\&M University, College Station, TX, USA
专题命中 幻觉与事实性 :safety(title,abstract);分类 cs.AI
AI总结 本文提出RADIANT-LLM框架,通过多模态检索增强生成技术,结合领域知识库和代理层,提升核工程中的决策支持准确性与透明度,降低幻觉风险。
vibe编码是未来吗?对LLM生成代码用于建设安全的实证评估
机构 * Department of Construction Management, Colorado State University(科罗拉多州立大学建设管理系)
专题命中 幻觉与事实性 :safety(title,abstract);分类 cs.AI
AI总结 研究评估了450个由三个前沿模型生成的Python脚本在建设安全中的可靠性、软件架构和领域特定安全精度,发现用户角色与数据幻觉存在显著关系,且存在高达45%的静默故障率。
ERA:基于证据的可靠性对齐用于诚实检索增强生成
机构 * Korea University(韩国大学) ; Gauss Labs Inc.(Gauss实验室)
专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.AI
AI总结 本文提出ERA框架,通过将置信度估计从标量概率转为显式证据分布,提升RAG系统中的回避行为,有效区分知识冲突与不确定性,实验表明在标准基准和定制泛化数据集上表现优异。
Comments Under Review