Real-time Out-of-distribution Detection in Learning-Enabled Cyber-Physical Systems
专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG
Comments Accepted by 11th International Conference on Cyber-Physical Systems (ICCPS2020)
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG
Comments Accepted by 11th International Conference on Cyber-Physical Systems (ICCPS2020)
专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG
Comments 10 pages, 4 figures
专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CY
Comments 32 pages, 23 figures. Primary contributors: Aarash Heydari and Janny Zhang. These authors contributed equally to the work
专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI
专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG
Comments 4 pages + 1 appendix. Presented at the ICLR 2019 Debugging Machine Learning Models workshop
专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG
Comments Changed margins
专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG
专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG
专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI
专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL
Comments 7 pages
专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI
Journal ref Journal of Mathematical Modelling and Algorithms, 2005
训练用于自解释忠实性的大语言模型
机构 * Imperial College London(帝国理工学院)
专题命中 幻觉与事实性 :分类 cs.CL、cs.AI、cs.LG;alignment(comments)
AI总结 提出强化学习方法,将忠实性度量改为训练目标,研究模型能否检测及优化影响决策因素以提高自解释忠实性。实验用随机词和用户偏差插入,微调模型在忠实性度量上显著改进,交叉干预泛化有模型依赖等情况,为减少不忠实推理提供路径。
Comments To appear at the ICLR 2026 Workshop on Representational Alignment (Re-Align), 10 pages (long paper)
专题命中 幻觉与事实性 :分类 cs.CL、cs.AI、cs.LG;trustworthy(comments)
Comments Published at ICLR 2024 Workshop on Secure and Trustworthy Large Language Models
冗长性权衡与规模对LLM自我解释忠实度的影响
机构 * Google DeepMind(谷歌DeepMind) ; Centre for AI, University College London(伦敦大学学院人工智能中心) ; Imperial College London(伦敦帝国学院) ; University College London(伦敦大学学院)
专题命中 幻觉与事实性 :分类 cs.CL、cs.AI;safety(comments);trustworthy(comments)
AI总结 本文分析13个模型家族共75个模型的反事实忠实度,提出phi-CCT和F-AUROC两个新指标,发现更大更强的模型在所有指标上更忠实。
Comments ICLR 2026 Workshop on Principled Design for Trustworthy AI - Interpretability, Robustness, and Safety across Modalities 67 pages, 13 figures
通过精炼和校准增强深度神经网络的可靠性
机构 * SIT, Indian Institute of Technology Delhi, New Delhi, India(印度理工学院德里SIT,新德里)
专题命中 幻觉与事实性 :分类 cs.AI、cs.LG;alignment(comments);trustworthy(comments)
AI总结 针对深度神经网络置信度不可靠的问题,提出一种通过监督对比学习显式优化精炼度的损失函数,并联合优化校准、精炼和准确性的统一训练框架RefCal,在CIFAR-100-LT数据集上显著提升性能。
Comments ICLR 2026, Trustworthy AI and Representational Alignment
弥合缺失模态的差距:改进纯文本校准的视觉语言模型
机构 * Graduate School of AI, KAIST(人工智能研究生院,韩国科学技术院)
专题命中 幻觉与事实性 :分类 cs.CL、cs.AI;safety(comments);trustworthy(comments)
AI总结 本文提出Latent Imagination Module,通过预测文本输入的潜在嵌入来提升纯文本环境下视觉语言模型的准确性和校准性能。
Comments 9 pages, 16 figures. Accepted at the ICLR 2026 Workshop on Principled Design for Trustworthy AI: Interpretability, Robustness, and Safety across Modalities
超越准确率:评估地理空间基础模型的校准度及其对分布偏移的敏感性
机构 * Technical University of Munich (TUM)(慕尼黑工业大学) ; German Aerospace Center (DLR)(德国航空航天中心) ; Massachusetts Institute of Technology (MIT)(麻省理工学院) ; Taylor Geospatial(泰勒地理空间公司)
专题命中 幻觉与事实性 :alignment(abstract)
AI总结 该研究指出GeoFMs仅用准确率排序的不足,分析其校准度与分布偏移敏感性,发现EO预训练模型更易过度自信,提出需多条件多指标评估以缩小实际部署差距。
ConfTriage:用于肺结节恶性程度分级的校准感知大语言模型分级框架,结合选择性专家模型转诊机制
机构 * Texas A&M University(德克萨斯农工大学) ; Hamad Bin Khalifa University(哈马德·本·哈利法大学)
专题命中 幻觉与事实性 :safety(abstract)
AI总结 本研究提出ConfTriage框架,以校准感知LLM为核心结合专家DL后备模型,通过肺结节属性的自然语言表述实现分级,在LIDC-IDRI数据集上取得88.22%的F1分数与0.92的AUC,可高效处理多数病例并仅转诊不确定病例,为医疗决策支持提供了新路径。
Comments 14 pages, 8 figures. Currently under review
重新思考大语言模型验证:证据结构、不确定性与选择性优化
机构 * Indian Institute of Technology Jammu(贾姆穆印度理工学院) ; Microsoft Research(微软研究院) ; SCB Dental College and Hospital(SCB牙科学院与医院)
专题命中 幻觉与事实性 :safety(abstract)
AI总结 该研究针对LLMs医疗应用的安全问题,提出两阶段框架,利用模型弃权信号优化推理,在GPT-5.5、DeepSeek-R1模型及MedReason、MedQA数据集上显著提升了医疗假设验证的准确率。
Comments Findings Track at the Conference on Empirical Methods in Natural Language Processing (EMNLP 2026)
面向卫星巡检任务的信息感知模型预测控制
专题命中 幻觉与事实性 :safety(abstract)
AI总结 该研究提出信息感知MPC框架,将估计协方差纳入控制目标,通过数值模拟验证其能生成满足约束且主动降低目标估计协方差的卫星巡检轨迹。
Comments Presented at the 2026 AAS/AIAA Astrodynamics Specialist Conference in Whistler, BC, Canada. v2 - corrected title metadata, content remains unchanged
TruthLens:通过大型视觉语言模型(LVLM)中的自评估真实性分数检测对象幻觉
机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) ; Peng Cheng Laboratory(鹏城实验室) ; University of Nottingham Malaysia(马来西亚诺丁汉大学) ; Hong Kong University of Science and Technology(香港科技大学)
专题命中 幻觉与事实性 :trustworthy(abstract)
AI总结 TruthLens 是一种无需额外成本的 LVLM 对象幻觉检测框架,通过微调 LM 头部输出真实性分数,在 MS-COCO 数据集上的 Qwen2.5-VL-7B 上实现了超 17% 的 AUROC 提升,性能达当前最优。
Comments Accepted by ECCV 2026
用于提升AI生成新闻摘要事实可靠性的跨平台认知验证
专题命中 幻觉与事实性 :trustworthy(abstract)
AI总结 本研究提出多源证据共识验证(MECV)框架,通过多异构来源证据聚合与多LLM陪审团机制修正AI生成新闻摘要的幻觉,在SummEdits基准上提升了事实一致性,为可信AI与自动化新闻研究提供了新方法。
RAC:面向通信高效的分割式大语言模型推理的参考感知激活压缩
专题命中 幻觉与事实性 :alignment(abstract)
AI总结 该研究针对分割式LLM推理的通信瓶颈,提出参考感知激活压缩方法RAC,通过参考感知编解码器等技术降低通信开销,在多模型多链路对实验中验证了其时间性能提升与任务分数变化情况。
Comments 10 pages, 7 figures, 2 tables
开发者使用本地大语言模型生成和评估的代码导航体验陌生代码库调试的研究
专题命中 幻觉与事实性 :trustworthy(abstract)
AI总结 该研究探讨开发者使用本地大语言模型生成评估的代码导航调试陌生代码库的体验,明确代码导航组件属性对开发者的影响,为优化代码导航生成与评估提供方向。
大规模事实核查:用于在线媒体真实性与上下文验证的多模态AI
专题命中 幻觉与事实性 :alignment(abstract)
AI总结 本文为2025年ACM多媒体大会多媒体验证挑战赛开发了多模态验证系统,整合视觉取证等技术,可检测脱离上下文的媒体,提升了多媒体验证水平,为相关从业者提供实用工具。
面向目标的基于逻辑的语义通信及用于自动驾驶的神经符号推理
专题命中 幻觉与事实性 :safety(abstract)
AI总结 本文针对自动驾驶场景,提出基于一阶逻辑的目标导向语义通信方法,通过选择关键证据传输实现安全决策,在相同通信预算下优于均匀证据选择。
FabriVLA:用于精确多任务操作的轻量级视觉-语言-动作模型
专题命中 幻觉与事实性 :safety(abstract)
AI总结 研究提出FabriVLA模型,结合视觉-语言主干与流匹配动作头,经单阶段联合优化训练。在Meta-World MT50基准测试中,该模型基于1B规模VLM,不依赖数十亿参数主干,实现90.0%平均成功率,展现强大性能。
Think2Go:基于大语言模型推理的生成式下一个兴趣点(POI)推荐
专题命中 幻觉与事实性 :alignment(abstract)
AI总结 Think2Go框架统一SFT与RL推理,通过优势加权机制校准策略优化,解决现有POI推荐模型的意图捕捉不足问题,提升推荐性能与稳健性。
Comments Accepted by KDD 2026 Research Track Cycle 1 (Oral presentation)