arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1738 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 1738 篇

2001.10494 2020-01-29 cs.LG cs.SY eess.SY stat.ML 57%

Real-time Out-of-distribution Detection in Learning-Enabled Cyber-Physical Systems

Feiyang Cai, Xenofon Koutsoukos

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

Comments Accepted by 11th International Conference on Cyber-Physical Systems (ICCPS2020)

详情

展开后加载摘要…

URL PDF HTML 收藏
2001.00893 2020-01-06 cs.LG stat.ML 57%

Aleatoric and Epistemic Uncertainty with Random Forests

Mohammad Hossein Shaker, Eyke Hüllermeier

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.03673 2019-12-10 cs.CV cs.LG stat.ML 57%

Detection of False Positive and False Negative Samples in Semantic Segmentation

Matthias Rottmann, Kira Maag, Robin Chan, Fabian Hüger, Peter Schlicht, Hanno Gottschalk

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1907.00435 2019-09-17 cs.CY 57%

YouTube Chatter: Understanding Online Comments Discourse on Misinformative and Political YouTube Videos

Aarash Heydari, Janny Zhang, Shaan Appel, Xinyi Wu, Gireeja Ranade

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CY

Comments 32 pages, 23 figures. Primary contributors: Aarash Heydari and Janny Zhang. These authors contributed equally to the work

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.11779 2019-09-02 cs.DC cs.AI cs.CR 57%

Analyzing Cyber-Physical Systems from the Perspective of Artificial Intelligence

Eric M. S. P. Veith, Lars Fischer, Martin Tröschel, Astrid Nieße

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.10922 2019-04-25 cs.LG stat.ML 57%

The Scientific Method in the Science of Machine Learning

Jessica Zosa Forde, Michela Paganini

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

Comments 4 pages + 1 appendix. Presented at the ICLR 2019 Debugging Machine Learning Models workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
1803.09186 2019-02-07 math.OC cs.LG 57%

Finite-Data Performance Guarantees for the Output-Feedback Control of an Unknown System

Ross Boczar, Nikolai Matni, Benjamin Recht

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

Comments Changed margins

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.03305 2018-12-04 cs.NE cs.CV cs.LG stat.ML 57%

BAR: Bayesian Activity Recognition using variational inference

Ranganath Krishnan, Mahesh Subedar, Omesh Tickoo

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1802.10501 2018-12-03 stat.ML cs.LG 57%

Predictive Uncertainty Estimation via Prior Networks

Andrey Malinin, Mark Gales

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1804.06647 2018-04-19 cs.AI cs.MA 57%

Modular Verification of Vehicle Platooning with Respect to Decisions, Space and Time

Maryam Kamali, Sven Linker, Michael Fisher

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1607.03594 2017-01-24 cs.LG 57%

Estimating Uncertainty Online Against an Adversary

Volodymyr Kuleshov, Stefano Ermon

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1701.02795 2017-01-12 cs.CL 57%

Bidirectional American Sign Language to English Translation

Hardie Cate, Zeshan Hussain

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
cs/0504066 2009-12-01 cs.AI 57%

Comparison of the Bayesian and Randomised Decision Tree Ensembles within an Uncertainty Envelope Technique

Vitaly Schetinin, Jonathan E. Fieldsend, Derek Partridge, Wojtek J. Krzanowski, Richard M. Everson, Trevor C. Bailey, Adolfo Hernandez

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

Journal ref Journal of Mathematical Modelling and Algorithms, 2005

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21090 2026-07-24 cs.LG cs.AI cs.CL 新提交 56%

Training Large Language Models for Self-Explanation Faithfulness

训练用于自解释忠实性的大语言模型

Yeoktatt Cheah, María Pérez-Ortiz, Noah Y. Siegel, Oana-Maria Camburu

机构 * Imperial College London(帝国理工学院)

专题命中 幻觉与事实性 :分类 cs.CL、cs.AI、cs.LG;alignment(comments)

AI总结 提出强化学习方法,将忠实性度量改为训练目标,研究模型能否检测及优化影响决策因素以提高自解释忠实性。实验用随机词和用户偏差插入,微调模型在忠实性度量上显著改进,交叉干预泛化有模型依赖等情况,为减少不忠实推理提供路径。

Comments To appear at the ICLR 2026 Workshop on Representational Alignment (Re-Align), 10 pages (long paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.05348 2024-05-10 cs.CL cs.AI cs.LG 56%

The Effect of Model Size on LLM Post-hoc Explainability via LIME

Henning Heyen, Amy Widdicombe, Noah Y. Siegel, Maria Perez-Ortiz, Philip Treleaven

专题命中 幻觉与事实性 :分类 cs.CL、cs.AI、cs.LG;trustworthy(comments)

Comments Published at ICLR 2024 Workshop on Secure and Trustworthy Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13445 2026-07-02 cs.CL cs.AI 版本更新 54%

Verbosity Tradeoffs and the Impact of Scale on the Faithfulness of LLM Self-Explanations

冗长性权衡与规模对LLM自我解释忠实度的影响

Noah Y. Siegel, Nicolas Heess, Maria Perez-Ortiz, Oana-Maria Camburu

机构 * Google DeepMind(谷歌DeepMind) Centre for AI, University College London(伦敦大学学院人工智能中心) Imperial College London(伦敦帝国学院) University College London(伦敦大学学院)

专题命中 幻觉与事实性 :分类 cs.CL、cs.AI;safety(comments);trustworthy(comments)

AI总结 本文分析13个模型家族共75个模型的反事实忠实度,提出phi-CCT和F-AUROC两个新指标,发现更大更强的模型在所有指标上更忠实。

Comments ICLR 2026 Workshop on Principled Design for Trustworthy AI - Interpretability, Robustness, and Safety across Modalities 67 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23249 2026-05-25 cs.LG cs.AI 54%

Enhancing Deep Neural Network Reliability with Refinement and Calibration

通过精炼和校准增强深度神经网络的可靠性

Ramya Hebbalaguppe, Ajay Shastry, Soumya Suvra Ghosal, Chetan Arora

机构 * SIT, Indian Institute of Technology Delhi, New Delhi, India(印度理工学院德里SIT,新德里)

专题命中 幻觉与事实性 :分类 cs.AI、cs.LG;alignment(comments);trustworthy(comments)

AI总结 针对深度神经网络置信度不可靠的问题,提出一种通过监督对比学习显式优化精炼度的损失函数,并联合优化校准、精炼和准确性的统一训练框架RefCal,在CIFAR-100-LT数据集上显著提升性能。

Comments ICLR 2026, Trustworthy AI and Representational Alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12517 2026-05-14 cs.CL cs.AI cs.CV 54%

Bridging the Missing-Modality Gap: Improving Text-Only Calibration of Vision Language Models

弥合缺失模态的差距:改进纯文本校准的视觉语言模型

Mingyeong Kim, Jungwon Choi, Chaeyun Jang, Juho Lee

机构 * Graduate School of AI, KAIST(人工智能研究生院,韩国科学技术院)

专题命中 幻觉与事实性 :分类 cs.CL、cs.AI;safety(comments);trustworthy(comments)

AI总结 本文提出Latent Imagination Module,通过预测文本输入的潜在嵌入来提升纯文本环境下视觉语言模型的准确性和校准性能。

Comments 9 pages, 16 figures. Accepted at the ICLR 2026 Workshop on Principled Design for Trustworthy AI: Interpretability, Robustness, and Safety across Modalities

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16614 2026-08-18 cs.CV 新提交 50%

Beyond Accuracy: Assessing Calibration of Geospatial Foundation Models and Their Sensitivity to Distribution Shifts

超越准确率:评估地理空间基础模型的校准度及其对分布偏移的敏感性

Nils Lehmann, Jakob Gawlikowski, Burak Ekim, Isaac Corley, Xiao Xiang Zhu

机构 * Technical University of Munich (TUM)(慕尼黑工业大学) German Aerospace Center (DLR)(德国航空航天中心) Massachusetts Institute of Technology (MIT)(麻省理工学院) Taylor Geospatial(泰勒地理空间公司)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 该研究指出GeoFMs仅用准确率排序的不足,分析其校准度与分布偏移敏感性,发现EO预训练模型更易过度自信,提出需多条件多指标评估以缩小实际部署差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10885 2026-08-12 cs.CV 新提交 50%

ConfTriage: A Calibration-Aware LLM Triage Framework for Pulmonary Nodule Malignancy with Selective Specialist Deferral

ConfTriage:用于肺结节恶性程度分级的校准感知大语言模型分级框架,结合选择性专家模型转诊机制

Md Rabiul Islam, Samir Abdaljalil, Erchin Serpedin, Hasan Kurban

机构 * Texas A&M University(德克萨斯农工大学) Hamad Bin Khalifa University(哈马德·本·哈利法大学)

专题命中 幻觉与事实性 :safety(abstract)

AI总结 本研究提出ConfTriage框架,以校准感知LLM为核心结合专家DL后备模型,通过肺结节属性的自然语言表述实现分级,在LIDC-IDRI数据集上取得88.22%的F1分数与0.92的AUC,可高效处理多数病例并仅转诊不确定病例,为医疗决策支持提供了新路径。

Comments 14 pages, 8 figures. Currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10725 2026-08-12 cs.CV cs.SC 新提交 50%

Rethinking LLM Verification: Evidence Structure, Uncertainty, and Selective Refinement

重新思考大语言模型验证:证据结构、不确定性与选择性优化

Uma Ranjan, Kunal Tilaganji, Aditya Koul, Anurag Mahipal, Dashpreet Singh, Hriday Rana, Manan Jain, Sidharth Gupta, Ajo Babu George, Vineeth Balasubramanian, Nagarajan Natarajan, Amit Sharma

机构 * Indian Institute of Technology Jammu(贾姆穆印度理工学院) Microsoft Research(微软研究院) SCB Dental College and Hospital(SCB牙科学院与医院)

专题命中 幻觉与事实性 :safety(abstract)

AI总结 该研究针对LLMs医疗应用的安全问题,提出两阶段框架,利用模型弃权信号优化推理,在GPT-5.5、DeepSeek-R1模型及MedReason、MedQA数据集上显著提升了医疗假设验证的准确率。

Comments Findings Track at the Conference on Empirical Methods in Natural Language Processing (EMNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07765 2026-08-12 eess.SY cs.SY 版本更新 50%

Information-Aware Model Predictive Control for Satellite Inspection

面向卫星巡检任务的信息感知模型预测控制

Sarah E. Clees, Sean Phillips, Christopher Petersen

专题命中 幻觉与事实性 :safety(abstract)

AI总结 该研究提出信息感知MPC框架,将估计协方差纳入控制目标,通过数值模拟验证其能生成满足约束且主动降低目标估计协方差的卫星巡检轨迹。

Comments Presented at the 2026 AAS/AIAA Astrodynamics Specialist Conference in Whistler, BC, Canada. v2 - corrected title metadata, content remains unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05616 2026-08-07 cs.CV 新提交 50%

TruthLens: Object Hallucination Detection via Self-Evaluating Truthfulness Scores in LVLMs

TruthLens:通过大型视觉语言模型(LVLM)中的自评估真实性分数检测对象幻觉

Yanqi Wu, Runhe Lai, Xinhua Lu, Qichao Chen, Zhiping Zhou, Jia-Xin Zhuang, Weijiang Yu, Ruixuan Wang

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Peng Cheng Laboratory(鹏城实验室) University of Nottingham Malaysia(马来西亚诺丁汉大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 幻觉与事实性 :trustworthy(abstract)

AI总结 TruthLens 是一种无需额外成本的 LVLM 对象幻觉检测框架,通过微调 LM 头部输出真实性分数,在 MS-COCO 数据集上的 Qwen2.5-VL-7B 上实现了超 17% 的 AUROC 提升,性能达当前最优。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05302 2026-08-07 cs.IR 新提交 50%

Cross-platform epistemic verification for improving factual reliability in AI-generated news summarization

用于提升AI生成新闻摘要事实可靠性的跨平台认知验证

Zhuo Xie, Haoze Ni

专题命中 幻觉与事实性 :trustworthy(abstract)

AI总结 本研究提出多源证据共识验证(MECV)框架,通过多异构来源证据聚合与多LLM陪审团机制修正AI生成新闻摘要的幻觉,在SummEdits基准上提升了事实一致性,为可信AI与自动化新闻研究提供了新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04991 2026-08-06 cs.DC 新提交 50%

RAC: Reference-Aware Activation Compression for Communication-Efficient Split LLM Inference

RAC:面向通信高效的分割式大语言模型推理的参考感知激活压缩

Guotao Yang, Mingxi Zhao, Haopeng Li, Zhengchao Wang, Sheng Chen, Yitao Hu, Keqiu Li

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 该研究针对分割式LLM推理的通信瓶颈,提出参考感知激活压缩方法RAC,通过参考感知编解码器等技术降低通信开销,在多模型多链路对实验中验证了其时间性能提升与任务分数变化情况。

Comments 10 pages, 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26987 2026-08-06 cs.SE 版本更新 50%

How Developers Experience Debugging Unfamiliar Codebases with Code Tours Generated and Evaluated by Local LLMs

开发者使用本地大语言模型生成和评估的代码导航体验陌生代码库调试的研究

Martin Balfroid, Julien Albert, Dzenatan Aliti, Xavier Devroey, Benoît Vanderose

专题命中 幻觉与事实性 :trustworthy(abstract)

AI总结 该研究探讨开发者使用本地大语言模型生成评估的代码导航调试陌生代码库的体验,明确代码导航组件属性对开发者的影响,为优化代码导航生成与评估提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08592 2026-08-05 cs.MM 版本更新 50%

Fact-Checking at Scale: Multimodal AI for Authenticity and Context Verification in Online Media

大规模事实核查:用于在线媒体真实性与上下文验证的多模态AI

Van-Hoang Phan, Tung-Duong Le-Duc, Long-Khanh Pham, Anh-Thu Le, Quynh-Huong Dinh-Nguyen, Dang-Quan Vo, Hoang-Quoc Nguyen-Son, Anh-Duy Tran, Dang Vu, Minh-Son Dao

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本文为2025年ACM多媒体大会多媒体验证挑战赛开发了多模态验证系统,整合视觉取证等技术,可检测脱离上下文的媒体,提升了多媒体验证水平,为相关从业者提供实用工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00878 2026-08-04 cs.IT math.IT 新提交 50%

Goal-Oriented Logic-based Semantic Communication for Neuro-Symbolic Reasoning with Applications onto Autonomous Driving

面向目标的基于逻辑的语义通信及用于自动驾驶的神经符号推理

Ahmet Faruk Saz, Duo Xu, Faramarz Fekri

专题命中 幻觉与事实性 :safety(abstract)

AI总结 本文针对自动驾驶场景,提出基于一阶逻辑的目标导向语义通信方法,通过选择关键证据传输实现安全决策,在相同通信预算下优于均匀证据选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08575 2026-08-04 cs.RO 版本更新 50%

FabriVLA: A Lightweight Vision-Language-Action Model with Conformal Action Chunk Uncertainty

FabriVLA:用于精确多任务操作的轻量级视觉-语言-动作模型

Shiyuan Yang, Borong Zhang, Jizheng Zhang, Zhijia Tao, Junfei Guo, Donglai Ran, Xu Bian, Qingbiao Li

专题命中 幻觉与事实性 :safety(abstract)

AI总结 研究提出FabriVLA模型,结合视觉-语言主干与流匹配动作头,经单阶段联合优化训练。在Meta-World MT50基准测试中,该模型基于1B规模VLM,不依赖数十亿参数主干,实现90.0%平均成功率,展现强大性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28997 2026-08-03 cs.IR 新提交 50%

Think2Go: Generative Next POI Recommendation with LLM Reasoning

Think2Go:基于大语言模型推理的生成式下一个兴趣点(POI)推荐

Zhuang Zhuang, Shanshan Feng, Hangwei Qian, Mingqi Yang, Heng Qi, Yanming Shen, Baocai Yin

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 Think2Go框架统一SFT与RL推理,通过优势加权机制校准策略优化,解决现有POI推荐模型的意图捕捉不足问题,提升推荐性能与稳健性。

Comments Accepted by KDD 2026 Research Track Cycle 1 (Oral presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏