arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-31 至 2026-07-31 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 6 篇

2607.28248 2026-07-31 stat.ML cs.LG 新提交 79%

Uncertainty quantification for trustworthy deep learning: Methods and measures

面向可信深度学习的不确定性量化:方法与度量

H. Martin Gillis, Thomas Trappenberg

专题命中 幻觉与事实性 :trustworthy(title);safety(abstract);分类 cs.LG

AI总结 本综述针对深度学习的不确定性量化,梳理五大类方法及相关任务,整合评估框架,还探讨大语言模型不确定性与开放研究方向,为可信深度学习提供结构化批判性参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08159 2026-07-31 cs.LG cs.AI cs.CL 版本更新 67%

The Confidence Manifold: Geometric Structure of Correctness Representations in Language Models

自信流形:语言模型中正确性表示的几何结构

Seonglae Cho, Zekun Wu, Kleyton Da Costa, Adriano Koshiyama

机构 * University College London(伦敦大学学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究揭示语言模型正确性表示的几何结构,发现低维子空间中的质心距离与探测器性能一致,表明检测是几何而非学习过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28137 2026-07-31 cs.CY cs.AI 新提交 62%

Asymmetric Communication: Large Language Models and Language Games

非对称通信:大语言模型与语言游戏

Enzo Fenoglio

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文通过提出非对称通信框架,纠正了AI讨论对大语言模型的错误属性投射,将相关现象重新归类为接收方一侧的现象,为AI治理提供了启示,明确对齐是制度约束工程,责任归人类机构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28237 2026-07-31 cs.AI 新提交 57%

AI and Authenticity in Islamic Research: A Critical Evaluation of Generative AI Reliability, Hallucination, and Source Fidelity in Quranic, Hadith, and Fiqh Knowledge

伊斯兰研究中的人工智能与真实性:对生成式人工智能在古兰经、圣训及教法知识中的可靠性、幻觉及来源保真度的批判性评估

Muhammad Sajjad Akbar

机构 * School of Computer Science, The University of Sydney(悉尼大学计算机学院) Macquarie University(麦考瑞大学) The University of New South Wales(新南威尔士大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

AI总结 本研究评估6款主流生成式AI在伊斯兰知识领域的可靠性,发现其仅适用于伊斯兰入门学习辅助,需验证后才可用于宗教指导或学术研究,为相关群体提供实践指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11018 2026-07-31 cs.CL 版本更新 57%

Measuring Human Value Expression in Social Media Texts: Calibrated LLM Annotation and Encoder Transfer

测量社交媒体文本中的人类价值表达:校准的LLM标注与编码器迁移

Maria Milkova, Maksim Rudnev

机构 * Independent researcher, Lisbon, Portugal(独立研究者,里斯本,葡萄牙) University of Waterloo, ON, Canada(滑铁卢大学,安大略省,加拿大)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 本研究使用校准的LLM标注和软标签训练,将基于Schwartz人类基本价值理论的社交媒体文本价值表达迁移到编码器模型,实现可扩展预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25991 2026-07-31 cs.AI cs.CV 版本更新 57%

Towards Unified Multimodal Misinformation Detection in Social Media: A Benchmark Dataset and Baseline

面向社交媒体中统一的多模态虚假信息检测:基准数据集与基线模型

Haiyang Li, Yaxiong Wang, Shengeng Tang, Yuchen Zhang, Lianwei Wu, Lechao Cheng, Liu Liu, Chaofeng Dong, Zhun Zhong

机构 * School of Computer Science and Information Engineering, Hefei University of Technology(计算机科学与信息工程学院,合肥工业大学) School of Computer Science and Technology, Northwestern Polytechnical University(计算机科学与技术学院,西北工业大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 该研究构建了含9.8万样本的OmniFake基准数据集,提出UMFDet框架,实现对人工与AI生成两类多模态虚假内容的统一检测,性能优于专用基线。

详情

展开后加载摘要…

URL PDF HTML 收藏