arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-11 至 2026-08-11 共收录 8 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 8 篇

2606.00898 2026-08-11 cs.CL cs.DL 版本更新 82%

Citation Grounding Measures the Oracle: Graph Coverage Determines Reported LLM Hallucination Rates in Law

引用溯源:通过法律引用图检测和减少LLM引用幻觉

Volodymyr Ovcharov

机构 * LEX AI LLC

专题命中 幻觉与事实性 :DPO(summary_cn,abstract_cn);trustworthy(abstract);分类 cs.CL

AI总结 提出引用溯源(CG)指标,利用乌克兰法院判决的引用图(1.008亿判决,5.02亿边)检测LLM法律引用幻觉,并通过CG-DPO方法(基于真实判决构建偏好对)减少幻觉,在100个法律查询上CG为0.791-0.873,幻觉率13-21%。

Comments 21 pages, 4 figures, 5 tables. Substantially revised: title, framing and several v1 results changed. Adds a coverage sweep and a separability analysis; corrects the DPO configuration, the density-accuracy correlation and the qualitative examples. Code and data: https://huggingface.co/datasets/overthelex/citation-grounding-eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07525 2026-08-11 cs.CL cs.AI 新提交 62%

Unified Hallucination Fuzzing for Multimodal Large Language Models

面向多模态大语言模型的统一幻觉模糊测试

Pengfei Zhou, Jiajun Song, Zhiwei Tang, Yixing Ma, Xiaopeng Peng, Donghui Si, Yuhang Xu, Huiqi Song, Yiyuan Miao, Yichen Qian, Weihua Chen, Wangbo Zhao, Bohan Zhuang, Jiasheng Tang, Yang You

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 针对多模态大语言模型的幻觉问题,提出含UniHall基准与SAMF自演化模糊测试的评估框架,发现SOTA模型在模糊测试下性能显著下降,存在有用性-幻觉权衡。

Comments 47 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07520 2026-08-11 cs.CY cs.AI 新提交 62%

KumbhDoot: A Scale-Ready, LLM-Bounded Architecture for Mass-Gathering Public-Service Assistants

KumbhDoot:面向大规模集会公共服务助手的可扩展、大语言模型(LLM)限定架构

Saurabh Sakalkar, Abhishek Singh, Ramesh Raskar

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.CY

AI总结 针对大壶节这类高风险低连接性的大规模集会,提出KumbhDoot架构,以相似度优先、LLM限定为核心,解决默认LLM助手成本高、易幻觉等问题,适配公共服务场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26502 2026-08-11 cs.AI cs.CL 版本更新 62%

Humans Disengage, Reasoning Models Persist: Separating Difficulty Registration from Deliberation Allocation

人类放弃,推理模型坚持:将难度登记与深思分配分离

Han-yu Wang

机构 * The University of Hong Kong(香港大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文通过分离难度登记与深思分配,发现人类与大型推理模型(LRM)在问题解决中的时间/令牌分配模式相反:人类在错误问题上用时更少,而LRM在错误问题上使用更多令牌。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26798 2026-08-11 cs.LG cs.AI 版本更新 62%

Explaining, Verifying, and Aligning Semantic Hierarchies in Vision-Language Model Embeddings

解释、验证和对齐视觉语言模型嵌入中的语义层次结构

Gesina Schwalbe, Mert Keser, Moritz Bayerkuhnlein, Edgar Heinert, Annika Mütze, Marvin Keller, Sparsh Tiwari, Georgii Mikriukov, Diedrich Wolter, Jae Hee Lee, Matthias Rottmann

机构 * University of Lübeck(吕贝克大学) Technical University of Munich(慕尼黑工业大学) AUMOVIO SE Osnabrück University(奥斯纳布吕克大学) Leibniz Institute for Agricultural Engineering and Bioeconomy(莱布尼茨农业工程与生物经济研究所) University of Hamburg(汉堡大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种框架,用于解释、验证和对齐视觉语言模型嵌入中的语义层次结构,通过聚类和概念库匹配提取层次结构,并利用人类本体评估其合理性,最终提出基于本体的对齐方法以提升共享嵌入空间的语义对齐。

Comments camera-ready version of accepted IJCAI-ECAI 2026 paper including supplementary material; code: https://github.com/gesina/ontological-commitment

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09011 2026-08-11 cs.LG 新提交 57%

Dynamic Distribution-Aware Uncertainty Tracking in Vision-Language Representation Learning

视觉-语言表示学习中的动态分布感知不确定性跟踪

Ao Zhou, Zhiwei Jiang, Zifeng Cheng, Cong Wang, Shufan Yang, Haoru Chen, Qing Gu

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) ByteDance Inc(字节跳动公司)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 针对视觉-语言模型事后不确定性量化方法忽略测试分布动态性的问题,提出DDA-UQ框架,通过高斯混合模型建模嵌入空间,实现动态不确定性估计,性能优于现有最优方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08621 2026-08-11 cs.AI 新提交 57%

Business Arena: Benchmarking LLM Agents in a Realistic Marketplace

商业竞技场:在现实市场中对大语言模型智能体进行基准测试

Yijun Pan, Yukun Lian, Kunyu Shi, Junbo Li, Hongwei Xue, Sicong Xie, Guannan Zhang, Xiaoying Xing

机构 * Alibaba Group(阿里巴巴集团) Yale University(耶鲁大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

AI总结 研究人员推出Business Arena测试平台,评估15个前沿LLM智能体在跨境商店运营中的表现,发现其平均最终净资产差9倍,最优模型仍逊于人类策略,为商业智能体评估提供了现实测试基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19735 2026-08-11 stat.ME cs.LG 版本更新 57%

Integrating RCTs, RWD, AI/ML and Statistics: Next-Generation Evidence Synthesis

整合RCTs、RWD、AI/ML和统计学:下一代证据合成

Shu Yang, Margaret Gamalo, Haoda Fu

机构 * Department of Statistics, North Carolina State University(统计学系,北卡罗来纳州立大学) VP and Statistics Head, Inflammation, Immunology & Specialty Care, Pfizer(副总裁及统计学负责人,炎症、免疫与专科医疗,辉瑞) Head of Exploratory Biostatistics, Amgen(探索性生物统计学负责人,安进)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG

AI总结 本文提出通过整合RCTs、RWD、AI/ML和统计学,提升证据合成的严谨性和实用性,推动下一代证据生成方法的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏