When Quantization Is Free: An int4 KV Cache That Outruns fp16 on Apple Silicon
量化为何免费:一种int4 KV缓存性能超越fp16的苹果硅芯片
机构 * Illumina
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI
AI总结 本文提出一种int4 KV缓存方法,在苹果硅芯片上实现比fp16更快的性能,通过融合金属内核和内存压缩,保持质量并提升效率。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
量化为何免费:一种int4 KV缓存性能超越fp16的苹果硅芯片
机构 * Illumina
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI
AI总结 本文提出一种int4 KV缓存方法,在苹果硅芯片上实现比fp16更快的性能,通过融合金属内核和内存压缩,保持质量并提升效率。
幻觉削弱信任;元认知是前进的方向
机构 * Tel Aviv University(特拉维夫大学)
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL
AI总结 研究指出,生成AI的幻觉问题源于知识边界扩展而非意识提升,提出通过元认知表达不确定性以提升可信度和能力。
Comments To appear in ICML 2026 (Position Track)
机器学习增强的激光光谱法用于复杂恶劣环境中的多物种气体检测
机构 * King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹大学科学与技术学院)
专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG
AI总结 本研究结合激光吸收光谱与机器学习,开发出多物种气体检测方法,通过深度去噪自编码器、结构化无监督框架和盲源分离技术提升检测可靠性,适用于动态或干扰环境。
Comments PhD thesis
基于检索的生成用于更安全的病理科图像描述生成
机构 * Kimia Lab, Department of Artificial Intelligence \& Informatics, Mayo Clinic, Rochester, MN, USA ; Department of Biomedical Informatics, University of Arkansas for Medical Sciences, Little Rock, AR, USA ; Lane Department of Computer Science ; Electrical Engineering, West Virginia University, Morgantown, WV, USA ; Department of Computer Science ; Engineering, Princeton University, Princeton, NJ, USA ; Department of Computer Sciences, University of Wisconsin--Madison, Madison, WI, USA
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI
AI总结 本文提出检索引导生成方法,通过总结相似病例的专家文本生成描述,提升病理图像描述的准确性与可靠性,实验表明其在语义对齐和诊断一致性方面优于现有方法。
在线对抗幻觉的视觉-语言模型自我校准
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG
AI总结 本文提出OSCAR框架,通过蒙特卡洛树搜索和双粒度奖励机制在线校准视觉-语言模型,减少幻觉并提升多模态能力。
Comments IJCAI 2026
构建中的理论:协调语言模型用于研究软件,其中规范在演变
机构 * Microsoft Research(微软研究院)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI
AI总结 本文提出Comet-H框架,通过迭代提示自动机协调语言模型在研究软件中的应用,解决规范演变中的 hallucination accumulation 和 desynchronization 问题,并通过实验证明其有效性。
ADVICE: 答案依赖性口头置信度估计
机构 * Department of Computer Science, Hanyang University(韩国汉阳大学计算机科学系)
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL
AI总结 本文提出ADVICE框架,通过增强答案依赖性改进大语言模型的置信度校准,减少过度自信现象,提升可信度。
Comments ACL 2026 Main
评估作为文本属性图的保证案例用于结构和来源分析
机构 * Simula Research Laboratory(Simula研究实验室)
专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG
AI总结 本文提出基于图诊断框架分析保证案例的结构和来源,通过链接预测和图分类检测偏见,实验表明GNN在链接预测和来源检测中表现优异。
Comments 10 pages, 4 figures, 8 tables. Accepted to EASE 2026 AI Models / Data track, Glasgow, United Kingdom Fix the captions of tables 7 and 8
当标注者意见不一致时,拓扑解释:Mapper,一种用于探索文本嵌入几何和模糊性的拓扑工具
机构 * CReSTIC, Université de Reims Champagne-Ardenne(里摩日大学CReSTIC研究所) ; Chochoy Conseil(Chochoy咨询公司)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL
AI总结 本文提出用拓扑方法分析模型如何编码模糊性,通过Mapper工具揭示微调后嵌入空间的模块化结构,并探讨结构自信与标签不确定性的矛盾。
Comments Accepted to appear in the Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025, Main Conference)
Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, pages 8457--8480, Suzhou, China. Association for Computational Linguistics
SycoPhantasy: 量化小型开放权重视觉-语言模型中趋炎附势行为与幻觉现象以评估奇幻角色的视觉-语言评分
机构 * IIT Gandhinagar(印度加尔各答理工学院) ; IIT Kanpur(印度坎浦尔理工学院) ; Asian Institute of Technology(亚洲理工学院)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI
AI总结 本文研究小型开放权重VLM在评估图像-文本对齐时是否存在趋炎附势行为,通过引入布林系数量化模型评分与视觉证据的不匹配程度,发现模型规模与趋炎附势率呈负相关。
Comments 13 pages, 12 figures, 6 tables
他们是什么意思?大语言模型如何在不同视角和角色下解析模糊的社会情境
机构 * Santa Clara University(圣克拉拉大学)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI
AI总结 研究探讨LLM在处理模糊社会情境时的响应方式,发现其倾向于通过叙事一致、规范建议等路径闭合模糊性,且叙述视角影响解读路径,凸显LLM在社会AI设计中保持不确定性的挑战。
Vibe Medicine:通过人机协作重新定义生物医学研究
机构 * School of Computing, University of Georgia(佐治亚大学计算学院) ; Department of Biomedical Engineering, New Jersey Institute of Technology(新泽西理工学院生物医学工程系) ; Department of Computer Science and Engineering, University of Texas at Arlington(德克萨斯大学阿灵顿分校计算机科学与工程系)
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI
AI总结 本文提出Vibe Medicine,通过自然语言指导AI代理执行复杂生物医学流程,解决多领域数据整合与分析难题,提升研究效率与公平性。
CGC:基于组成性 grounded 对比的细粒度多图像理解
机构 * School of Computer Science and Technology, Hangzhou Dianzi University(杭州电子科技大学计算机科学与技术学院) ; School of Computer Science(计算机科学学院) ; Technology, Hangzhou Dianzi University(技术,杭州电子科技大学)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI
AI总结 本文提出CGC框架,通过跨图像对比和内图像对比提升多图像细粒度理解,结合规则空间奖励增强属性和对齐,实验显示在多个基准上取得最佳结果,并在多模态任务中表现优异。
向LLM-代理社会模拟的操作验证:一个Reddit-like技术论坛的重复研究
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CY
AI总结 本文通过30天的模拟研究,验证LLM-代理在技术论坛中的操作有效性,发现模拟结果与真实数据在用户和帖子层面有重叠,但评论毒性等指标存在差异,揭示了代理设计对模拟结果的影响。
信任但验证:介绍DAVinCI——一种用于语言模型声明推断中双属性和验证的框架
机构 * Adobe(Adobe公司) ; Adobe Research(Adobe研究院)
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI
AI总结 本文提出DAVinCI框架,通过双属性和验证机制提升语言模型输出的事实可靠性与可解释性,实验表明其在分类准确率、属性精度、召回率和F1分数上提升5-20%。
一种异构长微尺度级联架构用于通用航空健康管理
专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG
AI总结 本文提出一种异构级联架构,通过分离全局异常检测与微尺度故障分类,解决接收场悖论,提升航空设备健康管理的准确性和效率。
Comments Significant methodological flaws have been identified in the experimental validation and metric computation procedures that undermine the reliability of the reported results. A comprehensive revision is underway
大型语言模型中的不完美悖论
机构 * LMU Munich(慕尼黑大学) ; The University of Tokyo(东京大学)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL
AI总结 研究揭示大型语言模型在事件复合语义理解上的局限性,发现其依赖表面概率启发式而非逻辑推理,提出ImperfectiveNLI数据集揭示目标导向事件的预测偏差。
Comments ACL 2026
变分视觉问答用于不确定性感知的选择性预测
机构 * TU Darmstadt(图宾根大学)
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI
AI总结 本文提出变分VQA方法,通过变分贝叶斯方法提升视觉问答和视觉推理任务的可靠性,尤其在低误差容忍度下表现优异,且优于AdamW训练模型。
Comments TMLR April 2026 version. 13 pages main paper, 31 pages with appendix. Updated bibliography
Journal ref Transactions on Machine Learning Research (2026)
大语言模型代理中的不确定性量化:基础、新兴挑战与机遇
机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; Carnegie Mellon University(卡内基梅隆大学) ; Nanyang Technological University(南洋理工大学) ; University of Pennsylvania(宾夕法尼亚大学) ; University of Southern California(南加州大学) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI
AI总结 本文探讨了大语言模型代理中不确定性量化的基础、挑战及未来方向,提出新的框架并分析了现实场景中的技术难题。
Comments ACL 2026 Main Conference
从被动度量到主动信号:不确定性量化在大语言模型中的演变角色
机构 * Salesforce AI Research(Salesforce AI研究院) ; Intuit(Intuit公司) ; Vanderbilt University(范德比大学) ; University of California, Davis(加州大学戴维斯分校) ; Vanderbilt University Medical Center(范德比大学医学中心)
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI
AI总结 本文探讨大语言模型中不确定性量化从被动诊断指标到主动控制信号的演变,分析其在高级推理、自主代理和强化学习中的应用及贡献。
Comments This paper has been accepted by ACL 2026
MeasHalu:通过增强推理缓解大型语言模型中的科学测量幻觉
机构 * Shenzhen Key Laboratory for High Performance Data Mining(深圳高性能数据挖掘重点实验室) ; Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) ; Artificial Intelligence Research Institute, Shenzhen University of Advanced Technology(深圳先进技术大学人工智能研究院)
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL
AI总结 本文提出MeasHalu框架,通过增强推理和针对性优化缓解LLM的科学测量幻觉问题,改进测量提取的准确性。
Comments To appear in ACL 2026
超越字面总结:重新定义医疗SOAP笔记评估中的幻觉
机构 * Augnito Research(Augnito研究)
专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI
AI总结 本文提出通过校准提示和基于医学本体的检索,重新定义医疗SOAP笔记评估中的幻觉,发现传统评估方法高估了幻觉率,影响模型评估。
Comments 12 pages, 2 figures,3 tables
BoundRL: 通过强化边界生成实现高效的结构化文本分段
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; Amazon Web Services(亚马逊网络服务)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL
AI总结 本文提出BoundRL,一种高效处理长结构化文本的分段与标签预测方法,通过强化学习优化文档重建和语义对齐,减少输出token并降低幻觉风险,实验证明其在复杂提示下优于其他基线方法。
Comments accepted by ACL 2026 findings
新兴理念:人工三元智能:一种生物启发、以传感器优先的物理AI架构
机构 * Seoul National University(首尔国立大学)
专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI
AI总结 本文提出人工三元智能(ATI),一种生物启发的物理AI架构,通过模块化设计实现传感器控制与推理的协同进化,提升动态环境下的性能与效率。
将外部知识转化为三元组以增强LLM中RAG的检索
机构 * School of Computing, Kyung Hee University(韩国庆熙大学计算机学院) ; School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) ; School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院) ; School of Robotics and Advanced Manufacture, Harbin Institute of Technology(哈尔滨工业大学机器人与先进制造学院) ; School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL
AI总结 Tri-RAG通过结构化三元组构建提升检索效率,减少冗余信息,提高生成质量与资源利用率。
Comments 12 pages, 5 figures
一个两阶段LLM框架用于可访问且验证的XAI解释
机构 * Department of Computer Engineering and Informatics, University of Patras(帕特拉大学计算机工程与信息学系) ; Department of Informatics and Telecommunications, University of Ioannina(伊奥安尼纳大学信息与电信系) ; Industrial Systems Institute, Athena Research Center(雅典研究中心工业系统研究所) ; Archimedes Unit, Athena Research Center(雅典研究中心阿基米德单位)
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI
AI总结 本文提出两阶段LLM框架,通过解释器和验证器LLM生成并验证XAI解释,提升解释的准确性与可访问性。
Comments 8 pages, 8 figures, Accepted for publication at the 2026 IEEE World Congress on Computational Intelligence (WCCI 2026)
TRUST代理:一种用于虚假新闻检测、可解释验证和逻辑感知声明推理的协作多智能体框架
机构 * George Mason University(乔治·马歇尔大学)
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI
AI总结 TRUST代理通过协作多智能体框架提升虚假新闻检测的可解释性和逻辑推理能力,引入分解器、陪审团和逻辑聚合器提升复杂声明的验证效果。
Comments 12 pages, 2 figures
评估小型开放语言模型用于医疗问答:一种实用框架
机构 * Bar-Ilan University(巴伊兰大学)
专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL
AI总结 本文提出评估小型本地部署开放权重语言模型在医疗问答中的实用框架,强调可重复性与准确性的平衡,通过八个质量指标和重复推理评估发现模型输出一致性不足,且领域微调影响评估结果。
CARE-ECG:基于因果代理的可解释与反事实ECG解读
机构 * University of California, Irvine(加州大学尔湾分校) ; Arizona State University(亚利桑那州立大学) ; California State University, Dominguez Hills(加州州立大学多明格斯山分校)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG
AI总结 CARE-ECG通过统一的表示学习、诊断和解释流程,提升ECG解读的准确性与可信度,减少幻觉,适用于多基准和专家问答场景。
从GPT-3到GPT-5:映射其能力、范围、限制及后果
机构 * University of Bergen(卑尔根大学) ; Norwegian University of Life Sciences(挪威生命科学大学) ; Sohar University(苏哈尔大学) ; Norwegian University of Science and Technology(挪威科技大学) ; Kristiania University of Applied Sciences(克里斯蒂安尼亚应用科学大学)
专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI
AI总结 本文比较分析GPT系列从GPT-3到GPT-5的发展,探讨技术演进、能力变化、部署转变、持续限制及下游影响,强调后续版本不仅是更大更准的模型,而是更复杂的系统。