arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-20 至 2026-08-20 共收录 21 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 21 篇

2606.00919 2026-08-20 cs.CL cs.LG 版本更新 91%

Towards Lightweight Reliability: Using Soft Prompts for Hallucination Mitigation in Large Language Models

迈向轻量级可靠性:使用软提示缓解大型语言模型中的幻觉

S M Tahmid Siddiqui, Akib Jawad Ononto, Anoop Singhal, Latifur Khan

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) National Institute of Standards and Technology(国家标准与技术研究院)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 提出一种参数高效的软提示方法RCSP,通过对比学习、课程学习和KL正则化平衡事实回忆、幻觉抑制和弃权,在多个QA数据集上优于基线。

Comments 20 pages, 5 tables, 2 figures. Accepted for publication in DBSec 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16002 2026-08-20 cs.CL cs.AI 版本更新 90%

From Sequence to Structure: Relational Uncertainty Propagation for LLM Agents

从序列到结构:面向大语言模型智能体的关系型不确定性传播

Zhengzhao Ma, Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 知识编辑与模型理解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对现有LLM智能体不确定性量化方法忽略长程依赖的问题,提出RUPA框架,通过建模轨迹图的关系依赖传播不确定性,在多个基准上实现更优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10476 2026-08-20 cs.CL cs.LG 版本更新 90%

Hallucination Detection in Large Language Models Using Diversion Decoding

使用转移解码检测大语言模型中的幻觉

Basel Abdeen, S M Tahmid Siddiqui, Meah Tahmeed Ahmed, Anoop Singhal, Latifur Khan, Punya Parag Modi, Ehab Al-Shaer

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) National Institute of Standards and Technology(美国国家标准与技术研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 研究大语言模型中的幻觉检测问题,提出转移解码新方法,通过在解码阶段挑战模型响应提取特征,训练机器学习模型度量不确定性,该方法计算复杂度低,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19124 2026-08-20 cs.CL cs.AI 新提交 88%

Intercepting the Kangaroo: Experimental Astrolinguistics with Constructed Lexicons, Active Probing, and Large Language Models as Informants and Hypothesis Proposers

拦截“袋鼠”:基于人工词汇、主动探测及大型语言模型作为信息提供者与假设提出者的实验天体语言学

Francesco Cordella, Mauro Cappelli

机构 * ENEA(意大利国家新技术、能源与经济可持续发展局)

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 该研究将天体语言学从推测变为实验,通过含不兼容人工词汇的语言模型、脚本协调器及结合多策略的协议,成功拦截翻译不确定性的“袋鼠效应”,提升覆盖度与正确性,还能恢复假设空间外的词语。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07625 2026-08-20 cs.AR cs.MA 版本更新 88%

HINT: Toward an Executable Hardware-Intent Representation Layer for LLM-Driven RTL Generation

HINT:面向大语言模型驱动的RTL生成的可执行硬件意图表示层

Tairan Cheng, Yi Liu, Dongsheng Zuo, Zhengyuan Shi, Hongji Zhang, Xiangfei Hu, Maoshuo He, Hao Yan, Qiang Xu

专题命中 知识编辑与模型理解 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文提出HINT可执行硬件意图表示层,用于LLM驱动的RTL生成,在7个算子案例中全量生成合规可综合RTL,面积较人工实现及直接C2RTL结果显著降低,还验证了其在各类复杂设计中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07941 2026-08-20 cs.CR 版本更新 86%

Collective Hallucination in Multi-Agent LLMs:Modeling and Defense

多智能体大语言模型中的集体幻觉:建模与防御

Saeid Jamshidi

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出一种系统级模型描述多智能体LLM中幻觉的传播与放大,并设计交互感知控制方法,通过置信加权聚合、自适应影响调节、外部验证和隔离不可靠智能体来抑制错误传播,在TruthfulQA和TriviaQA上使幻觉降低39%,事实准确率提升至0.87。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17574 2026-08-20 cs.AI eess.SY 交叉投稿 81%

Quantifying Risk Under Evolving Uncertainty: Belief-Dependent Robustness for Safe Sequential Decision Making

演化不确定性下的风险量化:面向安全序贯决策的信念依赖鲁棒性

Deep Kumar Ganguly, Jan Kretinsky

机构 * Technical University of Munich(慕尼黑工业大学) Masaryk University(马萨里克大学)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出RATTL算法,将智能体谨慎程度与认知不确定性绑定,证明其规划问题适定且满足安全三明治性质,可保障LLM等智能体在不确定性下的运行时安全。

Comments Accepted for presentation at the IJCAI-ECAI 2026 RobustifAI workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01367 2026-08-20 cs.CL stat.ML 版本更新 81%

MMD-Flagger: Leveraging Maximum Mean Discrepancy to Detect Hallucinations

MMD-Flagger:利用最大均值差异检测幻觉

Kensuke Mitsuzawa, Damien Garreau

机构 * Université Côte d’Azur, CNRS, LJAD, France(法国埃克塞特大学、法国国家科学研究中心、LJAD研究所) Center for Artificial Intelligence and Data Science (CAIDAS)(人工智能与数据科学中心) Julius-Maximilans-Universität Würzburg, Germany(德国维尔茨堡约利乌斯-马克斯米利安大学)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对智能体AI系统中大型语言模型的幻觉问题,提出基于最大均值差异(MMD)的MMD-Flagger方法,通过监控不同解码温度下的输出轨迹检测幻觉,在MUCH基准上用Llama-3、Gemma-3模型完成评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18709 2026-08-20 cs.CV cs.AI cs.LG 新提交 81%

A Critical Synthesis of Uncertainty Quantification and Foundation Models for Semantic Segmentation

语义分割中不确定性量化与基础模型的批判性综合研究

Steven Landgraf, Joceline Hinz, Markus Ulrich

机构 * Institute of Photogrammetry and Remote Sensing (IPF), Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院摄影测量与遥感研究所)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文首次系统评估四类不确定性量化方法在语义分割基础模型上的表现,揭示预测性能、可靠性与计算成本间的权衡,为现实应用需联合优化相关指标指明方向。

Comments Accepted for publication in the ISPRS Annals (ISPRS Congress 2026, Toronto, Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10882 2026-08-20 cs.SE 版本更新 80%

From Quality Properties to Practice: A Guideline and Workflow for Explainability Requirements

从质量属性到实践:可解释性需求的指南与工作流

Martin Obaidi, Jakob Droste, Hannah Deters, Marc Herrmann, Michel Krahl, Kurt Schneider

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出一个基于指南的迭代工作流,通过结构化文献综述、开发者访谈和从业者调查提炼出十个核心质量属性,并开发工具支持,实验表明工具辅助可减少23.5%的制定时间且需求质量与手动编写相当。

Comments This paper has been accepted at the research track of the 34th IEEE International Requirements Engineering Conference (RE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18984 2026-08-20 cs.CV 新提交 78%

Uncertainty-Aware Art-Historical Dating with Vision-Language Models

基于视觉语言模型的不确定性感知艺术史年代测定

Stefanie Schneider, Peter Bell

机构 * Marburg University(马尔堡大学)

专题命中 知识编辑与模型理解 :language model(title,abstract)

AI总结 该研究针对艺术品年代测定中的时间纠缠问题,将其转化为不确定性感知回归任务,通过在Wikidata艺术品语料库上实验发现视觉语言模型(VLMs)在该任务上优于纯视觉自监督基线,但存在偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18419 2026-08-20 cs.LG cs.AI 新提交 73%

Mechanistic Interpretability of Structure-Aware Numerical Reasoning in LLaMA 3.1 8B

LLaMA 3.1 8B中结构感知数值推理的机制可解释性

Rahul Chowdhury, Timothy A Rupprecht, Senhao Cao, Jiahao Liu, Octavia Camps, David Bau, Pu Zhao, Yanzhi Wang

机构 * Northeastern University(东北大学) EmbodyX Inc.(EmbodyX公司)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究从机制可解释性视角探究LLaMA 3.1 8B,通过构建需捕捉结构的数值序列任务,发现其可无监督计算存储一阶差分,还揭示其通过类诱导回路机制完成数值推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18106 2026-08-20 cs.CL cs.AI 新提交 73%

Different Facets of Verbalised Overconfidence: an Interpretability Study

言语化过度自信的不同方面:一项可解释性研究

Davide Mazzaccara, Leonardo Bertolazzi, Raffaella Bernardi

机构 * CIMeC, University of Trento(特伦托大学认知科学与技术跨学科研究中心) DISI, University of Trento(特伦托大学信息工程与计算机科学系) Free University of Bozen-Bolzano(波尔扎诺自由大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究以Qwen3-4B为对象,探究大型语言模型的过度自信现象,通过识别转码器特征揭示其默认机制偏向确定性生成,干预不确定性特征可缓解过度自信错误,且相关特征具有跨场景泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18265 2026-08-20 econ.TH cs.AI 新提交 70%

How AI Prompts Can Teach Us About the Structure of Human Behavior

AI提示词如何能帮助我们理解人类行为的结构

Matthew O. Jackson, Benjamin S. Manning, Yutong Xie, Walter Yuan, Qiaozhu Mei

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出一种基于大语言模型的AI方法,通过调整类型向量匹配人类选择,发现人类行为可由风险厌恶、策略复杂度、信任三个维度近似,能预测不同游戏行为,为行为科学提供简约理论支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18115 2026-08-20 cs.CL cs.AI cs.LG 新提交 67%

Temporal Multi-Signal Fusion for Token-Level Hallucination Detection

面向 token 级幻觉检测的多信号时序融合

Igor Itkin

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种融合多信号的时序方法,通过 BiGRU 序列标注检测 token 级幻觉,在 RAGTruth 上较基线提升 11 个百分点,适用于闭源模型且泛化性良好。

Comments 17 pages, 14 figures, 23 tables. Code: this https URL (https://github.com/YehudaItkin/temporal-hallucination-detection)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11290 2026-08-20 math.CO 版本更新 67%

Solutions to Five Challenge Problems in Enumerative and Algorithmic Combinatorics, with an Account of the Human-Machine Methodology Employed

形状为$[[n,n],[n,1]]$的立体标准杨表的Zeilberger递推关系的一个证明

Jaideep Sai Padhi

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)

AI总结 本文证明了Zeilberger提出的形状为$[[n,n],[n,1]]$的立体标准杨表数量满足的二阶线性递推关系,通过双射结合代数核方法完成证明并得到多项独立计数结果。

Comments 42 pages. Code, data and verification scripts at this https URL (https://github.com/jaideepsaipadhi/zeilberger-challenges)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06722 2026-08-20 cs.HC 版本更新 67%

CustomDance: Customized 3D Dance Generation with Coarse-to-Fine Human-Centered Interactive Control

CustomDance:基于以人为中心的粗到细交互式控制的定制化3D舞蹈生成

Xulong Tang, Kaixing Yang, Xiaohu Guo, Prabhakaran Balakrishnan, Rawan Alghofaili

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)

AI总结 CustomDance是基于粗到细交互式控制的定制化3D舞蹈生成系统,通过三阶段流程实现AI辅助编舞,在定量和定性比较中优于基线,为用户提供全面控制。

Comments Accepted to SIGGRAPH Asia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18936 2026-08-20 cs.LG cs.AI cs.NE 新提交 62%

Graphical Design of Interpretable Architectures

可解释架构的图形化设计

Pietro Barbiero

机构 * IBM Research(IBM研究院)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出改编自Penrose张量表示法的图形符号,可直观呈现可解释AI架构的全局视图并与PyTorch einsum代码一一对应,还绘制了Steerling-8B的架构图并转换为代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09011 2026-08-20 cs.LG 版本更新 57%

Dynamic Distribution-Aware Uncertainty Tracking in Vision-Language Representation Learning

视觉-语言表示学习中的动态分布感知不确定性跟踪

Ao Zhou, Zhiwei Jiang, Zifeng Cheng, Cong Wang, Shufan Yang, Haoru Chen, Qing Gu

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) ByteDance Inc(字节跳动公司)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.LG

AI总结 针对视觉-语言模型事后不确定性量化方法忽略测试分布动态性的问题,提出DDA-UQ框架,通过高斯混合模型建模嵌入空间,实现动态不确定性估计,性能优于现有最优方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09764 2026-08-20 cs.LG 版本更新 57%

Prototype-based Self-Supervised Multimodal Learning for PPG and Accelerometry Signals

基于原型的PPG与加速度计信号自监督多模态学习

Wanting Mao, Maxwell A Xu, Harish Haresamudram, Mithun Saha, Santosh Kumar, James Matthew Rehg

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Memphis(密苏里大学孟菲斯分校)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.LG

AI总结 针对PPG与加速度计等生物信号的多模态学习局限,提出基于原型的SSL框架ProtoMM,开发Pulse-Motion基础模型,性能优于现有对比式及多模态SSL方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18994 2026-08-20 cs.HC 新提交 50%

TractorBeam: Personalized AI Sensemaking Support via Collaborative Machine Annotation

TractorBeam:通过协作机器标注实现个性化AI意义建构支持

Sireesh Gururaja, Jordan Taylor, Emma Strubell

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 本研究提出TractorBeam浏览器扩展系统,通过协作机器标注隐喻解决语言模型文档问答系统的事实性与来源性问题,初步用户研究显示其可支持用户迭代优化模型输出并促进探索性意义建构。

Comments UIST Poster Extended Abstract

详情

展开后加载摘要…

URL PDF HTML 收藏