arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-28 至 2026-07-28 共收录 541 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 40 篇

2607.02632 2026-07-28 cs.LG cs.AI 版本更新 81%

QuantFlow: A Federated Mamba-Based Post-Transformer Foundation Model for Time-Series Forecasting

QuantFlow:一种基于联合曼巴的用于时间序列预测的后Transformer基础模型

Shah Nawaz Haider, Steve Austin, Arnab Barua, Sarowar Morshed Shawon, Hadaate Ullah

机构 * Department of Computer Science and Engineering, University of Science and Technology Chittagong(信息科学与工程系,查塔姆冈科技大学) Department of Electrical and Electronic Engineering, University of Science and Technology Chittagong(电气电子工程系,查塔姆冈科技大学) Faculty of Science, Engineering and Technology, University of Science and Technology Chittagong(科学、工程与技术学院,查塔姆冈科技大学)

专题命中 领域大模型 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对时间序列预测,提出结合多种技术的概率预测框架QuantFlow,用反向序列嵌入等进行处理,经实验验证其在多数据上效果好,且联合学习可保护隐私。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24551 2026-07-28 cs.AI 新提交 79%

LLM-Assisted Ontology Engineering and Construction of a French Legal Knowledge Graph

大语言模型辅助的本体工程与法国法律知识图谱构建

G{é}nesis Montenegro, Mokhtar Boumedyen Billami, Catherine Faron, Fabien Gandon, Pierre Monnin

专题命中 领域大模型 :LLM(title,abstract);分类 cs.AI

AI总结 针对法国维护法规处理难题,提出两阶段大语言模型辅助工作流程,先进行本体工程,再构建知识图谱。经实验,该流程输出强大、对齐良好,减少重复,明确关键细化步骤。

Journal ref SEMANTiCS 2026 - 22nd International Conference on Semantic Systems, Sep 2026, Ghent (BE), Belgium

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03423 2026-07-28 cs.CL cs.AI 79%

Training-Free Adaptation of New-Generation LLMs using Legacy Clinical Models

无需训练适应新一代语言模型使用遗留临床模型

Sasha Ronaghi, Chloe Stanwyck, Asad Aali, Amir Ronaghi, Miguel Fuentes, Tina Hernandez-Boussard, Emily Alsentzer

机构 * Stanford University(斯坦福大学) MemorialCare(纪念医疗中心)

专题命中 领域大模型 :language model(abstract);instruction tuning(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CAPT方法,通过模型融合实现无需训练的临床模型与通用领域模型适应,提升临床任务性能,适用于计算资源有限的医疗机构。

Journal ref Proceedings of the 7th Conference on Health, Inference, and Learning, PMLR 333:354-388, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23718 2026-07-28 cs.IR 新提交 78%

Melo: A Production LLM-Powered Music Recommendation Agent

Melo:一个由大语言模型驱动的音乐推荐代理

Shijia Wang, Da Guo, Qiang Xiao, Fanghui Bi, Weisheng Li, Dongjing Wang, Chuanjiang Luo

专题命中 领域大模型 :LLM(title,abstract)

AI总结 研究基于网易云音乐部署的大语言模型驱动音乐推荐代理Melo,针对实体幻觉和长尾退化故障模式,采用推理时实体基础和反思性重试机制,经测试在播放列表留存和参与度指标上有提升,强调运行时机制对推荐进展的重要性。

Journal ref Proceedings of the 20th ACM Conference on Recommender Systems (RecSys '26), September 27-October 02, 2026, Minneapolis, MN, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02458 2026-07-28 cs.CY cs.AI cs.ET 版本更新 77%

Statistical realism is not evidence that LLMs can estimate treatment effects in social science experiments

当模拟看起来正确但因果效应出错:大型语言模型作为行为模拟器

Zonghan Li, Feng Ji

机构 * University of Toronto(多伦多大学)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究评估了大型语言模型在气候心理学干预中的行为模拟能力,发现描述性拟合不等于因果准确性,不同干预逻辑和结果类型导致误差差异,提示依赖描述性拟合可能误导干预效果结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12650 2026-07-28 cs.CV cs.AI 版本更新 77%

AutoMat: Enabling Automated Crystal Structure Reconstruction from Microscopy via Agentic Tool Use

AutoMat:通过智能工具使用实现从显微镜图像自动重建晶体结构

Yaotian Yang, Yiwen Tang, Yizhe Chen, Xiao Chen, Jiangjie Qiu, Hao Xiong, Haoyu Yin, Zhiyao Luo, Yifei Zhang, Sijia Tao, Wentao Li, Qinghua Zhang, Yuqiang Li, Wanli Ouyang, Bin Zhao, Xiaonan Wang, Fei Wei

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究旨在从有噪声的STEM投影重建晶体结构,提出AutoMat智能控制器,通过闭环验证和多模块组合实现。引入基准数据集评估,结果显示其性能优于现有方法,建立了从微观到原子尺度建模的途径。

Comments The code and dataset are publicly available at https://github.com/yyt-2378/AutoMat and https://huggingface.co/datasets/yaotianvector/STEM2Mat

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23313 2026-07-28 econ.GN q-fin.EC 新提交 75%

Agentic AI Orchestration of Heterogeneous Economic Models for Rapid, Multi-scenario Analysis of Energy Crises

用于能源危机快速多场景分析的异构经济模型的智能人工智能编排

Dana Golden, Brett Indelicato, Lav R. Varshney, Carlos D. Messina, Suzanne Thornsbury

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究针对能源危机下政策制定者需快速决策但经济模型整合困难的问题,利用大语言模型开发框架,协调多个异构经济模型,通过构建场景、转化输入、执行模型和合成输出,快速评估霍尔木兹海峡关闭等情况,避免单一模型假设主导结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22758 2026-07-28 cs.MA cs.AI 新提交 74%

Spectral Dynamics of Semantic Drift in Clinical Multi-Agent Language Model Networks

临床多智能体语言模型网络中语义漂移的谱动力学

Amritesh Banerjee

专题命中 领域大模型 :language model(title);分类 cs.AI

AI总结 研究临床多智能体语言模型网络中语义漂移的谱动力学,通过映射多智能体通信不确定性轨迹到嵌入空间,揭示结构瓶颈危害。提出动态谱监测技术,经图拉普拉斯算子特征分解确保全局状态扩散,保障自主医疗诊断可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24371 2026-07-28 cs.CL cs.AI 新提交 73%

Closed-Loop Validation-Repair for Healthcare Interoperability: A Multi-Model Study of Schema Compliance in Clinical LLMs

医疗保健互操作性的闭环验证修复:临床大语言模型中模式合规性的多模型研究

Jianru Shen

机构 * University of Montana(蒙大拿大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究医疗大语言模型集成到电子健康记录系统面临的模式不合规问题,通过在多场景下部署三个开源模型并评估,发现模式不合规具有一致性,验证 - 修复框架可有效提高合规率,为医疗互操作性提供保障。

Comments Accepted at the 2026 IEEE International Conference on Systems, Man, and Cybernetics (SMC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22683 2026-07-28 cs.AI cs.CL cs.PL 新提交 73%

Imprompt: A Language Framework for Prompt Programming

Imprompt:一种用于提示编程的语言框架

Chentian Wu, Shengyuan Yang, Adithya Murali

专题命中 领域大模型 :language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对现有提示编程框架的问题,提出Imprompt语言框架。通过基础研究、结构化提示阐释、定义编译器、探索类型化概念等方法,实现编译器和类型检查器并评估,为提示编程领域贡献编程语言基础。

Comments 28 pages, 24 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24000 2026-07-28 cs.SE 新提交 71%

Industrial Practice of LLM-Based Test Case Carving and Assertion Generation (Experience Paper)

基于大语言模型的测试用例提取与断言生成的工业实践(经验论文)

Haozhen You, Zhen Dong, Jingjing Wang, Qiang Li, Xin Peng

专题命中 领域大模型 :LLM(title)

AI总结 针对微服务系统回归测试因文档问题面临的挑战,提出NL2Test工具,通过自然语言描述和流量捕获生成可执行API回归测试,经大语言模型和确定性算法完成测试用例提取与断言生成等任务,在工业场景中效果良好,减少人工并提升自动化程度。

Comments 23 pages, 6 figures, Proceedings of the 35th ACM SIGSOFT International Symposium on Software Testing and Analysis (ISSTA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23975 2026-07-28 cs.AI q-bio.QM 新提交 70%

Plato-Bio: verification-first biological novelty screening with temporal rediscovery and structural benchmarks

柏拉图生物:通过时间再发现和结构基准进行验证优先的生物新奇性筛选

Stefan G. Creadore

机构 * Praxa Labs(普拉克斯实验室)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究开发柏拉图生物,扩展开放架构并结合多种功能,修复评估缺陷。通过Python套件等验证其有效性,评估两个用例,如历史再发现任务及蛋白质结构比较,提供可重复软件契约和筛选基准,为生物研究提供支持。

Comments 16 pages, 6 figures, 3 tables. Companion code and data: https://github.com/Eldergenix/Plato-Scientific-Research-Autonomous-Agent. This fork-specific validation study cites, but does not duplicate, arXiv:2510.26887

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22677 2026-07-28 cs.DL cs.AI 新提交 70%

SetGo: Metadata Readiness for Scientific AI Datasets

SetGo:科学人工智能数据集的元数据就绪性

Sean R. Wilkinson, Polina Shpilker, Wesley Brewer

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对科学AI数据集元数据就绪性评估工具缺失的问题,提出开源工具SetGo,能从六个维度评估修复元数据,揭示通用工具未发现的缺陷,提升公平性分数,还可集成大语言模型支持自动化工作流程。

Comments 6 pages; accepted at SSDBM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21783 2026-07-28 cs.RO cs.LG 70%

Therapist-Robot-Patient Physical Interaction is Worth a Thousand Words: Enabling Intuitive Therapist Guidance via Remote Haptic Control

治疗师-机器人-患者物理互动值得千言万语:通过远程触觉控制实现直观的治疗师指导

Beatrice Luciani, Alex van den Berg, Matti Lang, Alexandre L. Ratschat, Laura Marchal-Crespo

机构 * Department of Cognitive Robotics, Delft University of Technology(认知机器人系,代尔夫特理工大学) Department of Rehabilitation Medicine, Erasmus Medical Center(康复医学系,埃拉斯姆斯医疗中心)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种通过远程触觉控制实现直观治疗师指导的系统,通过实验表明触觉演示能有效提升运动训练效率并减少治疗师负担。

Comments 14 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23130 2026-07-28 stat.ME stat.ML 新提交 67%

Identification and Learning of Semantic Observation Kernels: Partial Observation, Uniform Recovery, & Minimax Limits

语义观察核的识别与学习:部分观察、一致恢复与极小极大极限

Matthew Francis Dixon

专题命中 领域大模型 :large language model(abstract);language model(abstract)

AI总结 探讨可观察语言法则何时支持状态可重现后验概率,提出语义映射方法,保持语言法则非参数性且不使用隐藏模型量。理论上推导多项条件和率等,实证上通过模拟和研究验证相关指标,明确语言概率提供可审计状态测量的条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22606 2026-07-28 cs.CY 新提交 67%

Auditing Institutional Heterogeneity for Generative AI in Patient Education: A Large-Scale Study of 102 US Transplant Handbooks

审核患者教育中生成式人工智能的机构异质性:对102本美国移植手册的大规模研究

Yubo Li, Rema Padman, Ramayya Krishnan

专题命中 领域大模型 :large language model(abstract);language model(abstract)

AI总结 研究针对美国23个移植中心的102本手册及相关患者问题,用结构化输出大语言模型评判器审核。发现机构编辑风格超越器官类型界限,信息差距在特定主题突出,分歧主题聚类,且可由问题框架预测分歧,探讨了对移植护理中部署生成式人工智能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23368 2026-07-28 cs.CV cs.AI cs.CL 新提交 62%

Explaining BiomedCLIP with Weighted Banzhaf Interactions Supported by Tree-Gram Parsing

用基于树图解析支持的加权班扎夫交互解释生物医学CLIP

Jakub Rymarski, Adam Rempała, Bartłomiej Sobieski, Przemysław Biecek

机构 * University of Warsaw(华沙大学) Centre for Credible AI, Warsaw University of Technology(华沙理工大学可信人工智能中心)

专题命中 领域大模型 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对视觉语言模型在医学任务中解释难的问题,引入ParseFIxLIP方法,将树图解析融入班扎夫交互博弈,通过smart_depth分组策略减轻概念碎片化,提升跨模态交互可解释性,为VLM决策提供医学领域相关见解。

Comments 12 pages, 13 figures. Accepted at EXPLIMED 2026 (Third Workshop on Explainable Artificial Intelligence for the medical domain), IJCAI-ECAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22592 2026-07-28 cs.AI cs.CL cs.IR 新提交 62%

Structure Over Scale: Schema-Constrained Causal Graphs for RAG

结构跨越尺度:用于检索增强生成的模式约束因果图

Marc Saouda, Rajprakash Bale, Eren Aldis, Cloves Almeida

机构 * Boston Consulting Group(波士顿咨询集团)

专题命中 领域大模型 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究针对GraphRAG问题,提出HCG-RAG,用模式约束因果图取代开放式提取,构建紧凑两层图。该方法成本低,答案质量优,在医学等基准测试中表现出色,对比实验显示因果图作为检索过滤器有优势,表明图内容比节点数量更重要。

Comments 26 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22750 2026-07-28 cs.AI 新提交 57%

Commitment To Cooperation With Self-Negotiated Contracts

通过自我协商合同实现合作承诺

Tim Wyse, Kaitlin Bustos, Yulia Volkova, Max Kleiman-Weiner

机构 * University of Washington(华盛顿大学)

专题命中 领域大模型 :LLM(abstract);分类 cs.AI

AI总结 研究人工智能代理在多智能体世界中的合作问题,借鉴法律制度和契约,通过在时空博弈\CT中研究基于大型语言模型的代理使用不同合同表示,发现自我协商合同可改善合作结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04705 2026-07-28 cs.CV cs.AI 版本更新 57%

Enhancing MedSAM with a Lightweight Box Predictor for Medical Image Segmentation

通过轻量级框预测器增强 MedSAM 用于医学图像分割

Amirhossein Movahedisefat, Amirreza Fateh, Mohammad Reza Mohammadi

机构 * School of Computer Engineering, Iran University of Science and Technology (IUST)(伊朗科学技术大学计算机工程学院)

专题命中 领域大模型 :foundation model(abstract);分类 cs.AI

AI总结 提出一种集成轻量级框预测器的 MedSAM 增强框架,通过单次点击估计边界框以提升点提示的空间引导能力,在仅增加 1.6M 参数下显著提高多模态医学图像分割的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02366 2026-07-28 cs.IR cs.AI 版本更新 57%

TextBridgeGNN: Pre-training Graph Neural Network for Cross-Domain Recommendation via Text-Guided Transfer

TextBridgeGNN: 通过文本引导的迁移预训练图神经网络进行跨域推荐

Yiwen Chen, Yiqing Wu, Huishi Luo, Fuzhen Zhuang, Deqing Wang, Zhao Zhang

机构 * Beihang University(北京航空航天大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院)

专题命中 领域大模型 :language model(abstract);分类 cs.AI

AI总结 TextBridgeGNN通过多级图传播利用文本建立领域间关系,解决ID嵌入非转移性和异构图结构不兼容问题,提升跨域推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16170 2026-07-28 cs.IR cs.AI 版本更新 57%

EGRA:Toward Enhanced Behavior Graphs and Representation Alignment for Multimodal Recommendation

EGRA:迈向用于多模态推荐的增强行为图和表示对齐

Xiaoxiong Zhang, Xin Zhou, Zhiwei Zeng, Yongjie Wang, Zhiqi Shen

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院)

专题命中 领域大模型 :prompting(abstract);分类 cs.AI

AI总结 针对多模态推荐现有方法不足,EGRA通过纳入预训练模型生成表示构建的项-项图减轻稀疏性,引入双层动态对齐加权机制提升模态-行为表示对齐,实验证明其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24255 2026-07-28 cs.IR 新提交 50%

OxygenREC-v2: Internalizing Discrimination into Generative Recommendation

OxygenREC-v2:将歧视内化到生成式推荐中

Guo Tang, Hanye Wu, Changjiang Han, Qingyang Li, Ming Zhang, Xiangyu Qian, Yanchen Qiao, Huanjie Wang, Zhi Ma, Zhen Li, Yaqiang Zang, Pinghua Gong

专题命中 领域大模型 :post-training(abstract)

AI总结 研究针对生成式推荐中纳入行为信号的挑战,提出OxygenREC-v2,通过用记录行为条件生成及监督训练,在预训练和训练后分别采用不同方式,保持统一主干,部署在电商平台,相比OxygenREC-v1提升了用户点击率转化率和商品交易总额。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23993 2026-07-28 cs.CY cs.HC 新提交 50%

On Capturing the Narrative: Social Media Manipulation Wargaming for Cyberliteracy

关于捕捉叙事:用于网络素养的社交媒体操纵模拟演练

Alexandra Vassar, Rahat Masood, Hammond Pearce

专题命中 领域大模型 :LLM(abstract)

AI总结 该研究针对网络错误信息及数字素养教育问题,通过举办“捕捉叙事”多校竞赛,让学生团队构建大语言模型驱动的机器人影响模拟选举,分析竞赛情况及学生反馈,为教育工作者提供建议并提出改进方向。

Comments 7 pages, 1 figure. Paper is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22607 2026-07-28 cs.CY 新提交 50%

The Clinical Trial Pipeline Reveals the Next Wave of Artificial Intelligence in Healthcare: A Multidimensional Analysis of 8,532 Registered Studies

临床试验管道揭示医疗保健领域人工智能的下一波浪潮:对8532项注册研究的多维分析

Lior Rokach

专题命中 领域大模型 :LLM(abstract)

AI总结 该研究通过对8532项注册研究多维分析,揭示医学人工智能临床试验格局。用关键词搜索和分类器识别试验,从多维度分类,发现虽从回顾转向前瞻,但在规模、专业覆盖等方面有差距,未来进展取决于弥合这些差距。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 知识编辑与模型理解 29 篇

2603.01227 2026-07-28 cs.AI 版本更新 92%

The Lattice Representation Hypothesis of Large Language Models

大语言模型的晶格表示假说

Bo Xiong

机构 * Stanford University(斯坦福大学)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出大语言模型的晶格表示假说,通过嵌入几何将概念层次和逻辑运算统一到线性表示中,实验表明LLM嵌入编码概念晶格及其逻辑结构。

Comments Published at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05298 2026-07-28 cs.CL cs.MA 90%

Toward Reasonable Parrots: Why Large Language Models Should Argue with Us by Design

走向合理的鹦鹉:为何大型语言模型应通过设计与我们辩论

Elena Musi, Nadin Kokciyan, Khalid Al-Khatib, Davide Ceolin, Emmanuelle Dietz, Klara Gutekunst, Annette Hautli-Janisz, Cristian Manuel Santibañez Yañez, Jodi Schneider, Jonas Scholz, Cor Steging, Jacky Visser, Henning Wachsmuth

机构 * University of Liverpool(利兹大学) University of Edinburgh(爱丁堡大学) University of Groningen(格罗宁根大学) Centrum Wiskunde & Informatica(数学与信息学研究中心) Airbus Central R&T(空客中央研发与技术部) University of Kassel(卡塞尔大学) University of Passau(帕绍大学) Universidad de Católica de la Santísima de Concepción(圣地亚哥圣母大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Dundee(邓迪大学) Leibniz University Hannover(汉诺威莱布尼茨大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出通过设计使大型语言模型具备辩论能力,以提升人类批判性思维。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24072 2026-07-28 cs.CL 新提交 90%

LLM-Based vs. Lexicon-Based Sentiment Signals for Tail-Risk Detection in Meme Stocks

基于大语言模型与基于词典的情绪信号在表情包股票尾部风险检测中的比较

Paul Kilian, Markus Kleffmann

机构 * IU International University of Applied Sciences(IU国际应用科学大学)

专题命中 知识编辑与模型理解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 比较基于词典和基于大语言模型的情绪分析在表情包股票尾部风险检测中的应用,构建情绪指标并评估与市场回报关系,结果显示基于LLM的指标表征更丰富,但与市场走势关系因资产而异。

Comments 10 pages, 1 figure, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24586 2026-07-28 cs.CL cs.AI 新提交 88%

D-Score: A Spectral Hidden-State Signal for Hallucination Detection in Large Language Models

D分数:一种用于大语言模型中幻觉检测的谱隐藏状态信号

Bianca Raimondi, Davide Evangelista, Maurizio Gabbrielli, Elena Loli Piccolomini

机构 * Department of Computer Science and Engineering, University of Bologna(博洛尼亚大学计算机科学与工程系)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型幻觉检测,提出基于隐藏激活几何结构的D分数,通过单次前向传播计算,用作幻觉分数。经实验验证,该分数是强大的隐藏状态信号,检测时无需外部验证器等,为幻觉检测提供新方法。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23067 2026-07-28 cs.CL cs.AI 新提交 88%

Attention-Guided Layer Selection for Contrastive Decoding in Large Language Models

大语言模型中用于对比解码的注意力引导层选择

Yusuke Sakai, Natthawut Kertkeidkachorn, Kiyoaki Shirai

机构 * Japan Advanced Institute of Science and Technology(日本先进科学技术学院)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型中对比解码的层选择问题,提出Attention-JSD等三种基于注意力引导的策略,实验表明这些策略在TruthfulQA上优于原始DoLa,在多答案指标上有显著提升,凸显注意力分布在解决事实性知识上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏