arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 7526 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 7526 篇

2606.03136 2026-06-03 cs.CR cs.CL 89%

PsychoPass: Geometric Profiling of Multi-Turn Adversarial LLM Conversations

PsychoPass: 多轮对抗性LLM对话的几何轮廓分析

Muberra Ozmen, Subhabrata Majumdar

机构 * Coveo Montreal, QC, Canada(加拿大蒙特利尔 Coveo) Indian Institute of Management Bangalore(班加罗尔印度管理学院)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出PsychoPass框架,通过提取对话轨迹在嵌入空间中的几何特征,在有害内容生成前预测多轮越狱攻击,并发现早期几何信号具有鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29354 2026-05-29 cs.CR cs.LG 89%

Harmless Yet Harmful: Neutral Prompting Attacks for Stealthy Hallucination Steering in Agent Skills

无害却有害:针对Agent技能中隐蔽幻觉引导的中性提示攻击

Chia-Yi Hsu, Chia-Mu Yu, Chun-Ying Huang, Jun Sakuma

机构 * Department of Computer Science(计算机科学系) National Yang Ming Chiao Tung University(阳明交通大学) Department of Electronics and Electrical Engineering(电子与电气工程系) School of Computing(计算学院) Institute of Science Tokyo(东京科学研究所)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);prompting(title,abstract);分类 cs.LG

AI总结 本文提出中性提示攻击(NPA),通过语义上看似无害的指令(如鼓励想象和详尽性)增加代码生成Agent的包幻觉倾向,从而引入软件供应链风险,并评估了其对多种编码LLM的有效性和逃避防御的能力。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01724 2026-05-28 cs.AI 89%

MetaboT: An LLM-based Multi-Agent Frameworkfor Interactive Analysis of Mass SpectrometryMetabolomics Knowledge Graphs

MetaboT:基于LLM的多智能体框架,用于质谱代谢组学知识图谱的交互式分析

Madina Bekbergenova, Lucas Pradi, Benjamin Navet, Emma Tysinger, Franck Michel, Matthieu Feraud, Yousouf Taghzouti, Yan Zhou Chen, Olivier Kirchhoffer, Florence Mehl, Martin Legrand, Tao Jiang, Marco Pagni, Soha Hassoun, Jean-Luc Wolfender, Wout Bittremieux, Fabien Gandon, Louis-Félix Nothias

机构 * Department of Computer Science, University of Antwerp(安特卫普大学计算机科学系) Massachusetts Institute of Technology(麻省理工学院) Department of Computer Science, Tufts University(塔夫茨大学计算机科学系) Swiss Institute of Bioinformatics (SIB), Lausanne, Switzerland(瑞士生物信息学研究所(SIB),洛桑,瑞士) Department of Chemical and Biological Engineering, Tufts University(塔夫茨大学化学与生物工程系)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出MetaboT,一个基于大语言模型的多智能体框架,通过模块化架构将自然语言问题转化为SPARQL查询,降低代谢组学知识图谱的使用门槛。

Journal ref 33rd annual international conference on Intelligent Systems for Molecular Biology (ISMB 2025) / 24th Annual Conference of the European Conference on Computational Biology (ECCB 2025), Jul 2025, Liverpool, United Kingdom

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26332 2026-05-27 cs.CV cs.AI 89%

Erased but Exploitable: Black-box Embedding-Aware Prompting Against Unlearned Text-to-Image Diffusion Models

被擦除但可被利用:针对已遗忘文本到图像扩散模型的黑盒嵌入感知提示攻击

Arian Komaei Koma, Seyed Amir Kasaei, AmirMahdi Sadeghzadeh, Mohammad Hossein Rohban

机构 * Department of Computer Engineering(计算机工程系)

专题命中 知识编辑与模型理解 :prompting(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出一种黑盒嵌入感知对抗提示攻击BEAP,利用大语言模型迭代生成有效对抗提示,以恢复被遗忘概念,并在攻击成功率上提升超过60%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06339 2026-05-08 cs.AI 89%

A Regime Theory of Controller Class Selection for LLM Action Decisions

控制器类别选择的制度理论:用于LLM行动决策

Zhaoyang Jiang, Zhizhong Fu, Yunsoo Kim, Jiacong Mi, Zicheng Li, Xuanqi Peng, Honghan Wu

机构 * University of Glasgow(格拉斯哥大学) University College London(伦敦大学学院) UESTC(电子科技大学)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);language model(abstract);分类 cs.AI

AI总结 本文提出一种制度理论,通过分析有限样本下的实例不确定性信号,指导LLM在不同输入下选择合适的控制器类别,从而在有限样本中实现最优决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14896 2026-08-18 cs.CL cs.LG 新提交 88%

Interpretable Cross-Lingual Alignment in Small Language Models: Probing Cultural and Pragmatic Reasoning in Japanese-English Bilingual LLMs

小语言模型中的可解释跨语言对齐:探究日英双语大语言模型的文化与语用推理

Florian Braun

机构 * Sakaguchi–Inui Laboratory (Tohoku University)(东北大学坂口–乾实验室) Natural Language Understanding Team at RIKEN AIP(理化学研究所先进智能项目中心自然语言理解团队) Swallow Project at the Institute of Science Tokyo(东京科学大学Swallow项目) Sakana AI Tohoku University(东北大学) RIKEN AIP(理化学研究所先进智能项目中心) Institute of Science Tokyo(东京科学大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);small language model(title);large language model(abstract);分类 cs.CL、cs.LG

AI总结 本研究构建J-PragEval-v0基准,结合线性探针与教师强制评估探究TinySwallow-1.5B的日英语用表征,提出语用表征引导方法,下一步将扩展至Llama-3.1-Swallow-8B。

Comments 15 pages, no figures. Introduces the J-PragEval-v0 minimal-pair benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05280 2026-08-12 cs.IT cs.AI cs.LG math.IT 版本更新 88%

On Solomonoff Induction in Large Language Models and the Limits of Self-Improving: The Singularity Is Not Near Without Symbolic Model Synthesis

在大型语言模型中自我改进的极限:没有符号模型合成,奇点并不临近

Hector Zenil

机构 * Algorithmic Dynamics Lab(算法动力实验室) Department of Biomedical Computing(生物医学计算系) School of Biomedical Engineering and Imaging Sciences(生物医学工程与成像科学学院) King’s Institute for AI(国王人工智能研究所) King’s College London(伦敦国王学院) Oxford Immune Algorithmics(牛津免疫算法公司) Oxford University Innovation(牛津大学创新中心) London Institute for Healthcare Engineering(伦敦医疗工程研究所)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究指出大型语言模型在缺乏外部信号时自我改进会退化,提出神经符号整合方法以突破这一限制。

Comments 31 pages. Update: DPI and Levin's non-growth is not violated explanation when it comes to finite learners

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25633 2026-07-29 cs.CL cs.AI 新提交 88%

Construction-Driven Injection: Linguistically-Grounded Edit-Based Code-Mixing Fingerprints for Large Language Models

构造驱动注入:用于大语言模型的基于语言基础编辑的代码混合指纹

Yongyi Cui, Yue Li, Tianbao Jiang, Xin Yi

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究针对大语言模型易被滥用问题,提出统一指纹框架。通过LCF按规则构造代码混合指纹,再用LCFEdit结合多语言表示和跨语言对齐注入指纹,实现构造感知注入,确保更新稳定,能持续验证所有权且对模型效用影响小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24586 2026-07-28 cs.CL cs.AI 新提交 88%

D-Score: A Spectral Hidden-State Signal for Hallucination Detection in Large Language Models

D分数:一种用于大语言模型中幻觉检测的谱隐藏状态信号

Bianca Raimondi, Davide Evangelista, Maurizio Gabbrielli, Elena Loli Piccolomini

机构 * Department of Computer Science and Engineering, University of Bologna(博洛尼亚大学计算机科学与工程系)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型幻觉检测,提出基于隐藏激活几何结构的D分数,通过单次前向传播计算,用作幻觉分数。经实验验证,该分数是强大的隐藏状态信号,检测时无需外部验证器等,为幻觉检测提供新方法。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23067 2026-07-28 cs.CL cs.AI 新提交 88%

Attention-Guided Layer Selection for Contrastive Decoding in Large Language Models

大语言模型中用于对比解码的注意力引导层选择

Yusuke Sakai, Natthawut Kertkeidkachorn, Kiyoaki Shirai

机构 * Japan Advanced Institute of Science and Technology(日本先进科学技术学院)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型中对比解码的层选择问题,提出Attention-JSD等三种基于注意力引导的策略,实验表明这些策略在TruthfulQA上优于原始DoLa,在多答案指标上有显著提升,凸显注意力分布在解决事实性知识上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05969 2026-07-21 cs.CL cs.AI 版本更新 88%

Probing the Difficulty Perception Mechanism of Large Language Models

探究大语言模型的难度感知机制

Sunbowen Lee, Qingyu Yin, Chak Tou Leong, Jialiang Zhang, Yicheng Gong, Shiwen Ni, Min Yang, Xiaoyu Shen

机构 * Institute of Digital Twin, EIT(数字孪生研究所,EIT) Wuhan University of Science and Technology(武汉科技大学) Zhejiang University(浙江大学) Hong Kong Polytechnic University(香港理工大学) Shenzhen Institutes of Advanced Technology, CAS(深圳先进技术研究院,中国科学院)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型内部评估问题难度的能力,通过线性探测和定位特定注意力头实现难度感知建模,经消融实验验证,为用LLMs作自动难度注释器提供支持,揭示token级差异,表明难度感知有结构组织,提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13237 2026-07-20 cs.AI cs.CL 88%

NL2LOGIC: AST-Guided Translation of Natural Language into First-Order Logic with Large Language Models

NL2LOGIC: 基于抽象语法树的自然语言到一阶逻辑翻译框架

Rizky Ramadhana Putra, Raihan Sultan Pasha Basuki, Yutong Cheng, Peng Gao

机构 * Virginia Tech(弗吉尼亚理工大学) Universitas Ary Ginanjar(阿里·金纳jar大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 NL2LOGIC通过引入抽象语法树,结合递归大语言模型和生成器,实现了高准确性的自然语言到一阶逻辑转换,提升了逻辑求解的准确性和可执行性。

Comments Accepted to Findings of EACL 2026. 17 pages, 6 figures

Journal ref 2026.findings-eacl.317

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32032 2026-07-01 cs.CL cs.AI 新提交 88%

Reinforcement Learning with Metacognitive Feedback Elicits Faithful Uncertainty Expression in LLMs

基于元认知反馈的强化学习引发LLM忠实的不确定性表达

Gabrielle Kaili-May Liu, Avi Caciularu, Gal Yona, Idan Szpektor, Arman Cohan

机构 * Yale University(耶鲁大学) Google Research(谷歌研究院)

专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 提出强化学习与元认知反馈(RLMF)和元认知数据选择方法,通过模型自我判断质量优化偏好学习,实现忠实校准(FC),在保持准确性的同时显著提升LLM不确定性表达的忠实度。

Comments Code: https://github.com/yale-nlp/RLMF

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28358 2026-06-30 cs.IR cs.AI cs.CL 88%

How Do LLMs Cite? A Mechanistic Interpretation of Attribution in Retrieval-Augmented Generation

LLM如何引用?检索增强生成中归因的机制解释

Ian van Dort, Maria Heuss

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过激活修补方法,发现LLM的引用机制并非单一组件,而是由注意力头和MLP层组成的分布式“归因集成”,调控这些组件可修复大部分错误引用。

Comments This preprint has not undergone peer review or any post-submission improvements or corrections. The Version of Record of this contribution is published in Advances in Information Retrieval, ECIR 2026, Lecture Notes in Computer Science, vol. 16485, pp. 458-473, and is available online at https://doi.org/10.1007/978-3-032-21324-2_35

Journal ref Advances in Information Retrieval, ECIR 2026. Lecture Notes in Computer Science, vol. 16485, pp. 458-473. Springer, Cham (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05126 2026-06-23 cs.CL cs.AI 版本更新 88%

Generalization of Fine-Tuned Uncertainty Communication and Metacognition in Large Language Models

微调后大语言模型的不确定性沟通与元认知的泛化

Mark Steyvers, Catarina Belem, Padhraic Smyth

机构 * Department of Cognitive Sciences, University of California, Irvine, United States(认知科学系,加州大学伊文斯顿分校,美国) Department of Computer Science, University of California, Irvine, United States(计算机科学系,加州大学伊文斯顿分校,美国)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究通过监督微调提升大语言模型不确定性沟通能力,发现领域内校准和判别改善,但任务间迁移有限,多任务训练可促进泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07531 2026-06-09 cs.CL cs.AI 新提交 88%

mllm-shap: A Shapley Value Explainability Platform for Text-Audio Multimodal Large Language Models

mllm-shap:面向文本-音频多模态大语言模型的Shapley值可解释性平台

Jakub Muszyński, Paweł Pozorski, Maria Ganzha

机构 * Warsaw University of Technology(华沙理工大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出mllm-shap框架,通过模态感知掩码、多轮对话追踪和音素对齐分组技术,将Shapley值可解释性扩展到文本-音频多模态大语言模型,并实现10-50倍的计算加速。

Comments Submitted to ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19101 2026-06-04 cs.CL cs.AI 88%

Value Entanglement: Conflation Between Different Kinds of Good In (Some) Large Language Models

价值纠缠:大型语言模型中不同种类好的混淆

Seong Hah Cho, Junyi Li, Anna Leshinskaya

机构 * Independent Department of Cognitive Sciences, UC Irvine(独立认知科学系,加州大学 Irvine 分校)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 通过探测模型行为、嵌入和残差流激活,发现大型语言模型普遍存在价值纠缠,即道德、语法和经济三种价值被混淆,其中语法和经济价值过度受道德价值影响,通过选择性消融与道德相关的激活向量可修复此问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04638 2026-06-02 cs.CL cs.AI 88%

Gradients with Respect to Semantics Preserving Embeddings Tell the Uncertainty of Large Language Models

相对于语义保持嵌入的梯度揭示大语言模型的不确定性

Mingda Li, Rundong Lv, Xinyu Li, Weinan Zhang, Ting Liu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 知识编辑与模型理解 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出首个基于梯度的自由文本生成不确定性量化方法SemGrad,通过语义空间中的梯度计算实现高效且无需采样的不确定性估计。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24319 2026-06-01 cs.CL cs.AI 88%

Dual Mechanisms of Value Expression: Intrinsic vs. Prompted Values in Large Language Models

价值表达的双重机制:大型语言模型中的内在价值与提示价值

Jongwook Han, Jongwon Lim, Injin Kong, Yohan Jo

机构 * Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过价值向量和价值神经元分析,揭示大型语言模型中内在价值表达与提示价值表达在机制上部分共享核心组件,但各自拥有独特功能,内在机制促进多样性,提示机制增强指令遵从。

Comments Accepted at ICML 2026. Project page: https://holi-lab.github.io/ValueMechanism/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29826 2026-05-29 cs.CL cs.AI 88%

Towards Localized and Disentangled Knowledge Editing for Multimodal Large Language Models

面向多模态大语言模型的局部化与解耦知识编辑

Leijiang Gu, Zhen Zeng, Feng Li, Xinjian Gao, Zenglin Shi

机构 * Hefei University of Technology(合肥工业大学) Tongji University(同济大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对多模态知识编辑中因果错位和特征纠缠问题,提出LDKE框架,通过快速定位关键层和解耦分类器实现精准泛化编辑并保持高局部性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28828 2026-05-29 cs.CL cs.AI 88%

Micro-Macro Retrieval: Reducing Long-Form Hallucination in Large Language Models

微宏检索:减少大语言模型中的长文本幻觉

Yujie Feng, Jian Li, Zhihan Zhou, Pengfei Xu, Yujia Zhang, Xiaoyu Li, Xiaohui Zhou, Alan Zhao, Xi Chen, Xiao-Ming Wu

机构 * Solar System of OVB, Tencent, China(OVB太阳系,腾讯,中国) The Hong Kong Polytechnic University, Hong Kong S.A.R.(香港理工大学,香港特别行政区) Jilin University, China(吉林大学,中国)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出微宏检索(M2R)框架,通过宏观检索外部粗粒度证据和微观检索推理中关键信息库,解决长文本生成中关键信息与输出距离过远导致的幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28740 2026-05-28 cs.CL cs.AI 88%

Reverse Probing: Supervised Token-level Uncertainty Quantification for Large Language Models in Clinical Text

反向探测:临床文本中大语言模型的监督式词级不确定性量化

Bushi Xiao, Sarvesh Soni, Daisy Zhe Wang

机构 * University of Florida(佛罗里达大学) U.S. National Library of Medicine(美国国家医学图书馆)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出反向探测框架,利用预标注摘要从模型内部激活中提取词级不确定性信号,在临床文本中实现高效、可解释的不确定性量化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26670 2026-05-27 cs.CL cs.AI 88%

The Labyrinth and the Thread: Rethinking Regularizations in Sequential Knowledge Editing for Large Language Models

迷宫与线索:重新思考大语言模型顺序知识编辑中的正则化方法

Zheng Wang, Kaixuan Zhang, Wanfang Chen, Jingwen Zhang, Xiaonan Lu

机构 * Bosch Center for Artificial Intelligence (BCAI)(博世人工智能中心(BCAI)) Bosch (China) Investment Ltd.(博世(中国)投资有限公司) School of Statistics, East China Normal University(东华大学统计学院)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过优化分析证明顺序编辑与一次性编辑的等价性,揭示稳定性源于累积编辑约束而非专门正则化,从而简化大语言模型知识编辑流程。

Comments Accepted for publication at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13919 2026-05-15 cs.CL cs.LG 88%

Merging Methods for Multilingual Knowledge Editing for Large Language Models: An Empirical Odyssey

多语言知识编辑中合并方法的融合:一项实证探索

Kunil Lee, Ki-Young Shin, Jong-Hyeok Lee, Young-Joo Suh

机构 * Department of Computer Science and Engineering, POSTECH(POSTECH计算机科学与工程系) Designovel Co., Ltd.(Designovel公司) LLSOLLU Graduate School of Artificial Intelligence, POSTECH(POSTECH人工智能研究生院)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文探讨了多语言知识编辑中向量合并方法的有效性,分析了TSVM在减少多语言干扰方面的表现,并发现权重缩放因子和秩压缩比对性能有显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27167 2026-05-01 cs.GT cs.AI cs.LG 88%

What Suppresses Nash Equilibrium Play in Large Language Models? Mechanistic Evidence and Causal Control

在大型语言模型中什么抑制了纳什均衡行为?机制证据和因果控制

Paraskevas V. Lekeas, Giorgos Stamatopoulos

机构 * DreamWorks Animation(梦工厂动画) University of Crete(希腊克里特大学)

专题命中 知识编辑与模型理解 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 研究通过实验揭示大型语言模型在战略决策中抑制纳什均衡的行为机制,发现模型在早期层面对对手历史编码精确,但纳什行动编码较弱,且通过后期层的亲社会覆盖抑制纳什行为。

Comments 11 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16430 2026-04-21 cs.CL cs.AI 88%

HalluSAE: Detecting Hallucinations in Large Language Models via Sparse Auto-Encoders

HalluSAE:通过稀疏自编码器检测大型语言模型中的幻觉

Boshui Chen, Zhaoxin Fan, Ke Wang, Zhiying Leng, Faguo Wu, Hongwei Zheng, Yifan Sun, Wenjun Wu

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, School of Artificial Intelligence, Beihang University(北京未来区块链与隐私计算先进研究院,北京航空航天大学人工智能学院) State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) Beijing Academy of Blockchain and Edge Computing(北京区块链与边缘计算研究院) Renmin University of China(中国人民大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 HalluSAE通过稀疏自编码器和几何势能度量定位潜在相变区域,利用对比logit归因识别幻觉相关稀疏特征,通过线性探针检测因果幻觉,实验表明其在Gemma-2-9B上达到最先进的幻觉检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15741 2026-04-20 cs.CL cs.AI 88%

Learning Uncertainty from Sequential Internal Dispersion in Large Language Models

从大型语言模型中的序列内部分散性中学习不确定性

Ponhvoan Srey, Xiaobao Wu, Cong-Duy Nguyen, Anh Tuan Luu

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) Centre for AI Research, VinUniversity(Vin大学人工智能研究中心)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出SIVR框架,通过利用隐藏状态中的token和层级特征,以更基本的假设来估计不确定性,从而提高hallucination检测的准确性和泛化能力。

Comments Accepted at ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10874 2026-04-14 cs.CL cs.AI 88%

AOP-Smart: A RAG-Enhanced Large Language Model Framework for Adverse Outcome Pathway Analysis

AOP-Smart:一种增强检索的大型语言模型框架用于不良后果路径分析

Qinjiang Niu, Lu Yan

机构 * Nanyang Normal University(南阳师范学院)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出AOP-Smart框架,通过检索增强生成技术提升大型语言模型在不良后果路径分析中的可靠性与准确性,实验表明其显著缓解了模型幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07382 2026-04-14 cs.LG cs.AI 88%

Latent Structure of Affective Representations in Large Language Models

大型语言模型中情感表征的潜在结构

Benjamin J. Choi, Melanie Weber

机构 * Harvard University(哈佛大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究大型语言模型中情感表征的潜在几何结构,发现其与心理学中的valence-arousal模型一致,并展示了其在不确定性量化中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08284 2026-04-10 cs.CL cs.AI 88%

Distributed Multi-Layer Editing for Rule-Level Knowledge in Large Language Models

分布式多层编辑用于大语言模型中的规则级知识

Yating Wang, Wenting Zhao, Yaqi Zhao, Yongshun Gong, Yilong Yin, Haoliang Sun

机构 * School of Software, Shandong University(山东大学软件学院) Salesforce AI Research

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究针对规则级知识的编辑问题,提出分布式多层编辑方法,通过多层干预提升规则理解和实例可迁移性。

Comments 17 pages,3 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏