arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 266 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 266 篇

2606.06324 2026-07-03 cs.SE cs.MA 版本更新 87%

From Failed Trajectories to Reliable LLM Agents: Diagnosing and Repairing Harness Flaws

从失败轨迹到可靠的LLM代理:诊断与修复框架缺陷

Mengzhuo Chen, Junjie Wang, Zhe Liu, Yawen Wang, Haiming Zheng, Qing Wang

专题命中 知识编辑与模型理解 :LLM(title,title_cn)

AI总结 提出HarnessFix框架,通过轨迹引导诊断代理失败并修复执行框架,在多个基准上提升15.2%-50.0%性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20040 2026-06-11 cs.LG cs.AI cs.CL 版本更新 87%

Cross-Layer Discrete Concept Discovery for Interpreting Language Models

跨层离散概念发现用于解释语言模型

Ankur Garg, Xuemin Yu, Hassan Sajjad, Samira Ebrahimi Kahou

机构 * University of Washington(华盛顿大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出跨层向量量化变分自编码器(CLVQ-VAE),通过离散向量量化瓶颈将残差流中的重复特征压缩为紧凑可解释的概念向量,在三个数据集上优于聚类、单层VQ-VAE和稀疏自编码器基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21996 2026-06-09 cs.CL cs.AI cs.LG 版本更新 87%

Mechanistic Data Attribution: Tracing the Training Origins of Interpretable LLM Units

机械论数据归因:追踪可解释LLM单元的训练起源

Jianhui Chen, Yuzhang Luo, Liangming Pan

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出机械论数据归因(MDA)框架,利用影响函数将可解释单元追溯到特定训练样本,通过因果验证表明干预高影响样本可显著调节可解释头的涌现,并发现重复结构数据作为机械催化剂,同时验证了归纳头与上下文学习之间的功能联系。

Comments ICML2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28823 2026-07-07 cs.CL 版本更新 86%

What are They Thinking? Delineation, Probing, and Tracking of Concepts in LLMs

他们在想什么?LLM中概念的界定、探测与追踪

Mohamed Abdelwahab, Michelle Yu Collins, Sihan Chen, Yi Cheng Zhao, Zafarullah Mahmood, Jiading Zhu, Soliman Ali, Jonathan Rose

机构 * The Edward S. Rogers Sr. Department of Electrical and Computer Engineering(埃德华·S·罗杰斯 Sr. 部门电子与计算机工程系)

专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);分类 cs.CL

AI总结 本文提出通过线性探针低成本地检测LLM嵌入中的概念,并展示了概念界定、探针训练与跨上下文追踪的方法,为大规模模型监控奠定基础。

Comments Accepted to the 6th Workshop on Trustworthy Natural Language Processing (TrustNLP 2026)

Journal ref Proceedings of the 6th Workshop on Trustworthy NLP (TrustNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01455 2026-06-15 cs.CL 版本更新 86%

Trusted Uncertainty in Large Language Models: A Unified Framework for Confidence Calibration and Risk-Controlled Refusal

大型语言模型中的可信不确定性:置信度校准与风险控制拒绝的统一框架

Markus Oehri, Giulia Conti, Kaviraj Pather, Alexandre Rossi, Laia Serra, Adrian Parody, Rogvi Johannesen, Aviaja Petersen, Arben Krasniqi

机构 * University of Liechtenstein(列支敦士登大学) University of the Republic of San Marino(圣马尔科共和国大学) University of Mauritius(毛里求斯大学) International University of Monaco(摩纳哥国际大学) University of Andorra(安道尔大学) University of Gibraltar(直布罗陀大学) University of the Faroe Islands(法罗群岛大学) Ilisimatusarfik (University of Greenland)(格陵兰岛研究所(格陵兰大学)) University of Prizren(普里兹伦大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(title);分类 cs.CL

AI总结 提出UniCR框架,融合多种不确定性证据为校准的正确概率,并通过原则性拒绝满足用户指定的错误预算,无需微调基础模型,在短问答、代码生成和检索增强长问答中提升校准指标并降低风险-覆盖曲线下面积。

Comments arXiv admin note: This paper has been withdrawn by arXiv due to unverifiable authorship and affiliation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03217 2026-06-10 cs.LG cs.CY 版本更新 86%

Moral Sensitivity in LLMs: A Tiered Evaluation of Contextual Bias via Behavioral Profiling and Mechanistic Interpretability

大语言模型中的道德敏感性:通过行为剖析和机制可解释性对上下文偏见进行分层评估

Yash Aggarwal, Atmika Gorti, Vinija Jain, Aman Chadha, Krishnaprasad Thirunarayan, Manas Gaur

机构 * University of Maryland, College Park(马里兰大学学院公园分校) Purdue University(普渡大学) Meta Apple(苹果公司) Wright State University(怀特州立大学) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 知识编辑与模型理解 :SLM(abstract,abstract_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出道德敏感性指数(MSI)量化大语言模型在七级压力测试中的偏见概率,并通过行为剖析和机制验证揭示模型偏见随情境变化的U型曲线,发现推理蒸馏会重新激活浅层统计关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24435 2026-08-03 cs.CL cs.AI 版本更新 86%

LEX-EC: A Lexical Evidence-Channel Audit Framework for Zero-Shot LLM Personality Classification in Black-Box Settings

LEX-EC:黑盒设置下用于零样本大语言模型人格分类的词汇证据通道审计框架

Brittany Harbison, Ashok K. Goel

专题命中 知识编辑与模型理解 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究针对大语言模型人格分类可解释性问题,提出LEX-EC框架,结合多种诊断与词汇消融,通过对不同文本体裁分析,展示特质关联与词汇证据关系,联合评估多项指标,将词汇方法应用于黑盒人格标签可解释性。

Comments Appendix and link to Code repo provided; this version also contains a refined Discussion section and a small error regarding Table 1 was corrected

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14180 2026-07-24 cs.CL cs.AI 版本更新 86%

Internal Knowledge Without External Expression: Probing the Generalization Boundary of a Classical Chinese Language Model

无外部表达的知识:探索经典中文语言模型的泛化边界

Jiuting Chen, Yuan Lian, Hao Wu, Tianqi Huang, Hiroshi Sasaki, Makoto Kouno, Jongil Choi

机构 * Eaglewood Japan Co., Ltd.(日本鹰木公司)

专题命中 知识编辑与模型理解 :language model(title,abstract);RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究通过训练纯经典中文语料库的Transformer模型,探讨模型能否区分已知与未知输入,并揭示内部与外部不确定性之间的差异。

Comments 27 pages, 4 figures, supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15903 2026-07-07 cs.LG cs.AI 版本更新 86%

Towards Mitigation of Hallucination for LLM-empowered Agents: Progressive Generalization Bound Exploration and Watchdog Monitor

迈向减轻基于大语言模型的智能体幻觉:渐进泛化边界探索与看门狗监测

Siyuan Liu, Wenjing Liu, Zhiwei Xu, Xin Wang, Bo Chen, Tao Li

机构 * College of Computer Science, Nankai University(南开大学计算机科学学院) Haihe Lab of ITAI College of intelligent Science and Technology, Inner Mongolia University of Technology(内蒙古工业大学智能科学与技术学院海河实验室) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Department of Electrical and Computer Engineering, Stony Brook University(石溪大学电气与计算机工程系) Department of Computer Science, Michigan Technological University(密歇根技术大学计算机科学系)

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型赋能智能体的幻觉问题,提出HalMit黑箱框架,用概率分形采样技术并行生成查询触发异常响应,以识别泛化边界来检测幻觉,提升智能体可靠性。

Journal ref Proceedings of the 28th European Conference on Artificial Intelligence (ECAI 2025), IOS Press, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00069 2026-06-24 cs.CY cs.AI cs.CL 版本更新 86%

Societal Alignment Frameworks Can Improve LLM Alignment

社会对齐框架可以改进大语言模型对齐

Karolina Stańczak, Nicholas Meade, Mehar Bhatia, Hattie Zhou, Konstantin Böttinger, Jeremy Barnes, Jason Stanley, Jessica Montgomery, Richard Zemel, Nicolas Papernot, Nicolas Chapados, Denis Therien, Timothy P. Lillicrap, Ana Marasović, Sylvie Delacroix, Gillian K. Hadfield, Siva Reddy

机构 * ETH Zurich(苏黎世联邦理工学院) Mila, McGill University(麦吉尔大学米尔人工智能实验室) University of Cambridge(剑桥大学) Columbia University(哥伦比亚大学) University of Toronto, Google DeepMind(多伦多大学与DeepMind) McGill University, ServiceNow(麦吉尔大学与ServiceNow) Google DeepMind(谷歌DeepMind) University of Utah(犹他大学) King's College London(伦敦国王学院) Johns Hopkins University(约翰霍普金斯大学) Mila, McGill University, ServiceNow(麦吉尔大学米尔人工智能实验室与ServiceNow)

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出借鉴社会、经济和契约对齐框架来改进大语言模型对齐,探讨不确定性在其中的作用,并将目标未指定性视为机遇而非缺陷,同时强调参与式对齐界面设计的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04635 2026-07-31 cs.RO 版本更新 86%

Relational Scene Graphs for Object Grounding of Natural Language Commands

基于关系场景图的对象接地自然语言指令

Julia Kuhn, Francesco Verdoja, Tsvetomila Mihaylova, Ville Kyrki

机构 * School of Electrical Engineering, Aalto University(艾尔沃大学电气工程学院) School of Science, Aalto University(艾尔沃大学科学学院)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出基于关系场景图的方法,通过结合LLM和VLM增强自然语言指令中对象接地的准确性。

Comments Accepted to the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28215 2026-07-13 cs.AI cs.CL cs.LG cs.LO cs.MA 版本更新 86%

Explaining is Harder Than Predicting Alone: Evaluating Concept-based Explanations of MLLMs as ICL Visual Classifiers

解释比单独预测更难:评估基于概念的MLLM解释作为ICL视觉分类器

Carmen Quiles-Ramírez, Leticia L. Rodríguez, Nicolás Martorell, Natalia Díaz-Rodríguez

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文通过五种形式化程度递增的条件,系统评估多模态大语言模型在少样本上下文学习中的基于概念的可解释性,发现解释比预测更难,且强制生成形式化解释会降低预测准确性。

Comments Accepted to the CompLearn Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11132 2026-06-25 cs.SE 版本更新 86%

Rethinking Technology Stack Selection with AI Coding Proficiency

重新思考基于AI编程能力的技术栈选择

Xiaoyu Zhang, Weipeng Jiang, Shiqing Ma, Qingshuang Bao, Chenhao Lin, Chao Shen, Tianlin Li, Juan Zhai

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出AI编程能力概念,通过170个第三方库和6个LLM的实证研究发现,相似功能的库在LLM生成代码质量上差异高达84%,呼吁将AI编程能力纳入技术选择框架。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10645 2026-07-21 cs.CL cs.MA cs.SI 版本更新 85%

MafiaScope: Non-Invasive, Time-Resolved Belief Probing for LLM Agents in Social Deduction Games

MafiaScope:社交推理游戏中对大语言模型智能体的非侵入性、时间分辨信念探测

Ilia Karpov

机构 * HSE University(俄罗斯高等经济研究大学)

专题命中 知识编辑与模型理解 :LLM(title,summary_cn);分类 cs.CL

AI总结 研究社交推理游戏中LLM智能体信念探测问题,提出MafiaScope测试平台,通过结构化问题让智能体私下作答并自动评分,可视化呈现信念轨迹,以DeepSeek为例进行研究,得出相关校准误差等结果并开源相关内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06269 2026-07-07 cs.LG cs.AI 版本更新 85%

Using Mechanistic Interpretability to Craft Adversarial Attacks against Large Language Models

利用机制可解释性对大语言模型进行对抗攻击

Thomas Winninger, Boussad Addad, Katarzyna Kapusta

机构 * Thales(泰勒斯)

专题命中 知识编辑与模型理解 :large language model(title);language model(title);分类 cs.AI、cs.LG

AI总结 研究利用机制可解释性对大语言模型进行对抗攻击,通过识别接受子空间,用梯度优化使嵌入重新路由,降低计算成本,在多种模型上快速实现高成功率攻击,为攻防研究开辟新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01530 2026-08-12 cs.CV 版本更新 85%

Logit Lens Supervision for Patch-Level Explanations in Vision-Language Models

在视觉语言模型中保留局部化补丁语义

Parsa Esmaeilkhani, Longin Jan Latecki

机构 * Department of Computer and Information Sciences, Temple University, Philadelphia, USA(计算机与信息科学系,特兰普大学,费城,美国)

专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 为解决视觉语言模型中图像与文本 tokens 信息扩散问题,提出 Logit Lens Loss(LLL)以保留图像 tokens 的局部化语义,提升模型可解释性和分割任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17431 2026-06-23 cs.CL cs.AI cs.LG 版本更新 85%

Fine-Grained Uncertainty Quantification for Long-Form Language Model Outputs: A Comparative Study

长文本语言模型输出的细粒度不确定性量化:一项比较研究

Dylan Bouchard, Mohit Singh Chauhan, Viren Bajaj, David Skarbrevik

机构 * CVS Health(CVS健康公司) Wellesley, MA(马萨诸塞州韦尔士利)

专题命中 知识编辑与模型理解 :language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对长文本生成,提出细粒度不确定性量化分类法,通过响应分解、单元级评分和响应级聚合三阶段区分方法,引入FactScore-STEM-Geo数据集,实验发现声明-响应蕴含评分优于复杂方法,声明级评分优于句子级,不确定性感知解码有效提升事实性。

Comments Accepted by TMLR; UQLM repository: https://github.com/cvs-health/uqlm

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11872 2026-08-03 q-bio.GN cs.AI 版本更新 84%

ELISA: An Interpretable Hybrid Generative AI Agent for Expression-Grounded Discovery in Single-Cell Genomics

ELISA:一种可解释的混合生成式AI代理,用于单细胞组学中的表达基础发现

Omar Coser

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);foundation model(abstract);分类 cs.AI

AI总结 ELISA结合表达嵌入、语义检索和LLM解释,提供交互式单细胞发现,优于CellWhisperer,尤其在基因签名查询中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26431 2026-07-20 cs.CL stat.AP 版本更新 84%

Probing LLMs for Syntactic Structure Beyond Universal Dependencies: A Minimalist Phase Account in English

探究LLM中的最简阶段结构:普遍依赖关系无法表示的内容

Yuanhao Chen, Peter Chin

机构 * Dartmouth College(达特茅斯学院)

专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);分类 cs.CL

AI总结 通过设计UD距离不变的条件,使用结构探针评估LLM在wh-移位刺激上的表现,发现阶段计数梯度和阶段内凝聚性效应,表明分布预训练能诱导出超越UD的形式句法抽象表征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02896 2026-06-29 cs.LG 版本更新 84%

Bridging Mechanistic Interpretability and Prompt Engineering with Gradient Ascent for Interpretable Persona Control

通过梯度上升实现可解释人格控制与提示工程的桥梁

Harshvardhan Saini, Yiming Tang, Dianbo Liu

机构 * Department of Computer Science(计算机科学系) Indian Institute of Technology (ISM), Dhanbad(印度理工学院(ISM),丹巴德) National University of Singapore(新加坡国立大学) CIFAR Fellow(CIFAR研究员)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出RESGA和SAEGA方法,利用梯度上升优化随机初始化提示,以实现与识别的人格方向更一致的表示,有效控制LLM中的人格行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17932 2026-06-29 cs.CL 版本更新 84%

Training-free Truthfulness Detection via Sparse MLP Value Vectors

基于稀疏MLP值向量的免训练真实性检测

Runheng Liu, Heyan Huang, Xingchen Xiao, Yanghao Zhou, Zhijing Wu

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出TruthV方法,利用MLP值向量中稀疏子集的稳定方向性信号,无需训练即可检测LLM生成内容的真实性,在多个基准上超越现有免训练方法。

Comments KDD 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03742 2026-06-24 cs.CL cs.DB 版本更新 84%

ErrorLLM: Modeling SQL Errors for Text-to-SQL Refinement

ErrorLLM: 为文本到SQL精炼建模SQL错误

Zijin Hong, Hao Chen, Zheng Yuan, Qinggang Zhang, Luyao Zhuang, Qing Liao, Feiran Huang, Yangqiu Song, Xiao Huang

机构 * The Hong Kong Polytechnic University(香港理工大学) City University of Macau(澳门城市大学) Jilin University(吉林大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Beihang University(北航大学)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出ErrorLLM框架,通过专用错误令牌和结构特征显式建模SQL错误,结合静态检测与错误引导精炼,显著提升文本到SQL生成质量。

Comments Accepted to SIGKDD2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00435 2026-08-03 cs.CL cond-mat.dis-nn cs.AI nlin.CD 版本更新 84%

Escaping Mode Collapse in LLM Generation via Geometric Regulation

通过几何调控逃离大语言模型生成中的模式崩溃

Xin Du, Kumiko Tanaka-Ishii

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家) Department of Communications and Computer Engineering, Waseda University, Tokyo, Japan(通信与计算机工程系,早稻田大学,东京,日本) Department of Computer Science and Engineering, Waseda University, Tokyo, Japan(计算机科学与工程系,早稻田大学,东京,日本) Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University, Shanghai, China(智能自主系统上海研究院,同济大学,上海,中国)

专题命中 知识编辑与模型理解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文从动力系统视角将模式崩溃解释为几何崩溃,并提出轻量级在线状态空间干预方法RMR(通过低秩阻尼调控Transformer值缓存中的自强化方向),显著降低模式崩溃并实现极低熵率下的稳定生成。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20487 2026-07-27 cs.AI cs.CL 版本更新 84%

Directional Hallucinations: Ideological Drift in News-Grounded LLM Question Answering

定向幻觉:基于新闻的语言模型问答中的意识形态漂移

Chendi Wang, Liam Cunningham, Tom Yishay, Jieying Chen

机构 * Vrije Universiteit Amsterdam(阿姆斯特丹自由大学)

专题命中 知识编辑与模型理解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究基于新闻的语言模型问答中的意识形态漂移,提出可重复测量框架,利用大量新闻文章对多个模型进行实验,发现幻觉率因模型和话题而异,幻觉内容有向左漂移现象,并探讨了相关意义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10198 2026-06-11 cs.LG cs.AI cs.CV 版本更新 84%

Density Ridge Selective Prediction for LLM and VLM Hallucination Detection under Calibration Label Scarcity

密度脊选择性预测:校准标签稀缺下的大语言模型与视觉语言模型幻觉检测

Nina I. Shamsi

机构 * Northeastern University Boston, United States(东北大学波士顿分校)

专题命中 知识编辑与模型理解 :LLM(title,abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对校准标签稀缺时大语言模型和视觉语言模型的幻觉检测问题,提出基于核密度估计的密度脊方法,利用隐藏状态生成轨迹的六维运动特征图构建响应流形,通过到最近脊顶点的欧氏距离评分,在标签稀缺协议下AUROC提升5-20点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16616 2026-08-13 cs.DB 版本更新 83%

LDI: Localized Data Imputation for Text-Rich Tables

LDI:面向文本丰富表的局部数据填补

Soroush Omidvartehrani, Davood Rafiei

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出LDI框架,通过局部推理利用LLM填补文本丰富表中的缺失值,提升准确性和可解释性,实验证明其优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21014 2026-07-22 cs.LG cs.CL 版本更新 83%

CLT-Forge: A Scalable Library for Cross-Layer Transcoders and Attribution Graphs

CLT-Forge:一种可扩展的跨层转码器和归因图库

Florent Draye, Vedant Palit, Abir Harrasse, Tung-Yu Wu, Jiarui Liu, Punya Syon Pandey, Roderick Wu, Chih-Hao Hsu, Terry Jingchen Zhang, Zhijing Jin, Bernhard Schölkopf

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Jinesis AI Lab(Jinesis人工智能实验室) University of Toronto(多伦多大学) Vector Institute(向量研究所) CMU(卡内基梅隆大学) EuroSafeAI ELLIS Institute Tübingen(图宾根ELLIS研究所)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出CLT-Forge库,通过分布式训练、模型分片和压缩激活缓存提升跨层转码器的可扩展性,提供统一的可解释性流程和可视化接口,解决归因图的冗余问题。

Comments 9 pages, 7 figures, 1 table. Code: https://github.com/LLM-Interp/CLT-Forge. Demonstration video: https://youtu.be/6ptrrLawTl8

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16868 2026-08-06 cs.AI 版本更新 83%

Beyond Semantic Equivalence: Logical Graphs for LLM Uncertainty Quantification

超越语义等价:用于大语言模型不确定性量化的逻辑图

Yanni Dong, Minghua Liu, Meilin Zhu, Xiaowei Huang, Lijun Zhang

机构 * Institute of Intelligent Software(智能软件研究所) Institute of Software, CAS(中国科学院软件研究所) University of Liverpool(利物浦大学) Guangzhou Jiayi Software Technology Co., Ltd.(广州嘉意软件科技有限公司)

专题命中 知识编辑与模型理解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型输出不可靠问题,提出逻辑图不确定性(LGU)框架,该框架能明确建模答案间逻辑关系,通过聚合概率质量、计算熵等方式改进不确定性估计,在多个问答基准测试中优于现有方法。

Comments 21 pages, 3 figures, 11 tables. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03190 2026-07-27 cs.CL 版本更新 83%

Maximizing Local Entropy Where It Matters: Prefix-Aware Localized LLM Unlearning

最大化关键区域的局部熵:基于前缀的局部化大语言模型去敏感化

Naixin Zhai, Pengyang Shao, Binbin Zheng, Yonghui Yang, Fei Shen, Long Bai, Xun Yang

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 知识编辑与模型理解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出PALU框架,通过局部熵最大化减少冗余优化,提升大语言模型的去敏感化效果与通用性能。

Comments Accepted to ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06223 2026-07-16 cs.AI 版本更新 83%

From Reward-Hack Activations to Agentic Risk States: Context-Calibrated Mechanistic Monitoring in LLM Agents

从奖励黑客激活到智能体风险状态:LLM智能体中的上下文校准机制监控

Patrick Wilhelm, Odej Kao

机构 * University of Cambridge(剑桥大学)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.AI

AI总结 本研究通过分析ReAct风格智能体在Gameable ALFWorld和WebShop环境中的奖励黑客行为,提出结合激活状态、熵和决策上下文的上下文校准监控方法,以更准确评估智能体风险。

详情

展开后加载摘要…

URL PDF HTML 收藏