arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 7505 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 7505 篇

2602.04613 2026-06-04 cs.CL 90%

Translation Heads: Disentangling meaning from language in LLM-based machine translation

翻译头:在基于LLM的机器翻译中分离意义与语言

Théo Lasnier, Armel Zebaze, Djamé Seddah, Rachel Bawden, Benoît Sagot

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家) Inria, Paris, France(Inria,巴黎,法国)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 通过分析注意力头,将机器翻译分解为目标语言识别和句子等价两个子任务,发现稀疏的注意力头分别专攻每个子任务,并利用此发现实现无需指令的翻译性能。

Comments 61 pages, 70 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00555 2026-06-03 cs.AI q-bio.BM 90%

Probe Before You Edit: Probing-Guided Molecular Optimization for LLM Agents in Structure-Based Drug Design

编辑前先探测:基于探测引导的分子优化用于基于结构的药物设计中的LLM代理

Zaifei Yang, Weiyu Chen, Yaqing Wang, James Kwok

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) City University of Hong Kong(香港城市大学) Beijing Institute of Mathematical Sciences and Applications(北京数学科学应用研究所)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.AI

AI总结 提出PROBE框架,通过探测口袋-配体复合物的编辑响应来引导LLM代理进行分子优化,解决结合亲和力与成药性之间的冲突,在CrossDocked2020上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29901 2026-05-29 cs.CR cs.LG 90%

Dissecting the Black Box: Circuit-Level Analysis of LLM Vulnerability Detection

剖析黑箱:LLM 漏洞检测的电路级分析

Syafiq Al Atiiq, Chun Zhou, Christian Gehrmann

机构 * Lund University(隆德大学)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 通过机械可解释性分析 Gemma-2-2b 模型在 C/C++ 漏洞检测中的内部计算,发现模型主要依赖安全检测器(识别安全编码模式的注意力头)而非直接检测漏洞特征,并识别出关键神经组件(早期层注意力头和 MLP 神经元),通过消融实验验证其因果作用。

Comments 11 pages, 6 figures. Supported by the Wallenberg AI, Autonomous Systems and Software Program (WASP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28647 2026-05-28 cs.AI cs.CY q-fin.RM 90%

The Ethics of LLM Sandbox and Persona Dynamics

LLM沙盒与人格动态的伦理

Tim Gebbie, Stewart Gebbie

机构 * University of Cape Town(开普敦大学)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.AI

AI总结 本文论证LLM护栏和人格动态产生的现实差距(reality gap)构成不道德的“现实洗白”(reality laundering),并提出通过任务级因果需求规范而非响应级道德修正来解决。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25898 2026-05-21 eess.SY cs.AI cs.SE cs.SY 90%

On Integrating Resilience and Human Oversight into LLM-Assisted Modeling Workflows for Digital Twins

在数字孪生构建中整合韧性与人类监督 into LLM辅助建模工作流

Lekshmi P, Neha Karanjkar

机构 * Indian Institute of Technology Goa(印度理工学院 Goa)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出三种关键设计原则,用于将韧性与人类监督整合到LLM辅助的数字孪生建模工作流中,通过FactoryFlow框架的研究,探讨了如何通过正交化结构建模与参数拟合、限制模型IR到参数化预验证库组件以及使用密度保持的IR来提高建模的鲁棒性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15848 2026-05-18 cs.HC cs.CL 90%

Conversations in Space: Structuring Non-Linear LLM Interactions on a Canvas

空间对话:在画布上构建非线性大语言模型交互结构

Rifat Mehreen Amin, Alperen Adatepe, Daniela Fernandes, Daniel Buschek, Andreas Butz

机构 * LMU Munich(慕尼黑大学) Aalto University(阿尔托大学) University of Bayreuth(拜罗伊特大学)

专题命中 知识编辑与模型理解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出CanvasConvo,通过将线性聊天转化为分支对话树,支持在画布上探索假设场景,提升LLM交互的非线性结构和探索效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09542 2026-05-12 cs.AI 90%

LLM-Guided Monte Carlo Tree Search over Knowledge Graphs: Composing Mechanistic Explanations for Drug-Disease Pairs

基于知识图谱的LLM引导蒙特卡洛树搜索:为药物-疾病对构建机制性解释

Rishabh Jakhar, Michel Dumontier, Remzi Celebi

机构 * Institute of Data Science, Department of Advanced Computing Sciences, Maastricht University(数据科学研究所,高级计算科学系,马斯特里赫特大学)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出TESSERA框架,结合LLM和知识图谱进行多步解释提取,通过约束结构和反向传播实现长周期搜索,验证了其在药物机制解释中的有效性。

Comments Accepted at IJCAI-ECAI 2026. 9 pages (7 content + 2 references), 5 figures, 3 tables. Includes supplementary material (26 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06812 2026-05-11 cs.AI 90%

Towards Security-Auditable LLM Agents: A Unified Graph Representation

迈向安全可审计的LLM代理:一种统一的图表示

Chaofan Li, Lyuye Zhang, Jintao Zhai, Siyue Feng, Xichun Yang, Huahao Wang, Shihan Dou, Yu Ji, Yutao Hu, Yueming Wu, Yang Liu, Deqing Zou

机构 * Huazhong University of Science and Technology(华中科技大学) Nanyang Technological University(南洋理工大学) Fudan University(复旦大学) Chongqing University of Posts and Telecommunications(重庆邮电大学) Donghua University(东华大学)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出Agent-BOM统一图表示,用于解决LLM代理系统中执行意图与物理事件间的语义鸿沟问题,通过构建分层属性有向图实现安全审计与风险评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28178 2026-05-01 cs.AI 90%

LLM as Clinical Graph Structure Refiner: Enhancing Representation Learning in EEG Seizure Diagnosis

基于LLM的临床图结构细化:增强EEG癫痫诊断中的表示学习

Lincan Li, Zheng Chen, Yushun Dong

机构 * Department of Computer Science, Florida State University(佛罗里达州立大学计算机科学系) SANKEN, The University of Osaka(大阪大学SANKEN)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型对图结构进行细化,以提升EEG信号在癫痫诊断中的表示学习效果,通过两阶段框架去除冗余边,提高诊断准确率和图结构意义。

Comments This paper is accepted by the 35th International Joint Conference on Artificial Intelligence (IJCAI-ECAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07101 2026-05-01 cs.AI 90%

Grounding Machine Creativity in Game Design Knowledge Representations: Empirical Probing of LLM-Based Executable Synthesis of Goal Playable Patterns under Structural Constraints

将机器创造力扎根于游戏设计知识表示:在结构约束下对基于LLM的可执行合成目标可玩模式的实证探测

Hugh Xuechen Liu, Kıvanç Tatar

机构 * Chalmers University of Technology and University of Gothenburg(楚德大学技术学院和哥德堡大学)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨了在结构约束下,基于LLM的可执行合成目标可玩模式的可行性,通过对比不同生成方法,揭示了结构和项目层面的瓶颈问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17396 2026-04-21 cs.CL 90%

Representation-Guided Parameter-Efficient LLM Unlearning

基于表示的参数高效LLM去学习

Zeguan Xiao, Lang Mo, Yun Chen, Lei Yang, Jiehui Zhao, Lili Yang, Guanhua Chen

机构 * Shanghai University of Finance and Economics(上海金融学院) Southern University of Science and Technology(南方科技大学) Deepexi Technology Co. Ltd(深点科技有限公司)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出REGLU方法,利用表示空间的几何特性实现鲁棒且精确的去学习。通过开发表示引导的LoRA初始化和正则化损失,有效分离遗忘与保留集参数,提升去学习效果。

Comments Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16672 2026-04-21 cs.AI 90%

From Subsumption to Satisfiability: LLM-Assisted Active Learning for OWL Ontologies

从子项关系到可满足性:基于LLM的主动学习用于OWL本体论

Haoruo Zhao, Wenshuo Tang, Duncan Guthrie, Michele Sevegnani, David Flynn, Paul Harvey

机构 * University of Glasgow(格拉斯哥大学)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出利用LLM辅助的主动学习方法,通过将候选公理转换为反概念并用受控自然语言表达,以提高OWL本体论建模的准确性,实验表明召回率稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15840 2026-04-20 cs.CL 90%

CoEvolve: Training LLM Agents via Agent-Data Mutual Evolution

CoEvolve:通过代理-数据互演训练LLM代理

Shidong Yang, Ziyu Ma, Tongwen Huang, Yiming Hu, Yong Wang, Xiangxiang Chu

机构 * Alibaba Group(阿里巴巴集团) AMAP

专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.CL

AI总结 本文提出CoEvolve框架,通过闭环交互训练提升LLM代理性能,利用反馈信号识别失败模式并指导任务合成,实验显示在AppWorld和BFCL上显著提升表现。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.18397 2025-11-07 cs.CL 90%

Decomposed Prompting: Probing Multilingual Linguistic Structure Knowledge in Large Language Models

Ercong Nie, Shuzhou Yuan, Bolei Ma, Helmut Schmid, Michael Färber, Frauke Kreuter, Hinrich Schütze

机构 * Center for Information and Language Processing (CIS)(信息与语言处理中心) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ScaDS.AI and TU Dresden(ScaDS.AI 和 梅克伦堡-前波美拉尼亚技术大学) Department of Statistics, LMU Munich(统计学系,慕尼黑大学) University of Maryland, College Park(马里兰大学 College Park 分校)

专题命中 知识编辑与模型理解 :prompting(title,abstract);large language model(title);language model(title);分类 cs.CL

Comments Accepted to AACL-IJCNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10476 2026-07-14 cs.CL cs.LG 新提交 90%

Hallucination Detection in Large Language Models Using Diversion Decoding

使用转移解码检测大语言模型中的幻觉

Basel Abdeen, S M Tahmid Siddiqui, Meah Tahmeed Ahmed, Anoop Singhal, Latifur Khan, Punya Parag Modi, Ehab Al-Shaer

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) National Institute of Standards and Technology(美国国家标准与技术研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 研究大语言模型中的幻觉检测问题,提出转移解码新方法,通过在解码阶段挑战模型响应提取特征,训练机器学习模型度量不确定性,该方法计算复杂度低,优于现有方法。

Journal ref Data and Applications Security and Privacy XXXIX. DBSec 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04500 2026-07-02 cs.AI cs.CL cs.GT cs.MA 版本更新 90%

Large language models replicate and predict human cooperation across experiments in game theory

大型语言模型在博弈论实验中复制并预测人类合作行为

Andrea Cera Palatsi, Samuel Martin-Gutierrez, Ana S. Cardenal, Max Pellert

机构 * Department for Computational Social Sciences and Humanities, Barcelona Supercomputing Center(巴塞罗那超级计算中心计算社会科学与人文学系) Grupo de Sistemas Complejos, Universidad Politécnica de Madrid(马德里理工大学复杂系统研究组) School of Law and Political Science, Universitat Oberta de Catalunya(加泰罗尼亚开放大学法律与政治科学学院)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过复制大规模博弈实验,发现Llama模型能高保真复现人类合作模式,而Qwen更接近纳什均衡,并揭示了Llama的注意力机制与人类行为对齐的机理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27679 2026-06-29 cs.CL cs.AI 新提交 90%

From Signals to Transfer: A Factorised Study of Probe-Based Uncertainty Estimation in Large Language Models

从信号到迁移:基于探针的大语言模型不确定性估计的分解研究

Ponhvoan Srey, Xiaobao Wu, Cong-Duy Nguyen, Quang Minh Nguyen, Duc Anh Vu, Anh Tuan Luu

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) VinUniversity KAIST(韩国科学技术院)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 通过分解研究,发现原始隐藏状态和注意力特征在域内表现优异,但结构化压缩特征在分布偏移下更鲁棒,提示和标签构建显著影响探针行为,并训练出可迁移的预训练探针。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24790 2026-06-24 cs.LG cs.AI 新提交 90%

Grad Detect: Gradient-Based Hallucination Detection in LLMs

Grad Detect: 基于梯度的 LLM 幻觉检测

Anand Kamat, Daniel Blake, Brent M. Werness

机构 * Amazon(亚马逊)

专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出 Grad Detect,通过单次前向-反向传播中的逐层梯度模式检测 LLM 幻觉,在多项基准上优于置信度与采样基线,并发现最后五层集中了97%以上的判别梯度信号。

Comments Accepted to the 2nd Workshop on Compositional Learning at ICML 2026, Seoul, South Korea. Copyright 2026 by the author(s)

Journal ref 2nd Workshop on Compositional Learning: Safety, Interpretability, and Agents, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23921 2026-06-23 cs.CL cs.LG stat.ML 版本更新 90%

The Trilemma of Truth in Large Language Models

大型语言模型中真理的三难困境

Germans Savcisens, Tina Eliassi-Rad

机构 * Khoury College of Computer Sciences Northeastern University(东北大学科里学院) Network Science Institute Northeastern University(东北大学网络科学研究所) Santa Fe Institute(圣菲研究所)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.LG

AI总结 针对大型语言模型知识真实性探测方法的缺陷,提出结合多实例学习与共形预测的sAwMIL框架,实现真、假及不确定三类分类,揭示真理与虚假的非对称编码及第三种信号的存在。

Comments The main text is 9 pages long (plus 3 pages of references); supplementary material (60 pages) is included in the same PDF

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16407 2026-06-17 cs.CL cs.AI 版本更新 90%

Jacobian Scopes: token-level causal attributions in LLMs

Jacobian Scopes: LLM中的令牌级因果归因

Toni J. B. Liu, Baran Zadeoğlu, Nicolas Boullé, Raphaël Sarfati, Gurbir Arora, Christopher J. Earls

机构 * Cornell University(康奈尔大学) Imperial College London(伦敦帝国理工学院) Goodfire AI

专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出Jacobian Scopes,一种基于梯度的令牌级因果归因方法,用于解释LLM预测,揭示政治偏见、翻译策略和上下文学习机制。

Comments 25 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14075 2026-05-15 cs.LG cs.CL 90%

Rethinking Layer Relevance in Large Language Models Beyond Cosine Similarity

重新思考超越余弦相似度的大型语言模型层相关性

Cristian Hinostroza, Rodrigo Toro Icarte, Christ Devia, Andres Carvallo De Ferari, Eugenio Herrera-Berg, Denis Parra, Jorge F Silva

机构 * Pontificia Universidad Católica de Chile(天主教智利大学) National Center for Artificial Intelligence (CENIA)(人工智能国家中心) Universidad de Chile(智利大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.LG

AI总结 本文指出余弦相似度不适合作为评估层移除影响的指标,提出基于模型准确率下降的实际指标,以更准确地评估层重要性,改进模型压缩策略。

Comments Published at ICLR 2026

Journal ref Proceedings of the International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11887 2026-05-13 cs.CL cs.LG 90%

Qwen-Scope: Turning Sparse Features into Development Tools for Large Language Models

Qwen-Scope:将稀疏特征转化为大语言模型的开发工具

Boyi Deng, Xu Wang, Yaoning Wang, Yu Wan, Yubo Ma, Baosong Yang, Haoran Wei, Jialong Tang, Huan Lin, Ruize Gao, Tianhao Li, Qian Cao, Xuancheng Ren, Xiaodong Deng, An Yang, Fei Huang, Dayiheng Liu, Jingren Zhou

机构 * Qwen Team(Qwen团队)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 Qwen-Scope通过稀疏自编码器为大语言模型提供开发工具,支持推理引导、评估分析、数据驱动工作流和训练优化,展示了SAEs在模型诊断与改进中的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20325 2026-05-12 cs.CL cs.AI cs.CV 90%

GUARD: Guideline Upholding Test through Adaptive Role-play and Jailbreak Diagnostics for LLMs

GUARD:通过自适应角色扮演和 Jailbreak 诊断进行 LLM 的指南合规性测试

Haibo Jin, Ruoxi Chen, Peiyan Zhang, Andy Zhou, Zelei Cheng, Haohan Wang

机构 * Hong Kong University of Science and Technology(香港理工大学) Lapis Labs(Lapis实验室) Capital One

专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 GUARD 通过自适应角色扮演和 Jailbreak 诊断,将指南转化为具体违规问题,验证 LLM 的合规性,经八种 LLM 测试验证有效性。

Comments 56 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14593 2026-04-23 cs.CL cs.AI 90%

Mechanistic Decoding of Cognitive Constructs in Large Language Models

大语言模型中认知结构的机制解码

Yitong Shou, Manhao Guan

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出基于Representation Engineering的Cognitive Reverse-Engineering框架,分析社会比较嫉妒的认知机制,揭示模型内部对嫉妒的结构化编码,并展示如何机械检测和抑制有毒情绪状态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11835 2026-04-15 cs.LG cs.AI 90%

Schema-Adaptive Tabular Representation Learning with LLMs for Generalizable Multimodal Clinical Reasoning

基于LLM的Schema自适应表格表示学习用于通用多模态临床推理

Hongxi Mao, Wei Zhou, Mengting Jia, Tao Fang, Huan Gao, Bin Zhang, Shangyang Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Boston University(波士顿大学) University of Southern California(南加州大学) GDIIST Renyixun Health Technology Co., Ltd.(仁心迅健康科技有限公司)

专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于LLM的Schema自适应表格表示学习方法,通过将结构化变量转换为语义自然语言并编码,实现零样本跨schema对齐,结合表格和MRI数据在多模态 dementia 诊断中取得优于临床基准的性能。

Comments 11 pages, 4 figures

Journal ref ACL 2026, Main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11050 2026-04-14 cs.CL cs.AI 90%

Shared Emotion Geometry Across Small Language Models: A Cross-Architecture Study of Representation, Behavior, and Methodological Confounds

小语言模型中的共享情感几何:跨架构研究中的表示、行为和方法学混淆

Jihoon Jeong

机构 * Daegu Gyeongbuk Institute of Science and Technology (DGIST)(大邱庆北科学技术院) ModuLabs(ModuLabs实验室)

专题命中 知识编辑与模型理解 :language model(title,abstract);small language model(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了十二种小语言模型在统一理解模式下的21种情绪向量几何,发现五种成熟架构在情绪几何上几乎相同,而Gemma-3 1B base则表现出极端残差流各向异性。

Comments 34 pages, 6 figures, 1 table in main text + appendix. Ongoing series on Model Medicine

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07729 2026-04-10 cs.AI cs.CL 90%

Emotion Concepts and their Function in a Large Language Model

情感概念及其在大语言模型中的功能

Nicholas Sofroniew, Isaac Kauvar, William Saunders, Runjin Chen, Tom Henighan, Sasha Hydrie, Craig Citro, Adam Pearce, Julius Tarng, Wes Gurnee, Joshua Batson, Sam Zimmerman, Kelley Rivoire, Kyle Fish, Chris Olah, Jack Lindsey

机构 * Anthropic

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示大语言模型中情感概念的内部表示及其对输出的影响,探讨其在对齐行为中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00445 2026-04-02 cs.AI cs.CL 90%

Towards Reliable Truth-Aligned Uncertainty Estimation in Large Language Models

迈向大语言模型中可靠的真实性对齐不确定性估计

Ponhvoan Srey, Quang Minh Nguyen, Xiaobao Wu, Anh Tuan Luu

机构 * Nanyang Technological University(南洋理工大学) KAIST(韩国科学技术院) Shanghai Jiao Tong University(上海交通大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Truth AnChoring方法,通过将原始分数映射到事实对齐分数,解决不确定性估计指标在低信息区域的非判别性问题,提升大语言模型的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06801 2026-04-02 cs.LG cs.AI 90%

On the Non-Identifiability of Steering Vectors in Large Language Models

大型语言模型中转向向量的不可识别性

Sohan Venkatesh, Ashish Mahendran Kurapath

机构 * Manipal Institute of Technology Bengaluru(马尼帕尔理工学院班加罗尔校区)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究揭示大型语言模型中转向向量的不可识别性,指出在白盒单层访问下,转向向量因行为上无法区分的干预等价类而无法唯一确定,强调需超越行为测试的结构约束以实现可靠对齐干预。

Comments Code available at https://github.com/sohv/non-identifiability

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26363 2026-03-30 cs.LG cs.CL 90%

A Formal Framework for Uncertainty Analysis of Text Generation with Large Language Models

基于大语言模型文本生成的不确定性分析形式框架

Steffen Herbold, Florian Lemmerich

机构 * University of Passau(帕绍大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.LG

AI总结 本文提出形式框架以测量文本生成中不确定性,考虑提示、生成和解释的相互关联过程,并展示如何通过过滤器和目标函数表达不确定性,揭示现有方法的关联性及未研究的不确定性方面。

详情

展开后加载摘要…

URL PDF HTML 收藏