Deal, or no deal (or who knows)? Forecasting Uncertainty in Conversations using Large Language Models
专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI、cs.LG
Comments 2 Figures; 7 Tables; 27 pages
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI、cs.LG
Comments 2 Figures; 7 Tables; 27 pages
专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI、cs.LG
专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI、cs.LG
专题命中 知识编辑与模型理解 :language model(title,abstract);prompting(title,abstract)
熟能生险:自我改进的大语言模型智能体中的技能误演化
机构 * Adelaide University(阿德莱德大学) ; City University of Hong Kong(香港城市大学)
专题命中 知识编辑与模型理解 :LLM(title,summary_cn);分类 cs.AI
AI总结 该研究针对自我改进LLM智能体的技能误演化问题,构建SkillMisevo-Gym与SkillMisevo-Bench基准,提出SafeEvolve方法,可显著降低不安全检索与新会话危害,同时对良性效用影响极小。
感知耳语的大语言模型:用于鲁棒耳语语音识别的自监督不确定性学习
机构 * Qwen Business Unit of Alibaba(阿里巴巴通义千问业务部)
专题命中 知识编辑与模型理解 :LLM(title,summary_cn);分类 cs.AI
AI总结 本文提出Whisper-Aware LLM框架,通过自监督学习量化声学信号缺陷并结合置信融合解码机制,在AISHELL6-Whisper数据集上将耳语语音识别的CER相对降低17%,幻觉率降至4.5%,达到最优性能。
基于概率偏好基的不确定性感知变分奖励分解用于大语言模型个性化
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Korea University(高丽大学)
专题命中 知识编辑与模型理解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文提出变分奖励分解框架,通过概率偏好基和变分分布实现用户偏好建模,提升LLM个性化效果。
Comments COLM'26
解读巴西央行货币政策委员会(Copom)的语气:用于判断鹰派-鸽派情绪、前瞻性指引及不确定性的加权大语言模型(LLM)框架
专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.AI
AI总结 本研究提出一种加权大语言模型框架,用于分析巴西央行Copom声明的鹰派-鸽派情绪、前瞻性指引及不确定性,通过实证样本验证了方法的有效性,核心贡献为构建了可分离语气与政策指引的可审计系统。
Comments 12 pages, 8 tables, 5 figures
面向异质处理效应估计的不确定性引导大语言模型语义增强
机构 * Beihang University(北京航空航天大学) ; School of Economics and Management, Tsinghua University(清华大学经济管理学院)
专题命中 知识编辑与模型理解 :LLM(title,summary_cn);分类 cs.LG
AI总结 本研究针对异质处理效应估计的局部不稳定性,提出CURL方法,通过LLM生成分离的分配与异质性导向表示,在四个基准上提升了10种主学习者的性能。
Comments 17 pages, 12 figures, 5 tables
TRE:用于扩散语言模型的无训练幻觉检测
机构 * University of Bern(伯尔尼大学) ; Nanyang Technological University(南洋理工大学) ; Griffith University(格里菲斯大学)
专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.AI
AI总结 针对扩散语言模型的幻觉问题,现有方法有局限。本文提出无训练的TRE指标,通过在模型解码过程中沿时空维度提取熵信号来估计幻觉风险,经实验验证其性能有竞争力,具有泛化性、效率和鲁棒性等优点。
Comments 25 pages
熵哨兵:基于STEM解码熵迹的连续LLM准确性监控
机构 * Departamento de Matematica, FCEyN Universidad de Buenos Aires(数学系,布宜诺斯艾利斯大学) ; ELIAS Lab, Departamento de Ingeniería Universidad de San Andres(ELIAS实验室,圣安德烈斯大学)
专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.CL
AI总结 提出利用输出熵迹作为推理时信号,通过轻量分类器预测实例正确性并聚合为领域级准确性估计,在STEM推理基准上验证了其用于监控和数据采集的有效性。
用于可信大语言模型推理的概率概念感知引导
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究针对大语言模型推理中现有引导向量方法的问题,提出概率概念感知引导框架,通过概念驱动检索和概率校准,在保留模型能力的同时实现可控、安全的语义偏差引导。
通过内部归因图对大语言模型越狱进行机制性可解释性研究
机构 * Department of Computer Science, University of South Dakota(南达科他大学计算机科学系) ; School of Information and Artificial Intelligence, Yangzhou University(扬州大学信息与人工智能学院)
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究大语言模型越狱漏洞,通过构建内部计算图揭示对抗攻击引发的内部推理转变,提出统一框架实现因果诊断,实验证明计算图偏差与不安全行为相关,干预可提升模型鲁棒性。
探究语言模型的错误对齐思维过程
机构 * University of Oxford(牛津大学)
专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.AI
AI总结 提出通过线性探针检测模型内部激活中的18种错误对齐指标,以可靠识别策略欺骗等行为,在分布外基准上达到0.935 AUROC。
LLM智能体社会中的涌现关系秩序:从集体情感到权威分层
机构 * Renmin University of China(中国人民大学) ; Beihang University(北京航空航天大学) ; Minzu University of China(民族大学)
专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.AI
AI总结 基于情感控制理论、社会认同理论和涂尔干集体情感,提出CAREB-MAS多智能体框架,通过长期模拟自发再现差序格局的五种核心现象,支持将差序格局解释为社会机制的结构敏感性涌现结果。
Comments Accepted to Findings of the Association for Computational Linguistics: ACL 2026. 37 pages
主观图LLM智能体用于模拟课堂社会感知中的不确定性
机构 * Complex Lab, School of Computer Science and Engineering(复杂实验室,计算机科学与工程学院) ; University of Electronic Science and Technology of China(电子科学与技术大学) ; Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) ; School of Health and Medical Technology, Chengdu Neusoft University(成都新软大学健康与医疗技术学院)
专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.AI
AI总结 提出基于主观图和可信度通信的多智能体框架,模拟课堂中学术地位的持久扭曲,在12个班级482名学生数据上验证,排名误差从0.066增至0.124。
对比差异CKA揭示跨语言模型架构的概念特定结构对齐
机构 * Alibaba Cloud(阿里云)
专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);language model(title);分类 cs.CL
AI总结 提出对比差异CKA(CKA_Delta)方法,发现不同LLM架构在概念表示上存在几何收敛与功能可迁移性分离的现象,能有效区分概念特定相似性与通用相似性。
当图标记沉没:图语言模型的机制分析
机构 * University of Virginia(弗吉尼亚大学) ; Capital One
专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.LG
AI总结 本文通过分析图语言模型中图标记的内部行为,发现激活层面的显著性与图信息利用之间存在解耦,揭示了现有图标记构建、放置和对齐机制的局限性。
AdaptiveK:基于复杂度的稀疏自编码器用于可解释的语言模型表示
机构 * Zhejiang University(浙江大学) ; University of Illinois Chicago(伊利诺伊大学香槟分校) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.LG
AI总结 提出 AdaptiveK SAE,根据输入语义复杂度动态调整稀疏度,利用线性探针引导特征分配,在重构保真度、解释方差、余弦相似度和可解释性指标上优于固定稀疏度方法。
Comments Accepted by ACL 2026
解码前拒绝:检测和利用中间LLM激活中的拒绝信号
机构 * University of Padua(帕多瓦大学) ; Örebro University(欧雷布罗大学) ; Fondazione Bruno Kessler(布鲁诺·凯索基金会)
专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.AI
AI总结 本文通过线性探针在变压器块的残差流激活中检测拒绝行为,并提出Mechanistic AutoDAN方法,利用探针引导的遗传搜索实现高效攻击,显著降低搜索时间并保持攻击成功率。
无控制的表征:测试语言模型中的实现效应
机构 * Columbia University(哥伦比亚大学)
专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.AI
AI总结 通过提示行为、线性读出和因果控制三个层面,测试语言模型是否表现出类似人类的实现效应,发现潜在读出成功但因果控制无效,表明三者不自动共存。
任务感知提升大语言模型生成与不确定性
机构 * School of Computation, Information \& Technology, Technical University of Munich ; Munich Data Science Institute ; Munich Center for Machine Learning
专题命中 知识编辑与模型理解 :LLM(title,summary_cn);分类 cs.LG
AI总结 提出在任务依赖的潜在结构中直接建模LLM输出,通过贝叶斯最优响应合成和贝叶斯风险量化不确定性,优于标准解码方法并改善与输出质量的校准。
DECOR:通过信息操纵理论审计大语言模型的欺骗行为
机构 * Department of Computer Sciences, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系) ; Amazon(亚马逊)
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文提出DECOR框架,基于信息操纵理论,通过细粒度审计实现对大语言模型欺骗行为的有效检测,展示了其在单轮和多轮欺骗检测中的优越性能。
基于大语言模型的代码生成的不确定性量化
机构 * State Key Lab of Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) ; ETH Zürich(苏黎世联邦理工学院) ; Birkbeck, University of London(伦敦大学伯克贝克学院)
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出RisCoSet方法,通过多重假设检验构建风险控制的预测集,用于大语言模型代码生成任务,有效减少代码移除并提升准确性。
BoolXLLM: 基于大语言模型的布尔模型可解释性
机构 * AI Center of Excellence, Fidelity Investments(富达投资人工智能卓越中心) ; Department of Computer Science, Brown University(布朗大学计算机科学系)
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出BoolXLLM框架,结合大语言模型提升布尔模型的可解释性,通过特征选择、阈值推荐和规则压缩三个阶段增强解释性,实现理论与人类可理解的结合。
基于大语言模型的6G智能协商:解决不确定性忽视和尾事件风险
机构 * i2CAT Foundation(i2CAT基金会) ; Technical University of Catalonia(技术大学巴塞罗那) ; University of Oulu(奥卢大学) ; Research Institute for Digital Future(数字未来研究院) ; Khalifa University(卡利法大学) ; ISI/ATH and University of Patras(ISI/ATH和帕特拉斯大学)
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出一个无偏、风险意识的智能协商框架,通过数字孪生和极值理论中的条件风险价值(CVaR)预测尾部风险,提升6G网络切片的资源分配鲁棒性,验证了无偏方法在消除SLA违规和降低延迟方面的有效性。
潜在对抗检测:适应性探测LLM激活以多轮攻击检测
机构 * Mountain View, CA(山景城,加利福尼亚州)
专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.AI
AI总结 本文通过分析LLM激活层的轨迹特征,提出对抗性不稳定性概念,提升多轮攻击检测精度,验证了模型家族间的信号一致性及数据分布对泛化能力的影响。
基于大语言模型系统的不确定性传播
机构 * Responsible AI Research (RAIR) Centre(责任人工智能研究 (RAIR) 中心) ; Adelaide University(阿德莱德大学) ; CSIRO(澳大利亚联邦科学与工业研究组织) ; UNSW Sydney Australia(新南威尔士大学悉尼分校)
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文研究了大语言模型系统中不确定性传播问题,提出系统层面的分析框架,梳理了内在模型、系统级和社会技术层面的传播机制,并识别了五个开放性研究挑战。
Comments WIP under review
大语言模型函数调用的不确定性量化
机构 * University of Oxford(牛津大学) ; Apple(苹果公司)
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文研究了大语言模型函数调用中不确定性量化的关键问题,发现多样本方法在自然语言问答中表现优异,但在函数调用场景中不如单样本方法有效,并提出利用函数调出输出特性改进现有方法。
谁定义了公平性?面向生成模型的基于目标的提示方法用于人口特征表示
机构 * University of California, Santa Cruz(加州大学圣克ruz分校)
专题命中 知识编辑与模型理解 :prompting(title);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 本文提出一种轻量级框架,在推理阶段通过提示级干预减轻生成模型中的代表性偏见,允许用户选择多种公平性定义,通过审计目标符合度和肤色分布来评估公平性。