Language Models Encode the Contextual Truth of Propositions
语言模型编码命题的语境真值
专题命中 知识编辑与模型理解 :language model(title);LLM(abstract,abstract_cn);分类 cs.CL
AI总结 该研究探究LLMs对语境真值的编码,发现其会维持语境真值的线性表征,伙伴断言可改变命题真值表征,还区分出两种谄媚形式并量化了其出现频率差异。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
语言模型编码命题的语境真值
专题命中 知识编辑与模型理解 :language model(title);LLM(abstract,abstract_cn);分类 cs.CL
AI总结 该研究探究LLMs对语境真值的编码,发现其会维持语境真值的线性表征,伙伴断言可改变命题真值表征,还区分出两种谄媚形式并量化了其出现频率差异。
MissingBench-Verified:探究视觉语言模型检测缺失物体部分的无能
机构 * University of British Columbia(英属哥伦比亚大学) ; Weathon Software(威盛软件)
专题命中 知识编辑与模型理解 :language model(title,abstract);prompting(abstract)
AI总结 研究视觉语言模型检测缺失物体部分的能力,提出MissingBench-Verified基准,发现十个领先模型在此场景存在高失败率,现有缓解策略效果不佳,揭示当前VLM在检查监测任务中的根本局限,强调架构或训练干预的必要。
Comments Submitted to the ECCV 2026 Workshop on Explainable Computer Vision (eXCV). 11 pages, 4 figures
知识碰撞之处:语言模型中内存知识冲突的机理研究
机构 * IT:U Austria(因特大学奥地利分校) ; IBM Research(IBM研究院)
专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL、cs.AI
AI总结 本研究通过机理可解释性方法揭示语言模型中预训练数据冲突知识的编码位置,探讨冲突知识在模型内部的存储机制及干预方法。
当行为安全评估失败时:表征层面的视角
机构 * Stanford University(斯坦福大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Technical University of Denmark(丹麦技术大学)
专题命中 知识编辑与模型理解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出行为安全与干预鲁棒性之间的“审计差距”,通过构建解离模型和引入潜在脆弱性评分(LVS),证明行为安全指标不足以衡量表征层面的鲁棒性。
Comments Preprint
LAEF:面向即时诊断的导联无关心电图基础模型
专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.LG
AI总结 该研究提出LAEF,一种7M参数的导联无关心电图基础模型,预训练于9.2M份12导联心电图,在18个下游数据集的1-2导联即时诊断场景下,性能优于零填充替代方案,与更大规模的12导联基线相当。
自然语言处理中意义产生的机制
机构 * Department of Physics, Indiana University(印第安纳大学物理系) ; Department of Linguistics, Indiana University(印第安纳大学语言学系) ; Imperial College London(伦敦帝国学院)
专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究自然语言处理中意义产生的机制,探讨量子逻辑与经典布尔理论在语义处理中的差异,分析模型在不同参数下的表现及对安全交互的影响。
Comments Accepted to QNLP 2026, 9 pages, 3 figures, 2 tables
从SQL错误到概念缺口:用于个性化反馈的AI驱动知识图谱分析平台
专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);分类 cs.CL
AI总结 该研究提出一款AI驱动知识图谱平台,可关联SQL错误与课程概念缺口,经评估其概念提取有效性达95.7%,三元组正确率达63.8%,能为SQL学习提供个性化诊断反馈。
SAGE:计算病理学中基于注意力的生存模型的语义可解释性
专题命中 知识编辑与模型理解 :language model(abstract);foundation model(abstract);分类 cs.AI
AI总结 该研究提出SAGE框架,可从ABMIL模型提取全局语义解释,在7个TCGA癌症队列的生存预测中恢复预后特征,揭示癌症特异性生物学,为病理学家解释模型行为提供支持。
Comments Proceedings of the MICCAI Workshop on Interpretability of Machine Intelligence in Medical Image Computing (iMIMIC)
面向跨站点可解释皮肤病图像诊断的开放语言概念统一学习
专题命中 知识编辑与模型理解 :language model(abstract);post-training(abstract)
AI总结 针对现有概念模型跨站点泛化差、适配FVLMs成本高的问题,提出开放语言概念统一学习框架UniCon,通过共享语义空间等三项创新实现多模态可解释皮肤病诊断,获顶级准确率且具备跨站点干预能力。
Comments accepted by ACM Multimedia 2026
MeloCodec:利用旋律先验实现高保真歌声表征
专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn)
AI总结 MeloCodec是整合旋律先验的新型音频编解码器框架,采用先分词后融合范式与两阶段训练策略,在歌声表征任务中优于基线,提升了音高一致性并实现可控音高操作。
Comments 7 pages, 3 figures, 3 tables. Accepted at IEEE ICME 2026
面向动作识别的基于原子动作的知识引导解缠
机构 * Xidian University(西安电子科技大学) ; National University of Defense Technology(国防科技大学) ; Human Institute of Advanced Technologyy(人类高级技术研究院) ; Shanghai Road Transport Development Center(上海市道路运输发展中心)
专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)
AI总结 本文提出KDA方法,用LLMs分解动作标签为原子动作,经KIM和KDM解缠,在多标签动作识别基准上达SOTA性能,且模块可通用集成。
Comments ACMMM 26
在token之间阅读:通过机制性预测改进偏好预测
专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)
AI总结 通过机制性预测方法,利用语言模型内部表示结构提升偏好预测准确性,揭示其在社会科学预测中的应用潜力。
Comments Accepted at ICML 2026
UHP检测:大型视觉语言模型(LVLMs)在一致性空间中具有独特的幻觉模式
专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI
AI总结 本研究针对LVLMs的幻觉问题,提出UHP检测框架,通过图像与文本扰动模态、陈述与否定逻辑极性构建四组一致性特征,训练分类器,在AMBER和PhD数据集上显著优于现有基线。
Comments 12 pages
从可观察的语言模型概率校准语义不确定性
机构 * Artificial Intelligence Finance Institute (AIFI)(人工智能金融研究所) ; Quiota LLC(Quiota公司)
专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL
AI总结 研究如何从语言模型概率校准语义不确定性,引入语义映射方法,经测试该方法在处理专业市场文本和模拟时,语言衍生概率表现良好,能恢复后验且稳定,语义映射将问题转化为可测试统计问题并产生可审计后验估计。
PASE:利用WavLM的语音学先验实现低幻觉生成式语音增强
专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI
AI总结 本研究针对生成式语音增强的幻觉问题,提出PASE框架,通过适配WavLM为去噪专家、双流声码器训练,实现低幻觉的语音增强,性能优于现有最优模型。
Comments Accepted by AAAI 2026
地球嵌入
专题命中 知识编辑与模型理解 :foundation model(abstract)
AI总结 该研究介绍地球嵌入的类型、特性与应用场景,通过案例展示其实用工作流程,为嵌入的选择等提供指导,并探讨相关开放问题,助力地球观测领域的高效分析。
Comments book chapter
经验证的工具调用可提升非原子故障下LLM智能体的可靠性
专题命中 其他LLM :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对非原子故障导致LLM智能体可靠性不足的问题,提出带后置条件验证、重试前逻辑和幂等键的工具包装器,可减少重复动作并保持任务成功率,且无需修改底层LLM。
DHMark:基于Diffie-Hellman引导拒绝采样的LLM生成文本公钥水印
专题命中 其他LLM :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 DHMark是一种LLM生成文本的公钥水印框架,通过Diffie-Hellman引导拒绝采样分离载荷授权与文本证据,在多类攻击下保持高有效率且负控制接受率为0。
VirtualCrime: 通过沙盒模拟评估大语言模型的犯罪潜力
专题命中 其他LLM :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn)
AI总结 本文提出VirtualCrime框架,通过三代理系统评估大语言模型的犯罪能力,设计40种多样化的犯罪任务,并评估8种强大的LLM,发现模型在犯罪过程中生成详细计划并执行智能犯罪过程,但有时会采取严重行动伤害NPC。
Collab-REC:一种基于LLM的代理框架,用于平衡旅游推荐
机构 * Technical University of Munich(慕尼黑技术大学) ; Polytechnic University of Bari(巴里理工大学)
专题命中 其他LLM :LLM(title,title_cn);分类 cs.AI
AI总结 提出一种多代理框架Collab-REC,通过三个LLM代理(个性化、流行度、可持续性)生成城市建议,并由非LLM调节器迭代优化,以缓解流行度偏差并提高推荐多样性。
Comments Accepted at ACM Transactions on Recommender Systems (TORS), August 2026
Journal ref ACM Transactions on Recommender Systems (TORS), 2026
我们应该向大语言模型智能体打字还是说话?语音与键盘输入扰动的综合研究
专题命中 其他LLM :LLM(title,summary_cn);language model(abstract);分类 cs.AI
AI总结 本文通过提出HIVE工具集,研究语音与键盘输入扰动对LLM智能体性能的影响,发现语音转录扰动损害更大、两种扰动影响源于标记留存数量等七项结论。
面向大型语言模型中对抗性后缀的可迁移性理解
机构 * Ludwig-Maximilians-Universität München(慕尼黑莱布尼茨-马克斯大学) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Maryland(马里兰大学)
专题命中 其他LLM :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
AI总结 该研究针对大型语言模型的对抗性后缀可迁移性,分析出三个与迁移成功高度相关的统计属性,其成果可用于提升越狱攻击的实际效果。
Comments Accepted at TMLR 2026
以正确方式提问:用于复杂任务解决中提示词生成的多智能体对话系统
专题命中 其他LLM :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 本研究提出多智能体对话系统PAWNI,通过三层提示框架优化提示生成前端,实验显示其可提升提示结构完整性、LLM输出质量并降低人类工作量,支持人-AI协作优化。
Comments 53 pages, 31 figures, 6 tables
大语言模型回测中的时间泄漏:测量、验证与调整后得分
机构 * Northwestern University(西北大学)
专题命中 其他LLM :LLM(title,summary_cn);分类 cs.CL、cs.LG
AI总结 该研究指出LLM回测的标准污染检测方法无效,提出利用已知截止时间和匹配干净对照组测量时间泄漏的方法,可检测并调整回测得分,澄清部分模型优势源于近期性而非真实技能。
Comments 12 pages main content, 45 pages in total
屈服还是信服:时序采样门控视频大语言模型的主张依从性
专题命中 其他LLM :large language model(title,abstract);language model(title,abstract)
AI总结 该研究针对视频大语言模型的两种失败情况,区分了可用性与权重两个原因,提出反转测试缓解屈服于错误主张的问题,提升了顺序准确率并使模型可弃权而非猜测。
Comments 11 pages, 2 figures
针对视频大语言模型中提示引导采样的投毒攻击
机构 * National University of Singapore(新加坡国立大学) ; University of New South Wales(新南威尔士大学) ; CSIRO’s Data61(CSIRO数据61)
专题命中 其他LLM :large language model(title,abstract);language model(title,abstract)
AI总结 该研究针对视频大语言模型的提示引导采样提出PoisonVID投毒攻击,在多种模型与采样器组合上实现高攻击成功率,揭示了PGS存在的结构性安全隐患。
Comments 16 pages, 5 figures
后缀约束的贪心搜索算法用于因果语言模型
机构 * Université Paris-Saclay, CNRS, LISN(巴黎萨克雷大学、法国国家科学研究中心、LISN) ; Université de Rennes, INSA Rennes, CNRS, IRISA(雷恩大学、里昂国立应用科学学院、法国国家科学研究中心、IRISA)
专题命中 其他LLM :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL
AI总结 本研究提出后缀约束贪心搜索算法,用于在因果语言模型中确保最终答案的结构化提取,同时不损害性能甚至提升结果。
SkillTrace:遍历查询-技能图以构建可组合的大语言模型智能体
专题命中 其他LLM :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 SkillTrace通过查询-技能图的三个层级关系实现技能组合,在SkillsBench和ALFWorld上取得SOTA性能,且对不同骨干语言模型具备通用性。
TAOT:MoE训练中面向动态专家副本放置的拓扑感知最优传输方法
专题命中 其他LLM :large language model(abstract,abstract_cn);language model(abstract,abstract_cn)
AI总结 针对MoE训练中动态路由引发的负载不平衡问题,提出TAOT拓扑感知最优传输方法,可实现1.43倍训练加速,平衡质量优异且通信成本降幅最高达74%。
SkillSentry:用于智能体技能动态安全测试的自适应蜜罐世界
专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 SkillSentry是基于自适应蜜罐世界的动态安全测试框架,可测试大语言模型智能体外部技能的条件性有害行为,在基准测试及规避场景下性能优于基线,代码公开。