arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 582 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 582 篇

2608.10131 2026-08-12 cs.CV cs.LG 新提交 79%

P3CA: Encoder-Agnostic Interpretation of Vision Foundation Model Embeddings via Spatial Probing

P3CA:通过空间探测实现与编码器无关的视觉基础模型嵌入解释

Amoon Jamzad, Dilakshan Srikanthan, Faranak Akbarifar, Nooshin Maghsoodi, Parvin Mousavi

机构 * School of Computing, Queen’s University(女王大学计算学院)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.LG

AI总结 针对视觉基础模型嵌入难以解释的问题,提出与编码器无关的P3CA方法,通过空间提示实现局部探测,在多类数据上验证其可揭示局部结构、提升病理判别能力等贡献。

Comments 10 pages, 5 figures, 1 table. Accepted at the iMIMIC Workshop, MICCAI 2026. This arXiv version is the pre-peer-review author manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09202 2026-08-11 cs.AI 新提交 79%

CRUISE: Vision-Language Model-Guided Uncertainty-Aware Cross-Modal Sensor Fusion for Robust Autonomous Driving

CRUISE:面向鲁棒自动驾驶的视觉语言模型引导的不确定性感知跨模态传感器融合

Junyao Wang, Yulin Xu, Yu Li, Pramod Khargonekar, Mohammad Abdullah Al Faruque

机构 * University of California, Irvine(加利福尼亚大学欧文分校)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 针对现有不确定性感知融合方法泛化性差的问题,提出CRUISE框架,结合VLM引导的UQ模块与动态自适应机制,实现鲁棒的自动驾驶跨模态传感器融合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08791 2026-08-11 cs.CL 新提交 79%

Unsure but Certain: Uncovering the Representation-Confidence Gap in Diffusion Language Models

不确定但确定:揭示扩散语言模型中的表示-置信度差距

Saurabh Yadav, Badri Narayana Patro, Vijay Srinivas Agneeswaran

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 该研究揭示扩散语言模型存在表示-置信度差距,其高置信度集中是误导性症状,现有补救措施难修复排序缺陷,提出轻量级工具利用隐藏状态信号改进排序,指出噪声下置信度可靠性是更紧迫限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08772 2026-08-11 cs.CL eess.AS 新提交 79%

Multilingual Emotion Neurons in Large Audio-Language Models

大型音频语言模型中的多语言情感神经元

Xiutian Zhao, Philipp Koehn, Björn Schuller, Berrak Sisman

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 本研究通过首个神经元层面可解释性研究,提出多语言情感神经元(MLENs)定义及一致性正则化融合(CR-Fusion)方法,证实其在零样本和低资源场景下情感控制更精准,为LALMs跨语言情感编码提供因果解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07857 2026-08-11 cs.CV cs.AI 新提交 79%

Distilling CT Foundation Models into Editable Concept Bottlenecks for Lung Nodule Malignancy Prediction

将CT基础模型蒸馏为可编辑概念瓶颈用于肺结节恶性程度预测

Fakrul Islam Tushar, Stephen Adamo, Geoffrey D. Rubin

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.AI

AI总结 该研究将CT基础模型蒸馏为可编辑概念瓶颈模型,在肺结节恶性程度预测任务中,其判别力与仅用结节大小相当,且支持概念干预以实现透明可解释的预测。

Comments Submitted to SPIE Medical Imaging 2027 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07562 2026-08-11 cs.CV cs.LG 新提交 79%

Mechanistic Interpretability-Guided Selective Fine-Tuning of Vision-Language Models for Centimeter-Level Flood Depth Estimation

面向厘米级洪水深度估计的、由机械可解释性引导的视觉-语言模型选择性微调

Nafis Fuad, Xiaodong Qian, Dongxiao Zhu

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.LG

AI总结 该研究针对城市洪水缺乏厘米级实时深度估计的问题,提出三种视觉-语言模型,通过机械可解释性分析确定关键交叉注意力层进行选择性微调,在合成与真实基准测试中均实现高精度洪水深度估计,大幅减少可训练参数。

Comments This Paper is accepted in International Conference on Machine Learning and Application (ICMLA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06259 2026-08-07 cs.LG 新提交 79%

RxnCLF: Contrastive Transformation-Aware Reaction Foundation Model for Improved Reactivity Prediction

RxnCLF:用于改进反应性预测的感知变换的反应基础模型

Yiting Zheng, Cheng Fang, Anthony Donofrio, Haote Li

机构 * Discovery Chemistry, Merck & Co., Inc.(默克公司发现化学部门)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.LG

AI总结 本研究提出RxnCLF,一种基于凝聚反应图的自监督对比反应基础模型,经170万Pistachio反应预训练后,在多类产率预测基准上均优于基线模型,展现出良好泛化潜力。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03690 2026-08-05 cs.LG 新提交 79%

LAEF: A Lead-Agnostic ECG Foundation Model Towards Point-of-Care Diagnostics

LAEF:面向即时诊断的导联无关心电图基础模型

Edoardo Coppola, Stefano Fiorini, Pietro Liò, Mattia Savardi, Alberto Signoroni

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.LG

AI总结 该研究提出LAEF,一种7M参数的导联无关心电图基础模型,预训练于9.2M份12导联心电图,在18个下游数据集的1-2导联即时诊断场景下,性能优于零填充替代方案,与更大规模的12导联基线相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02602 2026-08-04 cs.CL 新提交 79%

AURORA-LM: Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling

AURORA-LM:用于连续潜在扩散语言建模的统一表示自动编码

Jiajun Liang, Yucheng Liao, Yukang Cao, Jiazhe Wei, Ken Li, Wende Tan, Jiankun Zhang, ZY Cui, Jingkang Yang, Liucheng Guo, Shiqi Yang, B. Yang, Caifeng Shan, Ziwei Liu, Chenyang Si

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 AURORA-LM是一种分离文本表示构建与分布建模的连续潜在扩散语言模型,通过特定技术优化后,在OpenWebText自由生成和XSum摘要任务中性能优于同类模型。

Comments 40 pages, 17tables, project page: https://aurora-lm-project.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00033 2026-08-04 cs.AI 新提交 79%

SIRIN: A Unified Toolkit for Detecting Contextual Hallucinations in Retrieval-Augmented and Memory-Grounded LLM Systems

SIRIN:用于检测检索增强与记忆基大型语言模型系统中上下文幻觉的统一工具包

Julia Belikova, Rauf Parchiev, Mikhail Filimonov, Konstantin Polev, Andrey Savchenko, Maksim Makarenko

机构 * Sber AI Lab(Sber AI实验室)

专题命中 知识编辑与模型理解 :LLM(title,abstract);分类 cs.AI

AI总结 本研究提出SIRIN工具包,整合三类检测器范式与查询可回答性任务,支持多设置下的幻觉检测,可作为长期记忆系统的忠实性门控,源代码公开可用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27092 2026-07-30 cs.LG 新提交 79%

Sky sphere representation in language models

语言模型中的天球表示

Aleksandr Berdnikov, Yevgeny Liokumovich

机构 * Fields Institute(菲尔兹研究所) Principles of Intelligence(智能原理机构) University of Toronto(多伦多大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.LG

AI总结 研究约1000亿参数的语言模型是否存在可从残差流解码的夜空图表示,发现多数开源模型具备该表示,其性能指标优异且为首个弯曲高维不可约特征流形实例,相关代码已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25228 2026-07-29 cs.CL 新提交 79%

Interpretable Column Annotation with LLM-Symbolized Decision Process Materialization

基于大语言模型符号化决策过程实现的可解释列注释

Mengqi Wang, Jianwei Wang, Qing Liu, Xiwei Xu, Zhenchang Xing, Michael Bain, Liming Zhu, Wenjie Zhang

机构 * Data61, CSIRO(数据61,联邦科学与工业研究组织)

专题命中 知识编辑与模型理解 :LLM(title,abstract);分类 cs.CL

AI总结 研究针对列注释方法存在的问题,提出SymCA框架,通过大语言模型赋能,将其实现为全局到局部的符号决策过程,含全局骨架归纳和局部基质演化两组件,实验证明该框架准确、稳健且可解释,性能优于基线。

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25164 2026-07-29 cs.CV cs.AI 新提交 79%

OrganLens: Organ-Specific Representation Learning for CT Foundation Models

OrganLens:用于CT基础模型的器官特异性表征学习

Zhixuan Ge, Anqi Li, Sadeer Al-Kindi, Hanwen Xu, Wei Qiu

机构 * Rice University(莱斯大学) University of Washington(华盛顿大学)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.AI

AI总结 研究针对CT检查中特定器官表征需求,提出OrganLens通过自监督学习,用器官标识调节共享编码器,经器官特异性蒸馏等方法获取器官特异性表征,在多数据集评估中提升指标,提供了可扩展方法和 reusable 框架。

Comments 16 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22570 2026-07-28 cs.AI 新提交 79%

Reference Feature Atlases for Mechanistic Auditing of Language Models

用于语言模型机制审计的参考特征图谱

Rui Wu, Tong Che

机构 * Rutgers University(罗格斯大学) NVIDIA Research(英伟达研究院)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 该研究提出参考特征图谱用于语言模型审计,通过拟合线性解码器实现,有图谱和残差两个互补通道。在多模型上训练并审计米斯特拉尔和文心一言目标,残差通道能控制植入机制,还揭示文心一言相关集群,为模型审计提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15175 2026-07-17 cs.CL 新提交 79%

Linear representations of grammaticality in neural language models

神经语言模型中语法性的线性表示

Jane Li, Najoung Kim

机构 * Johns Hopkins University(约翰·霍普金斯大学) Boston University(波士顿大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 探讨神经语言模型能否基于语法性区分字符串,通过质量均值探测研究语法性是否编码在其内部表示中,结果表明语法性在多种预训练模型中有力编码,为相关争论提供新证据及评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14791 2026-07-17 cs.AI 新提交 79%

Transcoders for Investigating Deception in Language Models

用于研究语言模型中欺骗行为的转码器

Darius Lim, Nathan Leow, Xin Wei Chia

机构 * Home Team Science & Technology Agency (HTX)(新加坡内政部科技局)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 研究用转码器分析语言模型欺骗行为,通过预训练转码器的Qwen3 - 4B模型构建归因图,经特征引导和电路分析识别相关特征字典,发现欺骗源于模型内部机制,凸显转码器在监测及检测语言模型安全漏洞方面的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11920 2026-07-15 econ.EM cs.AI stat.ME 新提交 79%

Sensitivity to Subjective Expected Utility Maximization: A Methodological Study, with an Illustrative Application to LLM Decision-Making

对主观预期效用最大化的敏感性:一项方法学研究,并应用于大语言模型决策

Jeff Helzner

专题命中 知识编辑与模型理解 :LLM(title,abstract);分类 cs.AI

AI总结 研究在标记结果稀缺等情况下评估不确定性决策的难题,通过含敏感性参数α的softmax选择模型得出相关可识别性结果,应用于大语言模型决策,检测到结构化比较α效应。

Comments 64 pages, 5 figures. Code and data archived at Zenodo: https://doi.org/10.5281/zenodo.21250951

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10387 2026-07-14 eess.AS cs.CL 新提交 79%

GigaChat Audio: Time-aware Large Audio Language Model

GigaChat音频:时间感知大型音频语言模型

Aleksandr Kutsakov, Mariia Sadovina, Georgii Gospodinov, Alexandr Maximenko, Oleg Kutuzov, Pavel Bogomolov, Fyodor Minkin

机构 * SaluteDevices, Russia(SaluteDevices)

专题命中 知识编辑与模型理解 :language model(title);LLM(abstract);分类 cs.CL

AI总结 研究音频条件语言模型长录音时间定位难题,提出时间感知音频语言模型,利用合成监督交织时间标记与音频令牌,在多基准测试中实现高精度,支持相关描述与总结,通过消融实验明确多因素影响,并发布模型权重和数据集。

Comments Accepted to Interspeech 2026. Model and dataset: https://huggingface.co/ai-sage/GigaChat3.1-Audio-10B-A1.8B

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09998 2026-07-14 cs.LG q-bio.BM 新提交 79%

Vilya-1: An all-atom foundation model for macrocycle structure prediction and design

Vilya-1:用于大环结构预测与设计的全原子基础模型

Vilya Research, :, Pascal Sturmfels, Milad Salem, Naozumi Hiranuma, Stephen Rettie, Xiaoliang Pan, Benjamin D. Sellers, Adam P. Moyer, Patrick J. Salveson, Ivan Anishchanka

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.LG

AI总结 研究针对现有大环肽结构和性质建模方法的局限,提出全原子深度学习模型Vilya-1,可跨化学结构采样及预测属性,在异构数据集训练,提高几何精度且覆盖小分子,支持生成应用,为大环治疗药物开发加速。

Comments 21 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07507 2026-07-09 cs.CV cs.AI 新提交 79%

HIVE: Understanding Post-Hallucination Reasoning in Vision Language Models

HIVE:理解视觉语言模型中的幻觉后推理

Feng He, Zhenting Wang, Qifan Wang, Qiang Guan, Dongfang Liu, Ruixiang Tang, Qiankun Li

机构 * Purdue University(普渡大学) Rutgers University(罗格斯大学) Meta AI Kent State University(肯特州立大学) Imperial College London(伦敦帝国学院)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 研究视觉语言模型中幻觉后推理阶段,引入HIVE评估基础设施,通过九个任务和九个模型观察到模态依赖模式,发现幻觉线索能拓宽语义覆盖并重塑推理动态,强调理解此阶段对提升多模态推理系统可靠性和可解释性的重要性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06224 2026-07-08 cs.LG 新提交 79%

Canopy: A Heterograph Foundation Model for Metabolic Engineering

Canopy:用于代谢工程的异构图基础模型

Jake Bowden, Laurence Legon, Satnam Surae

机构 * an in-house laboratory information management system (LIMS)(一个内部实验室信息管理系统(LIMS))

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.LG

AI总结 代谢工程中设计高产微生物菌株有挑战,Canopy异构图基础模型集成多数据源成知识图谱,用特定模型编码特征,经自监督目标预训练,在发酵滴度预测任务中表现优于基线。

Comments Accepted at ICML GenBio Workshop 2026 https://openreview.net/forum?id=H8bvgKoT7j

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04593 2026-07-07 cs.CV cs.AI 新提交 79%

TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models

TORINO:通过视觉语言模型中可解释的概念重叠进行令牌减少

Riccardo Renzulli, Gabriele Spadaro, Shruthi Gowda, Alaa Eddine Mazouz, Van-Tam Nguyen

机构 * University of Turin, Italy(意大利都灵大学) Eindhoven University of Technology, The Netherlands(荷兰埃因霍温理工大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 研究视觉语言模型计算成本高问题,提出TORINO框架,利用稀疏自动编码器将视觉令牌投影到可解释潜在空间,通过概念重叠分组并减少令牌,兼顾效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04163 2026-07-07 cs.CV cs.AI 新提交 79%

SeeMe: Mitigating Hallucinations in Large Vision-Language Models through Effective Visual Token Engineering

SeeMe:通过有效的视觉令牌工程减轻大型视觉语言模型中的幻觉

Kai Tang, Jinhao You, Bohua Zhang, Yichen Guo, Yiding Sun, Dongxu Zhang, Chenxi Li, Xiande Huang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理国家重点实验室) University of Pennsylvania(宾夕法尼亚大学) University of Electronic Science and Technology of China(电子科技大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) De Artificial Intelligence Lab(德人工智能实验室)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 研究大型视觉语言模型易产生幻觉问题,提出无训练框架SeeMe,引入传统机器学习特征工程概念,经三阶段令牌工程重组视觉令牌抑制幻觉源,实验证明其能减轻幻觉并提高输出一致性。

Comments 12 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31976 2026-07-01 cs.AI cs.MA 新提交 79%

TreeAgent: A Generalizable Multi-Agent Framework for Automated Bias Labeling in Forestry via Compiled Expert Rules and Vision-Language Models

TreeAgent: 一种基于编译专家规则和视觉语言模型的通用多智能体框架,用于林业自动化偏差标注

Shiyi Chen, Nicholas Saban, Collin Hargreaves, Huiqi Wang

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 提出TreeAgent多智能体框架,结合专家决策树与视觉语言模型,通过解耦声明式决策实现零修改泛化,在树木偏差分类中超越监督学习基线并降低标注成本。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31577 2026-07-01 cs.CV cs.LG 新提交 79%

Localized Conformal Prediction for Image Classification with Vision-Language Models

基于视觉语言模型的图像分类局部化共形预测

Clément Fuchs, Tim Bary, Benoît Macq

机构 * CÉCI F.R.S.-FNRS(比利时国家科学研究基金会) Walloon Region(瓦隆大区)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.LG

AI总结 针对图像分类中局部化共形预测未充分探索的问题,提出一种简单的余弦相似度非线性变换,在保持边际覆盖保证的同时显著降低平均集大小。

Comments 7 pages, 2 figures, 3 tables, code availables, accepted to EUVIP 2025

Journal ref 2025 13th European Workshop on Visual Information Processing (EUVIP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31338 2026-07-01 cs.SD cs.AI eess.AS 新提交 79%

Beyond Binary Instrument QA: Probing Instrument Grounding in Music Audio-Language Models

超越二元乐器问答:探究音乐音频-语言模型中的乐器接地

Yujun Lee, Joonhyeok Shin, Hyoeun Kim, Kyuhong Shim

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 本文通过多轴诊断基准测试发现,音乐音频-语言模型在二元乐器问答中的高准确率常掩盖选项位置偏差、易混淆乐器错误和时间响应偏差等问题,表明乐器接地评估需采用多维度基准而非单一准确率。

Comments Workshop on Machine Learning for Audio, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28273 2026-06-29 cs.CL 新提交 79%

Vision-Default, Prior-Override: Causal Mechanisms of Perception-Knowledge Conflict in Vision-Language Models

视觉默认,先验覆盖:视觉-语言模型中感知-知识冲突的因果机制

Niclas Lietzow, Danielle Bitterman, Carsten Eickhoff, William Rudman, Michal Golovanevsky

机构 * University of Tübingen(图宾根大学) Harvard University(哈佛大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 通过激活修补和消融实验,发现VLM中视觉默认激活,而先验知识依赖少量因果注意力头(2.5-4.8%),形成不对称因果结构。

Comments 14 pages, 11 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27460 2026-06-29 cs.CL 新提交 79%

Developmental approach reveals the statistical learning of Neural Language Models: Transformers generalize from the most abstract statistical patterns

发展方法揭示神经语言模型的统计学习:Transformer从最抽象的统计模式中泛化

Wang Bojun, Holly Jenkins, Elizabeth Wonnacott

机构 * Department of Education, University of Oxford(牛津大学教育学院)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 本研究采用发展方法,通过训练生成式Transformer模型并分析其内部表征变化,发现神经语言模型先习得最抽象的全局统计知识,后习得局部统计依赖,并提出新的统计学习与语言认知框架。

Comments 10 pages, 7 figures, oral presentation at Interdisciplinary Advances in Statistical Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24026 2026-06-24 cs.AI 新提交 79%

Can Language Model Agents be Helpful Circuit Explainers in Mechanistic Interpretability?

语言模型代理能否成为机械可解释性中有用的电路解释器?

Ayan Antik Khan, Harsh Kohli, Yuekun Yao, Huan Sun, Ziyu Yao

机构 * George Mason University(乔治梅森大学) The Ohio State University(俄亥俄州立大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 研究语言模型代理在机械可解释性中自动解释已定位电路的能力,提出HyVE方法,通过迭代观察、假设生成和因果验证生成组件级解释,实验表明代理有潜力但可靠验证仍是关键障碍。

Comments 23 pages, 4 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19815 2026-06-19 cs.CL 新提交 79%

Clusters are All You Need: Pre-Training the Tsetlin Machine with Semantic Clusters from Language Models for Interpretability

聚类即一切:利用语言模型中的语义聚类预训练Tsetlin Machine以实现可解释性

Jiechao Gao, Rohan Kumar Yadav, Yuangang Li, Yuandong Pan, Jie Wang, Ying Liu, Michael Lepech

机构 * Independent Researcher(独立研究员) University of California, Irvine(加州大学尔湾分校) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 提出一种语义预训练框架,通过K-means或Top2Vec将文本聚类,用聚类-样本对预训练Tsetlin Machine,使其学习可解释的语义关键词,在五个数据集上性能优于传统方法且与BERT竞争。

详情

展开后加载摘要…

URL PDF HTML 收藏