arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 582 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 582 篇

2608.01306 2026-08-04 cs.CV 新提交 67%

SPAE: Spectrally Guided Autoencoder for Pretrained Visual Latents

SPAE:用于预训练视觉隐层的频谱引导自编码器

Yibin Huang, Jixiang Hong, Zongzhao Li, Yuhan Dai, Zhibin Wang, Chunwei Wang, Jun Song, Chen Wang, Xiaofei Sun, Xiaoxiao Xu, Conghui Zhu

机构 * Alibaba Group(阿里巴巴集团) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)

专题命中 知识编辑与模型理解 :foundation model(abstract,abstract_cn)

AI总结 针对DiT生成隐层与编码器隐层的频谱不匹配问题,提出SPAE框架,通过紧凑瓶颈结构与通道级掩码策略实现隐层适配,在视觉理解、生成质量与重建保真度间取得良好平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26387 2026-07-30 cs.CY 新提交 67%

"Nobody Did This": Contribution, Originality, and Accountability in Agent-Mediated Collaboration

“没人做过这件事”:智能体介导协作中的贡献、原创性与问责制

Kashif Imteyaz, Mohammad Rashidujjaman Rifat, Divya Ramesh, Steven R. Rick, Simo Hosio, Hauke Sandhaus, Advait Sarkar, Christoph Riedl, Saiph Savage

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn)

AI总结 本研讨会聚焦智能体介导协作中的贡献消解问题,将召集研究者与从业者,通过多元活动探讨应对方案,旨在形成共享研究议程与基础设施应对基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14147 2026-07-17 cs.CL cs.AI cs.CR cs.LG 新提交 67%

Breaking Refusal in the First Half: A Mechanistic Study of the Prefill Jailbreak

上半场打破拒绝:预填充越狱的机制研究

Alex Kwon

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究语言模型中预填充消除拒绝的现象,通过实验定位到早期窗口,揭示拒绝是浅层响应端计算,预填充控制是通用自回归条件作用,还明确了主导机制及相关特征,指出监测器免疫特点和机制的分散性与失效表面的局部性。

Comments 31 pages, 3 figures. Code and derived artifacts: https://github.com/collapseindex/breaking-refusal

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07264 2026-07-09 cs.CV 新提交 67%

Naming the Concepts Classifiers Rely On: Language-Anchored Decomposition for Faithful Explanation

命名概念分类器所依赖的内容:用于忠实解释的语言锚定分解

Ahsan Habib Akash, Dipkamal Bhusal, Stacey Jones, Donald A. Adjeroh, Binod Bhattarai, Prashnna Kumar Gyawali

机构 * West Virginia University(西弗吉尼亚大学) Rochester Institute of Technology(罗彻斯特理工学院) O Analytics(O分析公司) University of Aberdeen(阿伯丁大学) Fogsphere (Redev.AI Ltd, UK)(Fogsphere(Redev.AI有限公司,英国)) University College London(伦敦大学学院)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)

AI总结 研究针对深度神经网络在高风险视觉应用中可解释性的问题,提出语言锚定分解(LAD)框架,通过大语言模型和非负矩阵分解,在不修改模型的情况下获得命名、忠实且与决策相关的概念解释。

Comments Code available at https://github.com/machine-intelligence-lab-wvu/LAD

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03598 2026-07-07 cs.CL cs.AI cs.LG 新提交 67%

They Infer What You Meant: Models Represent Communicative Intent More Reliably Than They Act On It

他们推断你的意图:模型对交际意图的表征比其实际行动更可靠

Alex Kwon

机构 * Independent Researcher(独立研究者)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究语言模型常按信息表面而非发送者意图回复的问题,用线性探针从模型隐藏状态解码意图,表明表征可靠但读出存在问题,还找到因果处理方向可恢复预期行为。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02964 2026-07-07 cs.LG cs.AI cs.CL 新提交 67%

Individual Parameters in Weight-Sparse Transformers Appear Interpretable

权重稀疏变压器中的单个参数似乎具有可解释性

Arnau Marin-Llobet, Stefan Heimersheim

专题命中 知识编辑与模型理解 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究单个权重能否在整个训练分布中全局理解,引入自动语言模型管道描述权重何时重要并验证,发现稀疏变压器中可解释权重比例更高。

Comments 20 pages, 19 figures, 3 tables. Project website: https://weightpedia.org/individual-parameters-in-sparse-transformers/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27601 2026-06-29 cs.SE 新提交 67%

Test Case Selection for Deep Neural Networks: A Replication Study on LLMs for Code

深度神经网络的测试用例选择:面向代码的大语言模型的复现研究

Ali Asgari, Mitchell Olsthoorn, Annibale Panichella

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn)

AI总结 本文对深度神经网络测试用例选择技术在代码大语言模型上的有效性进行了大规模复现研究,发现基于不确定性的特征对早期故障发现有效,而基于表示的特征对准确率估计更鲁棒,且性能因任务和模型而异。

Comments Accepted at ISSTA 2026, the 35th ACM SIGSOFT International Symposium on Software Testing and Analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24570 2026-06-25 cs.CV 新提交 67%

Jolia: Concept-Level Vision-Language Alignment for 3D CT Contrastive Learning

Jolia: 用于3D CT对比学习的概念级视觉-语言对齐

Julien Khlaut, Charles Corbière, Baptiste Callard, Amaury Prat, Leo Butsanets, Antoine Saporta, Théo Danielou, Leo Machado, Korentin Le Floch, Tom Boeken, Pierre Manceron, Corentin Dancette

机构 * Raidium Department of Vascular and Oncological Interventional Radiology, Hôpital Européen Georges Pompidou, AP-HP(欧洲乔治·蓬皮杜医院血管与肿瘤介入放射科,AP-HP) Faculté de Santé, Université Paris-Cité(巴黎西岱大学健康学院) HEKA, INRIA(HEKA,法国国家信息与自动化研究所) Imaging Department, Fondation Ophtalmologique Adolphe de Rothschild(阿道夫·罗斯柴尔德眼科基金会影像科)

专题命中 知识编辑与模型理解 :foundation model(abstract);pretraining(abstract)

AI总结 提出ConQuer方法,通过概念查询将报告拆分为特定概念部分,学习交叉注意力查询以匹配图像特征,实现概念级对齐,在胸部与腹部CT上训练的Jolia模型在多项任务中超越CLIP基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24292 2026-06-24 cs.CV 新提交 67%

ActiveScope: Actively Seeking and Correcting Perception for MLLMs

ActiveScope: 主动寻求和纠正MLLMs的感知

Yajing Wang, Chao Bi, Junshu Sun, Shufan Shen, Zhaobo Qi, Shuhui Wang, Qingming Huang

机构 * University of Chinese Academy of Sciences(中国科学院大学) State Key Lab of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(中国科学院人工智能安全国家重点实验室,计算技术研究所,北京,中国) Harbin Institute of Technology (Weihai)(哈尔滨工业大学(威海))

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)

AI总结 提出ActiveScope框架,通过语义锚点定位和干扰抑制细化模块,解决MLLMs在高分辨率图像中的细粒度感知问题,在V* Bench上达到96.34%准确率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18924 2026-06-18 cs.SD 新提交 67%

Who Wins the Conflict? Mechanistic Interpretability of Text Bias in Audio LLMs

谁赢得冲突?音频大模型中文本偏差的机制可解释性

Hyebin Cho, Suho Yoo, Jaehyuk Jang, Changick Kim, Joon Son Chung

机构 * School of Electrical Engineering, KAIST(韩国科学技术院电子工程学院)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)

AI总结 本文通过机制分析揭示音频大模型中的文本主导偏差,发现文本路径主动抑制完整音频表征,并提出无训练干预方法back-patching以增强音频表征,缓解文本主导。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14586 2026-06-15 cs.CV 新提交 67%

S$^2$COPE: Self-Supervised Concept Discovery via Preference Learning

S$^2$COPE: 通过偏好学习进行自监督概念发现

Shilong Xiang, Zirui Zhang, Chengzhi Mao

机构 * Rutgers University(罗格斯大学)

专题命中 知识编辑与模型理解 :language model(abstract);preference optimization(abstract)

AI总结 提出S$^2$COPE框架,利用视觉大语言模型在自监督偏好优化循环中自主发现结构化概念,无需任何标签,在多个领域提升下游分类准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08031 2026-06-09 cs.CV 新提交 67%

Vision-Language Asymmetry in Bistable Image Captioning

双稳态图像描述中的视觉-语言不对称性

Arohan Agate

机构 * Arohan Agate

专题命中 知识编辑与模型理解 :language model(abstract);prompting(abstract)

AI总结 通过83个双稳态刺激的行为基线和稀疏自编码器分析,发现视觉塔中同时激活两种解释,但因果干预仅能翻转默认主导刺激的描述,揭示视觉表征与语言承诺之间的不对称性。

Comments Accepted at ICML 2026 Workshop on Philosophy of Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07420 2026-06-08 cs.CR 新提交 67%

Lost in Migration: Exposing Android Framework Vulnerabilities in Parallel Java-Kotlin Implementations

迷失在迁移中:揭示Android框架中Java-Kotlin并行实现的安全漏洞

Rui Li, Wenrui Diao, Debin Gao

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)

AI总结 本文首次系统研究Android框架中Java-Kotlin并行实现的语义差异,设计ParaDroid分析框架识别并比较并行方法,发现37个可利用漏洞,其中3个已确认并分配CVE。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11661 2026-08-13 cs.LG cs.AI 新提交 62%

Low-Interaction-Rank Learning: Unifying Multiplicative Dual-Encoder Heads

低交互秩学习:统一乘法双编码器头

Zijian Zhao, Sen Li

机构 * The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出低交互秩学习框架,统一乘法双编码器头架构,解决其设计决策、可识别性等问题,经实验验证该框架可解释对比维度不可解释性并恢复真实模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09638 2026-08-11 cs.AI cs.CL cs.CY cs.GT 新提交 62%

Avalon-ToM-Bench: Evaluating Fine-Grained Theory of Mind via Asymmetric Game Mechanics

Avalon-ToM-Bench:通过非对称游戏机制评估细粒度心理理论

Yen-Shan Chen, Yu Chian Duan, Chih-En Kuo, Jian-Bin Wu, Yun-Nung Chen

机构 * National Taiwan University(台湾大学) CyCraft AI Lab(CyCraft人工智能实验室)

专题命中 知识编辑与模型理解 :LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出Avalon-ToM-Bench基准,基于阿瓦隆游戏机制评估大语言模型的细粒度心理理论,发现模型ToM能力不足源于推理策略而非知识或表征,推理训练比测试时思维链增益更显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08266 2026-08-11 cs.SE cs.AI cs.LG 新提交 62%

On the Robustness of LLMs' Internal Representation of Code Correctness

大型语言模型内部代码正确性表示的鲁棒性研究

Francisco Ribeiro, Sohaila Abdulsattar, Renata Gonzalez, Mahmoud Kassem, Sarah Nadi

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究系统探究大型语言模型内部代码正确性信号的鲁棒性,发现无最优提取配置且分离故障无法提升信号质量。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07886 2026-08-11 cs.CV cs.AI cs.CL 新提交 62%

Vision-Language Grounding as Bidirectional Concept Correspondence

视觉-语言 Grounding 作为双向概念对应

Jieyu Zhang, Ziqi Gao, Luke Zettlemoyer, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for AI(艾伦人工智能研究所) FAIR at Meta(Meta FAIR实验室)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究将视觉-语言 Grounding 建模为双向概念对应,提出 ConCor-1 模型统一相关任务,在长文本数据集和零样本 LVIS 上对应 F1 分别提升 48%、29%,性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01585 2026-08-04 cs.CL cs.LG 新提交 62%

Semantic Alignment of AI Models: Concept Collapse, Checkpoint Dynamics, and Cross-Lingual Transfer

AI模型的语义对齐:概念坍缩、检查点动态与跨语言迁移

Tyler Ashoff, Jordan Rodu

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对语言模型基准测试的难点,提出用拓扑方法将模型高维嵌入空间与可解释基线严格比较,以实现多模态对齐,追踪模型适应并测试跨语言短语理解。

Comments Code available at github.com/tylerashoff/persiscope (PyPI: persiscope)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01021 2026-08-04 cs.CV cs.AI cs.CL 新提交 62%

Can Humans Dream of Electric Sheep? Human-Written Samples for Fine-Grained Vision-and-Language Hallucination Benchmarking

人类能否“梦到”电子羊?用于细粒度视觉语言幻觉基准测试的人类编写样本

Timothee Mickus, Claudio Savelli, Eduardo Calò, Emilio Raimond, Stella Frank, Hengyu Luo, Flavio Giobergia, Vincent Segonne, Chuyuan Li, Aman Sinha, Lorenzo Vaiani, Jörg Tiedemann, Raúl Vázquez

机构 * University of Helsinki(赫尔辛基大学) Politecnico di Torino(都灵理工大学) Universiteit Utrecht(乌得勒支大学) Université Bretagne Sud(南布列塔尼大学) University of Copenhagen(哥本哈根大学) University Grenoble Alpes(格勒诺布尔阿尔卑斯大学) University of Lorraine(洛林大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对模型迭代快导致幻觉评估普适性不足的问题,构建多语言人类编写幻觉样本数据集,证实其可替代模型生成样本用于细粒度视觉语言幻觉基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26792 2026-07-30 stat.ML cs.AI cs.CE cs.LG q-fin.CP 新提交 62%

Crossing-Free Probabilistic K-Line Forecasts Without Retraining

无需重新训练的无交叉概率K线预测

Runyao Yu, Yuchen Tao, Yujie Chen, Wentao Wang, Derek W. Bunn

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出无需重新训练的KQSP方法,解决概率K线预测的分位数与K线交叉问题,保持预测准确性并将交叉率降至零。

Comments 8 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25459 2026-07-29 cs.LG cs.AI q-fin.ST 新提交 62%

Emergent Latent-State Computation under Stochastic Volatility

随机波动率下的涌现潜态计算

Xiaoyu Huang, Lulu Wang

机构 * Temple University(天普大学) Dickinson College(迪金森学院)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 研究序列模型在部分可观测下如何表示潜在随机动态,发现在随机波动率设置中有两阶段计算,Transformer中潜态可解码性在特定阶段出现,输出头替换揭示部分退化原因,为机械可解释性提供有用基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23379 2026-07-28 cs.CL cs.AI 新提交 62%

When Activation Oracles Learn Not to Read: Concept-Specific Blind Spots in Fine-Tuned Oracles

当激活预言机学会不读取时:微调预言机中的特定概念盲点

Tobias Bersia, Tatiana Gaintseva

机构 * Queen Mary University of London(伦敦玛丽女王大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究在禁忌词猜测设置下,激活预言机经微调后成为特定概念反读取器的现象,发现其无法恢复自身训练时存在的概念,失败源于读取路径,揭示了行为泄漏等因素可分离,引发对可解释性接口可靠性的担忧。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23361 2026-07-28 cs.DS cs.CL cs.LG 新提交 62%

Hallucination Rates in Language Generation

语言生成中的幻觉率

Debmalya Panigrahi, Fan Wei, Ian Zhang

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究有(无限)幻觉的语言生成极限,表明即使幻觉率为0也使极限生成更强大,展示了由幻觉率和生成目标语言比例表征的语言集合严格层次结构,确立幻觉率为语言生成理论研究的重要参数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21491 2026-07-24 cs.CL cs.LG 新提交 62%

What, Where, and How: Disentangling the Roles of Task, Language, and Model in Code Model Representations

是什么、在哪里以及如何:解开任务、语言和模型在代码模型表示中的作用

Piotr Wilam

机构 * University College London(伦敦大学学院)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究独立训练的语言模型在代码表示上的情况,通过2x2设计扩展概念电路提取方法,测量语法概念,发现任务决定概念获专用电路,模型决定电路位置及增长方式,还得出如Rust与Python电路差异等结论,为后续测试奠定基础。

Comments 16 pages, 11 figures, 6 tables. Code: https://github.com/piotrwilam/Atlas2x2 ; dataset: https://huggingface.co/datasets/piotrwilam/Atlas2x2

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20652 2026-07-24 cs.LG cs.AI 新提交 62%

Scaling Interpretable Transformers with Parity Bottleneck Layers

使用奇偶瓶颈层扩展可解释的Transformer

Andrew Mack, Kraig Yuheng Tou, Mark Henry, Zhengxun Wu, Lauren Greenspan

机构 * Principles of Intelligence(智能原理)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 研究旨在解决训练可解释Transformer模型的难题,提出ParityTransformer架构,通过奇偶瓶颈层实现,实验表明其在稀疏探测任务中表现良好,在特征相关指标上更优,朝着训练内部表示可设计解释的模型迈出一步。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17770 2026-07-21 cs.CV cs.AI cs.LG 新提交 62%

Measuring Monosemanticity in Sparse Autoencoders via Latent Activation Coherence

通过潜在激活一致性测量稀疏自编码器中的单语义性

Katarzyna Filus, Sebastian Pokuciński

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对可解释人工智能中评估稀疏自编码器单语义性的挑战,提出无标签的Tversky单语义性分数(TMS),通过激活集一致性衡量。在多种模型和设置下评估,结果显示TMS受编码器各向异性影响小,能揭示训练动态,还能体现概念删除有效性。

Comments This is a preprint version. A shorter version of this paper has been accepted for presentation and publication in the post-workshop proceedings of the 8th International Workshop on eXplainable Knowledge Discovery in Data Mining (XKDD 2026), co-located with ECML PKDD 2026. The appendix is included only in this preprint and is not part of the peer-reviewed proceedings paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16448 2026-07-21 cs.LG cs.AI 新提交 62%

Retrieval is Enough: Training-Free Interpretability with a Tool-Using Agent

检索就足够了:使用工具的智能体实现无需训练的可解释性

Sriram Balasubramanian, Soheil Feizi

机构 * University of Maryland(马里兰大学)

专题命中 知识编辑与模型理解 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究神经网络激活可解释性方法,提出HARP方法,即让语言模型智能体利用激活向量数据库及工具,通过迭代查询、形成并验证假设来实现无需训练的可解释性,该方法在多方面表现出色,还凸显现有训练方法局限并推动新基准测试。

Comments 25 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15847 2026-07-20 cs.CL cs.AI 新提交 62%

CAMMAR: Culture-Aware Matryoshka for Metaphorical Arabic Representations

CAMMAR:用于隐喻阿拉伯语表示的文化感知套娃

Suzan Awinat, Alfonso Ortega del Puente

机构 * Autonomous University of Madrid (UAM)(马德里自治大学) IE University(IE大学) Oviedo University(奥维耶多大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对阿拉伯语语言模型语义模糊问题,提出CAMMAR框架,通过分阶段语义课程组织意义到嵌套子空间,基于词汇与隐喻表示距离产生隐喻性几何度量,在新数据集上评估,有监督时检测隐喻效果好,还发现基于形态学词根有提升。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08605 2026-07-10 cs.CV cs.AI cs.LG 新提交 62%

When Structured Sparse Autoencoders Learn Consistent Concepts Across Modalities

当结构化稀疏自编码器跨模态学习一致概念时

Weiduo Liao, Yunqiao Yang, Ying Wei

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 研究视觉语言模型中普通稀疏自编码器难以学习模态一致概念的问题,提出结构化稀疏自编码器$S^2AE$,通过图像块分组及结构化稀疏正则化强化概念一致性,经实验验证该方法在语义对齐等方面有提升,能促进跨模态表示更连贯解缠。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07724 2026-07-10 cs.LG cs.CL 新提交 62%

Uncertainty-gated selection for block-sparse attention

用于块稀疏注意力的不确定性门控选择

Thomas Rossi

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究针对块稀疏注意力截断短视问题,提出信息价值路由器,通过测量 top-k 截断决定性程度调整保留集。该方法与主干无关,可堆叠现有方法。实验表明其在多个模型上提升召回率,保留准确率,且减少运行时间。

详情

展开后加载摘要…

URL PDF HTML 收藏