arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-27 至 2026-04-27 共收录 35 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 35 篇

2510.25977 2026-04-27 cs.CL 92%

NeuronMLP: Efficient LLM Inference via Singular Value Decomposition Compression and Tiling on AWS Trainium

NeuronMLP:通过AWS Trainium上的奇异值分解压缩和分块实现高效的LLM推理

Dinghong Song, Jierui Xu, Weichu Yang, Pengfei Su, Dong Li

机构 * University of California, Merced USA University of Wisconsin, Madison USA Yotta Labs \& University of California, Merced USA University of California, Merced University of Wisconsin, Madison Yotta Labs \& University of California, Merced

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出NeuronMLP,基于奇异值分解压缩和分块技术优化AWS Trainium上的LLM推理,通过定制化技术减少数据移动,提升SRAM带宽,实现1.35倍的内核加速和1.21倍的端到端推理加速。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22411 2026-04-27 cs.AI cs.CL cs.LG 91%

Introducing Background Temperature to Characterise Hidden Randomness in Large Language Models

引入背景温度以表征大语言模型中的隐藏随机性

Alberto Messina, Stefano Scotta

机构 * RAI - Radiotelevisione Italiana, Centre for Research, Technological Innovation and Experimentation (CRITS)(意大利广播电视台,研究中心、技术创新与实验中心(CRITS))

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文引入背景温度概念,探讨大语言模型中隐藏随机性的来源,提出通过有效温度评估实现依赖扰动,并通过实验验证其对可重复性、评估和部署的影响。

Journal ref Transactions on Machine Learning Research (TMLR), February 2026, https://openreview.net/pdf?id=bz0he4bARF

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22061 2026-04-27 cs.CL cs.AI cs.LG 90%

Lightweight Retrieval-Augmented Generation and Large Language Model-Based Modeling for Scalable Patient-Trial Matching

轻量级检索增强生成与基于大语言模型的建模用于可扩展的患者试验匹配

Xiaodi Li, Yang Xiao, Munhwan Lee, Konstantinos Leventakos, Young J. Juhn, David Jones, Terence T. Sio, Wei Liu, Maria Vassilaki, Nansu Zong

机构 * Department of Artificial Intelligence and Informatics, Mayo Clinic(人工智能与信息学系,梅奥诊所) Computer Science Department, University of Tulsa(图兰大学计算机科学系) Mayo Clinic Comprehensive Cancer Center, Mayo Clinic(梅奥诊所综合癌症中心,梅奥诊所) Division of Community Pediatric and Adolescent Medicine, Department of Pediatrics, Mayo Clinic(社区儿科与青少年医学分会,儿科部,梅奥诊所) Department of Neurology, Mayo Clinic(神经病学部,梅奥诊所) Department of Radiation Oncology, Mayo Clinic(放射肿瘤学部,梅奥诊所) Department of Quantitative Health Sciences, Mayo Clinic(定量健康科学部,梅奥诊所)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出轻量级框架,结合检索增强生成和大语言模型建模,解决患者试验匹配中长异构电子健康记录和复杂资格标准的可扩展性、泛化性和计算效率问题。

Comments 31 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22520 2026-04-27 cs.CL 90%

RouteLMT: Learned Sample Routing for Hybrid LLM Translation Deployment

RouteLMT: 为混合LLM翻译部署设计的学得样本路由

Yingfeng Luo, Hongyu Liu, Dingyang Lin, Kaiyan Chang, Chenglong Wang, Bei Li, Quan Du, Tong Xiao, Jingbo Zhu

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院,中国沈阳) NiuTrans Research, Shenyang, China(牛译研究院,中国沈阳)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出RouteLMT,通过在模型内部预测大模型相对于小模型的边际增益,实现高效的样本路由,优于传统启发式和质量估计方法,达到更优的质量-预算帕累托前沿。

Comments Accepted to ACL 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03779 2026-04-27 cs.CL 90%

Tracing the complexity profiles of different linguistic phenomena through the intrinsic dimension of LLM representations

通过LLM表示的内在维度追溯不同语言现象的复杂性特征

Marco Baroni, Emily Cheng, Iria de-Dios-Flores, Francesca Franzon

机构 * Universitat Pompeu Fabra (UPF)(巴塞罗那自治大学) ICREA(加泰罗尼亚凝聚态物理与应用研究中心)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL

AI总结 研究通过LLM表示的内在维度揭示语言复杂性对比,发现复杂现象在不同层间表现出更高的维度差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22166 2026-04-27 cs.LG cs.AI 89%

Motivating Next-Gen Accelerators with Flexible (N:M) Activation Sparsity via Benchmarking Lightweight Post-Training Sparsification Approaches

通过基准测试轻量级后训练稀疏化方法来推动下一代加速器的灵活(N:M)激活稀疏化

Shirin Alanova, Kristina Kazistova, Ekaterina Galaeva, Alina Kostromina, Vladimir Smirnov, Redko Dmitry, Alexey Dontsov, Maxim Zhelnin, Evgeny Burnaev, Egor Shvetsov

机构 * Applied AI(应用人工智能) Artificial Intelligence Research Institute(人工智能研究所) HSE University(俄罗斯高等经济大学) Sb AI Lab(Sb人工智能实验室) MWS AI(MWS人工智能) Yandex Independent Researcher(独立研究者)

专题命中 效率与部署 :post-training(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文通过基准测试轻量级后训练稀疏化方法,探讨了灵活(N:M)激活稀疏化在大语言模型中的应用,展示了激活稀疏化在保持生成能力方面的优势,并提出了适用于未来硬件的稀疏化模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17681 2026-04-27 cs.LG cs.CL 88%

LATMiX: Learnable Affine Transformations for Microscaling Quantization of LLMs

LATMiX:用于LLM微缩量化的学习可逆变换

Ofir Gordon, Lior Dikstein, Arnon Netzer, Idan Achituve, Hai Victor Habi

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出LATMiX方法,通过学习可逆仿射变换提升LLM微缩量化精度,实验显示在多种零样本基准上优于现有方法。

Comments 32 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21026 2026-04-27 cs.LG 87%

MCAP: Deployment-Time Layer Profiling for Memory-Constrained LLM Inference

MCAP:面向内存受限LLM推理的部署时层性能分析

Anurita Das

机构 * Genovation Technological Solutions Pvt Ltd(基因创新技术解决方案私人有限公司)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 MCAP通过部署时的层重要性估计,实现动态精度和内存分配决策,提升解码吞吐量并拓展内存受限下的模型运行范围。

Comments Code available at https://github.com/genovationtech/nve

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21957 2026-04-27 cs.IT cs.AI cs.LG eess.SP math.IT 87%

MambaCSP: Hybrid-Attention State Space Models for Hardware-Efficient Channel State Prediction

MambaCSP: 用于硬件高效通道状态预测的混合注意力状态空间模型

Aladin Djuhera, Haris Gacanin, Holger Boche

机构 * Technical University Munich, Germany(慕尼黑技术大学,德国) RWTH Aachen University, Germany(亚琛工业大学,德国)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MambaCSP,一种混合注意力状态空间模型,通过线性时间Mamba模型替代LLM,提升CSI预测精度与效率,降低资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18655 2026-04-27 cs.DC cs.AI cs.CL 86%

Unlocking the Edge deployment and ondevice acceleration of multi-LoRA enabled one-for-all foundational LLM

解锁多LoRA支持的多用途基础大语言模型的边缘部署与设备端加速

Sravanth Kodavanti, Sowmya Vajrala, Srinivas Miriyala, Utsav Tiwari, Uttam Kumar, Utkarsh Kumar Mahawar, Achal Pratap Singh, Arya D, Narendra Mutyala, Vikram Nelvoy Rajendiran, Sharan Kumar Allur, Euntaik Lee, Dohyoung Kim, HyeonSu Lee, Gyusung Cho, JungBae Kim

机构 * Samsung Research Institute(三星研究院) Samsung Electronics(三星电子)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出一种硬件感知框架,实现基于LLaMA的多语言基础模型在三星S24/S25设备上的高效设备端推理,通过动态任务切换和多流解码机制,提升内存和延迟性能,验证了多用途大语言模型在边缘设备上的可行性。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13193 2026-04-27 cs.AI 85%

Cost-Effective Communication: An Auction-based Method for Language Agent Interaction

高效通信:一种基于拍卖的语言代理交互方法

Yijia Fan, Jusheng Zhang, Kaitong Cai, Jing Yang, Chengpei Tang, Jian Wang, Keze Wang

机构 * Sun Yat-sen University(中山大学) Snap Inc. Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室)

专题命中 效率与部署 :language agent(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出DALA框架,通过将通信带宽视为稀缺资源,解决多代理系统中通信低效问题,实验表明其在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21548 2026-04-27 cs.CL cs.IT cs.LG math.IT 85%

MultiTok: Variable-Length Tokenization for Efficient LLMs Adapted from LZW Compression

MultiTok: 可变长度分词用于高效大语言模型,源自LZW压缩

Noel Elias, Homa Esfahanizadeh, Kaan Kale, Sriram Vishwanath, Muriel Medard

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Nokia Bell Labs(诺基亚贝尔实验室) Boğaziçi University(博雅大学) Georgia Institute of Technology(佐治亚理工学院) Massachusetts Institute of Technology (MIT)(麻省理工学院(MIT))

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出基于LZW压缩的MultiTok分词方法,通过压缩重复短语提升LLM训练效率,实现更高效训练与相似准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22575 2026-04-27 cs.LG 83%

SpikingBrain2.0: Brain-Inspired Foundation Models for Efficient Long-Context and Cross-Platform Inference

SpikingBrain2.0:面向高效长上下文和跨平台推理的脑启发基础模型

Yuqi Pan, Jinghao Zhuang, Yupeng Feng, Fangzhi Zhong, Siyu Ding, Xuerui Qiu, Shaowei Gu, Bohan Sun, Zhiyong Qin, Yibo Zhong, Lingtao Ouyang, Kun Yang, Zehao Liu, Yuhong Chou, Shurong Wang, Anjie Hu, Han Xu, Bo Xu, Guoqi Li

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Key Laboratory of Brain-Inspired General Intelligence Large Model(北京脑启发通用智能大模型重点实验室) Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology(脑认知与脑启发智能技术重点实验室) The Hong Kong Polytechnic University(香港理工大学)

专题命中 效率与部署 :foundation model(title,abstract);LLM(abstract_cn);分类 cs.LG

AI总结 SpikingBrain2.0通过双空间稀疏注意力机制和优化训练策略,在保持性能的同时提升长上下文处理效率,实现跨平台高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11931 2026-04-27 cs.CL cs.AI 82%

AdaptEvolve: Improving Efficiency of Evolutionary AI Agents through Adaptive Model Selection

AdaptEvolve: 通过自适应模型选择提高进化AI代理的效率

Pretam Ray, Pratik Prabhanjan Brahma, Zicheng Liu, Emad Barsoum

机构 * IIT Kharagpur(印度理工学院Kharagpur分校) Advanced Micro Devices, Inc. (AMD)(先进微器件公司(AMD))

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出AdaptEvolve方法,通过自适应选择大语言模型提升进化代理效率,实验证明在保持准确性的同时降低推理成本37.9%。

Comments 9 pages, 2 Figues

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22432 2026-04-27 cs.SE 82%

R2Code: A Self-Reflective LLM Framework for Requirements-to-Code Traceability

R2Code:一种用于需求到代码追溯的自反思大语言模型框架

Yifei Wang, Jacky Keung, Xiaoxue Ma, Zhenyu Mao, Kehui Chen, Yishu Li

专题命中 效率与部署 :LLM(title,abstract);prompting(abstract)

AI总结 本文提出R2Code框架,通过分解增强的双向对齐网络、自反思一致性验证模块和动态上下文适应检索机制,提升需求到代码追溯的准确性并降低推理成本。

Comments Accepted to IEEE COMPSAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22180 2026-04-27 cs.IR cs.AI 81%

ResRank: Unifying Retrieval and Listwise Reranking via End-to-End Joint Training with Residual Passage Compression

ResRank:通过端到端联合训练与残差段落压缩统一检索与列表级重排序

Xiaojie Ke, Shuai Zhang, Liansheng Sun, Yongjin Wang, Hengjun Jiang, Xiangkun Liu, Cunxin Gu, Jian Xu, Guanjun Jiang

机构 * Qwen Applications Business Group of Alibaba(阿里巴巴Qwen应用业务组)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ResRank通过端到端联合训练与残差段落压缩技术,解决传统重排序方法中输入长度增加导致的排名质量下降和推理延迟问题,实现高效且有效的检索与重排序统一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20979 2026-04-27 cs.LG 81%

Toward Robust and Efficient ML-Based GPU Caching for Modern Inference

迈向鲁棒且高效的基于机器学习的GPU缓存

Peng Chen, Jiaji Zhang, Hailiang Zhao, Yirong Zhang, Shenyao Chen, Jiahong Yu, Xueyan Tang, Yixuan Wang, Hao Li, Jianping Zou, Gang Xiong, Kingsum Chow, Shuibing He, Shuiguang Deng

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Kuaishou(快手)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.LG

AI总结 本文提出学习增强型LRU算法,通过整合预测提升缓存性能,实现1-一致性与O(k)-鲁棒性,同时在GPU上构建LCR缓存,实验显示在LLM和DLRM任务中显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15919 2026-04-27 cs.DC cs.AI 81%

HFX: Joint Design of Algorithms and Systems for Multi-SLO Serving and Fast Scaling

HFX:多SLO服务与快速扩展的算法与系统联合设计

Zahra Yousefijamarani, Xinglu Wang, Qian Wang, Morgan Lindsay Heisler, Taha Shabani, Niloofar Gholipour, Parham Yassini, Hong Chang, Kan Chen, Qiantao Zhang, Xiaolong Bai, Jiannan Wang, Ying Xiong, Yong Zhang, Zhenan Fan

机构 * Huawei Technologies Canada Co., Ltd.(华为技术加拿大有限公司) Simon Fraser University(西蒙弗雷泽大学) École de technologie supérieure(高等技术学院) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 HFX通过联合优化请求调度与弹性扩展,满足多样化的SLO,实验显示在延迟、成本等方面优于现有系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22028 2026-04-27 cs.SE 80%

FlyCatcher: Neural Inference of Runtime Checkers from Tests

FlyCatcher: 从测试中自动推断运行时检查器

Beatriz Souza, Chang Lou, Suman Nath, Michael Pradel

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 FlyCatcher通过结合LLM合成、静态分析和动态验证,从现有测试中自动推断运行时检查器,能检测更多隐性故障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09028 2026-04-27 q-bio.QM cs.AI 79%

From Classical Machine Learning to Emerging Foundation Models: Review on Multimodal Data Integration for Cancer Research

从经典机器学习到新兴基础模型:癌症研究中多模态数据整合的综述

Amgad Muneer, Muhammad Waqas, Maliazurina B Saad, Eman Showkatian, Rukhmini Bandyopadhyay, Hui Xu, Wentao Li, Joe Y Chang, Zhongxing Liao, Cara Haymaker, Luisa Solis Soto, Carol C Wu, Natalie I Vokes, Xiuning Le, Lauren A Byers, Don L Gibbons, John V Heymach, Jianjun Zhang, Jia Wu

机构 * Department of Imaging Physics, The University of Texas MD Anderson Cancer Center(影像物理系,德克萨斯大学MD安德森癌症中心) Department of Thoracic/Head and Neck Medical Oncology, The University of Texas MD Anderson Cancer Center(胸腔/头颈医学肿瘤科,德克萨斯大学MD安德森癌症中心) Department of Thoracic Radiation Oncology, The University of Texas MD Anderson Cancer Center(胸腔放射肿瘤科,德克萨斯大学MD安德森癌症中心) Department of Translational Molecular Pathology, The University of Texas MD Anderson Cancer Center(转化分子病理学系,德克萨斯大学MD安德森癌症中心) Department of Thoracic Imaging, The University of Texas MD Anderson Cancer Center(胸腔影像科,德克萨斯大学MD安德森癌症中心)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI

AI总结 本文综述了多模态数据整合在癌症研究中的应用,探讨了传统机器学习向基础模型转变的趋势,以及多组学与先进影像数据整合的最新方法和挑战。

Comments 10 figures, 5 tables

Journal ref Artificial Intelligence Review 59, 119 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00955 2026-04-27 cs.CL 77%

Efficient Multi-Agent System Training with Data Influence-Oriented Tree Search

高效多智能体系统训练中的数据影响导向树搜索

Wentao Shi, Zichun Yu, Fuli Feng, Xiangnan He, Chenyan Xiong

机构 * University of Science and Technology of China(中国科学技术大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出数据影响导向树搜索框架,通过影响评分指导树搜索和数据选择,提升多智能体系统训练效率与效果。

Comments Accepted by ACL 2026 Main;

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17624 2026-04-27 cs.HC 75%

Developing Models of Procedural Skills using an AI-assisted Text-to-Model Approach

利用AI辅助的文本到模型方法开发程序技能模型

Rahul K. Dass, Shubham Puri, Arpit Khandelwal, Xiao Jin, Ashok K. Goel

专题命中 效率与部署 :LLM(abstract,abstract_cn);prompting(abstract)

AI总结 本文提出一种AI辅助的文本到模型方法,通过本体约束提示和模板生成,将教学材料转化为完整的任务-方法-知识模型,显著降低结构化程序技能表示的构建成本,使大规模AI辅导系统部署成为可能。

Comments 10 pages. To appear in Proceedings of the 13th ACM Conference on Learning at Scale (L@S '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22558 2026-04-27 cs.LG cs.AI 73%

SOLAR-RL: Semi-Online Long-horizon Assignment Reinforcement Learning

SOLAR-RL:半在线长 horizon 分配强化学习

Jichao Wang, Liuyang Bian, Yufeng Zhou, Han Xiao, Yue Pan, Guozhi Wang, Hao Wang, Zhaoxiong Wang, Yafei Wen, Xiaoxin Chen, Shuai Ren, Lingfang Zeng

机构 * vivo AI Lab(vivo人工智能实验室) Zhejiang Lab(浙江实验室) CUHK MMLab(香港大学多模态实验室) Hubei University(湖北省大学) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 SOLAR-RL通过整合全局轨迹信息到离线学习中,提升GUI任务的长horizon完成率和鲁棒性,提供高效样本利用的自主导航方案。

Comments 14 pages, 11 figures. Accepted to Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22661 2026-04-27 cs.IR cs.CL 70%

Can QPP Choose the Right Query Variant? Evaluating Query Variant Selection for RAG Pipelines

QPP能否选择正确的查询变体?评估RAG流水线中的查询变体选择

Negar Arabzadeh, Andrew Drozdov, Michael Bendersky, Matei Zaharia

机构 * UC Berkeley(伯克利大学) Databricks(Databricks公司)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了在RAG流水线中如何选择最佳查询变体,通过大规模实验评估了预检索和后检索预测器的性能,发现检索相关性与生成保真度之间存在'效用差距',但QPP能有效提升端到端质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22312 2026-04-27 cs.DC cs.AR cs.PF 67%

Guess-Verify-Refine: Data-Aware Top-K for Sparse-Attention Decoding on Blackwell via Temporal Correlation

猜测-验证-细化:基于数据的Blackwell上的稀疏注意力解码Top-K

Long Cheng, Ritchie Zhao, Timmy Liu, Mindy Li, Xianjie Qiao, Kefeng Duan, Yu-Jung Chen, Xiaoming Chen, Bita Darvish Rouhani, June Yang

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 本文提出Guess-Verify-Refine算法,通过利用解码步骤间的时序相关性,优化稀疏注意力解码中的Top-K选择,提升性能并保持精确性。

Comments 31 Pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19308 2026-04-27 math.NA cs.NA 67%

Efficient approximations of matrix multiplication using truncated decompositions

利用截断分解高效近似矩阵乘法

Suvendu Kar, Hariprasad M., Sai Gowri J. N., Murugesan Venkatapathi

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文提出利用截断奇异值分解和循环分解高效近似大规模稠密矩阵乘法,方法在算术运算上具有O(n² log n)的复杂度,且在相对误差约1%的容忍度下表现良好,同时展示了在大型语言模型中的效率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06019 2026-04-27 cs.CL cs.LG 62%

Multi-Token Prediction via Self-Distillation

通过自蒸馏实现多token预测

John Kirchenbauer, Abhimanyu Hans, Brian Bartoldson, Micah Goldblum, Ashwinee Panda, Tom Goldstein

机构 * University of Maryland(马里兰大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) Columbia University(哥伦比亚大学) TogetherAI

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过自蒸馏将预训练的自回归语言模型转换为快速独立的多token预测模型,无需额外辅助模型或复杂管道,实现更快的解码速度和更高的准确性。

Comments 9 pages and 5 figures in the main body

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09003 2026-04-27 q-bio.QM cs.AI 57%

Digital Modeling of Spatial Pathway Activity from Histology Reveals Tumor Microenvironment Heterogeneity

从组织学图像数字建模揭示肿瘤微环境异质性

Ling Liao, Changhuei Yang, Maxim Artyomov, Mark Watson, Adam Kepecs, Haowen Zhou, Alexey Sergushichev, Richard Cote

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI

AI总结 通过从组织学图像预测空间通路活性,研究肿瘤微环境异质性,发现TGFb信号在乳腺和肺癌数据集中预测准确率最高,且空间活动图谱与预期一致。

Comments The paper was withdrawn because the original submission was an early draft manuscript and not the final version for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22095 2026-04-27 cs.CL 57%

An End-to-End Ukrainian RAG for Local Deployment. Optimized Hybrid Search and Lightweight Generation

端到端的乌克兰RAG系统用于本地部署。优化的混合搜索和轻量级生成

Mykola Trokhymovych, Yana Oliinyk, Nazarii Nyzhnyk

机构 * Pompeu Fabra University(庞皮乌斯·法布拉大学) Independent Researcher(独立研究者)

专题命中 效率与部署 :language model(abstract);分类 cs.CL

AI总结 本文提出一个高效的检索增强生成系统,用于乌克兰文档问答,在UNLP 2026共享任务中获第二名。系统包含定制的两阶段搜索流程和针对乌克兰语言的微调模型,最终通过模型压缩实现轻量级部署。

Comments To appear at UNLP'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11719 2026-04-27 cs.LG hep-ex 57%

jBOT: Semantic Jet Representation Clustering Emerges from Self-Distillation

jBOT:语义喷流表示聚类从自蒸馏中涌现

Ho Fung Tsoi, Dylan Rankin

机构 * University of Pennsylvania, USA(美国宾夕法尼亚大学)

专题命中 效率与部署 :foundation model(abstract);分类 cs.LG

AI总结 本文提出jBOT,一种基于自蒸馏的预训练方法,通过局部粒子级和全局喷流级蒸馏学习喷流表示,支持异常检测和分类等下游任务,并在无标签喷流上观察到语义类聚类。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏