arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-03 至 2026-07-03 共收录 59 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 59 篇

2607.02460 2026-07-03 cs.LG cs.AI 新提交 92%

Neuron-Aware Data Selection for Annotation-Free LLM Self-Distillation

面向无标注LLM自蒸馏的神经元感知数据选择

Zhuowei Chen, Xiang Lorraine Li

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 效率与部署 :LLM(title,title_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出Neuron-OPSD框架,利用神经元激活指导训练数据选择和教师上下文构建,通过在线策略蒸馏实现无标注自蒸馏,提升领域内性能并保持跨领域泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23370 2026-07-03 cs.CR cs.LG cs.OS 新提交 92%

FlexServe: A Fast and Secure LLM Serving System for Mobile Devices with Flexible Resource Isolation

FlexServe: 一种面向移动设备的快速安全LLM服务系统,具有灵活的资源隔离

Yinpeng Wu, Yitong Chen, Lixiang Wang, Jinyu Gu, Zhichao Hua, Yubin Xia

机构 * Institute of Parallel and Distributed Systems(并行与分布式系统研究所)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对移动设备上LLM推理中TrustZone资源隔离不灵活和安全管理低效的问题,提出FlexServe系统,通过解耦安全资源的访问权限与管理权限,实现快速安全的推理,平均TTFT加速比达10.05倍。

Comments Repeated paper uploading due to mistakes. See arXiv:2603.09046

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09046 2026-07-03 cs.CR cs.LG cs.OS 版本更新 92%

FlexServe: A Fast and Secure LLM Serving System for Mobile Devices with Flexible Resource Isolation

FlexServe: 一种适用于移动设备的高效且安全的LLM服务系统,具有灵活的资源隔离

Yinpeng Wu, Yitong Chen, Lixiang Wang, Jinyu Gu, Zhichao Hua, Yubin Xia

机构 * Institute of Parallel and Distributed Systems(并行与分布式系统研究所)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出FlexServe,一种适用于移动设备的高效且安全的LLM服务系统,通过灵活的资源隔离机制提升推理速度和安全性,采用多模型调度器优化多模型工作流,实验显示在TTFT和多模型工作流中均取得显著加速效果。

Comments 13 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01313 2026-07-03 cs.LG cs.AI cs.CL cs.CR 新提交 91%

Black-Box Inference of LLM Architectural Properties with Restrictive API Access

受限API访问下LLM架构属性的黑盒推断

Christopher Ellis, Shreyas Chaudhari, Mei-Yu Wang, Leighton Barnes, Giulia Fanti, José M. F. Moura

机构 * Carnegie Mellon University(卡内基梅隆大学) Pittsburgh Supercomputing Center(匹兹堡超级计算中心)

专题命中 效率与部署 :LLM(title,title_cn);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对当前商业LLM API仅返回单logit且禁止logit偏置的限制,提出NightVision方法,通过新型公共集提示技术和首令牌时间测量,估计隐藏维度、深度和参数数量,在32个开源模型上验证了可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28749 2026-07-03 cs.CY cs.AI cs.HC 版本更新 91%

Four Types of LLM Reliance and Their Predictors Among Undergraduate Writers: A Mixed-Methods Study at a Minority-Serving R1 University

本科写作者对LLM的四种依赖类型及其预测因素:一项在少数族裔服务R1大学的混合方法研究

Shahin Hossain

机构 * School of Education, University of Maryland, Baltimore County(大学教育学院,马里兰大学巴尔的摩县分校)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究在少数族裔服务大学通过混合方法识别出本科生的四种LLM依赖类型(策略型、工具型、对话型、依赖型),发现价值与成本信念预测依赖强度,AI素养预测依赖类型,且策略型用户在标准结果测量中得分最低。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01579 2026-07-03 cs.DC 新提交 90%

OmniPilot: An Uncertainty-Aware LLM Inference Advisor for Heterogeneous GPU Clusters

OmniPilot: 面向异构GPU集群的不确定性感知LLM推理顾问

D. Balamurugan, Thomas W. Bush

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出OmniPilot,通过共形校准分位数成本模型和分布外弃权层,为异构GPU集群上的LLM服务选择最优配置,预测吞吐量MAPE为6.2%,top-1准确率95%。

Comments 10 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01394 2026-07-03 cs.AI 新提交 90%

The Wiola Architecture for Efficient Small Language Models

Wiola架构:高效小型语言模型

Aryuemaan Kumar Chowdhury, Afreen Shaik, Yaparla Bhargavi, Brahma Kumar

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);SLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出Wiola小型语言模型架构,包含五种原创组件,在多个规模上超越GPT-2、LLaMA-2和Mistral。

Comments 7 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15588 2026-07-03 cs.CL 版本更新 90%

YuFeng-XGuard: A Reasoning-Centric, Interpretable, and Flexible Guardrail Model for Large Language Models

YuFeng-XGuard:一种以推理为中心、可解释且灵活的大语言模型护栏模型

Junyu Lin, Meizhen Liu, Xiufeng Huang, Jinfeng Li, Haiwen Hong, Xiaohan Yuan, Yuefeng Chen, Longtao Huang, Hui Xue, Ranjie Duan, Zhikai Chen, Yuchuan Fu, Defeng Li, Lingyao Gao, Yitong Yang

机构 * Alibaba-AAIG(阿里云-阿里人工智能研究院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出YuFeng-XGuard护栏模型系列,通过结构化风险预测(含风险类别、置信度分数及自然语言解释)实现可解释的多维风险感知,并采用分层推理范式平衡延迟与解释深度,同时引入动态策略机制解耦风险感知与策略执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02043 2026-07-03 cs.DC cs.AI 新提交 90%

Towards Load-Aware Prefill Deflection for Disaggregated LLM Serving

面向负载感知的预填充偏转用于分离式LLM服务

Shrikara Arun, Anjaly Parayil, Srikant Bharadwaj, Renee St. Amant, Victor Rühle

机构 * Microsoft(微软)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 针对分离式LLM服务中预填充节点过载而解码节点空闲的问题,提出一种主动预填充偏转调度器,通过将预填充作为分块步骤在解码节点上交错执行,消除节点间KV传输,显著降低P95 TTFT并提高SLO达标率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01601 2026-07-03 cs.AI 新提交 90%

SemHash-LLM: A Multi-Granularity Semantic Hashing Framework for Document Deduplication

SemHash-LLM:一种用于文档去重的多粒度语义哈希框架

Xinyi Fang, Kejian Tong, Jiabei Liu, Tao Ning, Yuhang He

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 提出多粒度语义哈希框架SemHash-LLM,融合语义投影哈希、注意力加权MinHash、对比边界学习和选择性LLM裁决,实现高效的大规模文档去重。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11357 2026-07-03 cs.DC cs.AI cs.AR cs.PF 新提交 90%

TileFuse: A Fused Mixed-Precision Kernel Library for Efficient Quantized LLM Inference on AMD NPUs

TileFuse:用于AMD NPU上高效量化LLM推理的融合混合精度内核库

Wesley Pang, Gregory Hyegang Jun, Feiyang Liu, Deming Chen

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 针对边缘NPU上量化LLM部署困难,提出TileFuse库,通过融合解包、反量化与GEMM/GEMV内核,并设计交错预分块布局与数据流,在XDNA2上实现AWQ格式原生支持,性能提升最高281%,能耗降低64.6%。

Comments 13 pages excluding reference, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14331 2026-07-03 cs.LG 版本更新 90%

LLM Priors for ERM over Programs

程序上经验风险最小化的LLM先验

Shivam Singhal, Priyadarsi Mishra, Eran Malach, Tomer Galanti

机构 * LLM Priors for ERM over Programs(LLM 优先级用于程序上的经验风险最小化)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 提出LLM-PV方法,利用预训练LLM作为先验,通过提议-验证机制实现程序类上的ERM选择,无需穷举枚举,在算法任务上从少量样本恢复规则并泛化到更长序列。

Comments The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01617 2026-07-03 cs.AR 新提交 89%

3DLS: A 3D Logic-Stacked Architecture for Disaggregated LLM Serving

3DLS:一种用于分离式LLM服务的3D逻辑堆叠架构

Jaehun Lee, In-Jun Jung, Joo-Young Kim

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对预填-解码分离与张量并行中KV缓存传输和TP集合共享互连导致的关键路径争用问题,提出3D逻辑堆叠架构3DLS,通过垂直互连分离流量,提升吞吐量达1.49倍,降低端到端延迟60.2%。

Comments Accepted to IEEE Computer Architecture Letters (CAL), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02391 2026-07-03 cs.DC cs.LG 新提交 89%

WattGPU: Predicting Inference Power and Latency on Unseen GPUs and LLMs

WattGPU: 在未见过的GPU和LLM上预测推理功耗和延迟

Mauricio Fadel Argerich, Jonathan Fürst, Marta Patiño-Martínez

机构 * Universidad Politécnica de Madrid(马德里理工大学) Zurich University of Applied Sciences(苏黎世应用科学大学)

专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出WattGPU模型,利用公开的LLM元数据和GPU规格,无需硬件访问即可预测平均GPU功耗和令牌间延迟,在未见过的GPU和LLM上误差低至3.4%,优于基线方法。

Comments Accepted at 1st Workshop on Sustainability and Resource-Efficiency of Artificial Intelligence @ IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28565 2026-07-03 cs.PF cs.AI cs.AR 版本更新 89%

KernelSight-LM: A Kernel-Level LLM Inference Simulator

KernelSight-LM: 一种内核级LLM推理模拟器

Xiteng Yao, Taeho Kim, Hengzhi Pei, Xinle Liu, Kyle Ulrich, Leonard Lausen, Ashish Khetan, Xiang Song, George Karypis, Martin Herbordt

机构 * Amazon Web Services(亚马逊网络服务) Boston University(波士顿大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出KernelSight-LM,一种细粒度推理模拟器,通过分解服务步骤为屋顶线内核模型、通信模型和主机开销模型,并集成前缀缓存和连续批处理,实现跨GPU代际或少量目标数据下的精确延迟预测,支持硬件/软件协同设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10431 2026-07-03 cs.LG 版本更新 88%

QTALE: Quantization-Robust Token-Adaptive Layer Execution for LLMs

QTALE: 面向LLM的量化鲁棒令牌自适应层执行

Kanghyun Noh, Jinheon Choi, Yulhwa Kim

机构 * Department of Semiconductor Systems Engineering, Sungkyunkwan University(成均馆大学半导体系统工程系)

专题命中 效率与部署 :LLM(title_cn,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出QTALE框架,通过多样化训练路径和后训练调整机制,实现令牌自适应层执行与量化的无缝集成,在保持精度的同时降低计算和内存开销。

Comments 22 pages, 10 figures, 20 tables,

Journal ref ICML 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07571 2026-07-03 cs.LG cs.AI 新提交 88%

Enabling KV Caching of Shared Prefix for Diffusion Language Models

为扩散语言模型启用共享前缀的KV缓存

Younghun Go, Jaehoon Han, Changyong Shin, Chuck Yoo, Gyeongsik Yang

机构 * Korea University(高丽大学)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.AI、cs.LG

AI总结 针对扩散语言模型中双向注意力导致共享前缀KV不稳定的问题,提出双向前缀缓存(bicache),通过动态识别安全层深度重用KV,避免精度崩溃,提升吞吐量36.3%-98.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03056 2026-07-03 cs.AI 版本更新 87%

SkillDAG: Self-Evolving Typed Skill Graphs for LLM Skill Selection at Scale

SkillDAG:面向大规模LLM技能选择的自演化类型化技能图

Tong Bai, Zhenglin Wan, Pengfei Zhou, Xingrui Yu, Yang You, Ivor W. Tsang

机构 * Fudan University(复旦大学) National University of Singapore(国立新加坡大学) CFAR A*STAR

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 提出SkillDAG,通过类型化有向图建模技能间关系,并作为推理时可调用的结构化检索接口,支持在线演化,在ALFWorld和SkillsBench上显著超越基线。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01678 2026-07-03 cs.LG cs.DC 新提交 85%

SCAPE: Accurate and Efficient LLM Training with Extreme Sparse Communication

SCAPE:基于极端稀疏通信的高效准确大语言模型训练

Mingkai Zheng, Junlin Chen, Haotian Xie, Zhao Zhang

机构 * Rutgers University(罗格斯大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出SCAPE分布式优化器,利用AdamS的一阶矩稳定性实现高稀疏度通信,通过基于一阶矩的掩码生成、分片并行和延迟掩码策略,在90%-99%稀疏度下保持模型质量,并减少端到端训练时间达43.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28864 2026-07-03 cs.CV 版本更新 85%

On Test-Time Scaling for Vision-Language Models

关于视觉-语言模型的测试时扩展

Fawaz Sammani, Tzoulio Chamiti, Nikos Deligiannis

机构 * ETRO Department, Vrije Universiteit Brussel(布鲁塞尔自由大学ETRO部门) imec

专题命中 效率与部署 :language model(title,abstract);LLM(abstract_cn);large language model(abstract)

AI总结 本文系统研究了视觉-语言模型(LVLM)的测试时扩展方法,发现小型高性能模型受益最大,性能提升可达30%,并揭示了视觉信息在推理链早期编码后图像令牌贡献显著下降。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07843 2026-07-03 cs.LG cs.AI cs.CL 版本更新 85%

ThreadWeaver: Adaptive Threading for Efficient Parallel Reasoning in Language Models

ThreadWeaver:自适应线程化实现语言模型高效并行推理

Long Lian, Sida Wang, Felix Juefei-Xu, Tsu-Jui Fu, Xiuyu Li, Adam Yala, Trevor Darrell, Alane Suhr, Yuandong Tian, Xi Victoria Lin

机构 * UC Berkeley(伯克利大学) UCSF(旧金山大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出ThreadWeaver框架,通过两阶段并行轨迹生成、基于trie的展开设计和并行化感知强化学习,在保持与顺序推理模型相当准确率的同时,显著降低推理延迟。

Comments Accepted as an oral paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02512 2026-07-03 cs.LG cs.AI cs.CL 新提交 83%

Program-as-Weights: A Programming Paradigm for Fuzzy Functions

程序即权重:一种模糊函数的编程范式

Wentao Zhang, Liliana Hotsko, Woojeong Kim, Pengyu Nie, Stuart Shieber, Yuntian Deng

机构 * University of Waterloo(滑铁卢大学) Cornell University(康奈尔大学) Harvard University(哈佛大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);foundation model(abstract);prompting(abstract)

AI总结 提出模糊函数编程范式,通过Program-as-Weights方法将自然语言规范编译为轻量可执行神经工件,在保持性能的同时大幅降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26180 2026-07-03 cs.DB cs.AI cs.CL 版本更新 82%

Evergreen: Efficient Claim Verification for Semantic Aggregates

Evergreen:用于语义聚合的高效声明验证

Alexander W. Lee, Benjamin Han, Shayak Sen, Sam Yeom, Ugur Cetintemel, Anupam Datta

机构 * Brown University(布朗大学) Snowflake Inc.(Snowflake公司)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 Evergreen将声明验证转化为语义查询处理任务,通过定制优化和溯源捕获,减少LLM调用成本和延迟,提升验证质量与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25421 2026-07-03 cs.LG cs.AI 版本更新 82%

FED-FSTQ: Fisher-Guided Token Quantization for Communication-Efficient Federated Fine-Tuning of LLMs on Edge Devices

FED-FSTQ:基于Fisher的令牌量化用于边缘设备上通信高效联邦微调大型语言模型

Changyu Li, Shuanghong Huang, Jiashen Liu, Ming Lei, Jidu Xing, Kaishun Wu, Lu Wang, Fei Luo

机构 * School of Computing and Information Technology, Great Bay University(计算与信息学院,大亚湾大学) Beijing Institute of Technology(北京理工大学) University of Warwick(沃里克大学) City University of Hong Kong (Dongguan)(香港城市大学(东莞)) Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) College of Computer Science and Software Engineering, Shenzhen University(计算机科学与软件工程学院,深圳大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Fed-FSTQ,一种基于Fisher的令牌量化方法,用于在边缘设备上高效联邦微调大型语言模型,通过非均匀混合精度量化和重要性感知令牌选择,减少通信开销并提升训练效率。

Comments 18 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21254 2026-07-03 cs.LG cs.CL 版本更新 82%

Hyperloop Transformers

超环变压器

Abbas Zeitoun, Lucas Torroba-Hennigen, Yoon Kim

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种改进语言模型参数效率的超环变压器架构,通过循环Transformer和超连接技术,在较少参数下优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01851 2026-07-03 cs.CV 新提交 82%

Geometric Foundation Model Distillation for Efficient Lunar 3D Reconstruction

几何基础模型蒸馏用于高效月球三维重建

Clémentine Grethen, Florient Chouteau, Géraldine Morin, Simone Gasparini

机构 * IRIT, University of Toulouse(图卢兹大学IRIT研究所) Airbus Defence and Space(空中客车防务与航天公司)

专题命中 效率与部署 :foundation model(title,abstract);pretraining(abstract)

AI总结 针对硬件受限场景,通过知识蒸馏将MASt3R模型压缩7倍,保留大部分重建精度,提出SVD初始化方法提升训练稳定性,并揭示编码器类型、蒸馏策略等关键因素。

Comments Accepted to ECCV 2026, code can be accessed via https://clementinegrethen.github.io/publications/ECCV.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00224 2026-07-03 math.ST cs.IT cs.LG math.IT stat.ML stat.TH 新提交 81%

Sample Complexities of Estimating Gumbel--Max Watermark Proportions with and without Reduction to Pivotal Statistics

估计Gumbel-Max水印比例(含和不含降为枢轴统计量)的样本复杂度

Shuwen Chai, Qiaosen Wang

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究在Gumbel-max水印机制下,估计文档中水印文本比例的问题,比较了完整观测和降为枢轴统计量两种情形,提出了相应估计器并建立了匹配的样本复杂度下界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01607 2026-07-03 cs.AR 新提交 80%

MxGLUT: A Reconfigurable LUT-Centric Broadcast Dataflow Accelerator for Mixed-Precision GEMM

MxGLUT:面向混合精度GEMM的可重构LUT中心广播数据流加速器

Weiyu Zhou, Chen Ding, Mingyuan Liu, Liangyu Gan, Yukun Feng, Hao Jia, Haoming Chu, Lirong Zheng, Ning Ma, Yuxiang Huan

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出MxGLUT,一种基于可重构LUT中心广播数据流的混合精度GEMM加速器,通过统一LUT计算机制支持FP8-INT4和FP8-FP8,消除独立FP数据路径,在预填充和解码阶段分别实现2.16倍和1.49倍延迟加速,面积和能效显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01876 2026-07-03 cs.CV cs.AI 新提交 79%

SAB-LVLM: Significance-Aware Binarization for Large Vision-Language Models

SAB-LVLM: 面向大型视觉-语言模型的重要性感知二值化

Qi Lyu, Jiahua Dong, Baichen Liu, Xudong Wang, Mingfei Han, Yulun Zhang, Fahad Shahbaz Khan, Salman Khan, Lianqing Liu, Zhi Han

机构 * State Key Laboratory of Robotics and Intelligent Systems(机器人学国家重点实验室) Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 提出SAB-LVLM方法,通过构建空间重要性图与模态引导整合策略,实现跨层跨模态权重重要性感知的二值化,在约1比特压缩下优于现有二值化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01710 2026-07-03 cs.AI 新提交 79%

Generic Expert Coverage for Pruning SparseMixture-of-Experts Language Models

用于剪枝稀疏混合专家语言模型的通用专家覆盖

Yongqin Zeng, Sicheng Pan, Jiale Wang, Hai-tao Zheng, Hong-Gee Kim, Chunxia Ma, XiuTeng Zhou

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 提出Generic TB-Coverage方法,利用通用文本语料库对每个专家分别评估效用,通过固定预算覆盖规则保留各语料库的高效用专家,无需下游校准数据即可有效剪枝MoE模型。

详情

展开后加载摘要…

URL PDF HTML 收藏