arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22280 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22280 篇

2509.05276 2026-05-11 cs.LG cs.AI cs.CL 88%

SpikingBrain: Spiking Brain-inspired Large Models

SpikingBrain:基于大脑的高效大模型

Yuqi Pan, Yupeng Feng, Jinghao Zhuang, Siyu Ding, Han Xu, Zehao Liu, Bohan Sun, Yuhong Chou, Xuerui Qiu, Anlin Deng, Anjie Hu, Shurong Wang, Peng Zhou, Man Yao, Jibin Wu, Jian Yang, Guoliang Sun, Bo Xu, Guoqi Li

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Key Laboratory of Brain-Inspired General Intelligence Large Model(北京脑启发通用智能大模型重点实验室) Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology(脑认知与脑启发智能技术重点实验室) Beijing Academy of Artificial Intelligence(北京人工智能研究院) The Hong Kong Polytechnic University(香港理工大学) Zhongguancun Academy(中关村学院) Beihang University(北航) Zhejiang University(浙江大学) LuxiTech MetaX Integrated Circuit Co., Ltd(MetaX集成电路有限公司)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SpikingBrain,一种受大脑启发的大模型,通过高效架构和算法优化,在非NVIDIA平台实现大规模LLM训练与推理,提升长上下文处理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13727 2026-05-08 cs.LG cs.AI cs.CL 88%

Attribution-Guided Pruning for Insight and Control: Circuit Discovery and Targeted Correction in Small-scale LLMs

基于归因的剪枝用于洞察与控制:小型LLM中的回路发现与针对性修正

Sayed Mohammad Vakilzadeh Hatefi, Maximilian Dreyer, Reduan Achtibat, Patrick Kahardipraja, Thomas Wiegand, Wojciech Samek, Alexander Binder, Sebastian Lapuschkin

机构 * Data Science Center ScaDS.AI, Universität Leipzig(ScaDS.AI数据科学中心,莱比锡大学) Department of Artificial Intelligence, Fraunhofer Heinrich-Hertz-Institute(人工智能系,弗劳恩霍夫 Heinrich-Hertz 研究所) Department of Electrical Engineering and Computer Science, Technische Universität Berlin(电气工程与计算机科学系,柏林技术大学) BIFOLD - Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所) Centre of eXplainable Artificial Intelligence, Technological University Dublin(可解释人工智能中心,都柏林技术大学)

专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于归因的剪枝方法,通过识别对模型输出贡献最大的参数,用于小型LLM中的回路发现与针对性修正,通过剪枝减少有毒输出和重复文本生成,验证了方法的通用性。

Comments Work in progress (9 pages manuscript, 3 pages references, 16 pages appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27002 2026-05-01 cs.CR 88%

Membership Inference Attacks Against Video Large Language Models

针对视频大语言模型的成员推断攻击

Wei Song, Yuxin Cao, Ziqi Ding, Yi Liu, Gelei Deng, Yuekang Li

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 本文研究了针对视频大语言模型的黑盒成员推断攻击,通过温度扰动生成与视频感知难度特征结合,验证了视频大语言模型对隐私风险的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26152 2026-04-30 cs.SE 88%

AI Observability for Large Language Model Systems: A Multi-Layer Analysis of Monitoring Approaches from Confidence Calibration to Infrastructure Tracing

为大语言模型系统设计的AI可观测性:从置信度校准到基础设施追踪的多层分析

Twinkll Sisodia

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 本文分析了大语言模型在生产环境中的可观测性需求,探讨了从置信度校准到基础设施追踪的多层监控方法,识别了当前领域中的关键缺口。

Comments 10 pages, 2 figures, 3 tables, survey paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17783 2026-04-29 cs.PF cs.AI cs.CL cs.LG 88%

Energy-Aware LLMs: A step towards sustainable AI for downstream applications

面向能源效率的大型语言模型:迈向可持续AI的一步

Nguyen Phuc Tran, Brigitte Jaumard, Oscar Delgado

机构 * Concordia University(康科迪亚大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种端到端的管道,研究在通信网络故障工单分析中LLM的能效与性能的权衡,并通过两个真实数据集评估了根因分析和响应反馈任务的性能提升。

Comments This work has been submitted to V. International Conference on Electrical, Computer and Energy Technologies (ICECET 2025) for possible publication

Journal ref 2025 5th International Conference on Electrical, Computer and Energy Technologies (ICECET)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14582 2026-04-21 cs.CV 88%

OmniZip: Audio-Guided Dynamic Token Compression for Fast Omnimodal Large Language Models

OmniZip:面向快速多模态大语言模型的音频引导动态令牌压缩

Keda Tao, Kele Shao, Bohan Yu, Weiqiang Wang, Jian liu, Huan Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Ant Group(蚂蚁集团) Shanghai Innovation Institute(上海创新研究院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出OmniZip,一种无需训练的音频引导多模态令牌压缩框架,通过动态压缩音频视频令牌提升推理速度和内存效率,保持模型性能。

Comments [CVPR 2026] Code Link: https://github.com/KD-TAO/OmniZip

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09547 2026-04-14 cs.CV 88%

Tango: Taming Visual Signals for Efficient Video Large Language Models

Tango:驯服视觉信号以提高视频大语言模型的效率

Shukang Yin, Sirui Zhao, Hanchao Wang, Baozhi Jia, Xianquan Wang, Chaoyou Fu, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) Reconova AI Lab(Reconova AI实验室) Nanjing University(南京大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 Tango通过改进注意力选择和相似性聚类方法,优化视频大语言模型的视觉信号利用,实现在保留10%视频token时性能损失仅0.1%,推理速度提升1.88倍。

Comments Code: https://github.com/xjtupanda/Tango

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08050 2026-04-10 cs.CV 88%

ABMAMBA: Multimodal Large Language Model with Aligned Hierarchical Bidirectional Scan for Efficient Video Captioning

ABMAMBA: 多模态大语言模型中的对齐层次双向扫描用于高效的视频描述

Daichi Yashima, Shuhei Kurita, Yusuke Oda, Shuntaro Suzuki, Seitaro Otsuki, Komei Sugiura

机构 * Keio University(庆应义塾大学) National Institute of Informatics(国立信息学研究所) National Institute of Informatics Research and Development Center for Large Language Models(国立信息学研究所大型语言模型研发中心)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出ABMamba,一种具有线性计算复杂度的多模态大语言模型,通过替代二次注意力机制,实现视频序列的高效处理,在视频描述任务中表现出色。

Comments Accepted to ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07674 2026-04-10 cs.CV 88%

Weight Group-wise Post-Training Quantization for Medical Foundation Model

按权重的后训练量化用于医疗基础模型

Yineng Chen, Peng Huang, Aozhong Zhang, Hui Guo, Penghang Yin, Shu Hu, Shao Lin, Xin Li, Tzu-Jen Kao, Balakrishnan Prabhakaran, MingChing Chang, Xin Wang

机构 * University at Albany, SUNY(纽约州立大学奥尔巴尼分校) Southwest Jiaotong University(西南交通大学) Purdue University(普渡大学) GE HealthCare(通用电气医疗)

专题命中 效率与部署 :foundation model(title,abstract);post-training(title,abstract)

AI总结 本文提出Permutation-COMQ算法,通过简单点积和四舍五入操作实现无反向传播的后训练量化,采用权重感知策略优化通道结构,提升2/4/8位量化精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14273 2026-04-10 stat.OT 88%

Using large language models for sensitivity analysis in causal inference: case studies on Cornfield inequality and E-value

利用大型语言模型进行因果推断中的敏感性分析:关于Cornfield不等式和E值的案例研究

Qingyan Xiang, Jiahao Zhang, Bojian Feng

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 本文探讨了利用大型语言模型进行敏感性分析的可行性,评估了四种模型在Cornfield不等式和E值计算中的准确性及解释能力,发现ChatGPT、Claude和Gemini表现良好,而DeepSeek存在轻微偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08410 2026-04-10 cs.CV 88%

Towards Effective Long Video Understanding of Multimodal Large Language Models via One-shot Clip Retrieval

通过一次剪辑检索增强多模态大语言模型的长视频理解

Tao Chen, Shaobo Ju, Qiong Wu, Chenxin Fang, Kun Zhang, Jun Peng, Hui Li, Yiyi Zhou, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China(多媒体可信感知与高效计算教育部重点实验室) Xiamen University(厦门大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出OneClip-RAG方法,通过一次剪辑检索提升多模态大语言模型对长视频的理解能力,改进知识完整性和语义连贯性,并设计新数据集和训练方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19433 2026-04-09 cs.CV 88%

dMLLM-TTS: Self-Verified and Efficient Test-Time Scaling for Diffusion Multi-Modal Large Language Models

dMLLM-TTS:用于扩散多模态大语言模型的自验证和高效测试时间扩展

Yi Xin, Siqi Luo, Tianxiang Xu, Qi Qin, Haoxing Chen, Kaiwen Zhu, Zhiwei Zhang, Yangfan He, Rongchao Zhang, Jinbin Bai, Shuo Cao, Bin Fu, Junjun He, Yihao Liu, Yuewen Cao, Xiaohong Liu

机构 * Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Lab(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) National University of Singapore(新加坡国立大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出dMLLM-TTS框架,通过轨迹探索扩展和迭代细化扩展两个互补的扩展轴,提升生成多样性和稳定性,同时通过自验证机制提高效率,实验表明在GenEval基准上生成质量显著提升且效率提高6倍。

Comments Project page: https://github.com/Alpha-VLLM/Lumina-DiMOO

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03048 2026-04-06 cs.SE 88%

Combining Static Code Analysis and Large Language Models Improves Correctness and Performance of Algorithm Recognition

结合静态代码分析和大语言模型提高算法识别的正确性和性能

Denis Neumüller, Sebastian Boll, David Schüler, Matthias Tichy

专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract);prompting(abstract)

AI总结 本文研究了结合大语言模型与静态代码分析在算法识别中的效果,发现该方法能显著降低运行时间并提升F1分数,同时验证了模型在标识符混淆下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04270 2026-04-01 cs.NE 88%

Towards Automated Knowledge Transfer in Evolutionary Multitasking via Large Language Models

通过大语言模型实现进化多任务优化中的自动化知识转移

Xuebin Lyu, Yuxiao Huang, XueFeng Chen, Jing Tang, Liang Feng, Kay Chen Tan

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出SKTD框架,利用大语言模型自动生成进化多任务优化中的知识转移方法,提升异构任务和多场景下的优化效果与泛化能力。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10848 2026-04-01 cs.CL cs.AI cs.LG 88%

Accelerating Diffusion Large Language Models with SlowFast Sampling: The Three Golden Principles

通过SlowFast采样加速扩散大语言模型:三大黄金原则

Qingyan Wei, Yaojie Zhang, Zhiyuan Liu, Puyu Zeng, Yuxuan Wang, Biqing Qi, Dongrui Liu, Linfeng Zhang

机构 * EPIC Lab, Shanghai Jiao Tong University(上海交通大学 EPIC 实验室) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 效率与部署 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SlowFast采样策略,通过三大原则动态切换探索与加速解码阶段,提升扩散语言模型的生成速度与效率。

Comments 11 pages; 5 figures;

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27650 2026-03-31 cs.CV 88%

V-CAST: Video Curvature-Aware Spatio-Temporal Pruning for Efficient Video Large Language Models

V-CAST:面向高效视频大语言模型的曲率感知时空剪枝

Xinying Lin, Xuyang Liu, Yiyu Wang, Teng Ma, Wenqi Ren

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Shenzhen Loop Area Institute(深圳河套学院) Sichuan University(四川大学) EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出V-CAST,一种无需训练的视频长上下文推理剪枝策略,通过曲率引导的时空分配模块和双锚点空间选择机制,提升视频大语言模型的效率与性能。

Comments Code: \url{https://github.com/xinyouu/V-CAST}

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.12214 2026-03-19 cs.CR 88%

InferDPT: Privacy-Preserving Inference for Closed-box Large Language Model

InferDPT:闭箱大语言模型的隐私保护推断

Meng Tong, Kejiang Chen, Jie Zhang, Yuang Qi, Weiming Zhang, Nenghai Yu, Tianwei Zhang, Zhikun Zhang

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出InferDPT框架,通过差分隐私机制实现闭箱大语言模型的隐私保护推断,结合扰动模块和提取模块,提升文本生成质量并抵御嵌入式修订攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16002 2026-03-18 cs.CL cs.AI cs.LG 88%

RadAnnotate: Large Language Models for Efficient and Reliable Radiology Report Annotation

RadAnnotate:用于高效可靠放射科报告标注的大型语言模型

Saisha Pradeep Shetty, Roger Eric Goldman, Vladimir Filkov

机构 * Department of Computer Science, University of California, Davis, CA, USA(加州大学戴维斯分校计算机科学系) Department of Radiology, University of California, Davis, CA, USA(加州大学戴维斯分校放射学系)

专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出RadAnnotate框架,通过检索增强合成报告和基于置信度的选择性自动化,减少放射科报告标注的人力成本,提升标注效率和可靠性。

Comments 10 pages, 3 figures. Accepted at AMIA Amplify Informatics Summit 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05385 2026-03-17 cs.CV 88%

ShaRP: SHAllow-LayeR Pruning for Efficient Video Large Language Models

ShaRP: 用于高效视频大语言模型的浅层层剪枝

Yingjie Xia, Tao Liu, Jinglei Shi, Qingsong Xie, Heng Guo, Jian Yang, Xi Wang

机构 * VCIP & TMCC & DISSec, College of Computer Science, Nankai University(VCIP与TMCC与DISSec学院,南开大学计算机科学学院) LIX, Ecole Polytechnique, IP Paris(LIX,巴黎高等理工学院,IP巴黎) OPPO Research Institute(OPPO研究院) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出ShaRP框架,通过改进局部信息聚合、校准位置偏差和减少冗余,解决浅层解码器剪枝中的性能下降问题,实现97.2%的性能保留和86%的TFLOPs减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13251 2026-03-11 cs.NE 88%

Large Language Model Assisted Automated Algorithm Generation and Evolution via Meta-black-box optimization

通过元黑箱优化实现大型语言模型辅助的自动算法生成与进化

Xu Yang, Rui Wang, Kaiwen Li, Wenhua Li, Weixiong Huang

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 本研究提出AwesomeDE,利用大型语言模型生成约束进化算法的更新规则,提升计算效率和解的准确性,并展示其在不同领域中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18352 2026-02-23 cs.HC cs.CR cs.SE 88%

Qualitative Coding Analysis through Open-Source Large Language Models: A User Study and Design Recommendations

通过开源大语言模型进行定性编码分析:一项用户研究与设计建议

Tung T. Ngo, Dai Nguyen Van, Anh-Minh Nguyen, Phuong-Anh Do, Anh Nguyen-Quoc

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出ChatQDA,一个基于开源LLMs的本地化定性分析工具,通过用户研究发现其在隐私保护和解释一致性方面的挑战,并提出设计建议以提升信任度。

Comments 6 pages. Accepted as Poster to CHI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01635 2026-02-23 cs.SE 88%

MIMIC: Integrating Diverse Personality Traits for Better Game Testing Using Large Language Model

MIMIC:整合多样化人格特质以通过大型语言模型实现更有效的游戏测试

Yifei Chen, Sarra Habchi, Lili Wei

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 MIMIC通过整合多样化人格特质,提升游戏测试的覆盖率和多样性,有效发现边缘情况。

Comments 13 pages, 7 figures, 6 tables. This paper is accepted by the 40th IEEE/ACM International Conference on Automated Software Engineering, ASE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17196 2026-02-20 cs.CV 88%

EntropyPrune: Matrix Entropy Guided Visual Token Pruning for Multimodal Large Language Models

EntropyPrune: 基于矩阵熵的视觉令牌修剪用于多模态大语言模型

Yahong Wang, Juncheng Wu, Zhangkai Ni, Chengmei Yang, Yihang Liu, Longzhen Yang, Yuyin Zhou, Ying Wen, Lianghua He

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) University of California, Santa Cruz(加州大学圣克ruz分校) East China Normal University(华东师范大学) Shanghai Eye Disease Prevention and Treatment Center(上海眼病预防与治疗中心)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 EntropyPrune通过矩阵熵指导的视觉令牌修剪方法,提升多模态大语言模型的推理效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14102 2026-02-17 cs.HC 88%

DALL: Data Labeling via Data Programming and Active Learning Enhanced by Large Language Models

DALL:通过数据编程和主动学习增强的大语言模型进行数据标注

Guozheng Li, Ao Wang, Shaoxiang Wang, Yu Zhang, Pengcheng Cao, Yang Bai, Chi Harold Liu

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 DALL通过数据编程和主动学习结合大语言模型,提升文本标注的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10869 2026-02-12 cs.CR 88%

Agentic Knowledge Distillation: Autonomous Training of Small Language Models for SMS Threat Detection

代理知识蒸馏:自主训练小型语言模型用于短信威胁检测

Adel ElZemity, Joshua Sylvester, Budi Arief, Rogério De Lemos

专题命中 效率与部署 :language model(title);small language model(title);LLM(abstract);SLM(abstract)

AI总结 本研究提出代理知识蒸馏方法,通过自主训练小型语言模型实现高效的短信威胁检测,实验显示教师LLM的选择对性能影响显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09483 2026-02-11 cs.CV 88%

Beyond Next-Token Alignment: Distilling Multimodal Large Language Models via Token Interactions

超越单个词对齐:通过令牌交互蒸馏多模态大语言模型

Lin Chen, Xiaoke Zhao, Kun Ding, Weiwei Feng, Changtao Miao, Zili Wang, Wenxuan Guo, Ying Wang, Kaiyuan Zheng, Bo Zhang, Zhe Li, Shiming Xiang

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所信息与智能系统研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Zhejiang University(浙江大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 Align-TI通过令牌交互改进知识蒸馏,实现多模态大语言模型的高效压缩与性能提升

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22936 2026-02-06 cs.CV 88%

PPE: Positional Preservation Embedding for Token Compression in Multimodal Large Language Models

PPE:用于多模态大语言模型中token压缩的位置保持嵌入

Mouxiao Huang, Borui Jiang, Dehua Zheng, Hailin Hu, Kai Han, Xinghao Chen

机构 * Huawei Technologies(华为技术有限公司)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 PPE通过保持位置信息提升多模态大语言模型的token压缩效率和性能

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20322 2026-02-05 cs.CV 88%

Dynamic Pyramid Network for Efficient Multimodal Large Language Model

动态金字塔网络用于高效多模态大语言模型

Hao Ai, Kunyi Wang, Zezhou Wang, Hao Lu, Jin Tian, Yaxin Luo, Peng Xing, Jen-Yuan Huang, Huaxia Li, Gen luo

机构 * Beihang University(北航大学) Shanghai AI Laboratory(上海人工智能实验室) KAUST(卡塔尔大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Technical University Of Denmark(丹麦技术大学) Nanjing University of Science and Technology(南京理工大学) Peking University(北京大学) Xiaohongshu Inc(小红书公司)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 动态金字塔网络通过分层结构和动态池化专家提升多模态大语言模型的效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01901 2026-02-03 cs.CV 88%

Q Cache: Visual Attention is Valuable in Less than Half of Decode Layers for Multimodal Large Language Model

Q Cache:视觉注意力在少于一半的解码层中具有价值用于多模态大语言模型

Jiedong Zhuang, Lu Lu, Ming Dai, Rui Hu, Jian Chen, Qiang Liu, Haoji Hu

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 Q Cache通过跨层共享相似注意力模式,减少多模态大语言模型中的KV缓存使用量,提升吞吐量并保持性能

Comments Accepted by AAAI26

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20198 2026-02-03 cs.CV 88%

A Survey of Token Compression for Efficient Multimodal Large Language Models

多模态大语言模型高效性中的标记压缩综述

Kele Shao, Keda Tao, Kejia Zhang, Sicheng Feng, Mu Cai, Yuzhang Shang, Haoxuan You, Can Qin, Yang Sui, Huan Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Xiamen University(厦门大学) National University of Singapore(新加坡国立大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of Central Florida(佛罗里达大学) Salesforce AI Research(Salesforce AI研究) Rice University(德克萨斯大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 本文综述了多模态大语言模型中标记压缩技术,分类讨论了图像、视频和音频三种模态的压缩方法及其机制,旨在推动该领域的发展。

Comments For ongoing updates and to track the latest advances in this promising area, we maintain a public repository: https://github.com/cokeshao/Awesome-Multimodal-Token-Compression

详情

展开后加载摘要…

URL PDF HTML 收藏