arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-10 至 2026-08-10 共收录 56 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 56 篇

2608.06723 2026-08-10 cs.LG cs.AI 新提交 92%

Multi-Level Modeling of Large Language Model Inference Latency and Energy via Hybrid Analytical--Machine-Learning Predictors

基于混合分析-机器学习预测器的大语言模型推理延迟与能耗的多级建模

Saeid Shokoufa, Mohammad Erfan Sadeghi, Mehdi Kamal, Massoud Pedram

机构 * University of Southern California(南加州大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究提出混合三级框架HYMELL,结合分析建模与机器学习,在NVIDIA H100 GPU上对LLaMA 3 8B的预填充、解码阶段误差均低于5%,可实现LLM推理延迟与能耗的精准估计及能效优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06867 2026-08-10 cs.CL 新提交 92%

LLMRouter: Unified Infrastructure for Developing, Evaluating, and Deploying LLM Routers

LLMRouter:用于开发、评估和部署LLM路由器的统一基础设施

Tao Feng, Fangxu Yu, Haozhen Zhang, Zhongjie Dai, Liangqi Yuan, Zijie Lei, Weizhi Zhang, Kunlun Zhu, Haodong Yue, Keyang Xuan, Ge Liu, Jiaxuan You

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Maryland, College Park(马里兰大学帕克分校) Nanyang Technological University(南洋理工大学) Purdue University(普渡大学) University of Illinois Chicago(芝加哥伊利诺伊大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对现有LLM路由器难以公平比较和扩展的问题,研究提出LLMRouter统一基础设施,构建含多类任务的基准xRouteBench,发现学习型路由器等的性能优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06557 2026-08-10 cs.DC cs.LG 新提交 92%

Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving

Cascade:利用感知SLO的延迟预算实现公平且高吞吐量的LLM推理服务

Muhammad Adnan, Rohan Mahapatra, Prashant J. Nair, Daniel Berger, Pantea Zardoshti, Rodrigo Fonseca, Esha Choukse

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 Cascade是一款LLM服务系统,利用单请求延迟预算协同调度与KV缓存管理,在保留异构请求公平性的同时,使LLM推理服务吞吐量最高提升2.4倍,SLO违规率降低40%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16336 2026-08-10 cs.CR cs.AI cs.CY 版本更新 92%

On Seeding Watermarks to Detect Verbatim LLM Copy-Paste Responses

检测作业中的直接LLM复制粘贴

Aizierjiang Aiersilan, Artin Yousefi, Robert Pless

机构 * The George Washington University(乔治·华盛顿大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SteganoPrompt工具,通过在作业提示中嵌入隐形指令,使LLM在响应时生成特征签名,帮助教师检测学生直接复制粘贴模型回复的行为。

Comments We are pleased to announce that this paper has been accepted by the 9th AAAI/ACM Conference on AI, Ethics, and Society (AIES 2026). We appreciate the valuable feedback from the reviewers and look forward to sharing our findings with the community

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07419 2026-08-10 cs.LG 新提交 90%

Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration

超越事后温度缩放:用于大语言模型校准的双层优化方法

Ruochen Jin, Zhanliang Wang, Zongyu Dai, Jiancong Xiao, Bojian Hou

机构 * Dartmouth College(达特茅斯学院) University of Pennsylvania(宾夕法尼亚大学) National University of Singapore(新加坡国立大学)

专题命中 效率与部署 :LLM(title,summary_cn);language model(abstract,comments);large language model(abstract);分类 cs.LG

AI总结 针对LLM偏好对齐导致的过度自信与校准问题,提出基于双层优化的校准方法,通过最大化预测分布熵实现,在多项选择与开放式问答任务中提升了校准效果与域外泛化能力。

Comments Third Conference on Language Modeling (COLM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07126 2026-08-10 cs.HC cs.AI 新提交 90%

PHOENIX: Fine-Tuned SLM-Powered Autonomous Satellite Lifetime Extension via Predictive Self-Healing and Multi-Agent AI Recovery

PHOENIX:通过预测性自修复与多智能体AI恢复实现的经微调小型语言模型驱动的自主卫星寿命延长

Sumaiya Islam, Harsha Kumara Moraliyage

专题命中 效率与部署 :SLM(title,summary_cn);language model(abstract);small language model(abstract);分类 cs.AI

AI总结 该研究针对CubeSat在轨故障无法及时修复导致寿命不足的问题,提出PHOENIX系统,利用微调SLM与多智能体AI实现自主故障修复,基于ESA基准验证了初步效果。

Comments 6 pages, 2 figures. Accepted at IEEE IRAI 2026 (International Conference on Responsible Artificial Intelligence)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07091 2026-08-10 cs.HC cs.AI 新提交 90%

Human-Centered Explainable AI for TinyML Edge Devices: A Pareto-Based Selection Framework with LLM-Guided Design

面向TinyML边缘设备的以人为中心的可解释人工智能:基于帕累托的选择框架与大语言模型引导设计

Zeinab Dehghani, Dhavalkumar Thakker, Koorosh Aslansefat, Kuniko Paxton, Bhupesh Kumar Mishra, Baseer Ahmad, Rameez Raja Kureshi

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出一种整合LLM引导设计与帕累托优化的以人为中心XAI选择框架,用于TinyML边缘设备部署,经皮肤病变分类任务验证可识别帕累托有效权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22481 2026-08-10 cs.DC 版本更新 89%

OmniInfer: System-Wide Acceleration Techniques for Optimizing LLM Serving Throughput and Latency

OmniInfer: 通过优化LLM服务吞吐量和延迟提升系统整体加速技术

Jun Wang, Yunxiang Yao, Wenwei Kuang, Runze Mao, Zhenhao Sun, Zhuang Tao, Ziyang Zhang, Dengyu Li, Jiajun Chen, Zhili Wang, Kai Cui, Congzhi Cai, Longwen Lan, Ken Zhang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 OmniInfer通过统一框架优化LLM服务吞吐量和延迟,减少TPOT和TTFT,提升系统整体性能。

Comments Project page: [this https URL](https://gitee.com/omniai/omniinfer)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18871 2026-08-10 cs.LG cs.AI 89%

Periodic Asynchrony: An On-Policy Approach for Accelerating LLM Reinforcement Learning

周期性异步性:一种用于加速大语言模型强化学习的在线策略方法

Jian Lu, Yi Luo

机构 * Big Data & AI Lab(大数据与人工智能实验室)

专题命中 效率与部署 :LLM(title,summary_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种周期性异步框架,通过分离推理与训练部署,提升LLM强化学习的训练效率,采用统一三模型架构和共享提示注意力机制,实现高效异步执行并减少冗余计算,实验显示在NPU平台实现约2倍的吞吐量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07427 2026-08-10 cs.AI cs.PF 新提交 89%

A Picture is Worth a Thousand Tokens: How Vision Language Models Cut AI Energy Costs While Improving Accuracy

一图胜千词:视觉语言模型如何在提升准确率的同时降低AI能源成本

Bhavika Jalli, Nikhil Korati Prasanna, Jayanta Choudhury

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(title,abstract);分类 cs.AI

AI总结 该研究提出将时间序列编码为二维图的视觉语言模型,可大幅减少输入词元、降低推理能耗,同时在电信异常检测等任务中提升准确率,解决了LLM处理多维度KPI数据的低效问题。

Comments Accepted at the 14th European Conference on Renewable Energy Systems (ECRES), July 7--9, 2026, London, UK

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10317 2026-08-10 cs.RO cs.LG 版本更新 89%

Robot guide with multi-agent control and automatic scenario generation with LLM

基于多智能体控制与大语言模型自动场景生成的机器人引导系统

Elizaveta D. Moskovskaya, Anton D. Moscowsky

机构 * National Research Center "Kurchatov Institute"(国家研究快机构"库恰托夫研究所")

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究开发了结合多智能体资源管理与LLM自动场景生成的混合社交机器人控制架构,在MENTOR-1导游机器人上验证了其能提升长期讲故事任务中机器人交互的自然性与丰富度。

Comments 14 pages, 4 figures, 4 tables, 1 demo-video and repository link. There were major changes: an introduction, a review, and a new experiment. Some tables and figures have also been changed

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02515 2026-08-10 cs.CL cs.LG 版本更新 88%

LiveMem: Maintaining Memory State Continuity in Long-Running LLM Inference

LiveMem:在长期运行的大语言模型推理中维持记忆状态连续性

Zhichen Liu, Ruihan Sun, Hengjie Yang, Zipeng Wu, Zhaohan Chen, Xiaofan Zhang, Yang Xu

机构 * Southern University of Science and Technology(南方科技大学) Xidian University(西安电子科技大学)

专题命中 效率与部署 :LLM(title,summary_cn);post-training(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对长期运行LLM推理中上下文切换导致状态不连续的问题,提出LiveMem方法,通过引入独立于活跃上下文的持久记忆状态,实现状态连续性,在LongMemEval等测试中表现领先。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07279 2026-08-10 eess.SP 新提交 88%

Token Communication for Multimodal Large Language Model

多模态大语言模型的令牌通信

Jingkai Ying, Zhijin Qin, Yuan Shen, Khaled B. Letaief

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 本文针对多模态大语言模型(MLLMs)的令牌传输问题,提出适配MLLMs的令牌通信框架,通过集成神经编解码器、两阶段语义对齐训练及自适应适配器,在相同传输数据量下实现更优任务性能。

Comments 13 pages, 11 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07004 2026-08-10 cs.RO cs.SY eess.SY 新提交 88%

Benchmarking and Reasoning Distillation of Large Language Models for Feedback Controller Design in Complex Dynamical Systems

面向复杂动态系统反馈控制器设计的大语言模型基准测试与推理蒸馏

Zhongchao Zhou, Yixuan Xie, Wenwei Yu, Yuxi Lu, Yaonan Zhu, Qian Niu, Yutaka Matsuo, Yusuke Iwasawa

机构 * The University of Tokyo(东京大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Chiba University(千叶大学) Tongji University(同济大学) Shanghai Research Institute for Intelligent Autonomous Systems(上海智能自主系统研究院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 该研究构建了CoDyControlBench基准,评估了6种LLMs的控制器设计性能,开发的15亿参数推理蒸馏模型可实现边缘部署,在机械臂试验中成功完成目标跟踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19932 2026-08-10 cs.CL cs.SD 版本更新 87%

Efficient Chain-of-Modality Reasoning via Progressive Compression for Spoken Language Models

通过渐进压缩实现口语语言模型的高效模态链推理

Pengchao Feng, Chao-Hong Tan, Qian Chen, Wen Wang, Xiangang Li, Xie Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Token Foundry, Alibaba Group(阿里巴巴集团淘系技术)

专题命中 效率与部署 :language model(title,abstract);SLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL

AI总结 针对口语语言模型推理能力落后问题,提出高效模态链推理(ECoM推理),通过压缩文本组件提高推理准确性,并用渐进压缩策略训练,实验显示其在口语数学问答基准测试中,增强推理且保持效率,准确率提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06989 2026-08-10 cs.AR 新提交 87%

Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM

重新思考NPU-PIM系统的统一内存:面向大语言模型动态推理的双视图内存

Shixin Zhao, Lian Liu, Tianhua Han, Mengdi Wang, Yinhe Han, Ying Wang

专题命中 效率与部署 :LLM(title,summary_cn)

AI总结 针对NPU-PIM系统现有统一内存无法适配LLM动态推理导致的带宽浪费问题,提出双视图内存方案PFM,可将端到端吞吐量提升最高达2.32倍。

Comments Accepted by MICRO'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07193 2026-08-10 cs.LG cs.CV 新提交 86%

An AI4AI Framework for Visual Token Pruning

用于视觉令牌剪枝的AI4AI框架

Zhen Liu, Wenli Huang, Wei Song, Yuhan Liu, Zhiqin Yang, Jingwen Fu

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究提出AutoPrune框架,通过TPDSL让LLM自动设计视觉令牌剪枝策略,在14个多模态基准和3个MLLM主干上,剪枝94.4%视觉令牌仍保留超99%性能,大幅降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12756 2026-08-10 cs.CV 版本更新 86%

VisCo: Leveraging Large Language Models as Intrinsic Encoders for Visual Token Compression

VisCo:利用大语言模型作为视觉令牌压缩的内在编码器

Yupeng Zheng, Kai Zou, Bin Liu, Nenghai Yu

专题命中 效率与部署 :language model(title,abstract);large language model(title)

AI总结 研究针对视觉语言模型处理视觉令牌时的高成本问题,提出训练高效的自压缩框架VisCo,将预训练VLM用作内在压缩器,通过参数共享自动编码器压缩视觉信息,实验证明其在压缩率上超先前方法,还能捕获互补表示改进基础模型。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06901 2026-08-10 cs.CV cs.LG 新提交 85%

Prune Once: Retraining-Free Task-Agnostic Pruning for Vision-Language Models

一次剪枝:面向视觉-语言模型的无需重训练的任务无关剪枝

Minseok Kang, Hyunwoo Kim, Chanyoung Kim, Minwoo Kim, Jaekoo Lee, Dahuin Jung

机构 * Chung-Ang University(中央大学) Soongsil University(崇实大学) Kookmin University(国民大学)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出名为PORTA的无需重训练的任务无关VLM剪枝框架,通过自适应稀疏分配实现高压缩下的竞争力性能,支持高效VLM压缩。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29678 2026-08-10 cs.CL cs.DC cs.PF 版本更新 85%

TokTier: Exact Stateful CPU+GPU Tokenization for Agentic LLM Serving

TokTier:面向智能体大语言模型服务的精确有状态分词方案

Zhenyu Zhang, Zhichao Cao

机构 * Arizona State University(亚利桑那州立大学)

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.CL

AI总结 本研究提出TokTier,一种面向智能体LLM服务的精确有状态分词方案,通过增量修复、GPU加速分词等技术,将首次令牌生成时间降低16%-34%,饱和请求速率提升至1821次/秒,性能远超现有方案。

Comments 26 pages. Code: https://github.com/asu-idi/toktier

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07076 2026-08-10 cs.SE 新提交 85%

Explanation-Guided Metamorphic Testing of Specialized Language Models: An Empirical Study

面向专用语言模型的解释引导式变异测试:一项实证研究

Xingcheng Chen, Mehmet Besenk, Andrea Stocco

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文通过在三个数据集、四种模型架构下的20种配置开展实证研究,发现解释引导式变异测试生成的经验证故障诱导测试用例是启发式变异策略的2.30倍,可有效评估专用语言模型的鲁棒性。

Comments 20 pages, 4 figures. Accepted at ESEM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06630 2026-08-10 cs.LG 新提交 84%

The Sparsity Whisperer

稀疏低语者

Linghao Kong, Inimai Subramanian, Micah Adler, Dan Alistarh, Dan Gutfreund, Nir Shavit

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文针对大语言模型剪枝忽略输出差异的问题,提出Wisp、Wisp+、Whisper等差异感知剪枝方法,在Llama系列模型上提升了剪枝效果,可与其他技术结合优化性能。

Comments 10 pages, 3 figures. Code available at https://github.com/Shavit-Lab/Whisper

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07885 2026-08-10 cs.DC cs.AI cs.CL cs.LG 版本更新 83%

Intelligence per Watt: Measuring Intelligence Efficiency of Local AI

每瓦智能:衡量本地AI的智能效率

Jon Saad-Falcon, Avanika Narayan, Hakki Orhun Akengin, J. Wes Griffin, Herumb Shandilya, Adrian Gamarra Lafuente, Medhya Goel, Rebecca Joseph, Shlok Natarajan, Etash Kumar Guha, Shang Zhu, Ben Athiwaratkun, John Hennessy, Azalia Mirhoseini, Christopher Ré

机构 * Stanford University(斯坦福大学) Together AI

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了本地AI在能源效率和性能上的表现,提出了一种统一的衡量指标IPW,展示了本地推理在重新分配需求方面的能力,并揭示了本地加速器的优化潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06763 2026-08-10 cs.LG cs.DC 新提交 83%

CubicQuant: Parametric Non-Uniform Codebooks for High-Throughput LLM Inference with 1-8-Bit Weights

CubicQuant:用于1-8比特权重的高吞吐量大语言模型推理的参数化非均匀码本

Xuetian Gao

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.LG

AI总结 研究针对LLM推理的权重量化问题,提出CubicQuant参数化非均匀标量格式,其在不同分布下的重构误差优于现有方案,且具备高效GPU执行潜力。

Comments 23 pages, 1 figure. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06628 2026-08-10 cs.LG 新提交 83%

Retrofitting Linear Attention into Diffusion Language Models

将线性注意力改造融入扩散语言模型

Jinha Kim, Younghun Roh, Jaeyeon Kim

机构 * Apple(苹果公司) Google DeepMind(谷歌DeepMind) Harvard University(哈佛大学) MIT(麻省理工学院)

专题命中 效率与部署 :language model(title,abstract);post-training(abstract);分类 cs.LG

AI总结 本文提出分块混合注意力,将其融入预训练dLLM LLaDA~2.1得到LLaDA-Hybrid,在保持基准性能的同时提升解码吞吐量与并发请求支持能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06849 2026-08-10 cs.CL cs.AI 新提交 82%

Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry

头自主性:基于冻结查询-键几何的无数据稀疏注意力

Yehan Yang, Junyuan Shang, Yang Li, Guanqun Zhao, Shuohuan Wang, Dianhai Yu

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Beijing University of Posts and Telecommunications(北京邮电大学) Baidu Inc.(百度公司)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出无数据稀疏注意力方法 AoH,通过查询-键投影谱几何识别检索头与流头,在 50% 稀疏度下平均保留全注意力 96.5% 性能,同时显著降低 LLM 的计算延迟与 KV-cache 内存。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17584 2026-08-10 cs.AR cs.LG 版本更新 81%

CHIME: A Case for Efficient Long-Context Attention-FC Disaggregated Inference with DIMM-PIM

CHIME:基于DIMM-PIM的高效长上下文注意力-全连接分离式推理方案

Qingyuan Liu, Liyan Chen, Haocheng Wang, Yanning Yang, Dong Du, Zhigang Mao, Naifeng Jing, Yubin Xia, Haibo Chen

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.LG

AI总结 CHIME是首个集成DIMM-PIM的AFD系统,通过无气泡流水线等技术解决同步问题,实现最高5.15倍于HBM-PIM方案的LLM推理加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06677 2026-08-10 cs.DB 新提交 80%

From Interpretation to Compilation: A Compilation-Based Execution Engine for Semantic Operator Systems

从解释到编译:面向语义算子系统的基于编译的执行引擎

Wenkai Dong, Yifan Wang

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 提出SemBaker编译式执行引擎,通过生成Python函数本地执行替代逐项LLM调用,支持多工具,在200查询的问答工作负载中获4.8-6.3倍加速与5.4-10.7倍成本降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07066 2026-08-10 cs.AI 新提交 79%

PTQ4SNN: Membrane-Aware Post-Training Quantization for Spiking Neural Networks

PTQ4SNN:面向脉冲神经网络的感知膜后训练量化

Hui Xie, Tong Shi, Haotong Qin, Aishan Liu, Xiaode Liu, Jinyang Guo

专题命中 效率与部署 :post-training(title,abstract);分类 cs.AI

AI总结 PTQ4SNN是一种仅用小型校准集联合量化SNN权重与循环膜状态的感知膜后训练量化框架,可在无需重训骨干网络的情况下,于W4量化和约4位膜精度下保持模型准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07033 2026-08-10 cs.AI 新提交 79%

ZIPBrain: Can EEG Foundation Models Be Faster, Locally Deployable, but Accurate?

ZIPBrain:脑电基础模型能否更快、可本地部署且仍保持准确?

Lingwei Li, Yirong Kan, Peng Chen, Xu Cao, Zheng Chen, Yasuhiko Nakashima

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI

AI总结 本研究提出即插即用模块ZIPBrain,利用EEG低SNR特性减少token数量,使EEG基础模型推理速度提升32.7%(最高41.8%)且平均准确率提升1.3%-10.5%,可本地部署。

Comments 7 pages(14 pages including appendix), 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏