arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-06 至 2026-08-06 共收录 54 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 54 篇

2604.07396 2026-08-06 cs.AR cs.LG 版本更新 92%

SHIELD: A Segmented Hierarchical Memory Architecture for Energy-Efficient LLM Inference on Edge NPUs

SHIELD:一种用于边缘NPUs上高效LLM推断的分段分层内存架构

Jintao Zhang, Xuanyao Fong

机构 * National University of Singapore(新加坡国立大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 SHIELD通过分段eDRAM架构优化边缘NPUs上LLM推断的能效,减少eDRAM刷新能耗35%同时保持准确性。

Comments Accepted to 2026 IEEE 8th International Conference on Artificial Intelligence Circuits and Systems (AICAS'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06024 2026-08-06 q-bio.QM cs.AI 交叉投稿 90%

TourSynbio-Search: A Large Language Model Driven Agent Framework for Unified Search Method for Protein Engineering

TourSynbio-Search:一种用于蛋白质工程的统一搜索方法的大语言模型驱动智能体框架

Yungeng Liu, Zan Chen, Yu Guang Wang, Yiqing Shen

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 TourSynbio-Search是TourSynbio-7B驱动的双模块搜索智能体框架,可跨多平台检索文献与蛋白质数据,降低技术门槛,提升蛋白质工程研究的信息检索效率与生产力

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04065 2026-08-06 cs.CR cs.AI 新提交 90%

An Inline Control Architecture for Language Models in Intelligent Transportation Systems

智能交通系统中语言模型的内联控制架构

Narendra Kumar Dewangan, Mounira Msahli

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 针对V2X系统中LLM的提示级攻击问题,提出Guarded-V2X内联语义护栏架构,经四阶段实验验证其可降低入侵成功率且不超延迟预算。

Comments 18 pages, under minor revision (IEEE transactions)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23035 2026-08-06 cs.LG cs.AR 90%

OASIS: Outlier-Aware LUT-Based GEMM with Dual-Side Quantization for LLM Inference Acceleration

OASIS:基于查找表的离群点感知双端量化LLM推理加速通用矩阵乘法

Xueying Wu, Baijun Zhou, Zhihui Gao, Yuzhe Fu, Qilin Zheng, Yintao He, Hai Li

机构 * National University of Singapore(新加坡国立大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出OASIS架构,利用预计算笛卡尔积查找表实现非均匀量化权重与激活的高效通用矩阵乘法,通过离群点感知量化方案和实时离群点检测引擎Orizuru,在保持精度的同时显著提升推理速度和能效。

Journal ref 2026 ACM/IEEE 53rd Annual International Symposium on Computer Architecture (ISCA), pp. 307-321

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04991 2026-08-06 cs.DC 新提交 89%

RAC: Reference-Aware Activation Compression for Communication-Efficient Split LLM Inference

RAC:面向通信高效的分割式大语言模型推理的参考感知激活压缩

Guotao Yang, Mingxi Zhao, Haopeng Li, Zhengchao Wang, Sheng Chen, Yitao Hu, Keqiu Li

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对分割式LLM推理的通信瓶颈,提出参考感知激活压缩方法RAC,通过参考感知编解码器等技术降低通信开销,在多模型多链路对实验中验证了其时间性能提升与任务分数变化情况。

Comments 10 pages, 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04866 2026-08-06 cs.CV 新提交 89%

Persistent Object Narratives for Token-Efficient Video Language Models

用于令牌高效视频语言模型的持久对象叙事

Junzhe Chen, Siyuan Meng, Xiaojie Guo

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract)

AI总结 本文提出SlotNarrative,一种用于Video-LLM的紧凑结构化视觉接口,通过持久对象叙事减少视觉令牌数量,在多数据集上实现准确率与令牌数的良好权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04714 2026-08-06 cs.SE cs.AI cs.LG 新提交 88%

What We Observe as LLM Behavior Can Be a Side-effect of Inference Backend

我们所观察到的大语言模型(LLM)行为可能是推理后端的副作用

Shahed Masoudian, Passant Shafaei, Monorama Swain, Markus Schedl

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 该研究发现推理后端是影响LLM基准测试分数的不可忽视因素,约39%的分数变异性源于后端,建议披露后端信息及完整生成配置以提升结果可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02087 2026-08-06 cs.AI cs.CL cs.LG 版本更新 88%

Instruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned Policy

基于非对称强化学习与自蒸馏的指令条件探索

Jim Dilkes, Vahid Yazdanpanah, Sebastian Stein

机构 * University of Southampton(南安普顿大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 该研究针对LLM强化学习中的探索挑战,提出指令条件探索(ICE)方法,结合非对称RL/SD训练目标,使Qwen3-1.7B数学推理性能提升5.0%且长上下文下仍有效。

Comments Submitted to ACL Rolling Review (ARR) May 2026 cycle. OpenReview submission record at https://openreview.net/forum?id=PV945lekMa

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04255 2026-08-06 cs.CR cs.LG 新提交 87%

PriDyG: Privacy-preserving Dynamic Graph Inference with LLM-GNN Collaboration

PriDyG:结合大语言模型与图神经网络的隐私保护动态图推理

Yuyang Xia, Ruixuan Liu, Li Xiong

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.LG

AI总结 PriDyG是结合GNN结构学习与LLM语义推理的隐私保护动态图推理框架,可在边级差分隐私约束下,在节点分类等任务中降低累计隐私开销并保持良好效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04048 2026-08-06 cs.LG cs.AI 新提交 87%

Recurrent Residual Quantization: A Progressive Multi-Precision Representation for LLMs

循环残差量化:面向大语言模型的渐进式多精度表示

Yu Luo, Bo Dong, Wenhua Cheng, Haihao Shen

机构 * Intel(英特尔)

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出循环残差量化(RRQ)框架,可从单个检查点生成LLM的多种精度表示,构建速度比MatGPTQ快3.3倍,在6、8比特精度下表现有竞争力,代码将公开。

Comments NeurIPS 2026 submission; 14 tables, 1 algorithm, and no figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10367 2026-08-06 cs.CL cs.AI 版本更新 87%

Large-Small Model Collaboration for Enhancing Edge-Deployed Small Models

用于增强边缘部署小模型的大小模型协作

Peigen Liu, Yijiang Fan, Zixuan Xu, Yuren Mao, Longbin Lai, Ying Zhang

专题命中 效率与部署 :LLM(abstract,abstract_cn);SLM(abstract,abstract_cn);language model(abstract);small language model(abstract)

AI总结 该研究提出自适应边缘-云框架G-Boost,通过动态选择推理或对数融合的协作方式,提升边缘部署小语言模型的任务性能,在两个数学推理数据集上优于多种基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05063 2026-08-06 cs.CR cs.AI cs.AR 新提交 86%

Hardware Design and Security in the Era of Chiplets and LLMs

小芯片与大语言模型时代的硬件设计与安全

Johann Knechtel, Ozgur Sinanoglu, Paul V. Gratz, Ramesh Karri

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文针对小芯片与LLM时代的硬件安全问题,分析了小芯片系统及LLM驱动EDA流水线的各类攻击,提出基于2.5D拆分制造与主动中介层的防御方法,还探讨了LLM对硬件安全的推动作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03487 2026-08-06 cs.DB cs.AI cs.IR 交叉投稿 86%

RAG-Stack: Co-Optimizing RAG Serving Performance and Quality

RAG-Stack:协同优化RAG服务性能与质量

Haiqiang Zhang, Yuanqing Lei, Wanting Li, Tao Zhang, Wenqi Jiang

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.AI

AI总结 RAG-Stack是可高效发现RAG质量-性能帕累托前沿的框架,其含三个核心组件,在相同优化迭代下,该框架发现的帕累托前沿覆盖的归一化质量-性能空间比最先进方法多52.5%-153.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04426 2026-08-06 cs.AI 版本更新 86%

XGrammar-2: Dynamic and Efficient Structured Generation Engine for Agentic LLMs

XGrammar-2: 面向智能体LLM的高效动态结构化生成引擎

Linzhang Li, Yixin Dong, Guanjie Wang, Ziyi Xu, Alexander Jiang, Tianqi Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Carnegie Mellon University(卡内基梅隆大学) Carnegie Mellon University, NVIDIA(卡内基梅隆大学,NVIDIA)

专题命中 效率与部署 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 针对智能体LLM中动态结构化生成(如工具调用和响应协议)的挑战,提出XGrammar-2引擎,通过标签触发结构切换和跨语法子结构缓存实现高效编译与近零开销。

Comments 9 pages, ACM CAIS 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01928 2026-08-06 cs.CL cs.LG 版本更新 86%

Esoteric Language Models: A Family of Any-Order Diffusion LLMs

深奥语言模型:一类任意阶扩散LLM

Subham Sekhar Sahoo, Zhihan Yang, Yash Akhauri, Johnna Liu, Deepansha Singh, Zhoujun Cheng, Zhengzhong Liu, Eric Xing, John Thickstun, Arash Vahdat

机构 * Cornell University(康奈尔大学) NVIDIA(英伟达)

专题命中 效率与部署 :language model(title,abstract);LLM(title_cn);分类 cs.CL、cs.LG

AI总结 提出Eso-LMs模型,融合自回归与掩码扩散范式,通过因果注意力实现精确似然计算和KV缓存,在速度-质量帕累托前沿上达到新最优。

Comments ICML 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04464 2026-08-06 cs.CE 新提交 86%

Trie-Constrained Token Prediction with Hierarchy-Aware Semantic Alignment for HS Code Prediction

结合前缀树约束的令牌预测与层级感知语义对齐的HS编码预测

Minseop Kim, Taekhyun Park, Kikun Park, Hyerim Bae

专题命中 效率与部署 :SLM(abstract,abstract_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 本研究提出TRIE-HSA方法,结合前缀树约束的令牌预测与层级感知语义对齐,在集装箱码头数据实验中,其HS6准确率较零样本推理提升49.96个百分点,为受限环境下的HS编码预测提供实用方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04169 2026-08-06 cs.AR cs.ET 新提交 86%

On Design Principles for Efficient Heterogeneous DRAM-PIM-GPU Systems

高效异构DRAM-PIM-GPU系统的设计原则

Corey Lammie, Hadjer Benmeziane, William Andrew Simon, Irem Boybat

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 该研究针对异构DRAM-PIM-GPU系统,通过系统评估OPT、Mamba2系列模型,揭示了三项设计原则,为内存加速LLM系统架构设计提供了指导。

Comments Accepted at 2026 IEEE International System-on-Chip Conference (SOCC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23200 2026-08-06 cs.CE 版本更新 86%

Large Language Models, Encoder Architectures and Hybrid Approaches for Patent Classification

大型语言模型在专利分类中的应用:优势、权衡与长尾效应

Lorenzo Emer, Marco Lippi, Andrea Mina, Andrea Vandin

专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract)

AI总结 本文比较了基于编码器和LLMs在专利分类中的表现,发现编码器在常见类别表现更好,而LLMs在罕见类别表现更优,两者互补,且编码器更高效。

Comments 44 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04588 2026-08-06 cs.CL cs.AI 新提交 84%

EASy: Towards Efficient LLM-Based Agentic System

EASy:迈向高效的基于大语言模型的智能体系统

Junnan Liu, Linhao Luo, Thuy-Trang Vu, Gholamreza Haffari

机构 * Monash University(莫纳什大学)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 EASy是一种可训练的智能体框架,通过强化学习优化任务性能与计算效率,采用里程碑-规划-执行工作流,在多类基准上实现了更优的性能-效率权衡。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04390 2026-08-06 cs.CL cs.DB 新提交 83%

EdgeLM: Edge Demonstrations for Language Models' Table Understanding

EdgeLM:面向语言模型表格理解的边缘演示

Soroush Omidvartehrani, Mohammadamin Habibollah, Mohammadreza Daviran, Davood Rafiei

机构 * University of Alberta(阿尔伯塔大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 EdgeLM是一种检索框架,通过选择数据边缘和模型边缘两种互补的边缘证据,在五个数据整理任务、十五个数据集及五种LLMs上,始终取得最佳或接近最佳的表格理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23933 2026-08-06 cs.DC cs.AI cs.LG cs.PF 版本更新 81%

SpecBox: Speculative Sandbox Scheduling for Efficient LLM Agent Serving

SpecBox:用于高效大语言模型智能体服务的推测性沙盒调度

Yihui Zhang, Tianyu Wo, Jinghao Wang, Xiaoyang Sun, Menghao Zhang, Cangzhou Yuan, Li Li, Chunming Hu, Albert Y. Zomaya, Renyu Yang

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型智能体服务中沙盒部署的资源利用与延迟矛盾,提出SpecBox,通过推测性沙盒预分配、上下文感知随机预取及相关优化,有效降低端到端延迟并削减峰值内存消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05104 2026-08-06 cs.LG 新提交 79%

BnBERT-iPET: Sparse Few-Shot Language Modeling for Bengali via Lottery Ticket Pruning

BnBERT-iPET:基于彩票剪枝的孟加拉语稀疏少样本语言建模

Sajib Hossain, Md Kamrus Samad, Anan Ghosh, Labib Imam Chowdhury, Nabeel Mohammed

机构 * North South University(北南大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.LG

AI总结 本研究提出BnBERT-iPET,一种基于彩票剪枝的孟加拉语稀疏少样本语言建模方法,仅保留初始模型10%边、实现90%稀疏度,在孟加拉语下游任务中性能可与多个最先进语言模型媲美。

Comments 14 pages, 9 tables, 13 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04496 2026-08-06 cs.CV cs.LG 新提交 79%

DIVE: Dynamic Iterative Visual Evidence Construction for Efficient Vision-Language Models

DIVE:面向高效视觉-语言模型的动态迭代视觉证据构建

Chen Zhong, Xiao An, Zijie Wang, Jiepan Li, Guangyi Yang, Wei He

专题命中 效率与部署 :language model(title,abstract);分类 cs.LG

AI总结 本研究针对视觉-语言模型中视觉token导致的推理瓶颈,提出无需训练的DIVE框架,通过动态迭代构建视觉证据,在减少88.9%视觉token的同时保留98.2%的平均性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04454 2026-08-06 cs.CV cs.LG 新提交 79%

Beyond Global Routing Aggregation: Phase-Aware Expert Merging for MoE Vision-Language Models

超越全局路由聚合:面向MoE视觉-语言模型的阶段感知专家合并

Hongyu Zhang, Cheng Yan, Xiang Xia, Wuyang Zhang

专题命中 效率与部署 :language model(title,abstract);分类 cs.LG

AI总结 针对MoE-VLM全局路由聚合导致专家角色混淆的问题,提出无需训练的RoleMerge方法,通过阶段归一化路由统计合并专家,在匹配专家保留比例下性能优于现有方法,六任务宏平均相对提升最高9.6%。

Comments 17 pages, 3 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04174 2026-08-06 cs.LG 新提交 79%

TS2TabPFN: Time Series Classification and Extrinsic Regression through Feature Extraction and a Tabular Foundation Model

TS2TabPFN:通过特征提取和表格基础模型实现时间序列分类与外生回归

Gabriel da Costa Merlin, Diego Furtado Silva

机构 * University of São Paulo (USP)(圣保罗大学)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 TS2TabPFN框架将显式特征提取与表格基础模型TabPFN 2.5集成,在时间序列外生回归任务中显著优于现有最优模型,为时间序列分类提供了稳健高效的替代方案,建立了新的时间序列最优水平。

Comments Accepted at ECML PKDD 2026. To appear in Springer LNCS. 18 pages; 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03854 2026-08-06 cs.LG 版本更新 79%

Quantization Effects on Biomedical LLM Reliability

量化对生物医学大语言模型可靠性的影响

Anton Rasmussen, Hong Qin

专题命中 效率与部署 :LLM(title);language model(abstract);分类 cs.LG

AI总结 该研究针对 Mistral-7B 变体在 PubMed RCT 句子分类任务上,评估量化及提示模板、评分规则等对生物医学大语言模型可靠性的影响,发现这些因素对校准和准确率的影响不可忽视。

Comments 8 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11506 2026-08-06 cs.LG cs.AI cs.AR cs.PF 版本更新 79%

RooflineBench: A Benchmarking Framework for On-Device LLMs via Roofline Analysis

RooflineBench:通过 Roofline 分析为设备端 LLMs 提供的基准测试框架

Zhen Bi, Xueshu Chen, Luoyang Sun, Yuhang Yao, Qing Shen, Jungang Lou, Cheng Deng

专题命中 效率与部署 :large language model(abstract);language model(abstract);small language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于 Roofline 模型的统一框架,通过操作强度(OI)统一架构原语和硬件约束,引入相对推理潜力作为新指标,分析不同 LLMs 在相同硬件上的效率差异,并揭示序列长度和模型深度对性能和 OI 的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04610 2026-08-06 cs.CV 新提交 75%

HiSC: Hierarchical Spatial Clustering Token Compression for Efficient 3D Scene Understanding

HiSC:用于高效3D场景理解的分层空间聚类令牌压缩

Jiuhe Qu, Yingping Liang, Ying Fu

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);language model(abstract)

AI总结 本文提出无训练框架HiSC,通过SGraM策略和SCluP范式实现3D VLMs的分层空间聚类令牌压缩,在高剪枝率下实现超90%令牌减少且性能下降极小,验证了其有效性。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04405 2026-08-06 cs.LG cs.AI cs.CL 新提交 75%

Training-Free Hashing-Based Attention via Binary Principal Components

基于二元主成分的无训练哈希注意力机制

Daohai Yu, Zhanpeng Zeng, Keyu Chen, Wenhao Li, Zhifeng Shen, Luxi Lin, Ruizhi Qiao, Xing Sun, Rongrong Ji

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对长上下文LLMs自注意力的解码效率瓶颈,提出无训练的BinaryPC方法,通过数据二元主成分构建哈希码,在保持精度的同时将解码吞吐量提升3.56倍。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04175 2026-08-06 cs.CV 新提交 75%

TriCLE: Tri-Modal Vision-Language Reasoning for Edge-Deployed Fine-Grained Clustering

TriCLE:面向边缘部署的细粒度聚类的三模态视觉-语言推理

Kishor Datta Gupta, Md. Mahfuzur Rahman, Fahad Rahman, Ahmed Rafi Hasan, Faysal Mehrab Chowdhury, Mohd Ariful Haque, Roy George

机构 * Clark Atlanta University(克拉克亚特兰大大学) United International University(国际大学) North South University(北南大学)

专题命中 效率与部署 :SFT(abstract,abstract_cn);language model(abstract)

AI总结 TriCLE是面向边缘部署的三模态视觉-语言系统,通过生成伪热视图和伪激光雷达深度,结合对齐策略实现细粒度飞机聚类,适配8GB内存边缘设备,验证与测试均取得良好性能。

详情

展开后加载摘要…

URL PDF HTML 收藏