arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-06 至 2026-08-06 共收录 353 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 54 篇

2608.04048 2026-08-06 cs.LG cs.AI 新提交 87%

Recurrent Residual Quantization: A Progressive Multi-Precision Representation for LLMs

循环残差量化:面向大语言模型的渐进式多精度表示

Yu Luo, Bo Dong, Wenhua Cheng, Haihao Shen

机构 * Intel(英特尔)

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出循环残差量化(RRQ)框架,可从单个检查点生成LLM的多种精度表示,构建速度比MatGPTQ快3.3倍,在6、8比特精度下表现有竞争力,代码将公开。

Comments NeurIPS 2026 submission; 14 tables, 1 algorithm, and no figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10367 2026-08-06 cs.CL cs.AI 版本更新 87%

Large-Small Model Collaboration for Enhancing Edge-Deployed Small Models

用于增强边缘部署小模型的大小模型协作

Peigen Liu, Yijiang Fan, Zixuan Xu, Yuren Mao, Longbin Lai, Ying Zhang

专题命中 效率与部署 :LLM(abstract,abstract_cn);SLM(abstract,abstract_cn);language model(abstract);small language model(abstract)

AI总结 该研究提出自适应边缘-云框架G-Boost,通过动态选择推理或对数融合的协作方式,提升边缘部署小语言模型的任务性能,在两个数学推理数据集上优于多种基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05063 2026-08-06 cs.CR cs.AI cs.AR 新提交 86%

Hardware Design and Security in the Era of Chiplets and LLMs

小芯片与大语言模型时代的硬件设计与安全

Johann Knechtel, Ozgur Sinanoglu, Paul V. Gratz, Ramesh Karri

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文针对小芯片与LLM时代的硬件安全问题,分析了小芯片系统及LLM驱动EDA流水线的各类攻击,提出基于2.5D拆分制造与主动中介层的防御方法,还探讨了LLM对硬件安全的推动作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03487 2026-08-06 cs.DB cs.AI cs.IR 交叉投稿 86%

RAG-Stack: Co-Optimizing RAG Serving Performance and Quality

RAG-Stack:协同优化RAG服务性能与质量

Haiqiang Zhang, Yuanqing Lei, Wanting Li, Tao Zhang, Wenqi Jiang

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.AI

AI总结 RAG-Stack是可高效发现RAG质量-性能帕累托前沿的框架,其含三个核心组件,在相同优化迭代下,该框架发现的帕累托前沿覆盖的归一化质量-性能空间比最先进方法多52.5%-153.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04426 2026-08-06 cs.AI 版本更新 86%

XGrammar-2: Dynamic and Efficient Structured Generation Engine for Agentic LLMs

XGrammar-2: 面向智能体LLM的高效动态结构化生成引擎

Linzhang Li, Yixin Dong, Guanjie Wang, Ziyi Xu, Alexander Jiang, Tianqi Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Carnegie Mellon University(卡内基梅隆大学) Carnegie Mellon University, NVIDIA(卡内基梅隆大学,NVIDIA)

专题命中 效率与部署 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 针对智能体LLM中动态结构化生成(如工具调用和响应协议)的挑战,提出XGrammar-2引擎,通过标签触发结构切换和跨语法子结构缓存实现高效编译与近零开销。

Comments 9 pages, ACM CAIS 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01928 2026-08-06 cs.CL cs.LG 版本更新 86%

Esoteric Language Models: A Family of Any-Order Diffusion LLMs

深奥语言模型:一类任意阶扩散LLM

Subham Sekhar Sahoo, Zhihan Yang, Yash Akhauri, Johnna Liu, Deepansha Singh, Zhoujun Cheng, Zhengzhong Liu, Eric Xing, John Thickstun, Arash Vahdat

机构 * Cornell University(康奈尔大学) NVIDIA(英伟达)

专题命中 效率与部署 :language model(title,abstract);LLM(title_cn);分类 cs.CL、cs.LG

AI总结 提出Eso-LMs模型,融合自回归与掩码扩散范式,通过因果注意力实现精确似然计算和KV缓存,在速度-质量帕累托前沿上达到新最优。

Comments ICML 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04464 2026-08-06 cs.CE 新提交 86%

Trie-Constrained Token Prediction with Hierarchy-Aware Semantic Alignment for HS Code Prediction

结合前缀树约束的令牌预测与层级感知语义对齐的HS编码预测

Minseop Kim, Taekhyun Park, Kikun Park, Hyerim Bae

专题命中 效率与部署 :SLM(abstract,abstract_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 本研究提出TRIE-HSA方法,结合前缀树约束的令牌预测与层级感知语义对齐,在集装箱码头数据实验中,其HS6准确率较零样本推理提升49.96个百分点,为受限环境下的HS编码预测提供实用方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04169 2026-08-06 cs.AR cs.ET 新提交 86%

On Design Principles for Efficient Heterogeneous DRAM-PIM-GPU Systems

高效异构DRAM-PIM-GPU系统的设计原则

Corey Lammie, Hadjer Benmeziane, William Andrew Simon, Irem Boybat

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 该研究针对异构DRAM-PIM-GPU系统,通过系统评估OPT、Mamba2系列模型,揭示了三项设计原则,为内存加速LLM系统架构设计提供了指导。

Comments Accepted at 2026 IEEE International System-on-Chip Conference (SOCC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23200 2026-08-06 cs.CE 版本更新 86%

Large Language Models, Encoder Architectures and Hybrid Approaches for Patent Classification

大型语言模型在专利分类中的应用:优势、权衡与长尾效应

Lorenzo Emer, Marco Lippi, Andrea Mina, Andrea Vandin

专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract)

AI总结 本文比较了基于编码器和LLMs在专利分类中的表现,发现编码器在常见类别表现更好,而LLMs在罕见类别表现更优,两者互补,且编码器更高效。

Comments 44 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04588 2026-08-06 cs.CL cs.AI 新提交 84%

EASy: Towards Efficient LLM-Based Agentic System

EASy:迈向高效的基于大语言模型的智能体系统

Junnan Liu, Linhao Luo, Thuy-Trang Vu, Gholamreza Haffari

机构 * Monash University(莫纳什大学)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 EASy是一种可训练的智能体框架,通过强化学习优化任务性能与计算效率,采用里程碑-规划-执行工作流,在多类基准上实现了更优的性能-效率权衡。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04390 2026-08-06 cs.CL cs.DB 新提交 83%

EdgeLM: Edge Demonstrations for Language Models' Table Understanding

EdgeLM:面向语言模型表格理解的边缘演示

Soroush Omidvartehrani, Mohammadamin Habibollah, Mohammadreza Daviran, Davood Rafiei

机构 * University of Alberta(阿尔伯塔大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 EdgeLM是一种检索框架,通过选择数据边缘和模型边缘两种互补的边缘证据,在五个数据整理任务、十五个数据集及五种LLMs上,始终取得最佳或接近最佳的表格理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23933 2026-08-06 cs.DC cs.AI cs.LG cs.PF 版本更新 81%

SpecBox: Speculative Sandbox Scheduling for Efficient LLM Agent Serving

SpecBox:用于高效大语言模型智能体服务的推测性沙盒调度

Yihui Zhang, Tianyu Wo, Jinghao Wang, Xiaoyang Sun, Menghao Zhang, Cangzhou Yuan, Li Li, Chunming Hu, Albert Y. Zomaya, Renyu Yang

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型智能体服务中沙盒部署的资源利用与延迟矛盾,提出SpecBox,通过推测性沙盒预分配、上下文感知随机预取及相关优化,有效降低端到端延迟并削减峰值内存消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05104 2026-08-06 cs.LG 新提交 79%

BnBERT-iPET: Sparse Few-Shot Language Modeling for Bengali via Lottery Ticket Pruning

BnBERT-iPET:基于彩票剪枝的孟加拉语稀疏少样本语言建模

Sajib Hossain, Md Kamrus Samad, Anan Ghosh, Labib Imam Chowdhury, Nabeel Mohammed

机构 * North South University(北南大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.LG

AI总结 本研究提出BnBERT-iPET,一种基于彩票剪枝的孟加拉语稀疏少样本语言建模方法,仅保留初始模型10%边、实现90%稀疏度,在孟加拉语下游任务中性能可与多个最先进语言模型媲美。

Comments 14 pages, 9 tables, 13 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04496 2026-08-06 cs.CV cs.LG 新提交 79%

DIVE: Dynamic Iterative Visual Evidence Construction for Efficient Vision-Language Models

DIVE:面向高效视觉-语言模型的动态迭代视觉证据构建

Chen Zhong, Xiao An, Zijie Wang, Jiepan Li, Guangyi Yang, Wei He

专题命中 效率与部署 :language model(title,abstract);分类 cs.LG

AI总结 本研究针对视觉-语言模型中视觉token导致的推理瓶颈,提出无需训练的DIVE框架,通过动态迭代构建视觉证据,在减少88.9%视觉token的同时保留98.2%的平均性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04454 2026-08-06 cs.CV cs.LG 新提交 79%

Beyond Global Routing Aggregation: Phase-Aware Expert Merging for MoE Vision-Language Models

超越全局路由聚合:面向MoE视觉-语言模型的阶段感知专家合并

Hongyu Zhang, Cheng Yan, Xiang Xia, Wuyang Zhang

专题命中 效率与部署 :language model(title,abstract);分类 cs.LG

AI总结 针对MoE-VLM全局路由聚合导致专家角色混淆的问题,提出无需训练的RoleMerge方法,通过阶段归一化路由统计合并专家,在匹配专家保留比例下性能优于现有方法,六任务宏平均相对提升最高9.6%。

Comments 17 pages, 3 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04174 2026-08-06 cs.LG 新提交 79%

TS2TabPFN: Time Series Classification and Extrinsic Regression through Feature Extraction and a Tabular Foundation Model

TS2TabPFN:通过特征提取和表格基础模型实现时间序列分类与外生回归

Gabriel da Costa Merlin, Diego Furtado Silva

机构 * University of São Paulo (USP)(圣保罗大学)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 TS2TabPFN框架将显式特征提取与表格基础模型TabPFN 2.5集成,在时间序列外生回归任务中显著优于现有最优模型,为时间序列分类提供了稳健高效的替代方案,建立了新的时间序列最优水平。

Comments Accepted at ECML PKDD 2026. To appear in Springer LNCS. 18 pages; 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03854 2026-08-06 cs.LG 版本更新 79%

Quantization Effects on Biomedical LLM Reliability

量化对生物医学大语言模型可靠性的影响

Anton Rasmussen, Hong Qin

专题命中 效率与部署 :LLM(title);language model(abstract);分类 cs.LG

AI总结 该研究针对 Mistral-7B 变体在 PubMed RCT 句子分类任务上,评估量化及提示模板、评分规则等对生物医学大语言模型可靠性的影响,发现这些因素对校准和准确率的影响不可忽视。

Comments 8 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11506 2026-08-06 cs.LG cs.AI cs.AR cs.PF 版本更新 79%

RooflineBench: A Benchmarking Framework for On-Device LLMs via Roofline Analysis

RooflineBench:通过 Roofline 分析为设备端 LLMs 提供的基准测试框架

Zhen Bi, Xueshu Chen, Luoyang Sun, Yuhang Yao, Qing Shen, Jungang Lou, Cheng Deng

专题命中 效率与部署 :large language model(abstract);language model(abstract);small language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于 Roofline 模型的统一框架,通过操作强度(OI)统一架构原语和硬件约束,引入相对推理潜力作为新指标,分析不同 LLMs 在相同硬件上的效率差异,并揭示序列长度和模型深度对性能和 OI 的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04610 2026-08-06 cs.CV 新提交 75%

HiSC: Hierarchical Spatial Clustering Token Compression for Efficient 3D Scene Understanding

HiSC:用于高效3D场景理解的分层空间聚类令牌压缩

Jiuhe Qu, Yingping Liang, Ying Fu

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);language model(abstract)

AI总结 本文提出无训练框架HiSC,通过SGraM策略和SCluP范式实现3D VLMs的分层空间聚类令牌压缩,在高剪枝率下实现超90%令牌减少且性能下降极小,验证了其有效性。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04405 2026-08-06 cs.LG cs.AI cs.CL 新提交 75%

Training-Free Hashing-Based Attention via Binary Principal Components

基于二元主成分的无训练哈希注意力机制

Daohai Yu, Zhanpeng Zeng, Keyu Chen, Wenhao Li, Zhifeng Shen, Luxi Lin, Ruizhi Qiao, Xing Sun, Rongrong Ji

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对长上下文LLMs自注意力的解码效率瓶颈,提出无训练的BinaryPC方法,通过数据二元主成分构建哈希码,在保持精度的同时将解码吞吐量提升3.56倍。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04175 2026-08-06 cs.CV 新提交 75%

TriCLE: Tri-Modal Vision-Language Reasoning for Edge-Deployed Fine-Grained Clustering

TriCLE:面向边缘部署的细粒度聚类的三模态视觉-语言推理

Kishor Datta Gupta, Md. Mahfuzur Rahman, Fahad Rahman, Ahmed Rafi Hasan, Faysal Mehrab Chowdhury, Mohd Ariful Haque, Roy George

机构 * Clark Atlanta University(克拉克亚特兰大大学) United International University(国际大学) North South University(北南大学)

专题命中 效率与部署 :SFT(abstract,abstract_cn);language model(abstract)

AI总结 TriCLE是面向边缘部署的三模态视觉-语言系统,通过生成伪热视图和伪激光雷达深度,结合对齐策略实现细粒度飞机聚类,适配8GB内存边缘设备,验证与测试均取得良好性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04033 2026-08-06 cs.CR 新提交 75%

SoK: How Frontier AI Reshapes System-Level Security Risk Dynamics in Critical Infrastructure

SoK:前沿人工智能如何重塑关键基础设施中的系统级安全风险动态

Chandra Thapa, Mohan Baruwal Chhetri, Marthie Grobler, Shahroz Tariq, Tooba Aamir

专题命中 效率与部署 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本研究提出五维风险动态框架,分析前沿人工智能重塑关键基础设施系统级安全风险的机制,指出学术研究与运营约束的错配,推动系统级安全保证研究。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21343 2026-08-06 cs.CV 版本更新 75%

Latent Denoising Improves Visual Alignment in Large Multimodal Models

潜在去噪提升大多模态模型的视觉对齐

Dhruv Parikh, Jacob Fein-Ashley, Rajgopal Kannan, Viktor Prasanna

机构 * University of Southern California(南加州大学) DEVCOM ARL Army Research Office(DEVCOM ARL陆军研究办公室)

专题命中 效率与部署 :LLM(abstract,abstract_cn);language model(abstract)

AI总结 本文提出通过潜在去噪框架改进大多模态模型的内部视觉特征对齐和多模态理解,采用掩码和高斯噪声混合腐蚀视觉token,并利用解码器恢复教师特征,提升模型在分布偏移下的鲁棒性。

Comments ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04515 2026-08-06 cs.CV cs.AI cs.CL 新提交 73%

CARVE: Cross-Slice Anisotropic Reallocation of Visual Evidence for Efficient 3D Medical Volume Understanding

CARVE:用于高效3D医学体积理解的视觉证据跨切片各向异性重分配

Zhenyu Yi, Qiang Hu, Zhenhao Li, Jiaxuan Zhao, Yusong Sun, Lichi Zhang

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 针对3D医学体积理解中切片式MLLM的视觉令牌冗余问题,提出无需训练的CARVE框架,通过跨切片各向异性重分配压缩80%令牌,在AMOS-MM等基准上性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04330 2026-08-06 cs.CL cs.LG 新提交 73%

Right Reset: Chunking by Prefix Removal

右侧重置:通过前缀移除进行分块

Mike Vegeto

专题命中 效率与部署 :language model(abstract);prompting(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出右侧重置(RR)方法,通过前缀移除探测将因果语言模型的上下文依赖转化为边界信号,在文本分块任务上优于基线方法,减少局部输出干扰。

Comments 12 pages, 2 figures, 4 tables. Code, data, and reproduction materials: https://github.com/ZECTBynmo/right-reset-paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04074 2026-08-06 cs.LG cs.AI cs.IT eess.SP math.IT 新提交 73%

Spend Bits Where Queries Look: KV Cache Vector Quantization with Attention-Preserving Transforms

将比特分配至查询关注处:基于注意力保留变换的KV缓存向量量化

Samuel Fernández-Menduiña, Amir Ziashahabi, Eduardo Pavez, Antonio Ortega, Salman Avestimehr

机构 * University of Southern California(南加州大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出名为NOVA-KV的KV缓存量化方法,将其建模为变换编码问题,推导闭式最优变换,在每元素2比特时可恢复标量量化方法损失的大部分长上下文检索精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04458 2026-08-06 cs.AI cs.AR cs.OS 新提交 70%

Architectural Implications of Agentic AI Workflows

智能体AI工作流的架构影响

Jirong Yang, Peizhe Liu, Chaojie Zhang, Jovan Stojkovic

机构 * Microsoft Azure(微软Azure)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究通过生产与受控研究分析智能体AI工作流的架构特性,揭示传统服务器的不匹配问题,提出Agora原型优化资源利用与吞吐量,为未来服务器架构指明方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03529 2026-08-06 cs.CL 版本更新 70%

Consensus Measures for Unstructured Biomedical Text Annotations

非结构化生物医学文本标注的一致性度量

Pascal Wullschleger, Christian Kreis, Martin A. Walter, Jennifer Foster, Marc Pouly

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对生物医学非结构化文本标注的一致性量化难题,提出基于自然语言推理的折中度量方案,经实验验证多种语义等价度量的特性及局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03897 2026-08-06 cs.LG stat.ME stat.ML 版本更新 70%

GenAI-Powered Inference

生成式人工智能驱动的推断

Kosuke Imai, Kentaro Nakamura

机构 * Harvard University(哈佛大学) John F. Kennedy School of Government(约翰·F·肯尼迪政府学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究人员提出GPI统计框架,利用开源GenAI模型提取非结构化数据的低维表示,无需微调生成模型,通过三个应用验证其可用于因果与预测推断,开源软件包可实现该框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04630 2026-08-06 eess.SP 新提交 67%

Generalizable and Computational Efficient Channel Extrapolation for 6G: A Configurable AI-Driven Framework Built from a Modular Perspective

面向6G的可泛化且计算高效的信道外推:一种从模块化视角构建的可配置AI驱动框架

Yuan Gao, Xinyi Wu, Jiang Jun, Yi Yu, Yanliang Jin, Shunqing Zhang, Zhu Han, Shugong Xu

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 针对6G信道外推泛化差、复杂度高的问题,提出三阶段模块化可配置AI框架,降低了信道外推误差与复杂度,性能优于混合专家模型。

详情

展开后加载摘要…

URL PDF HTML 收藏