arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22280 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22280 篇

2512.08088 2025-12-10 cs.CL 87%

Adaptation of Embedding Models to Financial Filings via LLM Distillation

通过LLM蒸馏适应金融文件的嵌入模型

Eliot Brenner, Dominic Seyler, Manjunath Hegde, Andrei Simion, Koustuv Dasgupta, Bing Xiang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract,comments);language model(abstract,comments);分类 cs.CL

AI总结 本文通过LLM蒸馏方法,提升金融领域检索性能,实现MRR@5和DCG@5的显著提升。

Comments In proceedings of LLM-Finance 2025 : The 2nd IEEE International Workshop on Large Language Models for Finance

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18764 2026-08-21 cs.IR 版本更新 87%

GateDiffInt: Gate-Mediated Controllable Diffusion and Multi-Intent LLM Distillation for User Behavior Modeling

GateDiffInt:用于用户行为建模的门控介导可控扩散与多意图大语言模型蒸馏

Jialong Duan, Zichen Zhang, Zirui Tu, Zheng Zhang, Zepeng Li, Qingyao Cui, Qinwen Wang, Yudan Liu, Luo Yang, Yao Hu

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 针对现有排序模型难以解耦结构化意图的问题,提出GateDiffInt框架,通过可控扩散与LLM蒸馏实现意图感知表示,在公开及工业数据集和线上测试中均取得显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15264 2026-08-18 cs.SE 新提交 87%

AgentR A Stateful and Recovery-Aware Software Architecture for LLM-based Auditable Workflows

AgentR:面向基于大语言模型的可审计工作流的有状态且故障恢复感知的软件架构

Riya Samanta, Bidyut Saha, Soumya Kanti Ghosh, Rajkumar Buyya

专题命中 效率与部署 :LLM(title,summary_cn)

AI总结 提出AgentR架构,以有状态设计结合异步编排与成本审计,实现LLM工作流的高可恢复性、可观测性与可审计性,原型在文献综述场景验证获99.2%作业完成率及最高4.3倍并行加速

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09291 2026-08-11 cs.DC 新提交 87%

UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge

UnionSparse:面向边缘设备低比特稀疏大语言模型推理的索引高效稀疏性框架

Tianhao Jiang, Hang Gu, Teng Wang, Qianyu Cheng, ZhenDong Zheng, Cheng Tang, Qiyue Su, Wenqi Lou, Lei Gong, Chao Wang, Xi Li, Xuehai Zhou

专题命中 效率与部署 :LLM(title,summary_cn)

AI总结 该研究针对边缘低比特稀疏LLM推理中索引流量等SpMM瓶颈,提出UnionSparse框架,结合IE-BME与LSPD内核,在W4A4量化及30%-70%稀疏度下实现优于现有方案的性能。

Comments 14 pages, 19 figures. Accepted via the ESWEEK 2026 Journal Track for publication in IEEE Transactions on Computer-Aided Design of Integrated Circuits and Systems (TCAD)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09155 2026-08-11 cs.MA 新提交 87%

Beyond Tier Labels: Role- and Deployment-Dependent Model Substitution in Multi-Call LLM Workflows

超越层级标签:多调用大语言模型工作流中依赖角色与部署的模型替换

Renxiang Wang, Jiaming Cui

专题命中 效率与部署 :LLM(title,summary_cn)

AI总结 该研究针对多调用LLM工作流的模型替换问题,通过谓词-动作分解分离决策,经多任务实验揭示模型价值依赖角色与部署,提出大规模工作流路由的实用序列。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07926 2026-08-11 cs.SE 新提交 87%

Refining LLM-based Directed Test Input Generation via Runtime Value Feedback

基于大语言模型的定向测试输入生成:通过运行时值反馈进行优化

Narin Han, Shin Hong

专题命中 效率与部署 :LLM(title,summary_cn)

AI总结 该研究针对基于LLM的定向测试输入生成技术的不足,提出ReDig框架,通过运行时反馈的控制循环优化测试输入生成,在Poppler和Libsndfile案例中验证了其诊断失败原因与优化测试脚本的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06989 2026-08-10 cs.AR 新提交 87%

Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM

重新思考NPU-PIM系统的统一内存:面向大语言模型动态推理的双视图内存

Shixin Zhao, Lian Liu, Tianhua Han, Mengdi Wang, Yinhe Han, Ying Wang

专题命中 效率与部署 :LLM(title,summary_cn)

AI总结 针对NPU-PIM系统现有统一内存无法适配LLM动态推理导致的带宽浪费问题,提出双视图内存方案PFM,可将端到端吞吐量提升最高达2.32倍。

Comments Accepted by MICRO'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03741 2026-08-05 cs.DC 新提交 87%

When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference

拆分何时划算?智能体大语言模型推理的预填-解码-注意力-前馈网络专业化模拟

Przemyslaw Forys, Haoran Wu, Can Xiao, Jiayi Nie, Tony Liu, Rika Antonova, Timothy Jones, Robert Mullins, Wayne Luk, Aaron Zhao, George A. Constantinides

专题命中 效率与部署 :LLM(title,summary_cn)

AI总结 该研究提出HeteroPanacea模拟框架,针对智能体LLM推理的预填-解码-注意力-前馈网络拆分,验证其可提升吞吐量,为异构智能体服务系统提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02681 2026-08-05 cs.CR 新提交 87%

Safety in Batches? Understanding and Mitigating Safety Failures in Batch Prompting

批量提示中的安全性?理解并缓解批量提示中的安全故障

Kihyun Kim, Hee-Seon Kim, Wonjun Lee, Changick Kim

专题命中 效率与部署 :prompting(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 该研究发现批量提示存在独特安全故障模式,可作为黑盒攻击实现高成功率,提出感知批量的偏好优化可缓解该漏洞,为大语言模型安全对齐提供了新方向。

Comments jailbreak, safety

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00690 2026-08-04 cs.NI 新提交 87%

LLM-Assisted Coalition Formation for Cooperative Perception in Autonomous Driving

大语言模型辅助的自动驾驶协同感知联盟形成

Ahmad Sarlak, Hao Wang, Rahul Amin, Abolfazl Razi

专题命中 效率与部署 :LLM(title,summary_cn)

AI总结 该研究针对现有协同感知方法未优化车辆选择的问题,提出LLM辅助的联盟形成框架,结合DPP与ADMM优化,在OPV2V等数据集上实现更优性能与网络效率。

Comments Accepted for presentation at IEEE Global Communications Conference (GLOBECOM 2026), Cognitive Radio and AI-Enabled Networks Symposium

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27249 2026-07-31 cs.SE 新提交 87%

OwlPath: Lossless Knowledge Compression for LLM Bug Repair

OwlPath:面向大语言模型漏洞修复的无损知识压缩

Bo Zhang, Ren Pan, Huan Chen, Xiang Song

专题命中 效率与部署 :LLM(title,summary_cn)

AI总结 OwlPath是构建于CodeGraph之上的OWL2推理层,通过无损知识压缩将代码编码为OWL2本体,提升LLM漏洞修复的结构检索性能,在多组基准测试中实现了严格应用率、召回率等指标的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11688 2026-07-31 cs.NI cs.DC 版本更新 87%

GORGO: Online Tuning for Cross-Region Network-Aware LLM Serving

GORGO:面向跨区域网络感知的LLM服务的在线调优

Alessio Ricci Toniolo, Rome Thorstenson, Abinaya Dinesh

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 提出GORGO代理架构,通过可调参数综合考量网络延迟、预填充成本和排队延迟,并发布长上下文数据集ART-Chat-2.5M,利用进化策略优化p95 TTFT,在保留测试中p95 TTFT提升6.9-15.5%,端到端延迟提升14.3-30.9%。

Comments 12 pages, 4 figures. Code: https://github.com/Arcadia-Research-Team/GORGO

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26475 2026-07-30 cs.DC 新提交 87%

DualDecoder: Accelerate Long Context LLM Inference by Predictive Prefetch

DualDecoder:通过预测预取加速长上下文大语言模型推理

Zuning Liang, Zhiyi Yao, Qi Chen, Yuedong Xu, Hao Dai, Zhiqiang Ding, Tongkai Yang, Jinlong Hou, Yuan Cheng

专题命中 效率与部署 :LLM(title,summary_cn)

AI总结 该研究针对长上下文LLM推理的内存墙瓶颈,提出轻量级服务系统DualDecoder,通过双token解码流水线预测预取关键KV条目,消除辅助状态开销,使解码吞吐量最高提升2.62倍且保留延迟与模型质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19438 2026-07-23 cs.AR cs.AI cs.CL cs.DC cs.LG cs.PF 新提交 87%

BaseRT: Advancing Best-in-Class LLM Inference with Apple M5 Neural Accelerators

BaseRT:利用苹果M5神经加速器提升一流大语言模型推理性能

Fabian Waschkowski, Prabod Rathnayaka, Lukas Wesemann

机构 * Base Compute

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究利用苹果M5神经加速器提升大语言模型推理性能,通过BaseRT无框架设计及添加特定内核,将计算密集型矩阵乘法经M5处理,大幅提升推理吞吐量及解码优势,确立了设备上大语言模型推理新性能上限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16488 2026-07-21 cs.AR 新提交 87%

Auto-Scaling Heterogeneous Neural Processing Units for Energy and Cost-Efficient LLM Serving

用于高效能和低成本的大语言模型服务的异构神经处理单元自动缩放

Yuqi Xue, Jichuan Chang, Jian Huang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究如何利用异构神经处理单元为大语言模型服务实现能源和成本高效。提出NeuScale自动缩放框架,通过新vPod抽象管理资源,基于屋顶线分析分配,支持动态供应。经模拟器验证,可显著提升成本效率和SLO满意度。

Comments Accepted to MICRO'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16473 2026-07-21 cs.AR 新提交 87%

Enabling Spatially Fine-Grained DVFS in Neural Processing Units for Energy-Efficient LLM Serving

在神经处理单元中实现空间细粒度动态电压频率调节以实现高效节能的大语言模型服务

Yuqi Xue, Jerry Wu, Corey Yu, Jian Huang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对NPU服务LLMs时功耗问题,开发eNPU支持空间细粒度、组件级DVFS,通过重构流水线、引入通信机制、扩展ISA及采用编译器驱动搜索优化,实现能耗降低25.8% - 35.2%且保持SLO保证。

Comments Accepted by MICRO'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01415 2026-07-14 cs.MA 版本更新 87%

Evidence-Decision-Feedback: Theory-Driven Adaptive Scaffolding for LLM Agents

证据-决策-反馈:面向LLM代理的理论驱动自适应支架框架

Clayton Cohn, Siyuan Guo, Surya Rayala, Hanchen David Wang, Naveeduddin Mohammed, Umesh Timalsina, Shruti Jain, Angela Eeds, Menton Deweese, Pamela J. Osborn Popp, Rebekah Stanton, Shakeera Walker, Meiyi Ma, Gautam Biswas

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 本文提出EDF框架,通过Copa代理在真实课堂中展示其能有效引导反馈与学生理解一致,促进支架退化,并提供可解释的证据支持解释。

Comments Published as a long paper in the proceedings of the 27th International Conference on Artificial Intelligence in Education (AIED26)

Journal ref International Conference on Artificial Intelligence in Education. Cham: Springer Nature Switzerland, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18665 2026-07-13 cs.IR cs.AI cs.CL cs.CR cs.LG 87%

Membership Inference Attacks on In-Context Examples in LLM-based Recommender Systems

基于LLM的推荐系统中上下文示例的成员推断攻击

Jiajie He, Min-Chun Chen, Xintong Chen, Xinyang Fang, Yuechun Gu, Keke Chen

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校) University of Cincinnati(辛辛那提大学) University of Southern California(南加州大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出两种针对LLM推荐系统中上下文示例的成员推断攻击,揭示了敏感信息暴露的风险及现有防御方法的不足。

Comments This is paper is accepted by ACM RecSys 2026 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20576 2026-06-23 cs.NI 新提交 87%

Exploring LLM in Semantic Communication for V2X Networks

探索V2X网络中的语义通信大语言模型

Sihem Bakri, Navdeep Singh, Nicola Marchetti

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 提出将大语言模型与图知识表示结合的语义通信框架,通过传输高级语义消息而非原始数据,在V2X网络中平均降低33.54%带宽消耗。

Comments Accepted at: IEEE 103rd Vehicular Technology Conference (VTC2026-Spring) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16824 2026-06-16 cs.DC cs.OS 新提交 87%

CacheWise: Understanding Workloads and Optimizing KVCache Management for Efficiently Serving LLM Coding Agents

CacheWise:理解工作负载并优化KVCache管理以高效服务LLM编码代理

Shubham Tiwari, Tapan Chugh, Nash Rickert, Simon Peter, Ratul Mahajan, Haiying Shen

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 针对编码代理会话中大量前缀复用导致KVCache压力的问题,提出CacheWise管理层,结合前缀感知调度和基于工具调用元数据的轻量级预测驱逐策略,减少KVCache驱逐并提升会话完成时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16135 2026-06-16 cs.DC 新提交 87%

SwiftCache: Efficient LLM Serving for Multi-turn Conversations with Heterogeneous KV Cache Sharing

SwiftCache: 面向多轮对话的高效LLM服务与异构KV缓存共享

Jianmin Hu, Minxian Xu, Sa Wang, Chong Ma, Min Shen, Kejiang Ye, Lin Qu, Chengzhong Xu

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 针对多轮对话中KV缓存占用显存导致推理延迟高、上下文受限的问题,提出SwiftCache系统,通过异构模型间共享空闲GPU内存和NVLink带宽,仅保留当前层KV缓存,降低延迟并扩展上下文长度。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15177 2026-06-16 cs.DC 新提交 87%

Coordinated Scheduling for MoE LLM Serving

MoE大语言模型服务的协调调度

Yifan Sun, Zhexiang Zhang, Jiantong Jiang, Gholamreza Haffari, Minxian Xu, Feng Liu, Rajkumar Buyya, Adel N. Toosi

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 提出Gimbal,一种跨层协调调度系统,通过细粒度DP引擎调度和专家负载均衡,减少平均TTFT 42.9%和TPOT 33.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05299 2026-06-16 cs.LG cs.AI cs.CL cs.SD 版本更新 87%

WavSLM: Single-Stream Speech Language Modeling via WavLM Distillation

WavSLM: 通过WavLM蒸馏的单流语音语言建模

Luca Della Libera, Cem Subakan, Mirco Ravanelli

机构 * Concordia University(康科迪亚大学) Mila-Quebec AI Institute(蒙特利尔AI研究所) Université Laval(拉瓦尔大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出WavSLM,通过量化蒸馏WavLM自监督表示到单一码本并优化自回归下一块预测,实现无文本监督的单流语音语言建模,在一致性和生成任务上表现竞争。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11690 2026-06-11 cs.DC cs.PF 新提交 87%

Beyond Per-Token Pricing: A Concurrency-Aware Methodology for LLM Infrastructure Cost Estimation

超越按Token定价:一种考虑并发性的LLM基础设施成本估算方法

Chitral Patil

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 针对现有成本计算器将GPU利用率作为固定输入导致严重误差的问题,提出一种基于测量请求率λ的并发感知成本估算方法,并开源vllm-cost-meter工具,验证了低负载下成本被低估2.5-36.3倍。

Comments 26 pages, 9 figures. Code: https://github.com/pChitral/vllm-cost-meter

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04650 2026-06-04 cs.IR 87%

Improving the Efficiency and Effectiveness of LLM Knowledge Distillation for Conversational Search

提升大语言模型知识蒸馏在对话搜索中的效率与效果

Stan Fris, Jan Hutter, Jan Henrik Bertrand, Simon Lupart, Mohammad Aliannejadi

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本研究通过引入对比损失和正则化损失改进基于KLD的蒸馏方法,在对话搜索中同时提升了检索精度和推理效率。

Comments SCAI Workshop at SIGIR '26}{July 20--24, 2026}{Melbourne, Naarm, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04394 2026-06-04 cs.SE 87%

Beyond Single-Policy: Evaluating Composed Organization-Specific Policy Alignment in LLM Chatbots

超越单一策略:评估LLM聊天机器人中组合的组织特定策略对齐

Yingjie Liu, Yongxiang Hu, Xuan Wang, Yilun Li, Yunlei Wei, Xiaoyu Wang, Yangfan Zhou

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对现有基准忽视的组合策略违规问题,提出COPAL工具,通过经验推导的交互模式和显式处理契约生成触发组合策略失败的查询,在9个模型中平均错误率达33.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15826 2026-06-04 cs.HC 87%

Campus AI vs. Commercial AI: Comparing How Students and Employees Perceive their University's LLM Chatbot vs. ChatGPT

校园AI vs. 商业AI:比较学生和员工如何看待其大学的LLM聊天机器人与ChatGPT

Leon Hannig, Annika Bush, Meltem Aksoy, Tim Trappen, Steffen Becker, Greta Ontrup

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 通过实地研究(N=526),比较德国一所大学的学生和员工对其定制的LLMaaS聊天机器人与ChatGPT的感知差异,发现定制系统在信任、隐私和幻觉体验方面更优。

Comments To appear in the Proceedings of the ACM CHI Conference on Human Factors in Computing Systems (CHI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03266 2026-06-03 cs.HC 87%

ReforMe: Re-Shaping Documents with Contextual Prompting and Layout-Aware Propagation

ReforMe: 通过上下文提示和布局感知传播重塑文档

Nabin Khanal, Tongyan Wang, Jui-Cheng Chiu, Ningning Nicole Kong, Hannah Yanhua Zong, Yingjie Victor Chen

专题命中 效率与部署 :LLM(summary_cn,abstract);prompting(title)

AI总结 提出一个交互式文档数字化系统,结合布局感知解析、OCR和基于LLM的重建,通过用户驱动精炼和布局感知传播机制,提高复杂文档的校正效率和结构化表示能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01556 2026-06-02 cs.DC 87%

TwinQuant: Learnable Subspace Decomposition for 4-Bit LLM Quantization

TwinQuant: 可学习的子空间分解用于4位LLM量化

Haodong Wang, Junjie Liu, Zicong Hong, Qianli Liu, Jian Lin, Song Guo, Xu Chen

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出TwinQuant框架,通过联合优化Stiefel流形和一般线性流形学习量化友好的子空间分解,重塑低秩和残差分量以减少量化误差,并设计融合双分量内核实现高效端到端执行。

Comments 17pages, Accepted by ICML26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25375 2026-05-26 cs.DC 87%

Bandwidth-Aware and Cost-Efficient Pipeline Parallel Scheduling in Geo-Distributed LLM Training

地理分布式大语言模型训练中带宽感知且成本高效的流水线并行调度

Han Zhang, Jianchun Liu, Hongli Xu

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 提出BACE-Pipe框架,通过动态作业优先级、带宽感知路径搜索和成本最小化分配,在异构带宽和电价下优化流水线并行调度,同时降低作业完成时间和总电费。

详情

展开后加载摘要…

URL PDF HTML 收藏