arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22280 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22280 篇

2602.24044 2026-07-07 cs.DC cs.AI cs.CL cs.LG 版本更新 88%

Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving

用于分布式大语言模型适配器服务的GPU效率数据驱动优化

Ferran Agullo, Joan Oliveras, Chen Wang, Alberto Gutierrez-Torre, Olivier Tardieu, Alaa Youssef, Jordi Torres, Josep Ll. Berral

机构 * BSC(巴塞罗那超级计算中心) IBM(国际商业机器公司) UPC(巴塞罗那技术大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究分布式大语言模型适配器服务中GPU资源利用问题,提出数据驱动管道,通过性能预测、数字孪生等组件,以最少GPU服务工作负载,提升效率,还可用于其他目标。

Comments update of the journal paper contents after major revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00447 2026-07-01 cs.SE 版本更新 88%

Think Harder and Don't Overlook Your Options: Revisiting Issue-Commit Linking with LLM-Assisted Retrieval

深入思考并不要忽视你的选项:重新审视基于LLM辅助检索的议题-提交链接

Cole Morgan, Muhammad Asaduzzaman, Shaiful Chowdhury, Shaowei Wang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文重新评估了多种议题-提交链接恢复技术,通过比较不同检索方法和机器学习模型,发现密集检索优于稀疏检索,传统机器学习方法性能优于大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25647 2026-06-25 cs.CE 新提交 88%

Retrieval-Grounded Multilingual LLM Assistance for Island Smallholder Farmers

基于检索的多语言LLM辅助工具用于岛屿小农户

Nikolaos D. Tantaroudas, Ilias Karachalios, Andrew J. McCracken

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对偏远岛屿小农户获取农业建议困难且方言知识缺乏全球语料支持的问题,提出嵌入双语电商平台的对话AI助手Falco eleonorae,通过工具增强检索(MCP)获取本地化数据,实现可信的多语言、语音和图像交互。

Comments 13, 4

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16825 2026-06-16 cs.CL cs.AI cs.LG 新提交 88%

Tying the Loop -- Tied Expert Layers in Mixture-of-Experts Language Models

循环绑定——混合专家语言模型中的专家层绑定

Martin Jaggi

机构 * EPFL(瑞士联邦理工学院洛桑)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);pretraining(abstract)

AI总结 提出专家绑定方法,通过共享连续Transformer层的专家参数,在保持独立路由和注意力的同时,将MoE模型内存占用降低近2倍,且不损失困惑度或下游性能。

Comments Code available at https://github.com/epfml/looped-moe

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02955 2026-06-16 cs.CL cs.AI cs.LG 版本更新 88%

Fast-dLLM++: Fréchet Profile Decoding for Faster Diffusion LLM Inference

Fast-dLLM++: 用于更快扩散LLM推理的Fréchet轮廓解码

Siva Rajesh Kasa, Yasong Dai, Sumit Negi, Hongdong Li

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对扩散大语言模型推理中并行令牌生成的瓶颈,提出Fréchet轮廓解码方法,通过利用异构置信度轮廓选择并行提交集,在保持模型和缓存不变的情况下提升吞吐量。

Comments Initial version accepted at Workshop on Structured Probabilistic Inference & Generative Modeling, ICML 2026. Project Page: https://ringo-star.github.io/projectpage_frechet/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24528 2026-06-02 cs.AI cs.CL cs.LG 88%

Hypothesis Generation and Inductive Inference in Children and Language Models

儿童与语言模型中的假设生成与归纳推理

Jeffrey Qin, Wasu Top Piriyakulkij, Zhuangfei Gao, Mia Radovanovic, Jessica Sommerville, Kevin Ellis, Marta Kryven

机构 * Computer Science University of Waterloo(滑铁卢大学计算机科学系) Department of Computer Science Cornell University(康奈尔大学计算机科学系) Department of Computer Science Dalhousie University(达尔豪斯大学计算机科学系) Department of Psychology University of Toronto(多伦多大学心理学系)

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 通过归纳推理盒子任务,结合贝叶斯粒子推断的程序归纳形式化,比较儿童与基于LLM的智能体在不确定性下的假设生成与证据寻求行为,发现两者在适应环境结构上相似但信息寻求成本与归纳偏差不同。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28268 2026-05-28 cs.DB 88%

Towards Cost-effective LLMs Routing with Batch Prompting

面向成本效益的批量提示大语言模型路由

Haotian Xu, Kangfei Zhao, Jiadong Xie

专题命中 效率与部署 :prompting(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出RoBatch框架,联合优化模型分配和查询聚合两个维度,在成本预算下实现更优的成本-性能帕累托前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28051 2026-05-28 cs.CV 88%

Beyond Surrogate Gradients: Fully Differentiable Token Pruning for Vision-Language Models

超越代理梯度:面向视觉-语言模型的完全可微分令牌剪枝

Landi He, Mingde Yao, Shawn Young, Lijian Xu

机构 * Shenzhen University of Advanced Technology(深圳大学先进技术学院) CUHK MMLab(香港中文大学MMLab) CPII under InnoHK(创新工场CPII)

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(title,abstract)

AI总结 提出DiffPrune方法,通过将剪枝重新表述为令牌信息的连续控制而非离散选择学习,利用信息节流阀调节令牌,实现完全可微分的令牌重要性学习,在保持96.5%全模型精度的同时将LLM预填充加速2.85倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23640 2026-05-25 cs.CR 88%

CachePrune: Privacy-Aware and Fine-Grained KV Cache Sharing for Efficient LLM Inference

CachePrune:面向高效LLM推理的隐私感知细粒度KV缓存共享

Guanlong Wu, Zhaohan li, Yao Zhang, Zheng Zhang, Jianyu Niu, Ye Wu, Yinqian Zhang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对跨用户KV缓存共享带来的侧信道泄露问题,提出CachePrune机制,通过令牌级细粒度缓存管理实现隐私感知的KV条目选择性重用,在消除直接泄露的同时显著降低首令牌延迟并提高缓存命中率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11938 2026-05-12 cs.DC 88%

FlexPipe: Adapting Dynamic LLM Serving Through Inflight Pipeline Refactoring in Fragmented Serverless Clusters

FlexPipe:通过片段化无服务器集群中的飞行管道重构实现动态LLM服务

Yanying Lin, Shijie Peng, Chengzhi Lu, Chengzhong Xu, Kejiang Ye

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 FlexPipe通过动态重构管道架构,解决无服务器集群中资源碎片化和请求模式变化带来的效率问题,实现8.5倍资源利用率提升和38.3%的延迟降低。

Comments EuroSys 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26821 2026-04-30 cs.AR cs.DC 88%

Exploring the Efficiency of 3D-Stacked AI Chip Architecture for LLM Inference with Voxel

探索3D堆叠AI芯片架构在大语言模型推理中的效率:Voxel

Yiqi Liu, Noelle Crawford, Michael Wang, Jilong Xue, Jian Huang

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Voxel框架,用于探索3D堆叠AI芯片在LLM推理中的效率,分析计算范式、映射策略及硬件架构的影响,揭示效率取决于多因素协同及映射设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02501 2026-04-06 eess.SP 88%

ECG Foundation Models and Medical LLMs for Agentic Cardiovascular Intelligence at the Edge: A Review and Outlook

ECG基础模型与医疗大语言模型用于边缘端心血管智能:综述与展望

Mudassir Hasan Khan, Ahmad Nayfeh, Mudassir Masood, Ali Ahmad Al-Shaikhi, Muhammad Mahboob Ur Rahman, Tareq Y. Al-Naffouri

专题命中 效率与部署 :foundation model(title,abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 本文综述了用于心血管疾病诊断、监测和临床决策支持的ECG基础模型和医疗大语言模型,探讨了其在边缘计算中的应用及未来发展方向。

Comments 18 pages, 4 figures, 4 tables, under review with a journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19133 2026-03-30 cs.DC 88%

A Pipelined Collaborative Speculative Decoding Framework for Efficient Edge-Cloud LLM Inference

一种用于高效边缘-云LLM推理的流水线协同推测解码框架

Yida Zhang, Zhiyong Gao, Shuaibing Yue, Jie Li, Rui Wang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 本文提出PicoSpec框架,通过异步流水线解决边缘协作中的等待问题,并引入稀疏压缩降低通信延迟,实现在边缘-云协同推理中的高效性能。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14327 2026-03-06 cs.LG cs.AI cs.CL 88%

Yuan3.0 Ultra: A Trillion-Parameter Enterprise-Oriented MoE LLM

Yuan3.0 Ultra:一个万亿参数企业导向的MoE大语言模型

YuanLab. ai, :, Shawn Wu, Jiangang Luo, Darcy Chen, Sean Wang, Louie Li, Allen Wang, Xudong Zhao, Tong Yu, Bach Li, Joseph Shen, Gawain Ma, Jasper Jia, Marcus Mao, Claire Wang, Hunter He, Carol Wang, Zera Zhang, Jason Wang, Chonly Shen, Leo Zhang, Logan Chen, Qasim Meng, James Gong, Daniel Zhao, Penn Zheng, Owen Zhu

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 Yuan3.0 Ultra通过LAEP算法提升预训练效率,实现万亿参数企业导向MoE大语言模型的高效训练与多领域性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12225 2026-01-09 cs.LG cs.AI cs.CL stat.ML 88%

Mining Intrinsic Rewards from LLM Hidden States for Efficient Best-of-N Sampling

从LLM隐藏状态中挖掘内在奖励以实现高效的Best-of-N采样

Jizhou Guo, Zhaomin Wu, Hanchen Yang, Philip S. Yu

机构 * Zhiyuan College, Shanghai Jiao Tong University(上海交通大学紫阳学院) National University of Singapore(新加坡国立大学) Tongji University(同济大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 SWIFT通过从LLM隐藏状态中挖掘内在奖励,实现高效Best-of-N采样,提升模型性能并减少计算成本。

Comments Accepted by KDD 2026 (Research Track). Project page: https://aster2024.github.io/swift-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14398 2025-11-18 cs.CL cs.AI cs.LG 88%

On the Limitations of Language Targeted Pruning: Investigating the Calibration Language Impact in Multilingual LLM Pruning

Simon Kurz, Jian-Jia Chen, Lucie Flek, Zhixue Zhao

机构 * Department of Computer Science, TU Dortmund University(图恩-多特蒙德大学计算机科学系) Bonn-Aachen International Center for Information Technology, University of Bonn(波恩-亚琛国际信息科技中心,波恩大学) Computer Science School, University of Sheffield(谢菲尔德大学计算机科学学院) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔人工智能与机器学习研究所)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments Accepted for publication in TACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14686 2025-11-12 cs.CV 88%

From Semantics, Scene to Instance-awareness: Distilling Foundation Model for Grounded Open-vocabulary Situation Recognition

Chen Cai, Tianyi Liu, Jianjun Gao, Wenyang Liu, Kejun Wu, Ruoyu Wang, Yi Wang, Soo Chin Liew

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Huazhong University of Science and Technology(华中科技大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 效率与部署 :foundation model(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02483 2025-10-06 cs.LG cs.AI cs.CL 88%

Litespark Technical Report: High-Throughput, Energy-Efficient LLM Training Framework

Nii Osae Osae Dade, Moinul Hossain Rahat

机构 * Mindbeam AI

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04096 2025-08-07 cs.SD eess.AS 88%

Efficient Scaling for LLM-based ASR

Bingshen Mu, Yiwen Shao, Kun Wei, Dong Yu, Lei Xie

机构 * Tencent AI Lab(腾讯人工智能实验室)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments Accepted by ASRU 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.15933 2025-08-05 cs.CL cs.AI cs.LG 88%

You Can Generate It Again: Data-to-Text Generation with Verification and Correction Prompting

Xuan Ren, Zeyu Zhang, Lingqiao Liu

机构 * AIML, University of Adelaide(人工智能实验室,阿德莱德大学)

专题命中 效率与部署 :prompting(title,abstract);large language model(abstract);language model(abstract);small language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12000 2025-07-18 eess.SP 88%

DSSD: Efficient Edge-Device LLM Deployment and Collaborative Inference via Distributed Split Speculative Decoding

Jiahong Ning, Ce Zheng, Tingting Yang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);small language model(abstract)

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11959 2025-07-17 cs.CL cs.AI cs.LG 88%

PoTPTQ: A Two-step Power-of-Two Post-training for LLMs

Xinyu Wang, Vahid Partovi Nia, Peng Lu, Jerry Huang, Xiao-Wen Chang, Boxing Chen, Yufei Cui

机构 * McGill University, Canada(麦吉尔大学) Huawei Noah's Ark Lab, Canada(华为诺亚实验室) Mila – Quebec AI Institute, Canada(魁北克AI研究院)

专题命中 效率与部署 :post-training(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments Accepted at ECAI 2025 (European Conference on Artificial Intelligence)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06698 2025-06-10 cs.AI cs.CL cs.CV cs.LG 88%

Contextual Experience Replay for Self-Improvement of Language Agents

Yitao Liu, Chenglei Si, Karthik Narasimhan, Shunyu Yao

专题命中 效率与部署 :language agent(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments Accepted to ACL 2025. 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02958 2025-06-09 cs.LG cs.AI cs.CL cs.MA 88%

AutoML-Agent: A Multi-Agent LLM Framework for Full-Pipeline AutoML

Patara Trirat, Wonyong Jeong, Sung Ju Hwang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments ICML 2025, Project Page: https://deepauto-ai.github.io/automl-agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02208 2025-06-04 cs.LG cs.AI cs.CL 88%

KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning

Hongling Xu, Qi Zhu, Heyuan Deng, Jinpeng Li, Lu Hou, Yasheng Wang, Lifeng Shang, Ruifeng Xu, Fei Mi

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 效率与部署 :post-training(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03621 2025-06-02 cs.NI 88%

JPPO++: Joint Power and Denoising-inspired Prompt Optimization for Mobile LLM Services

Feiran You, Hongyang Du, Kaibin Huang, Abbas Jamalipour

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);small language model(abstract)

Comments arXiv admin note: text overlap with arXiv:2411.18010

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11882 2025-05-29 cs.AI cs.CL cs.HC cs.LG cs.MA 88%

Leveraging Dual Process Theory in Language Agent Framework for Real-time Simultaneous Human-AI Collaboration

Shao Zhang, Xihuai Wang, Wenhao Zhang, Chaoran Li, Junru Song, Tingyu Li, Lin Qiu, Xuezhi Cao, Xunliang Cai, Wen Yao, Weinan Zhang, Xinbing Wang, Ying Wen

机构 * Shanghai Jiao Tong University(上海交通大学) Meituan(美团) Intelligent Game and Decision Laboratory(智能游戏与决策实验室)

专题命中 效率与部署 :language agent(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments Accepted by ACL 2025 Main. Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07428 2025-04-11 cs.IT cs.NI math.IT 88%

Task-oriented Age of Information for Remote Inference with Hybrid Language Models

Shuying Gan, Xijun Wang, Chenyuan Feng, Chao Xu, Howard H. Yang, Xiang Chen, Tony Q. S. Quek

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);small language model(abstract)

Comments accepted by ICCCS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03360 2025-04-07 cs.CY cs.AI cs.CL cs.LG 88%

Sustainable LLM Inference for Edge AI: Evaluating Quantized LLMs for Energy Efficiency, Output Accuracy, and Inference Latency

Erik Johannes Husom, Arda Goknil, Merve Astekin, Lwin Khin Shar, Andre Kåsen, Sagar Sen, Benedikt Andreas Mithassel, Ahmet Soylu

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments 30 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17793 2025-03-25 cs.LG cs.AI cs.CL 88%

Every Sample Matters: Leveraging Mixture-of-Experts and High-Quality Data for Efficient and Accurate Code LLM

Codefuse, Ling Team, :, Wenting Cai, Yuchen Cao, Chaoyu Chen, Chen Chen, Siba Chen, Qing Cui, Peng Di, Junpeng Fang, Zi Gong, Ting Guo, Zhengyu He, Yang Huang, Cong Li, Jianguo Li, Zheng Li, Shijie Lian, BingChang Liu, Songshan Luo, Shuo Mao, Min Shen, Jian Wu, Jiaolong Yang, Wenjie Yang, Tong Ye, Hang Yu, Wei Zhang, Zhenduo Zhang, Hailin Zhao, Xunjin Zheng, Jun Zhou

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏