arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-06 至 2026-04-06 共收录 38 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 38 篇

2604.02367 2026-04-06 cs.NI cs.CL 91%

Evaluating Small Language Models for Front-Door Routing: A Harmonized Benchmark and Synthetic-Traffic Experiment

评估小型语言模型用于前端路由:一个统一的基准和合成流量实验

Warren Johnson, Charles Lee

机构 * Plexor Labs(Plexor实验室) Project Autobots

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);SLM(abstract,comments);LLM(abstract)

AI总结 本文通过统一基准和合成流量实验,评估小型语言模型在前端路由中的性能,发现Qwen-2.5-3B在准确率、延迟和成本上表现优异,但整体仍存在准确率与延迟的平衡问题。

Comments 23 pages, 1 figure, 9 tables. Article 8 in the TAAC Research Series. Code and data: https://github.com/micoverde/plexor-slm-frontdoor-rct

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02816 2026-04-06 cs.CV cs.AI 89%

QAPruner: Quantization-Aware Vision Token Pruning for Multimodal Large Language Models

QAPruner: 量化感知的多模态大语言模型视觉标记剪枝

Xinhao Wang, Zhonyu Xia, Zhiwei Lin, Zhe Li, Yongtao Wang

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.AI

AI总结 本文提出QAPruner框架,通过结合量化误差模拟与异常强度指标,实现多模态大语言模型的视觉标记剪枝与后训练量化联合优化,提升低比特下的推理精度。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02501 2026-04-06 eess.SP 88%

ECG Foundation Models and Medical LLMs for Agentic Cardiovascular Intelligence at the Edge: A Review and Outlook

ECG基础模型与医疗大语言模型用于边缘端心血管智能:综述与展望

Mudassir Hasan Khan, Ahmad Nayfeh, Mudassir Masood, Ali Ahmad Al-Shaikhi, Muhammad Mahboob Ur Rahman, Tareq Y. Al-Naffouri

专题命中 效率与部署 :foundation model(title,abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 本文综述了用于心血管疾病诊断、监测和临床决策支持的ECG基础模型和医疗大语言模型,探讨了其在边缘计算中的应用及未来发展方向。

Comments 18 pages, 4 figures, 4 tables, under review with a journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02556 2026-04-06 cs.LG cs.AR cs.PF 88%

Fast NF4 Dequantization Kernels for Large Language Model Inference

快速的NF4去量化内核用于大语言模型推理

Xiangbo Qi, Chaoyi Jiang, Murali Annavaram

机构 * University of Southern California(南加州大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出了一种轻量级共享内存优化方法,通过利用内存层次结构提升性能,实现大语言模型推理的加速,展示了在不同模型上的显著速度提升。

Comments 7 pages, 4 figures, EMC2 Workshop at ASPLOS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03048 2026-04-06 cs.SE 88%

Combining Static Code Analysis and Large Language Models Improves Correctness and Performance of Algorithm Recognition

结合静态代码分析和大语言模型提高算法识别的正确性和性能

Denis Neumüller, Sebastian Boll, David Schüler, Matthias Tichy

专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract);prompting(abstract)

AI总结 本文研究了结合大语言模型与静态代码分析在算法识别中的效果,发现该方法能显著降低运行时间并提升F1分数,同时验证了模型在标识符混淆下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01207 2026-04-06 cs.LG cs.AI stat.ME 87%

Efficient Causal Graph Discovery Using Large Language Models

利用大语言模型高效发现因果图

Thomas Jiralerspong, Xiaoyin Chen, Yash More, Vedant Shah, Yoshua Bengio

机构 * Mila, Université de Montréal(蒙特利尔大学Mila研究所) Mila, McGill University(麦吉尔大学Mila研究所)

专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种利用大语言模型进行完整因果图发现的新框架,通过广度优先搜索方法提高效率,并展示其在不同规模真实因果图上的最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02985 2026-04-06 cs.IR cs.AI cs.CL 86%

Prompt Compression in the Wild: Measuring Latency, Rate Adherence, and Quality for Faster LLM Inference

野火中的提示压缩:测量延迟、速率遵守和质量以加快大语言模型推理

Cornelius Kummer, Lena Jurkschat, Michael Färber, Sahar Vahdati

机构 * ScaDS.AI Dresden/Leipzig, CIDS, TU Dresden(ScaDS.AI 德累斯顿/莱比锡,CIDS,德累斯顿工业大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了提示压缩在实际应用中的延迟、速率遵守和质量影响,通过大规模实验发现,当提示长度、压缩比和硬件容量匹配时,LLMLingua可实现18%的端到端加速,但超出此范围压缩步骤会抵消收益。

Comments Accepted at ECIR 2026 (Full Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02334 2026-04-06 cs.AI cs.MA 85%

Holos: A Web-Scale LLM-Based Multi-Agent System for the Agentic Web

Holos:一种基于大语言模型的多智能体系统,用于代理网络

Xiaohang Nie, Zihan Guo, Zicai Cui, Jiachi Yang, Zeyi Chen, Leheyi De, Yu Zhang, Junwei Liao, Bo Huang, Yingxuan Yang, Zhi Han, Zimian Peng, Linyao Chen, Wenzheng Tom Tang, Zongkai Liu, Tao Zhou, Botao Amber Hu, Shuyang Tang, Jianghao Lin, Weiwen Liu, Muning Wen, Yuanjian Zhou, Weinan Zhang

机构 * Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Harbin Institute of Technology(哈尔滨工业大学) Sun Yat-sen University(中山大学) University of Oxford(牛津大学) Holos Engineering

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Holos是一种大规模多智能体系统,旨在解决LLM驱动智能体在扩展、协调和价值分配中的挑战,通过五层架构和内生价值循环,推动代理网络的自组织和持续发展。

Comments 38 pages, 8 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02776 2026-04-06 cs.SE 83%

Evaluating the Environmental Impact of using SLMs and Prompt Engineering for Code Generation

评估使用SLMs和提示工程进行代码生成的环境影响

Md Afif Al Mamun, Sayan Nath, Gias Uddin, Novarun Deb

专题命中 效率与部署 :large language model(abstract);language model(abstract);small language model(abstract);SLM(abstract)

AI总结 本文研究了基于SLMs的代码生成中不同提示策略对准确性和可持续性的影响,发现可持续性与准确性脱钩,提示工程可实现环保与性能的平衡。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14617 2026-04-06 cs.DC cs.LG 83%

Seer: Online Context Learning for Fast Synchronous LLM Reinforcement Learning

Seer:在线上下文学习用于快速同步LLM强化学习

Ruoyu Qin, Weiran He, Weixiao Huang, Yangkun Zhang, Yikai Zhao, Bo Pang, Xinran Xu, Yingdi Shan, Yongwei Wu, Mingxing Zhang

机构 * Moonshot AI(月之暗面) Tsinghua University(清华大学)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 Seer通过动态负载均衡、上下文感知调度和自适应分组推测解码技术,显著降低长尾延迟并提升资源利用率,实现2.04倍的端到端效率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02945 2026-04-06 cs.DC 82%

MSAO: Adaptive Modality Sparsity-Aware Offloading with Edge-Cloud Collaboration for Efficient Multimodal LLM Inference

MSAO:基于边缘-云协作的自适应模态稀疏性感知卸载框架用于高效多模态大语言模型推理

Zheming Yang, Qi Guo, Jun Wan, Jiarui Ruan, Yunqing Hu, Chang Zhao, Xiangyang Li

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出MSAO框架,通过边缘-云协作和模态稀疏性分析,降低多模态大语言模型推理的延迟和资源消耗,提升吞吐量。

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02702 2026-04-06 cs.SE cs.PL 82%

TypePro: Boosting LLM-Based Type Inference via Inter-Procedural Slicing

TypePro: 通过跨过程切片提升基于大语言模型的类型推断

Teyu Lin, Minghao Fan, Huaxun Huang, Zhirong Shen, Rongxin Wu

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出TypePro方法,通过跨过程代码切片补充上下文信息,提升动态语言类型推断的准确性和鲁棒性,实验结果显示在ManyTypes4Py和ManyTypes4TypeScript数据集上分别达到88.9%和86.6%的Top-1精确匹配率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03057 2026-04-06 cs.CL cs.AI 81%

Querying Structured Data Through Natural Language Using Language Models

通过语言模型查询结构化数据

Hontan Valentin-Micu, Bunea Andrei-Alexandru, Tantaroudas Nikolaos Dimitrios, Popovici Dan-Matei

机构 * National University of Science and Technology POLITEHNICA Bucharest(布加勒斯特理工大学) Institute of Communication and Computer Systems (ICCS)(通信与计算机系统研究所)

专题命中 效率与部署 :language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种开源方法,使用户能通过自然语言查询结构化非文本数据集,通过训练LLM生成可执行查询,展示了在资源受限环境下小型领域模型的高效性。

Comments in publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03110 2026-04-06 cs.CL 79%

Multi-Aspect Knowledge Distillation for Language Model with Low-rank Factorization

多方面知识蒸馏用于具有低秩因子化的语言模型

Zihe Liu, Yulong Mao, Jinan Xu, Xinrui Peng, Kaiyu Huang

机构 * Key Laboratory of Big Data & Artificial Intelligence in Transportation(交通大数据与人工智能重点实验室) School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL

AI总结 本文提出多方面知识蒸馏方法,通过深入模仿自注意力和前馈模块,捕捉不同方面的丰富语言知识,实验表明其在相同存储预算下能与强基线模型竞争,并在蒸馏自回归架构模型中表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02570 2026-04-06 cs.CV cs.LG 79%

WSVD: Weighted Low-Rank Approximation for Fast and Efficient Execution of Low-Precision Vision-Language Models

WSVD:用于低精度视觉-语言模型快速高效执行的加权低秩近似

Haiyu Wang, Yutong Wang, Jack Jiang, Sai Qian Zhang

机构 * Tandon School of Engineering, New York University(纽约大学坦登工程学院) Courant Institute of Mathematical Sciences, New York University(纽约大学库朗数学科学研究所)

专题命中 效率与部署 :language model(title,abstract);分类 cs.LG

AI总结 本文提出WSVD方法,通过加权低秩近似和量化技术,提升视觉-语言模型的执行效率,实现1.8倍以上的解码速度提升同时保持精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02344 2026-04-06 cs.LG cs.DC cs.PF 79%

Characterizing WebGPU Dispatch Overhead for LLM Inference Across Four GPU Vendors, Three Backends, and Three Browsers

对四种GPU厂商、三个后端和三个浏览器下LLM推理中WebGPU调度开销的表征

Jędrzej Maczan

机构 * Independent Researcher(独立研究者)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.LG

AI总结 本文研究WebGPU调度开销对LLM推理的影响,通过四个GPU厂商、两个后端和三个浏览器的系统表征,发现调度开销显著影响性能,提出顺序调度方法揭示调度开销真实成本,并展示不同后端和实现的选择对性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02956 2026-04-06 cs.CV 78%

Collaborative Multi-Mode Pruning for Vision-Language Models

多模式协作剪枝用于视觉-语言模型

Zimeng Wu, Yunhong Wang, Donghao Wang, Jiaxin Chen

机构 * State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)

专题命中 效率与部署 :language model(title,abstract)

AI总结 本文提出CoMP框架,通过联合参数和token剪枝,解决单一模式剪枝导致的性能下降问题,通过协作重要性度量和多模式剪枝策略提升高剪枝率下的模型性能。

Comments CVPR2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02665 2026-04-06 cs.SE 78%

AgentSZZ: Teaching the LLM Agent to Play Detective with Bug-Inducing Commits

AgentSZZ: 教授LLM代理通过引发缺陷的提交进行调查

Yunbo Lyu, Jieke Shi, Hong Jin Kang, Ratnadira Widyasari, Junda He, Yuqing Niu, Chengran Yang, Junkai Chen, Zhou Yang, Julia Lawall, David Lo

专题命中 效率与部署 :LLM(title,abstract)

AI总结 AgentSZZ通过LLM代理探索仓库并识别缺陷引发提交,结合专用工具、领域知识和ReAct循环,提升跨文件和幽灵提交的召回率,实现F1分数提升27.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25744 2026-04-06 cs.CV 78%

MuRF: Unlocking the Multi-Scale Potential of Vision Foundation Models

MuRF:解锁视觉基础模型的多尺度潜力

Bocheng Zou, Mu Cai, Mark Stanley, Dingfu Lu, Yong Jae Lee

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 效率与部署 :foundation model(title,abstract)

AI总结 本文提出MuRF策略,通过多分辨率融合提升视觉基础模型的推理性能,适用于多种任务和模型家族。

Comments Project Page: https://murf-vfm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13633 2026-04-06 cs.CV 78%

EGM: Efficient Visual Grounding Language Models

EGM: 高效视觉语义语言模型

Guanqi Zhan, Changye Li, Zhijian Liu, Yao Lu, Yi Wu, Song Han, Ligeng Zhu

机构 * NVIDIA(英伟达) MIT(麻省理工学院) University of Oxford(牛津大学) Tsinghua University(清华大学)

专题命中 效率与部署 :language model(title,abstract)

AI总结 本文提出EGM,通过生成大量中等质量token来提升小模型的视觉语义能力,实验证明其在效率和性能上优于大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05528 2026-04-06 cs.LG 77%

ARMOR: High-Performance Semi-Structured Pruning via Adaptive Matrix Factorization

ARMOR:通过自适应矩阵分解实现高性能半结构化剪枝

Lawrence Liu, Alexander Liu, Mengdi Wang, Tuo Zhao, Lin F. Yang

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校) University of Washington(华盛顿大学) Princeton University(普林斯顿大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG

AI总结 ARMOR通过自适应矩阵分解技术,实现高效的半结构化剪枝,保留模型质量的同时提升压缩效率和任务准确性。

Comments ICLR 2026, code: https://github.com/LawrenceRLiu/ARMOR

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03072 2026-04-06 cs.CV 75%

MI-Pruner: Crossmodal Mutual Information-guided Token Pruner for Efficient MLLMs

MI-Pruner:跨模态互信息引导的令牌修剪器用于高效的大语言模型

Jiameng Li, Aleksei Tiulpin, Matthew B. Blaschko

机构 * Faculty of Medicine, University of Oulu, Finland(芬兰奥卢大学医学院)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出MI-Pruner,通过计算视觉与文本特征间的互信息来指导令牌修剪,无需依赖注意力机制,实现高效的大语言模型推理。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03040 2026-04-06 cs.CV 75%

QVAD: A Question-Centric Agentic Framework for Efficient and Training-Free Video Anomaly Detection

QVAD:一种以问题为中心的代理框架,用于高效且无需训练的视频异常检测

Lokman Bekit, Hamza Karim, Nghia T Nguyen, Yasin Yilmaz

机构 * Department of Electrical Engineering, University of South Florida, Tampa, Florida, USA(南佛罗里达大学电气工程系,坦帕,佛罗里达州,美国)

专题命中 效率与部署 :LLM(abstract);language model(abstract);foundation model(abstract)

AI总结 QVAD提出一种以问题为中心的代理框架,通过动态对话机制提升视频异常检测的效率和性能,无需参数更新即可实现高精度检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02971 2026-04-06 cs.AI 70%

InfoSeeker: A Scalable Hierarchical Parallel Agent Framework for Web Information Seeking

InfoSeeker:一种用于网络信息检索的可扩展分层并行代理框架

Ka Yiu Lee, Yuxuan Huang, Zhiyuan He, Huichi Zhou, Weilin Luo, Kun Shao, Meng Fang, Jun Wang

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出InfoSeeker框架,通过分层结构和并行机制解决大规模信息整合中的效率与准确性问题,实验证明其在信息检索任务中具有显著的提升效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02689 2026-04-06 cs.CV cs.AI 70%

Efficient3D: A Unified Framework for Adaptive and Debiased Token Reduction in 3D MLLMs

Efficient3D: 一种用于3D多模态大语言模型中自适应和去偏token减少的统一框架

Yuhui Lin, Siyue Yu, Yuxing Yang, Guangliang Cheng, Jimin Xiao

机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学) University of Liverpool(利物浦大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Efficient3D框架,通过去偏视觉token重要性估计器和自适应token再平衡策略,实现3D MLLMs的高效推理,提升性能并降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02492 2026-04-06 cs.CV cs.AI 70%

Token-Efficient Multimodal Reasoning via Image Prompt Packaging

通过图像提示包装实现高效的多模态推理

Joong Ho Choi, Jiayang Zhao, Avani Appalla, Himansh Mukesh, Dhwanil Vasani, Boyi Qian

机构 * BNY Pittsburgh US(美国匹兹堡)

专题命中 效率与部署 :language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出图像提示包装方法,通过将结构化文本嵌入图像以减少文本令牌开销,并在多个数据集和模型上验证其效果,展示了在多模态系统设计中视觉编码的重要性。

Comments 9 pages including references

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02911 2026-04-06 cs.RO 67%

Learning Task-Invariant Properties via Dreamer: Enabling Efficient Policy Transfer for Quadruped Robots

通过Dreamer学习任务不变属性:为四足机器人实现高效的策略迁移

Junyang Liang, Yuxuan Liu, Yabin Chang, Junfan Lin, Junkai Ji, Hui Li, Changxin Huang, Jianqiang Li

机构 * Shenzhen University(深圳大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文提出DreamTIP框架,通过在Dreamer世界模型中引入任务不变属性学习,提升仿真到现实的迁移能力,实验表明其在复杂地形任务中表现优异,性能提升显著。

Comments Accepted by IEEE International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05094 2026-04-06 cs.HC 67%

Agentic Link Construction for Environment and Intent Aware 6G Communication

面向环境和意图感知的6G通信代理链路构建

Zhaoyang Li, Shangzhuo Xie, Qianqian Yang

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文提出基于强化学习的多模态通信决策模型,实现链路构建的语义对齐与个性化适应,提升6G通信的鲁棒性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03192 2026-04-06 cs.CL cs.AI 62%

Reliability Gated Multi-Teacher Distillation for Low Resource Abstractive Summarization

可靠性导向的多教师蒸馏用于低资源抽象摘要

Dipto Sumit, Ankan Kumar Roy, Sadia Khair Rodela, Atia Haque Asha, Mourchona Afrin, Niloy Farhan, Farig Yousuf Sadeque

机构 * BRAC University(BRAC大学)

专题命中 效率与部署 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了从可靠性角度出发的多教师知识蒸馏,提出EWAD和CPDP机制,通过实验发现logit级KD效果最佳,复杂蒸馏提升短摘要语义相似性但影响长摘要,跨语言伪标签KD在压缩率下保持ROUGE L分数,揭示了单判 pipelines 的校准偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02339 2026-04-06 cs.LG cs.CL 62%

SIEVE: Sample-Efficient Parametric Learning from Natural Language

SIEVE: 从自然语言中高效参数学习

Parth Asawa, Alexandros G. Dimakis, Matei Zaharia

机构 * University of California, Berkeley(加州大学伯克利分校) Bespoke Labs

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.LG

AI总结 SIEVE通过合成数据生成管道实现高效参数学习,仅需三个查询示例即可提升模型性能,适用于需要上下文的推理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏