arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-17 至 2026-03-17 共收录 96 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 96 篇

2505.20112 2026-03-17 cs.CL cs.AI 91%

ERC-SVD: Error-Controlled SVD for Large Language Model Compression

ERC-SVD: 基于误差控制的大型语言模型压缩SVD

Haolei Bai, Siyong Jian, Tuo Liang, Yu Yin, Huan Wang

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

AI总结 本文提出ERC-SVD方法,通过利用截断过程生成的残差矩阵减少截断损失,并选择性压缩模型最后一层以降低误差传播,从而提升压缩模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13765 2026-03-17 cs.CL cs.AI 91%

Knowledge Distillation for Large Language Models

为大型语言模型进行知识蒸馏

Alejandro Paredes La Torre, Barbara Flores, Diego Rodriguez

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(abstract);prompting(abstract)

AI总结 本文提出一种高效的压缩框架,结合引导的思维链强化学习,通过知识蒸馏和链式思维提示提升模型效率,实现更小规模的模型部署。

Comments Code and data are available at: https://github.com/AlejandroParedesLT/knowledge_distillLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13314 2026-03-17 cs.LG 90%

Linear Predictability of Attention Heads in Large Language Models

大语言模型中注意力头的线性可预测性

Khalid Shaikh, Asmit Kumar Singh, Rebecca Christopher Dsouza, Shikhar Shiromani

机构 * Georgia Institute of Technology(佐治亚理工学院) Santa Clara University(圣克拉拉大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

AI总结 研究发现预训练Transformer中注意力头激活存在线性结构,通过少量参考头可高精度重建目标头,利用此特性可减少KV缓存并提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13834 2026-03-17 cs.AI cs.LG 90%

Intelligent Materials Modelling: Large Language Models Versus Partial Least Squares Regression for Predicting Polysulfone Membrane Mechanical Performance

智能材料建模:大语言模型与偏最小二乘回归在预测聚砜膜机械性能中的比较

Dingding Cao, Mieow Kee Chan, Wan Sieng Yeo, Said Bey, Alberto Figoli

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文比较了大语言模型与偏最小二乘回归在预测聚砜膜机械性能中的表现,发现大语言模型在非线性、约束敏感属性上表现更优,而偏最小二乘回归在需要可解释性分解的线性关系中仍具竞争力。

Comments 29 pages, 8 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23404 2026-03-17 cs.CL 89%

AJF: Adaptive Jailbreak Framework Based on the Comprehension Ability of Black-Box Large Language Models

AJF:基于黑盒大语言模型理解能力的自适应突破框架

Mingyu Yu, Wei Wang, Yanjie Wei, Sujuan Qin, Fei Gao, Wenmin Li

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出AJF框架,通过分析目标LLM的理解能力,针对不同类型的LLM采用不同的突破策略,实验显示在GPT-4o和GPT-4.1上攻击成功率分别达到98.9%和99.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13562 2026-03-17 cs.LG 89%

Scalable Classification of Course Information Sheets Using Large Language Models: A Reusable Institutional Method for Academic Quality Assurance

利用大语言模型实现课程信息表的可扩展分类:一种用于学术质量保证的可重用机构方法

Brecht Verbeken, Joke Van den Broeck, Inge De Cleyn, Steven Van Luchene, Nadine Engels, Andres Algaba, Vincent Ginis

机构 * Vrije Universiteit Brussel(布鲁塞尔自由大学) Harvard University(哈佛大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 本文提出一种利用大语言模型对课程信息表进行大规模分类的方法,通过迭代优化和多模型比较,实现了对课程评估风险的识别与验证,为学术质量保证提供了可重用的机构方法。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13313 2026-03-17 cs.RO 89%

MRPoS: Mixed Reality-Based Robot Navigation Interface Using Spatial Pointing and Speech with Large Language Model

基于混合现实的机器人导航接口:结合空间指针与语音及大语言模型

Eduardo Iglesius, Masato Kobayashi, Yuki Uranishi

机构 * The University of Osaka(大阪大学) Kobe University(Kobe大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出MRPoS接口,利用空间指针和语音交互替代传统手势,提升机器人导航的直观性和效率,实验表明任务完成时间与工作负荷显著降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14745 2026-03-17 cs.LG 88%

CAMD: Coverage-Aware Multimodal Decoding for Efficient Reasoning of Multimodal Large Language Models

CAMD:面向多模态大语言模型高效推理的覆盖感知多模态解码

Huijie Guo, Jingyao Wang, Lingyu Si, Jiahuan Zhou, Changwen Zheng, Wenwen Qiang

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出CAMD,通过动态分配计算资源提升多模态大语言模型的推理效率与可靠性,解决解码方法在易例和难例间的计算不匹配问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05385 2026-03-17 cs.CV 88%

ShaRP: SHAllow-LayeR Pruning for Efficient Video Large Language Models

ShaRP: 用于高效视频大语言模型的浅层层剪枝

Yingjie Xia, Tao Liu, Jinglei Shi, Qingsong Xie, Heng Guo, Jian Yang, Xi Wang

机构 * VCIP & TMCC & DISSec, College of Computer Science, Nankai University(VCIP与TMCC与DISSec学院,南开大学计算机科学学院) LIX, Ecole Polytechnique, IP Paris(LIX,巴黎高等理工学院,IP巴黎) OPPO Research Institute(OPPO研究院) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出ShaRP框架,通过改进局部信息聚合、校准位置偏差和减少冗余,解决浅层解码器剪枝中的性能下降问题,实现97.2%的性能保留和86%的TFLOPs减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13776 2026-03-17 cs.IR cs.AI 87%

Retrieval-Feedback-Driven Distillation and Preference Alignment for Efficient LLM-based Query Expansion

检索-反馈驱动的蒸馏与偏好对齐用于高效的基于大语言模型的查询扩展

Minghan Li, Guodong Zhou

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 本文提出一种检索反馈驱动的蒸馏与偏好对齐框架,通过从强教师模型转移检索友好的扩展行为到紧凑的学生模型,以降低推理成本并提升检索效果。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13256 2026-03-17 cs.CL cs.AI cs.ET cs.MA 86%

Training-Free Agentic AI: Probabilistic Control and Coordination in Multi-Agent LLM Systems

无需训练的代理AI:多代理大语言模型系统的概率控制与协调

Mohammad Parsa Hosseini, Ankit Shah, Saiyra Qureshi, Alex Huang, Connie Miao, Wei Wei

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出REDEREF控制器,通过概率方法提升多代理LLM系统的路由效率与鲁棒性,减少资源消耗并提高任务成功率。

Comments under review, 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14896 2026-03-17 cs.CL cs.AI 86%

Quantization Meets dLLMs: A Systematic Study of Post-training Quantization for Diffusion LLMs

量化与扩散大语言模型:对后训练量化在扩散大语言模型上的系统研究

Haokun Lin, Haobo Xu, Yichen Wu, Ziyu Guo, Renrui Zhang, Zhichao Lu, Ying Wei, Qingfu Zhang, Zhenan Sun

专题命中 效率与部署 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文系统研究了扩散大语言模型的后训练量化,探讨了激活异常值对低比特量化的影响,并通过多维度评估提供了实用见解,为高效部署扩散大语言模型奠定基础。

Comments Published in Machine Intelligence Research, DOI: 10.1007/s11633-025-1624-x

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14283 2026-03-17 cs.CR cs.AI 85%

AEX: Non-Intrusive Multi-Hop Attestation and Provenance for LLM APIs

AEX:非侵入式多跳认证与溯源用于LLM API

Yongjie Guan

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AEX为现有JSON基于LLM API提供非侵入式认证扩展,通过添加签名顶层认证对象,绑定客户端可见请求投影到完整响应或流式输出,支持真实部署并防止转换输出被误认为源流前缀。

Comments 29 pages total; 6 figures; 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14110 2026-03-17 cs.LG 85%

SVD Contextual Sparsity Predictors for Fast LLM Inference

基于SVD的上下文稀疏性预测器用于快速LLM推理

Georgii Serbin, Kirill Koshkin, Zhongao Sun, Anastasiya Bistrigova, C. C. Korikov

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一种无需训练的快速稀疏模式预测方法,利用截断感知SVD和阈值校准算法,加速ReGLUFFN的LLM推理,实验显示在保持低精度损失下,解码时间减少1.8倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23586 2026-03-17 cs.SE cs.AI 85%

Reducing Cost of LLM Agents with Trajectory Reduction

通过轨迹缩减降低LLM代理的成本

Yuan-An Xiao, Pengfei Gao, Chao Peng, Yingfei Xiong

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出AgentDiet方法,通过减少LLM代理轨迹中的冗余信息,降低计算成本,实验显示可减少输入token和总计算成本达39.9%-59.7%和21.1%-35.9%。

Comments 22 pages, 5 figures; accepted for FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15004 2026-03-17 cs.SE 85%

TriFusion-LLM: Prior-Guided Multimodal Fusion with LLM Arbitration for Fine-grained Code Clone Detection

TriFusion-LLM:基于LLM仲裁的先验引导多模态融合用于细粒度代码克隆检测

Mengdi Li, Yuming Liu, He Wang, Zifeng Xu, Yuqing Zhang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出TriFusion-LLM框架,结合传统机器学习的启发式相似性先验、AST结构信号和CodeBERT语义嵌入,提升细粒度代码克隆检测的分类性能,实验表明其在BigCloneBench上将Macro-F1提升至0.875。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06569 2026-03-17 cs.CV 85%

Penguin-VL: Exploring the Efficiency Limits of VLM with LLM-based Vision Encoders

Penguin-VL:探索基于大语言模型的视觉编码器的效率极限

Boqiang Zhang, Lei Ke, Ruihan Yang, Qi Gao, Tianyuan Qu, Rossell Chen, Dong Yu, Leoweiliang

机构 * Tencent AI Lab(腾讯AI实验室)

专题命中 效率与部署 :LLM(title,abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出Penguin-VL,通过基于大语言模型的视觉编码器替代传统对比预训练,实现更高效的多模态理解,在文档理解、视觉知识和多视角视频理解等任务中超越现有领先VLM。

Comments Penguin-VL demonstrates that text-only initialized vision encoders can achieve superior performance in multimodal understanding tasks; Code: https://github.com/tencent-ailab/Penguin-VL

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14769 2026-03-17 cs.LG cs.AI 84%

POLCA: Stochastic Generative Optimization with LLM

POLCA:基于LLM的随机生成优化

Xuanfei Ren, Allen Nie, Tengyang Xie, Ching-An Cheng

专题命中 效率与部署 :LLM(title,abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出POLCA框架,通过生成语言模型作为优化器,结合数值奖励和文本反馈,解决复杂系统的随机生成优化问题,实现高效探索与利用的平衡,实验表明其在多种基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01842 2026-03-17 cs.LG 83%

Prism: Efficient Test-Time Scaling via Hierarchical Search and Self-Verification for Discrete Diffusion Language Models

Prism:通过分层搜索和自验证实现离散扩散语言模型的高效测试时扩展

Jinbin Bai, Yixuan Li, Yuchen Zhu, Yi Xin, Qingyu Shi, Aosong Feng, Xiaohong Liu, Molei Tao, Jianru Xue, Xiangtai Li, Ming-Hsuan Yang

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 本文提出Prism框架,通过分层轨迹搜索、局部分支和自验证反馈,提升离散扩散语言模型的测试时扩展效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02320 2026-03-17 cs.CL 83%

Estimating Text Temperature with Language Models

利用语言模型估计文本温度

Nikolay Mikhaylovskiy

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本文提出通过最大似然方法估计文本温度,评估多种LLM的性能,并发现大部分文本温度接近1,但某些数据集如笑话、GSM8K和AG News温度较高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13401 2026-03-17 cs.CV cs.AI physics.optics 83%

MAD: Microenvironment-Aware Distillation -- A Pretraining Strategy for Virtual Spatial Omics from Microscopy

MAD:微环境感知蒸馏——一种从显微镜获取虚拟空间组学的预训练策略

Jiashu Han, Kunzan Liu, Yeojin Kim, Saurabh Sinha, Sixian You

机构 * Research Laboratory of Electronics, Massachusetts Institute of Technology(麻省理工学院电子研究实验室) Department of Electrical Engineering and Computer Science, Massachusetts Institute of Technology(麻省理工学院电气工程与计算机科学系) The Wallace H. Coulter Department of Biomedical Engineering, Georgia Institute of Technology(佐治亚理工学院Wallace H. Coulter生物医学工程系) H. Milton Stewart School of Industrial & Systems Engineering, Georgia Institute of Technology(佐治亚理工学院H. Milton Stewart工业与系统工程学院)

专题命中 效率与部署 :pretraining(title,abstract);foundation model(abstract);分类 cs.AI

AI总结 MAD通过联合自蒸馏显微镜图像的形态视图和微环境视图,学习细胞中心嵌入,实现细胞亚型分类、转录组预测等任务的最先进性能。

Comments 34 pages, 6 figures; under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04467 2026-03-17 cs.CV cs.AI cs.CL cs.LG 82%

VisionZip: Longer is Better but Not Necessary in Vision Language Models

VisionZip: 更长并非必要,但在视觉语言模型中更优

Senqiao Yang, Yukang Chen, Zhuotao Tian, Chengyao Wang, Jingyao Li, Bei Yu, Jiaya Jia

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出VisionZip方法,通过选择信息性视觉token提升效率并保持性能,实验显示在多种设置下性能提升至少5%,同时显著加快推理速度。

Comments Code: https://github.com/dvlab-research/VisionZip

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14591 2026-03-17 cs.LG cs.AI cs.IR 81%

FlashHead: Efficient Drop-In Replacement for the Classification Head in Language Model Inference

FlashHead: 语言模型推理中分类头的高效替换方案

Wilhelm Tranheden, Shahnawaz Ahmed, Devdatt Dubhashi, Jonna Matthiesen, Hannes von Essen

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 FlashHead通过信息检索原理优化语言模型分类头,实现推理效率提升1.75倍,同时保持输出准确性,为更小的模型在消费级硬件上应用奠定基础。

Comments A collection of models with FlashHead optimization can be found at: https://huggingface.co/collections/embedl/flashhead

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13426 2026-03-17 cs.LG cs.AI 81%

Outcome-Aware Tool Selection for Semantic Routers: Latency-Constrained Learning Without LLM Inference

面向结果的工具选择用于语义路由器:无LLM推理的延迟受限学习

Huamin Chen, Xunzhuo Liu, Junchen Jiang, Bowei He, Xue Liu

机构 * vLLM Semantic Router Project(vLLM语义路由器项目) Tensormesh Inc / UChicago(Tensormesh公司/芝加哥大学) MBZUAI / McGill University(MBZUAI/麦吉尔大学)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出面向结果的工具选择方法OATS,通过插值工具嵌入向成功查询的质心,提升语义路由器的NDCG@5指标,同时在无额外计算开销的情况下优化工具选择。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17015 2026-03-17 cs.LG cs.AI cs.DC 81%

Justitia: Fair and Efficient Scheduling of Task-parallel LLM Agents with Selective Pampering

Justitia: 任务并行LLM代理的公平高效调度算法

Mingyan Yang, Guanjie Wang, Manqi Luo, Yifei Liu, Chen Chen, Han Zhao, Yu Feng, Quan Chen, Minyi Guo

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Justitia调度器,通过内存导向的成本量化和轻量预测方法,实现任务并行LLM代理的公平高效调度,实验表明其能显著提升调度效率并保持公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15340 2026-03-17 cs.CL stat.ML 79%

DOS: Dependency-Oriented Sampler for Masked Diffusion Language Models

DOS:基于依赖关系的掩码扩散语言模型采样器

Xueyu Zhou, Yangrong Hu, Jian Huang

机构 * Department of Data Science and AI(数据科学与人工智能系)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL

AI总结 DOS是一种无需训练的解码策略,通过利用令牌间依赖关系提升生成质量,尤其在代码生成和数学推理任务中表现优异,且能与现有并行采样方法结合提升效率。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22333 2026-03-17 cs.DC cs.CL 79%

PAT: Accelerating LLM Decoding via Prefix-Aware Attention with Resource Efficient Multi-Tile Kernel

PAT: 通过资源高效的多瓷砖内核加速大语言模型解码的前缀感知注意力

Jinjun Yi, Zhixin Zhao, Yitao Hu, Ke Yan, Weiwei Sun, Hao Wang, Laiping Zhao, Yuhao Zhang, Wenxin Li, Keqiu Li

专题命中 效率与部署 :LLM(title,abstract);分类 cs.CL

AI总结 本文提出PAT,一种基于前缀感知的注意力内核,通过包前向合并范式减少内存访问,提升资源利用率,降低解码延迟和TPOT。

Comments Accepted by ASPLOS'26, code available at https://github.com/flashserve/PAT

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13605 2026-03-17 cs.AI 79%

Orla: A Library for Serving LLM-Based Multi-Agent Systems

Orla:一个用于服务基于LLM的多智能体系统的库

Rana Shahout, Hayder Tirmazi, Minlan Yu, Michael Mitzenmacher

机构 * Harvard University(哈佛大学) Boston University(波士顿大学)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI

AI总结 Orla提供了一种通用抽象,将请求执行与工作流级策略分离,通过阶段映射器、工作流编排器和内存管理器实现智能体级控制,展示了在客户支持工作流中的应用,并通过两个数据集验证了其在延迟和成本上的改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13404 2026-03-17 cs.SE cs.AI 79%

Schema First Tool APIs for LLM Agents: A Controlled Study of Tool Misuse, Recovery, and Budgeted Performance

为LLM代理设计的基于模式的工具API:对工具误用、恢复和预算性能的受控研究

Akshey Sigdel, Rista Baral

机构 * Independent Researcher(独立研究者)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI

AI总结 本文通过受控实验探讨基于模式的工具合同和结构化验证诊断对LLM代理在严格交互预算下的可靠性影响,发现模式条件减少接口误用但未改善语义误用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15614 2026-03-17 cs.CV 79%

Tri-Prompting: Video Diffusion with Unified Control over Scene, Subject, and Motion

Tri-Prompting:具有统一场景、主体和运动控制的视频扩散

Zhenghong Zhou, Xiaohang Zhan, Zhiqin Chen, Soo Ye Kim, Nanxuan Zhao, Haitian Zheng, Qing Liu, He Zhang, Zhe Lin, Yuqian Zhou, Jiebo Luo

机构 * Adobe Research(Adobe研究院) University of Rochester(罗切斯特大学)

专题命中 效率与部署 :prompting(title,abstract)

AI总结 Tri-Prompting提出统一框架,整合场景、多视角主体一致性和运动控制,提升视频生成的可控性和真实感。

Comments Project page: https://zhouzhenghong-gt.github.io/Tri-Prompting-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏