arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-10 至 2026-03-10 共收录 75 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 75 篇

2603.06616 2026-03-10 cs.LG cs.AI math.ST stat.TH 90%

RACER: Risk-Aware Calibrated Efficient Routing for Large Language Models

RACER:面向大型语言模型的风险感知校准高效路由

Sai Hao, Hao Zeng, Hongxin Wei, Bingyi Jing

机构 * Southern University of Science and Technology, China(南方科技大学) The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)) Shenzhen Loop Area Institute, China(深圳环湖研究院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 RACER通过构建嵌套模型集和校准阈值,实现了对大型语言模型路由的风险感知校准,从而提升下游任务的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08083 2026-03-10 cs.CL 88%

High-Fidelity Pruning for Large Language Models

大语言模型的高保真剪枝

Yijun Zhu, Jianxin Wang, Chengchao Shen

机构 * Central South University(中南大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出基于模型输出分布信息熵的高保真剪枝方法,有效提升大语言模型的剪枝效率和预测保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08185 2026-03-10 cs.LG 87%

SERQ: Saliency-Aware Low-Rank Error Reconstruction for LLM Quantization

SERQ:基于显著性的低秩误差重建用于LLM量化

Yeonsik Park, Hyeonseong Kim, Seungkyu Choi

机构 * Kyung Hee University(庆熙大学) Yonsei University(延世大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 SERQ通过基于显著性的低秩误差重建方法,在低比特LLM推理中提升精度并降低校准复杂度。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06617 2026-03-10 cs.LG cs.AI 87%

Evo: Autoregressive-Diffusion Large Language Models with Evolving Balance

Evo:具有进化平衡的自回归-扩散大语言模型

Junde Wu, Minhao Hu, Jiayuan Zhu, Yuyuan Liu, Tianyi Zhang, Kang Li, Jingkun Chen, Jiazhen Pan, Min Xu, Yueming Jin

机构 * University of Oxford(牛津大学) National University of Singapore(新加坡国立大学) Technical University of Munich(慕尼黑技术大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract);分类 cs.AI、cs.LG

AI总结 Evo通过进化平衡机制,结合自回归和扩散模型,实现高效且高质量的语言生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08528 2026-03-10 cs.CL 86%

Efficient Continual Learning for Small Language Models with a Discrete Key-Value Bottleneck

小语言模型高效持续学习中的离散键值瓶颈

Andor Diera, Lukas Galke, Fabian Karl, Ansgar Scherp

机构 * Ulm University(乌尔姆大学) University of Southern Denmark(南部丹麦大学)

专题命中 效率与部署 :language model(title,abstract);small language model(title);分类 cs.CL

AI总结 本研究提出了一种适用于小语言模型的离散键值瓶颈结构,通过局部更新实现高效的持续学习,有效缓解灾难性遗忘并降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08475 2026-03-10 cs.RO cs.AI 85%

R2F: Repurposing Ray Frontiers for LLM-free Object Navigation

R2F:利用射线前沿进行无需大语言模型的对象导航

Francesco Argenziano, John Mark Alexis Marcelo, Michele Brienza, Abdel Hakim Drid, Emanuele Musumeci, Daniele Nardi, Domenico D. Bloisi, Vincenzo Suriani

机构 * Department of Computer, Automation and Management Engineering, Sapienza University of Rome(罗马萨皮恩扎大学计算机、自动化与管理工程系) Department of Electronics and Automation, Mohamed Khider University of Biskra(比斯克拉Mohamed Khider大学电子与自动化系) International University of Rome UNINT, Rome(罗马国际大学UNINT)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 R2F通过重新利用射线前沿技术,开发无需大语言模型的室内开放词汇对象导航框架,实现实时高效导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13824 2026-03-10 cs.LG 85%

ELSA: Efficient LLM-Centric Split Aggregation for Privacy-Aware Hierarchical Federated Learning over the Network Edge

ELSA: 面向网络边缘的隐私感知分层联邦学习的高效LLM中心分割聚合

Xiaohong Yang, Tong Xie, Minghui Liwang, Chikai Shang, Yang Lu, Zhenzhen Jiao, Liqun Fu, Seyyedali Hosseinalipour

机构 * School of Informatics, Xiamen University(厦门大学信息学院) National University of Singapore(新加坡国立大学) Teleinfo iF-Labs, China Academy of Information and Communications Technology(Teleinfo iF-Labs,中国信息通信技术研究院) Department of Electrical Engineering, University at Buffalo-SUNY(电气工程系,布法罗大学-纽约州立大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 ELSA通过任务无关聚类、动态模型分割和轻量通信方案,实现网络边缘隐私保护下的高效LLM微调。

Comments 11 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07887 2026-03-10 cs.LG cs.AI cs.CL math.ST stat.ML stat.TH 85%

Reject, Resample, Repeat: Understanding Parallel Reasoning in Language Model Inference

拒绝、重采样、重复:理解语言模型推理中的并行推理

Noah Golowich, Fan Chen, Dhruv Rohatgi, Raghav Singhal, Carles Domingo-Enrich, Dylan J. Foster, Akshay Krishnamurthy

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过粒子过滤算法研究语言模型推理中采样误差的理论与实践,揭示SMC方法的非渐近保证及采样误差的限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07810 2026-03-10 eess.SY cs.SY 85%

Temperature-Aware Scheduling of LLM Inference in Large-Scale Geo-Distributed Edge Data Centers with Distributed Optimization

具有分布式优化的温度感知LLM推理调度在大规模地理分布边缘数据中心中的应用

Arash Khalatbarisoltani, Amin Mahmoudi, Jie Han, Muhammad Saeed, Wenxue Liu, Jinwen Li, Solmaz Kahourzade, Amirmehdi Yazdani, Xiaosong Hu

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本研究提出一种温度感知方法,通过分布式优化共同优化LLM的能耗、碳排放、首次令牌时间和水资源消耗,以提升地理分布边缘数据中心的可持续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20982 2026-03-10 cs.DC 85%

DOPD: A Dynamic PD-Disaggregation Architecture for Maximizing Goodput in LLM Inference Serving

DOPD:一种动态PD解聚架构,用于在LLM推理服务中最大化吞吐量

Junhan Liao, Minxian Xu, Wanyi Zheng, Yan Wang, Kejiang Ye, Rajkumar Buyya, Chengzhong Xu

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 DOPD通过动态调整预填和解码实例比例,提升LLM推理服务的吞吐量和响应效率。

Comments 14 pages

Journal ref IEEE Transactions on Services Computing 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13109 2026-03-10 cs.LG cs.AI cs.CL 85%

FreeKV: Boosting KV Cache Retrieval for Efficient LLM Inference

FreeKV: 提升KV缓存检索效率以实现高效的LLM推理

Guangda Liu, Chengwei Li, Zhenyu Ning, Jing Lin, Yiwu Yao, Danning Ke, Minyi Guo, Jieru Zhao

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 FreeKV通过算法与系统协同优化,提升KV缓存检索效率并保持精度,实现高达13倍的加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05286 2026-03-10 cs.DB 85%

HEXGEN-FLOW: Optimizing LLM Inference Request Scheduling for Agentic Text-to-SQL

HEXGEN-FLOW: 优化基于代理的大型语言模型推理请求调度以实现智能文本到SQL

You Peng, Youhe Jiang, Wenqi Jiang, Chen Wang, Binhang Yuan

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 HEXGEN-FLOW通过优化调度策略和参数调整,显著提升了基于代理的LLM文本到SQL系统在异构GPU集群中的性能和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18274 2026-03-10 cs.LG 84%

Structural Inference: Interpreting Small Language Models with Susceptibilities

结构推断:通过易感性解释小型语言模型

Garrett Baker, George Wang, Jesse Hoogland, Daniel Murfet

专题命中 效率与部署 :language model(title);small language model(title);分类 cs.LG

AI总结 通过易感性分析,研究如何利用线性响应框架解释小型语言模型的功能模块结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08267 2026-03-10 cs.AI cs.CE cs.LG 84%

Towards a more efficient bias detection in financial language models

迈向更高效的金融语言模型偏见检测

Firas Hadj Kacem, Ahmed Khanfir, Mike Papadakis

机构 * SnT, University of Luxembourg(卢森堡大学SnT学院) RIADI, ENSI, University of Manouba(突尼斯曼努巴大学RIADI学院)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过大规模分析五个金融语言模型的偏见,提出跨模型引导的偏见检测方法,显著降低偏见检测成本。

Journal ref ICLR 2026 Workshop on Advances in Financial AI (AFA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06728 2026-03-10 cs.LG cs.AR cs.CL 84%

Orion: Characterizing and Programming Apple's Neural Engine for LLM Training and Inference

Orion: 为大语言模型训练和推理表征和编程苹果的神经引擎

Ramchand Kumaresan

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 Orion通过直接编程苹果神经引擎实现LLM训练和推理,提供高效的编译器和运行时,显著提升训练速度并支持动态适配器更新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05974 2026-03-10 cs.SE 83%

Balancing Latency and Accuracy of Code Completion via Local-Cloud Model Cascading

通过本地-云模型级联平衡代码补全的延迟与准确性

Hanzhen Lu, Lishui Fan, Jiachi Chen, Qiuyuan Chen, Zhao Wei, Zhongxin Liu

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 MCCom通过本地-云模型级联平衡代码补全的延迟与准确性,提升性能并降低成本

Comments Accepted by FSE'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08022 2026-03-10 cs.LG 83%

Capacity-Aware Mixture Law Enables Efficient LLM Data Optimization

面向容量的混合法则实现高效大语言模型数据优化

Jingwei Li, Xinran Gu, Jingzhao Zhang

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University(交叉信息研究院,清华大学) Shanghai Qizhi Institute(上海启智研究院)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 面向容量的混合法则通过高效数据混合优化,减少50%的优化成本并提升3%的下游性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07897 2026-03-10 cs.LG 83%

LeJOT-AutoML: LLM-Driven Feature Engineering for Job Execution Time Prediction in Databricks Cost Optimization

LeJOT-AutoML:基于LLM的特征工程用于Databricks成本优化中的作业执行时间预测

Lizhi Ma, Yi-Xiang Hu, Yihui Ren, Feng Wu, Xiang-Yang Li

机构 * University of Science and Technology of China(中国科学技术大学) Lenovo(联想)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 LeJOT-AutoML利用LLM驱动的AutoML框架,通过动态生成特征提升Databricks作业执行时间预测的准确性,从而实现成本优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07287 2026-03-10 cs.IR cs.AI cs.SE 83%

Do Deployment Constraints Make LLMs Hallucinate Citations? An Empirical Study across Four Models and Five Prompting Regimes

部署约束是否使大语言模型产生引文幻觉?对四个模型和五个提示模式的实证研究

Chen Zhao, Yuan Tang, Yitian Qian

机构 * New York University(纽约大学) Carnegie Mellon University(卡内基梅隆大学) Boston University(波士顿大学)

专题命中 效率与部署 :prompting(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文通过实证研究探讨部署约束对大语言模型引文真实性的影响,发现不同提示模式下引文存在率差异显著,揭示了需在SE文献中进行事后验证的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08289 2026-03-10 cs.CV 82%

Novel Semantic Prompting for Zero-Shot Action Recognition

新颖的语义提示用于零样本动作识别

Salman Iqbal, Waheed Rehman

专题命中 效率与部署 :prompting(title,abstract);language model(abstract)

AI总结 本文提出SP-CLIP框架,通过结构化语义提示提升零样本动作识别性能,尤其在细粒度和组合动作上表现优异,同时保持模型效率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07461 2026-03-10 cs.CL cs.AI cs.LG 82%

The Dual-Stream Transformer: Channelized Architecture for Interpretable Language Modeling

双流变压器:用于可解释语言模型的通道化架构

J. Clayton Kerce, Alexis Fox

机构 * Georgia Tech Research Institute(佐治亚理工学院研究机构)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 双流变压器通过分解残差流为两个功能组件,实现可解释性与性能之间的权衡,适用于可解释语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07223 2026-03-10 cs.LG 81%

Unlocking Data Value in Finance: A Study on Distillation and Difficulty-Aware Training

解锁金融数据价值:关于蒸馏和难度感知训练的研究

Chuxue Cao, Honglin Lin, Zhanping Zhong, Xin Gao, Mengzhang Cai, Conghui He, Sirui Han, Lijun Wu

机构 * Shanghai Artificial Intelligence Laboratory, OpenDataLab, OpenDataArena(上海人工智能实验室、OpenDataLab、OpenDataArena) Hong Kong University of Science and Technology(香港科技大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);post-training(abstract);SFT(abstract)

AI总结 本文提出ODA-Fin-SFT-318k和ODA-Fin-RL-12k数据集,通过多阶段蒸馏和难度感知训练提升金融领域模型性能,实现高质量的链式思维监督和任务多样性平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08660 2026-03-10 cs.LG cs.CL 81%

How Far Can Unsupervised RLVR Scale LLM Training?

无监督强化学习如何扩展大语言模型训练?

Bingxiang He, Yuxin Zuo, Zeyuan Liu, Shangziqi Zhao, Zixuan Fu, Junlin Yang, Cheng Qian, Kaiyan Zhang, Yuchen Fan, Ganqu Cui, Xiusi Chen, Youbang Sun, Xingtai Lv, Xuekai Zhu, Li Sheng, Ran Li, Huan-ang Gao, Yuchen Zhang, Bowen Zhou, Zhiyuan Liu, Ning Ding

专题命中 效率与部署 :LLM(title,abstract);分类 cs.CL、cs.LG

AI总结 本文研究了无监督强化学习如何扩展大语言模型训练,分析了内在和外部奖励方法的理论和实验结果,揭示了模型先验对训练效果的影响,并提出了模型崩溃步骤作为评估指标。

Comments Accepted to the ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08429 2026-03-10 cs.CL cs.AI cs.IR 81%

One Model Is Enough: Native Retrieval Embeddings from LLM Agent Hidden States

一个模型就足够:从LLM代理隐藏状态中获取原生检索嵌入

Bo Jiang

机构 * Temple University(特拉华大学)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过轻量级投影头使LLM代理具备原生检索能力,无需额外嵌入模型,保留97%检索质量并在QReCC基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11148 2026-03-10 cs.CL cs.AI 81%

Improving the Efficiency of Visually Augmented Language Models

提升视觉增强语言模型的效率

Paula Ontalvilla, Aitor Ormazabal, Gorka Azkune

机构 * HiTZ Center - Ixa, University of the Basque Country (UPV/EHU)(巴斯克大学HiTZ中心 - Ixa,巴斯克大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出BLIND-VALM模型,通过使用CLIP获取的视觉 grounding 文本表示,提升视觉增强语言模型的效率和性能。

Comments COLING 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07835 2026-03-10 cs.CR cs.AI cs.CL 81%

DistillGuard: Evaluating Defenses Against LLM Knowledge Distillation

DistillGuard: 评估对抗大语言模型知识蒸馏的防御措施

Bo Jiang

专题命中 效率与部署 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 DistillGuard通过系统评估发现,现有输出层面防御措施在对抗大语言模型知识蒸馏时效果有限,尤其在数学推理任务中表现突出,揭示了防御措施的依赖性和任务特定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06726 2026-03-10 cs.LG cs.AI 81%

Regression Models Meet Foundation Models: A Hybrid-AI Approach to Practical Electricity Price Forecasting

回归模型与基础模型相遇:一种混合AI方法用于实际电价预测

Yunzhong Qiu, Binzhu Li, Hao Wei, Shenglin Weng, Chen Wang, Zhongyi Pei, Mingsheng Long, Jianmin Wang

机构 * School of Software, BNRist Tsinghua University(软件学院,北京理工大学) Suzhou Industrial Park Xingzhixun CS Co., Ltd.(苏州工业园区星讯CS公司)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出FutureBoosting方法,通过整合时间序列基础模型生成的预测特征,提升回归模型在电价预测中的性能,实现MAE降低超过30%。

Comments 15 pages. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08239 2026-03-10 cs.LG cs.AI cs.CL 80%

Fibration Policy Optimization

纤维策略优化

Chang Li, Tshihao Tsu, Yaren Zhang, Chao Xue, Xiaodong He

机构 * JD Explore Academy(京东探索研究院) Carleton University(卡尔顿大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 纤维策略优化通过引入聚合策略裁剪目标和纤维束门控框架,实现多尺度稳定性控制,提升大语言模型策略优化的效率与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07848 2026-03-10 cs.AI 79%

Intentional Deception as Controllable Capability in LLM Agents

意图性欺骗作为LLM代理中的可控能力

Jason Starace, Terence Soule

机构 * Department of Computer Science University of Idaho(计算机科学系大学爱达荷州立大学)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI

AI总结 本文研究了意图性欺骗作为LLM代理可控能力的系统性分析,发现动机是主要攻击向量,而信念系统更难识别,现有事实验证方法不足以应对战略框架的欺骗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07710 2026-03-10 cs.LG q-bio.BM 79%

Reverse Distillation: Consistently Scaling Protein Language Model Representations

反蒸馏:一致地扩展蛋白质语言模型表示

Darius Catrina, Christian Bepler, Samuel Sledzieski, Rohit Singh

机构 * Department of Computer Science(计算机科学系) Duke University(杜克大学) Center for Computational Biology(计算生物学中心) Flatiron Institute(Flatiron研究所) Depts of Biostats. and Bioinformatics(生物统计学与生物信息学系;细胞生物学系) and Cell Biology

专题命中 效率与部署 :language model(title,abstract);分类 cs.LG

AI总结 反蒸馏通过分解大型蛋白质语言模型表示为正交子空间,使较大模型在相同维度下始终优于较小模型,提升了蛋白质特征编码效果。

Comments Proceedings of ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏