arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-08 至 2026-05-08 共收录 73 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 73 篇

2605.01120 2026-05-08 cs.AI math.CO 92%

New Bounds for Zarankiewicz Numbers via Reinforced LLM Evolutionary Search

通过强化LLM进化搜索获得Zarankiewicz数的新界

Jay Bhan, Nicole Nobili, Patrick Langer

机构 * Massachusetts Institute of Technology(麻省理工学院) ETH Zürich(苏黎世联邦理工学院) Stanford University(斯坦福大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文首次确定三个Zarankiewicz数的精确值,并通过强化LLM进化搜索方法为41个数建立下界,展示了LLM引导的进化搜索在数学研究中的潜力。

Comments *Jay Bhan and Nicole Nobili contributed equally to this work as first authors, and their order was determined via coin flip

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06052 2026-05-08 cs.AR 91%

XtraMAC: An Efficient MAC Architecture for Mixed-Precision LLM Inference on FPGA

XtraMAC:一种适用于FPGA上混合精度LLM推断的高效MAC架构

Feng Yu, Hongshi Tan, Yao Chen, Weng-Fai Wong, Bingsheng He

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出XtraMAC架构,通过统一整数、浮点和混合精度运算,实现动态运算打包和高效资源共享,提升FPGA在混合精度LLM推断中的计算密度和能效。

Comments Accepted to ISCA 2026. 14 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05274 2026-05-08 cs.CR 91%

Sealing the Audit-Runtime Gap for LLM Skills

填补LLM技能的审计-运行时差距

Tingda Shen, Yebo Feng, Konglin Zhu, Xiaojun Jia, Yang Liu, Lin Zhang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出SIGIL框架,通过去中心化链上注册表和技能验证协议,实现LLM技能从发布到运行时的可验证绑定,有效抵御技能供应链攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06402 2026-05-08 cs.LG 91%

SparseForge: Efficient Semi-Structured LLM Sparsification via Annealing of Hessian-Guided Soft-Mask

SparseForge:通过Hessian引导的软掩码退火实现高效的半结构化LLM稀疏化

Liu Hanzuo, Chaofan Lin, Weixuan Sun, Yulong Wang, Key, Rayying, Mingyu Gao

机构 * Tsinghua University(清华大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 SparseForge通过优化稀疏掩码而非扩大重训练token数量,实现高效的半结构化LLM稀疏化,提升稀疏恢复效率,实验显示其在准确率与效率的权衡上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05344 2026-05-08 cs.CV cs.AI cs.IR 91%

Open-SAT: LLM-Guided Query Embedding Refinement for Open-Vocabulary Object Retrieval in Satellite Imagery

Open-SAT: 一种基于LLM的查询嵌入细化方法用于卫星影像开放词汇物体检索

Md Adnan Arefeen, Biplob Debnath, Ravi K. Rajendran, Murugan Sankaradas, Srimat T. Chakradhar

机构 * North South University(北南大学) NEC Laboratories America(NEC实验室)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Open-SAT通过LLM引导在推理阶段优化查询与卫星影像内容的对齐,提升开放词汇检索性能,实验表明其F1分数提升达16.04%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09316 2026-05-08 cs.LG cs.CL 91%

Large Language Model Prompt Datasets: An In-depth Analysis and Insights

大语言模型提示数据集:深入分析与洞察

Yuanming Zhang, Yan Lin, Arijit Khan, Huaiyu Wan

机构 * School of Computer Science and Technology(计算机科学与技术学院) Beijing Jiaotong University(北京交通大学) Department of Computer Science(计算机科学系) Aalborg University(奥尔堡大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.CL、cs.LG

AI总结 本文深入分析了129个异构LLM提示数据集,通过多层级语言分析揭示提示与一般文本的区别模式,并通过三个下游实验验证了提示过滤、领域分类和提示质量预测的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05401 2026-05-08 cs.HC 90%

Why Someone Asked "Why": Foil Inference in Human and LLM Question Interpretation

为何有人问“为何”:人类和LLM的问题解读中的 foil 推理

Britt Besch, Tobias Gerstenberg

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 研究探讨人类和LLM如何通过 hindsight expectation 判断 why 问题的 foil,发现人类选择 foil 的最佳预测因素是 hindsight expectation,而 LLM 的显式期望判断与 foil 选择存在不一致。

Comments Accepted at Proceedings of the 48th Annual Conference of the Cognitive Science Society (CogSci 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06476 2026-05-08 cs.CL 90%

Towards Emotion Consistency Analysis of Large Language Models in Emotional Conversational Contexts

面向情感一致性分析的大型语言模型在情感对话情境中的研究

Sneha Oram, Ojaswita Bhushan, Pushpak Bhattacharyya

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文研究了大型语言模型在情感对话中生成响应的一致性,通过极端和中等情绪的三个查询测试,发现模型在处理包含错误假设的查询时表现欠佳,尤其在中等情绪内容中更易受虚假信念影响。

Comments Under-review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12355 2026-05-08 cs.LG 90%

Tree-Structured Synergy of Large Language Models and Bayesian Optimization for Efficient CASH

树状结构下大语言模型与贝叶斯优化的协同作用:高效CASH问题

Beicheng Xu, Weitong Qian, Lingching Tung, Yupeng Lu, Bin Cui

机构 * School of Computer Science, Peking University(北京大学计算机科学系)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出LB-MCTS框架,通过树状结构整合大语言模型与贝叶斯优化,解决高维CASH问题中的冷启动问题,实验表明其优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06320 2026-05-08 cs.MA cs.AI cs.CL 90%

Improving the Efficiency of Language Agent Teams with Adaptive Task Graphs

通过自适应任务图提高语言代理团队的效率

Elizabeth Mieczkowski, Alexander Ku, Tiwalayo Eisape, Dilip Arumugam, John Matters, Katherine M. Collins, Ilia Sucholutsky, Thomas L. Griffiths

机构 * Princeton University(普林斯顿大学) University of Cambridge(剑桥大学) MIT(麻省理工学院) New York University(纽约大学)

专题命中 效率与部署 :language agent(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出LATTE框架,通过自适应任务图提升语言代理团队效率,减少资源消耗并提高协作准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05696 2026-05-08 cs.DC cs.AI cs.LG 90%

Irminsul: MLA-Native Position-Independent Caching for Agentic LLM Serving

Irminsul:基于MLA的原生位置无关缓存用于代理LLM服务

Bole Ma, Jan Eitzinger, Harald Köstler

机构 * Erlangen National High Performance Computing Center(埃朗根国家高性能计算中心)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出Irminsul,一种基于MLA的原生位置无关缓存,通过内容哈希键和δ旋转规则提升代理LLM服务性能,实现高达83%的提示词恢复率和63%的预填能量节省。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05485 2026-05-08 cs.CL cs.AI 90%

ReaComp: Compiling LLM Reasoning into Symbolic Solvers for Efficient Program Synthesis

ReaComp:将LLM推理编译为符号求解器以实现高效的程序合成

Atharva Naik, Yash Mathur, Prakam, Carolyn Rose, David Mortensen

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 通过编译推理轨迹生成符号求解器,提升程序合成效率与准确性,同时减少对LLM的依赖,适用于多个基准测试任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03379 2026-05-08 cs.LG cs.CL 90%

Two Calls, Two Moments, and the Vote-Accuracy Curve of Repeated LLM Inference

两次调用、两次矩与重复LLM推理的投票准确性曲线

Yi Liu

机构 * York University(约克大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 研究重复LLM推理的二元正确性层,在条件独立同分布调用下,通过两次调用确定第二矩和相同示例正确性相关性,从而为固定多数投票预算提供分布无关的两调用区间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06455 2026-05-08 cs.AI 90%

PrefixGuard: From LLM-Agent Traces to Online Failure-Warning Monitors

PrefixGuard: 从LLM-代理轨迹到在线故障预警监控

Xinmiao Huang, Jinwei Hu, Rajarshi Roy, Changshun Wu, Yi Dong, Xiaowei Huang

机构 * University of Liverpool(利物浦大学) Université Grenoble Alpes(格勒诺布尔阿尔卑斯大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 PrefixGuard通过离线StepView诱导和监督学习训练监控器,有效提升异构轨迹上的在线故障预警性能,实现0.900/0.710/0.533/0.557 AUPRC的高精度预警。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06068 2026-05-08 cs.AI cs.DC 90%

VibeServe: Can AI Agents Build Bespoke LLM Serving Systems?

VibeServe: 人工智能代理能否构建定制化的LLM服务系统?

Keisuke Kamahori, Shihang Li, Simon Peter, Baris Kasikci

机构 * University of Washington(华盛顿大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出VibeServe,一种通过多代理循环自动合成定制化LLM服务系统的框架,在标准部署中与vLLM竞争,在非标准场景中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05777 2026-05-08 cs.CL 90%

Estimating the Black-box LLM Uncertainty with Distribution-Aligned Adversarial Distillation

通过分布对齐对抗蒸馏估计黑盒大语言模型的不确定性

Huizi Cui, Huan Ma, Qilin Wang, Yuhang Gao, Changqing Zhang

机构 * School of Computer Science and Technology, Tianjin University, China(天津大学计算机科学与技术学院) School of Future Technology, Tianjin University, China(天津大学未来技术学院) Georgia Tech Shenzhen Institute, Tianjin University, China(Georgia Tech深圳研究院) School of Artificial Intelligence, Tianjin University, China(天津大学人工智能学院)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出DisAAD方法,通过生成-判别架构引导轻量级代理模型学习黑盒LLM的输出分布高质量区域,从而有效估计其不确定性。实验表明,即使代理模型仅占目标LLM大小的1%,也能实现可靠的不确定性量化。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05914 2026-05-08 quant-ph cs.AI cs.LG 90%

Quantum-enhanced Large Language Models on Quantum Hardware via Cayley Unitary Adapters

通过凯莱单位ary适配器在量子硬件上增强大型语言模型

Borja Aizpurua, Sukhbinder Singh, Augustine Kshetrimayum, Saeed S. Jahromi, Roman Orus

机构 * Multiverse Computing Parque Científico y Tecnológico de Gipuzkoa(吉普乌科阿科技公园) Department of Basic Sciences(基础科学系) Tecnun – University of Navarra(塔努大学) Centre for Social Innovation(社会创新中心) Donostia International Physics Center(多斯蒂亚国际物理中心) Ikerbasque Foundation for Science(Ikerbasque科学基金会)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 本研究通过在预训练语言模型的冻结投影层中插入量子电路块,利用IBM Quantum System Two处理器提升Llama 3.1 8B模型的困惑度,仅需6000个额外参数,并在真实量子处理器上验证端到端推理。

Comments 31 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05467 2026-05-08 cs.DC 89%

Nitsum: Serving Tiered LLM Requests with Adaptive Tensor Parallelism

Nitsum:通过自适应张量并行性服务分层LLM请求

Vikranth Srivatsa, Zijian He, Pu Guo, Dongming Li, Yiying Zhang

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 Nitsum通过自适应张量并行性优化分层LLM服务,提升多租户场景下的吞吐量,实验显示性能提升达5.3倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05277 2026-05-08 cs.CR 89%

GLiNER Guard: Unified Encoder Family for Production LLM Safety and Privacy

GLiNER Guard:面向生产LLM安全与隐私的统一编码器家族

Bogdan Minko, Sabrina Sadiekh, Evgeniy Kokuykin

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 本文提出GLiNER Guard统一编码器,实现安全分类与PII检测,提升生产LLM的安全性和隐私保护效率。

Comments Models: https://huggingface.co/collections/hivetrace/gliner-guard-v1 PII-Bench: https://huggingface.co/datasets/hivetrace/pii-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15155 2026-05-08 cs.DC 89%

eLLM: Elastic Memory Management Framework for Efficient LLM Serving

eLLM:一种高效的大型语言模型服务弹性内存管理框架

Jiale Xu, Rui Zhang, Yi Xiong, Cong Guo, Zihan Liu, Yangjie Zhou, Weiming Hu, Hao Wu, Changxu Shao, Ziqing Wang, Yongjie Yuan, Junping Zhao, Minyi Guo, Jingwen Leng

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 eLLM提出一种弹性内存管理框架,通过虚拟张量抽象、弹性内存机制和轻量调度策略,提升LLM服务的内存利用效率,实现在动态负载下的更高吞吐量和更大批次大小。

Comments 7pages, accepted to DAC'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01627 2026-05-08 cs.LG 89%

Importance-Guided Basis Selection for Low-Rank Decomposition of Large Language Models

基于重要性的基选择用于大型语言模型的低秩分解

Daniel Agyei Asante, Ernie Chang, Yang Li

机构 * Iowa State University(爱荷华州立大学) Meta

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.LG

AI总结 本文提出BSI框架,通过估计移除每个基所导致的损失增加来选择和剪枝基,提升低秩分解效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06423 2026-05-08 cs.CR 89%

Pop Quiz Attack: Black-box Membership Inference Attacks Against Large Language Models

Pop Quiz Attack:针对大语言模型的黑盒成员推断攻击

Zeyuan Chen, Yihan Ma, Xinyue Shen, Michael Backes, Yang Zhang

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn)

AI总结 本文提出PopQuiz攻击,通过将目标数据转化为选择题来推断大语言模型是否能回忆特定训练数据,平均ROC-AUC达0.873,优于现有方法。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06206 2026-05-08 cs.LG 88%

Federation of Experts: Communication Efficient Distributed Inference for Large Language Models

专家联邦:用于大型语言模型的通信高效的分布式推理

Muhammad Shahir Abdurrahman, Chun Deng, Azalia Mirhoseini, Philip Levis

机构 * Stanford University(斯坦福大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出FedEx架构,通过将MoE块分为多个集群,减少专家间通信开销,提升单节点和多节点下的推理吞吐量和延迟,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21623 2026-05-08 cs.LG cs.NA math.NA 88%

LAMP: Look-Ahead Mixed-Precision Inference of Large Language Models

LAMP:大型语言模型的前瞻性混合精度推理

Stanislav Budzinskiy, Marian Gloser, Tolunay Yilmaz, Ying Hong Tham, Yuanyi Lin, Wenyi Fang, Fan Wu, Philipp Petersen

机构 * Faculty of Mathematics University of Vienna(维也纳大学数学系) Huawei Technologies(华为技术)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出了一种前瞻性混合精度推理方法,通过选择性提高部分组件的计算精度,提升Transformer推理的准确性,实验证明在GPT-2模型上精度提升达两个数量级。

Comments Major revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06412 2026-05-08 cs.LG cs.CL 88%

Sample-efficient LLM Optimization with Reset Replay

基于重置回放的高效大语言模型优化

Zichuan Liu, Jinyu Wang, Lei Song, Jiang Bian

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 效率与部署 :LLM(title,abstract);post-training(abstract);preference optimization(abstract);分类 cs.CL、cs.LG

AI总结 本文提出LoRR方法,通过高重播训练和周期性重置策略提升偏好优化的样本效率,实验表明其在数学和通用推理基准上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13727 2026-05-08 cs.LG cs.AI cs.CL 88%

Attribution-Guided Pruning for Insight and Control: Circuit Discovery and Targeted Correction in Small-scale LLMs

基于归因的剪枝用于洞察与控制:小型LLM中的回路发现与针对性修正

Sayed Mohammad Vakilzadeh Hatefi, Maximilian Dreyer, Reduan Achtibat, Patrick Kahardipraja, Thomas Wiegand, Wojciech Samek, Alexander Binder, Sebastian Lapuschkin

机构 * Data Science Center ScaDS.AI, Universität Leipzig(ScaDS.AI数据科学中心,莱比锡大学) Department of Artificial Intelligence, Fraunhofer Heinrich-Hertz-Institute(人工智能系,弗劳恩霍夫 Heinrich-Hertz 研究所) Department of Electrical Engineering and Computer Science, Technische Universität Berlin(电气工程与计算机科学系,柏林技术大学) BIFOLD - Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所) Centre of eXplainable Artificial Intelligence, Technological University Dublin(可解释人工智能中心,都柏林技术大学)

专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于归因的剪枝方法,通过识别对模型输出贡献最大的参数,用于小型LLM中的回路发现与针对性修正,通过剪枝减少有毒输出和重复文本生成,验证了方法的通用性。

Comments Work in progress (9 pages manuscript, 3 pages references, 16 pages appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05419 2026-05-08 cs.CY 87%

LLMorphism: When humans come to see themselves as language models

LLMorphism:当人类开始将自己视为语言模型

Valerio Capraro

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract)

AI总结 本文探讨了人类将自身认知类比为大语言模型的偏误信念,分析了这种偏误的形成机制及其对社会各领域的潜在影响。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06053 2026-05-08 cs.LG 86%

Towards Generation-Efficient Uncertainty Estimation in Large Language Models

向大型语言模型的生成效率不确定性估计

Mingcheng Zhu, Yu Liu, Tingting Zhu

机构 * University of Oxford(牛津大学)

专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract_cn);分类 cs.LG

AI总结 本文提出通过部分生成或仅输入信息实现高效不确定性估计,提出Logit Magnitude和MetaUE方法,在通用和领域基准上验证了部分生成的有效性。

Comments 21 pages, 6 figures, and 8 tables. The abstract provided in the metadata differs slightly from the manuscript version due to character limits

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02241 2026-05-08 cs.AI cs.CL cs.ET 85%

Zero-Shot Confidence Estimation for Small LLMs: When Supervised Baselines Aren't Worth Training

小语言模型的零样本置信度估计:当监督基线不再值得训练

Luong N. Nguyen

机构 * BuffaloTechRider(布法罗科技骑手)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 本文研究小语言模型如何在无监督数据下估计自身正确性,通过比较零样本置信信号与监督基线,发现基于平均token对数概率的方法在分布内和分布外均表现更优,提出检索条件自我评估方法提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02821 2026-05-08 cs.PF 85%

When Is the Same Model Not the Same Service? A Measurement Study of Hosted Open-Weight LLM APIs

当同一模型不是同一服务时:一种托管开源大语言模型API的测量研究

Haorui Li, Zhenghui He, Xuanzi Liu, Yang Xu, Dongsheng Liu, Jiakang Ma, Lupan Wu, Yangjie Wu, Xiongchao Tang, Tianhui Shi

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文通过测量研究探讨托管开源大语言模型API服务的异质性,发现服务层影响'同一模型'的含义,揭示了需求分布、供应与使用分离以及任务混合对服务选择的影响。

Comments 25 pages, 21 figures; substantially revised abstract, add open-sourced code repo

详情

展开后加载摘要…

URL PDF HTML 收藏