arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22116 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22116 篇

2509.26037 2026-05-19 cs.AI cs.CV cs.LG 92%

CoLLM-NAS: Collaborative Large Language Models for Efficient Knowledge-Guided Neural Architecture Search

CoLLM-NAS:协作大型语言模型用于高效知识引导的神经架构搜索

Zhe Li, Zhiwei Lin, Yongtao Wang

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机科学技术研究院)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出CoLLM-NAS,一种基于协作大型语言模型的两阶段神经架构搜索框架,通过导航和生成两个LLM及协调模块,有效指导搜索过程,提升效率并取得新状态最优结果。

Comments Accepted as Oral at CVPR 2026 Workshop on Neural Architecture Search (NAS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23467 2026-04-28 cs.LG cs.AI cs.AR 92%

Hybrid JIT-CUDA Graph Optimization for Low-Latency Large Language Model Inference

混合JIT-CUDA图优化用于低延迟大语言模型推理

Divakar Kumar Yadav, Tian Zhao

机构 * Department of Computer Science(计算机科学系) University of Wisconsin-Milwaukee(威斯康星大学密尔沃基分校) Milwaukee, WI, USA(美国威斯康星州密尔沃基)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种混合运行时框架,结合JIT编译与CUDA图执行,以降低启动开销并保持自回归解码的运行时灵活性,通过静态组件和动态组件的分离,有效减少短序列LLM推理的延迟和方差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21276 2026-04-24 cs.CL cs.AI cs.SD 92%

Do LLM Decoders Listen Fairly? Benchmarking How Language Model Priors Shape Bias in Speech Recognition

大语言模型解码器是否公平?评估语言模型先验如何塑造语音识别中的偏见

Srishti Ginjala, Eric Fosler-Lussier, Christopher W. Myers, Srinivasan Parthasarathy

机构 * The Ohio State University(俄亥俄州立大学) Air Force Research Laboratory(空军研究实验室)

专题命中 效率与部署 :LLM(title,summary_cn);language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 研究评估九种模型在不同人口特征上的语音识别性能,发现LLM解码器在种族偏见上表现更公平,但Whisper在印度口音语音上出现病理学幻觉,且音频压缩对口音公平性影响更大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16940 2026-04-21 cs.LG cs.AI 92%

D-QRELO: Training- and Data-Free Delta Compression for Large Language Models via Quantization and Residual Low-Rank Approximation

D-QRELO:通过量化和残差低秩近似实现大型语言模型的训练和数据无关的delta压缩

Junlin Li, Shuangyong Song, Guodong Du, Ngai Wong, Xuebo Liu, Yongxiang Li, Min Zhang, Jing Li, Xuelong Li

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) TeleAI of China Telecom(中国电信TeleAI) The Hong Kong Polytechnic University(香港理工大学) The University of Hong Kong(香港大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);SFT(abstract,abstract_cn)

AI总结 本文提出DQRELO方法,通过量化和残差低秩近似实现大型语言模型的delta压缩,解决大规模数据训练导致的压缩误差问题,提升压缩效果和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07035 2026-02-10 cs.AI cs.LG 92%

DLLM-Searcher: Adapting Diffusion Large Language Model for Search Agents

DLLM-Searcher: 为搜索代理适应扩散大语言模型

Jiahao Zhao, Shaoxuan Xu, Zhongxiang Sun, Fengqi Zhu, Jingyang Ou, Yuling Shi, Chongxuan Li, Xiao Zhang, Jun Xu

机构 * Renmin University of China(中国人民大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

AI总结 DLLM-Searcher通过优化基于dLLM的搜索代理,解决代理能力不足和延迟挑战,提升推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21841 2026-07-28 physics.comp-ph 版本更新 92%

False Summit and Silent Drift: A Failure Taxonomy and Efficiency Analysis of LLM-Assisted Multiphysics Simulation in an Open-Source Framework

假峰与无声漂移:开源框架中LLM辅助多物理场仿真的失败分类与效率分析

Chi-Chun Chiang, Shih-Ming He

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究LLM辅助多物理场仿真开发中的失败模式,提出八类失败分类法,并通过LPCVD模型案例揭示假峰和无声漂移两类关键错误。

Comments 29 pages, 7 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25039 2026-06-25 cs.LG cs.AI cs.CL math.DS 新提交 92%

LLM-ACES: Closed-Loop Discovery of Dynamical Systems with LLM-Guided Adaptive Search

LLM-ACES:基于LLM引导的自适应搜索的动力学系统闭环发现

Nikhil Abhyankar, Sha Li, Sanchit Kabra, Naren Ramakrishnan, Yulia Gel, Chandan K. Reddy

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出LLM-ACES框架,利用大语言模型引导的主动闭环搜索,联合优化符号假设构建与自适应数据采集,从数据中发现常微分方程,在122个系统上取得最低中位NMSE和高达52.4%的符号准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23701 2026-06-24 cs.CL cs.AI cs.HC cs.LG 新提交 92%

Evaluating LLM Usage for Efficient and Explainable Numerical and Classified Implicit Sentiment Analysis of Product Desirability

评估LLM在高效可解释的产品期望数值与分类隐式情感分析中的应用

Sherri Weitl-Harms, John Hastings

机构 * Creighton University(克雷顿大学) The Beacom College of Computer & Cyber Sciences, Dakota State University(达科他州立大学比肯计算机与网络科学学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出基于LLM的可扩展框架,从定性反馈中量化产品期望,零样本数值评分和分类情感分析分别达到0.97皮尔逊相关和94%准确率,GPT-4o-mini以94%更低成本实现可比性能,并集成置信度与可解释性。

Comments 20 pages, 6 figures, 11 tables. arXiv admin note: text overlap with arXiv:2408.01527

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23003 2026-06-23 cs.CR 新提交 92%

VCT: A Verifiable Transcript System for LLM Conversations

VCT: 一种用于LLM对话的可验证转录系统

Ruilin Xing, Feihong Li, Jiayue Liu, Jiali Zheng, Wei Liu, Wanzhi Xie

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 针对LLM对话非线性演化(如重提示、回复再生、会话删除等)导致传统日志无法保证完整性的问题,提出VCT系统,通过三层密码学数据结构(分支级哈希链、会话级Merkle树、账户级Merkle根)和带删除屏障的状态转换协议,实现账户级对话记录的完整性、一致性、可验证共享和不可否认性。

Comments 58 pages, 14 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05500 2026-06-09 cs.LG cs.AI cs.CL 版本更新 92%

POET-X: Memory-efficient LLM Training by Scaling Orthogonal Transformation

POET-X:通过扩展正交变换实现内存高效的LLM训练

Zeju Qiu, Lixin Liu, Adrian Weller, Han Shi, Weiyang Liu

机构 * University of Cambridge(剑桥大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 POET-X通过优化正交等价变换降低计算和内存开销,实现高效稳定的LLM训练,支持在单块H100 GPU上预训练十亿参数模型。

Comments ICML 2026 Oral (15 pages, 7 figures, project page: https://spherelab.ai/poetx/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07116 2026-06-08 cs.LG cs.AI cs.CL 新提交 92%

OffQ: Taming Structured Outliers in LLM Quantization by Offsetting

OffQ:通过偏移驯服LLM量化中的结构化异常值

Haoqi Wang, Lorenz K. Mueller, Jiawei Zhuang, Mathieu Salzmann, Lukas Cavigelli

机构 * School of Computer and Communication Sciences, EPFL, Switzerland(瑞士联邦理工学院计算机与通信科学学院) Huawei, Switzerland(华为公司) Swiss Data Science Center, ETHZ & EPFL, Switzerland(瑞士数据科学中心,苏黎世联邦理工学院与联邦理工学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出OffQ方法,通过top-1 PCA识别异常值子空间、旋转集中异常值通道并转换为共享偏移,实现LLM的低比特均匀量化,在W4A4KV4下提升精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00405 2026-06-02 cs.GT 92%

From Talking Words to Sharing Thoughts: Scalable Multi-LLM Aggregation via Structured Message Passing

从言语到思想:通过结构化消息传递实现可扩展的多LLM聚合

Niloufar Mehrabi, Sayed Pedram Haeri Boroujeni, Abolfazl Razi

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出基于二分因子图的消息传递框架,通过语义层集成多个LLM的输出分布,实现高效、可扩展的多模型聚合,在降低97%令牌使用和6倍API调用的同时,性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29543 2026-05-29 cs.LG cs.AI cs.CL cs.HC cs.IR 92%

SCOPE: A Lightweight-training LLM Framework for Air Traffic Control Readback Monitoring

SCOPE:一种用于空中交通管制复诵监控的轻量训练LLM框架

Qihan Deng, Minghua Zhang, Yang Yang, Zhenyu Gao

机构 * Department of Mechanical and Aerospace Engineering, The Hong Kong University of Science and Technology(香港科学与技术大学机械与航空航天工程系) School of Electronic and Information Engineering, Beihang University(北航电子与信息工程学院) State Key Laboratory of CNS/ATM(国家空管自动化系统实验室)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出SCOPE框架,通过冻结LLM结合插件式开放集分类器和上下文学习机制,实现高效准确的空管复诵监控,在少样本设置下开放集检测准确率达91.05%,异常纠正率96.63%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03594 2026-04-23 cs.CL cs.AI cs.DC cs.LG 92%

BatchLLM: Optimizing Large Batched LLM Inference with Global Prefix Sharing and Throughput-oriented Token Batching

BatchLLM: 通过全局前缀共享和面向吞吐量的令牌批处理优化大批次LLM推理

Zhen Zheng, Xin Ji, Taosong Fang, Fanghao Zhou, Chuanjie Liu, Gang Peng

机构 * Microsoft(微软)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出BatchLLM,通过全局前缀共享和面向吞吐量的令牌批处理优化大批次LLM推理,提高GPU利用率。

Comments Accepted at MLSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12634 2026-04-15 cs.AI cs.CL cs.LG cs.MA 92%

RPRA: Predicting an LLM-Judge for Efficient but Performant Inference

RPRA:为高效且高性能推断预测一个LLM判断者

Dylan R. Ashley, Gaël Le Lan, Changsheng Zhao, Naina Dhingra, Zhipeng Cai, Ernie Chang, Mingchen Zhuge, Yangyang Shi, Vikas Chandra, Jürgen Schmidhuber

机构 * Meta Platforms, Inc.(Meta公司) The Swiss AI Lab IDSIA (USI-SUPSI)(瑞士AI实验室IDSIA) Center of Excellence for Generative AI, KAUST(生成式人工智能卓越中心)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨了通过预测LLM判断者评分来提升小模型推断性能的方法,通过零样本预测、上下文报告卡和监督微调三种方法,发现大模型在零样本预测中表现优异,而小模型通过微调或报告卡显著提升预测准确性,达到最高55%的改进。

Comments 10 pages in main text + 6 pages of references + 36 pages of appendices, 12 figures in main text + 37 figures in appendices, 2 tables in main text + 3 table in appendices, 13 prompts in appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15331 2026-01-23 cs.CL cs.AI cs.CR cs.LG 92%

RECAP: A Resource-Efficient Method for Adversarial Prompting in Large Language Models

RECAP:一种资源高效的对抗性提示方法用于大型语言模型

Rishit Chugh

机构 * Rishit Chugh(独立研究者)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RECAP提出一种无需重新训练的高效对抗性提示方法,通过匹配预训练对抗性提示数据库,降低计算成本并提升攻击成功率。

Comments Code for RECAP is available at: https://github.com/R-C101/RECAP

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09947 2025-10-08 cs.SE 92%

Toward Green Code: Prompting Small Language Models for Energy-Efficient Code Generation

Humza Ashraf, Syed Muhammad Danish, Shadikur Rahman, Zeeshan Sattar

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);prompting(title,abstract);large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26497 2025-10-01 cs.CV 92%

Revealing the Power of Post-Training for Small Language Models via Knowledge Distillation

Miao Rang, Zhenni Bi, Hang Zhou, Hanting Chen, An Xiao, Tianyu Guo, Kai Han, Xinghao Chen, Yunhe Wang

专题命中 效率与部署 :language model(title,abstract);post-training(title,abstract);small language model(title);large language model(abstract)

Comments 7

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08981 2025-05-15 cs.AR 92%

ITERA-LLM: Boosting Sub-8-Bit Large Language Model Inference via Iterative Tensor Decomposition

Keran Zheng, Yinting Huang, Zhewen Yu, Christos-Savvas Bouganis

专题命中 效率与部署 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04636 2025-03-18 cs.CL cs.AI cs.CR cs.LG 92%

Mark Your LLM: Detecting the Misuse of Open-Source Large Language Models via Watermarking

Yijie Xu, Aiwei Liu, Xuming Hu, Lijie Wen, Hui Xiong

专题命中 效率与部署 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by the ICLR 2025 Workshop on GenAI Watermarking

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06839 2025-02-26 cs.CL cs.AI cs.LG 92%

LLM-NEO: Parameter Efficient Knowledge Distillation for Large Language Models

Runming Yang, Taiqiang Wu, Jiahao Wang, Pengfei Hu, Yik-Chung Wu, Ngai Wong, Yujiu Yang

专题命中 效率与部署 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments ARR under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10385 2024-10-01 cs.CL cs.AI cs.CV cs.LG 92%

By My Eyes: Grounding Multimodal Large Language Models with Sensor Data via Visual Prompting

Hyungjun Yoon, Biniyam Aschalew Tolera, Taesik Gong, Kimin Lee, Sung-Ju Lee

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to the 2024 Conference on Empirical Methods in Natural Language Processing (EMNLP 2024) Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17470 2024-05-29 cs.LG cs.AI cs.CL 92%

Athena: Efficient Block-Wise Post-Training Quantization for Large Language Models Using Second-Order Matrix Derivative Information

Yanshu Wang, Wenyang He, Tong Yang

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14866 2024-04-17 cs.LG cs.AI cs.CL 92%

APTQ: Attention-aware Post-Training Mixed-Precision Quantization for Large Language Models

Ziyi Guan, Hantao Huang, Yupeng Su, Hong Huang, Ngai Wong, Hao Yu

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 6 pages, 2 figures, published to DAC 2024: 61st IEEE/ACM Design Automation Conference. (DAC'24)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00308 2024-04-02 cs.CV 92%

ST-LLM: Large Language Models Are Effective Temporal Learners

Ruyang Liu, Chen Li, Haoran Tang, Yixiao Ge, Ying Shan, Ge Li

专题命中 效率与部署 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.01305 2023-11-14 cs.LG cs.AI cs.CL 92%

AWEQ: Post-Training Quantization with Activation-Weight Equalization for Large Language Models

Baisong Li, Xingwang Wang, Haixiao Xu

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.15987 2023-08-31 cs.CL cs.AI cs.LG 92%

FPTQ: Fine-grained Post-Training Quantization for Large Language Models

Qingyuan Li, Yifan Zhang, Liang Li, Peng Yao, Bo Zhang, Xiangxiang Chu, Yerui Sun, Li Du, Yuchen Xie

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02879 2026-08-05 cs.AI 新提交 92%

Interpreting Black-Box Large Language Models with Sentence-Level Energy Landscapes

基于句子级能量景观的黑盒大语言模型解释

Maryam Rezaee, Pooriya Safaei, Maryam Asgarinezhad, Fatemeh Seyyedsalehi

机构 * Sharif University of Technology(谢里夫理工大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 针对黑盒LLM的可解释性缺失问题,提出一种句子级模型无关后验归因解释器,通过EBM代理捕获概念一致性,无需额外API查询即可量化提示对目标输出的影响,实验验证其能有效识别关键提示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27704 2026-07-31 cs.AR cs.LG 新提交 92%

LightRot: A Light-Weighted Rotation Scheme and Architecture for Accurate Low-Bit Large Language Model Inference

LightRot:用于精确低比特大语言模型推理的轻量级旋转方案与架构

Sangjin Kim, Yuseon Choi, Jungjun Oh, Byeongcheol Kim, Hoi-Jun Yoo

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本研究提出LightRot轻量级旋转方案与硬件加速器,通过算法创新结合28nm工艺实现4比特推理27.4 TOPS/W能效,适配LLaMA系列模型,为低比特LLM推理提供新范式。

Comments 13 pages, journal version. Published in IEEE Journal on Emerging and Selected Topics in Circuits and Systems (JETCAS), vol. 15, no. 2, pp. 231-243, 2025, DOI: 10.1109/JETCAS.2025.3558300

Journal ref IEEE Journal on Emerging and Selected Topics in Circuits and Systems, vol. 15, no. 2, pp. 231-243, June 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27172 2026-07-30 cs.IR cs.AI 新提交 92%

Improving Item Discoverability in e-Commerce Search via Related Intent Generation

通过相关意图生成提升电商搜索中的商品可发现性

Ji Xin, Xiao Xiao, Ishan Bhatt, Vinesh Gudla, Trace Levinson, Raochuan Fan, Shishir Kumar Prasad, Prakash Putta, Tejaswi Tenneti

专题命中 效率与部署 :LLM(summary_cn,abstract);SLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 该研究提出两阶段混合架构的发现增强型搜索系统,通过LLM和微调SLM提升电商搜索的商品可发现性,将查询流量发现覆盖率从60%提至80%,成本仅为教师模型的30%,还可平衡市场供给。

Comments Accepted to KDD 2026 TSMO

详情

展开后加载摘要…

URL PDF HTML 收藏