arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22089 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22089 篇

2606.14711 2026-06-16 cs.DC 新提交 95%

SWARM-LLM: Collaborative Inference for Edge-based Small Language Models

SWARM-LLM:基于边缘的小语言模型的协同推理

Mostafa Dahshan, Quazi Mamun, Tanmoy Debnath

专题命中 效率与部署 :LLM(title,title_cn);language model(title,abstract);small language model(title,abstract);SLM(summary_cn,abstract_cn)

AI总结 提出SWARM-LLM路由协作层,通过轻量级不确定性估计和安全信号,在边缘SLM、对等SLM协作和云端FM之间动态选择查询处理方式,实现精度、延迟和成本的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00255 2026-07-02 cs.IT math.IT 新提交 95%

SLM, LLM or Agentic AI? Toward Intelligent UAV-Enabled WPT Systems in Low-Altitude Economy Networks

SLM、LLM 还是 Agentic AI?面向低空经济网络中智能无人机赋能WPT系统

Feibo Jiang, Li Dong, Lei Mao, Kezhi Wang, Xianbin Wang, Abbas Jamalipour

专题命中 效率与部署 :LLM(title,title_cn);SLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 研究在资源受限动态环境下,利用小语言模型(SLM)和基于大语言模型(LLM)的Agentic AI框架优化无人机无线充电(WPT)路径与能量,实现低复杂度、低延迟和高能效。

Journal ref IEEE Journal on Selected Areas in Communications, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23263 2026-04-28 cs.CL cs.AI 94%

Small Language Model Helps Resolve Semantic Ambiguity of LLM Prompt

小语言模型帮助解决LLM提示的语义歧义

Zhenzhen Huang, Chaoning Zhang, Fachrina Dewi Puspitasari, Jiaquan Zhang, Yitian Zhou, Shuxu Chen, Yang Yang

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) Department of Electronic Engineering, Kyung Hee University(庆熙大学电子工程系)

专题命中 效率与部署 :LLM(title,title_cn);language model(title,abstract);small language model(title,abstract);large language model(abstract)

AI总结 本文提出通过显式提示消歧机制解决LLM提示的语义歧义问题,利用小语言模型高效计算提升推理性能,实验表明方法在多个基准上提升2.5点,成本仅0.02美元。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13418 2026-08-04 cs.LG cs.AI 版本更新 94%

GPrune-LLM: Generalization-Aware Structured Pruning for Large Language Models

GPrune-LLM: 为大语言模型的通用性感知结构剪枝

Xiaoyun Liu, Divya Saxena, Jiannong Cao, Yuqing Zhao, Yiying Dong, Penghui Ruan

机构 * Department of Computing, The Hong Kong Polytechnic University, Hong Kong(香港理工大学计算机系) School of Artificial Intelligence and Data Science, IIT Jodhpur(IIT朱罗浦人工智能与数据科学学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出GPrune-LLM框架,通过识别神经元在不同分布下的行为差异,改进结构化剪枝方法,提升模型在分布外任务中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08643 2026-07-10 cs.LG 新提交 94%

BiSCo-LLM: Lookup-Free Binary Spherical Coding for Extreme Low-Bit Large Language Model Compression

BiSCo-LLM:用于极低比特大语言模型压缩的无查找表二进制球面编码

Yuantian Shao, Peisong Wang, Zhilei Liu, Chuangyi Li, Yuanteng Chen, Pengcheng Xie, Yiwu Yao, Zhihui Wei, Jian Cheng

机构 * Nanjing University of Science and Technology(南京理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Huawei(华为)

专题命中 效率与部署 :LLM(title,title_cn);large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 研究大语言模型部署时的压缩问题,提出BiSCo-LLM框架,通过将局部权重块映射到超球面二值化、编码重建误差、进行类别恢复蒸馏及设置保护通道路径等方法,实现极低比特权重压缩并减少存储开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22695 2026-06-12 cs.LG 版本更新 94%

LLM-ODDR: A Large Language Model Framework for Joint Order Dispatching and Driver Repositioning

LLM-ODDR:一种用于联合订单调度和司机重新定位的大语言模型框架

Tengfei Lyu, Siyuan Feng, Hao Liu, Hai Yang

机构 * Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou)(人工智能前沿技术 thrust,香港科学与技术大学(广州)) Department of Aeronautical and Aviation Engineering, The Hong Kong Polytechnic University(航空与航空工程系,香港理工大学) Research Center for Low Altitude Economy, The Hong Kong Polytechnic University(低空经济研究中心,香港理工大学) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(计算机科学与工程系,香港科学与技术大学) Department of Civil and Environmental Engineering, The Hong Kong University of Science and Technology(土木与环境工程系,香港科学与技术大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 提出LLM-ODDR框架,利用大语言模型联合优化网约车订单调度与司机重新定位,通过多目标价值细化、公平感知调度和时空需求感知重定位提升效果、适应性和可解释性。

Comments Published in IEEE Transactions on Intelligent Transportation Systems (TITS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18396 2026-05-26 cs.CL 94%

River-LLM: Large Language Model Seamless Exit Based on KV Share

River-LLM:基于KV共享的大型语言模型无缝退出

Yingtao Shen, An Zou

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 针对解码器-only架构中早期退出因KV缓存缺失导致的延迟和精度问题,提出无需训练的River-LLM框架,通过轻量级KV共享退出流实现令牌级无缝退出,并利用状态转移相似性预测KV误差指导退出决策,在数学推理和代码生成任务上获得1.53-2.16倍实际加速且保持高质量。

Comments Accepted to ACL 2026, 13pages, with appendix. Corrected some typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05640 2026-05-20 cs.CR cs.DC 94%

FedShield-LLM: A Secure and Scalable Federated Fine-Tuned Large Language Model

FedShield-LLM: 一种安全且可扩展的联邦微调大语言模型

Md Jueal Mia, M. Hadi Amini

专题命中 效率与部署 :LLM(title,title_cn);large language model(title,abstract);language model(title,abstract)

AI总结 本文提出FedShield-LLM,通过结合剪枝与全同态加密技术,提升联邦学习中大语言模型的安全性和可扩展性,同时减少计算和通信开销,实现高效的任务特定模型训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23795 2026-04-28 cs.CR 94%

LLM-CEG: Extending the Classification Error Gauge Framework for Privacy Auditing of Large Language Models

LLM-CEG:扩展分类误差量规框架以进行大型语言模型的隐私审计

Kato Mivule

专题命中 效率与部署 :LLM(title,title_cn);large language model(title,abstract);language model(title,abstract)

AI总结 本文将分类误差量规框架扩展至大型语言模型的隐私审计,提出LLM-CEG框架,通过成员推断攻击成功率和模型困惑度作为隐私和效用指标,迭代调整差分隐私参数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28058 2026-05-28 cs.CL 94%

Prompting Is All You Need: Multi-view Prompting Large Language Models for Aspect-Based Sentiment Analysis

提示即一切:基于多视角提示的大语言模型在方面级情感分析中的应用

Nils Constantin Hellwig, Niklas Donhauser, Jakob Fehle, Udo Kruschwitz, Christian Wolff

机构 * Media Informatics Group, University of Regensburg, Germany(里根大学媒体信息学小组) Information Science Group, University of Regensburg, Germany(里根大学信息科学小组)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(title,abstract)

AI总结 提出LLM-MvP方法,通过多视角提示、模式约束解码和前缀批处理,使大语言模型在少量样本下达到与微调模型竞争甚至更优的性能,同时降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28066 2026-06-10 cs.CL cs.AI 版本更新 94%

PromptEmbedder: Efficient and Transferable Text Embedding via Dual-LLM Soft Prompting

PromptEmbedder:通过双LLM软提示实现高效且可迁移的文本嵌入

Yu-Che Tsai, Kuan-Yu Chen, Yuan-Hao Chen, Yu-Han Chang, Ching-Yu Tsai, Yu-Hsiang Chuang, Shou-De Lin

机构 * Department of Computer Science and Information Engineering, National Taiwan University(国立台湾大学计算机科学与资讯工程系) National Taiwan University AI Center of Research Excellence(国立台湾大学人工智能研究中心)

专题命中 效率与部署 :LLM(title,title_cn);prompting(title,abstract);large language model(abstract);language model(abstract)

AI总结 提出PromptEmbedder双LLM框架,通过可微分的软提示生成将嵌入知识从特定骨干权重中解耦,在保持性能的同时降低40% GPU内存并加速3.7倍训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03267 2026-02-02 cs.LG cs.AI 94%

PT$^2$-LLM: Post-Training Ternarization for Large Language Models

PT²-LLM:大语言模型的后训练三元化

Xianglong Yan, Chengzhu Bao, Zhiteng Li, Tianao Zhang, Kaicheng Yang, Haotong Qin, Ruobing Xie, Xingwu Sun, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) ETH Zürich(苏黎世联邦理工学院) Tencent Hunyuan(腾讯文言)

专题命中 效率与部署 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);post-training(title,abstract)

AI总结 PT²-LLM通过后训练三元化技术,在降低内存成本的同时提升大语言模型的推理速度和效率。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24120 2026-06-02 cs.CV cs.AI 93%

Enhancing LLM-Based Neural Network Generation: Few-Shot Prompting and Efficient Validation for Automated Architecture Design

增强基于LLM的神经网络生成:面向自动化架构设计的少样本提示与高效验证

Raghuvir Duvvuri, Chandini Vysyaraju, Avi Goyal, Dmitry Ignatov, Radu Timofte

机构 * Computer Vision Lab, CAIDAS & IFI, University of Würzburg, Germany(计算机视觉实验室,CAIDAS与IFI,乌尔姆大学,德国)

专题命中 效率与部署 :LLM(title,title_cn);prompting(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出少样本架构提示(FSAP)和空白归一化哈希验证方法,以提升基于LLM的计算机视觉架构自动生成效率,并通过大规模实验验证其有效性。

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), pp. 3242-3251, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10666 2026-04-28 cs.CL cs.AI cs.LG 93%

Green Prompting: Characterizing Prompt-driven Energy Costs of LLM Inference

绿色提示:字符化提示驱动的LLM推理能耗

Marta Adamska, Daria Smirnova, Hamid Nasiri, Zhengxin Yu, Peter Garraghan

机构 * School of Computing and communications(计算与通信学院)

专题命中 效率与部署 :LLM(title,title_cn);prompting(title);large language model(abstract);language model(abstract)

AI总结 研究通过实验分析不同提示和响应特征对LLM推理能耗的影响,发现任务语义和关键词对能耗有显著影响,提示设计优化可提升推理效率。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19364 2026-06-19 cs.LG 新提交 93%

Closing the Social-Semantic Gap: SPSD for Edge-Based Prompt Compression in Cloud LLM Inference

缩小社会-语义差距:SPSD用于云LLM推理中的边缘端提示压缩

Abhinit Sen, Ajeet Kumar, Manaranjan Pradhan

机构 * Indian School of Business(印度管理学院)

专题命中 效率与部署 :LLM(title,title_cn);SLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对云LLM推理中提示词预填充阶段能耗高的问题,提出SPSD边缘端管道,利用4比特量化小语言模型压缩用户提示,在保持响应质量非劣效的前提下,平均节省99.9个输入token,每调用净节能70-270 uWh。

Comments 19 pages, 7 tables, 1 figure, includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11657 2026-08-13 cs.CL cs.AI nlin.CG 新提交 93%

Semantic Lenia: Emergence of Homeostatic Solitons within the Semantic Space of Large Language Models

语义LENIA:大语言模型语义空间内的稳态孤子涌现

Yoshihiko Kayama

机构 * BAIKA Women’s University(梅田花女子大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出Semantic Lenia人工生命框架,将LLM推理转化为宏观logit空间的连续动力系统,通过非线性稳态反馈回路平衡语义吸引与句法排斥,在混沌边缘涌现自主语义孤子,建立机器认知的物理标度律。

Comments 17 pages, 5 figures. Code, datasets, and interactive phase diagrams are available at https://y-kayama.github.io/semantic-lenia/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24636 2026-04-28 cs.SE cs.AI cs.CL 93%

Less Is More: Engineering Challenges of On-Device Small Language Model Integration in a Mobile Application

少即是多:在移动应用中集成设备端小型语言模型的工程挑战

William Oliveira

机构 * Independent Researcher(独立研究者)

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(title,abstract);small language model(title,abstract);SLM(abstract,abstract_cn)

AI总结 本文研究了在移动应用中集成设备端小型语言模型(SLMs)的工程挑战,通过案例研究发现,尽管SLMs能提供离线隐私AI体验,但实际应用中需接受'LLM做最少'的约束,提出八条设计指导原则。

Comments 28 pages, 8 tables, 17 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02975 2026-08-05 cs.CL cs.AI cs.LG 新提交 93%

TQLite: Multi-LLM Jury Guided Distillation for Real-time MQM Translation Quality Evaluation

TQLite:多大语言模型评审团引导的蒸馏用于实时MQM翻译质量评估

Bhavin Jawade, Cameron R. Wolfe

机构 * Netflix(网飞公司)

专题命中 效率与部署 :LLM(title,summary_cn);SLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本研究提出TQLite蒸馏框架,通过多LRM评审团生成合成训练数据,使SLMs的MQM翻译质量评估性能远超普通SLM,成为LLM/LRM评估器的高性价比替代方案。

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00922 2026-08-04 cs.DC 新提交 93%

From Cloud to Crowd: Democratizing LLM Service with Decentralized Edge Collaboration for RAG

从云端到人群:通过去中心化边缘协作实现面向检索增强生成(RAG)的大语言模型服务民主化

Jiaxing Li, Hengzhi Wang, Feng Wang, Chi Xu, Danyang Song, Ruixiao Zhang, Edith C. H. Ngai, Jiangchuan Liu

专题命中 效率与部署 :LLM(title,summary_cn);SLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 该研究提出DEFRAG系统,通过异构边缘设备的去中心化协作优化RAG的检索与生成,缩小SLM与LLM的准确率差距,大幅降低成本并提升吞吐量,助力边缘LLM服务民主化。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03350 2024-12-31 cs.CL cs.AI cs.LG 93%

A Comprehensive Survey of Small Language Models in the Era of Large Language Models: Techniques, Enhancements, Applications, Collaboration with LLMs, and Trustworthiness

Fali Wang, Zhiwei Zhang, Xianren Zhang, Zongyu Wu, Tzuhao Mo, Qiuhao Lu, Wanjing Wang, Rui Li, Junjie Xu, Xianfeng Tang, Qi He, Yao Ma, Ming Huang, Suhang Wang

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);small language model(title,abstract);SLM(abstract)

Comments 78 pages, 32 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28826 2026-08-03 cs.LG 新提交 93%

Distilling Knowledge from Large Language Models into Lightweight Reinforcement Learning Agents for Autonomous Cyber Operations

将大型语言模型中的知识蒸馏为用于自主网络操作的轻量级强化学习智能体

Konur Tholl, François Rivest, Mariam El Mezouar, Adrian Taylor, Ranwa Al Mallah

机构 * Royal Military College of Canada(加拿大皇家军事学院) Defence Research and Development Canada(加拿大国防研究与发展部) Polytechnique Montreal(蒙特利尔理工学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract);分类 cs.LG

AI总结 该研究针对自主网络操作中强化学习智能体训练不稳定的问题,通过提示工程证明80亿参数网络安全LLM性能优于基线RL智能体,再经在线策略蒸馏将其防御知识迁移至仅64910参数的轻量级RL智能体,为前沿网络安全模型的实用化提供了可行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11317 2026-05-13 cs.CL cs.AI 93%

SOMA: Efficient Multi-turn LLM Serving via Small Language Model

SOMA:通过小型语言模型实现高效的多轮LLM服务

Xueqi Cheng, Qiong Wu, Zhengyi Zhou, Xugui Zhou, Tyler Derr, Yushun Dong

机构 * Florida State University(佛罗里达州立大学) AT&T Chief Data Office(AT&T首席数据办公室) Louisiana State University(路易斯安那州立大学) Vanderbilt University(范德比大学)

专题命中 效率与部署 :LLM(title,title_cn);language model(title,abstract);small language model(title,abstract);large language model(abstract)

AI总结 SOMA通过利用对话早期轮次估计局部响应流形,利用小型替代模型提升多轮对话效率,同时提供理论分析和实验验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17685 2025-12-23 cs.CL cs.AI 93%

Ensemble Bayesian Inference: Leveraging Small Language Models to Achieve LLM-level Accuracy in Profile Matching Tasks

集成贝叶斯推断:利用小语言模型在资料匹配任务中实现LLM级别的准确性

Haru-Tada Sato, Fuka Matsuzaki, Jun-ichiro Takahashi

专题命中 效率与部署 :LLM(title,abstract);language model(title,abstract);small language model(title,abstract);large language model(abstract)

AI总结 本文提出集成贝叶斯推断方法,通过结合多个小型语言模型的判断,实现与大语言模型相当的资料匹配任务准确性。

Comments 13 pages, 2 figures

Journal ref Adv. Artif. Intell. Mach. Learn., 2025, 5 (3 ):4154-4173

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06702 2026-05-11 cs.AI cs.CL cs.LG 93%

CASCADE: Case-Based Continual Adaptation for Large Language Models During Deployment

CASCADE:基于案例的连续适应:在部署期间为大型语言模型进行持续适应

Siyuan Guo, Yali Du, Hechang Chen, Yi Chang, Jun Wang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, Jilin University(吉林大学知识驱动人机智能工程研究中心) International Center of Future Science, Jilin University(吉林大学未来科学国际中心) Department of Informatics, King’s College London(伦敦国王学院信息学院) The Alan Turing Institute(艾伦·图灵研究所) AI Centre, Department of Computer Science, UCL(UCL计算机科学系人工智能中心)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 本文提出CASCADE框架,通过在部署期间持续学习提升LLM性能,实现20.9%的提升,并在多个领域任务中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00034 2023-11-09 cs.LG cs.AI cs.CL 93%

PB-LLM: Partially Binarized Large Language Models

Yuzhang Shang, Zhihang Yuan, Qiang Wu, Zhen Dong

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(title,abstract);post-training(abstract)

Comments Frist work using network binarization for large language model compression

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08161 2026-07-10 cs.CL cs.CV 新提交 93%

SQuaD-SQL: Efficient Text-to-SQL with Small Language Models via LLM-Guided Knowledge Distillation

SQuaD-SQL:通过大语言模型引导的知识蒸馏,利用小语言模型实现高效的文本到SQL转换

Wangyu Wu, Xiaojian Lin, Rong Fu, Zaiyang Yu, Xuhang Chen, Wenjun Yu, Zhenhong Chen

机构 * The University of Liverpool(利物浦大学) University of Macau(澳门大学) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Microsoft(微软) Shanghai University of International Business and Economics(上海国际经贸管理大学) Huizhou University(惠州市大学)

专题命中 效率与部署 :LLM(title,abstract);language model(title,abstract);small language model(title,abstract);large language model(abstract)

AI总结 研究如何让小语言模型在文本到SQL任务中接近大语言模型性能。核心方法是通过知识蒸馏和合成数据生成,包含基于大语言模型的合成数据生成、参数高效微调和领域自适应微调三个关键组件。主要贡献是在WikiSQL数据集上执行准确率达86.9%,推理更快、内存使用更低。

Comments Accepted at IEEE SMC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18105 2026-06-19 eess.AS cs.CL cs.SD 版本更新 93%

NIM4-ASR: Towards Efficient, Robust, and Customizable Real-Time LLM-Based ASR

NIM4-ASR:迈向高效、鲁棒且可定制的实时基于LLM的语音识别

Yuan Xie, Jiaqi Song, Guang Qiu, Xianliang Wang, Kai Qiao, Junfeng Yuan, Shengqing Liu, Yi Zhang, Bowen Chen, Ming Lei, Jie Gao, Jie Wu

机构 * Advanced Intelligent Systems Group, NIO(蔚来智能系统集团)

专题命中 效率与部署 :LLM(title,title_cn);SFT(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出NIM4-ASR框架,通过重新设计多阶段训练范式(包括预训练架构优化、迭代异步SFT和ASR专用强化学习)以及生产优化(噪声鲁棒性、流式推理和RAG热词定制),在2.3B参数下实现SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11222 2026-05-13 cs.LG 93%

ADMM-Q: An Improved Hessian-based Weight Quantizer for Post-Training Quantization of Large Language Models

ADMM-Q: 一种改进的基于Hessian的权重量化器用于大语言模型的后训练量化

Ryan Lucas, Mehdi Makni, Xiang Meng, Adam Deng, Rahul Mazumder

机构 * MIT Operations Research Center(麻省理工学院运筹学中心) MIT Sloan School of Management(麻省理工学院斯隆管理学院) MIT Center for Statistics(麻省理工学院统计中心)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);LLM(abstract,abstract_cn)

AI总结 ADMM-Q是一种新的权重量化算法,通过交替方向乘子法的组合变体,优化层间重建误差并逐步施加量化约束,提升大语言模型的压缩性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00831 2025-09-26 cs.RO cs.CL 93%

SmallPlan: Leverage Small Language Models for Sequential Path Planning with Simulation-Powered, LLM-Guided Distillation

Quang P. M. Pham, Khoi T. N. Nguyen, Nhi H. Doan, Cuong A. Pham, Qinbo Sun, Weimin Qi, Kentaro Inui, Dezhen Song

机构 * Department of Robotics, MBZUAI, UAE(机器人系,MBZUAI,阿联酋)

专题命中 效率与部署 :LLM(title,abstract);language model(title,abstract);small language model(title,abstract);large language model(abstract)

Comments Paper is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22478 2025-07-31 cs.CL 93%

SLM-SQL: An Exploration of Small Language Models for Text-to-SQL

Lei Sheng, Shuai-Shuai Xu

机构 * Wuhan University of Technology(武汉理工大学) University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);SLM(title,abstract);large language model(abstract)

Comments 16 pages, 2 figures, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏