arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22188 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22188 篇

2512.06673 2026-05-12 cs.CV 90%

Detector-Empowered Video Large Language Model for Efficient Spatio-Temporal Grounding

基于检测器的视频大语言模型用于高效的时空定位

Shida Gao, Feng Xue, Xiangfeng Wang, Anlong Ming, Zhaowen Lin, Haiyang Zhang, Teng Long, Nicu Sebe, Yihua Shao, Haozhe Wang, Wei Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of Trento(特伦特大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Hong Kong University of Science and Technology(香港科技大学) ZTE Corporation(中兴通讯)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文提出DEViL模型,通过将密集空间定位任务转移给训练良好的检测器,提升视频时空定位的效率与性能,实现43.1%的m_vIoU和14.33 FPS的高效表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18030 2026-04-29 cs.CL cs.AI cs.LG 90%

From Local to Global: Revisiting Structured Pruning Paradigms for Large Language Models

从局部到全局:重新审视大型语言模型的结构剪枝范式

Ziyan Wang, Enmao Diao, Qi Le, Pu Wang, Minwoo Lee, Shu-ping Yeh, Evgeny Stupachenko, Hao Feng, Li Yang

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) DreamSoul University of Minnesota(明尼苏达大学) Intel Corporation(英特尔公司)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出GISP,一种基于全局重要性度量的迭代结构剪枝方法,通过去除注意力头和MLP通道提升模型效率和下游任务性能。

Comments 20 pages, 6 figures. Accepted by ACL2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22061 2026-04-27 cs.CL cs.AI cs.LG 90%

Lightweight Retrieval-Augmented Generation and Large Language Model-Based Modeling for Scalable Patient-Trial Matching

轻量级检索增强生成与基于大语言模型的建模用于可扩展的患者试验匹配

Xiaodi Li, Yang Xiao, Munhwan Lee, Konstantinos Leventakos, Young J. Juhn, David Jones, Terence T. Sio, Wei Liu, Maria Vassilaki, Nansu Zong

机构 * Department of Artificial Intelligence and Informatics, Mayo Clinic(人工智能与信息学系,梅奥诊所) Computer Science Department, University of Tulsa(图兰大学计算机科学系) Mayo Clinic Comprehensive Cancer Center, Mayo Clinic(梅奥诊所综合癌症中心,梅奥诊所) Division of Community Pediatric and Adolescent Medicine, Department of Pediatrics, Mayo Clinic(社区儿科与青少年医学分会,儿科部,梅奥诊所) Department of Neurology, Mayo Clinic(神经病学部,梅奥诊所) Department of Radiation Oncology, Mayo Clinic(放射肿瘤学部,梅奥诊所) Department of Quantitative Health Sciences, Mayo Clinic(定量健康科学部,梅奥诊所)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出轻量级框架,结合检索增强生成和大语言模型建模,解决患者试验匹配中长异构电子健康记录和复杂资格标准的可扩展性、泛化性和计算效率问题。

Comments 31 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17002 2026-04-21 cs.HC 90%

Intelligent Drill-Down: Large Language Model-Driven Drill-Down Technique for Human-AI Collaborative Visual Exploration

智能钻取:基于大语言模型的人机协作视觉探索钻取技术

Zhijun Zheng, Tian Qiu, Yuheng Zhao, Siming Chen

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文提出基于大语言模型的智能钻取框架,通过生成视觉洞察、解读用户意图和生成钻取路径,提升多维数据探索效率,减少认知负担。

Comments 11 pages, 6 figures. Accepted to IEEE PacificVis 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15270 2026-04-17 cs.SE 90%

Enhancing Large Language Models with Retrieval Augmented Generation for Software Testing and Inspection Automation

通过检索增强生成提升大型语言模型用于软件测试和检查自动化

Zoe Fingleton, Nazanin Siavash, Armin Moin

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文通过检索增强生成方法提升大型语言模型在软件测试和检查自动化中的应用,有效减少项目成本并提高验证与确认活动的效果和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13016 2026-04-16 cs.LG cs.AI cs.CL 90%

Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe

重新思考大型语言模型的在线策略蒸馏:现象、机制和配方

Yaxuan Li, Yuxin Zuo, Bingxiang He, Jinqian Zhang, Chaojun Xiao, Cheng Qian, Tianyu Yu, Huan-ang Gao, Wenkai Yang, Zhiyuan Liu, Ning Ding

机构 * Tsinghua University(清华大学) ShanghaiTech University(上海交通大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Renmin University of China(中国人民大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文系统研究了在线策略蒸馏的动态和机制,发现成功关键在于师生思维模式兼容及教师提供新能力,提出两种恢复失败蒸馏的策略,并指出密集奖励的表面优势背后存在代价。

Comments 30 pages, 23 figures. Code: https://github.com/thunlp/OPD

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12582 2026-04-15 cs.CV 90%

Relaxing Anchor-Frame Dominance for Mitigating Hallucinations in Video Large Language Models

缓解视频大语言模型幻觉的锚架主导问题

Zijian Liu, Sihan Cao, Pengcheng Zheng, Kuien Liu, Caiyan Qin, Xiaolin Qin, Jiwei Wei, Chaoning Zhang

机构 * University of Electronic Science and Technology of China(电子科技大学) Institute of Software Chinese Academy of Sciences(中国科学院软件研究所) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Chengdu Institute of Computer Applications, Chinese Academy of Sciences, University of the Chinese Academy of Sciences(中国科学院成都计算机应用研究所,中国科学院大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文提出DTR方法,通过解码器侧时间再平衡缓解视频大语言模型在生成时的时间证据分配不均问题,提升幻觉鲁棒性并保持视频理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12387 2026-04-15 q-bio.GN 90%

oxo-call: Documentation-grounded Skill Augmentation for Accurate Bioinformatics Command-line Generation with Large Language Models

oxo-call:基于文档的技能增强用于准确的生物信息学命令行生成与大型语言模型

Yun Peng, Yujun Sun, Jia Ding, Bin Yan, Zhangyu Wang, Chunyang Wang, Chenyang Shu, Jian-Guo Zhou, Shixiang Wang

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 oxo-call通过文档优先 grounding 和精选技能增强策略,提升生物信息学命令行生成的准确性,提供150+内置技能和可扩展的流程引擎。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10799 2026-03-12 cs.CL cs.AI cs.LG 90%

Toward Adaptive Large Language Models Structured Pruning via Hybrid-grained Weight Importance Assessment

面向基于混合粒度权重重要性评估的自适应大语言模型结构剪枝

Jun Liu, Zhenglun Kong, Pu Zhao, Changdi Yang, Hao Tang, Xuan Shen, Geng Yuan, Wei Niu, Wenbin Zhang, Xue Lin, Dong Huang, Yanzhi Wang

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出HyWIA方法,通过混合粒度权重重要性评估提升大语言模型剪枝效果,实现更优的性能保留和结构优化。

Comments AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09173 2026-03-11 cs.CV 90%

Point Cloud as a Foreign Language for Multi-modal Large Language Model

点云作为多模态大语言模型的外语

Sneha Paul, Zachary Patterson, Nizar Bouguila

机构 * Concordia University(康科迪亚大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);preference optimization(abstract)

AI总结 SAGE是首个端到端3D多模态大语言模型,通过轻量级3D分词器直接处理点云,提升3D任务的推理能力与鲁棒性。

Comments Accepted in The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06495 2026-03-09 cs.LG cs.AI cs.CL 90%

COLD-Steer: Steering Large Language Models via In-Context One-step Learning Dynamics

COLD-Steer: 通过上下文一步学习动态引导大型语言模型

Kartik Sharma, Rakshit S. Trivedi

机构 * Georgia Institute of Technology(佐治亚理工学院) Massachusetts Institute of Technology(麻省理工学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 COLD-Steer通过近似学习动态实现无需训练的LLM引导,有效提升引导效果并减少样本需求。

Comments ICLR 2026. Code available at https://github.com/Ksartik/cold-steer

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08646 2026-03-04 cs.LG cs.AI cs.CL stat.ML 90%

Mitigating Over-Refusal in Aligned Large Language Models via Inference-Time Activation Energy

通过推理时间激活能量缓解对齐大语言模型中的过度拒绝

Eric Hanchen Jiang, Weixuan Ou, Run Liu, Shengyuan Pang, Guancheng Wan, Ranjie Duan, Wei Dong, Kai-Wei Chang, XiaoFeng Wang, Ying Nian Wu, Xinfeng Li

机构 * UCLA(加州大学洛杉矶分校) Alibaba Cloud Computing(阿里云计算) SJTU(上海交通大学) Alibaba Group(阿里巴巴集团) NTU(国立科技大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过能量景观引导框架,提升大语言模型的安全性并减少虚假拒绝,实验显示在ORB-H基准上合规性显著提高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18471 2026-03-02 cs.IR cs.AI cs.CL cs.LG q-fin.ST 90%

FinBloom: Knowledge Grounding Large Language Model with Real-time Financial Data

FinBloom:基于实时金融数据的知识引导大型语言模型

Ankur Sinha, Chaitanya Agarwal, Pekka Malo

机构 * Indian Institute of Management Ahmedabad(印度管理学院阿赫迈德亚德分校) Aalto University School of Business(阿尔托大学商学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 FinBloom通过实时金融数据增强LLMs能力,实现高效金融任务处理。

Comments 39 pages, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18502 2026-02-27 cs.AI cs.CL cs.LG 90%

Knowledge Fusion of Large Language Models Via Modular SkillPacks

通过模块化技能包实现大语言模型的知识融合

Guodong Du, Zhuo Li, Xuanning Zhou, Junlin Li, Zesheng Shi, Wanyu Lin, Ho-Kin Tang, Xiucheng Li, Fangming Liu, Wenya Wang, Min Zhang, Jing Li

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 GraftLLM通过模块化技能包实现大语言模型的知识融合,提升跨能力迁移的效率和效果。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12121 2026-02-19 cs.AI cs.CL cs.LG 90%

Precise Attribute Intensity Control in Large Language Models via Targeted Representation Editing

通过针对性表征编辑实现大语言模型中的精确属性强度控制

Rongzhi Zhang, Liqin Ye, Yuzhao Heng, Xiang Chen, Tong Yu, Lingkai Kong, Sudheer Chava, Chao Zhang

机构 * Georgia Institute of Technology(佐治亚理工学院) Adobe Research(Adobe研究) Harvard University(哈佛大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过针对性表征编辑方法,实现大语言模型中精确属性强度控制,提升模型对用户需求的适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11731 2026-02-10 cs.LG cs.AI cs.CL 90%

Dist2ill: Distributional Distillation for One-Pass Uncertainty Estimation in Large Language Models

Dist2ill: 基于分布的蒸馏用于大语言模型中单次传递的不确定性估计

Yicong Zhao, King Yeung Tsang, Harshil Vejendla, Haizhou Shi, Zhuohang Li, Zhigang Hua, Qi Xu, Tunyu Zhang, Yi Wang, Ligong Han, Bradley A. Malin, Hao Wang

机构 * Rutgers University(罗格斯大学) Vanderbilt University(范德比尔特大学) Meta

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Dist2ill通过在单次推断中生成多个多样化的推理路径,利用轻量级模块近似置信度分数,实现大语言模型中更准确的不确定性估计。

Comments Preprint; work in progress. Update Log: 05/2025 (v1&v2): Introduced Dist2ill (previously named EUD) for efficient uncertainty estimation, focusing on discriminative reasoning tasks. 02/2026 (v3): Extended Dist2ill to a unified framework supporting both discriminative and generative reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03632 2026-02-04 cs.SE 90%

CALM: A Self-Adaptive Orchestration Approach for QoS-Aware Routing in Small Language Model based Systems

CALM:一种面向服务质量的自适应协调方法,用于基于小型语言模型的系统中路由

Hemang Jain, Divyansh Pandey, Karthik Vaidhyanathan

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);LLM(abstract);SLM(abstract)

AI总结 CALM通过自适应协调机制优化小型语言模型路由,降低延迟和能耗,提升服务质量

Comments Accepted as full paper at SEAMS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04531 2026-02-03 cs.CL cs.AI cs.LG 90%

DP-Fusion: Token-Level Differentially Private Inference for Large Language Models

DP-Fusion: 令牌级差分隐私推理用于大语言模型

Rushil Thareja, Preslav Nakov, Praneeth Vepakomma, Nils Lukas

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(莫扎德·本·泽亚德人工智能大学) Massachusetts Institute of Technology (MIT)(麻省理工学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DP-Fusion通过令牌级差分隐私机制,在保证隐私的同时提升大语言模型的文本质量。

Comments Code: https://github.com/rushil-thareja/dp-fusion-lib | PyPI: https://pypi.org/project/dp-fusion-lib/ | Demo: https://www.documentprivacy.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22307 2026-02-03 cs.LG cs.AI cs.CL cs.CR 90%

SVIP: Towards Verifiable Inference of Open-source Large Language Models

SVIP:面向开源大语言模型的可验证推理

Yifan Sun, Yuhang Li, Yue Zhang, Yuchen Jin, Huan Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Hyperbolic Labs(双曲实验室)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SVIP是一种基于秘密的可验证LLM推理协议,通过计算高效的方法确保计算提供者诚实,实现低误报率和高效验证。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19611 2026-01-28 cs.LG cs.AI cs.CL 90%

Explicit Multi-head Attention for Inter-head Interaction in Large Language Models

显式多头注意力机制用于大语言模型中头间的交互

Runyu Peng, Yunhua Zhou, Demin Song, Kai Lv, Bo Wang, Qipeng Guo, Xipeng Qiu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出显式多头注意力机制,通过显式建模头间交互提升注意力性能,实现更高效的参数利用和内存压缩,同时保持模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07878 2026-01-14 cs.LG cs.AI cs.CL 90%

Sliced-Wasserstein Distribution Alignment Loss Improves the Ultra-Low-Bit Quantization of Large Language Models

切片瓦瑟斯坦分布对齐损失提高了大语言模型的超低比特量化

Deyu Cao, Yixin Yin, Samin Aref

机构 * Department of Information and Communication Engineering, The University of Tokyo(信息与通信工程系,东京大学) Department of Computer Science, University of Toronto(计算机科学系,多伦多大学) Department of Mechanical and Industrial Engineering, University of Toronto(机械与工业工程系,多伦多大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 切片瓦瑟斯坦分布对齐损失通过提升超低比特量化性能,有效恢复模型准确性。

Comments Post-peer-review accepted manuscript, 17 pages including the supplementary information

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07185 2025-12-30 cs.CL cs.AI cs.LG 90%

DySK-Attn: A Framework for Efficient, Real-Time Knowledge Updating in Large Language Models via Dynamic Sparse Knowledge Attention

DySK-Attn:通过动态稀疏知识注意力实现大语言模型高效实时知识更新的框架

Kabir Khan, Priya Sharma, Arjun Mehta, Neha Gupta, Ravi Narayanan

机构 * Department of Computer Science, San Francisco State University, San Francisco, CA 94132, India(计算机科学系,圣何塞州立大学) Department of Computer Science and Engineering, Indian Institute of Technology Bombay, Mumbai 400076, India(印度班加罗尔理工学院计算机科学与工程系) Department of Computer Science and Engineering, Indian Institute of Technology Delhi, New Delhi 110016, India(印度德里理工学院计算机科学与工程系) Department of Computer Science and Automation, Indian Institute of Science, Bengaluru 560012, India(印度班加罗尔科学研究所计算机科学与自动化系) Machine Learning Lab, International Institute of Information Technology Hyderabad (IIIT-H), Hyderabad 500032, India(国际信息科技研究所海得拉巴分所机器学习实验室)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DySK-Attn通过动态稀疏知识注意力机制,实现大语言模型高效实时知识更新,提升事实准确性和计算效率。

Comments Preprint; 7 figures, 3 tables, 1 algorithm; v1. Code and data will be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13334 2025-11-26 cs.CL cs.AI cs.LG 90%

BiasJailbreak:Analyzing Ethical Biases and Jailbreak Vulnerabilities in Large Language Models

BiasJailbreak: 分析大型语言模型中的伦理偏见和 jailbreak 漏洞

Isack Lee, Haebin Seong

机构 * Theori Inc.(Theori公司)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究分析了大型语言模型中的伦理偏见和 jailbreak 漏洞,提出 BiasJailbreak 和 BiasDefense 方法以提高模型安全性。

Comments Accepted as a workshop paper at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18690 2025-11-25 eess.SP 90%

LLM4AMC: Adapting Large Language Models for Adaptive Modulation and Coding

LLM4AMC: 为自适应调制与编码适应大型语言模型

Xinyu Pan, Boxun Liu, Xiang Cheng, Chen Chen

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

AI总结 LLM4AMC利用预训练大型语言模型优化自适应调制与编码,通过改进的网络架构提升信道质量预测精度,从而提升链路性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11624 2025-11-18 cs.DC cs.AI cs.CL cs.LG 90%

Characterizing and Understanding Energy Footprint and Efficiency of Small Language Model on Edges

Md Romyull Islam, Bobin Deng, Nobel Dhar, Tu N. Nguyen, Selena He, Yong Shi, Kun Suo

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Submitted version; 9 pages, 5 figures; presented at IEEE MASS 2025 (online publication pending)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11017 2025-11-17 cs.LG cs.AI cs.CL cs.CV 90%

First-Order Error Matters: Accurate Compensation for Quantized Large Language Models

Xingyu Zheng, Haotong Qin, Yuye Li, Haoran Chu, Jiakai Wang, Jinyang Guo, Michele Magno, Xianglong Liu

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by AAAI 2026. The code is available at https://github.com/Xingyu-Zheng/FOEM

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05314 2025-10-28 cs.CL cs.AI cs.LG 90%

Constrained Entropic Unlearning: A Primal-Dual Framework for Large Language Models

Taha Entesari, Arman Hatami, Rinat Khaziev, Anil Ramakrishna, Mahyar Fazlyab

机构 * Johns Hopkins University(约翰霍普金斯大学) Amazon(亚马逊)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments The Thirty-Ninth Annual Conference on Neural Information Processing Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24293 2025-10-14 cs.LG cs.AI cs.CL 90%

Equivalent Linear Mappings of Large Language Models

James R. Golden

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments title changed; major revisions; code available at https://github.com/jamesgolden1/equivalent-linear-LLMs/; published at https://openreview.net/forum?id=oDWbJsIuEp

Journal ref Transactions on Machine Learning Research (TMLR) (10/2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21613 2025-09-29 cs.CL cs.AI cs.LG cs.MA 90%

Multi-Objective Reinforcement Learning for Large Language Model Optimization: Visionary Perspective

Lingxiao Kong, Cong Yang, Oya Deniz Beyan, Zeyd Boukhers

机构 * Fraunhofer Institute for Applied Information Technology FIT, Germany(弗劳恩霍夫应用信息科技研究所) Soochow University, China(苏州大学) University Hospital of Cologne, Germany(科隆大学医院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 3 pages, 1 figure, accepted by ECAI MODeM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14526 2025-09-19 cs.CL cs.AI cs.LG 90%

Delta Knowledge Distillation for Large Language Models

Yihan Cao, Yanbin Kang, Zhengming Xing, Ruijie Jiang

机构 * LinkedIn Corporation(领英公司)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);SFT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏