arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4771 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 4771 篇

2606.12113 2026-06-11 cs.CL cs.AI 新提交 81%

Augmenting Molecular Language Models with Local $n$-gram Memory

增强分子语言模型的局部 $n$-gram 记忆

Xinni Zhang, Zijing Liu, He Cao, Yu Li, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) International Digital Economy Academy(国际数字经济学院)

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对SMILES字符串的Transformer模型因字符级分词破坏化学语义的问题,提出MolGram模块,通过条件$n$-gram记忆哈希查找注入局部上下文,在三个任务上以更少参数超越基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25085 2026-06-09 cs.IT cs.AI cs.LG math.IT 版本更新 81%

Polynomial Context-Truncation Sensitivity in Autoregressive Language Models: Sequential Wyner-Ziv Bounds for KV Cache Compression

自回归语言模型中的多项式上下文截断敏感性:KV缓存压缩的序列Wyner-Ziv界

Munsik Kim

机构 * Independent Researcher(独立研究者)

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究自回归语言模型中在线KV缓存压缩的率失真极限,将其建模为序列Wyner-Ziv信源编码,发现下一词分布对上下文截断的敏感性呈多项式衰减,并推导了仅后缀缓存策略的每词内存需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05263 2026-06-05 cs.LG cs.AI 81%

Policy-Conditioned Counterfactual Credit for Verifiable Reinforcement Learning of Long-Horizon Language Agents

基于策略条件的反事实信用分配用于长周期语言智能体的可验证强化学习

Renwei Meng

机构 * stu.ahu.edu.cn(安徽大学)

专题命中 长上下文与记忆 :language agent(title,abstract);分类 cs.AI、cs.LG

AI总结 提出CVT-RL算法,通过策略条件反事实贡献估计和可验证奖励约束,解决长周期语言智能体在推理和工具使用中的虚假证据链、信念漂移和捷径行为问题,在多个任务上提升成功率并降低作弊率。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00415 2026-06-02 cs.AI cs.LG 81%

PolarMem: A Training-Free Polarized Latent Graph Memory for Verifiable Vision-Language Models

PolarMem: 一种无需训练的可验证视觉语言模型极化隐式图记忆

Zhisheng Chen, Tingyu Wu, Zijie Zhou, Zhengwei Xie, Jinhan Li, Ziyan Weng, Liang Lin, Jingwei Song, Zikai Xiao, Yingwei Zhang

机构 * ICT, CAS(中国科学院信息科技研究院) UCAS(中国科学院大学) CUPB(中国政法大学) USTC(中国科学技术大学) CityU-DG(城市大学-数据科学) HKU(香港大学) ZJU(浙江大学)

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出PolarMem,一种无需训练的极化隐式图记忆框架,通过语义一致性验证和自适应分布划分将视觉语言模型感知信号转化为HAS、NOT_HAS和Uncertain记忆状态,并采用词典逻辑感知检索协议优先保证逻辑一致性,从而提升检索密集型任务性能并减少矛盾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18657 2026-05-26 cs.LG cs.AI 81%

KairosHope: A Next-Generation Time-Series Foundation Model for Specialized Classification via Dual-Memory Architecture

KairosHope: 一种基于双记忆架构的下一代时间序列基础模型,用于专门分类

Luis Balderas, José Alberto Rodríguez, Miguel Lastra, Antonio Arauzo-Azofra, José M. Benítez

机构 * Department of Computer Science and Artificial Intelligence(计算机科学与人工智能系) DiCITS, iMUDS, DaSCI(DiCITS、iMUDS、DaSCI) University of Granada(格拉纳达大学) Advanced Medical Imaging Group(先进医学成像组) Instituto de Investigación Biosanitaria de Granada (ibs.Granada)(格拉纳达生物医学研究机构(ibs.Granada)) Department of Software Engineering(软件工程系) Department of Rural Engineering(农村工程系) University of Córdoba(科尔多瓦大学)

专题命中 长上下文与记忆 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 针对标准注意力计算瓶颈和经典统计知识缺失问题,提出KairosHope模型,通过双记忆系统(Titans模块和连续记忆系统CMS)替代二次注意力,并融合深度表示与统计特征的混合决策头,在UCR基准上实现优越分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17641 2026-05-19 cs.AI cs.CL 81%

Causal Intervention-Based Memory Selection for Long-Horizon LLM Agents

基于因果干预的记忆选择用于长时域大语言模型智能体

Saksham Sahai Srivastava

机构 * School of Computing, University of Georgia, Athens, Georgia, USA(佐治亚大学计算机学院)

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Causal Memory Intervention(CMI)方法,通过因果推理选择大语言模型的长期记忆,以提高回答质量和鲁棒性,同时引入Causal-LoCoMo基准数据集进行评估。

Comments 12 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10643 2026-05-12 cs.CL cs.LG 81%

A Single-Layer Model Can Do Language Modeling

单层模型也能进行语言建模

Zanmin Wang

机构 * Proton

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出单层接地预测网络GPN,通过单个递归模块实现语言建模,实验表明其在参数量为1.3亿时达到FineWeb-Edu的18.06 perplexity,接近深度模型表现。

Comments 9 pages, 5 figures, 1 table. Code: https://github.com/steve-z-wang/grounded-prediction-network

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09315 2026-05-12 cs.AI cs.CL 81%

Do Self-Evolving Agents Forget? Capability Degradation and Preservation in Lifelong LLM Agent Adaptation

自我进化代理会遗忘吗?在终身大语言模型代理适应中的能力退化与保持

Ye Yu, Xiaopeng Yuan, Haibo Jin, Heming Liu, Yaoning Yu, Haohan Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了自我进化过程中能力退化现象,提出能力保持进化原则,通过四种进化维度提升能力稳定性与适应性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24715 2026-04-28 cs.CL cs.LG 81%

Long-Context Aware Upcycling: A New Frontier for Hybrid LLM Scaling

长上下文意识的升级:混合大语言模型扩展的新前沿

Parsa Ashrafi Fashi, Utkarsh Saxena, Mehdi Rezagholizadeh, Aref Jafari, Akash Haridas, Mingyu Yang, Vansh Bhatia, Guihong Li, Vikram Appia, Emad Barsoum

机构 * AMD

专题命中 长上下文与记忆 :LLM(title);post-training(abstract);分类 cs.CL、cs.LG

AI总结 本文提出HyLo方法,通过架构适应与高效Transformer块结合,提升长上下文能力,实现上下文长度扩展32倍,内存消耗降低90%,在混合架构中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21768 2026-04-28 cs.LG cs.AI 81%

Extending Precipitation Nowcasting Horizons via Spectral Fusion of Radar Observations and Foundation Model Priors

通过雷达观测与基础模型先验的频谱融合扩展降水现在预报时间范围

Yuze Qin, Qingyong Li, Zhiqing Guo, Wen Wang, Yan Liu, Yangli-ao Geng

机构 * 1 Key Laboratory of Big Data \& Artificial Intelligence in Transportation (Ministry of Education), Beijing Jiaotong University, Beijing, China 2 CMA Key Laboratory of Transportation Meteorology, Nanjing Innovation Institute for Atmospheric Sciences, Nanjing, China

专题命中 长上下文与记忆 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出PW-FouCast框架,通过频谱融合雷达数据与气象先验,解决雷达图像与气象数据表示差异问题,提升降水预报可靠性与时间范围。

Comments Accepted by IJCNN 2026. Code is available at https://github.com/Onemissed/PW-FouCast

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16428 2026-04-21 cs.LG cs.AI stat.ML 81%

Non-Stationarity in the Embedding Space of Time Series Foundation Models

时间序列基础模型嵌入空间中的非平稳性

Jinmyeong Choi, Brad Shook, Artur Dubrawski

机构 * Auton Lab(自动化实验室) Robotics Institute(机器人研究所) Carnegie Mellon University(卡内基梅隆大学)

专题命中 长上下文与记忆 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究时间序列基础模型嵌入空间中非平稳性的检测方法,分析不同分布非平稳性和时间非平稳性对模型检测能力的影响。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12056 2026-04-15 cs.CL cs.LG 81%

LoSA: Locality Aware Sparse Attention for Block-Wise Diffusion Language Models

LoSA:基于块状扩散语言模型的局部意识稀疏注意力

Haocheng Xi, Harman Singh, Yuezhou Hu, Coleman Hooper, Rishabh Tiwari, Aditya Tomar, Minjae Lee, Wonjun Kang, Michael Mahoney, Chenfeng Xu, Kurt Keutzer, Amir Gholami

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 LoSA通过局部意识稀疏注意力机制,针对块状扩散语言模型中的KV膨胀问题,优化注意力计算,提升效率和精度,实现更高的准确率和速度。

Comments 16 pages, 11 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04144 2026-04-13 cs.CL cs.AI 81%

Many Preferences, Few Policies: Towards Scalable Language Model Personalization

多种偏好,少数政策:迈向可扩展的语言模型个性化

Cheol Woo Kim, Jai Moondra, Roozbeh Nahavandi, Andrew Perrault, Milind Tambe, Swati Gupta

机构 * Harvard University(哈佛大学) Carnegie Mellon University(卡内基梅隆大学) The Ohio State University(俄亥俄州立大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 长上下文与记忆 :language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PALM方法,通过多维权重向量建模用户偏好,生成小规模LLM组合以实现个性化,理论保证了规模和近似质量的平衡。

Comments Fixed typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03263 2026-04-11 cs.CL cs.AI cs.NE 81%

LPC-SM: Local Predictive Coding and Sparse Memory for Long-Context Language Modeling

LPC-SM:局部预测编码与稀疏记忆用于长上下文语言建模

Keqin Xie

机构 * Independent Researcher, Suzhou, China(独立研究者,苏州,中国)

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出LPC-SM架构,通过分离局部注意力、持久记忆、预测修正和运行时控制,改进长上下文语言模型的性能,实验显示其在不同任务中均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04300 2026-04-07 cs.CL cs.LG 81%

High-Stakes Personalization: Rethinking LLM Customization for Individual Investor Decision-Making

高风险个性化:重新思考面向个人投资者决策的LLM定制

Yash Ganpat Sawant

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.CL、cs.LG

AI总结 本文探讨了在高风险、长期决策领域中,LLM个性化面临的核心挑战,包括行为记忆复杂性、主题一致性、风格信号张力及无地面真相的对齐问题,并提出相应的架构改进方向。

Comments 4 pages + 1 page references. Submitted to CustomNLP4U Workshop @ ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03537 2026-04-07 cs.CL cs.LG 81%

Rethinking Token Prediction: Tree-Structured Diffusion Language Model

重新思考标记预测:树结构扩散语言模型

Zihao Wu, Haoming Yang, Juncheng Dong, Vahid Tarokh

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出树结构扩散语言模型,通过利用标记间的内在结构,减少参数和内存使用,实现在有限资源下提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01350 2026-04-03 cs.CL cs.AI cs.CR 81%

No Attacker Needed: Unintentional Cross-User Contamination in Shared-State LLM Agents

无需攻击者:共享状态LLM代理中的无意跨用户污染

Tiankai Yang, Jiate Li, Yi Nian, Shen Dong, Ruiyao Xu, Ryan Rossi, Kaize Ding, Yue Zhao

机构 * University of Southern California(南加州大学) Michigan State University(密歇根州立大学) Northwestern University(西北大学) Adobe Research(Adobe研究院)

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 研究揭示共享状态LLM代理中因局部有效信息被错误应用导致的跨用户污染问题,提出三种污染类型并评估两种机制,发现需在文本级清洗外增加 artifact 级防护以防止静默失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00009 2026-04-02 cs.CL cs.AI 81%

Eyla: Toward an Identity-Anchored LLM Architecture with Integrated Biological Priors -- Vision, Implementation Attempt, and Lessons from AI-Assisted Development

Eyla:迈向具有集成生物先验的LLM架构——视觉、实现尝试及AI辅助开发的教训

Arif Aditto

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 Eyla提出一种以身份为基础的LLM架构,整合生物启发子系统,通过AI辅助开发的失败分析,揭示了AI辅助软件工程中的系统性失效模式。

Comments 8 pages, 3 tables, 25 references. Preprint under review for workshop submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15634 2026-03-18 cs.AI cs.IR cs.LG 81%

NextMem: Towards Latent Factual Memory for LLM-based Agents

NextMem: 向基于大语言模型的智能体构建潜在事实记忆

Zeyu Zhang, Rui Li, Xiaoyan Zhao, Yang Zhang, Wenjie Wang, Xu Chen, Tat-Seng Chua

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 NextMem提出一种基于自回归自编码器的潜在事实记忆框架,通过两阶段训练和量化技术提升记忆构建效率与准确性,在检索、鲁棒性和扩展性方面表现优异。

Comments 17 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14588 2026-03-17 cs.AI cs.IR cs.LG 81%

SuperLocalMemory V3: Information-Geometric Foundations for Zero-LLM Enterprise Agent Memory

SuperLocalMemory V3:信息几何基础用于零LLM企业代理记忆

Varun Pratap Bhardwaj

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于信息几何的零LLM企业代理记忆系统,通过信息几何度量、黎曼流形动力学和细胞sheaf模型,提升记忆检索与一致性,实验显示在LoCoMo基准上性能提升显著。

Comments 43 pages, 5 figures, 9 tables, 3 appendices. Code: https://github.com/qualixar/superlocalmemory. Zenodo DOI: 10.5281/zenodo.19038659

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04549 2026-03-06 cs.AI cs.CL cs.MA 81%

Adaptive Memory Admission Control for LLM Agents

自适应记忆准入控制用于大语言模型代理

Guilin Zhang, Wei Jiang, Xiejiashan Wang, Aisha Behr, Kai Zhao, Jeffrey Friedman, Xu Chu, Amine Anoun

机构 * Workday AI

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 提出自适应记忆准入控制框架,通过分解记忆价值因素提升大语言模型代理的长期记忆管理效率与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10729 2026-03-03 cs.AI cs.LG cs.PF 81%

OrbitFlow: SLO-Aware Long-Context LLM Serving with Fine-Grained KV Cache Reconfiguration

OrbitFlow: 带有SLO意识的长上下文LLM服务与细粒度KV缓存重新配置

Xinyue Ma, Heelim Hong, Taegeon Um, Jongseop Lee, Seoyeong Choy, Woo-Yeon Lee, Myeongjae Jeon

机构 * Samsung Research(三星研究院)

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 OrbitFlow通过细粒度KV缓存管理,提高了长上下文LLM服务的SLO达成率和吞吐量,减少了延迟。

Comments Accepted at the 52nd International Conference on Very Large Data Bases (VLDB 2026). Xinyue Ma and Heelim Hong contributed equally (co-first authors)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19657 2026-02-24 cs.CL cs.AI 81%

One Token Is Enough: Improving Diffusion Language Models with a Sink Token

一个标记足矣:通过sink标记改进扩散语言模型

Zihou Zhang, Zheyong Xie, Li Zhong, Haifeng Liu, Yao Hu, Shaosheng Cao

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 通过引入额外的sink标记,改进扩散语言模型的稳定性与性能,该标记具有低语义内容且位置无关,提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16054 2026-02-19 cs.CL cs.LG 81%

CLAA: Cross-Layer Attention Aggregation for Accelerating LLM Prefill

CLAA: 跨层注意力聚合用于加速大语言模型预填

Bradley McDanel, Steven Li, Harshit Khaitan

机构 * Franklin and Marshall College(弗兰克林与马歇尔学院) Meta Reality Labs(Meta现实实验室)

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.CL、cs.LG

AI总结 CLAA通过跨层聚合注意力分数,提升大语言模型预填阶段的推理速度,将TTFT降低至39%。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14770 2026-02-18 cs.CL cs.AI cs.CY cs.HC 81%

Multi-Agent Comedy Club: Investigating Community Discussion Effects on LLM Humor Generation

多智能体喜剧俱乐部:探究社区讨论对LLM幽默生成的影响

Shiwei Hong, Lingyao Li, Ethan Z. Rong, Chenxinran Shen, Zhicong Lu

机构 * George Mason University(乔治·马歇尔大学) University of South Florida(佛罗里达州立大学) University of Toronto(多伦多大学)

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究通过多智能体实验探讨社区讨论对LLM生成幽默的影响,发现讨论条件在Craft/Clarity和社会反应指标上显著优于基线条件。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05430 2026-02-06 cs.AI cs.LG 81%

Day-Ahead Electricity Price Forecasting for Volatile Markets Using Foundation Models with Regularization Strategy

利用正则化策略的基础模型进行日提前电力价格预测

Kritchanat Ponyuenyong, Pengyu Tu, Jia Wei Tan, Wei Soon Cheong, Jamie Ng Suat Ling, Lianlian Jiang

专题命中 长上下文与记忆 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种正则化策略,利用基础模型在波动市场中提升电力价格预测的准确性。

Comments Accepted to AI4TS Workshop @ AAAI'26 (Oral and Poster), see https://ai4ts.github.io/aaai2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11007 2026-02-06 cs.CV cs.AI cs.LG 81%

VisMem: Latent Vision Memory Unlocks Potential of Vision-Language Models

VisMem: 通过潜在视觉记忆解锁视觉-语言模型的潜力

Xinlei Yu, Chengming Xu, Guibin Zhang, Zhangquan Chen, Yudong Zhang, Yongbo He, Peng-Tao Jiang, Jiangning Zhang, Xiaobin Hu, Shuicheng Yan

机构 * National University of Singapore(新加坡国立大学) Fudan University(复旦大学) Tsinghua University(清华大学) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) vivo

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 VisMem通过引入动态潜在视觉记忆模块,提升视觉-语言模型在复杂视觉任务中的性能,实现感知准确性和语义一致性之间的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15124 2026-01-27 cs.LG cs.AI 81%

RAG-GFM: Overcoming In-Memory Bottlenecks in Graph Foundation Models via Retrieval-Augmented Generation

RAG-GFM:通过检索增强生成克服图基础模型中的内存瓶颈

Haonan Yuan, Qingyun Sun, Jiacheng Tao, Xingcheng Fu, Jianxin Li

机构 * SKLCCSE, School of Computer Science and Engineering(计算机科学与工程学院) Beihang University(北航) Guangxi Normal University(广西师范大学)

专题命中 长上下文与记忆 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 RAG-GFM通过检索增强生成方法,解决图基础模型中的内存瓶颈问题,提升模型的效率和效果。

Comments Accepted by the Web Conference 2026 (Research Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01747 2026-01-23 cs.CR cs.AI cs.CV cs.LG 81%

Crafting Adversarial Inputs for Large Vision-Language Models Using Black-Box Optimization

为大型视觉-语言模型设计对抗输入使用黑盒优化

Jiwei Guan, Haibo Jin, Haohan Wang

机构 * School of Computing, Macquarie University(麦考瑞大学计算机学院) School of Information Sciences, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校信息科学学院)

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于零阶优化的黑盒劫持攻击方法,针对大型视觉-语言模型实现高成功率的对抗性攻击,揭示了当前模型安全机制的不足。

Comments EACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08215 2026-01-14 cs.CL cs.LG 81%

Towards Principled Design of Mixture-of-Experts Language Models under Memory and Inference Constraints

面向内存和推理约束下混合专家语言模型的原理性设计

Seng Pei Liew, Kenta Shinzato, Yuyang Dong

机构 * SB Intuitions

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出基于内存和推理约束的混合专家语言模型设计原则,通过系统研究揭示性能主要由总参数和专家稀疏性决定,并提出优化方法指导架构设计。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏