arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-16 至 2026-06-16 共收录 644 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 126 篇

2606.15333 2026-06-16 cs.CL cs.LG 新提交 90%

Replay What Matters: Off-Policy Replay for Efficient LLM Reinforcement Unlearning

重放重要内容:面向高效LLM强化反学习的离策略重放

Zirui Pang, Chenlong Zhang, Haosheng Tan, Zhuoran Jin, Jiaheng Wei, Zixin Zhong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Glasgow(格拉斯哥大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 针对LLM反学习中在线策略优化对困难样本利用不足的问题,提出ReRULE方法,通过离策略重放缓冲区存储并复用低奖励困难样本,在保持通用性的同时提升反学习效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17106 2026-06-16 cs.CL cs.LG 版本更新 90%

HyDRA: Hybrid Dynamic Routing Architecture for Heterogeneous LLM Pools

HyDRA:异构LLM池的混合动态路由架构

Aashna Garg, Siddharth Singha Roy, Jinu Jang, Federico Brancasi, Shengyu Fu

机构 * Microsoft(微软)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 本文提出HyDRA,一种能够根据查询预测细粒度多维能力需求并匹配配置定义模型配置的混合动态路由架构,实现了在异构LLM池中高效且无需重新训练的模型选择。

Comments preprint v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05163 2026-06-16 cs.CL cs.LG 版本更新 90%

Enhancing LLM Safety Through a Theoretical Minimax Game Lens

通过理论极小极大博弈视角增强LLM安全性

Yihe Deng, Yu Yang, Junkai Zhang, Wei Wang, Bo Li

机构 * University of California, Los Angeles(加州大学洛杉矶分校) VirtueAI University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出极小极大强化学习框架,通过数据生成器与分类器协同进化生成高质量多语言安全数据,理论证明收敛到纳什均衡,使小模型在英文基准上超越SOTA近10%且推理速度提升4.5倍。

Comments 24 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00887 2026-06-16 cs.CL cs.AI cs.LG 版本更新 90%

EffGen: Enabling Small Language Models as Capable Autonomous Agents

EffGen: 使小型语言模型成为能干的自主智能体

Gaurav Srivastava, Aafiya Hussain, Chi Wang, Yingyan Celine Lin, Xuan Wang

机构 * Department of Computer Science, Virginia Tech, Blacksburg, VA, USA(弗吉尼亚理工大学计算机科学系) Georgia Institute of Technology, Atlanta, GA, USA(佐治亚理工学院) Google DeepMind, USA(谷歌DeepMind)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 EffGen是一个针对小型语言模型优化的开源智能体框架,通过提示压缩、任务分解、复杂度路由和统一记忆系统,实现高效、安全的本地部署,在13个基准测试中优于LangChain等框架。

Comments Accepted to ICML 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16813 2026-06-16 cs.AI 新提交 90%

GIST-CMTF: Goal-State Inference for Causal Minimal Tool Filtering in LLM Agents

GIST-CMTF:LLM代理中因果最小工具过滤的目标状态推断

Rahul Suresh Babu, Rohit Shukla

机构 * Rahul Suresh Babu Rohit Shukla

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 提出GIST-CMTF层,通过预测候选符号目标状态并估计歧义性,解决工具增强LLM代理因用户请求多义性导致的错误目标执行问题,在120个任务上达到97.0%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16332 2026-06-16 cs.DC cs.AI cs.PF 新提交 90%

SMEPilot: Characterizing and Optimizing LLM Inference with Scalable Matrix Extensions

SMEPilot: 利用可扩展矩阵扩展表征和优化LLM推理

Feiyang Chen, Haibo Chen

机构 * IPADS, Shanghai Jiao Tong University(上海交通大学IPADS)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 针对CPU矩阵扩展单元与核心在LLM推理中的不匹配,提出SMEPilot引擎,通过基于屋顶线的表征指导算子执行选择,实现SME与CPU协同工作,端到端性能提升达3.94倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06302 2026-06-16 cs.LG cs.SE 版本更新 90%

Tangram: Unlocking Non-Uniform KV Cache Compression for Efficient Multi-turn LLM Serving

Tangram: 解锁非均匀KV缓存以实现高效的多轮LLM服务

Hyungmin Kim, Minsoo Kim, Hongseok Kim, Jungwook Choi

机构 * Hanyang University(翰林大学) Rebellions Republic of Korea(Rebellions)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 针对多轮LLM服务中KV缓存线性增长导致的GPU内存和带宽压力,提出Tangram系统,通过确定性预算分配、头组页面和提前负载均衡三项技术实现非均匀KV缓存的高效管理,吞吐量提升达2.6倍。

Comments 13 pages. 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04547 2026-06-16 cs.IR cs.CL 版本更新 90%

Beyond Retrieval: Learning Compact User Representations for Scalable LLM Personalization

超越检索:学习紧凑用户表示以实现可扩展的LLM个性化

Heng Cao, Fan Zhang, Jian Yao, Yujie Zheng, Changlin Zhao, Lu Hao, Yuxuan Wei, Wangze Ni, Huaiyu Fu, Yuqian Sun, Xuyan Mo

机构 * Microsoft(微软公司) Shanghai International Studies University(上海国际问题研究大学) Zhejiang University(浙江大学) Department of Data Science and Artificial Intelligence, The Hong Kong Polytechnic University(数据科学与人工智能系,香港理工大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出TAP-PER框架,通过可学习的用户状态前缀嵌入编码用户偏好,避免显式提示构建和繁重的每用户适配器,在六个LaMP任务上优于基线方法,并显著减少参数开销。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09309 2026-06-16 cs.AI 版本更新 90%

Rescaling Confidence: What Scale Design Reveals About LLM Metacognition

重新缩放置信度:量表设计揭示LLM元认知

Yuyang Dai, Yuxia Wang

机构 * INSAIT, Sofia University "St. Kliment Ohridski"(INSAIT,索菲亚大学‘圣克莱门特·欧里德斯基’)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 研究LLM口头置信度受量表设计影响,发现0-20量表比标准0-100量表更有效提升元认知效率。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02908 2026-06-16 cs.LG cs.DC 版本更新 90%

Photon: Federated LLM Pre-Training

Photon: 联邦大语言模型预训练

Lorenzo Sani, Alex Iacob, Zeyu Cao, Royson Lee, Bill Marino, Yan Gao, Dongqi Cai, Zexi Li, Wanru Zhao, Xinchi Qiu, Nicholas D. Lane

机构 * University of Cambridge(剑桥大学) Flower Labs(Flower实验室) Zhejiang University(浙江大学)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出Photon系统,首次实现联邦端到端LLM预训练,通过跨孤岛联邦学习在弱连接GPU上训练高达7B参数模型,通信量减少64-512倍,收敛速度比DiLoCo快2倍。

Comments 18 pages, 9 appendix pages, 12 figures, 3 algorithms, 12 tables

Journal ref Proceedings of Machine Learning and Systems 7 (MLSys 2025), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16515 2026-06-16 cs.CL cs.CR 90%

LLM-based Privacy Data Augmentation Guided by Knowledge Distillation with a Distribution Tutor for Medical Text Classification

基于知识蒸馏和分布导师的LLM隐私数据增强方法用于医学文本分类

Yiping Song, Juhua Zhang, Zhiliang Tian, Yuxin Yang, Minlie Huang, Dongsheng Li

机构 * College of Science, National University of Defense Technology, Hunan, China(国防科技大学科学学院,湖南,中国) College of Computer, National University of Defense Technology, Hunan, China(国防科技大学计算机学院,湖南,中国) The CoAI Group, DCST, BNRist, Tsinghua University, Beijing(清华大学北京人工智能研究院,北京)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL

AI总结 本文提出一种结合LLM和知识蒸馏的隐私数据增强方法,通过分布导师控制生成分布,提升医学文本分类的隐私保护与性能。

Journal ref Neural Networks, Vol. 199, 2026, 108668

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16264 2026-06-16 cs.DC 新提交 89%

Tropical: Enhancing SLO Attainment in Disaggregated LLM Serving via SLO-Aware Multiplexing

Tropical: 通过SLO感知的多路复用提升解聚式LLM服务中的SLO达成率

Jinming Ma, Jiefei Chen, Xiuhong Li, Jiangfei Duan, Haojie Duanmu, Xingcheng Zhang, Chao Yang, Dahua Lin

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出Tropical系统,通过SLO感知的多路复用策略平衡排队时间和干扰,同时满足预填充和解码阶段的延迟约束,在真实数据集上相比现有系统提升高达2.09倍的请求数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06694 2026-06-16 cs.LG 版本更新 89%

NanoQuant: Efficient Sub-1-Bit Quantization of Large Language Models

NanoQuant: 大型语言模型高效子1位量化

Hyochan Chong, Dongkyu Kim, Changdong Kim, Minseop Choi

机构 * KAIST(韩国科学技术院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.LG

AI总结 本文提出NanoQuant,一种新型后训练量化方法,能够将大型语言模型压缩到二进制和子1位水平,通过低秩二进制分解问题实现高效压缩,并在消费者硬件上实现大规模部署。

Comments Accepted to ICML 2026. Hyochan Chong and Dongkyu Kim contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11418 2026-06-16 cs.CL 版本更新 89%

CentroidKV: Efficient Long-Context LLM Inference via KV Cache Clustering

CentroidKV: 通过KV缓存聚类实现高效的长上下文LLM推理

Jie Hu, Shengnan Wang, Yutong He, Ping Gong, Jiawei Yi, Juncheng Zhang, Youhui Bai, Renhai Chen, Gong Zhang, Cheng Li, Kun Yuan

机构 * Peking University(北京大学) Huawei Technologies(华为技术有限公司) University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出CentroidKV框架,通过在线聚类KV缓存减少内存占用,在保持性能的同时实现高达75%的缓存压缩和1.92倍解码加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16825 2026-06-16 cs.CL cs.AI cs.LG 新提交 88%

Tying the Loop -- Tied Expert Layers in Mixture-of-Experts Language Models

循环绑定——混合专家语言模型中的专家层绑定

Martin Jaggi

机构 * EPFL(瑞士联邦理工学院洛桑)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);pretraining(abstract)

AI总结 提出专家绑定方法,通过共享连续Transformer层的专家参数,在保持独立路由和注意力的同时,将MoE模型内存占用降低近2倍,且不损失困惑度或下游性能。

Comments Code available at https://github.com/epfml/looped-moe

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02955 2026-06-16 cs.CL cs.AI cs.LG 版本更新 88%

Fast-dLLM++: Fréchet Profile Decoding for Faster Diffusion LLM Inference

Fast-dLLM++: 用于更快扩散LLM推理的Fréchet轮廓解码

Siva Rajesh Kasa, Yasong Dai, Sumit Negi, Hongdong Li

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对扩散大语言模型推理中并行令牌生成的瓶颈,提出Fréchet轮廓解码方法,通过利用异构置信度轮廓选择并行提交集,在保持模型和缓存不变的情况下提升吞吐量。

Comments Initial version accepted at Workshop on Structured Probabilistic Inference & Generative Modeling, ICML 2026. Project Page: https://ringo-star.github.io/projectpage_frechet/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15044 2026-06-16 cs.CL 新提交 88%

Equity with Efficiency: An Empirical Study of Tokenizers for Multilingual Large Language Models

公平与效率:多语言大语言模型分词器的实证研究

Kieron Seven Jun Wei Lee, Muhammad Reza Qorib, Andrew Ivan Soegeng, Hwee Tou Ng

机构 * National University of Singapore(新加坡国立大学) Carnegie Mellon University(卡内基梅隆大学) SAP

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文系统比较了11种东南亚语言上的公平分词器,发现Parity-aware BPE在效率与公平的权衡中处于帕累托前沿,而Morphology-Driven Byte Encoding在语义推理上表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22420 2026-06-16 cs.DC cs.AI 版本更新 88%

Nightjar: Dynamic Adaptive Speculative Decoding for Large Language Models Serving

Nightjar: 面向大语言模型服务的动态自适应推测解码

Rui Li, Zhaoning Zhang, Libo Zhang, Huaimin Wang, Xiang Fu, Zhiquan Lai

机构 * State Key Laboratory of Complex & Critical Software Environment, National Key Laboratory of Parallel and Distributed Computing, College of Computer Science and Technology, National University of Defense Technology(复杂与关键软件环境国家重点实验室、平行与分布式计算国家实验室、计算机科学与技术学院、国防科技大学)

专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出Nightjar框架,通过动态调整推测长度和主动禁用推测解码,在高低负载下优化吞吐量,最高提升14.76%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15576 2026-06-16 cs.LG cs.AI 新提交 88%

Localizing Credit at the Divergence: Path-Conditioned Self-Distillation for LLM Reasoning

在分歧处定位信用:路径条件自蒸馏用于LLM推理

Yu Li, Shu Hong, Tian Lan

机构 * Department of Electrical and Computer Engineering, George Washington University(乔治华盛顿大学电气与计算机工程系)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出Hindsight Self-Distillation (HSD)方法,通过将教师模型条件于当前训练组中的成功同伴轨迹,在失败与成功轨迹的分歧处提供密集信用信号,提升LLM在数学和代码推理任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15555 2026-06-16 math.OC cs.AI cs.LG stat.ML 新提交 88%

Service-Induced Congestion in Memory-Constrained LLM Serving

内存受限的大语言模型服务中的服务引发拥塞

Ruicheng Ao, Jing Dong, Gan Luo, David Simchi-Levi

机构 * Institute for Data, Systems, and Society, Massachusetts Institute of Technology(数据、系统与社会研究所,麻省理工学院) Columbia Business School, Columbia University(哥伦比亚大学商学院) School of Mathematical Sciences, Peking University(北京大学数学科学学院)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过离散时间动力学模型研究内存受限的大语言模型服务中,因键值缓存增长导致的服务引发拥塞,发现同质负载下无驱逐均衡不稳定且收敛到最坏情况极限环,异质负载下稳定条件与解码长度互质相关,并提出调度设计原则。

Comments 101 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16067 2026-06-16 cs.CV 新提交 88%

Stepwise Token Selection for Efficient Multimodal Large Language Models

逐步令牌选择用于高效多模态大语言模型

Landi He, Shawn Young, Lijian Xu

机构 * Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 提出一种基于指针机制的逐步视觉令牌选择方法,通过可微松弛实现端到端训练,动态决定保留令牌数量,在去除88.9%令牌时保持94.6%准确率并加速1.88倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14788 2026-06-16 cs.SD cs.AI cs.LG eess.AS 新提交 87%

Unifying Acoustic Features and Text with Multimodal LLMs for Neurodegenerative Screening

统一声学特征与文本的多模态大语言模型用于神经退行性疾病筛查

Qingfeng Zhang, Yuanxiong Guo, Yanmin Gong

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出NeurMLLM框架,通过多模态大语言模型融合声谱图、MFCC和文本,实现阿尔茨海默病和帕金森病的精细分期,优于传统方法和现有LLM方法。

Comments IEEE International Conference on Healthcare Informatics, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16824 2026-06-16 cs.DC cs.OS 新提交 87%

CacheWise: Understanding Workloads and Optimizing KVCache Management for Efficiently Serving LLM Coding Agents

CacheWise:理解工作负载并优化KVCache管理以高效服务LLM编码代理

Shubham Tiwari, Tapan Chugh, Nash Rickert, Simon Peter, Ratul Mahajan, Haiying Shen

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 针对编码代理会话中大量前缀复用导致KVCache压力的问题,提出CacheWise管理层,结合前缀感知调度和基于工具调用元数据的轻量级预测驱逐策略,减少KVCache驱逐并提升会话完成时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16135 2026-06-16 cs.DC 新提交 87%

SwiftCache: Efficient LLM Serving for Multi-turn Conversations with Heterogeneous KV Cache Sharing

SwiftCache: 面向多轮对话的高效LLM服务与异构KV缓存共享

Jianmin Hu, Minxian Xu, Sa Wang, Chong Ma, Min Shen, Kejiang Ye, Lin Qu, Chengzhong Xu

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 针对多轮对话中KV缓存占用显存导致推理延迟高、上下文受限的问题,提出SwiftCache系统,通过异构模型间共享空闲GPU内存和NVLink带宽,仅保留当前层KV缓存,降低延迟并扩展上下文长度。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15177 2026-06-16 cs.DC 新提交 87%

Coordinated Scheduling for MoE LLM Serving

MoE大语言模型服务的协调调度

Yifan Sun, Zhexiang Zhang, Jiantong Jiang, Gholamreza Haffari, Minxian Xu, Feng Liu, Rajkumar Buyya, Adel N. Toosi

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 提出Gimbal,一种跨层协调调度系统,通过细粒度DP引擎调度和专家负载均衡,减少平均TTFT 42.9%和TPOT 33.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05299 2026-06-16 cs.LG cs.AI cs.CL cs.SD 版本更新 87%

WavSLM: Single-Stream Speech Language Modeling via WavLM Distillation

WavSLM: 通过WavLM蒸馏的单流语音语言建模

Luca Della Libera, Cem Subakan, Mirco Ravanelli

机构 * Concordia University(康科迪亚大学) Mila-Quebec AI Institute(蒙特利尔AI研究所) Université Laval(拉瓦尔大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出WavSLM,通过量化蒸馏WavLM自监督表示到单一码本并优化自回归下一块预测,实现无文本监督的单流语音语言建模,在一致性和生成任务上表现竞争。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15076 2026-06-16 cs.DC 新提交 86%

A RAG-Enhanced Bi-Level Cognitive Orchestration Framework for LEO Satellite Networks

一种面向LEO卫星网络的RAG增强双层认知编排框架

Yuhong Jiang, Zhishu Shen, Tong Yin, Qiushi Zheng, Yichao Jin, Fidan Mehmeti, Jiong Jin

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 针对LEO卫星网络中资源碎片化问题,提出RAG增强的双层认知编排框架,上层LLM利用离线专家知识库动态推断偏好权重,下层遗传调度器计算路由与任务卸载方案,在Walker-Delta网络测试中丢包率降低30.7%,能效提升30%,端到端时延降低8.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15008 2026-06-16 cs.CR 新提交 86%

Security Engineering of OpenClaw: Analyzing Attack Surface Expansion and Trust-Boundary Violations

OpenClaw的安全工程:分析攻击面扩展与信任边界违反

Saeid Jamshidi, Arghavan Moradi Dakhel, Kawser Wazed Nafi, Foutse Khomh

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文分析多智能体LLM系统OpenClaw中攻击面扩展与信任边界违反,发现输出聚合导致妥协概率从0.24升至0.86,防御控制可显著降低风险但影响效用与延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16461 2026-06-16 cs.LG 新提交 85%

Privacy from Symmetry: Orthogonally Equivariant Transformers for LLM Inference

对称性带来的隐私:用于大语言模型推理的正交等变Transformer

Alexander Yukhimchuk, Andrey Shulga, Mladen Kolar, Martin Takáč

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) University of Southern California(南加州大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对拆分推理中隐藏表示易被近邻搜索恢复的问题,提出正交混淆方法,并设计ConjFormer架构实现O(d)-等变性,在不加噪声或重加密下将令牌恢复率从35%降至1.3%,困惑度仅增0.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16383 2026-06-16 cs.CL 新提交 85%

Surpassing Scale by Efficiency: A Compact 135M Parameter Foundational LLM Natively Adapted for the Bangla Language

通过效率超越规模:一个紧凑的135M参数基础LLM原生适配孟加拉语

Rabindra Nath Nandi

机构 * Independent Researcher(独立研究者)

专题命中 效率与部署 :LLM(title,title_cn);language model(abstract);分类 cs.CL

AI总结 提出一个135M参数的紧凑型解码器模型bangla-smollm-135m,通过确定性交集-追加词元合并策略解决孟加拉语子词碎片化,在零样本多任务基准上匹配或超越两倍大小模型。

Comments Submitted to a Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏