arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-17 至 2026-04-17 共收录 297 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 48 篇

2604.05158 2026-04-17 cs.CL 86%

Just Pass Twice: Efficient Token Classification with LLMs for Zero-Shot NER

只需两次通过:利用LLM进行零样本命名实体识别的高效标记分类

Ahmed Ewais, Ahmed Hashish, Amr Ali

机构 * WitnessAI

专题命中 效率与部署 :LLM(title_cn,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出JPT方法,通过两次输入拼接实现双向上下文的标记分类,提升零样本NER性能,比现有方法快20倍,F1得分提升7.9%。

Comments 16 pages, 9 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20151 2026-04-17 cs.CL 86%

BoundRL: Efficient Structured Text Segmentation through Reinforced Boundary Generation

BoundRL: 通过强化边界生成实现高效的结构化文本分段

Haoyuan Li, Zhengyuan Shen, Sullam Jeoung, Yueyan Chen, Jiayu Li, Qi Zhu, Shuai Wang, Vassilis Ioannidis, Huzefa Rangwala

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Amazon Web Services(亚马逊网络服务)

专题命中 效率与部署 :SFT(abstract,abstract_cn);LLM(abstract);language model(abstract);small language model(abstract)

AI总结 本文提出BoundRL,一种高效处理长结构化文本的分段与标签预测方法,通过强化学习优化文档重建和语义对齐,减少输出token并降低幻觉风险,实验证明其在复杂提示下优于其他基线方法。

Comments accepted by ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03341 2026-04-17 cs.AI 85%

What Deserves Memory: Adaptive Memory Distillation for LLM Agents

哪些信息值得记忆:面向大语言模型代理的自适应记忆蒸馏

Wenquan Ma, Jiayan Nan, Wenlong Wu, Yize Chen

机构 * Fudan University(复旦大学) Shanda Group(上海莎anda集团) Beihang University(北航) Shanghai University of Finance and Economics(上海财经大学)

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.AI

AI总结 本文提出NEMORI框架,通过预测性来评估经验的未来效用,实现自适应记忆蒸馏,提升LLM代理的记忆性能与存储效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14210 2026-04-17 cs.CL cs.SE 84%

Chinese Language Is Not More Efficient Than English in Vibe Coding: A Preliminary Study on Token Cost and Problem-Solving Rate

中文并非在 vibe 编码中比英语更高效:关于 token 成本和问题解决率的初步研究

Simiao Ren, Xingyu Shen, Yuchen Zhou, Dennis, Ng, Ankit Raj

专题命中 效率与部署 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.CL

AI总结 本文通过 SWE-bench Lite 评估中文在 LLM 编码任务中的 token 效率,发现中文并无效率优势,且成功率低于英语,提示语言切换未必带来成本节约。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14885 2026-04-17 cs.CL cs.AI 82%

RACER: Retrieval-Augmented Contextual Rapid Speculative Decoding

RACER:检索增强的上下文快速推测解码

Zihong Zhang, Zuchao Li, Lefei Zhang, Ping Wang, Hai Zhao

机构 * School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) School of Computer Science, Wuhan University(武汉大学计算机学院) School of Information Management, Wuhan University(武汉大学信息管理学院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机学院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 RACER通过整合检索的精确模式与logit驱动的未来提示,提升大语言模型的推理效率,实现超过2倍的加速,优于现有无训练方法。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14612 2026-04-17 cs.LG cs.CL 82%

ConfLayers: Adaptive Confidence-based Layer Skipping for Self-Speculative Decoding

ConfLayers:基于置信度的自推测解码中动态层跳过

Walaa Amer, Uday das, Fadi Kurdahi

机构 * Department of Electrical Engineering and Computer Sciences, University of California Irvine, Irvine, USA(电气工程与计算机科学系,加州大学伊尔弗斯分校,伊尔弗斯,美国)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 ConfLayers通过动态置信度层跳过方法优化自推测解码,提升生成速度而不牺牲质量,实现更一致的速度-质量权衡。

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08055 2026-04-17 cs.LG cs.DC 81%

From Tokens to Layers: Redefining Stall-Free Scheduling for MoE Serving with Layered Prefill

从令牌到层:重新定义MoE服务中的无停滞调度

Gunjun Lee, Jiwon Kim, Jaiyoung Park, Younjoo Lee, Jung Ho Ahn

机构 * Anonymous Institution, Anonymous City, Anonymous Region, Anonymous Country(匿名机构,匿名城市,匿名地区,匿名国家)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出分层预填调度方法,通过将Transformer层组作为调度单元,减少MoE模型中的专家权重重复加载,提升TTFT和TBT性能,降低能耗和带宽需求。

Comments 24 pages, 5 figure, 12 tables, accepted at MLSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15009 2026-04-17 cs.AI cs.LG 81%

Towards Faster Language Model Inference Using Mixture-of-Experts Flow Matching

迈向更快的语言模型推断:专家混合流匹配

Aihua Li

机构 * Duke University(杜克大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出MoE-FM框架,通过分解复杂潜空间传输几何结构,提升语言模型推断效率,YAN模型在多个任务中表现优异,速度提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11496 2026-04-17 cs.CV cs.CL cs.LG 81%

Revisiting Compositionality in Dual-Encoder Vision-Language Models: The Role of Inference

重新审视双编码视觉-语言模型中的组合性:推断的作用

Imanol Miranda, Ander Salaberria, Eneko Agirre, Gorka Azkune

机构 * HiTZ Center – Ixa, University of the Basque Country (UPV/EHU)(希茨中心–Ixa,巴斯克国家大学(UPV/EHU))

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文探讨了双编码视觉-语言模型中组合性问题的根源,提出通过改进推断协议提升组合性能,引入轻量级变压器学习局部对齐,优于全微调和端到端训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14149 2026-04-17 cs.CV 80%

One Token per Highly Selective Frame: Towards Extreme Compression for Long Video Understanding

每个高度选择性帧一个标记:朝着长视频理解的极端压缩

Zheyu Zhang, Ziqi Pang, Shixing Chen, Xiang Hao, Vimal Bhat, Yu-Xiong Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon Prime Video(亚马逊Prime视频)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出XComp模型,通过极端视频标记压缩提升长视频理解性能,结合标记级和帧级压缩,实现更高的压缩比和更密集的帧采样。

Comments Appear in the proceedings of NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14820 2026-04-17 cs.SE 80%

SWE-TRACE: Optimizing Long-Horizon SWE Agents Through Rubric Process Reward Models and Heuristic Test-Time Scaling

SWE-TRACE:通过规则过程奖励模型和启发式测试时间缩放优化长 horizon SWE代理

Hao Han, Jin Xie, Xuehao Ma, Weiquan Zhu, Ziyao Zhang, ZhiLiang Long, Hongkai Chen, Qingwen Ye

专题命中 效率与部署 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn)

AI总结 本文提出SWE-TRACE框架,通过优化数据收集、强化学习和测试时间推理,提升SWE代理的长horizon推理能力,减少token消耗和推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15188 2026-04-17 cs.CV cs.AI 79%

VisPCO: Visual Token Pruning Configuration Optimization via Budget-Aware Pareto-Frontier Learning for Vision-Language Models

VisPCO:通过预算感知的帕累托前沿学习实现视觉令牌修剪配置优化

Huawei Ji, Yuanhao Sun, Yuan Jin, Cheng Deng, Jiaxin Ding, Luoyi Fu, Xinbing Wang

机构 * Shanghai Jiao Tong University(上海交通大学) University of Edinburgh(爱丁堡大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 本文提出VisPCO框架,通过将视觉令牌修剪问题建模为帕累托配置优化问题,自动识别最优配置。实验表明,该方法在8个视觉基准上有效逼近帕累托前沿,并在不同修剪方法和VLM架构中泛化良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14739 2026-04-17 cs.LG 79%

Assessing the Performance-Efficiency Trade-off of Foundation Models in Probabilistic Electricity Price Forecasting

评估概率电力价格预测中基础模型的性能-效率权衡

Jan Niklas Lettner, Hadeer El Ashhab, Veit Hagenmeyer, Benjamin Schäfer

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 本文比较了四种模型在欧洲招标区日-ahead概率电力价格预测中的表现,发现TSFMs在CRPS、能量评分和预测区间校准方面优于专用深度学习模型,但经过优化的专用模型在某些情况下也能超越TSFMs,强调了在概率电力价格预测中需权衡计算成本与边际性能提升。

Comments Submitted to the 7th International Workshop on Energy Data and Analytics (EDA), held in conjunction with ACM e-Energy 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14629 2026-04-17 cs.CV 78%

Switch-KD: Visual-Switch Knowledge Distillation for Vision-Language Models

Switch-KD:视觉切换知识蒸馏用于视觉-语言模型

Haoyi Sun, Xiaoxiao Wang, Ning Mao, Qian Wang, Lifu Mu, Wen Zheng, Tao Wei, Wei Chen

机构 * Li Auto Inc(利-auto公司)

专题命中 效率与部署 :language model(title,abstract)

AI总结 Switch-KD通过统一视觉-语言知识转移,解决多模态对齐问题,使小模型高效蒸馏大模型的多模态知识。

Comments 11 pages, 3 figures

Journal ref IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00313 2026-04-17 cs.CV 78%

Label-efficient underwater species classification with logistic regression on frozen foundation model embeddings

高效标签的水下物种分类:基于冻结基础模型嵌入的逻辑回归

Thomas Manuel Rost

机构 * Thomas Manuel Rost(托马斯·曼努埃尔·罗斯)

专题命中 效率与部署 :foundation model(title,abstract)

AI总结 本文研究了在冻结基础模型嵌入上使用逻辑回归进行水下物种分类,证明在标签稀缺情况下,冻结表示在物种层面具有强线性可分性,无需深度学习训练或领域特定数据工程。

Comments v2. New methodology, instead of semi supervised now focused on linear separability. Methodological updates, performance upgrades. The concept is still the same, but the experimental setup and the implementation details have changed

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14186 2026-04-17 eess.AS cs.AI cs.CL 76%

HARNESS: Lightweight Distilled Arabic Speech Foundation Models

HARNESS:轻量级阿拉伯语语音基础模型

Vrunda N. Sukhadia, Shammur Absar Chowdhury

机构 * Amazon India(亚马逊印度) Qatar Computing Research Institute, HBKU, Qatar(卡塔尔计算研究所,HBKU,卡塔尔)

专题命中 效率与部署 :foundation model(title);分类 cs.CL、cs.AI

AI总结 本文提出HARNESS,一种轻量级阿拉伯语语音基础模型,通过迭代自蒸馏实现高效准确率与效率的平衡,适用于自动语音识别、方言识别和语音情感识别任务。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14375 2026-04-17 cs.LG cs.AI 73%

Modular Continual Learning via Zero-Leakage Reconstruction Routing and Autonomous Task Discovery

通过零泄漏重建路由和自主任务发现实现模块化持续学习

Noureddine Kermiche

机构 * Western Digital Corporation(西部数字公司)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出一种硅本征模块化架构,通过任务特定专家和基于异常值的门卫实现结构参数隔离,采用同时流水线并行处理教师学习、学生蒸馏和路由流形获取,有效提升计算效率并满足隐私要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03295 2026-04-17 cs.CL cs.AI cs.CV 73%

POP: Prefill-Only Pruning for Efficient Large Model Inference

POP:仅预填充剪枝用于高效大模型推理

Junhui He, Zhihui Fu, Jun Wang, Qingan Li

机构 * Wuhan University(武汉大学) OPPO Research Institute(OPPO研究院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出POP剪枝方法,通过区分预填充和解码阶段,仅剪枝深度层以提升预填充效率,保留完整模型用于解码,实现1.37倍的预填充延迟提升且性能损失小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15244 2026-04-17 cs.CL 70%

From Tokens to Steps: Verification-Aware Speculative Decoding for Efficient Multi-Step Reasoning

从标记到步骤:面向验证的推测解码用于高效多步推理

Kiran Purohit, Ramasuri Narayanam, Soumyabrata Pal

机构 * IIT Kharagpur(印度克哈格普尔理工学院) Adobe Research(Adobe研究院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出SpecGuard框架,通过模型内部信号进行步骤级验证,提升多步推理的准确性和效率,实验显示在多个推理基准上准确率提升3.6%且延迟降低11%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27844 2026-04-17 cs.CL 70%

Model Capability Dominates: Inference-Time Optimization Lessons from AIMO 3

模型能力主导:来自AIMO 3的推理时间优化启示

Natapong Nitarach

机构 * Proton

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 通过AIMO 3竞赛发现,多数投票多模型推理提升数学能力,但相关误差限制样本量。通过分配不同推理策略的Diverse Prompt Mixer方法显示,模型能力主导,优化效果有限。

Comments 18 pages, 6 figures, 10 tables. Kaggle AIMO 3 competition entry. Code and notebooks: https://github.com/nat-nischw/model-capability-dominates-lessons-aimo3

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14317 2026-04-17 cs.CR cs.AI 70%

Challenges and Future Directions in Agentic Reverse Engineering Systems

代理反工程系统中的挑战与未来方向

Salem Radey, Jack West, Kassem Fawaz

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨了基于大语言模型的代理系统在二进制反工程中的表现,分析了静态、动态和混合代理的局限性,指出token限制、反编译困难和缺乏程序防护等挑战,并提出未来发展方向。

Comments 7 pages, 1 figure, accepted at SAGAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14166 2026-04-17 cs.CL 70%

Hierarchical Retrieval Augmented Generation for Adversarial Technique Annotation in Cyber Threat Intelligence Text

层级检索增强生成用于网络威胁情报文本中的对抗技术标注

Filippo Morbiato, Markus Keller, Priya Nair, Luca Romano

机构 * University of Padua(帕多瓦大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出H-TechniqueRAG框架,通过层级检索机制和结构约束策略提升网络威胁情报文本中对抗技术标注的效率与准确性,实验表明其在F1得分、推理延迟和API调用次数上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14160 2026-04-17 cs.AI 70%

NuHF Claw: A Risk Constrained Cognitive Agent Framework for Human Centered Procedure Support in Digital Nuclear Control Rooms

NuHF Claw:一种面向数字核控制室的人本流程支持的风险约束认知代理框架

Xingyu Xiao, Jiejuan Tong, Jun Sun, Zhe Sui, Peng Chen, Jingang Liang, Haitao Wang

机构 * Institute of Nuclear and New Energy Technology, Tsinghua University(清华大学核能与新能源技术研究院) National Key Laboratory of Human Factors Engineering(人因工程国家重点实验室) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出NuHF Claw框架,通过风险约束代理运行时,将认知状态推断与概率安全评估结合,实现实时自主系统行为调控,提升核控制室操作安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03307 2026-04-17 cs.CV cs.AI 70%

V-Reflection: Transforming MLLMs from Passive Observers to Active Interrogators

V-Reflection:将多模态大语言模型从被动观察者转变为主动提问者

Jiazhou Zhou, Yucheng Chen, Hongyang Li, Qing Jiang, Hu Zhou, Ying-Cong Chen, Lei Zhang

机构 * AI Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)人工智能方向) International Digital Economy Academy(国际数字经济学院) MedVisAI Lab, Lee Kong Chian School of Medicine, Nanyang Technological University, and Centre of AI in Medicine(医学视觉人工智能实验室,南洋理工大学Lee Kong Chian医学院,以及人工智能在医学中的中心) South China University of Technology(华南理工大学) Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电子与电气工程系)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出V-Reflection框架,通过'思考后再观察'的视觉反思机制,使多模态大语言模型能主动提问视觉特征空间,提升细粒度任务的感知能力。

Comments Main paper 14 pages with supplementary 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07529 2026-04-17 cs.LG 70%

MedVerse: Efficient and Reliable Medical Reasoning via DAG-Structured Parallel Execution

MedVerse: 通过DAG结构并行执行实现高效可靠的医学推理

Jianwen Chen, Xinyu Yang, Peng Xia, Arian Azarang, Yueh Z Lee, Gang Li, Hongtu Zhu, Yun Li, Beidi Chen, Huaxiu Yao

机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 MedVerse通过将医学推理转化为可并行的有向无环图过程,提升复杂医疗问题的效率和可靠性,实验表明其在通用大语言模型上提升了8.9%的性能,同时减少推理延迟并提高生成吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21262 2026-04-17 cs.CL 70%

CausalEmbed: Auto-Regressive Multi-Vector Generation in Latent Space for Visual Document Embedding

CausalEmbed: 在潜在空间中实现自动回归多向量生成用于视觉文档嵌入

Jiahao Huo, Yu Huang, Yibo Yan, Ye Pan, Kening Zheng, Wei-Chieh Huang, Yi Cao, Mingdong Ou, Philip S. Yu, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Alibaba Cloud Computing(阿里云计算) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出CausalEmbed方法,通过对比训练中的迭代边际损失生成紧凑且结构良好的多向量嵌入,实现高效的视觉文档检索,减少30-155倍的token数量同时保持高性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14690 2026-04-17 cs.NI 67%

Switching Efficiency: A Novel Framework for Dissecting AI Data Center Network Efficiency

交换效率:一种用于解析AI数据中心网络效率的新型框架

Niangen Ye, Jiawen Zhu, Baojun Chen, Dong Wang, Jiang Sun, Weiqiang Sun, Weisheng Hu

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 本文提出交换效率框架,通过分解数据、路由效率和端口利用率,分析AI数据中心网络效率瓶颈,指导未来网络设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15272 2026-04-17 cs.PL cs.AI cs.LG 62%

Prism: Symbolic Superoptimization of Tensor Programs

Prism: 张量程序的符号超优化

Mengdi Wu, Xiaoyu Jiang, Oded Padon, Zhihao Jia

机构 * Carnegie Mellon University(卡内基梅隆大学) Tsinghua University(清华大学) Weizmann Institute of Science(魏茨曼科学研究院)

专题命中 效率与部署 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 Prism通过符号化层级表示实现张量程序的符号超优化,结合符号推理与自动调优,提升效率并减少优化时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10120 2026-04-17 cs.MA cs.AI cs.CL 62%

TopoDIM: One-shot Topology Generation of Diverse Interaction Modes for Multi-Agent Systems

TopoDIM:多智能体系统中多样化交互模式的一键拓扑生成

Rui Sun, Jie Ding, Chenghua Gong, Tianjun Gu, Yihang Jiang, Juyuan Zhang, Liming Pan, Linyuan Lü

机构 * University of Science and Technology of China(中国科学技术大学) East China Normal University(华东师范大学)

专题命中 效率与部署 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 TopoDIM通过一键生成拓扑结构,实现多智能体系统中多样化交互模式,提升任务性能和token效率,实验表明其在token消耗和性能提升方面优于现有方法。

Comments ACL Findings Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14442 2026-04-17 cs.CL cs.AI 62%

Hierarchical vs. Flat Iteration in Shared-Weight Transformers

层次化与扁平化迭代在共享权重变换器中的比较

Sang-Il Han

机构 * Korea University of Technology and Education(韩国技术教育大学) Biomonster Co.(Biomonster公司)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究比较了层次化共享权重递归与独立层堆叠在Transformer语言模型中的表现,发现层次化结构在参数匹配下具有更优的表示质量。

详情

展开后加载摘要…

URL PDF HTML 收藏