arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-14 至 2026-05-14 共收录 354 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 61 篇

2605.13248 2026-05-14 eess.SP cs.AI 79%

Compact Latent Manifold Translation: A Parameter-Efficient Foundation Model for Cross-Modal and Cross-Frequency Physiological Signal Synthesis

紧凑的潜在流形翻译:一种参数高效的基础模型用于跨模态和跨频率生理信号合成

Bo Cui, Xiaowen Song, Yaowen Zhang, Shunzhe Zhang, B. J. F. van Beijnum, Monique Tabak, Ying Wang

机构 * Department of Biomedical Signals and Systems(生物医学信号与系统系) University of Twente(埃因霍温理工大学)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI

AI总结 本文提出CLMT模型,通过双阶段离散翻译范式解决生理信号跨模态和跨频率合成问题,显著提升临床检测精度和超分辨率性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03730 2026-05-14 stat.ML cs.LG 79%

Efficient Generative Prediction for EHR Foundation Models: The SCOPE and REACH Estimators

高效生成预测用于电子健康记录基础模型:SCOPE和REACH估计量

Luke Solo, Matthew B. A. McDermott, William F. Parker, Bashar Ramadan, Michael C. Burkhart, Brett K. Beaulieu-Jones

机构 * University of Chicago(芝加哥大学) Columbia University(哥伦比亚大学)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出SCOPE和REACH估计量,通过利用未被标准蒙特卡洛方法利用的下一个令牌概率分布,提高了生成模型在电子健康记录中的临床预测性能,同时显著降低计算成本和方差。

Comments 10 pages, 4 figures, 1 Table

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01502 2026-05-14 q-bio.NC cs.CV cs.LG 79%

Behavioral Geometric Supervision Aligns Video Foundation Models with Human Social Perception

行为几何监督使视频基础模型与人类社会感知对齐

Kathy Garcia, Leyla Isik

机构 * Department of Cognitive Science(认知科学系) Department of Biomedical Engineering(生物医学工程系) Johns Hopkins University(约翰霍普金斯大学)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出行为几何监督(BGS),通过引入人类社会判断数据,提升视频模型对社会关系的感知能力,实验表明该方法能显著提升模型性能并揭示可解释的社会情感属性。

Comments v2: Major revision. Retitled; expanded from TimeSformer alone to four backbones (V-JEPA 2/2.1, TimeSformer, VideoMAE, CLIP), with V-JEPA 2.1 nearly tripling pretrained performance. Adds zero-shot PHASE transfer, attention-rollout analysis, and a language-distillation control. Data (OOO sim. judgments) & core hybrid triplet+RSA LoRA method unchanged from v1. Prepared for NeurIPS 2026 submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12574 2026-05-14 cs.CV cs.AI 79%

DistractMIA: Black-Box Membership Inference on Vision-Language Models via Semantic Distraction

DistractMIA: 通过语义干扰在视觉语言模型上进行黑盒成员推断

Hongyi Tang, Zhihao Zhu, Yi Yang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 针对部署的视觉语言模型成员推断难题,提出DistractMIA框架,通过语义干扰技术在仅观察生成文本响应的情况下,有效区分成员与非成员样本,优于现有基线方法。

Comments 23 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18245 2026-05-14 cs.LG cs.AI 79%

Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs

参数规模与模型架构的交汇:迈向推理高效的大型语言模型

Song Bian, Tao Yu, Shivaram Venkataraman, Youngsuk Park

机构 * UW-Madison(威斯康星大学麦迪逊分校) Amazon Web Services(亚马逊网络服务)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了模型架构因素如何影响推理成本与准确性,提出条件缩放定律并验证了其有效性,结果表明优化架构在相同训练预算下提升了准确率和推理吞吐量。

Comments 32 pages, 27 figures

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21360 2026-05-14 cs.CV 78%

Prototype-Based Test-Time Adaptation of Vision-Language Models

基于原型的测试时间适应性视觉-语言模型

Zhaohong Huang, Yuxin Zhang, Wenjing Liu, Fei Chao, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception(多媒体可信感知关键实验室) Efficient Computing, Ministry of Education of China, Xiamen University, 361005, P.R. China(高效计算,中华人民共和国教育部,厦门大学,361005,中国)

专题命中 效率与部署 :language model(title,abstract)

AI总结 本文提出基于原型的测试时间适应方法PTA,通过类特定知识原型积累测试样本知识,提高效率并实现跨领域图像识别和点云分析的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18993 2026-05-14 cs.LG 77%

CR-Net: Scaling Parameter-Efficient Training with Cross-Layer Low-Rank Structure

CR-Net:通过跨层低秩结构实现参数高效训练

Boao Kong, Junzhu Liang, Yuxi Liu, Renjia Deng, Kun Yuan

机构 * Peking University(北京大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 CR-Net通过跨层低秩结构提升大语言模型预训练效率,减少计算和内存需求,同时保持模型性能。

Comments 32 pages. Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12741 2026-05-14 cs.LG 77%

Learning with Rare Success but Rich Feedback via Reflection-Enhanced Self-Distillation

通过反思增强的自我蒸馏实现稀有成功但丰富的反馈学习

Yuwei Zhang, Sha Li, Changlong Yu, Qin Lu, Shuowei Jin, Chengyu Dong, Haoran Liu, Ilgee Hong, Xintong Li, Zhenyu Shi, Bing Yin, Jingbo Shang

机构 * UC San Diego(UC圣地亚哥大学) Amazon(亚马逊) Georgia Institute of Technology(佐治亚理工学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG

AI总结 本文提出反思增强的自我蒸馏框架,通过将失败反馈转化为主动监督信号,提升在稀有成功场景下的持续学习能力,实验表明其在多个连续学习任务中优于传统方法。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03429 2026-05-14 cs.AI cs.CL cs.HC cs.LG 75%

DiscoverLLM: From Executing Intents to Discovering Them

DiscoverLLM:从执行意图到发现意图

Tae Soo Kim, Yoonjoo Lee, Jaesang Yu, John Joon Young Chung, Juho Kim

机构 * University of Michigan(密歇根大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DiscoverLLM通过引入新的用户模拟器,帮助用户形成和发现意图,提升任务性能并减少对话长度。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13255 2026-05-14 cs.AI 74%

Respecting Self-Uncertainty in On-Policy Self-Distillation for Efficient LLM Reasoning

尊重自我不确定性在在线自我蒸馏中的高效大语言模型推理

Junlong Ke, Zichen Wen, Weijia Li, Conghui He, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 效率与部署 :LLM(title);分类 cs.AI

AI总结 本文提出EGRSD方法,通过三种信号统一token级更新,提升大语言模型推理的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12947 2026-05-14 stat.ML cs.AI cs.LG stat.ME 73%

When Should an AI Workflow Release? Always-Valid Inference for Black-Box Generate-Verify Systems

何时应释放AI工作流?始终有效的推理用于黑盒生成-验证系统

Young Hyun Cho, Will Wei Sun

机构 * Department of Statistics, Purdue University(普渡大学统计系)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出一种始终有效的释放包装器,用于现有生成-验证流程,通过构建高质量失败参考池并校准部署时的验证器评分,以在可选停止条件下保证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05242 2026-05-14 cs.SE cs.AI cs.LG 73%

EGSS: Entropy-guided Stepwise Scaling for Reliable Software Engineering

EGSS: 基于熵引导的逐步缩放以实现可靠的软件工程

Chenhui Mao, Yuanting Lei, Zhixiang Wei, Ming Liang, Zhixiang Wang, Jingxuan Xu, Dajun Chen, Wei Jiang, Yong Li

机构 * Ant Group(蚂蚁集团)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 EGSS通过熵引导的自适应搜索和稳健的测试套件增强,解决了代理测试时间缩放中的计算开销问题,提升了性能并降低了推理时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21060 2026-05-14 cs.LG cs.AI 73%

On the Sample Complexity of Differentially Private Policy Optimization

关于差分隐私策略优化的样本复杂性

Yi He, Xingyu Zhou

机构 * Wayne State University(韦恩州立大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了差分隐私策略优化的样本复杂性,分析了多种策略优化算法在隐私约束下的样本复杂性,揭示隐私成本在样本复杂性中的表现。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13784 2026-05-14 cs.LG 70%

Attention Once Is All You Need: Efficient Streaming Inference with Stateful Transformers

注意力一次就足够:高效的流式推断与状态化Transformer

Victor Norgren

机构 * LayerScale, Inc.(LayerScale公司)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出基于状态化会话的数据驱动计算模型,通过增量式KV缓存降低预填充成本,实现查询延迟与上下文长度无关。Flash Queries利用空闲GPU周期预处理问题,提升流式推断效率,实测在市场数据基准上达到5.9倍速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13740 2026-05-14 cs.LG 70%

Learning POMDP World Models from Observations with Language-Model Priors

从观测中学习POMDP世界模型:利用语言模型先验

Valentin Six, Frederik Panse, Mathis Fajeau, Lancelot Da Costa, Mridul Sharma, Alfonso Amayuelas, Tim Z. Xiao, David Hyland, Philipp Hennig, Bernhard Schölkopf

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) IRIIS University of California, Santa Barbara(加州大学圣芭芭拉分校) University of Tübingen(图宾根大学) University of Oxford(牛津大学) ELLIS Institute Tübingen(图宾根ELLIS研究所)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出Pinductor,利用语言模型先验从少量观测-动作轨迹学习POMDP模型,实现高效世界模型学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13429 2026-05-14 cs.CL 70%

TokAlign++: Advancing Vocabulary Adaptation via Better Token Alignment

TokAlign++: 通过更好的词 token 对齐推进词汇适应

Chong Li, Yingzhuo Deng, Wen Yang, Jiajun Zhang, Chengqing Zong

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, CAS, Beijing, China(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院,北京,中国) School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学人工智能学院,北京,中国)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 TokAlign++通过学习更好的词 token 对齐词典,提升多语言模型的词汇适应性能,实验显示其能提升多语言文本压缩率并保持模型能力,仅需1k步即可恢复基础模型性能。

Comments Paper under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17187 2026-05-14 cs.IT cs.AI math.IT 70%

High-Rate Quantized Matrix Multiplication I

高速率量化矩阵乘法 I

Or Ordentlich, Yury Polyanskiy

机构 * Hebrew University of Jerusalem(海法大学) MIT(麻省理工学院) MIT-IBM Watson AI Lab(麻省理工-IBM Watson AI实验室)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了量化矩阵乘法问题,探讨了量化速率与失真之间的信息论权衡,并对比了主流量化方案的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12943 2026-05-14 cs.LG 70%

Reinforced Collaboration in Multi-Agent Flow Networks

多智能体流网络中的强化协作

Zheng Wang, Yuang Liu, Yangkai Ding

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出MANGO框架,通过流网络优化多智能体协作流程,结合强化学习和文本梯度提升效率与性能,实验显示在七个基准上性能提升12.8%,效率提升47.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22910 2026-05-14 cs.CL 70%

EchoKV: Efficient KV Cache Compression via Similarity-Based Reconstruction

EchoKV: 通过基于相似性的重建实现高效的KV缓存压缩

Shiyu Ji, Yixuan Wang, Yijun Liu, Qingfu Zhu, Wanxiang Che

机构 * Research Center for Social Computing and Interactive Robotics, Harbin Institute of Technology, China(社会计算与交互机器人研究院,哈尔滨工业大学,中国)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出EchoKV框架,支持按需切换全缓存与压缩缓存,利用轻量网络重建丢弃的KV组件,通过层内和层间相似性提升压缩效率,实验显示其在多种压缩比和模型上均优于现有方法,保持短上下文场景的吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00616 2026-05-14 cs.AI 70%

SPOT: Selective Prompt Projection via Total Variation for Inference-Only Safe Text-to-Image Generation

SPOT:基于总变分的选性提示投影用于仅推理的文本到图像生成

Minhyuk Lee, Hyekyung Yoon, Myungjoo Kang

机构 * Seoul National University(首尔国立大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出SPOT框架,通过总变分约束生成器参考分布,实现对文本到图像生成中不安全内容的抑制,同时保持良性提示的行为,实验显示其在多个数据集上显著降低不适当评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12876 2026-05-14 cs.LG 70%

MaskPro: Linear-Space Probabilistic Learning for Strict (N:M)-Sparsity on LLMs

MaskPro: 用于LLMs上严格(N:M)-稀疏性的线性空间概率学习

Yan Sun, Qixin Zhang, Zhiyuan Yu, Xikun Zhang, Li Shen, Dacheng Tao

机构 * School of Computer Science Faculty of Engineering The University of Sydney(悉尼大学计算机科学与工程学院) Generative AI Lab College of Computing and Data Science Nanyang Technological University(南洋理工大学生成人工智能实验室) University of Science and Technology of China(中国科学技术大学) RMIT University(皇家理工大学) School of Cyber Science and Technology Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络科学与技术学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 MaskPro通过学习每个M连续权重的先验分类分布,在N-way采样中生成(N:M)-稀疏性,解决了现有方法在误差和训练成本上的问题,同时提升内存效率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13382 2026-05-14 cs.RO 67%

BlockVLA: Accelerating Autoregressive VLA via Block Diffusion Finetuning

BlockVLA: 通过块扩散微调加速自回归VLA

Ruiheng Wang, Shuanghao Bai, Haoran Zhang, Badong Chen, Xiangyu Xu

机构 * Xi'an Jiaotong University(西安交通大学)

专题命中 效率与部署 :language model(abstract);pretraining(abstract)

AI总结 本文提出BlockVLA框架,通过块扩散方法将预训练自回归模型转化为高效离散扩散策略,减少推理延迟并提升训练效率,实验证明在复杂长周期任务中性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22455 2026-05-14 cs.CV 67%

Exploring Multimodal LMMs for Online Episodic Memory Question Answering on the Edge

探索多模态大语言模型用于边缘端在线事件记忆问答

Giuseppe Lando, Rosario Forte, Antonino Furnari

机构 * Department of Mathematics and Computer Science, University of Catania, Italy(数学与计算机科学系,卡塔尼亚大学,意大利)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文研究多模态大语言模型在边缘端实时在线事件记忆问答中的可行性,通过双线程架构实现视频转文本记忆与问答推理,实验显示边缘端方案在隐私保护方面具有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15867 2026-05-14 cs.LG cs.AI cs.CL cs.MA 67%

RDMA: Cost Effective Agent-Driven Rare Disease Mining from Electronic Health Records

RDMA: 低成本的代理驱动罕见病挖掘从电子健康记录

John Wu, Adam Cross, Jimeng Sun

机构 * Department of Computer Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机科学系) Department of Pediatrics, University of Illinois College of Medicine Peoria(伊利诺伊大学皮奥里亚医学院儿科系)

专题命中 效率与部署 :LLM(abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 RDMA通过代理框架在电子健康记录中挖掘罕见病,无需特定任务训练,提升性能并降低部署成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13021 2026-05-14 cs.LG cs.AI 62%

Rethinking Efficient Graph Coarsening via a Non-Selfishness Principle

重新思考通过非自私原则的高效图粗化

Xu Bai, Bin Lu, Kun Zhang, Shengbo Chen, Xinbing Wang, Chenghu Zhou, Meng Jin

机构 * School of Information Science and Electronic Engineering, Shanghai Jiao Tong University, Shanghai, China(上海交通大学信息科学与电子工程学院) School of Artificial Intelligence, Shanghai Jiao Tong University, Shanghai, China(上海交通大学人工智能学院) School of Environment Science and Engineering, Shanghai Jiao Tong University, Shanghai, China(上海交通大学环境科学与工程学院) School of Artificial Intelligence, Nanchang University, Nanchang, China(南昌大学人工智能学院) Institute of Geographic Sciences and Natural Resources Research, Chinese Academy of Sciences, Beijing, China(中国科学院地理科学与资源研究所)

专题命中 效率与部署 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出非自私原则的图粗化方法NOPE,通过局部各向同性假设降低计算复杂度,实现线性内存和近线性时间复杂度,实验显示在高阶节点上具有显著加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12980 2026-05-14 cs.LG cs.AI 62%

CoRe-Gen: Robust Spectrum-to-Structure Generation under Imperfect Fingerprint Conditions

CoRe-Gen:在不完美指纹条件下实现鲁棒的光谱到结构生成

Tianbo Liu, Chixiang Lu, Jing Hao, Hengyu Zhang, Lifei Wang, Haibo Jiang, Xiaojuan Qi

机构 * The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Zhejiang Shuren University(浙江师范大学)

专题命中 效率与部署 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 针对光谱到结构生成中指纹预测误差的问题,CoRe-Gen通过合成光谱预训练、频率感知指纹扰动和结构感知解码,提升了生成鲁棒性,在NPLIB1上达到新高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02001 2026-05-14 cs.LG cs.AI 62%

Preserve-Then-Quantize: Balancing Rank Budgets for Quantization Error Reconstruction in LLMs

在量化误差重建中平衡秩预算:用于大语言模型的秩预算平衡

Yoonjun Cho, Dongjae Jeon, Soeun Kim, Moongyu Jeon, Albert No

机构 * Department of Computer Science, Yonsei University(延世大学计算机科学系) Department of Artificial Intelligence, Yonsei University(延世大学人工智能系)

专题命中 效率与部署 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SRR框架,通过在量化前保留激活缩放权重的前k个奇异子空间,仅量化残差,并利用剩余秩r-k进行误差重建,从而在秩约束下平衡量化暴露能量和不可恢复误差,提升PTQ精度。

Comments Accepted at ICML 2026. Project page: https://ai-isl.github.io/srr

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13688 2026-05-14 cs.CV cs.LG 57%

MedCore: Boundary-Preserving Medical Core Pruning for MedSAM

MedCore: 保留边界的医学核心剪枝用于MedSAM

Cenwei Zhang, Suncheng Xiang, Lei You

机构 * Shanghai Jiao Tong University(上海交通大学) Technical University of Denmark(技术大学)

专题命中 效率与部署 :foundation model(abstract);分类 cs.LG

AI总结 MedCore通过保留关键结构提升医学分割性能,减少参数和FLOPs,同时保持边界精度。

Comments 3 figures, 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13414 2026-05-14 cs.AI 57%

TRIAGE: Evaluating Prospective Metacognitive Control in LLMs under Resource Constraints

TRIAGE:在资源限制下评估大语言模型的前瞻性元认知控制

Zabir Al Nazi, Shubhashis Roy Dipta

机构 * University of California, Riverside, USA(加州大学河滨分校) University of Maryland, Baltimore County, USA(马里兰大学巴尔的摩县分校)

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 研究评估了大语言模型在资源限制下的前瞻性元认知控制能力,通过Triage框架测试不同模型在多个领域的表现,揭示了现有模型在该能力上的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12928 2026-05-14 cs.LG 57%

The Efficiency Gap in Byte Modeling

字节建模中的效率差距

Celine Lee, Jing Nathan Yan, Chen Liang, Jiaxin Shi, Yin Zhang, Jeremiah Liu, Pengcheng Yin, Fernando Pereira, Ed Chi, Derek Cheng, Alexander M. Rush, Ruoxi Wang

机构 * Google DeepMind(谷歌DeepMind) Department of Computer Science, Cornell University(康奈尔大学计算机科学系) Work done while at Google DeepMind(曾在谷歌深Mind工作)

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 研究字节建模与掩码扩散建模在计算成本上的差异,发现字节建模在掩码扩散建模中效率更低,需引入新的结构偏置以维持扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏