arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-11 至 2026-05-11 共收录 415 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 68 篇

2605.02971 2026-05-11 cs.LG cs.AI cs.CL 83%

Multilingual Safety Alignment via Self-Distillation

通过自蒸馏实现多语言安全对齐

Ruiyang Qin, Qingzhuo Wang, Dongrui Liu, Qiang Li, Zhihua Wei, Wen Shen

机构 * Tongji University(同济大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出多语言自蒸馏框架,通过将高资源语言的安全能力迁移到低资源语言,解决多语言安全对齐问题,无需特定语言响应数据,实验表明方法在多语言安全性能上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07726 2026-05-11 cs.DC 82%

A Scalable Recipe on SuperMUC-NG Phase 2: Efficient Large-Scale Training of Language Models

在SuperMUC-NG Phase 2上的可扩展配方:高效大规模训练语言模型

Ajay Navilarekal Rajgopal, Nikolai Solmsdorf

专题命中 效率与部署 :language model(title,abstract);large language model(abstract)

AI总结 本文研究了在SuperMUC-NG Phase 2系统上高效训练大规模语言模型的方法,通过并行训练技术提升计算效率,实现了1750亿参数模型的高效训练。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25584 2026-05-11 cs.AI cs.CL cs.CV cs.IT cs.LG math.IT 82%

Skip-It? Theoretical Conditions for Layer Skipping in Vision-Language Models

跳过层?视觉-语言模型中层跳过的理论条件

Max Hartman, Vidhata Jayaraman, Moulik Choraria, Akhil Bhimaraju, Lav R. Varshney

机构 * Department of Electrical and Computer Engineering, The University of Illinois, Champaign, IL, United States(电气与计算机工程系,伊利诺伊大学香槟分校) Department of Mathematics, The University of Illinois, Champaign, IL, United States(数学系,伊利诺伊大学香槟分校) AI Innovation Institute, Stony Brook University, Stony Brook, NY, United States(人工智能创新研究所,石溪大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出统一框架,通过可验证的冗余概念,理论分析视觉-语言模型中层跳过的条件,验证早期和晚期视觉token的冗余性,并统一现代层跳技术的理论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07180 2026-05-11 cs.CL 81%

Learning Agent Routing From Early Experience

从早期经验学习代理路由

Yimin Wang, Jiahao Qiu, Xuan Qi, Xinzhe Juan, Jingzhe Shi, Zelin Zhao, Hongru Wang, Shilong Liu, Mengdi Wang

机构 * AI Lab, Princeton University(普林斯顿大学人工智能实验室) University of Michigan(密歇根大学) Institute for Interdisciplinary Information Sciences (IIIS), Tsinghua University(清华大学交叉信息学院) Shanghai Jiao Tong University(上海交通大学) University of Edinburgh(爱丁堡大学) King’s College London(伦敦国王学院)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文研究在冷启动条件下如何在轻量级LLM推理与完整代理执行间进行路由,提出无需训练的BoundaryRouter框架,通过早期行为经验和指导性推理决定是否直接使用LLM还是升级至代理,实验显示其在降低推理时间与提升性能方面优于其他方法。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20816 2026-05-11 cs.CL cs.LG 81%

Don't Ignore the Tail: Decoupling top-K Probabilities for Efficient Language Model Distillation

不要忽视尾部:为高效语言模型蒸馏解耦top-K概率

Sayantan Dasgupta, Trevor Cohn, Timothy Baldwin

机构 * School of Computing and Information Systems, University of Melbourne, Melbourne, Australia(计算与信息系统学院,墨尔本大学,澳大利亚墨尔本)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种尾部意识的分歧度,解耦教师模型top-K预测概率与低概率预测的贡献,提升分布尾部信息在语言模型蒸馏中的作用。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07865 2026-05-11 cs.LG cs.AI cs.CL 80%

KL for a KL: On-Policy Distillation with Control Variate Baseline

KL 为 KL:带有控制变量基线的在线蒸馏

Minjae Oh, Sangjun Song, Gyubin Choi, Yunho Choi, Yohan Jo

机构 * Graduate School of Data Science(数据科学研究生院) Seoul National University(首尔国立大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出vOPD,通过引入控制变量基线将在线蒸馏转化为策略梯度强化学习,有效降低梯度方差,提升稳定性,并在多个基准上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07547 2026-05-11 cs.DC cs.NI cs.SY eess.SY 80%

Deadline-Driven Hierarchical Agentic Resource Sharing for AI Services and RAN Functions in AI-RAN

面向截止期限的分层代理资源共享框架用于AI服务和RAN功能在AI-RAN中

Haiyuan Li, Yulei Wu, Dimitra Simeonidou

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出了一种分层代理框架,结合大语言模型用于慢速时间尺度的AI服务和RAN功能放置,以及基于截止期限的凸优化算法用于快速时间尺度的GPU/CPU分配,以提高AI-RAN的资源利用率和SLA满足率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02204 2026-05-11 eess.SP 80%

When Eavesdroppers Reason: Agentic Eavesdropping Attacks on Semantic Communication

当窃听者进行推理:语义通信中的代理窃听攻击

Shunpu Tang, Qianqian Yang, Zhiguo Shi, Jiming Chen, Xuemin Shen

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出一种基于大语言模型的代理窃听者,通过闭环工作流中的三个功能代理,无需窃听信道状态信息即可实现超过75%的窃听成功率,揭示了语义通信中严重的隐私威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02001 2026-05-11 cs.NI cs.LG 79%

Versatile yet Efficient Network Traffic Analysis: Offloading Network Foundation Model to SmartNIC

多功能且高效的网络流量分析:将网络基础模型卸载到智能网卡

Chungang Lin, Xuying Meng, Tianyu Zuo, Weiyao Zhang, Meng Shen, Ruijie Zhao, Guanming Che, Ruiqi Meng, Ziyue Huang, Haitong Luo, Zhiwei Xu, Yujun Zhang

机构 * Institute of Computing Technology, Chinese Academy of Sciences, China(中国科学院计算技术研究所) University of Chinese Academy of Sciences, China(中国科学院大学) University of Virginia, USA(弗吉尼亚大学) Beijing Institute of Technology, China(北京理工大学) Southeast University, China(东南大学) Northeastern University, China(东北大学) Haihe Lab of ITAI, China(ITAI海河实验室) Corresponding authors(通讯作者)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出Nepco系统,通过将网络基础模型卸载到智能网卡,实现多功能且高效的网络流量分析,减少端到端延迟。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07055 2026-05-11 cs.CV cs.AI 79%

Pan-FM: A Pan-Organ Foundation Model with Saliency-Guided Masking for Missing Robustness

Pan-FM:一种具有显著性引导掩码的全器官基础模型以实现缺失鲁棒性

Qiangqiang Wu, Grace McIlvain, Zhou Yu, Junhao Wen

机构 * Laboratory of AI and Biomedical Science(人工智能与生物医学科学实验室) Columbia University(哥伦比亚大学)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI

AI总结 Pan-FM通过显著性引导掩码技术,解决多模态生物医学数据缺失问题,提升全器官表示学习的鲁棒性,优于单器官和多器官基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08064 2026-05-11 cs.CV 78%

Proxy3D: Efficient 3D Representations for Vision-Language Models via Semantic Clustering and Alignment

Proxy3D: 通过语义聚类和对齐实现视觉-语言模型的高效3D表示

Jerry Jiang, Haowen Sun, Denis Gudovskiy, Yohei Nakata, Tomoyuki Okuno, Kurt Keutzer, Wenzhao Zheng

机构 * Tsinghua University(清华大学) Panasonic AI Lab(松下人工智能实验室) Panasonic DX-CPS(松下DX-CPS) UC Berkeley(伯克利大学)

专题命中 效率与部署 :language model(title,abstract)

AI总结 本文提出Proxy3D方法,通过语义和几何编码器提取场景特征并进行语义感知聚类,生成紧凑且全面的3D代理表示,提升视觉-语言模型在3D视觉问答、视觉定位和空间智能任务中的性能。

Comments Accepted by CVPR 2026. Project page: https://wzzheng.net/Proxy3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06760 2026-05-11 cs.CR 78%

Language Models Can Autonomously Hack and Self-Replicate

语言模型可以自主黑客和自我复制

Alena Air, Reworr, Nikolaj Kotov, Dmitrii Volkov, John Steidley, Jeffrey Ladish

专题命中 效率与部署 :language model(title,abstract)

AI总结 研究展示语言模型通过利用易受攻击的主机自主复制权重并跨网络传播,核心方法是发现和利用网络漏洞,主要贡献是验证了模型自我复制能力及效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07517 2026-05-11 cs.IR cs.AI 77%

LARAG: Link-Aware Retrieval Strategy for RAG Systems in Hyperlinked Technical Documentation

LARAG:超链接技术文档中基于链接的RAG系统检索策略

Giorgia Bolognesi, Claudio Estatico, Ulderico Fugacci, Isabella Mastroianni, Claudio Muselli, Luca Oneto

机构 * Rulex s.r.l.(Rulex公司) Department of Mathematics (DIMA), University of Genoa(热那亚大学数学系) Department of Computer Science, Bioengineering, Robotics, and Systems Engineering (DIBRIS), University of Genoa(热那亚大学计算机科学、生物工程、机器人学和系统工程系)

专题命中 效率与部署 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 LARAG通过利用HTML文档中已有的超链接结构,改进RAG系统检索效果,提升答案质量并降低资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07139 2026-05-11 cs.CL cs.AI cs.LG 75%

Structural Rationale Distillation via Reasoning Space Compression

通过推理空间压缩实现结构性理性提炼

Jialin Yang, Jiankun Wang, Jiajun Wu, Henry Leung, Jiayu Zhou, Steve Drew

机构 * University of Calgary(卡尔加里大学) University of Michigan(密歇根大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出D-RPC方法,通过压缩推理空间约束教师模型生成一致且多样化的推理路径,提升学生模型在数学和常识推理任务中的表现,优于多种基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06683 2026-05-11 cs.LG cs.AI cs.CL 75%

Toeplitz MLP Mixers are Low Complexity, Information-Rich Sequence Models

Toeplitz MLP Mixers 是低复杂度、信息丰富的序列模型

Benjamin L. Badger, Ethan Roland

机构 * IBM AE Studio

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Toeplitz MLP Mixer,通过三角掩码的Toeplitz矩阵乘法替代注意力机制,实现更低的计算复杂度,同时在信息保留和复制能力上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05848 2026-05-11 cs.CV cs.AI 70%

VideoRouter: Query-Adaptive Dual Routing for Efficient Long-Video Understanding

VideoRouter: 为高效长视频理解的查询适应双路由

Kuanwei Lin, Wenhao Zhang, Ge Li

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 VideoRouter通过双路由框架实现高效长视频理解,通过语义路由和图像路由动态分配证据,减少冗余token,提升压缩效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07193 2026-05-11 cs.LG 70%

Coupling Models for One-Step Discrete Generation

一步离散生成的耦合模型

Fred Zhangzhi Peng, Avishek Joey Bose, Anru R. Zhang, Alexander Tong

机构 * Duke University(杜克大学) Imperial College London(伦敦帝国学院) AITHYRA

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种一步离散生成模型,通过直接耦合离散序列与高斯潜在变量,提升生成效果,在文本生成、增强器设计和图像生成任务中均取得显著改进。

Comments Code is available at https://github.com/pengzhangzhi/Coupling-Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07162 2026-05-11 cs.CL 70%

CLIPer: Tailoring Diverse User Preference via Classifier-Guided Inference-Time Personalization

CLIPer:通过分类器引导的推理时个性化实现多样化用户偏好

Jinyan Su, Jinpeng Zhou, Claire Cardie, Wen Sun

机构 * Cornell University(康奈尔大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 CLIPer通过分类器引导在推理时个性化,实现多样化用户偏好,无需大量微调,具有高效可控的个性化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06941 2026-05-11 cs.LG math.OC 70%

Causal-Aware Foundation-Model for Bilevel Optimization in Discrete Choice Settings

面向离散选择场景的因果感知基础模型用于双层优化

Shivaram Subramanian, Zhengliang Xue, Markus Ettl, Yingdong Lu, Jayant Kalagnanam

机构 * IBM T.J. Watson Research Center(IBM T.J. Watson研究院)

专题命中 效率与部署 :foundation model(abstract);prompting(abstract);分类 cs.LG

AI总结 本文提出一种因果感知基础模型框架,用于离散选择环境中实时最优决策。通过约束三头价格优化网络解决服务提供者选择最优商品组合的问题,同时考虑用户个性化接受或拒绝选择。模型在模拟、合成和真实数据集上表现优异,应用于医疗、招标定价等领域,提升定价KPI。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06788 2026-05-11 cs.LG cs.MA 70%

Conformal Agent Error Attribution

符合性代理错误归因

Naihe Feng, Yi Sui, Shiyi Hou, Ga Wu, Jesse C. Cresswell

机构 * Dalhousie University(达尔豪西大学) Layer 6 AI

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出基于符合预测框架的代理错误归因方法,通过连续序列预测集实现高效恢复与调试,为多代理系统提供原理化的不确定性层。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06713 2026-05-11 cs.CR cs.AI cs.HC 70%

Agentic AI and the Industrialization of Cyber Offense: Forecast, Consequences, and Defensive Priorities for Enterprises and the Mittelstand

代理AI与网络攻击的工业化:预测、后果及企业与中产阶层的防御优先事项

Christopher Koch

机构 * Independent Researcher(独立研究者)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文探讨代理AI对网络攻击生命周期的影响,提出三通道代理网络风险模型和攻击压缩模型,通过2026年Linux内核复制失败事件案例,预测2026-2028年企业及德国中产防御需求,强调身份验证、补丁速度等防御优先级。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06708 2026-05-11 cs.CV cs.AI 70%

Visual Text Compression as Measure Transport

视觉文本压缩作为度量传输

Lv Tang, Tianyi Zheng, Yang Liu, Bo Li, Xingyu Li

机构 * University of Alberta(阿尔伯塔大学) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司) Tsinghua University(清华大学)

专题命中 效率与部署 :LLM(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过度量传输理论分析视觉文本压缩,提出无标签路由准则和传输感知聚焦机制,提升压缩效率并优化下游任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06679 2026-05-11 cs.LG 70%

Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding

打破幻觉:当积极与消极在多模态解码中相遇

Yubo Jiang, Yitong An, Xin Yang, Abudukelimu Wuerkaixi, Xuxin Cheng, Fengying Xie, Zhiguo Jiang, Cao Liu, Ke Zeng, Haopeng Zhang

机构 * School of Astronautics, Beihang University(北京航空航天大学航天学院) Longcat Interaction Team, Meituan(美团Longcat交互团队) Tianmushan Laboratory, Beihang University(北京航空航天大学天门山实验室)

专题命中 效率与部署 :language model(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出PND框架,通过在解码过程中引入正负对比路径,增强视觉真实性,无需重新训练即可在POPE、MME和CHAIR数据集上取得最佳性能。

Comments Accepted by CVPR 2026 (Conference on Computer Vision and Pattern Recognition). 11 pages, 5 figures. Code available at: https://github.com/JiangYubo4399/PND

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02525 2026-05-11 cs.LG 70%

AdaHOP: Fast and Accurate Low-Precision Training via Outlier-Pattern-Aware Rotation

AdaHOP: 通过异常模式感知旋转实现快速且准确的低精度训练

Seonggon Kim, Alireza Khodamoradi, Pranathi Vasireddy, Kristof Denolf, Eunhyeok Park

机构 * Advanced Micro Devices, Inc.(先进微器件公司) POSTECH(POSTECH大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出AdaHOP,通过分析权重、激活和梯度中的三种稳定异常模式,采用自适应Hadamard变换和异常提取策略,在MXFP4精度下实现BF16级质量,提升内存压缩和训练速度。

Comments 21 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06283 2026-05-11 cs.LG 70%

SOCKET: SOft Collision Kernel EsTimator for Sparse Attention

SOCKET: 用于稀疏注意力的软碰撞核估计器

Sahil Joshi, Agniva Chowdhury, Wyatt Bellinger, Amar Kanakamedala, Ekam Singh, Hoang Anh Duy Le, Aditya Desai, Anshumali Shrivastava

机构 * Department of Computer Science, Rice University(里士大学计算机科学系) Department of Electrical Engineering and Computer Sciences, UC Berkeley(伯克利大学电气工程与计算机科学系)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 SOCKET通过引入软碰撞核估计器改进稀疏注意力,利用概率性相似性聚合替代传统二元碰撞信号,提升长上下文推理效率和内存利用率。

Comments 7 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01621 2026-05-11 cs.CR cs.LG 70%

CGF-Softmax: A Cumulant-Based Softmax Reformulation for Efficient Inference under Homomorphic Encryption

CGF-Softmax: 一种基于累积生成函数的softmax重参数化方法,用于在同态加密下高效推理

Hanjun Park, Byeongseo Min, Jiheon Woo, Min-Wook Jeong, Jongho Shin, Yongwoo Lee, Young-Sik Kim, Yongjune Kim

机构 * Pohang University of Science and Technology (POSTECH)(釜山科学技术大学) LG Electronics R&D Center(LG电子研发中心) Inha University(inha大学) Daegu Gyeongbuk Institute of Science and Technology (DGIST)(大邱广开府科学技术院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出CGF-softmax,通过累积生成函数重参数化softmax分母,消除了同态除法和显式最大减法,降低乘法深度并保持softmax关键属性,在视觉Transformer和大语言模型中实现高效准确的加密推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08069 2026-05-11 stat.ME stat.ML 67%

Empirical Bayes Rebiasing

经验贝叶斯再校正

Wanyi Ling, Sida Li, Junming Guan, Nikolaos Ignatiadis

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 本文提出经验贝叶斯再校正方法,通过学习数据估计未知偏分布,改进多偏估计的同时分析,提升置信区间精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08044 2026-05-11 cs.CL cs.AI cs.LG 67%

Fast Byte Latent Transformer

快速字节潜在变换器

Julie Kallini, Artidoro Pagnoni, Tomasz Limisiewicz, Gargi Ghosh, Luke Zettlemoyer, Christopher Potts, Xiaochuang Han, Srinivasan Iyer

机构 * FAIR at Meta(Meta的FAIR) Stanford University(斯坦福大学) University of Washington(华盛顿大学)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出BLT Diffusion和BLT Self-speculation等方法,通过并行生成和验证步骤提升字节级语言模型的生成速度和质量,降低内存带宽消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08003 2026-05-11 cs.CV 67%

SphereVAD: Training-Free Video Anomaly Detection via Geodesic Inference on the Unit Hypersphere

SphereVAD: 基于单位超球面几何推断的无训练视频异常检测

Chao Huang, Penfei Wei, Wei Wang, Jie Wen, Zhihua Wang, Li Shen, Wenqi Ren, Xiaochun Cao

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 SphereVAD通过几何推断在单位超球面上实现无训练视频异常检测,利用预训练多模态大语言模型的中间层特征,通过Frechet均值中心化、Holistic Scene Attention和vMF引导的球面几何拉近技术,实现零样本异常识别。

Comments 48 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07924 2026-05-11 cs.LG cs.AI cs.CL 67%

Trajectory as the Teacher: Few-Step Discrete Flow Matching via Energy-Navigated Distillation

轨迹作为教师:通过能量导航蒸馏实现少步离散流匹配

Amin Karimi Monsefi, Dominic Culver, Nikhil Bhendawade, Manuel R. Ciosici, Yizhe Zhang, Irina Belousova

机构 * The Ohio State University(俄亥俄州立大学) Apple(苹果公司)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出TS-DFM方法,通过能量导航蒸馏减少离散流匹配的训练步骤,实现更高效的文本生成,实验表明其在生成质量与速度上均优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏