arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-11 至 2026-08-11 共收录 772 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 146 篇

2608.03836 2026-08-11 cs.LG cs.DC cs.LO cs.SE 版本更新 70%

Resume Means Resume: A Machine-Checked Conformance Contract for Checkpoint, Interrupt, and Resume Semantics in Workflow Persistence Layers

恢复即恢复:工作流持久层中检查点、中断与恢复语义的机器可检查一致性契约

Sajjad Khan

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 该研究提出了RESUME CONTRACT契约,用TLA+模型等方法验证了五个智能体工作流框架的一致性问题,并通过REMIT修复了相关故障。

Comments 25 pages, 10 tables, 1 figure. Supplementary material included as an ancillary file. v3: rejoins a paragraph split across a table float and harmonizes a label glyph in the supplement; no change to results, claims, or numbers

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07080 2026-08-11 cs.SD cs.AI eess.AS 版本更新 70%

dots.tts Technical Report

dots.tts 技术报告

Shi Lian, Changtao Li, Bohan Li, Hankun Wang, Da Zheng, Junfeng Tian, Yufeng Ma, Colin Zhang, Kai Yu

机构 * ByteDance(字节跳动)

专题命中 效率与部署 :foundation model(abstract);post-training(abstract);分类 cs.AI

AI总结 提出一个20亿参数的连续自回归TTS基础模型,通过多目标AudioVAE、全历史条件流匹配和无奖励自校正后训练,在Seed-TTS-Eval上取得最优性能,并支持低延迟推理。

Comments 22 pages, 2 figures. Revised technical report with updated technical content, experiments, efficiency results, references, figures, project links, and abstract metadata formatting

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06247 2026-08-11 cs.CR cs.AI 版本更新 70%

SALLIE: Generation-Free Hidden-State Detection of Jailbreaks and Prompt Injections Across Text and Vision

SALLIE:防范潜在语言与图像攻击

Guy Azov, Ofer Rivlin, Guy Shtar

机构 * Intuit

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SALLIE是一种轻量级运行时检测框架,通过机制可解释性提取模型内部激活信号,有效应对文本和图像攻击,无需性能降级或架构修改。

Comments 17 pages, 5 figures, 17 tables. Preprint under review. v2: substantially revised - new title expansion, reworked method presentation, added calibration-regime analysis (shared / threshold-only / fully calibrated) and matched-protocol comparison with RCS-KCD; technical appendices A-H now included

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02637 2026-08-11 cs.MA cs.CL cs.PL 版本更新 70%

StitchCUDA: An Automated Multi-Agents End-to-End GPU Programing Framework with Rubric-based Agentic Reinforcement Learning

StitchCUDA:一种基于规则的多智能体端到端GPU编程框架与基于代理的强化学习

Shiyang Li, Zijian Zhang, Winson Chen, Yuebo Luo, Mingyi Hong, Caiwen Ding

机构 * Department of Computer Science\&Engineering, University of Minnesota-Twin Cities, Minnesota, USA Department of Electrical Engineering, University of Minnesota-Twin Cities, Minnesota, USA

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 StitchCUDA通过基于规则的多智能体强化学习,实现了端到端GPU编程的高效生成与验证,显著提升了性能和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02791 2026-08-11 cs.SE cs.AI 版本更新 70%

Contamination Means Overestimation? A Fine-Grained Empirical Study in Code Intelligence

重新审视数据污染在代码智能中的影响

Zhen Yang, Hongyi Lin, Yifan He, Junqi Wang, Zeyu Sun, Shuo Liu, Jie Xu, Pengpeng Wang, Zhongxing Yu, Qingyuan Liang

机构 * Shandong University(山东大学) Institute of Software, Chinese Academy of sciences(中国科学院软件研究所) City University of Hong Kong(香港城市大学) Columbia University(哥伦比亚大学) Peking University(北京大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文重新审视了数据污染对代码智能模型的影响,发现不同模型在不同污染场景下的表现差异显著,挑战了污染必然导致性能高估的传统观点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20968 2026-08-11 cs.DC cs.AI 版本更新 70%

Mesh-Attention: A New Communication-Efficient Distributed Attention with Improved Data Locality

Mesh-Attention: 一种新的通信高效分布式注意力机制,具有改进的数据本地性

Sirui Chen, Jingji Chen, Siqi Zhu, Ziheng Jiang, Yanghua Peng, Xuehai Qian

机构 * Tsinghua University(清华大学) Purdue University(普渡大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ByteDance Seed(字节跳动种子)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Mesh-Attention通过改进的数据本地性,提高了分布式注意力的通信效率和可扩展性,实验显示在大规模GPU上实现了显著的加速和通信量减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10903 2026-08-11 cs.AI 版本更新 70%

Multi-Granular Node Pruning for Causal Circuit Discovery

多粒度节点剪枝用于因果电路发现

Muhammad Umair Haider, Hammad Rizwan, Hassan Sajjad, A. B. Siddique

机构 * Department of Computer Science, University of Kentucky, USA(美国肯塔基大学计算机科学系) Department of Computer Science, Dalhousie University, Canada(加拿大达尔豪斯大学计算机科学系)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种节点级剪枝框架,通过可学习掩码和多粒度稀疏惩罚,在单次微调中从大语言模型中高效发现最小因果电路,节点更少且性能相当,内存占用降低5-10倍。

Comments Published at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19969 2026-08-11 cs.AI 版本更新 70%

M$^3$Prune: Hierarchical Communication Graph Pruning for Efficient Multi-Modal Multi-Agent Retrieval-Augmented Generation

M$^3$Prune: 多模态多智能体分层通信图剪枝用于高效多模态多智能体检索增强生成

Weizi Shao, Taolin Zhang, Zijie Zhou, Chen Chen, Chengyu Wang, Xiaofeng He

机构 * East China Normal University(东华大学) Hefei University of Technology(合肥工业大学) China University of Petroleum(中国石油大学) Guangdong university of Finance & Economics(广东财经大学) Alibaba Group(阿里巴巴集团)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 M$^3$Prune通过分层通信图剪枝提升多模态多智能体检索增强生成的效率和性能。

Comments Critical flaw in Eq.(5)/Alg.1 (Sec 3.2): scoring fails Lipschitz continuity in multi-modal spaces, causing invalid hierarchy. Thus, latency/FLOPs in Tables 2&3 are overestimated & irreproducible. Core defect unfixable by minor update. Withdraw to avoid misleading; will revise theory & experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09931 2026-08-11 cs.CV 新提交 67%

Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots

监督之前的感知:来自反事实盲区的自包含视觉蒸馏

Shravan Venkatraman, Omkar Thawakar, Ritesh Thawkar, Abdelrahman Shaker, Rao Muhammad Anwer

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Aalto University(阿尔托大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 该研究提出首个完全自包含的视觉自蒸馏框架 CVPD,通过识别模型视觉盲区生成密集对比监督,在 Qwen3-VL-8B-Instruct 上的 12 个基准中优于 6 个自进化基线,取得多项指标提升且无性能倒退。

Comments BMVC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09789 2026-08-11 cs.CV 新提交 67%

ADOPD: Reference-Privileged On-Policy Distillation for MLLM-Based Industrial Anomaly Detection

ADOPD:面向多模态大语言模型(MLLM)的工业异常检测的参考特权在线策略蒸馏

Jingtai He, Shiyuan Meng, Wenchao Meng, Qinmin Yang

机构 * Zhejiang University(浙江大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本研究针对工业异常检测问题,提出ADOPD参考特权在线策略蒸馏框架,通过参考感知教师监督仅查询的学生模型,在MMAD基准零样本推理下获77.31%平均准确率,优于Qwen3-VL-4B主干及其一样本设置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09376 2026-08-11 cs.DB 新提交 67%

"Will This Data Break My Task?" - Interactive Synthesis of Task-Aware Data Unit Tests

“这些数据会破坏我的任务吗?”——面向任务感知的数据单元测试的交互式综合

Hao Chen, Arnab Phani, Sebastian Schelter

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 针对现有数据单元测试框架忽略下游任务代码语义的问题,提出复合AI系统PrismaDV,联合分析数据与任务代码生成任务感知数据单元测试,通过交互式界面完成验证与优化。

Comments Accepted as a demo paper at CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09055 2026-08-11 cs.GT cs.CR 新提交 67%

Repeated-Game Security for Restaking-Based Verifiable Inference

基于再质押的可验证推理的重复博弈安全性

Zhenhang Shang, Yingzhe Yu, Kani Chen

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 本文针对基于再质押的可验证推理协议,发现其单轮罚没条件高估安全性,提出结合历史挑战、声誉加权罚没与质押归属的机制,可降低重复博弈偏差利润,减少审计率。

Comments Length: 29 pages total (15 pages main text, plus appendix and references). Figures: 5. Artifact: https://anonymous.4open.science/r/Repeated-Slashing-8031/README.md

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08950 2026-08-11 cs.SE 新提交 67%

Independent Patch Verification for Coding Agents with a Bidirectional Reconstruct-and-Verify Framework

基于双向重构-验证框架的代码智能体独立补丁验证

Chenglin Li, Yisen Xu, Zehao Wang, Shin Hwei Tan, Tse-Hsun, Chen

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本研究针对代码智能体生成补丁后缺乏独立验证的问题,提出无需训练的RETRACE双向重构-验证框架,在SWE-bench Verified等基准上显著提升了代码补丁的正确性。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08751 2026-08-11 cs.DB 新提交 67%

InSituANN: Revisiting IVF for PCIe-Efficient Billion-Scale Vector Search

InSituANN:为PCIe高效的十亿级向量搜索重新审视IVF

Yuemeng Xu, Zongxi Liu, Junyu Long, Yiming Huang, Jiarui Guo, Yangyujia Wang, Jiachen Xu, Dongyuan Yu, Zongwei Lv, Tong Yang

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 InSituANN是一种基于IVF的ANNS引擎,将基础向量存于主机内存、就地执行精细搜索,在单个商用GPU上实现十亿级向量搜索,大幅提升吞吐量并开源。

Comments 16 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08425 2026-08-11 cs.NI cs.DC 新提交 67%

PSP: Low-Overhead Packet-Level Load Balancing for Stale-State and Bandwidth-Asymmetric Networks

PSP:面向 stale 状态与带宽非对称网络的低开销报文级负载均衡

Jiaqi Liu, Chunyang Zhang, Heng Pan, Yanbiao Li

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 针对数据中心网络微突发与高并发问题,提出概率状态比例(PSP)报文级负载均衡算法,其性能优于 JSQ、随机调度,与 Top-k 相当且硬件成本更低,实现性能、稳定性与开销的平衡。

Comments 12 pages, 10 figures, 5 tables. Accepted by IEEE LCN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08340 2026-08-11 cs.DC 新提交 67%

OpRAG: A Resource-Deterministic Runtime for GPU-Backed Multi-Stage RAG Workflows

OpRAG:面向GPU支持的多阶段RAG工作流的资源确定性运行时

Arup Kumar Sarker, Mills Staylor, Aymen Alsaadi, Gregor von Laszewski, Shantenu Jha, Geoffrey Fox

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 本文提出OpRAG,一种面向GPU多阶段RAG的资源确定性分布式运行时,通过优化编排层降低非模型开销,在多模型多基准测试中显著提升RAG端到端性能。

Comments 14 pages, 6 figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07971 2026-08-11 cs.DC 新提交 67%

ElastiCo: Elastic Configuration and Interference-Aware Orchestration for GPU Clusters

ElastiCo:面向GPU集群的弹性配置与感知干扰的编排

Jinghao Wang, Yihang Zhou, Xiaoyang Sun, Chunming Hu, Tianyu Wo, Xu Wang, Albert Y. Zomaya, Renyu Yang

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 ElastiCo是一种基于Kubernetes的弹性共置框架,通过资源形态转换、弹性影子定价、感知干扰共置三种机制,实现训练与推理工作负载安全共享GPU,显著降低平均JCT、提升集群吞吐量与GPU利用率。

Comments 27 pages, 9 figures, 9 tables. Submitted to Performance Evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21886 2026-08-11 cs.HC 版本更新 67%

VisCanvas: A Node-Based Interface for Exploratory Visualization Authoring with LLMs

VisCanvas:用于基于大语言模型的探索性可视化创作的基于节点的界面

Yuki Ueno, Bretho Danzy, Zhuojun Jiang, Chris Bryan

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 研究针对大语言模型下可视化创作工具线性界面不适用于探索性分析工作流的问题,介绍基于节点的VisCanvas界面,通过用户研究表明其能在维持性能水平时促进多样数据交互,还提炼了未来AI辅助可视化创作环境的设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04425 2026-08-11 cs.CL cs.AI cs.CV cs.LG cs.MM 版本更新 67%

UI-MOPD: Multi-Platform On-Policy Distillation for Unified GUI Agents

UI-MOPD:用于持续GUI智能体学习的多平台策略蒸馏

Niu Lian, Tongbo Chen, Zhehao Yu, Chengzhen Duan, Fazhan Liu, Hui Liu, Pei Fu, Jian Luan, Heng Qu, Shu-Tao Xia, Jinpeng Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Xiaomi(小米) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Zhejiang University(浙江大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 效率与部署 :foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对构建多平台GUI智能体的挑战,构建高质量数据集Uni-GUI,提出UI-MOPD方法,通过多教师策略蒸馏实现持续学习,动态选教师并转移行为先验,实验证明其能平衡跨平台能力保留与新平台适应。

Comments Technical report. 27 pages, 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15532 2026-08-11 cs.LG cs.AI cs.CL 版本更新 67%

DeltaPrompts: Escaping the Zero-Delta Trap in Multimodal Distillation

DeltaPrompts: 逃离多模态蒸馏中的零delta陷阱

Jaehun Jung, Hyunwoo Kim, Brandon Cui, Ximing Lu, David Acuna, Prithviraj Ammanabrolu, Yejin Choi

机构 * NVIDIA Research(NVIDIA研究院)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出DeltaPrompts,通过量化教师与学生之间的答案分歧(Δ)来生成高分歧的推理问题,从而解决传统蒸馏中因零delta提示导致的学习信号不足问题,实验表明DeltaPrompts在多个场景下显著提升了模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14735 2026-08-11 cs.DC 版本更新 67%

FAME: QoS-aware Async Service Orchestration for Agentic Workflows

为MCP启用的智能工作流优化FaaS平台

Haseeb Abdullah Kollorath, Vaibhav Jha, Varad Kulkarni, Vinay, Nikhil Reddy, Anand Eswaran, Praveen Jayachandran, Yogesh Simmhan

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文提出FAME架构,利用FaaS平台优化MCP启用的智能工作流,实现模块化组合和状态持久化,提升效率与成本效益。

Comments Extended version of paper to appear in the proceedings of the International Conference on Web Services (ICWS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08176 2026-08-11 cs.AI cs.LG 新提交 62%

Matching Supervision to the Student's Learning Capacity: A Unified Framework for On-Policy Self-Distillation

匹配监督与学生学习能力:一种用于在线自蒸馏的统一框架

Yongkang Yang, Zhezheng Hao, Hong Zhang, Yi Liu, Xiankun Lin, Wence Ji, Fanjunduo Wei, Jiarui Yu, Qiang Lin, Xiaoyun Liang, Hande Dong

机构 * Tencent(腾讯)

专题命中 效率与部署 :LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 本文针对在线自蒸馏的次优问题,提出统一在线自蒸馏(USD)框架,该框架通过耦合学习难度预算与师生 divergence,在多模型规模及推理基准上均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07851 2026-08-11 cs.LG cs.CL 新提交 62%

TEMPER: Tensorized Efficient Manifold-constrained Parameterization for Expressive Residual Routing

TEMPER:用于表达性残差路由的张量化高效流形约束参数化

Yuxuan Gu, Wuyang Zhou, Huijun Xing, Danilo Mandic

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对残差路由方法参数随流增长过快的问题,提出TEMPER方法,用张量网络参数化生成器,在语言建模等任务上性能相当或更优,参数效率显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07814 2026-08-11 cs.LG cs.AI 新提交 62%

Shape Mutating Expert Compression:LorExperts and BTExperts

形状变异专家压缩:LorExperts与BTExperts

Inesh Chakrabarti, Sourjya Roy, Bowen Bao, Thiago Crepaldi, Spandan Tiwari, Ashish Sirasao

机构 * Advanced Micro Devices(超威半导体公司)

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文针对混合专家(MoE)语言模型的专家权重压缩问题,提出LorExperts与BTExperts方法,在保留所有专家与原始路由的前提下实现约50%专家压缩,性能优于基线且随专家数量增长优势更显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00040 2026-08-11 cs.LG cs.AI 版本更新 62%

Attn-QAT: 4-Bit Attention With Quantization-Aware Training

Attn-QAT:4位注意力与量化感知训练

Peiyuan Zhang, Matthew Noto, Wenxuan Tan, Chengquan Jiang, Will Lin, Wei Zhou, Hao Zhang

机构 * Stanford University(斯坦福大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Georgia Institute of Technology(佐治亚理工学院)

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 Attn-QAT通过稳定4位量化感知训练实现高效的注意力计算,提升模型推理速度并保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17092 2026-08-11 cs.CY cs.AI cs.LG 版本更新 62%

Enhancing Knowledge Tracing through Leakage-Free and Recency-Aware Embeddings

通过无泄漏且感知近期性的嵌入增强知识追踪

Yahya Badran, Christine Preisach

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对知识追踪模型的标签泄漏问题,提出含MASK标签的无泄漏嵌入与近期编码方法,融入DKT等模型后可提升预测准确性,方法高效且适用范围广。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09222 2026-08-11 cs.CL q-bio.NC 新提交 57%

Reading Cognition as Decisions Unfold in Words: A Factorized Inverse Decision Model

将决策过程的阅读认知解读为文字展开过程:一种因子化解码策模型

Jiawen Kang, Dongrui Han, Xixin Wu, Helen Meng

专题命中 效率与部署 :language model(abstract);分类 cs.CL

AI总结 该研究针对现有逆决策建模未覆盖言语化认知任务响应动态的问题,提出FIDM模型,在400名老年人的杂货购物对话任务数据上验证其可选择性估计因子、保留动作差异,且能提升认知状态分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09176 2026-08-11 cs.CV cs.AI 新提交 57%

Not All Visual Tokens Are Equally Safe to Remove:Consequence-Sensitive Visual Token Compression

并非所有视觉 token 都可安全移除:后果敏感型视觉 token 压缩

Jingbo Wen, Liang He, Mingyu Cao, Haoyu Wang, Minxuan Hu, Kangning Cui, Xilu Wang

机构 * The University of Sydney(悉尼大学) Tongji University(同济大学) University of Surrey(萨里大学) Nankai University(南开大学) Cornell University(康奈尔大学) City University of Hong Kong(香港城市大学)

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 该研究针对视觉语言模型提出后果敏感型视觉 token 压缩方法,可在相同总 token 预算下降低高风险错误,还能减少代价加权错误并降低延迟,泛化性良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08961 2026-08-11 cs.LG 新提交 57%

Gradient Under Microscope: Benchmarking Resource Utilization of Memory-Efficient Gradient Computation Methods

显微镜下的梯度:对内存高效梯度计算方法的资源利用基准测试

Sarthak Mahapatra, Zihan Zhou, Khatoon Khedri, Mehdi Hosseinzadeh, Reza Rawassizadeh

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 该研究针对四种Transformer架构,测试五种梯度优化器在三种内存策略下的资源利用,发现梯度累积效果最优,Adam并非普遍最优,梯度检查点效果依赖架构,为模型训练部署提供实用指南。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08627 2026-08-11 cs.AI 新提交 57%

UniMoMo: Expert Merging-Based MoE Acceleration for Large Recommendation Models

UniMoMo:基于专家合并的大推荐模型混合专家(MoE)加速方法

Lei Xin, Bin Gu, Peize Li, Zitong Wang, Jianbo Zhao, Changjiang Jiang, Yanyue Xie, Chao Huang, Xuyang Zhao, Zunhai Su, Fanhu Zeng, Zhenglun Kong

机构 * Kuaishou Technology(快手科技) Hohai University(河海大学) Wuhan University(武汉大学) ByteDance, Seed(字节跳动 Seed) Alibaba, Ant Group(阿里巴巴蚂蚁集团) ByteDance, Douyin(字节跳动抖音) The University of Hong Kong(香港大学) Harvard University(哈佛大学)

专题命中 效率与部署 :post-training(abstract);分类 cs.AI

AI总结 UniMoMo是一种后训练压缩框架,通过功能相似性合并MoE专家并引入层自适应保护,在Amazon Beauty等三个数据集上实现推荐MoE的高效压缩与加速,且性能损失极小。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏