arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1009 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 1009 篇

2502.12096 2026-07-07 cs.MM cs.CV cs.IT eess.SP math.IT 版本更新 75%

Token Communications: A Large Model-Driven Framework for Cross-modal Context-aware Semantic Communications

令牌通信:一种用于跨模态上下文感知语义通信的大模型驱动框架

Li Qiao, Mahdi Boloursaz Mashhadi, Zhen Gao, Rahim Tafazolli, Mehdi Bennis, Dusit Niyato

机构 * School of Information and Electronics, Beijing Institute of Technology, Beijing 100081, China(信息与电子学院,北京理工大学,北京) GIC & 6GIC, Institute for Communication Systems (ICS), University of Surrey, Guildford, United Kingdom(5GIC与6GIC,通信系统研究所(ICS), Surrey大学, Guildford,英国) Centre for Wireless Communications, University of Oulu, 90014 Oulu, Finland(无线通信中心,奥卢大学, Oulu,芬兰) School of Computer Science and Engineering, Nanyang Technological University, Singapore 639798(计算机科学与工程学院,南洋理工大学, Singapore)

专题命中 效率与部署 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 介绍令牌通信框架,借助生成基础模型和多模态大语言模型,以令牌为通信单元,在语义通信中利用跨模态上下文信息,提升带宽效率,并给出关键原则与研究方向。

Comments Accepted at IEEE Wireless Communications Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22048 2026-07-03 cs.SE 版本更新 75%

Dynamic analysis enhances issue resolution

动态分析增强问题解决

Mingwei Liu, Zihao Wang, Zhenxi Chen, Zheng Pei, Yanlin Wang, Zibin Zheng

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出DAIRA框架,通过动态分析提升代码缺陷修复效率,实现高准确率和低资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05275 2026-07-02 cs.CV 版本更新 75%

Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs

Magic-MM-Embedding: 面向视觉令牌高效的多模态大语言模型通用嵌入

Qi Li, Yanzhe Zhao, Yongxin Zhou, Yameng Wang, Yandong Yang, Yuanjia Zhou, Jinxiang Liu

机构 * Honor Device Co., Ltd., China(荣耀终端有限公司,中国)

专题命中 效率与部署 :large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 提出Magic-MM-Embedding,通过视觉令牌压缩架构和多阶段渐进训练策略,在通用多模态嵌入中实现高效率和最先进性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30553 2026-07-01 cs.AR cs.DC 版本更新 75%

COSM: A Cooperative Scheduling Framework for Concurrent PIM and CPU Execution on Mobile Devices

COSM:一种用于移动设备上并发PIM和CPU执行的协同调度框架

Yilong Zhao, Fangxin Liu, Onur Mutlu, Mingyu Gao, Jian Liu, Haibing Guan, Li Jiang

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出COSM框架,通过低干扰PIM控制接口和空闲感知调度方法,实现移动设备上PIM与CPU的并发执行,提升PIM吞吐量达2.8倍且CPU性能损失小于2.0%。

Comments 18 pages, 13 figures, ISCA'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26872 2026-06-29 cs.LG cs.AI cs.CL 版本更新 75%

The Strongest Teacher Is Not Always the Best Teacher: Student-Centric Answer Selection

最强的教师并不总是最好的教师:以学生为中心的答案选择

Zhengyu Hu, Zheyuan Xiao, Linxin Song, Fengqing Jiang, Yuetai Li, Zhihan Xiong, Yue Liu, Junhao Lin, Yao Su, Lijie Hu, Kaize Ding, Teng Xiao, Radha Poovendran

机构 * University of Washington(华盛顿大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Southern California(南加州大学) Independent Researcher(独立研究者) National University of Singapore(新加坡国立大学) Microsoft(微软) Google(谷歌) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Northwestern University(西北大学) Allen Institute for AI (AI2)(人工智能研究院(AI2))

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出以学生为中心的答案采样(SCAS)框架,通过估计学生中心的学习成本选择教师生成的答案,从而提升学生模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16886 2026-06-29 cs.CL cs.AI cs.LG 版本更新 75%

ReFreeKV: Towards Threshold-Free KV Cache Compression

ReFreeKV: 迈向无阈值的KV缓存压缩

Xuanfan Ni, Liyan Xu, Chenyang Lyu, Longyue Wang, Mo Yu, Lemao Liu, Fandong Meng, Jie Zhou, Piji Li

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对KV缓存压缩中阈值依赖导致性能不稳定的问题,提出无阈值方法ReFreeKV,自适应调整预算分配,在13个数据集上保持全缓存性能。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17917 2026-06-25 cs.LG cs.AI cs.CL cs.CV 版本更新 75%

Streaming-dLLM: Accelerating Diffusion LLMs via Suffix Pruning and Dynamic Decoding

Streaming-dLLM: 通过后缀剪枝和动态解码加速扩散大语言模型

Zhongyu Xiao, Zhiwei Hao, Jianyuan Guo, Yong Luo, Jia Liu, Jie Xu, Han Hu

机构 * School of information(信息学院) Electronics, Beijing Institute of Technology, Beijing(电子学院,北京理工大学,北京) Department of Computer Science, City University of Hong Kong, Hong Kong(计算机科学系,香港城市大学,香港) School of Computer Science, Wuhan University, Wuhan(计算机科学学院,武汉大学,武汉) School of Economics(经济学院) Management, Communication University of China, Beijing(管理学院,中国传媒大学,北京) School of Science(科学学院) Engineering, The Chinese University of Hong Kong (Shenzhen), Shenzhen(工程学院,香港中文大学(深圳),深圳)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出Streaming-dLLM,通过空间上的注意力引导后缀建模剪枝冗余掩码令牌和时间上的动态置信度感知早停策略,实现无需训练的扩散大语言模型推理加速,最高达68.2倍加速且保持生成质量。

Comments Tech report. Code is available at https://github.com/xiaoshideta/Streaming-dLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06952 2026-06-19 cs.CV 版本更新 75%

LaTtE-Flow: Layerwise Timestep-Expert Flow-based Transformer

LaTtE-Flow: 基于层间时间步专家流的Transformer

Ying Shen, Zhiyang Xu, Jiuhai Chen, Shizhe Diao, Jiaxin Zhang, Yuguang Yao, Joy Rimchala, Ismini Lourentzou, Lifu Huang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Maryland(马里兰大学) Nvidia(英伟达) Salesforce AI Research(Salesforce AI研究) Intuit AI Research(Intuit AI研究)

专题命中 效率与部署 :language model(abstract);foundation model(abstract);pretraining(abstract)

AI总结 提出LaTtE-Flow,一种基于预训练视觉语言模型的高效统一架构,通过层间时间步专家流和条件残差注意力机制,实现图像理解与生成,生成速度提升约6倍。

Comments Unified multimodal model, Flow-matching

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15201 2026-06-11 cs.LG cs.AI cs.CL stat.ML 版本更新 75%

Pass@K Policy Optimization: Solving Harder Reinforcement Learning Problems

Pass@K 策略优化:解决更困难的强化学习问题

Christian Walder, Deep Karkhanis

机构 * Google DeepMind(谷歌DeepMind)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出 Pass-at-k 策略优化 (PKPO),通过变换奖励直接优化 pass@k 性能,利用低方差无偏估计器,在训练中退火 k 可同时提升 pass@1 和 pass@k,解决更难问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06042 2026-06-08 cs.CV 版本更新 75%

LoomVideo: Unifying Multimodal Inputs into Video Generation and Editing

LoomVideo: 统一多模态输入到视频生成与编辑

Jianzong Wu, Hao Lian, Jiongfan Yang, Dachao Hao, Ye Tian, Yunhai Tong, Jingyuan Zhu, Biaolong Chen, Qiaosong Qi, Aixi Zhang, Wanggui He, Mushui Liu, Jinlong Liu, Pipei Huang, Hao Jiang

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团)

专题命中 效率与部署 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 提出LoomVideo,一种5B参数的高效统一架构,通过多模态大语言模型和零开销Scale-and-Add条件机制,实现视频生成与编辑,显著降低计算复杂度并加速推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13911 2026-08-14 cs.CV cs.LG 版本更新 74%

Continual Distillation Learning for Rehearsal-Free Class-Incremental Learning via Decoupled Prompting

通过解耦提示学习实现无重放类增量学习的连续蒸馏学习

Qifan Zhang, Yunhui Guo, Yu Xiang

机构 * Department of Computer Science University of Texas at Dallas(计算机科学系 德州大学达拉斯分校)

专题命中 效率与部署 :prompting(title);分类 cs.LG

AI总结 该研究针对无重放类增量学习,提出解耦连续蒸馏学习(D-CDL),通过解耦提示与蒸馏提升跨模型知识迁移能力,在多数据集实验中优于现有蒸馏基线。

Comments Accepted at CoLLAs 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23893 2026-08-04 cs.IR cs.CL cs.CY 版本更新 74%

Who Gets Named: Citation Type Predicts Individual Naming by Grounded Language Models, and a Roster Instrument Captures 0.5% of It

谁会被提及:引用类型可预测基础语言模型的个体提及情况,而一份名册工具仅捕捉到其中的0.5%

Dmitrij Żatuchin

专题命中 效率与部署 :language model(title);分类 cs.CL

AI总结 研究在买家选人的类别中,通过API调用研究语言模型提及个体情况,发现类别主导、模型有差异,引用类型可预测提及,引用量不能,还通过名册测量个体AI可见性,发现其只覆盖模型行为的一小部分且不具代表性。

Comments 28 pages, 5 figures. Data: https://doi.org/10.5281/zenodo.21612690

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25062 2026-08-04 cs.LG 版本更新 74%

SIGMA: Semantic Identifier Grouping for Molecular Autoregression

SIGMA: 通过自回归对比学习实现的结构不变生成分子对齐用于化学语言模型

Xinyu Wang, Fei Dou, Jinbo Bi, Minghu Song

机构 * School of Computing, University of Connecticut(康涅狄格大学计算学院) Institute for Artificial Intelligence, University of Georgia(佐治亚大学人工智能研究所) Institute of Hydrobiology, Chinese Academy of Sciences(中国科学院水生生物研究所)

专题命中 效率与部署 :language model(title);分类 cs.LG

AI总结 本文提出SIGMA方法,通过自回归对比学习解决分子序列生成中的结构不一致问题,提升生成效率与结构多样性。

Comments 9 pages, 2 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05313 2026-07-14 cs.LG 版本更新 74%

Controllably Efficient Language Models

可控高效语言模型

Jatin Prakash, Aahlad Puli, Rajesh Ranganath

机构 * New York University(纽约大学)

专题命中 效率与部署 :language model(title);分类 cs.LG

AI总结 研究提出可控高效语言模型CAT,通过关注压缩序列块解码,能在训练时控制推理成本与质量的权衡,测试时无需重新训练,使用密集注意力作混合器可匹配多种高效模型,在长上下文理解任务中表现出色且吞吐量高。

Comments Preprint v2; Added more experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19635 2026-07-07 cs.SD cs.AI 版本更新 74%

StarTSE: Towards Streaming Target Speaker Extraction via Chunk-wise Interleaved Splicing of Autoregressive Language Model

面向流式目标说话人提取的分块交织拼接自回归语言模型

Shuhai Peng, Hui Lu, Jinjiang Liu, Liyang Chen, Guiping Zhong, Jiakui Li, Huimeng Wang, Haiyun Li, Liang Cao, Shiyin Kang, Zhiyong Wu

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) The Chinese University of Hong Kong(香港中文大学) SenseTime Research(商汤科技研究院)

专题命中 效率与部署 :language model(title);分类 cs.AI

AI总结 本文提出一种分块交织拼接方法,用于提升流式目标说话人提取的效率与稳定性,实验表明其在低延迟下保持高性能且优于离线基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15136 2026-06-23 stat.ML cs.LG 版本更新 74%

Universal priors: solving empirical Bayes via Bayesian inference and pretraining

通用先验:通过贝叶斯推断和预训练解决经验贝叶斯问题

Nick Cannella, Anzo Teh, Yanjun Han, Yury Polyanskiy

机构 * Courant Institute of Mathematical Sciences, NYU(纽约大学Courant数学科学研究所) Center for Data Science, NYU(纽约大学数据科学中心) Department of EECS, MIT(麻省理工学院电子工程与计算机科学系)

专题命中 效率与部署 :pretraining(title);分类 cs.LG

AI总结 本文从理论上证明,在合成数据上预训练的Transformer能通过后验收缩自适应未知测试分布,实现经验贝叶斯问题的近最优遗憾界。

Comments To appear at COLT 2026. 43 pages, 5 figures. Code release at https://github.com/Anzoteh96/eb-transformers

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28378 2026-06-17 cs.SD cs.AI 版本更新 74%

Membership Inference Attacks against Large Audio Language Models

针对大型音频语言的成员推断攻击

Jia-Kai Dong, Yu-Xiang Lin, Hung-Yi Lee

机构 * National Taiwan University(国立台湾大学) NTU Artificial Intelligence Center of Research Excellence(国立成功大学人工智能卓越研究中心)

专题命中 效率与部署 :language model(title);分类 cs.AI

AI总结 首次系统评估大型音频语言模型的成员推断攻击,提出盲基线协议控制分布偏移,发现跨模态记忆仅源于说话人声纹与文本绑定。

Comments Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10046 2026-06-11 cs.SD cs.AI 版本更新 74%

Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models

潜流内部:音频分离基础模型中注意力动力学的因果解读

Yuxuan Chen, Haoyuan Yu, Peize He

机构 * Jilin University(吉林大学) Hunan University(湖南大学) University of Electronic Science and Technology of China(电子科学与技术大学)

专题命中 效率与部署 :foundation model(title);分类 cs.AI

AI总结 本文通过因果干预协议揭示流匹配Transformer在音频分离中的双路径注意力机制,并提出无训练加速方法LSAC,在保持质量的同时减少约25%自注意力计算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06564 2026-08-14 cs.LG cs.CL 版本更新 73%

Which Decisions Low-Bit Quantization Breaks, and How to Predict Them

量化损伤是乘法性的,而非加法性的

Zekun Wu, Swati Dhiman, Adriano Koshiyama

机构 * Holistic AI(霍利斯提克人工智能公司) University College London(伦敦大学学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 该研究发现大型语言模型的量化损伤是乘法性的,而非加法性的,提出边际收缩概念,拟合关系可准确预测决策翻转率,增加1位是修复损伤最廉价的方式。

Comments 18 pages, 9 figures, 8 tables. Under review at the Third Workshop on Uncertainty-Aware NLP (UncertaiNLP), EMNLP 2026 (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27431 2026-08-14 cs.LG cs.AI 版本更新 73%

SE(3)-MeanFlow: Few-Step Protein Backbone Generation on Lie Groups

SE(3)-MeanFlow:李群上的少步蛋白质主链生成

Yikun Bai, Binghang Lu, Yikai Liu, Elaheh Akbari, Soheil Kolouri, Linxuan Wang, Ping He, Shuchan Wang, Ruqi Zhang, Guang Lin

机构 * Purdue University(普渡大学) Vanderbilt University(范德堡大学) Freie Universität Berlin(柏林自由大学)

专题命中 效率与部署 :pretraining(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 SE(3)-MeanFlow将MeanFlow扩展到李群几何,通过新训练目标实现少步蛋白质主链生成,性能优于多倍采样的流匹配基线,适配高通量设计需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05678 2026-08-14 cs.CL cs.AI 版本更新 73%

Gradual Code-Switching as Inference-Time Cross-Lingual Representational Alignment for LLMs

渐进式代码切换作为大语言模型推理时的跨语言表征对齐

Haneul Yoo, Jiho Jin, Kyunghyun Cho, Alice Oh

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型跨语言性能不均衡问题,提出推理时的代码切换上下文学习机制,经多模型、多语言、多数据集验证,可显著提升目标及未见语言任务性能,尤其在低资源场景表现突出。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20244 2026-08-11 cs.CL cs.AI 版本更新 73%

Hybrid Policy Distillation for LLMs

混合策略蒸馏用于大语言模型

Wenhong Zhu, Ruobing Xie, Rui Wang, Pengfei Liu

机构 * Department of Computer Science(计算机科学系) Engineering, Shanghai Jiao Tong University(上海交通大学工程学院) Shanghai Innovation Institute(上海创新研究院) Large Language Department, Tencent(腾讯大语言部门)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出混合策略蒸馏方法,结合正反KL散度优势,提升模型生成能力和效率,验证了其在多种任务中的有效性。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05164 2026-08-11 cs.LG cs.AI 版本更新 73%

Not All Turns Are Equally Hard: Adaptive Thinking Budgets For Efficient Multi-Turn Reasoning in Agents

并非所有转折都同样困难:为高效多轮推理的自适应思维预算

Neharika Jali, Anupam Nayak, Gauri Joshi

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出TAB方法,通过自适应预算分配提升多轮推理效率,在数学推理基准中实现更高的准确率与token节省。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01900 2026-08-11 cs.CL cs.LG 版本更新 73%

High-Layer Attention Pruning with Rescaling

高层注意力剪枝与重缩放

Songtao Liu, Peng Liu

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种高层注意力剪枝与重缩放方法,通过自适应重缩放参数优化表示尺度,提升LLMs在生成任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19366 2026-08-11 cs.CL cs.LG 版本更新 73%

MoE-Prism: Disentangling Monolithic Experts for Elastic MoE Services via Model-System Co-Designs

MoE-Prism:通过模型-系统协同设计解耦整体式专家以实现弹性MoE服务

Xinfeng Xia, Xiaofeng Hou, Jiacheng Liu, Wenfeng Wang, Mingxuan Zhang, Peng Tang, Chao Li, Minyi Guo

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 MoE-Prism通过模型-系统协同设计将MoE的整体专家分解为细粒度子专家,实现请求级计算弹性,扩展路由工作点数量,提升吞吐量并降低首包时间,验证了实用弹性MoE服务的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28633 2026-08-10 cs.LG cs.AI cs.PF 版本更新 73%

Topology-Aware Data Movement for Disaggregated GPU Inference

面向拆分式GPU推理的拓扑感知数据移动

Sanjeev Rao Ganjihal

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 针对拆分式GPU推理中现有系统忽略GPU间带宽差异的问题,本文设计拓扑感知传输编排器,通过三项机制实现3至18倍传输延迟降低。

Comments 8 pages, 4 tables, 1 algorithm. v2: corrects MLA compression to 57x (576 dims per DeepSeek); fixes a factor-of-two in GQA sizing rows and all dependent transfer numbers (Llama-70B 4K = 1.3 GB); pipelining band recomputed (76 to 100 percent); PCIe on Gen5; NIXL positioning added; NVLink 5 and 2026 model notes (bandwidth- and bytes-parametric); wording fixes

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02691 2026-08-07 cs.LG cs.AI 版本更新 73%

Output-Aware Rotation for INT2 KV-Cache Quantization

面向INT2 KV缓存量化的输出感知旋转

Vincent-Daniel Yun, Woosang Lim, Minsoo Cheong, Sunwoo Lee, Murali Annavaram, Sai Praneeth Karimireddy, Sungjoo Yoo

机构 * University of Southern California(南加州大学) Seoul National University(首尔大学) Inha University(仁荷大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对长上下文大模型KV缓存的INT2量化瓶颈,提出OptR输出感知旋转方法,通过分解误差、学习正交修正等,提升QuaRot等性能并增强长上下文检索能力,且开销可忽略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28076 2026-08-04 cs.AI cs.LG 版本更新 73%

Group-Reflective Self-Distillation for Agentic Reinforcement Learning

面向智能体强化学习的组内自蒸馏方法

Binbin Zheng, Zijun Xie, Guanqun Zhao, Enlei Gong, Xing Ma, Xiaoliang Fu, Zeyu Chen

机构 * Baidu(百度)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对智能体强化学习中终端奖励监督粗粒度的问题,提出组内自蒸馏方法,利用策略自身已验证轨迹生成指导,细化回合级信用分配,在多环境多模型上性能优于基线且泛化性更好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22583 2026-08-04 cs.AI cs.CL 版本更新 73%

Multi-Objective Structured Pruning of LLMs for Latency and Model Size Optimization

用于延迟和模型大小优化的大语言模型多目标结构化剪枝

Muhammad Junaid Ali, Smail Niar, El-Ghazali Talbi

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型在边缘计算环境部署的挑战,提出硬件感知多目标结构化剪枝框架,分两阶段优化,粗粒度移除模块,细粒度搜索最优剪枝率,实验证明能降低模型复杂度,在多方面实现良好权衡,适合边缘部署。

Comments Submitted to the ICTAI 2026 (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17055 2026-08-04 cs.LG cs.AI 版本更新 73%

GradientStabilizer:Fix the Norm, Not the Gradient

GradientStabilizer:固定范数,而非梯度

Tianjin Huang, Zhangyang Wang, Haotian Hu, Zhenyu Zhang, Gaojie Jin, Xiang Li, Li Shen, Jiaxing Shang, Tianlong Chen, Ke Li, Lu Liu, Qingsong Wen, Shiwei Liu

机构 * Department of Computer Science, University of Exeter(埃克塞特大学计算机科学系) Department of Mathematics and Computer Science, Eindhoven University of Technology(埃因霍温理工大学数学与计算机科学系) School of the Gifted Young, University of Science and Technology of China(中国科学技术大学天才青年学院) Department of Electrical and Computer Engineering, University of Texas at Austin(德克萨斯大学奥斯汀分校电气与计算机工程系) Department of Computer Science, University of Reading(阅读大学计算机科学系) School of Cyber Science and Technology, Sun Yat-sen University(中山大学网络科学与技术学院) Department of Computer Science, The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校计算机科学系) ELLIS Institute Tubingen(图宾根ELLIS研究所) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Tübingen AI Center, Tübingen, Germany(图宾根人工智能中心,德国图宾根) College of Computer Science, Chongqing University(重庆大学计算机学院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出GradientStabilizer,一种轻量级梯度变换方法,通过统计稳定的梯度范数估计替换更新幅度,在不改变梯度方向的前提下抑制极端梯度尖峰,从而提升训练稳定性并减少发散。

Comments Accepted By ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏