arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-07 至 2026-07-07 共收录 122 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 122 篇

2607.02072 2026-07-07 cs.LG cs.AI cs.CR 新提交 92%

kNNGuard: Turning LLM Hidden Activations into a Training-Free Configurable Guardrail

kNNGuard:将LLM隐藏激活转化为无需训练的可配置护栏

Mahmoud Abdelfattah, Hamid Nasiri, Peter Garraghan

机构 * Lancaster University(兰卡斯特大学) Mindgard

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出kNNGuard,一种利用现成LLM激活空间的无需训练护栏,通过多层kNN融合激活和嵌入空间分数,在多个领域达到与微调方法相当或更优的F1,且速度更快。

Comments 17 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04749 2026-07-07 cs.DC 新提交 90%

Direct Model State Migration for Elastic Training of Large Language Models

用于大语言模型弹性训练的直接模型状态迁移

Weijian Liu, Mingzhen Li, Rui Kang, Chen Sun, Guangming Tan, Weile Jia

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 研究大语言模型训练适应共享集群动态资源的问题,提出无检查点状态迁移框架ETC,利用状态局部性和通信合并减少GPU间数据移动,相比基于检查点的方案降低迁移开销,实现高效弹性训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09544 2026-07-07 cs.CL cs.AI cs.LG 版本更新 90%

Large Language Models Generate Harmful Responses Using a Distinct Mechanism, Shared Across Harm Types

大语言模型通过一种独特的统一机制生成有害内容

Hadas Orgad, Boyi Wei, Kaden Zheng, Martin Wattenberg, Peter Henderson, Seraphina Goldfarb-Tarrant, Yonatan Belinkov

机构 * Kempner Institute, Harvard University(哈佛大学肯普纳研究所) Princeton University(普林斯顿大学) Harvard University(哈佛大学) Cohere Technion—IIT(以色列理工学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过权重剪枝揭示大语言模型中有害生成的内部结构,发现有害内容生成依赖于一组通用且与良性能力不同的权重,表明对齐训练重塑了有害表示,解释了领域微调引发的广泛对齐偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09972 2026-07-07 cs.LG cs.CL cs.NE 90%

AP-BMM: Approximating Capability-Cost Pareto Sets of LLMs via Asynchronous Prior-Guided Bayesian Model Merging

AP-BMM: 通过异步先验引导的贝叶斯模型合并近似LLM的能力-成本帕累托集

Kesheng Chen, Yamin Hu, Zhenqian Zhu, Yiya Diao, Wenjian Luo

机构 * Guangdong Provincial Key Laboratory of Novel Security Intelligence Technologies(广东新型安全智能技术重点实验室) Institute of Cyberspace Security(网络空间安全研究院) School of Computer Science and Technology(计算机科学与技术学院)

专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出AP-BMM方法,通过异步贝叶斯优化和层间合并策略,提升LLM在准确性和成本之间的帕累托集质量与覆盖范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04379 2026-07-07 cs.CR 新提交 89%

Knowledge Base Poisoning Attacks and Defense for Policy-Aware LLM-RAG Framework

用于战场物联网任务控制的策略感知大语言模型检索增强生成(PA-LLM-RAG)框架的知识库中毒攻击与防御

Om Solanki, Lopamudra Praharaj, Deepti Gupta, Maanak Gupta

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 研究针对战场物联网任务控制的PA-LLM-RAG框架的对抗安全。提出查询无关语义检索中毒攻击,能注入规则致大语言模型上下文损坏。还提出CLD-KB防御框架,在检测中毒和知识保存方面性能优异。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05055 2026-07-07 cs.AI 新提交 89%

Toward Trustworthy Large Language Model Agents in Healthcare

迈向医疗保健领域值得信赖的大语言模型智能体

Hadi Hasan, Safaa Salman, Adam Tai Abou Dargham, Ammar Mohanna, Ali Chehab

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 针对医疗预约调度瓶颈,提出CareConnect智能体,利用大语言模型函数调用等技术,协调工具支持预约操作,设安全护栏。经评估有高任务完成率、安全合规性及成本效益,能自动化复杂医疗工作流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04562 2026-07-07 cs.AI cs.NE 新提交 89%

Heaviside Continuity of Rolling Coefficients for Eliminating Epistemic Entropy in Large Language Models

用于消除大语言模型认知熵的滚动系数的海维赛德连续性

MY Pitsane, Hope Mogale

机构 * North-West University, RSA(南非北开普大学) University of Pretoria, RSA(南非彼得里亚大学) Mankind Research Labs, Sandton(沙顿人类研究实验室)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 研究大语言模型输出难检测错误的问题,提出海维赛德连续性的滚动系数框架,将推理重新表述为谓词门控状态转换,结合模型置信度与并行验证信号,防止无效状态传播,降低认知熵。

Comments A First draft

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04290 2026-07-07 cs.NI cs.AI 新提交 89%

Agentic-V2X: Small Language Model Agents for Deadline-Aware V2X Scheduling in 5G/6G Networks

Agentic-V2X:用于5G/6G网络中具有截止日期感知的V2X调度的小型语言模型代理

Gerasimos Papanikolaou-Ntais, Alexandros Kaloxylos, Athanasios Kanavos

机构 * Department of Informatics, University of Piraeus(比雷埃克斯大学信息学院) Department of Informatics and Telecommunications, University of Peloponnese(希腊佩拉索斯大学信息与电信学院)

专题命中 效率与部署 :language model(title,abstract);small language model(title);LLM(abstract);large language model(abstract)

AI总结 研究针对5G/6G网络中V2X调度,提出Agentic-V2X架构。小型本地部署语言模型生成策略,经验证后由轻量级控制器执行,评估多种策略,该架构能生成有效可执行策略,在多方面有竞争力,但非最佳。

Comments 20 pages 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05353 2026-07-07 cs.CR cs.AI cs.CL cs.LG 新提交 89%

Selective Disclosure Watermarking for Large Language Models

面向大语言模型的选择性披露水印技术

Xuyang Chen, Xiang Li, Yangxinyu Xie, Qi Long

机构 * Xuyang Chen 1(陈绪阳 1) Xiang Li 1(李翔 1) Yangxinyu Xie 1(谢洋新宇 1) Qi Long 1(龙启 1)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对现有多比特LLM水印无法部分披露引发隐私泄露问题,提出分层词汇路由框架,实现细粒度水印访问控制,保障文本质量且检测精度高、延迟低。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12993 2026-07-07 cs.AR 版本更新 89%

HPIM: Heterogeneous Processing-In-Memory-based Accelerator for Large Language Models Inference

HPIM:用于大语言模型推理的基于异构内存内处理的加速器

Cenlin Duan, Jianlei Yang, Rubing Yang, Yikun Wang, Yiou Wang, Lingkun Long, Yingjie Qi, Xiaolin He, Ao Zhou, Xueyan Wang, Weisheng Zhao

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 针对大语言模型推理挑战,提出HPIM,用软硬件协同设计,将工作负载依特性分至SRAM-PIM和HBM-PIM子系统,引入耦合管道策略,显著优于现有加速器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03050 2026-07-07 cs.LG cs.AI cs.CV cs.SD 新提交 88%

OmniFocus: Query-Guided Modality-Balanced Token Compression for Omni-Modal Large Language Models

OmniFocus:用于全模态大语言模型的查询引导模态平衡令牌压缩

Shijie Cao, Qingyu Zhang, Boxi Yu, Yuzhong Zhang, Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉科学学院) Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所中文信息处理实验室) University of Limerick(利默里克大学) CUHK, Shenzhen(香港中文大学(深圳))

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究全模态大语言模型推理成本高的问题,提出无训练的查询引导令牌压缩方法OmniFocus,独立评估音视频重要性,实现模态对称压缩,提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24044 2026-07-07 cs.DC cs.AI cs.CL cs.LG 版本更新 88%

Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving

用于分布式大语言模型适配器服务的GPU效率数据驱动优化

Ferran Agullo, Joan Oliveras, Chen Wang, Alberto Gutierrez-Torre, Olivier Tardieu, Alaa Youssef, Jordi Torres, Josep Ll. Berral

机构 * BSC(巴塞罗那超级计算中心) IBM(国际商业机器公司) UPC(巴塞罗那技术大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究分布式大语言模型适配器服务中GPU资源利用问题,提出数据驱动管道,通过性能预测、数字孪生等组件,以最少GPU服务工作负载,提升效率,还可用于其他目标。

Comments update of the journal paper contents after major revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15206 2026-07-07 cs.CL 版本更新 88%

Fair-GPTQ: Bias-Aware Quantization for Large Language Models

Fair-GPTQ:大语言模型的偏差感知量化

Irina Proskurina, Guillaume Metzler, Julien Velcin

机构 * Université Claude Bernard Lyon 1(克莱尔伯恩大学里昂1分校) Université Lumière Lyon 2(里昂2大学) ERIC École Centrale de Lyon(里昂中央理工学院) LIRIS CNRS UMR 5205(国家科学研究中心UMR 5205)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究针对生成式语言模型高内存需求的量化问题,通过在量化目标中添加显式组公平约束建立与模型公平的新联系,引入Fair-GPTQ减少大语言模型不公平性,性能影响小且保留量化优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03333 2026-07-07 cs.DC cs.AI cs.LG 新提交 88%

SPORK: Self-Speculative Forking to Accelerate Agentic LLM Inference

SPORK:自我推测性分叉以加速智能体大语言模型推理

Huajun Bai, Weiwei Lv, Huichuan Zheng, Youyou Lu, Jiwu Shu

机构 * Tsinghua University(清华大学) Meituan(美团)

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.AI、cs.LG

AI总结 研究LLM智能体推理中串行循环耗时问题,提出SPORK方法,利用模型自身预测提前调度推测工具调用,通过成本模型等组件优化,大幅提升推理效率且不影响任务准确性。

Comments 16 pages, 15 figures. Code: https://github.com/baihuajun24/spork

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02930 2026-07-07 cs.CV 新提交 88%

CL-Anomaly: Layer-Adaptive Mixture-of-Experts with Multimodal Large Language Model for Continual Learning in Anomaly Detection

CL-Anomaly:用于异常检测中持续学习的具有多模态大语言模型的层自适应专家混合模型

Wen Dong, Zhao Wang, Shuangqing Zhang, Kai Sun, Ben Li, Guo-Sen Xie, Caifeng Shan, Fang Zhao

机构 * Nanjing University(南京大学) China Mobile Zijin Innovation Institute(中国移动紫金创新研究院) Nanjing University of Science and Technology(南京理工大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 针对多模态大语言模型持续学习计算昂贵及现有方法语义纠缠问题,提出CL-Anomaly框架,用隔离共享协作实现参数高效微调,介绍任务私有专家PrivLoRA等,实验表明其性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11943 2026-07-07 cs.OS cs.LG 版本更新 87%

ProbeLogits: Kernel-Level LLM Inference Primitives for AI-Native Operating Systems

ProbeLogits:面向AI原生操作系统内核级的LLM推理原语

Daeyeon Son

机构 * Independent Researcher(独立研究者)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 本文提出ProbeLogits,一种在操作系统内核层面执行单次前向传递并读取特定token logit的原语,用于分类代理行为的安全性,通过校准强度alpha实现部署时的策略控制,提升安全性与效率。

Comments 18 pages, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04428 2026-07-07 cs.CL cs.AI 新提交 86%

dOPSD: On-Policy Self-Distillation for Diffusion Language Models

dOPSD:扩散语言模型的策略内自蒸馏

Phuong Tuan Dat, Qi Li, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 研究扩散语言模型强化推理难的问题,提出dOPSD,通过从学生去噪轨迹直接推导教师特权信息,实现策略内自蒸馏,提升模型在数学推理和代码生成等任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01237 2026-07-07 cs.CL cs.AI 新提交 86%

KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression

Kara: 通过滑动窗口KV缓存压缩实现高效推理LLM服务

Shen Han, Yuyang Wu, Junpu Yu, Olexandr Isayev

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 效率与部署 :LLM(title,title_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对推理语言模型长思维链导致KV缓存过大、解码延迟高的问题,提出Kara滑动窗口KV缓存压缩方法,利用双向注意力评分选择信息性KV对并通过Token2Chunk模块扩展为块,结合PagedAttention构建KvLLM推理框架,降低内存占用并提升输出吞吐量。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21952 2026-07-07 cs.LG cs.AI cs.AR cs.NE cs.RO 86%

Focus Session: Hardware and Software Techniques for Accelerating Multimodal Foundation Models

聚焦会议:加速多模态基础模型的硬件和软件技术

Muhammad Shafique, Abdul Basit, Muhammad Abdullah Hanif, Alberto Marchisio, Rachmad Vidya Wicaksana Putra, Minghao Shao

机构 * eBRAIN Lab, New York University (NYU) Abu Dhabi(eBRAIN实验室,纽约大学(NYU)阿布扎比)

专题命中 效率与部署 :foundation model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出了一种多层方法,通过硬件和软件协同设计和优化流程,提升多模态基础模型的效率。方法包括混合精度量化、结构剪枝、推测解码等技术,结合硬件加速器优化计算和内存需求,验证了在医疗和代码生成任务中的有效性。

Comments Accepted at the Design, Automation and Test in Europe Conference (DATE), April 20-22, 2026 in Verona, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03174 2026-07-07 cs.SE cs.AI 新提交 85%

Effectiveness of LLM-based Software Diversity for Reliability Improvement -- an Empirical Study

基于大语言模型的软件多样性对可靠性提升的有效性——一项实证研究

Gabriel Almeida, Ilir Gashi, Vladimir Stankovic, João R. Campos

机构 * University of Coimbra, CISUC/LASI(科英布拉大学,CISUC/LASI) Centre for Software Reliability(软件可靠性中心) Department of Informatics Engineering(信息工程系) Department of Computer Science(计算机科学系) City St George’s, University of London(伦敦城市圣乔治大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型能否成为软件多样性的实用生成器及提升可靠性程度。通过扩展经典实证研究,对多种规范程序进行测试,探索大语言模型多样性多维度影响,结果表明其能助力可靠性提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04302 2026-07-07 cs.LG cs.AI cs.AR cs.CL cs.PF 新提交 85%

HiFA4: Training-Free 4-bit FlashAttention on Ascend HIF4 NPUs for LLM Inference

HiFA4:用于大语言模型推理的昇腾HIF4 NPU上的免训练4位FlashAttention

Hui Dong, Yanzhao Li, Jie Gao, Chunlu Li, Zhiyuan Zhang, Yupeng Sun, Zhenyuan Chen, Zhiqiang Zou

机构 * Huawei Technologies(华为技术有限公司)

专题命中 效率与部署 :LLM(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 HiFA4是一种训练后算子级设计,在昇腾NPU上用4位HIF4 Cube GEMM执行QK^T和PV进行大语言模型推理,结合Smooth-QK和P-Reordering机制,减少量化决策漂移,提升准确率。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04181 2026-07-07 cs.DC 新提交 85%

CoCoScale: Leveraging Layer-wise Scaling to Unlock the Potential of Online LLM Serving

CoCoScale:利用逐层缩放释放在线大语言模型服务的潜力

Jingfeng Wu, Yiyuan He, Minxian Xu, Xitong Gao, Chong Ma, Le Chen, Min Shen, Lin Qu, Kejiang Ye, CHengzhong Xu

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究在线大语言模型服务中动态工作负载问题,提出CoCoScale逐层动态缩放机制,通过利用闲置资源扩展热层并行度,减少冷启动延迟,提升动态适应性和资源效率。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04969 2026-07-07 cs.LG cs.CL 新提交 84%

Train Smarter, Not Longer: Memorization-Guided Data Reuse for Efficient LLM Training

更智能而非更长时间训练:用于高效大语言模型训练的记忆引导数据复用

Jingwei Zuo, Cong Zeng, Ilyas Chahed, Maksim Velikanov, Dhia Eddine Rhaiem, Pasquale Balsebre, Abhay Kumar, Younes Belkada, Hakim Hacid

机构 * Technology Innovation Institute(技术创新研究院)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究大语言模型训练范式,通过观察模型‘记忆窗口’信号,提出记忆引导数据复用范式,自适应决定数据复用时间和方式,为记忆感知训练计划奠定基础,助于用有限高质量数据更智能训练。

Comments Published as a paper at 3rd DATA-FM workshop @ ICLR 2026, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04574 2026-07-07 cs.LG cs.AI 新提交 84%

A Few Teacher Steps Go a Long Way: Cost-Efficient On-Policy Data Augmentation for Agent Post-Training

教师的少量步骤作用显著:智能体训练后基于策略的数据增强的成本效益

Junze Ye, Jiayi Cheng, Miao Lu, Michal Mankowski, Jose Blanchet, Mohsen Bayati

机构 * Stanford University(斯坦福大学) New York University(纽约大学)

专题命中 效率与部署 :post-training(title);LLM(abstract);SFT(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型智能体,将基于策略的数据构建视为预算分配问题,通过特定方式形式化设计空间,在多个任务中实验表明少量教师步骤在学习者诱导情境下更具成本效益。

Comments Accepted by ICML 2026 Workshop: RLxF: Reinforcement Learning from World Feedback

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03089 2026-07-07 cs.LG cs.AI 新提交 84%

STELLA: Efficient Sensor-to-LLM Translation for On-Device Human Activity Recognition

STELLA:用于设备端人类活动识别的高效传感器到语言模型翻译

Nirhoshan Sivaroopan, Albert Zomaya, Kanchana Thilakarathna

机构 * The University of Sydney(悉尼大学)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 研究设备端人类活动识别难题,提出STELLA框架,通过轻量级分层分词器压缩传感器数据,投影到预训练语言模型嵌入空间,结合自然语言提示打分,支持设备端个性化,提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03948 2026-07-07 cs.AI cs.LG math.OC 新提交 84%

Online Linear Programming for Multi-Objective Routing in LLM Serving

大语言模型服务中多目标路由的在线线性规划

Zixi Chen, Yinyu Ye, Zijie Zhou

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型服务在线路由问题,引入多目标优化框架将路由设为在线线性规划,应用高效出价控制策略,开发热启动投影一阶更新,集成路由器到模拟器,结果表明基于科学方法优于启发式方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12262 2026-07-07 cs.CL cs.LG 版本更新 84%

Few-Step Diffusion Language Models via Trajectory Self-Distillation

通过轨迹自蒸馏实现少步扩散语言模型

Tunyu Zhang, Xinxi Zhang, Ligong Han, Haizhou Shi, Xiaoxiao He, Zhuowei Li, Hao Wang, Kai Xu, Akash Srivastava, Chengzhi Mao, Hao Wang, Vladimir Pavlovic, Dimitris N. Metaxas

机构 * Rutgers University(罗格斯大学) Red Hat AI Innovation(红帽AI创新) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过轨迹自蒸馏框架训练少步学生模型,以匹配全步教师的生成轨迹,从而减少解码步骤带来的输出质量下降,并结合DDO提升推理任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02521 2026-07-07 cs.DC cs.LG cs.PL 新提交 83%

Tile-Level Activation Overlap for Efficient LLM Inference

用于高效大语言模型推理的瓦片级激活重叠

Abhinav Jangda, Tyler Sorensen, Sebastian Burckhardt, Jianlan YE, Chaoyin Li, Atul Gupta

机构 * Microsoft Research(微软研究院)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究针对现代大语言模型中SwiGLU中间张量物化成本高的问题,提出基于CUTLASS的SM90内核,通过瓦片级融合SwiGLU与GeMM,提升推理速度,验证手工设计的必要性且数值表现优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08791 2026-07-07 cs.DC cs.AI 版本更新 83%

Prima.cpp: Fast 30-70B LLM Inference on Heterogeneous and Low-Resource Home Clusters

Prima.cpp:在异构和低资源家用集群上进行快速30 - 70B语言模型推理

Zonghang Li, Tao Li, Wenjiao Feng, Rongxing Xiao, Jianshu She, Hong Huang, Mohsen Guizani, Hongfang Yu, Qirong Ho, Wei Xiang, Xue Liu

机构 * MBZUAI(穆罕默德·本·拉希德人工智能技术研究所) UESTC(电子科技大学) City University of Hong Kong(香港城市大学) La Trobe University(拉筹伯大学)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究在消费者家用集群上运行30 - 70B语言模型的挑战,提出分布式推理系统Prima.cpp,引入流水线环并行等方法,实现低内存压力下快速推理,相比其他方案有优势。

Comments 38 pages, 21 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08521 2026-07-07 cs.CV cs.AI 版本更新 83%

VISOR: Visual Input-based Steering for Output Redirection in Vision-Language Models

VISOR:视觉语言模型中用于输出重定向的基于视觉输入的转向

Mansi Phute, Ravikumar Balakrishnan

机构 * Georgia Institute of Technology(佐治亚理工学院) HiddenLayer, Inc(HiddenLayer公司)

专题命中 效率与部署 :language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 研究提出VISOR方法,通过优化视觉输入实现对视觉语言模型行为的精细控制,在关键对齐任务中验证其有效性,且具有低开销等优势,但也揭示了视觉通道安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏