arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-05 至 2026-08-05 共收录 439 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 95 篇

2607.28639 2026-08-05 cs.CL cs.AI cs.CY 版本更新 88%

The Asymmetric Effects of Knowledge Distillation on Bias in Small Language Models

知识蒸馏对小型语言模型偏见的非对称影响

Plawan Kumar Rath

机构 * Meta

专题命中 效率与部署 :language model(title,abstract);small language model(title);SFT(abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究发现知识蒸馏对小型语言模型偏见存在非对称影响,明确任务下提升上下文遵循能力,模糊任务下破坏弃权校准,提出PCCD协议可捕捉聚合指标遗漏的危害。

Comments 18 pages, 5 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25699 2026-08-05 cs.AR 版本更新 88%

NVLLM: A 3D NAND-Centric Architecture Enabling Edge on-Device LLM Inference

NVLLM:一种以3D NAND为中心的架构, enabling 边缘设备上的LLM推理

Mingbo Hao, Changwei Yan, Haoyu Cui, Zhihao Yan, Yizhi Ding, Zhangrui Qian, Weiwei Shan

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 NVLLM通过将前馈网络计算移至Flash并利用轻量CMOS逻辑执行注意力,实现边缘设备上的高效LLM推理,其在参数规模达30B的模型上实现了显著的加速。

Comments Published in the Proceedings of the 63rd ACM/IEEE Design Automation Conference (DAC 2026). This version includes additional supplementary material

Journal ref Proceedings of the 63rd ACM/IEEE Design Automation Conference (DAC 2026), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03083 2026-08-05 cs.CV cs.CL 新提交 88%

GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models

GSTEP:面向高效视频大语言模型的全局时空密度驱动视觉令牌剪枝

Mengjie Zhang, Qihui Zhu, Tao Zhang, Shuangwu Chen, Huihuang Qin, Yu Guo, Shenghao Ye, Zijian Wen, Yunpeng Hou, Dong Jin, Xiaobin Tan, Huasen He, Jian Yang

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出即插即用的GSTEP剪枝框架,解决现有视频令牌剪枝方法的局部剪枝缺陷,在多个VideoLLMs上实现良好的准确率-效率权衡,在LLaVA-OneVision-7B上剪去75%视觉令牌,保留100.2%原始性能并获1.17倍端到端加速。

Comments 4 figures, accepted to ACM MM 26'

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03494 2026-08-05 cs.CL cs.LG 新提交 88%

Beyond Initialization Loss: A Systematic Study of Token Embedding Initialization Strategies for LLM Vocabulary Extension

超越初始化损失:大语言模型词汇扩展的词元嵌入初始化策略的系统研究

Raviraj Joshi, Utkarsh Vaidya, Sanjay Singh Chauhan, Niranjan Wartikar

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对LLM词汇扩展,对比20余种初始化策略,发现子词组合方法更优,最优配置使CPT步骤减超6倍,轻量CPT可可靠选择最优初始化策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02947 2026-08-05 cs.LG cs.CL 新提交 88%

ATFlash: Per-RoPE-Wavelength Attention Windows for Compute/Memory-Efficient LLM Inference

ATFlash:用于计算/内存高效LLM推理的逐RoPE波长注意力窗口

Shun-ichiro Hayashi, Daichi Mukunoki, Tetsuya Hoshino, Takahiro Katagiri

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 ATFlash提出逐RoPE波长注意力窗口,修剪查询-键内积项,在保持长上下文任务性能的同时,可移植至FlashAttention-4等框架,在多款模型上实现LLM推理的计算与内存效率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03838 2026-08-05 cs.AI 新提交 87%

LatentGuard: Efficient and Inspectable Latent Reasoning for LLM Safeguards

LatentGuard:面向大语言模型安全防护的高效可检查潜在推理方法

Zhinan Liu, Jie Li, Mingyu Kang, Jiayi Ji

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.AI

AI总结 LatentGuard是将连续潜在推理引入防护模型的高效可检查框架,其8B参数版本在提升安全判定性能的同时大幅降低推理成本,还具备良好的审计效用,为可部署的LLM安全防护提供了可行路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03741 2026-08-05 cs.DC 新提交 87%

When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference

拆分何时划算?智能体大语言模型推理的预填-解码-注意力-前馈网络专业化模拟

Przemyslaw Forys, Haoran Wu, Can Xiao, Jiayi Nie, Tony Liu, Rika Antonova, Timothy Jones, Robert Mullins, Wayne Luk, Aaron Zhao, George A. Constantinides

专题命中 效率与部署 :LLM(title,summary_cn)

AI总结 该研究提出HeteroPanacea模拟框架,针对智能体LLM推理的预填-解码-注意力-前馈网络拆分,验证其可提升吞吐量,为异构智能体服务系统提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02681 2026-08-05 cs.CR 新提交 87%

Safety in Batches? Understanding and Mitigating Safety Failures in Batch Prompting

批量提示中的安全性?理解并缓解批量提示中的安全故障

Kihyun Kim, Hee-Seon Kim, Wonjun Lee, Changick Kim

专题命中 效率与部署 :prompting(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 该研究发现批量提示存在独特安全故障模式,可作为黑盒攻击实现高成功率,提出感知批量的偏好优化可缓解该漏洞,为大语言模型安全对齐提供了新方向。

Comments jailbreak, safety

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02641 2026-08-05 cs.SE cs.AI 新提交 86%

IR2Solve: Structured Intermediate Representations for Cost-Efficient Optimization Autoformulation

IR2Solve:面向成本高效优化自动建模的结构化中间表示

Penglin Zhu, Linhai Zhang, Jungang Xu, Xinchi Wei, Xiuqi Wu

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 IR2Solve以结构化中间表示为核心构建优化自动建模流水线,仅用1次LLM语义调用,在保证目标函数正确性的同时大幅降低推理成本,性能优于Chain-of-Experts和SAC-Opt等系统。

Comments 17 pages, 3 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09176 2026-08-05 cs.LG cs.AI math.OC 交叉投稿 86%

Navigating LLM Valley: From AdamW to Memory-Efficient and Matrix-Based Optimizers

在大语言模型谷中导航:从AdamW到内存高效和矩阵优化器

Aditya Ranganath

机构 * Center for Applied Scientific Computing(应用科学计算中心)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文探讨了大语言模型优化器的发展,从传统方法到内存高效和矩阵优化器,强调了在大规模训练中优化器的统计有效性、计算和内存效率。

Comments No figures, 65 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03033 2026-08-05 cs.AR eess.SP 新提交 86%

Interpolation of Non-Linear Functions for LLMs using Partial Reconfiguration in FPGAs

基于FPGA部分重配置的LLM非线性函数插值

Roger Morales-Monge, Nazareth Jimenez-Chacon, Jose Gabriel Villalobos-Alvarado, Luis G. Leon-Vega, Jorge Castro-Godinez

专题命中 效率与部署 :LLM(title_cn,summary_cn)

AI总结 该研究针对FPGA上LLM非线性函数实现成本高的问题,提出基于部分重配置的PWL插值框架,通过动态加载模块实现面积节省,验证了分段策略的权衡效果。

Comments Submitted to ICECS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28149 2026-08-05 cs.LG 版本更新 84%

Sign-Aware Gated Sparse Autoencoders: Modeling Anticorrelated Features with Bi-Jump-ReLU Activations

符号感知门控稀疏自编码器:使用Bi-Jump-ReLU激活函数建模反相关特征

Bartosz Wieciech, Zmnako Awrahman, Marcin Czelej, Victor Hugo Jaramillo Velasquez, Wioletta Stobieniecka

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出符号感知门控稀疏自编码器(SA-GSAE),通过双面门控稀疏性、符号幅度路径和辅助重构,利用Bi-Jump-ReLU激活实现双极性共享,在保持参数效率的同时,在多个LLM激活点上优于标准门控SAE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00837 2026-08-05 cs.CL cs.LG 版本更新 84%

Pruned BPE: Post-training Visibility Pruning and Token Reallocation for Byte Pair Encoding

剪枝BPE:针对字节对编码的训练后可见性剪枝与令牌重新分配

Kenny Shao

机构 * Florida International University(佛罗里达国际大学)

专题命中 效率与部署 :post-training(title,abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Pruned BPE方法,通过训练后可见性剪枝与令牌重新分配提升BPE词汇效率,在不增加模型可见词汇规模的情况下减少编码长度,取得了优于标准BPE的效果。

Comments 18 pages, 2 figures, 4 tables, and 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27405 2026-08-05 cs.CL cs.AI 版本更新 84%

Benchmarking LLM Competence on Logical Inference over Probability Operators

基于概率算子的逻辑推理能力大语言模型基准测试

Nayera Hasan, Jack Greff, Alvin Grissom

机构 * Haverford College(哈维福德学院)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究构建含14320个提示的概率算子推理基准,评估29个大语言模型,发现多数模型存在答案偏差,仅9个超随机水平,且各维度均有偏差。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12787 2026-08-05 cs.AI cs.CL cs.CV cs.MM 版本更新 84%

Do We Really Need Multimodal Emotion Language Models Larger Than 1B Parameters?

我们真的需要参数超过10亿的多模态情感语言模型吗?

Kaiwen Zheng, Junchen Fu, Wenhao Deng, Hu Han, Joemon M. Jose, Xuri Ge

机构 * University of Glasgow(格拉斯哥大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Artificial Intelligence, Shandong University(山东大学人工智能学院)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 质疑多模态情感识别需参数超10亿模型的假设,提出轻量级MER框架Light-MER,通过知识蒸馏及两种优化策略,在九个基准数据集实验中实现最优性能并显著提高推理效率,凸显小模型潜力。

Comments Accepted by ACM MM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04468 2026-08-05 cs.AI cs.CL 版本更新 84%

What Makes a Sale? Simulating End-to-End Seller--Buyer Retail Dynamics with LLM Agents

什么促成了一次销售?通过LLM代理重新思考端到端的卖家-买家零售动态

Jeonghwan Choi, Jibin Hwang, Gyeonghun Sun, Minjeong Ban, Taewon Yun, Hyeonjae Cheon, Hwanjun Song

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文提出RetailSim框架,通过统一环境建模零售流程,展现行为忠实度和经济规律,用于分析买家-卖家互动及销售策略评估。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03311 2026-08-05 cs.SE cs.AI 新提交 83%

Evaluating LLM Trade-offs for Enterprise Automation: Lessons from Workflow Generation in a Production Enterprise Platform

评估用于企业自动化的大语言模型权衡:来自生产级企业平台中工作流生成的经验教训

Xavier Wrenn, Radoslav Raykov, Aleksandar Angelov, Hirokuni Kitahara, Yuji Watanabe, Anca Sailer

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究通过在生产级企业平台评估6种大语言模型的工作流生成能力,发现分段式流水线可提升结构成功率,使小型模型达生产可行性,为云工程提供模型无关的自动化方案。

Comments 10 pages, 3 figures, 5 tables. Accepted at the 14th IEEE International Conference on Cloud Engineering (IC2E 2026), Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03450 2026-08-05 cs.MM cs.AI cs.CL cs.CV 新提交 82%

Balancing Efficiency and Efficacy: Training-Free Attention-Guided Switching Between Explicit and Latent Thoughts for MLLMs

平衡效率与效能:面向多模态大语言模型(MLLM)的无训练注意力引导式显式与隐式思维切换

Haoqian Kang, Liupeng Li, Kuofeng Gao, Jinpeng Wang, Zhenyu Lu, Bin Chen, Ke Chen, Yaowei Wang

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对MLLM推理中感知与逻辑混淆的问题,提出无训练的注意力引导式切换框架,通过视觉-文本注意力比率自适应切换显式与隐式推理,实现性能与效率的双重提升。

Comments Accepted by ACM MM 2026. 10 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03148 2026-08-05 cs.LG cs.AI 新提交 82%

Lightweight Chunk Selection for Mobile Retrieval-Augmented Generation

面向移动端检索增强生成的轻量级分块选择

Sicong Chang, Yidan Shen, Wen Yu, Jiefu Chen, Xin Fu, Renjie Hu

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本文针对移动端RAG部署的成本问题,提出结合LLM侧查询意图、MoE路由信号与检索分块嵌入的轻量级分块选择方法,提升了排名1的证据选择性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03138 2026-08-05 cs.CL cs.AI 新提交 82%

Internalizing Academic Writing Workflows for Introduction Generation via Struct-Aware Policy Learning

通过结构感知策略学习内化学术写作工作流以生成引言

Meicong Zhang, Tiancheng Su, Jiahao Cheng, Guoxiu He, Xinqi Tao, Dejia Song

专题命中 效率与部署 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对LLM生成论文引言的挑战,提出StructPO框架将多阶段写作工作流内化为单遍策略,实验显示其在语义对齐等指标上优于基线,泛化性好且与GPT-5.1性能相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02901 2026-08-05 cs.LG cs.CL 新提交 82%

AnchorKV: Anchor-Residual KV Cache Compression

AnchorKV:锚点-残差键值缓存压缩

Malik Khalaf, Yara Shamshoum, Nitzan Hodos, Yuval Sieradzki, Assaf Schuster

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL、cs.LG

AI总结 针对长上下文LLM推理的KV缓存内存瓶颈,提出AnchorKV压缩方案,不丢令牌且压缩20倍,70B规模下保留99%全缓存精度,大幅降低上下文成本。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01804 2026-08-05 cs.LG cs.AI 版本更新 82%

LEAP: Lean Environment-Feedback via Adaptive Pruning for Code RL in GPU Kernel Generation

LEAP:面向GPU内核生成的代码强化学习的自适应剪枝轻量环境反馈框架

Tankun Li, Zhi Chen, Yaohua Tang

机构 * Moore Threads(摩尔线程)

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 LEAP是针对GPU内核生成的代码强化学习框架,通过难度条件剪枝与基于排名的奖励公式解决低级代码RL的信号稀疏性等问题,收敛更快且性能更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22511 2026-08-05 stat.ML cs.AI cs.LG econ.EM 版本更新 82%

CausalForge: A Formally Grounded, Self-Improving Agentic Framework for Automated Research in Causal Inference

因果锻造:一个用于因果推理自动化研究的形式化基础、自我改进的智能框架

Jiyuan Tan, Vasilis Syrgkanis

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出因果锻造框架用于因果推理自动化研究,结合因果论库与因果史密斯智能管道,通过声明审核增强内核验证,并用自主研究工件评估系统,为因果推理自动化研究提供新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30580 2026-08-05 cs.CL cs.LG 版本更新 82%

Speculative Decoding and the Curse of Multilinguality

跨语言的推测解码

Nirajan Paudel, Michael Ginn, Luc De Nardi, Alexis Palmer

机构 * University of Colorado(科罗拉多大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了通过微调草稿模型或使用n-gram模型来提高非英语语言中推测解码效率的策略,发现任务特定蒸馏虽能提升效率但泛化性差,而n-gram模型尽管接受率较低,但由于生成速度快,始终能提供显著的加速效果。

Comments 15 pages, 12 figures, submitted to ACL ARR August 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03580 2026-08-05 cs.CV 新提交 82%

SlimVLM: Sensitivity-aware Dynamic Structured Pruning with Adaptive Visual Token Selection for Efficient Vision-Language Models

SlimVLM:面向高效视觉-语言模型的感知敏感性动态结构化剪枝与自适应视觉token选择

Yaozhi Wen, Jialong Guo, Zhenliang Ni, Han Shu, Xinghao Chen

专题命中 效率与部署 :language model(title,abstract);large language model(abstract)

AI总结 SlimVLM是一种结构化剪枝框架,通过自适应视觉token选择和感知敏感性动态剪枝机制,在压缩视觉-语言模型的同时保持性能,在多模态基准测试中达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01058 2026-08-05 cs.LG cs.AI cs.CL 82%

LEAP: Layer-wise Exit-Aware Pretraining for Efficient Transformer Inference

LEAP:用于高效Transformer推理的分层退出感知预训练

Shashank Kapadia, Deep Naryan Mishra, Sujal Reddy Alugubelli, Haoan Wang, Saipraveen Vabbilisetty, Rishi Bhatia, Anupriya Sharma

机构 * Walmart Inc.(沃尔玛公司)

专题命中 效率与部署 :pretraining(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 LEAP通过分层退出感知预训练解决传统蒸馏与早退机制的兼容性问题,实现显著的推理加速与效率提升。

Comments Accepted at ACL 2026 (Industry Track). 14 pages, 5 figures

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026), Industry Track, pages 761-774, San Diego, California, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28239 2026-08-05 cs.AR 版本更新 82%

A Switch-Centric In-Network Architecture for Accelerating LLM Inference in Shared-Memory Network

一种面向共享内存网络的开关中心网络架构,用于加速大语言模型推理

Aojie Jiang, Kang Zhu, Zhiheng Zhang, Zhengxu Su, Juntao Liu, Yuan Du, Li Du

专题命中 效率与部署 :LLM(title,abstract)

AI总结 本文提出SCIN架构,通过在开关内直接访问附加加速器的内存区域,实现低延迟高带宽的All-Reduce,同时支持8位精度的In-Network Quantization,提升LLaMA-2模型推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03632 2026-08-05 cs.AI 新提交 81%

When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation

当教师误导时:感知虚假信号的在线策略蒸馏

Yinuo Jiang, Yongjie Ye, Zhou Tao, Xiang Zhuang, Qiang Zhang, Huajun Chen, Tiankai Li

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对在线策略蒸馏中存在的虚假信号问题,提出SA-OPD框架,通过输入接地性代理过滤误导性token级监督,实验表明其性能优于普通OPD及其他选择性方法。

Comments 21 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03609 2026-08-05 cs.AI 新提交 81%

Formal Verification of Agentic Systems over Operational Data

基于操作数据的智能体系统的形式化验证

Alejandro J. Mercado, Alessio Lomuscio

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文针对操作数据上的智能体系统,提出形式化验证框架,定义STEADs模型,证明其FO-CTL验证问题的不可判定性,给出有限域下的充分条件,引入规范包装器并在案例工作流中验证。

Comments 21 pages, including appendix; 0 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03597 2026-08-05 cs.AI cs.LG 新提交 81%

FOUND-AF: Benchmarking ECG Foundation Models for Atrial Fibrillation Detection

FOUND-AF:用于心房颤动检测的心电基础模型基准测试

Amirhossein Taleshinosrati, Yangyang Wang, Atitaya Phoemsuk, Vahid Abolghasemi, Naser Hossein Motlagh, Sadasivan Puthusserypady, Daniel Teichmann, Abdolrahman Peimankar

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究提出FOUND-AF基准框架,在统一条件下评估9种心电基础模型在4种数据集上的心房颤动检测性能,发现ECGFounder综合表现最优,为相关模型选择提供可复现方案。

详情

展开后加载摘要…

URL PDF HTML 收藏