arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-07 至 2026-07-07 共收录 712 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 122 篇

2602.24044 2026-07-07 cs.DC cs.AI cs.CL cs.LG 版本更新 88%

Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving

用于分布式大语言模型适配器服务的GPU效率数据驱动优化

Ferran Agullo, Joan Oliveras, Chen Wang, Alberto Gutierrez-Torre, Olivier Tardieu, Alaa Youssef, Jordi Torres, Josep Ll. Berral

机构 * BSC(巴塞罗那超级计算中心) IBM(国际商业机器公司) UPC(巴塞罗那技术大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究分布式大语言模型适配器服务中GPU资源利用问题,提出数据驱动管道,通过性能预测、数字孪生等组件,以最少GPU服务工作负载,提升效率,还可用于其他目标。

Comments update of the journal paper contents after major revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15206 2026-07-07 cs.CL 版本更新 88%

Fair-GPTQ: Bias-Aware Quantization for Large Language Models

Fair-GPTQ:大语言模型的偏差感知量化

Irina Proskurina, Guillaume Metzler, Julien Velcin

机构 * Université Claude Bernard Lyon 1(克莱尔伯恩大学里昂1分校) Université Lumière Lyon 2(里昂2大学) ERIC École Centrale de Lyon(里昂中央理工学院) LIRIS CNRS UMR 5205(国家科学研究中心UMR 5205)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究针对生成式语言模型高内存需求的量化问题,通过在量化目标中添加显式组公平约束建立与模型公平的新联系,引入Fair-GPTQ减少大语言模型不公平性,性能影响小且保留量化优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03333 2026-07-07 cs.DC cs.AI cs.LG 新提交 88%

SPORK: Self-Speculative Forking to Accelerate Agentic LLM Inference

SPORK:自我推测性分叉以加速智能体大语言模型推理

Huajun Bai, Weiwei Lv, Huichuan Zheng, Youyou Lu, Jiwu Shu

机构 * Tsinghua University(清华大学) Meituan(美团)

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.AI、cs.LG

AI总结 研究LLM智能体推理中串行循环耗时问题,提出SPORK方法,利用模型自身预测提前调度推测工具调用,通过成本模型等组件优化,大幅提升推理效率且不影响任务准确性。

Comments 16 pages, 15 figures. Code: https://github.com/baihuajun24/spork

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02930 2026-07-07 cs.CV 新提交 88%

CL-Anomaly: Layer-Adaptive Mixture-of-Experts with Multimodal Large Language Model for Continual Learning in Anomaly Detection

CL-Anomaly:用于异常检测中持续学习的具有多模态大语言模型的层自适应专家混合模型

Wen Dong, Zhao Wang, Shuangqing Zhang, Kai Sun, Ben Li, Guo-Sen Xie, Caifeng Shan, Fang Zhao

机构 * Nanjing University(南京大学) China Mobile Zijin Innovation Institute(中国移动紫金创新研究院) Nanjing University of Science and Technology(南京理工大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 针对多模态大语言模型持续学习计算昂贵及现有方法语义纠缠问题,提出CL-Anomaly框架,用隔离共享协作实现参数高效微调,介绍任务私有专家PrivLoRA等,实验表明其性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11943 2026-07-07 cs.OS cs.LG 版本更新 87%

ProbeLogits: Kernel-Level LLM Inference Primitives for AI-Native Operating Systems

ProbeLogits:面向AI原生操作系统内核级的LLM推理原语

Daeyeon Son

机构 * Independent Researcher(独立研究者)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 本文提出ProbeLogits,一种在操作系统内核层面执行单次前向传递并读取特定token logit的原语,用于分类代理行为的安全性,通过校准强度alpha实现部署时的策略控制,提升安全性与效率。

Comments 18 pages, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04428 2026-07-07 cs.CL cs.AI 新提交 86%

dOPSD: On-Policy Self-Distillation for Diffusion Language Models

dOPSD:扩散语言模型的策略内自蒸馏

Phuong Tuan Dat, Qi Li, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 研究扩散语言模型强化推理难的问题,提出dOPSD,通过从学生去噪轨迹直接推导教师特权信息,实现策略内自蒸馏,提升模型在数学推理和代码生成等任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01237 2026-07-07 cs.CL cs.AI 新提交 86%

KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression

Kara: 通过滑动窗口KV缓存压缩实现高效推理LLM服务

Shen Han, Yuyang Wu, Junpu Yu, Olexandr Isayev

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 效率与部署 :LLM(title,title_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对推理语言模型长思维链导致KV缓存过大、解码延迟高的问题,提出Kara滑动窗口KV缓存压缩方法,利用双向注意力评分选择信息性KV对并通过Token2Chunk模块扩展为块,结合PagedAttention构建KvLLM推理框架,降低内存占用并提升输出吞吐量。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21952 2026-07-07 cs.LG cs.AI cs.AR cs.NE cs.RO 86%

Focus Session: Hardware and Software Techniques for Accelerating Multimodal Foundation Models

聚焦会议:加速多模态基础模型的硬件和软件技术

Muhammad Shafique, Abdul Basit, Muhammad Abdullah Hanif, Alberto Marchisio, Rachmad Vidya Wicaksana Putra, Minghao Shao

机构 * eBRAIN Lab, New York University (NYU) Abu Dhabi(eBRAIN实验室,纽约大学(NYU)阿布扎比)

专题命中 效率与部署 :foundation model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出了一种多层方法,通过硬件和软件协同设计和优化流程,提升多模态基础模型的效率。方法包括混合精度量化、结构剪枝、推测解码等技术,结合硬件加速器优化计算和内存需求,验证了在医疗和代码生成任务中的有效性。

Comments Accepted at the Design, Automation and Test in Europe Conference (DATE), April 20-22, 2026 in Verona, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03174 2026-07-07 cs.SE cs.AI 新提交 85%

Effectiveness of LLM-based Software Diversity for Reliability Improvement -- an Empirical Study

基于大语言模型的软件多样性对可靠性提升的有效性——一项实证研究

Gabriel Almeida, Ilir Gashi, Vladimir Stankovic, João R. Campos

机构 * University of Coimbra, CISUC/LASI(科英布拉大学,CISUC/LASI) Centre for Software Reliability(软件可靠性中心) Department of Informatics Engineering(信息工程系) Department of Computer Science(计算机科学系) City St George’s, University of London(伦敦城市圣乔治大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型能否成为软件多样性的实用生成器及提升可靠性程度。通过扩展经典实证研究,对多种规范程序进行测试,探索大语言模型多样性多维度影响,结果表明其能助力可靠性提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04302 2026-07-07 cs.LG cs.AI cs.AR cs.CL cs.PF 新提交 85%

HiFA4: Training-Free 4-bit FlashAttention on Ascend HIF4 NPUs for LLM Inference

HiFA4:用于大语言模型推理的昇腾HIF4 NPU上的免训练4位FlashAttention

Hui Dong, Yanzhao Li, Jie Gao, Chunlu Li, Zhiyuan Zhang, Yupeng Sun, Zhenyuan Chen, Zhiqiang Zou

机构 * Huawei Technologies(华为技术有限公司)

专题命中 效率与部署 :LLM(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 HiFA4是一种训练后算子级设计,在昇腾NPU上用4位HIF4 Cube GEMM执行QK^T和PV进行大语言模型推理,结合Smooth-QK和P-Reordering机制,减少量化决策漂移,提升准确率。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04181 2026-07-07 cs.DC 新提交 85%

CoCoScale: Leveraging Layer-wise Scaling to Unlock the Potential of Online LLM Serving

CoCoScale:利用逐层缩放释放在线大语言模型服务的潜力

Jingfeng Wu, Yiyuan He, Minxian Xu, Xitong Gao, Chong Ma, Le Chen, Min Shen, Lin Qu, Kejiang Ye, CHengzhong Xu

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究在线大语言模型服务中动态工作负载问题,提出CoCoScale逐层动态缩放机制,通过利用闲置资源扩展热层并行度,减少冷启动延迟,提升动态适应性和资源效率。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04969 2026-07-07 cs.LG cs.CL 新提交 84%

Train Smarter, Not Longer: Memorization-Guided Data Reuse for Efficient LLM Training

更智能而非更长时间训练:用于高效大语言模型训练的记忆引导数据复用

Jingwei Zuo, Cong Zeng, Ilyas Chahed, Maksim Velikanov, Dhia Eddine Rhaiem, Pasquale Balsebre, Abhay Kumar, Younes Belkada, Hakim Hacid

机构 * Technology Innovation Institute(技术创新研究院)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究大语言模型训练范式,通过观察模型‘记忆窗口’信号,提出记忆引导数据复用范式,自适应决定数据复用时间和方式,为记忆感知训练计划奠定基础,助于用有限高质量数据更智能训练。

Comments Published as a paper at 3rd DATA-FM workshop @ ICLR 2026, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04574 2026-07-07 cs.LG cs.AI 新提交 84%

A Few Teacher Steps Go a Long Way: Cost-Efficient On-Policy Data Augmentation for Agent Post-Training

教师的少量步骤作用显著:智能体训练后基于策略的数据增强的成本效益

Junze Ye, Jiayi Cheng, Miao Lu, Michal Mankowski, Jose Blanchet, Mohsen Bayati

机构 * Stanford University(斯坦福大学) New York University(纽约大学)

专题命中 效率与部署 :post-training(title);LLM(abstract);SFT(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型智能体,将基于策略的数据构建视为预算分配问题,通过特定方式形式化设计空间,在多个任务中实验表明少量教师步骤在学习者诱导情境下更具成本效益。

Comments Accepted by ICML 2026 Workshop: RLxF: Reinforcement Learning from World Feedback

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03089 2026-07-07 cs.LG cs.AI 新提交 84%

STELLA: Efficient Sensor-to-LLM Translation for On-Device Human Activity Recognition

STELLA:用于设备端人类活动识别的高效传感器到语言模型翻译

Nirhoshan Sivaroopan, Albert Zomaya, Kanchana Thilakarathna

机构 * The University of Sydney(悉尼大学)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 研究设备端人类活动识别难题,提出STELLA框架,通过轻量级分层分词器压缩传感器数据,投影到预训练语言模型嵌入空间,结合自然语言提示打分,支持设备端个性化,提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03948 2026-07-07 cs.AI cs.LG math.OC 新提交 84%

Online Linear Programming for Multi-Objective Routing in LLM Serving

大语言模型服务中多目标路由的在线线性规划

Zixi Chen, Yinyu Ye, Zijie Zhou

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型服务在线路由问题,引入多目标优化框架将路由设为在线线性规划,应用高效出价控制策略,开发热启动投影一阶更新,集成路由器到模拟器,结果表明基于科学方法优于启发式方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12262 2026-07-07 cs.CL cs.LG 版本更新 84%

Few-Step Diffusion Language Models via Trajectory Self-Distillation

通过轨迹自蒸馏实现少步扩散语言模型

Tunyu Zhang, Xinxi Zhang, Ligong Han, Haizhou Shi, Xiaoxiao He, Zhuowei Li, Hao Wang, Kai Xu, Akash Srivastava, Chengzhi Mao, Hao Wang, Vladimir Pavlovic, Dimitris N. Metaxas

机构 * Rutgers University(罗格斯大学) Red Hat AI Innovation(红帽AI创新) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过轨迹自蒸馏框架训练少步学生模型,以匹配全步教师的生成轨迹,从而减少解码步骤带来的输出质量下降,并结合DDO提升推理任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02521 2026-07-07 cs.DC cs.LG cs.PL 新提交 83%

Tile-Level Activation Overlap for Efficient LLM Inference

用于高效大语言模型推理的瓦片级激活重叠

Abhinav Jangda, Tyler Sorensen, Sebastian Burckhardt, Jianlan YE, Chaoyin Li, Atul Gupta

机构 * Microsoft Research(微软研究院)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究针对现代大语言模型中SwiGLU中间张量物化成本高的问题,提出基于CUTLASS的SM90内核,通过瓦片级融合SwiGLU与GeMM,提升推理速度,验证手工设计的必要性且数值表现优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08791 2026-07-07 cs.DC cs.AI 版本更新 83%

Prima.cpp: Fast 30-70B LLM Inference on Heterogeneous and Low-Resource Home Clusters

Prima.cpp:在异构和低资源家用集群上进行快速30 - 70B语言模型推理

Zonghang Li, Tao Li, Wenjiao Feng, Rongxing Xiao, Jianshu She, Hong Huang, Mohsen Guizani, Hongfang Yu, Qirong Ho, Wei Xiang, Xue Liu

机构 * MBZUAI(穆罕默德·本·拉希德人工智能技术研究所) UESTC(电子科技大学) City University of Hong Kong(香港城市大学) La Trobe University(拉筹伯大学)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究在消费者家用集群上运行30 - 70B语言模型的挑战,提出分布式推理系统Prima.cpp,引入流水线环并行等方法,实现低内存压力下快速推理,相比其他方案有优势。

Comments 38 pages, 21 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08521 2026-07-07 cs.CV cs.AI 版本更新 83%

VISOR: Visual Input-based Steering for Output Redirection in Vision-Language Models

VISOR:视觉语言模型中用于输出重定向的基于视觉输入的转向

Mansi Phute, Ravikumar Balakrishnan

机构 * Georgia Institute of Technology(佐治亚理工学院) HiddenLayer, Inc(HiddenLayer公司)

专题命中 效率与部署 :language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 研究提出VISOR方法,通过优化视觉输入实现对视觉语言模型行为的精细控制,在关键对齐任务中验证其有效性,且具有低开销等优势,但也揭示了视觉通道安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05147 2026-07-07 cs.AI cs.CL 新提交 82%

DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation

DSpark:结合半自回归生成的置信度调度投机解码框架

Xin Cheng, Xingkai Yu, Chenze Shao, Jiashi Li, Yunfan Xiong, Yi Qian, Jiaqi Zhu, Shirong Ma, Xiaokang Zhang, Jiasheng Ye, Qinyu Chen, Chengqi Deng, Jiping Yu, Damai Dai, Zhengyan Zhang, Yixuan Wei, Yixuan Tan, Wenkai Yang, Runxin Xu, Yu Wu, Zhean Xu, Xuanyu Wang, Muyang Chen, Rui Tian, Xiao Bi, Zhewen Hao, Shaoyuan Chen, Huanqi Cao, Wentao Zhang, Anyi Xu, Huishuai Zhang, Dongyan Zhao, Wenfeng Liang

机构 * Peking University(北京大学) DeepSeek-AI(深势科技人工智能)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对现有投机解码接受率衰减、高并发下吞吐量劣化问题,DSpark采用半自回归架构与置信度调度验证,在实测中显著提升大模型推理速度与系统性能边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03953 2026-07-07 cs.CL cs.AI 新提交 82%

The Remarkable Effectiveness of Providing AI Agents with Natural Language Tools: A Replication Study Validating NLT Performance Across 14 Models

为人工智能智能体提供自然语言工具的显著有效性:一项在14个模型上验证自然语言工具性能的复制研究

Alexander Somma, Isabelle Plante, Fred Premji

机构 * Sage.is AI-UI(Sage.is人工智能用户界面)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究独立复制并扩展了自然语言工具(NLT)框架,在14个模型和8560次试验中评估NLT,验证其效果,发现其能提升工具调用准确率、减少关键错误、降低令牌使用量,还证实模型能力对NLT优势有调节作用。

Comments 28 pages, 6 figures, replication study, replication of arXiv:2510.14453 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03426 2026-07-07 cs.LG cs.AI 新提交 82%

Amortising Bayesian Experimental Design for Sequential Information Gathering in LLMs

用于大语言模型中顺序信息收集的摊销贝叶斯实验设计

Jakob Hartmann, James Harvey, Jhonathan Navott, Erik Y. Wang, Luckeciano C. Melo, Flaviu Cipcigan, Cheng Zhang, Alessandro Abate

机构 * University of Oxford(牛津大学) Ellison Institute of Technology(埃里森理工学院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型在顺序决策中信息收集问题,提出摊销顺序信息收集方法,将贝叶斯实验设计融入模型策略,经实验验证该方法能有效提升成功率并降低推理成本。

Comments 20 pages, 7 figures. Accepted to FoGen 2026: Foundations of Deep Generative Models: Understanding Memorization, Generalization, and Reasoning, an ICML 2026 workshop (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07475 2026-07-07 cs.LG cs.AI 版本更新 82%

ARCQuant: Boosting NVFP4 Quantization with Augmented Residual Channels for LLMs

ARCQuant:通过增强残差通道提升大语言模型的NVFP4量化

Haoqian Meng, Yilun Luo, Yafei Zhao, Wenyuan Liu, Peng Zhang, Xindian Ma

机构 * School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出ARCQuant框架,利用增强残差通道提升NVFP4性能,维持统一格式,将误差补偿融入矩阵降维以用标准GEMM内核,理论分析和实验表明达到先进精度且有实际效益。

Comments Accepted to ACL 2026 (Main Conference)

Journal ref In Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 8609-8623, San Diego, California, United States, July 2026. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04164 2026-07-07 cs.DC 新提交 82%

BrownoutMoE: Structure-Aware Expert Grouping for Efficient and Accurate LLM Web-based Services

BrownoutMoE:用于高效准确的基于大语言模型的网络服务的结构感知专家分组

Yi Ding, Minxian Xu, Zhengxin Fang, Kejiang Ye, Chengzhong Xu

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract)

AI总结 研究基于混合专家(MoE)的大语言模型在网络服务中推理的问题,通过结构感知优化框架BrownoutMoE,将专家分组并利用强化学习找策略,减少精度下降,提升吞吐量。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25777 2026-07-07 eess.SP cs.DC 版本更新 82%

SpecFed: Accelerating Federated LLM Inference with Speculative Decoding and Compressed Transmission

SpecFed: 通过推测解码和压缩传输加速联邦大语言模型推理

Ce Zheng, Xinghan Wang, Jiahong Ning, Yuxuan Shi, Ning Huang, Tingting Yang

专题命中 效率与部署 :LLM(title,abstract)

AI总结 本文提出SpecFed方法,通过推测解码和压缩传输技术,提升联邦学习中大语言模型推理效率,减少通信开销并保持生成质量。

Comments IEEE International Symposium on Information Theory (ISIT), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12298 2026-07-07 cs.AR 82%

CD-PIM: A High-Bandwidth and Compute-Efficient LPDDR5-Based PIM for Low-Batch LLM Acceleration on Edge-Device

CD-PIM:一种高带宽且计算高效的基于LPDDR5的存内计算架构,用于边缘设备上低批量大语言模型加速

Ye Lin, Chao Fang, Xiaoyong Song, Qi Wu, Anying Jiang, Yichuan Bai, Li Du

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出CD-PIM,通过高带宽计算高效模式、低批量交错模式和计算高效CU设计,解决边缘设备上低批量大语言模型执行内存密集型矩阵向量乘法时的带宽瓶颈问题,实现显著加速。

Comments To appear in 2026 Design, Automation and Test in Europe Conference (DATE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02416 2026-07-07 cs.CL 新提交 81%

The Future of NLP may not be at NLP Conferences: Scholarly Migration Patterns in Natural Language Processing

NLP的未来可能不在NLP会议上:自然语言处理领域的学术迁移模式

David Jurgens

机构 * School of Information, University of Michigan(信息学院,密歇根大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究通过分析2010-2026年NLP论文发表数据,发现NLP研究正从传统ACL会议向通用ML会议迁移,新作者在ML会议发表比例从5%升至21%,且ML会议带来显著引用优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01590 2026-07-07 cs.AI cs.SE 新提交 81%

Hawk: Harnessing Hardware-Aware Knowledge for High-Performance NPU Kernel Generation

Hawk:利用硬件感知知识生成高性能NPU内核

Junyi Wen, Ruiyan Zhuang, Yongjia Xu, Pengtu Li, Rui Zou, Hongyi Chen, Chingman Wan, Puxu Yang, Wuhui Chen, Yanlin Wang

机构 * Sun Yat-sen University(中山大学) Greater Bay Area National Technology Innovation Center(粤港澳大湾区国家技术创新中心) Peng Cheng Laboratory(鹏城实验室)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出Hawk框架,通过运行时知识合成、瓶颈感知检索和效果驱动蒸馏三个模块,将NPU内核生成准确率从49.4%提升至80.0%,执行速度最高提升2.2倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04013 2026-07-07 cs.LG cs.AI 新提交 81%

When Does Small Data Work? Accuracy and Efficiency Trade-offs Between Tabular Foundation Models and Conventional Methods for Crowd-State Classification at Hajj and Umrah

小数据何时起作用?朝觐和副朝人群状态分类中表格基础模型与传统方法之间的准确性和效率权衡

AlJawharh S. AlOtaibi, Mohamed Eltahir, Jude AlSubaie

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究在朝觐和副朝人群状态分类中,测试表格基础模型在标签稀缺时的作用,将其与传统机器学习方法比较,评估不同模型,揭示标签数量影响模型选择及两种方法在准确性和效率上的权衡。

Comments 6 pages, 3 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02893 2026-07-07 cs.LG cs.CL 新提交 81%

Variable Bit-width Quantization: Learning Per-Group Precision for "Bigger-but-Smaller" Language Models

可变比特宽度量化:为“更大但更小”的语言模型学习每组精度

Hamish Ogilvy

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究提出可变比特宽度量化(VBQ),通过Gumbel-Softmax松弛为每组64个权重学习分辨率,经交替优化联合训练。VBQ能实现强异构分配,有更好存储效率和推理加速,还揭示了深层自修复量化误差机制。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏