arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-12 至 2026-03-12 共收录 35 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 35 篇

2403.10799 2026-03-12 cs.CL cs.AI cs.LG 90%

Toward Adaptive Large Language Models Structured Pruning via Hybrid-grained Weight Importance Assessment

面向基于混合粒度权重重要性评估的自适应大语言模型结构剪枝

Jun Liu, Zhenglun Kong, Pu Zhao, Changdi Yang, Hao Tang, Xuan Shen, Geng Yuan, Wei Niu, Wenbin Zhang, Xue Lin, Dong Huang, Yanzhi Wang

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出HyWIA方法,通过混合粒度权重重要性评估提升大语言模型剪枝效果,实现更优的性能保留和结构优化。

Comments AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10775 2026-03-12 cs.CL 89%

Large Language Models as Annotators for Machine Translation Quality Estimation

大语言模型作为机器翻译质量估计的标注器

Sidi Wang, Sophie Arnoult, Amir Kamran

机构 * Maastricht university(马斯特里赫特大学) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) Taus

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出利用大语言模型生成MQM标注以训练COMET模型,通过简化标注方案提升中文-英文和英文-德语的段级机器翻译质量估计性能。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10088 2026-03-12 cs.LG cs.AI 88%

ES-dLLM: Efficient Inference for Diffusion Large Language Models by Early-Skipping

ES-dLLM:通过早期跳过实现扩散大语言模型的高效推理

Zijian Zhu, Fei Ren, Zhanhong Tan, Kaisheng Ma

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 ES-dLLM通过早期跳过技术提升扩散大语言模型的推理效率,实现高达16.8倍的加速效果。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09579 2026-03-12 cs.CL cs.AI 88%

Modelling Language using Large Language Models

利用大语言模型建模语言

Jumbly Grindrod

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了大型语言模型作为公共语言科学模型的潜力,提出通过计算语言学研究开发模型诠释以理解语言结构。

Comments Philosophical Studies (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10862 2026-03-12 cs.SD 87%

OSUM-Pangu: An Open-Source Multidimension Speech Understanding Foundation Model Built upon OpenPangu on Ascend NPUs

OSUM-Pangu:基于OpenPangu在Ascend NPUs上的开源多维语音理解基础模型

Yujie Liao, Xuelong Geng, Hongfei Xue, Shuiyuan Wang, Lei Xie

机构 * Ascend NPUs(Ascend NPU)

专题命中 效率与部署 :foundation model(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 OSUM-Pangu基于非CUDA的Ascend NPU平台,结合openPangu-7B LLM后端,实现语音理解任务的高准确率与自然语言交互能力。

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01815 2026-03-12 cs.CL cs.AI cs.LG 87%

KV Cache Transform Coding for Compact Storage in LLM Inference

KV缓存变换编码用于LLM推理中的紧凑存储

Konrad Staniszewski, Adrian Łańcucki

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 KVTC通过变换编码实现LLM推理中的高效缓存压缩,保持推理和长上下文准确性,压缩率可达20倍或更高。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01914 2026-03-12 cs.CL 85%

AdaPonderLM: Gated Pondering Language Models with Token-Wise Adaptive Depth

AdaPonderLM: 带令牌级自适应深度的门控沉思语言模型

Shixiang Song, He Li, Zitong Wang, Boyi Zeng, Feichen Song, Yixuan Wang, Zhiqin John Xu, Ziwei He, Zhouhan Lin

机构 * LUMIA Lab(LUMIA实验室) School of Artificial Intelligence(人工智能学院) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Sun Yat-sen University(中山大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 AdaPonderLM通过自适应深度和令牌级门控机制,在保持语言建模性能的同时减少推理计算,实现高效自监督训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09723 2026-03-12 cs.HC cs.CL 85%

AgentA/B: Automated and Scalable Web A/BTesting with Interactive LLM Agents

AgentA/B: 基于交互式LLM代理的自动化和可扩展的网页A/B测试

Yuxuan Lu, Ting-Yao Hsu, Hansu Gu, Limeng Cui, Yaochen Xie, William Headden, Bingsheng Yao, Akash Veeragouni, Jiapeng Liu, Sreyashi Nag, Jessie Wang, Dakuo Wang

机构 * Northeastern University(东北大学) Pennsylvania State University(宾夕法尼亚州立大学) Amazon USA(亚马逊美国)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 AgentA/B通过交互式LLM代理实现自动化和可扩展的网页A/B测试,模拟用户行为以评估网页设计效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10587 2026-03-12 cs.SD 85%

Distilling LLM Semantic Priors into Encoder-Only Multi-Talker ASR with Talker-Count Routing

将LLM语义先验 distilling 到仅编码器的多说话人ASR中 with 谈者计数路由

Hao Shi, Yusuke Fujita, Roman Koshkin, Mengjie Zhao, Yuan Gao, Lianbo Liu, Yui Sudo

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种仅编码器的多说话人ASR模型,通过distilling LLM语义先验并引入Talker-Count Head,实现了在三说话人条件下显著提升的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10353 2026-03-12 cs.DC 85%

S-HPLB: Efficient LLM Attention Serving via Sparsity-Aware Head Parallelism Load Balance

S-HPLB: 通过稀疏性感知的头部并行负载平衡实现高效的LLM注意力服务

Di Liu, Yifei Liu, Chen Chen, Zhibin Yu, Xiaoyi Fan, Quan Chen, Minyi Guo

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 S-HPLB通过稀疏性感知的头部并行负载平衡策略,有效提升了LLM服务中注意力计算的效率和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09566 2026-03-12 cs.AI cs.LG 81%

Toward Closed-loop Molecular Discovery via Language Model, Property Alignment and Strategic Search

通过语言模型、性质对齐和战略搜索实现闭环分子发现

Junkai Ji, Zhangfan Yang, Dong Xu, Ruibin Bai, Jianqiang Li, Tingjun Hou, Zexuan Zhu

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 Trio结合语言模型、性质对齐和战略搜索,实现高效且可解释的闭环分子设计,提升药物配体的结合亲和力、药物性和合成可及性。

Comments 30 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10877 2026-03-12 cs.CL 79%

From Images to Words: Efficient Cross-Modal Knowledge Distillation to Language Models from Black-box Teachers

从图像到词语:高效的跨模态知识蒸馏用于从黑盒教师模型向语言模型转移

Ayan Sengupta, Shantanu Dixit, Md Shad Akhtar, Tanmoy Chakraborty

机构 * Indian Institute of Technology Delhi, India(印度德里印度理工学院) Indraprastha Institute of Information Technology Delhi, India(印度德里印度信息科技学院)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL

AI总结 本文提出ARMADA框架,通过高效的跨模态知识蒸馏方法,从黑盒视觉-语言模型向语言模型转移知识,实现性能提升且无需昂贵预训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10695 2026-03-12 cs.CV cs.AI 79%

RandMark: On Random Watermarking of Visual Foundation Models

RandMark: 关于视觉基础模型的随机水印技术

Anna Chistyakova, Mikhail Pautov

机构 * Trusted AI Research Center, RAS(俄罗斯科学院可信人工智能研究中心)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI

AI总结 RandMark通过随机水印嵌入技术,在视觉基础模型中实现所有权验证,有效区分水印和非水印模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10042 2026-03-12 cs.CR cs.AI 79%

Targeted Bit-Flip Attacks on LLM-Based Agents

针对基于大语言模型(LLM)的智能体的位翻转攻击

Jialai Wang, Ya Wen, Zhongmou Liu, Yuxiao Wu, Bingyi He, Zongpeng Li, Ee-Chien Chang

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出Flip-Agent,首个针对基于LLM的智能体的位翻转攻击框架,通过操控最终输出和工具调用,揭示LLM智能体系统中的关键安全漏洞。

Comments To appear in DAC 2026 (Design Automation Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10031 2026-03-12 cs.AR cs.AI cs.DC 79%

Architecture-Aware LLM Inference Optimization on AMD Instinct GPUs: A Comprehensive Benchmark and Deployment Study

面向AMD Instinct GPU的架构感知LLM推理优化:全面的基准测试与部署研究

Athos Georgiou

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI

AI总结 研究针对AMD Instinct GPU优化LLM推理,通过基准测试发现架构感知优化对MLA模型至关重要,同时揭示不同模型在文本和视觉任务中的吞吐量差异及内存带宽瓶颈。

Comments 40 pages, 6 figures, 30 tables. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09771 2026-03-12 cs.CV cs.AI 79%

Ego: Embedding-Guided Personalization of Vision-Language Models

Ego:基于嵌入的视觉-语言模型个性化

Soroush Seifi, Simon Gardier, Vaggelis Dorovatas, Daniel Olmeda Reino, Rahaf Aljundi

机构 * Toyota Motor Europe(丰田欧洲公司)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于模型内部机制的高效视觉-语言模型个性化方法,通过提取目标概念的视觉标记实现个性化描述与记忆。

Comments Accepted at the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10705 2026-03-12 cs.CV 78%

Enhanced Continual Learning of Vision-Language Models with Model Fusion

增强视觉-语言模型的持续学习与模型融合

Haoyuan Gao, Zicong Zhang, Yuqi Wei, Linglan Zhao, Guilin Li, Yexin Li, Bo Wang, Linghe Kong, Weiran Huang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) State Key Laboratory of General Artificial Intelligence, BIGAI(国家一般人工智能重点实验室,BIGAI) Tencent(腾讯)

专题命中 效率与部署 :language model(title,abstract)

AI总结 本文提出ConDU方法,通过模型融合解决VLMs在持续学习中的灾难性遗忘问题,提升零样本性能和多任务表现。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10298 2026-03-12 cs.LG 77%

GaLoRA: Parameter-Efficient Graph-Aware LLMs for Node Classification

GaLoRA:参数高效图感知大语言模型用于节点分类

Mayur Choudhary, Saptarshi Sengupta, Katerina Potika

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 GaLoRA通过整合结构信息提升LLMs在文本属性图节点分类中的性能,仅用0.24%的参数量即可达到与最新模型相当的效果。

Comments 10 pages, 2 figures, 11 tables, 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02873 2026-03-12 cs.CL 77%

LaTeX Compilation: Challenges in the Era of LLMs

LaTeX编译:在大语言模型时代面临的挑战

Tianyou Liu, Ziqiang Li, Xurui Liu, Yu Wu, Yansong Li

机构 * Southern University of Science and Technology(南方科技大学) Alibaba(阿里巴巴) Tsinghua University(清华大学) Rutgers University(罗格斯大学) Liii Network(Liii网络)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Mogan STEM作为替代TeX的结构编辑器,通过高效的数据结构和按需插件加载,在编译效率、生成语义和工具生态系统等方面优于TeX,并展示了其在LLM微调中的优势。

Comments 25 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08907 2026-03-12 cs.CL 77%

Autoencoding-Free Context Compression for LLMs via Contextual Semantic Anchors

无需自动编码的上下文压缩用于LLM:通过上下文语义锚点

Xin Liu, Runsong Zhao, Pengcheng Huang, Xinyu Liu, Junyi Xiao, Chunyang Xiao, Tong Xiao, Shengxiang Gao, Zhengtao Yu, Jingbo Zhu

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院,中国沈阳) NiuTrans Research, Shenyang, China(沈阳NiuTrans研究院,中国) Kunming University of Science and Technology, Kunming, China(昆明理工大学,中国昆明)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 SAC通过引入锚点嵌入和双向注意力修改,无需自动编码即可实现更高效的上下文压缩,提升问答和长上下文摘要任务性能。

Comments 23 pages,10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10342 2026-03-12 cs.DC 75%

AgentServe: Algorithm-System Co-Design for Efficient Agentic AI Serving on a Consumer-Grade GPU

AgentServe: 为在消费级GPU上高效执行代理AI服务的算法-系统协同设计

Yuning Zhang, Yan Yan, Nan Yang, Dong Yuan

专题命中 效率与部署 :large language model(abstract);language model(abstract);small language model(abstract)

AI总结 AgentServe通过算法-系统协同设计,在消费级GPU上实现高效代理AI服务,提升延迟稳定性并保持吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10899 2026-03-12 cs.LG cs.AI 73%

LookaheadKV: Fast and Accurate KV Cache Eviction by Glimpsing into the Future without Generation

LookaheadKV: 通过不生成未来预览实现快速且准确的KV缓存淘汰

Jinwoo Ahn, Ingyu Seong, Akhil Kedia, Junhan Kim, Hyemi Jang, Kangwook Lee, Yongkweon Jeon

机构 * Samsung Research(三星研究院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 LookaheadKV通过无需显式生成未来响应的轻量级框架,实现高效准确的KV缓存淘汰,减少淘汰成本并提升推理速度。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10842 2026-03-12 cs.CL 70%

PivotAttack: Rethinking the Search Trajectory in Hard-Label Text Attacks via Pivot Words

PivotAttack: 重新思考通过枢纽词的硬标签文本攻击中的搜索轨迹

Yuzhi Liang, Shiliang Xiao, Jingsong Wei, Qiliang Lin, Xia Li

机构 * Guangdong University of Foreign Studies(广东外语外贸大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 PivotAttack通过识别枢纽集并扰动以诱导标签翻转,提高了硬标签文本攻击的效率和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10544 2026-03-12 cs.LG cs.AI 62%

SCORE: Replacing Layer Stacking with Contractive Recurrent Depth

SCORE:用收缩性递归深度取代层堆叠

Guillaume Godin

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 SCORE通过收缩性递归深度替代传统层堆叠,提升深度神经网络的收敛速度和训练效率。

Comments 32 pages, 21 figures, 12 tableaux

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09378 2026-03-12 cs.LG cs.AI cs.RO 62%

SPAARS: Safer RL Policy Alignment through Abstract Exploration and Refined Exploitation of Action Space

通过抽象探索和动作空间精细化利用实现更安全的强化学习策略对齐

Swaminathan S K, Aritra Hazra

专题命中 效率与部署 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 SPAARS通过抽象探索和动作空间精细化利用,提升强化学习策略对齐的安全性与效率

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10918 2026-03-12 cs.LG 57%

Sequential-Parallel Duality in Prefix Scannable Models

前缀可扫描模型中的序列-并行二元性

Morris Yau, Sharut Gupta, Valerie Engelmayer, Kazuki Irie, Stefanie Jegelka, Jacob Andreas

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) TU Munich(慕尼黑技术大学) Harvard University(哈佛大学)

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 本文提出前缀可扫描模型(PSMs),通过放宽状态聚合运算符,统一了多种序列模型,并在效率和表达力上表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03666 2026-03-12 cs.CV cs.AI 57%

MonitorVLM:A Vision Language Framework for Safety Violation Detection in Mining Operations

MonitorVLM:一种用于采矿作业中安全违规检测的视觉语言框架

Jiang Wu, Sichao Wu, Yinsong Ma, Guangyuan Yu, Haoyuan Xu, Lifang Zheng, Jingliang Duan

机构 * School of Mechanical Engineering, University of Science and Technology Beijing(北京科技大学机械工程学院) Laboratory for Computational Sensing and Robotics, Johns Hopkins University(约翰霍普金斯大学计算感知与机器人实验室)

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 MonitorVLM通过视觉语言框架提升采矿作业中安全违规检测的精度和召回率,实现高效自动化监控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00379 2026-03-12 cs.LG 57%

Composer: A Search Framework for Hybrid Neural Architecture Design

Composer: 一种用于混合神经网络架构设计的搜索框架

Bilge Acun, Prasoon Sinha, Newsha Ardalani, Sangmin Bae, Alicia Golden, Chien-Yu Lin, Meghana Madhyastha, Fei Sun, Neeraja J. Yadwadkar, Carole-Jean Wu

机构 * FAIR at Meta(Meta 的 FAIR 部门) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 效率与部署 :LLM(abstract);分类 cs.LG

AI总结 Composer提出了一种模块化框架,通过小规模探索和扩展策略发现优于Llama 3.2的混合LLM架构,提升了模型性能和效率。

Journal ref The International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09480 2026-03-12 cs.CV 50%

Prune Redundancy, Preserve Essence: Vision Token Compression in VLMs via Synergistic Importance-Diversity

剪枝冗余,保留本质:通过协同重要性-多样性压缩视觉语言模型中的视觉标记

Zhengyao Fang, Pengyuan Lyu, Chengquan Zhang, Guangming Lu, Jun Yu, Wenjie Pei

专题命中 效率与部署 :language model(abstract)

AI总结 PruneSID通过协同重要性-多样性方法有效压缩视觉语言模型中的视觉标记,实现高精度与高效能的平衡。

Comments accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24799 2026-03-12 cs.SE 50%

Compiler.next: A Search-Based Compiler to Power the AI-Native Future of Software Engineering

Compiler.next: 一种基于搜索的编译器以推动软件工程的AI原生未来

Filipe R. Cogo, Gustavo A. Oliva, Ahmed E. Hassan

专题命中 效率与部署 :foundation model(abstract)

AI总结 Compiler.next是一种基于搜索的编译器,旨在通过降低技术门槛,实现AI原生软件的自动化开发与高效演进。

Comments 31 pages, 5 figures, submitted to ACM Transactions on Software Engineering and Methodology

详情

展开后加载摘要…

URL PDF HTML 收藏