arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-26 至 2026-02-26 共收录 28 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 28 篇

2602.21652 2026-02-26 cs.CL cs.AI 92%

Sparsity Induction for Accurate Post-Training Pruning of Large Language Models

稀疏性诱导用于大语言模型的准确后训练剪枝

Minhao Jiang, Zhikai Li, Xuewen Liu, Jing Zhang, Mengjuan Chen, Qingyi Gu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出稀疏性诱导方法,通过增强分布和特征层面的稀疏性,提升大语言模型后训练剪枝的性能。

Comments 5 pages, 1 figure, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22158 2026-02-26 cs.DC 89%

LLMTailor: A Layer-wise Tailoring Tool for Efficient Checkpointing of Large Language Models

LLMTailor: 一种用于大型语言模型高效检查点存储的分层定制工具

Minqiu Sun, Xin Huang, Luanzheng Guo, Nathan R. Tallent, Kento Sato, Dong Dai

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 LLMTailor通过分层定制工具实现大型语言模型高效检查点存储,减少存储开销和检查点时间,同时保持模型质量。

Comments 9 pages, 3 figures, accepted at PDSW'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21547 2026-02-26 cs.DB 89%

RAC: Relation-Aware Cache Replacement for Large Language Models

基于关系的大型语言模型缓存替换策略RAC

Yuchong Wu, Zihuan Xu, Wangze Ni, Peng Cheng, Lei Chen, Xuemin Lin, Heng Tao Shen, Kui Ren

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 RAC通过利用请求之间的语义关系,提出了一种高效的缓存替换策略,显著提升了缓存命中率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21756 2026-02-26 cs.IR cs.LG 85%

Offline Reasoning for Efficient Recommendation: LLM-Empowered Persona-Profiled Item Indexing

离线推理用于高效推荐:基于LLM的个性化-属性化物品索引

Deogyong Kim, Junseong Lee, Jeongeun Lee, Changhoe Kim, Junguel Lee, Jungseok Lee, Dongha Lee

机构 * Yonsei University(延世大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 Persona4Rec通过离线推理构建物品个性化表示,实现高效且可解释的推荐系统,减少推理时间并提供直观解释。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04517 2026-02-26 cs.LG cs.CL 84%

DOTResize: Reducing LLM Width via Discrete Optimal Transport-based Neuron Merging

DOTResize: 通过基于离散最优传输的神经元合并减少LLM宽度

Neha Verma, Kenton Murray, Kevin Duh

机构 * Center for Language and Speech Processing, Johns Hopkins University, Baltimore, MD, USA(语言与语音处理中心,约翰霍普金斯大学,巴尔的摩,MD,美国) Human Language Technology Center of Excellence, Johns Hopkins University, Baltimore, MD, USA(人工智能语言技术卓越中心,约翰霍普金斯大学,巴尔的摩,MD,美国)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 DOTResize通过离散最优传输方法实现神经元宽度缩减,作为剪枝的补充手段,有效降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18424 2026-02-26 cs.CL 83%

Compressing Language Models for Specialized Domains

面向专业领域的语言模型压缩

Miles Williams, George Chrysostomou, Vitor Jeronymo, Nikolaos Aletras

机构 * University of Sheffield(谢菲尔德大学) Enterprise AI Services, AstraZeneca(AstraZeneca企业人工智能服务)

专题命中 效率与部署 :language model(title,abstract);post-training(abstract);分类 cs.CL

AI总结 本文提出MixCal方法,通过训练后校准提升压缩语言模型在专业领域任务中的性能,同时降低计算成本。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01552 2026-02-26 cs.CV 82%

Variation-aware Vision Token Dropping for Faster Large Vision-Language Models

面向变化的视觉令牌丢弃以加速更大的视觉-语言模型

Junjie Chen, Xuyang Liu, Zichen Wen, Yiyu Wang, Siteng Huang, Honggang Chen

机构 * Sichuan University(四川大学) EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) Zhejiang University(浙江大学)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract)

AI总结 本文提出V²Drop方法,通过动态令牌变化机制在LVLM推理中减少令牌数量,提升计算效率,同时保持任务性能。

Comments Accepted by CVPR 2026. Code is available at \url{https://github.com/xuyang-liu16/V2Drop}

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10953 2026-02-26 cs.CL cs.AI 81%

Search or Accelerate: Confidence-Switched Position Beam Search for Diffusion Language Models

搜索或加速:基于置信度切换的位置束搜索用于扩散语言模型

Mingyu Cao, Alvaro H. C. Correia, Christos Louizos, Shiwei Liu, Lu Yin

机构 * University of Surrey(塞拉利昂大学) Qualcomm AI Research. Qualcomm AI Research is an initiative of Qualcomm Technologies, Inc.(高通人工智能研究) ELLIS Institute Tübingen(图宾根ELLIS研究所) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Tübingen AI Center(图宾根人工智能中心)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 SOAR通过置信度切换机制优化扩散语言模型的解码过程,提高生成质量并保持推理效率。

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21227 2026-02-26 cs.CL cs.AI 79%

Budget-Aware Agentic Routing via Boundary-Guided Training

基于边界引导的预算感知代理路由

Caiqi Zhang, Menglin Xia, Xuchao Zhang, Daniel Madrigal, Ankur Mallick, Samuel Kessler, Victor Ruehle, Saravan Rajmohan

机构 * University of Cambridge(剑桥大学) M365 Research, Microsoft(微软M365研究)

专题命中 效率与部署 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于边界引导的预算感知代理路由方法,通过动态选择廉价和昂贵模型以优化成本-成功率,并在稀疏奖励下实现高效训练和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21212 2026-02-26 cs.CL cs.IR cs.LG 79%

Disaster Question Answering with LoRA Efficiency and Accurate End Position

利用LoRA效率和准确端位置的灾难问答

Takato Yasuno

专题命中 效率与部署 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种基于日本灾难经验的问答系统,利用LoRA优化实现高准确率的灾难响应问答。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02137 2026-02-26 cs.LG cs.AI cs.SY eess.SY 79%

DCoPilot: Generative AI-Empowered Policy Adaptation for Dynamic Data Center Operations

DCoPilot: 基于生成AI的动态数据中心操作策略适应

Minghao Li, Ruihang Wang, Rui Tan, Yonggang Wen

机构 * NTU(国立新加坡大学) Yunnan University(云南大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 DCoPilot通过结合大型语言模型和超网络生成动态数据中心操作的控制策略,实现高效适应与稳定收敛。

Comments Accepted as a full paper at HSCC/ICCPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21477 2026-02-26 cs.MA 78%

Pancake: Hierarchical Memory System for Multi-Agent LLM Serving

Pancake:多代理LLM服务的分层内存系统

Zhengding Hu, Zaifeng Pan, Prabhleen Kaur, Vibha Murthy, Zhongkai Yu, Yue Guan, Zhen Wang, Steven Swanson, Yufei Ding

专题命中 效率与部署 :LLM(title,abstract)

AI总结 Pancake是一种多级代理内存系统,通过多级索引缓存、协调索引管理和GPU-CPU协作,提升了LLM服务的内存管理效率和吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22090 2026-02-26 cs.CL 77%

Confidence-Driven Multi-Scale Model Selection for Cost-Efficient Inference

基于置信度的多尺度模型选择以实现高效推理

Bo-Wei Chen, Chung-Chi Chen, An-Zi Yen

机构 * Department of Computer Science, National Yang Ming Chiao Tung University(计算机科学系,国家阳明交通大学) Artificial Intelligence Research Center, AIST(人工智能研究中心,AIST)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出基于置信度的多尺度模型选择方法,通过动态选择合适模型提升推理效率,实验表明在保持准确性的同时降低计算成本达20%-40%。

Comments Accepted by EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22142 2026-02-26 cs.CV 75%

WeaveTime: Stream from Earlier Frames into Emergent Memory in VideoLLMs

WeaveTime: 从早期帧中流式传输以形成涌现记忆在视频LLMs中

Yulin Zhang, Cheng Shi, Sibei Yang

机构 * ShanghaiTech University(上海科技大学) School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) School of Computing and Data Science, The University of Hong Kong(香港大学计算科学与数据科学学院)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 WeaveTime通过引入时间重建目标和动态关注缓存,提升视频LLMs在流式场景中的时间感知能力,减少延迟并提高准确性。

Comments Accepted at CVPR 2026 (preview; camera-ready in preparation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21215 2026-02-26 cs.CL cs.AI 73%

Inference-time Alignment via Sparse Junction Steering

推理时对齐 via 稀疏节点引导

Runyi Hu, Jie Zhang, Shiqian Zhao, Jiale Meng, Jiwei Li, Jason Zeng, Ming Wu, Michael Heinrich, Yonggang Wen, Tianwei Zhang

机构 * Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学) G Labs(0G实验室)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过稀疏节点引导方法,实现更高效的推理过程对齐,减少计算开销并提升生成质量。

Comments 28 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17849 2026-02-26 cs.LG cs.IT math.IT 70%

Quad Length Codes for Lossless Compression of e4m3

四长度编码用于e4m3的无损压缩

Aditya Agrawal, Albert Magyar, Hiteshwar Eswaraiah, Patrick Sheridan, Pradeep Janedula, Ravi Krishnan Venkatesan, Krishna Nair, Ravi Iyer

机构 * Google LLC(谷歌公司)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出四长度编码,结合压缩效率与解码速度,适用于e4m3数据类型的无损压缩。

Comments The first version proposed lossless compression of BFloat16 using dual length codes. This version proposes lossless compression of e4m3 using quad length codes. The versions will be merged later

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11935 2026-02-26 cs.PL cs.AI cs.SE 70%

A Problem-Oriented Perspective and Anchor Verification for Code Optimization

面向问题的视角与锚点验证用于代码优化

Tong Ye, Tengfei Ma, Xuhong Zhang, Hang Yu, Jianwei Yin, Wenhai Wang

机构 * Zhejiang University(浙江大学) Stony Brook University(石溪大学) AntGroup(蚂蚁集团)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出面向问题的视角与锚点验证框架,用于提升代码优化的正确性和效率,减少优化过程中的性能损耗。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21600 2026-02-26 cs.IR 67%

AQR-HNSW: Accelerating Approximate Nearest Neighbor Search via Density-aware Quantization and Multi-stage Re-ranking

AQR-HNSW:通过密度感知量化和多阶段重排序加速近似最近邻搜索

Ganap Ashit Tewary, Nrusinga Charan Gantayat, Jeff Zhang

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 AQR-HNSW通过密度感知量化和多阶段重排序提升HNSW算法的可扩展性,实现更高的查询速度和更低的内存消耗。

Comments Accepted at DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21447 2026-02-26 cs.CR cs.AI cs.CL cs.LG 67%

Adversarial Intent is a Latent Variable: Stateful Trust Inference for Securing Multimodal Agentic RAG

对抗意图是潜在变量:用于安全多模态代理RAG的状态信任推断

Inderjeet Singh, Vikas Pahuja, Aishvariya Priya Rathina Sabapathy, Chiara Picardi, Amit Giloni, Roman Vainshtein, Andrés Murillo, Hisashi Kojima, Motoyoshi Sekiya, Yuki Unno, Junichi Suga

机构 * Fujitsu Research of Europe, UK(富士通欧洲研究机构,英国) Fujitsu Limited, Japan(富士通株式会社,日本)

专题命中 效率与部署 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MMA-RAG^T框架,通过状态化信任推断提升多模态代理RAG的安全性,实验显示攻击成功率显著降低。

Comments 13 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21224 2026-02-26 cs.CL cs.AI cs.DC cs.LG 67%

Make Every Draft Count: Hidden State based Speculative Decoding

让每个草稿都值得:基于隐藏状态的推测解码

Yuetao Chen, Xuliang Wang, Xinzhou Zheng, Ming Li, Peng Wang, Hong Xu

机构 * The Chinese University of Hong Kong(香港中文大学) University of Waterloo(滑铁卢大学) University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于隐藏状态的推测解码系统,通过自回归预测和延迟整合标记信息,提高隐藏状态重用率,实现3.3倍的推理速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14249 2026-02-26 cs.CV 67%

Any Image Restoration via Efficient Spatial-Frequency Degradation Adaptation

通过高效空间-频率退化适应实现任意图像修复

Bin Ren, Eduard Zamfir, Zongwei Wu, Yawei Li, Yidi Li, Danda Pani Paudel, Radu Timofte, Ming-Hsuan Yang, Luc Van Gool, Nicu Sebe

机构 * University of Trento(特伦托大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Würzburg(乌尔姆大学) ETH Zürich(苏黎世联邦理工学院) Taiyuan University of Technology(太原理工大学) University of California, Merced(加州大学默塞德分校)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 AnyIR通过联合嵌入机制实现高效且全面的图像修复,减少模型参数和FLOPs达84%和80%,在四个基准测试中取得SOTA性能。

Comments Efficient All-in-One Image Restoration, Accepted by TMLR in 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21757 2026-02-26 cs.LG cs.AI 62%

Learning from Yesterday's Error: An Efficient Online Learning Method for Traffic Demand Prediction

从昨日误差学习:一种用于交通需求预测的高效在线学习方法

Xiannan Huang, Quan Yuan, Chao Yang

机构 * Key Laboratory of Road and Traffic Engineering, Ministry of Education at Tongji University(交通工程教育部重点实验室,同济大学) Urban Mobility Institute, Tongji University(交通 mobility 院,同济大学)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 FORESEE提出了一种高效在线学习方法,通过利用昨日误差修正交通需求预测,实现高精度和低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21472 2026-02-26 cs.LG 57%

The Design Space of Tri-Modal Masked Diffusion Models

三模态掩码扩散模型的设计空间

Louis Bethune, Victor Turrisi, Bruno Kacper Mlodozeniec, Pau Rodriguez Lopez, Lokesh Boominathan, Nikhil Bhendawade, Amitis Shidani, Joris Pelemans, Theo X. Olausson, Devon Hjelm, Paul Dixon, Joao Monteiro, Pierre Ablin, Vishnu Banna, Arno Blaas, Nick Henderson, Kari Noriy, Dan Busbridge, Josh Susskind, Marco Cuturi, Irina Belousova, Luca Zappella, Russ Webb, Jason Ramapuram

机构 * Apple(苹果公司) Google Deepmind(谷歌DeepMind) University of Cambridge(剑桥大学) MIT(麻省理工学院)

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 本文提出了一种从头开始预训练的三模态掩码扩散模型,通过分析多模态扩展定律和批大小效应,实现了优化的推理采样,并在文本生成、图像生成和语音生成任务中取得了显著成果。

Comments 41 pages, 29 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13329 2026-02-26 cs.CL 57%

Embedding-Based Context-Aware Reranker

基于嵌入的上下文感知重排序器

Ye Yuan, Mohammad Amin Shabani, Siqi Liu

机构 * McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克人工智能研究所) RBC Borealis

专题命中 效率与部署 :language model(abstract);分类 cs.CL

AI总结 本文提出EBCAR,一种基于嵌入的上下文感知重排序器,通过增强跨段落理解提升信息检索的准确性和效率。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22020 2026-02-26 cs.SE cs.HC 50%

Detecting UX smells in Visual Studio Code using LLMs

使用LLMs检测Visual Studio Code中的用户体验问题

Andrés Rodriguez, Juan Cruz Gardey, Alejandra Garrido

专题命中 效率与部署 :LLM(abstract)

AI总结 本文提出利用LLMs检测Visual Studio Code中用户体验问题的方法,通过分析用户报告的问题发现信息性、清晰性、直观性和效率是主要的用户体验问题所在。

Comments 4 pages, 2 figures, 1 table, 3rd International Workshop on Integrated Development Environments (IDE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21656 2026-02-26 physics.optics 50%

Pure-amplitude holograms for high-efficiency generation of phase radial grating based radial carpet beams: Theory and experiments under plane-wave and Gaussian illumination

纯幅度全息图用于高效生成基于径向光栅的径向地毯光束:平面波和高斯光束下的理论与实验

Saifollah Rasouli, Somaye Fathollazade, Mohammad Mohammadi

专题命中 效率与部署 :SLM(abstract)

AI总结 本研究提出了一种纯幅度全息图,通过平面波和高斯光束生成高效径向地毯光束,显著提高功率效率。

Comments 28 pages and 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01984 2026-02-26 cs.CV 50%

Enhancing Multi-Image Understanding through Delimiter Token Scaling

通过分隔符标记扩展提升多图像理解

Minyoung Lee, Yeji Park, Dongjun Hwang, Yejin Kim, Seong Joon Oh, Junsuk Choe

专题命中 效率与部署 :language model(abstract)

AI总结 通过扩展分隔符标记的隐藏状态,提升多图像理解性能,有效减少跨图像信息泄露,提高模型区分和推理能力。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00981 2026-02-26 cs.SD 50%

FlexiCodec: A Dynamic Neural Audio Codec for Low Frame Rates

FlexiCodec: 一种用于低帧率的动态神经音频编解码器

Jiaqi Li, Yao Qian, Yuxuan Hu, Leying Zhang, Xiaofei Wang, Heng Lu, Manthan Thakker, Jinyu Li, Sheng Zhao, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Microsoft(微软公司) Shanghai Jiao Tong University(上海交通大学) Shenzhen Loop Area Institute(深圳河套学院) City University of Macau(澳门城市大学) Amphion Technology Co., Ltd.(Amphion科技有限公司)

专题命中 效率与部署 :language model(abstract)

AI总结 FlexiCodec通过动态帧率方法和双流编码架构,提升低帧率下的语义保留和音频重建质量。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏