arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-31 至 2026-03-31 共收录 405 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 62 篇

2603.28569 2026-03-31 cs.LG cs.AI cs.IR cs.PF 86%

CirrusBench: Evaluating LLM-based Agents Beyond Correctness in Real-World Cloud Service Environments

CirrusBench:在真实云服务环境中评估基于LLM的代理超越正确性的能力

Yi Yu, Guangquan Hu, Chenghuang Shen, Xingyan Liu, Jing Gu, Hangyi Sun, Junzhuo Ma, Weiting Liu, Jianfeng Liu, Mingyue Pu, Yu Wang, Zhengdong Xiao, Rui Xie, Longjiu Luo, Qianrong Wang, Gurong Cui, Honglin Qiao, Wenlian Lu

机构 * School of Mathematics and Sciences, Fudan University(复旦大学数学科学学院) Shanghai Center for Mathematical Sciences, Fudan University(复旦大学上海数学中心) Alibaba Group(阿里巴巴集团) Institute of Science and Technology for Brain-Inspired Intelligence, Fudan University(复旦大学类脑智能科学与技术研究院) Center for Applied Mathematics & Shanghai Key Laboratory of Contemporary Applied Mathematics, Fudan University(复旦大学应用数学中心暨上海市现代应用数学重点实验室)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CirrusBench框架,基于真实云服务工单数据评估LLM代理的鲁棒性和解决效率,引入客户导向指标量化服务质量,揭示现有模型在复杂多轮任务中的不足。

Comments Submitted for SIGKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01499 2026-03-31 cs.CR cs.AI 85%

Towards Privacy-Preserving LLM Inference via Covariant Obfuscation (Technical Report)

通过协变混淆实现隐私保护的大语言模型推断(技术报告)

Yu Lin, Qizhi Zhang, Wenqiang Ruan, Daode Zhang, Jue Hong, Ye Wu, Hanning Xia, Yunlong Mao, Sheng Zhong

机构 * ByteDance(字节跳动) Nanjing University(南京大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出AloePri,首个适用于工业应用的隐私保护大语言模型推断方法,通过协变混淆同时保护输入输出数据,实现高准确性和隐私性,兼容现有基础设施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27138 2026-03-31 cs.LG 85%

ScoutAttention: Efficient KV Cache Offloading via Layer-Ahead CPU Pre-computation for LLM Inference

ScoutAttention:通过层前CPU预计算实现高效的KV缓存卸载以用于LLM推理

Qiuyang Zhang, Kai Zhou, Ding Tang, Kai Lu, Cheng Li, Zhenyu Yang, Peng Xu, Jiguang Wan

机构 * Huazhong University of Science and Technology(华中科技大学) Huawei Technologies(华为技术有限公司)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出ScoutAttention框架,通过GPU-CPU协作计算加速LLM推理,采用层前CPU预计算和异步召回机制,减少CPU负载,实验表明在保持2.4%准确率的同时,比现有方法快2.1倍。

Comments Accepted at the 63rd Design Automation Conference (DAC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14903 2026-03-31 cs.CL 85%

ExPosST: Explicit Positioning with Adaptive Masking for LLM-Based Simultaneous Machine Translation

ExPosST:基于自适应掩码的LLM同时机器翻译显式定位

Yuzhe Shang, Pengzhi Gao, Yazheng Yang, Jiayao Ma, Wei Liu, Jian Luan, Jinsong Su

机构 * School of Informatics, Xiamen University(厦门大学信息学院) MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus团队) The University of Hong Kong(香港大学)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 ExPosST通过显式位置分配解决LLM在同时机器翻译中的位置不匹配问题,实现高效解码与位置一致性,支持多种策略下的同时翻译。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26797 2026-03-31 cs.LG 85%

MemGuard-Alpha: Detecting and Filtering Memorization-Contaminated Signals in LLM-Based Financial Forecasting via Membership Inference and Cross-Model Disagreement

MemGuard-Alpha:通过成员推断和跨模型分歧检测和过滤受记忆污染的信号在基于LLM的金融预测中

Anisha Roy, Dip Roy

机构 * Jaypee Institute of Information Technology(贾伊皮信息技术学院) Indian Institute of Technology Patna(印度理工学院巴特那分校)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 MemGuard-Alpha通过成员推断和跨模型分歧方法,检测并过滤LLM生成的受记忆污染的信号,提升金融预测的准确性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28018 2026-03-31 eess.SP 85%

Low-Latency Edge LLM Handover via Joint KV Cache Transfer and Token Prefill

通过联合KV缓存传输和令牌预填充实现低延迟边缘LLM切换

Seunghun Lee, Jihong Park, Ce Zheng, Hyuncheol Park

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种联合选择预填充长度和调度回传KV缓存传输的统一切换设计,以最小化多用户设备的LLM切换延迟,通过仿真验证其在不同回传容量、预填充速度和上下文大小下的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10079 2026-03-31 cs.LG cs.AI cs.CL 85%

Sparse-RL: Breaking the Memory Wall in LLM Reinforcement Learning via Stable Sparse Rollouts

稀疏强化学习:通过稳定稀疏回放突破大语言模型强化学习的内存瓶颈

Sijia Luo, Xiaokang Zhang, Yuxuan Hu, Bohan Zhang, Ke Wang, Jinbo Su, Mengshu Sun, Lei Liang, Jing Zhang

机构 * School of Information, Renmin University of China(中国人民大学信息学院) Key Laboratory of Data Engineering and Knowledge Engineering(数据工程与知识工程重点实验室) Ant Group(蚂蚁集团)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出稀疏强化学习方法,通过稳定稀疏回放解决大语言模型强化学习中的内存瓶颈问题,采用稀疏采样和重要性重加权技术减少计算开销并提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26716 2026-03-31 eess.SP cs.LG 83%

FEMBA on the Edge: Physiologically-Aware Pre-Training, Quantization, and Deployment of a Bidirectional Mamba EEG Foundation Model on an Ultra-low Power Microcontroller

FEMBA在边缘:一种生理感知的预训练、量化和在超低功耗微控制器上部署双向Mamba EEG基础模型

Anna Tegon, Nicholas Lehmann, Yawei Li, Andrea Cossettini, Luca Benini, Thorir Mar Ingolfsson

机构 * Integrated Systems Laboratory, ETH Zürich(苏黎世联邦理工学院集成系统实验室) DEI, University of Bologna(博洛尼亚大学电气、电子与信息工程系)

专题命中 效率与部署 :foundation model(title,abstract);post-training(abstract);分类 cs.LG

AI总结 本文提出FEMBA,通过生理感知预训练、量化和部署,实现基于Mamba的EEG基础模型在超低功耗微控制器上的高效应用,提升长期神经监测性能。

Comments 10 pages, 9 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28119 2026-03-31 cs.SE 82%

Compressing Code Context for LLM-based Issue Resolution

基于LLM的问题解决的代码上下文压缩

Haoxiang Jia, Earl T. Barr, Sergey Mechtaev

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出OCD算法和SWEzze模型,通过遗传搜索和delta调试压缩代码上下文,提升问题解决效率,实现6倍压缩率,减少51.8%-71.3%的token预算,提高5.0%-9.2%的问题解决率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13191 2026-03-31 cs.CV cs.AI cs.CL 81%

CoPE-VideoLM: Leveraging Codec Primitives For Efficient Video Language Modeling

CoPE-VideoLM:利用编解码器原语实现高效的视频语言建模

Sayan Deb Sarkar, Rémi Pautrat, Ondrej Miksik, Marc Pollefeys, Iro Armeni, Mahdi Rad, Mihai Dusmanu

机构 * Microsoft Spatial AI Lab(微软空间人工智能实验室) Stanford University(斯坦福大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CoPE-VideoLM,通过利用视频编解码器原语(如运动矢量和残差)减少计算开销,提升视频语言模型的效率和性能。

Comments Project Page: https://microsoft.github.io/CoPE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26675 2026-03-31 cs.CL cs.LG 81%

GeoBlock: Inferring Block Granularity from Dependency Geometry in Diffusion Language Models

GeoBlock:从扩散语言模型中的依赖几何推断块粒度

Lipeng Wan, Junjie Ma, Jianhui Gu, Zeyang Liu, Xuyang Lu, Xuguang Lan

机构 * Xi'an Jiaotong University(西安交通大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 GeoBlock通过分析依赖几何推断块粒度,提升扩散语言模型的并行效率与依赖一致性。

Comments 13 pages, 4 figures, Code available upon publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28060 2026-03-31 cs.SE 80%

DAInfer+: Neurosymbolic Inference of API Specifications from Documentation via Embedding Models

DAInfer+: 通过嵌入模型从文档中推断API规范的神经符号推理

Maryam Masoudian, Anshunkang Zhou, Chengpeng Wang, Charles Zhang

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出DAInfer+,利用NLP和嵌入模型从库文档推断API规范,通过神经符号优化提高数据流和别名关系推断的精度与效率。

Comments 35 pages, Under submission to ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28534 2026-03-31 cs.CL physics.data-an 79%

Compressing Transformer Language Models via Matrix Product Operator Decomposition: A Case Study on PicoGPT

通过矩阵积算符分解压缩变换器语言模型:以PicoGPT为例

Younes Javanmard, Tanmoy Pandit, Masoud Mardani

机构 * Institut für Theoretische Physik, Leibniz Universität Hannover(莱布尼茨汉诺威大学理论物理研究所) VTT Technical Research Centre of Finland(芬兰VTT技术研究中心) National High Magnetic Field Laboratory(国家高磁场实验室)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL

AI总结 本文研究了通过矩阵积算符分解压缩变换器语言模型的方法,以PicoGPT为例,展示了在不同bond维度下参数压缩效果及模型精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27385 2026-03-31 cs.LG 79%

Active In-Context Learning for Tabular Foundation Models

基于表格的上下文学习主动学习

Wilailuck Treerath, Fabrizio Pittorino

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出Tab-AICL方法,通过四种获取规则提升表格基础模型的冷启动样本效率,实验显示其在20个分类基准上优于梯度提升基线。

Comments 8 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24143 2026-03-31 cs.CL 79%

Activation Steering for Masked Diffusion Language Models

激活引导用于掩码扩散语言模型

Adi Shnaidman, Erin Feiglin, Osher Yaari, Efrat Mentel, Amit Levi, Raz Lapid

机构 * Deepkeep Technion—Israel Institute of Technology(以色列理工学院)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL

AI总结 本文提出激活引导方法,通过提取对比提示集的低维方向,实现对MDLMs推理过程的控制,展示了在安全拒绝任务中的有效性及跨语言迁移能力。

Comments Accepted at ReALM-GEN @ ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26769 2026-03-31 cs.CV cs.AI 79%

Edge Reliability Gap in Vision-Language Models: Quantifying Failure Modes of Compressed VLMs Under Visual Corruption

视觉-语言模型边缘可靠性差距:压缩VLM在视觉损坏下的失败模式量化

Mehmet Kaan Erol

机构 * Marmara University, Institute of Pure and Applied Sciences(马尔马拉大学纯科学与应用科学研究所)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 本文比较了压缩的视觉-语言模型在视觉损坏下的失败模式,发现紧凑模型在COCO上表现出更高的语义漂移和对象盲区,且置信度校准存在显著差异。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26731 2026-03-31 cs.CV cs.AI 79%

Contextual inference from single objects in Vision-Language models

从单个物体中推断上下文在视觉-语言模型中的研究

Martina G. Vilas, Timothy Schaumlöffel, Gemma Roig

机构 * Goethe University Frankfurt(法兰克福大学) The Hessian Center for AI(黑森州人工智能中心)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 本文研究了视觉-语言模型中单个物体推断场景上下文的能力,发现物体属性影响推断性能,且不同层次的推断存在解耦现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26823 2026-03-31 cs.LG cs.AI cs.PF 79%

Throughput Optimization as a Strategic Lever in Large-Scale AI Systems: Evidence from Dataloader and Memory Profiling Innovations

通过吞吐量优化在大规模AI系统中的战略杠杆作用:来自数据加载器和内存分析创新的证据

Mayank Jha

机构 * Amazon Robotics(亚马逊机器人)

专题命中 效率与部署 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过数据加载器和内存优化创新,探讨吞吐量优化在大规模AI系统中的战略作用,分析架构改进、内存优化及编译器优化对训练效率的影响。

Comments 5 pages double sided

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26770 2026-03-31 cs.CV 78%

Quantized Vision-Language Models for Damage Assessment: A Comparative Study of LLaVA-1.5-7B Quantization Levels

量化视觉-语言模型用于损伤评估:LLaVA-1.5-7B量化级别的比较研究

Takato Yasuno

专题命中 效率与部署 :language model(title,abstract)

AI总结 本文研究了量化视觉-语言模型在桥梁损伤评估中的应用,比较了不同量化级别在描述质量、推理速度和资源需求之间的平衡,发现Q5_K_M在质量、速度和效率上达到最佳平衡。

Comments 16 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28062 2026-03-31 cs.AI 77%

SLOW: Strategic Logical-inference Open Workspace for Cognitive Adaptation in AI Tutoring

SLOW:面向AI辅导的认知适应战略逻辑推理开放工作区

Yuang Wei, Ruijia Li, Bo Jiang

机构 * Shanghai Institute of Artificial Intelligence for Education(上海人工智能教育研究院)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SLOW框架通过透明决策工作区实现学习者状态推理与教学决策分离,提升个性化、情感敏感性和清晰度。

Comments 15 pages,3 figures. The 27th International Conference on Artificial Intelligence in Education

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27850 2026-03-31 cs.SE cs.CL 77%

EffiSkill: Agent Skill Based Automated Code Efficiency Optimization

EffiSkill:基于代理技能的自动代码效率优化

Zimu Wang, Yuling Shi, Mengfan Li, Zijun Liu, Jie M. Zhang, Chengcheng Wan, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学) University of California, Berkeley(加州大学伯克利分校) Columbia University(哥伦比亚大学) King's College London(伦敦国王学院) East China Normal University(华东师范大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 EffiSkill通过构建可移植的优化工具箱,利用代码效率优化机制,实现无运行反馈的代码优化,提升了优化成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27423 2026-03-31 cs.AI cs.SE 77%

AstraAI: LLMs, Retrieval, and AST-Guided Assistance for HPC Codebases

AstraAI:基于LLM、检索与AST引导的HPC代码库辅助系统

Mahesh Natarajan, Xiaoye Li, Weiqun Zhang

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AstraAI通过整合LLM、RAG和AST分析,实现对复杂科学代码库的上下文感知代码生成,支持HPC环境中的代码修改与结构保持。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27414 2026-03-31 math.ST cs.AI stat.TH 77%

Multiple-Prediction-Powered Inference

多预测驱动推断

Charlie Cowen-Breen, Alekh Agarwal, Stephen Bates, William W. Cohen, Jacob Eisenstein, Amir Globerson, Adam Fisch

机构 * Massachusetts Institute of Technology(麻省理工学院) Google Research(谷歌研究院) Google DeepMind(谷歌DeepMind)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出多预测驱动推断框架,通过优化分配资源于不同数据源,实现统计高效估计。理论证明其最小最大最优性、有限样本性能和渐近正态性,并在三个大语言模型评估场景中验证了其优于现有基线的估计误差。

Comments ICLR 2026, 45 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03548 2026-03-31 cs.CL 77%

SEAD: Self-Evolving Agent for Multi-Turn Service Dialogue

SEAD:多轮服务对话的自演化代理

Yuqin Dai, Ning Gao, Wei Zhang, Jie Wang, Zichen Luo, Jinpeng Wang, Yujie Wang, Ruiyuan Wu, Chaozheng Wang

机构 * Meituan(美团)

专题命中 效率与部署 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.CL

AI总结 SEAD通过自演化机制提升服务对话性能,无需大规模人工标注,实验显示其任务完成率和对话效率均优于开源和商用模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28430 2026-03-31 cs.LG cs.CL 76%

IsoQuant: Hardware-Aligned SO(4) Isoclinic Rotations for LLM KV Cache Compression

IsoQuant: 基于硬件对齐的 SO(4) 等倾旋转用于 LLM KV 缓存压缩

Zhongping Ji

专题命中 效率与部署 :LLM(title);分类 cs.CL、cs.LG

AI总结 IsoQuant 基于四元数代数和 SO(4) 的等倾分解,通过块级旋转框架实现低比特在线向量量化,减少存储和计算成本,提升 KV 缓存压缩效率。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28366 2026-03-31 cs.CV 75%

AutoCut: End-to-end advertisement video editing based on multimodal discretization and controllable generation

AutoCut:基于多模态离散化和可控生成的端到端广告视频编辑

Milton Zhou, Sizhong Qin, Yongzhi Li, Quan Chen, Peng Jiang

机构 * Tsinghua University(清华大学) Kuaishou Technology(快手科技)

专题命中 效率与部署 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出AutoCut框架,通过多模态离散化和可控生成实现广告视频编辑,提升一致性和可控性,降低生产成本和迭代时间。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22590 2026-03-31 cs.SE 75%

Small is Beautiful: A Practical and Efficient Log Parsing Framework

小即是美:一种实用且高效的日志解析框架

Minxing Wang, Yintong Huo

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出EFParser,一种基于LLM的日志解析器,通过架构创新提升小型模型性能,实验证明其在小型模型上优于现有方法12.5%。

Comments Accepted by FSE'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28028 2026-03-31 cs.CV cs.LG 74%

Efficient Domain Adaptation for Text Line Recognition via Decoupled Language Models

通过解耦语言模型实现文本行识别的高效领域适应

Arundhathi Dev, Justin Zhan

机构 * University of Cincinnati(辛辛那提大学)

专题命中 效率与部署 :language model(title);分类 cs.LG

AI总结 本文提出一种模块化检测-校正框架,利用预训练序列模型实现高效领域适应,减少计算量95%,在现代手写体、连笔字和历史文档上均表现优异。

Comments Accepted to the International Conference on Machine Intelligence Theory and Applications (MiTA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02711 2026-03-31 cs.CL cs.LG 73%

CREST: Universal Safety Guardrails Through Cluster-Guided Cross-Lingual Transfer

CREST:通过聚类引导的跨语言迁移实现通用安全性防护

Lavish Bansal, Naman Mishra

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出CREST模型,通过跨语言迁移有效提升低资源语言的安全性防护,展示其在六个安全基准上的优越表现。

Comments 9 Pages, 5 Figures, Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03616 2026-03-31 cs.CL cs.AI 73%

Multilingual Retrieval-Augmented Generation for Knowledge-Intensive Task

多语言检索增强生成用于知识密集型任务

Leonardo Ranaldi, Barry Haddow, Alexandra Birch

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究多语言检索增强生成在开放域问答中的有效性,提出tRAG和MultiRAG方法,发现tRAG覆盖有限,MultiRAG效率高但存在不一致,CrossRAG通过翻译文档到共同语言提升性能。

Journal ref 2026.findings-eacl.35

详情

展开后加载摘要…

URL PDF HTML 收藏