arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1921 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 1921 篇

2606.17372 2026-06-18 cs.CL cs.AI 新提交 81%

Implicit vs. Explicit Prompting Strategies for LVLMs in Referential Communication

LVLMs在指称通信中的隐式与显式提示策略

Peter Zeng, Amie J. Paige, Weiling Li, Susan E. Brennan, Owen Rambow, Cameron R. Jones

机构 * Stony Brook University(石溪大学)

专题命中 效率与部署 :prompting(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究通过控制任务差异,比较显式与隐式提示对LVLM生成高效指称表达的影响,发现显式提示下模型能协调高效表达,而隐式提示则失败,揭示了人机通信的关键差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11766 2026-06-17 eess.AS cs.AI cs.CL cs.SD 新提交 81%

Fast Speech Foundation Model Distillation Using Interleaved Stacking

快速语音基础模型蒸馏使用交错堆叠

Eungbeom Kim, Kyogu Lee

机构 * IPAI AIIS Dept. of Intelligence and Information(智能与信息系)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出交错堆叠方法加速语音基础模型蒸馏训练,通过保持层位置一致性解决性能下降问题,在SUPERB上验证有效性。

Comments Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09643 2026-06-09 cs.DC cs.AI cs.LG cs.OS 新提交 81%

FMplex: Model Virtualization for Serving Extensible Foundation Models

FMplex: 用于服务可扩展基础模型的模型虚拟化

Hetvi Shastri, Pragya Sharma, Walid A. Hanafy, David Irwin, Mani Srivastava, Prashant Shenoy

机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) University of California Los Angeles(加州大学洛杉矶分校)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出FMplex系统,通过将基础模型作为虚拟化层实现多任务共享,结合批感知公平队列调度器,在7个基础模型和92个下游任务上降低延迟达80%,提升任务容量6倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08565 2026-06-09 cs.LG cs.AI 新提交 81%

EinSort: Sorting is All We Need for Tensorizing LLM

EinSort: 张量化大语言模型,排序即一切

Toshiaki Koike-Akino, Jing Liu, Ye Wang

机构 * Toshiaki Koike-Akino Jing Liu Ye Wang

专题命中 效率与部署 :LLM(title);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 提出EinSort方法,通过索引排序发现张量中的低秩结构,实现大语言模型权重和KV缓存的张量化压缩,相比基线方法提升了重构质量。

Comments 38 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08497 2026-06-09 cs.AI cs.CL 新提交 81%

Explaining Black-Box Language Models: Learning to Optimize Linguistically-Structured Word Subsets

解释黑盒语言模型:学习优化语言结构化的单词子集

Minyoung Hwang, Seokhyun Lee, Changhee Lee

机构 * Korea University(高丽大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对黑盒语言模型解释的三个关键需求(推理效率、黑盒兼容性、语言结构可解释性),提出一种通过强化学习选择信息性单词子集的方法,实现高效、无梯度且语言连贯的解释。

Comments KDD 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07630 2026-06-09 cs.LG cs.AI stat.ML 新提交 81%

Active Learning with Foundation Model Priors: Efficient Learning under Class Imbalance

基于基础模型先验的主动学习:类别不平衡下的高效学习

Jiancheng Zhang, Meiqing Li, Qi Zhang, Yinglun Zhu

机构 * University of California, Riverside(加州大学河滨分校) Carnegie Mellon University(卡内基梅隆大学) Worcester Polytechnic Institute(伍斯特理工学院)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 针对现实数据中的类别不平衡和噪声标注问题,提出一种利用基础模型先验的主动学习框架,通过不平衡感知的协同决策选择信息量最大的样本,在图像和文本数据集上实现超过50%的标注节省。

Comments To appear at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07581 2026-06-09 cs.LG cs.AI cs.ET 新提交 81%

Training-Inference Kernel Contracts: Bounding Divergence in Post-Training and Deployment

训练-推理核契约:约束后训练与部署中的偏差

Bruce Changlong Xu, Lan Wu

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 效率与部署 :post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 提出核契约框架,通过数值、统计、运行时和可观测性条款约束训练核与推理核之间的分布偏差,并推导偏差界以保障策略梯度无偏性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11553 2026-06-11 cs.LG 新提交 80%

APEX: A Network-Native Time-Series Foundation Model for Forecasting and Anomaly Detection for Wireless Edge Operations

APEX:面向无线边缘运维的预测与异常检测的网络原生时间序列基础模型

Swadhin Pradhan, Niloo Bahadori, Peiman Amini

机构 * Cisco Systems, USA(思科系统公司)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 提出网络原生解码器Transformer APEX,针对企业AP遥测数据预训练,在DHCP退化基准上MAE比最强基线降低18%,异常检测F1=0.93,边缘版本实现亚秒级隐私保护推理。

Comments 5 pages, 1 figure, 4 tables. Discusses a network-native time-series foundation model for wireless edge operations

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14783 2026-08-18 cs.CV cs.GR 新提交 80%

MegaParts: Scaling Part-Aware 3D Object Generation to 300 Parts via Token-Efficient Autoregressive Modeling

MegaParts:通过令牌高效自回归建模将部件感知三维物体生成扩展至300个部件

Manwen Liao, Xinyu Lian, Jian Mao, Kaixu Chen, Li Luo, Jinghao Yan, Wanshui Gan, Qiao Yu, Weitian Zhang, Chunhua Shen, Guang Chen, Bo Dai, Xudong Xu, Zhaoyang Lyu

机构 * The University of Hong Kong(香港大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Tongji University(同济大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 MegaParts提出结合结构化序列建模与令牌高效矢量量化形状令牌化器的自回归框架,将部件感知3D生成扩展至300个部件,性能优于基线模型,为大规模部件感知3D生成提供新方案。

Comments 12 pages, 6 pages appendix, 13 figures, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14561 2026-08-18 cs.DC cs.OS cs.PF 新提交 80%

A Biophysically-Inspired Feedback Controller for Multi-Class Cache Fairness

受生物物理启发的多类缓存公平性反馈控制器

Matt R. Flax

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 针对多租户LLM服务的缓存公平性问题,提出受生物物理启发的多类缓存替换策略,在合成工作负载上缩小了LRU与Belady的未命中率差距,实现公平性与吞吐量的可调权衡。

Comments 24 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13723 2026-08-17 cs.RO 新提交 80%

Graph-MambaNav: Spatial-Temporal Graph Mamba Leveraging Object-Relation Knowledge for Object-Goal Navigation

Graph-MambaNav:利用对象关系知识的时空图Mamba用于目标对象导航

Leyuan Sun, Genxin Chen, Linwei Ye, Yan Zhang, Xi Kan, Yanfei Sun

机构 * School of Internet of Things Engineering, Wuxi University(无锡大学物联网工程学院) School of Communications and Information Engineering, Nanjing University of Posts and Telecommunications(南京邮电大学通信与信息工程学院)

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 本研究提出Graph-MambaNav,一种结合LLM常识对象关系的目标感知时空图编码框架,通过节点排序与Mamba建模实现高效导航,在仿真环境表现优异且泛化性好,经真实机器人部署验证有效。

Comments Accepted by IEEE Robotics and Automation Letters (IEEE RA-L), will transfer to 2027 IEEE International Conference on Robotics & Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12209 2026-08-13 cs.CV 新提交 80%

Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction

作为辅助监督的生成:通过解耦嵌入预测以零推理开销增强视觉理解

Zhongbin Guo, Jiahao Xie, Dongling Xiao, Qianle Wang, Ruiqi Lu, Xiaomin He, Wanxuan Sun, Cheng Yang

机构 * ByteDance(字节跳动)

专题命中 效率与部署 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn)

AI总结 本研究提出GAS框架,将视觉生成作为辅助监督,通过解耦MoT架构的NEP实现零推理开销,提升了多模态理解尤其是感知与空间理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11820 2026-08-13 cs.CV 新提交 80%

TD-VAD: Breaking Visual Dependence in Video Anomaly Detection with Text-Driven Learning

TD-VAD:通过文本驱动学习打破视频异常检测中的视觉依赖

Shuangqing Zhang, Lei-Lei Ma, Zhao Wang, Wen Dong, Xinyi Xu, Guo-Sen Xie, Caifeng Shan, Fang Zhao

机构 * School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) School of Artificial Intelligence Engineering, Hefei Institute of Technology(合肥工业大学人工智能工程学院) China Mobile Zijin Innovation Institute(中国移动紫金创新研究院) School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院)

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 针对现有视频异常检测依赖视觉数据的问题,提出TD-VAD方法,利用LLM生成的文本描述训练模型,结合事件演化因果注意力模块与CLIP编码器,在XD-Violence和UCF-Crime上性能大幅优于现有方法。

Comments Accepted to ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10139 2026-08-12 cs.DB 新提交 80%

AI Query Compilation for Unified and Optimized Execution

用于统一且优化执行的AI查询编译

Yeounoh Chung, Helena Caminal, Fatma Ozcan

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 该研究提出统一编译执行架构范式,将SQL与LLM整合为张量计算图消除PCIe瓶颈,在SemBench数据集的TPU实验获最高5.3倍延迟、9.8倍吞吐量加速,还给出相关研究路线图。

Comments Proceedings of the VLDB Endowment, Vol. 14, No. 1 ISSN 2150-8097

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08352 2026-08-11 cs.PL 新提交 80%

SimP: Unifying Syntax- and Semantic-Guided Techniques for Efficient Program Reduction

SimP:统一语法与语义引导技术的高效程序缩减方法

Ye Xiong, Xiangyu Gao, Qiaochu Chen, Mingyu Li, Haibo Chen

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 SimP框架结合传统与LLM式缩减技术,兼顾缩减效率与质量,且LLM成本可忽略,解决编译器漏洞调试中测试程序过大的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06677 2026-08-10 cs.DB 新提交 80%

From Interpretation to Compilation: A Compilation-Based Execution Engine for Semantic Operator Systems

从解释到编译:面向语义算子系统的基于编译的执行引擎

Wenkai Dong, Yifan Wang

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 提出SemBaker编译式执行引擎,通过生成Python函数本地执行替代逐项LLM调用,支持多工具,在200查询的问答工作负载中获4.8-6.3倍加速与5.4-10.7倍成本降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02909 2026-08-05 econ.EM stat.ML 新提交 80%

When Predictions Become Regressors: A Split-Sample Correction for Biases in Downstream Inference

当预测成为回归元:针对下游推断偏差的拆分样本校正方法

Nathan Canen, Ted Enamorado

专题命中 效率与部署 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn)

AI总结 本文针对预测生成测度用作回归元的偏差问题,提出基于独立拆分样本构建工具变量的校正方法,经模拟及两个实证案例验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03223 2026-08-05 cs.LG cs.AI cs.CL 新提交 80%

Agentic Reinforcement Learning with Self-Distilled Reward Shaping

具有自提炼奖励塑造的智能体强化学习

Ranxu Zhang, Guinan Chen, Chenshaodong, Jinghao Lin, Xiaozhou Xu, Sunzhe, Yanyong Zhang, Chao Wang

专题命中 效率与部署 :LLM(abstract,abstract_cn);language agent(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对智能体强化学习中稀疏奖励无法分配中间决策信用的问题,提出ADRS框架,通过校准教师分数等提升多轮语言智能体在长时域任务的性能,且增益稳定。

Comments 17 pages,10 figures,11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03065 2026-08-05 cs.SE 新提交 80%

Efficient Grammar-Constrained Decoding via Parser Stack Classification

基于解析器栈分类的高效语法约束解码

Yongmin Li, Yihong Dong, Jia Li, Ge Li

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 本文提出PSC方法,通过解析器栈分类实现高效语法约束解码,其计算掩码速度远快于基线,可提升LLM的端到端吞吐量。

Comments accepted by ISSTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00368 2026-08-04 eess.SP 新提交 80%

Agent-Native Task-Oriented Communication with Joint Token Compression Coding and Modulation

面向智能体原生的任务导向通信:联合令牌压缩编码与调制

Zhuoran Xiao, Yihang Huang, Tianyu Jiao, Xiaohua Xu, Yin Xu

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 该研究针对无线令牌通信系统的原生设计缺口,提出AI原生语义通信框架JTCM,通过两阶段训练实现任务导向的令牌传输,可降低传输开销并提升任务精度与鲁棒性。

Comments This paper is accepted by IEEE Globecom 2026, to appear

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01785 2026-08-04 cs.DC 新提交 80%

HorizonServe: Coordinating Request Scheduling with GPU Sharing for Omni-Model Serving

HorizonServe:面向全模态模型服务的请求调度与GPU共享协调系统

Yuning Zhang, Dong Yuan

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 HorizonServe是一款单GPU全模态模型服务系统,通过协调请求准入与GPU分配,提升了SLO达成率并降低了首响应延迟,解决了全模态模型统一部署的调度问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29069 2026-08-03 cs.DC 新提交 80%

Rethinking AI Cloud Infrastructure for Agentic Serving Systems with the Aries Experimentation Framework

基于Aries实验框架重新思考智能体服务系统的AI云基础设施

Leonid Kondrashov, Hongrui Liu, JooYoung Park, Boxi Zhou, Zonghao Liu, Chengzhi Lu, Riccardo Mancini, Esha Choukse, Haris Javaid, German Sviridov, Tao Peng, Chen Zhao, Anastasia Avdeeva, Aleksei Gusev, Marios Kogias, Luo Mai, Dmitrii Ustiugov

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 该研究针对自主智能体对传统LLM服务的挑战,提出Aries全栈实验框架,通过实验揭示服务系统的关键瓶颈,探讨智能体原生服务系统的设计愿景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28147 2026-07-31 cs.CR 新提交 80%

Agent Harness Distillation: Inference-Time Harness Extraction and Exploitation in Autonomous Multi-Agent Systems

智能体调控蒸馏:自主多智能体系统中的推理时调控提取与利用

Yu Cui, Wuli Yang, Yirui Shi, Junhao Xia, Hui Jiang, Lei Gao, Chenfu Bao

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出AHD框架,将AMAS推理时调控提取形式化为新安全问题,实验证实其可提取调控致IP泄露,还提出对应欺骗防御,揭示AMAS新安全威胁。

Comments This work is currently in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26805 2026-07-30 cs.SE 新提交 80%

MRCoder: An Efficient Context Selecting Approach for Repository-Level Code Generation

MRCoder:一种面向仓库级代码生成的高效上下文选择方法

Peiding Wang, Li Zhang, Fang Liu

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 MRCoder是一种基于Map-Reduce范式的仓库级代码生成上下文选择框架,通过SADGS策略和并行验证,在提升代码生成准确率的同时降低了token消耗与推理时间。

Comments Under review in TOSEM

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25936 2026-07-29 cs.CR 新提交 80%

From Role Prompt to Infinite Thinking: Exploiting Persona Conditioning for Inference Cost Attacks in LLMs

从角色提示到无限思考:利用角色条件进行大语言模型推理成本攻击

Zhiyi Mou, Wangze Ni, Tianfang Xiao, Haoyang LI, Chen Jason Zhang, Hanzhi Ma, Yang Bai, Zhibo Wang, Kui Ren

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 研究LLMs推理成本问题,提出RolePlay框架利用角色条件诱导低效行为放大推理成本,实验证明该框架优于现有方法,为LLM推理效率攻击提供新视角。

Comments 17pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25141 2026-07-29 cs.SE cs.LO cs.SY eess.SY 新提交 80%

Specification-Driven DevOps for Multi-Service Environments

多服务环境下基于规范驱动的DevOps

Oleg Grynets, Kyrylo Fursov, Vasyl Lyashkevych, Volodymyr Veres

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究探讨前沿大语言模型能否利用存储库内容为多服务应用生成配置,通过对三个异构存储库评估发现生成环境虽能运行,但有遗漏,进而区分功能正确性与部署意图保真度并得出最小显式部署规范。

Comments 25 pages, 8 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21333 2026-07-24 cs.IR 新提交 80%

SHIFT: Self-reconstruction Harnesses Implicit Fine-grained Thinking for Retrieval

SHIFT:自我重建利用隐式细粒度思维进行检索

Yuxiao Luo, Da Li, Mingjie Zhang, Zhentao He, Shikun Zhang, Wei Ye

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 研究针对基于LLM的检索器存在的问题,提出SHIFT框架。通过残差投影等转换LLM为高效检索器,利用细粒度重建缓解不匹配,经实验验证其性能优于其他检索器,为信息检索提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13407 2026-07-16 cs.DB 新提交 80%

From Interpretation to Compilation: Compilation-Based Execution of Semantic Operators [Vision]

从解释到编译:基于编译的语义算子执行 [视觉]

Wenkai Dong, Yifan Wang

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 研究语义算子系统执行效率问题,提出基于编译的执行方法,在编译时调用LLM将算子规范转为可执行代码,本地运行减少调用次数,应用于多种算子并集成到系统,初步结果显示减少了执行时间和调用次数,还拓展了LLM在该领域的角色认知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13196 2026-07-16 cs.SE 新提交 80%

From Human-Centric to Agentic Code Review: The Impact of Different Generations of Generative AI Technology on Review Quality

从以人类为中心到智能体代码审查:不同代际生成式人工智能技术对审查质量的影响

Suzhen Zhong, Shayan Noei, Bram Adams, Ying Zou

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究不同代际生成式人工智能技术对代码审查质量的影响,通过分析102万条GitHub拉取请求,识别三种人工智能审查者采用模式,将审查讨论建模为交互序列,发现智能体协作模式虽能提高效率,但未提升质量,为设计高效代码审查过程提供实证指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09603 2026-07-13 cs.MA 新提交 80%

Mosaic: Runtime-Efficient Multi-Agent Embodied Planning

Mosaic:运行时高效的多智能体实体规划

Kunjal Panchal, Saayan Mitra, Sunav Choudhary, Victor Bursztyn, Somdeb Sarkhel, Hui Guan

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 研究基于LLM的多智能体实体规划执行延迟高问题,提出Mosaic框架,通过智能体中心语义内存和整数线性规划应对挑战,在多基准测试中执行更快、调用更少、步数更少且成功率更高,证明相关因素对多智能体规划的重要性。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏