arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1859 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 1859 篇

2608.07419 2026-08-10 cs.LG 新提交 90%

Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration

超越事后温度缩放:用于大语言模型校准的双层优化方法

Ruochen Jin, Zhanliang Wang, Zongyu Dai, Jiancong Xiao, Bojian Hou

机构 * Dartmouth College(达特茅斯学院) University of Pennsylvania(宾夕法尼亚大学) National University of Singapore(新加坡国立大学)

专题命中 效率与部署 :LLM(title,summary_cn);language model(abstract,comments);large language model(abstract);分类 cs.LG

AI总结 针对LLM偏好对齐导致的过度自信与校准问题,提出基于双层优化的校准方法,通过最大化预测分布熵实现,在多项选择与开放式问答任务中提升了校准效果与域外泛化能力。

Comments Third Conference on Language Modeling (COLM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17104 2026-06-17 cs.AR cs.AI cs.DC 新提交 90%

Prefill/Decode-Aware Evaluation of LLM Inference on Emerging AI Accelerators

新兴AI加速器上LLM推理的Prefill/Decode感知评估

Shun Usami, Venkatram Vishwanath, E. Wes Bethel

机构 * Department of Computer Science(计算机科学系) San Francisco State University(旧金山州立大学) Argonne National Laboratory(阿贡国家实验室) Lawrence Berkeley National Laboratory(伯克利国家实验室)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过分离测量Prefill和Decode阶段,评估GPU与新兴AI加速器在Llama2-7B模型上的推理性能,发现GPU在计算密集的Prefill阶段占优,而GroqRack在Decode延迟上更优,但GPU随批处理增大在吞吐上反超。

Comments 8 pages, 5 figures. Accepted to the Workshop on HPC for AI Foundation Models & LLMs for Science (HPAI4S'26), co-located with IEEE IPDPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08744 2026-08-11 cs.CL cs.AI cs.CE cs.ET cs.LG 新提交 90%

Can We Optimize the Performance-Carbon Emission Break-Even Point?: The Quest for Greener LLMs

我们能否优化性能-碳排放盈亏平衡点?——探寻更环保的大语言模型(LLM)

Sourav Das, Tanmay Joshi, Kripabandhu Ghosh

专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究探究能否通过将感知碳排放的联合损失机制用于微调,在Gemmc-2 2B等三类LLM上实现推理性能与碳排放的盈亏平衡,发现碳排放项作用随任务结构变化,提出轻量正则化方案。

Comments 13 Pages, 6 Figures, Submitted to ARR Cycle

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08188 2026-08-11 cs.AI cs.CL cs.LG 新提交 90%

Quantization Degradation in Large Language Models: A Signal-Noise Perspective

大语言模型中的量化退化:一种信号-噪声视角

Chenxi Zhou, Pengfei Cao, Jinyu Ye, Bohan Yu, Haida Yu, Jiang Li, Jun Zhao, Kang Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Inner Mongolia University(内蒙古大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究从信号-噪声视角,系统分析了不同位宽、量化方法等因素下大语言模型量化退化的规律,揭示了退化源于源端误差产生与跨层累积的共同作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28341 2026-07-31 cs.CV 新提交 90%

Capturing Token Tendencies for Training-Free Token Pruning in Multimodal Large Language Models

捕捉令牌趋势以实现多模态大语言模型中无需训练的令牌剪枝

Jie Ma, Zhike Qiu, Jie Gao, Jiayi Ji, Qian Chen, Xiaoshuai Sun, Rongrong Ji

机构 * Xiamen University(厦门大学) Xiamen Ocean Vocational College(厦门海洋职业技术学院) Sino-Russian Research Center for Digital Economy(中俄数字经济研究中心)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 该研究针对多模态大语言模型现有无训练剪枝方法忽略令牌重要性动态变化的问题,提出趋势感知剪枝框架,通过捕捉注意力流动量实现动态修正,大幅减少视觉令牌且保持性能,实现高效多模态推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18640 2026-07-22 eess.SP 新提交 90%

Semantic-Aware Data-Aided Channel Estimation with Large Language Models for MIMO Systems

用于MIMO系统的基于大语言模型的语义感知数据辅助信道估计

Sojeong Park, Jaehyun Choi, Hyun Jong Yang

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 针对MIMO系统,提出基于大语言模型的语义感知数据辅助信道估计框架,利用语义信息进行可靠符号选择与校正,采用两层机制,仿真表明该框架在归一化均方误差和误码率上优于传统方案,接近理想估计器性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07142 2026-07-09 cs.NI 新提交 90%

Small Language Model-based Control for BBR over Low Earth Orbit Satellite Internet

基于小语言模型的低地球轨道卫星互联网上的BBR控制

Rakshitha De Silva, Shiva Raj Pokhrel, Jonathan Kua

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);SLM(abstract,abstract_cn)

AI总结 研究低地球轨道卫星互联网中BBR控制问题,提出基于小语言模型的自适应框架,结合多种技术生成可行步调动作,实验表明该框架能在保持吞吐量优势时大幅减少重传,降低计算成本。

Comments 10 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04749 2026-07-07 cs.DC 新提交 90%

Direct Model State Migration for Elastic Training of Large Language Models

用于大语言模型弹性训练的直接模型状态迁移

Weijian Liu, Mingzhen Li, Rui Kang, Chen Sun, Guangming Tan, Weile Jia

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 研究大语言模型训练适应共享集群动态资源的问题,提出无检查点状态迁移框架ETC,利用状态局部性和通信合并减少GPU间数据移动,相比基于检查点的方案降低迁移开销,实现高效弹性训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31016 2026-07-01 cs.NI 新提交 90%

Beyond Wireless Security: Covert Communications in Large Language Model-enabled Edge Networks

超越无线安全:大语言模型赋能边缘网络中的隐蔽通信

Yuanai Xie, Jiaxin Chen, Zhaozhi Liu

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 针对大语言模型赋能边缘网络面临的安全威胁,提出一种隐蔽通信与计算方法,在严格安全约束下最小化总延迟,兼顾隐私保护与任务执行效率。

Comments Accepted for publication in IEEE Communications Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10415 2026-06-10 cs.DC 新提交 90%

RATrain: A Resource-Aware Training Runtime for Large Language Models on Bandwidth-Constrained Heterogeneous Supercomputing Platforms

RATrain:面向带宽受限异构超级计算平台的大语言模型资源感知训练运行时

Yao Lu, Shiqing Ma, Zhongzhi Luan, Gen Li, Jiaxing Qi, Bin Han, Hailong Yang, Depei Qian

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 针对显存层级化、DDR容量有限且集群间通信受限的MT-3000平台,提出资源感知训练运行时RATrain,通过训练状态生命周期调度和资源感知规划器,实现高达1.35倍加速和97.0%的扩展效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07335 2026-06-08 cs.CR 新提交 90%

Defending Jailbreak Attacks on Large Language Models via Manifold Trajectory Kinetics

通过流形轨迹动力学防御大语言模型的越狱攻击

Hangtao Zhang, Yucheng Zhao, Sishun Liu, Ziqi Zhou, Zeyu Ye, Wei Wan, Minghui Li, Shengshan Hu, Yanjun Zhang, Yi Liu, Leo Yu Zhang

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 提出流形轨迹动力学(MTK)方法,通过分析提示词在模型层间的邻域结构演化来检测越狱攻击,在伪恶意提示和自适应攻击下均表现鲁棒。

Comments Accepted to USENIX Security '26 Cycle 2. Code is available at https://github.com/Rookie143/mtk

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14065 2026-08-17 cs.SE cs.AI 新提交 90%

Rethinking Automated Program Repair: The Impact of Bug Complexity, Fault Localization, and LLM Cost-efficiency

重新思考自动程序修复:缺陷复杂度、缺陷定位与大语言模型成本效率的影响

Junchi Liu, Ali Bigdeli, Roya Daneshi, Atu Ambala, Sudipto Ghosh, Fabio Santos

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究通过实证分析,发现中等复杂度缺陷可超50%由低成本LLM修复,不精确缺陷定位会扩大APR技术差距,高成本LLM与强推理设置并非总能提升成本效率,DeepSeek-V3.2成本效率最优。

Comments 20 pages, 6 figures, 10 tables. Accepted at ESEM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12915 2026-08-14 cs.DC cs.AI 新提交 90%

InFactPlanner: Planning Sustainable Geo-Distributed LLM Data Centers

InFactPlanner:可持续地理分布式大语言模型(LLM)数据中心规划

Nicoletta Tsiopani, Moysis Symeonides, George Pallis, Marios D. Dikaiakos

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 InFactPlanner是用于LLM推理的可持续地理分布式数据中心部署假设分析的决策支持框架,可通过多维度建模分析得出可持续性与延迟最优选择存在差异等结论。

Comments Author copy of paper published at 34th International Symposium on the Modeling, Analysis, and Simulation of Computer and Telecommunication System (MASCOTS2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07583 2026-08-11 stat.ML cs.LG 新提交 90%

RouteGuard: Certifying Routing Gain in LLM Multi-Agent Systems When Complementarity Is Not Enough

RouteGuard:当互补性不足时,对LLM多智能体系统中的路由增益进行认证

Anchen Sun, Kaiqi Yang

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 针对LLM多智能体路由的部署问题,提出RouteGuard框架,通过分解增益、结合Le Cam下界等实现认证,在两个基准中验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09577 2026-08-11 cs.AI 新提交 90%

ElasticBack: Stealthy Conditional Backdoor in LLM-Agent Skills via Coupled Trigger-Rule Optimization

ElasticBack:通过耦合触发-规则优化实现LLM智能体技能中的隐蔽条件后门

Hao Sui, Simeng Qin, Jie Liao, Xiaojun Jia, Bing Chen, Yang Liu

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 本研究提出ElasticBack,通过耦合触发-规则优化在LLM智能体技能中植入条件性单技能后门,实验显示其攻击性能优异且隐蔽性强,可推动技能供应链的防御研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09555 2026-08-11 cs.AI 新提交 90%

Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents

面向基于技能的大语言模型智能体强化学习的双向上下文自蒸馏

Tianjun Pan, Yuan Li, Hongda Wang, Linbo Jin, Mengfei Song, Lei Gao, Qiming Shi, Shaokang Fu, Jiarong Zhao, Chengyu Wang, Chengfu Huo

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究针对基于技能的LLM智能体技能利用不足问题,提出BCSD框架,通过双向上下文自蒸馏结合强化学习,在ALFWorld和WebShop上取得最优性能,验证了互补视角的有效性。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09225 2026-08-11 cs.CR cs.AI 新提交 90%

Governing the KV Cache: Preventing Timing Side-Channel Leakage in Multi-Tenant LLM Inference

管控KV缓存:防止多租户大语言模型推理中的时序侧信道泄露

Tejasvi C. Addagada

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文针对多租户LLM推理中KV缓存引发的时序侧信道泄露问题,提出KVGov治理层,结合盐值机制与ORIGAMI调度器,可抵御三类攻击,同时保留93%的缓存效率,在真实硬件与模拟环境中验证了防御效果。

Comments 12 pages, 5 figures, 9 tables. Measurements on NVIDIA A100 with vLLM 0.26.0, independently replicated on llama.cpp/Apple Metal. Experimental scripts and raw results available from the author on request

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08382 2026-08-11 cs.AI cs.DC 新提交 90%

LLMVisor: A Real-Time Latency Attribution Model for Multi-Tenant LLM Serving

LLMVisor:面向多租户大语言模型(LLM)服务的实时延迟归因模型

Shuowei Jin, Xueshen Liu, Jiaxin Shan, Le Xu, Tieying Zhang, Liguang Xie, Z. Morley Mao

机构 * University of Michigan(密歇根大学) ByteDance(字节跳动)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 针对多租户LLM服务中联合批处理导致的延迟归因难题,提出基于屋顶线模型的LLMVisor实时延迟归因模型,在微秒级高效运行,相比基线方法大幅降低预填充和解码阶段的相对误差

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07974 2026-08-11 cs.LG cs.DC 新提交 90%

ZeroLock: Concurrent Memory-Efficient LLM Training via Modular Update Decoupling

ZeroLock:通过模块化更新解耦实现并发内存高效的大语言模型训练

Wentao Dai, Xuanran Li, Yuxiang Zhang, Ming Tang, Chao Huang

机构 * Southern University of Science and Technology(南方科技大学) Montclair State University(蒙特克莱尔州立大学)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对边缘LLM微调的BP训练存在更新锁定瓶颈,本研究提出ZeroLock无BP算法,通过模块化更新解耦突破局限,经实验验证可降内存26.5%、提吞吐量4.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07126 2026-08-10 cs.HC cs.AI 新提交 90%

PHOENIX: Fine-Tuned SLM-Powered Autonomous Satellite Lifetime Extension via Predictive Self-Healing and Multi-Agent AI Recovery

PHOENIX:通过预测性自修复与多智能体AI恢复实现的经微调小型语言模型驱动的自主卫星寿命延长

Sumaiya Islam, Harsha Kumara Moraliyage

专题命中 效率与部署 :SLM(title,summary_cn);language model(abstract);small language model(abstract);分类 cs.AI

AI总结 该研究针对CubeSat在轨故障无法及时修复导致寿命不足的问题,提出PHOENIX系统,利用微调SLM与多智能体AI实现自主故障修复,基于ESA基准验证了初步效果。

Comments 6 pages, 2 figures. Accepted at IEEE IRAI 2026 (International Conference on Responsible Artificial Intelligence)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07091 2026-08-10 cs.HC cs.AI 新提交 90%

Human-Centered Explainable AI for TinyML Edge Devices: A Pareto-Based Selection Framework with LLM-Guided Design

面向TinyML边缘设备的以人为中心的可解释人工智能:基于帕累托的选择框架与大语言模型引导设计

Zeinab Dehghani, Dhavalkumar Thakker, Koorosh Aslansefat, Kuniko Paxton, Bhupesh Kumar Mishra, Baseer Ahmad, Rameez Raja Kureshi

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出一种整合LLM引导设计与帕累托优化的以人为中心XAI选择框架,用于TinyML边缘设备部署,经皮肤病变分类任务验证可识别帕累托有效权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04065 2026-08-06 cs.CR cs.AI 新提交 90%

An Inline Control Architecture for Language Models in Intelligent Transportation Systems

智能交通系统中语言模型的内联控制架构

Narendra Kumar Dewangan, Mounira Msahli

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 针对V2X系统中LLM的提示级攻击问题,提出Guarded-V2X内联语义护栏架构,经四阶段实验验证其可降低入侵成功率且不超延迟预算。

Comments 18 pages, under minor revision (IEEE transactions)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03961 2026-08-05 cs.AI 新提交 90%

Interpretable Adaptive Sampling for LLM Test-Time Scaling

面向大语言模型测试时缩放的可解释自适应采样

Mobina Kashaniyan, Ali Jannesari

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对LLM测试时推理的固定计算预算不灵活、不可解释的问题,提出带轻量级模糊控制器的自适应采样方法,在问答和数学任务上提升性能并减少平均采样数,为高效测试时推理提供实用方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03463 2026-08-05 cs.AI 新提交 90%

LeanMem: Simple and Efficient Long-Term Memory for LLM Agents

LeanMem:面向LLM智能体的简单高效长期记忆系统

Yuxin Liao, Le Wu, Min Hou, Hao Liu, Han Wu, Zishu Wang

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 LeanMem是面向LLM智能体的轻量级长期记忆框架,通过差异化处理历史内容、动态分配资源,在两个数据集上提升了记忆基线的准确率,同时降低了成本与延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01536 2026-08-04 cs.AR cs.LG 新提交 90%

Celty: SpMspV GPU Kernel and SIMT Co-Design for Efficient Dual-Sparse LLM Inference

Celty:用于高效双稀疏大语言模型推理的SpMspV GPU内核与SIMT协同设计

Ruokai Yin, Priyadarshini Panda

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对双稀疏LLM推理中spMspV workload处理低效问题,提出协同设计的Celty稀疏格式、GPU内核与SIMT微架构,实现最高5.3倍加速。

Comments ICCAD 2026. Will update with the camera-ready version once ready. The code is available on Github at https://github.com/RuokaiYin/Celty

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00303 2026-08-04 cs.AI 新提交 90%

CrystalMem: Elastic Memory for Self-Evolving LLM Agents via Knowledge Crystallization

CrystalMem:基于知识结晶的自进化大语言模型智能体弹性内存

Beining Wu, Jun Huang

机构 * South Dakota State University(南达科他州立大学)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对LLM智能体的内存滞后问题,提出弹性内存组件CrystalMem,通过知识结晶策略恢复能力,在多环境实验中性能优于基准方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00026 2026-08-04 cs.AI cs.DC 新提交 90%

Request-Level Energy Attribution for Batched LLM Serving

批量大语言模型(LLM)服务的请求级能耗归因

Qi Luo, Kunlin Li, Ziwen Wang, Dongsheng Wang, Yun Chen

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 本研究提出JouleShare框架,通过计算Shapley能耗建立请求级基准,用JCalib校准模型提升批量LLM服务的请求级能耗归因精度,验证了token比例归因的偏差及JCalib的有效性。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28268 2026-07-31 cs.AI 新提交 90%

LLM-Guided Evolutionary Search for Constraint Model Reformulation to Improve Solver Efficiency

基于大语言模型引导的进化搜索的约束模型重构以提升求解器效率

Kostis Michailidis, Dimos Tsouros, Nguyen Dang, Tias Guns

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出LLM引导的进化框架,引入PDR策略保留多样化上下文,在8个CSPLib问题上验证迭代重构可提升求解速度,且多样化上下文策略和验证选择均能增强加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27090 2026-07-30 cs.DC cs.LG 新提交 90%

InferScale: GPU-Native KV Injection for Personalized LLM Serving

InferScale:面向个性化大语言模型服务的原生GPU KV注入方案

Peter Li, Prashant Pandey

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 InferScale是原生GPU的LLM内存系统,通过可复用KV状态替代重复提示词预填充,引入Chunked RoPE与上下文窗口编码,在LoCoMo数据集上显著降低TTFT、提升吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26967 2026-07-30 cs.CL 新提交 90%

Generation or Judgement? A Paradigm Perspective on LLM-Based Emotion-Cause Pair Extraction in Conversation

生成还是判断?基于范式视角的对话中基于大语言模型(LLM)的情感-原因对抽取

Weijie Feng, Hongchuang Wang, Binbin Liu, Zhiyong Cheng

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL

AI总结 该研究针对对话情感-原因对抽取,对比LLM的生成与判断范式,发现对级判断更优,引入辅助检索器后在三个数据集上实现F1提升,明确任务分解与候选范围的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏