arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22188 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22188 篇

2606.04050 2026-06-30 cs.LG cs.AI 90%

LiftQuant: Continuous Bit-Width LLM via Dimensional Lifting and Projection

LiftQuant: 通过维度提升和投影实现连续位宽的LLM

Liulu He, XuanAng Liu, Juntao Liu, Taolue Feng, Ting Lu, Chunsheng Gan, Zhiyv Peng, Yuan Du, Huanrui Yang, Yijiang Liu, Li Du

机构 * Nanyang Technological University(南洋理工大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出LiftQuant框架,通过“提升-投影”机制实现准连续位宽控制,以精确适配内存预算,在70B模型上以2.4位压缩超越现有2位模型。

Comments ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03243 2026-06-29 cs.LG cs.AI cs.DC cs.PF 版本更新 90%

Ranking Before Serving: Low-Latency LLM Serving via Pairwise Learning-to-Rank

先排序后服务:通过成对学习排序实现低延迟LLM服务

Yiheng Tao, Yihe Zhang, Matthew Dearing, Xin Wang, Yuping Fan, Michael E. Papka, Zhiling Lan

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Argonne National Laboratory(阿贡国家实验室)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出PARS调度器,通过成对排序预测任务响应长度,近似最短作业优先调度,减少队头阻塞,在vLLM上实现高达15.7倍延迟降低。

Comments 13 pages, 4 figures. Published in ISC High Performance 2026 Research Paper Proceedings (41st International Conference)

Journal ref ISC High Performance 2026 Research Paper Proceedings (41st International Conference), Hamburg, Germany, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15877 2026-06-26 cs.AI cs.CL cs.MA 版本更新 90%

Experience Compression Spectrum: Unifying Memory, Skills, and Rules in LLM Agents

经验压缩光谱:在LLM代理中统一记忆、技能和规则

Xing Zhang, Guanghui Wang, Yanwei Cui, Wei Qiu, Ziyuan Li, Bing Zhu, Peiyang He

机构 * AWS Generative AI Innovation Center(AWS生成式AI创新中心) HSBC Holdings Plc., HSBC Technology Center, China(汇丰控股有限公司,汇丰技术中心,中国)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 针对LLM代理长期多会话部署中经验管理效率问题,提出经验压缩光谱框架,统一记忆、技能和规则的压缩轴,解决压缩适应性和跨层级压缩缺失问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21869 2026-06-23 cs.CL cs.AI 新提交 90%

The Language-Energy Divide: Measuring Energy Costs of Multilingual LLM Inference

语言-能量鸿沟:衡量多语言大模型推理的能量成本

Naihao Deng, Alissa Shen, Yiming Feng, Joan Nwatu, Jae-Won Chung, Mosharaf Chowdhury, Yulong Chen, Rada Mihalcea

机构 * University of Michigan(密歇根大学) University of Cambridge(剑桥大学) University of Aberdeen(阿伯丁大学)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 系统研究多语言LLM推理的能量消耗,发现不同语言间每token能耗差异达8.3倍,总能耗差异达179倍,低资源语言能耗高且准确率低,建议将能量作为评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20640 2026-06-23 cs.AI cs.LG math.OC 新提交 90%

An LLM-Explainable DRL Framework for Passenger-Directed Autonomous Driving

面向乘客导向自动驾驶的LLM可解释DRL框架

Ouided Braoui, Meriem Bouali, Nadir Farhi

机构 * LITAN, ESTIN(LITAN,ESTIN) Cosys-Grettia, Univ Gustave Eiffel(Cosys-Grettia,古斯塔夫·埃菲尔大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出结合深度强化学习与大型语言模型可解释模块的框架,实现自适应驾驶控制并向乘客解释决策,平衡安全性、适应性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09613 2026-06-23 cs.CL cs.AI 新提交 90%

AGENTSERVESIM: A Hardware-aware Simulator for Multi-Turn LLM Agent Serving

AGENTSERVESIM:面向多轮LLM智能体服务的硬件感知模拟器

Rakibul Hasan Rajib, Mengxin Zheng, Qian Lou

机构 * University of Central Florida(中佛罗里达大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出AGENTSERVESIM模拟器,通过程序编排器、工具模拟器、会话感知路由器和KV驻留模型等模块,在程序粒度上评估多轮LLM智能体服务策略,在CPU上以6%误差复现真实系统行为。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16100 2026-06-16 cs.CR cs.CL cs.LG 新提交 90%

Your "Pro" LLM Subscription May Actually Be "Free": Exposing Fingerprint Spoofing Risks in LLM Inference Services

你的“专业”LLM订阅可能实际上是“免费”的:揭示LLM推理服务中的指纹欺骗风险

Jiahao Zhang, Xiuyu Li, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出指纹欺骗攻击,恶意服务商通过参数高效微调弱模型模仿强模型,绕过用户指纹验证;理论证明用户资源限制导致指纹易被欺骗,并设计GhostPrint攻击框架,实验表明其能以低成本持续绕过主流指纹方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15652 2026-06-16 cs.LG cs.CL 新提交 90%

MosaicQuant: Inlier-Outlier Disaggregation for Unified 4-Bit LLM Quantization

MosaicQuant: 基于内点-离点分离的统一4位LLM量化

Yangjia Hu, Haodong Wang, Zicong Hong, Qianli Liu, Quanxin Shou, Jian Lin, Song Guo, Xiaowei Shen, Xiangjun Huang, Dian Wang, Jian Yang

机构 * HKUST(香港科技大学) EPFL(瑞士联邦理工学院洛桑) MetaX Integrated Circuits Co., Ltd(MetaX集成电路有限公司)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出MosaicQuant,通过将权重矩阵量化为密集4位基分量和稀疏4位残差分量,结合ZipperEngine融合稀疏块计算,实现统一4位推理,在LLaMA3和Qwen3上保持近FP16精度并加速1.24倍。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15333 2026-06-16 cs.CL cs.LG 新提交 90%

Replay What Matters: Off-Policy Replay for Efficient LLM Reinforcement Unlearning

重放重要内容:面向高效LLM强化反学习的离策略重放

Zirui Pang, Chenlong Zhang, Haosheng Tan, Zhuoran Jin, Jiaheng Wei, Zixin Zhong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Glasgow(格拉斯哥大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 针对LLM反学习中在线策略优化对困难样本利用不足的问题,提出ReRULE方法,通过离策略重放缓冲区存储并复用低奖励困难样本,在保持通用性的同时提升反学习效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17106 2026-06-16 cs.CL cs.LG 版本更新 90%

HyDRA: Hybrid Dynamic Routing Architecture for Heterogeneous LLM Pools

HyDRA:异构LLM池的混合动态路由架构

Aashna Garg, Siddharth Singha Roy, Jinu Jang, Federico Brancasi, Shengyu Fu

机构 * Microsoft(微软)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 本文提出HyDRA,一种能够根据查询预测细粒度多维能力需求并匹配配置定义模型配置的混合动态路由架构,实现了在异构LLM池中高效且无需重新训练的模型选择。

Comments preprint v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05163 2026-06-16 cs.CL cs.LG 版本更新 90%

Enhancing LLM Safety Through a Theoretical Minimax Game Lens

通过理论极小极大博弈视角增强LLM安全性

Yihe Deng, Yu Yang, Junkai Zhang, Wei Wang, Bo Li

机构 * University of California, Los Angeles(加州大学洛杉矶分校) VirtueAI University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出极小极大强化学习框架,通过数据生成器与分类器协同进化生成高质量多语言安全数据,理论证明收敛到纳什均衡,使小模型在英文基准上超越SOTA近10%且推理速度提升4.5倍。

Comments 24 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10444 2026-06-15 cs.LG cs.AI 版本更新 90%

The Curse and Blessing of Mean Bias in FP4-Quantized LLM Training

FP4量化LLM训练中均值偏差的诅咒与祝福

Hengjie Cao, Zhendong Huang, Mengyi Chen, Yifeng Yang, Fang Dong, Anrui Chen, Ruijun Huang, Xin Zhang, Mingzhi Dong, Yujiang Wang, Jinlong Hou, Qin Lv, Robert P. Dick, Yuan Cheng, Tun Lu, Fan Yang, Yixuan Chen, Li Shang

机构 * Fudan University(复旦大学) University of Bath(巴斯大学) Shanghai Innovation Institute(上海创新研究院) University of Oxford(牛津大学) Oxford Suzhou Centre for Advanced Research(牛津苏浙研究中心) University of Colorado Boulder(科罗拉多大学波德格分校) University of Michigan(密歇根大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 发现FP4训练失败源于激活异常值由秩一均值偏差主导,提出Averis均值残差分离量化法,在Qwen3模型上实现鲁棒W4A4G4训练,损失差距低于NVIDIA的Hadamard方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04021 2026-06-12 cs.DC cs.AI cs.LG cs.PF 版本更新 90%

Prism: Cost-Efficient Multi-LLM Serving via GPU Memory Ballooning

Prism: 通过GPU内存气球实现经济高效的多LLM服务

Shan Yu, Yifan Qiao, Mingyuan Ma, Yangmin Li, Shuo Yang, Xinyuan Tong, Yang Wang, Zhiqiang Xie, Yuwei An, Shiyi Cao, Ke Bao, Deepak Vij, Xiaoning Ding, Yichen Wang, Qingda Lu, Zhong Wang, Gao Gao, Harry Xu, Junyi Shu, Jiarong Xing, Ying Sheng

机构 * UCLA(加州大学洛杉矶分校) UC Berkeley(伯克利加州大学) Harvard University(哈佛大学) CMU(卡内基梅隆大学) University of Edinburgh(爱丁堡大学) Intel(英特尔) Stanford University(斯坦福大学) LMSYS(灵州市系统实验室) ByteDance(字节跳动) Alibaba Cloud(阿里云) Tsinghua University(清华大学) Novita AI Rice University(里士满大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 针对多LLM服务中资源效率低下的问题,提出基于内存气球的内存中心化LLM协同服务框架Prism,统一空间与时间共享,已在10K+ GPU生产环境部署。

Comments OSDI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04567 2026-06-11 cs.LG cs.AI 版本更新 90%

GILT: An LLM-Free, Tuning-Free Graph Foundational Model for In-Context Learning

GILT:一种无需LLM、无需微调的图基础模型用于上下文学习

Weishuo Ma, Yanbo Wang, Xiyuan Wang, Lei Zou, Muhan Zhang

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Wangxuan Institute of Computer Technology, Peking University(北京大学王宣计算机技术研究所)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出GILT框架,通过基于令牌的上下文学习机制统一处理节点、边和图级别的分类任务,无需大语言模型或微调,实现高效泛化。

Comments Accepted as an oral presentation at the GFM @ ICML 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07586 2026-06-10 cs.LG cs.AI cs.AR cs.MA 版本更新 90%

From Human Guidance to Autonomy: Agent Skill System for End-to-End LLM Deployment on Spatial NPUs

从人类引导到自主:面向空间NPU上端到端LLM部署的智能体技能系统

Jiajie Li, Erwei Wang, Zhiru Zhang, Samuel Bayliss

机构 * AMD Research and Advanced Development(AMD研究与高级开发)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出两阶段方法,从人类引导的智能体辅助部署到自主技能系统,在AMD XDNA 2 NPU上实现8种LLM的端到端自动部署,性能超越或持平人工优化基线。

Comments Accepted to the Machine Learning for Architecture and Systems Workshop (MLArchSys), co-located with ISCA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08454 2026-06-09 cs.LG cs.CL 新提交 90%

Beyond Linear Activation Steering: Invertible Latent Transformations for Controlling LLM Behavior

超越线性激活引导:用于控制大语言模型行为的可逆潜在变换

Tuc Nguyen, Thai Le

机构 * Indiana University Bloomington(印第安纳大学伯明顿分校)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出INNSteer框架,通过可逆神经网络将LLM激活映射到潜在空间进行线性控制,再逆变换回原空间,实现非线性、输入依赖的激活引导,在多个模型和基准上优于现有方法。

Comments 36 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10028 2026-06-09 cs.LG cs.AI cs.DC 版本更新 90%

Efficient Onboard Vision-Language Inference in UAV-Enabled Low-Altitude Economy Networks via LLM-Enhanced Optimization

基于LLM增强优化的无人机低空经济网络高效机载视觉-语言推理

Yang Li, Ruichen Zhang, Yinqiu Liu, Guangyuan Liu, Abbas Jamalipour, Xianbin Wang, Dong In Kim

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院、新加坡国立科技大学) The University of Sydney, Sydney, Australia(悉尼大学、澳大利亚悉尼) Department of Electrical and Computer Engineering, Western University, London, Canada(电气与计算机工程系、西方大学、加拿大伦敦) Department of Electrical and Computer Engineering, Sungkyunkwan University, South Korea(电气与计算机工程系、全州大学、韩国)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对无人机低空经济网络中机载视觉-语言模型推理的准确性与通信效率挑战,提出分层优化框架,包括交替分辨率与功率优化算法及大语言模型增强的强化学习轨迹优化方法,有效提升推理性能与通信效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05682 2026-06-08 cs.AI cs.LG 版本更新 90%

Beyond Output Matching: Preserving Internal Geometry in NVFP4 LLM Distillation

超越输出匹配:在NVFP4 LLM蒸馏中保留内部几何结构

Fangbo Tu, Junhua Zhao, Chi Liu, Xin Chen, Haifeng Wu, Jian Wan, Srinivasan Manoharan

机构 * Fangbo Tu(图方波) Junhua Zhao(赵俊华) Chi Liu(刘驰) Xin Chen(陈新) Haifeng Wu(吴海峰) Jian Wan(万健) Srinivasan Manoharan(曼纳哈兰)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对NVFP4低精度量化蒸馏中仅输出匹配导致内部表示退化的问题,提出CKA-QAD方法,通过CKA引导的层间Gram矩阵对齐保留内部几何结构,提升推理和编码任务准确率。

Comments 13 pages,1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05130 2026-06-04 cs.LG cs.AI 90%

Towards Efficient and Evidence-grounded Mobility Prediction with LLM-Driven Agent

面向高效且基于证据的移动预测:基于LLM驱动的智能体

Linyao Chen, Qinlao Zhao, Zechen Li, Mingming Li, Likun Ni, Jinyu Chen, Yuhao Yao, Xuan Song, Noboru Koshizuka, Hiroki Kobayashi

机构 * The University of Tokyo(东京大学) Huazhong University of Science and Technology(华中科技大学) University of New South Wales, Sydney(新南威尔士大学(悉尼)) LocationMind Inc.(LocationMind公司) Southern University of Science and Technology(南方科技大学) Jilin University(吉林大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出一种无需训练的LLM驱动智能体框架AgentMob,通过自适应证据收集机制解决移动预测中的模糊情况,在多个数据集上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20402 2026-06-03 cs.LG cs.AI 90%

Decomposing MXFP4 quantization error for LLM reinforcement learning: reducible bias, recoverable deadzone, and an irreducible floor

分解 MXFP4 量化误差以用于大语言模型强化学习:可约简的偏差、可恢复的死区以及不可约简的底噪

Xiaocan Li, Shiliang Wu, Zheng Shen

机构 * Huawei Canada(华为加拿大)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文通过将 MXFP4 量化误差分解为三个可加分量(尺度偏差、死区截断和网格噪声),并针对每个分量提出针对性修正(宏块缩放、异常值回退和自适应量化噪声),从而在 LLM 强化学习后训练中恢复精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02355 2026-06-02 cs.AI cs.LG 90%

SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training

SIRI:具有内在技能的自我内化强化学习用于LLM智能体训练

Zhongyu He, Yuanfan Li, Fei Huang, Tianyu Chen, Siyuan Chen, Xingyang Li, Meng Hsuan Yu, Xiangrong Liu, Leyi Wei, Lu Pan, Ke Zeng, Xunliang Cai

机构 * Xiamen University(厦门大学) Meituan(美团) Macao Polytechnic University(澳门 polytechnic 大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出SIRI框架,通过自我技能挖掘、验证和内化,使LLM智能体无需外部技能生成器或推理时技能库即可提升长程任务性能,在ALFWorld和WebShop上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05395 2026-06-02 stat.ML cs.AI cs.LG 90%

Optimal Bayesian Stopping for Efficient Inference of Consistent LLM Answers

用于高效推断一致LLM答案的最优贝叶斯停止

Jingkai Huang, Will Ma, Zhengyuan Zhou

机构 * Stern School of Business, New York University, New York, USA(纽约大学 Stern 商学院) Graduate School of Business, Columbia University, New York, USA(哥伦比亚大学 商学院)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 利用贝叶斯先验信息,通过L-聚合停止策略在达到足够一致性时提前停止采样,以最小化采样成本并高效识别最一致的LLM答案。

Comments Accepted to ICML 2026. Camera-ready version

Journal ref Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22722 2026-06-01 cs.IR cs.AI cs.LG 90%

Aligning Dense Retrievers with LLM Utility via Distillation

通过蒸馏将稠密检索器与LLM效用对齐

Rajinder Sandhu, Di Mu, Cheng Chang, Md Shahriar Tasjid, Himanshu Rai, Maksims Volkovs, Ga Wu

机构 * Dalhousie University(达尔豪西大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出Utility-Aligned Embeddings (UAE)框架,通过蒸馏LLM的困惑度降低效用分布来训练双编码器,在不增加测试时LLM推理开销的情况下提升稠密检索的精度和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28827 2026-05-29 cs.CL cs.LG 90%

RightNow-Arabic-0.5B-Turbo: An Open Sub-1B Arabic Language Model via Vocabulary Injection and Edge-First Deployment

RightNow-Arabic-0.5B-Turbo: 通过词汇注入和边缘优先部署的开源子10亿参数阿拉伯语语言模型

Jaber Jaber, Osama Jaber

机构 * RightNow AI

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);pretraining(abstract)

AI总结 针对现有阿拉伯语模型要么是多语言模型对阿拉伯语支持不足,要么是参数过大难以部署的问题,提出基于Qwen2.5-0.5B的518M参数阿拉伯语专用模型RightNow-Arabic-0.5B-Turbo,通过词汇注入、继续预训练和监督微调等方法,在三个阿拉伯语基准上达到35.9%平均准确率,与1.5B模型性能相当,并实现边缘端高效部署。

Comments 12 pages, 7 tables, 4 figures, 1 algorithm. Weights: https://huggingface.co/RightNowAI/RightNow-Arabic-0.5B-Turbo

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28583 2026-05-28 cs.RO cs.AI cs.LG cs.SY eess.SY 90%

SARAD: LLM-Based Safety-Aware Hybrid Reinforcement Learning with Collision Prediction for Autonomous Driving

SARAD:基于LLM的安全感知混合强化学习与碰撞预测在自动驾驶中的应用

Kangyu Wu, Peng Cui, Guoxi Chen, Ya Zhang

机构 * National Natural Science Foundation (NNSF) of China(中国国家自然科学基金委员会) National Science and Major Project(国家科学技术重大专项)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出SARAD框架,结合大语言模型和深度强化学习,通过检索增强生成和碰撞预测模块提升自动驾驶的安全性和效率。

Comments 7 pages, 4 figures, accepted by IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28302 2026-05-28 cs.LG cs.AI cs.DC 90%

How Far Can Disaggregation Go? A Design-Space Exploration of Attention-FFN Disaggregation for Efficient MoE LLM Serving

解聚能走多远?面向高效 MoE LLM 服务的 Attention-FFN 解聚设计空间探索

Hanjiang Wu, Abhimanyu Rajeshkumar Bambhaniya, Sarbartha Banerjee, Tuhin Khare, Sudarshan Srinivasan, Suvinay Subramanian, Souvik Kundu, Madhu Kumar, Midhilesh Elavazhagan, William Won, Amir Yazdanbakhsh, Tushar Krishna

机构 * Georgia Institute of Technology(佐治亚理工学院) Intel(英特尔) Google(谷歌) Google DeepMind(谷歌DeepMind) Infravana

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文系统探索了从分块预填充、预填充-解码解聚到算子级 Attention-FFN 解聚 (AFD) 的不同解聚层次在 MoE 模型推理中的收益与局限,通过融合设备内核测量与高保真网络仿真的框架,在严格 TTFT/TPOT SLO 下 AFD 可在 DeepSeek-V3.2 上维持约 4k tokens/s 的系统吞吐量,并给出了联合优化吞吐与交互性的具体设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26731 2026-05-27 cs.AI cs.CL 90%

It's Not the Capability: Harness Sensitivity Is Non-Monotone Across LLM Agent Tiers

不是能力问题:LLM 智能体层级间的驾驭敏感性非单调

Yong-eun Cho

机构 * KailosLab(凯罗斯实验室)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 通过 432 次实验,发现 LLM 智能体的驾驭敏感性随模型层级非单调变化,且依赖模型类型(聊天 vs. 推理),推翻了“更高能力模型需要更少结构指导”的假设。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02355 2026-05-27 cs.LG cs.AI 90%

"Give Me BF16 or Give Me Death"? Accuracy-Performance Trade-Offs in LLM Quantization

“给我BF16,否则给我死亡”?LLM量化中的精度-性能权衡

Eldar Kurtic, Alexandre Marques, Shubhra Pandit, Mark Kurtz, Dan Alistarh

机构 * Red Hat AI(红帽AI) Institute of Science and Technology Austria(奥地利科学与技术研究院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过超过50万次评估,全面研究了FP8、INT8和INT4量化在Llama-3.1模型族上的精度-性能权衡,发现FP8无损、INT8精度损失低、INT4权重仅量化具有竞争力,并基于vLLM框架给出了不同部署场景下的最优量化格式建议。

Comments Accepted to ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25424 2026-05-26 cs.LG cs.AI 90%

SeqRoute: Global Budget-Aware Sequential LLM Routing via Offline Reinforcement Learning

SeqRoute: 通过离线强化学习实现全局预算感知的顺序LLM路由

Zhongling Xu, Shunan Zheng, Wei Wang

机构 * Department of Operations Research and Industrial Engineering(运筹学与工业工程系)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出SeqRoute框架,将多轮LLM路由建模为有限时域马尔可夫决策过程,通过离线强化学习(CQL)和事后预算重标记(HBR)学习延迟满足,在全局预算约束下优化成本与质量,降低破产率至1%以下。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25141 2026-05-26 cs.CL cs.AI 90%

LLM Agent Based Renewable Energy Forecasting Using Edge and IoT Data A Review of Solar Wind Weather and Grid Aware Decision Support

基于LLM Agent的利用边缘和物联网数据的可再生能源预测:太阳能、风能、天气和电网感知决策支持综述

Pavan Manjunath, Thomas Pruefer

机构 * Independent Researcher(独立研究员)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了如何利用大语言模型代理整合异构传感器流、天气API数据、历史发电记录和电网约束,形成统一的决策支持工作流,以增强可再生能源预测。

详情

展开后加载摘要…

URL PDF HTML 收藏