arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1009 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 1009 篇

2606.28864 2026-07-03 cs.CV 版本更新 85%

On Test-Time Scaling for Vision-Language Models

关于视觉-语言模型的测试时扩展

Fawaz Sammani, Tzoulio Chamiti, Nikos Deligiannis

机构 * ETRO Department, Vrije Universiteit Brussel(布鲁塞尔自由大学ETRO部门) imec

专题命中 效率与部署 :language model(title,abstract);LLM(abstract_cn);large language model(abstract)

AI总结 本文系统研究了视觉-语言模型(LVLM)的测试时扩展方法,发现小型高性能模型受益最大,性能提升可达30%,并揭示了视觉信息在推理链早期编码后图像令牌贡献显著下降。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07843 2026-07-03 cs.LG cs.AI cs.CL 版本更新 85%

ThreadWeaver: Adaptive Threading for Efficient Parallel Reasoning in Language Models

ThreadWeaver:自适应线程化实现语言模型高效并行推理

Long Lian, Sida Wang, Felix Juefei-Xu, Tsu-Jui Fu, Xiuyu Li, Adam Yala, Trevor Darrell, Alane Suhr, Yuandong Tian, Xi Victoria Lin

机构 * UC Berkeley(伯克利大学) UCSF(旧金山大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出ThreadWeaver框架,通过两阶段并行轨迹生成、基于trie的展开设计和并行化感知强化学习,在保持与顺序推理模型相当准确率的同时,显著降低推理延迟。

Comments Accepted as an oral paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17633 2026-06-15 cs.SD cs.CR 版本更新 85%

SARSteer: Safeguarding Large Audio-Language Models via Safe-Ablated Refusal Steering

SARSteer: 通过安全消融拒绝引导保护大型音频语言模型

Weilin Lin, Jianze Li, Hui Xiong, Li Liu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 提出SARSteer,首个针对大型音频语言模型的推理时防御框架,通过文本衍生的拒绝引导和分解安全空间消融,有效提升有害查询拒绝率并减少良性查询的过度拒绝。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10820 2026-06-11 cs.LG cs.AI cs.CL 版本更新 85%

K-Forcing: Joint Next-K-Token Decoding via Push-Forward Language Modeling

K-Forcing:通过前推语言建模进行联合下一K词解码

Zhiwei Tang, Yuanyu He, Yizheng Han, Wangbo Zhao, Jiasheng Tang, Fan Wang, Bohan Zhuang

机构 * DAMO Academy, Alibaba Group(阿里巴巴达摩院) Hupan Lab(湖畔实验室) Zhejiang University(浙江大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出K-Forcing范式,通过前推映射将自回归模型蒸馏为单次前向传播生成多个未来词,实现2.4-3.5倍加速,质量损失小。

Comments Code: https://github.com/alibaba-damo-academy/K-Forcing

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27476 2026-06-09 cs.CV 版本更新 85%

EdgeFM: Efficient Edge Inference for Vision-Language Models

EdgeFM: 为视觉-语言模型高效边缘推理设计的框架

Mengling Deng, Yuanpeng Chen, Sheng Yang, Wei Tao, Wenhai Zhang, Hui Song, Linyuanhao Qin, Kai Zhao, Xiaojun Ye, Shanhui Mo, Jingli Fan, Shuang Zhang, Bei Liu, Tiankun Zhao, Xiangjing An

机构 * Go Further. AI School of Data Science Fudan University(复旦大学数据科学学院) RUYi Dynamics Co. Ltd(RUYi Dynamics有限公司) Independent Researcher(独立研究者)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 EdgeFM通过轻量级代理驱动框架,优化边缘部署的视觉-语言模型推理,提升跨平台性能和可移植性,实现比传统工具链更快的推理速度。

Comments Technique Report version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28149 2026-08-05 cs.LG 版本更新 84%

Sign-Aware Gated Sparse Autoencoders: Modeling Anticorrelated Features with Bi-Jump-ReLU Activations

符号感知门控稀疏自编码器:使用Bi-Jump-ReLU激活函数建模反相关特征

Bartosz Wieciech, Zmnako Awrahman, Marcin Czelej, Victor Hugo Jaramillo Velasquez, Wioletta Stobieniecka

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出符号感知门控稀疏自编码器(SA-GSAE),通过双面门控稀疏性、符号幅度路径和辅助重构,利用Bi-Jump-ReLU激活实现双极性共享,在保持参数效率的同时,在多个LLM激活点上优于标准门控SAE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23348 2026-07-22 cs.DC cs.AI cs.NI 版本更新 84%

CWind: A Cross-site Router for Large Language Model Inference Serving at Renewable Energy Farms

XWind: 面向可再生能源农场的跨站点大语言模型推理服务路由器

Tella Rajashekhar Reddy, Atharva Deshmukh, Liangcheng Yu, Chaojie Zhang, Mike Shepperd, Rohan Gandhi, Anjaly Parayil, Srinivasan Iyengar, Ajay Manchepalli, Debopam Bhattacherjee

机构 * Microsoft(微软)

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.AI

AI总结 提出AI绿色围栏部署模式,并构建XWind路由器,利用实时信号动态配置站点和分发请求,以在可变风力供电下高效服务推理请求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14643 2026-07-21 cs.AI 版本更新 84%

Arbor: A Framework for Reliable Navigation of Critical Conversation Flows

Arbor:一种用于关键对话流程可靠导航的框架

Luís Silva, Diogo Gonçalves, Catarina Farinha, Clara Matos, Luís Ungaro

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 Arbor通过分解决策树导航为节点级任务,提升了医疗分诊中对话流程的准确性和效率,使小型模型能超越大模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29179 2026-06-17 cond-mat.mtrl-sci cs.AI 版本更新 84%

Sustainable Metal-Organic Framework Water Harvesters in the Artificial Intelligence Era

人工智能时代可持续的金属有机框架水收集器

Reid A. Coyle, Shyam Chand Pal, Peter Walther, Saeun Park, Bin Feng, Zhiling Zheng

机构 * Department of Chemistry, Washington University(华盛顿大学化学系) Institute of Materials Science & Engineering, Washington University(华盛顿大学材料科学与工程学院)

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨了金属有机框架(MOF)在干旱条件下水收集的设计原理,并介绍了人工智能(AI)、大语言模型(LLM)和数据挖掘如何加速高性能吸附剂的发现。

Comments 10 pages of main text, 26 total pages. 3 Figures and 1 Table of Content Graphic

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04581 2026-06-09 cs.DC cs.AI cs.NI 版本更新 84%

Multi-SPIN: Multi-Access Speculative Inference for Cooperative Token Generation at the Edge

Multi-SPIN:面向边缘协作令牌生成的多接入推测推理

Haotian Zheng, Zhanwei Wang, Mingyao Cui, Chang Cai, Hongyang Du, Kaibin Huang

机构 * Department of Electrical and Computer Engineering, The University of Hong Kong(香港大学电子与计算机工程系)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 提出多接入推测推理(Multi-SPIN)架构,通过联合优化草案长度控制和带宽分配,在异构边缘系统中最大化令牌总吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15509 2026-08-11 cs.CV cs.AI cs.LG 版本更新 84%

LLM-Driven AutoML for Cross-Lingual Handwritten OCR: Closed-Loop Neural Architecture Search with GPT-5, GPT-4o, and Claude Sonnet 4

用于跨语言手写OCR的基于大语言模型驱动的自动化机器学习:使用GPT-5、GPT-4o和Claude十四行诗4的闭环神经架构搜索

Mobina Kashaniyan, Amirhossein Ghassemi, Nasser Mozayani

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对跨语言手写OCR,提出用GPT-5等大语言模型驱动的自动化机器学习框架,能自主生成、训练等优化神经网络架构,经实验评估,该框架无需人工设计等就能发现高效准确模型,实现跨语言手写识别。

Comments 6 pages, 10 figures, and 2 tables. Published in the 2025 15th International Conference on Computer and Knowledge Engineering (ICCKE)

Journal ref 2025 15th International Conference on Computer and Knowledge Engineering (ICCKE), IEEE, 2025, Article No. 11273810

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02544 2026-08-11 cs.CL cs.AI 版本更新 84%

SimSD: Simple Speculative Decoding in Diffusion Language Models

SimSD:扩散语言模型中的简单推测解码

Junxia Cui, Haotian Ye, Runchu Tian, Hongcan Guo, Jinya Jiang, Haoru Li, Chaojie Ren, Yiming Huang, Kaijie Zhu, Zhongkai Yu, Kun Zhou, Jingbo Shang

机构 * University of California San Diego(加州大学圣地亚哥分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google(谷歌) University of California Santa Barbara(加州大学圣芭芭拉分校)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 针对扩散语言模型无法直接使用标准推测解码的问题,提出SimSD算法,通过即插即用的掩码策略引入参考令牌并设计注意力掩码,实现单次前向传播验证多个草稿令牌,在保持并行解码优势的同时提升解码吞吐量。

Comments 13 pages, 4 figures, code available at https://github.com/airevo2/SimSD-release

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26828 2026-08-07 cs.LG cs.AI 版本更新 84%

Budget-Aware LLM Discovery via Cost-Calibrated Frontier Utility

基于成本校准前沿效用的预算感知大语言模型发现

Yansen Zhang, Yilu Liu, Tianyu Liu, Jiamin Chen, Xiaokun Zhang, Kai Xie, Xue Liu, Yiyan Qi, Chen Ma

机构 * City University of Hong Kong(香港城市大学) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) International Digital Economy Academy (IDEA)(国际数字经济学院)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对大语言模型发现的成本问题,提出 CostAda 成本自适应控制器,通过成本校准前沿效用优化预算使用,在多基准测试中以更少预算达到或超越现有模型的质量表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07568 2026-08-07 cs.LG cs.AI 版本更新 84%

d3LLM: Ultra-Fast Diffusion LLM using Pseudo-Trajectory Distillation

d3LLM:基于伪轨迹蒸馏的超快扩散大语言模型

Yu-Yang Qian, Junda Su, Lanxiang Hu, Peiyuan Zhang, Zhijie Deng, Peng Zhao, Hao Zhang

机构 * University of California, San Diego(加州大学圣地亚哥分校) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 d3LLM通过伪轨迹蒸馏和熵基多块解码技术,在提升并行性的同时保持准确性,实现超快的扩散大语言模型。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00837 2026-08-05 cs.CL cs.LG 版本更新 84%

Pruned BPE: Post-training Visibility Pruning and Token Reallocation for Byte Pair Encoding

剪枝BPE:针对字节对编码的训练后可见性剪枝与令牌重新分配

Kenny Shao

机构 * Florida International University(佛罗里达国际大学)

专题命中 效率与部署 :post-training(title,abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Pruned BPE方法,通过训练后可见性剪枝与令牌重新分配提升BPE词汇效率,在不增加模型可见词汇规模的情况下减少编码长度,取得了优于标准BPE的效果。

Comments 18 pages, 2 figures, 4 tables, and 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27405 2026-08-05 cs.CL cs.AI 版本更新 84%

Benchmarking LLM Competence on Logical Inference over Probability Operators

基于概率算子的逻辑推理能力大语言模型基准测试

Nayera Hasan, Jack Greff, Alvin Grissom

机构 * Haverford College(哈维福德学院)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究构建含14320个提示的概率算子推理基准,评估29个大语言模型,发现多数模型存在答案偏差,仅9个超随机水平,且各维度均有偏差。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12787 2026-08-05 cs.AI cs.CL cs.CV cs.MM 版本更新 84%

Do We Really Need Multimodal Emotion Language Models Larger Than 1B Parameters?

我们真的需要参数超过10亿的多模态情感语言模型吗?

Kaiwen Zheng, Junchen Fu, Wenhao Deng, Hu Han, Joemon M. Jose, Xuri Ge

机构 * University of Glasgow(格拉斯哥大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Artificial Intelligence, Shandong University(山东大学人工智能学院)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 质疑多模态情感识别需参数超10亿模型的假设,提出轻量级MER框架Light-MER,通过知识蒸馏及两种优化策略,在九个基准数据集实验中实现最优性能并显著提高推理效率,凸显小模型潜力。

Comments Accepted by ACM MM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04468 2026-08-05 cs.AI cs.CL 版本更新 84%

What Makes a Sale? Simulating End-to-End Seller--Buyer Retail Dynamics with LLM Agents

什么促成了一次销售?通过LLM代理重新思考端到端的卖家-买家零售动态

Jeonghwan Choi, Jibin Hwang, Gyeonghun Sun, Minjeong Ban, Taewon Yun, Hyeonjae Cheon, Hwanjun Song

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文提出RetailSim框架,通过统一环境建模零售流程,展现行为忠实度和经济规律,用于分析买家-卖家互动及销售策略评估。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30363 2026-08-04 q-fin.CP cs.AI cs.LG q-fin.ST 版本更新 84%

Enhancing Regime Shift Detection Using Unstructured Data: A Study on the Treasury Market

利用非结构化数据增强制度转换检测:国债市场研究

Mingxuan Yi, Vidal Mehra, Jing Chen, John Cartlidge

机构 * School of Engineering Mathematics and Technology, University of Bristol, UK(布里斯托大学工程数学与技术学院) Propellant Digital B.V., Amsterdam, Netherlands(荷兰阿姆斯特丹Propellant Digital公司) School of Mathematics, Cardiff University, UK(卡迪夫大学数学学院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract,comments);language model(abstract,comments);分类 cs.AI、cs.LG

AI总结 提出一种结合大语言模型推理与统计检验的文本增强型制度转换检测框架,在国债市场数据上实现F1=0.82,优于纯数据驱动方法。

Comments 9 pages, 4 figures. Selected for Long Oral presentation at the International Symposium on Large Language Models for Financial Services (FinLLM@IJCAI 2026), Bremen, Germany, 15 August 2026 (non-archival). Code available at: https://github.com/mingxuan-yi/regime_shift

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21759 2026-08-04 cs.CL cs.LG 版本更新 84%

Orchestrating Dual-Boundaries: An Arithmetic Intensity Inspired Acceleration Framework for Diffusion Language Models

协调双边界:一种受算术强度启发的加速框架用于扩散语言模型

Linye Wei, Wenjue Chen, Pingzhi Tang, Xiaotian Guo, Le Ye, Runsheng Wang, Meng Li

机构 * Peking University(北京大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

AI总结 ODB-dLLM通过协调双边界,利用算术强度差异优化扩散语言模型的推理速度,显著提升效率并减少准确性损失。

Comments Accepted by DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20757 2026-07-27 cs.LG cs.CL 版本更新 84%

GaugeQuant: Online Learning of Quantization-Optimal Bases from LLM Symmetries

规范量化:从语言模型对称性中在线学习量化最优基

Miguel P. Bento, João F. Seabra

专题命中 效率与部署 :LLM(title);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 研究利用Transformer内部连续对称性,通过在损失中引入LogSumExp项破坏对称性,在线学习量化最优基,无需校准数据和量化模拟,训练开销小,在不同量化设置下降低了LLaMA - 2 7B模型的困惑度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12262 2026-07-07 cs.CL cs.LG 版本更新 84%

Few-Step Diffusion Language Models via Trajectory Self-Distillation

通过轨迹自蒸馏实现少步扩散语言模型

Tunyu Zhang, Xinxi Zhang, Ligong Han, Haizhou Shi, Xiaoxiao He, Zhuowei Li, Hao Wang, Kai Xu, Akash Srivastava, Chengzhi Mao, Hao Wang, Vladimir Pavlovic, Dimitris N. Metaxas

机构 * Rutgers University(罗格斯大学) Red Hat AI Innovation(红帽AI创新) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过轨迹自蒸馏框架训练少步学生模型,以匹配全步教师的生成轨迹,从而减少解码步骤带来的输出质量下降,并结合DDO提升推理任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29215 2026-07-01 cs.LG cs.CL 版本更新 84%

Multi-Block Diffusion Language Models

多块扩散语言模型

Yijie Jin, Jiajun Xu, Yuxuan Liu, Chenkai Xu, Yi Tu, Jiajun Li, Dandan Tu, Xiaohui Yan, Kai Yu, Pengfei Liu, Zhijie Deng

机构 * Shanghai Jiao Tong University(上海交通大学) Xi’an Jiao Tong University(西安交通大学) Huawei(华为)

专题命中 效率与部署 :language model(title,abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 提出多块教师强制(MultiTF)训练策略,将单块扩散语言模型扩展为多块扩散(MultiBD),通过块缓冲机制实现并行解码,提升令牌吞吐量和准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14035 2026-06-19 cs.LG cs.AI 版本更新 84%

Wisdom of Committee: Diverse Distillation from Large Foundation Models and Domain Experts

委员会智慧:来自大型基础模型和领域专家的多样化蒸馏

Zichang Liu, Qingyun Liu, Yuening Li, Liang Liu, Anshumali Shrivastava, Shuchao Bi, Lichan Hong, Ed H. Chi, Zhe Zhao

机构 * Rice University(Rice大学) Google DeepMind(谷歌DeepMind) Google Inc(谷歌公司) University of California, Davis(加州大学戴维斯分校)

专题命中 效率与部署 :foundation model(title,abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对基础模型向紧凑领域模型蒸馏时能力、架构和模态差异大的问题,提出DiverseDistill框架,通过可学习的问答机制和对齐异构教师输出,在推荐和视觉任务上恢复73-114%的性能差距。

Comments Accepted at the 1st Workshop on Resource-Efficient Learning and Knowledge Discovery (RelKD), KDD 2026

Journal ref Proceedings of the International Workshop on Resource-Efficient Learning and Knowledge Discovery (RelKD), KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10239 2026-06-18 cs.LG cs.AI 版本更新 84%

Efficient Zeroth-Order Federated Finetuning of Language Models on Resource-Constrained Devices

资源受限设备上语言模型的高效零阶联邦微调

Mohamed Aboelenien Ahmed, Kilian Pfeiffer, Ramin Khalili, Heba Khdr, Jörg Henkel

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Huawei(华为) Heisenberg Research Center (Munich), Germany(海森堡研究中心(慕尼黑),德国)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 提出一种基于零阶优化的联邦微调方法,通过分块模型并分配更多扰动到后一块,复用中间激活减少前向评估次数,在保持内存和通信优势的同时将计算量降低至其他零阶方法的1/3。

Comments Published at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06154 2026-06-17 cs.LG cs.CL 版本更新 84%

MoSE: Mixture of Slimmable Experts for Efficient and Adaptive Language Models

MoSE: 混合可瘦身专家实现高效自适应语言模型

Nurbek Tastan, Stefanos Laskaridis, Karthik Nandakumar, Samuel Horvath

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI), UAE(Mohamed bin Zayed人工智能大学(MBZUAI)) Michigan State University (MSU), USA(密歇根州立大学(MSU)) Amazon Science, UK(亚马逊科学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

AI总结 提出MoSE架构,每个专家具有可变宽度的嵌套结构,支持在推理时连续调节精度-计算权衡,通过多宽度训练和轻量级测试时训练实现高效自适应。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11320 2026-06-16 cs.LG cs.AI cs.DC math.OC stat.ML 版本更新 84%

Optimizing LLM Inference: Fluid-Guided Online Scheduling with Memory Constraints

优化大语言模型推理:带有内存约束的流引导在线调度

Ruicheng Ao, Gan Luo, David Simchi-Levi, Xinshang Wang

机构 * Institute for Data, Systems, and Society, Massachusetts Institute of Technology(数据、系统与社会研究所,麻省理工学院) School of Mathematical Sciences, Peking University(北京大学数学科学学院) Alibaba Group(阿里巴巴集团)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出流引导在线调度方法,通过等待阈值算法和嵌套等待算法,在内存约束下优化大语言模型推理的延迟和容量,减少过载时的延迟。

Comments 79 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26099 2026-06-08 cs.CL cs.AI 版本更新 84%

Do Language Models Need Sleep? Offline Recurrence for Improved Online Inference

语言模型需要睡眠吗?用于改进在线推理的离线循环

Sangyun Lee, Sean McLeish, Tom Goldstein, Giulia Fanti

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Maryland(马里兰大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种类似睡眠的巩固机制,通过离线循环将上下文转换为快速权重,以解决Transformer注意力机制随上下文长度扩展性差的问题,并在合成任务和数学推理任务上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07885 2026-08-10 cs.DC cs.AI cs.CL cs.LG 版本更新 83%

Intelligence per Watt: Measuring Intelligence Efficiency of Local AI

每瓦智能:衡量本地AI的智能效率

Jon Saad-Falcon, Avanika Narayan, Hakki Orhun Akengin, J. Wes Griffin, Herumb Shandilya, Adrian Gamarra Lafuente, Medhya Goel, Rebecca Joseph, Shlok Natarajan, Etash Kumar Guha, Shang Zhu, Ben Athiwaratkun, John Hennessy, Azalia Mirhoseini, Christopher Ré

机构 * Stanford University(斯坦福大学) Together AI

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了本地AI在能源效率和性能上的表现,提出了一种统一的衡量指标IPW,展示了本地推理在重新分配需求方面的能力,并揭示了本地加速器的优化潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17723 2026-07-20 q-fin.GN 版本更新 83%

LR-Robot: A Unified Supervised Intelligent Framework for Real-Time Systematic Literature Reviews with Large Language Models

LR-Robot:一种结合大语言模型的实时系统性文献综述统一监督智能框架

Wei Wei, Jin Zheng, Zining Wang

专题命中 效率与部署 :large language model(title);language model(title)

AI总结 本文提出LR-Robot框架,结合AI与专家监督,实现系统性文献综述的多维分类、关系映射和细粒度主题演化分析,通过期权定价案例展示其在文献综合中的应用与效果。

Comments I've uploaded an updated paper and now it's already on arXiv (arXiv:2604.14793)

详情

展开后加载摘要…

URL PDF HTML 收藏