arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22280 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22280 篇

2606.08098 2026-07-14 cs.AI cs.LG 版本更新 88%

When Does Delegation Beat Majority? A Delegation-Based Aggregator for Multi-Sample LLM Inference

何时委托优于多数?一种基于委托的多样本LLM推理聚合器

Yasushi Sakai, Allen Song, Kent Larson

机构 * MIT Media Lab(麻省理工学院媒体实验室)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出基于委托的聚合器PPV,利用样本的字母熵和推理几何信号,在MMLU-Pro上比多数投票高1.5个百分点,无需标签或训练。

Comments Preprint. 16 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24256 2026-07-14 cs.LG cs.AI 版本更新 88%

Graph Optimization Foundation Model: Tokenizing Graph via A Language-Model Paradigm

图优化基础模型:通过语言模型范式对图进行分词

Yunhao Liang, Pujun Zhang, Yuan Qu, Jingyuan Yang, Shaochong Lin, Zuo-jun Max Shen

机构 * Faculty of Engineering, The University of Hong Kong(香港大学工程学院) Costello College of Business, George Mason University(乔治·马歇尔大学商学院) Faculty of Business and Economics, The University of Hong Kong(香港大学商学院) College of Engineering, University of California, Berkeley(加州大学伯克利分校工程学院)

专题命中 效率与部署 :foundation model(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究旨在将预训练-迁移范式用于图优化,引入图基础模型(GFM)。通过在图随机游走路径上进行自监督预训练,使其内化图规则。该方法能有效应对多种优化挑战,实验显示其性能与专用求解器相当且推理更快,建立了图优化新范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04983 2026-07-10 cs.NE cs.AI cs.ET cs.GL cs.LG 新提交 88%

LLM for the development of FCM

用于模糊认知图开发的语言模型

Alexis Kafantaris

机构 * Qwen2.5-32B

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究利用本地大语言模型开发模糊认知图,以Qwen2.5 - 32B从酒店评论提取数据构建模糊认知图,经训练、评估及外部验证,形成希腊评论的星型拓扑模糊认知图,关联评论星级与预测满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03333 2026-07-07 cs.DC cs.AI cs.LG 新提交 88%

SPORK: Self-Speculative Forking to Accelerate Agentic LLM Inference

SPORK:自我推测性分叉以加速智能体大语言模型推理

Huajun Bai, Weiwei Lv, Huichuan Zheng, Youyou Lu, Jiwu Shu

机构 * Tsinghua University(清华大学) Meituan(美团)

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.AI、cs.LG

AI总结 研究LLM智能体推理中串行循环耗时问题,提出SPORK方法,利用模型自身预测提前调度推测工具调用,通过成本模型等组件优化,大幅提升推理效率且不影响任务准确性。

Comments 16 pages, 15 figures. Code: https://github.com/baihuajun24/spork

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07571 2026-07-03 cs.LG cs.AI 新提交 88%

Enabling KV Caching of Shared Prefix for Diffusion Language Models

为扩散语言模型启用共享前缀的KV缓存

Younghun Go, Jaehoon Han, Changyong Shin, Chuck Yoo, Gyeongsik Yang

机构 * Korea University(高丽大学)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.AI、cs.LG

AI总结 针对扩散语言模型中双向注意力导致共享前缀KV不稳定的问题,提出双向前缀缓存(bicache),通过动态识别安全层深度重用KV,避免精度崩溃,提升吞吐量36.3%-98.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31524 2026-07-01 cs.LG cs.AI stat.ML 新提交 88%

On the Convergence of Self-Improving Online LLM Alignment

关于自改进在线大语言模型对齐的收敛性

Xudong Wu, Pangpang Liu, Vaneet Aggarwal, Jiayu Chen

机构 * The University of Hong Kong(香港大学) Yale University(耶鲁大学) Purdue University(普渡大学)

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.AI、cs.LG

AI总结 针对SAIL算法收敛性分析缺失的问题,提出SAIL-RevKL正则化目标,证明其满足PL条件并实现近线性样本复杂度,在MuJoCo和LLM对齐任务上优于原始SAIL。

Comments Accepted at UAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31519 2026-07-01 cs.LG cs.CL 新提交 88%

RaBitQCache: Rotated Binary Quantization for KVCache in Long Context LLM Inference

RaBitQCache: 面向长上下文LLM推理中KVCache的旋转二值量化

Wenhao Li, Jinhao Dong, Hailin Zhang, Wenhang Shi, Wei Lu, Xiaoyong Du

机构 * School of Information, Renmin University of China(中国人民大学信息学院) Peking University(北京大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 针对长上下文大语言模型推理中KV缓存导致的瓶颈,提出RaBitQCache框架,利用随机旋转二值量化和高效二进制-INT4算术无偏估计注意力权重,实现自适应Top-p检索,加速推理并减少内存I/O。

Comments Accept by ICML 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30696 2026-07-01 cs.RO cs.CL cs.LG 新提交 88%

ViTL: Temporal Logic-Guided Zero-Shot Natural Language Navigation via Vision-Language Models

ViTL:基于视觉语言模型的时间逻辑引导零样本自然语言导航

Kaier Liang, Hengde Dai, Cristian-Ioan Vasile

机构 * Lehigh University(里海大学)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL、cs.LG

AI总结 提出ViTL框架,利用大语言模型将自然语言命令编译为线性时序逻辑公式,并引入方向性评分,实现零样本多目标时序约束导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29563 2026-06-30 cs.CL cs.AI 88%

Coverage-Driven KV Cache Eviction for Efficient and Improved Inference of LLM

覆盖驱动的KV缓存淘汰策略用于高效且改进的大语言模型推理

Shuvendu Roy, Mengyao Zhai, Hossein Hajimirsadeghi, Golnoosh Samei

机构 * RBC Borealis(RBC 培生)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型推理中KV缓存内存开销大、现有淘汰策略导致长上下文任务性能下降的问题,提出覆盖感知的K-VEC策略,通过跨头跨层覆盖模块提升token保留,在LongBench上最高提升10.35点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27743 2026-06-29 cs.IR cs.AI cs.LG 新提交 88%

End-to-End Dynamic Sparsity for Resource-Adaptive LLM Inference

端到端动态稀疏性用于资源自适应的大语言模型推理

Yuhang Chen, Jinhao Duan, Ruichen Zhang, Mingfu Liang, Xiaohan Wei, Yunchen Pu, Fei Tian, Chonglin Sun, Parish Aggarwal, Frank Shyu, Luke Simon, Sandeep Pandey, Tianlong Chen, Xi Liu

机构 * Meta AI University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出L2A框架,通过预算条件和输入感知的门控网络,实现层跳过、头剪枝和推理令牌减少的资源自适应推理,在Llama-3-8B和Qwen-3-4B上达到34%层稀疏性且性能损失小于0.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27683 2026-06-29 cs.LG cs.AI 新提交 88%

CBD: API-Only LLM Black-Box Unlearning through Controlled Behavioral Divergence

CBD:通过受控行为差异实现仅API的黑盒大模型遗忘

Zhiqiang Xie, Yijing Lin, Zhipeng Gao, Dong In Kim

机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications(北京邮电大学网络与交换技术国家重点实验室) Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(北京未来区块链与隐私计算高精尖创新中心) Department of Electronic and Electrical Engineering, Sungkyunkwan University(成均馆大学电子与电气工程系)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对仅API黑盒访问下大模型遗忘难题,提出受控行为差异(CBD)框架,利用辅助模型构建保留与遗忘输入的行为差异并路由遗忘提示,通过基于梯度统计的判别基提升相似数据区分度,实现更优的遗忘-效用权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24506 2026-06-29 cs.DC cs.AI cs.LG cs.PF 新提交 88%

CrossPool: Efficient Multi-LLM Serving for Cold MoE Models through KV-Cache and Weight Disaggregation

CrossPool: 通过KV缓存和权重分离实现冷MoE模型的高效多LLM服务

Zhuoren Ye, Tianyu Wo, Dinghao Xue, Mingming Zhang, Yuchen Teng, Chunming Hu, Renyu Yang

机构 * School of Software, Beihang University(北京航空航天大学软件学院)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 针对冷MoE模型权重与KV缓存竞争GPU内存的问题,提出CrossPool引擎,将FFN权重和KV缓存分离到不同内存池,结合规划器、虚拟化器和流水线调度器,显著提升内存利用率和长上下文支持,P99 TBT降低达10.4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00410 2026-06-26 cs.CL cs.AI cs.SE 88%

Agent Capsules: Quality-Gated Granularity Control for Multi-Agent LLM Pipelines

代理胶囊:多代理LLM流水线中的质量门控粒度控制

Aninda Ray

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文提出Agent Capsules,通过将多代理流水线执行视为优化问题,结合质量约束实现粒度控制,有效减少token消耗并保持质量,实验显示在不同流水线中均取得显著效率提升。

Comments 17 pages, 7 figures. Code: https://github.com/aray-17/agent-capsules

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12805 2026-06-18 q-bio.GN cs.AI cs.CL 版本更新 88%

SciHorizon-GENE: Benchmarking LLM for Life Sciences Inference from Gene Knowledge to Functional Understanding

SciHorizon-GENE:从基因知识到功能理解的生命科学推理基准测试

Xiaohan Huang, Meng Xiao, Chuan Qin, Qingqing Long, Jinmiao Chen, Yuanchun Zhou, Hengshu Zhu

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) University of the Chinese Academy of Sciences(中国科学院大学) DUKE-NUS Medical School, National University of Singapore(新加坡国立大学杜克-新加坡医学学校) Singapore Immunology Network, Agency for Science, Technology and Research(新加坡免疫网络,科技研究局)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型在基因级推理能力上的不足,构建了包含超过19万个人类基因和54万问题的基准SciHorizon-GENE,从研究关注敏感性、幻觉倾向、答案完整性和文献影响力四个生物学关键维度评估模型,揭示了模型在生成忠实、完整且基于文献的功能解释方面的持续挑战。

Comments Accepted by SIGKDD 2026. 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15576 2026-06-16 cs.LG cs.AI 新提交 88%

Localizing Credit at the Divergence: Path-Conditioned Self-Distillation for LLM Reasoning

在分歧处定位信用:路径条件自蒸馏用于LLM推理

Yu Li, Shu Hong, Tian Lan

机构 * Department of Electrical and Computer Engineering, George Washington University(乔治华盛顿大学电气与计算机工程系)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出Hindsight Self-Distillation (HSD)方法,通过将教师模型条件于当前训练组中的成功同伴轨迹,在失败与成功轨迹的分歧处提供密集信用信号,提升LLM在数学和代码推理任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15555 2026-06-16 math.OC cs.AI cs.LG stat.ML 新提交 88%

Service-Induced Congestion in Memory-Constrained LLM Serving

内存受限的大语言模型服务中的服务引发拥塞

Ruicheng Ao, Jing Dong, Gan Luo, David Simchi-Levi

机构 * Institute for Data, Systems, and Society, Massachusetts Institute of Technology(数据、系统与社会研究所,麻省理工学院) Columbia Business School, Columbia University(哥伦比亚大学商学院) School of Mathematical Sciences, Peking University(北京大学数学科学学院)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过离散时间动力学模型研究内存受限的大语言模型服务中,因键值缓存增长导致的服务引发拥塞,发现同质负载下无驱逐均衡不稳定且收敛到最坏情况极限环,异质负载下稳定条件与解码长度互质相关,并提出调度设计原则。

Comments 101 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14368 2026-06-15 cs.LG cs.CL 新提交 88%

Be My Tutor: On-Policy Co-Distillation for Mutual LLM Improvement via Peer Feedback

做我的导师:通过同伴反馈实现互惠LLM改进的在策略共蒸馏

Woohyeon Byeon, Jiwon Jeon, Jeonghye Kim, Youngchul Sung

机构 * KAIST(韩国科学技术院)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 提出在策略共蒸馏(OPCoD)方法,通过认知门控和反馈锚定实现两个不同领域强模型间的相互教学,达到帕累托改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10487 2026-06-10 cs.LG cs.AI 新提交 88%

Stop Early, Spend Less: Hidden-State Probes as a Practical Recipe for Streaming Moderation of LLM Outputs

早停早省:隐藏状态探针作为LLM输出流式审核的实用方案

Huizhen Shu, Xuying Li, Piao Xue

机构 * ModelOneAI yunshanai(云山AI)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出基于隐藏状态的轻量级词元级探针,在解码循环中实时检测不安全输出,无需额外前向传播,实现亚毫秒级安全审核,可提前中断或修改生成。

Comments Technical Report. 14 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10209 2026-06-10 cs.AI cs.LG cs.SE 新提交 88%

Less Context, Better Agents: Efficient Context Engineering for Long-Horizon Tool-Using LLM Agents

更少上下文,更优智能体:面向长周期工具使用LLM智能体的高效上下文工程

Abhilasha Lodha, Mahsa Pahlavikhah Varnosfaderani, Abir Chakraborty, Abhinav Mithal

机构 * Microsoft(微软)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对企业工具使用场景中上下文过长导致的问题,提出选择性保留最近工具交互并添加紧凑摘要的方法,在费用明细任务上将完成率从71.0%提升至91.6%,同时大幅降低token消耗和运行时间。

Comments 17 pages, 3 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07819 2026-06-09 cs.AI cs.LG 新提交 88%

Joint Structural Pruning and Mixed-Precision Quantization for LLM Compression

联合结构剪枝与混合精度量化的大语言模型压缩

Hoang-Loc La, Truong-Thanh Le, Amir Taherkordi, Phuong Hoai Ha

机构 * UiT The Arctic University of Norway(挪威北极大学) University of Oslo, Norway(挪威奥斯陆大学)

专题命中 效率与部署 :LLM(title,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出端到端框架,通过全局误差最小化的混合精度量化策略和联合优化结构剪枝与量化策略,在超低比特下显著降低困惑度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17693 2026-06-08 cs.DB cs.AI cs.CL 版本更新 88%

Database Normalization via Dual-LLM Self-Refinement

通过双LLM自精炼的数据库规范化

Eunjae Jo, Nakyung Lee, Gyuyeong Kim

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出Miffie框架,利用双模型自精炼架构和大语言模型实现数据库自动规范化,无需人工干预且保持高准确率。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06470 2026-06-05 cs.LG cs.AI 88%

PC Layer: Polynomial Weight Preconditioning for Improving LLM Pre-Training

PC层:通过多项式权重预处理改进大语言模型预训练

Senmiao Wang, Tiantian Fang, Haoran Zhang, Yushun Zhang, Kunxiang Zhao, Alex Schwing, Ruoyu Sun

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Google LLC(谷歌公司) Shenzhen International Center for Industrial and Applied Mathematics(深圳国际工业与应用数学中心) Shenzhen Research Institute of Big Data(深圳大数据研究院) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.AI、cs.LG

AI总结 提出一种多项式预条件子权重参数化方法(PC层),通过低阶多项式预条件重塑权重矩阵奇异值谱,确保LLM训练中权重条件稳定,且训练后无推理开销,在Llama-1B预训练中优于标准Transformer。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04511 2026-06-04 cs.CL cs.LG 88%

SparDA: Sparse Decoupled Attention for Efficient Long-Context LLM Inference

SparDA: 用于高效长上下文LLM推理的稀疏解耦注意力

Yaosheng Fu, Guangxuan Xiao, Xin Dong, Song Han, Oreste Villa

机构 * NVIDIA Thinking Machines Lab ByteDance Seed MIT

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 提出SparDA架构,通过引入第四投影Forecast实现KV缓存预取与注意力解耦,减少稀疏选择开销,在长上下文推理中实现1.25倍预填充加速和1.7倍解码加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15152 2026-06-04 cs.LG cs.AI 88%

Widening the Gap: Exploiting LLM Quantization via Outlier Injection

扩大差距:通过异常值注入利用LLM量化

Xiaohua Zhan, Kazuki Egashira, Robin Staab, Mark Vero, Martin Vechev

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出首个针对多种先进量化方法(AWQ、GPTQ、GGUF I-quants)的量化条件攻击,通过注入异常值导致权重塌缩,诱导模型在量化后出现恶意行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03073 2026-06-03 cs.LG cs.AI 88%

Efficient Hyperparameter Optimization for LLM Reinforcement Learning

大语言模型强化学习的高效超参数优化

Minping Chen, Bowen Xiao, Du Liang, Chuxuan Zeng, Zeyi Wen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学) China United Network Communications Group(中国联合网络通信集团)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出联合保真度超参数优化方法,通过同时调整模型大小和训练预算作为保真度,并集成早停策略和检查点机制,显著提升计算效率(每轮最高14.9倍)且性能提升5.8%-111.6%。

Comments 12 pages, 6 figures, accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00956 2026-06-03 cs.LG cs.CL 88%

WUSH: Near-Optimal Adaptive Transforms for LLM Quantization

WUSH: 面向LLM量化的近最优自适应变换

Jiale Chen, Vage Egiazarian, Roberto L. Castro, Torsten Hoefler, Dan Alistarh

机构 * University of Tartu(塔尔图大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 提出一种结合Hadamard基与数据依赖二阶矩的非正交变换WUSH,在标准RTN AbsMax缩放块量化器下实现权重-激活联合量化的闭式最优解,显著提升低比特量化精度并支持高效GPU实现。

Comments Published as a conference paper at the 43rd International Conference on Machine Learning (ICML 2026): https://openreview.net/forum?id=ZsECxUkbKB

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01204 2026-06-02 cs.CL cs.AI cs.CY 88%

Implicit Geographic Inference in LLM Medical Triage: Language-Driven Disparities in Emergency Recommendations

LLM医疗分诊中的隐式地理推断:语言驱动的急诊推荐差异

Qi Han Wong

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究大型语言模型在相同症状下,仅因患者提示语言不同而产生不同的医疗分诊推荐,发现模型根据输入语言隐式推断地理位置,导致急诊推荐率差异显著。

Comments 7 pages, 4 tables. Code and data at https://github.com/wongqihan/ai-behavioral-experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00946 2026-06-02 cs.DC cs.AI cs.LG 88%

Lodestar: An Online-Learning LLM Inference Router

Lodestar: 一种在线学习的大语言模型推理路由器

Gangmuk Lim, Wanyu Zhao, Brighten Godfrey, Jiaxin Shan, Le Xu, Liguang Xie

机构 * UIUC(伊利诺伊大学香槟分校) Bytedance(字节跳动) University of Edinburgh(爱丁堡大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出Lodestar,一种基于在线学习的请求路由系统,通过实时收集集群状态并训练奖励预测器,以最小化TTFT为目标分配推理请求,在异构GPU集群上显著降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08026 2026-06-02 cs.CL cs.AI cs.PF 88%

DyLLM: Efficient Diffusion LLM Inference via Saliency-based Token Selection and Partial Attention

DyLLM: 基于显著性标记选择与部分注意力的高效扩散LLM推理

Younjoo Lee, Seungkyun Dan, Junghoo Lee, Jaiyoung Park, Jung Ho Ahn

机构 * University of Seoul(首尔大学)

专题命中 效率与部署 :LLM(title,title_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对扩散语言模型迭代去噪计算昂贵的问题,提出DyLLM框架,通过仅计算显著标记的注意力与前馈操作,实现无需训练的加速推理,在保持精度的同时吞吐量提升高达9.6倍。

Comments 21 pages, 10 figures, 7 tables, accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29843 2026-05-29 cs.LG cs.AI 88%

HARP: Hadamard-Preconditioned Adaptive Rotation Processor for Extreme LLM Quantization

HARP: 哈达玛预条件自适应旋转处理器用于极端LLM量化

Artur Zagitov, Gleb Molodtsov, Aleksandr Beznosikov

机构 * BRAIn Lab(BRAIn实验室)

专题命中 效率与部署 :LLM(title,title_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 提出HARP,一种可学习的结构化双正交处理器,替代固定随机哈达玛变换,通过自适应旋转基来改善极端低位量化中的激活异常值和各向异性权重曲率问题,在2-4比特设置下提升困惑度和零样本准确率,并保持部署效率。

详情

展开后加载摘要…

URL PDF HTML 收藏