arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1859 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 1859 篇

2606.09551 2026-06-09 cs.CR cs.AI 新提交 90%

FuseFSS: Efficient Secure LLM Inference with Function Secret Sharing

FuseFSS:基于函数秘密共享的高效安全LLM推理

Yuhan Ma, Yong Li, Stefan Schmid

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出FuseFSS编译器,通过统一编译流水线替代逐算子协议设计,实现安全推理中非线性与辅助操作的高效处理,在BERT和GPT模型上取得1.24-1.50倍加速并减少通信与预处理开销。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09084 2026-06-09 cs.CR cs.AI 新提交 90%

Context-Fractured Decomposition Attacks on Tool-Using LLM Agents: Exploiting Artifact Provenance Gaps

上下文碎片化解构攻击:利用工具使用LLM代理的工件来源鸿沟

Xiaofeng Lin, Yukai Yang, Daniel Guo, Sahil Arun Nale, Charles Fleming, Guang Cheng

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 针对工具使用LLM代理,提出上下文碎片化解构(CFD)攻击,利用跨上下文工件来源鸿沟实现多步越狱,成功率提升高达28.3个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07846 2026-06-09 cs.DC cs.AI cs.MA 新提交 90%

Cost-Aware Speculative Execution for LLM-Agent Workflows: An Integrated Five-Dimension Method

成本感知的LLM-Agent工作流投机执行:一种综合五维方法

Faisal Fareed

机构 * AWS(亚马逊网络服务)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 提出一种五维投机执行方法,通过贝叶斯概率估计和成本定价,在LLM-Agent工作流中平衡延迟与成本,并确保无副作用回滚。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13591 2026-08-17 cs.AI cs.CL 新提交 90%

Stable Miscalibration in Large Language Models: A Practical View of High-Confidence Errors

大语言模型中的稳定校准误差:高置信度错误的实用视角

Akira Okutomi

机构 * ToppyMicroServices OÜ

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出稳定校准误差概念,结合两类诊断方法,发现自我批判提示可降低模型隐藏状态敏感性,但高置信度错误未必是推理脆弱,部分或为稳定校准不当。

Comments Accepted at the 2nd Workshop on Epistemic Intelligence in Machine Learning (EIML)@ICML 2026. 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13580 2026-08-17 cs.CL cs.AI 新提交 90%

Jais 2: A Family of Arabic-Centric Open Large Language Models

Jais 2:以阿拉伯语为核心的开源大语言模型家族

Mohamed Anwar, Abed Alhakim Freihat, George Ibrahim, Mostafa Awad, Abdelrahman Sadallah, Gurpreet Gosal, Gokulakrishnan Ramakrishnan, Sarath Chandran, Biswajit Mishra, Rituraj Joshi, Ahmed Frikha, Etienne Goffinet, Abhishek Maiti, Ali El Filali, Sarah AlBarri, Samujjwal Ghosh, Rahul Pal, Parvez Mullah, Awantika Shukla, Sajid siddiki, Samta Kamboj, Onkar Pandit, Sunil Kumar Sahu, AbdelRahman Elbadawy, Amr Mohamed, Ahmad Chamma, Evan Dufraisse, Abdelaziz Bounhar, Dani Bouch, Hadi Abdine, Guokan Shang, Fajri Koto, Yuxia Wang, Zhuohan Xie, Ali Mekky, Rania Elbadry, Sarfraz Ahmad, Momina Ahsan, Omar El Herraoui, Daniil Orel, Hasan Iqbal, Kareem Elzeky, Mervat Abassy, Kareem Elozeiri, Saadeldine Eletter, Farah Atif, Nurdaulet Mukhituly, Haonan Li, Xudong Han, Aaryamonvikram Singh, Zainul Abedien Ahmed Quraishi, Neha Sengupta, Larry Murray, Avraham Sheinin, Joel Hestness, Natalia Vassilieva, Hector Xuguang Ren, Zhengzhong Liu, Michalis Vazirgiannis, Preslav Nakov

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 Jais 2是MBZUAI等联合开发的以阿拉伯语为核心的开源大语言模型家族,含70B、8B参数变体,在阿拉伯语及文化相关基准上表现领先,已开源并部署为多平台聊天应用,可支撑相关研究开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00019 2026-08-04 cs.LG cs.AI 新提交 90%

Uncertainty-Aware Simulation-Based Inference for Operations Research with Large Language Models

面向运筹学的基于模拟的不确定性感知大语言模型推理

Liang Guo, Lin Shaochong, Shen Zuo-Jun Max, Zhang Kun

机构 * Institute of Statistics and Big Data, Renmin University of China(中国人民大学统计与大数据研究院) The University of Hong Kong(香港大学) School of Information, Renmin University of China(中国人民大学信息学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 本文针对大语言模型用于运筹学建模时的短视策略易引发下游错误的问题,提出一种不确定性感知无训练推理框架,通过短前瞻模拟与重要性重采样提升OR公式生成的可靠性,在多基准上表现优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18280 2026-07-22 cs.LG cs.AI 新提交 90%

Beyond Single-Dimensional Compression: The Compound Sparsity Frontier of Large Language Models

超越单维压缩:大语言模型的复合稀疏前沿

Chao Han, Haozhe Hu, Xiaoyu Shen

机构 * Ningbo Institute of Digital Twin, Eastern Institute of Technology(宁波数字孪生研究院,东方理工大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型压缩,提出复合稀疏框架,结合静态参数剪枝和动态令牌级计算,通过低秩近似、通道剪枝及引入轻量级路由器实现。实验表明其在相同总稀疏度下优于单机制压缩,揭示跨维度干扰及有效分配方式,为改进压缩提供实用途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16243 2026-07-21 cs.LG cs.AI 新提交 90%

RobustMAD: Evaluating Real-World Robustness of Multimodal Small Language Models for Deployable Anomaly Detection Assistants

RobustMAD:评估用于可部署异常检测助手的多模态小语言模型的现实世界鲁棒性

Anushiya Arunan, Xin Li, Yan Qin, U-Xuan Tan, Nhu Khue Vuong, Xiaoli Li, Chau Yuen

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局) Nanyang Technological University(南洋理工大学) Chongqing University(重庆大学)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对多模态小语言模型现场部署的鲁棒性评估问题,开发RobustMAD基准测试,通过多种开放式查询评估模型,发现最佳模型虽有潜力但仍存差距及三种失败模式,为下一代多模态工业检测助手设计提供指导。

Comments Accepted for publication in Transactions on Machine Learning Research (TMLR), 2026 at https://openreview.net/forum?id=skrA9UYNIZ

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13115 2026-07-16 cs.AI cs.LG 新提交 90%

Improving Molecular Property Prediction in Small Language Models Using Graph-based Tools

使用基于图的工具改进小语言模型中的分子性质预测

Konstantinos Bougiatiotis, Dimitrios Kelesis, Georgios Paliouras

机构 * Institute of Informatics and Telecommunications, National Center for Scientific Research “Demokritos(信息与电信研究所,国家科学研究中心“德谟克利特”)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 研究针对小语言模型在分子性质预测时的结构盲目性问题,提出模块化上下文增强提示框架,通过GNN专家模型和提取子图来辅助预测,在MUTAG和Tox21数据集上实验表明该方法能显著提升预测准确性,验证了基序相关性,但与专门GNN模型仍有差距。

Comments Presented at the 2nd Causal Neuro-symbolic Artificial Intelligence (Causal NeSy): Toward Agentic LLMs with Neuro-Symbolic and Graph Based Reasoning Workshop @ ESWC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08786 2026-07-13 cs.LG cs.AI cs.AR 新提交 90%

Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices

使用适度非结构化稀疏权重矩阵加速大语言模型的GPU推理

Tao Lu, Haoyu Wang, Zonghui Wang, Keshen Xiang, Jiaheng Zhang, Wenzhi Chen

机构 * National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型推理成本挑战,提出含稀疏张量核层等的三层矩阵存储格式,设计联合稀疏张量核与CUDA核的SpMM内核,实现了在现代GPU上超越密集矩阵乘法,取得显著加速。

Comments DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18063 2026-06-17 cs.CV cs.AI cs.LG 新提交 90%

When LLMs Analyze Scars: From Images to Clinically-Meaningful Features

当LLM分析疤痕:从图像到临床有意义的特征

Ruman Wang, Hangting Ye

机构 * Liaoning University of Traditional Chinese Medicine(辽宁中医药大学) School of Artificial Intelligence, Jilin University(吉林大学人工智能学院)

专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出ScaFE框架,利用LLM作为知识驱动的特征工程师,将高维图像转化为低维临床可解释特征,在数据稀缺的疤痕分类中优于端到端深度学习方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13868 2026-08-17 cs.AR 新提交 89%

Exploring High-Bandwidth Flash for Modern LLM Inference: Opportunities and Challenges

探索用于现代大语言模型推理的高带宽闪存:机遇与挑战

Dowon Son, Yonggon Park, Hyunuk Cho, Hyungkyu Ham, Onur Mutlu, Sungjin Lee, Gwangsun Kim, Jisung Park

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本研究分析高带宽闪存(HBF)用于大语言模型(LLM)推理的机遇与挑战,发现HBF可提升LLM服务系统性能并降低GPU需求,但需维持类HBM读取带宽并提升耐用性。

Comments 4 pages, 7 figures, IEEE Computer Architecture Letters (CAL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09089 2026-08-11 stat.AP 新提交 89%

Extreme Value Alpha and Crash Risk: Separating Structural Tails from Lottery Tails with LLM-Extracted Disclosure Networks

极值阿尔法与崩盘风险:通过LLM提取的披露网络区分结构性尾部与彩票式尾部

Lin Zhang, Fan Yang

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 该研究利用LLM从10-K文件提取的公司披露网络,将股票收益上尾分为崩盘侧与结构性尾部,通过24家科技公司试点验证了崩盘侧信号的有效性,明确了判别器的适用边界。

Comments 19 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09440 2026-08-11 cs.IR 新提交 89%

MetaStrategy: Generative Ranking with Executable LLM Strategies

MetaStrategy:基于可执行大语言模型策略的生成式排序

Chengyu Lai, Jiuning Lin, Zhibo Xiao, Xiaodong Zhu, Ruiquan Lan, Bin Zhang, Zihong Huang, Wendong Zhang, Chuxin Chen, Yinjiang Cai, Shuai Zhong, Lingqing Zhang, Dimin Wang, Jialin Zhu, Han Zhu

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 MetaStrategy是一种可执行LLM策略的生成式排序框架,经淘宝部署测试,其提升了多项核心业务指标且未增加响应时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09252 2026-08-11 cs.AR 新提交 89%

FSGen: Agile Fused and Sparse Accelerator Generator with Accurate Power Model for LLM Applications

FSGen:面向大语言模型应用的具备精确功耗模型的敏捷融合与稀疏加速器生成器

Jay Zhe-An Mok, Qijun Zhang, Zhiyao Xie

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 FSGen是面向LLM的敏捷加速器生成框架,支持融合算子数据流与稀疏性,其PPA评估器精度更高,能找到功耗效率提升1.4倍或加速比达10倍的帕累托最优设计,大幅缩短设计空间探索时间,品质因数提升58倍。

Comments Research Manuscript Published in Design Automation Conference (DAC) 63 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08611 2026-08-11 cs.DC cs.AR cs.CE 新提交 89%

C2C-Explorer: An Exploration Framework for Chip-to-Chip Interconnect Architectures in LLM Cloud Computing Systems

C2C-Explorer:用于大语言模型云计算系统中芯片间互连架构的探索框架

Jiayi Li, Di Wu, Qingxu Li, Hongxiao Zhao, Jiaqi Yang, Anjunyi Fan, Wenbin Zhang, Boqiang Wu, Shuting Liu, Shifeng Fang, Jianbo Dong, Dimin Niu, Bonan Yan

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 C2C-Explorer是一种自适应贝叶斯DSE框架,整合流量生成器、可扩展互连模拟器与评估器,用于探索LLM云计算系统的C2C互连架构,在DeepSeek-R1-671B负载中可提升有效吞吐量并降低内存占用。

Comments Accepted in DAC'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04991 2026-08-06 cs.DC 新提交 89%

RAC: Reference-Aware Activation Compression for Communication-Efficient Split LLM Inference

RAC:面向通信高效的分割式大语言模型推理的参考感知激活压缩

Guotao Yang, Mingxi Zhao, Haopeng Li, Zhengchao Wang, Sheng Chen, Yitao Hu, Keqiu Li

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对分割式LLM推理的通信瓶颈,提出参考感知激活压缩方法RAC,通过参考感知编解码器等技术降低通信开销,在多模型多链路对实验中验证了其时间性能提升与任务分数变化情况。

Comments 10 pages, 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04866 2026-08-06 cs.CV 新提交 89%

Persistent Object Narratives for Token-Efficient Video Language Models

用于令牌高效视频语言模型的持久对象叙事

Junzhe Chen, Siyuan Meng, Xiaojie Guo

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract)

AI总结 本文提出SlotNarrative,一种用于Video-LLM的紧凑结构化视觉接口,通过持久对象叙事减少视觉令牌数量,在多数据集上实现准确率与令牌数的良好权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03867 2026-08-05 cs.AR 新提交 89%

Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference

面向高效低比特大语言模型推理的异构感知微缩放技术

Junyi Luo, Xinting Jiang, Tai-Hao Wen, Ruichen Qi, Minxing Chu, Hongyi Wu, Gregory Kielian, Ben Laurie, Qirui Zhang, Quan Cheng, Dennis Sylvester, Mehdi Saligane

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究针对低比特LLM推理的MX格式精度损失问题,提出异构感知的AdaMX格式与加速器,在不增加EBW的前提下提升精度、降低存储能耗,在多类LLM及多模态模型上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02341 2026-08-04 cs.NI 新提交 89%

Broadcast Rate Limits in Wi-Fi: A Forgotten Bottleneck for Collaborative Edge LLM Inference

Wi-Fi中的广播速率限制:协作式边缘大语言模型(LLM)推理被遗忘的瓶颈

Liujianfu Wang, Yuyang Du, Shiqi Xu, Soung Chang Liew

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 该研究针对协作式边缘LLM推理的通信瓶颈,提出适配UDP广播的MoE推理方法,发现Wi-Fi广播速率限制的遗留问题并通过仿真验证,推动Wi-Fi标准将广播纳入高吞吐量数据平面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00378 2026-08-04 cs.SE 新提交 89%

CASPER-Change-Aware Slice Prioritization for Efficient Regression Testing of LLM-based systems

CASPER——面向基于大语言模型(LLM)系统高效回归测试的感知变更的切片优先级排序

Biruk Asmare Muse, Lionel Briand, Yiwei Lu, Keheliya Gallaba

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 针对基于LLM系统回归测试的独特挑战,提出CASPER框架,通过进化切片识别与基于执行日志行为信息的优先级排序,实现更优的回归切片处理效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01126 2026-08-04 cs.IT math.IT 新提交 89%

Spatial Prefix Caching for Wireless Edge LLM Inference: A Stochastic-Geometry and Queueing Framework

面向无线边缘大语言模型推理的空间前缀缓存:一种随机几何与排队框架

Le Yang, Zhouyong Liu

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文构建随机几何与排队框架,针对无线边缘LLM推理的空间通信-缓存-计算权衡优化,揭示延迟最优节点非最近节点、TTFT随缓存前缀深度非单调变化的规律。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29575 2026-08-03 cs.DC cs.PF 新提交 89%

SLIM: Saturation-Aware Lightweight Performance Modeling for LLM Serving

SLIM:面向大语言模型服务的饱和度感知轻量级性能建模

Pol G. Recasens, Ferran Agullo, Yue Zhu, Chen Wang, Jordi Torres, Josep Ll. Berral

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对LLM服务吞吐量饱和问题,通过GPU剖析明确其源于解码阶段注意力内核的DRAM带宽饱和,提出SLIM半分析性能模型及BCA工具,可高效预测吞吐量与延迟并优化批处理配置。

Comments Pol G. Recasens and Ferran Agullo contributed equally to the work

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28150 2026-07-31 cs.DC 新提交 89%

SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer

SmartGen:支持无缝拆分式大语言模型推理的选择性KV缓存传输方案

Xuchuan Luo, Jiacheng Shen, Xin Wang, Yangfan Zhou

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 SmartGen是一款KV缓存传输引擎,通过三种数据传输路径实现拆分式LLM推理的KV缓存选择性传输,可将首token生成时间最多缩短4.3倍,且后续性能与准确率相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27648 2026-07-31 cs.SE 新提交 89%

Not as Sweet by Another Name: An Empirical Study of Format Robustness in LLM Document Workflows

换个名字就不甜了:LLM文档工作流中格式鲁棒性的实证研究

Xiaoyu Zhang, Xianyun Cheng, Tianlin Li, Yuwei Zheng, Yue Yang, Yang Liu

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 本文提出感知格式的变形测试框架,经大规模实证研究发现LLM文档工作流的格式鲁棒性存在严重问题,切换格式可致准确率降53.63%,并设计出无需重训模型的缓解策略。

Comments 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27606 2026-07-31 cs.SE 新提交 89%

LimICE: Integrating LLM into ICE Framework for Efficient Loop Invariant Inference

LimICE:将大语言模型(LLM)集成到ICE框架以实现高效循环不变式推理

Kai Fan, ShiWen Yu, GuangSheng Fan, HaoAng Chi, WanWei Liu, Ji Wang

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 该研究提出集成LLM与ICE框架的增量式学习框架LimICE,用于循环不变式综合,在367个线性、50个非线性基准上的实验显示其解决实例更多、运行速度更快,性能优于相关基线。

Comments 21 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26633 2026-07-30 cs.AR 新提交 89%

NELSSA: A GPU-PNM Heterogeneous System for Mixed-Length LLM Serving via Length-based Request Placement

NELSSA:一种基于GPU-PNM异构系统的LLM混合长度服务框架,通过基于长度的请求放置实现

Sookyung Choi, Seungyong Lee, Kangkyu Park, Yunseo Chun, Junseok Lee, Hyeongseok Gwak, Myunghyun Rhee, Euiseok Kim, Donguk Moon, Kwangsik Shin, Guseul Heo, Youngpyo Joo, Hoshik Kim, Jongse Park

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 NELSSA是集成GPU与PNM加速器的LLM服务系统,通过基于长度的请求放置处理混合长度工作负载,解码吞吐量最高提升5.5倍,P99延迟最高降低15倍,为LLM基础设施提供新范式。

Comments 14 pages, 19 figures. Accepted to the 59th IEEE/ACM International Symposium on Microarchitecture (MICRO 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25498 2026-07-29 cs.AR 新提交 89%

Beyond Prefill-Decode Disaggregation: Dissecting LLM Inference for Heterogeneous Platforms via Dynamic Operator Scheduling

超越预填充-解码分解:通过动态算子调度剖析异构平台上的大语言模型推理

Jiaqi Yang, Jiayi Li, Yihan Fu, Hongxiao Zhao, Zhan Chen, Qiuping Wu, Yuchao Yang, Bonan Yan

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究针对异构平台上LLM推理,提出硬件感知的DOPS框架,通过构建阶段感知DAG,集成双焦点调度器和权重布局仲裁器,实现算子调度与权重布局联合优化,在异构系统中取得加速效果并支持相关分析。

Comments To appear in MICRO 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17175 2026-07-21 cs.DC 新提交 89%

LMEdge: QoS-Aware LLM Inference Orchestration on Edge Clusters

LMEdge:边缘集群上的QoS感知大语言模型推理编排

Reza Farahani, Zoha Azimi, Mario Colosi, Schahram Dustdar

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究在边缘集群上进行QoS感知的LLM推理编排问题,提出LMEdge服务。通过BILP优化并结合五个轻量级ML模型预测相关指标,设计轻量级启发式方法。在边缘测试平台评估,结果显示其降低延迟、保持准确性、提高资源利用率及服务比率。

Comments 12 pages, 5 figures, 2 tables, EUROPAR conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11810 2026-07-14 cs.HC 新提交 89%

Supporting Reflection in LLM-based Exploratory Search

支持基于大语言模型的探索性搜索中的反思

Giulia Di Fede, Salvatore Andolina

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究探索性搜索中LLMs的问题,提出TrailLM系统,通过与用户意义建构工作流程对齐,帮助用户重构和重温探索路径,在保留基于LLM搜索优势的同时,增加对搜索过程批判性反思机会。

详情

展开后加载摘要…

URL PDF HTML 收藏