arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1009 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 1009 篇

2605.01143 2026-07-14 cs.AI 版本更新 92%

A Low-Latency Fraud Detection Layer for Detecting Adversarial Interaction Patterns in LLM-Powered Agents

面向LLM代理的低延迟欺诈检测层:用于检测对抗性交互模式

Sheldon Yu, Yingcheng Sun, Hanqing Guo, Qianqian Tong

机构 * University of California, San Diego(加州大学圣地亚哥分校) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种低延迟欺诈检测机制,通过交互轨迹的结构化运行时特征检测对抗性交互模式,采用轻量模型实现实时部署,实验表明交互层面行为检测应成为LLM代理部署时的核心防护措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17267 2026-07-13 cs.AI stat.AP 版本更新 92%

Rectification Difficulty and Optimal Sample Allocation in LLM-Augmented Surveys

LLM增强调查中的校正难度与最优样本分配

Zikun Ye, Hema Yoganarasimhan

机构 * Michael G. Foster School of Business, University of Washington(华盛顿大学Michael G. Foster商学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究在LLM预测可用时如何分配人类样本以提高估计效率,提出校正难度分析、最优分配规则及元学习方法,通过实验证明其在不同领域和LLM上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29251 2026-07-09 cs.AI q-fin.CP 版本更新 92%

When Summaries Distort Decisions: Information Fidelity in LLM-Compressed Financial Analysis

当摘要扭曲决策:LLM压缩财务分析中的信息保真度

Hoyoung Lee, Suhwan Park, Seunghan Lee, Jun Seo, Jaehoon Lee, Sungdong Yoo, Minjae Kim, CheolWon Na, Zhangyang Wang, Zach Golkhou, Minkyu Kim, Sotirios Sabanis, Alejandro Lopez-Lira, Dhagash Mehta, Soonyoung Lee, Chanyeol Choi, Wonbin Ahn, Yongjae Lee

机构 * UNIST(全纳科学技术大学) LG AI Research(LG人工智能研究) Sungkyunkwan University(成均馆大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) J.P. Morgan Chase(摩根大通) State Street(州立银行) University of Edinburgh(爱丁堡大学) University of Florida(佛罗里达大学) BlackRock(黑石) LinqAlpha

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究LLM压缩财务信息时因丢失决策相关上下文导致投资判断改变的问题,提出通过生成多个候选压缩并审计分歧的代理上下文压缩方法。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11021 2026-07-08 cs.LG 版本更新 92%

Leech Lattice Vector Quantization for Efficient LLM Compression

Leech晶格向量量化用于高效的LLM压缩

Tycho F. A. van der Ouderaa, Mart van Baalen, Paul Whatmough, Markus Nagel

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出Leech晶格向量量化方法,通过高维晶格结构实现高效LLM压缩,优于现有量化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09046 2026-07-03 cs.CR cs.LG cs.OS 版本更新 92%

FlexServe: A Fast and Secure LLM Serving System for Mobile Devices with Flexible Resource Isolation

FlexServe: 一种适用于移动设备的高效且安全的LLM服务系统,具有灵活的资源隔离

Yinpeng Wu, Yitong Chen, Lixiang Wang, Jinyu Gu, Zhichao Hua, Yubin Xia

机构 * Institute of Parallel and Distributed Systems(并行与分布式系统研究所)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出FlexServe,一种适用于移动设备的高效且安全的LLM服务系统,通过灵活的资源隔离机制提升推理速度和安全性,采用多模型调度器优化多模型工作流,实验显示在TTFT和多模型工作流中均取得显著加速效果。

Comments 13 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10540 2026-07-02 cs.LG 版本更新 92%

FusionFactory: Fusing LLM Capabilities with Multi-LLM Log Data

FusionFactory: 融合多LLM日志数据中的大语言模型能力

Tao Feng, Haozhen Zhang, Zijie Lei, Pengrui Han, Mostofa Patwary, Mohammad Shoeybi, Bryan Catanzaro, Jiaxuan You

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Nanyang Technological University(南洋理工大学) Meta Monetization AI(Meta 变现人工智能) NVIDIA(英伟达)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出FusionFactory框架,通过查询级、思维级和模型级融合策略,利用多LLM日志数据提升模型性能,在14个基准测试中均优于最佳单模型。

Journal ref TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08187 2026-07-01 cs.AI 版本更新 92%

Improving LLM Reasoning with Homophily-aware Structural and Semantic Text-Attributed Graph Compression

利用同质性感知的结构和语义文本属性图压缩提升LLM推理能力

Zijun Di, Bin Lu, Huquan Kang, Luoyi Fu, Jiaxin Ding, Xiaoying Gan, Lei Zhou, Xinbing Wang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出HS2C框架,通过结构熵最小化进行全局层次划分以识别同质社区,并利用检测到的结构同质性指导LLM进行差异化语义聚合,在10个节点级和7个图级基准上同时提升压缩率和推理精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17188 2026-07-01 cs.NI cs.AI cs.CR 版本更新 92%

LLM-Aided Joint Secrecy Precoding and Trajectory for RSMA-Based Heterogeneous UAV Networks

基于RSMA的异构无人机网络中LLM辅助的联合保密预编码与轨迹设计

Lijie Zheng, Ji He, Shih Yu Chang, Yulong Shen

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Department of Applied Data Science, San Jose State University(圣何塞州立大学应用数据科学系)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对RSMA异构无人机网络中的安全通信问题,提出分层优化框架:内层用SDR-S2DC算法求解固定位置下的保密预编码,外层用LLM引导的多智能体强化学习优化轨迹,实现保密速率与能效的权衡。

Comments Submitted to IEEE Transactions on Mobile Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23132 2026-06-25 cs.CR cs.AI 版本更新 92%

Verifiable Manifest Signing and Transparency Enforcement for Secure MCP-Based LLM Pipelines

可验证的清单签名与透明度强制:面向基于MCP的安全LLM流水线

Saeid Jamshidi, Kawser Wazed Nafi, Arghavan Moradi Dakhel, Foutse Khomh, Mohammad Hamdaqa

机构 * SWAT Laboratory, Polytechnique Montréal(SWAT实验室,蒙特利尔理工学院) SæT Laboratory, Polytechnique Montréal(SæT实验室,蒙特利尔理工学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对MCP协议缺乏工具清单认证的问题,提出清单级强制层,通过策略验证、新鲜度检查、数字签名、执行前验证和Merkle透明度日志,实现低开销、可追溯的LLM工具调用安全控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26557 2026-06-18 cs.CL 版本更新 92%

MemBoost: A Memory-Boosted Framework for Cost-Aware LLM Inference

MemBoost:一种面向成本感知的LLM推理的内存增强框架

Joris Köster, Zixuan Liu, Siavash Khajavi, Zizhan Zheng

机构 * University of Cambridge(剑桥大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出MemBoost框架,通过轻量模型重用历史答案和检索支持信息,并选择性将困难查询路由到强模型,以降低LLM推理成本,同时保持回答质量。

Comments ICML MemFM 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02721 2026-06-17 cs.SE cs.AI cs.PL 版本更新 92%

Blueprint First, Model Second: A Framework for Deterministic LLM Workflow

蓝图优先,模型其次:确定性LLM工作流框架

Libin Qiu, Yuhang Ye, Zhirong Gao, Xide Zou, Junfu Chen, Ziming Gui, Weizhi Huang, Xiaobo Xue, Wenkai Qiu, Kun Zhao

机构 * Alibaba(阿里巴巴)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出“蓝图优先,模型其次”框架,通过将工作流逻辑解耦为源代码蓝图并由确定性引擎执行,LLM仅处理子任务,在TravelPlanner上最终通过率提升97.6%,约束违反减少96.0%。

Comments 12 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04945 2026-06-09 cs.LG 版本更新 92%

STaR-Quant: State-Time Consistent Post-Training Quantization for Diffusion Large Language Models

STaR-Quant:扩散大语言模型的状态-时间一致训练后量化

Xin Yan, Aqiang Wang, Zhenglin Wan, Xingrui Yu, Ivor Tsang

机构 * School of Artificial Intelligence, Beijing Normal University, Beijing, China(北京师范大学人工智能学院) Department of Computer Science, National University of Singapore, Singapore(新加坡国立大学计算机科学系) Centre for Frontier AI Research, Agency for Science, Technology and Research (A*STAR), Singapore(科技研究局前沿人工智能研究中心)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);分类 cs.LG

AI总结 针对扩散大语言模型低比特量化中的状态相关激活差异和时间误差累积问题,提出STaR-Quant框架,通过状态引导激活变换和时间注意力补偿实现高效量化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30836 2026-06-09 cs.LG math.DG 版本更新 92%

Cross-Layer Subspace Coupling for LLM Compression: A Unifying Framework and Its Empirical Limits

跨层子空间耦合用于LLM压缩:一个统一框架及其经验极限

Snigdha Chandan Khilar

机构 * Independent Researcher(独立研究者)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一个统一框架将SVD LLM和Basis Sharing等基于SVD的压缩方法纳入同一优化问题,但实验发现跨层耦合在实用任务中失败,原因是残差流在正向传播中解耦了相邻层,因此逐层优化优于联合优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24189 2026-06-09 cs.CL 版本更新 92%

SPECTRA: Revealing the Full Spectrum of User Preferences via Distributional LLM Inference

SPECTRA:通过分布化LLM推理揭示用户偏好的全频谱

Luyang Zhang, Jialu Wang, Shichao Zhu, Beibei Li, Zhongcun Wang, Guangmou Pan, Yang Song

机构 * Carnegie Mellon University(卡内基梅隆大学) TikTok Inc.(TikTok公司)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出SPECTRA方法,将微调后的LLM视为隐式概率模型,通过探测softmax层推断用户偏好的概率分布,有效恢复长尾偏好并提升公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07472 2026-06-08 cs.LG cs.NI 版本更新 92%

Scalable Joint Resource Allocation for SLO-Constrained LLM Inference in Heterogeneous GPU Clouds

异构GPU云中SLO约束的LLM推理的可扩展联合资源分配

Jiaming Cheng, Duong Tung Nguyen

机构 * Ira A. Fulton Schools of Engineering, Arizona State University(亚利桑那州立大学工程学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对异构GPU云中LLM推理的SLO约束,提出可扩展框架,通过约束感知启发式算法(GH和AGH)实现联合资源分配,在秒级内生成可行解并接近最优,显著降低成本和SLO违规。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29395 2026-08-14 cs.CV 版本更新 91%

NaLA: A 3D Native LLM Layout Agent for High-quality 3D Scene Generation

NaLA: 一种用于高质量3D场景生成的原生3D LLM布局代理

Cheng Wan, Yongsen Mao, Wenzheng Wu, Yuxuan Xie, Chucheng Xiang, Runze Wang, Xiang Zhang, Zhongyuan Liu, Rushi Dai, Yuan Liu

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出NaLA,一种原生3D LLM布局代理,通过直接编码3D边界和资产到LLM中,采用粗到细预测机制,解决文本-3D模态差距导致的布局不合理问题,在生成质量和推理效率上优于现有方法。

Comments Accepted to ECCV 2026. Project page: https://adamcwan.github.io/NaLA/. Code: https://github.com/adamcwan/NaLA-code

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05639 2026-08-13 cs.AR 版本更新 91%

TokenStack: A Heterogeneous HBM-PIM Architecture and Runtime for Efficient LLM Inference

TokenStack:一种异构HBM-PIM架构和运行时,用于高效的LLM推理

Zhuoran Li, Zhuohang Bian, Zihao Huang, Yibo Zhao, Xueqi Li, Guangyu Sun, Youwei Zhuo

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 TokenStack通过异构HBM-PIM架构优化KV缓存,提升LLM推理效率,实现1.62倍吞吐量和1.70倍服务能力提升,同时降低能耗30-47%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09321 2026-08-13 cs.CR 版本更新 91%

SpatialJB: How Text Distribution Art Becomes the "Jailbreak Key" for LLM Guardrails

SpatialJB: 文本分布艺术如何成为LLM防护机制的'突破密钥'

Zhiyi Mou, Jingyuan Yang, Zeheng Qian, Wangze Ni, Tianfang Xiao, Ning Liu, Chen Zhang, Zhan Qin, Kui Ren

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 SpatialJB通过破坏LLM输出生成过程,利用空间结构扰动突破现有防护机制,实验显示其高效性,同时提出基础防御策略以应对此类攻击。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02329 2026-08-12 cs.DC 版本更新 91%

Taming Request Imbalance: SLO-Aware Scheduling for Disaggregated LLM Inference

驯服请求不平衡:面向解聚LLM推理的SLO感知调度

Qipeng Wang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对解聚LLM推理中请求长度长尾分布导致的预填阶段队头阻塞和解码阶段拖尾者利用率低的问题,提出SLO感知调度系统Kairos,通过预填侧的紧迫性优先级调度和解码侧的松弛引导自适应批处理,显著提升SLO达成率和吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09695 2026-07-30 cs.SE 版本更新 91%

How well LLM-based test generation techniques perform with newer LLM versions?

基于新版本LLM的测试生成技术表现如何?

Michael Konstantinou, Renzo Degiovanni, Mike Papadakis

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文研究了基于新版本LLM的测试生成技术表现,发现纯LLM方法在覆盖率和变异评分上优于现有方法,且成本相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14516 2026-07-22 cs.DC 版本更新 91%

Efficient Multi-round LLM Inference over Disaggregated Serving

高效多轮LLM推理的解耦服务

Wenhao He, Youhe Jiang, Penghao Zhao, Quanqing Xu, Eiko Yoneki, Bin Cui, Fangcheng Fu

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 AMPD通过自适应协调预填充和解码工作负载,提升多轮LLM推理的服务级别目标达成率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12198 2026-07-16 cs.IR 版本更新 91%

LLM-Based User Personas for Recommendations at Scale

基于LLM的用户画像用于大规模推荐

Haoting Wang, Haokai Lu, Zheyun Feng, Jenny Huang, Yifat Amir, Gregory Hinkson, Ben Most, Zelong Zhao, Yixin Kelly Cui, Rein Zhang, Fabio Soldo, Yu Xia, Nihar Bhupalam, Minmin Chen, Konstantina Christakopoulou, Lichan Hong, Ed H. Chi

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出实时生成LLM用户兴趣画像的框架,通过知识蒸馏、异步推理和语义聚类优化,平衡利用-探索权衡,提升大规模视频推荐效果。

Comments Accepted by 2026 RecSys Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06093 2026-06-16 cs.AR 版本更新 91%

Compass: Co-Exploration of Mapping and Hardware for Heterogeneous Multi-Chiplet Accelerators Targeting LLM Inference Service Workloads

Compass:面向LLM推理服务工作负载的异构多芯粒加速器映射与硬件协同探索

Boyu Li, Zongwei Zhu, Qianyue Cao, Xi Li, Xuehai Zhou

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对LLM推理服务的动态请求类型和可变序列长度,提出Compass框架,通过基于计算执行图的映射编码方案和协同优化引擎,在异构多芯粒加速器上实现延迟降低63.92%、能耗降低40.32%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12928 2026-06-15 cs.DC 版本更新 91%

ProServe: Unified Multi-Priority Request Scheduling for LLM Serving

ProServe: 面向LLM服务的统一多优先级请求调度

Weizhe Huang, Tao Peng, Tongxuan Liu, Donghe Jin, Kang Meng, Xianzhe Dong, Ke Zhang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对LLM服务中多优先级请求的SLO保障问题,提出ProServe框架,通过引擎层滑动批处理和块管理优化及服务层增益导向调度,最大化服务增益。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05727 2026-06-11 cs.DC 版本更新 91%

LLM-Enhanced Deep Reinforcement Learning for Task Offloading in Collaborative Edge Computing

LLM增强的深度强化学习用于协作边缘计算中的任务卸载

Hao Guo, Kaixiang Xu, Ziwu Ge, Lei Yang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出LeDRL框架,结合轻量级LLM与自注意力增强DRL,通过结构化提示和语义反馈实现实时任务卸载,在成功率、收敛速度和实时性上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22124 2026-08-14 cs.CL cs.DC 版本更新 91%

Toward Federated Large Language Models in Medicine: A Parameter-Efficient Framework for Privacy-Preserving, Multi-Institutional Adaptation

一种联邦学习和参数高效的大型语言模型在医学中的训练框架

Anran Li, Yuanyuan Chen, Wenjun Long, Yu Yin, Yan Hu, Hyunjae Kim, Weipeng Zhou, Yujia Zhou, Hongyi Peng, Yang Ren, Xuguang Ai, Zhenyue Qin, Ming Hu, Xiaoxiao Li, Han Yu, Yih-Chung Tham, Lucila Ohno-Machado, Hua Xu, Qingyu Chen

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文提出Fed-MedLoRA框架,通过低秩适配器参数实现医学LLM的联邦学习,提升跨机构异质性下的模型收敛性和泛化能力。

Comments 41 pages, 11 tables, 3 figures; Just accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17231 2026-06-09 cs.CL cs.CR 版本更新 91%

Efficient and Stealthy Jailbreak Attacks via Adversarial Prompt Distillation from LLMs to SLMs

通过从大语言模型到小语言模型的对抗性提示蒸馏实现高效且隐蔽的越狱攻击

Xiang Li, Chong Zhang, Jia Wang, Fangyu Wu, Yushi Li, Xiaobo Jin

机构 * Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) The Chinese University of Hong Kong(香港中文大学) University of Liverpool(利物浦大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);SLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出对抗性提示蒸馏(APD)框架,将LLM的越狱能力迁移到SLM,实现高效低资源攻击,在GPT-4上达到96.4%攻击成功率,速度提升3.7倍,参数减少11.3倍。

Comments 24 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00086 2026-08-04 cs.CV cs.AI cs.CL cs.LG 版本更新 91%

Hierarchical Pre-Training of Vision Encoders with Large Language Model

基于大语言模型的视觉编码器分层预训练

Eugene Lee, Ting-Yu Chang, Jui-Huang Tsai, Jiajie Diao, Chen-Yi Lee

机构 * University of Cincinnati(辛辛那提大学) National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出HIVE框架,通过引入视觉编码器与大语言模型间的分层交叉注意力机制,提升视觉语言对齐,改进特征融合与表征学习,实验表明其在图像分类和多模态任务中表现优异。

Comments 17 pages, 14 figures, accepted to Computer Vision and Pattern Recognition Conference (CVPR) Workshops 2026. 5th MMFM Workshop: What is Next in Multimodal Foundation Models?

Journal ref In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (pp. 7415-7424) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21312 2026-06-16 cs.DC cs.AI cs.LG 版本更新 91%

Frontier: Towards Comprehensive and Accurate LLM Inference Simulation

Frontier: 向全面且准确的LLM推理模拟迈进

Yicheng Feng, Xin Tan, Yangtao Deng, Yimin Jiang, Yibo Zhu, Hong Xu

机构 * The Chinese University of Hong Kong(香港中文大学) Anuttacon StepFun

专题命中 效率与部署 :LLM(title,title_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Frontier,一种用于现代LLM推理服务的离散事件模拟器,通过离散化抽象和对关键运行时优化的建模,实现了对复杂工作负载的准确预测,从而在不同服务场景中提供更精确的计算、通信和内存成本预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17255 2026-06-15 cs.LG cs.AI 版本更新 91%

UltraSketchLLM: Sub-1-Bit LLM Compression via Sketch and Hardware-Friendly Operators

UltraSketchLLM:基于草图与硬件友好算子的低于1比特LLM压缩

Sunan Zou, Xueting Sun, Ziyun Zhang, Guojie Luo

机构 * National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(国家多媒体信息处理重点实验室,计算机科学学院,北京大学) School of Electronic Engineering and Computer Science, Peking University(电子工程与计算机科学学院,北京大学) Center for Energy-efficient Computing and Applications, Peking University(能效计算与应用中心,北京大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出UltraSketchLLM,利用数据草图将LLM权重压缩至0.5比特,结合硬件友好实现,在保持可接受性能下降的同时实现14.9倍加速。

Comments Accepted by the 63rd ACM/IEEE The Chips to Systems Conference (DAC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏