arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-04 至 2026-08-04 共收录 147 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 147 篇

2603.13418 2026-08-04 cs.LG cs.AI 版本更新 94%

GPrune-LLM: Generalization-Aware Structured Pruning for Large Language Models

GPrune-LLM: 为大语言模型的通用性感知结构剪枝

Xiaoyun Liu, Divya Saxena, Jiannong Cao, Yuqing Zhao, Yiying Dong, Penghui Ruan

机构 * Department of Computing, The Hong Kong Polytechnic University, Hong Kong(香港理工大学计算机系) School of Artificial Intelligence and Data Science, IIT Jodhpur(IIT朱罗浦人工智能与数据科学学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出GPrune-LLM框架,通过识别神经元在不同分布下的行为差异,改进结构化剪枝方法,提升模型在分布外任务中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00922 2026-08-04 cs.DC 新提交 93%

From Cloud to Crowd: Democratizing LLM Service with Decentralized Edge Collaboration for RAG

从云端到人群:通过去中心化边缘协作实现面向检索增强生成(RAG)的大语言模型服务民主化

Jiaxing Li, Hengzhi Wang, Feng Wang, Chi Xu, Danyang Song, Ruixiao Zhang, Edith C. H. Ngai, Jiangchuan Liu

专题命中 效率与部署 :LLM(title,summary_cn);SLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 该研究提出DEFRAG系统,通过异构边缘设备的去中心化协作优化RAG的检索与生成,缩小SLM与LLM的准确率差距,大幅降低成本并提升吞吐量,助力边缘LLM服务民主化。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00481 2026-08-04 cs.AI 新提交 92%

F-WANDA: Fisher-Reweighted Post-Training Pruning for Sustainable Deployment of Large Language Models

F-WANDA:用于大语言模型可持续部署的Fisher重加权后训练剪枝方法

Himanshu Mishra

机构 * University of British Columbia(不列颠哥伦比亚大学)

专题命中 效率与部署 :language model(title,abstract);post-training(title,abstract);large language model(title);LLM(abstract,abstract_cn)

AI总结 F-WANDA是WANDA的改进后训练剪枝方法,通过Fisher重加权分配保留预算,在LLAMA-2-7B上实现更优MMLU指标且能耗仅为SPARSEGPT的1/3,处于性能与剪枝成本的帕累托前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15622 2026-08-04 cs.CV cs.LG 版本更新 92%

AdaDINO: Context-Adaptive DINO-Distilled Vision Foundation Models for Efficient Open-Vocabulary Edge Inference

AdaVFM:通过LLM引导执行实现边缘智能的自适应视觉基础模型

Yiwei Zhao, Yi Zheng, Huapeng Su, Jieyu Lin, Stefano Ambrogio, Cijo Jose, Michael Ramamonjisoa, Patrick Labatut, Barbara De Salvo, Chiao Liu, Phillip B. Gibbons, Ziyun Li

机构 * Carnegie Mellon University(卡内基梅隆大学) Meta

专题命中 效率与部署 :LLM(title_cn,summary_cn);foundation model(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出AdaVFM,一种通过LLM引导执行实现边缘设备上语言对齐视觉基础模型高效推理的自适应框架,通过动态调整计算实现性能与效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01655 2026-08-04 cs.DC 新提交 92%

PrefixPlace: Provable Prefix Key-Value Placement for Large Language Model Serving under Heterogeneous Compute and Transfer Costs

PrefixPlace:异构计算与传输成本下大语言模型服务的可证明前缀键值放置方案

Zhiyu Wang, Rajkumar Buyya

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 针对异构计算与传输成本下LLM前缀KV放置的次优问题,提出PrefixPlace规划器,其性能接近最优且效率高,可提升RAG等场景的成本节省效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02244 2026-08-04 cs.DC cs.SY eess.SY 新提交 91%

Efficiency and Cost Alignment in Batched LLM Serving via Resource-Fair Scheduling

通过资源公平调度实现批量大语言模型(LLM)服务的效率与成本对齐

Dayi Yao, Zijie Zhou

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文针对批量LLM服务中异构请求导致的资源分配低效问题,提出ISJL算法,实现高吞吐量的同时对齐最大驱动批次成本与token计量收入,达到3/4的竞争比下界,平衡了FCFS与LJF的优缺点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01250 2026-08-04 eess.SY cs.SY 新提交 91%

Smoothing the Ramp, Not the Peak: Scheduling-Induced Power Dynamics of LLM Inference and Their Grid-Scale Consequences

平滑斜坡而非峰值:LLM推理的调度诱导功率动态及其电网级后果

Pan Li, Yize Chen, Xia Miao, Dai Wang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 该研究揭示LLM分块预填充调度可降低功率斜坡速率,随系统饱和度提升效益增大,经转化为电网调节备用采购问题后,可减少电网快速斜坡备用容量,为运营商提供无成本需求侧塑形工具。

Comments 15 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00086 2026-08-04 cs.CV cs.AI cs.CL cs.LG 版本更新 91%

Hierarchical Pre-Training of Vision Encoders with Large Language Model

基于大语言模型的视觉编码器分层预训练

Eugene Lee, Ting-Yu Chang, Jui-Huang Tsai, Jiajie Diao, Chen-Yi Lee

机构 * University of Cincinnati(辛辛那提大学) National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出HIVE框架,通过引入视觉编码器与大语言模型间的分层交叉注意力机制,提升视觉语言对齐,改进特征融合与表征学习,实验表明其在图像分类和多模态任务中表现优异。

Comments 17 pages, 14 figures, accepted to Computer Vision and Pattern Recognition Conference (CVPR) Workshops 2026. 5th MMFM Workshop: What is Next in Multimodal Foundation Models?

Journal ref In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (pp. 7415-7424) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01460 2026-08-04 cs.LG 新提交 90%

Conformalized Large Language Models under Configuration Shift

配置偏移下的共形大语言模型

Yuqicheng Zhu, Jialin Yu, Lin Li, Gengyuan Zhang, Zhen Yang, Steffen Staab, Puneet Dokania, Philip Torr, Jie Tang, Evgeny Kharlamov

机构 * University of Stuttgart(斯图加特大学) Robert Bosch GmbH(罗伯特·博世有限公司) University of Oxford(牛津大学) LMU Munich(慕尼黑大学) Tsinghua University(清华大学) University of Southampton(南安普顿大学) University of Oslo(奥斯陆大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 该研究针对配置偏移对共形大语言模型有效性的影响展开系统分析,通过多维度实证研究揭示其削弱覆盖率的问题,提出两种实用缓解措施以恢复覆盖率并保留效率。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01975 2026-08-04 cs.SE cs.CL cs.LG cs.PF 新提交 90%

TELLER: Non-intrusive Cross-Layer Root-Cause Analysis for LLM Inference

TELLER:面向大语言模型推理的非侵入式跨层根因分析

Ruilin Xu, Junyi Li, Pengfei Chen, Zongxuan Xie

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 TELLER是面向LLM推理的非侵入式跨层根因分析框架,通过跟踪与日志结合实现异常定位与自然语言解释,在多节点GPU工作负载上兼具高效压缩与诊断性能,为LLM推理RCA提供实用支撑。

Comments 12 pages, 1 figure, 9 tables. Accepted to the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01651 2026-08-04 cs.DC cs.CL cs.LG 新提交 90%

Bole: Efficient Tree Speculation for Hybrid-Attention Language Models

Bole:面向混合注意力语言模型的高效树推测解码

Li Wang, Yi Su, Xiabao Wu, Chiran You, Yongchao Liu, Zhan Qiu, Juelu Zhang, Jiajun Zheng, Fangxin Liu, Jie Zhang, Chen Tian, Chengying Huan

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

AI总结 Bole是内核-运行时协同设计方案,通过优化树推测解码的线性注意力树验证与瞬态内存管理,显著提升混合注意力LLM的离线解码吞吐量与在线智能体工作负载的延迟性能。

Comments 14 pages, 12 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01536 2026-08-04 cs.AR cs.LG 新提交 90%

Celty: SpMspV GPU Kernel and SIMT Co-Design for Efficient Dual-Sparse LLM Inference

Celty:用于高效双稀疏大语言模型推理的SpMspV GPU内核与SIMT协同设计

Ruokai Yin, Priyadarshini Panda

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对双稀疏LLM推理中spMspV workload处理低效问题,提出协同设计的Celty稀疏格式、GPU内核与SIMT微架构,实现最高5.3倍加速。

Comments ICCAD 2026. Will update with the camera-ready version once ready. The code is available on Github at https://github.com/RuokaiYin/Celty

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00303 2026-08-04 cs.AI 新提交 90%

CrystalMem: Elastic Memory for Self-Evolving LLM Agents via Knowledge Crystallization

CrystalMem:基于知识结晶的自进化大语言模型智能体弹性内存

Beining Wu, Jun Huang

机构 * South Dakota State University(南达科他州立大学)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对LLM智能体的内存滞后问题,提出弹性内存组件CrystalMem,通过知识结晶策略恢复能力,在多环境实验中性能优于基准方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00026 2026-08-04 cs.AI cs.DC 新提交 90%

Request-Level Energy Attribution for Batched LLM Serving

批量大语言模型(LLM)服务的请求级能耗归因

Qi Luo, Kunlin Li, Ziwen Wang, Dongsheng Wang, Yun Chen

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 本研究提出JouleShare框架,通过计算Shapley能耗建立请求级基准,用JCalib校准模型提升批量LLM服务的请求级能耗归因精度,验证了token比例归因的偏差及JCalib的有效性。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21633 2026-08-04 cs.LG 版本更新 90%

HERALD: High-Throughput Block Diffusion LLM Serving via CPU-GPU Cooperative KV Cache Retrieval

HERALD: 通过CPU-GPU协同KV缓存检索实现高吞吐量块扩散LLM服务

Omin Kwon, Doyeon Kim, Jongseok Park, Seung Yul Lee, Ion Stoica, Jae W. Lee

机构 * Seoul National University(首尔国立大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 针对块扩散LLM中KV缓存随上下文增长导致吞吐量下降的问题,提出HERALD系统,利用块内去噪步骤间KV条目一致性,通过稀疏检索和计算重叠实现高精度低开销的KV卸载,在5-10%缓存预算下达到近无损精度,延迟降低1.59倍,吞吐量提升2.47倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07665 2026-08-04 cs.PL cs.AI 版本更新 90%

AgentCompile: An LLM-Guided Compiler for Direct CUDA Inference

AgentCompile:一种用于直接CUDA推理的LLM引导编译器

Xuanzhe Li, Ziyan Weng, Zhiyu Zhu, Junhui Hou

机构 * City University of Hong Kong (Dongguan)(香港城市大学(东莞)) City University of Hong Kong(香港城市大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 提出AgentCompile,利用LLM提供语义建议,通过模板生成CUDA候选实现并验证,在多个Transformer模型上实现4-5.7倍加速。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00019 2026-08-04 cs.LG cs.AI 新提交 90%

Uncertainty-Aware Simulation-Based Inference for Operations Research with Large Language Models

面向运筹学的基于模拟的不确定性感知大语言模型推理

Liang Guo, Lin Shaochong, Shen Zuo-Jun Max, Zhang Kun

机构 * Institute of Statistics and Big Data, Renmin University of China(中国人民大学统计与大数据研究院) The University of Hong Kong(香港大学) School of Information, Renmin University of China(中国人民大学信息学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 本文针对大语言模型用于运筹学建模时的短视策略易引发下游错误的问题,提出一种不确定性感知无训练推理框架,通过短前瞻模拟与重要性重采样提升OR公式生成的可靠性,在多基准上表现优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02341 2026-08-04 cs.NI 新提交 89%

Broadcast Rate Limits in Wi-Fi: A Forgotten Bottleneck for Collaborative Edge LLM Inference

Wi-Fi中的广播速率限制:协作式边缘大语言模型(LLM)推理被遗忘的瓶颈

Liujianfu Wang, Yuyang Du, Shiqi Xu, Soung Chang Liew

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 该研究针对协作式边缘LLM推理的通信瓶颈,提出适配UDP广播的MoE推理方法,发现Wi-Fi广播速率限制的遗留问题并通过仿真验证,推动Wi-Fi标准将广播纳入高吞吐量数据平面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00378 2026-08-04 cs.SE 新提交 89%

CASPER-Change-Aware Slice Prioritization for Efficient Regression Testing of LLM-based systems

CASPER——面向基于大语言模型(LLM)系统高效回归测试的感知变更的切片优先级排序

Biruk Asmare Muse, Lionel Briand, Yiwei Lu, Keheliya Gallaba

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 针对基于LLM系统回归测试的独特挑战,提出CASPER框架,通过进化切片识别与基于执行日志行为信息的优先级排序,实现更优的回归切片处理效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01126 2026-08-04 cs.IT math.IT 新提交 89%

Spatial Prefix Caching for Wireless Edge LLM Inference: A Stochastic-Geometry and Queueing Framework

面向无线边缘大语言模型推理的空间前缀缓存:一种随机几何与排队框架

Le Yang, Zhouyong Liu

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文构建随机几何与排队框架,针对无线边缘LLM推理的空间通信-缓存-计算权衡优化,揭示延迟最优节点非最近节点、TTFT随缓存前缀深度非单调变化的规律。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11083 2026-08-04 cs.LG cs.CR 版本更新 89%

Token-Efficient Change Detection in LLM APIs

LLM API中的令牌高效变化检测

Timothée Chauvin, Clément Lalanne, Erwan Le Merrer, Jean-Michel Loubes, François Taïani, Gilles Tredan

机构 * Université de Rennes, Inria, CNRS/IRISA(里昂大学、法国国家信息与自动化技术研究院、法国国家科学研究中心/IRISA) Equipe Regalia, Inria(Regalia团队、法国国家信息与自动化技术研究院) LAAS, CNRS(拉劳斯研究中心、法国国家科学研究中心) Univ Toulouse, INUC, UT2J, INSA Toulouse, TSE, CNRS, IMT(图卢兹大学、INUC、UT2J、图卢兹国家高等工业学院、TSE、法国国家科学研究中心、IMT)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 提出基于边界输入的黑盒变化检测方案B3IT,在仅观察输出令牌的条件下实现低成本、高性能的LLM变化检测。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07725 2026-08-04 cs.CL cs.AI 版本更新 88%

SOD: Step-wise On-policy Distillation for Small Language Model Agents

SOD:分步式在线蒸馏用于小型语言模型代理

Qiyong Zhong, Mao Zheng, Mingyang Song, Xin Lin, Jie Sun, Houcheng Jiang, Xiang Wang, Junfeng Fang

机构 * Zhejiang University(浙江大学) Large Language Model Department, Tencent(腾讯大语言模型部门) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对小型语言模型中工具集成推理的稳定性问题,提出SOD分步式在线蒸馏框架,通过动态调整蒸馏强度缓解教师信号误导,提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01985 2026-08-04 cs.CV 新提交 88%

DiffPrune: differentiable information throttling for token pruning in vision-language models

DiffPrune:用于视觉-语言模型中 token 剪枝的可微信息节流方法

Landi He, Mingde Yao, Shawn Young, Lijian Xu

机构 * Shenzhen University of Advanced Technology(深圳先进技术大学) CUHK MMLab, CPII under InnoHK(香港中文大学MMLab,InnoHK下属CPII)

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(title,abstract)

AI总结 DiffPrune 是一种用于视觉-语言模型的可微 token 剪枝方法,通过信息节流器避免松弛选择的不稳定性,在保留 96.5% 准确率的同时实现 2.85 倍 LLM 预填充加速,推理开销仅 0.69 毫秒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23193 2026-08-04 cs.CV 版本更新 88%

OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models

OmniScope:用于全模态大语言模型的模态解耦令牌压缩

Jinsen Su, Yongdong Luo, Yuexiao Ma, Yibo Hu, Meiguang Jin, Xiawu Zheng

机构 * Media Analytics and Computing Lab, Xiamen University(厦门大学媒体分析与计算实验室) Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能研究所) Alibaba Group(阿里巴巴集团)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 研究针对全模态大语言模型令牌压缩问题,提出无需训练的OmniScope框架,以查询为语义锚点分别估计音频和视频相关性,分配特定模态预算并采用相应策略处理,在多基准和模型规模上效果佳,实现加速和内存减少,提出跨模态推理设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05713 2026-08-04 cs.CL cs.AI cs.LG 版本更新 88%

Visualising Information Flow in Word Embeddings with Diffusion Tensor Imaging

用扩散张量成像可视化词嵌入中的信息流

Thomas Fabian

机构 * Technical University Darmstadt(达姆斯塔特技术大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出利用扩散张量成像技术可视化词嵌入中的信息流,揭示LLM中自然语言表达的信息流动机制,提升NLP模型的可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01891 2026-08-04 cs.DC cs.AI 新提交 87%

Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling

通过解耦注意力机制与前馈网络及灵活频率缩放实现高能效大语言模型服务

Cunchen Hu, Liangliang Xu, Tian Liu, Min Lyu, Yongkun Li, Sa Wang, Shuo Quan, Yanan Yang, Wenda Tang, Yiduo Wang, Fu Yu, Jie Wu

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AFlex框架通过全局调度器、局部DVFS控制器及交错A/F流水线,优化解耦A/F服务的资源配置与GPU频率,在满足SLO的同时将每token能耗降低最高49%

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00423 2026-08-04 cs.AI 新提交 87%

Diagnose Before You Compress: Prediction-Independent Bottleneck Witness Refinement for LLM Serving Traces

压缩前诊断:面向大语言模型服务轨迹的预测独立瓶颈见证优化

Liming Liu, Chao Hu, Mingfei Lu, Cong Tan, Yiwei Ge, Chijin Zhou, Yongjun Xie, Runzhe Wang, Xiaohai Shi, Heyuan Shi

机构 * Central South University(中南大学) University of Technology Sydney(悉尼科技大学) Chongqing Normal University(重庆师范大学) East China Normal University(华东师范大学) Alibaba Group(阿里巴巴集团)

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.AI

AI总结 针对LLM服务轨迹重放成本高及现有方法的局限,提出BPW框架,通过三阶段流程构建紧凑可靠的重放套件,在三个数据集上优于16种策略,获两项指标提升

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03618 2026-08-04 cs.AI 版本更新 87%

Cross-Lingual Token Arbitrage: Optimizing Code Agent Context Windows via Local LLM Preprocessing

跨语言令牌套利:通过本地LLM预处理优化代码智能体上下文窗口

Mehmet Utku Colak

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 提出一种预处理的边缘端提示重写中间件,利用本地Llama 3.2模型进行跨语言翻译和结构重写,在保持或提升任务准确率的同时减少34-47%的提示令牌和最高18.8%的总令牌消耗。

Comments Updated References

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24785 2026-08-04 cs.AR cs.AI cs.DC cs.PF 版本更新 87%

Cloud to Edge: Benchmarking LLM Inference On Hardware-Accelerated Single-Board Computers

云到边缘:在硬件加速的单板计算机上评估大语言模型推理

Harri Renney, Fouad Trad, Michael Mattarock, Jayden Evetts, Zena Wood

机构 * Kaze Technologies(凯兹技术) Kaze Consulting(凯兹咨询) Electrical and Computer Engineering(电气与计算机工程) Lebanese American University(黎巴嫩美国大学) Carnegie Mellon University(卡内基梅隆大学) University of Exeter(埃克塞特大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种多维评估方法,评估四种物联网适用的边缘平台配置,测试最新硬件加速器的单板计算机,揭示硬件加速器在隐私敏感和连接受限环境中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14581 2026-08-04 cs.LG cs.AI 版本更新 87%

CARE: Context-Aware Ranking Evolution with Executable Scoring Programs for Budgeted Reaction Optimization

CARE:通过科学实验中的可审计证据审查控制LLM生成的策略

Guanyu Liu, Weiyi Kong, Chao Tang, Zeyu Wang, Boer Zhang, Baiqing Li, Peiyu Zhang, Tianyu Shi

机构 * University of Macau(澳门大学) University of Toronto(多伦多大学) UCLA(加州大学洛杉矶分校) Harvard University(哈佛大学) XtalPi(晶泰科技) McGill University(麦吉尔大学)

专题命中 效率与部署 :LLM(title_cn,summary_cn);分类 cs.AI、cs.LG

AI总结 提出CARE框架,通过可审计的干预门控机制,在保留非LLM优化器作为默认路径的同时,利用LLM修正挑战者排序策略,显著提升高通量实验优化性能。

Comments 27 pages, 5 figures. Code: https://github.com/SHITIANYU-hue/care

详情

展开后加载摘要…

URL PDF HTML 收藏