arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22188 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22188 篇

2605.10977 2026-05-26 cs.CR cs.AI 90%

PASA: A Principled Embedding-Space Watermarking Approach for LLM-Generated Text under Semantic-Invariant Attacks

PASA:一种针对语义不变攻击的LLM生成文本的原则性嵌入空间水印方法

Zhenxin Ai, Haiyun He

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出PASA水印算法,在潜在嵌入空间的语义簇上嵌入和检测水印,通过理论框架实现检测精度、鲁棒性和失真的基本权衡,在强释义攻击下仍保持鲁棒性和文本质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03955 2026-05-26 cs.AI cs.MA 90%

AgentArk: Distilling Multi-Agent Intelligence into a Single LLM Agent

AgentArk:将多智能体智能蒸馏到单个LLM智能体中

Yinyi Luo, Yiqiao Jin, Weichen Yu, Mengqi Zhang, Srijan Kumar, Xiaoxiao Li, Weijie Xu, Xin Chen, Jindong Wang

机构 * Carnegie Mellon University(卡内基梅隆大学) William & Mary(威廉与玛丽学院) Georgia Institute of Technology(佐治亚理工学院) Amazon(亚马逊) University of British Columbia(不列颠哥伦比亚大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出AgentArk框架,通过三种分层蒸馏策略将多智能体系统的交互动态蒸馏到单个模型权重中,使单个智能体具备多智能体的推理和自校正能力,同时保持计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11215 2026-05-25 cs.DC cs.AI 90%

ReCoVer: Resilient LLM Pre-Training System via Fault-Tolerant Collective and Versatile Workload

ReCoVer: 通过容错集合和多功能工作负载实现的弹性LLM预训练系统

Ziyue Liu, Zhengyang Wang, Ruijie Zhang, Avinash Maurya, Hui Zhou, Paul Hovland, Sheng Di, Franck Cappello, Bogdan Nicolae, Zheng Zhang

机构 * University of California at Santa Barbara(加州大学圣芭芭拉分校) Argonne National Laboratory(阿贡国家实验室)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出ReCoVer系统,通过保持每次迭代微批次数恒定、容错集合通信、步内细粒度恢复和动态工作负载重分配,实现并行方案无关的弹性LLM预训练,在512 GPU上即使丢失256 GPU也能保持训练轨迹,有效吞吐量比检查点重启基线高2.23倍。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22897 2026-05-25 cs.LG 90%

From Residuals to Reasons: LLM-Guided Mechanism Inference from Tabular Data

从残差到原因:基于LLM的表格数据机制推断

Mohammad R. Rezaei, Rahul G. Krishnan

机构 * Department of Computer Science(计算机科学系) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 提出多智能体残差上下文学习框架(MARICL),通过让LLM分析基础模型残差并迭代生成修正项,在多个科学基准上提升预测性能并实现机制泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07985 2026-05-22 cs.DC cs.AI 90%

Dooly: Configuration-Agnostic, Redundancy-Aware Profiling for LLM Inference Simulation

Dooly: 一种配置无关、冗余感知的LLM推理模拟器

Joon Ha Kim, Geon-Woo Kim, Anoop Rachakonda, Daehyeok Kim

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出Dooly,一种能够忽略配置差异并高效处理冗余的LLM推理模拟器,通过单次推理过程和智能标签传播减少冗余 profiling 耗时,提升模拟精度和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21405 2026-05-21 cs.SE cs.AI cs.PL 90%

Stdlib or Third-Party? Empirical Performance and Correctness of LLM-Assisted Zero-Dependency Python Libraries

标准库还是第三方?LLM辅助零依赖Python库的实证性能和正确性

Peng Ding, Rick Stevens

机构 * University of Chicago(芝加哥大学) Argonne National Laboratory(阿贡国家实验室)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 本文通过零依赖项目探讨了仅使用Python标准库能否替代第三方库,并评估了LLM在严格约束下生成正确且高性能代码的能力。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21082 2026-05-21 cs.AI 90%

AutoRPA: Efficient GUI Automation through LLM-Driven Code Synthesis from Interactions

AutoRPA: 通过基于LLM的代码合成实现高效的GUI自动化

Minghao Chen, Xinyi Hu, Zhou Yu, Yufei Yin

机构 * Zhejiang Key Laboratory of Space Information Sensing and Transmission(浙江空间信息感知与传输重点实验室) School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机科学学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出AutoRPA框架,通过将ReAct风格代理的决策逻辑自动转化为鲁棒的RPA功能,提高GUI自动化效率和可重用性,同时减少82%到96%的token使用量。

Comments Accepted in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19537 2026-05-21 cs.LG 90%

The Silent Hyperparameter: Quantifying the Impact of Inference Backends on LLM Reproducibility

沉默的超参数:量化推理后端对LLM可重复性的影响

David Pape, Jonathan Evertz, Lea Schönherr

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全研究中心)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 本文研究了推理后端对LLM基准测试结果的影响,发现不同后端可能导致基准分数变化达16.6个百分点,并引发高比例的输出分歧,强调了推理后端作为关键超参数的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18672 2026-05-19 cs.AI 90%

Position: A Three-Layer Probabilistic Assume-Guarantee Architecture Is Structurally Required for Safe LLM Agent Deployment

位置:一种三层概率性假设-保证架构在安全LLM代理部署中是结构上必需的

S. Bensalem, Y. Dong, M. Franzle, X. Huang, J. Kroger, D. Nickovic, A. Nouri, R. Roy, C. Wu

机构 * CSX-AI University of Liverpool(利物浦大学) Carl von Ossietzky Universität Oldenburg(奥尔登堡卡尔·冯·奥西特齐克大学) Austrian Institute of Technology(奥地利技术研究院) Université Grenoble Alpes(格勒诺布尔阿尔卑斯大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出,单层抽象层内强制LLM代理安全并非仅仅是次优,而是结构性上不足以满足部署的LLM代理需求。安全操作的三个维度——语义意图和政策合规性、环境有效性以及动态可行性——各自依赖于在执行不同阶段才变得可用的信息集。没有单一的防护措施可以保证这三个维度。我们主张社区必须采用基于合同的架构,其中每个安全维度由独立认证的层强制执行,其概率保证满足下一层的假设。我们勾勒了这样的架构,并通过概率链规则推导出其允许的系统级安全界限。三个开放性问题阻碍着这一标准的实现:从非独立同分布轨迹中估计界限、在部署漂移下合同的渐进退化,以及向多代理设置的扩展——LLM代理运行时保证中最关键的未完成任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16474 2026-05-19 cs.IR cs.AI 90%

LERA: LLM-Enhanced RAG for Ad Auction in Generative Chatbots

LERA:基于大语言模型的生成聊天机器人广告拍卖

Haoran Sun, Xinrui Song, Xinyu Zhang, Zhaohua Chen, Xu Chu, Zhilin Zhang, Chuan Yu, Jian Xu, Bo Zheng, Xiaotie Deng

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团) Shandong University(山东大学)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 LERA提出一种两阶段检索生成拍卖框架,通过嵌入粗过滤和LLM提示生成优化广告相关性评分,提升广告选择准确性和多样性。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16191 2026-05-18 cs.CL cond-mat.other physics.comp-ph 90%

Optimized Three-Dimensional Photovoltaic Structures with LLM guided Tree Search

优化的三维光伏结构与LLM引导的树搜索

Michael P. Brenner, Lizzie Dorfman, John C. Platt

机构 * Google Research School of Engineering and Applied Sciences, Harvard University(谷歌研究工程与应用科学学院,哈佛大学) Google Research(谷歌研究)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL

AI总结 本文利用AI编码系统生成新型科学假设,通过LLM驱动的树搜索算法优化三维光伏结构,解决中纬度地区传统光伏板的效率瓶颈问题。

Comments 10 pages 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14249 2026-05-15 cs.LG 90%

EnergyLens: Predictive Energy-Aware Exploration for Multi-GPU LLM Inference Optimization

EnergyLens: 多GPU LLM推理优化中的预测能效探索

Zhiye Song, Kyungmi Lee, Eun Kyung Lee, Xin Zhang, Tamar Eilam, Anantha P. Chandrakasan

机构 * Massachusetts Institute of Technology(麻省理工学院) IBM Research(IBM研究院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 EnergyLens通过einsum接口和MoE建模优化多GPULLM推理能耗,实现9.25%-13.19%的能耗预测精度,揭示配置间能效差异并推动分布式服务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16964 2026-05-15 cs.MA cs.AI cs.DC 90%

Optimizing PyTorch Inference with LLM-Based Multi-Agent Systems

通过基于LLM的多智能体系统优化PyTorch推理

Kirill Nagaitsev, Luka Grbcic, Samuel Williams, Costin Iancu

机构 * NVIDIA Corporation(NVIDIA公司) Microsoft Corporation(微软公司) Ansel et al. ( 2024 )(Ansel等人(2024)) Sabne ( 2020 )(Sabne(2020)) Kerr et al. ( 2017 )(Kerr等人(2017)) Tillet et al. ( 2019 )(Tillet等人(2019)) Spector et al. ( 2024 )(Spector等人(2024)) Ouyang et al. ( 2025 )(Ouyang等人(2025)) Lange et al. ( 2025a(Lange等人(2025a;b)) b )(Li等人(2025)) Li et al. ( 2025 )(METR(2025)) METR ( 2025 )(Andrews和Witteveen(2025)) Andrews and Witteveen ( 2025 )(Baronio等人(2025)) Baronio et al. ( 2025 )(Novikov等人(2025)) Novikov et al. ( 2025 )(Wei等人(2025)) Wei et al. ( 2025 )(Sharma(2025)) Sharma ( 2025 )

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出基于LLM的多智能体系统用于优化PyTorch推理,发现exploit策略与error-fixing智能体结合效果最佳,实现2.88倍速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13624 2026-05-14 cs.CL 90%

Edit-level Majority Voting Mitigates Over-Correction in LLM-based Grammatical Error Correction

基于编辑层面多数投票的过纠正缓解方法:用于基于大语言模型的语法错误修正

Takumi Goto, Yusuke Sakai, Taro Watanabe

机构 * Nara Institute of Science and Technology(奈良科学技术研究所)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种无需训练的推理方法,通过多候选生成模型进行编辑层面多数投票,缓解LLM在语法纠错中的过纠正问题,在多个语言基准测试中优于贪婪和MBR解码。

Comments BEA Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07770 2026-05-14 cs.DC cs.CL 90%

ArcLight: A Lightweight LLM Inference Architecture for Many-Core CPUs

ArcLight:一种为多核CPU设计的轻量级大语言模型推理架构

Yuzhuang Xu, Xu Han, Yuxuan Li, Wanxiang Che

机构 * Harbin Institute of Technology(哈尔滨工业大学) Tsinghua University(清华大学)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出ArcLight,一种为多核CPU优化的LLM推理架构,通过高效内存管理和线程调度及精细控制的张量并行性,解决多核CPU上的跨节点内存访问瓶颈,实现更高的推理吞吐量。

Comments Accepted by ACL 2026 Demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12001 2026-05-13 cs.IT cs.AI math.IT 90%

CR^2: Cost-Aware Risk-Controlled Routing for Wireless Device-Edge LLM Inference

CR²:面向无线设备-边缘LLM推断的成本感知风险控制路由

Nan Xue, Shengkang Chen, Zhiyong Chen, Jiangchao Yao, Yaping Sun, Zixia Hu, Meixia Tao

机构 * Cooperative Medianet Innovation Center, Shanghai Jiao Tong University(合作中位网创新中心,上海交通大学) Department of Broadband Communication, Pengcheng Laboratory(宽带通信部,鹏城实验室) Future Network of Intelligent Institute (FNii), the Chinese University of Hong Kong (Shenzhen)(智能网络研究所(FNii),香港中文大学(深圳)) Meta

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出CR²框架,通过分离轻量级设备模型与边缘模型的决策机制,优化无线边缘环境下的推断效率与成本,提升部署准确性与能耗平衡。

Comments submitted to IEEE Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11603 2026-05-13 cs.AI 90%

GAR: Carbon-Aware Routing for LLM Inference via Constrained Optimization

GAR:通过约束优化实现碳感知的LLM推理

Disha Sheshanarayana, Rajat Subhra Pal, Manjira Sinha, Tirthankar Dasgupta

机构 * Manipal University Jaipur(曼海普大学斋普尔) TCS Research(塔塔咨询服务)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出GAR框架,通过约束优化在保证准确性和延迟的同时减少碳排放,实验表明其在保持性能的同时显著降低碳足迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09702 2026-05-12 stat.ME cs.CL 90%

Calibrate, Don't Curate: Label-Efficient Estimation from Noisy LLM Judges

校准,而非筛选:从噪声LLM评判者中高效估计

Yanran Li

机构 * Department of Biostatistics(生物统计学系)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL

AI总结 本文研究了在噪声LLM评判者中如何通过校准而非筛选来提高估计效率,发现校准全组评判者优于基于准确率的筛选,且在多个基准测试中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13630 2026-05-12 cs.CR cs.AI 90%

SafeHarness: Lifecycle-Integrated Security Architecture for LLM-based Agent Deployment

SafeHarness:面向LLM代理部署的生命周期集成安全架构

Xixun Lin, Yang Liu, Yancheng Chen, Yongxuan Wu, Yucheng Ning, Yilong Liu, Nan Sun, Shun Zhang, Bin Chong, Chuan Zhou, Yanan Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) Institute of Applied Physics and Computational Mathematics(应用物理与计算数学研究所) Peking University(北京大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SafeHarness架构,通过四个防御层集成到代理生命周期中,解决现有安全方法的结构性不匹配问题,降低不安全行为和攻击成功率。

Comments 26 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08636 2026-05-12 cs.CL 90%

EdgeFlowerTune: Evaluating Federated LLM Fine-Tuning Under Realistic Edge System Constraints

EdgeFlowerTune: 在现实边缘系统约束下评估联邦大语言模型微调

Jiaxiang Geng, Yiyi Lu, Lunyu Zhao, Yan Gao, Nicholas D. Lane, Bing Luo

机构 * Duke Kunshan University(杜克-肯尼思大学) Flower Labs(Flower实验室) University of Cambridge(剑桥大学)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出EdgeFlowerTune基准,评估联邦LLM微调在现实边缘系统中的可行性,通过联合评估模型质量和系统成本,包括通信、时延、内存使用、能耗和动态边缘条件鲁棒性,揭示仅凭准确率评估的局限性。

Comments 30 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04738 2026-05-12 cs.LG 90%

OSAQ: Outlier Self-Absorption for Accurate Low-bit LLM Quantization

OSAQ: 用于准确低比特LLM量化中的异常自吸收

Zhikai Li, Zhen Dong, Xuewen Liu, Jing Zhang, Qingyi Gu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of California, Santa Barbara(加州大学圣芭芭拉分校)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出OSAQ方法,通过利用Hessian的低秩特性,利用加法权重抑制技术有效抑制低比特量化中的异常,提升模型性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20012 2026-05-12 eess.SP cs.LG 90%

Reliable LLM-Based Edge-Cloud-Expert Cascades for Telecom Knowledge Systems

可靠的基于大语言模型的边缘-云-专家级联系统用于电信知识系统

Qiushuo Hou, Sangwoo Park, Matteo Zecchin, Yunlong Cai, Guanding Yu, Osvaldo Simeone, Tommaso Melodia

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) Centre for Intelligent Information Processing Systems (CIIPS), Department of Engineering, King’s College London(伦敦国王学院工程系智能信息处理系统中心) Intelligent Networked Systems Institute (INSI) at Northeastern University(东北大学智能网络化系统研究所)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一种边缘-云-专家级联的LLM知识系统,通过问答流程实现决策,利用高效边缘模型处理常规查询,云模型处理复杂问题,必要时引入专家。通过统计严谨的阈值选择方法,保证在给定置信水平下可靠性。

Comments This paper has been submitted to a journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08386 2026-05-12 cs.AI 90%

SkillLens: Adaptive Multi-Granularity Skill Reuse for Cost-Efficient LLM Agents

SkillLens: 适应性多粒度技能重用以实现成本高效的LLM代理

Yongliang Miao, Ziyang Yu, Liang Zhao, Bowen Zhu, Hasibul Haque

机构 * Emory University(埃默里大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 SkillLens通过分层技能进化框架实现多粒度技能重用,解决技能重用中的相关性与成本矛盾,提升LLM代理在MuLocbench和ALFWorld中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07982 2026-05-11 cs.CL cs.CR 90%

GLiGuard: Schema-Conditioned Classification for LLM Safeguard

GLiGuard:面向LLM安全的模式条件分类

Urchade Zaratiana, Mary Newhauser, George Hurn-Maloney, Ash Lewis

机构 * Qwen Team(通义实验室)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 GLiGuard通过模式条件编码实现高效多维度内容安全评估,在参数更小的情况下达到与大模型守卫模型相当的准确率,同时提升吞吐量和降低延迟。

Comments 20 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06455 2026-05-08 cs.AI 90%

PrefixGuard: From LLM-Agent Traces to Online Failure-Warning Monitors

PrefixGuard: 从LLM-代理轨迹到在线故障预警监控

Xinmiao Huang, Jinwei Hu, Rajarshi Roy, Changshun Wu, Yi Dong, Xiaowei Huang

机构 * University of Liverpool(利物浦大学) Université Grenoble Alpes(格勒诺布尔阿尔卑斯大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 PrefixGuard通过离线StepView诱导和监督学习训练监控器,有效提升异构轨迹上的在线故障预警性能,实现0.900/0.710/0.533/0.557 AUPRC的高精度预警。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06068 2026-05-08 cs.AI cs.DC 90%

VibeServe: Can AI Agents Build Bespoke LLM Serving Systems?

VibeServe: 人工智能代理能否构建定制化的LLM服务系统?

Keisuke Kamahori, Shihang Li, Simon Peter, Baris Kasikci

机构 * University of Washington(华盛顿大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出VibeServe,一种通过多代理循环自动合成定制化LLM服务系统的框架,在标准部署中与vLLM竞争,在非标准场景中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05777 2026-05-08 cs.CL 90%

Estimating the Black-box LLM Uncertainty with Distribution-Aligned Adversarial Distillation

通过分布对齐对抗蒸馏估计黑盒大语言模型的不确定性

Huizi Cui, Huan Ma, Qilin Wang, Yuhang Gao, Changqing Zhang

机构 * School of Computer Science and Technology, Tianjin University, China(天津大学计算机科学与技术学院) School of Future Technology, Tianjin University, China(天津大学未来技术学院) Georgia Tech Shenzhen Institute, Tianjin University, China(Georgia Tech深圳研究院) School of Artificial Intelligence, Tianjin University, China(天津大学人工智能学院)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出DisAAD方法,通过生成-判别架构引导轻量级代理模型学习黑盒LLM的输出分布高质量区域,从而有效估计其不确定性。实验表明,即使代理模型仅占目标LLM大小的1%,也能实现可靠的不确定性量化。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00254 2026-05-04 cs.NI cs.AI 90%

Rethinking Network Topologies for Cost-Effective Mixture-of-Experts LLM Serving

重新思考面向低成本专家混合模型LLM服务的网络拓扑

Junsun Choi, Sam Son, Sunjin Choi, Hansung Kim, Yakun Sophia Shao, Scott Shenker, Sylvia Ratnasamy, Borivoje Nikolic

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 本文研究了专家混合模型LLM服务的网络拓扑,通过系统分析发现低成本无交换机拓扑在多种场景下更有效,且未来GPU升级将进一步巩固其优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27747 2026-05-01 cs.IR cs.AI 90%

Position-Aware Drafting for Inference Acceleration in LLM-Based Generative List-Wise Recommendation

基于位置感知的drafting用于LLM生成列表式推荐的推理加速

Jiaju Chen, Chongming Gao, Chenxiao Fan, Haoyan Liu, Qingpeng Cai, Peng Jiang, Xiangnan He

机构 * University of Science and Technology of China(中国科学技术大学) Zhongguancun Academy(中关村学院) Independent Researcher(独立研究员)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出PAD-Rec,通过引入位置感知drafting机制,提升生成式推荐的推理效率,实验显示在四个真实数据集上达到3.1倍的时钟速度提升,并保持推荐质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09718 2026-05-01 cs.DC cs.AI cs.PL 90%

Agentic Compilation: Mitigating the LLM Rerun Crisis for Minimized-Inference-Cost Web Automation

代理编译:缓解LLM重跑危机以实现最小化推理成本的网络自动化

Jagadeesh Chundru

机构 * Selfotix

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出编译与执行架构,通过分离LLM推理与浏览器执行,将每项工作流的推理成本降至0.1美元以下,实现零样本编译成功率80-94%,并证明确定性编译可经济可行地实现大规模自动化。

Comments 12 pages, 4 figures, 2 tables. v2: Expanded literature review and clarified architecture limitations

详情

展开后加载摘要…

URL PDF HTML 收藏