arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-11 至 2026-05-11 共收录 68 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 68 篇

2605.06702 2026-05-11 cs.AI cs.CL cs.LG 93%

CASCADE: Case-Based Continual Adaptation for Large Language Models During Deployment

CASCADE:基于案例的连续适应:在部署期间为大型语言模型进行持续适应

Siyuan Guo, Yali Du, Hechang Chen, Yi Chang, Jun Wang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, Jilin University(吉林大学知识驱动人机智能工程研究中心) International Center of Future Science, Jilin University(吉林大学未来科学国际中心) Department of Informatics, King’s College London(伦敦国王学院信息学院) The Alan Turing Institute(艾伦·图灵研究所) AI Centre, Department of Computer Science, UCL(UCL计算机科学系人工智能中心)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 本文提出CASCADE框架,通过在部署期间持续学习提升LLM性能,实现20.9%的提升,并在多个领域任务中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07840 2026-05-11 cs.LG 92%

RelAgent: LLM Agents as Data Scientists for Relational Learning

RelAgent:基于LLM的数据科学家用于关系学习

Xingyue Huang, Louis Tichelman, Jinwoo Kim, Krzysztof Olejniczak, İsmail İlkan Ceylan

机构 * University of Oxford(牛津大学) TU Wien(维也纳技术大学) AITHYRA(AITHYRA研究所) KAIST(韩国科学技术院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 RelAgent是一种基于LLM的关系学习自主数据科学家,通过两阶段流程构建SQL特征程序并选择预测模型,最终通过SQL查询和经典模型实现快速、确定性和可解释的预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05927 2026-05-11 cs.CL cs.SD eess.AS 92%

Minimizing Modality Gap from the Input Side: Your Speech LLM Can Be a Prosody-Aware Text LLM

从输入侧最小化模态差距:你的语音大语言模型可以成为具有语调意识的文本大语言模型

Wenqian Cui, Xiao-Hui Li, Daxin Tan, Qiyong Zheng, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) Huawei Technologies(华为技术)

专题命中 效率与部署 :LLM(title,abstract);SLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出TextPro-SLM,通过改进语音输入使其更接近具有语调意识的文本大语言模型,从而有效减少模态差距,实验表明其在3B和7B规模下表现最佳,且数据效率高。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07783 2026-05-11 cs.CL 91%

Chain-based Distillation for Effective Initialization of Variable-Sized Small Language Models

基于链式蒸馏的变量大小小型语言模型有效初始化方法

Boyu Shi, YiCheng Jiang, Chang Liu, Qiufeng Wang, Xu Yang, Xin Geng

机构 * School of Computer Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院,南京,中国) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及其交叉应用重点实验室(东南大学),教育部,中国)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);SLM(abstract,abstract_cn);large language model(abstract)

AI总结 本文提出链式蒸馏方法,通过逐步蒸馏构建中间模型链,实现变量大小语言模型的高效初始化,提升效率和下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24013 2026-05-11 cs.LG cs.AI cs.CV cs.DC 91%

CommFuse: Hiding Tail Latency via Communication Decomposition and Fusion for Distributed LLM Training

CommFuse:通过通信分解与融合隐藏尾部延迟以分布式LLM训练

Rezaul Karim, Austin Wen, Wang Zongzuo, Weiwei Zhang, Yang Liu, Walid Ahmed

机构 * Huawei(华为)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CommFuse方法,通过分解与融合通信操作,有效缓解分布式LLM训练中的通信瓶颈,降低延迟并提升模型利用率。

Comments Slightly modified the title, and corresponding minor wording change in the content

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13010 2026-05-11 cs.LG cs.AI 91%

Lightning OPD: Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillation

Lightning OPD: 为大推理模型高效实现离线在线蒸馏

Yecheng Wu, Song Han, Hai Cai

机构 * NVIDIA

专题命中 效率与部署 :post-training(title,abstract);LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract)

AI总结 本文提出Lightning OPD,通过强制教师一致性消除对实时教师服务器的需求,实现高效离线在线蒸馏,实验表明其在数学推理和代码生成任务中性能与传统OPD相当,训练效率提升4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05693 2026-05-11 cs.AI cs.LG 91%

Saliency-Aware Regularized Quantization Calibration for Large Language Models

具有显著性感知的正则化量化校准用于大语言模型

Yanlong Zhao, Xiaoyuan Cheng, Huihang Liu, Baihua He, Xinyu Zhang, Harrison Bo Hua Zhu, Wenlong Chen, Li Zeng, Zhuo Sun

机构 * University of Science and Technology of China(中国科学技术大学) University College London(伦敦大学学院) Shanghai University of Finance and Economics(上海财经大学) Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) University of Copenhagen(哥本哈根大学) Imperial College London(伦敦帝国学院) Technical University of Denmark(丹麦技术大学) Peking University(北京大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);post-training(abstract)

AI总结 本文提出SARQC,通过引入显著性感知正则化改进量化校准,提升大语言模型的泛化能力,实验表明在密集和专家混合模型中提升了困惑度和零样本准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05615 2026-05-11 cs.LG cs.CY 90%

LLMSpace: Carbon Footprint Modeling for Large Language Model Inference on LEO Satellites

LLMSpace:大型语言模型在低地球轨道卫星上的推理碳足迹建模

Lei Jiang, Adrian Ildefonso, Daniel Loveless, Fan Chen

机构 * Indiana University(印第安纳大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出LLMSpace框架,用于建模AI赋能低地球轨道卫星上大型语言模型推理的碳足迹,分析碳足迹、延迟、硬件设计和使用寿命之间的关键权衡。

Comments 12 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22316 2026-05-11 cs.LG 90%

Outlier Smoothing with Closed-Form Rotations for W4A4 Large Language Model Quantization

基于闭式旋转的W4A4大语言模型量化去噪

Jinying Xiao, Bin Ji, Shasha Li, Xiaodong Liu, Ma Jun, Chao Wang, Wei Li, Ye Zhong, Xuan Xie, Nyima Tashi, Jie Yu

机构 * National University of Defense Technology(国防科技大学) Qinghai Normal University(青海师范大学) Tibet University(西藏大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出SingleQuant框架,通过闭式最优旋转平滑激活异常值,提升大语言模型量化性能,实验证明其在多种任务中优于基线方法。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07982 2026-05-11 cs.CL cs.CR 90%

GLiGuard: Schema-Conditioned Classification for LLM Safeguard

GLiGuard:面向LLM安全的模式条件分类

Urchade Zaratiana, Mary Newhauser, George Hurn-Maloney, Ash Lewis

机构 * Qwen Team(通义实验室)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 GLiGuard通过模式条件编码实现高效多维度内容安全评估,在参数更小的情况下达到与大模型守卫模型相当的准确率,同时提升吞吐量和降低延迟。

Comments 20 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07238 2026-05-11 cs.DC 89%

FATE: Future-State-Aware Scheduling for Heterogeneous LLM Workflows

FATE:面向异构大语言模型工作流的未来状态感知调度

Zirui Huang, Yi-Xiang Hu, Feng Wu, Xiangyang Li

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 FATE通过结合前沿规划、前瞻性候选评分和多设备分片执行,优化异构LLM工作流的未来状态,降低延迟并提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06113 2026-05-11 cs.DC 89%

Tackling the Data-Parallel Load Balancing Bottleneck in LLM Serving: Practical Online Routing at Scale

解决大规模LLM服务中的数据并行负载均衡瓶颈:大规模下的实用在线路由

Tianci Bu, Yuan Lyu, Zixi Chen, Chendong Song, Hong Liang, Tsepten Gurung, Yuwei Fan, Yinyu Ye, Zijie Zhou

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 本文提出BalanceRoute算法,通过在线路由减少LLM服务中的数据并行负载不均衡,提升端到端服务吞吐量。

Comments 30 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07182 2026-05-11 cs.LG 89%

Star Elastic: Many-in-One Reasoning LLMs with Efficient Budget Control

Star Elastic:多模型一体的推理LLM及其高效预算控制

Ali Taghibakhshi, Ruisi Cai, Saurav Muralidharan, Sharath Turuvekere Sreenivas, Aditya Vavre, Ameya Sunil Mahabaleshwarkar, Bilal Kartal, Sheldon Liang, Marcin Chochowski, Zijia Chen, Akhiad Bercovich, Ran Zilberstein, Ran El-Yaniv, Yonatan Geifman, Daniel Korzekwa, Yoshi Suhara, Oluwatobi Olabiyi, Ashwath Aithal, Nima Tajbakhsh, Pavlo Molchanov

机构 * NVIDIA(英伟达)

专题命中 效率与部署 :LLM(title_cn,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出Star Elastic方法,通过单次训练任务添加多个嵌套子模型,降低训练成本并解决静态架构的刚性问题,实现动态预算控制,提升推理准确率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07775 2026-05-11 cs.LG cs.AI stat.ML 89%

POETS: Uncertainty-Aware LLM Optimization via Compute-Efficient Policy Ensembles

POETS: 通过计算高效的策略集合实现不确定性感知的LLM优化

Nicolas Menet, Andreas Krause, Abbas Rahimi

机构 * IBM Research – Zurich(IBM瑞士苏黎世实验室) Department of Computer Science, ETH Zürich(苏黎世联邦理工学院计算机科学系)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 POETS通过计算高效的策略集合,结合KL正则化和策略优化,实现了在序列决策和黑箱优化中的不确定性量化,提升了样本效率和优化轨迹。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23198 2026-05-11 cs.LG cs.CL 89%

Sparser, Faster, Lighter Transformer Language Models

更稀疏、更快、更轻量的Transformer语言模型

Edoardo Cetin, Stefano Peluchetti, Emilio Castillo, Akira Naruse, Mana Murakami, Llion Jones

机构 * Sakana AI NVIDIA

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);foundation model(abstract)

AI总结 本文提出一种基于无结构稀疏性的方法,通过改进的稀疏打包格式和CUDA内核,提升Transformer模型的推理和训练效率,实现更高效的模型压缩与资源利用。

Comments Code and checkpoints available at: https://github.com/SakanaAI/sparser-faster-llms

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01752 2026-05-11 cs.CL cs.CR 89%

WorldCup Sampling for Multi-bit LLM Watermarking

多比特LLM水印的WorldCup采样

Yidan Wang, Yubing Ren, Yanan Cao, Li Guo

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络与信息安全学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出WorldCup框架,通过结构化通信通道建模和分层竞争机制实现多比特水印嵌入,提升文本质量和解码鲁棒性,实验表明其在容量、检测性、鲁棒性等方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07883 2026-05-11 cs.CL 88%

Beyond "I cannot fulfill this request": Alleviating Rigid Rejection in LLMs via Label Enhancement

超越'我无法完成此请求':通过标签增强缓解LLM中的刚性拒绝

Ying Zhang, Congyu Qiao, Xin Geng, Ning Xu

机构 * Southeast University, Nanjing, China(东南大学)

专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出LANCE方法,通过标签增强实现安全且灵活的响应,减少LLM中的刚性拒绝问题,提升交互自然性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17942 2026-05-11 cs.AI cs.DB 88%

LLM-Based SQL Generation: Prompting, Self-Refinement, and Adaptive Weighted Majority Voting

基于大型语言模型的SQL生成:提示、自我完善与自适应加权多数投票

Yu-Jie Yang, Hung-Fu Chang, Po-An Chen

机构 * Institute of Information Management(信息管理研究所) National Yang Ming Chiao Tung University(阳明交通大学) R. B. Annis School of Engineering(R. B. Annis工程学院) University of Indianapolis(印第安纳大学)

专题命中 效率与部署 :LLM(title);prompting(title);large language model(abstract);language model(abstract)

AI总结 本文提出SSEV管道,通过自我完善与加权多数投票提升SQL生成准确性,在多个基准测试中取得良好成绩,并进一步提出ReCAPAgent-SQL框架以应对企业数据库复杂性,提升实际应用效果。

Comments 29 pages, 22 figures

Journal ref 2026 International Conference on Information Management

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10880 2026-05-11 cs.CR cs.AI cs.CL 88%

Searching for Privacy Risks in LLM Agents via Simulation

通过模拟搜索LLM代理中的隐私风险

Yanzhe Zhang, Diyi Yang

机构 * Georgia Tech(佐治亚理工学院) Stanford University(斯坦福大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文提出通过模拟搜索改进攻击与防御策略,发现攻击策略从直接请求演变为伪装和伪造同意等复杂手段,防御策略从规则约束升级为身份验证状态机,为隐私安全代理发展提供洞察。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06914 2026-05-11 cs.DC cs.AI cs.CL 88%

Regulating Branch Parallelism in LLM Serving

在LLM服务中调节分支并行度

Swapnil Gandhi, Siva Hari, William J. Dally, Christos Kozyrakis

机构 * Stanford University(斯坦福大学) NVIDIA(英伟达)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文提出TAPER,一种按步骤的准入控制器,通过预测分支外部性来调节分支并行度,提升吞吐量并保持服务级别目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05703 2026-05-11 cs.MA cs.AI cs.LG 88%

Active Learning for Communication Structure Optimization in LLM-Based Multi-Agent Systems

基于大语言模型多智能体系统的通信结构优化的主动学习

Huchen Yang, Xinghao Dong, Dan Negrut, Jin-Long Wu

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于信息论的任务选择框架,通过估计任务信息量优化多智能体系统通信结构,在有限预算下提升性能并减少token使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05276 2026-05-11 cs.LG cs.AI cs.CL 88%

SpikingBrain: Spiking Brain-inspired Large Models

SpikingBrain:基于大脑的高效大模型

Yuqi Pan, Yupeng Feng, Jinghao Zhuang, Siyu Ding, Han Xu, Zehao Liu, Bohan Sun, Yuhong Chou, Xuerui Qiu, Anlin Deng, Anjie Hu, Shurong Wang, Peng Zhou, Man Yao, Jibin Wu, Jian Yang, Guoliang Sun, Bo Xu, Guoqi Li

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Key Laboratory of Brain-Inspired General Intelligence Large Model(北京脑启发通用智能大模型重点实验室) Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology(脑认知与脑启发智能技术重点实验室) Beijing Academy of Artificial Intelligence(北京人工智能研究院) The Hong Kong Polytechnic University(香港理工大学) Zhongguancun Academy(中关村学院) Beihang University(北航) Zhejiang University(浙江大学) LuxiTech MetaX Integrated Circuit Co., Ltd(MetaX集成电路有限公司)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SpikingBrain,一种受大脑启发的大模型,通过高效架构和算法优化,在非NVIDIA平台实现大规模LLM训练与推理,提升长上下文处理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19669 2026-05-11 cs.CL 85%

DiffAdapt: Difficulty-Adaptive Reasoning for Token-Efficient LLM Inference

DiffAdapt:面向令牌高效大语言模型推理的难度自适应推理

Xiang Liu, Xuming Hu, Xiaowen Chu, Eunsol Choi

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) New York University(纽约大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出DiffAdapt框架,通过分析推理轨迹中的熵分布,根据问题难度选择不同的推理策略,减少令牌使用量,提升推理效率。

Comments ICLR 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07355 2026-05-11 cs.CV cs.AI 85%

TTF: Temporal Token Fusion for Efficient Video-Language Model

TTF: 时空融合用于高效的视频-语言模型

Simin Huo, Ning LI

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出TTF方法,通过利用视频中的时间冗余性,减少视频语言模型的推理成本,保留高精度的同时显著降低视觉token数量。

Comments 14 pages; manuscript submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05439 2026-05-11 cs.AI cs.FL 85%

BEAVER: An Efficient Deterministic LLM Verifier

BEAVER:一种高效的确定性大语言模型验证器

Tarun Suresh, Nalin Wadhwa, Debangshu Banerjee, Gagandeep Singh

机构 * University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 BEAVER 提出了一种计算大语言模型安全属性确定性概率界限的框架,通过新颖的 Token trie 和 Frontier 数据结构系统探索模型输出空间,提供可靠保证并识别更多高风险实例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02971 2026-05-11 cs.LG cs.AI cs.CL 83%

Multilingual Safety Alignment via Self-Distillation

通过自蒸馏实现多语言安全对齐

Ruiyang Qin, Qingzhuo Wang, Dongrui Liu, Qiang Li, Zhihua Wei, Wen Shen

机构 * Tongji University(同济大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出多语言自蒸馏框架,通过将高资源语言的安全能力迁移到低资源语言,解决多语言安全对齐问题,无需特定语言响应数据,实验表明方法在多语言安全性能上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07726 2026-05-11 cs.DC 82%

A Scalable Recipe on SuperMUC-NG Phase 2: Efficient Large-Scale Training of Language Models

在SuperMUC-NG Phase 2上的可扩展配方:高效大规模训练语言模型

Ajay Navilarekal Rajgopal, Nikolai Solmsdorf

专题命中 效率与部署 :language model(title,abstract);large language model(abstract)

AI总结 本文研究了在SuperMUC-NG Phase 2系统上高效训练大规模语言模型的方法,通过并行训练技术提升计算效率,实现了1750亿参数模型的高效训练。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25584 2026-05-11 cs.AI cs.CL cs.CV cs.IT cs.LG math.IT 82%

Skip-It? Theoretical Conditions for Layer Skipping in Vision-Language Models

跳过层?视觉-语言模型中层跳过的理论条件

Max Hartman, Vidhata Jayaraman, Moulik Choraria, Akhil Bhimaraju, Lav R. Varshney

机构 * Department of Electrical and Computer Engineering, The University of Illinois, Champaign, IL, United States(电气与计算机工程系,伊利诺伊大学香槟分校) Department of Mathematics, The University of Illinois, Champaign, IL, United States(数学系,伊利诺伊大学香槟分校) AI Innovation Institute, Stony Brook University, Stony Brook, NY, United States(人工智能创新研究所,石溪大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出统一框架,通过可验证的冗余概念,理论分析视觉-语言模型中层跳过的条件,验证早期和晚期视觉token的冗余性,并统一现代层跳技术的理论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07180 2026-05-11 cs.CL 81%

Learning Agent Routing From Early Experience

从早期经验学习代理路由

Yimin Wang, Jiahao Qiu, Xuan Qi, Xinzhe Juan, Jingzhe Shi, Zelin Zhao, Hongru Wang, Shilong Liu, Mengdi Wang

机构 * AI Lab, Princeton University(普林斯顿大学人工智能实验室) University of Michigan(密歇根大学) Institute for Interdisciplinary Information Sciences (IIIS), Tsinghua University(清华大学交叉信息学院) Shanghai Jiao Tong University(上海交通大学) University of Edinburgh(爱丁堡大学) King’s College London(伦敦国王学院)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文研究在冷启动条件下如何在轻量级LLM推理与完整代理执行间进行路由,提出无需训练的BoundaryRouter框架,通过早期行为经验和指导性推理决定是否直接使用LLM还是升级至代理,实验显示其在降低推理时间与提升性能方面优于其他方法。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20816 2026-05-11 cs.CL cs.LG 81%

Don't Ignore the Tail: Decoupling top-K Probabilities for Efficient Language Model Distillation

不要忽视尾部:为高效语言模型蒸馏解耦top-K概率

Sayantan Dasgupta, Trevor Cohn, Timothy Baldwin

机构 * School of Computing and Information Systems, University of Melbourne, Melbourne, Australia(计算与信息系统学院,墨尔本大学,澳大利亚墨尔本)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种尾部意识的分歧度,解耦教师模型top-K预测概率与低概率预测的贡献,提升分布尾部信息在语言模型蒸馏中的作用。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏