arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-10 至 2026-06-10 共收录 54 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 54 篇

2605.28066 2026-06-10 cs.CL cs.AI 版本更新 94%

PromptEmbedder: Efficient and Transferable Text Embedding via Dual-LLM Soft Prompting

PromptEmbedder:通过双LLM软提示实现高效且可迁移的文本嵌入

Yu-Che Tsai, Kuan-Yu Chen, Yuan-Hao Chen, Yu-Han Chang, Ching-Yu Tsai, Yu-Hsiang Chuang, Shou-De Lin

机构 * Department of Computer Science and Information Engineering, National Taiwan University(国立台湾大学计算机科学与资讯工程系) National Taiwan University AI Center of Research Excellence(国立台湾大学人工智能研究中心)

专题命中 效率与部署 :LLM(title,title_cn);prompting(title,abstract);large language model(abstract);language model(abstract)

AI总结 提出PromptEmbedder双LLM框架,通过可微分的软提示生成将嵌入知识从特定骨干权重中解耦,在保持性能的同时降低40% GPU内存并加速3.7倍训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10286 2026-06-10 cs.AI 新提交 92%

Sim2Schedule: A Simulator-Guided LLM Framework for Autonomous Open-Pit Mine Scheduling

Sim2Schedule: 一种模拟器引导的LLM框架用于自主露天矿调度

Mustavi Ibne Masum, Thiago Eustaquio Alves de Oliveira, Mahzabeen Emu

机构 * Department of Computer Science, Lakehead University(湖头大学计算机科学系) Quantum Communications and Computing Research Center and Department of Electrical and Computer Engineering, Memorial University of Newfoundland(新斯科舍纪念大学量子通信与计算研究中心及电气与计算机工程系) Department of Electrical and Computer Engineering, Memorial University of Newfoundland(新斯科舍纪念大学电气与计算机工程系)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出模拟器引导的LLM框架,将地质约束编码到动作生成中,零样本生成可解释调度方案,在保持线性计算时间下恢复MILP最优NPV的94%-99%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11145 2026-06-10 cs.CR 新提交 91%

OpenPCC: Open and Confidential LLM Serving on Commodity TEEs

OpenPCC:在商用TEE上提供开放且保密的LLM服务

Haoling Zhou, Shixuan Zhao, Chao Wang, Zhiqiang Lin

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对云推理服务中用户请求包含敏感信息的问题,提出OpenPCC框架,利用商用TEE实现开放、保密的LLM服务,并通过原型验证其可行性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09927 2026-06-10 cs.LG cs.AI cs.CL 新提交 90%

Trainable Smooth-Rotation Transforms with Learned Channel Scales for LLM Quantization

可训练平滑旋转变换与学习通道尺度用于LLM量化

Patrik Czakó, Gábor Kertész, Sándor Szénási

机构 * Doctoral School of Applied Informatics and Applied Mathematics, Obuda University(应用信息学与应用数学博士学校,奥布达大学) John von Neumann Faculty of Informatics, Obuda University(约翰·冯·诺伊曼信息学系,奥布达大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 针对大语言模型量化中激活值量化困难的问题,提出基于分位数鲁棒的缩放策略和梯度优化的通道尺度学习,在W4A4量化下显著降低误差。

Comments 6 pages, 8 figures, 3 tables. Accepted to IEEE INES 2026 conference proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09543 2026-06-10 cs.SE cs.AI 90%

SWEnergy: An Empirical Study on Energy Efficiency in Agentic Issue Resolution Frameworks with SLMs

SWEnergy:关于使用SLM的代理问题解决框架的能量效率实证研究

Arihant Tripathy, Ch Pavan Harshit, Karthik Vaidhyanathan

机构 * SERC, IIIT-Hyderabad(IIIT-海得拉巴研究所)

专题命中 效率与部署 :SLM(title_cn,summary_cn);LLM(abstract);language model(abstract);small language model(abstract)

AI总结 本文通过实证研究,探讨了四种主流代理问题解决框架在使用小型语言模型时的能量效率和资源消耗,发现框架架构是主要能耗驱动因素,但SLM的有限推理能力导致大量能耗浪费。

Comments 8 pages, 5 figures, 1 table. Accepted to AGENT 2026 (ICSE 2026 workshop)

Journal ref Proceedings of the 2026 International Workshop on Agentic Engineering (AGENT 2026), ACM, 2026, pp. 104-111

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07586 2026-06-10 cs.LG cs.AI cs.AR cs.MA 版本更新 90%

From Human Guidance to Autonomy: Agent Skill System for End-to-End LLM Deployment on Spatial NPUs

从人类引导到自主:面向空间NPU上端到端LLM部署的智能体技能系统

Jiajie Li, Erwei Wang, Zhiru Zhang, Samuel Bayliss

机构 * AMD Research and Advanced Development(AMD研究与高级开发)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出两阶段方法,从人类引导的智能体辅助部署到自主技能系统,在AMD XDNA 2 NPU上实现8种LLM的端到端自动部署,性能超越或持平人工优化基线。

Comments Accepted to the Machine Learning for Architecture and Systems Workshop (MLArchSys), co-located with ISCA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10415 2026-06-10 cs.DC 新提交 90%

RATrain: A Resource-Aware Training Runtime for Large Language Models on Bandwidth-Constrained Heterogeneous Supercomputing Platforms

RATrain:面向带宽受限异构超级计算平台的大语言模型资源感知训练运行时

Yao Lu, Shiqing Ma, Zhongzhi Luan, Gen Li, Jiaxing Qi, Bin Han, Hailong Yang, Depei Qian

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 针对显存层级化、DDR容量有限且集群间通信受限的MT-3000平台,提出资源感知训练运行时RATrain,通过训练状态生命周期调度和资源感知规划器,实现高达1.35倍加速和97.0%的扩展效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10861 2026-06-10 cs.SE cs.AI cs.HC 新提交 90%

From Perception to Action: Can UI Interventions Foster Sustainable LLM Chatbot

从感知到行动:UI干预能否促进可持续的LLM聊天机器人

Nitish Patkar, Pooja Rani, Jack Glässer, Simon Lüscher, Martin Kropp

机构 * University of Applied Sciences and Arts Northwestern Switzerland (FHNW)(瑞士西北应用科学与艺术大学(FHNW)) University of Mannheim(曼海姆大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 研究通过UI干预(如模式切换、能耗反馈)提升用户对LLM聊天机器人能耗的感知,并鼓励节能行为,发现模式切换是主要行为机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10148 2026-06-10 cs.CR 新提交 89%

RadKey: An LLM-Guided RF Backscatter System for Through-Wall Keystroke Inference

RadKey: 一种基于LLM引导的RF反向散射系统用于穿墙击键推断

Qijun Wang, Chunqi Qian, Huacheng Zeng

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 提出RadKey系统,利用无源反向散射标签捕获击键振动和声音,通过RF信号远距离穿墙窃听,结合信号处理与LLM在线自适应,实现跨用户、跨键盘的准确击键推断。

Comments Accepted to the 47th IEEE Symposium on Security and Privacy (IEEE S&P), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10706 2026-06-10 cs.LG cs.AI 新提交 89%

Unifying Data, Memory, and Compute Efficiency in LLM training: A Survey

统一LLM训练中的数据、内存和计算效率:一项综述

Vanessa Schmidt, Huy Hoang Nguyen, Cédric Jung, Shirin Salehi, Anke Schmeink

机构 * Chair of Information Theory and Data Analytics (INDA), RWTH Aachen University(亚琛工业大学信息理论与数据分析教席) AIT Austrian Institute of Technology GmbH(奥地利技术研究所) Automation and Control Institute, Technische Universität Wien (TUW)(维也纳工业大学自动化与控制研究所)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文从资源约束视角综述大语言模型训练中的数据效率、内存效率和计算预算感知三大瓶颈,强调三者需联合优化而非孤立处理。

Comments Accpeted for publication in IEEE Transactions on Artificial Intelligence (TAI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10445 2026-06-10 cs.LG cs.CL 新提交 89%

SpenseGPT: Practical One-shot Pruning Enabling Sparse and Dense GEMMs for LLM Inference

SpenseGPT: 面向LLM推理的实用一次性剪枝,支持稀疏和稠密GEMM

Jaeseong Lee, Seung-won Hwang, Samyam Rajbhandari

机构 * Snowflake AI Research(Snowflake AI研究) Seoul National University(首尔大学)

专题命中 效率与部署 :LLM(title,title_cn);post-training(abstract);分类 cs.CL、cs.LG

AI总结 提出Spense混合稀疏-稠密格式,将权重矩阵分为2:4稀疏和稠密区域,结合一次性剪枝方法SpenseGPT,在B200 GPU上实现高达1.2倍端到端解码加速,同时保持模型精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10294 2026-06-10 cs.LG cs.AI cs.AR cs.NE physics.comp-ph 新提交 89%

LLM-Guided Neural Architecture Search for Robust Co-Design of Physical Neural Networks

LLM引导的神经架构搜索用于物理神经网络的鲁棒协同设计

Tyler King, Timothee Leleu

机构 * University of California, Berkeley(加州大学伯克利分校) DeepMind(深度思维)

专题命中 效率与部署 :LLM(title,title_cn);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出UH-NAS框架,利用大语言模型作为进化算子,协同优化任务准确率和推理能耗,实现跨硬件平台的公平比较,在光学MZI硬件上发现更鲁棒的架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10487 2026-06-10 cs.LG cs.AI 新提交 88%

Stop Early, Spend Less: Hidden-State Probes as a Practical Recipe for Streaming Moderation of LLM Outputs

早停早省:隐藏状态探针作为LLM输出流式审核的实用方案

Huizhen Shu, Xuying Li, Piao Xue

机构 * ModelOneAI yunshanai(云山AI)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出基于隐藏状态的轻量级词元级探针,在解码循环中实时检测不安全输出,无需额外前向传播,实现亚毫秒级安全审核,可提前中断或修改生成。

Comments Technical Report. 14 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10209 2026-06-10 cs.AI cs.LG cs.SE 新提交 88%

Less Context, Better Agents: Efficient Context Engineering for Long-Horizon Tool-Using LLM Agents

更少上下文,更优智能体:面向长周期工具使用LLM智能体的高效上下文工程

Abhilasha Lodha, Mahsa Pahlavikhah Varnosfaderani, Abir Chakraborty, Abhinav Mithal

机构 * Microsoft(微软)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对企业工具使用场景中上下文过长导致的问题,提出选择性保留最近工具交互并添加紧凑摘要的方法,在费用明细任务上将完成率从71.0%提升至91.6%,同时大幅降低token消耗和运行时间。

Comments 17 pages, 3 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09879 2026-06-10 cs.LG 新提交 87%

Operator Fusion for LLM Inference on the Tensix Architecture

面向Tensix架构的LLM推理算子融合

Qingbo Wu, Ke Li, Wenzhu Wang, Jie Yu, Ruian Zhang, Lili Liu

机构 * KylinSoft Co., Ltd, Tianjin, China(KylinSoft有限公司,天津,中国) openKylin Community, Tianjin, China(openKylin社区,天津,中国) College of Computer Science and Technology, National University of Defense Technology, Changsha, China(计算机科学与技术学院,国防科技大学,长沙,中国)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 针对Tensix架构的LLM推理瓶颈,提出RMSNorm与矩阵乘法融合的算子融合策略,利用片上SRAM和NoC多播减少DRAM读写与调度开销,在Wormhole平台上实现注意力延迟降低37.44%、MLP延迟降低15.89%,且数值一致性保持98.75%以上。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08779 2026-06-10 cs.LG 版本更新 87%

Reformulate LLM Reinforcement Learning for Efficient Training under Black-box Discrepancy

重新制定LLM强化学习以在黑箱差异下高效训练

Jiashun Liu, Runze Liu, Xu Wan, Jing Liang, Hongyao Tang, Ling Pan

机构 * Hong Kong University of Science and Technology(香港科技大学) Zhejiang University(浙江大学) Tianjin University(天津大学)

专题命中 效率与部署 :LLM(title,title_cn);post-training(abstract);分类 cs.LG

AI总结 针对强化学习中的训练-推理差异问题,提出差异约束马尔可夫决策过程(DCMDP),通过拉格朗日松弛自适应平衡性能提升与差异控制,实现稳定高效训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11045 2026-06-10 cs.AI cs.LG 新提交 85%

What Fits (Into Few Tokens) Doesn't Overfit: Compression and Generalization in ML Research Agents

什么适合(少量标记)就不会过拟合:ML研究智能体中的压缩与泛化

Martin Andres Bertran, Aaron Roth, Zhiwei Steven Wu

机构 * Amazon Responsible AI(亚马逊负责任人工智能) University of Pennsylvania(宾夕法尼亚大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究LLM驱动的科研智能体在输出和输入压缩下能否保持性能,发现短提示和可压缩反馈足以复现高性能模型,支持成功策略位于低复杂度区域的假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11113 2026-06-10 cs.DC 新提交 85%

A Neurosymbolic Prolog Skill for LLM-Driven Service Placement

一种用于LLM驱动服务放置的神经符号Prolog技能

Jacopo Massa, Giuseppe Bisicchia, Patrizio Dazzi, Antonio Brogi

专题命中 效率与部署 :LLM(title,title_cn);language model(abstract)

AI总结 提出一种基于Prolog技能的神经符号方法,将服务放置意图转化为符号事实和规则,利用Prolog进行约束验证和推理,实现可检查的策略感知放置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.04680 2026-06-10 cs.CL cs.AI cs.LG 85%

The Cost of Down-Scaling Language Models: Fact Recall Deteriorates before In-Context Learning

大语言模型降维的成本:事实回忆在内省学习之前恶化

Tian Jin, Nolan Clement, Xin Dong, Vaishnavh Nagarajan, Michael Carbin, Jonathan Ragan-Kelley, Gintare Karolina Dziugaite

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) MIT Harvard University(麻省理工学院哈佛大学) Google Research(谷歌研究) Google DeepMind(谷歌DeepMind)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨了大语言模型参数数量缩放对核心能力的影响,发现模型规模缩减会显著降低事实回忆能力,但对内省信息处理影响较小。

Journal ref The Twelfth International Conference on Learning Representations (ICLR), 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11106 2026-06-10 cs.CV cs.AI 新提交 83%

FADA: Accessible fetal ultrasound interpretation and annotation with a selectively distilled unified vision-language model

FADA: 可访问的胎儿超声解读与标注——基于选择性蒸馏的统一视觉-语言模型

Mahmood Alzubaidi, Uzair Shah, Raden Muaz, Ines Abbes, Nader Mohammed, Abdullatif Magram, Khalid Alyafei, Mowafa Househ, Marco Agus

机构 * Hamad Bin Khalifa University(哈马德·本·哈利法大学) HMC(哈马德医疗公司) Advanced AlRazi Diagnostic Center(高级阿尔拉齐诊断中心) Sidra Medicine(锡德拉医学)

专题命中 效率与部署 :language model(title,abstract);foundation model(abstract);分类 cs.AI

AI总结 提出统一视觉-语言模型FADA,通过选择性蒸馏从四个领域基础模型提取知识,实现胎儿超声的解读、分类、检测和分割,在单个消费级GPU上训练,无需外部标签,可在智能手机上离线运行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10147 2026-06-10 cs.AI cs.CL cs.CV cs.SD 新提交 82%

From Senses to Decisions: The Information Flow of Auditory and Visual Perception in Multimodal LLMs

从感知到决策:多模态大语言模型中听觉与视觉感知的信息流

Wish Suharitdamrong, Muhammad Awais, Xiatian Zhu, Sara Atito

机构 * Surrey Institute for People-Centred AI (PAI)(萨里人本人工智能研究所) University of Surrey(萨里大学) Centre for Vision, Speech and Signal Processing (CVSSP)(视觉、语音和信号处理中心)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究多模态大语言模型(AVLLMs)中音频和视觉信息流的路径与整合机制,发现顺序流与并行流两种路由模式,并证明信息传递后可丢弃无关token以提升效率。

Comments 40 pages, 29 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09916 2026-06-10 cs.LG cs.AI 新提交 82%

IntentKV: Cross-Turn Intent-Aware KV Cache Pruning for Agent Inference

IntentKV: 面向Agent推理的跨轮次意图感知KV缓存剪枝

Junjie Li, Jiong Lou, Jie Li

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 针对多轮LLM Agent中KV缓存成为服务瓶颈的问题,提出IntentKV方法,通过会话级QueryMemory和残差注意力头实现跨轮次意图感知的KV剪枝,在保持精度的同时大幅降低峰值请求token和KV读取量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10457 2026-06-10 cs.AI 新提交 81%

Trace2Policy: From Expert Behavior Traces to Self-Evolving Decision Agents

Trace2Policy:从专家行为轨迹到自我进化的决策代理

Junli Zha, Jinbo Wang, Chao Zhou, Xiang Song

机构 * SF Express(顺丰速运)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出Trace2Policy框架,通过错误驱动的迭代技能精炼(EISR)从专家行为中提取可读规则,在合规敏感任务中规则质量是关键性能杠杆,经8轮迭代后编译为确定性Python代码达到79.6%准确率,并在实际部署中优于纯LLM基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10974 2026-06-10 cs.RO 新提交 80%

Language-Driven Cost Optimization for Autonomous Driving

语言驱动的自动驾驶成本优化

Diego Martinez-Baselga, Khaled Mustafa, Javier Alonso-Mora

机构 * TU Delft(代尔夫特理工大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出语言驱动框架,利用大语言模型解释场景和用户查询,生成风险感知MPPI控制器的参数,并通过人机交互验证和反馈迭代优化自动驾驶行为。

Comments Paper accepted at IEEE Intelligent Transportation Systems Conference (ITSC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10431 2026-06-10 cs.CV cs.AI 新提交 79%

Vision-Assisted Foundation Model for Solving Multi-Task Vehicle Routing Problems

视觉辅助的基础模型解决多任务车辆路径问题

Shuangchun Gui, Zhiguang Cao, Wen Song, Yew-Soon Ong

机构 * School of Computing and Information Systems, Singapore Management University(新加坡管理大学计算与信息系统学院) Institute of Marine Science and Technology, Shandong University(山东大学海洋科学与技术研究院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Centre for Frontier AI Research, Institute of High Performance Computing, Agency for Science, Technology and Research(新加坡科技研究局高性能计算研究所前沿人工智能研究中心)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI

AI总结 提出视觉辅助基础模型VaFM,通过将约束编码为图像并融合图节点嵌入,同时解决16种VRP变体,在复杂约束变体上超越现有方法。

Comments Accepted by TNNLS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10385 2026-06-10 cs.LG cs.AI 新提交 79%

Beyond Absolute Imitation: Anchored Residual Guidance for Privileged On-Policy Distillation

超越绝对模仿:基于锚定残差引导的特权在线蒸馏

Wenhao Zhang

机构 * South China University of Technology(华南理工大学)

专题命中 效率与部署 :SFT(abstract,abstract_cn);LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 提出锚定残差在线蒸馏(AR-OPD),通过部分特权教师建立局部兼容锚点并注入受控残差,解决特权在线蒸馏中后见偏差导致的局部不可达问题,在推理任务上平均提升2.3个点。

Comments 17 pages, 8 figures. Project page: https://vanhowe.github.io/AR-OPD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11187 2026-06-10 cs.CV 新提交 75%

Next Forcing: Causal World Modeling with Multi-Chunk Prediction

Next Forcing: 基于多块预测的因果世界建模

Gangwei Xu, Qihang Zhang, Jiaming Zhou, Xing Zhu, Yujun Shen, Xin Yang, Yinghao Xu

机构 * Robbyant HUST(华中科技大学) HKUST(香港科技大学) HKUST (GZ)(香港科技大学(广州))

专题命中 效率与部署 :large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 提出Next Forcing框架,通过多块预测训练目标加速视频生成模型收敛、提升精度并实现推理加速,在多个基准上取得最优结果。

Comments Project page: https://gangweix.github.io/next-forcing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11119 2026-06-10 cs.LG cs.AI cs.CL 新提交 75%

TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning

TRACE:一种用于高效智能体强化学习的统一展开预算分配框架

Heming Zou, Qi Wang, Yun Qu, Yuhang Jiang, Lizhou Cai, Yixiu Mao, Ru Peng, Xin Xu, Weijie Liu, Kai Yang, Saiyong Yang, Xiangyang Ji

机构 * Tsinghua University(清华大学) Tencent(腾讯)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对多轮智能体强化学习中奖励对比度不足的问题,提出TRACE框架,通过将每个ReAct式思考-行动-观察步骤建模为语义节点,在固定采样预算内将预算分配到提示根和中间前缀,增强奖励对比,提升策略更新信号。

Comments 32 pages, 12 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10935 2026-06-10 cs.LG cs.AI 新提交 73%

CLP: Collocation-Length Prediction for Zero-Loss Adaptive Multi-Token Inference

CLP: 零损失自适应多令牌推理的搭配长度预测

Xuezhen Xie, Zhiqiang Zhou

机构 * Xiamen University(厦门大学) Tsinghua University(清华大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出CLP方法,通过轻量级线性层预测可安全接受的额外令牌数,解决多令牌预测中头-主干竞争导致的输出退化问题,在Qwen2.5模型上实现零质量损失的1.14x-1.29x加速。

Comments 13 pages, 8 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10369 2026-06-10 cs.CL cs.LG 新提交 73%

PADD: Path-Aligned Decompression Distillation for Non-Router Teacher to Guide MoE Student Learning

PADD: 面向非路由器教师指导MoE学生学习的路径对齐解压缩蒸馏

Xinyue Peng, Yi Qian, Jiaojiao Lin, Wenjian Shao, Yanming Liu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出路径对齐解压缩蒸馏(PADD)框架,通过四阶段两阶段流程将密集教师知识蒸馏到混合专家(MoE)学生中,同时学习高质量路由策略,在数学推理任务上显著优于基线。

Comments published in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏