arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-07 至 2026-08-07 共收录 47 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 47 篇

2608.05926 2026-08-07 cs.NI cs.AI 新提交 92%

BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks

BALANCE:无线边缘网络中的混合自回归-推测式大语言模型推理

Guanqiao Qu, Shuo Chen, Qian Chen, Kin K. Leung, Xianhao Chen

专题命中 效率与部署 :LLM(title,summary_cn);SLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对边缘LLM推理的延迟-内存权衡问题,提出混合自回归-推测式框架BALANCE,通过多项式时间算法优化资源分配,提升了任务吞吐量与服务用户数。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05695 2026-08-07 cs.AI cs.CL cs.CR 新提交 92%

DreamGuard: Efficient Runtime Guardrail for LLM Agents via Risk-Aware World Model

DreamGuard:基于风险感知世界模型的LLM智能体高效运行时护栏

Wenhao Lin, Chenyu Yu, Xingwei Lin, Sicong Cao, Xiang Chen, Lei Xue, Le Yu, Letian Sha, Chunming Wu

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对LLM智能体运行时护栏的长视野风险盲点问题,提出基于风险感知世界模型的主动式护栏DreamGuard,经实验验证其安全-效用权衡更优且延迟低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01997 2026-08-07 cs.LG cs.AI 版本更新 91%

On the Limits of Layer Pruning for Generative Reasoning in Large Language Models

关于生成推理中大语言模型层剪枝的极限

Safal Shrestha, Anubhav Shrestha, Aadim Nepal, Minwu Kim, Keith Ross

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);post-training(abstract)

AI总结 研究发现层剪枝在分类任务中有效压缩模型但生成推理任务表现较差,揭示了剪枝对算法能力如算术和括号生成的影响,指出在受限条件下生成推理能力恢复有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05651 2026-08-07 cs.CL cs.AI cs.NE 新提交 90%

Relay, Don't Route: Adaptive Population Handoff for Cost-Efficient LLM-Driven Evolution

中继而非路由:面向成本高效的大语言模型驱动演化的自适应种群交接

Sichun Luo, Yi Huang, Guanzhi Deng, Haibo Wang, Haochen Luo, Lei Li, Zefa Hu, Junlan Feng, Qi Liu

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对LLM驱动演化全程用强模型成本高的问题,提出无需训练的自适应种群交接框架,通过廉价模型探索、中继增益触发交接,在12个测试设置中11个获最高平均分数,性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05303 2026-08-07 cs.AR cs.CL cs.LG 新提交 90%

EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding

EdgeXpert:一种基于混合专家与推测解码的内存高效型大语言模型推理边缘设备

Sangwoo Ha, Hyunwoo Seo, Yurim Jo, Youngjin Moon, Hoi-Jun Yoo

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 EdgeXpert是一款软硬件协同设计的LLM加速器,通过优化预填充与解码阶段的专家处理,解决推测解码与MoE的兼容性问题,在降低延迟与能耗的同时维持精度,适用于边缘设备的LLM推理。

Comments Accepted at the 59th IEEE/ACM International Symposium on Microarchitecture (MICRO 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06135 2026-08-07 cs.LG 新提交 89%

LLM Inference Under Bursty Workload Distribution: Modifying the WAIT Algorithm

突发工作负载分布下的大语言模型推理:对WAIT算法的改进

Anjali Gangadhar Katageria, Shobha Rani, Raghu Nandan Sengupta

机构 * Indian Institute of Technology Dharwad(印度达尔瓦德印度理工学院) Indian Institute of Technology Kanpur(印度坎普尔印度理工学院)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究针对LLM推理中突发工作负载的问题,改进了WAIT算法,通过在线估计请求强度提升了低到达率变化场景下的吞吐量,且延迟与现有基准相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03873 2026-08-07 cs.LG cs.CL 版本更新 88%

SODA: Semi On-Policy Black-Box Distillation for Large Language Models

SODA:大语言模型的半在线盒式知识蒸馏

Xiwen Chen, Jingjing Wang, Wenhui Zhu, Peijie Qiu, Xuanzhao Dong, Yueyue Deng, Hejian Sang, Zhipeng Wang, Alborz Geramifard, Feng Luo

机构 * Clemson University(克莱姆森大学) LinkedIn(领英) Washington University in St. Louis(圣路易斯华盛顿大学) Arizona State University(亚利桑那州立大学) Columbia University(哥伦比亚大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出SODA,一种高效的半在线盒式知识蒸馏方法,通过对比教师最优响应与学生静态输出,实现高质量分布对齐,无需动态回放和对抗平衡,提升蒸馏效率和稳定性。

Comments Efficient Reasoning@COLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06183 2026-08-07 cs.AI 新提交 87%

MicroEvo: Knowledge-Guided LLM Sampling for Efficient Microarchitecture Design Space Exploration

MicroEvo:知识引导的大语言模型采样用于高效微架构设计空间探索

Jia Xiong, Runkai Li, Chenxu Niu, Guangyuan Gao, Changwen Xing, Yifan Zhang, Xinlai Wan, Jieran Cui, Chen Bai, Yusheng Hua, Ying Wang, Ming Ling, Xi Wang, Tao Xie

机构 * Southeast University(东南大学) National Center of Technology Innovation for EDA(国家EDA技术创新中心) NVIDIA Corporation(英伟达公司) Fudan University(复旦大学) Nanjing University of Posts and Telecommunications(南京邮电大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Peking University(北京大学)

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.AI

AI总结 MicroEvo是结合LLM与MCTS的知识引导框架,用于多目标微架构优化,可提升帕累托前沿质量与搜索效率,具备工业级可扩展性。

Comments Accepted by ICCAD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05791 2026-08-07 cs.MA cs.AI 新提交 87%

A Two-Tier Perspective on Inference-Time Parallelism in Multi-Agent LLM Systems

多智能体大语言模型系统推理时并行性的两层视角

Zihan Xu, Haolin Tian, Hai Jiang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出整合两类并行性的TIPEX框架,在GAIA基准上验证推理时并行性可提升多智能体系统性能,中等难度任务从两类并行性协调中获益最多。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28617 2026-08-07 cs.AI cs.CL cs.CY cs.HC 版本更新 87%

AISPA: User-Centric System Prompt Auditing for Large Language Model Applications

AISPA:面向大语言模型应用的以用户为中心的系统提示审计框架

Xiangning Lin, Shenzhe Zhu, Shu Yang, Zhenyu Zhang, Haoqian Zhang, Yipeng Zhao, Chengxuan Qian, Tianwei Wang, Ziheng Zhang, Zhenlong Yuan, Dingcheng Wang, Juncheng Wu, Yuan Si, Jiaxin Liu, Baolong Bi, Robert Mahari, Tobin South, Dazza Greenwood, Zexue He, Rishi Bommasani, Sophia Kazinnik, Andreas Haupt, Samuele Marro, Erik Brynjolfsson, Alex Pentland, Jiaxin Pei

机构 * Stanford University(斯坦福大学) CMU(卡内基梅隆大学) UT Austin(德克萨斯大学奥斯汀分校) University of Toronto(多伦多大学) UCSB(加利福尼亚大学圣巴巴拉分校) WashU(华盛顿大学) OSU(俄亥俄州立大学) UCSC(加利福尼亚大学圣克鲁兹分校) Northwestern University(西北大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) KAUST(阿卜杜拉国王科技大学) MIT(麻省理工学院) University of Oxford(牛津大学) Institute for Decentralized AI(去中心化人工智能研究所)

专题命中 效率与部署 :large language model(title);language model(title);foundation model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出以用户为中心的AISPA框架,审计88款商业AI产品的3249条系统提示指令,发现其设计差异大、保护指令范围浅、长度增长但仍存问题指令,凸显系统提示需更高透明度与监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13105 2026-08-07 cs.AR 版本更新 86%

Knowledge-Driven Hybrid SSD Management Enhanced by Fine-Tuned LLMs

微调大语言模型(LLMs)增强的知识驱动混合固态硬盘(SSD)管理

Qian Wei, Yi Li, Zehao Chen, Tianren Zhou, Zhaoyan Shen, Dongxiao Yu, Bingzhe Li

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 该研究提出LLM-hybridSSD框架,将混合SSD管理转化为参数调优问题,结合LLM与强化学习优化,使吞吐量平均提升58.92%、写放大降低28.56%。

Comments DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02940 2026-08-07 cs.AI 版本更新 85%

When Compression Scores Cannot Decide: Information Boundaries for Group-Robust LLM Pruning

当压缩分数无法做出决策时:群体鲁棒大语言模型剪枝的信息边界

Andrew Zhang

机构 * KTH Royal Institute of Technology(皇家理工学院)

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.AI

AI总结 该研究针对压缩统计量无法准确选择群体鲁棒 LLM 剪枝候选的问题,通过信息接口建模偏差,提出粗粒度深度分配等方法,实现最差群体困惑度与 KL 散度降低,提升剪枝效果。

Comments 19 pages, 6 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26828 2026-08-07 cs.LG cs.AI 版本更新 84%

Budget-Aware LLM Discovery via Cost-Calibrated Frontier Utility

基于成本校准前沿效用的预算感知大语言模型发现

Yansen Zhang, Yilu Liu, Tianyu Liu, Jiamin Chen, Xiaokun Zhang, Kai Xie, Xue Liu, Yiyan Qi, Chen Ma

机构 * City University of Hong Kong(香港城市大学) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) International Digital Economy Academy (IDEA)(国际数字经济学院)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对大语言模型发现的成本问题,提出 CostAda 成本自适应控制器,通过成本校准前沿效用优化预算使用,在多基准测试中以更少预算达到或超越现有模型的质量表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07568 2026-08-07 cs.LG cs.AI 版本更新 84%

d3LLM: Ultra-Fast Diffusion LLM using Pseudo-Trajectory Distillation

d3LLM:基于伪轨迹蒸馏的超快扩散大语言模型

Yu-Yang Qian, Junda Su, Lanxiang Hu, Peiyuan Zhang, Zhijie Deng, Peng Zhao, Hao Zhang

机构 * University of California, San Diego(加州大学圣地亚哥分校) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 d3LLM通过伪轨迹蒸馏和熵基多块解码技术,在提升并行性的同时保持准确性,实现超快的扩散大语言模型。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05499 2026-08-07 cs.CV cs.AI cs.LG 新提交 82%

APQF: Agentic Profiling-Guided Structured Pruning and Mixed-Precision Quantization with Adaptive Fine-Tuning

APQF:基于智能体分析引导的结构化剪枝与混合精度量化及自适应微调

Sadegh Jafari, Mohiuddin Bilwal, Fan Zhou, Brian Gelder, Ali Jannesari

机构 * Iowa State University(爱荷华州立大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 APQF是结合LLM引导与分析支撑的自动化剪枝量化框架,在ImageNet等数据集上实现高压缩比且精度接近基线,优于现有联合剪枝量化方法。

Comments 22 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06153 2026-08-07 cs.SE cs.AI 新提交 81%

Learning Globally Reusable Skills for Coding Agents

为编码智能体学习全局可复用技能

Chen Yang, Jiashuo Tian, Ziqi Wang, Xinyin Liu, Meiru Ye, Junjie Chen

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对编码智能体技能进化的过拟合与泛化问题,提出GSE框架,通过技能关系图、聚类整合与回放验证优化,在多个编码任务与智能体上实现性能提升,效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09297 2026-08-07 cs.SE cs.AI 版本更新 81%

SkillMOO: Multi-Objective Optimization of Agent Skills for Software Engineering

SkillMOO:软件工程中代理技能的多目标优化

Jingzhi Gong, Ruizhen Gu, Zhiwei Fei, Yazhuo Cao, Lukas Twist, Alina Geiger, Shuo Han, Dominik Sobania, Federica Sarro, Jie M. Zhang

机构 * King's College London(伦敦国王学院) Queen's University Belfast(贝尔法斯特女王大学) Nanjing University(南京大学) Johannes Gutenberg University Mainz(美因茨约翰尼斯·古滕贝格大学) University College London(伦敦大学学院) University of Duisburg-Essen(杜伊斯堡- Essen大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出SkillMOO框架,通过LLM提议的编辑和NSGA-II算法优化代理技能包,提升任务成功率并降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05240 2026-08-07 quant-ph cs.AI cs.LG 新提交 81%

One Qubit Can Beat One Bit: Quantum Advantage for Post-Training Quantization

一个量子比特可胜过一个比特:后训练量化的量子优势

Yuma Ichikawa, Moeto Mishima

专题命中 效率与部署 :post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究提出量子随机存取量化(QRAQ)框架,证明其在重构风险等方面优于共享符号的1比特后训练量化,展现了后训练量化中的量子优势。

Comments 40 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06031 2026-08-07 cs.LG 新提交 79%

Dynamic Graph Prompting via Topology-Routed Mixed-Curvature Experts

基于拓扑路由的混合曲率专家的动态图提示

Quanxin Wang, Xuanting Xie, Bingheng Li, Xingtong Yu, Shuo Wang, Ruiyi Fang, Zhao Kang

专题命中 效率与部署 :prompting(title,abstract);分类 cs.LG

AI总结 本研究针对动态图提示的几何适配不足问题,提出CurvPrompt框架,通过拓扑路由混合曲率专家实现自适应表示,在少样本链接预测和节点分类任务上表现优异,验证了几何自适应提示的必要性。

Comments Suggestions and comments are welcomed

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01263 2026-08-07 cs.LG 版本更新 79%

Distill What the Student Can See: Fisher-Projected On-Policy Distillation for Vision-Language Models

提炼学生可见内容:面向视觉语言模型的Fisher投影在线策略蒸馏

Leyan Xue, Feng Xiong, Mingjun Ma, Changqing Zhang

专题命中 效率与部署 :language model(title,abstract);分类 cs.LG

AI总结 针对视觉语言模型在线策略蒸馏中教师修正与学生能力不匹配的问题,提出FP-OPD方法,在8B到2B的蒸馏中使7个多模态基准平均得分分别提升2.77和1.60个点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12617 2026-08-07 cs.LG cs.AI 版本更新 79%

When Drafts Evolve: Speculative Decoding Meets Online Learning

当草稿进化:推测解码与在线学习的交汇

Yu-Yang Qian, Hao-Cong Wu, Yichao Fu, Hao Zhang, Peng Zhao

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 效率与部署 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出OnlineSpec框架,利用交互反馈持续进化草稿模型,通过动态遗憾最小化建立在线学习性能与推测系统加速率的联系,实现24%的加速提升。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02551 2026-08-07 cs.LG cs.AI 版本更新 79%

CUDA-L2: Surpassing cuBLAS Performance for Matrix Multiplication through Reinforcement Learning

CUDA-L2:通过强化学习超越cuBLAS在矩阵乘法上的性能

Songqiao Su, Xiaoya Li, Albert Wang, Guoyin Wang, Jiwei Li, Chris Shum

机构 * DeepReinforce Team(DeepReinforce 团队)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究提出CUDA-L2系统,结合大语言模型与强化学习自动优化HGEMM的CUDA内核,以CUDA执行速度为奖励,在多种配置上优化。实验表明其在离线和服务器模式下均超越主要基线,证明可通过该方法改进关键内核。

Comments Project code: github.com/ornith-ai/CUDA-L2

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18141 2026-08-07 cs.DC 版本更新 78%

A CXL Memory Rack for Multi-Turn LLM Serving

HyMCache:一种用于多轮大语言模型服务的基于CXL混合内存的键值缓存框架

Hakbeom Jang, Inho Song, Hoshik Kim, Sam H. Noh, Jongryool Kim

专题命中 效率与部署 :LLM(title,abstract)

AI总结 研究针对多轮大语言模型服务中键值缓存重用问题,提出HyMCache框架集成CXL混合内存。利用多轮缓存访问特性优化DRAM管理,通过请求级前缀预取等技术,在真实原型上评估,相比其他方案有性能优势且节省DRAM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06347 2026-08-07 cs.CL 新提交 77%

RP-OPSD: Reasoning-Pivot-Guided On-Policy Self-Distillation for Multilingual Reasoning Transfer

RP-OPSD:基于推理枢轴引导的多语言推理迁移在线策略自蒸馏

Xinye Wang, Junxiao Liu, Shujian Huang

机构 * Nanjing University(南京大学)

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对多语言推理迁移中现有在线策略自蒸馏未优先考虑关键推理信号的问题,提出 RP-OPSD 方法,利用教师视图分布偏移引导特权蒸馏,在 17 种语言的数学推理基准上优于基线,提升了多语言推理能力。

Comments 16 pages. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05131 2026-08-07 cs.CV cs.AI 版本更新 77%

OPD-V: Visual On-Policy Self-Distillation with Modality Balance

OPD-V:结合模态平衡的视觉在线策略自蒸馏

Aniri, Jinhe Bi, Peng Liao, Zengjie Jin, Volker Tresp, Fei Shen, Yunpu Ma, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Ludwig Maximilian University of Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Sun Yat-sen University(中山大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 该研究针对多模态大语言模型的模态不平衡问题,提出视觉在线策略自蒸馏范式OPD-V,通过正、负教师模型实现模态平衡,在多基准与骨干上提升推理性能并降低训练成本。

Comments Corrected the uploaded manuscript. Project Page:https://github.com/aniri15/OPD-V

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05959 2026-08-07 cs.SE 新提交 75%

AgentExecutor: Partial Code Execution via Agentic Context Generation

AgentExecutor:基于智能体上下文生成的部分代码执行工具

Junkai Chen, Chengran Yang, Xing Hu, Zhenhao Li, Xin Xia, David Lo

专题命中 效率与部署 :LLM(abstract,abstract_cn);language model(abstract)

AI总结 本文提出多智能体框架AgentExecutor,通过三阶段设计和自适应优化策略提升部分代码执行效果,在两个数据集上的覆盖度、执行时间和成本均优于现有最优方法Treefix。

Comments ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04884 2026-08-07 cs.CV 版本更新 75%

HunyuanOCR-1.5: Making Lightweight OCR VLMs Faster and Better

浑元OCR-1.5:让轻量级OCR视觉语言模型更快更好

Gengluo Li, Xingyu Wan, Shangpin Peng, Weinong Wang, Hao Feng, Yongkun Du, Binghong Wu, Zheng Ruan, Zhiqiong Lu, Liang Wu, Pengyuan Lyu, Huawen Shen, Zibin Lin, Shijing Hu, Jieneng Yang, Hongbing Wen, Guanghua Yu, Hong Liu, Bochao Wang, Can Ma, Han Hu, Chengquan Zhang, Yu Zhou

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Large Language Model Department, Tencent(腾讯大语言模型部) Nankai University(南开大学)

专题命中 效率与部署 :language model(abstract);pretraining(abstract);post-training(abstract)

AI总结 研究改进轻量级端到端OCR视觉语言模型。基于HunyuanOCR-1.0架构,用DFlash提升效率,提出Agentic Data Flow增强能力,在多任务表现出色,还将发布模型权重和代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05604 2026-08-07 cs.CL cs.AI 新提交 73%

SkillZip: Contract-Preserving Graph Compression for Scalable Agent Skill Libraries

SkillZip:用于可扩展智能体技能库的保留契约的图压缩方法

Xingyu Tan, Xiaoyang Wang, Qing Liu, Xiwei Xu, Xin Yuan, Liming Zhu, Wenjie Zhang

机构 * UNSW(新南威尔士大学) CSIRO(联邦科学与工业研究组织)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 SkillZip是一种执行感知的过程抽象框架,通过对节级图进行保留契约的压缩,解决了智能体技能库的可扩展问题,在基准测试中优于基线,实现了高压缩率和稳健检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05168 2026-08-07 cs.AI cs.CL 新提交 73%

Woodpecker Distillation: Weak Models Diagnose Reasoning Bugs in Strong Models

啄木鸟蒸馏:弱模型诊断强模型中的推理错误

Dayu Wang, Jiaye Yang, Weikang Li, Jiahui Liang, Yang Li, Deguo Xia, Jizhou Huang

机构 * Baidu Inc.(百度公司) Nanyang Technological University(南洋理工大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出Woodpecker Distillation框架,通过弱模型的局部干预对比学习,修复强模型的推理错误,在数学推理基准上提升了强模型性能且优于直接模仿基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02691 2026-08-07 cs.LG cs.AI 版本更新 73%

Output-Aware Rotation for INT2 KV-Cache Quantization

面向INT2 KV缓存量化的输出感知旋转

Vincent-Daniel Yun, Woosang Lim, Minsoo Cheong, Sunwoo Lee, Murali Annavaram, Sai Praneeth Karimireddy, Sungjoo Yoo

机构 * University of Southern California(南加州大学) Seoul National University(首尔大学) Inha University(仁荷大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对长上下文大模型KV缓存的INT2量化瓶颈,提出OptR输出感知旋转方法,通过分解误差、学习正交修正等,提升QuaRot等性能并增强长上下文检索能力,且开销可忽略。

详情

展开后加载摘要…

URL PDF HTML 收藏