arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-27 至 2026-05-27 共收录 437 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 74 篇

2605.26489 2026-05-27 cs.LG 83%

The Stability of Singular Distribution: A Spectral Perspective on the Two-Phase Dynamics of Language Model Pre-training

奇异分布的稳定性:语言模型预训练两阶段动力学的谱视角

Hongtao Zhang, Wenjie Zhou, Chenxi Jia, Wei Chen, Xueqi Cheng

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学先进交叉学科学院) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(中国科学院人工智能安全国家重点实验室) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) School of Mathematics, Southeast University, Nanjing, China(东南大学数学学院)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.LG

AI总结 本文发现语言模型预训练中奇异值谱的早期稳定现象(SoSD),并证明该现象与慢下降阶段同步,通过理论分析揭示了权重范数增长导致SoSD阈值,从而限制后续损失下降速率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27130 2026-05-27 cs.LG cs.AI 82%

DEI: Diversity in Evolutionary Inference for Quality-Diversity Search

DEI:质量-多样性搜索中的进化推理多样性

John Donaghy, Shikhar Rastogi

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出DEI框架,通过异构大语言模型作为变异算子进行分布式质量-多样性搜索,实验表明模型多样性比并行性更能提升搜索性能。

Comments Accepted to ICML 2026 Workshop Scalable Learning and Optimization for Efficient Multimodal AI Agents (SCALE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19420 2026-05-27 cs.CR cs.AI cs.LG cs.MA math.OC 82%

Securing Multi-Agent Systems Against Corruptions via Node Contribution Backpropagation

通过节点贡献反向传播保护多智能体系统免受腐败影响

Chengcan Wu, Zhixin Zhang, Mingqian Xu, Zeming Wei, Meng Sun

机构 * Peking University(北京大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对多智能体系统中对抗性智能体注入误导信息的问题,提出一种基于有向无环图的反向传播动态防御方法,通过计算每个智能体对最终决策的贡献来识别和隔离恶意智能体,实验表明该方法优于现有防御机制。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27361 2026-05-27 cs.AI cs.SY eess.SY 81%

Natural Language Query to Configuration for Retrieval Agents

面向检索代理的自然语言查询到配置

Melissa Z. Pan, Negar Arabzadeh, Mathew Jacob, Fiodar Kazhamiaka, Esha Choukse, Matei Zaharia

机构 * UC Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学) Microsoft Azure Research - Systems(微软Azure研究 - 系统)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出BRANE方法,利用LLM将查询转换为工作负载特征,并训练轻量级预测器选择最优配置,在多个基准上实现成本-质量帕累托前沿的优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27220 2026-05-27 cs.CL cs.IR 81%

The Coverage Illusion: From Pre-retrieval Routing Failure to Post-retrieval Cascades in a Production RAG System

覆盖幻觉:从检索前路由失败到生产RAG系统中的检索后级联

Zafar Hussain, Kristoffer Nielbo

机构 * Aarhus University(奥胡斯大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文通过丹麦国家百科全书的案例研究,发现合成查询高估了LLM增强的需求(覆盖幻觉),并提出一种检索后级联策略,按成本递增顺序执行工作流,仅在无结果时升级到LLM增强,从而在无需训练开销的情况下提升质量并降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02192 2026-05-27 cs.LG cs.DC 81%

ECHO-2: A Large-Scale Distributed Rollout Framework for Cost-Efficient Reinforcement Learning

ECHO-2: 一种面向经济高效强化学习的大规模分布式推演框架

Jingwei Song, Meng Chen, Jie Xiao, Qingnan Ren, Jiaqi Huang, Yangshen Deng, Chris Tong, Wanyi Chen, Suli Wang, Zhisheng Chen, Ziqian Bi, Shuo Lu, Yiqun Duan, Xu Wang, Rymon Yu, Lynn Ai, Eric Yang, Tianyu Shi

机构 * The University of Hong Kong(香港大学) Fudan University(复旦大学) Gradient University of Edinburgh(爱丁堡大学) Soochow University(苏州大学) Technical University of Darmstadt(达姆施塔特技术大学) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出ECHO-2分布式强化学习框架,通过重叠推演生成、传播与训练,结合对等辅助流水线广播和成本感知异构工作节点激活,在保持奖励性能的同时显著提升成本效率。

Comments 24 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11063 2026-05-27 cs.AI cs.CR 81%

Think Twice Before You Act: Enhancing Agent Behavioral Safety with Thought Correction

三思而后行:通过思想修正增强智能体行为安全

Changyue Jiang, Wenqi Zhang, Xudong Pan, Geng Hong, Min Yang

机构 * Fudan University, Shanghai, China(复旦大学,上海,中国) Shanghai Innovation Institute, Shanghai, China(上海创新研究院,上海,中国) Shanghai Pudong Research Institute of Cryptology, Shanghai, China(上海浦东密码研究院,上海,中国)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出Thought-Aligner,一种轻量级插件式安全模型,在动作执行前对不安全思想进行因果修正,无需修改底层智能体,通过两阶段对比学习训练,在多个基准和六种LLM上将行为安全从约50%提升至约90%,超越现有防护约23%,同时提升有用性约5%。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07190 2026-05-27 cs.CY cs.AI cs.LG 81%

The ATOM Report: Measuring the Open Language Model Ecosystem

ATOM报告:衡量开放语言模型生态系统

Nathan Lambert, Florian Brand

机构 * Interconnects AI

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究通过分析约1500个主流开放语言模型(如阿里巴巴的Qwen、DeepSeek、Meta的Llama)的下载量、衍生模型、推理市场份额和性能指标,揭示了2025年夏季中国模型超越美国模型并持续扩大差距的趋势。

Comments 23 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26486 2026-05-27 cs.CV 80%

LongCat-Video-Avatar 1.5 Technical Report

LongCat-Video-Avatar 1.5 技术报告

Meituan LongCat Team, Xunliang Cai, Meng Cheng, Feng Gao, Zhe Kong, Jiamu Li, Le Li, Weiheng Li, Hongyu Liu, Shuai Tan, Xiaoming Wei, Tianyu Yang, Yong Zhang

机构 * Meituan LongCat Team(美团LongCat团队)

专题命中 效率与部署 :RLHF(summary_cn,abstract)

AI总结 本文提出 LongCat-Video-Avatar 1.5,一个通过升级音频编码器、优化训练策略、数据筛选和RLHF训练实现高精度唇同步、全身时间稳定性和长视频生成的开放框架,在多个基准测试中达到或超越商业系统性能。

Comments Homepage: https://meigen-ai.github.io/LongCat-Video-Avatar-1.5-Page/ Github: https://github.com/meituan-longcat/LongCat-Video

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26297 2026-05-27 cs.DC 80%

Agentic AI Workload Characteristics

Agentic AI 工作负载特征

Yichao Yuan, Ankita Nayak, Souvik Kundu, Nishil Talati

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 本文通过端到端追踪基础设施,在五个智能体基准测试上刻画 ReAct 风格智能体的 LLM 服务和工具执行特征,发现智能体工作负载并非简单长提示工作负载,其执行以解码为主且依赖长寿命 KV 缓存状态,工具使用具有从读/探索到执行/写的时序结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28096 2026-05-27 cs.NI 80%

Beyond Traffic Matrix: DELTA -- A DAG-Aware OCS Logical Topology Optimization for AIDCs

超越流量矩阵:DELTA——一种面向AIDC的DAG感知OCS逻辑拓扑优化

Niangen Ye, Jingya Liu, Guofu Zhu, Weiqiang Sun, Weisheng Hu

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出DELTA框架,利用计算通信有向无环图(DAG)将时变流量模式编码为混合整数线性规划(MILP)模型,通过可变长度时间间隔公式和双轨加速策略优化光学电路开关(OCS)逻辑拓扑,减少通信时间并节省光端口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27156 2026-05-27 cs.CL cs.AI 79%

LitSeg: Narrative-Aware Document Segmentation for Literary RAG

LitSeg: 面向文学RAG的叙事感知文档分割

Ruikang Zhang, Zhanni Chen, Yiqiao Cai, Qi Su

机构 * Peking University(北京大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 提出LitSeg,一种基于叙事理论引导的文档分割框架,通过多阶段提示提取事件、梳理叙事线索并定位转折点,以解决现有分割方法忽视文学叙事结构导致检索与生成性能下降的问题,并引入轻量版LitSeg-Lite通过数据蒸馏降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26178 2026-05-27 cs.MA cs.LG 77%

ATOM: Instantiating Budget-Controllable Multi-Agent Collaboration via Nucleus-Electron Hierarchy

ATOM: 通过核-电子层次结构实例化预算可控的多智能体协作

Xinkui Zhao, Sai Liu, Yifan Zhang, Qingyu Ma, Zewen Lin, Naibo Wang, Guanjie Cheng, Chang Liu, Yueshen Xu

机构 * Zhejiang University(浙江大学) Ningbo Global Innovation Center, Zhejiang University(浙江大学宁波全球创新中心) Zhejiang Key Laboratory of Digital-Intelligence Service Technology(浙江省数字智能服务技术重点实验室) Xidian University(西安电子科技大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出ATOM框架,采用核-电子层次结构和任务驱动强化学习,生成预算可控的协作图,在保持性能的同时将token效率提升高达30%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27081 2026-05-27 cs.LG cs.AI cs.DC 76%

ReMoE: Boosting Expert Reuse through Router Fine-Tuning in Memory-Constrained MoE LLM Inference

ReMoE: 在内存受限的MoE大模型推理中通过路由器微调提升专家重用

Xiongwei Zhu, Xiaojian Liao, Tianyang Jiang, Yusen Zhang, Liang Wang, Limin Xiao

机构 * School of Computer Science and Engineering, Beihang University, Beijing 100191, China(北京航空航天大学计算机科学与工程学院) Huawei Technologies Ltd(华为技术有限公司)

专题命中 效率与部署 :LLM(title);分类 cs.AI、cs.LG

AI总结 提出ReMoE路由器微调框架,通过偏向近期选中的专家实现时间稳定的路由,减少专家从外部存储的获取次数,在保持下游任务性能的同时提升专家重用26%,并在实际系统中实现8.4%的吞吐量提升和1.77-1.99倍的解码加速。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27358 2026-05-27 cs.LG cs.AI cs.CL 75%

MobileMoE: Scaling On-Device Mixture of Experts

MobileMoE: 扩展设备端混合专家模型

Yanbei Chen, Hanxian Huang, Ernie Chang, Jacob Szwejbka, Digant Desai, Zechun Liu, Vikas Chandra, Raghuraman Krishnamoorthi

机构 * Meta AI

专题命中 效率与部署 :LLM(abstract_cn);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对设备端部署,提出MobileMoE系列子十亿参数MoE语言模型,通过联合优化架构和四阶段训练,在14个基准上匹配或超越领先的密集模型和MoE模型,并在智能手机上实现高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01336 2026-05-27 cs.CL cs.AI cs.LG 75%

HiSpec: Hierarchical Speculative Decoding for LLMs

HiSpec: 分层推测解码用于大语言模型

Avinash Kumar, Sujay Sanghavi, Poulami Das

机构 * Department of Electrical and Computer Engineering, The University of Texas at Austin(德克萨斯大学奥斯汀分校电子与计算机工程系)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出HiSpec框架,利用早期退出模型进行低开销中间验证,通过重用键值缓存和隐藏状态提高吞吐量,平均加速1.28倍,最高2.01倍,且不损失准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04275 2026-05-27 cs.CR cs.AI cs.CL 73%

Shadow Unlearning: A Neuro-Semantic Approach to Fidelity-Preserving Faceless Forgetting in LLMs

影子遗忘:一种面向LLM保真保留的无面孔遗忘的神经语义方法

Dinesh Srivasthav P, Ashok Urlana, Rahul Mishra, Bala Mallikarjunarao Garlapati, Ponnurangam Kumaraguru

机构 * TCS Research, Hyderabad(TCS研究院,海得拉巴) IIIT Hyderabad(IIIT海得拉巴)

专题命中 效率与部署 :LLM(title_cn);分类 cs.CL、cs.AI

AI总结 提出影子遗忘范式,通过神经语义投影器遗忘(NSPU)框架在匿名化遗忘数据上实现机器遗忘,保护隐私的同时保持模型效用,计算效率提升至少10倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27360 2026-05-27 cs.NI cs.AI 70%

GENESIS: Harnessing AI Agents for Autonomous 6G RAN Synthesis, Research, and Testing

GENESIS: 利用AI智能体实现自主6G RAN合成、研究与测试

Tamerlan Aghayev, Maxime Elkael, Michele Polese, Minh Dat Nguyen, Gabriele Gemmi, Andrea Lacava, Ali Saeizadeh, Reshma Prasad, Paolo Testolina, Angelo Feraudo, Soumendra Nanda, Pedram Johari, Salvatore D'Oro, Tommaso Melodia

机构 * Institute for Intelligent Networked Systems(智能网络系统研究所)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出GENESIS框架,通过智能体、技能和钩子三种可组合原语及知识层SYNAPSE,将意图转化为经空口实验验证的解决方案,以加速6G无线接入网研发。

Comments 18 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27186 2026-05-27 cs.CL 70%

MAIGO: Mitigating Lost-in-Conversation with History-Cleaned On-Policy Self-Distillation

MAIGO: 通过历史清理的在线策略自蒸馏缓解对话丢失

Haoyu Zheng, Yun Zhu, Shu Yuan, Shangming Chen, Qing Wang, Wenqiao Zhang, Jun Xiao, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) Huazhong University of Science and Technology(华中科技大学) Fuzhou University(福州大学) Tencent(腾讯)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对大语言模型在多轮对话中性能下降(对话丢失)的问题,提出MAIGO方法,通过在线策略自蒸馏和清理历史助手回复来减少自污染,无需验证器或推理时辅助,显著提升多轮对话准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27030 2026-05-27 cs.CL 70%

Share More, Search Less: Collaborative Parallel Thinking for Efficient Test-Time Scaling

分享更多,搜索更少:面向高效测试时间扩展的协作并行思考

Xinglin Wang, Hao Lin, Shaoxiong Feng, Peiwen Yuan, Yiwei Li, Jiayi Shi, Yueqi Zhang, Chuyi Tan, Ji Zhang, Boyuan Pan, Yao Hu, Kan Li

机构 * School of Computer Science, Beijing Institute of Technology(北京理工大学计算机学院) Xiaohongshu Inc(小红书公司)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出一种无需训练的协作并行思考框架,通过在并行分支间共享搜索信息来减少冗余探索,从而在测试时间扩展中实现更优的准确率-延迟帕累托边界。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26952 2026-05-27 cs.CL 70%

Efficient Agentic Reinforcement Learning with On-Policy Intrinsic Knowledge Boundary Enhancement

基于策略内在知识边界增强的高效智能体强化学习

Dingwei Chen, Zefang Zong, Zhipeng Ma, Leo Luo, Yang Li, Chengming Li, Peng Chen, Jie Jiang

机构 * Tencent Inc(腾讯公司) The Chinese University of Hong Kong(香港中文大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出AKBE方法,通过双路径(有工具和无工具)在线策略训练动态探测模型内在知识边界,构建针对性监督信号,在保持准确率的同时减少工具调用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26289 2026-05-27 cs.LG 70%

Stateful Inference for Low-Latency Multi-Agent Tool Calling

面向低延迟多智能体工具调用的有状态推理

Victor Norgren

机构 * LayerScale, Inc.(LayerScale公司)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出一种有状态推理架构,通过持久化KV缓存和增量处理,将多智能体工具调用的每轮成本从O(n_t)降至O(Δ_t),在6轮和35轮工作流中分别实现2.1倍和4.2倍的加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17617 2026-05-27 cs.AI 70%

GraphMind: From Operational Traces to Self-Evolving Workflow Automation

GraphMind:从操作轨迹到自演化工作流自动化

Yiwen Zhu, Joyce Cahoon, Anna Pavlenko, Qiushi Bai, Nima Shahbazi, Divya Vermareddy, Meina Wang, Mathieu Demarne, Swati Bararia, Wenjing Wang, Hemkesh Vijaya Kumar, Hannah Lerner, Katherine Lin, Steve Toscano, Miso Cilimdzic, Subru Krishnan

机构 * Microsoft, USA University of Illinois Chicago, USA Microsoft, Spain

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出GraphMind系统,通过离线提取因果工作流图、在线多智能体遍历执行和自适应遍历强化,实现云数据库事故调查中的自动化工作流,相比基线方法减少8倍检索上下文并降低26%幻觉率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18103 2026-05-27 cs.AI 70%

Stability Implies Redundancy: Delta Attention Selective Halting for Efficient Long-Context Prefilling

稳定性意味着冗余:Delta注意力选择性停止用于高效长上下文预填充

Yujie Chen, Tailai Chen, Yifeng Gao, Zoe Wanying He, Yijue Xu, Shaobo Wang, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) University of California, San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对长上下文场景中预填充计算成本高的问题,提出一种无需训练的Delta注意力选择性停止策略(DASH),通过监控自注意力层更新动态来停止稳定令牌的处理,从而在不牺牲模型准确性和硬件效率的前提下实现预填充加速。

Comments Accepted to ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01518 2026-05-27 cs.AI 70%

Qrita: High-performance Top-k and Top-p using Pivot-based Truncation and Selection

Qrita:使用基于枢轴的截断和选择的高性能Top-k和Top-p

Jongseok Park, Sunga Kim, Alvin Cheung, Ion Stoica

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出Qrita算法,通过基于高斯sigma截断和四元枢轴搜索的枢轴方法,高效实现Top-k和Top-p采样,在保持与排序算法相同输出的同时,将端到端服务吞吐量提升至1.4倍并减少一半内存使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27238 2026-05-27 cs.SE 67%

EviACT: An Evidence-to-Action Framework for Agentic Program Repair

EviACT:一种面向智能体程序修复的证据到行动框架

Qianru Meng, Xiao Zhang, Zhaochun Ren, Joost Visser

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 提出EviACT框架,通过协调三个证据驱动的防护栏(检索支架、编译门、测试驱动门)来提升智能体程序修复的定位、生成和验证效率,在多个基准上修复率提升1.6-6.0个百分点,API成本降低70.1-88.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26584 2026-05-27 cs.CV 67%

O-MARC: Omni Memory-Augmented Compression Distillation for Efficient Video Understanding

O-MARC: 全记忆增强压缩蒸馏用于高效视频理解

Peiran Wu, Yunze Liu, Chi-Hao Wu, Chen Chen, Junxiao Shen

机构 * University of Bristol(布里斯托大学) Memories.ai Research(Memories.ai研究院) University of Central Florida(佛罗里达中央大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 提出O-MARC框架,通过无训练压缩方法OMAC保留视觉记忆和音频锚点,并利用压缩蒸馏使紧凑模型鲁棒,在多个基准上提升性能并降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26558 2026-05-27 cs.AR 67%

Cassandra: Enabling Reasoning LLMs at Edge via Self-Speculative Decoding

Cassandra: 通过自推测解码在边缘设备上实现推理型大语言模型

Soongyu Choi, Yuntae Kim, Muyoung Son, Joo-Young Kim

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 提出Cassandra算法-硬件协同设计的自推测解码框架,通过细粒度数据选择和无训练剪枝与尾数截断构建高性能草稿模型,实现低批量场景下高达2.41倍加速。

Comments To appear at ISCA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05204 2026-05-27 cs.CV 67%

D-OPSD: On-Policy Self-Distillation for Continuously Tuning Step-Distilled Diffusion Models

D-OPSD:用于连续调优步蒸馏扩散模型的在线自蒸馏方法

Dengyang Jiang, Xin Jin, Dongyang Liu, Zanyi Wang, Mingzhe Zheng, Ruoyi Du, Xiangpeng Yang, Qilong Wu, Zhen Li, Peng Gao, Harry Yang, Steven Hoi

机构 * The Hong Kong University of Science and Technology(香港科技大学) Z-Image Team, Alibaba Group(阿里集团Z-Image团队) University of California, San Diego(加州大学圣地亚哥分校) The Chinese University of Hong Kong(香港中文大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 提出D-OPSD,一种在线自蒸馏训练范式,使步蒸馏扩散模型在监督微调中保持少步推理能力,通过让模型同时作为教师和学生,利用不同上下文条件(学生仅文本特征,教师多模态特征)最小化预测分布,学习新概念和风格而不牺牲原有少步能力。

Comments Project Page: https://vvvvvjdy.github.io/d-opsd/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26165 2026-05-27 cs.SE cs.AI cs.CL 62%

Tool-Schema Compression Enables Agentic RAG Under Constrained Context Budgets

工具模式压缩实现受限上下文预算下的智能体检索增强生成

Furkan Sakizli

机构 * Independent Researcher(独立研究者)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI

AI总结 针对智能体RAG系统中工具模式与检索上下文竞争资源的问题,提出工具模式压缩方法,在8K上下文预算下将平均精确匹配率提升20.5个百分点,并验证了压缩模式在超过800个工具时仍可运行。

Comments 12 pages (8 main + 4 appendix), 7 tables, 2 figures. Code and data: https://github.com/SKZL-AI/tscg

详情

展开后加载摘要…

URL PDF HTML 收藏