arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-26 至 2026-05-26 共收录 663 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 114 篇

2604.18170 2026-05-26 cs.CL cs.AI 88%

Copy-as-Decode: Grammar-Constrained Parallel Prefill for LLM Editing

Copy-as-Decode: 面向LLM编辑的语法约束并行预填充

Ziyang Liu

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出Copy-as-Decode机制,通过语法约束的并行预填充加速LLM编辑,实现高达303倍的自回归解码加速,并保持高覆盖率与无损性。

Comments The authors have decided to withdraw this version following internal review regarding authorship and contribution agreements

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23853 2026-05-26 cs.AI 87%

ClawTrace: Cost-Aware Tracing for LLM Agent Skill Distillation

ClawTrace: 面向LLM智能体技能蒸馏的成本感知追踪

Boqin Yuan, Yue Su, Renchu Song, Sen Yang, Jing Qin

机构 * University of California San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 针对技能蒸馏管道缺乏每步成本信号的问题,提出ClawTrace记录成本归因轨迹并生成TraceCard,通过CostCraft生成保留、剪枝和修复三类技能补丁,发现剪枝补丁作为质量护栏而保留补丁导致回归,主张按规则类型评估可复用技能。

Comments Accepted at Agent Skills '26 Workshop, ACM Conference on AI and Agentic Systems (CAIS 2026), San José, CA, May 26, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12116 2026-05-26 cs.AI cs.SE 87%

The A-R Behavioral Space: Execution-Level Profiling of Tool-Using Language Model Agents in Organizational Deployment

A-R行为空间:组织部署中工具使用语言模型代理的执行层剖析

Shasha Yu, Fiona Carroll, Barry L. Bentley

机构 * Cardiff School of Technologies, Cardiff Metropolitan University(卡迪夫技术学院,卡迪夫市政大学) School of Professional Studies, Clark University(专业研究学院,克拉克大学) Harvard Medical School, Harvard University(哈佛医学院,哈佛大学)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.AI

AI总结 提出基于动作率(A)和拒绝信号(R)的二维A-R空间及散度(D)来测量执行层行为,评估不同规范制度和自主性配置下语言模型代理的执行与拒绝分布模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24414 2026-05-26 cs.AI 87%

JT-SAFE-V2: Safety-by-Design Foundation Model with World-Context Data

JT-SAFE-V2:具有世界上下文数据的安全设计基础模型

Junlan Feng, Fanyu Meng, Chong Long, Pengyu Cong, Duqing Wang, Yan Zheng, Yuyao Zhang, Xuanchang Gao, Ye Yuan, Yunfei Ma, Zhijie Ren, Fan Yang, Na Wu, Di Jin, Chao Deng

机构 * JIUTIAN Research(九天研究院)

专题命中 效率与部署 :foundation model(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出JT-Safe-V2大语言模型,通过世界知识预训练、高确定性训练和安全强化后训练实现通用智能与安全设计的联合优化,并引入Safe-MoMA框架降低推理成本,在通用智能和安全基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24144 2026-05-26 cs.AR cs.LG 87%

EVA: Accelerating LLM Decoding via an Efficient Vector Quantization Architecture

EVA:通过高效向量量化架构加速大语言模型解码

Bowen Duan, Cong Guo, Chiyue Wei, Haoxuan Shan, Yuzhe Fu, Xinhua Chen, Yifan Xu, Ziyue Zhang, Changchun Zhou, Hai Li, Yiran Chen

机构 * Duke University(杜克大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对大语言模型解码阶段内存瓶颈和计算利用率低的问题,提出EVA架构,将GEMV计算转化为GEMM并消除内存冲突,实现最高11.17倍加速和7.17倍能效提升。

Comments 17 pages. Accepted to ISCA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24632 2026-05-26 cs.CR cs.AI cs.LG 87%

Demystifying the Mythos or Disrupting Bugonomics? From Zero-Day Asymmetry to Defender Remediation Throughput

揭秘神话或颠覆漏洞经济学?从零日不对称到防御者修复吞吐量

Alfredo Pesoli, Herman Errico, Lorenzo Cavallaro

机构 * University College London(伦敦大学学院) Bynario

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过漏洞经济学视角分析LLM驱动的漏洞发现,指出其核心影响并非增加零日漏洞,而是提升防御者修复吞吐量,并利用Anthropic Mythos预览和Mozilla Firefox合作数据论证这一转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25375 2026-05-26 cs.DC 87%

Bandwidth-Aware and Cost-Efficient Pipeline Parallel Scheduling in Geo-Distributed LLM Training

地理分布式大语言模型训练中带宽感知且成本高效的流水线并行调度

Han Zhang, Jianchun Liu, Hongli Xu

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 提出BACE-Pipe框架,通过动态作业优先级、带宽感知路径搜索和成本最小化分配,在异构带宽和电价下优化流水线并行调度,同时降低作业完成时间和总电费。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22774 2026-05-26 cs.AR cs.DC 87%

Characterizing CPU-Induced Slowdowns in Multi-GPU LLM Inference

多GPU大语言模型推理中CPU引起的性能下降特征分析

Euijun Chung, Yuxiao Jia, Aaron Jezghani, Hyesoon Kim

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 通过分析多GPU大语言模型推理负载,发现CPU资源不足导致GPU利用率低下,增加CPU核心数可显著提升性能并降低首令牌延迟。

Comments 13 pages, 13 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25203 2026-05-26 cs.LG cs.AI cs.LO 87%

Influence-Inspired Spectral Rotations for Extreme Low-Bit LLM Quantization

基于影响启发的谱旋转用于极端低位LLM量化

Gorgi Pavlov

机构 * Lehigh University(莱斯大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文利用伴随理论论文的影响自适应Walsh几何,通过WHT旋转和列缩放结合重构误差量化器,实现极端低位权重量化,在多个模型上降低困惑度15-58%。

Comments 14 pages, no figures. Companion application paper to arXiv:2605.01637 (theory). Code and pinned eval stack: https://github.com/gogipav14/spectral-llm

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25893 2026-05-26 cs.AI 86%

$D^2$-Monitor: Dynamic Safety Monitoring for Diffusion LLMs via Hesitation-Aware Routing

$D^2$-Monitor: 通过犹豫感知路由实现扩散LLM的动态安全监控

Aoxi Liu, Yupeng Chen, James Oldfield, Guanzhe Hong, Junchi Yu, Baoyuan Wu, Philip Torr, Adel Bibi

机构 * Torr Vision Group, University of Oxford(奥克斯大学托尔视觉组) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 效率与部署 :LLM(title_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对扩散大语言模型的安全监控问题,提出基于犹豫感知路由的双层动态监控框架$D^2$-Monitor,通过轻量级探针实时估计犹豫度并触发高容量探针,在3个数据集上以0.85M参数达到最优性能与效率平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25701 2026-05-26 cs.DC cs.CL cs.IR cs.NI 86%

Neural Router: Semantic Content Matching for Agentic AI

神经路由器:面向智能体AI的语义内容匹配

Lauri Lovén, Abhishek Kumar, Alexander Engelhardt, Alaa Saleh, Roberto Morabito, Xiaoli Liu, Naser Hossein Motlagh, Sasu Tarkoma

机构 * Future Computing Group, University of Oulu(奥卢大学未来计算组) Department of Computer Science, University of Helsinki(赫尔辛基大学计算机科学系) Department of Communication Systems, EURECOM(EURECOM通信系统部门)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出将大语言模型作为内容发布/订阅代理的语义匹配引擎,通过分析上下文窗口交叉点和判别能力交叉点,实现成本-准确性权衡,并给出三个可组合算法和自主LLM层级选择框架。

Comments 35 pages, 12 figures. Combined main paper and electronic supplement, folded into one document for arXiv

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24453 2026-05-26 cs.SE cs.AI 86%

Code2UML: Agentic LLMs with context engineering for scalable software visualization

Code2UML: 基于上下文工程的可扩展软件可视化的智能体LLM

Alin-Gabriel Văduva, Anca-Ioana Andreescu, Simona-Vasilica Oprea, Adela Bâra

机构 * Bucharest University of Economic Studies(布加勒斯特经济大学)

专题命中 效率与部署 :LLM(title_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种基于五个专门智能体和确定性IR压缩层的智能体架构,用于从源代码仓库自动生成UML图,在12个开源仓库和7种UML图上验证了高语法有效性(平均91.5%)和结构质量(平均81.7/100),且质量不随规模下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24138 2026-05-26 cs.SE cs.AI 86%

Understanding Conversational Patterns in Multi-agent Programming: A Case Study on Fibonacci Game Development

多智能体编程中的对话模式理解:以斐波那契游戏开发为例

Srijita Basu, Viktor Kjellberg, Simin Sun, Bengt Haraldsson, Md. Abu Ahammed Babu, Wilhelm Meding, Farnaz Fotrousi, Miroslaw Staron

机构 * Chalmers University of Technology University of Gothenburg Gothenburg Sweden Research \& Development, Volvo Car Corporation Gothenburg Sweden University of Gothenburg Research \& Development, Volvo Car Corporation

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过分析12种开源LLM组合中设计者与程序员智能体的对话,揭示了多智能体交互的效率、一致性和有效性三个关键维度,发现DeepSeek-R1:DeepSeek-R1对能从首次迭代起稳定收敛到正确解,而其他组合则存在发散或错误共识问题。

Comments 10 pages, 7 figures, AIware, FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23934 2026-05-26 cs.AI quant-ph 86%

Practical Quantum CIM Empowerment via All-Domestic-Core Agentic Large Model

实用量子CIM赋能:基于全自主核心智能体大模型

Wang Rui, Lu Diannan

机构 * Department of Chemical Engineering, Tsinghua University(清华大学化学工程系)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究将飞秒激光泵浦的相干伊辛机与LLM驱动的智能体系统结合,实现QUBO/Ising模型校准、约束权重决策迭代和文献方案快速验证,并完全基于国产大模型和硬件完成,同时发现智能体辅助量子计算迭代可反向增强智能体问题解决能力的新范式。

Comments 21 pages 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11182 2026-05-26 cs.AI 84%

The Many Faces of On-Policy Distillation: Pitfalls, Mechanisms, and Fixes

在线策略蒸馏的多种面貌:陷阱、机制与修复

Siqi Zhu, Xuyan Ye, Hongyu Lu, Weiye Shi, Ge Liu

机构 * UIUC(伊利诺伊大学香槟分校) Renmin University of China(中国人民大学) Peking University(北京大学)

专题命中 效率与部署 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文通过实证研究分析了在线策略蒸馏(OPD)和在线策略自蒸馏(OPSD)在大语言模型后训练中的有效性、失败机制及修复方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24381 2026-05-26 cs.LG cs.AI stat.AP stat.ML 84%

Assessing the Operational Viability of Foundation Models for Time Series Forecasting

评估基础模型在时间序列预测中的操作可行性

Kavin Soni, Debanshu Das, Vamshi Guduguntla

机构 * Google, USA(谷歌公司,美国)

专题命中 效率与部署 :foundation model(title,abstract);LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 通过对比基础模型与监督学习方法在四种操作场景下的性能,提出基于经验特征的复杂度路由器以实现精度与效率的平衡。

Comments 21 pages, 8 Figures, Code available at [https://github.com/kavin-soni/timeseries-zeroshot-eval]

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10593 2026-05-26 cs.SE cs.AI cs.CL cs.LG 83%

ToolRegistry: A Protocol-Agnostic Tool Management Library for Function-Calling LLMs

ToolRegistry: 一个用于函数调用LLM的协议无关工具管理库

Peng Ding, Rick Stevens

机构 * University of Chicago(芝加哥大学) Argonne National Laboratory(阿贡国家实验室)

专题命中 效率与部署 :LLM(title_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出ToolRegistry系统,通过统一工具对象和注册表实现协议无关的工具管理,支持多种传输协议、可插拔后端和高级功能,显著减少集成代码并提升吞吐量。

Comments 16 pages, 4 figures, v3: add co-author, permission system, progressive tool disclosure, think-augmented calling, RPC framing, multi-provider support

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18908 2026-05-26 cs.AI 83%

Characterizing Linear Alignment Across Language Models

表征语言模型间的线性对齐

Matt Gorbett, Suman Jana

机构 * Independent Researcher(独立研究者) Department of Computer Science(计算机科学系) Columbia University(哥伦比亚大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 研究独立训练的大语言模型间是否存在线性对齐,并探索其在文本生成、嵌入分类、分布外检测及隐私保护跨孤岛推理中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25250 2026-05-26 cs.AI 83%

LipoAgent: Coordinating Fine-Tuned LLM Agents for Safer Lipid Design

LipoAgent: 协调微调的大语言模型智能体以实现更安全的脂质设计

Leshu Li, An Lu, Haiyu Wang, Zhibin Feng, Conghui Duan, Qing Bao, Zongmin Zhao, Sai Qian Zhang

机构 * New York University(纽约大学) University of Illinois Chicago(伊利诺伊大学香槟分校)

专题命中 效率与部署 :LLM(title,abstract);foundation model(abstract);分类 cs.AI

AI总结 提出LipoAgent,一种安全感知的多智能体大语言模型框架,通过条件预测目标强制毒性作为效率预测的前提,并结合多智能体验证,在mRNA转染效率预测上平均相对提升32%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24168 2026-05-26 cs.AI cs.LG 82%

Inference Time Context Sparsity: Illusion or Opportunity?

推理时上下文稀疏性:幻觉还是机遇?

Sahil Joshi, Prithvi Dixit, Agniva Chowdhury, Anshumali Shrivastava, Joseph E. Gonzalez, Ion Stoica, Kumar Krishna Agrawal, Aditya Desai

机构 * Berkeley(伯克利)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本文通过实证和理论证据论证,在长上下文LLM推理中采用极端但原则性的上下文维度稀疏性不仅是可行的,而且能显著加速处理(如H100上实现10倍加速),从而挑战了密集注意力机制的必要性。

Comments 19 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25393 2026-05-26 cs.RO 82%

Decision-Making with Lightweight Confidence-Aware Language Model for Autonomous Driving

基于轻量级置信感知语言模型的自动驾驶决策

Ruoyu Yao, Ruiguo Zhong, Pei Liu, Mingxing Peng, Rui Yang, Jun Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 效率与部署 :language model(title,abstract);large language model(abstract)

AI总结 提出一种利用轻量级置信感知语言模型的决策框架,通过多智能体协作生成置信注释的决策演示并蒸馏到双头轻量模型,在nuPlan上实现SOTA成功率和低延迟。

Comments 8 Pages, 3 figures, ITSC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18543 2026-05-26 cs.CR cs.AI 81%

SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models

SoK: GPT 和 DeepSeek 模型越狱鲁棒性的全面安全分析

Xiaodong Wu, Xiangman Li, Qi Li, Lingshuang Liu, Jianbing Ni

机构 * Queen’s University(女王大学) University of Waterloo(滑铁卢大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过 HarmBench 基准测试,对 DeepSeek 模型系列与 GPT-3.5、GPT-4 进行首次全面越狱分析,发现 DeepSeek 对优化驱动攻击有部分鲁棒性但易受提示工程攻击,而 GPT-4 Turbo 具有更一致的安全对齐,揭示了模型效率与对齐泛化之间的固有权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25244 2026-05-26 cs.CL 81%

Inference Time Optimization with Confidence Dynamics

基于置信度动态的推理时优化

Yu Wang, Minghao Liu, Jiayun Wang, Jinrui Huang, Ankit Shah, Wei Wei

机构 * Center for Advanced AI, Accenture(Accenture高级人工智能中心)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过观察推理轨迹中置信度的动态变化,发现正确轨迹置信度上升而错误轨迹下降,据此提出置信度动态增益投票方法,显著提升大语言模型推理性能。

Comments Published in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25188 2026-05-26 cs.AI 81%

DarkForest: Less Talk, Higher Accuracy for Multi-Agent LLMs

DarkForest: 少说话,多智能体LLM更高精度

Yi Li, Songtao Wei, Dongming Jiang, Zhichun Guo, Qiannan Li, Bingzhe Li

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) Independent Researcher(独立研究者) University of California, Davis(加州大学戴维斯分校)

专题命中 效率与部署 :LLM(title_cn,abstract);分类 cs.AI

AI总结 提出DarkForest框架,通过保持智能体独立、结构化解析响应并基于信念分布协调,减少通信开销和错误传播,在六个推理基准上实现领先质量并大幅降低令牌消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24793 2026-05-26 cs.CL 81%

Beyond the Target: From Imitation to Collaboration in Speculative Decoding

超越目标:从模仿到协作的推测解码

Jinze Li, Yixing Xu, Guanchen Li, Jinfeng Xu, Shuo Yang, Yang Zhang, Xuanwu Yin, Dong Li, Edith C. H. Ngai, Emad Barsoum

机构 * Advanced Micro Devices, Inc.(先进微设备公司) The University of Hong Kong(香港大学) University of North Texas(北卡罗来纳州立大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出协作推测解码(CoSpec),通过强化学习训练仲裁策略,在推测解码中灵活选择接受草稿或目标模型的令牌,在保持加速的同时超越仅使用目标模型的性能。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15759 2026-05-26 cs.CL 81%

DimMem: Dimensional Structuring for Efficient Long-Term Agent Memory

DimMem:面向高效长期智能体记忆的维度结构化

Wentao Qiu, Haotian Hu, Fanyi Wang, Jinwei Kong, Yu Zhang

机构 * StepOS Xiamen University(厦门大学) ShanghaiTech University(上海科技大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出DimMem维度记忆框架,通过原子化、类型化、自包含的记忆单元(含时间、地点、原因等显式字段)实现维度感知检索与更新,在LoCoMo-10和LongMemEval-S上分别达到81.43%和78.20%准确率,且每查询token成本降低24%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24432 2026-05-26 cs.CL 81%

Found in Conversation: LLMs Teach Themselves to Close the Multi-Turn Gap

在对话中发现:LLMs 自我学习弥合多轮差距

Tianlang Chen, Shirley Wu, Jure Leskovec

机构 * Stanford(斯坦福大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出 Found in Conversation (FiC) 框架,通过视图非对称自蒸馏方法,让模型从单轮视角向多轮视角迁移能力,显著缩小多轮对话与单轮性能的差距。

Comments 17 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23931 2026-05-26 cs.AI cs.PL cs.SE 81%

BODHI: Precise OS Kernel Specification Inference

BODHI:精确的操作系统内核规范推断

Zhiming Chang, Ziyang Li

机构 * Department of Applied Mathematics and Statistics(应用数学与统计学系) Johns Hopkins University(约翰霍普金斯大学) Department of Computer Science(计算机科学系)

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出一种领域知识提示方法BODHI,通过结构化C到Python翻译指南增强少样本提示,在OSV-Bench基准上将Pass@1从55.10%提升至96.73%,缩小了通用代码生成与形式规范合成之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24957 2026-05-26 cs.AI cs.CV cs.LG 81%

Mitigating Object Hallucinations in Vision-Language Models through Region-Aware Attention Recalibration

通过区域感知注意力重校准减轻视觉语言模型中的对象幻觉

Yuanzhi Xu, Qian Gao, Jun Fan, Guohui Ding, Zhenyu Yang, Sixue Lin, Yuteng Xiao

机构 * Qilu University of Technology (Shandong Academy of Sciences)(齐鲁工业大学(山东省科学院)) China Telecom Digital Intelligence Technology Co, Ltd(中国电信数字智能技术有限公司) Shenyang Aerospace University(沈阳航空航天大学) Qilu Institute of Technology(齐鲁理工学院)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出一种无需训练的区域感知自适应加权机制,通过计算注意力头的稳健统计中点并利用跨头分歧动态调整干预预算,以连续惩罚调制抑制幻觉路径,有效纠正视觉语义错位,同时保持生成流畅性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02544 2026-05-26 cs.LG cs.AI 81%

SPA-Cache: Singular Proxies for Adaptive Caching in Diffusion Language Models

SPA-Cache: 扩散语言模型中的自适应缓存奇异代理

Wenhao Sun, Rong-Cheng Tu, Yifu Ding, Zhao Jin, Jingyi Liao, Yongcheng Jing, Dacheng Tao

机构 * College of Computing(计算学院) Data Science, Nanyang Technological University, Singapore, Singapore(数据科学,南洋理工大学,新加坡,新加坡)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 针对扩散语言模型因非因果特性无法使用标准KV缓存导致计算开销大的问题,提出SPA-Cache方法,通过低维奇异代理识别关键令牌并自适应分配缓存预算,实现高达8倍吞吐量提升和2-4倍加速。

Comments Accepted by ICML 2026.The code repository is available at https://github.com/wenhao728/spa-cache

详情

展开后加载摘要…

URL PDF HTML 收藏