arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-13 至 2026-05-13 共收录 421 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 75 篇

2605.08151 2026-05-13 cs.DC cs.AI 87%

SPECTRE: Hybrid Ordinary-Parallel Speculative Serving for Resource-Efficient LLM Inference

SPECTRE:混合普通-并行推测服务用于资源高效的LLM推理

Jincheng Xie, Yawen Ling, Qi Xiao, Feiyu Zhang, Zhongyi Huang, Wen Hu, Yu Zheng

机构 * Tsinghua University(清华大学) AI Infra Team at JDT(AI基础设施团队) JD iCity, JD Technology, JD Intelligent Cities Research(京东i城、京东科技、京东智能城市研究院)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 SPECTRE通过利用未充分利用的尾部模型服务作为远程草稿生成器,提升大型模型推理效率,采用混合策略、推测优先调度和草稿压缩技术,实现并行处理,提升吞吐量并减少干扰。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12412 2026-05-13 cs.CL cs.AI cs.LG 86%

Stories in Space: In-Context Learning Trajectories in Conceptual Belief Space

空间中的故事:概念信念空间中的上下文学习轨迹

Eric Bigelow, Raphaël Sarfati, Daniel Wurgaft, Owen Lewis, Thomas McGrath, Jack Merullo, Atticus Geiger, Ekdeep Singh Lubana

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过故事理解探讨LLM在概念信念空间中的动态信念更新,发现信念更新可描述为低维结构流形上的轨迹,并能通过简单线性探针预测行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11864 2026-05-13 cs.IR cs.AI cs.CV cs.MM 84%

Very Efficient Listwise Multimodal Reranking for Long Documents

非常高效的长文档多模态重排序方法

Yiqun Sun, Pengfei Wei, Lawrence B. Hsieh

机构 * Magellan Technology Research Institute (MTRI)(马杰拉技术研究院(MTRI))

专题命中 效率与部署 :LLM(summary_cn,abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出ZipRerank,通过轻量级查询-图像早期交互机制和单次前向传递消除自回归解码,实现高效多模态重排序,实验表明其在MMDocIR基准上性能优异且显著降低LLM推理延迟。

Comments To appear in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12131 2026-05-13 cs.LG cs.DC 84%

BOOST: BOttleneck-Optimized Scalable Training Framework for Low-Rank Large Language Models

BOOST:用于低秩大语言模型的瓶颈优化可扩展训练框架

Zhengyang Wang, Ziyue Liu, Ruijie Zhang, Avinash Maurya, Paul Hovland, Bogdan Nicolae, Franck Cappello, Zheng Zhang

机构 * Anonymous Authors(匿名作者)

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.LG

AI总结 BOOST通过引入瓶颈感知张量并行和优化技术,提升低秩瓶颈架构的训练效率,实现1.46-1.91倍的速度提升,同时减少通信开销和GPU利用率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11093 2026-05-13 cs.LG cs.AI cs.PF cs.SE cs.SY eess.SY 84%

Enabling Performant and Flexible Model-Internal Observability for LLM Inference

使LLM推理具备高效且灵活的模型内部可观察性

Nengneng Yu, Sixian Xiong, Yibo Zhao, Wei Wang, Zaoxing Liu

机构 * Department of Computer Science(计算机科学系)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出DMI-Lib,通过异步可观察性子系统实现模型内部状态的高效观测,减少推理延迟并优化资源使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11516 2026-05-13 cs.NI 83%

Agents Should Replace Narrow Predictive AI as the Orchestrator in 6G AI-RAN

智能体应取代窄预测AI作为6G AI-RAN的协调者

Pranshav Gajjar, Vijay K Shah

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文主张为实现Level 5自主6G网络,AI-RAN应从碎片化的窄预测模型转向多模态大语言模型作为核心推理智能体,通过提升LLM作为认知操作系统,动态翻译人类意图并自主诊断网络异常。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11442 2026-05-13 cs.CR cs.AI cs.CL 82%

Can a Single Message Paralyze the AI Infrastructure? The Rise of AbO-DDoS Attacks through Targeted Mobius Injection

单条消息能否瘫痪AI基础设施?通过针对性Mobius注入的AbO-DDoS攻击崛起

Zi Liang, Ronghua Li, Yanyun Wang, Qingqing Ye, Haibo Hu

机构 * The Hong Kong Polytechnic University(香港理工大学) HKUST (GZ)(香港科技大学(广州))

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示了通过Mobius注入攻击利用代理逻辑中的语义闭合漏洞,实现对AI基础设施的隐蔽攻击,展示了攻击的轻量、隐蔽性和高配置性,并提出基于组件能量分析的防御机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06485 2026-05-13 cs.LG cs.AI 82%

Inference-Time Code Selection via Symbolic Equivalence Partitioning

推理时通过符号等价划分进行代码选择

David Cho, Yifan Wang, Fanping Sui, Ananth Grama

机构 * Texas Instruments(德州仪器)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本文提出SEP框架,通过符号执行将候选程序划分为功能等价类,提升推理时代码选择的准确性,无需辅助测试生成或额外LLM推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12335 2026-05-13 cs.IR cs.AI cs.LG 82%

EHR-RAGp: Retrieval-Augmented Prototype-Guided Foundation Model for Electronic Health Records

EHR-RAGp: 用于电子健康记录的检索增强型原型引导基础模型

Saeed Shurrab, Mariam Al-Omari, Dana El Samad, Farah E. Shamout

机构 * New York University(纽约大学) New York University Abu Dhabi(纽约大学阿布扎赫德)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出EHR-RAGp模型,通过动态整合患者历史信息提升临床预测性能,优于现有基础模型和Transformer基线。

Comments Retrieval Augmented EHR Foundation Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12245 2026-05-13 cs.LG 81%

SOAR: Scale Optimization for Accurate Reconstruction in NVFP4 Quantization

SOAR:在NVFP4量化中的尺度优化以实现准确重建

Chengzhu Bao, Xianglong Yan, Zhiteng Li, Guangshuo Qin, Guanghua Yu, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Hunyuan(腾讯文心)

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出SOAR框架,通过闭式联合尺度优化和解耦尺度搜索提升NVFP4量化精度,实验证明其在相同内存占用下优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12240 2026-05-13 cs.AI 81%

No Action Without a NOD: A Heterogeneous Multi-Agent Architecture for Reliable Service Agents

没有NOD就没有行动:一种异质多智能体架构用于可靠的服务代理

Zixu Yang, Hang Zheng, Nan Jiang, Zhiyang Tang, Situo Zhang, Xiaobao Wu, Lu Chen, Kai Yu

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(X-LANCE实验室,计算机科学学院,上海交通大学,上海,中国) Shanghai Innovation Institution, Shanghai, China(上海创新机构,上海,中国) Jiangsu Key Lab of Language Computing, Suzhou, China(江苏省语言计算重点实验室,苏州,中国)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出NOD架构,通过外部化全局状态和选择性外部监督,提升服务代理在长周期任务中的可靠性,实验表明其在任务成功率和关键动作精度上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11789 2026-05-13 cs.AI 81%

Beyond Inefficiency: Systemic Costs of Incivility in Multi-Agent Monte Carlo Simulations

超越低效:多智能体蒙特卡洛模拟中不文明行为的系统性成本

Alison Moldovan-Mauer, Benedikt Mangold

机构 * Technische Hochschule Nürnberg(纽伦堡技术大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究通过多智能体蒙特卡洛模拟探讨不文明行为对交互效率的影响,发现参数较少的模型收敛延迟更显著,并发现先发优势在不同毒性条件下均显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11605 2026-05-13 cs.CV cs.AI 81%

Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs

保留音频无法表达的内容:面向多模态大语言模型的上下文保留令牌修剪

Chaeyoung Jung, Kyeongha Rho, Joon Son Chung

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ContextGuard框架,通过保留音频-视觉上下文并去除跨模态冗余,实现多模态大语言模型的高效令牌修剪,实验表明其在多个基准测试中表现优异,能有效减少输入令牌数量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08083 2026-05-13 cs.CL 81%

LLMs Improving LLMs: Agentic Discovery for Test-Time Scaling

LLMs改进LLMs:测试时扩展的代理发现

Tong Zheng, Haolin Liu, Chengsong Huang, Huiwen Bao, Sheng Zhang, Rui Liu, Runpeng Dai, Ruibo Chen, Chenxi Liu, Tianyi Xiong, Xidong Wu, Hongming Zhang, Heng Huang

机构 * UMD(马里兰大学) UVA(弗吉尼亚大学) WUSTL(华盛顿大学) UNC(北卡罗来纳大学) Google(谷歌) Meta

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出AutoTTS框架,通过环境驱动的方法自动发现测试时扩展策略,提升大语言模型性能,实验表明其在数学推理基准上的准确率与成本平衡优于人工设计基线。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10953 2026-05-13 physics.geo-ph cs.CV cs.LG 79%

Parameter-Efficient Adaptation of Pre-Trained Vision Foundation Models for Active and Passive Seismic Data Denoising

高效适应预训练视觉基础模型用于主动和被动地震数据去噪

Jiahua Zhao, Umair bin Waheed, Jing Sun, Yang Cui, Nikos Savva, Eric Verschuur

机构 * Computation-based Science and Technology Research Center, The Cyprus Institute(计算科学与技术研究中心,塞浦路斯研究所) Department of Geosciences, College of Petroleum Engineering and Geosciences, King Fahd University of Petroleum & Minerals(地质学系,石油工程与地质学院,国王法赫德石油与矿物大学) Department of Intelligent Systems, Faculty of Electrical Engineering, Mathematics and Computer Science, Delft University of Technology(智能系统系,电气工程、数学与计算机科学学院,代尔夫特理工大学) Department of Mathematics and Statistics, Faculty of Pure and Applied Sciences, University of Cyprus(数学与统计学系,纯应用科学学院,塞浦路斯大学) Department of Geoscience and Engineering, Faculty of Civil Engineering and Geosciences, Delft University of Technology(地质科学与工程系,土木工程与地质科学学院,代尔夫特理工大学)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出一种高效框架,利用预训练的视觉基础模型进行地震数据去噪,通过低秩适应提升特征适应性,并引入基于kurtosis的无监督测试时适应模块以增强鲁棒性,实验证明其在勘探地震学中的有效性。

Comments 34 pages, 8 figures, 6 tables. Submitted to Geophysics for publication consideration

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05408 2026-05-13 cs.CV cs.AI 79%

See the past: Time-Reversed Scene Reconstruction from Thermal Traces Using Visual Language Models

回望过去:利用视觉语言模型从热迹中进行时间反转场景重建

Kebin Contreras, Luis Toscano-Palomino, Mauro Dalla Mura, Jorge Bacca

机构 * Physics School, Universidad Industrial de Santander, Colombia(圣安德烈大学物理系,哥伦比亚) Department of Computer Science, Universidad Industrial de Santander, Colombia(圣安德烈大学计算机科学系,哥伦比亚) GIPSA-Lab, Université Grenoble Alpes, CNRS, Grenoble INP, Grenoble, France(格拉斯实验室,格勒诺布尔阿尔卑斯大学,CNRS,格勒诺布尔INP,法国) Institut Universitaire de France (IUF), France(法国国家科学院(IUF))

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 本文提出利用视觉语言模型和约束扩散过程,从热迹中恢复过去几秒钟的场景状态,展示了时间反转成像的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09430 2026-05-13 cs.CV 79%

FlashAR: Efficient Post-Training Acceleration for Autoregressive Image Generation

FlashAR: 用于自回归图像生成的高效后训练加速

Junkang Zhou, Yefei He, Feng Chen, Weijie Wang, Bohan Zhuang

机构 * Zhejiang University(浙江大学) University of Adelaide(阿德莱德大学)

专题命中 效率与部署 :post-training(title,abstract)

AI总结 本文提出FlashAR框架,通过双向往前预测将预训练自回归模型转化为高效并行生成器,实现512x512图像生成速度提升22.9倍。

Comments Post-training acceleration for autoregressive image generation, code is available at https://lxazjk.github.io/FlashAR/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11128 2026-05-13 cs.CL 77%

Sampling More, Getting Less: Calibration is the Diversity Bottleneck in LLMs

采样更多,得到更少:校准是大语言模型中的多样性瓶颈

Amin Banayeeanzade, Qingchuan Yang, Dhruv Tarsadiya, Fatemeh Bahrani, Leonardo Blas, Alfy Samuel, Robin Jia, Meisam Razaviyayn, Sai Praneeth Karimireddy

机构 * University of Southern California(南加州大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL

AI总结 研究揭示了大语言模型中多样性崩溃的原因,提出有效性-多样性框架,分析了顺序校准和形状校准两种误校准形式,发现局部失败会累积导致序列层面多样性损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10670 2026-05-13 cs.CL cs.AI cs.SD 73%

Towards Fine-Grained Code-Switch Speech Translation with Semantic Space Alignment

面向语义空间对齐的细粒度代码切换语音翻译

Yan Gao, Yazheng Yang, Zhibin Lan, Yidong Chen, Min Zhang, Daimeng Wei, Derek F. Wong, Jinsong Su

机构 * School of Informatics, Xiamen University, China(厦门大学信息学院) Huawei Translation Services Center, Beijing, China(华为翻译服务中心) NLP 2 CT Lab, Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系NLP 2 CT实验室)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过混合专家模型提升大语言模型,以实现更精确的代码切换语音翻译,通过语言特定损失和组内负载平衡损失优化语义空间对齐,实验表明在多个数据集上提升了翻译性能。

Comments Accepted to IJCAI 2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11613 2026-05-13 cs.LG cs.AI 73%

From Generic Correlation to Input-Specific Credit in On-Policy Self Distillation

从通用相关性到输入特定的信用在在线自我蒸馏中

Guobin Shen, Lei Huang, Xiang Cheng, Chenxiao Zhao, Jindong Li, Dongcheng Zhao, Xing Yu

机构 * Xiaohongshu Inc.(小红书公司) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 效率与部署 :language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文研究在线自我蒸馏中奖励的测量与信用分配,提出CREDIT方法通过对比学习分离输入特定成分,提升模型在多个基准上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10999 2026-05-13 cs.LG cs.AI cs.MA 73%

SkillGen: Verified Inference-Time Agent Skill Synthesis

SkillGen: 验证推理时间智能体技能合成

Yuchen Ma, Yue Huang, Han Bao, Haomin Zhuang, Swadheen Shukla, Michel Galley, Xiangliang Zhang, Stefan Feuerriegel

机构 * Munich Center for Machine Learning, LMU Munich(慕尼黑马尔他学习中心,慕尼黑大学) University of Notre Dame(诺特尔达大学) Microsoft Research(微软研究院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 SkillGen通过对比诱导生成可审计的技能,提升智能体性能,优于现有基线方法,且技能可迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05225 2026-05-13 cs.CL cs.AI cs.NE 73%

BEExformer: A Fast Inferencing Binarized Transformer with Early Exits

BEExformer: 一种快速推理的二值化Transformer与早退出机制

Wazib Ansar, Saptarsi Goswami, Amlan Chakrabarti

机构 * A. K. Choudhury School of IT University of Calcutta(A.K. 首席学校信息技术学院加尔各答大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 BEExformer通过二值化和早退出机制提升Transformer推理效率,减少模型大小并提高准确性,经多任务验证展现最优性能与效率平衡。

Comments This revised manuscript includes 18 pages, 6 figures, and 6 tables. Methodology and results sections have been improved for clarity and depth, incorporating additional comparisons, ablations, and new evaluation datasets. A few relevant references were added, and overall organization refined for better readability

Journal ref in IEEE Transactions on Sustainable Computing, vol. 11, no. 2, pp. 98-110, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09100 2026-05-13 cs.CL 70%

GRC: Unifying Reasoning-Driven Generation, Retrieval and Compression

GRC:统一推理驱动生成、检索与压缩

Zhongtao Miao, Qiyu Wu, Yoshimasa Tsuruoka

机构 * The University of Tokyo(东京大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出GRC框架,通过元潜在标记和统一训练方法,将推理驱动生成、文本表示和上下文压缩整合于单次前向传递中,提升部署效率与训练效果。

Comments Fixed typos in Eq. 4 and GPU names; added details on hybrid paged attention implementation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11537 2026-05-13 cs.LG 70%

Fast MoE Inference via Predictive Prefetching and Expert Replication

通过预测性预取和专家复制实现快速MoE推理

Ankit Jyothish, Ali Jannesari, Aishwarya Sarkar, Joseph Zuber

机构 * Iowa State University(爱荷华州立大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出动态专家复制策略,通过预测过载专家并复制以提升并行性,减少GPU空闲时间,实现更快的MoE推理,实验表明在Switch-base-128和Switch-base-256模型上推理速度提升达3倍,性能损失低于5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11240 2026-05-13 cs.GT cs.CY cs.LG 70%

When to Ask a Question: Understanding Communication Strategies in Generative AI Tools

何时提问:理解生成式AI工具中的沟通策略

Charlotte Park, Kate Donahue, Manish Raghavan

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 研究探讨生成式AI工具中用户与模型交互时信息获取与推断的平衡,提出兼顾用户负担与偏好表示的优化目标,分析如何通过信息采集减少系统性偏见,提升多样性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12110 2026-05-13 cs.DC 67%

AB-Sparse: Sparse Attention with Adaptive Block Size for Accurate and Efficient Long-Context Inference

AB-Sparse:基于自适应块大小的稀疏注意力用于准确且高效的长上下文推理

Di Liu, Ruitian Wang, Chen Chen, Mingliang Gong, Yongjie Yuan, Han Zhao, Yu Feng, Quan Chen, Minyi Guo

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 AB-Sparse通过自适应块大小分配提升长上下文推理的准确性,同时保持吞吐量,采用无损块中心量化和定制GPU内核实现高效执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11591 2026-05-13 cs.CV 67%

Logit-Attention Divergence: Mitigating Position Bias in Multi-Image Retrieval via Attention-Guided Calibration

Logit-Attention Divergence:通过注意力引导的校准缓解多图像检索中的位置偏差

Mingtao Xian, Yifeng Yang, Qinying Gu, Xinbing Wang, Nanyang Ye

机构 * Zhiyuan College, Shanghai Jiao Tong University, Shanghai, China(上海交通大学紫阳学院) Shanghai Jiao Tong University, Shanghai, China(上海交通大学) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室) Shanghai Innovation Institute, Shanghai, China(上海创新研究院)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文提出一种无需训练的注意力引导去偏框架,通过利用内在注意力信号在推理时进行实例级校正,显著提升排列不变性并取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11277 2026-05-13 cs.AR 67%

Sieve: Dynamic Expert-Aware PIM Acceleration for Evolving Mixture-of-Experts Models

Sieve: 动态专家感知的PIM加速用于演进的专家混合模型

Jungwoo Kim, Rubens Lacouture, Genghan Zhang, Gina Sohn, Qizheng Zhang, Swapnil Gandhi, Christos Kozyrakis, Kunle Olukotun

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文提出Sieve框架,通过动态调度专家执行,优化多GPU系统中PIM的效率,提升吞吐量和交互性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11051 2026-05-13 cs.SE cs.AI cs.CL cs.LG 67%

On Problems of Implicit Context Compression for Software Engineering Agents

关于软件工程代理隐式上下文压缩的问题

Kirill Gelvan, Igor Slinko, Felix Steinbauer, Egor Bogomolov, Florian Kofler, Yaroslav Zharov

机构 * JetBrains Research(JetBrains研究院) Technical University of Munich, Germany(慕尼黑技术大学,德国)

专题命中 效率与部署 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究软件工程代理在长周期任务中因上下文长度限制导致的失败问题,探讨连续嵌入编码方法的适用性及多步骤编码任务中的性能不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10980 2026-05-13 cs.LG cs.AI 62%

LEAP: Unlocking dLLM Parallelism via Lookahead Early-Convergence Token Detection

LEAP: 通过前瞻性早期收敛令牌检测解锁dLLM并行性

Haohui Zhang, Zhiye Wang, Xiaoying Gan, Xinbing Wang, Bo Jiang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 LEAP通过前瞻性早期收敛令牌检测方法,有效降低dLLM解码延迟和步骤,减少约30%的去噪步骤,提升并行解码效率。

详情

展开后加载摘要…

URL PDF HTML 收藏