arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-30 至 2026-04-30 共收录 48 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 48 篇

2604.26153 2026-04-30 cs.AR cs.IR 92%

RAG-Enhanced Kernel-Based Heuristic Synthesis (RKHS): A Structured Methodology Using Large Language Models for Hardware Design

基于检索增强的核启发式合成(RKHS):利用大语言模型的结构化方法用于硬件设计

Shiva Ahir, Alex Doboli

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 本文提出RKHS方法,结合检索增强生成、紧凑核启发式模板和LLM驱动的反馈循环,用于硬件设计中的启发式优化,实验证明其在降低延迟的列表调度中有效。

Comments Presented at the NSF Workshop on Agents for Chip Design Automation, UCLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26170 2026-04-30 cs.CL 92%

EvoSelect: Data-Efficient LLM Evolution for Targeted Task Adaptation

EvoSelect:面向目标任务的高效LLM进化

Ting-Wei Li, Sirui Chen, Jiaru Zou, Yingbing Huang, Tianxin Wei, Jingrui He, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出EvoSelect框架,通过迭代生成-选择-训练循环提升LLM在目标任务上的适应能力,通过最优传输和多样性机制优化数据选择,实验表明其在不同基准测试中均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26590 2026-04-30 cs.SE 91%

Recommendations for Efficient and Responsible LLM Adoption within Industrial Software Development

工业软件开发中高效负责任的LLM采用建议

Krishna Ronanki, Beatriz Cabrero-Daniel, Tomas Herda, Stefan Sitkovich, Jennifer Horkoff, Christian Berger

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出七条可行建议,旨在解决工业软件环境中高效且负责任地采用LLM的实践缺口,通过多案例研究和问卷调查验证了建议的相关性。

Comments Accepted for publication in the Information and Software Technology Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26378 2026-04-30 cs.LG 90%

CoQuant: Joint Weight-Activation Subspace Projection for Mixed-Precision LLMs

CoQuant:混合精度LLM的联合权重-激活子空间投影

Zhe Ding, Su Pan, Duowei Pan

机构 * School of Internet of Things, Nanjing University of Posts and Telecommunications(南京邮电大学物联网学院) Amazon AGI(亚马逊人工智能)

专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 CoQuant通过联合建模权重和激活的子空间,提升混合精度LLM的量化效果,在WikiText perplexity和零样本常识推理准确率上优于现有方法。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26557 2026-04-30 cs.DC cs.AI cs.PF 90%

DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference

DUAL-BLADE:双路径NVMe直接KV缓存卸载用于边缘大语言模型推理

Bodon Jeong, Hongsu Byun, Youngjae Kim, Weikuan Yu, Kyungkeun Lee, Jihoon Yang, Sungyong Park

机构 * Sogang University(ソンガン大学) Florida State University(佛罗里达州立大学) Samsung Electronics Co.(三星电子公司)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出DUAL-BLADE双路径框架,通过动态分配KV张量到页缓存或NVMe直接路径,减少I/O瓶颈,提升边缘LLM推理吞吐量。

Comments To appear in IEEE International Conference on Distributed Computing Systems (ICDCS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21480 2026-04-30 cs.DB cs.CL cs.IR 90%

Both Ends Count! Just How Good are LLM Agents at "Text-to-Big SQL"?

两端都算!LLM代理在『文本到大数据SQL』方面表现如何?

Germán T. Eizaguirre, Lars Tissen, Marc Sánchez-Artigas

机构 * RWTH Aachen University(亚琛工业大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL

AI总结 本文提出评估『文本到大数据SQL』的新指标,揭示传统文本到SQL指标在处理大规模数据时的不足,展示LLM代理在执行效率、成本及数据规模影响方面的表现。

Comments 14 pages, 8 figures

Journal ref Proc. EuroMLSys '26 (2026) 333-345

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26231 2026-04-30 cs.IR 89%

ProMax: Exploring the Potential of LLM-derived Profiles with Distribution Shaping for Recommender Systems

ProMax:探索基于分布塑造的LLM衍生资料在推荐系统中的潜力

Yi Zhang, Yiwen Zhang, Kai Zheng, Tong Chen, Hongzhi Yin

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出ProMax框架,通过分布塑造技术提升推荐系统性能,利用用户和物品资料的协同关系,改进推荐模型对未见物品的偏好学习。

Comments 11 pages, 8 figures, accepted by SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26951 2026-04-30 cs.CL cs.AI cs.LG 89%

Turning the TIDE: Cross-Architecture Distillation for Diffusion Large Language Models

将TIDE转向:用于扩散大语言模型的跨架构蒸馏

Gongbo Zhang, Wen Wang, Ye Tian, Li Yuan

机构 * Peking University(北京大学) Zhejiang University(浙江大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出TIDE框架,通过跨架构蒸馏提升扩散大语言模型性能,采用三个模块解决不同架构间的知识转移问题,在八个基准测试中平均提升1.53分,尤其在代码生成任务中表现突出。

Comments 15 pages, 3 figures. Code: https://github.com/PKU-YuanGroup/TIDE

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26687 2026-04-30 cs.DC 89%

COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training

COPUS:大语言模型训练中的协同并行与批量大小选择

Akhmed Sakip, Erland Hilman Fuadi, Omar Sayedelahl, Zonghang Li, Jianshu She, Alham Fikri Aji, Steve Liu, Eric Xing, Qirong Ho

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 COPUS通过动态调整全局批量大小、并行策略和微批次大小,提升大语言模型训练效率,实验显示在不同配置下平均收敛时间缩短3.9%-8.0%,峰值提升达11.1%。

Comments 22 pages, 13 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24940 2026-04-30 cs.CL cs.AI 88%

ADE: Adaptive Dictionary Embeddings -- Scaling Multi-Anchor Representations to Large Language Models

ADE:自适应词典嵌入——将多锚表示扩展到大语言模型

Orhan Demirci, Sezer Aptourachman, Aydın Kaya

机构 * Department of Computer Engineering(计算机工程系) Hacettepe University(哈切塔佩大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 ADE通过引入词汇投影、分组位置编码和上下文感知锚重加权,有效扩展多锚表示到大语言模型,减少参数并提升性能。

Comments 13 pages (9 pages main text + 4 pages appendix), 6 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26821 2026-04-30 cs.AR cs.DC 88%

Exploring the Efficiency of 3D-Stacked AI Chip Architecture for LLM Inference with Voxel

探索3D堆叠AI芯片架构在大语言模型推理中的效率:Voxel

Yiqi Liu, Noelle Crawford, Michael Wang, Jilong Xue, Jian Huang

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Voxel框架,用于探索3D堆叠AI芯片在LLM推理中的效率,分析计算范式、映射策略及硬件架构的影响,揭示效率取决于多因素协同及映射设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06635 2026-04-30 cs.LG 88%

Graph Property Inference in Small Language Models: Effects of Representation and Reasoning Strategy

在小型语言模型中进行图属性推断:表示与推理策略的影响

Michal Podstawski

机构 * NASK National Research Institute, Warsaw, Poland(波兰华沙国家研究 institute)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);分类 cs.LG

AI总结 研究探讨了小型指令微调语言模型在图属性推断中的表现,发现输入表示和推理策略显著影响结果,未经过微调的模型在估计图属性时存在系统性误差,但通过改进表示和推理设计可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26152 2026-04-30 cs.SE 88%

AI Observability for Large Language Model Systems: A Multi-Layer Analysis of Monitoring Approaches from Confidence Calibration to Infrastructure Tracing

为大语言模型系统设计的AI可观测性:从置信度校准到基础设施追踪的多层分析

Twinkll Sisodia

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 本文分析了大语言模型在生产环境中的可观测性需求,探讨了从置信度校准到基础设施追踪的多层监控方法,识别了当前领域中的关键缺口。

Comments 10 pages, 2 figures, 3 tables, survey paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08373 2026-04-30 cs.AI cs.LG 87%

Grounding Generative Planners in Verifiable Logic: A Hybrid Architecture for Trustworthy Embodied AI

基于可验证逻辑的生成规划器:一种可信具身AI的混合架构

Feiyu Wu, Xu Zheng, Yue Qu, Zhuocheng Wang, Zicheng Feng, Hui Li

机构 * School of Cyber Engineering, Xidian University(电子科技大学信息工程学院)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出VIRF框架,通过逻辑导师与LLM的对话机制实现主动协作,提升具身AI的安全性与可靠性,实验显示其在家庭安全任务中表现优异。

Comments Accepted to ICLR 2026. Project page. https://openreview.net/forum?id=wb05ver1k8&noteId=v1Ax8CwI71

Journal ref Proceedings of the International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26074 2026-04-30 cs.DC 87%

DAK: Direct-Access-Enabled GPU Memory Offloading with Optimal Efficiency for LLM Inference

DAK:支持直接访问的GPU内存卸载,以实现LLM推理的最优效率

Shouxu Lin, Zhiyuan Guo, Jiaxin Lin

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 本文提出DAK框架,通过直接访问远程内存优化GPU内存卸载,提升系统带宽效率,实验显示在NVLink-C2C和PCIe系统中性能提升达3倍和1.8倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23865 2026-04-30 cs.LG cs.AI stat.ML 86%

Inverting Foundation Models of Brain Function with Simulation-Based Inference

通过基于模拟的推断翻转脑功能基础模型

Niels Bracher, Xavier Intes, Stefan T. Radev

机构 * Center for Modeling, Simulation, \& Imaging in Medicine, Rensselaer Polytechnic Institute, NY, USA

专题命中 效率与部署 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究通过TRIBEv2验证了能否从合成脑活动恢复刺激属性,利用大语言模型生成刺激参数,展示了基础脑模型在逆向设计中的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26209 2026-04-30 cs.CL cs.AI 86%

Breaking the Autoregressive Chain: Hyper-Parallel Decoding for Efficient LLM-Based Attribute Value Extraction

打破自回归链:用于高效LLM属性值提取的超并行解码

Theodore Glavas, Nikhita Vedula, Dushyanta Dhyani, Yilun Zhu, Shervin Malmasi

机构 * Amazon.com, Inc.(亚马逊公司) McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克AI研究所) Int. Lab. Learning Systems(学习系统国际实验室)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文提出超并行解码方法,通过利用共享内存和计算实现批量并行,提升属性值提取任务的效率,减少推理成本和时间,适用于多种独立输出结构的场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04872 2026-04-30 cs.CL cs.AI 85%

TinyR1-32B-Preview: Boosting Accuracy with Branch-Merge Distillation

TinyR1-32B-Preview: 通过分支-合并蒸馏提升精度

Lin Sun, Guangxiang Zhao, Xiaoqi Jian, Yuhan Wu, Weihong Lin, Yongfu Zhu, Qilong Shi, Change Jia, Aomufei Yuan, Yuxuan Tian, Linglin Zhang, Jinzhu Wu, Junfeng Ran, Sai-er Hu, Zihan Jiang, Junting Zhou, Wenrui Liu, Xusen Xiao, Bin Cui, Tong Yang, Xiangzheng Zhang

机构 * Qiyuan Tech(启元科技) Peking University(北京大学)

专题命中 效率与部署 :SFT(abstract,abstract_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出分支-合并蒸馏方法,通过领域特定监督微调和跨领域知识迁移,提升模型压缩效果,实验显示在数学、编程和科学领域均取得显著提升。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26334 2026-04-30 cs.DC cs.AR cs.LG 84%

Efficient, VRAM-Constrained xLM Inference on Clients

高效、受限于VRAM的xLM客户端推断

Aditya Ukarande, Deep Shekhar, Marc Blackstein, Ram Rangan

机构 * Microsoft Corporation(微软公司) NVIDIA Corporation(英伟达公司)

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出pipelined sharding技术,通过CPU-GPU混合调度优化xLM在客户端的高效推断,提升TTFT和TPS性能,适用于LLM和VLM。

Comments Accepted at MLSys 2026 (Industry Track). 17 pages, 7 figures, 9 tables. Code and artifacts available at: https://github.com/deepshnv/pipeshard-mlsys26-ae

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26779 2026-04-30 cs.LG cs.CL 84%

Accelerating RL Post-Training Rollouts via System-Integrated Speculative Decoding

通过系统集成的推测解码加速RL训练后的 rollout

Hayate Iso, Tiyasa Mitra, Sudipta Mondal, Rasoul Shafipour, Venmugil Elango, Terry Kong, Yuki Huang, Seonjin Na, Izzy Putterman, Benjamin Chislett, Maor Ashkenazi, Joseph Guman, Gerald Shen, Tugrul Konuk, Ashwath Aithal, Ritika Borkar, Ran Zilberstein, Bita Rouhani

机构 * NeMo-RL vLLM

专题命中 效率与部署 :post-training(title,abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了通过系统集成的推测解码技术提升RL训练后rollout效率的方法,展示了在大规模模型上实现1.8倍的吞吐量提升,并通过模拟预测异步RL可实现2.5倍的训练加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13963 2026-04-30 cs.CL cs.LG 82%

Through a Compressed Lens: Investigating The Impact of Quantization on Factual Knowledge Recall

通过压缩镜头:探讨量化对事实知识回忆的影响

Qianli Wang, Mingyang Wang, Nils Feldhus, Simon Ostermann, Yuan Cao, Hinrich Schütze, Sebastian Möller, Vera Schmitt

机构 * Quality and Usability Lab, Technische Universität Berlin(柏林技术大学质量与可用性实验室) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) Saarland Informatics Campus(萨尔州信息学院) LMU Munich(慕尼黑大学) Bosch Center for Artificial Intelligence (BCAI)(博世人工智能中心) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Centre for European Research in Trusted AI (CERTAIN)(可信人工智能欧洲研究中心) BIFOLD – Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究院) Technical University of Munich(慕尼黑技术大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究通过量化技术对大型语言模型的事实知识回忆能力影响,发现量化导致信息损失,但部分模型在低精度下表现更优,BitSandBytes保留最多原始精度的知识回忆能力。

Comments TrustNLP @ ACL 2026; camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18165 2026-04-30 cs.AI cs.CL cs.LG cs.SE 82%

Saber: An Efficient Sampling with Adaptive Acceleration and Backtracking Enhanced Remasking for Diffusion Language Model

Saber: 一种高效的采样方法,具有自适应加速和回溯增强的重新遮蔽,用于扩散语言模型

Yihong Dong, Zhaoyu Ma, Xue Jiang, Zhiyuan Fan, Jiaru Qian, Yongmin Li, Jianha Xiao, Zhi Jin, Rongyu Cao, Binhua Li, Fei Huang, Yongbin Li, Ge Li

机构 * School of Computer Science, Peking University(北京大学计算机科学系) Tongyi Lab, Alibaba Group(阿里云实验室)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Saber算法,通过动态调整每步未遮蔽令牌数量和回溯机制提升代码生成的推理速度和输出质量,实验显示在多个基准上Pass@1准确率提升1.9%,推理速度提升251.4%。

Comments Accepted to ACL 2026 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21420 2026-04-30 cs.CV cs.CL 81%

ReGATE: Learning Faster and Better with Fewer Tokens in MLLMs

ReGATE:通过减少令牌数在MLLMs中实现更快更好的学习

Chaoyu Li, Yogesh Kulkarni, Pooyan Fazli

机构 * Arizona State University(亚利桑那州立大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ReGATE通过参考引导的自适应令牌消除方法加速MLLM训练,减少计算量同时保持模型准确性,在多个基准测试中表现出色。

Comments ACL 2026. Project page: https://people-robots.github.io/regate

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14845 2026-04-30 cs.LG cs.AI 81%

Integrating Weather Foundation Model and Satellite to Enable Fine-Grained Solar Irradiance Forecasting

融合天气基础模型与卫星实现精细化太阳能辐照度预报

Ziqing Ma, Kai Ying, Xinyue Gu, Tian Zhou, Tianyu Zhu, Haifan Zhang, Peisong Niu, Zheng Wang, Cong Bai, Liang Sun

机构 * DAMO Academy, Alibaba Group(阿里集团达摩院) College of Computer Science, Zhejiang University of Technology(浙江工业大学计算机学院)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Baguan-solar框架,融合全球天气基础模型与高分辨率静止卫星图像,实现千米级24小时辐照度预报,优于现有基准模型,降低RMSE 16.08%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26217 2026-04-30 cs.CR 78%

OpenSOC-AI: Democratizing Security Operations with Parameter Efficient LLM Log Analysis

OpenSOC-AI:通过参数高效的大语言模型日志分析民主化安全运营

Chaitanya Vilas Garware, Sharif Noor Zisad

专题命中 效率与部署 :LLM(title);language model(abstract)

AI总结 本文提出OpenSOC-AI,利用参数高效微调的11亿参数语言模型,实现自动化威胁分类、MITRE ATT&CK技术映射和严重性评估,提升中小企业安全运营能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15808 2026-04-30 cs.AI 77%

Inference-Time Scaling of Verification: Self-Evolving Deep Research Agents via Test-Time Rubric-Guided Verification

推理时的验证扩展:通过测试时的评分指南验证实现自我进化深度研究代理

Yuxuan Wan, Tianqing Fang, Zaitang Li, Yintong Huo, Wenxuan Wang, Haitao Mi, Dong Yu, Michael R. Lyu

机构 * The Chinese University of Hong Kong(香港中文大学) Tencent AI Lab(腾讯人工智能实验室) Singapore Management University(新加坡管理学院) The Renmin University of China(中国人民大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.AI

AI总结 本文提出通过测试时评分指南验证实现深度研究代理的自我进化,通过迭代验证策略模型输出,提升验证能力,实验显示在GAIA和XBench-DeepSearch上准确率提升8%-11%。

Comments ACL'2026-Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20714 2026-04-30 cs.CV cs.AI 77%

Inferix: A Block-Diffusion based Next-Generation Inference Engine for World Simulation

Inferix:基于块扩散的下一代世界模拟推理引擎

Inferix Team, Tianyu Feng, Yizeng Han, Jiahao He, Yuanyu He, Xi Lin, Teng Liu, Hanfeng Lu, Jiasheng Tang, Wei Wang, Zhiyuan Wang, Jichao Wu, Mingyang Yang, Yinghao Yu, Zeyu Zhang, Bohan Zhuang

机构 * Inferix Team(Inferix 团队)

专题命中 效率与部署 :LLM(abstract,abstract_cn);foundation model(abstract);分类 cs.AI

AI总结 Inferix 是一种基于块扩散的下一代推理引擎,通过优化半自回归解码过程实现沉浸式世界合成,支持交互式视频流和性能分析,结合 LV-Bench 提供高效评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22750 2026-04-30 cs.CL cs.AI cs.CY cs.HC cs.SE 73%

How Do AI Agents Spend Your Money? Analyzing and Predicting Token Consumption in Agentic Coding Tasks

AI代理如何花费你的钱?分析和预测代理编码任务中的令牌消耗

Longju Bai, Zhemin Huang, Xingyao Wang, Jiao Sun, Rada Mihalcea, Erik Brynjolfsson, Alex Pentland, Jiaxin Pei

机构 * University of Michigan(密歇根大学) Stanford University(斯坦福大学) All Hands AI Google Deepmind(谷歌DeepMind) Microsoft AI(微软AI) Massachusetts Institute of Technology(麻省理工学院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文研究了代理编码任务中令牌消耗模式,发现代理任务消耗远高于代码推理和代码聊天,且模型在任务执行前难以准确预测自身令牌使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23410 2026-04-30 cs.LG cs.AI cs.PF 73%

PATCH: Learnable Tile-level Hybrid Sparsity for LLMs

PATCH:用于LLMs的可学习分块混合稀疏性

Younes Hourri, Mohammad Mozaffari, Maryam Mehri Dehnavi

机构 * Department of Computer Science(计算机科学系)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 PATCH通过可学习的分块混合稀疏性方法,在LLMs中实现连续稀疏率控制,提升模型效率与精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26274 2026-04-30 cs.CR cs.AI 70%

Enforcing Benign Trajectories: A Behavioral Firewall for Structured-Workflow AI Agents

强制良性轨迹:一种用于结构化工作流AI代理的行为防火墙

Hung Dang

机构 * Van Lang University(范朗大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种基于 telemetry 的行为异常检测防火墙,通过构建参数化确定性有限自动机来限制工具调用序列,从而降低攻击成功率,同时保持低延迟和低误报率。

详情

展开后加载摘要…

URL PDF HTML 收藏