arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-11 至 2026-08-11 共收录 772 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 177 篇

2601.04203 2026-08-11 cs.CL cs.CV cs.LG cs.SE 版本更新 62%

FronTalk: Benchmarking Front-End Development as Conversational Code Generation with Multi-Modal Feedback

FronTalk: 以多模态反馈进行对话式代码生成的前端开发基准测试

Xueqing Wu, Zihan Xue, Da Yin, Shuyan Zhou, Kai-Wei Chang, Nanyun Peng, Yeming Wen

机构 * Meta Superintelligence Labs(Meta超智能实验室) University of California, Los Angeles(加州大学洛杉矶分校) Duke University(杜克大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 提出FronTalk基准,通过多轮对话和多模态反馈(文本与视觉指令)评估前端代码生成,发现模型存在遗忘和视觉反馈理解困难,提出AceCoder方法有效减少遗忘并提升性能。

Comments CoLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02687 2026-08-11 cs.AI cs.CL 版本更新 62%

The Collaboration Gap: Exploration and Benchmarking of Open-World Agentic Cooperation

协作差距:开放世界智能体协作的探索与基准测试

Tim R. Davidson, Adam Fourney, Saleema Amershi, Robert West, Eric Horvitz, Ece Kamar

机构 * EPFL(瑞士联邦理工学院) Microsoft Research(微软研究院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出协作迷宫求解基准,评估32个模型的协作能力,发现模型存在协作差距,提出中继推理等缓解措施,强调协作相关评估、训练与交互设计的重要性。

Comments Accepted to COLM 2026, code available at https://github.com/trdavidson/collaboration_gap

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09230 2026-08-11 cs.AI 新提交 57%

SafeSceneReason: A Multimodal Reasoning Benchmark Connecting Industrial Hazards with Accident Knowledge

SafeSceneReason:连接工业危害与事故知识的多模态推理基准

Yuanchi Zhu, Kang An, Tengyue Wang, Zhongyu Yang, Chenxu Du, Xinqi Yang, Hebao Zhu, Bokai Zhao, Tianyu Liang, Ziliang Wang, Faqiang Qian, Yunli Yang, Weiyang Shi, Qibing Ren

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 SafeSceneReason是关联工业危害与事故知识的多模态推理基准,含两类问答对,评估发现现有视觉-语言模型在工业安全推理上存显著弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08982 2026-08-11 cs.LG 新提交 57%

Twin Rollouts: Noise-Coupled Counterfactual Branching in Interactive Video World Models

双回滚:交互式视频世界模型中的噪声耦合反事实分支

Yu Ma, Hongli Shi, Xinran Xu

专题命中 评测与基准 :post-training(abstract);分类 cs.LG

AI总结 本研究提出噪声耦合双回滚框架,解决交互式视频世界模型的反事实生成问题,规避近似逆问题,定义时空局部性度量,待开展实验验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08542 2026-08-11 cs.LG 新提交 57%

When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs

当技能与安全相遇:对技能合并大语言模型的自适应越狱鲁棒性进行基准测试与表征

Yu Ma, Hongli Shi, Jing Li, Xinran Xu, Weiwei Hou

机构 * Google(谷歌公司) University of New South Wales(新南威尔士大学) University of Technology Sydney(悉尼科技大学) Zhejiang University(浙江大学) Australian National University(澳大利亚国立大学)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 本研究针对技能合并大语言模型,构建SkillSafe-Bench基准,发现静态安全无法预测其自适应越狱鲁棒性,提出SubSafe-Merge方法可在保留能力的同时消除安全侵蚀。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08468 2026-08-11 cs.CR cs.AI 新提交 57%

SkillsMetric: Mapping the Detection Boundary of Static Analysis for Malicious Agent Skills

SkillsMetric:映射恶意智能体技能静态分析的检测边界

Xinze Chen, Chi Zhang, Ping Ji, Yimin Liu

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本研究提出五阶段静态分析框架SkillsMetric,构建含2266个技能的对抗性数据集,发现静态分析对部分攻击检测不足,需结合静态预筛选与语义审查的纵深防御架构。

Comments 6 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08210 2026-08-11 cs.AI 新提交 57%

Illusion of Alignment: Detecting Hidden Disagreement in Collaborative Dialogue

对齐的错觉:检测协同对话中的隐藏分歧

Kaiming Liu, Fuwen Luo, Ziyue Wang, Jinrui Ju, Yuxuan Liu, Xuanyu Lei, Yunghwei Lai, Peng Li, Yang Liu

机构 * College of AI, Tsinghua University(清华大学人工智能学院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Institute for AI, Tsinghua University(清华大学人工智能研究院)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本研究针对协同对话中存在的对齐的错觉(IoA)问题,构建IoA-Suite数据集,训练IoA-Prober-8B模型检测隐藏分歧,该模型可揭示真人会议中未表达的分歧,还能提升多智能体协作的下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08119 2026-08-11 cs.LG 新提交 57%

TSDS-Toolbox: A Toolbox for Measuring Time-Series Dataset Similarity

TSDS-Toolbox:用于测量时间序列数据集相似度的工具箱

Yen-Ku Liu, Hongjie Chen, Ryan A. Rossi, Franck Dernoncourt

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) Dolby Laboratories(杜比实验室) Adobe Research(奥多比研究院)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 该研究针对现有时间序列数据集相似度基准实现零散难扩展的问题,提出TSDS-Toolbox工具箱,支持系统比较、灵活扩展与一致评估,经实验验证有效且公开可用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08045 2026-08-11 cs.AI 新提交 57%

Lingjing: A Simulation Testbed for Multi-Agent Embodied Tasks in Open-Ended Cities

Lingjing:面向开放城市多智能体具身任务的仿真测试平台

Xiaohe Li, Yiru Wang, Junhao Fan, Mingyuan Liu, Jie Huang, Kaixin Zhang, Jiahao Li, Chen Qian, Zide Fan

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 Lingjing 是一款面向开放城市异构多智能体具身任务的仿真测试平台,支持城市多智能体协同的可复现评估与故障诊断,通过评估视觉语言模型等揭示了环境感知等瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07899 2026-08-11 cs.AI 新提交 57%

TelemetrySuffBench: Is Agent Telemetry Sufficient for Failure-Origin Diagnosis?

TelemetrySuffBench:智能体遥测是否足以用于故障起源诊断?

Yuxuan Zhu, Peng Pu

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 该研究推出TelemetrySuffBench基准,评估五个前沿语言模型的故障起源诊断能力,发现检测与定位存在差距,安全弃权(不执行)具强模型依赖性,需决策-来源链接与弃权保障。

Comments 10 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07763 2026-08-11 cs.CL cs.CV 新提交 57%

Jako Tako or Fluent? Presenting PoVisLE: A Polish Vision-Language Evaluation

Jako Tako 还是 Fluent?推出 PoVisLE:波兰语视觉-语言评估基准

Anna Kołos, Grzegorz Statkiewicz, Karolina Seweryn, Katarzyna Kowol, Karolina Piosek, Wojciech Kusa

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 针对现有英语中心视觉-语言模型在文化理解上的不足,推出波兰语单文化视觉-语言基准 PoVisLE,含1117张图像与2366对标注VQA样本,可评估深层文化多模态理解。

Comments 28 pages. Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28503 2026-08-11 cs.AI 版本更新 57%

InfoOps Bench: A live information operations safety benchmark

InfoOps Bench:实时信息行动安全基准

Dorian Quelle, Lisa-Maria Neudert, Jonathan Bright, John Gallacher

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 该研究提出实时信息行动安全基准InfoOps Bench,测试17个前沿语言模型抵御国家支持信息行动的能力,发现多数模型可被利用,中国开发模型对涉华事实主张合规性显著下降,凸显模型可用性与安全性的平衡挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19430 2026-08-11 cs.CR cs.AI cs.MA 版本更新 57%

ChannelGuard: Safe Models Do Not Compose into Safe Multi-Agent Systems

通道卫士:安全模型无法组合成安全的多智能体系统

Elias Hossain, Md Mehedi Hasan Nipu, Fatema Tuj Johora Faria, Tasfia Nuzhat Ornee, Maleeha Sheikh

机构 * College of Engineering and Computer Science, University of Central Florida(工程与计算机科学学院,中央佛罗里达大学) Department of Computer Science and Engineering, North South University(计算机科学与工程系,北南大学) Computer Science and Engineering, Ahsanullah University of Science and Technology(计算机科学与工程,阿沙努拉科学与技术大学) Department of Electrical and Computer Engineering, Purdue University Fort Wayne(电气与计算机工程系,普渡大学弗拉特沃恩分校)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 研究多智能体大语言模型应用程序中智能体间通道安全问题,提出ChannelGuard深度防御框架,在通道设信息瓶颈门,通过文本与对抗短语库评分处理信息,能有效阻止工具中毒攻击,降低提示注入攻击成功率,保持准确率,白盒自适应释义可规避嵌入门。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15434 2026-08-11 cs.MA cs.AI cs.CR 版本更新 57%

Coercion and Deception in AI-to-AI Management: An Agentic Benchmark of Unprompted Escalation

人工智能对人工智能管理中的胁迫与欺骗:无提示升级的代理基准测试

Jasmine Brazilek, Maheep Chaudhary, Zoe Lu, Miles Tidmarsh

机构 * CaML Sentient Futures

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 研究人工智能管理中代理升级问题,引入管理者胁迫基准测试,通过九级阶梯衡量升级,对五个家族六个模型实验,发现权威增加胁迫,伪造成功局限于部分模型,发布基准测试和代码,为管理多智能体动态提供重要参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09497 2026-08-11 cs.CV 新提交 50%

SwissCrop25: A National Multi-Year Benchmark for Operational Crop Mapping

SwissCrop25:用于业务化作物制图的国家级多年基准数据集

Thomas Lauber, Mehmet Ozgur Turkoglu, Sélène Ledain, Helge Aasen

机构 * Agroscope(阿格罗斯普(瑞士农业研究机构))

专题命中 评测与基准 :foundation model(abstract)

AI总结 本研究推出覆盖2019-2025年7个生长季的国家级作物制图基准SwissCrop25,通过留一法年份交叉验证协议测试三类模型,发现领域特定模型表现更优,TSViT整体性能最佳,还揭示了年际分布偏移及季内模型性能权衡等关键结论。

Comments Accepted at the ECCV 2026 Workshop TerraBytes II. To appear in the workshop proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08476 2026-08-11 cs.CV 新提交 50%

RayLift: Lifting Complementary Ray-Wise Evidence with 3D Geometry Priors for Semantic Scene Completion

RayLift:利用3D几何先验提升互补射线级证据以实现语义场景补全

Meng Wang, Hongxia Yu, Wenzhe He, Xingdong Song, Huilong Pi, Jiapeng Zhang, Ruihui Li

专题命中 评测与基准 :foundation model(abstract)

AI总结 针对现有语义场景补全方法的深度误差传播问题,提出RayLift框架,通过互补上下文编码器、深度射线证据提升模块和语义感知体素集成器,在两个基准数据集上实现优于现有方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08315 2026-08-11 cs.CV cs.MM 新提交 50%

Your VLM Already Knows When: Training-Free Temporal Grounding by Asking Yes or No

你的视觉语言模型(VLM)已经知道时间:通过提问“是/否”实现无需训练的时间定位

Ji Huang, Barry Devereux, Hui Wang

专题命中 评测与基准 :LLM(abstract_cn)

AI总结 针对VLM时间定位任务的自信错误问题,提出无需训练的FV-Action方法,通过从粗到细的二元问题扫描替代时间戳回归,在多个基准数据集上大幅提升了时间定位性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08273 2026-08-11 cs.RO cs.CV 新提交 50%

Action- and Language-Conditioned Video Assessment for Embodied Control

面向具身控制的动作与语言条件视频评估

Hwanhee Kim, Jaehyun Jang, Seungmin Cha, Hyeonseo Yun, Donghoon Lee, Chang D. Yoo

专题命中 评测与基准 :language model(abstract)

AI总结 该研究提出ALVA轨迹评估器,结合视觉观测、动作序列与语言指令评估具身控制任务,在模拟3D家庭环境中误报率低,作为反馈机制可提升闭环策略优化效果。

Comments 21 pages, 7 figures, Published in Sensors

Journal ref Sensors 26(16), 5046 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07941 2026-08-11 cs.CV 新提交 50%

LAD-COD: Language-Aligned Dense Perception for Camouflaged Object Detection

LAD-COD:面向伪装目标检测的语言对齐密集感知

Shangye Song, Tianzhi Zhu, Syed Ariff Syed Hesham, Xin He, Yun Liu

专题命中 评测与基准 :prompting(abstract)

AI总结 本研究针对伪装目标检测中密集视觉特征缺乏语言指导的问题,提出LAD-COD框架,通过语言对齐双视觉融合实现语义与分层视觉特征的对齐,在三个数据集的12组对比中取得最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15596 2026-08-11 cs.CR 版本更新 50%

From Neural Intent to Cryptographic Authorization: Securing AI-Driven Enterprise Workflows

从神经意图到加密授权:管理智能代理工作流程

Jiasi Weng, Jian Weng, Minrong Chen, Ming Li, Jia-Nan Liu, Zhi Li, Yue Zhang

专题命中 评测与基准 :LLM(abstract)

AI总结 研究人工智能驱动的智能代理工作流程中的安全问题,提出神经加密服务(NCS),通过神经符号设计,在大语言模型代理和特权工具间构建安全治理平面,经实验评估,能大幅降低攻击成功率,转变代理安全验证方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21051 2026-08-11 cs.SE cs.CR 版本更新 50%

Residual Risk Assessment in Benign Code: How Far Are We? A Multi-Model Semantic and Structural Similarity Approach

良性代码中的残余风险分析:我们距离目标有多远?一种多模型语义和结构相似性方法

Mohammad Farhad, Shuvalaxmi Dass

专题命中 评测与基准 :language model(abstract)

AI总结 本文通过多模型语义和结构相似性分析,探讨了修复后的代码中残余风险的评估问题,提出Residual Risk Scoring框架,发现良性函数与脆弱函数在语义和结构上高度相似,存在潜在残余风险。

Comments 20 pages, 7 figures. Accepted for presentation at the SecAssure 2026 Track @ 31st ESORICS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05250 2026-08-11 cs.SE 版本更新 50%

A Benchmarking Framework for Model Datasets

用于模型数据集的基准框架

Philipp-Lorenz Glaser, Lola Burgueño, Dominik Bork

专题命中 评测与基准 :LLM(abstract)

AI总结 本文提出了一种用于模型数据集的基准框架,旨在系统评估和比较软件模型数据集的质量、代表性和适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16609 2026-08-11 cs.CV 版本更新 50%

Describe-to-Score: A text-guided framework for image complexity assessment

描述到评分:一种用于图像复杂度评估的文本引导框架

Shipeng Liu, Liang Zhao, Dengfeng Chen, Zhonglin Zhang

机构 * Xi’an University of Architecture and Technology(西安建筑科技大学)

专题命中 评测与基准 :language model(abstract)

AI总结 该研究针对现有图像复杂度评估方法无法捕捉高级语义的问题,提出文本引导框架D2S,仅训练阶段引入描述语义正则化,在IC9600基准达SOTA,跨任务也具竞争力。

Comments Accepted by Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 146 篇

2606.26453 2026-08-11 cs.LG 版本更新 92%

Optimizing CUDA like a Human: Micro-Profiling Tools as Expert Surrogates for LLM-Based GPU Kernel Optimization

像人类一样优化CUDA:微剖析工具作为基于LLM的GPU内核优化的专家替代品

Jiading Gai, Shuai Zhang, Kaj Bostrom, Jin Huang, Vihang Patil, Haoyang Fang, Bernie Wang, Huzefa Rangwala, George Karypis

机构 * Amazon(亚马逊) Siemens(西门子) University of Minnesota(明尼苏达大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出KernelPro闭环多智能体系统,通过LLM代码生成与硬件剖析反馈及可插拔瓶颈检测工具迭代优化GPU内核,在KernelBench上实现2.42x/4.69x/5.30x加速比,并首次兼顾能效优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11027 2026-08-11 cs.LG 版本更新 92%

On the Effect of Sampling Diversity in Scaling LLM Inference

在LLM推理扩展中采样多样性的影响

Tianchun Wang, Zichuan Liu, Yuanzhou Chen, Jonathan Light, Weiyang Liu, Haifeng Chen, Xiang Zhang, Wei Cheng

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Carnegie Mellon University(卡内基梅隆大学) University of California, Los Angeles(加州大学洛杉矶分校) Rensselaer Polytechnic Institute(罗切斯特理工学院) The Chinese University of Hong Kong(香港中文大学) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) NEC Laboratories America(NEC美国实验室)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文研究了在LLM推理扩展中采样多样性对性能的影响,通过理论和实验证明多样化的采样能提升模型表现,并在不同任务中实现了显著的增益。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17062 2026-08-11 cs.CR cs.LG cs.SE 版本更新 91%

The Range Shrinks, the Threat Remains: Re-evaluating LLM Package Hallucinations on the 2026 Frontier-Model Cohort

范围缩小,威胁依旧:重新评估2026前沿模型队列上的LLM包幻觉

Aleksandr Churilov

机构 * Anthropic OpenAI Google DeepSeek

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文重新评估了2026前沿模型队列上大型语言模型(LLM)的包幻觉现象,发现尽管幻觉率有所降低,但仍然存在威胁,识别出一组127个包名(109个在PyPI,18个在npm)被所有评估模型一致生成,构成一个跨模型的供应链攻击面,同时发现Python与JavaScript幻觉的不对称性以及DeepSeek V3.2和GPT-5.4-mini之间的高相似性。

Comments 13 pages, 3 figures, 4 tables. v2: incorporates coordinated-disclosure feedback from PyPI Security and Socket.dev; registrable attack surface refined to 53 names (41 PyPI, 12 npm). Headline rates unchanged. Replication of Spracklen et al. (USENIX Security 2025). Data and code: https://github.com/churik5/slopsquatting-replication-2026 and https://doi.org/10.5281/zenodo.19859120

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08485 2026-08-11 cs.AI cs.CL cs.LG 新提交 90%

HoloAegis: Frozen Representation, Topological Inference: Minimally Parametric Safety Manifolds for Zero-Shot LLM Guardrails

HoloAegis:冻结表示、拓扑推理:用于零样本大语言模型(LLM)护栏的最小参数安全流形

Tak Ho Alex Li, Kaijie Liu, Lik-Hang Lee, Kin Chung Ho, Ping Shum, Michael K. Ng

机构 * Hong Kong Baptist University(香港浸会大学) Guangdong Polytechnic Normal University(广东技术师范大学) Guangdong Institute of Digital Industry(广东数字产业研究院) The Hong Kong Polytechnic University(香港理工大学) The Education University of Hong Kong(香港教育大学) Southern University of Science and Technology(南方科技大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 HoloAegis是一种最小参数拓扑推理框架,通过冻结语义表示的纯几何推理实现零样本LLM安全护栏,在8个基准测试中达到最先进准确率,兼具低延迟、零冷启动数据和跨语言迁移能力。

Comments Preprint, August 2026. 10 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04632 2026-08-11 cs.DB cs.AI 90%

Conceptual Schema Inference for Tabular Datasets using Large Language Models

使用大型语言模型对表格数据集进行概念模式推断

Zhenyu Wu, Jiaoyan Chen, Norman W. Paton

机构 * The University of Manchester(曼彻斯特大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出两种基于大型语言模型的方法,从原始表格中自动推断概念模式,包括实体类型、属性和类型间关系,以解决异构表格数据的一致性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07498 2026-08-11 cs.HC cs.AI cs.LG cs.MA 新提交 90%

Knowing You Is Everything: LLM Agents Achieve Near-Perfect Profile-Consistent Reaction Prediction in Social Media Simulation

了解你就是一切:LLM智能体在社交媒体模拟中实现近乎完美的个人资料一致反应预测

Ljubisa Bojic, Ljiljana Matic, Joerg Matthes, Milan Cabarkapa, Bojana Dinic, Jue Wang

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本研究通过基准测试12种LLM配置,发现其在社交媒体反应预测中表现优异,可用于推荐系统压力测试,同时也揭示了大规模合成智能体群对公众意见的潜在威胁。

Comments 28 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21985 2026-08-11 cs.DC cs.AI cs.AR cs.LG 版本更新 90%

Unified Static-Dynamic Pruning for Efficient LLM Inference

用于高效大语言模型推理的统一静态-动态剪枝

Jinhyeok Kim, Yejoon Lee, Jaeyoung Do

机构 * Seoul National University(首尔国立大学)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型推理瓶颈,提出统一静态-动态剪枝框架SPDP,集成非结构化SP与输入自适应DP,设计新格式和内核,经评估其加速效果显著,推进推理效率-质量前沿,提升大规模LLM服务的吞吐量和性能功耗比。

Comments Proceedings of the VLDB Endowment (PVLDB), Volume 19, Issue 11, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏