arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22280 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22280 篇

2603.05863 2026-04-21 cs.CL cs.LG cs.SE 88%

ReflexiCoder: Teaching Large Language Models to Self-Reflect on Generated Code and Self-Correct It via Reinforcement Learning

ReflexiCoder:通过强化学习教大语言模型自我反思和自我纠正生成的代码

Juyong Jiang, Jiasi Shen, Sunghun Kim, Kang Min Yoo, Jeonghoon Kim, Sungju Kim

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) Amazon AGI(亚马逊人工智慧实验室) NAVER Cloud(NAVER云)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出ReflexiCoder,一种基于强化学习的框架,使大语言模型在推理过程中自我反思和纠正代码,通过细粒度奖励函数优化整个反思-纠正过程,实现无需外部反馈的自我调试能力,实验表明其在多个基准测试中表现优异,且在推理效率上更高效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07794 2026-04-21 cs.CL cs.AI 88%

Emergent Structured Representations Support Flexible In-Context Inference in Large Language Models

涌现的结构化表示支持大型语言模型中的灵活上下文推理

Ningyu Xu, Qi Zhang, Xipeng Qiu, Xuanjing Huang

机构 * College of Computer Science and Artificial Intelligence(计算机科学与人工智能学院) Fudan University(复旦大学) Shanghai, China(中国上海)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究揭示大型语言模型在上下文推理中通过结构化表示动态构建和利用潜在表示,为灵活适应的计算过程提供新见解。

Comments 36 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16913 2026-04-21 cs.AI cs.CL cs.CR cs.DC 88%

The Cognitive Penalty: Ablating System 1 and System 2 Reasoning in Edge-Native SLMs for Decentralized Consensus

认知惩罚:在边缘原生SLM中消融系统1和系统2推理以实现去中心化共识

Syed Muhammad Aqdas Rizvi

机构 * Independent Researcher(独立研究者) Lahore University of Management Sciences(拉合尔管理科学大学)

专题命中 效率与部署 :SLM(title_cn,summary_cn);language model(abstract);small language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了边缘原生SLM中系统1和系统2推理对去中心化共识的影响,发现系统1在对抗性环境中表现更优,而系统2导致计算准确率倒置和稳定性下降。

Comments Working paper. 14 pages, 3 figures, 6 tables. Code and dataset: https://github.com/smarizvi110/sentinel-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09025 2026-04-21 cs.CL cs.LG 88%

Lizard: An Efficient Linearization Framework for Large Language Models

Lizard:一种高效的大型语言模型线性化框架

Chien Van Nguyen, Huy Nguyen, Ruiyi Zhang, Hanieh Deilamsalehy, Puneet Mathur, Viet Dac Lai, Haoliang Wang, Jayakumar Subramanian, Ryan A. Rossi, Trung Bui, Nikos Vlassis, Franck Dernoncourt, Thien Huu Nguyen

机构 * University of Oregon(俄勒冈大学) Adobe Research(Adobe研究院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 Lizard提出一种高效线性化框架,将预训练的Transformer大型语言模型转换为亚二次架构,通过亚二次注意力机制提升计算效率,实现模型质量与内存控制的平衡。

Comments ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03052 2026-04-21 cs.LG cs.AI 88%

From 2:4 to 8:16 sparsity patterns in LLMs for Outliers and Weights with Variance Correction

从2:4到8:16稀疏模式在LLM中的应用:用于异常值和方差校正的权重

Egor Maximov, Yulia Kuzkina, Azamat Kanametov, Alexander Prutko, Aleksei Goncharov, Maxim Zhelnin, Egor Shvetsov

机构 * Moscow Independent Research Institute of Artificial Intelligence(莫斯科独立人工智能研究 institute) MIL Team(MIL 团队) MWS AI(MWS 人工智能) Applied AI(应用人工智能)

专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了8:16半结构化稀疏模式在LLM中的应用,通过方差校正和权重平等化技术提升稀疏模型性能,展示其在压缩与精度间的平衡优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05015 2026-04-17 cs.LG cs.AI 88%

SPaCe: Unlocking Sample-Efficient Large Language Models Training With Self-Pace Curriculum Learning

SPaCe:通过自适应课程学习解锁高效大语言模型训练

Dai Do, Manh Nguyen, Svetha Venkatesh, Hung Le

机构 * Deakin Applied AI Initiative, Deakin University, Australia(德金应用人工智能倡议,德金大学,澳大利亚)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 SPaCe通过自适应课程学习框架,优化数据选择与训练时机,提升大语言模型的训练效率,实验表明其在多个推理基准上性能优于现有方法,样本使用减少达100倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16068 2026-04-14 cs.CR cs.AI cs.CL 88%

Resource Consumption Threats in Large Language Models

大语言模型中的资源消耗威胁

Yuanhe Zhang, Xinyue Wang, Zhican Chen, Weiliu Wang, Zilu Zhang, Zhengshuo Gong, Zhenhong Zhou, Kun Wang, Li Sun, Yang Liu, Sen Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Hangzhou Dianzi University(杭州电子科技大学) Nanyang Technological University(南洋理工大学) Chongqing University of Posts and Telecommunications(重庆邮电大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文系统回顾了大语言模型中资源消耗威胁,分析其影响并提出统一视角,旨在明确问题领域以支持后续建模和缓解措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06307 2026-04-14 cs.LG cs.AI 88%

Optimizing Large Language Models: Metrics, Energy Efficiency, and Case Study Insights

优化大语言模型:指标、能效与案例研究洞察

Tahniat Khan, Soroor Motie, Sedef Akinli Kocak, Shaina Raza

机构 * Vector Institute(向量研究所) University of Ottawa(渥太华大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了在大语言模型部署中整合能效优化技术,通过量化和本地推断技术降低碳足迹,实验表明可减少45%的能耗和碳排放,适用于资源受限环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09024 2026-04-13 cs.CV cs.AI cs.CR cs.LG 88%

Leave My Images Alone: Preventing Multi-Modal Large Language Models from Analyzing Images via Visual Prompt Injection

别让我看图片:通过视觉提示注入防止多模态大语言模型分析图片

Zedian Shao, Hongbin Liu, Yuepeng Hu, Neil Zhenqiang Gong

机构 * Georgia Institute of Technology(佐治亚理工学院) Duke University(杜克大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出ImageProtector,通过在图像中嵌入精心设计的微小扰动,使多模态大语言模型在分析时产生拒绝响应,同时评估了三种潜在的防御措施,发现它们在降低ImageProtector效果的同时影响模型性能。

Comments Appeared in ACL 2026 main conference

Journal ref The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07808 2026-04-10 cs.CL cs.LG 88%

GRASS: Gradient-based Adaptive Layer-wise Importance Sampling for Memory-efficient Large Language Model Fine-tuning

GRASS:基于梯度的自适应层级重要性采样用于内存高效的大型语言模型微调

Kaiyuan Tian, Yu Tang, Gongqingjian Jiang, Baihui Liu, Yifu Gao, Xialin Su, Linbo Qiao, Dongsheng Li

机构 * National University of Defense Technology(国防科技大学) Information Support Force Engineering University(信息支援部队工程大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 GRASS提出一种基于梯度的自适应层级重要性采样方法,通过动态调整层采样概率和优化器状态卸载机制,在降低内存使用的同时提升微调性能,实验显示其在多个模型和基准测试中均优于现有方法。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07385 2026-04-10 cs.LG cs.AI 88%

Playing DOOM with 1.3M Parameters: Specialized Small Models vs Large Language Models for Real-Time Game Control

用130万参数进行DOOM游戏:专用小型模型与大型语言模型在实时游戏控制中的对比

David Golchinfar, Daryoush Vaziri, Alexander Marquardt

机构 * VAGO Solutions University of Applied Sciences Bonn-Rhein-Sieg(波恩-莱茵-锡格应用技术大学) Cybernetics and Reality Engineering (CARE) Laboratory, Nara Institute of Science and Technology(奈良先端科学技术大学院大学控制论与真实工程实验室)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出SauerkrautLM-Doom-MultiVec模型,通过31ms/决策的ASCII帧表示选择游戏动作,在实时DOOM游戏中超越了包括Nemotron-120B在内的大型语言模型,展示了专用小型模型在实时控制任务中的优势。

Comments 17 pages, 3 figures, 3 tables. Code and model weights available at https://github.com/VAGOsolutions/SauerkrautLM-Doom-MultiVec

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04493 2026-04-07 cs.LG cs.AI 88%

SLaB: Sparse-Lowrank-Binary Decomposition for Efficient Large Language Models

SLaB:用于高效大语言模型的稀疏低秩二进制分解

Ziwei Li, Yuang Ma, Yi Kang

机构 * School of Microelectronics, University of Science and Technology of China(中国科学技术大学微电子学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 SLaB通过将线性层权重分解为稀疏矩阵、低秩矩阵和二进制矩阵,实现大语言模型的高效压缩,在50%压缩下使困惑度降低36%,在零样本任务中提升准确率8.98%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00733 2026-04-07 cs.LG cs.AI 88%

Spectral Compact Training: Pre-Training Large Language Models via Permanent Truncated SVD and Stiefel QR Retraction

谱紧凑训练:通过永久截断SVD和Stiefel QR回退预训练大语言模型

Björn Roman Kohlberger

机构 * EctoSpace

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出SCT方法,通过永久截断SVD和Stiefel QR回退减少内存占用,实现大语言模型的高效预训练,实验显示内存占用降低达199倍,提升训练效率。

Comments 8 pages, 3 figures, 4 tables. Patent pending: Irish Application PTIE20260000000219. Code at https://github.com/EctoSpace/SCT

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02343 2026-03-31 cs.LG cs.AI 88%

MicroMix: Efficient Mixed-Precision Quantization with Microscaling Formats for Large Language Models

MicroMix:基于微缩格式的高效混合精度量化用于大语言模型

Wenyuan Liu, Haoqian Meng, Yilun Luo, Yafei Zhao, Peng Zhang, Xindian Ma

机构 * College of Intelligence and Computing, Tianjin University(天津大学智能与计算学部)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 MicroMix通过引入微缩格式实现大语言模型的高效混合精度量化,平衡精度与效率,实现接近FP16的性能,且在多个任务中保持无损准确性。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27094 2026-03-31 cs.CR cs.AI cs.LG 88%

Sovereign Context Protocol: An Open Attribution Layer for Human-Generated Content in the Age of Large Language Models

主权上下文协议:大型语言模型时代的人类生成内容开放归属层

Praneel Panchigar, Torlach Rush, Matthew Canabarro

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Sovereign Context Protocol,旨在为大型语言模型提供开放的归属层,解决人类生成内容在价值链中的可见性问题,通过标准化LLM与创作者数据的连接方式,实现访问事件的记录、许可和归属。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24296 2026-03-27 cs.CL cs.AI 88%

DiffuGuard: How Intrinsic Safety is Lost and Found in Diffusion Large Language Models

DiffuGuard: 差分扩散语言模型中内在安全的丧失与恢复

Zherui Li, Zheng Nie, Zhenhong Zhou, Yue Liu, Yitong Zhang, Yu Cheng, Qingsong Wen, Kun Wang, Yufei Guo, Jiaheng Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Squirrel Ai Learning(松鼠AI) Peking University(北京大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文分析了差分扩散语言模型在对抗攻击中的脆弱性,提出DiffuGuard框架通过随机退火重标记和块级审计修复提升模型安全性,有效降低攻击成功率。

Comments Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22355 2026-03-25 stat.ML cs.CL cs.LG 88%

Demystifying Low-Rank Knowledge Distillation in Large Language Models: Convergence, Generalization, and Information-Theoretic Guarantees

解析大型语言模型中低秩知识蒸馏:收敛性、泛化能力和信息论保证

Alberlucia Rafael Soarez, Daniel Kim, Mariana Costa, Alejandro Torre

机构 * Department of Computer Science, University of Brasilia(巴西布拉兹利亚大学计算机科学系)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文研究了大型语言模型中低秩知识蒸馏的理论基础,推导了收敛率、泛化界限及信息论分析,提出最优秩选择原则,并通过实验验证理论结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16440 2026-03-18 cs.LG cs.CL 88%

Capability-Guided Compression: Toward Interpretability-Aware Budget Allocation for Large Language Models

基于能力的压缩:迈向大语言模型中可解释性感知的预算分配

Rishaank Gupta

机构 * Independent Researcher(独立研究者)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出基于能力的压缩方法,通过能力密度图分配不同压缩预算,解决传统压缩方法中缺乏对模型组件功能编码表示的问题,证明高能力密度组件具有更低的结构冗余和更早达到相变点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10088 2026-03-12 cs.LG cs.AI 88%

ES-dLLM: Efficient Inference for Diffusion Large Language Models by Early-Skipping

ES-dLLM:通过早期跳过实现扩散大语言模型的高效推理

Zijian Zhu, Fei Ren, Zhanhong Tan, Kaisheng Ma

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 ES-dLLM通过早期跳过技术提升扩散大语言模型的推理效率,实现高达16.8倍的加速效果。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09579 2026-03-12 cs.CL cs.AI 88%

Modelling Language using Large Language Models

利用大语言模型建模语言

Jumbly Grindrod

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了大型语言模型作为公共语言科学模型的潜力,提出通过计算语言学研究开发模型诠释以理解语言结构。

Comments Philosophical Studies (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02751 2026-03-09 cs.CL cs.AI cs.CR 88%

Window-based Membership Inference Attacks Against Fine-tuned Large Language Models

基于窗口的细调大语言模型成员推断攻击

Yuetian Chen, Yuntao Du, Kaiyuan Zhang, Ashish Kundu, Charles Fleming, Bruno Ribeiro, Ninghui Li

机构 * Purdue University(普渡大学) Cisco Research(思科研究) Cisco Systems(思科系统)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出WBC方法,通过滑动窗口和符号聚合技术,有效识别细调大语言模型中的训练数据,显著提升检测性能。

Comments Accepted to USENIX Security 2026. This extended arXiv version includes complete experimental results. The source code is publicly available at: https://github.com/Stry233/WBC/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26577 2026-02-27 cs.CL cs.LG 88%

Inference-Cost-Aware Dynamic Tree Construction for Efficient Inference in Large Language Models

面向推理成本的动态树结构构建用于大型语言模型高效推理

Yinrong Hong, Zhiquan Tan, Kai Hu

机构 * Beihang University(北航大学) E Fund Management Co., Ltd.(E基金管理有限公司)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出CAST方法,通过考虑推理成本优化动态树结构,显著提升大型语言模型的推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22345 2026-02-27 cs.LG cs.AI 88%

Structure and Redundancy in Large Language Models: A Spectral Study via Random Matrix Theory

大语言模型的结构与冗余:通过随机矩阵理论的谱研究

Davide Ettori

机构 * Laurea Magistrale in Computer Science Engineering - Ingegneria Informatica(计算机科学工程硕士课程 - 信息工程)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究通过谱几何和随机矩阵理论,提出EigenTrack用于检测大语言模型幻觉和分布外行为,以及RMT-KD用于压缩深度网络,提升模型可靠性与效率。

Comments Executive Summary of Master Thesis in Computer Science Engineering, Politecnico di Milano

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11184 2026-02-25 cs.LG cs.AI 88%

KBVQ-MoE: KLT-guided SVD with Bias-Corrected Vector Quantization for MoE Large Language Models

KBVQ-MoE:基于KLT引导SVD与偏置校正向量量化的大语言模型MoE

Zukang Xu, Zhixiong Zhao, Xing Hu, Zhixuan Chen, Dawei Yang

机构 * Houmo AI Nanyang Technological University(南洋理工大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 KBVQ-MoE通过KLT引导SVD和偏置校正输出稳定化,提升MoE大语言模型的极低比特量化精度与部署效率。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00553 2026-02-24 cs.LG cs.AI 88%

On Predictability of Reinforcement Learning Dynamics for Large Language Models

关于大型语言模型强化学习动态的可预测性

Yuchen Cai, Ding Cao, Xin Xu, Zijun Yao, Yuqing Huang, Zhenyu Tan, Benyi Zhang, Guangzhong Sun, Guiquan Liu, Junfeng Fang

机构 * USTC(中国科学技术大学) NUS(新加坡国立大学) HKUST(香港科技大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究发现大型语言模型强化学习动态的两个基本特性,并提出AlphaRL框架实现加速训练,保留高推理性能。

Comments 48 pages, 28 figures;

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00794 2026-02-20 cs.LG cs.AI 88%

Efficient Reinforcement Learning for Large Language Models with Intrinsic Exploration

为大语言模型高效强化学习引入内在探索

Yan Sun, Jia Guo, Stanley Kok, Zihao Wang, Zujie Wen, Zhiqiang Zhang

机构 * National University of Singapore(新加坡国立大学) Ant Group(蚂蚁集团)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 PREPO通过利用内在数据属性提升大语言模型强化学习的数据效率,减少回放需求同时保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08796 2026-02-17 cs.LG cs.AI 88%

Robust Multi-Objective Controlled Decoding of Large Language Models

鲁棒多目标控制解码大型语言模型

Seongho Son, William Bankes, Sangwoong Yoon, Shyam Sundhar Ramesh, Xiaohang Tang, Ilija Bogunovic

机构 * University College London(伦敦大学学院) Ulsan National Institute of Science and Technology(釜山国立科学技术研究所) University of Basel(巴塞尔大学) University College London AI Centre(伦敦大学学院人工智能中心)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出RMOD算法,通过最大化最坏情况奖励实现鲁棒多目标解码,有效提升大型语言模型在多个人类目标上的对齐性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10030 2026-02-11 cs.CL cs.AI 88%

Inference-Aware Prompt Optimization for Aligning Black-Box Large Language Models

面向推理的提示优化以对齐黑盒大语言模型

Saaduddin Mahmud, Mason Nakamura, Kyle Hollins Wray, Shlomo Zilberstein

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出IAPO框架,通过联合优化提示和推理规模,提升黑盒大语言模型对齐效果。

Comments Accepted to AAAI 2026. Extended 17-page version

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12932 2026-02-10 cs.LG cs.AI cs.CE 88%

Investigating Data Pruning for Pretraining Biological Foundation Models at Scale

大规模预训练生物基础模型的数据剪枝研究

Yifan Wu, Jiyue Jiang, Xichen Ye, Yiqi Wang, Chang Zhou, Yitao Xu, Jiayang Chen, He Hu, Weizhong Zhang, Cheng Jin, Jiao Yuan, Yu Li

专题命中 效率与部署 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种影响引导的数据剪枝方法,用于大规模预训练生物基础模型,通过有效减少计算成本和数据冗余,提升生物信息学任务的可重复性和可访问性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07909 2026-02-10 cs.CL cs.LG 88%

SparseEval: Efficient Evaluation of Large Language Models by Sparse Optimization

SparseEval: 通过稀疏优化高效评估大语言模型

Taolin Zhang, Hang Guo, Wang Lu, Tao Dai, Shu-Tao Xia, Jindong Wang

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Microsoft Research Asia(微软亚洲研究院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 SparseEval通过稀疏优化方法高效评估大语言模型,利用梯度下降和迭代细化策略提升基准测试效率,展现高鲁棒性和实用性。

Comments ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏