arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22280 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22280 篇

2605.26339 2026-05-27 cs.LG cs.CL 88%

QAM-W: Joint 2D Codebook Quantization for LLM Weights via Hadamard Rotation and Activation-Aware Scaling

QAM-W: 通过哈达玛旋转和激活感知缩放实现LLM权重的联合2D码本量化

Preetam Sharma, Kacper Dobek

机构 * Independent Research(独立研究) Institute of Computing Science(计算科学研究所) Poznan University of Technology(波兹南技术大学)

专题命中 效率与部署 :LLM(title,title_cn);post-training(abstract);分类 cs.CL、cs.LG

AI总结 提出QAM-W方法,通过L2归一化、块哈达玛旋转和2D坐标配对量化,结合激活感知缩放,在约5.5 bpw下使困惑度接近BF16,优于极坐标编码,并在5-6 bpw范围内保持质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00419 2026-05-26 cs.LG cs.CL 88%

Rethinking LLM Ensembling from the Perspective of Mixture Models

从混合模型的角度重新思考大语言模型集成

Jiale Fu, Yuchu Jiang, Peijun Wu, Chonghan Liu, Joey Tianyi Zhou, Xu Yang

机构 * Key Laboratory of New Generation Artificial Intelligence Technology(新一代人工智能技术关键实验室) Its Interdisciplinary Applications (Southeast University), Ministry of Education(交叉应用(东南大学),教育部) Southeast University(东南大学) Centre for Frontier AI Research (CFAR), Agency for Science, Technology(前沿人工智能研究(CFAR),科技研究局) Research (A STAR), Singapore(研究(A STAR),新加坡) Institute of High Performance Computing (IHPC), Agency for Science, Technology(高性能计算(IHPC),科技研究局)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出混合模型式集成(ME),通过将集成重新解释为混合模型,随机选择单个模型生成下一个token,避免显式计算完整集成分布,实现1.78x-2.68x加速,并揭示了集成与token级路由方法的联系。

Comments ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18170 2026-05-26 cs.CL cs.AI 88%

Copy-as-Decode: Grammar-Constrained Parallel Prefill for LLM Editing

Copy-as-Decode: 面向LLM编辑的语法约束并行预填充

Ziyang Liu

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出Copy-as-Decode机制,通过语法约束的并行预填充加速LLM编辑,实现高达303倍的自回归解码加速,并保持高覆盖率与无损性。

Comments The authors have decided to withdraw this version following internal review regarding authorship and contribution agreements

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19701 2026-05-18 cs.LG cs.AI 88%

LASER: Language Model Regression for Semi-Structured Workflow Resource and Runtime Estimation

LASER:用于半结构化工作流资源和运行时间估计的语言模型回归

Yuxuan Yin, Shengke Zhou, Yunjie Zhang, Ajay Mohindra, Boxun Xu, Peng Li

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校)

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(title);分类 cs.AI、cs.LG

AI总结 本文提出LASER框架,通过微调LLM实现多目标资源和运行时间回归,采用科学计数法和约束解码提升预测精度与效率,验证表明其在大规模芯片设计任务和GHARuntime基准上优于人类专家和现有表格型ML方法。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10880 2026-05-11 cs.CR cs.AI cs.CL 88%

Searching for Privacy Risks in LLM Agents via Simulation

通过模拟搜索LLM代理中的隐私风险

Yanzhe Zhang, Diyi Yang

机构 * Georgia Tech(佐治亚理工学院) Stanford University(斯坦福大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文提出通过模拟搜索改进攻击与防御策略,发现攻击策略从直接请求演变为伪装和伪造同意等复杂手段,防御策略从规则约束升级为身份验证状态机,为隐私安全代理发展提供洞察。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06914 2026-05-11 cs.DC cs.AI cs.CL 88%

Regulating Branch Parallelism in LLM Serving

在LLM服务中调节分支并行度

Swapnil Gandhi, Siva Hari, William J. Dally, Christos Kozyrakis

机构 * Stanford University(斯坦福大学) NVIDIA(英伟达)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文提出TAPER,一种按步骤的准入控制器,通过预测分支外部性来调节分支并行度,提升吞吐量并保持服务级别目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05703 2026-05-11 cs.MA cs.AI cs.LG 88%

Active Learning for Communication Structure Optimization in LLM-Based Multi-Agent Systems

基于大语言模型多智能体系统的通信结构优化的主动学习

Huchen Yang, Xinghao Dong, Dan Negrut, Jin-Long Wu

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于信息论的任务选择框架,通过估计任务信息量优化多智能体系统通信结构,在有限预算下提升性能并减少token使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06412 2026-05-08 cs.LG cs.CL 88%

Sample-efficient LLM Optimization with Reset Replay

基于重置回放的高效大语言模型优化

Zichuan Liu, Jinyu Wang, Lei Song, Jiang Bian

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 效率与部署 :LLM(title,abstract);post-training(abstract);preference optimization(abstract);分类 cs.CL、cs.LG

AI总结 本文提出LoRR方法,通过高重播训练和周期性重置策略提升偏好优化的样本效率,实验表明其在数学和通用推理基准上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23277 2026-04-28 cs.CL cs.AI 88%

From Similarity to Structure: Training-free LLM Context Compression with Hybrid Graph Priors

从相似性到结构:基于混合图先验的训练自由LLM上下文压缩

Yitian Zhou, Chaoning Zhang, Jiaquan Zhang, Zhenzhen Huang, Jinyu Guo, Sung-Ho Bae, Lik-Hang Lee, Caiyan Qin, Yang Yang

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院) Department of Computer Science and Engineering, Kyung Hee University(Kyung Hee大学计算机科学与工程系) Department of Industrial and Systems Engineering, The Hong Kong Polytechnic University(香港理工大学工业与系统工程系) School of Robotics and Advanced Manufacture, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区机器人与先进制造学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种无需训练的上下文压缩框架,利用混合图先验选择句子,通过构建稀疏句子图、提取主题骨架并结合可解释评分进行冗余抑制,实验证明在长文档基准上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20021 2026-04-23 cs.LG cs.CL 88%

Continuous Semantic Caching for Low-Cost LLM Serving

连续语义缓存用于低成本大语言模型服务

Baran Atalar, Xutong Liu, Jinhang Zuo, Siwei Wang, Wei Chen, Carlee Joe-Wong

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Washington Tacoma(华盛顿大学塔科马分校) City University of Hong Kong(香港城市大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出连续语义缓存框架,通过动态ε-网离散化与核岭回归,解决连续查询空间下的缓存优化问题,降低计算和切换开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15464 2026-04-20 cs.PF cs.AI cs.LG 88%

Ragged Paged Attention: A High-Performance and Flexible LLM Inference Kernel for TPU

不规则分页注意机制:一种高性能且灵活的TPU大语言模型推理内核

Jevin Jiang, Ying Chen, Blake A. Hechtman, Fenghui Zhang, Yarong Mu

机构 * Google(谷歌)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RPA,一种用于TPU的高性能注意力内核,通过细粒度分块、定制软件流水线和分布感知编译策略,提升TPU在动态不规则执行模式下的效率,实现在解码和预填充任务中达到86%和73%的利用率。

Comments 23 pages, 19 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20868 2026-04-17 cs.LG cs.AI cs.NE 88%

Rethinking LLM-Driven Heuristic Design: Generating Efficient and Specialized Solvers via Dynamics-Aware Optimization

重新思考基于大语言模型的启发式设计:通过动态感知优化生成高效且专用的求解器

Rongzheng Wang, Yihong Huang, Muquan Li, Jiakai Li, Di Liang, Bob Simons, Pei Ke, Shuang Liang, Ke Qin

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DASH框架,通过动态感知指标优化求解器搜索机制和运行时间安排,提升求解效率和性能,同时通过Profiled Library Retrieval减少重新适应成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06296 2026-04-17 cs.LG cs.AI cs.MA cs.SE 88%

AgentOpt v0.1 Technical Report: Client-Side Optimization for LLM-Based Agent

AgentOpt v0.1 技术报告:基于LLM的代理的客户端优化

Wenyue Hua, Sripad Karne, Qian Xie, Armaan Agrawal, Nikos Pagonas, Kostis Kaffes, Tianyi Peng

机构 * Microsoft Research, AI Frontiers(微软研究院,人工智能前沿) Cornell University(康奈尔大学) Columbia University(哥伦比亚大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出AgentOpt框架,用于解决LLM代理客户端资源分配问题,通过多种搜索算法优化模型选择和资源分配,提升效率与效果。

Comments 24 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13151 2026-04-08 cs.LG cs.CL 88%

Quantization-Robust LLM Unlearning via Low-Rank Adaptation

通过低秩适应实现抗量化的大语言模型反学习

João Vitor Boer Abitante, Joana Meneguzzo Pasquali, Luan Fonseca Garcia, Ewerton de Oliveira, Thomas da Silva Paula, Rodrigo C. Barros, Lucas S. Kupssinskü

机构 * Kunumi Institute, Brazil(Kunumi研究所,巴西)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出LoRA方法,通过冻结基础模型并集中反学习到可训练适配器中,提升4位量化下的模型性能,同时减少隐私泄露,适用于需要量化部署的场景。

Comments Accepted to IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07374 2026-03-30 cs.CL cs.AI 88%

TernaryLM: Memory-Efficient Language Modeling via Native 1.5-Bit Quantization with Adaptive Layer-wise Scaling

TernaryLM: 通过原生1.5位量化与自适应层间缩放实现内存高效的语言模型

Nisharg Nargund, Priyesh Shukla

机构 * KIIT Bhubaneshwar, India(印度KIIT大学) IIIT Hyderabad, India(印度国际信息技术学院海德拉巴分校)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);pretraining(abstract);post-training(abstract)

AI总结 TernaryLM通过原生1.5位量化与自适应层间缩放,在保持语言建模能力的同时显著减少内存使用,实验显示其在多个任务上的表现优异,且在小数据集上防止过拟合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24174 2026-03-02 cs.CL cs.AI cs.IT math.IT 88%

Task-Centric Acceleration of Small-Language Models

面向任务的小型语言模型加速

Dor Tsur, Sharon Adar, Ran Levy

机构 * Amazon(亚马逊)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);small language model(abstract);SLM(abstract)

AI总结 本文提出TASC框架,通过任务自适应序列压缩方法提升小型语言模型的推理效率,同时保持任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17621 2026-02-24 cs.MA cs.AI cs.CL 88%

From Competition to Coordination: Market Making as a Scalable Framework for Safe and Aligned Multi-Agent LLM Systems

从竞争到协调:市场制作作为安全且对齐的多智能体大语言模型系统的可扩展框架

Brendan Gho, Suman Muppavarapu, Afnan Shaik, Tyson Tsay, Atharva Mohan, James Begin, Kevin Zhu, Archana Vaidheeswaran, Vasu Sharma

机构 * Algoverse AI Research(Algoverse AI研究院)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出一种基于市场机制的多智能体大语言模型协调框架,通过结构化经济交换提升推理准确性和透明度,实现自我组织和可验证推理,为安全、对齐的AI系统提供可扩展解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02546 2026-02-09 cs.LG cs.AI 88%

D$^2$Quant: Accurate Low-bit Post-Training Weight Quantization for LLMs

D$^2$Quant: 高精度低比特后训练权重量化用于大语言模型

Xianglong Yan, ChengZhu Bao, Zhiteng Li, Tianao Zhang, Shaoqiu Zhang, Ruobing Xie, Samm Sun, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Hunyuan(腾讯文心)

专题命中 效率与部署 :post-training(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 D$^2$Quant通过双尺度量化器和偏差感知修正提升低比特权重量化精度,实现更高效的LLM部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16083 2025-12-19 cs.DB cs.AI cs.HC cs.LG 88%

Scaling Text2SQL via LLM-efficient Schema Filtering with Functional Dependency Graph Rerankers

通过LLM高效模式过滤实现Text2SQL扩展

Thanh Dat Hoang, Thanh Tam Nguyen, Thanh Trung Huynh, Hongzhi Yin, Quoc Viet Hung Nguyen

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 通过LLM高效模式过滤框架提升Text2SQL系统在大规模模式下的性能与效率

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13935 2025-12-17 cs.LG cs.AI q-bio.QM 88%

Informing Acquisition Functions via Foundation Models for Molecular Discovery

通过基础模型指导获取函数以加速分子发现

Qi Chen, Fabio Ramos, Alán Aspuru-Guzik, Florian Shkurti

机构 * Department of Computer Science, University of Toronto(计算机科学系,多伦多大学) NVIDIA Research Seattle Robotics Lab (SRL)(NVIDIA研究塞班机器人实验室) University of Sydney(悉尼大学) Department of Chemical Engineering & Applied Chemistry, University of Toronto(化学工程与应用化学系,多伦多大学) Acceleration Consortium(加速联盟) Data Science Institute(数据科学研究所) Vector Institute(向量研究所) Robotics Institute(机器人研究所) Canadian Institute for Advanced Research (CIFAR)(加拿大高级研究研究院)

专题命中 效率与部署 :foundation model(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种无需显式替代模型的贝叶斯优化方法,利用通用LLMs和化学基础模型的先验知识指导获取函数,提升分子发现的扩展性、鲁棒性和样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21762 2025-12-01 cs.CL cs.AI 88%

Factors That Support Grounded Responses in LLM Conversations: A Rapid Review

支持LLM对话中基础响应的因素:一项快速回顾

Gabriele Cesar Iwashima, Claudia Susie Rodrigues, Claudio Dipolitto, Geraldo Xexéo

机构 * (June 2025)((2025年6月))

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文通过快速回顾识别了支持LLM对话中基础响应的因素,重点分析了推理时间、训练后及强化学习方法,旨在提升LLM响应的准确性和可靠性。

Comments 28 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22691 2025-10-28 cs.CL cs.LG 88%

SALSA: Single-pass Autoregressive LLM Structured Classification

Ruslan Berdichevsky, Shai Nahum-Gefen, Elad Ben Zaken

机构 * Dream Security Ltd.(Dream Security有限公司)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01420 2025-10-27 cs.CL cs.LG 88%

Self-Refining Language Model Anonymizers via Adversarial Distillation

Kyuyoung Kim, Hyunjun Jeon, Jinwoo Shin

机构 * KAIST AI(韩国科学技术院人工智能研究所)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);small language model(abstract)

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20214 2025-10-23 cs.LG cs.AI 88%

Q-Palette: Fractional-Bit Quantizers Toward Optimal Bit Allocation for Efficient LLM Deployment

Deokjae Lee, Hyun Oh Song

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00028 2025-10-02 cs.LG cs.AI 88%

Rethinking RoPE Scaling in Quantized LLM: Theory, Outlier, and Channel-Band Analysis with Weight Rescaling

Ye Qiao, Haocheng Xu, Xiaofan Zhang, Sitao Huang

机构 * Department of EECS, University of California, Irvine, USA(加州大学尔湾分校电子工程与计算机科学系) Google(谷歌)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17513 2025-08-29 cs.LG cs.AI cs.AR 88%

Improving Quantization with Post-Training Model Expansion

Giuseppe Franco, Pablo Monteagudo-Lago, Ian Colbert, Nicholas Fraser, Michaela Blott

机构 * AMD

专题命中 效率与部署 :post-training(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16712 2025-08-26 cs.PF cs.AI cs.AR cs.DC cs.LG 88%

Systematic Characterization of LLM Quantization: A Performance, Energy, and Quality Perspective

Tianyao Shi, Yi Ding

机构 * Purdue University(普渡大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments 14 pages, 10 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13167 2025-08-20 cs.AI cs.CL 88%

Chain-of-Agents: End-to-End Agent Foundation Models via Multi-Agent Distillation and Agentic RL

Weizhen Li, Jianbo Lin, Zhuosong Jiang, Jingyi Cao, Xinpeng Liu, Jiayu Zhang, Zhenqiang Huang, Qianben Chen, Weichen Sun, Qiexiang Wang, Hongxuan Lu, Tianrui Qin, Chenghao Zhu, Yi Yao, Shuying Fan, Xiaowan Li, Tiannan Wang, Pai Liu, King Zhu, He Zhu, Dingfeng Shi, Piaohong Wang, Yeyi Guan, Xiangru Tang, Minghao Liu, Yuchen Eleanor Jiang, Jian Yang, Jiaheng Liu, Ge Zhang, Wangchunshu Zhou

专题命中 效率与部署 :foundation model(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments 51 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00370 2025-08-07 cs.CL cs.LG 88%

EdgeInfinite-Instruct: Bridging SFT-Based Optimization and NPU-Level Efficiency for Edge Devices

Jiyu Chen, Poh Seng Lim, Shuang Peng, Daxiong Luo, JungHau Foo, Yap Deep, Timothy Lee Jun Jie, Kelvin Teh Kae Wen, Fan Yang, Danyu Feng, Hao-Yun Chen, Peng-Wen Chen, Fangyuan Li, Xiaoxin Chen, Wong Wai Mun

专题命中 效率与部署 :SFT(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments The data and method in the paper need to be re-audited

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13109 2025-06-17 cs.CL cs.AI 88%

Leveraging In-Context Learning for Language Model Agents

Shivanshu Gupta, Sameer Singh, Ashish Sabharwal, Tushar Khot, Ben Bogin

机构 * University of California Irvine(加州大学伊文斯分校) Allen Institute for AI(人工智能研究所)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)

Comments 16 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏