arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-05 至 2026-03-05 共收录 43 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 43 篇

2603.04292 2026-03-05 cs.CL 90%

Position: Vector Prompt Interfaces Should Be Exposed to Enable Customization of Large Language Models

位置:应暴露向量提示接口以实现大语言模型的定制

Liangwei Yang, Shiyu Wang, Haolin Chen, Rithesh Murthy, Ming Zhu, Jielin Qiu, Zixiang Chen, Juntao Tan, Jianguo Zhang, Zhiwei Liu, Wenting Zhao, Silvio Savarese, Caiming Xiong, Huan Wang, Shelby Heinecke

机构 * Salesforce AI Research(Salesforce人工智能研究)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文主张通过暴露向量提示接口实现大语言模型的定制化,指出向量提示微调优于文本提示优化,并强调在现实部署中仅推理的定制需求增加。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15374 2026-03-05 cs.IR cs.AI cs.CL 90%

Leveraging Large Language Models for Semantic Query Processing in a Scholarly Knowledge Graph

利用大语言模型在学术知识图谱中进行语义查询处理

Runsong Jia, Bowen Zhang, Sergio J. Rodríguez Méndez, Pouya G. Omran

机构 * Australian National University(澳大利亚国立大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用大语言模型与学术知识图谱结合,提升语义查询处理的准确性和效率,以改进学术研究中的知识管理与发现。

Comments for the associated repository, see http://w3id.org/kgcp/KGQP

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03310 2026-03-05 cs.CL cs.LG 90%

Entropic-Time Inference: Self-Organizing Large Language Model Decoding Beyond Attention

熵-时间推断:超越注意力的自组织大语言模型解码

Andrew Kiruluta

机构 * School of Information(信息学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 本文提出熵-时间推断方法,通过自组织架构实现基于熵的解码优化,提升大语言模型推理效率与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02686 2026-03-05 cs.IT math.IT 89%

Large Language Model Empowered CSI Feedback in Massive MIMO Systems

大语言模型赋能的海量MIMO系统中的CSI反馈

Jie Wu, Wei Xu, Le Liang, Xiaohu You, Mérouane Debbah

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出利用大语言模型进行CSI反馈,通过掩码标记预测和自信息策略提升压缩反馈的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03597 2026-03-05 cs.LG 87%

NuMuon: Nuclear-Norm-Constrained Muon for Compressible LLM Training

NuMuon:基于核范数约束的穆恩优化器用于可压缩大语言模型训练

Hadi Mohaghegh Dolatabadi, Thalaiyasingam Ajanthan, Sameera Ramasinghe, Chamin P Hewa Koneputugodage, Shamane Siriwardhana, Violetta Shevchenko, Karol Pajak, James Snewin, Gil Avraham, Alexander Long

机构 * Pluralis Research(Pluralis研究)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 NuMuon通过引入核范数约束,增强大语言模型的权重压缩性并提升压缩后模型质量,同时保持Muon的收敛性能。

Comments 47 pages, 22 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03318 2026-03-05 cs.CL cs.AI quant-ph 87%

Quantum-Inspired Self-Attention in a Large Language Model

量子启发的大型语言模型中的自注意力机制

Nikita Kuznetsov, Niyaz Ismagilov, Ernesto Campos

机构 * Higher School of Economics, National Research University, St. Petersburg, Russian Federation(俄罗斯联邦圣彼得堡高等经济学院国家研究大学) JV Quantum LLC, State Atomic Energy Corporation Rosatom, Moscow, Russian Federation(JV量子有限公司,俄罗斯原子能机构罗斯托克莫斯)

专题命中 效率与部署 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI

AI总结 本文提出了一种量子启发的自注意力机制,并将其应用于GPT-1模型,实现了在多个评估指标上的显著提升,同时推理时间仅增加2.6倍。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17874 2026-03-05 cs.LG 86%

Deep Hierarchical Learning with Nested Subspace Networks for Large Language Models

基于嵌套子空间网络的深度分层学习用于大型语言模型

Paulius Rauba, Mihaela van der Schaar

机构 * University of Cambridge(剑桥大学)

专题命中 效率与部署 :large language model(title);language model(title);foundation model(abstract);分类 cs.LG

AI总结 本文提出嵌套子空间网络,通过动态调整计算预算实现高效的大语言模型推理,实验证明在精度损失较小的情况下显著降低计算量。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04028 2026-03-05 cs.LG cs.AI cs.CR 86%

A Multi-Dimensional Quality Scoring Framework for Decentralized LLM Inference with Proof of Quality

一种用于去中心化大语言模型推理的多维质量评分框架

Arther Tian, Alex Ding, Frank Chen, Simon Wu, Aaron Chan

机构 * DGrid AI

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种多维质量评分框架,用于去中心化LLM推理中的质量评估,通过分解输出质量为多个模块化维度,并通过实验验证其在不同任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21091 2026-03-05 stat.ML cs.AI cs.LG 84%

Best-of-$\infty$ -- Asymptotic Performance of Test-Time LLM Ensembling

最佳的无穷大 -- 测试时LLM融合的渐近性能

Junpei Komiyama, Daisuke Oba, Masafumi Oyamada

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫莫德·宾·扎耶德人工智能大学) New York University(纽约大学) RIKEN AIP(理化学研究所AIP) Institute of Science Tokyo(东京科学研究所) NEC Corporation(日本电报电话株式会社)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种自适应生成方案,通过动态选择N和加权融合多个LLM,实现测试时LLM融合的渐近性能优化。

Comments To appear at ICLR2026. Our code is available at https://github.com/jkomiyama/BoInf-code-publish/. Updated the title

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03326 2026-03-05 cs.CL cs.AI 82%

Controllable and explainable personality sliders for LLMs at inference time

用于推理时的可控且可解释的人格滑块

Florian Hoppe, David Khachaturov, Robert Mullins, Mark Huasong Meng

机构 * Technical University of Munich, Germany(慕尼黑技术大学) University of Cambridge, United Kingdom(剑桥大学) University College Dublin, Ireland(都柏林大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);SFT(abstract);RLHF(abstract)

AI总结 本文提出一种模块化框架,通过顺序自适应引导方法实现LLM推理时的可控且可解释的人格控制,通过正交化引导向量提升多维人格调节的精度和效率。

Comments 20 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04355 2026-03-05 cs.LG cs.AI 81%

Efficient Refusal Ablation in LLM through Optimal Transport

通过最优传输实现LLM中的高效拒绝消融

Geraldin Nanfack, Eugene Belilovsky, Elvis Dohmatob

机构 * Concordia University(康科德大学) Mila – Quebec AI Institute(魁北克人工智能研究所)

专题命中 效率与部署 :LLM(title);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于最优传输的框架,通过层选择性干预提升LLM拒绝机制的鲁棒性,实现更高的攻击成功率并保持模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04045 2026-03-05 cs.LG cs.AI 81%

Inference-Time Toxicity Mitigation in Protein Language Models

蛋白质语言模型中的推理时间毒性缓解

Manuel Fernández Burda, Santiago Aranguri, Iván Arcuschin Moreno, Enzo Ferrante

机构 * Laboratory of Applied Artificial Intelligence (LIAA), Institute of Computer Sciences (ICC), CONICET - Universidad de Buenos(应用人工智能实验室(LIAA)、计算机科学研究所(ICC)、CONICET - 布宜诺斯艾利斯大学) AI Safety Argentina (AISAR)(阿根廷人工智能安全(AISAR)) Goodfire APOLO Biotech(APOLO生物技术)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出LDA方法,通过放大logit差异在推理阶段缓解蛋白质语言模型的毒性生成问题,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06415 2026-03-05 cs.CV cs.AI cs.CL 81%

Index-Preserving Lightweight Token Pruning for Efficient Document Understanding in Vision-Language Models

保持索引的轻量级标记修剪用于视觉-语言模型中的高效文档理解

Jaemin Son, Sujin Choi, Inyong Yun

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种轻量级标记修剪方法,通过过滤非信息性背景区域来降低视觉-语言模型在文档理解任务中的计算成本,同时保持较高的准确性。

Comments Accepted to ICLR 2026 Workshop MM Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22935 2026-03-05 cs.LG cs.AI 81%

EnECG: Efficient Ensemble Learning for Electrocardiogram Multi-task Foundation Model

EnECG:用于心电图多任务基础模型的高效集成学习

Yuhao Xu, Xiaoda Wang, Jiaying Lu, Sirui Ding, Defu Cao, Huaxiu Yao, Yan Liu, Xiao Hu, Carl Yang

机构 * Department of Computer Science, Emory University(埃默里大学计算机科学系) Center for Data Science, School of Nursing, Emory University(埃默里大学护理学院数据科学中心) Bakar Computational Health Sciences Institute, UCSF(旧金山大学巴卡计算健康科学研究所) Department of Computer Science, USC(美国南加州大学计算机科学系) Department of Computer Science, UNC(北卡罗来纳大学教堂山分校计算机科学系)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 EnECG通过集成多个专门基础模型,高效处理多种ECG任务,降低计算成本并提升实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22469 2026-03-05 cs.CV cs.AI 79%

Beyond Dominant Patches: Spatial Credit Redistribution For Grounded Vision-Language Models

超越主导块:面向 grounded 视觉-语言模型的空间信用再分配

Niamul Hassan Samin, Md Arifur Rahman, Abdullah Ibne Hanif Arean, Juena Ahmed Noshin, Md Ashikur Rahman

机构 * The KOW Company(KOW公司) American International University Bangladesh (AIUB)(美国国际大学(Bangladesh)) University of Dhaka(达卡大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 本文提出SCR方法,通过空间信用再分配减少视觉-语言模型的幻觉问题,提升生成质量并降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23157 2026-03-05 cs.CR cs.LG 79%

No More, No Less: Least-Privilege Language Models

无需更多,无需更少:最小特权语言模型

Paulius Rauba, Dominykas Seputis, Patrikas Vanagas, Mihaela van der Schaar

专题命中 效率与部署 :language model(title,abstract);分类 cs.LG

AI总结 本文提出最小特权语言模型,通过在推理过程中动态控制模型的可访问功能,实现对语言模型能力的细粒度控制,挑战传统输出层面控制的假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03640 2026-03-05 cs.RO 78%

MistyPilot: An Agentic Fast-Slow Thinking LLM Framework for Misty Social Robots

MistyPilot: 一种面向Misty社交机器人的代理快速-缓慢思考LLM框架

Xiao Wang, Lu Dong, Jingchen Sun, Ifeoma Nwogu, Srirangaraj Setlur, Venu Govindaraju

机构 * State University of New York at Buffalo(纽约州立大学布法罗分校)

专题命中 效率与部署 :LLM(title,abstract)

AI总结 MistyPilot通过代理驱动的LLM框架,实现社交机器人中工具选择、协调及参数配置的高效执行,提升任务效率与情感一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06850 2026-03-05 cs.LO cs.AI cs.AR 77%

Formal that "Floats" High: Formal Verification of Floating Point Arithmetic

形式化地‘高’:浮点运算的形式验证

Hansa Mohanty, Vaisakh Naduvodi Viswambharan, Deepak Narayan Gadde

机构 * 1 Infineon Technologies Semiconductor India Private Limited, India 2 Infineon Technologies Dresden AG \& Co. KG, Germany

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种基于代理AI的形式化验证方法,通过直接RTL到RTL模型检查和黄金参考模型验证浮点运算,结合AI生成属性和人机协作细化,提升验证效率和覆盖范围。

Comments To appear at the 37th IEEE International Conference on Microelectronics (ICM), December 14-17, 2025, Cairo, Egypt

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03299 2026-03-05 cs.CL 77%

How LLMs Cite and Why It Matters: A Cross-Model Audit of Reference Fabrication in AI-Assisted Academic Writing and Methods to Detect Phantom Citations

大型语言模型如何引用及为何重要:对AI辅助学术写作中参考文献伪造的跨模型审计及检测幻影引用的方法

MZ Naser

专题命中 效率与部署 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 研究分析了LLM在不同领域和提示条件下引用伪造现象,提出多模型共识和重复验证过滤器,并开发轻量级分类器用于检测幻影引用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04176 2026-03-05 cs.DB 75%

Scalable Join Inference for Large Context Graphs

大规模上下文图的可扩展连接推断

Shivani Tripathi, Ravi Shetye, Shi Qiao, Alekh Jindal

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种结合统计剪枝与LLM推理的可扩展连接推断方法,用于提升大规模上下文图构建的精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03099 2026-03-05 cs.RO 75%

Point2Act: Efficient 3D Distillation of Multimodal LLMs for Zero-Shot Context-Aware Grasping

Point2Act: 多模态大语言模型的高效3D蒸馏用于零样本情境感知抓取

Sang Min Kim, Hyeongjun Heo, Junho Kim, Yonghyeon Lee, Young Min Kim

机构 * Seoul National University(首尔国立大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 Point2Act通过多模态大语言模型高效蒸馏实现零样本情境感知抓取,生成空间定位响应以支持实际操作任务。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03325 2026-03-05 cs.CL cs.AI cs.LG 75%

IntPro: A Proxy Agent for Context-Aware Intent Understanding via Retrieval-conditioned Inference

IntPro:一种通过检索条件推理的代理代理,用于基于情境的意图理解

Guanming Liu, Meng Wu, Peng Zhang, Yu Zhang, Yubo Shu, Xianliang Huang, Kainan Tu, Ning Gu, Liuxin Zhang, Qianying Wang, Tun Lu

机构 * Fudan University(复旦大学) Lenovo Group Ltd(联想集团有限公司)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 IntPro通过检索条件推理学习适应个体用户,提升基于情境的意图理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04241 2026-03-05 cs.AI cs.LG 73%

Agentics 2.0: Logical Transduction Algebra for Agentic Data Workflows

Agentics 2.0:逻辑转导代数用于代理数据工作流

Alfio Massimiliano Gliozzo, Junkyu Lee, Nahuel Defosse

机构 * IBM(国际商业机器公司)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 Agentics 2.0通过逻辑转导代数构建高质量、可解释且类型安全的代理数据工作流,展示了在数据驱动发现和NL到SQL语义解析中的先进性能。

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07109 2026-03-05 cs.IR cs.AI cs.CL 73%

OSCAR: Online Soft Compression And Reranking

OSCAR: 在线软压缩与重排序

Maxime Louis, Thibault Formal, Hervé Dejean, Stéphane Clinchant

机构 * NAVER LABS Europe(NAVER欧洲实验室)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 OSCAR通过在线软压缩和重排序方法提升RAG管道效率,实现推理速度提升2-5倍且准确率无损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03681 2026-03-05 cs.CV cs.AI 70%

EvoPrune: Early-Stage Visual Token Pruning for Efficient MLLMs

EvoPrune:面向高效MLLMs的早期阶段视觉标记剪枝

Yuhao Chen, Bin Shan, Xin Ye, Cheng Chen

机构 * ByteDance(字节跳动)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 EvoPrune通过在视觉编码早期阶段剪枝视觉标记,提升多模态大语言模型的推理效率,实现在VideoMME数据集上2倍加速且性能损失低于1%。

Comments 16 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17509 2026-03-05 cs.CL 70%

Annotation-Efficient Universal Honesty Alignment

标注高效通用诚实对齐

Shiyu Ni, Keping Bi, Jiafeng Guo, Minghao Tang, Jingtong Wu, Zengxin Han, Xueqi Cheng

机构 * State Key Laboratory of AI Safety(人工智能安全国家重点实验室) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 EliCal通过两阶段框架实现高效标注的通用诚实对齐,仅需少量正确性标注即可达到接近最优的对齐效果。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15198 2026-03-05 cs.CL 70%

RAEE: A Robust Retrieval-Augmented Early Exit Framework for Efficient Inference

RAEE: 一种鲁棒的检索增强型早退框架,用于高效的推理

Lianming Huang, Shangyu Wu, Yufei Cui, Ying Xiong, Haibo Hu, Xue Liu, Tei-Wei Kuo, Nan Guan, Chun Jason Xue

机构 * City University of Hong Kong(香港城市大学) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) MILA, McGill University(麦吉尔大学机器学习研究院) National Taiwan University(台湾国立大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 RAEE通过检索增强型早退框架,结合中间层纠正信息提升模型性能,实现高效推理和鲁棒零样本表现。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03535 2026-03-05 cs.LG 70%

Trade-offs in Ensembling, Merging and Routing Among Parameter-Efficient Experts

参数高效专家中集成、融合与路由的权衡

Sanae Lotfi, Lucas Caccia, Alessandro Sordoni, Jordan T. Ash, Miroslav Dudik

机构 * New York University(纽约大学) Microsoft Research(微软研究院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究探讨了参数高效专家中集成、融合与路由的权衡,发现非均匀集成和融合提升性能,而路由提供更大收益,同时通过聚类和贪心子集选择降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03333 2026-03-05 cs.CL 70%

Training-free Dropout Sampling for Semantic Token Acceptance in Speculative Decoding

无需训练的Dropout采样用于推测解码中的语义标记接受

Jeongtae Lee, Minjung Jo, Hyunjoon Jeong, Gunho Park, Sunghyeon Woo, Joonghoon Kim, Se Jung Kwon, Dongsoo Lee

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出DropMatch,一种无需训练的数据和校准的推测解码方法,通过蒙特卡洛dropout实现基于采样的token接受,提升推理速度。

Comments 14 pages, 6 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04272 2026-03-05 cs.CV 67%

SSR: A Generic Framework for Text-Aided Map Compression for Localization

SSR:一种用于定位的文本辅助地图压缩通用框架

Mohammad Omama, Po-han Li, Harsh Goel, Minkyu Choi, Behdad Chalaki, Vaishnav Tadiparthi, Hossein Nourkhiz Mahjoub, Ehsan Moradi Pari, Sandeep P. Chinchali

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Honda Research Institute(本田研究机构)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 SSR通过结合文本描述和小图像特征向量,实现高效地图压缩,提升定位精度和资源效率。

详情

展开后加载摘要…

URL PDF HTML 收藏