arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-17 至 2026-03-17 共收录 507 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 96 篇

2602.00359 2026-03-17 cs.AI 77%

Position: Agentic Evolution is the Path to Evolving LLMs

位置:代理进化是进化大语言模型的路径

Minhua Lin, Hanqing Lu, Zhan Shi, Bing He, Rui Mao, Zhiwei Zhang, Zongyu Wu, Xianfeng Tang, Hui Liu, Zhenwei Dai, Xiang Zhang, Suhang Wang, Benoit Dumoulin, Jian Pei

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出代理进化作为大语言模型适应的未来方向,通过A-Evolve框架实现持续优化,并提出进化扩展假设。

Comments Update code link

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15218 2026-03-17 cs.LG cs.AI cs.NE 76%

Towards Foundation Models for Consensus Rank Aggregation

迈向共识排名聚合的基础模型

Yijun Jin, Simon Klüttermann, Chiara Balestra, Emmanuel Müller

机构 * TU Dortmund University, Dortmund, Germany(图卢兹大学(德累斯顿)) Research Center Trustworthy Data Science and Security, University Alliance Ruhr, Dortmund, Germany(可信数据科学与安全研究中心,鲁尔大学联盟,德累斯顿,德国)

专题命中 效率与部署 :foundation model(title);分类 cs.AI、cs.LG

AI总结 本文提出Kemeny Transformer,一种基于Transformer的算法,通过强化学习高效近似Kemeny最优排名,优于传统方法并在实际排名聚合任务中具有可扩展性。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15448 2026-03-17 cs.HC 75%

The Social Sycophancy Scale: A psychometrically validated measure of sycophancy

社会阿谀量表:一种经过心理测量学验证的阿谀量表

Jean Rehani, Victoria Oldemburgo de Mello, Dariya Ovsyannikova, Ashton Anderson, Michael Inzlicht

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出了一种基于LLM行为的阿谀量表,通过三个样本验证其有效性,揭示了阿谀与共情之间的关系,指出AI设计中的伦理困境。

Comments 35 pages, 1 figure, 5 tables. For supplementary material, see https://osf.io/r8gys/ Author Contributions: J.R and M.I conceived the study design and research questions. J.R and D.O programmed the experimental iterations, collected, and cleaned the data. J.R and V.O.M analyzed the data. J.R wrote the manuscript. All authors edited the manuscript and provided oversight of and feedback on the work

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14278 2026-03-17 cs.CR 75%

Activation Surgery: Jailbreaking White-box LLMs without Touching the Prompt

激活手术:无需修改提示的白盒LLM劫持

Maël Jenny, Jérémie Dentan, Sonia Vanier, Michaël Krajecki

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出通过直接操控模型内部激活来改变生成轨迹,揭示拒绝产生的位置与机制,并抑制安全机制,探讨开放权重模型的安全影响。

Comments To appear in Proceedings of ESORICS 2026 (Springer LNCS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13349 2026-03-17 cs.CV cs.AI 74%

MURE: Hierarchical Multi-Resolution Encoding via Vision-Language Models for Visual Document Retrieval

MURE:基于视觉-语言模型的多分辨率编码框架用于视觉文档检索

Fengbin Zhu, Zijing Cai, Yuzhe Wang, Pengyang Shao, Wenjie Wang, Fuli Feng, Richang Hong, Tat-Seng Chua

机构 * National University of Singapore, Singapore(新加坡国立大学) University of Science and Technology of China, China(中国科学技术大学) Hefei University of Technology, China(合肥工业大学)

专题命中 效率与部署 :language model(title);分类 cs.AI

AI总结 本文提出MURE框架,通过多分辨率采样编码、跨粒度特征融合和语义感知聚类机制,提升视觉文档检索效率与效果,实验表明其优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15619 2026-03-17 cs.CL cs.AI 73%

Mixture-of-Depths Attention

深度混合注意力

Lianghui Zhu, Yuxin Fang, Bencheng Liao, Shijie Wang, Tianheng Cheng, Zilong Huang, Chen Chen, Lai Wei, Yutao Zeng, Ya Wang, Yi Lin, Yu Li, Xinggang Wang

机构 * School of EIC, Huazhong University of Science \& Technology

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MoDA机制,通过允许每个注意力头在当前层和前层的KV对上进行注意力计算,提升深度模型性能,实验显示其在多个基准上表现优异,计算开销低。

Comments Code is released at https://github.com/hustvl/MoDA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14128 2026-03-17 cs.CV cs.AI cs.LG 73%

Diffusion Reinforcement Learning via Centered Reward Distillation

通过中心化奖励蒸馏实现扩散强化学习

Yuanzhi Zhu, Xi Wang, Stéphane Lathuilière, Vicky Kalogeiton

专题命中 效率与部署 :pretraining(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出中心化奖励蒸馏框架,通过KL正则化奖励最大化和前向过程微调,解决扩散模型在细粒度提示保真度、组合正确性等任务中的表现问题,实现更稳定的奖励优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11935 2026-03-17 cs.LG cs.AI 73%

MobileKernelBench: Can LLMs Write Efficient Kernels for Mobile Devices?

MobileKernelBench: LLMs能否为移动设备编写高效的内核?

Xingze Zou, Jing Wang, Yuhua Zheng, Xueyi Chen, Haolei Bai, Lingcheng Kong, Syed A. R. Abu-Bakar, Zhaode Wang, Chengfei Lv, Haoji Hu, Huan Wang

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨LLMs能否为移动设备编写高效内核,提出MobileKernelBench框架,发现现有模型在移动框架中表现不佳,提出MoKA多智能体系统提升编译成功率和性能。

Comments Paper webpage: https://zeezou-isee.github.io/Mobilekernelbench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20081 2026-03-17 cs.CL cs.AI 73%

Inference-time Alignment in Continuous Space

连续空间中的推理对齐

Yige Yuan, Teng Xiao, Li Yunfan, Bingbing Xu, Shuchang Tao, Yunqi Qiu, Huawei Shen, Xueqi Cheng

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SEA算法,通过连续潜在空间中的梯度采样对齐大语言模型,提升在弱基策略或小候选集下的效果,实验显示在AdvBench和MATH上分别提升77.51%和16.36%。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21474 2026-03-17 cs.CL cs.AI 73%

Estimating Causal Effects of Text Interventions Leveraging LLMs

利用大语言模型估计文本干预的因果效应

Siyi Guo, Myrl G. Marmarelis, Fred Morstatter, Kristina Lerman

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CausalDANN方法,通过大语言模型处理复杂文本数据,解决传统因果推断方法在高维文本数据中的不足,实现对文本干预效果的稳健估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13277 2026-03-17 cs.LG cs.AI cs.IR 73%

Learning Retrieval Models with Sparse Autoencoders

通过稀疏自编码器学习检索模型

Thibault Formal, Maxime Louis, Hervé Dejean, Stéphane Clinchant

机构 * NAVER LABS Europe(NAVER实验室欧洲)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SPLARE方法,利用稀疏自编码器改进检索模型,实验显示其在多语言和领域外任务中优于传统方法,SPLARE-7B在多语言检索任务中表现优异。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15569 2026-03-17 cs.LG 70%

Mamba-3: Improved Sequence Modeling using State Space Principles

Mamba-3:基于状态空间原理的序列建模改进

Aakash Lahoti, Kevin Y. Li, Berlin Chen, Caitlin Wang, Aviv Bick, J. Zico Kolter, Tri Dao, Albert Gu

专题命中 效率与部署 :LLM(abstract);language model(abstract);分类 cs.LG

AI总结 Mamba-3通过结合更丰富的递归、复值状态更新规则和多输入多输出框架,提升了序列建模的性能和效率,实现了在检索、状态跟踪和下游语言建模任务中的显著改进。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14825 2026-03-17 cs.CV cs.AI 70%

Two Birds, One Projection: Harmonizing Safety and Utility in LVLMs via Inference-time Feature Projection

双鸟归一投影:通过推理时特征投影在LVLMs中调和安全与效用

Yewon Han, Yumin Seol, EunGyung Kong, Minsoo Jo, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院) Mobilint

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨了安全与效用在LVLMs中的对抗性,提出通过推理时投影消除模态偏差方向以提升安全性和效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00623 2026-03-17 cs.CL 70%

Efficient Construction of Model Family through Progressive Training Using Model Expansion

通过模型扩展进行渐进训练构建模型家族的高效方法

Kazuki Yano, Sho Takase, Sosuke Kobayashi, Shun Kiyono, Jun Suzuki

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出通过渐进训练构建模型家族的方法,通过逐步扩展小模型至大模型,减少计算成本并提升模型一致性。

Comments 17pages, accepted by COLM 2025 as a conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14541 2026-03-17 cs.AI cs.IR 70%

Expert Mind: A Retrieval-Augmented Architecture for Expert Knowledge Preservation in the Energy Sector

专家思维:一种用于能源领域专家知识保留的检索增强架构

Diego Ezequiel Cervera

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Expert Mind系统,通过RAG、大语言模型和多模态技术,解决能源领域专家知识流失问题,提升知识传递效率与入职效率。

Comments 6 pages, 1 figure, conceptual architecture paper on retrieval-augmented expert knowledge systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14448 2026-03-17 cs.LG 70%

Zoom to Essence: Trainless GUI Grounding by Inferring upon Interface Elements

聚焦本质:通过推断界面元素实现无训练GUI接地

Ziwei Liu, Tao Feng, Borui Kang, Yanbing Yang, Jun Luo

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出ZoomUI,通过推断界面元素实现无训练GUI接地,利用推理缩放引导常见MLLM逐步锚定指令元素到更详细的界面元素,提升GUI代理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14183 2026-03-17 cs.CL 70%

Selective Fine-Tuning of GPT Architectures for Parameter-Efficient Clinical Text Classification

针对参数高效临床文本分类的GPT架构选择性微调

Fariba Afrin Irany, Sampson Akwafuo

专题命中 效率与部署 :language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 本文提出一种参数高效的GPT-2选择性微调框架,通过冻结大部分参数仅更新关键模块,实现高效临床文本分类,在5万份放射报告上达到91%的准确率,兼顾性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14171 2026-03-17 cs.LG 70%

TACTIC for Navigating the Unknown: Tabular Anomaly deteCTion via In-Context inference

TACTIC用于未知领域的导航:通过上下文推理进行表格异常检测

Patryk Marszałek, Tomasz Kuśmierczyk, Marek Śmieja

专题命中 效率与部署 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出TACTIC,一种基于上下文推理的表格异常检测方法,通过预训练异常中心合成先验,实现快速且数据依赖的异常判断,优于传统得分方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13940 2026-03-17 cs.AI 70%

GroupGuard: A Framework for Modeling and Defending Collusive Attacks in Multi-Agent Systems

GroupGuard:多智能体系统中 collusion 攻击建模与防御的框架

Yiling Tao, Xinran Zheng, Shuo Yang, Meiling Tao, Xingjun Wang

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出 GroupGuard 框架,通过多层防御策略识别并隔离协同攻击,提升多智能体系统的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18269 2026-03-17 cs.CV cs.AI 70%

StreamingTOM: Streaming Token Compression for Efficient Video Understanding

StreamingTOM: 流式令牌压缩以实现高效的视频理解

Xueyi Chen, Keda Tao, Kele Shao, Huan Wang

专题命中 效率与部署 :LLM(abstract);language model(abstract);分类 cs.AI

AI总结 StreamingTOM通过双阶段框架解决流式视频视觉-语言模型中预-后LLM瓶颈,实现kv-cache压缩和低延迟,提升实时视频理解效率。

Comments Accepted at CVPR 2026. Project page: https://yige24.github.io/StreamingTOM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13306 2026-03-17 cs.CV cs.LG 70%

Benchmarking Compact VLMs for Clip-Level Surveillance Anomaly Detection Under Weak Supervision

对弱监督条件下Clip级监控异常检测的紧凑视觉语言模型进行基准测试

Kirill Borodin, Kirill Kondrashov, Nikita Vasiliev, Ksenia Gladkova, Inna Larina, Mikhail Gorodnichev, Grach Mkrtchian

机构 * Faculty of Information Technology, Moscow Technical University of Communication

专题命中 效率与部署 :language model(abstract);prompting(abstract);分类 cs.LG

AI总结 本文研究了在弱监督条件下,紧凑型视觉语言模型在Clip级监控异常检测中的性能,通过统一评估协议比较了参数高效适应的紧凑VLMs与无训练VLM流水线和弱监督基线,展示了在准确率和效率上的平衡。

Comments Published ad MDPI Journal of Imaging (see at https://www.mdpi.com/2313-433X/11/11/400)

Journal ref Journal of Imaging. 2025; 11(11):400

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15589 2026-03-17 cs.AR 67%

LEXI: Lossless Exponent Coding for Efficient Inter-Chiplet Communication in Hybrid LLMs

LEXI:无损指数编码用于混合大语言模型中高效芯片片间通信

Miao Sun, Alish Kanani, Kaushik Shroff, Umit Ogras

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 针对大语言模型推理延迟问题,提出基于霍夫曼编码的无损指数压缩方案,有效降低芯片片间通信和推理延迟。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15530 2026-03-17 cs.AR cs.DC 67%

DUET: Disaggregated Hybrid Mamba-Transformer LLMs with Prefill and Decode-Specific Packages

DUET:基于解耦混合Mamba-Transformer语言模型的预填和解码专用加速器

Alish Kanani, Sangwan Lee, Han Lyu, Jiahao Lin, Jaehyun Park, Umit Y. Ogras

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 DUET通过解耦预填和解码阶段,利用专用加速器提升大语言模型性能,实现更快的首个token生成时间、更高的吞吐量和更低的token间时间。

Comments Paper accepted for publication at the Design Automation Conference (DAC) 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14219 2026-03-17 cs.CV 67%

Safety-Potential Pruning for Enhancing Safety Prompts Against VLM Jailbreaking Without Retraining

安全潜力修剪:提升对抗VLM劫持的安全提示而无需重新训练

Chongxin Li, Hanzhang Wang, Lian Duan

专题命中 效率与部署 :language model(abstract);prompting(abstract)

AI总结 本文提出安全潜力修剪方法,通过去除对安全提示不敏感的权重,增强安全路径,提升VLM对抗能力,减少攻击成功率22%。

Comments Accepted for publication in Transactions of the Association for Computational Linguistics (TACL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13906 2026-03-17 cs.DB 67%

ATCC: Adaptive Concurrency Control for Unforeseen Agentic Transactions

ATCC:面向意外代理事务的自适应并发控制

Weixing Zhou, Zhiyou Wang, Zeshun Peng, Hetian Chen, Yanfeng Zhang, Ge Yu

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文提出ATCC,一种针对意外代理事务的自适应并发控制方法,通过动态调整乐观与悲观执行策略,显著提升事务吞吐量并降低尾部延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13639 2026-03-17 cs.HC cs.MM cs.SE 67%

Adaptive Virtual Reality Museum: A Closed-Loop Framewor for Engagement-Aware Cultural Heritage

自适应虚拟现实博物馆:一种闭环框架用于参与感知的文化遗产

Joseph Damouni, Wadia Tanus, Naomi Unkelos-Shpigel

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文提出一种闭环自适应界面,通过隐式多模态感知实时调整内容深度,提升文化遗产VR体验的参与度与探索时间。

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13575 2026-03-17 cs.HC 67%

Exploring Human-AI Collaboration in E-Textile Design: A Case Study on Flex Sensor Placement for Shoulder Motion Detection

探索人机协作在电子织物设计中的应用:一项关于柔性传感器在肩部运动检测中放置的案例研究

Zhuchenyang Liu, Yao Zhang, Yalan He, Hilla Paasio, Changyi Li, Guna Semjonova, Yu Xiao

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文通过柔性传感器在肩部运动检测中的应用,探讨了人机协作在电子织物设计中的效率与效果,发现协作能提升非专业设计者的性能,但对经验丰富的设计师产生负面影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15413 2026-03-17 cs.LG cs.AI cs.AR 62%

RESQ: A Unified Framework for REliability- and Security Enhancement of Quantized Deep Neural Networks

RESQ:一种用于量化深度神经网络可靠性与安全增强的统一框架

Ali Soltan Mohammadi, Samira Nazari, Ali Azarpeyvand, Mahdi Taheri, Milos Krstic, Michael Huebner, Christian Herglotz, Tara Ghasempouri

机构 * University of Zanjan(赞詹大学) Brandenburg Technical University(勃兰登堡技术大学) Leibniz Institute for High Performance Microelectronics(莱比锡高性能微电子研究所) Tallinn University of Technology(塔林技术大学)

专题命中 效率与部署 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个三阶段统一框架,通过细调提升攻击鲁棒性,通过故障感知细调增强故障鲁棒性,并通过轻量级后训练调整提升效率和进一步降低故障敏感性。实验显示在多个数据集上攻击鲁棒性提升10.35%,故障鲁棒性提升12.47%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15871 2026-03-17 cs.LG cs.AI 62%

Why Inference in Large Models Becomes Decomposable After Training

为什么在大模型中推理在训练后变得可分解

Jidong Jin

专题命中 效率与部署 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 研究发现大模型训练后推理系统结构非均匀且可分解,通过后训练统计标准和结构退火过程去除无效依赖,实现并行推理。

Comments 42 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13281 2026-03-17 cs.LG cs.AI 62%

ICaRus: Identical Cache Reuse for Efficient Multi Model Inference

ICaRus:相同缓存重用以实现高效的多模型推理

Sunghyeon Woo, Jaeeun Kil, Hoseung Kim, Minsub Kim, Joonghoon Kim, Ahreum Seo, Sungjae Lee, Minjung Jo, Jiwon Ryu, Baeseong Park, Se Jung Kwon, Dongsoo Lee

机构 * NAVER Cloud(NAVER云)

专题命中 效率与部署 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ICaRus架构,通过共享KV缓存减少多模型推理中的内存消耗和重计算开销,提升效率和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏