arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-17 至 2026-03-17 共收录 507 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 96 篇

2603.06569 2026-03-17 cs.CV 85%

Penguin-VL: Exploring the Efficiency Limits of VLM with LLM-based Vision Encoders

Penguin-VL:探索基于大语言模型的视觉编码器的效率极限

Boqiang Zhang, Lei Ke, Ruihan Yang, Qi Gao, Tianyuan Qu, Rossell Chen, Dong Yu, Leoweiliang

机构 * Tencent AI Lab(腾讯AI实验室)

专题命中 效率与部署 :LLM(title,abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出Penguin-VL,通过基于大语言模型的视觉编码器替代传统对比预训练,实现更高效的多模态理解,在文档理解、视觉知识和多视角视频理解等任务中超越现有领先VLM。

Comments Penguin-VL demonstrates that text-only initialized vision encoders can achieve superior performance in multimodal understanding tasks; Code: https://github.com/tencent-ailab/Penguin-VL

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14769 2026-03-17 cs.LG cs.AI 84%

POLCA: Stochastic Generative Optimization with LLM

POLCA:基于LLM的随机生成优化

Xuanfei Ren, Allen Nie, Tengyang Xie, Ching-An Cheng

专题命中 效率与部署 :LLM(title,abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出POLCA框架,通过生成语言模型作为优化器,结合数值奖励和文本反馈,解决复杂系统的随机生成优化问题,实现高效探索与利用的平衡,实验表明其在多种基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01842 2026-03-17 cs.LG 83%

Prism: Efficient Test-Time Scaling via Hierarchical Search and Self-Verification for Discrete Diffusion Language Models

Prism:通过分层搜索和自验证实现离散扩散语言模型的高效测试时扩展

Jinbin Bai, Yixuan Li, Yuchen Zhu, Yi Xin, Qingyu Shi, Aosong Feng, Xiaohong Liu, Molei Tao, Jianru Xue, Xiangtai Li, Ming-Hsuan Yang

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 本文提出Prism框架,通过分层轨迹搜索、局部分支和自验证反馈,提升离散扩散语言模型的测试时扩展效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02320 2026-03-17 cs.CL 83%

Estimating Text Temperature with Language Models

利用语言模型估计文本温度

Nikolay Mikhaylovskiy

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本文提出通过最大似然方法估计文本温度,评估多种LLM的性能,并发现大部分文本温度接近1,但某些数据集如笑话、GSM8K和AG News温度较高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13401 2026-03-17 cs.CV cs.AI physics.optics 83%

MAD: Microenvironment-Aware Distillation -- A Pretraining Strategy for Virtual Spatial Omics from Microscopy

MAD:微环境感知蒸馏——一种从显微镜获取虚拟空间组学的预训练策略

Jiashu Han, Kunzan Liu, Yeojin Kim, Saurabh Sinha, Sixian You

机构 * Research Laboratory of Electronics, Massachusetts Institute of Technology(麻省理工学院电子研究实验室) Department of Electrical Engineering and Computer Science, Massachusetts Institute of Technology(麻省理工学院电气工程与计算机科学系) The Wallace H. Coulter Department of Biomedical Engineering, Georgia Institute of Technology(佐治亚理工学院Wallace H. Coulter生物医学工程系) H. Milton Stewart School of Industrial & Systems Engineering, Georgia Institute of Technology(佐治亚理工学院H. Milton Stewart工业与系统工程学院)

专题命中 效率与部署 :pretraining(title,abstract);foundation model(abstract);分类 cs.AI

AI总结 MAD通过联合自蒸馏显微镜图像的形态视图和微环境视图,学习细胞中心嵌入,实现细胞亚型分类、转录组预测等任务的最先进性能。

Comments 34 pages, 6 figures; under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04467 2026-03-17 cs.CV cs.AI cs.CL cs.LG 82%

VisionZip: Longer is Better but Not Necessary in Vision Language Models

VisionZip: 更长并非必要,但在视觉语言模型中更优

Senqiao Yang, Yukang Chen, Zhuotao Tian, Chengyao Wang, Jingyao Li, Bei Yu, Jiaya Jia

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出VisionZip方法,通过选择信息性视觉token提升效率并保持性能,实验显示在多种设置下性能提升至少5%,同时显著加快推理速度。

Comments Code: https://github.com/dvlab-research/VisionZip

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14591 2026-03-17 cs.LG cs.AI cs.IR 81%

FlashHead: Efficient Drop-In Replacement for the Classification Head in Language Model Inference

FlashHead: 语言模型推理中分类头的高效替换方案

Wilhelm Tranheden, Shahnawaz Ahmed, Devdatt Dubhashi, Jonna Matthiesen, Hannes von Essen

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 FlashHead通过信息检索原理优化语言模型分类头,实现推理效率提升1.75倍,同时保持输出准确性,为更小的模型在消费级硬件上应用奠定基础。

Comments A collection of models with FlashHead optimization can be found at: https://huggingface.co/collections/embedl/flashhead

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13426 2026-03-17 cs.LG cs.AI 81%

Outcome-Aware Tool Selection for Semantic Routers: Latency-Constrained Learning Without LLM Inference

面向结果的工具选择用于语义路由器:无LLM推理的延迟受限学习

Huamin Chen, Xunzhuo Liu, Junchen Jiang, Bowei He, Xue Liu

机构 * vLLM Semantic Router Project(vLLM语义路由器项目) Tensormesh Inc / UChicago(Tensormesh公司/芝加哥大学) MBZUAI / McGill University(MBZUAI/麦吉尔大学)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出面向结果的工具选择方法OATS,通过插值工具嵌入向成功查询的质心,提升语义路由器的NDCG@5指标,同时在无额外计算开销的情况下优化工具选择。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17015 2026-03-17 cs.LG cs.AI cs.DC 81%

Justitia: Fair and Efficient Scheduling of Task-parallel LLM Agents with Selective Pampering

Justitia: 任务并行LLM代理的公平高效调度算法

Mingyan Yang, Guanjie Wang, Manqi Luo, Yifei Liu, Chen Chen, Han Zhao, Yu Feng, Quan Chen, Minyi Guo

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Justitia调度器,通过内存导向的成本量化和轻量预测方法,实现任务并行LLM代理的公平高效调度,实验表明其能显著提升调度效率并保持公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15340 2026-03-17 cs.CL stat.ML 79%

DOS: Dependency-Oriented Sampler for Masked Diffusion Language Models

DOS:基于依赖关系的掩码扩散语言模型采样器

Xueyu Zhou, Yangrong Hu, Jian Huang

机构 * Department of Data Science and AI(数据科学与人工智能系)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL

AI总结 DOS是一种无需训练的解码策略,通过利用令牌间依赖关系提升生成质量,尤其在代码生成和数学推理任务中表现优异,且能与现有并行采样方法结合提升效率。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22333 2026-03-17 cs.DC cs.CL 79%

PAT: Accelerating LLM Decoding via Prefix-Aware Attention with Resource Efficient Multi-Tile Kernel

PAT: 通过资源高效的多瓷砖内核加速大语言模型解码的前缀感知注意力

Jinjun Yi, Zhixin Zhao, Yitao Hu, Ke Yan, Weiwei Sun, Hao Wang, Laiping Zhao, Yuhao Zhang, Wenxin Li, Keqiu Li

专题命中 效率与部署 :LLM(title,abstract);分类 cs.CL

AI总结 本文提出PAT,一种基于前缀感知的注意力内核,通过包前向合并范式减少内存访问,提升资源利用率,降低解码延迟和TPOT。

Comments Accepted by ASPLOS'26, code available at https://github.com/flashserve/PAT

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13605 2026-03-17 cs.AI 79%

Orla: A Library for Serving LLM-Based Multi-Agent Systems

Orla:一个用于服务基于LLM的多智能体系统的库

Rana Shahout, Hayder Tirmazi, Minlan Yu, Michael Mitzenmacher

机构 * Harvard University(哈佛大学) Boston University(波士顿大学)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI

AI总结 Orla提供了一种通用抽象,将请求执行与工作流级策略分离,通过阶段映射器、工作流编排器和内存管理器实现智能体级控制,展示了在客户支持工作流中的应用,并通过两个数据集验证了其在延迟和成本上的改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13404 2026-03-17 cs.SE cs.AI 79%

Schema First Tool APIs for LLM Agents: A Controlled Study of Tool Misuse, Recovery, and Budgeted Performance

为LLM代理设计的基于模式的工具API:对工具误用、恢复和预算性能的受控研究

Akshey Sigdel, Rista Baral

机构 * Independent Researcher(独立研究者)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI

AI总结 本文通过受控实验探讨基于模式的工具合同和结构化验证诊断对LLM代理在严格交互预算下的可靠性影响,发现模式条件减少接口误用但未改善语义误用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15614 2026-03-17 cs.CV 79%

Tri-Prompting: Video Diffusion with Unified Control over Scene, Subject, and Motion

Tri-Prompting:具有统一场景、主体和运动控制的视频扩散

Zhenghong Zhou, Xiaohang Zhan, Zhiqin Chen, Soo Ye Kim, Nanxuan Zhao, Haitian Zheng, Qing Liu, He Zhang, Zhe Lin, Yuqian Zhou, Jiebo Luo

机构 * Adobe Research(Adobe研究院) University of Rochester(罗切斯特大学)

专题命中 效率与部署 :prompting(title,abstract)

AI总结 Tri-Prompting提出统一框架,整合场景、多视角主体一致性和运动控制,提升视频生成的可控性和真实感。

Comments Project page: https://zhouzhenghong-gt.github.io/Tri-Prompting-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20309 2026-03-17 cs.CL cs.LG 79%

Guiding Giants: Lightweight Controllers for Weighted Activation Steering in LLMs

引导巨人:用于LLM加权激活引导的轻量控制器

Amr Hegazy, Mostafa Elhoushi, Amr Alanwar

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种轻量可控网络,在推理时动态调节激活以引导LLM行为,通过加权引导策略提升拒绝有害输入的能力,实验表明其在安全基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15374 2026-03-17 cs.CV 78%

Spectral Rectification for Parameter-Efficient Adaptation of Foundation Models in Colonoscopy Depth Estimation

光谱校正用于结肠镜深度估计中基础模型的参数高效适应

Xiaoxian Zhang, Minghai Shi, Lei Li

机构 * Department of Biomedical Engineering, National University of Singapore, Singapore(新加坡国立大学生物医学工程系) Department of Radiotherapy, The First Affiliated Hospital of Xi'an Jiaotong University, Xi'an, China(西安交通大学第一附属医院放疗科)

专题命中 效率与部署 :foundation model(title,abstract)

AI总结 本文提出SpecDepth框架,通过光谱校正模块提升结肠镜图像处理性能,实现参数高效适应,取得最佳性能。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15166 2026-03-17 cs.CV 78%

DAIT: Distillation from Vision-Language Models to Lightweight Classifiers with Adaptive Intermediate Teacher Transfer

DAIT: 从视觉-语言模型到轻量分类器的适应性中间教师知识蒸馏

Zhengxu He, Jun Li, Zhijian Wu

机构 * School of Computer and Electronic Information, Nanjing Normal University, Nanjing, China(南京师范大学计算机与电子信息学院) Medical Artificial Intelligence Lab, Westlake University(西湖大学医学人工智能实验室)

专题命中 效率与部署 :language model(title,abstract)

AI总结 本文提出DAIT方法,通过引入可训练的中间教师模型,从冻结的视觉-语言模型中适应性地蒸馏出任务对齐的知识,提升细粒度视觉分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14989 2026-03-17 cs.CV 78%

MMSpec: Benchmarking Speculative Decoding for Vision-Language Models

MMSpec:用于视觉-语言模型的推测解码基准测试

Hui Shen, Xin Wang, Ping Zhang, Yunta Hsieh, Qi Han, Zhongwei Wan, Ziheng Zhang, Jingxuan Zhang, Jing Xiong, Ziyuan Liu, Yifan Zhang, Hangrui Cao, Chenyang Zhao, Mi Zhang

机构 * University of Michigan(密歇根大学) The Ohio State University(俄亥俄州立大学) Independent(独立) Indiana University(印第安纳大学) The University of Hong Kong(香港大学) Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) LMSYS Org(LMSYS组织)

专题命中 效率与部署 :language model(title,abstract)

AI总结 本文提出MMSpec基准,评估视觉-语言模型中的推测解码方法,发现文本模型在多模态场景下表现下降,视觉意识在大批次中更关键,且吞吐量提升不等于延迟降低,提出ViSkip方法实现最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14957 2026-03-17 cs.CV 78%

CyCLeGen: Cycle-Consistent Layout Prediction and Image Generation in Vision Foundation Models

CyCLeGen:视觉基础模型中的循环一致布局预测与图像生成

Xiaojun Shan, Haoyu Shen, Yucheng Mao, Xiang Zhang, Abhay Anand, Bingnan Li, Haiyang Xu, Zhuowen Tu

机构 * UC San Diego(加州大学圣迭戈分校)

专题命中 效率与部署 :foundation model(title,abstract)

AI总结 CyCLeGen是一种统一的视觉-语言基础模型,通过单一自回归框架实现图像理解和生成,采用循环一致学习确保生成与布局之间的双向一致性,提升模型的自我反思能力和数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18706 2026-03-17 cs.CV 78%

CoD: A Diffusion Foundation Model for Image Compression

CoD:一种面向图像压缩的扩散基础模型

Zhaoyang Jia, Zihan Zheng, Naifu Xue, Jiahao Li, Bin Li, Zongyu Guo, Xiaoyi Zhang, Houqiang Li, Yan Lu

专题命中 效率与部署 :foundation model(title,abstract)

AI总结 本文提出CoD,一种面向图像压缩的扩散基础模型,通过端到端优化提升压缩效率和生成质量,在超低比特率下实现SOTA结果,同时降低训练成本并提供新研究视角。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15562 2026-03-17 cs.IT eess.SP math.IT 78%

Reducing Pilots in Channel Estimation with Predictive Foundation Models

通过预测基础模型减少通道估计中的飞行员

Xingyu Zhou, Le Liang, Hao Ye, Jing Zhang, Chao-Kai Wen, Shi Jin

专题命中 效率与部署 :foundation model(title,abstract)

AI总结 本文提出基于预测基础模型的通道估计框架,通过提取通用通道表示和预测先验,实现低开销且可推广的CSI获取,结合视觉Transformer架构的飞行员处理网络和高效融合机制,在多样配置中优于传统和数据驱动基线。

Comments 16 pages, 15 figures. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04446 2026-03-17 cs.CV 78%

DiCoDe: Diffusion-Compressed Deep Tokens for Autoregressive Video Generation with Language Models

DiCoDe:扩散压缩深度标记用于语言模型的自回归视频生成

Yizhuo Li, Yuying Ge, Yixiao Ge, Ying Shan, Ping Luo

专题命中 效率与部署 :language model(title,abstract)

AI总结 DiCoDe利用扩散压缩深度标记,通过自回归语言模型生成视频,实现高效压缩与高质量输出,展示了在视频建模中的潜力。

Comments Project Page: https://liyz15.github.io/DiCoDe

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13394 2026-03-17 cs.CV 78%

Language-Guided Token Compression with Reinforcement Learning in Large Vision-Language Models

基于强化学习的语言引导标记压缩在大视觉-语言模型中

Sihan Cao, Jianwei Zhang, Pengcheng Zheng, Jiaxin Yan, Caiyan Qin, Yalan Ye, Wei Dong, Peng Wang, Yang Yang, Chaoning Zhang

机构 * School of Computer Science and Engineering(计算机科学与工程学院) University of Electronic Science and Technology of China(电子科学与技术大学) School of Robotics and Advanced Manufacture(机器人与先进制造学院) Harbin Institute of Technology(哈尔滨工业大学) College of Information and Control Engineering(信息与控制工程学院)

专题命中 效率与部署 :language model(title,abstract)

AI总结 本文提出TPRL框架,通过语言引导的序列优化实现视觉标记压缩,减少推理成本并提升效率,实验显示可减少66.7%的视觉标记和54.2%的FLOPs,精度损失仅0.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13393 2026-03-17 cs.CV 78%

Colony Grounded SAM2: Zero-shot detection and segmentation of bacterial colonies using foundation models

基于群体的SAM2:利用基础模型进行细菌群落的零样本检测和分割

Daan Korporaal, Patrick de Kruijf, Ralph H. G. M. Litjens, Bas H. M. van der Velden

专题命中 效率与部署 :foundation model(title,abstract)

AI总结 本文提出Colony Grounded SAM2,利用预训练的基础模型进行细菌群落的零样本检测和分割,无需进一步训练,实现了高精度的检测和分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13358 2026-03-17 cs.NI 78%

Not All Prefills Are Equal: PPD Disaggregation for Multi-turn LLM Serving

并非所有预填充都相同:多轮LLM服务中的PPD拆分

Zongze Li, Jingyu Liu, Zach Xu, Yineng Zhang, Tahseen Rabbani, Ce Zhang

专题命中 效率与部署 :LLM(title,abstract)

AI总结 本文提出PPD拆分架构,通过动态路由减少多轮交互中的KV传输拥堵,提升TTFT性能同时保持TPOT效率。

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15030 2026-03-17 cs.LG 77%

A Systematic Evaluation of On-Device LLMs: Quantization, Performance, and Resources

对设备端大语言模型的系统评估:量化、性能与资源

Qingyu Song, Rui Liu, Wei Lin, Peiyu Liao, Wenqian Zhao, Yiwen Wang, Shoubo Hu, Yining Jiang, Mochun Long, Hui-Ling Zhen, Ning Jiang, Mingxuan Yuan, Qiao Xiang, Hong Xu

专题命中 效率与部署 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG

AI总结 研究通过分析不同规模模型和量化方法,揭示了量化程度与性能的关系,以及资源利用与计算延迟的关联,为边缘环境下的大语言模型优化提供指导。

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13290 2026-03-17 cs.NI cs.AI 77%

AGORA: Agentic Green Orchestration Architecture for Beyond 5G Networks

AGORA:面向6G网络的代理绿色协调架构

Rodrigo Moreira, Larissa Ferreira Rodrigues Moreira, Maycon Peixoto, Flavio De Oliveira Silva

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出AGORA架构,通过嵌入本地工具增强的大语言模型代理,将自然语言可持续性目标转化为基于 telemetry 的操作,实现能量感知的流量引导,展示紧凑模型在低能耗和正确策略执行中的优势。

Journal ref 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11656 2026-03-17 cs.CV cs.AI cs.RO 77%

SToRM: Supervised Token Reduction for Multi-modal LLMs toward efficient end-to-end autonomous driving

SToRM:面向高效端到端自动驾驶的多模态大语言模型监督令牌缩减

Seo Hyun Kim, Jin Bok Park, Do Yeon Koo, Hogun Park, Il Yong Chun

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SToRM框架,通过监督令牌缩减方法在保持性能的同时降低计算成本,实现实时端到端自动驾驶。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08801 2026-03-17 cs.CV cs.AI cs.MM 77%

Lumos-1: On Autoregressive Video Generation with Discrete Diffusion from a Unified Model Perspective

Lumos-1:从统一模型视角看基于离散扩散的自回归视频生成

Hangjie Yuan, Weihua Chen, Jun Cen, Hu Yu, Jingyun Liang, Shuning Chang, Zhihui Lin, Tao Feng, Pengwei Liu, Jiazheng Xing, Hao Luo, Jiasheng Tang, Fan Wang, Yi Yang

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Lumos-1提出一种基于LLM的统一模型,通过改进的MM-RoPE和离散扩散机制,在高效生成视频方面超越现有模型,适用于多种视频评估基准。

Comments ICLR 2026 Camera Ready Version. Code and Models: https://github.com/alibaba-damo-academy/Lumos

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13327 2026-03-17 cs.AI 77%

DOVA: Deliberation-First Multi-Agent Orchestration for Autonomous Research Automation

DOVA:基于协商的多智能体协作以实现自主研究自动化

Aaron Shen, Alfred Shen

机构 * University of California, Berkeley, USA(加州大学伯克利分校) Amazon Web Services, USA(亚马逊网络服务)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 DOVA通过协商优先的协作机制、混合协同推理和自适应多层思考,提升多源信息整合与复杂任务处理能力,降低推理成本并提高回答准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏