arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-13 至 2026-05-13 共收录 421 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 92 篇

2605.09598 2026-05-13 cs.CV 50%

SoccerLens: Grounded Soccer Video Understanding Beyond Accuracy

SoccerLens: 超越准确性的 grounded 球赛视频理解

Ismael Elsharkawi, Ahmed Sait, Silvio Giancola, Bernard Ghanem, Hossam Sharara, Abdelrahman Eldesokey

机构 * Department of Computer Science and Engineering, The American University in Cairo(美国亚历山大大学计算机科学与工程系) Image And Visual Understanding Lab (IVUL), KAUST(卡塔尔大学图像与视觉理解实验室)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出 SoccerLens 基准测试,评估球赛视频理解中视觉 grounding 的有效性,发现现有模型在准确率高但 grounding 表现差,揭示了时空复杂领域中 grounded 评估的重要性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 75 篇

2605.11317 2026-05-13 cs.CL cs.AI 93%

SOMA: Efficient Multi-turn LLM Serving via Small Language Model

SOMA:通过小型语言模型实现高效的多轮LLM服务

Xueqi Cheng, Qiong Wu, Zhengyi Zhou, Xugui Zhou, Tyler Derr, Yushun Dong

机构 * Florida State University(佛罗里达州立大学) AT&T Chief Data Office(AT&T首席数据办公室) Louisiana State University(路易斯安那州立大学) Vanderbilt University(范德比大学)

专题命中 效率与部署 :LLM(title,title_cn);language model(title,abstract);small language model(title,abstract);large language model(abstract)

AI总结 SOMA通过利用对话早期轮次估计局部响应流形,利用小型替代模型提升多轮对话效率,同时提供理论分析和实验验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11222 2026-05-13 cs.LG 93%

ADMM-Q: An Improved Hessian-based Weight Quantizer for Post-Training Quantization of Large Language Models

ADMM-Q: 一种改进的基于Hessian的权重量化器用于大语言模型的后训练量化

Ryan Lucas, Mehdi Makni, Xiang Meng, Adam Deng, Rahul Mazumder

机构 * MIT Operations Research Center(麻省理工学院运筹学中心) MIT Sloan School of Management(麻省理工学院斯隆管理学院) MIT Center for Statistics(麻省理工学院统计中心)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);LLM(abstract,abstract_cn)

AI总结 ADMM-Q是一种新的权重量化算法,通过交替方向乘子法的组合变体,优化层间重建误差并逐步施加量化约束,提升大语言模型的压缩性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11169 2026-05-13 cs.AI 92%

OLIVIA: Online Learning via Inference-time Action Adaptation for Decision Making in LLM ReAct Agents

OLIVIA:通过推理时间动作适应实现LLM ReAct代理的在线学习

Sheldon Yu, Junda Wu, Xintong Li, Nikki Lijing Kuang, Sizhe Zhou, Tong Yu, Jiawei Han, Jingbo Shang, Julian McAuley

机构 * UC San Diego(加州大学圣地亚哥分校) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Adobe Research(Adobe研究)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 OLIVIA通过在推理时对动作进行适应,改进LLM ReAct代理在部署中的决策能力,提供可跟踪、细粒度和不确定性感知的适应方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05497 2026-05-13 cs.DC cs.AI cs.AR cs.LG 92%

Patterns behind Chaos: Forecasting Data Movement for Efficient Large-Scale MoE LLM Inference

混沌背后的模式:为高效大规模MoE LLM推理预测数据移动

Zhongkai Yu, Yue Guan, Zihao Yu, Chenyang Zhou, Zhengding Hu, Shuyi Pei, Yangwook Kang, Yufei Ding, Po-An Tsai

机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校) Columbia University(哥伦比亚大学) NVIDIA

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究通过分析大规模MoE模型的数据移动模式,提出优化方法,提升大规模LLM推理效率,实现6.6倍平均加速和1.25倍速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11509 2026-05-13 cs.AI cs.LG cs.MA cs.SY eess.SY 92%

Hierarchical LLM-Driven Control for HAPS-Assisted UAV Networks: Joint Optimization of Flight and Connectivity

分层LLM驱动控制用于HAPS辅助无人机网络:飞行与连接的联合优化

Zijiang Yan, Hao Zhou, Wael Jaafar, Jianhua Pei, Ping Wang, Halim Yanikomeroglu, Hina Tabassum

机构 * Department of Electrical Engineering and Computer Science, York University(约克大学电气工程与计算机科学系) Samsung Research America(三星美国研究院) Department of Software and IT Engineering, École de technologie supérieure (ÉTS), University of Quebec(魁北克大学软件与信息技术工程系,École de technologie supérieure) Non-Terrestrial Networks (Carleton-NTN) Lab and the Department of Systems and Computer Engineering, Carleton University(非地面网络(Carleton-NTN)实验室和系统与计算机工程系,卡尔顿大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在整合陆地和非陆地网络中多无人机系统的联合优化问题,提出基于LLM的分层多速率控制框架,通过高精度仿真平台验证了其在提升运输效率、通信吞吐量和减少碰撞率方面的优势。

Comments Submission for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11232 2026-05-13 cs.AI cs.LG 92%

Rethinking LLMOps for Fraud and AML: Building a Compliance-Grade LLM Serving Stack

重新思考LLMOps用于欺诈和反洗钱:构建合规级LLM服务栈

Prathamesh Vasudeo Naik, Naresh Dintakurthi, Yue Wang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出针对欺诈和反洗钱工作负载的LLMOps栈,通过自托管开源模型提升服务性能,优化吞吐量、降低延迟并提高GPU利用率,展示合规级LLM服务的关键挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05772 2026-05-13 cs.CL cs.LG 92%

Sparse Attention Remapping with Clustering for Efficient LLM Decoding on PIM

基于聚类的稀疏注意力重映射用于PIM上的高效LLM解码

Zehao Fan, Garrett Gagnon, Zhenyu Liu, Liu Liu

机构 * Electrical, Computer, and Systems Engineering(电气、计算机与系统工程) Rensselaer Polytechnic Institute(伦斯勒理工学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出STARC方案,通过聚类KV对并映射到PIM银行结构对齐的连续内存区域,减少LLM解码的注意力层延迟和能耗,提升PIM架构下的长上下文推理效率。

Comments Early preprint; peer-reviewed version of record published in ASPLOS '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01621 2026-05-13 cs.DC cs.AI 92%

DWDP: Distributed Weight Data Parallelism for High-Performance LLM Inference on NVL72

DWDP:分布式权重数据并行用于NVL72上的高性能LLM推理

Wanqian Li, Jintao Peng, Zongfei Jing, Tianyu Zhang, Ze Long, Xianjie Qiao, Xiaoming Chen, Dongxu Yang, Kefeng Duan, June Yang

机构 * NVIDIA

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出DWDP,一种无需层间同步的分布式权重数据并行策略,通过跨peer GPU卸载MoE权重和按需获取缺失专家,提升LLM推理性能,实测在8K输入和1K输出序列长度下,端到端TPS/GPU提升8.8%。

Comments Technical Report. 17 pages. 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11582 2026-05-13 cs.CL 92%

Efficient LLM-based Advertising via Model Compression and Parallel Verification

通过模型压缩和并行验证实现高效的LLM广告

Wenxin Dong, Chang Gao, Guanghui Yu, Xuewu Jiao, Mingqing Hu, Qiang Fu, Peng Xu, Penghui Wei, Hui Xu, Yue Xing, Shuanglong Li, Lin Liu

机构 * Baidu Inc.(百度公司)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Efficient Generative Targeting框架,结合自适应分组量化、层适应性分层稀疏化和前缀树并行验证,提升LLM推理效率并保持生成质量,实验显示在真实广告场景中实现显著加速且质量损失可控。

Comments 10 pages, 7 figures, industry paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11581 2026-05-13 cs.CL 92%

Ada-MK: Adaptive MegaKernel Optimization via Automated DAG-based Search for LLM Inference

Ada-MK: 通过基于DAG的自动搜索实现适应性MegaKernel优化以用于LLM推理

Wenxin Dong, Mingqing Hu, Guanghui Yu, Qiang Fu, Peng Xu, Hui Xu, Yue Xing, Xuewu Jiao, Shuanglong Li, Lin Liu

机构 * Baidu Inc.(百度公司)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Ada-MK,通过基于DAG的自动搜索优化MegaKernel,减少共享内存峰值使用50%,消除运行时分支,提升LLM推理吞吐量和效率。

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11186 2026-05-13 cs.LG cs.AI 91%

CATS: Cascaded Adaptive Tree Speculation for Memory-Limited LLM Inference Acceleration

CATS:基于内存限制的LLM推理加速的级联自适应树推测

Yuning Han, Yangchenchen Jin, Dylan Zhao, Jingwei Sun

机构 * University of Florida(佛罗里达大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 CATS通过级联验证和修正机制,在内存受限设备中优化LLM推理,提升吞吐量并保持内存足迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11209 2026-05-13 cs.LG 91%

Measuring Five-Nines Reliability: Sample-Efficient LLM Evaluation in Saturated Benchmarks

测量五九可靠性:在饱和基准上的样本高效LLM评估

Eungyeup Kim, Chenchen Gu, Vashisth Tiwari, J. Zico Kolter

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出通过交叉熵方法学习失败倾向输入分布,显著减少LLM评估所需推理次数,揭示模型在标准基准上表现相近但可靠性差异显著的问题。

Comments Project page: https://five-nines-reliability.notion.site/Measuring-Five-Nines-Reliability-Sample-Efficient-LLM-Evaluation-in-Saturated-Benchmarks-312b998d4f39802d88c0e9886db1b9cd

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11774 2026-05-13 cs.CL cs.LG 91%

From Token to Token Pair: Efficient Prompt Compression for Large Language Models in Clinical Prediction

从标记到标记对:用于临床预测的大型语言模型高效提示压缩

Mingcheng Zhu, Zhiyao Luo, Yu Liu, Tingting Zhu

机构 * Department of Engineering Science, University of Oxford, Oxford, United Kingdom(牛津大学工程科学系,英国牛津)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文提出MedTPE方法,通过将频繁共现的医疗标记对合并为复合标记,实现无损压缩,减少输入标记长度和推理延迟,同时保持或提升预测性能。

Comments 21 pages, 6 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11513 2026-05-13 cs.CL cs.AI 91%

A Study on Hidden Layer Distillation for Large Language Model Pre-Training

针对大语言模型预训练的隐藏层蒸馏研究

Maxime Guigon, Lucas Dixon, Michaël E. Sander

机构 * Google DeepMind(谷歌DeepMind)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文研究了隐藏层蒸馏在大语言模型预训练中的应用,对比了蒸馏与基于输出logits的方法,发现蒸馏在某些配置下能提升困惑度,但未在下游任务中超越标准蒸馏。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21159 2026-05-13 cs.AI cs.LG cs.MA 91%

MAC: Masked Agent Collaboration Boosts Large Language Model Medical Decision-Making

MAC:掩码代理协作提升大语言模型医疗决策能力

Zhihao Peng, Liuxin Bao, Yixuan Yuan

机构 * School of Automation, Hangzhou Dianzi University(杭州电子大学自动化学院) Department of Electronic Engineering, Chinese University of Hong Kong(香港中文大学电子工程系)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出MAC框架,通过帕累托最优代理构建和交叉一致性最大化机制,提升医疗决策能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11859 2026-05-13 cs.RO cs.AI 90%

EvoNav: Evolutionary Reward Function Design for Robot Navigation with Large Language Models

EvoNav:基于大语言模型的机器人导航奖励函数进化设计

Zhikai Zhao, Chuanbo Hua, Federico Berto, Zihan Ma, Kanghoon Lee, Jiachen Li, Jinkyoo Park

机构 * KAIST(韩国科学技术院) Radical Numerics UC Riverside(加州大学河滨分校) Omelet AI4CO

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出EvoNav框架,利用大语言模型自动设计机器人导航奖励函数,通过逐步升温-提升流程降低训练成本,实验表明其优于人工设计和现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12019 2026-05-13 cs.LG cs.AI 90%

Efficient and Adaptive Human Activity Recognition via LLM Backbones

通过LLM骨干实现高效且自适应的人体活动识别

Aleksandr Bredikhin, Philippe Lalanda, German Vega

机构 * Univ. Grenoble Alpes, France(格勒诺布尔阿尔卑斯大学,法国)

专题命中 效率与部署 :LLM(title,title_cn);language model(abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用预训练大语言模型作为通用时间骨干,用于基于传感器的人体活动识别,通过结构化卷积投影和参数高效LoRA适应,提升跨数据集迁移能力和低数据场景下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11999 2026-05-13 cs.DC cs.AI cs.LG cs.PF 90%

The Illusion of Power Capping in LLM Decode: A Phase-Aware Energy Characterisation Across Attention Architectures

LLM解码中的功率限制幻觉:跨注意力架构的相位感知能耗分析

Bole Ma, Ayesha Afzal, Jan Eitzinger, Gerhard Wellein

机构 * Erlangen National High Performance Computing Center(埃朗根国家高性能计算中心) Friedrich-Alexander-Universität Erlangen-Nürnberg(埃朗根-纽伦堡弗里德里希-亚历山大大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 研究揭示LLM解码中功率限制的表面现象,通过分析四种注意力架构发现解码实际耗能较低,内存瓶颈导致带宽饱和而非计算瓶颈,钟速锁定比功率限制更有效,可提升解码能耗32%并最小化吞吐量损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11334 2026-05-13 cs.LG cs.CL cs.IR 90%

VERDI: Single-Call Confidence Estimation for Verification-Based LLM Judges via Decomposed Inference

VERDI:基于验证的LLM裁判的单次调用置信度估计方法

Jasmine Qi, Danylo Dantsev, Muyang Sun

机构 * Indeed Inc(Indeed公司)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 VERDI通过分解推理过程提取置信度信号,无需额外调用,提升验证型LLM裁判的可信度评估。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11202 2026-05-13 cs.CR cs.AI cs.LG cs.SE 90%

Continuous Discovery of Vulnerabilities in LLM Serving Systems with Fuzzing

在LLM服务系统中通过模糊测试连续发现漏洞

Yunze Zhao, Yibo Zhao, Yuchen Zhang, Zaoxing Liu, Michelle L. Mazurek

机构 * University of Maryland(马里兰大学) New York University(纽约大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出GRIEF模糊器,通过时间多请求追踪发现LLM服务层漏洞,包括15个漏洞,10个已确认,涉及缓存隔离失败、跨请求性能干扰和崩溃问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11019 2026-05-13 cs.LG cs.AI 90%

Efficient LLM Reasoning via Variational Posterior Guidance with Efficiency Awareness

通过变分后验指导实现高效的LLM推理:具有效率意识

Zizhao Chen, Yuying Li, Siting Lin, Lianxi Wang

机构 * Guangdong University of Foreign Studies(广东外语外贸大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出VPG-EA框架,通过变分推断和效率感知证据下界提升LLM推理效率,实验显示在不同模型规模下效率指标提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13770 2026-05-13 cs.AI cs.CL cs.LG stat.ME stat.ML 90%

Ice Cream Doesn't Cause Drowning: Benchmarking LLMs Against Statistical Pitfalls in Causal Inference

冰淇淋不导致溺水:对LLM在因果推断统计陷阱中的基准测试

Jin Du, Li Chen, Xun Xian, An Luo, Fangqiao Tian, Ganghua Wang, Charles Doss, Xiaotong Shen, Jie Ding

机构 * School of Statistics, University of Minnesota(明尼苏达大学统计学系) Data Science Institute, University of Chicago(芝加哥大学数据科学研究所)

专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出CausalPitfalls基准测试,评估LLM在因果推断中的能力,揭示当前LLM在统计因果推断中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12001 2026-05-13 cs.IT cs.AI math.IT 90%

CR^2: Cost-Aware Risk-Controlled Routing for Wireless Device-Edge LLM Inference

CR²:面向无线设备-边缘LLM推断的成本感知风险控制路由

Nan Xue, Shengkang Chen, Zhiyong Chen, Jiangchao Yao, Yaping Sun, Zixia Hu, Meixia Tao

机构 * Cooperative Medianet Innovation Center, Shanghai Jiao Tong University(合作中位网创新中心,上海交通大学) Department of Broadband Communication, Pengcheng Laboratory(宽带通信部,鹏城实验室) Future Network of Intelligent Institute (FNii), the Chinese University of Hong Kong (Shenzhen)(智能网络研究所(FNii),香港中文大学(深圳)) Meta

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出CR²框架,通过分离轻量级设备模型与边缘模型的决策机制,优化无线边缘环境下的推断效率与成本,提升部署准确性与能耗平衡。

Comments submitted to IEEE Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11603 2026-05-13 cs.AI 90%

GAR: Carbon-Aware Routing for LLM Inference via Constrained Optimization

GAR:通过约束优化实现碳感知的LLM推理

Disha Sheshanarayana, Rajat Subhra Pal, Manjira Sinha, Tirthankar Dasgupta

机构 * Manipal University Jaipur(曼海普大学斋普尔) TCS Research(塔塔咨询服务)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出GAR框架,通过约束优化在保证准确性和延迟的同时减少碳排放,实验表明其在保持性能的同时显著降低碳足迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11290 2026-05-13 cs.CL cs.AI 90%

ReAD: Reinforcement-Guided Capability Distillation for Large Language Models

ReAD:基于强化学习的能力蒸馏用于大语言模型

Xueqi Cheng, Xugui Zhou, Tyler Derr, Yushun Dong

机构 * Florida State University(佛罗里达州立大学) Louisiana State University(路易斯安那州立大学) Vanderbilt University(范德比大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 ReAD通过强化学习指导能力蒸馏,在固定token预算下提升下游任务性能,减少有害溢出和无效蒸馏成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11260 2026-05-13 cs.LG cs.AI 90%

Curriculum Learning-Guided Progressive Distillation in Large Language Models

基于课程学习的渐进蒸馏:大型语言模型中的知识蒸馏

Jincheng Cao, Fanzhi Zeng, Leqi Liu, Aryan Mokhtari

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Google Research(谷歌研究)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);small language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CLPD框架,通过结合数据难度与教师强度,改进知识蒸馏方法,实验证明其在推理任务中优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11733 2026-05-13 cs.CE cs.DC 89%

Position: LLM Inference Should Be Evaluated as Energy-to-Token Production

位置:LLM推理应作为能量到令牌生产进行评估

Xiang Liu, Shimiao Yuan, Zhenheng Tang, Peijie Dong, Kaiyong Zhao, Qiang Wang, Bo Li, Xiaowen Chu

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 本文提出将LLM推理视为能量到令牌生产,强调在固定质量和性能目标下,约束从理论峰值计算转向实际能源、冷却和效率问题,呼吁报告能耗、绑定约束和效率指标。

Comments https://dominic789654.github.io/energy-to-token/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12056 2026-05-13 cs.AI 88%

OmniRefine: Alignment-Aware Cooperative Compression for Efficient Omnimodal Large Language Models

OmniRefine: 一种面向对齐的协作压缩方法以提高多模态大语言模型的效率

Yuchen Deng, Zidang Cai, Hai-Tao Zheng, Jie Wang, Feidiao Yang, Yuxing Han

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Pengcheng Laboratory(鹏城实验室)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出OmniRefine,一种无需训练的两阶段框架,通过跨模态对齐和协作压缩提升多模态大语言模型的推理效率与性能稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11803 2026-05-13 cs.CV cs.AI 88%

OTT-Vid: Optimal Transport Temporal Token Compression for Video Large Language Models

OTT-Vid: 基于最优传输的视频大语言模型时间令牌压缩

Minseok Kang, Minhyeok Lee, Jungho Lee, Minjung Kim, Donghyeong Kim, Dayeon Lee, Heeseung Choi, Ig-jae Kim, Sangyoun Lee

机构 * Yonsei University(延世大学) LG Electronics(LG电子) KIST(韩国科学技术院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 OTT-Vid通过结合空间修剪和最优传输,有效压缩视频令牌,保持高性能,实验显示在保留10%令牌的情况下,VQA和VTG性能分别达到95.8%和73.9%。

Comments 22pages, 9 figures. Code available at https://github.com/minseokii/OTT-Vid

详情

展开后加载摘要…

URL PDF HTML 收藏