arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-12 至 2026-08-12 共收录 354 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 61 篇

2409.04744 2026-08-12 cs.LG cs.AI 90%

Reward Guidance for Reinforcement Learning Tasks Based on Large Language Models: The LMGT Framework

Yongxin Deng, Xihe Qiu, Jue Chen, Xiaoyu Tan

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

Journal ref Knowledge-Based Systems, 322 (2025) 113689

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02068 2026-08-12 cs.CR cs.CL cs.LG 版本更新 88%

Robust and Secure Code Watermarking for Large Language Models via ML/Crypto Codesign

基于ML/密码学协同设计的大语言模型鲁棒安全代码水印

Ruisi Zhang, Neusha Javidnia, Nojan Sheybani, Farinaz Koushanfar

专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 该研究提出首个ML/密码学协同设计的RoSeMary框架,通过端到端训练结合CodeT5实现高质量代码水印,用零知识证明安全验证,兼具高检测准确率、抗攻击能力与高效性。

Comments accept to ACM TAISAP

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10459 2026-08-12 cs.CL cs.AI 新提交 88%

MD-ProTector: Positioning Multiple Data-Driven Prototypes for LLM-Generated Text Detection

MD-ProTector:为大语言模型生成文本检测定位多个数据驱动原型

Jinmo Han, Jimin Hong, Chanyeong Moon, Ju Yeon Kang, Seonuk Kim, Nam Soo Kim

机构 * Seoul National University(首尔大学)

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.CL、cs.AI

AI总结 该研究针对LLM生成文本检测的类别内部差异问题,提出MD-ProTector模型,通过原型定位损失优化,在多基准测试中取得优于同类编码器方法的检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10447 2026-08-12 cs.IR cs.AI 新提交 87%

Towards Efficient Reasoning in LLM-Based Recommender Systems via Model Merging

基于模型合并的大语言模型推荐系统高效推理研究

Linh Dieu Le, Tong Chen, Shazia Sadiq, Hongzhi Yin, Ming Jin, Junliang Yu

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究针对LLM推荐系统推理冗长导致成本高的问题,提出首个用于推理压缩的注意力头级细粒度模型合并框架,在不降低推荐准确率的前提下最多缩短24.3%的推理长度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08932 2026-08-12 cs.AR 版本更新 86%

From Indiscriminate to Targeted: Functionally Critical Signal-Driven Assertion Generation using LLMs for Efficient RTL Verification

从盲目到定向:通过功能关键信号驱动的LLM断言生成实现高效的RTL验证

Yonghao Wang, Hongqin Lyu, Boling Chen, Jiaxin Zhou, MinYang Bao, Wenchao Ding, Feng Gu, Zhiteng Chao, Jianan Mu, Kan Shi, Tiancheng Wang, Huawei Li

专题命中 效率与部署 :LLM(title_cn,summary_cn)

AI总结 本文提出AgileAssert框架,通过构建RTL语义图并识别关键信号,指导LLM生成定向断言,提升验证效率,减少断言数量并提高覆盖率。

Comments 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07215 2026-08-12 cs.SE cs.PL 版本更新 86%

The CodeInverter Suite: Structure- and Data-Aware Binary Decompilation with Efficient LLMs

CodeInverter工具套件:基于结构与数据感知及高效大语言模型的二进制反编译技术

Peipei Liu, Jian Sun, Rongkang Sun, Li Chen, Zhaoteng Yan, Xiaoling Zhang, Dawei Wang, Dapeng Sun, Peizheng Zhang, Dan Li

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 针对现有LLM反编译方法在结构重构、数据恢复等方面的不足,本文提出含CIW、CID、CIMs的CodeInverter套件,经实验验证可显著提升反编译性能,CIM-6.7B达最优效果

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10939 2026-08-12 cs.CL cs.AI 新提交 85%

A Cost-Efficient Routing Pipeline for Multilingual Short-Text Classification Using Small Language Models

使用小型语言模型的低成本多语言短文本分类路由流水线

Wajdi Ben Saad, Safa Madiouni

专题命中 效率与部署 :language model(title);small language model(title);分类 cs.CL、cs.AI

AI总结 本研究提出一种使用小型语言模型的多语言短文本分类路由流水线,通过选择性翻译低资源语言提升分类性能,在两个基准上验证了该策略的有效性。

Comments Accepted for publication at the 16th International Conference on Advanced Computer Information Technologies (ACIT 2026), https://acit.tech/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09941 2026-08-12 cs.CL 新提交 84%

The Multilingual Quantization Tax: Structural Collapse and Typological Fragility in Edge SLMs

多语言量化代价:边缘端小型语言模型(SLM)中的结构崩溃与类型学脆弱性

Mohammad Wathiq Soualhi

专题命中 效率与部署 :SLM(title_cn,abstract_cn);language model(abstract);small language model(abstract);分类 cs.CL

AI总结 本研究针对Gemma 4、Qwen 3.5架构开展4比特量化的零样本多语言评估,发现量化存在类型学脆弱性等四类现象,揭示了量化代价的多语言差异。

Comments Under review at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11121 2026-08-12 stat.OT stat.ME 新提交 83%

Generative AI use in Statistical Research: A Literature Review and Code Generation Case Study

生成式AI在统计研究中的应用:文献综述与代码生成案例研究

Natalie Morosin, Adel Ahmadi Nadi, Michael P. Wallace

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究通过案例研究分析了ChatGPT-5和ScholarAI在统计研究的文献综述与代码生成中的应用,发现其需专业人员提示监督,可作为研究工具但无法替代专业方法论知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09921 2026-08-12 cs.LG 版本更新 83%

A Tale of Two Temperatures: Simple, Efficient, and Diverse Sampling from Diffusion Language Models

双温度的故事:从扩散语言模型中实现简单、高效且多样的采样

Theo X. Olausson, Metod Jazbec, Xi Wang, Armando Solar-Lezama, Christian A. Naesseth, Stephan Mandt, Eric Nalisnick

机构 * Massachusetts Institute of Technology(麻省理工学院) UvA-Bosch Delta Lab, University of Amsterdam(阿姆斯特丹大学UvA-Bosch Delta实验室) Johns Hopkins University(约翰霍普金斯大学) University of California, Irvine(加州大学尔湾分校)

专题命中 效率与部署 :language model(title,abstract);post-training(abstract);分类 cs.LG

AI总结 本文提出通过温和的温度化方法提升扩散语言模型采样多样性,实现高效且多样化的样本生成,优于现有方法。

Comments V2: accepted as a full conference paper at COLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08240 2026-08-12 cs.CV cs.AI 版本更新 83%

Hybrid Token Compression for Vision-Language Models

HybridToken-VLM:用于视觉-语言模型的混合令牌压缩

Jusheng Zhang, Xiaoyang Guo, Tongyu Mo, Qinhan Lv, Wenhao Chai, Jian Wang, Keze Wang, Liang Lin

机构 * Sun Yat-sen University(中山大学) Princeton University(普林斯顿大学) Snap Inc(Snap公司)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract_cn);分类 cs.AI

AI总结 HybridToken-VLM通过混合令牌压缩技术,在保持性能的同时显著提升视觉-语言模型的效率

Comments Accepted at CVPR 2026. Code available at https://github.com/jushengzhang/HybridToken-VLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10288 2026-08-12 cs.LG cs.CL 新提交 82%

Power law graph attention: exact generalization of scaled dot-product attention, empirical collapse at inference

幂律图注意力:缩放点积注意力的精确泛化,推理时的经验崩溃

Burc Gokden

机构 * Fromthesky Research Labs LLC(弗洛姆斯基研究实验室有限责任公司)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 该研究提出PLGA注意力机制,其在$G_{LM}=I$时精确包含SDPA,还证明了推理崩溃定理,在测试样本上的分块与顺序评分结果与TruthfulQA度量偏差极小,相关证明核心已通过Lean 4机器验证。

Comments 61 pages, 1 figure, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00135 2026-08-12 cs.LG cs.AI 版本更新 82%

On Effectiveness and Efficiency of Agentic Tool-calling and RL Training

论智能体工具调用与强化学习训练的有效性与效率

Tong Liu, Cheng Qian, Matej Cief, Yuan He, Daniele Dan, Nikolaos Aletras, Gabriella Kazai

机构 * University of California, Berkeley(加州大学伯克利分校) University of Cambridge(剑桥大学) University of Toronto(多伦多大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文系统分析工具调用评估中的实现选择对结果敏感性的影响,并针对强化学习训练中的计算浪费提出两种加速技术。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11076 2026-08-12 cs.CV 新提交 82%

Foundation Model-Enabled Efficient Data Sampling (FEEDS): A label-efficient training strategy for pan-cancer, multi-tracer PET/CT datasets

基于基础模型的高效数据采样(FEEDS):用于泛癌、多示踪剂PET/CT数据集的标签高效训练策略

Biratal Raj Wagle, Bashirul Azam Biswas, Grant Chau, Matthew E. Maeder, Muhammad Azeem Arshad, Michael S. Leapman, James B. Yu, Indrani Bhattacharya

机构 * Geisel School of Medicine at Dartmouth(达特茅斯盖泽尔医学院) Dartmouth Hitchcock Medical Center(达特茅斯-希区柯克医疗中心) Yale University(耶鲁大学)

专题命中 效率与部署 :foundation model(title,abstract)

AI总结 该研究提出FEEDS策略,利用视觉基础模型嵌入选择信息性和多样性未标注病例,在减少70%标注负担时达到全标注训练性能,解决了PET/CT病灶分割的标签稀缺问题。

Comments Code is publicly available on https://github.com/Image-and-Multimodal-Data-Analytics/FEEDS

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10801 2026-08-12 cs.CV 新提交 82%

Evaluating Semantic and Spatial Guidance for Foundation Model Segmentation of Small-Scale PV in Remote Sensing Imagery

评估基础模型在遥感影像中小规模光伏分割的语义与空间引导

Roni Blushtein-Livnon, Tal Svoray, Osher Rafaeli, Michael Dorman, Itay Fischhendler, Havazelet Yahel, Emir Galilee

机构 * Ben-Gurion University of the Negev(内盖夫本-古里安大学) The Hebrew University of Jerusalem(耶路撒冷希伯来大学) Ben Gurion Institute for the Study of Israel & Zionism(本-古里安以色列与犹太复国主义研究所) Ben-Gurion Israel Research Institute(本-古里安以色列研究所)

专题命中 效率与部署 :foundation model(title,abstract);prompting(abstract)

AI总结 该研究评估了SAM3在遥感影像中小规模光伏分割中不同提示策略的效果,发现混合提示性能最优,仅需少量标注样本即可实现高效分割,为无电网地区光伏测绘提供了可行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06085 2026-08-12 cs.DC 82%

LAAFD: LLM-based Agents for Accelerated FPGA Design

LAAFD: 基于大语言模型的加速FPGA设计代理

Maxim Moraru, Kamalavasan Kamalakkannan, Jered Dominguez-Trujillo, Patrick Diehl, Atanu Barai, Julien Loiseau, Zachary Kent Baker, Howard Pritchard, Galen M Shipman

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract)

AI总结 LAAFD利用大语言模型将通用C++转换为优化的Vitis HLS内核,实现高性能FPGA设计,同时降低专业门槛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10362 2026-08-12 cs.OS cs.AI 新提交 81%

MemSpec: Memory-Aware Runtime for Adaptive Draft Scheduling in Speculative Decoding on Edge Devices

MemSpec:边缘设备上推测解码中自适应草稿调度的内存感知运行时

Eunjeong Kim, Yeong Jun Jeon, Myeonggyun Han

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对边缘设备推测解码中内存受限导致自适应方法吞吐量提升不足的问题,提出MemSpec内存感知运行时,通过解耦草稿选择与执行等设计,使Jetson Orin Nano上的稳态生成吞吐量平均提升40.7%

Comments Published in LCTES 2026

Journal ref Proc. ACM LCTES 2026, 180-192 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10290 2026-08-12 cs.SE cs.AI cs.HC cs.PL 新提交 81%

Comprendia: AI-Augmented Code Comprehension

Comprendia:AI增强型代码理解工具

Costain Nachuma, Minhaz F. Zibran

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究提出一款名为Comprendia的Eclipse插件,通过集成结构依赖可视化、LLM代码解释、克隆检测及CVE风险叠加功能,为Java程序理解提供支持,在含已知克隆与漏洞的Java项目上验证了其有效性。

Comments 5 pages, 2 figures. Accepted at ICSME 2026, Tool Demonstration and Data Showcase Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01418 2026-08-12 cs.CL 版本更新 81%

Cost-Efficient Estimation of General Abilities Across Benchmarks

跨基准的低成本能力估计

Michael Krumdick, Adam Wiemerslage, Seth Ebner, Charles Lovering, Chris Tanner

机构 * Kensho Technologies MIT(麻省理工学院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出通过改进的多维项目反应理论模型与自适应项目选择方法,以低成本预测模型在未见任务上的性能,实现高效基准评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26508 2026-08-12 cs.LG cs.AI cs.CV cs.DC cs.NI 版本更新 81%

Progressive Semantic Communication for Efficient Edge-Cloud Vision-Language Models

渐进式语义通信用于高效边缘-云视觉-语言模型

Cyril Shih-Huan Hsu, Wig Yuan-Cheng Cheng, Chrysa Papagianni

机构 * Informatics Institute, University of Amsterdam(阿姆斯特丹大学信息学院) Open-EP Community(开放EP社区)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出渐进式语义通信框架,通过Meta AutoEncoder压缩视觉token,实现灵活的边缘-云VLM部署,减少网络延迟并保持语义一致性。

Comments Accepted for publication in the 2026 IEEE Global Communications Conference (GLOBECOM). Extended version with additional figures and appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10139 2026-08-12 cs.DB 新提交 80%

AI Query Compilation for Unified and Optimized Execution

用于统一且优化执行的AI查询编译

Yeounoh Chung, Helena Caminal, Fatma Ozcan

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 该研究提出统一编译执行架构范式,将SQL与LLM整合为张量计算图消除PCIe瓶颈,在SemBench数据集的TPU实验获最高5.3倍延迟、9.8倍吞吐量加速,还给出相关研究路线图。

Comments Proceedings of the VLDB Endowment, Vol. 14, No. 1 ISSN 2150-8097

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09290 2026-08-12 cs.SE 版本更新 80%

OpenCodeReview: Determinism over Non-Determinism for Cost-Effective Agent-Based Code Review

OpenCodeReview:面向成本效益型智能体代码评审的非确定性转确定性方案

Zhengfeng Li, Lei Zhang, Xianwei Wu, Zhengqi Zhuang, Yingjie Xu, Boge Wang, Shaofei Zhu, Chuan Wang, Peng Zhao, Xinyu Zheng, Guoping Rong

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 OpenCodeReview针对LLM代码评审智能体的非确定性与上下文局部性缺陷,通过在三个流水线节点注入确定性,在AACR-Bench上实现SEM-F1提升且大幅降低令牌消耗,性能优于主流编码智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11716 2026-08-12 cs.AR 版本更新 80%

A Fast Locality Simulator for GEMM Design-Space Exploration on Multi-Chiplet GPUs

面向多芯片GPU的GEMM设计空间探索的快速局部性模拟器

Euijun Chung, Hyesoon Kim

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出一种快速、功能级、瓦片级局部性模拟器,用于评估多芯片GPU上GEMM的内核选择对片间流量影响,发现远程流量变化可达90倍,并揭示2D块交织CTA遍历可减少远程流量达5.1倍。

Comments Poster presentation at the Workshop on Modeling & Simulation of Systems and Applications (MODSIM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08086 2026-08-12 cs.CL 版本更新 79%

Archer: Adaptive Reuse of Cached Hidden States for Efficient Rollback in Diffusion Language Models

Archer:用于扩散语言模型高效回滚的缓存隐藏状态自适应复用方法

Xuning He, Zinan Sheng, Yongding Tao, Huanyu Liu, Ge Li, Xue Jiang, Yihong Dong

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL

AI总结 本文提出Archer方法,通过自适应复用缓存的提示隐藏状态,在保证扩散语言模型回滚能力的同时,实现了2.57倍平均加速与33.63%最佳平均性能,还提升了Pass@1指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19436 2026-08-12 cs.CV cs.AI cs.LG cs.MM 版本更新 79%

VDC-Agent: When Video Detailed Captioners Evolve Themselves via Agentic Self-Reflection

VDC-Agent:当视频详细描述器通过代理自我反思而自我进化

Qiang Wang, Xinyuan Gao, Yuhang He, Jizhou Han, Jiangyang Li, SongLin Dong, Zhiheng Ma, Yihong Gong

机构 * Xi’an Jiaotong University(西安交通大学) Kuaishou Technology(快手科技) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 VDC-Agent通过自我反思机制实现视频详细描述的自我进化,利用自动生成的(描述,评分)对提升描述准确性与评分表现。

Comments Accepted to ECCV 2026. Project Page: https://vdcagent.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10864 2026-08-12 cs.CV 新提交 78%

Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models

面向视觉语言模型空间推理的多视图关系蒸馏

Kiet T. Nguyen, Hanbo Shim, Jinwoo Kim, Seunghoon Hong

机构 * KAIST(韩国科学技术院)

专题命中 效率与部署 :language model(title,abstract)

AI总结 针对视觉语言模型空间推理的几何脆弱性问题,提出多视图关系蒸馏方法,在保留语言对齐的同时提升视觉空间推理性能,可泛化至3D场景理解任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10280 2026-08-12 astro-ph.IM astro-ph.CO 新提交 78%

Tabular foundation models for the estimation of probabilistic quasar photometric redshifts in S-PLUS

用于S-PLUS中类星体概率测光红移估计的表格基础模型

Raquel R. Valença, Lilianne Nakazono, Rafael Izbicki, Marco Henrique de Almeida Inácio, Bruno Marcondes e Resende, Maycon Jorge Deláqua da Silva, Kiana Coimbra Buin Lins, Natanael M. Cardoso, Claudia Mendes de Oliveira

专题命中 效率与部署 :foundation model(title,abstract)

AI总结 本研究以S-PLUS DR6类星体为对象,对比表格基础模型与8种基线模型,发现TabPFN 2.5在概率测光红移估计中表现最优,尤其适用于小训练集或协变量偏移场景。

Comments 28 pages, 10 figures, 6 tables. Submitted to the AAS Journals

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24602 2026-08-12 cs.CV 版本更新 78%

Majorization-Guided Test-Time Adaptation for Vision-Language Models under Modality-Specific Shift

基于主导性的测试时适应以应对视觉-语言模型在模态特定偏移下的表现

Lixian Chen, Mingxuan Huang, Yanhui Chen, Junyi Lin, Yang Shi

机构 * Guangdong University of Technology(广东工业大学)

专题命中 效率与部署 :language model(title,abstract)

AI总结 本文研究了视觉-语言模型在部署时视觉与文本分支不对称偏移的问题,提出MG-MTTA方法通过控制模态可靠性而非仅预测熵来提升性能。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10932 2026-08-12 cs.CV cs.AI 新提交 77%

Temporally Grounded Compositional Camera Motion Understanding via Geometric Knowledge Distillation

基于几何知识蒸馏的时序锚定组合式相机运动理解

Dazhao Du, Shiyan Du, Jian Liu, Yongjian Yu, Bohai Gu, Tao Han, Hualuo Liu, Eric Liu, Yujia Zhang, Xi Chen, Song Guo

机构 * The Hong Kong University of Science and Technology(香港科技大学) Tencent(腾讯)

专题命中 效率与部署 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 本研究提出CamDistill方法,通过几何知识蒸馏实现时序锚定的组合式相机运动理解,推出含4229个片段的CamChoreo基准,提升了相机运动识别的细粒度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10489 2026-08-12 cs.CV 新提交 75%

When Vision Becomes Text: Visual Token Pruning via Cross-Modal Residual Guidance in VLMs

当视觉变为文本:视觉语言模型(VLM)中基于跨模态残差引导的视觉令牌剪枝

Congyang Ou, Ruike Song, Yang Zhou, Libo Sun, Haokui Zhang, Zhenbo Luo

专题命中 效率与部署 :LLM(abstract,abstract_cn);language model(abstract)

AI总结 该研究针对视觉语言模型(VLM)海量视觉令牌导致推理成本高的问题,提出基于跨模态残差(CMR)的无训练压缩方法SIEVE,在LLaVA-NeXT-7B上仅保留11.1%视觉令牌,实现显著加速与缓存缩减且性能损失极小。

详情

展开后加载摘要…

URL PDF HTML 收藏