arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-11 至 2026-08-11 共收录 772 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 146 篇

2608.09016 2026-08-11 cs.IR cs.LG 新提交 79%

PreGress: Ranking-Native Pre-training and Prompting for Graph Node Ranking

PreGress:面向图节点排序的原生排序预训练与提示学习框架

Lujie Ban, Jiasheng shi, Yingli Zhou, Kaiwen Xue, Daiyin Wang, Xubin Li, Shuanghua Li, Chenhao Ma

专题命中 效率与部署 :prompting(title,abstract);分类 cs.LG

AI总结 PreGress是首个原生排序预训练与提示学习框架,通过多任务预训练与轻量提示模块,在低开销下实现了多节点排序任务的优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08319 2026-08-11 cs.CV cs.LG 新提交 79%

A continually expandable foundation model for brain MRI

可持续扩展的脑MRI基础模型

Michail Mamalakis, Carmen Jimenez-Mesa, Yonghao Li, Hao Chen, Chao Li, Antonios Mamalakis, John Suckling, Richard Bethlehem, Stephen J. Price, Richard J. Gilbertson, Pietro Lio

机构 * University of Cambridge(剑桥大学) University of Málaga(马拉加大学)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出可扩展的Alcmaeon脑MRI基础模型,结合体积编码、潜在扩散生成与Graph-Blueprint Pruning,在跨临床领域扩展时遗忘程度更低,可支持多种任务,为持续发展的脑MRI基础模型提供了可行方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08282 2026-08-11 cs.LG 新提交 79%

Stateful CARS: Exact Cross-History Reuse for Policy-Constrained LLM Agents

有状态CARS:策略约束大语言模型智能体的精确跨历史复用

Ibne Farabi Shihab, Md Najmus Swaqeeb, Abu Sa-Adat Mohamed Moon-Im Al Ahsan

机构 * Iowa State University(爱荷华州立大学) BRAC University(BRAC大学)

专题命中 效率与部署 :LLM(title);language model(abstract);分类 cs.LG

AI总结 本文针对受含义随观测和动作变化约束的工具使用语言模型智能体,提出有状态CARS方法,通过冻结状态-延续模式实现跨历史无效性证书复用,实验表明其精确性高但系统性能未优于官方CARS。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08256 2026-08-11 cs.CL 新提交 79%

AraSSM: A bidirectional state-space encoder for Arabic masked language modeling

AraSSM:面向阿拉伯语掩码语言建模的双向状态空间编码器

Ahmed Amine Aliane, Hassina Aliane, Nasredine Semmar

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL

AI总结 本文提出面向阿拉伯语的双向状态空间编码器AraSSM,经掩码语言建模预训练后,在四项阿拉伯语NLU基准上的表现接近或优于同规模Transformer,验证了消费级硬件训练的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08138 2026-08-11 cs.CV cs.LG 新提交 79%

EFFEKT: Efficient Federated Knowledge Transfer to Foundation Models

EFFEKT:面向基础模型的高效联邦知识迁移

Matteo Caligiuri, Francesco Barbato, Pietro Zanuttigh, Francesco Restuccia

机构 * Northeastern University(东北大学) University of Padua(帕多瓦大学)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 EFFEKT是一种联邦学习框架,通过双向跨蒸馏策略,结合轻量级客户端代理模型与服务器端基础模型,实现高效的领域特定LoRA适配器训练,在低功耗边缘设备上性能优于基线。

Comments 12 main content pages, 8 appendix pages; 3 main figures, 9 appendix figures; 8 main tables, 9 appendix tables; 1 main algorithm, 4 appendix algorithms; accepted at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16305 2026-08-11 cs.CV cs.AI 版本更新 79%

LookME: Lookup-Based Multimodal Embeddings for Layer Injection in Vision-Language Models

LookME:用于视觉语言模型层注入的基于查找的多模态嵌入

Zeyu Xu, Xingzhong Hou, Pengkai Guo, Siling Lin, Xiao Xu, Menghua Zhai, Haoyu Chen, Yunke Zhang, Fei Huang

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 本文针对视觉语言模型在资源受限环境中部署的问题,提出LookME框架。通过分层两级查找方法和稀疏注入策略,实现基于查找的多模态嵌入增强,实验表明该方法优于仅文本的PLE风格方法,有效提升了模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02455 2026-08-11 cs.SD cs.CL eess.AS 版本更新 79%

Diagnostic-Driven Layer-Wise Compensation for Post-Training Quantization of Encoder-Decoder ASR Models

基于诊断的层间补偿用于编码器-解码器ASR模型的后训练量化

Xinyu Wang, Ziyu Zhao, Yajie Luo, Yihong Wu, Liheng Ma, Jingrui Tian, Lei Ding, Xiao-Wen Chang, Peng Lu

机构 * McGill University(麦吉尔大学) University of Manitoba(曼尼托巴大学) Mila - Quebec AI Institute(魁北克AI研究院)

专题命中 效率与部署 :post-training(title,abstract);分类 cs.CL

AI总结 本文提出FADE框架,通过结合内在脆弱性评分和校准可靠性评分,为编码器-解码器ASR模型的各层分配适应性补偿系数,以平衡局部量化保真度与跨层误差校正,从而提升在3-4位精度下的词错误率性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09836 2026-08-11 cs.AI cs.CL 新提交 79%

Mismatch Matters: On-Policy Distillation Beyond Token Agreement

失配很重要:超越token一致性的在线蒸馏

Zichao Yu, Chengzhi Yu, Shengze Xu, Yujin Han, Bingqing Jiang, Xu Wang, Difan Zou

机构 * The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.CL、cs.AI

AI总结 本文针对在线蒸馏存在的退化一致性失效问题,提出TIDE方法修正师生失配,在数学推理基准上显著提升性能、缩短响应长度并减少格式错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07508 2026-08-11 cs.HC cs.AI cs.CL 新提交 79%

JaleesBench: Are AI Assistants Good Spiritual Company?

JaleesBench:AI助手能否成为良好的精神陪伴?

M. Waleed Kadous, Benjamin Olsen

专题命中 效率与部署 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究人员推出JaleesBench基准测试,评估AI助手的精神陪伴能力,发现简单提示指导可提升通用模型的陪伴表现,领域微调助手的优势来自检索和提示层,还可用于改进现有宗教类AI助手。

Comments 21 pages, 8 figures, 4 tables. Open-source harness, scenario bank, proof texts, and full evaluation (model responses and both judges' verdicts): https://github.com/iaser-ai/jaleesbench . Interactive browser for inspecting scenarios, responses, and judge verdicts: https://s.iaser.ai/jb

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11505 2026-08-11 cs.LG cs.AI 版本更新 79%

Proxy OPD: On-Policy Distillation with Transferable Relative Proxy Update

代理探索与可重用引导:基于代理引导更新信号的模块化大语言模型训练后范式

Daocheng Fu, Rong Wu, Yu Yang, Jianbiao Mei, Licheng Wen, Pinlong Cai, Xuemeng Yang, Yong Liu, Botian Shi, Yu Qiao

专题命中 效率与部署 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型训练后优化信号耦合问题,提出PUST框架,通过代理模型探索、提取并传输相对改进信号,解耦更新信号探索与分布对齐,减少计算开销,支持异步处理与跨模型转移,提升训练后范式的模块化、可重用性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02047 2026-08-11 cs.CL cs.AI 版本更新 79%

Goose: Anisotropic Speculation Trees for Training-Free Speculative Decoding

Goose:用于无训练推测解码的各向异性推测树

Tao Jin, Phuong Minh Nguyen, Naoya Inoue

机构 * Japan Advanced Institute of Science and Technology (JAIST)(日本先端科学技术大学院大学)

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Goose通过构建适应性脊柱树,利用高接受率的上下文匹配令牌和低接受率的替代分支,实现无训练推测解码的各向异性树结构,提升解码速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18721 2026-08-11 cs.LG cs.AI 版本更新 79%

Towards Realistic Guarantees: A Probabilistic Certificate for SmoothLLM

迈向现实保证:一种概率证书用于SmoothLLM

Adarsh Kumarappan, Ayushi Mehrotra

机构 * California Institute of Technology(加州理工学院)

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出一种概率框架,通过(k, ε)-unstable假设提升LLM对抗劫持攻击的安全性保障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01067 2026-08-11 cs.CV 版本更新 78%

ReACT-CLIP: Response-Aware Test-Time Defense for Vision--Language Models

ReACT-CLIP:面向视觉-语言模型的响应感知测试时防御

Hashmat Shadab Malik, Toluwani Aremu, Samuele Poppi, Muzammal Naseer, Salman Khan

专题命中 效率与部署 :language model(title,abstract)

AI总结 ReACT-CLIP是无需训练的响应感知测试时防御,通过跨噪声特征漂移与预测不稳定性得分动态调整修正强度,在多数据集上提升了CLIP类模型的对抗鲁棒性且保留干净准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16854 2026-08-11 cs.CV 版本更新 78%

Certainty Is Redundant: Token Sparsification for Efficient Camouflaged Object Detection with Vision Foundation Models

CATP:基于置信度的令牌修剪用于伪装目标检测

Yuhan Gao, Shuhao Kang, Xin He, Bing Li, Ming-Ming Cheng, Yun Liu

机构 * VCIP, College of Computer Science, Nankai University(VCIP,计算机科学学院,南开大学) Academy for Advanced Interdisciplinary Studies, Nankai University(先进交叉学科研究院,南开大学) School of Computer Science and Engineering, Tianjin University of Technology(计算机科学与工程学院,天津工业大学) School of Information and Communication Engineering, UESTC(信息与通信工程学院,电子科技大学) Nankai International Advanced Research Institute, Shenzhen Futian(南开国际先进研究院,深圳福田)

专题命中 效率与部署 :foundation model(title,abstract)

AI总结 本文提出CATP框架,通过分层修剪和双路径补偿机制提升伪装目标检测效率,减少计算量并保持高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09185 2026-08-11 cs.DB cs.AI cs.SE 新提交 77%

SiriusDeliver: Automating Data Warehouse Delivery at Tencent

SiriusDeliver:腾讯的数据仓库交付自动化方案

Haining Xie, Xiaokai Zhou, Jiaming Yang, Siqi Shen, Ziwei Wang, Yifeng Zheng, Tengyue Xu, Yipeng Shi, Zefang Zong, Yang Li, Peng Chen, Jie Jiang, Debiao He, Xiao Yan, Jiawei Jiang

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 腾讯提出SiriusDeliver端到端交付自动化智能体,集成三类组件,经离线实验和腾讯云WeData大规模部署验证,可显著提升DW交付的成功率、效率,缩短交付时间与工程师工作量。

Comments 13 pages, 13 figures, 3 tables. Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09160 2026-08-11 cs.LG cs.DC 新提交 77%

SwiftQK: Fast and Communication-Efficient Tensor Parallelism for Query-Key Normalization

SwiftQK:面向查询-键归一化的快速且通信高效的张量并行方法

Gyudong Kim, Wonjun Han, Young Geun Kim

机构 * Korea University(高丽大学)

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 SwiftQK是一种多GPU的RMSNorm核,通过仅交换标量归一化统计量并重叠归约与计算,大幅降低了张量并行下查询-键归一化的通信开销与延迟,提升了大型语言模型的推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02927 2026-08-11 cs.CV cs.AI 77%

PrismVAU: Prompt-Refined Inference System for Multimodal Video Anomaly Understanding

PrismVAU: 用于多模态视频异常理解的提示优化推理系统

Iñaki Erregue, Kamal Nasrollahi, Sergio Escalera

机构 * Universitat de Barcelona(巴塞罗那大学) Computer Vision Center(计算机视觉中心) Aalborg University(奥胡斯大学) Milestone Systems(Milestone系统)

专题命中 效率与部署 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.AI

AI总结 PrismVAU通过轻量级系统和自动提示工程实现高效的多模态视频异常理解,无需复杂标注和外部模块。

Comments This paper has been accepted to the 6th Workshop on Real-World Surveillance: Applications and Challenges (WACV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07627 2026-08-11 cs.AI cs.CL cs.LG cs.MA 新提交 75%

From Single Chatbots to Governed Agent Ecosystems: An Agentic AI Pattern Catalogue and Orchestration Framework for Mission-Critical Hospital Information Management Systems

从单一聊天机器人到受管控的智能体生态系统:面向关键任务型医院信息管理系统的智能体AI模式目录与编排框架

Manideep Dhar, Ritwik Singh, Sharat Chandra Kumar Manikonda

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究针对医院信息管理系统提出以合规为核心的智能体AI模式目录与编排框架,可减少文档处理时间等成本、强化管控,助力医院将AI投资转化为可持续回报。

Comments Peer-reviewed published article

Journal ref International Journal of Innovative Science and Research Technology (IJISRT), 11-2026(5), IJISRT26MAY1651

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26041 2026-08-11 cs.CV 版本更新 75%

Where and How to Prune: An Empirical Study of Visual Token Pruning for GUI Agent Navigation

重新思考GUI视觉代理中历史截图的标记剪枝:语义、空间和时间视角

Daiqiang Li, Zihao Pan, Zeyu Zhang, Xuyang Liu, Shijia Xu, Ronghao Chen, Huacan Wang, Honggang Chen, Linfeng Zhang, Zhangquan Chen, Haiyun Jiang

机构 * Sichuan University(四川大学) Sun Yat-sen University(中山大学) Australian National University(澳大利亚国立大学) Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文从语义、空间和时间角度研究GUI视觉代理中历史截图的标记剪枝,发现背景区域对界面状态转换有重要价值,随机剪枝在空间结构保留上更有效,且GUI代理具有近期效应,通过分配更多预算给近期截图可降低计算成本而不影响性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09745 2026-08-11 cs.LG cs.AI stat.ML 新提交 73%

SR-OPSD: Self-Referenced On-Policy Self-Distillation

SR-OPSD:自引用同策略自蒸馏

Zhuo Sun, Entong Li, Yanlong Zhao, Xiaoyuan Cheng, Wenxuan Yuan, Kaiyu Li, Che Liu, Huihang Liu, Harrison Bo Hua Zhu, Li Zeng

机构 * Shanghai University of Finance and Economics(上海财经大学) Imperial College London(伦敦帝国学院) University of Science and Technology of China(中国科学技术大学) University College London(伦敦大学学院) Nanyang Technological University(南洋理工大学) Technical University of Denmark(丹麦技术大学) University of Copenhagen(哥本哈根大学) Peking University(北京大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对同策略自蒸馏的优化不稳定问题,提出SR-OPSD方法,通过几何插值结合Rényi散度优化蒸馏目标,在多任务大语言模型实验中取得最优或竞争性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08910 2026-08-11 cs.CL cs.LG 新提交 73%

Tied Trit-Planes: Constraining PTQTP to a Uniform Nine-Level Quantizer, with a Persistent Folded Format for Disk-Streamed Mixture-of-Experts Serving

绑定三进制平面:将PTQTP约束为统一九级量化器,并为磁盘流式混合专家服务提供持久折叠格式

Matteo Grella

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本研究将PTQTP约束为统一九级量化器,提出持久折叠格式,在DeepSeek-V4-Flash-0731混合专家模型上实现量化,提升解码速度并减小文件体积,且保真度与基线相当,相关成果开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08721 2026-08-11 cs.CL cs.AI 新提交 73%

LibraSpec: Dynamic Diffusion-Based Speculative Decoding via Marginal-Gain-Driven Optimization

LibraSpec:基于动态扩散的推测解码,通过边际增益驱动优化

Zexun Lin, Yuan Feng, Junlin Lv, Kevin S. Zhou, Xike Xie

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LibraSpec是一种无需训练的即插即用推测解码算法,通过边际增益驱动优化动态确定推测长度,可提升大语言模型推理速度,在多基准上较基线加速0.5~1.5倍、较自回归解码最高达8.49倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08100 2026-08-11 cs.CR cs.AI cs.LG 新提交 73%

Defending Retrieval-Augmented Intrusion Detection Against Knowledge Poisoning and Prompt Injection

防御检索增强型入侵检测系统免受知识投毒与提示注入攻击

Kaysarul Anas Apurba, Md. Hasibul Hasan, Mahedee Zaman Moon, Sk. Md. Mizanur Rahman, Atsuo Inomata

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RAG-IDS三层多智能体入侵检测框架,通过软信任评分、LECC和提示净化的检索边界防御,可在知识投毒与提示注入攻击下恢复分类质量,在CIC-UNSW-NB15数据集上表现出良好的防御效果。

Comments 14 pages with Appnedix, 11 figures. Submitted to IEEE CIC 2026, Research Track (double-blind review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20244 2026-08-11 cs.CL cs.AI 版本更新 73%

Hybrid Policy Distillation for LLMs

混合策略蒸馏用于大语言模型

Wenhong Zhu, Ruobing Xie, Rui Wang, Pengfei Liu

机构 * Department of Computer Science(计算机科学系) Engineering, Shanghai Jiao Tong University(上海交通大学工程学院) Shanghai Innovation Institute(上海创新研究院) Large Language Department, Tencent(腾讯大语言部门)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出混合策略蒸馏方法,结合正反KL散度优势,提升模型生成能力和效率,验证了其在多种任务中的有效性。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05164 2026-08-11 cs.LG cs.AI 版本更新 73%

Not All Turns Are Equally Hard: Adaptive Thinking Budgets For Efficient Multi-Turn Reasoning in Agents

并非所有转折都同样困难:为高效多轮推理的自适应思维预算

Neharika Jali, Anupam Nayak, Gauri Joshi

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出TAB方法,通过自适应预算分配提升多轮推理效率,在数学推理基准中实现更高的准确率与token节省。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01900 2026-08-11 cs.CL cs.LG 版本更新 73%

High-Layer Attention Pruning with Rescaling

高层注意力剪枝与重缩放

Songtao Liu, Peng Liu

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种高层注意力剪枝与重缩放方法,通过自适应重缩放参数优化表示尺度,提升LLMs在生成任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19366 2026-08-11 cs.CL cs.LG 版本更新 73%

MoE-Prism: Disentangling Monolithic Experts for Elastic MoE Services via Model-System Co-Designs

MoE-Prism:通过模型-系统协同设计解耦整体式专家以实现弹性MoE服务

Xinfeng Xia, Xiaofeng Hou, Jiacheng Liu, Wenfeng Wang, Mingxuan Zhang, Peng Tang, Chao Li, Minyi Guo

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 MoE-Prism通过模型-系统协同设计将MoE的整体专家分解为细粒度子专家,实现请求级计算弹性,扩展路由工作点数量,提升吞吐量并降低首包时间,验证了实用弹性MoE服务的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09119 2026-08-11 cs.AI 新提交 70%

Motif 3: Technical Report

Motif 3:技术报告

Junghwan Lim, Joon Son Chung, Sungmin Lee, Wai Ting Cheung, Gihun Cho, Minsu Ha, Sangho Kang, Beomgyu Kim, Dongseok Kim, Jangwoong Kim, Taehyun Kim, Taewhan Kim, Jeesoo Lee, Jeongdoo Lee, Junhyeok Lee, Dongpin Oh, Hyeyeon Cho, Dahye Choi, Jaeheui Her, Hanbin Jung, Changjin Kang, Minjae Kim, Youngrok Kim, Hyukjin Kweon, Hongjoo Lee, Yeongjae Park, Bokki Ryu

机构 * Motif Technologies(Motif科技公司)

专题命中 效率与部署 :language model(abstract);post-training(abstract);分类 cs.AI

AI总结 本研究推出仅解码器的MoE语言模型Motif 3,采用GDLA等技术,经万亿token预训练及多阶段后训练,在长上下文、推理等任务上性能与领先开源模型相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08794 2026-08-11 cs.AI cs.MM cs.SD 新提交 70%

Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs

面向全模态大语言模型(Omni-LLMs)的基于局部视听动态的延迟音频剪枝方法

Kyeongyoon Lee, Hongyeob Kim, Youngeun Kim, Sungeun Hong

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对全模态大语言模型的高开销问题,提出两阶段框架A-PACK,利用局部视听动态延迟音频剪枝,在Qwen2.5-Omni基准上实现性能最优,同时大幅降低预填充开销并提升解码吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03921 2026-08-11 cs.AI cs.NE 版本更新 70%

The Transformer Revolution, Part 1: Dynamic Processing through Output-Weight Interconnections

Transformer革命 第一部分:通过输出-权重互连实现的动态处理

Marco Giunti, Fabrizia Giulia Garavaglia

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Transformer推理阶段的SIDPP计算机制,通过输出-权重互连构建依赖提示的动态变换,其贡献随提示长度增加,还推测人类语言处理或为类似SIDPP的形式。

Comments v1: 7 Sections, References, Appendix, Tables (2 tables), Figures Part A (6 figures), Figures Part B (42 figures), Figures Part C (5 figures); v2: corrected typos, new version of Figure 20

详情

展开后加载摘要…

URL PDF HTML 收藏