arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-11 至 2026-06-11 共收录 67 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 67 篇

2509.23248 2026-06-11 cs.AI cs.NI 版本更新 92%

Resource-Aware LLM Reasoning for Mobile Edge General Intelligence

面向移动边缘通用智能的资源感知LLM推理

Mingyi Luo, Ruichen Zhang, Xiangwang Hou, Jun Du, Chunxiao Jiang, Yong Ren, Shiwen Mao

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen(清华大学深圳国际研究生院,清华大学,深圳) College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学 computing 和数据科学学院,新加坡) Department of Electronic Engineering, Tsinghua University, Beijing(清华大学电子工程系,北京) State Key Laboratory of Space Network and Communications, Tsinghua University, Beijing(空间网络与通信国家重点实验室,清华大学,北京) Beijing National Research Center for Information Science and Technology, Tsinghua University, Beijing(北京信息科学与技术国家研究中心,清华大学,北京) Department of Electrical and Computer Engineering, Auburn University, Auburn, USA(阿伯丁大学电气与计算机工程系,阿伯丁,美国)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出联合优化框架,通过自适应CoT提示和分布式MoE架构协同优化推理深度、专家激活和传输功率,在资源受限的移动边缘环境中实现LLM高效推理,推理质量与资源效率平衡,额外推理时间小于1秒时准确率和延迟满足率均达90%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11244 2026-06-11 cs.AR cs.AI 新提交 92%

SPEAR: A System for Post-Quantization Error-Adaptive Recovery Enabling Efficient Low-Bit LLM Serving

SPEAR: 一种后量化误差自适应恢复系统,实现高效低比特LLM服务

Hongyuan Liu, Yawei Li, Zhiqiang Que, Qinli Yang, Junming Shao, Guosheng Hu

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) University of Bristol(布里斯托大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对低比特量化导致LLM质量下降的问题,提出SPEAR系统,通过输入感知的门控误差补偿器(EC)选择性修正高误差层,结合自适应内核融合调度和SLO感知调度器,在<1%内存开销下恢复W4与FP16之间56-75%的困惑度差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21824 2026-06-11 cs.LG cs.DC 92%

DASH: Deterministic Attention Scheduling for High-throughput Reproducible LLM Training

DASH:确定性注意力调度用于高吞吐量可重复LLM训练

Xinwei Qiang, Hongmin Chen, Shixuan Sun, Jingwen Leng, Xin Liu, Minyi Guo

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) ByteDance Seed(字节跳动种子) Zhiyuan College, Shanghai Jiao Tong University(上海交通大学智源学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出DASH算法,通过优化计算和梯度缩减阶段调度,解决确定性注意力训练中的性能损失问题,提升LLM训练效率。

Journal ref Proceedings of the International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05727 2026-06-11 cs.DC 版本更新 91%

LLM-Enhanced Deep Reinforcement Learning for Task Offloading in Collaborative Edge Computing

LLM增强的深度强化学习用于协作边缘计算中的任务卸载

Hao Guo, Kaixiang Xu, Ziwu Ge, Lei Yang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出LeDRL框架,结合轻量级LLM与自注意力增强DRL,通过结构化提示和语义反馈实现实时任务卸载,在成功率、收敛速度和实时性上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11605 2026-06-11 cs.LG cs.AI 新提交 91%

Physics-Distilled Neural Network enabled by Large Language Models for Manufacturing Process-Property Predictive Modeling

基于大语言模型的物理蒸馏神经网络用于制造过程-性能预测建模

Ge Song, Kiarash Naghavi Khanghah, Anandkumar Patel, Rajiv Malhotra, Hongyi Xu

机构 * School of Mechanical, Aerospace and Manufacturing Engineering, University of Connecticut(康奈尔大学机械、航空航天与制造工程学院) Department of Mechanical & Aerospace Engineering, Rutgers, the State University of New Jersey(新泽西州立大学鲁特大学机械与航空航天工程学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出一种知识蒸馏框架,利用大语言模型从文献中提取物理先验,通过图掩码注意力层捕获变量依赖,蒸馏至轻量学生模型,在数据稀缺下实现高精度预测与实时部署。

Comments Under review, Journal of Computing and Information Science in Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12203 2026-06-11 cs.CL 新提交 90%

Adaptive Multi-Resolution Procedural Knowledge Compression for Large Language Models

自适应多分辨率程序性知识压缩用于大型语言模型

Changyue Wang, Weihang Su, Qingyao Ai, Yichen Tang, Runzhong Qiao, Xuancheng Li, Min Zhang, Yiqun Liu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出SKIM框架,通过自适应多分辨率软令牌压缩程序性技能,在保持任务性能的同时将技能令牌长度压缩至30%-60%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04567 2026-06-11 cs.LG cs.AI 版本更新 90%

GILT: An LLM-Free, Tuning-Free Graph Foundational Model for In-Context Learning

GILT:一种无需LLM、无需微调的图基础模型用于上下文学习

Weishuo Ma, Yanbo Wang, Xiyuan Wang, Lei Zou, Muhan Zhang

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Wangxuan Institute of Computer Technology, Peking University(北京大学王宣计算机技术研究所)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出GILT框架,通过基于令牌的上下文学习机制统一处理节点、边和图级别的分类任务,无需大语言模型或微调,实现高效泛化。

Comments Accepted as an oral presentation at the GFM @ ICML 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11806 2026-06-11 cs.CL 新提交 90%

External Experience Serving in Production LLM Systems: A Deployment-Oriented Study of Quality-Cost Trade-offs

生产级LLM系统中的外部经验服务:面向部署的质量-成本权衡研究

Lin Sun, Heming Zhang, Xiangzheng Zhang

机构 * Qiyuan Tech(奇元科技)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL

AI总结 研究生产级LLM系统中注入外部经验的质量-成本权衡,发现选择性检索优于全局注入,且检索质量比增加Top-K更重要,成本效益因任务输出长度而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11379 2026-06-11 cs.AI 新提交 90%

Automated Mediator for Human Negotiation: Pre-Mediation via a Structured LLM Pipeline

人类谈判的自动调解器:通过结构化LLM流水线进行预调解

Jamie Bergen, Sarit Kraus

机构 * University of Washington(华盛顿大学) University of Haifa(海法大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 提出一种结构化LLM流水线作为自动调解器,在整合性谈判中支持预调解,通过分解准备任务为专用模块,在短期自我报告结果上与人类调解员相当,并在偏好推理任务上误差降低36%。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12341 2026-06-11 cs.CR 新提交 89%

OCELOT: Inference-Leakage Budgets for Privacy-Preserving LLM Agents

OCELOT:面向隐私保护LLM代理的推理泄露预算

Jin Xie, Songze Li

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出OCELOT运行时中介,通过后验风险控制和证人验证降级机制,在代理轨迹中预算对手信念更新,平衡任务效用与隐私泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11700 2026-06-11 cs.IR 新提交 89%

CompRank: Efficient LLM Reranking via Token-Level Compression and Decoding-Free Scoring

CompRank: 通过令牌级压缩和无解码评分实现高效的LLM重排序

Xuan Lu, Haohang Huang, Yingqi Fan, Junlong Tong, Yuxuan Zhang, Ping Nie, Rui Meng, Xiaoyu Shen

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出CompRank框架,通过令牌级压缩和无解码注意力评分减少冗余计算,在BEIR数据集上仅保留10.2%文档令牌即达到接近全令牌的排序性能,并实现4.9-9.5倍端到端加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11592 2026-06-11 cs.CR 新提交 89%

Defense Against Prompt Inversion Attacks: An Information-Theoretic Approach for LLM Collaborative Inference

对抗提示反转攻击:面向LLM协作推理的信息论方法

Sayedeh Leila Noorbakhsh, Hossein Khalili, Nader Sehatbakhsh

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出信息论防御框架,通过最小化中间激活与输入提示的互信息来学习隐私表示,实现隐私-效用-延迟权衡,攻击成功率降低35%。

Comments Preprint. 33 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13628 2026-06-11 cs.NI 版本更新 89%

Compact LLM Deployment and World Model Assisted Offloading in Mobile Edge Computing

紧凑型大语言模型部署与世界模型辅助的卸载在移动边缘计算中

Ruichen Zhang, Xiaofeng Luo, Jiayi He, Jiawen Kang, Zehui Xiong, Shiwen Mao

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文研究了移动边缘计算网络中紧凑型大语言模型(LLM)部署和世界模型辅助的推断卸载问题,提出了一种边缘紧凑型LLM部署(ECLD)框架,结合结构化剪枝、低比特量化和知识蒸馏来构建可部署于边缘的LLM变种,并通过四个互补指标评估这些模型。基于这些紧凑模型,提出了一个MEC卸载优化问题,旨在最小化长期平均推断延迟,同时满足设备能耗预算和LLM特定的服务质量约束。为了解决未知且时间变化的网络动态问题,开发了一种世界模型-近端策略优化(PPO)算法,该算法在原策略优化算法中加入了学习的递归世界模型,以提供改进的价值目标和短时间想象回放。

Comments 16 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11589 2026-06-11 eess.SY cs.SY 新提交 89%

Large Language Models in Process Systems Engineering: Opportunities, Architectures, and Industrial Deployment Challenges

过程系统工程中的大语言模型:机遇、架构与工业部署挑战

Bhushan Gopaluni, Vidya Kotamraju, Syon Bhushan

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文系统综述了大语言模型在过程系统工程中的应用,涵盖七个领域,指出其在自然语言任务上表现良好,但在实时执行、约束满足和形式化安全保证方面仍面临挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25820 2026-06-11 cs.LG 版本更新 88%

Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models

基于扩散的多模态大语言模型的视觉冗余控制并行解码

Yulin Yuan, Hongshuo Zhao, Xiangming Meng

机构 * Zhejiang University(浙江大学) ZJUI-UIUC Institute(ZJUI-UIUC研究院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 针对扩散型多模态大语言模型并行解码中视觉冗余问题,提出视觉冗余指数(VRI)和无需训练的视觉冗余控制解码(VRCD)方法,通过令牌到图像的注意力优先选择视觉互补位置,在多个基准上提升准确率。

Comments 18 pages, 5 figures, preprint. Code is available at https://github.com/infiniteYuanyl/VRCD

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29128 2026-06-11 cs.LG 版本更新 87%

Apertus LLM Family Expansion via Distillation and Quantization

通过蒸馏和量化扩展 Apertus LLM 系列

Andrei Panferov, Davit Melikidze, Martin Jaggi, Dan Alistarh

机构 * LLM Family Expansion via Distillation and Quantization(LLM家族通过蒸馏和量化进行扩展)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 本文通过蒸馏和量化方法,基于 Apertus 8B 模型低成本扩展出参数高达 4B 的模型系列,覆盖多种硬件约束并保持强准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11690 2026-06-11 cs.DC cs.PF 新提交 87%

Beyond Per-Token Pricing: A Concurrency-Aware Methodology for LLM Infrastructure Cost Estimation

超越按Token定价:一种考虑并发性的LLM基础设施成本估算方法

Chitral Patil

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 针对现有成本计算器将GPU利用率作为固定输入导致严重误差的问题,提出一种基于测量请求率λ的并发感知成本估算方法,并开源vllm-cost-meter工具,验证了低负载下成本被低估2.5-36.3倍。

Comments 26 pages, 9 figures. Code: https://github.com/pChitral/vllm-cost-meter

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06485 2026-06-11 cs.CL cs.AI 版本更新 86%

Litespark Inference For CPUs: Ultra-Fast SIMD Framework for Ternary (1.58-bit) Language Models

Litespark Inference For CPUs: 三元(1.58位)语言模型的超快SIMD框架

Nii Osae Osae Dade, Tony Morri, Moinul Hossain Rahat, Sayandip Pal, Rickston Pinto

机构 * Mindbeam AI

专题命中 效率与部署 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);分类 cs.CL、cs.AI

AI总结 针对三元语言模型权重为{-1,0,1}的特点,提出自定义SIMD内核,用加减运算替代矩阵乘法,在CPU上实现18-96倍加速和6倍内存减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12370 2026-06-11 cs.LG cs.CL 新提交 85%

Breaking Entropy Bounds: Accelerating RL Training via MTP with Rejection Sampling

打破熵界:通过带拒绝采样的多令牌预测加速强化学习训练

Yucheng Li, Huiqiang Jiang, Yang Xu, Jianxin Yang, Yi Zhang, Yizhong Cao, Yuhao Shen, Fan Zhou, Rui Men, Jianwei Zhang, An Yang, Bowen Yu, Bo Zheng, Fei Huang, Junyang Lin, Dayiheng Liu, Jingren Zhou

机构 * Qwen Team, Alibaba Inc(阿里巴巴集团 Qwen 团队)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 针对强化学习训练中多令牌预测接受率因熵波动而下降的问题,提出Bebop方法,采用概率拒绝采样和端到端TV损失优化,实现高达95%接受率和1.8倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10820 2026-06-11 cs.LG cs.AI cs.CL 版本更新 85%

K-Forcing: Joint Next-K-Token Decoding via Push-Forward Language Modeling

K-Forcing:通过前推语言建模进行联合下一K词解码

Zhiwei Tang, Yuanyu He, Yizheng Han, Wangbo Zhao, Jiasheng Tang, Fan Wang, Bohan Zhuang

机构 * DAMO Academy, Alibaba Group(阿里巴巴达摩院) Hupan Lab(湖畔实验室) Zhejiang University(浙江大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出K-Forcing范式,通过前推映射将自回归模型蒸馏为单次前向传播生成多个未来词,实现2.4-3.5倍加速,质量损失小。

Comments Code: https://github.com/alibaba-damo-academy/K-Forcing

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12342 2026-06-11 cs.CL cs.AI cs.ET cs.LG 新提交 83%

ALIGNBEAM : Inference-Time Alignment Transfer via Cross-Vocabulary Logit Mixing

ALIGNBEAM: 通过跨词汇表logit混合实现推理时对齐迁移

Chirag Chawla, Pratinav Seth, Vinay Kumar Sankarapu

机构 * Lexsi Labs

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对领域微调降低大模型安全性的问题,提出无需训练的ALIGNBEAM方法,通过逐token翻译锚模型logit并选择最安全候选,实现跨词汇表的安全对齐迁移,保持任务准确性和推理开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11680 2026-06-11 cs.AI cs.CL cs.LG 新提交 83%

Organize then Retrieve: Hierarchical Memory Navigation for Efficient Agents

先组织再检索:面向高效智能体的层次化记忆导航

Hao-Lun Hsu, Nikki Lijing Kuang, Boyi Liu, Zhewei Yao, Yuxiong He

机构 * Duke University(杜克大学) Snowflake AI Research(Snowflake AI研究)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出HORMA框架,通过构建文件系统式的层次化记忆结构并利用强化学习训练的轻量级导航代理,实现高效检索,在长时任务中提升性能并降低令牌消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11576 2026-06-11 cs.CV cs.AI 新提交 83%

AVIS: Adaptive Test-Time Scaling for Vision-Language Models

AVIS: 视觉语言模型的自适应测试时缩放

Ahmadreza Jeddi, Minh Ngoc Le, Amirhossein Kazerouni, Hakki Can Karaimer, Hue Nguyen, Iqbal Mohomed, Michael Brudno, Alex Levinshtein, Konstantinos G. Derpanis, Babak Taati, Radek Grzeszczuk

机构 * AI Center-Toronto, Samsung Electronics(三星电子多伦多AI中心) University of Toronto(多伦多大学) Vector Institute(向量研究所) York University(约克大学)

专题命中 效率与部署 :language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 提出AVIS,通过轻量策略联合优化视觉上下文缩放和推理缩放,利用无训练的关键多样性剪枝和自适应自一致性,在多种基准上提升精度-计算权衡。

Comments Project page: https://avis-vlm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11257 2026-06-11 cs.CL cs.LG cs.PF 新提交 82%

Energy-Efficient On-Device RAG on a Mobile NPU: System Design and Benchmark on Snapdragon X Elite

移动NPU上的能效型设备端RAG:Snapdragon X Elite系统设计与基准测试

Zhiyuan Cheng, Longying Lai

机构 * Qualcomm(高通) Snapdragon X Elite(骁龙X Elite) Dell XPS 13 laptop(戴尔XPS 13笔记本电脑) Qualcomm Hexagon NPU(高通Hexagon NPU) Adreno X1-85

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文首次在Snapdragon X Elite的Hexagon NPU上实现端到端RAG流水线,通过对比CPU和GPU,NPU在嵌入吞吐量、系统能耗和查询延迟上分别提升9.1倍、降低12.3倍和4.0倍,且答案质量相当。

Comments 9 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11270 2026-06-11 cs.LG cs.AI cs.CL 新提交 82%

Quantifying Subliminal Behavioral Transfer Ratios in Language Model Distillation

量化语言模型蒸馏中的潜意识行为迁移比率

Uwe König, Hamza Kazmi, Ruizhe Li, Maheep Chaudhary

机构 * University of Freiburg(弗赖堡大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过控制教师模型行为强度并蒸馏学生模型,量化了潜意识行为迁移比率,发现迁移具有鲁棒性且呈现不同缩放行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11440 2026-06-11 cs.AI 新提交 81%

INFRAMIND: Infrastructure-Aware Multi-Agent Orchestration

INFRAMIND: 基础设施感知的多智能体编排

Ahasan Kabir, Jiaqi Xue, Mengxin Zheng, Qian Lou

机构 * University of Central Florida(中佛罗里达大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出INFRAMIND框架,通过强化学习将基础设施状态(队列深度、KV缓存压力等)融入多智能体LLM编排的规划、路由和调度决策,在共享GPU集群上实现质量与延迟的平衡,相比基线提升最高7.6%准确率并降低7倍延迟。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02229 2026-06-11 cs.LG eess.SP 版本更新 81%

Prediction-Powered Risk Monitoring of Deployed Models for Detecting Harmful Distribution Shifts

预测驱动的已部署模型风险监控:检测有害分布漂移

Guangyi Zhang, Yunlong Cai, Guanding Yu, Osvaldo Simeone

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出预测驱动风险监控(PPRM),一种基于预测驱动推断的半监督方法,通过结合合成标签与少量真实标签构建运行风险的随时有效下界,实现对有害漂移的检测,并在图像分类、大语言模型和电信监控任务中验证有效性。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11553 2026-06-11 cs.LG 新提交 80%

APEX: A Network-Native Time-Series Foundation Model for Forecasting and Anomaly Detection for Wireless Edge Operations

APEX:面向无线边缘运维的预测与异常检测的网络原生时间序列基础模型

Swadhin Pradhan, Niloo Bahadori, Peiman Amini

机构 * Cisco Systems, USA(思科系统公司)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 提出网络原生解码器Transformer APEX,针对企业AP遥测数据预训练,在DHCP退化基准上MAE比最强基线降低18%,异常检测F1=0.93,边缘版本实现亚秒级隐私保护推理。

Comments 5 pages, 1 figure, 4 tables. Discusses a network-native time-series foundation model for wireless edge operations

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11290 2026-06-11 cs.LG cs.AI cs.CL 新提交 80%

FlowBank: Query-Adaptive Agentic Workflows Optimization through Precompute-and-Reuse

FlowBank: 通过预计算与复用实现查询自适应智能体工作流优化

Lingzhi Yuan, Chenghao Deng, Fangxu Yu, Souradip Chakraborty, Mohammad Rostami, Furong Huang

机构 * University of Maryland, College Park(马里兰大学哥伦比亚公园分校) Amazon(亚马逊)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出FlowBank框架,通过预计算多样化工作流并压缩为紧凑组合,在推理时自适应选择最优工作流,平衡性能与成本,在五个基准上平均得分最高且成本可控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12412 2026-06-11 cs.CV cs.AI 新提交 79%

Reroute, Don't Remove: Recoverable Visual Token Routing for Vision-Language Models

重新路由,而非移除:面向视觉语言模型的可恢复视觉令牌路由

Cheng-Yu Yang, Shao-Yuan Lo, Yu-Lun Liu

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) National Taiwan University(国立台湾大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 针对视觉语言模型中视觉令牌重要性随解码器深度变化的问题,提出无需训练的可恢复路由方法Reroute,将不可逆移除改为可恢复路由,在激进令牌缩减下提升定位能力并保持通用VQA性能。

Comments Code: https://github.com/elmma/mllm-reroute/

详情

展开后加载摘要…

URL PDF HTML 收藏