arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-13 至 2026-07-13 共收录 44 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 44 篇

2604.17267 2026-07-13 cs.AI stat.AP 版本更新 92%

Rectification Difficulty and Optimal Sample Allocation in LLM-Augmented Surveys

LLM增强调查中的校正难度与最优样本分配

Zikun Ye, Hema Yoganarasimhan

机构 * Michael G. Foster School of Business, University of Washington(华盛顿大学Michael G. Foster商学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究在LLM预测可用时如何分配人类样本以提高估计效率,提出校正难度分析、最优分配规则及元学习方法,通过实验证明其在不同领域和LLM上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08776 2026-07-13 cs.LG cs.AI cs.CL cs.GT 新提交 91%

A Unified Approach to Interpreting Knowledge Distillation for Large Language Models via Interactions

一种通过交互解释大语言模型知识蒸馏的统一方法

Qingzhuo Wang, Ruiyang Qin, Zhenxin Qin, Wen Shen, Zhihua Wei

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究大语言模型知识蒸馏有效性背后机制,提出统一方法,通过交互分解输出分数,发现共同机制是交互稀疏化,不同方法性能差异源于处理复杂交互能力,进而提出CIP损失函数,实验证明其能提升多种KD方法性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08774 2026-07-13 cs.AI cs.HC 新提交 90%

CogniConsole: Externalizing Inference-Time Control as a Formal Abstraction for Reliable LLM Interactions

CogniConsole:将推理时控制作为可靠大语言模型交互的形式化抽象进行外化

Vanessa Figueiredo, Wilter Franceschi

机构 * University of Regina(里贾纳大学) Orbital Sea(轨道海)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究挑战大语言模型可靠性仅取决于模型能力的观点,引入CogniConsole将推理时控制外化为结构化接口,通过489个探针实验表明增加结构支架可降低输出方差和故障率,为LLM系统设计评估开辟新方向。

Comments Revised version focusing on the CogniConsole system architecture and empirical evaluation of inference-time control probes (N=489)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08786 2026-07-13 cs.LG cs.AI cs.AR 新提交 90%

Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices

使用适度非结构化稀疏权重矩阵加速大语言模型的GPU推理

Tao Lu, Haoyu Wang, Zonghui Wang, Keshen Xiang, Jiaheng Zhang, Wenzhi Chen

机构 * National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型推理成本挑战,提出含稀疏张量核层等的三层矩阵存储格式,设计联合稀疏张量核与CUDA核的SpMM内核,实现了在现代GPU上超越密集矩阵乘法,取得显著加速。

Comments DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23969 2026-07-13 cs.DC cs.CR cs.PF 新提交 89%

The Serialized Bridge: Understanding and Recovering LLM Serving Performance under Blackwell GPU Confidential Computing

序列化桥接:理解与恢复Blackwell GPU机密计算下的LLM服务性能

Hang Yin, Kevin Wang

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 本文发现Intel TDX加GPU-CC下LLM服务吞吐量下降13-27%的主因是机密VM-GPU桥接的序列化开销,而非GPU计算本身,并通过调度优化恢复高达92%的性能损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09104 2026-07-13 cs.CV cs.AI 新提交 89%

Integrating Large Language Models and Graph Convolutional Networks for Semi-Supervised Image Classification

将大语言模型与图卷积网络集成用于半监督图像分类

Camila Piscioneri Magalhães, Lucas Pascotti Valem

机构 * Institute of Mathematics and Computer Science (ICMC)(数学与计算机科学研究所) University of São Paulo (USP)(圣保罗大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 针对图像分类中图构建难题,该研究将大语言模型与图卷积网络集成,利用视觉语言模型生成文本描述,经大语言模型处理得到语义相似性分数,指导kNN图边修剪,提升了半监督图像分类准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04013 2026-07-13 cs.CL 版本更新 89%

AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving

AugServe:用于增强型大语言模型推理服务的自适应请求调度

Ying Wang, Zhen Jin, Jiexiong Xu, Wenhai Lin, Yiquan Chen, Wenzhi Chen

机构 * College of Computer Science and Technology, Zhejiang University, Hangzhou, China(浙江大学计算机科学与技术学院) Alibaba Group, Hangzhou, China(阿里巴巴集团)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 研究针对增强型大语言模型推理服务效率问题及现有系统挑战,提出AugServe框架,采用两阶段自适应请求调度策略并动态调整令牌批处理机制,有效提升了有效吞吐量并减少首次令牌时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08991 2026-07-13 cs.LG cs.CL 新提交 88%

Sensitivity-Aware Thresholding and Token Routing for Activation Sparsification in Large Language Models

大语言模型中用于激活稀疏化的灵敏度感知阈值处理和令牌路由

Bishmoy Paul, Youngmin Yi, Hoeseok Yang

机构 * Santa Clara University(圣塔克拉拉大学) Sogang University(西江大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究大语言模型中如何在保留模型质量时减少计算,提出灵敏度感知阈值处理方法SATS及轻量级令牌路由框架,经实验评估,SATS在匹配稀疏度时优于基线,令牌路由有更好的质量-吞吐量权衡,改进方法可提升大语言模型权衡效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21082 2026-07-13 cs.CL cs.LG stat.ML 版本更新 88%

Accelerating Large Language Model Inference with Self-Supervised Early Exits

通过自监督早期退出加速大语言模型推理

Florian Valade

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究通过在中间层添加自监督早期退出头加速大语言模型推理,评估多种置信度指标,实验表明可降成本保精度,还应用于推测性解码提出DSSD,高令牌接受率且少超参数调整。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12446 2026-07-13 cs.CL cs.AI cs.LG 版本更新 88%

Multi-Attribute Steering of Language Models via Targeted Intervention

通过目标干预对语言模型进行多属性引导

Duy Nguyen, Archiki Prasad, Elias Stengel-Eskin, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究如何对语言模型进行多属性引导,提出MAT-Steer框架,通过对齐目标学习引导向量,减少属性间冲突,在问答和生成任务中评估,该框架优于现有方法。

Comments ACL 2025 camera-ready, code link: https://github.com/duykhuongnguyen/MAT-Steer

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07459 2026-07-13 cs.CL 版本更新 88%

Beyond LLMs: A Linguistic Approach to Causal Graph Generation from Narrative Texts

超越大语言模型:一种从叙事文本生成因果图的语言学方法

Zehan Li, Ruhua Pan, Xinyu Pi

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 该研究提出从叙事文本生成因果图的框架,先以LLM提取顶点,引入含七个语言特征的“专家索引”并集成到分类模型,结合RoBERTa嵌入提升因果关系识别精度,经五次迭代提示构建因果图,实验证明其优于GPT-4o和Claude 3.5,还提供开源工具。

Comments published at the 7th Workshop on Narrative Understanding, NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09008 2026-07-13 cs.CV 新提交 88%

C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes

C-GAP:类感知与在线提示改进不均衡类上的视觉语言模型

Francis Fernandez, Arash Jahangiri, Salimeh Sekeh

机构 * San Diego State University(圣地亚哥州立大学)

专题命中 效率与部署 :prompting(title,abstract);language model(title);LLM(abstract)

AI总结 研究针对安全关键感知系统检测小标签空间中罕见物体类别的问题,提出C-GAP框架,通过建立复合字幕基线并利用语言模型迭代细化提示,无需更新检测器权重,有效提升少数类检测精度,实验证明其成效显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18665 2026-07-13 cs.IR cs.AI cs.CL cs.CR cs.LG 87%

Membership Inference Attacks on In-Context Examples in LLM-based Recommender Systems

基于LLM的推荐系统中上下文示例的成员推断攻击

Jiajie He, Min-Chun Chen, Xintong Chen, Xinyang Fang, Yuechun Gu, Keke Chen

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校) University of Cincinnati(辛辛那提大学) University of Southern California(南加州大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出两种针对LLM推荐系统中上下文示例的成员推断攻击,揭示了敏感信息暴露的风险及现有防御方法的不足。

Comments This is paper is accepted by ACM RecSys 2026 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09015 2026-07-13 cs.LG cs.AI 新提交 86%

Correlation-Aware Contextual Bandits with Surrogate Rewards for LLM Routing

用于大语言模型路由的具有替代奖励的相关感知上下文博弈

Ajay Narayanan Sridhar, Ronak Singh, Mehrdad Mahdavi, Vijaykrishnan Narayanan

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究用于大语言模型路由的相关感知上下文博弈问题,提出耦合奖励混合与解耦预测混合两种利用替代奖励的算法,经理论分析和实验评估,相比基线方法提高了样本效率和精度 - 成本权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08993 2026-07-13 cs.AR 新提交 86%

StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration

StreamDQ:用于可扩展人工智能推理加速的定制HBM中的近内存权重反量化

Minki Jeong, Daegun Yoon, Soohong Ahn, Seungyong Lee, Nameun Kang, Hyeonseok Ju, Ieryung Park, Joonseop Sim, Youngpyo Joo, Hoshik Kim

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对大语言模型内存和计算需求增长,提出StreamDQ架构,将反量化块集成到HBM基础芯片,通过内存端反量化减少GPU开销,实现高吞吐量推理,在混合精度GEMM和端到端LLM推理中均有显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09403 2026-07-13 cs.AI 新提交 85%

Fictional Worldbuilding: Multi-Agent LLM Collaboration with Hierarchical Context Compression and Iterative Review

虚构世界构建:基于分层上下文压缩和迭代审查的多智能体大语言模型协作

Jingbo Chen, He Wang, Wei Yuan, Yuqiao Lai, Zhenyan Lu

机构 * National University of Defense Technology(国防科技大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对大语言模型应用于世界构建面临的挑战,提出AutoWorldBuilder多智能体协作系统,通过五个组件应对,经实验验证,该系统在世界构建任务中有高成功率,能高效生成自洽概念,其架构模式可推广到其他知识密集型多智能体大语言模型应用。

Comments 36 pages, 7 fig

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09330 2026-07-13 cs.AI cs.MA 新提交 85%

Communication-Efficient Digital-Twin Coordination for Heterogeneous LLM Embodied Agents over Computing Power Networks

基于计算能力网络的异构大语言模型实体代理的通信高效数字孪生协调

Nuocheng Yang, Sihua Wang, Zihan Chen, Tony Q. S. Quek, Changchuan Yin

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对异构大语言模型实体代理协作面临的通信开销大、协调质量受LLMs能力限制和行动延迟等挑战,提出基于轻量级数字孪生的LDT-Coord框架,通过特定方法减少通信开销,实现与传统方法相当的任务成功率且保持鲁棒性。

Comments 14 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08791 2026-07-13 cs.NE cs.AI 新提交 85%

LLM-Driven Evolutionary Generation of Multi-Objective Bayesian Optimization Algorithms

基于大语言模型驱动的多目标贝叶斯优化算法的进化生成

Georgios Laskaris, Reuben Brasher, Niki van Stein, Elena Raponi, Thomas Bäck, Florian Neukart

机构 * LIACS, Leiden University, Leiden, Netherlands(LIACS,莱顿大学,莱顿,荷兰)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究如何设计多目标贝叶斯优化算法,核心方法是将LLaMEA框架扩展到MOBO,利用大语言模型生成算法并集成超参数优化。主要贡献是生成的算法在合成和实际工程问题上表现优异,能以低成本实现帕累托有效权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.07518 2026-07-13 cs.CR 版本更新 85%

Efficient and Universal Watermarking for LLM-Generated Code Detection

用于大语言模型生成代码检测的高效通用水印技术

Boquan Li, Zirui Fu, Mengdi Zhang, Peixin Zhang, Jun Sun, Xingmei Wang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对大语言模型生成代码检测问题,提出即插即用的ACW水印方法,无需训练,通过精心设计的代码转换作隐式水印,有效高效检测代码,保留其实用性且具通用性,解决了现有方法的局限。

Comments This work has been accepted by IEEE Transactions on Software Engineering for publication, and the copyright follows IEEE policies

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09084 2026-07-13 cs.NE cs.CL cs.ET cs.LG 84%

Language Modeling on a SpiNNaker 2 Neuromorphic Chip

在SpiNNaker 2神经形态芯片上的语言建模

Khaleelulla Khan Nazeer, Mark Schöne, Rishav Mukherji, Bernhard Vogginger, Christian Mayr, David Kappel, Anand Subramoney

机构 * Birla Institute of Technology(比拉理工学院) Centre for Tactile Internet (CeTI) with Human-in-the-Loop, Technische Universität Dresden, Germany(触觉互联网中心(CeTI)与人环路,德累斯顿技术大学,德国) Dept. of Computer Science, Royal Holloway, University of London, Egham, United Kingdom(计算机科学系,伦敦皇家霍洛威大学,埃格姆,英国)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

AI总结 本文首次在SpiNNaker 2神经形态芯片上实现基于EGRU架构的语言模型,展示了其在语言建模和手势识别任务中与LSTM相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09092 2026-07-13 cs.CL 新提交 83%

AgentKGV: Agentic LLM-RAG Framework with Two-Stage Training for the Fact Verification of Knowledge Graphs

AgentKGV:用于知识图谱事实验证的两阶段训练的智能语言模型-检索增强生成框架

Yumin Heo, Hyeon-gu Lee, Sumin Seo, Youngjoong Ko

机构 * SungKyunKwan University(成均馆大学) NAVER(纳维)

专题命中 效率与部署 :LLM(title,abstract);SFT(abstract);分类 cs.CL

AI总结 针对知识图谱事实错误验证难题,提出AgentKGV框架,集成动态路由等处理表面形式不匹配。引入两阶段训练策略,在开放域T-REx基准上,该框架提升了宏观F1,减少搜索调用次数,提高了验证准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08930 2026-07-13 cs.LG 新提交 83%

BlockServe: Block-Grained Continuous Batching for High-Throughput Diffusion LLM Serving

BlockServe:用于高吞吐量扩散语言模型服务的块粒度连续批处理

Yuanjie Zhu, Liangwei Yang, Ke Xu, Weizhi Zhang, Shanghao Li, Zihe Song, Philip S. Yu

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究针对扩散大语言模型服务的收敛异质性问题,提出BlockServe框架,集成块粒度调度、混合状态执行及计算感知准入控制器,在五个基准测试中实现高吞吐量,确立块粒度调度为高吞吐量离线dLLM推理基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08960 2026-07-13 cs.LG cs.AI 新提交 81%

Eluna: An Agentic LLM System for Automating Warehouse Operations with Reasoning and Task Execution

Eluna:一个用于通过推理和任务执行实现仓库运营自动化的智能语言模型系统

Ning Liu, Kalle Kujanpää, Zhaoxuan Zhu, P Aditya Sreekar, Kaiwen Liu, Chuanneng Sun, Jorge Marchena Menendez, Matthew Bales, Tianyu Yang, Shahnawaz Alam, Rose Yu, Baoyuan Liu, Kristina Klinkner, Shervin Malmasi

机构 * Amazon.com, Inc. Fulfillment Technologies and Robotics(亚马逊公司履约技术与机器人部门)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对仓库运营中SOP执行问题,提出Eluna智能体系统,它是图形引导多智能体框架,采用非对称情节蒸馏方法,在基准测试和生产应用中,微调模型表现出色,匹配或超教师模型,击败基线,在票务处理应用达94%专家一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09603 2026-07-13 cs.MA 新提交 80%

Mosaic: Runtime-Efficient Multi-Agent Embodied Planning

Mosaic:运行时高效的多智能体实体规划

Kunjal Panchal, Saayan Mitra, Sunav Choudhary, Victor Bursztyn, Somdeb Sarkhel, Hui Guan

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 研究基于LLM的多智能体实体规划执行延迟高问题,提出Mosaic框架,通过智能体中心语义内存和整数线性规划应对挑战,在多基准测试中执行更快、调用更少、步数更少且成功率更高,证明相关因素对多智能体规划的重要性。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08938 2026-07-13 cs.SE 新提交 80%

Better Harnesses, Smaller Models: Building 90% Cheaper Agents via Automated Harness Adaptation

更好的框架,更小的模型:通过自动框架适配构建成本降低90%的智能体

Chenyang Yang, Xinran Zhao, Tongshuang Wu, Christian Kästner

专题命中 效率与部署 :LLM(abstract);language model(abstract);small language model(abstract);SLM(abstract)

AI总结 研究针对前沿语言模型智能体推理成本高的问题,提出通过自动框架适配让小语言模型智能体以低90%成本匹配语言模型性能,创建相关框架和优化器,经实验验证该方法能扩大小语言模型智能体在日常业务任务中的部署范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09176 2026-07-13 cs.CR 新提交 78%

SherAgent: Scaling Attack Investigation in the Wild via LLM-Empowered Iterative Query-Filter Backtracking

SherAgent:通过大语言模型赋能的迭代查询-过滤回溯在野外扩展攻击调查

Zhenyuan Li, Zhengkai Wang, Ling Jiang, Xiangmin Shen, Ruixiao Lin, Sen Nie, Shi Wu, Shouling Ji

专题命中 效率与部署 :LLM(title,abstract)

AI总结 研究针对野外攻击调查中依赖爆炸和因果链碎片化问题。提出SherAgent系统,基于大语言模型,采用迭代“查询-过滤”回溯范式处理非结构化数据,克服相关问题。相比传统方法,提高调查成功率,且运行高效,减轻专家分析负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09029 2026-07-13 cs.CV 新提交 78%

MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models

MOSAIC:用于高效异构视觉语言模型的自适应层间组合

Yuncheng Yang, Feiyang Ye, Shixian Luo, Yinna Zhu, Lianlei Shan, Wangcai Zhao, Kuo Zhang, Yan Chen, Yong Wu, Yan Xie

机构 * LiAuto Inc.(理想汽车公司)

专题命中 效率与部署 :language model(title,abstract)

AI总结 研究针对视觉语言模型中异构结构依赖手工静态混合模式的问题,提出硬件感知搜索方法MOSAIC,通过多目标混合整数规划确定最优配置,并引入两阶段参数恢复过程,提升了模型推理效率且降低训练成本。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08973 2026-07-13 cs.DC 新提交 78%

SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference

SiFAR:用于低延迟大语言模型推理的无同步全规约算法

Hritvik Taneja, Anish Saxena, Abhishek Revinipati, Jae Hyung Ju, Neal C. Crago, Moinuddin Qureshi

专题命中 效率与部署 :LLM(title,abstract)

AI总结 研究针对大语言模型推理中令牌生成延迟瓶颈,提出无同步全规约算法SiFAR。通过消除一次性算法写后写依赖、利用交换机片上规约等方法,减少全规约延迟,提升端到端吞吐量,在特定条件下取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02763 2026-07-13 cs.CV 版本更新 78%

Looking Locally: Object-Centric Vision Transformers as Foundation Models for Efficient Segmentation

局部观察:以对象为中心的视觉Transformer作为高效分割的基础模型

Manuel Traub, Martin V. Butz

机构 * Neuro-Cognitive Modeling Group, University of Tübingen, Germany(图宾根大学神经认知建模组)

专题命中 效率与部署 :foundation model(title,abstract)

AI总结 研究针对当前分割模型浪费计算资源问题,提出FLIP模型,通过生物启发的注意力从输入中采样多分辨率补丁实现对象分割。该模型参数高效,在多个基准测试中表现优于SAM等模型,能准确分割小对象,为实时视觉提供可能,可作强大基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08780 2026-07-13 cs.LG cs.AI cs.CL 新提交 75%

Sticky Routing: Training MoE Models for Memory-Efficient Inference

粘性路由:为内存高效推理训练专家混合模型

Ali Kayyam

机构 * BrainChip Inc.(脑芯片公司)

专题命中 效率与部署 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究MoE模型推理时内存效率问题,提出StickyMoE方法,通过惩罚相邻token间专家切换,使专家表示和路由决策共同适应。实验表明该方法能大幅降低专家切换率,在质量-局部性方面优于事后微调。

详情

展开后加载摘要…

URL PDF HTML 收藏