Rethinking Network Topologies for Cost-Effective Mixture-of-Experts LLM Serving
重新思考面向低成本专家混合模型LLM服务的网络拓扑
机构 * UC Berkeley(加州大学伯克利分校)
专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI
AI总结 本文研究了专家混合模型LLM服务的网络拓扑,通过系统分析发现低成本无交换机拓扑在多种场景下更有效,且未来GPU升级将进一步巩固其优势。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
重新思考面向低成本专家混合模型LLM服务的网络拓扑
机构 * UC Berkeley(加州大学伯克利分校)
专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI
AI总结 本文研究了专家混合模型LLM服务的网络拓扑,通过系统分析发现低成本无交换机拓扑在多种场景下更有效,且未来GPU升级将进一步巩固其优势。
LLM-Emu: 通过基于性能的采样实现LLM推理的原生运行时仿真
专题命中 效率与部署 :LLM(title,title_cn)
AI总结 LLM-Emu通过基于性能的采样实现LLM推理的原生运行时仿真,能够准确模拟vLLM服务行为,支持在线实验。
Comments 6 page, 2 figures, workshop paper shape
BWLA: 突破 W1AX 事后训练量化在 LLMs 中的障碍
机构 * Houmo AI
专题命中 效率与部署 :post-training(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 本文提出 BWLA 框架,通过 1 位权重量化和 6 位低精度激活实现 LLMs 的高效压缩与加速,显著提升性能并降低计算成本。
Comments Accepted by ACL-Main 2026
硅的对决:消费级大语言模型推理中的性能、效率与生态系统障碍
机构 * Bahcesehir University(巴切希尔大学)
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文比较了Nvidia和Apple Silicon生态系统在部署大规模大语言模型时的性能、效率和生态系统挑战,揭示了不同架构在内存容量和计算密度上的差异及影响。
SiriusHelper:一种基于LLM代理的大数据平台操作助手
机构 * TEG, Tencent Inc.(腾讯科技(TEG)) ; School of Computer Science, Peking University(北京大学计算机学院)
专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI
AI总结 SiriusHelper通过统一在线助手自动识别用户意图并路由查询,结合深度搜索机制和优先级知识库,提升回答可靠性与响应速度,减少专家负担,实测降低20.8%的在线工单量。
TokenWeave:分布式大语言模型推理中的高效计算-通信重叠
机构 * Microsoft(微软)
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 TokenWeave通过优化RMSNorm与通信的融合核,实现高效计算-通信重叠,提升低token长度下的推理性能,实验显示延迟降低1.28倍,吞吐量提升1.19倍。
Comments Accepted at MLSys 2026. In Versions 1 and 2, Figure 6 erroneously reports Multimem-AllReduce bandwidth rather than Multimem Reduce-Scatter bandwidth. In Version 4, we corrected the x-axis tick labels in Figure 7
放任的伤害:生成语言模型中的算法偏见
机构 * Young Data Scientists League(年轻数据科学家联盟) ; Stanford University(斯坦福大学) ; Georgia Institute of Technology(佐治亚理工学院) ; Schar School of Policy and Government & Department of Computer Science(政策与政府学院及计算机科学系) ; George Mason University(乔治·马歇尔大学)
专题命中 效率与部署 :language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究通过开放性提示分析生成语言模型的偏见,发现五种主流模型对少数族裔、性别和性取向群体存在排除、从属和刻板印象的伤害,强调需保护消费者免受语言模型歧视性影响。
Comments 16 pages (43 if including supplementals), 8 figures (23 if including supplementals)
Journal ref Nat Commun 17, 1243 (2026)
技术报告:用于低比特大语言模型量化的小激活残差Hessian量化(ARHQ)
机构 * Graduate School of Information Sciences(信息科学研究生院)
专题命中 效率与部署 :LLM(title);post-training(abstract);分类 cs.CL、cs.LG
AI总结 ARHQ通过构建输入侧残差Hessian来隔离误差敏感的权重方向,提升低比特激活权重量化的层间SNR并保持下游推理性能。
重复与多样性:高信号数据过滤以提升德国语言模型的样本效率
机构 * Humboldt-Universität zu Berlin(洪堡大学柏林分校)
专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI
AI总结 本文研究了在德国语言模型训练中,通过高信号数据过滤在多样性和质量之间进行权衡,发现重复高质量数据比单次训练更大更少过滤的数据表现更优。
DEPTEX: 以组织为中心,开源依赖风险监控
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 DEPTEX通过图谱技术与大语言模型结合,解决开源依赖风险评估中的语义缺失问题,实现动态合规管理和主动风险控制。
语言模型能够识别应用于其激活上的dropout和高斯噪声
机构 * LawZero
专题命中 效率与部署 :language model(title,abstract);分类 cs.AI
AI总结 研究发现语言模型能检测并区分激活上的dropout和高斯噪声,通过多选问题测试不同模型的识别能力,结果表明模型能准确识别扰动类型。
Tempus:一种时间可扩展的资源不变GEMM流式框架用于Versal AI边缘
机构 * Versal AI Edge Report(Versal AI Edge报告)
专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文提出Tempus框架,通过时间迭代和算法数据分片实现GEMM加速,提升边缘AI推理效率,相比现有方法在资源利用和能耗方面表现更优。
Comments 11 pages, 3 figures, 8 tables, 4 algorithms
适配大型视觉语言模型以生成低光照增强
机构 * Dalian University of Technology(大连理工大学) ; National University of Singapore(新加坡国立大学) ; Hong Kong Polytechnic University(香港理工大学) ; University of California, San Francisco(加州大学旧金山分校) ; Nanjing University of Science and Technology(南京理工大学)
专题命中 效率与部署 :LLM(abstract,abstract_cn);language model(abstract)
AI总结 本文提出VLM-IMI框架,通过迭代和手动指令适配大型视觉语言模型,用于生成低光照增强。该框架包含正常光照指令先验生成和指令感知光照增强扩散两个分支,通过融合模块整合跨模态先验,提升生成效果。
Comments 11 papers,8 figures, CVPR2026 Findings
Peek2:无需正则表达式的字节级字节对编码预分词器用于边缘设备上的大语言模型推理
机构 * University of Glasgow(格拉斯哥大学)
专题命中 效率与部署 :LLM(title);分类 cs.CL
AI总结 Peek2是一种线性时间复杂度且内存消耗低的预分词算法,适用于边缘设备,提升了字节级BPE编码的吞吐量,且结果与基于正则表达式的分词器相同。
Comments 7 pages, 5 figures, accepted to ACL SRW 2026, for associated code, see https://github.com/omegacoleman/tokenizers_peek2 v2: updated to match accepted version in ACL SRW 2026
PPLLaVA:通过提示引导的视频序列理解
机构 * Peng Cheng Laboratory(鹏城实验室) ; Peking University(北京大学) ; XPeng Inc.(小鹏汽车有限公司) ; Ministry of Industry and Information Technology of the People’s Republic of China, China Electronics Standardization Institute, Beijing, China(中华人民共和国工业和信息化部,中国电子标准化研究院,北京,中国)
专题命中 效率与部署 :large language model(abstract);language model(abstract)
AI总结 PPLLaVA通过提示引导的池化策略实现视频序列高效理解,减少18倍token,提升推理效率并在多种视频理解任务中取得最佳性能。
Comments Accepted to ICLR' 26
学习行动与协作以实现分布式黑盒共识优化
专题命中 效率与部署 :large language model(abstract);language model(abstract)
AI总结 本文提出LACMAS框架,通过大语言模型提供稀疏高层指导,改进分布式黑盒共识优化中的局部适应、全局协调与通信效率。
Comments 20 pages, 5 figures
当更多改写损害:通过排序器反馈避免漂移
专题命中 效率与部署 :large language model(abstract);language model(abstract)
AI总结 本文提出ReformIR框架,通过预算感知的检索方法,在有限计算下优化改写查询的召回率并抑制漂移,实验表明其在MSMARCO和TREC DL基准上优于现有方法。
Comments Accepted to SIGIR 26 full paper track 11 pages
UniBCI: 向侵入式脑机接口的统一预训练模型迈进
专题命中 效率与部署 :foundation model(abstract);pretraining(abstract)
AI总结 本文提出UniBCI模型,通过整合上下文条件空间时间分块、层次化区间面积注意力机制和可扩展自监督掩码信号重建目标,实现对侵入式神经信号的高效表征学习,提升模型泛化能力与效率。
自适应双教师蒸馏与子网络校正用于桥接黑盒领域适应中的语义间隙
机构 * School of Computer Science and Engineering, Tianjin University of Technology(天津理工大学计算机科学与工程学院) ; School of Artificial Intelligence, Tianjin University(天津大学人工智能学院)
专题命中 效率与部署 :language model(abstract);分类 cs.LG
AI总结 本文提出DDSR框架,通过自适应预测融合策略和子网络正则化机制,解决黑盒领域适应中任务特定知识与语言对齐语义先验的不一致问题,提升领域适应性能。
Comments Under Review
ScreenParse:超越稀疏标注的完整屏幕解析监督
机构 * IBM Research Zurich, Zurich, Switzerland(IBM苏黎世研究实验室,瑞士苏黎世) ; ETH Zurich, Computer Vision(苏黎世联邦理工学院,计算机视觉) ; ETH AI Center, Switzerland(苏黎世联邦理工学院人工智能中心,瑞士) ; ETH Zurich, Photogrammetry(苏黎世联邦理工学院,摄影测量学) ; Microsoft, Switzerland(微软公司,瑞士)
专题命中 效率与部署 :language model(abstract)
AI总结 ScreenParse通过大规模完整屏幕解析标注,训练出性能优异的ScreenVLM模型,显著提升了密集解析能力和迁移表现。
Comments Accepted at ICML 2026. 28 pages, 15 figures
全速:从倾斜2D投影直接实时进行开放集3D大分子检测
机构 * Duke University(杜克大学)
专题命中 效率与部署 :prompting(abstract)
AI总结 本文提出FullTilt框架,通过直接处理对齐的2D倾斜系列图像,实现了开放集3D大分子检测,大幅提升了推理速度和效率,降低了内存需求。
量化对输入退化鲁棒性的研究:目标检测
机构 * Bahcesehir University(巴赫塞希尔大学)
专题命中 效率与部署 :post-training(abstract)
AI总结 本文研究了量化对目标检测模型在真实输入退化下的鲁棒性影响,通过评估YOLO模型在不同精度下的表现,发现静态INT8量化在清洁数据上速度提升显著,但退化感知校准在多数情况下未提升鲁棒性,但大模型在特定噪声下有例外。
基于Copula的视觉Transformer用于通过OU UWF视网膜图像诊断高度近视
机构 * Department of Applied Biology ; Chemical Technology, The Hong Kong Polytechnic University ; Department of Data Science \& AI, The Hong Kong Polytechnic University e2 ; School of Data Science, Fudan University e1 ; Department of Applied Mathematics, The Hong Kong Polytechnic University ; Department of Biostatistics, City University of Hong Kong ; Eye Institute ; Department of Ophthalmology, Eye \& ENT Hospital, Fudan University ; Eunice Kennedy Shriver National Institute of Child Health ; College of Business ; Economics, Australian National University
专题命中 效率与部署 :foundation model(abstract)
AI总结 本文提出Copula增强的视觉Transformer模型,用于通过OU UWF视网膜图像诊断高度近视,解决双目图像异质性和多任务学习中的条件依赖结构建模问题。
你有什么不明白吗?利用大型语言模型识别和表征学生在困难主题上的误解
机构 * Harvard Medical School and Division of Pulmonary, Critical Care and Sleep Medicine, Beth Israel Deaconess Medical Center(哈佛医学院和肺科、重症医学及睡眠医学部门,贝斯以色列德aconess医疗中心)
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL
AI总结 本文通过量化分析与大型语言模型结合的方法,识别在线学习环境中学生在关键主题上的误解,揭示了通过考试题目内容、学生回答模式和课堂讲义相结合的数据分析,发现学生误解的可操作见解。
Comments 60 pages. Education and Information Technologies (2026)
编码代理能否在计算材料科学中复现研究成果?
机构 * Johns Hopkins University(约翰霍普金斯大学)
专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);foundation model(abstract)
AI总结 研究探讨编码代理在计算材料科学领域复现研究结果的能力,提出AutoMat基准测试,发现当前LLM代理在复现复杂科学流程时表现有限,存在流程不完整、方法偏差等问题。
比较语言模型和人类的探索-利用策略:来自标准多臂老虎机实验的见解
机构 * Department of Mechanical & Industrial Engineering, University of Toronto(机械与工业工程系,多伦多大学) ; The Rotman School of Management, University of Toronto(罗特曼管理学院,多伦多大学) ; Department of Psychiatry, University of Toronto(精神病学系,多伦多大学)
专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 本文通过多臂老虎机实验比较语言模型、人类和算法的探索-利用策略,发现启用思考使语言模型行为更接近人类,但在复杂环境中表现受限。
轻量级领域适应大型语言模型用于印度法律援助
机构 * Department of Computer Science and Engineering, Sharda University, Greater Noida, India(计算机科学与工程系,Sharda大学,Greater Noida,印度)
专题命中 领域大模型 :large language model(title);language model(title);分类 cs.CL、cs.AI
AI总结 本文提出Legal Assist AI框架,通过检索增强生成与策略性提示工程,在印度法律领域实现高效表现,利用高质量法律文档集提升性能,比GPT-3.5 Turbo更高效,且有效缓解幻觉问题。
Comments 8 pages, 2 tables, 5 figures. This is a revised version of a preprint previously available at this DOI: \url{https://doi.org/10.48550/arXiv.2505.22003}
学术医疗中心中大语言模型的采用与使用
机构 * Stanford Medicine, Technology and Digital Solutions(斯坦福医学院技术与数字解决方案)
专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出ChatEHR系统,通过整合患者多年医疗记录,实现LLM在临床文档中的自动化与交互应用,提升医疗效率与数据准确性。
ViLegalNLI:越南法律文本的自然语言推理
机构 * University of Information Technology(信息技术大学) ; Vietnam National University(越南国家大学)
专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出ViLegalNLI,首个针对法律领域构建的越南语自然语言推理数据集,包含42,012个前提-假设对,涵盖多种法律领域,用于评估法律推理的结构逻辑与术语一致性。
Comments 33 pages, 17 figures
面向预算的路由:长临床文本
机构 * MIT, Cambridge, MA(麻省理工学院,马萨诸塞州剑桥) ; Cornell University, Ithaca, NY(康奈尔大学,纽约州伊萨克中心) ; Weill Cornell Medicine, New York, NY(韦尔医学院,纽约市)
专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文研究了在预算限制下选择临床文本上下文的方法,提出RCD目标平衡相关性、覆盖性和多样性,并通过实验展示不同单位化策略和路由启发式方法的效果差异。