arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-24 至 2026-07-24 共收录 58 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 58 篇

2607.20483 2026-07-24 cs.AI 新提交 90%

Tractable Hierarchical Control of Autoregressive Language Models

自回归语言模型的可处理分层控制

Max Scribner, Antonio Vergari, Vaishak Belle

机构 * University of Edinburgh(爱丁堡大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 研究如何约束自回归大语言模型生成,核心方法是将其提炼为可处理概率模型,利用有限时长$LR(k)$文法可多项式时间计算满足情况的特性,实现对LLM生成的有效约束与引导,确保输出满足形式句法约束。

Comments 21 pages, 4 figures, 2 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20806 2026-07-24 cs.AI 新提交 89%

Profiling Lightweight Large Language Models

轻量级大语言模型剖析

Tomohiro Harada, Enrique Alba, Gabriel Luque

机构 * Graduate School of Science and Engineering, Saitama University(埼玉大学理工学研究科) ITIS, University of Malaga(马拉加大学信息技术与系统研究所)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 研究轻量级大语言模型在资源受限环境中的情况,提出基于PTME的实验框架,通过硬件级测量联合测量精度、时间、内存和能耗,对一组模型进行测试,发现代理描述符不足,揭示非主导配置,为不同资源下选模型提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15706 2026-07-24 cs.LG 版本更新 89%

Overcoming the Communication-Performance Tradeoff in LLM Pretraining

克服大语言模型预训练中的通信-性能权衡

Amir Sarfi, Benjamin Thérien, Joel Lidin, Eugene Belilovsky

机构 * Covenant AI Université de Montréal, Mila(蒙特利尔大学,Mila) Concordia University, Mila(康科德大学,Mila)

专题命中 效率与部署 :LLM(title,abstract);pretraining(title);large language model(abstract);language model(abstract)

AI总结 研究旨在克服大语言模型预训练中的通信-性能权衡,提出SparseLoCo算法,利用Top-k稀疏化和2比特量化,使传输伪梯度极端稀疏,在不同模型规模等情况下,相比DiLoCo性能更好且伪梯度压缩优势明显。

Comments 22 pages, 19 tables, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21272 2026-07-24 cs.NI 新提交 89%

Large Language Model Assisted Intent-Based Satellite-Integrated Access and Backhaul FWA for Rural Areas

基于大语言模型辅助的意图驱动型卫星集成接入与回传的农村地区固定无线接入

Anselme Ndikumana, Kim Khoa Nguyen, Adel Larabi, Mohamed Cheriet

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 针对农村地区通信需求时空波动及资源利用低效问题,提出基于大语言模型辅助的意图感知卫星集成接入与回传方法,将用户意图转化为网络需求,开发动态卫星IAB的FWA网络方法,最大化能源效率,仿真验证方法有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21076 2026-07-24 cs.CV 新提交 88%

C-PTQ: Fisher-weighted Channel-wise Sensitivity for Post-training Quantization of MLLMs

C-PTQ:用于多模态大语言模型训练后量化的Fisher加权通道敏感性

Jiameng Li, Han Zhou, Matthew B. Blaschko

专题命中 效率与部署 :post-training(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究针对多模态大语言模型训练后量化中异常通道致性能下降问题,提出C-PTQ方法,通过设计Fisher加权目标统一任务特定损失扰动和量化误差,无需辅助模块达最优性能,经实验验证有效。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05881 2026-07-24 cs.LG cs.CL cs.RO 88%

Training Fast Robot Policies with Slow Foundation Models

用慢速基础模型训练快速机器人策略

Utsav Singh, Pramit Bhattacharyya, Vinay P. Namboodiri, Amrit Singh Bedi

专题命中 效率与部署 :foundation model(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出VGRS方法,通过利用慢速基础模型训练快速机器人策略,结合LLM生成奖励与视觉分析诊断,提升机器人在复杂任务中的表现和部署效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14675 2026-07-24 cs.RO cs.AI 版本更新 86%

An Intelligent-Cloud Edge Multimodal Interaction System for Robots

一种用于机器人的智能云边缘多模态交互系统

Zihan Guo, Xiaoqi Li

机构 * Hainan University(海南大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对复杂环境下资源受限机器人的交互问题,提出云边缘多模态交互框架,集成增强YOLO手势检测器与LLM、VLM智能体,改进手势检测方法,经实验验证该系统在手势检测精度、任务成功率及用户满意度方面表现良好,证明了方法的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13093 2026-07-24 cs.CR cs.AI 版本更新 86%

Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models

大语言模型的高效且隐私感知的边缘云协作推理

Cheng Li, Jiexiong Liu, Yixuan Chen, Yi Li

机构 * KunlunMeta(昆仑元)

专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract);分类 cs.AI

AI总结 研究大语言模型推理难题,提出基于端点认证键值缓存的边缘云协作推理框架,本地端点与云端分工协作,经优化支持多种设备,评估显示该框架能降延迟和载荷,性能与全云端推理相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20507 2026-07-24 cs.AI cs.LG 新提交 86%

MiniCache: Reusable Program Caching with Small Model Interfaces for Efficient LLM Inference

MiniCache:用于高效大语言模型推理的具有小模型接口的可重复使用程序缓存

Jingquan Chen, Jinghua Piao, Jie Feng, Shaogang Hu, Yong Li

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型推理成本高的问题,提出MiniCache框架,将PoT程序转换为参数化缓存对象,通过重用小模型进行语义变量提取和推测性起草,减少目标大语言模型调用,实验证明其能提升推理性能,平衡延迟、缓存重用和准确性。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20481 2026-07-24 cs.AI 新提交 85%

Routing Without Training: Controllable-Ratio LLM Offloading via Reliability Gating

无需训练的路由:通过可靠性门控实现可控比例的大语言模型卸载

Evan Chen, Shiqiang Wang, Kevin S Chan, Su Wang, Christopher Brinton

机构 * Purdue University(普渡大学) University of Exeter(埃克塞特大学) Army Research Laboratory(陆军研究实验室) Princeton University(普林斯顿大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究在资源受限下本地-云端协作部署大语言模型的问题,提出无需训练的CARGO路由框架,通过提示多样化采样等方法估计一致性并控制不确定性,在多任务和模型上表现出色,证明可从本地模型内在行为实现有效协作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02211 2026-07-24 cs.CV cs.CL cs.LG 版本更新 85%

How Robust Is Homogeneity Bias in LLMs? Evidence Across Models, Decoding Settings, and Identity Signals

开放权重大语言模型中的同质性偏见对解码超参数具有鲁棒性

Messi H. J. Lee

机构 * Independent Researcher(独立研究者)

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究开放权重LLM中同质性偏见对解码超参数的鲁棒性,发现西班牙裔和亚裔美国人的同质性偏见在大多数配置下稳健,而非裔美国人和性别偏见则因模型而异。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20524 2026-07-24 cs.AI 新提交 84%

Attention Degradation, Function Token Anchoring, and the Limits of Attention-Based Intervention in Large Language Models

注意力退化、功能令牌锚定以及基于注意力的大语言模型干预的局限性

Sagar Dangal, Manoj Shakya

机构 * London Metropolitan University(伦敦城市大学) Islington College(伊斯灵顿学院) Kathmandu University(加德满都大学)

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.AI

AI总结 研究探讨大语言模型中注意力退化问题,通过六个实验刻画其模式及功能令牌锚定特点,测试干预机制效果,发现平均注意力退化多为描述性,功能令牌作用于隐藏状态计算,为可解释性方法及推理优化提供启示。

Comments 19 pages, 2 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20470 2026-07-24 cs.AI 新提交 84%

PlanE: Meta Planning of Data, Tuning, and Inference for Extractive-based LLMs

PlanE:基于抽取式大语言模型的数据、调优和推理的元规划

Jiacheng Wang, Weiyan Zhang, Guangya Yu

机构 * Ant Group(蚂蚁集团) School of Information Science and Engineering, East China University of Science and Technology(华东理工大学信息科学与工程学院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 针对大语言模型特定任务能力提升中数据标注成本高及缺乏优化方法的问题,提出PlanE框架,含数据分解等,引入DTI规划器,实验验证了该框架及规划器在不同场景下的有效性和通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20469 2026-07-24 cs.AI 新提交 83%

DecodeShare: Tracing the Shared Subspace of LLM Decode-Time Decisions

DecodeShare:追踪大语言模型解码时刻决策的共享子空间

Zishan Shao, Lixun Zhang, Kangning Cui, Yixiao Wang, Ting Jiang, Hancheng Ye, Qinsi Wang, Zhixu Du, Yuzhe Fu, Fan Yang, Danyang Zhuo, Yiran Chen, Hai Helen Li

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型解码时任务通用结构,提出DecodeShare协议识别共享子空间并测试其因果作用,实验显示干扰该子空间对决策性能影响大,且其对激活引导有实际意义,能分离组件功能、提供可靠信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21291 2026-07-24 cs.CL cs.LG 新提交 82%

Adaptive Depth Sparse Framework: Similarity-Driven Resource Allocation for Pre-Trained LLMs

自适应深度稀疏框架:基于相似性驱动的预训练语言模型资源分配

Yidu Wu, Xiang Wang, Kejie Zhao, Zhangchi Wang, Qinghai Guo, Xiaoying Tang

机构 * Southern University of Science and Technology(南方科技大学) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究针对预训练语言模型推理成本高的问题,提出自适应深度稀疏框架AdaDSF,基于层输入输出隐藏状态余弦相似性分配令牌保留率,用轻量级路由器选择信息令牌,在多任务中大幅降推理FLOPs且精度退化小。

Comments Accepted by ICIC 2026. 12 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08137 2026-07-24 cs.LG cs.AI cs.CY 82%

Weight Pruning Amplifies Bias: A Multi-Method Study of Compressed LLMs for Edge AI

权重剪枝放大了偏见:压缩LLM用于边缘AI的多方法研究

Plawan Kumar Rath, Rahul Maliakkal

机构 * Meta

专题命中 效率与部署 :LLM(title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨了三种指令微调模型在不同剪枝方法下的公平性影响,发现激活感知剪枝虽保持低困惑度但放大偏见,而随机剪枝破坏语言能力但产生随机偏见,揭示剪枝对对齐风险高于量化。

Comments 8 pages, 7 figures, 8 tables. Accepted at the 7th Annual World AIIoT Congress (AIIoT 2026). This is the author's accepted version; the version of record will appear in IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20475 2026-07-24 cs.AI cs.CL cs.LG 新提交 82%

SonicSampler: Unified Tile-Aware Kernels for LLM Sampling and Speculative Verification

SonicSampler:用于语言模型采样和推测性验证的统一瓦片感知内核

Pragaash Ponnusamy, Shivam Sahni, Jue Wang, Tri Dao

机构 * Together AI

专题命中 效率与部署 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对语言模型推理采样中现有实现的局限,提出SonicSampler,它是统一的瓦片感知Triton内核套件,垂直融合采样流水线。核心方法是分层两阶段top-k算法,在异构推测性解码工作负载中比基线快达16倍,保持灵活批处理执行。

Comments 26 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09424 2026-07-24 cs.CL cs.AI cs.LG 版本更新 82%

A Sovereign, Open-Source Foundation Model for German and English

一个用于德语和英语的自主开源基础模型

Soofi-Team, :, Benedikt Droste, David Fitzek, Ruben Härle, Lukas Helff, Maximilian Idahl, Alex Jude, Abbas Goher Khan, Maurice Kraus, Timm Ruland, Richard Rutmann, Sebastian Sztwiertnia, Markus Frey, Daniil Gurgurov, Jan Pfister, Tom Röhr, Sebastian von Rohrscheidt, Jörg Bienert, Nicolas Flores-Herr, Simon Gottschalk, Andreas Hotho, Kristian Kersting, Joachim Köhler, Alexander Löser, Wolfgang Nejdl, Simon Ostermann, Jan Plogsties, Björn Plüster, Patrick Putzky, Mehdi Ali, Michael Fromm, Max Lübbering

机构 * KI Bundesverband(德国人工智能协会) DFKI(德国人工智能研究中心) Fraunhofer IAIS(弗劳恩霍夫自动化与信息研究所) Fraunhofer IIS(弗劳恩霍夫集成电路研究所) Technische Universität Darmstadt(达姆施塔特工业大学) Universität Würzburg(维尔茨堡大学) Berliner Hochschule für Technik(柏林技术大学) L3S Research Center(L3S研究中心) ellamind(艾拉明德公司) Merantix Momentum(梅兰蒂克斯动力公司)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究提出自主开源的Soofi S 30B - A3B基础模型,采用MoE混合设计,预训练于约27万亿令牌,在德英语基准测试表现出色,优于欧洲自主基线及其他开源模型,将在宽松条款下发布,为相关领域提供强大且开源的模型支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21042 2026-07-24 cs.AI 新提交 81%

Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs

更快的IndexTTS-2:在GPU上加速和流式自回归零样本文本到语音合成

Muyang Du, Shuang Yu, Junjie Lai

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究旨在加速自回归文本到语音模型IndexTTS-2,利用NVIDIA TensorRT和TensorRT-LLM在GPU上实现生产部署,支持流式合成与批处理推理,实验表明在Seed-TTS基准测试中能显著加速且质量损失小,为加速类似模型提供参考。

Comments 4 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20814 2026-07-24 cs.AI 新提交 81%

Enhancing Explainable Cardiac Diagnosis with Guide-Grounded Multimodal LLMs

用指南引导的多模态语言模型增强可解释的心脏诊断

Hai-Nam Duy Vuong, Duy-Anh Bui, Trong-Nghia Nguyen, Kim-Ngan Thi Nguyen, Trang Mai Xuan, Tien-Cuong Nguyen, Van-Dem Pham, Thien Van Luong

机构 * Business AI Lab, College of Technology, National Economics University(商业人工智能实验室,技术学院,越南国家经济大学) A2I Lab, Phenikaa School of Computing, Phenikaa University(A2I实验室,费尼卡计算机学院,费尼卡大学) VNPT AI, VNPT Group(VNPT人工智能,VNPT集团) FPT University(FPT大学) Department of Pediatrics, Hospital of University Medicine and Pharmacy, Vietnam National University Hanoi(越南河内国家大学医学与药学院儿科学系)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究针对深度学习模型在心脏诊断中可解释性有限等问题,提出指南引导的多模态框架,通过卷积神经网络、Grad-CAM及结构化解释指南生成诊断报告,实验证明该方法能提升报告质量,增强临床合理性。

Comments 12 pages, 3 figures, accepted at CITA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20477 2026-07-24 cs.AI 新提交 81%

Semi-Supervised Text-Attributed Graph Distillation

半监督文本属性图蒸馏

Yurui Lai, Samir Moustafa, Renchi Yang, Tsz Nam Chan

机构 * Hong Kong Baptist University(香港浸会大学) CeMM Research Center for Molecular Medicine of the Austrian Academy of Sciences(奥地利科学院分子医学CeMM研究中心) Universität Vienna(维也纳大学) Shenzhen University(深圳大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对文本属性图表示学习的可扩展性瓶颈等问题,提出基于Wasserstein距离的半监督框架\algo{},通过图-文本协作编码模块等方法,在基准数据集实验中实现了高效的TAG学习及性能-压缩权衡。

Comments Technical report for the paper "Semi-Supervised Text-Attributed Graph Distillation" accepted KDD2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20450 2026-07-24 cs.CL 新提交 81%

ShriNep@EEUCA 2026: RAKSHAK - Multi-Task DeBERTa with Rationale Distillation and Jigsaw-Augmented Training for Toxic Intent Classification

ShriNep@EEUCA 2026:RAKSHAK - 用于毒性意图分类的具有原理蒸馏和拼图增强训练的多任务DeBERTa

Binayak Karki, Aryan Kafle, Pingala Ghimire

机构 * Mechi Multiple Campus(梅奇多校区) Northern Kentucky University(北肯塔基大学) Himalaya College of Engineering(喜马拉雅工程学院)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 针对GameTox共享任务中《坦克世界》聊天话语毒性意图分类难题,提出多任务DeBERTa - v3 - base框架RAKSHAK,结合原理蒸馏等方法,通过跨域转移和LLM生成样本增强训练数据,相比另一系统表现更优,多任务架构和跨域转移贡献显著。

Comments 8 pages, 1 figure, EEUCA, ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13792 2026-07-24 cs.AI cs.CL 版本更新 81%

StackingNet: Collective Inference Across Independent AI Foundation Models

StackingNet:跨独立AI基础模型的集体推理

Siyang Li, Chenhao Liu, Dongrui Wu, Zhigang Zeng, Lieyun Ding

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.CL、cs.AI

AI总结 StackingNet通过元集成框架整合独立模型输出,提升准确率并减少误差,无需内部参数或训练数据,有效识别和修剪退化模型,在语言理解、视觉属性估计和学术论文评分中优于单一模型和经典集成方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21333 2026-07-24 cs.IR 新提交 80%

SHIFT: Self-reconstruction Harnesses Implicit Fine-grained Thinking for Retrieval

SHIFT:自我重建利用隐式细粒度思维进行检索

Yuxiao Luo, Da Li, Mingjie Zhang, Zhentao He, Shikun Zhang, Wei Ye

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 研究针对基于LLM的检索器存在的问题,提出SHIFT框架。通过残差投影等转换LLM为高效检索器,利用细粒度重建缓解不匹配,经实验验证其性能优于其他检索器,为信息检索提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21446 2026-07-24 cs.LG cs.CV 新提交 79%

KroQuant: Kronecker-Structured Block Transforms for Efficient Post-Training Quantization of Diffusion Transformers

KroQuant:用于扩散Transformer高效训练后量化的克罗内克结构块变换

Yann Bouquet, Alireza Khodamoradi, Kristof Denolf, Mathieu Salzmann

机构 * EPFL(洛桑联邦理工学院) Advanced Micro Devices, Inc.(超威半导体公司)

专题命中 效率与部署 :post-training(title,abstract);分类 cs.LG

AI总结 研究针对扩散Transformer训练后量化到W4A4质量严重下降问题,提出KroQuant方法,对激活值3个2元素块应用克罗内克结构可逆变换,存储参数少,运行快,结合离线LoRaQ权重校准,输出更接近FP参考且保持或提高图像质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20723 2026-07-24 cs.CR cs.LG 新提交 79%

Leaky Language Models: Stealing Architecture and Inference Optimizations via Per-Token Timing

泄漏语言模型:通过逐令牌计时窃取架构和推理优化

Sadegh Majidi, Niloofar Mireshghallah, Kazem Taram

机构 * Purdue University(普渡大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.LG

AI总结 研究通过LeakyLMs攻击从生产语言模型中窃取信息,利用令牌生成时间推断关键细节。核心方法是构建令牌生成时间模型,可针对推理优化和部署策略及恢复架构属性。主要贡献是能有效窃取模型、架构和部署信息,实验效果良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20488 2026-07-24 cs.AI 新提交 79%

Autonomous Topology Mutation: Safe Runtime Restructuring for Multi-Agent LLM Systems with Capability, State, and Shadow Invariants

自主拓扑变异:具有能力、状态和影子不变量的多智能体大语言模型系统的安全运行时重组

Bronislav Sidik, Chaya Levi, Nizzan Kimhi

机构 * Toga Networks (Huawei)(托加网络(华为))

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI

AI总结 研究多智能体大语言模型系统运行时无自我重组机制的问题,提出自主拓扑变异(ATM)机制,结合遥测驱动过载检测与安全不变量,经实验验证可提升任务成功率、减少隐私内存暴露并降低延迟,且相关内容已开源。

Comments 9 pages, 5 tables. Code and benchmark harness available at https://github.com/sidikbro/jiuwen_atm

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20468 2026-07-24 cs.AI 新提交 79%

InferenceBench: A Benchmark for Open-Ended LLM Inference Optimization by AI Agents

InferenceBench:用于通过人工智能代理进行开放式大语言模型推理优化的基准测试

Jehyeok Yeon, Ben Rank, Maksym Andriushchenko

机构 * ELLIS Institute Tübingen, Max Planck Institute for Intelligent Systems, Tübingen AI Center(图宾根ELLIS研究所、马克斯·普朗克智能系统研究所、图宾根人工智能中心)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI

AI总结 研究旨在为开放式大语言模型推理优化建立基准测试InferenceBench,让代理部署推理服务器优化推理速度。通过多种场景和配置测试,发现代理虽能提升性能,但仍有局限,瓶颈在于提出多样配置等能力,反映了代理在开放式环境中的操作能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18218 2026-07-24 cs.CV cs.AI 版本更新 79%

GigaPath-Flash and GigaTIME-Flash: Efficient Pathology Foundation Models for Whole-Slide and Tumor Microenvironment Analysis

GigaPath-Flash和GigaTIME-Flash:用于全切片和肿瘤微环境分析的高效病理学基础模型

Naoto Usuyama, Jeya Maria Jose Valanarasu, Sicong Yao, Hanwen Xu, Jaspreet Bagga, Guanghui Qin, Robert E. Kramer, Cliff Wong, Soohee Lee, Hao Qiu, Theodore Zhengde Zhao, Racheli Ben Shimol, Angela Crabtree, Kevin Matlock, Eduardo Alejandro Lozano Garcia, Naiteek Sangani, Alberto Santamaria-Pang, Maximilian Rokuss, Yashna Hasija, Naisargi Manishkumar Patel, Jason Entenmann, Alexandra Q. Bartlett, Bill J. Wright, Bernard A. Fox, Brian Piening, Sheng Zhang, Sheng Wang, Tristan Naumann, Carlo Bifulco, Hoifung Poon

机构 * Microsoft Research(微软研究院) Paul G. Allen School of Computer Science and Engineering, University of Washington(华盛顿大学保罗·G·艾伦计算机科学与工程学院) Providence Genomics(普罗维登斯基因组学公司) Earle A. Chiles Research Institute, Providence Cancer Institute(普罗维登斯癌症研究所厄尔·A·奇尔斯研究所) Providence Research Network(普罗维登斯研究网络)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI

AI总结 研究针对计算病理学中模型局限,提出GigaPath-Flash和GigaTIME-Flash模型用于全切片和肿瘤微环境分析。前者结合特定编码器,计算量少性能优;后者扩展架构预测肿瘤免疫微环境,速度快内存省,共同为相关领域提供开放许可模型及权重。

Comments Models: https://aka.ms/gigapath-flash (GigaPath-Flash) and https://aka.ms/gigatime-flash (GigaTIME-Flash)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20860 2026-07-24 cs.CR 新提交 78%

Which Model Is Actually Serving You? IRIS: Budgeted Black-Box Auditing of Model Substitution and Routing Dilution in LLM Gateways

哪个模型真正在为你服务?IRIS:大语言模型网关中模型替换和路由稀释的预算黑盒审计

Yuewei Zhang, Zhi-Hai Zhang, Hanzhang Qin

专题命中 效率与部署 :LLM(title,abstract)

AI总结 研究大语言模型网关中模型替换和路由稀释问题,提出IRIS审计方法,仅需返回文本,能结合多种检测与估计,通过实验验证其在不同场景下的有效性,相比其他审计方法有优势,还进行了多方面拓展实验。

详情

展开后加载摘要…

URL PDF HTML 收藏