arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-16 至 2026-04-16 共收录 267 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 45 篇

2604.13287 2026-04-16 cs.LG 86%

MOONSHOT : A Framework for Multi-Objective Pruning of Vision and Large Language Models

MOONSHOT:一种用于视觉和大语言模型多目标剪枝的框架

Gabriel Afriat, Xiang Meng, Shibal Ibrahim, Hussein Hazimeh, Rahul Mazumder

机构 * Google(谷歌) OpenAI Massachusetts Institute of Technology(麻省理工学院)

专题命中 效率与部署 :large language model(title);language model(title);post-training(abstract);分类 cs.LG

AI总结 MOONSHOT通过联合优化层重建误差和训练损失的二阶泰勒近似,提升视觉和大语言模型在无重新训练下的压缩效果,显著提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13098 2026-04-16 cs.MA cs.CV cs.RO 85%

C$^2$T: Captioning-Structure and LLM-Aligned Common-Sense Reward Learning for Traffic--Vehicle Coordination

C$^2$T:基于图像描述与大语言模型对齐的常识奖励学习用于交通-车辆协调

Yuyang Chen, Kaiyan Zhao, Yiming Wang, Ming Yang, Bin Rao, Zhenning Li

机构 * The State Key Laboratory of Internet of Things for Smart City, University of Macau(物联网智能城市国家重点实验室,澳门大学) Wuhan University(武汉大学) Hong Kong Polytechnic University(香港理工大学) Computer and Information Science, University of Macau(澳门大学计算机与信息科学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出C2T框架,通过从交通-车辆动态中学习常识协调模型,结合大语言模型的常识知识,提升交通协调系统的效率、安全性和舒适性。

Comments Accepted to CVPR 2026 Findings Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00598 2026-04-16 cs.LG cs.AI 84%

Fast and Low-Cost Genomic Foundation Models via Outlier Removal

通过异常值去除实现快速且低成本的基因组基础模型

Haozheng Luo, Chenghao Qiu, Maojiang Su, Zhihan Zhou, Zoe Mehta, Guo Ye, Jerry Yao-Chieh Hu, Han Liu

机构 * Northwestern University(西北大学) Tianjin University(天津大学) Vernon Hills High School(弗农希尔斯高中)

专题命中 效率与部署 :foundation model(title,abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GERM模型,通过去除异常值提升基因组模型的压缩性能和适应速度,有效提高效率和鲁棒性,并在实验中验证了其在微调和量化方面的优越表现。

Comments International Conference on Machine Learning (ICML) 2025

Journal ref Proceedings of the 42nd International Conference on Machine Learning, PMLR 267:41254-41289, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09613 2026-04-16 cs.DC cs.AI 83%

Token-Budget-Aware Pool Routing for Cost-Efficient LLM Inference

面向成本高效的大语言模型推理的令牌预算感知池路由

Huamin Chen, Xunzhuo Liu, Junchen Jiang, Bowei He, Xue Liu

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出基于令牌预算的池路由方法,通过估计请求总令牌预算并分配到适合的工作负载池,减少GPU实例,提升效率。

Comments duplicate of arXiv:2604.08075

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05407 2026-04-16 cs.AI cs.CL 82%

H-AdminSim: A Multi-Agent Simulator for Realistic Hospital Administrative Workflows with FHIR Integration

H-AdminSim:一种用于真实医院行政工作流的多智能体模拟器,集成FHIR

Jun-Min Lee, Meong Hi Son, Edward Choi

机构 * KAIST(韩国科学技术院) Samsung Medical Center(三星医疗中心)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 H-AdminSim通过结合真实数据生成与多智能体模拟,系统评估LLM在医院行政工作流中的表现,利用FHIR实现跨异构环境的标准化测试平台。

Comments Accepted at CHIL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22750 2026-04-16 cs.CL cs.AI 82%

MARCH: Evaluating the Intersection of Ambiguity Interpretation and Multi-hop Inference

MARCH:评估歧义解释与多跳推理的交集

Jeonghyun Park, Ingeol Baek, Seunghyun Yoon, Haeun Jang, Aparna Garimella, Akriti Jain, Nedim Lipka, Hwanhee Lee

机构 * Chung-Ang University(Chung-Ang 大学) Adobe Research(Adobe 研究)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本文提出MARCH基准,通过多LLM验证和人工标注,包含2209个多跳歧义问题,揭示了当前模型在结合歧义解决与多步推理上的挑战,并提出CLARION框架提升推理系统鲁棒性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09176 2026-04-16 cs.HC 82%

LIVE-GS: LLM Powers Interactive VR Experience with Physics-Aware Gaussian Splatting

LIVE-GS:通过大语言模型实现交互式VR体验的物理感知高斯点云

Haotian Mao, Hangyu Zhou, Zhuoxiong Xu, Siyue Wei, Yule Quan, Yan Zhang, Zixuan Guo, Nianchen Deng, Xubo Yang

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract)

AI总结 LIVE-GS利用大语言模型快速生成动态高斯点云资产并实现实时VR交互,通过物理属性分析提升虚拟现实中的物理交互真实感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11465 2026-04-16 cs.AI 81%

Three Roles, One Model: Role Orchestration at Inference Time to Close the Performance Gap Between Small and Large Agents

三种角色,一个模型:推理时的角色编排以缩小小规模与大规模代理之间的性能差距

S. Aaron McClendon, Jorge Gallego-Feliciano, Stavros Zervoudakis, Antonios Saravanos

机构 * Aimpoint Digital Labs(Aimpoint数字实验室) New York University(纽约大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究在推理时仅使用架构支撑是否能提升小模型在复杂多步骤环境中的性能,通过三阶段推理架构使小模型在AppWorld基准测试中任务完成率提升近一倍,展示了结构化推理干预使小模型能与大模型竞争。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13345 2026-04-16 cs.CV 80%

Multi-Agent Object Detection Framework Based on Raspberry Pi YOLO Detector and Slack-Ollama Natural Language Interface

基于Raspberry Pi YOLO检测器和Slack-Ollama自然语言接口的多智能体目标检测框架

Vladimir Kalušev, Branko Brkljač, Milan Brkljač

机构 * The Institute for Artificial Intelligence Research(人工智能研究机构) Development of Serbia(塞尔维亚发展) Department of Power, Electronic and Telecommunication Engineering(电力、电子与电信工程系) Faculty of Technical Sciences, University of Novi Sad(技术科学学院,诺维萨德大学) Faculty of Finance, Banking and Auditing, Alfa BK University(金融、银行与审计学院,阿尔法BK大学)

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 本文提出了一种基于边缘计算的多智能体目标检测系统,利用LLM自然语言接口实现系统控制与通信,并在资源受限硬件平台上集成所有组件。

Comments 19 pages, 7 figures, 2 tables, implementation code will be made available upon manuscript publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15742 2026-04-16 cs.LG cs.DC 79%

SHARe-KAN: Post-Training Vector Quantization for Cache-Resident KAN Inference

SHARe-KAN:面向缓存驻留KAN推理的后训练向量量化

Jeff Smith

机构 * Burnin

专题命中 效率与部署 :post-training(title,abstract);分类 cs.LG

AI总结 SHARe-KAN通过Gain-Shape-Bias分解和共享代码本压缩KAN的B样条系数,实现高效的存储压缩和推理加速,适用于边缘设备的多专家KAN部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13634 2026-04-16 cs.CL cs.LG 79%

Calibrated Speculative Decoding: Frequency-Guided Candidate Selection for Efficient Inference

校准的推测解码:基于频率的候选选择以实现高效的推理

Xuwen Zhou, Fangxin Liu, Chao Wang, Xiao Zheng, Hao Zheng, Min He, Li Jiang, Haibing Guan

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Cloud Computing(阿里云 computing)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出校准的推测解码,通过频率引导的候选选择和概率保护的接受机制,提升大语言模型推理效率,实测效果优于现有方法。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05909 2026-04-16 physics.atom-ph physics.chem-ph physics.comp-ph 78%

Towards a Universal Foundation Model for Protein Dynamics: A Multi-Chain Tree-Structured Framework with Transformer Propagators

面向蛋白质动力学的通用基础模型:一种多链树状结构框架与Transformer传播器

Jinzhen Zhu

专题命中 效率与部署 :foundation model(title,abstract)

AI总结 本文提出一种通用蛋白质动力学基础模型,通过树状结构框架和Transformer传播器实现高精度结构重建与多链系统泛化,加速率达10000至20000倍。

Comments 14 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14090 2026-04-16 cs.CL 77%

From Weights to Activations: Is Steering the Next Frontier of Adaptation?

从权重到激活:是否转向是适应的下一个前沿?

Simon Ostermann, Daniil Gurgurov, Tanja Baeumel, Michael A. Hedderich, Sebastian Lapuschkin, Wojciech Samek, Vera Schmitt

机构 * Saarland University(萨尔兰大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) Centre for European Research in Trusted AI (CERTAIN)(可信AI欧洲研究中心) Munich Center for Machine Learning(慕尼黑机器学习中心) Fraunhofer Heinrich Hertz Institute(弗劳恩霍夫海因里希·赫兹研究所) Technological University Dublin(都柏林技术大学) Technische Universität Berlin(柏林技术大学) Berlin Institute for the Foundations of Learning and Data (BIFOLD)(柏林学习与数据基础研究所)

专题命中 效率与部署 :language model(abstract);post-training(abstract);prompting(abstract);分类 cs.CL

AI总结 本文探讨了转向作为一种模型适应方法,通过激活空间的针对性干预实现局部可逆行为改变,提出统一的适应方法分类框架。

Comments Accepted to ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13565 2026-04-16 cs.CV cs.AI 74%

UHR-BAT: Budget-Aware Token Compression Vision-Language model for Ultra-High-Resolution Remote Sensing

UHR-BAT:面向超高清遥感的预算感知视觉-语言模型

Yunkai Dang, Minxin Dai, Yuekun Yang, Zhangnan Li, Wenbin Li, Feng Miao, Yang Gao

机构 * School of Artificial Intelligence Science and Technology, Nanjing University(南京大学人工智能科学与技术学院) School of Electronic Science and Engineering, Nanjing University(南京大学电子科学与工程学院) School of Physics, Nanjing University(南京大学物理学院)

专题命中 效率与部署 :language model(title);分类 cs.AI

AI总结 本文提出UHR-BAT模型,通过文本引导的多尺度重要性估计和区域保留合并策略,实现高效视觉token压缩,在严格预算下提升超高清遥感图像信息提取效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13440 2026-04-16 cs.LG cs.AI 73%

A KL Lens on Quantization: Fast, Forward-Only Sensitivity for Mixed-Precision SSM-Transformer Models

KL镜像于量化:混合精度SSM-Transformer模型的快速前向敏感性分析

Jason Kong, Nilesh Prasad Pandey, Flavio Ponzina, Tajana Rosing

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种轻量级、无需反向传播的替代敏感性分析框架,用于识别混合SSM-Transformer组件对量化退化最敏感的部分,通过KL散度指标提升边缘设备上混合模型的部署效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14053 2026-04-16 cs.CL 70%

From Where Words Come: Efficient Regularization of Code Tokenizers Through Source Attribution

词源何处:通过源归属高效正则化代码分词器

Pavel Chizhov, Egor Bogomolov, Ivan P. Yamshchikov

机构 * CAIRO, Technical University of Applied Sciences Würzburg-Schweinfurt(CAIRO应用技术大学(乌尔姆-施维林)) JetBrains Research(JetBrains研究) TU Delft(代尔夫特理工大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过源归属BPE(SA-BPE)正则化方法,解决代码分词器因训练数据不平衡导致的冗余token问题,提升分词效率与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14133 2026-04-16 cs.AI cs.CR cs.MA 70%

Formalizing the Safety, Security, and Functional Properties of Agentic AI Systems

形式化代理AI系统的安全、安全性和功能性属性

Edoardo Allegrini, Ananth Shreekumar, Z. Berkay Celik

机构 * Sapienza University of Rome(罗马萨皮恩扎大学) Purdue University(普渡大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一个统一的语义框架,用于分析、设计和部署正确、可靠且稳健的代理AI系统,通过形式化验证确保系统行为的安全性和功能性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13757 2026-04-16 cs.AI cs.HC 70%

Rethinking AI Hardware: A Three-Layer Cognitive Architecture for Autonomous Agents

重新思考人工智能硬件:一种三层认知架构用于自主代理

Li Chen

机构 * LI CHEN(李晨)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出Tri-Spirit架构,通过分解智能为规划、推理和执行三层,提升自主系统效率,实验显示任务延迟和能耗降低显著。

Comments A system architecture paper with simulation-based evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13048 2026-04-16 cs.DB cs.AI cs.SE 70%

From Natural Language to PromQL: A Catalog-Driven Framework with Dynamic Temporal Resolution for Cloud-Native Observability

从自然语言到PromQL:一种基于目录的框架,具有动态时间分辨率的云原生可观测性

Twinkll Sisodia

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出一种基于目录的框架,通过将自然语言问题转换为可执行的PromQL查询,解决云原生平台中正确查询的难题,贡献包括混合度量目录、多阶段查询管道和动态时间分辨率机制。

Comments 15 pages, 7 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09752 2026-04-16 cs.DC cs.AI 70%

A-IO: Adaptive Inference Orchestration for Memory-Bound NPUs

A-IO:面向内存受限NPUs的自适应推断编排

Chen Zhang, Yan Ding, Haotian Wang, Chubo Liu, Keqin Li, Kenli Li

机构 * Hunan University(湖南大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文针对异构NPUs上大语言模型部署中的内存瓶颈问题,提出A-IO框架,解决静态模型部署导致的模型扩展悖论及细粒度推测解码的同步开销问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26491 2026-04-16 cs.LG 70%

Data-Efficient RLVR via Off-Policy Influence Guidance

通过离策略影响指导实现数据高效的RLVR

Erle Zhu, Dazhi Jiang, Yuan Wang, Xujun Li, Jiale Cheng, Yuxian Gu, Yilin Niu, Aohan Zeng, Jie Tang, Minlie Huang, Hongning Wang

机构 * CoAI Group, Tsinghua University(联合人工智能组,清华大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出基于影响函数的理论方法,通过离策略影响估计和稀疏随机投影提升RLVR的数据效率,实验显示CROPI框架在训练加速方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14069 2026-04-16 cs.CV 67%

Towards Unconstrained Human-Object Interaction

迈向无约束的人-物交互

Francesco Tonini, Alessandro Conti, Lorenzo Vaquero, Cigdem Beyan, Elisa Ricci

机构 * Department of Information Engineering and Computer Science, University of Trento(特伦托大学信息工程与计算机科学系) Fondazione Bruno Kessler(布鲁诺·克塞勒基金会) Department of Computer Science, University of Verona(威尼斯大学计算机科学系)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文通过多模态大语言模型探索无约束人-物交互检测,提出无需预定义交互词汇的新任务,并展示MLLMs在该任务中的潜力。

Comments Accepted to the 20th IEEE International Conference on Automatic Face and Gesture Recognition (FG 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12358 2026-04-16 cs.CV 67%

Why and When Visual Token Pruning Fails? A Study on Relevant Visual Information Shift in MLLMs Decoding

为何及何时视觉标记修剪失效?对多模态大语言模型解码中相关视觉信息转移的研究

Jiwan Kim, Kibum Kim, Wonjoong Kim, Byung-Kwan Lee, Chanyoung Park

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) NVIDIA

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文研究了视觉标记修剪在复杂视觉推理任务中的失效原因,提出解码阶段感知标记修剪方法,有效缓解了修剪方法在复杂推理任务中的性能下降。

Comments Preprint, Project : https://ptkjw1997.github.io/DSTP-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12851 2026-04-16 cs.DC 67%

Accelerating Edge Inference for Distributed MoE Models with Latency-Optimized Expert Placement

加速分布式MoE模型的边缘推理:基于延迟优化的专家放置

Tian Wu, Liming Wang, Zijian Wen, Xiaoxi Zhang, Xu Chen, Jingpu Duan, Xianwei Zhang, Jinhang Zuo

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文提出Prism框架,通过优化边缘服务器间的通信和专家放置,降低MoE模型的推理延迟和通信成本,提升边缘环境下的模型部署效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13725 2026-04-16 cs.SE 67%

On the Effectiveness of Context Compression for Repository-Level Tasks: An Empirical Investigation

在仓库级任务中上下文压缩的有效性:一项实证研究

Jia Feng, Zhanyue Qin, Cuiyun Gao, Ruiqi Wang, Chaozheng Wang, Yingwei Ma, Xiaoyuan Xie

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文研究仓库级代码智能任务中上下文压缩的有效性,评估了八种方法的性能与效率,发现连续潜在向量方法在4倍压缩下性能提升达28.3%,效率显著提高。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13559 2026-04-16 cs.SE 67%

WebMAC: A Multi-Agent Collaborative Framework for Scenario Testing of Web Systems

WebMAC: 一种用于Web系统场景测试的多智能体协作框架

Zhenyu Wan, Gong Chen, Qing Huang, Xiaoyuan Xie

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 本文提出WebMAC框架,通过多智能体协作完成测试场景描述和转换,提升测试脚本执行成功率和效率,减少token消耗,并有效发现更多Web系统错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16445 2026-04-16 cs.RO 67%

FiLM-Nav: Efficient and Generalizable Navigation via VLM Fine-tuning

FiLM-Nav:通过VLM微调实现高效且通用的导航

Naoki Yokoyama, Sehoon Ha

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 效率与部署 :language model(abstract);foundation model(abstract)

AI总结 本文提出FiLM-Nav,通过微调预训练VLM作为导航策略,直接利用视觉轨迹历史和导航目标进行探索决策,实现复杂环境中的高效导航与物体定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13959 2026-04-16 cs.AI 57%

[Emerging Ideas] Artificial Tripartite Intelligence: A Bio-Inspired, Sensor-First Architecture for Physical AI

新兴理念:人工三元智能:一种生物启发、以传感器优先的物理AI架构

You Rim Choi, Subeom Park, Hyung-Sin Kim

机构 * Seoul National University(首尔国立大学)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI

AI总结 本文提出人工三元智能(ATI),一种生物启发的物理AI架构,通过模块化设计实现传感器控制与推理的协同进化,提升动态环境下的性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13883 2026-04-16 cs.CV cs.LG 57%

Context Sensitivity Improves Human-Machine Visual Alignment

上下文敏感性提升人机视觉对齐

Frieda Born, Tom Neuhäuser, Lukas Muttenthaler, Brett D. Roads, Bernhard Spitzer, Andrew K. Lampinen, Matt Jones, Klaus-Robert Müller, Michael C. Mozer

机构 * Technische Universität Berlin(技术大学柏林) BIFOLD Max Planck Institute for Human Development(人类发展马克斯·普朗克研究所) Aignostics Helmholtz Munich(慕尼黑海德堡研究所) Technical University of Munich(慕尼黑技术大学) University College London(伦敦大学学院) Technische Universität Dresden(德累斯顿技术大学) Google DeepMind(谷歌DeepMind) University of Colorado Boulder(科罗拉多大学博尔德分校) Korea University(韩国大学) Max Planck Institute for Informatics(信息马克斯·普朗克研究所)

专题命中 效率与部署 :foundation model(abstract);分类 cs.LG

AI总结 本文提出一种基于神经网络嵌入的上下文敏感相似性计算方法,用于解决三元组异类识别任务,通过锚图提供同时上下文,使模型在异类识别准确率上提升15%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15970 2026-04-16 cs.DB cs.AI 57%

100x Cost & Latency Reduction: Performance Analysis of AI Query Approximation using Lightweight Proxy Models

100倍成本与延迟降低:利用轻量级代理模型分析AI查询近似性能

Yeounoh Chung, Rushabh Desai, Jian He, Yu Xiao, Thibaud Hottelier, Yves-Laurent Kom Samo, Pushkar Khadilkar, Xianshun Chen, Sam Idicula, Fatma Özcan, Alon Halevy, Yannis Papakonstantinou

机构 * Google Cloud(谷歌云)

专题命中 效率与部署 :LLM(abstract_cn);分类 cs.AI

AI总结 本文研究了AI查询近似方法,通过轻量级代理模型实现100倍成本和延迟降低,提升语义过滤和排序性能,适用于OLAP和HTAP数据库。

详情

展开后加载摘要…

URL PDF HTML 收藏