arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-25 至 2026-05-25 共收录 52 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 52 篇

2605.23057 2026-05-25 cs.LG cs.CL cs.PF 92%

ModeSwitch-LLM: A Lightweight Phase-Aware Controller for Cross-Mode LLM Inference on a Single GPU

ModeSwitch-LLM:单GPU上跨模式LLM推理的轻量级阶段感知控制器

Aman Sunesh, Ali Alshehhi, Hivansh Dhakne

机构 * New York University Abu Dhabi(纽约大学阿布扎克分校) New York University(纽约大学) United States(美国)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出一种轻量级请求边界控制器ModeSwitch-LLM,通过基于工作负载特征在FP16、量化、推测解码等推理模式间路由请求,在单GPU上实现平均延迟加速2.10倍、每token能耗降低51.7%,且精度几乎无损。

Comments 10 pages main text, 11 pages including references, 5 figures, 3 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23158 2026-05-25 cs.CR cs.CL cs.LG 91%

What Does the Server See? Understanding Privacy Leakage from Large Language Models in Split Inference

服务器看到了什么?理解大语言模型在分割推理中的隐私泄露

Mingyuan Fan, Yu Liu, Fuyi Wang, Cen Chen

机构 * East China Normal University(华东师范大学) RMIT University(皇家墨尔本理工大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL、cs.LG

AI总结 提出ActInv方法解决中间激活匹配问题以重建客户端输入,并引入扰动放大因子(PAF)量化层固有抗重建能力,揭示隐私脆弱性在层间不均匀分布,进而设计PriPert防御策略。

Comments Accepted to ACM CCS'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23280 2026-05-25 cs.DB 91%

BCTuner: LLM-Guided Monte Carlo Tree Search for Efficient Blockchain Knob Tuning

BCTuner: 基于LLM引导的蒙特卡洛树搜索实现高效区块链参数调优

Yaoyi Deng, Chongyang Tao, Mingxuan Li, Xuelian Lin, Han Sun, Mingchao Wan, Shuai Ma

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对许可区块链参数调优中架构复杂、语义鸿沟及试错成本高的问题,提出BCTuner框架,结合大语言模型知识推理与蒙特卡洛树搜索,通过结构化动作轨迹逐步构建配置并自适应剪枝,显著提升吞吐量并减少系统交互次数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11215 2026-05-25 cs.DC cs.AI 90%

ReCoVer: Resilient LLM Pre-Training System via Fault-Tolerant Collective and Versatile Workload

ReCoVer: 通过容错集合和多功能工作负载实现的弹性LLM预训练系统

Ziyue Liu, Zhengyang Wang, Ruijie Zhang, Avinash Maurya, Hui Zhou, Paul Hovland, Sheng Di, Franck Cappello, Bogdan Nicolae, Zheng Zhang

机构 * University of California at Santa Barbara(加州大学圣芭芭拉分校) Argonne National Laboratory(阿贡国家实验室)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出ReCoVer系统,通过保持每次迭代微批次数恒定、容错集合通信、步内细粒度恢复和动态工作负载重分配,实现并行方案无关的弹性LLM预训练,在512 GPU上即使丢失256 GPU也能保持训练轨迹,有效吞吐量比检查点重启基线高2.23倍。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22897 2026-05-25 cs.LG 90%

From Residuals to Reasons: LLM-Guided Mechanism Inference from Tabular Data

从残差到原因:基于LLM的表格数据机制推断

Mohammad R. Rezaei, Rahul G. Krishnan

机构 * Department of Computer Science(计算机科学系) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 提出多智能体残差上下文学习框架(MARICL),通过让LLM分析基础模型残差并迭代生成修正项,在多个科学基准上提升预测性能并实现机制泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23389 2026-05-25 cs.DC 89%

AlignedServe: Orchestrating Prefix-aware Batching to Build a High-throughput and Computing-efficient LLM Serving System

AlignedServe:编排前缀感知批处理以构建高吞吐量和计算高效的LLM服务系统

Fengyao Bai, Hongbin Zhang, Zhitao Chen, Jiangsu Du, Zhiguang Chen, Yutong Lu

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对LLM服务中解码迭代内的气泡问题,提出基于前缀感知批处理的AlignedServe框架,通过分组相似KV缓存长度的请求、CPU内存维护大量飞行请求、批级调度和GPU间预取KV缓存,显著提升解码吞吐量并降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03117 2026-05-25 cs.CR 89%

PromptCOS: Towards Content-only System Prompt Copyright Auditing for LLMs

PromptCOS: 面向LLM的仅内容系统提示版权审计

Yuchen Yang, Yiming Li, Hongwei Yao, Enhao Huang, Shuo Shao, Yuyi Wang, Zhibo Wang, Dacheng Tao, Zhan Qin

专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract)

AI总结 针对系统提示版权审计中内容级验证不稳定的问题,提出基于内容输出相似性的PromptCOS方法,通过循环输出信号和辅助令牌实现水印稳定性与保真度,实验表明高效且鲁棒。

Comments This paper is accepted by IEEE S&P 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20102 2026-05-25 cs.LG cs.AI 88%

BarrierSteer: LLM Safety via Learning Barrier Steering

BarrierSteer: 通过学习障碍引导实现大语言模型安全

Thanh Q. Tran, Arun Verma, Kiwan Wong, Bryan Kian Hsiang Low, Daniela Rus, Wei Xiao

机构 * Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系) Singapore-MIT Alliance for Research and Technology Centre(新加坡-麻省理工联合研究中心) CSAIL, Massachusetts Institute of Technology(麻省理工学院计算机科学与人工智能实验室) Worcester Polytechnic Institute(沃斯堡理工学院)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract,comments);language model(abstract,comments);分类 cs.AI、cs.LG

AI总结 提出 BarrierSteer 框架,通过将学习到的非线性安全约束作为控制障碍函数嵌入潜在表示空间,在推理时引导模型生成安全内容,理论保证且不修改模型参数。

Comments This paper introduces SafeBarrier, a framework that enforces safety in large language models by steering their latent representations with control barrier functions during inference, reducing adversarial and unsafe outputs

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23640 2026-05-25 cs.CR 88%

CachePrune: Privacy-Aware and Fine-Grained KV Cache Sharing for Efficient LLM Inference

CachePrune:面向高效LLM推理的隐私感知细粒度KV缓存共享

Guanlong Wu, Zhaohan li, Yao Zhang, Zheng Zhang, Jianyu Niu, Ye Wu, Yinqian Zhang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对跨用户KV缓存共享带来的侧信道泄露问题,提出CachePrune机制,通过令牌级细粒度缓存管理实现隐私感知的KV条目选择性重用,在消除直接泄露的同时显著降低首令牌延迟并提高缓存命中率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23296 2026-05-25 cs.AI 87%

Parallel Context Compaction for Long-Horizon LLM Agent Serving

长视界LLM智能体服务的并行上下文压缩

Musa Cim, Burak Topcu, Chita Das, Mahmut Taylan Kandemir

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 针对长视界LLM智能体对话历史超出上下文窗口的问题,提出并行压缩方法,通过细粒度控制摘要体积和提示工程,在HotpotQA和LoCoMo基准上相比顺序基线降低端到端耗时并提升压缩吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23294 2026-05-25 cs.AR 87%

NASiC: 3D NAND-based CAM-Selected Multibit CIM Architecture for Efficient On-Device Mixture-of-Experts LLM Inference

NASiC: 基于3D NAND的CAM选择多比特CIM架构,用于高效设备端混合专家大语言模型推理

Weikai Xu, Meng Li, Shuzhang Zhong, Tianyang Luo, Dongxue Zhao, Ling Liang, Zongwei Wang, Qianqian Huang, Yimao Cai, Ru Huang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对MoE模型在设备端部署时动态稀疏专家激活导致计算并行度下降和Flash多比特存储能力利用不足的问题,提出NASiC架构,通过CAM掩码机制融合专家选择与CIM计算,结合电路级优化和多比特CIM单元,显著提升吞吐量和能效。

Comments Accepted by DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23196 2026-05-25 cs.CR 86%

Prompt Overflow: What the Guardrail Inspects Is Not What the Model Infers

提示溢出:护栏检查的内容并非模型推理的内容

Yuanbo Zhou, Changjia Zhu, Junyu Wang, Xu He, Yan Zhai, Kun Sun, Mingkui Wei, Junjie Xiong

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出提示溢出攻击,利用护栏模型有限检查窗口与下游大语言模型更大推理窗口之间的不匹配,通过将恶意指令碎片化并插入良性填充内容到超长提示中,使每个检查片段看似无害,但完整上下文仍可被LLM执行。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12043 2026-05-25 cs.RO 86%

Talk Less, Fly Lighter: Autonomous Semantic Compression for UAV Swarm Communication via LLMs

少说,轻飞:基于大语言模型的无人机集群自主语义压缩通信

Fei Lin, Tengchao Zhang, Qinghua Ni, Jun Huang, Siji Ma, Yonglin Tian, Yisheng Lv, Naiqi Wu

机构 * Department of Engineering Science, Faculty of Innovation Engineering, Macau University of Science and Technology(工程科学系,创新工程学院,澳门科学理工学院) State Key Laboratory for Management and Control of Complex Systems, Institute of Automation, Chinese Academy of Sciences(复杂系统管理与控制国家重点实验室,自动化研究所,中国科学院)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文探索利用大语言模型驱动无人机集群进行自主语义压缩通信,通过构建不同复杂度的仿真场景和通信执行管道,评估九种主流LLM的语义压缩性能,证明其在带宽受限和多跳链路条件下实现高效协同通信的潜力。

Journal ref Proc. 2025 21st IEEE International Conference on Mechatronic and Embedded Systems and Applications (MESA), pp. 29-34, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23054 2026-05-25 cs.CL cs.AI cs.LG 83%

Model Collapse as Cultural Evolution

模型崩溃作为文化演化

Dongxin Guo, Jikun Wu, Siu Ming Yiu

机构 * The University of Hong Kong(香港大学) Stellaris AI Limited(Stellaris AI有限公司)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文利用文化演化中的迭代学习理论解释模型崩溃现象,通过自训练LLaMA-2-7B和Mistral-7B模型验证了组合性先升后降的非单调轨迹等预测,并提供了压缩-通信权衡的首个LLM尺度证据。

Comments Accepted at CoNLL 2026. 18 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23572 2026-05-25 cs.IR cs.AI cs.LG 82%

HARNESS-LM: A Three-Phase Training Recipe for Harnessing SLMs in Sponsored Search Retrieval

HARNESS-LM: 一种在赞助搜索中利用小语言模型的三阶段训练方案

Vipul Gupta, Shikhar Mohan, Lakshya Kumar, Pranjal Chitale, Nikit Begwani, Amit Singh, Manik Varma

机构 * Microsoft AI(微软人工智能)

专题命中 效率与部署 :SLM(abstract,abstract_cn);language model(abstract);small language model(abstract);分类 cs.AI、cs.LG

AI总结 提出HARNESS-LM三阶段训练框架,通过知识蒸馏将大规模检索器能力迁移至紧凑模型,在Bing Ads上恢复98%以上精度并实现27倍延迟降低。

Comments 9 pages, 3 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26383 2026-05-25 cs.CL cs.AI 82%

Efficient and Transferable Agentic Knowledge Graph RAG via Reinforcement Learning

基于强化学习的高效可迁移智能知识图谱检索增强生成

Junhong Lin, Shicheng Liu, Jinyeop Song, Song Wang, Julian Shun, Yada Zhu

机构 * MIT CSAIL(麻省理工学院CSAIL) University of Virginia(弗吉尼亚大学) IBM Research(IBM研究院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出KG-R1框架,通过强化学习将单个智能体与知识图谱交互,统一检索、推理和生成过程,在KGQA基准上以更少生成token提升准确率,并展现跨图谱的零样本迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23605 2026-05-25 cs.LG cs.AI cs.CL 82%

DiLaDiff: Distilled Latent-Augmented Diffusion for Language Modeling

DiLaDiff: 蒸馏潜在增强扩散用于语言建模

Jean-Marie Lemercier, Tomas Geffner, Karsten Kreis, Morteza Mardani, Arash Vahdat, Ante Jukić

机构 * NVIDIA(英伟达)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出DiLaDiff,通过连续潜在空间、潜在扩散模型和一致性蒸馏解决扩散语言模型在解码令牌相关性上的不足,提升采样质量和推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06404 2026-05-25 cs.AI cond-mat.mtrl-sci physics.chem-ph 81%

GENIUS: An Agentic AI Framework for Autonomous Design and Execution of Simulation Protocols

GENIUS: 一种用于自主设计和执行模拟协议的智能AI框架

Mohammad Soleymanibrojeni, Roland Aydin, Diego Guedes-Sobrinho, Alexandre C. Dias, Maurício J. Piotrowski, Wolfgang Wenzel, Celso Ricardo Caldeira Rêgo

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Institute of Nanotechnology(纳米技术研究所) Hamburg University of Technology(汉堡技术大学) Federal University of Paraná(帕拉纳联邦大学) University of Brasília(巴西利亚大学) Federal University of Pelotas(普拉多斯联邦大学) Institute of Physics and International Center of Physics(物理研究所和国际物理中心)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出GENIUS框架,融合量子ESPRESSO知识图谱与分层大语言模型,通过有限状态错误恢复机器实现从自由文本到验证输入文件的自动生成,在295个基准测试中达到约80%的成功率,并大幅降低推理成本与幻觉。

Journal ref Communications Materials 7, 115 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13893 2026-05-25 cs.CL 81%

InfiGFusion: Graph-on-Logits Distillation via Efficient Gromov-Wasserstein for Model Fusion

InfiGFusion:通过高效Gromov-Wasserstein进行图对逻辑蒸馏的模型融合

Yuanyi Wang, Zhaoyi Yan, Yiming Zhang, Qi Zhou, Yanggan Gu, Fei Wu, Hongxia Yang

机构 * The Hong Kong Polytechnic University(香港理工大学) Zhejiang University(浙江大学) Daya Bay Technology and Innovation Research Institute(大亚湾技术与创新研究院)

专题命中 效率与部署 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出InfiGFusion,一种结构感知的模型融合框架,通过图对逻辑蒸馏损失显式建模词汇维度间的语义依赖,并利用排序闭式近似将Gromov-Wasserstein距离的计算复杂度从O(n^4)降至O(n log n),在多个基准上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20519 2026-05-25 cs.SD cs.AI 81%

Codec-Robust Attacks on Audio LLMs

针对音频大语言模型的编解码鲁棒攻击

Jaechul Roh, Jean-Philippe Monteuuis, Jonathan Petit, Amir Houmansadr

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Qualcomm(高通)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出CodecAttack,通过在神经音频编解码器的连续潜在空间中优化扰动,实现对抗Opus、MP3和AAC-LC等有损压缩的鲁棒攻击,平均目标子串攻击成功率85.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23065 2026-05-25 cs.CV cs.AI cs.LG 81%

Dithering Defense: Adversarial Robustness of Vision Foundation Models via Multi-Level Floyd-Steinberg Dithering

抖动防御:通过多级 Floyd-Steinberg 抖动实现视觉基础模型的对抗鲁棒性

Yury Belousov, Brian Pulfer, Vitaliy Kinakh, Slava Voloshynovskiy

机构 * Department of Computer Science, University of Geneva, Switzerland(日内瓦大学计算机科学系)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出多级 Floyd-Steinberg 误差扩散抖动作为轻量级、模型无关的输入变换,以破坏对抗扰动同时保留语义内容,在多个任务和模型上超越或匹配包括基于扩散的去噪在内的基线方法。

Comments Paper accepted at the IEEE International Conference on Image Processing (ICIP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21889 2026-05-25 cs.CL cs.AI cs.LG 80%

TingIS: Real-time Risk Event Discovery from Noisy Customer Incidents at Enterprise Scale

TingIS:企业级规模下从嘈杂客户事件中实时发现风险事件

Jun Wang, Ziyin Zhang, Rui Wang, Hang Yu, Peng Di, Rui Wang

机构 * Ant Group(蚂蚁集团) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出TingIS系统,通过多阶段事件链接引擎结合高效索引与大型语言模型,从嘈杂客户事件中稳定提取可操作事件,实现企业级实时风险发现。

Comments Accepted to ACL 2026 Industry Track (oral presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14821 2026-05-25 cs.CV 78%

POTR: Post-Training 3DGS Compression

POTR:训练后3DGS压缩

Bert Ramlot, Martijn Courteaux, Peter Lambert, Glenn Van Wallendael

机构 * IDLab-MEDIA research group(IDLab-MEDIA研究组) Ghent University(根特大学) imec

专题命中 效率与部署 :post-training(title,abstract)

AI总结 提出POTR后训练压缩框架,通过改进的3DGS光栅化器高效剪枝和重算光照系数,实现2-4倍剪枝率和1.5-2倍推理加速,在率失真和速度上优于现有方法。

Comments 15 pages, 12 figures. Submitted to IEEE TCSVT, under review

Journal ref IEEE Transactions on Circuits and Systems for Video Technology (TCSVT), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12260 2026-05-25 cs.CL 77%

PRISM: Pareto-Efficient Retrieval over Intent-Aware Structured Memory for Long-Horizon Agents

PRISM:面向长周期智能体的意图感知结构化记忆的帕累托高效检索

Jingyi Peng, Zhongwei Wan, Weiting Liu, Qiuzhuang Sun

机构 * Singapore Management University(新加坡管理大学) The Ohio State University(俄亥俄州立大学) Fudan University(复旦大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);language agent(abstract);分类 cs.CL

AI总结 提出PRISM框架,通过图结构记忆上的联合检索与压缩方法,在不训练的情况下实现长周期对话的高效记忆管理,显著提升准确率并降低上下文成本。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23493 2026-05-25 cs.AI 77%

EDGE-OPD: Internalizing Privileged Context with Evidence Guided On-Policy Distillation

EDGE-OPD:通过证据引导的在线策略蒸馏内化特权上下文

Aristotelis Lazaridis, Dylan Bates, Aman Sharma, Brian King, Vincent Lu, Jack FitzGerald

机构 * EdgeRunner AI

专题命中 效率与部署 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.AI

AI总结 针对在线策略自蒸馏中特权信息导致模型行为偏移的问题,提出EDGE-OPD方法,通过引导展开和证据掩码实现目标行为的高效迁移与通用能力保持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23190 2026-05-25 cs.CL 77%

Hidden Human-Like Nature of Machine-Generated Texts: Theory and Detection Enhancement

机器生成文本的隐藏类人本质:理论与检测增强

Chenwang Wu, Yiu-ming Cheung, Bo Han, Defu Lian

机构 * Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系) School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文揭示了机器生成文本中隐藏的类人片段,理论分析其对检测的影响,并提出模型无关的堆叠增强框架,通过硬EM迭代过滤类人片段来提升检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22843 2026-05-25 cs.CL cs.IR 77%

Knowledge Distillation for Low-Resource Open-source Text-to-SQL Model

面向低资源开源文本到SQL模型的知识蒸馏

Tianhao Qiu, Xiaojun Chen

机构 * Shenzhen University(深圳大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 针对低资源场景下文本到SQL任务中标注数据稀缺和领域知识缺失的问题,提出知识感知框架,通过构建任务特定知识库并注入训练和推理过程,提升开源和闭源大语言模型的性能。

Comments 17ages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23641 2026-05-25 cs.CR 75%

Kernel-Based ReLU Approximation for Homomorphic Encryption-Compatible Privacy-preserving Deep Learning Models

基于核的ReLU近似用于同态加密兼容的隐私保护深度学习模型

Dimitrios Sygletos, Dimitra Papatsaroucha, Marios Choudetsanakis, Ilias Politis, Evangelos K. Markakis

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出一种基于核的ReLU近似方法,使用二次多项式实现低乘法深度,支持同态加密下的隐私保护深度学习,并在预训练LLM的token嵌入上验证了近似保真度。

Comments 10 pages, 3 figures, submitted to the 33rd ACM Conference on Computer and Communications Security (CCS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23215 2026-05-25 cs.LG cs.AI cs.CL 75%

FastKernels: Benchmarking GPU Kernel Generation in Production

FastKernels:生产中GPU内核生成的基准测试

Gabriele Oliaro, Yichao Fu, May Jiang, Owen Lu, Junli Wang, Zhihao Jia, Hao Zhang, Samyam Rajbhandari

机构 * Snowflake AI Research(Snowflake AI研究院) CMU(卡内基梅隆大学) UCSD(加州大学圣地亚哥分校) Independent Researcher(独立研究者)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对现有基准与生产推理框架脱节的问题,提出FastKernels基准,包含46个代表性架构,覆盖96.2%的HuggingFace Transformers架构,并作为生产级推理框架,评估显示最强代理仅实现0.94倍加速,揭示基准-生产错位是关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07615 2026-05-25 cs.LG cs.CV 74%

Compression as Adaptation: Implicit Visual Representation with Diffusion Foundation Models

压缩即适应:基于扩散基础模型的隐式视觉表示

Zongyu Guo, Jiajun He, Zhaoyang Jia, Xiaoyi Zhang, Jiahao Li, Xiao Li, Bin Li, José Miguel Hernández-Lobato, Yan Lu

机构 * Microsoft Research Asia(微软亚洲研究院) University of Cambridge(剑桥大学)

专题命中 效率与部署 :foundation model(title);分类 cs.LG

AI总结 提出一种将视觉信号编码为函数的新框架,通过冻结的视觉生成模型附加低秩适应参数实现隐式表示,并进一步哈希为紧凑向量,在极低比特率下实现强感知视频压缩,同时支持推理时缩放和调控,统一了视觉压缩与生成。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏