arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-09 至 2026-04-09 共收录 52 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 52 篇

2604.06263 2026-04-09 cs.GT cs.AI cs.IR cs.LG 90%

Incentive-Aware Multi-Fidelity Optimization for Generative Advertising in Large Language Models

面向激励的多保真度优化用于大语言模型生成广告

Jiayuan Liu, Barry Wang, Jiarui Gan, Tonghan Wang, Leon Xie, Mingyu Guo, Vincent Conitzer

机构 * Carnegie Mellon University(卡内基梅隆大学) Adelaide University(阿德莱德大学) University of Oxford(牛津大学) Harvard University(哈佛大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出IAMFM框架,结合VCG激励与多保真度优化,解决生成广告中广告商策略行为和高成本的约束问题,通过主动反事实优化提升计算效率,实验表明其在不同预算下优于单保真度基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22599 2026-04-09 cs.DC cs.DB cs.LG 89%

DisCEdge: Distributed Context Management for Large Language Models at the Edge

DisCEdge:边缘侧大规模语言模型的分布式上下文管理

Mohammadreza Malekabbasi, Minghe Wang, David Bermbach

机构 * TU Berlin(柏林工业大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 本文提出DisCEdge,一种在边缘节点存储和复制用户上下文的系统,通过token化形式避免冗余计算,提升响应速度并降低同步开销。

Comments Accepted for publication in EuroMLSys '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00870 2026-04-09 cs.CR cs.AI 89%

ConfusionPrompt: Practical Private Inference for Online Large Language Models

ConfusionPrompt:在线大型语言模型的实用隐私推断

Peihua Mai, Youjia Yang, Ran Yan, Rui Ye, Yan Pang

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 ConfusionPrompt通过分解提示和生成伪提示,提升在线LLM的隐私保护,实现隐私与效用的平衡。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03044 2026-04-09 cs.CL cs.AI 89%

JoyAI-LLM Flash: Advancing Mid-Scale LLMs with Token Efficiency

JoyAI-LLM Flash: 通过令牌效率推进中等规模语言模型

Aichen Cai, Anmeng Zhang, Anyu Li, Bo Zhang, Bohua Cai, Chang Li, Changjian Jiang, Changkai Lu, Chao Xue, Chaocai Liang, Cheng Zhang, Dongkai Liu, Fei Wang, Guoqiang Huang, Haijian Ke, Han Lin, Hao Wang, Ji Miao, Jiacheng Zhang, Jialong Shi, Jifeng Zhu, Jingjing Qian, Junhui Luo, Junwu Xiong, Lam So, Liang Huang, Ming Ke, Mingyang Li, Panfeng Shi, Peng Hao, Qi Wang, Qian Lai, Qiaoqiao Yuan, Qingyu Yin, Qiong Cao, Qixiang Wang, Rongcheng Bian, Rongduo Han, Shaoqiang Zheng, Shi Hu, Shi Suo, Shijie Ren, Shijin Zhang, Shiying Fan, Shuai Xie, Tianyi Zhang, Wei Liu, Wentao Tan, Xianghan Meng, Xiaodong He, Xing Pan, Xiran Wang, Xuyang Peng, Ya Zhang, Yang Liu, Yangyang Duan, Yanxu Chen, Yicheng Gong, Yidan Huang, Yifei Liu, Yinhao Bai, Yongqiang Liu, Yuesong Zhang, Yuqi Zhang, Zerui Xie, Zhenfang Wang, Zhennan Shen, Zheyuan Liu, Zhuwei Zeng

专题命中 效率与部署 :LLM(title,abstract);language model(abstract);post-training(abstract);SFT(abstract)

AI总结 本文提出JoyAI-LLM Flash,一种高效的混合专家语言模型,通过平衡性能与令牌效率,在50B参数以下的范围内重新定义性能与效率的权衡。

Comments Xiaodong He is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19433 2026-04-09 cs.CV 88%

dMLLM-TTS: Self-Verified and Efficient Test-Time Scaling for Diffusion Multi-Modal Large Language Models

dMLLM-TTS:用于扩散多模态大语言模型的自验证和高效测试时间扩展

Yi Xin, Siqi Luo, Tianxiang Xu, Qi Qin, Haoxing Chen, Kaiwen Zhu, Zhiwei Zhang, Yangfan He, Rongchao Zhang, Jinbin Bai, Shuo Cao, Bin Fu, Junjun He, Yihao Liu, Yuewen Cao, Xiaohong Liu

机构 * Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Lab(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) National University of Singapore(新加坡国立大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出dMLLM-TTS框架,通过轨迹探索扩展和迭代细化扩展两个互补的扩展轴,提升生成多样性和稳定性,同时通过自验证机制提高效率,实验表明在GenEval基准上生成质量显著提升且效率提高6倍。

Comments Project page: https://github.com/Alpha-VLLM/Lumina-DiMOO

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06217 2026-04-09 cs.CY cs.AI 87%

The End of the Foundation Model Era: Open-Weight Models, Sovereign AI, and Inference as Infrastructure

基础模型时代的终结:开放权重模型、主权AI与推理作为基础设施

Jared James Grogan

机构 * Universitas AI

专题命中 效率与部署 :foundation model(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文探讨基础模型时代终结,指出经济、技术、商业和政治四个维度的重构,强调开放权重模型作为主权控制的工具。

Comments 44 pages, 75 references, 5 endnotes. Version 1.0, events covered through March 9, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23155 2026-04-09 cs.LG cs.AI 87%

SPICE: Submodular Penalized Information-Conflict Selection for Efficient Large Language Model Training

SPICE:基于子模惩罚的信息冲突选择用于高效大语言模型训练

Powei Chang, Jinpeng Zhang, Bowen Chen, Chenyu Wang, Chenlu Guo, Yixing Zhang, Yukang Gao, JianXiang Xiang, Yue Gao, Chaoqun Sun, Yiyi Chen, Dongying Kong

机构 * Bilibili Inc.(哔哩哔哩公司)

专题命中 效率与部署 :large language model(title);language model(title);instruction tuning(abstract);分类 cs.AI、cs.LG

AI总结 SPICE通过惩罚信息冲突提升大语言模型训练效率,利用子模惩罚优化信息选择,在减少数据量的同时实现性能提升。

Comments Accepted to ICLR 2026 main conference ; Code available at <https://github.com/Chang-pw/SPICE>

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06183 2026-04-09 cs.HC 87%

The Impact of Response Latency and Task Type on Human-LLM Interaction and Perception

响应延迟和任务类型对人与大语言模型交互与感知的影响

Felicia Fang-Yi Tan, Moritz A. Messerschmidt, Wen Yin, Oded Nov

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究探讨了响应延迟和任务类型对人与LLM交互行为及感知的影响,发现任务类型影响用户提示频率,延迟时间影响输出评价,提出延迟是可调节的设计变量。

Comments To be published in ACM CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06831 2026-04-09 cs.CR cs.AI 86%

Towards Privacy-Preserving Large Language Model: Text-free Inference Through Alignment and Adaptation

面向隐私保护的大语言模型:通过对齐与适应实现文本-free推理

Jeongho Yoon, Chanhee Park, Yongchan Chun, Hyeonseok Moon, Heuiseok Lim

机构 * Department of Computer Science and Engineering, Korea University(高丽大学计算机科学与工程系) Samsung Mobile eXperience Business(三星移动体验事业部)

专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract);分类 cs.AI

AI总结 本文提出PPFT方法,通过客户端编码器与服务器投影模块的协同训练,实现无需传输原始文本的隐私保护推理,平衡隐私与模型效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06666 2026-04-09 cs.CL cs.AI 86%

A Graph-Enhanced Defense Framework for Explainable Fake News Detection with LLM

一种基于图的增强防御框架用于可解释的假新闻检测与大语言模型

Bo Wang, Jing Ma, Hongzhan Lin, Zhiwei Yang, Ruichao Yang, Yuan Tian, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Hong Kong Baptist University(香港浸会大学) Guangdong Institute of Smart Education, Jinan University(暨南大学广东智慧教育研究院) University of Science and Technology Beijing(北京科技大学) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence(知识驱动人机智能教育部工程研究中心) International Center of Future Science, Jilin University(吉林大学未来科学国际合作中心)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出G-Defense框架,通过构建以声明为中心的图,利用检索增强生成技术获取证据并生成竞争性解释,以提高假新闻检测的准确性和解释质量。

Comments Accepted by TOIS

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06185 2026-04-09 cs.HC cs.AI cs.CL 86%

Benchmarking LLM Tool-Use in the Wild

在真实环境中评估大语言模型工具使用能力

Peijie Yu, Wei Liu, Yifan Yang, Jinjian Li, Zelong Zhang, Xiao Feng, Feng Zhang

机构 * Tencent(腾讯)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出WildToolBench基准测试,通过评估57个LLM在真实用户行为下的表现,揭示LLM在工具使用中的鲁棒性不足,强调需重新考虑LLM、用户与工具之间的交互。

Comments accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06627 2026-04-09 cs.CL 85%

DiffuMask: Diffusion Language Model for Token-level Prompt Pruning

DiffuMask: 用于令牌级提示压缩的扩散语言模型

Caleb Zheng, Jyotika Singh, Fang Tu, Weiyi Sun, Sujeeth Bharadwaj, Yassine Benajiba, Sujith Ravi, Eli Shlizerman, Dan Roth

机构 * University of Washington(华盛顿大学) Oracle AI(甲骨文人工智能)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.CL

AI总结 DiffuMask通过迭代掩码预测实现快速并行提示压缩,保留关键推理上下文,实现80%的提示长度缩减,同时保持或提升准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01423 2026-04-09 stat.ME 85%

Active Hypothesis Testing under Computational Budgets with Applications to GWAS and LLM

在计算预算下主动假设检验及其在GWAS和LLM中的应用

Qi Kuang, Bowen Gang, Yin Xia

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出了一种主动假设检验框架,利用低成本辅助统计量分配全局计算预算,通过数据自适应方法在保证有效性的同时满足预算约束,理论和实证结果表明其在固定资源限制下提升了统计效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07144 2026-04-09 cs.DC 85%

Autopoiesis: A Self-Evolving System Paradigm for LLM Serving Under Runtime Dynamics

自组织:一种面向LLM服务的自演化系统范式,用于运行时动态

Youhe Jiang, Ran Yan, You Peng, Wenshuang Li, Taiyi Wang, Fangcheng Fu, Binhang Yuan

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出Autopoiesis,一种自演化系统,使LLM服务从静态策略部署转向持续在线策略演化,通过实时动态驱动策略合成,提升服务在运行时动态下的适应性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06912 2026-04-09 cs.CV cs.AI 84%

Q-Zoom: Query-Aware Adaptive Perception for Efficient Multimodal Large Language Models

Q-Zoom:基于查询的自适应感知以实现高效多模态大语言模型

Yuheng Shi, Xiaohuan Pei, Linfeng Wen, Minjing Dong, Chang Xu

机构 * University of Sydney(悉尼大学) Sun Yat-sen University(中山大学) City University of Hong Kong(香港城市大学)

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.AI

AI总结 Q-Zoom通过高效粗到细的框架优化多模态大语言模型的高分辨率感知,提升推理速度并保持精度,实验表明其在文档识别和高分辨率场景中表现优异。

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06202 2026-04-09 cs.CL cs.AI 84%

Cross-Lingual Transfer and Parameter-Efficient Adaptation in the Turkic Language Family: A Theoretical Framework for Low-Resource Language Models

跨语言迁移与参数高效适应在突厥语系中的研究:突厥语系低资源语言模型的理论框架

O. Ibrahimzade, K. Tabasaransky

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出突厥语系多语言模型跨语言迁移与参数高效适应的理论框架,通过突厥语系语言的共性与差异分析,构建了基于形态相似性、词汇重叠和语法结构的突厥迁移系数模型。

Comments 22 pages, no figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16703 2026-04-09 cs.PF cs.AI cs.LG 84%

ShadowNPU: System and Algorithm Co-design for NPU-Centric On-Device LLM Inference

ShadowNPU:面向NPU为中心的设备端LLM推理的系统与算法协同设计

Wangsong Yin, Daliang Xu, Mengwei Xu, Gang Huang, Xuanzhe Liu

机构 * Key Lab of High Confidence Software Technologies (Peking University)(高可信软件技术重点实验室(北京大学)) State Key Laboratory of Networking and Switching Technology (BUPT)(网络与交换技术国家重点实验室(北京邮电大学))

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ShadowAttn,一种稀疏注意力模块,通过在NPU上稀疏计算少量token,减少对CPU/GPU的依赖,提升设备端LLM推理的效率和准确性。

Comments To Appear at MobiSys'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07173 2026-04-09 cs.DC 83%

InfiniLoRA: Disaggregated Multi-LoRA Serving for Large Language Models

InfiniLoRA:解耦的多LoRA服务用于大语言模型

Hongyu Chen, Letian Ruan, Zilin Xu, Yuchen Li, Xinyu Chen, Jingwen Leng, Bingsheng He, Minyi Guo, Shixuan Sun

专题命中 效率与部署 :large language model(title);language model(title)

AI总结 InfiniLoRA通过解耦LoRA执行与基础模型推理,提升多租户和多任务服务的效率与可扩展性,实验显示在严格延迟SLO下服务请求速率提升3.05倍,LoRA适配器满足SLO的百分比提高54.0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06833 2026-04-09 cs.CR cs.LG 83%

FedDetox: Robust Federated SLM Alignment via On-Device Data Sanitization

FedDetox: 通过设备端数据净化实现鲁棒的联邦SLM对齐

Shunan Zhu, Jiawei Chen, Yonghao Yu, Hideya Ochiai

机构 * The University of Tokyo(东京大学)

专题命中 效率与部署 :SLM(title);language model(abstract);small language model(abstract);分类 cs.LG

AI总结 FedDetox通过设备端数据净化技术,提升联邦学习中小型语言模型的安全对齐能力,保持模型安全性和通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19420 2026-04-09 cs.AI 81%

Commander-GPT: Dividing and Routing for Multimodal Sarcasm Detection

Commander-GPT:多模态讽刺检测的分工与路由

Yazhou Zhang, Chunwang Zou, Bo Wang, Jing Qin, Prayag Tiwari

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出Commander-GPT框架,通过分工协作的LLM代理团队,结合三种指挥官类型,提升多模态讽刺检测性能,实验结果显示在F1分数上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06871 2026-04-09 cs.CL cs.AI 81%

Do We Need Distinct Representations for Every Speech Token? Unveiling and Exploiting Redundancy in Large Speech Language Models

我们是否需要为每个语音令牌都使用不同的表示?揭示和利用大型语音语言模型中的冗余

Bajian Xiang, Tingwei Guo, Xuan Chen, Yang Han

机构 * Beike Inc.(贝壳找房)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大型语音语言模型中是否需要每个语音令牌都使用不同表示,通过层间干预揭示了冗余层次结构,并提出Affinity Pooling方法,有效压缩表示而不损失语义信息,实验表明在三个任务中实现了27.48%的计算节省和显著的效率提升。

Comments Accepted to ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19693 2026-04-09 cs.LG cs.AI 81%

TREASURE: The Visa Payment Foundation Model for High-Volume Transaction Understanding

TREASURE:高交易量理解的Visa支付基础模型

Chin-Chia Michael Yeh, Uday Singh Saini, Xin Dai, Xiran Fan, Shubham Jain, Yujie Fan, Jiarui Sun, Junpeng Wang, Menghai Pan, Yingtong Dou, Yuzhong Chen, Vineeth Rakesh, Liang Wang, Yan Zheng, Mahashweta Das

机构 * Visa Research(Visa研究院)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出TREASURE模型,用于高交易量数据理解,通过捕捉消费者行为和支付网络信号,提升异常检测和推荐系统性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06804 2026-04-09 cs.DB 80%

LASER: A Data-Centric Method for Low-Cost and Efficient SQL Rewriting based on SQL-GRPO

LASER: 一种数据驱动的低成本高效SQL重写方法基于SQL-GRPO

Jiahui Li, Tongwang Wu, Yuren Mao, Rong Kang, Tieying Zhang, Yunjun Gao

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 本文提出LASER,一种数据驱动的SQL重写方法,通过构建SQL-MCTS大规模语料库和SQL-GRPO专用对齐策略,提升小模型在SQL优化中的执行效率和零样本迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06277 2026-04-09 cs.AI cs.CL cs.LG 80%

Weakly Supervised Distillation of Hallucination Signals into Transformer Representations

弱监督蒸馏 hallucination 信号到 Transformer 表示

Shoaib Sadiq Salehmohamed, Jinal Prashant Thakkar, Hansika Aredla, Shaik Mohammed Omar, Shalmali Ayachit

机构 * LLM Lens

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出弱监督框架,通过子串匹配、句子嵌入相似性和LLM判官信号,无需人工标注即可标注生成响应是否 grounded 或 hallucinated,并通过五种探针分类器验证 hallucination 信号可被蒸馏到 Transformer 表示中。

Comments 20 pages, 6 figures, 6 tables. Introduces a 15k-sample representation-level hallucination dataset with full transformer hidden states and multi-signal weak supervision. Evaluates 5 probing architectures and demonstrates internal hallucination detection without external inference-time signals. Includes held-out test evaluation and deployment benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17421 2026-04-09 cs.CL cs.AI cs.LG 80%

LongSpec: Long-Context Lossless Speculative Decoding with Efficient Drafting and Verification

LongSpec: 长上下文无损推测解码与高效草稿生成与验证

Penghui Yang, Cunxiao Du, Fengzhuo Zhang, Haonan Wang, Tianyu Pang, Chao Du, Bo An

机构 * Sea AI Lab(Sea AI实验室) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 LongSpec通过三种创新解决长上下文场景下的推测解码问题,实现3.26倍速度提升和2.25倍时间减少,适用于长上下文理解任务。

Comments Accepted by ACL'25 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16206 2026-04-09 cs.CL cs.AI 80%

Computer Environments Elicit General Agentic Intelligence in LLMs

计算机环境在大语言模型中激发通用代理智能

Daixuan Cheng, Shaohan Huang, Yuxian Gu, Huatong Song, Guoxin Chen, Li Dong, Wayne Xin Zhao, Ji-Rong Wen, Furu Wei

机构 * GSAI, Renmin University of China(中国人民大学高瓴人工智能学院) Microsoft Research(微软研究院) Tsinghua University(清华大学)

专题命中 效率与部署 :LLM(abstract,comments);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了计算机环境如何通过虚拟沙盒激发大语言模型的通用能力,展示了环境对任务解决的提升效果及训练方法。

Comments Project Page: https://llm-in-sandbox.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06753 2026-04-09 cs.CL 79%

Select-then-Solve: Paradigm Routing as Inference-Time Optimization for LLM Agents

选择后再解决:作为大语言模型代理推理时间优化的范式路由

Heng Zhou, Zelin Tan, Zhemeng Zhang, Yutao Fan, Yibing Lin, Li Kang, Xiufeng Song, Rui Li, Songtao Huang, Ao Yu, Yuchen Fan, Yanxu Chen, Kaixin Xu, Xiaohong Liu, Yiran Qin, Philip Torr, Chen Zhang, Zhenfei Yin

专题命中 效率与部署 :LLM(title,abstract);分类 cs.CL

AI总结 研究通过比较六种推理范式在四个前沿LLM和十个基准上的表现,发现推理结构对任务效果有显著影响,提出选择后再解决方法通过轻量级嵌入路由提升任务准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06664 2026-04-09 cs.DC cs.LG 79%

Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start

Foundry:基于模板的CUDA图上下文材料化用于快速LLM服务冷启动

Xueshen Liu, Yongji Wu, Yuncheng Yao, Danyang Zhuo, Ion Stoica, Z. Morley Mao

机构 * University of Michigan(密歇根大学) UC Berkeley(加州大学伯克利分校) Duke(杜克大学)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.LG

AI总结 Foundry通过模板化CUDA图上下文材料化,减少LLM服务冷启动延迟,提升启动速度并保持吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06502 2026-04-09 cs.LG 79%

VLMShield: Efficient and Robust Defense of Vision-Language Models against Malicious Prompts

VLMShield: 有效且稳健的视觉语言模型对抗恶意提示防御

Peigui Qi, Kunsheng Tang, Yanpu Yu, Jialin Wu, Yide Song, Wenbo Zhou, Zhicong Huang, Cheng Hong, Weiming Zhang, Nenghai Yu

机构 * University of Science and Technology of China(中国科学技术大学) University of Washington(华盛顿大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.LG

AI总结 本文提出VLMShield,通过多模态聚合特征提取框架提升视觉语言模型对恶意提示的防御能力,实验显示其在鲁棒性、效率和实用性方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06440 2026-04-09 cs.CV cs.LG 79%

Visual prompting reimagined: The power of the Activation Prompts

视觉提示重新想象:激活提示的威力

Yihua Zhang, Hongkang Li, Yuguang Yao, Aochuan Chen, Shuai Zhang, Pin-Yu Chen, Meng Wang, Sijia Liu

机构 * Michigan State University(密歇根州立大学) University of Pennsylvania(宾夕法尼亚大学) New Jersey Institute of Technology(新泽西理工学院) IBM Research(IBM研究院) Rensselaer Polytechnic Institute(伦斯勒理工学院)

专题命中 效率与部署 :prompting(title,abstract);分类 cs.LG

AI总结 本文提出激活提示(AP)以改进视觉提示(VP),通过在中间层激活图上引入通用扰动,揭示VP在性能和效率上的固有局限,并在29个数据集上验证AP在准确性和效率上的优势。

Comments AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏