arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-25 至 2026-05-25 共收录 274 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 68 篇

2605.23159 2026-05-25 econ.GN cs.AI q-fin.EC 70%

Generative AI and the Reorganization of Labor Demand

生成式AI与劳动力需求的重组

Fangyan Wang, Zaiyan Wei, Yang Wang

机构 * Mitch Daniels School of Business, Purdue University(普渡大学米切尔丹尼尔斯商学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文利用美国职位发布数据,通过两阶段大语言模型管道测量生成式AI暴露度,发现劳动力需求调整主要通过职位间重新分配(占52%)和职位内任务重新设计(占39.5%)两个渠道,且不同职业阶梯的调整模式存在差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26411 2026-05-25 cs.AI 70%

MedSAE: Dissecting MedCLIP Representations with Sparse Autoencoders

MedSAE: 用稀疏自编码器剖析MedCLIP表示

Riccardo Renzulli, Colas Lepoutre, Enrico Cassano, Marco Grangetto

机构 * University of Turin(都灵大学) École polytechnique(巴黎-萨克勒高等理工学院)

专题命中 评测与基准 :language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 提出MedSAE方法,通过稀疏自编码器解析MedCLIP的潜在空间,结合相关性指标、熵分析和自动神经元命名框架,在CheXpert数据集上验证了比原始MedCLIP特征更高的单语义性和可解释性。

Comments Accepted at ICIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03784 2026-05-25 cs.LG 70%

Insulin Resistance Prediction From Wearables and Routine Blood Biomarkers

从可穿戴设备和常规血液生物标志物预测胰岛素抵抗

Ahmed A. Metwally, A. Ali Heydari, Daniel McDuff, Alexandru Solot, Zeinab Esmaeilpour, Anthony Z Faranesh, Menglian Zhou, David B. Savage, Conor Heneghan, Shwetak Patel, Cathy Speed, Javier L. Prieto

机构 * Google Research(谷歌研究) Institute of Metabolic Science, University of Cambridge(剑桥大学代谢科学研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究利用可穿戴设备时间序列数据和血液生物标志物,通过深度神经网络模型预测胰岛素抵抗,在最大规模远程招募数据集上实现了优于单一数据源的性能,并展示了模型在肥胖和久坐人群中的高灵敏度及可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22829 2026-05-25 cs.IR cs.AI 70%

LFRAG: Layout-oriented Fine-grained Retrieval-Augmented Generation on Multimodal Document Understanding

LFRAG:面向布局的多模态文档理解中的细粒度检索增强生成

Yifan Zhu, Yu Mi, Yue Lu, Yanchu Guan, Zhixuan Chu

机构 * Zhejiang University(浙江大学) Hangzhou High-Tech Zone (Binjiang) Zhejiang University Institute of Blockchain and Data Security(杭州高新技术区(滨江)浙江大学区块链与数据安全研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出LFRAG框架,通过布局分割和语义-布局融合编码器实现从页面级到块级的细粒度检索,提升多模态文档检索精度并减少生成冗余,在LFDocQA基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11416 2026-05-25 cs.CL 70%

Freeze Deep, Train Shallow: Interpretable Layer Allocation for Continued Pre-Training

冻结深层,训练浅层:面向持续预训练的可解释层分配

Yu-Hang Wu, Qin-Yuan Liu, Qiu-Yang Zhao, Bo Jiang, Jiang-Feng Yang, Qing-Wei Cong

机构 * Nanhu Research Institute of China Electronic Science and Technology(中国电子科技科技研究院纳米研究所) School of Electronic and Electrical Engineering, Shanghai University of Engineering Science(上海工程技术大学电子电气工程学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出LayerTracer框架,通过定位任务执行位置和量化层敏感性揭示层表示演化模式,发现深层是任务关键区域且对干扰更新稳定,训练浅层冻结深层在C-Eval和CMMLU上优于全参数微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23695 2026-05-25 cs.CR 67%

Validating Threat Modeling Results with the Help of Vulnerable Test Applications

借助易受攻击的测试应用验证威胁建模结果

Oleksandr Adamov, Davide Fucci, Felix Viktor Jedrzejewski, Ricardo Britto, Nishrith Saini

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文提出利用已知漏洞的测试应用作为基准,通过比较LLM辅助工具ThreMoLIA与微软威胁建模工具MTMT在AzureGoat和VulnBank上的漏洞覆盖率,验证威胁建模结果的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.01552 2026-05-25 cs.CL cs.AI cs.LG 67%

Perhaps PTLMs Should Go to School -- A Task to Assess Open Book and Closed Book QA

或许PTLMs应该去上学——一项评估开卷和闭卷问答的任务

Manuel R. Ciosici, Joe Cecil, Alex Hedges, Dong-Ho Lee, Marjorie Freedman, Ralph Weischedel

机构 * Information Sciences Institute, University of Southern California(信息科学研究所,南加州大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出一项基于大学教科书内容的新问答任务,通过闭卷和开卷测试评估预训练语言模型对教材的理解能力,发现模型在闭卷测试中表现接近随机,开卷测试略有提升。

Comments Identical to the EMNLP 2021 version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22841 2026-05-25 physics.soc-ph cs.AI cs.CL cs.GT cs.MA econ.GN q-fin.EC 66%

Strategic Coercion Within Alliances: The Greenland Sovereignty Game as an AI Stress Test

联盟内的战略胁迫:格陵兰主权博弈作为人工智能压力测试

Rommin Adl, Peyton Williams

机构 * Grinnell College(格里纳尔学院)

专题命中 评测与基准 :LLM(abstract,comments);分类 cs.CL、cs.AI

AI总结 通过多智能体模拟和逆向博弈论,研究美国对格陵兰的领土胁迫行为,揭示前沿大语言模型在联盟博弈中的升级倾向、模型间差异及和平解决路径。

Comments 78 pages, 17 figures, 18 tables. Multi-agent LLM simulation recovering structural utility parameters across 8 frontier models in the Greenland sovereignty crisis. v3: typo pass, fixes phantom action names (REQUEST_MULTILATERAL, INDEPENDENT) and a Blunden date mismatch. v2 added Section V safety findings (legitimacy-laundered escalation, signal decoupling) and Appendix H

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23118 2026-05-25 cs.CV cs.AI cs.LG 62%

Exploiting Longitudinal Context in Clinician-Verified Interactive Lesion Tracking

在临床医生验证的交互式病灶追踪中利用纵向上下文

Yannick Kirchhoff, Maximilian Rokuss, Daniel Philipp Mertens, David Füller, Benjamin Hamm, Andreas Schreyer, Oliver Ritter, Klaus Maier-Hein

机构 * German Cancer Research Center (DKFZ) Heidelberg, Division of Medical Image Computing, Germany(德国癌症研究中心(DKFZ)海德堡,医学图像计算部,德国) Faculty of Mathematics and Computer Science, Heidelberg University, Germany(海德堡大学数学与计算机科学学院,德国) HIDSS4Health -- Helmholtz Information and Data Science School for Health, Karlsruhe/Heidelberg, Germany(HIDSS4Health——海德堡信息与数据科学健康学校,卡尔斯鲁厄/海德堡,德国) Medical Faculty, Heidelberg University, Germany(海德堡大学医学学院,德国) University Hospital Brandenburg an der Havel, Brandenburg Medical School Theodor Fontane, Germany(勃兰登堡运河大学医院,布兰登堡泰奥多尔·冯·_fontane医学学校,德国) Pattern Analysis and Learning Group, Department of Radiation Oncology, Heidelberg University Hospital, Germany(放射肿瘤科模式分析与学习组,海德堡大学医院,德国)

专题命中 评测与基准 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出一种临床医生验证的追踪范式,结合早期空间提示融合与潜在时间差异加权,通过大规模合成预训练提升纵向上下文利用,在MICCAI autoPET IV挑战中获第一,并发布PanTrack基准。

Comments Accepted at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23028 2026-05-25 cs.LG cs.CL cs.CV 62%

RADAR: Relative Angular Divergence Across Representations

RADAR: 表示间的相对角度散度

Xavier Cadet, Mateusz Nowak, Peter Chin

机构 * Dartmouth College(达特茅斯学院)

专题命中 评测与基准 :foundation model(abstract);分类 cs.CL、cs.LG

AI总结 提出RADAR指标,通过分析层间表示的角度对齐和距离变化来估计基础模型中的跨域迁移性,在视觉和文本基准上表现优异。

Comments 27 pages; 8 figures; 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22866 2026-05-25 cs.AI cs.LG 62%

BOHM: Zero-Cost Hierarchical Attribution for Compound AI Systems

BOHM:复合AI系统的零成本层次归因

Joss Armstrong

机构 * Ericsson Research(爱立信研究)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 提出BOHM方法,从路由权重中提取层次归因树,实现零成本、多分辨率归因,与SHAP互补且无需访问组件内部。

Comments 35 pages, 10 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22833 2026-05-25 cs.IR cs.AI cs.LG 62%

RAG4Outcome: A Retrieval-Augmented Multimodal Framework for Prognostic Prediction in Chronic Osteomyelitis

RAG4Outcome:用于慢性骨髓炎预后预测的检索增强多模态框架

Daqian Shi, Pei Han, Jishizhan Chen, Yang Wang, Xiaolei Diao, Xianyou Zheng, Pengfei Cheng

机构 * Queen Mary University of London(女王玛丽大学) Shanghai Sixth People’s Hospital Affiliated to SJTU School of Medicine(上海第六人民医院附属复旦大学医学院) University College London(大学学院伦敦)

专题命中 评测与基准 :prompting(abstract);分类 cs.AI、cs.LG

AI总结 提出RAG4Outcome框架,通过检索增强生成技术融合PET-CT影像报告、结构化手术诊断记录和非结构化随访笔记等多模态临床数据,实现慢性骨髓炎的预后预测,提高可解释性和临床可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23899 2026-05-25 cs.AI 57%

From Raw Experience to Skill Consumption: A Systematic Study of Model-Generated Agent Skills

从原始经验到技能消费:模型生成智能体技能的系统研究

Zisu Huang, Jingwen Xu, Yifan Yang, Ziyang Gong, Qihao Yang, Muzhao Tian, Xiaohua Wang, Changze Lv, Xuemei Gao, Qi Dai, Bei Liu, Kai Qiu, Xue Yang, Dongdong Chen, Xiaoqing Zheng, Chong Luo

机构 * Fudan University(复旦大学) Microsoft Research(微软研究院) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :language agent(abstract);分类 cs.AI

AI总结 本文系统研究了模型生成技能在语言智能体中的全生命周期(经验生成、技能提取、技能消费),通过构建效用评估框架发现技能平均有益但存在负迁移,并提出了元技能以提升技能质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17134 2026-05-25 cs.CL 57%

RoIt-XMASA: Multi-Domain Multilingual Sentiment Analysis Dataset for Romanian and Italian

RoIt-XMASA:面向罗马尼亚语和意大利语的多领域多语言情感分析数据集

Andrei-Marius Avram, Aureliu Valentin Antonie, Cosmin-Mircea Croitoru, Vlad Andrei Muntean, Dumitru-Clementin Cercel

机构 * National University of Science and Technology POLITEHNICA Bucharest(波兰科技大学布加勒斯特分校)

专题命中 评测与基准 :prompting(abstract);分类 cs.CL

AI总结 本文构建了包含36,000条标注和202,141条未标注样本的罗马尼亚语和意大利语多领域情感分析数据集RoIt-XMASA,并提出一种基于元学习损失反转的多目标对抗训练框架,在XLM-R上取得66.23%的F1分数,比基线提升4.64%。

Comments Accepted at the International AAAI Conference on Web and Social Media (ICWSM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23420 2026-05-25 cs.CL 57%

Naturalistic measure of social norms alignment

社会规范一致性的自然主义度量

Yevhen Kostiuk, Kenneth Enevoldsen, Peter Bjerregaard Vahlstrup, Márton Kardos, Kristoffer Nielbo

机构 * Aarhus University(奥胡斯大学)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL

AI总结 提出通过解决方案匹配在自然主义自由形式设置中测量社会规范一致性的框架,并引入陈述一致性和显式一致性两个指标,基于丹麦语社会困境数据集评估LLM与人类的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17879 2026-05-25 cs.CV cs.AI 57%

Anatomy-Guided Vision-Language Learning with Angular Prototype Separation for Multi-Label Video Capsule Endoscopy Classification Under Class Imbalance

解剖引导的视觉-语言学习与角度原型分离用于类别不平衡下的多标签视频胶囊内镜分类

Podakanti Satyajith Chary, Nagarajan Ganapathy

机构 * Department of Engineering Science, IIT Hyderabad(印度海得拉尔理工学院工程科学系) Department of Biomedical Engineering, IIT Hyderabad(印度海得拉尔理工学院生物医学工程系)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 针对视频胶囊内镜多标签分类中的极端类别不平衡问题,提出结合角度分离损失和生物状态机解码器的框架,利用解剖上下文和原型学习提升罕见类检测性能。

Comments 12 pages, 1 figure, ICPR 2026 RARE-VISION Competition

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23790 2026-05-25 cs.CV 50%

Exploring deep learning for Event-Based Saliency Prediction with a Transformer-based model

探索基于事件的显著性预测:一种基于Transformer的模型

Romaric Mazna, Jean Martinet, Sai Deepesh Pokala

机构 * i3S/CNRS, Université Côte d’Azur(i3S/CNRS,法国国家科学研究中心,埃克塞特大学)

专题命中 评测与基准 :pretraining(abstract)

AI总结 提出SEST模型,利用自监督预训练的事件Swin Transformer和轻量CNN解码器,从事件数据预测动态显著性图,并创建两个新基准数据集,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23747 2026-05-25 cs.CV 50%

Revitalizing Dense Material Segmentation: Stabilized Vision Transformers and the Generalization Paradox

复兴密集材质分割:稳定的视觉Transformer与泛化悖论

Allan Kazakov, Duygu Cakir, Hilal Kurt İrfanoğlu, Yavuz İrfanoğlu

机构 * Bahcesehir University, Istanbul, Turkey(巴塞希尔大学,伊斯坦布尔,土耳其) Poder Bilişim Teknolojileri Sanayi ve Ticaret A.Ş., Istanbul, Turkey(Poder信息科技工业和贸易股份有限公司,伊斯坦布尔,土耳其) Galatasaray University, Istanbul, Turkey(加拉塔萨雷大学,伊斯坦布尔,土耳其)

专题命中 评测与基准 :foundation model(abstract)

AI总结 针对密集材质分割任务,提出稳定训练方法(高保真logit投影、查询熵正则化、物理增强)使SegFormer-B5达到SOTA,并揭示数据重划分导致分布同质化的泛化悖论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10077 2026-05-25 cs.CV 50%

DocRevive: A Unified Pipeline for Document Text Restoration

DocRevive:文档文本恢复的统一流水线

Kunal Purkayastha, Ayan Banerjee, Josep Llados, Umapada Pal

机构 * Computer Vision Center(计算机视觉中心) Indian Statistical Institute(印度统计研究所)

专题命中 评测与基准 :language model(abstract)

AI总结 提出DocRevive统一流水线,结合OCR、图像分析、掩码语言建模和扩散模型,用于恢复受损文档文本并保持视觉完整性,同时提出UCSM评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23304 2026-05-25 cs.CV 50%

General Hazard Detection

通用危险检测

Stephanie Ng, CP Lim, SueJen Looi, Hendrik Zurlinden, David Nguyen, Lei Wei, Saeid Nahavandi, Hailing Zhou

机构 * Swinburne University of Technology(斯winburne大学) National Transport Research Organisation(国家交通运输研究组织) Google Cloud(谷歌云) Deakin University(德金大学)

专题命中 评测与基准 :language model(abstract)

AI总结 针对现有危险检测系统在抽象安全概念上的局限性,提出基于规则合规评估的CompliVision数据集和结合LLaVA视觉推理与人在回路反馈的通用危险检测框架。

Comments 20 pages, 7 figures and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23068 2026-05-25 cs.CV 50%

RoboSurg-VQA: A Multimodal Benchmark for Surgical Segmentation-Aware Visual Question Answering

RoboSurg-VQA:面向手术分割感知的视觉问答多模态基准

Chengyi Zhang, Zi Ye, Ziyang Wang

机构 * Swansea University, UK(威尔士大学) Maynooth University, Ireland(迈诺特大学) Aston University, UK(阿斯顿大学)

专题命中 评测与基准 :prompting(abstract)

AI总结 提出RoboSurg-VQA基准,通过重新利用公共手术分割数据集,构建分割感知的视觉问答任务,以评估在机器人辅助和微创手术中恶劣视觉条件下的语言化临床问题理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 52 篇

2605.23057 2026-05-25 cs.LG cs.CL cs.PF 92%

ModeSwitch-LLM: A Lightweight Phase-Aware Controller for Cross-Mode LLM Inference on a Single GPU

ModeSwitch-LLM:单GPU上跨模式LLM推理的轻量级阶段感知控制器

Aman Sunesh, Ali Alshehhi, Hivansh Dhakne

机构 * New York University Abu Dhabi(纽约大学阿布扎克分校) New York University(纽约大学) United States(美国)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出一种轻量级请求边界控制器ModeSwitch-LLM,通过基于工作负载特征在FP16、量化、推测解码等推理模式间路由请求,在单GPU上实现平均延迟加速2.10倍、每token能耗降低51.7%,且精度几乎无损。

Comments 10 pages main text, 11 pages including references, 5 figures, 3 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23158 2026-05-25 cs.CR cs.CL cs.LG 91%

What Does the Server See? Understanding Privacy Leakage from Large Language Models in Split Inference

服务器看到了什么?理解大语言模型在分割推理中的隐私泄露

Mingyuan Fan, Yu Liu, Fuyi Wang, Cen Chen

机构 * East China Normal University(华东师范大学) RMIT University(皇家墨尔本理工大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL、cs.LG

AI总结 提出ActInv方法解决中间激活匹配问题以重建客户端输入,并引入扰动放大因子(PAF)量化层固有抗重建能力,揭示隐私脆弱性在层间不均匀分布,进而设计PriPert防御策略。

Comments Accepted to ACM CCS'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23280 2026-05-25 cs.DB 91%

BCTuner: LLM-Guided Monte Carlo Tree Search for Efficient Blockchain Knob Tuning

BCTuner: 基于LLM引导的蒙特卡洛树搜索实现高效区块链参数调优

Yaoyi Deng, Chongyang Tao, Mingxuan Li, Xuelian Lin, Han Sun, Mingchao Wan, Shuai Ma

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对许可区块链参数调优中架构复杂、语义鸿沟及试错成本高的问题,提出BCTuner框架,结合大语言模型知识推理与蒙特卡洛树搜索,通过结构化动作轨迹逐步构建配置并自适应剪枝,显著提升吞吐量并减少系统交互次数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11215 2026-05-25 cs.DC cs.AI 90%

ReCoVer: Resilient LLM Pre-Training System via Fault-Tolerant Collective and Versatile Workload

ReCoVer: 通过容错集合和多功能工作负载实现的弹性LLM预训练系统

Ziyue Liu, Zhengyang Wang, Ruijie Zhang, Avinash Maurya, Hui Zhou, Paul Hovland, Sheng Di, Franck Cappello, Bogdan Nicolae, Zheng Zhang

机构 * University of California at Santa Barbara(加州大学圣芭芭拉分校) Argonne National Laboratory(阿贡国家实验室)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出ReCoVer系统,通过保持每次迭代微批次数恒定、容错集合通信、步内细粒度恢复和动态工作负载重分配,实现并行方案无关的弹性LLM预训练,在512 GPU上即使丢失256 GPU也能保持训练轨迹,有效吞吐量比检查点重启基线高2.23倍。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22897 2026-05-25 cs.LG 90%

From Residuals to Reasons: LLM-Guided Mechanism Inference from Tabular Data

从残差到原因:基于LLM的表格数据机制推断

Mohammad R. Rezaei, Rahul G. Krishnan

机构 * Department of Computer Science(计算机科学系) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 提出多智能体残差上下文学习框架(MARICL),通过让LLM分析基础模型残差并迭代生成修正项,在多个科学基准上提升预测性能并实现机制泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23389 2026-05-25 cs.DC 89%

AlignedServe: Orchestrating Prefix-aware Batching to Build a High-throughput and Computing-efficient LLM Serving System

AlignedServe:编排前缀感知批处理以构建高吞吐量和计算高效的LLM服务系统

Fengyao Bai, Hongbin Zhang, Zhitao Chen, Jiangsu Du, Zhiguang Chen, Yutong Lu

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对LLM服务中解码迭代内的气泡问题,提出基于前缀感知批处理的AlignedServe框架,通过分组相似KV缓存长度的请求、CPU内存维护大量飞行请求、批级调度和GPU间预取KV缓存,显著提升解码吞吐量并降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03117 2026-05-25 cs.CR 89%

PromptCOS: Towards Content-only System Prompt Copyright Auditing for LLMs

PromptCOS: 面向LLM的仅内容系统提示版权审计

Yuchen Yang, Yiming Li, Hongwei Yao, Enhao Huang, Shuo Shao, Yuyi Wang, Zhibo Wang, Dacheng Tao, Zhan Qin

专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract)

AI总结 针对系统提示版权审计中内容级验证不稳定的问题,提出基于内容输出相似性的PromptCOS方法,通过循环输出信号和辅助令牌实现水印稳定性与保真度,实验表明高效且鲁棒。

Comments This paper is accepted by IEEE S&P 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20102 2026-05-25 cs.LG cs.AI 88%

BarrierSteer: LLM Safety via Learning Barrier Steering

BarrierSteer: 通过学习障碍引导实现大语言模型安全

Thanh Q. Tran, Arun Verma, Kiwan Wong, Bryan Kian Hsiang Low, Daniela Rus, Wei Xiao

机构 * Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系) Singapore-MIT Alliance for Research and Technology Centre(新加坡-麻省理工联合研究中心) CSAIL, Massachusetts Institute of Technology(麻省理工学院计算机科学与人工智能实验室) Worcester Polytechnic Institute(沃斯堡理工学院)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract,comments);language model(abstract,comments);分类 cs.AI、cs.LG

AI总结 提出 BarrierSteer 框架,通过将学习到的非线性安全约束作为控制障碍函数嵌入潜在表示空间,在推理时引导模型生成安全内容,理论保证且不修改模型参数。

Comments This paper introduces SafeBarrier, a framework that enforces safety in large language models by steering their latent representations with control barrier functions during inference, reducing adversarial and unsafe outputs

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23640 2026-05-25 cs.CR 88%

CachePrune: Privacy-Aware and Fine-Grained KV Cache Sharing for Efficient LLM Inference

CachePrune:面向高效LLM推理的隐私感知细粒度KV缓存共享

Guanlong Wu, Zhaohan li, Yao Zhang, Zheng Zhang, Jianyu Niu, Ye Wu, Yinqian Zhang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对跨用户KV缓存共享带来的侧信道泄露问题,提出CachePrune机制,通过令牌级细粒度缓存管理实现隐私感知的KV条目选择性重用,在消除直接泄露的同时显著降低首令牌延迟并提高缓存命中率。

详情

展开后加载摘要…

URL PDF HTML 收藏