arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 53 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 隐私与版权 53 篇

2608.01311 2026-08-04 cs.CL 新提交 83%

RH-RAG: Trustworthy Long-Form Generation for Privacy-Constrained Settings

RH-RAG:适用于隐私受限场景的可信长文本生成

Raj Shekhar Singh

机构 * Indian Institute of Technology, Roorkee(鲁尔基印度理工学院)

专题命中 隐私与版权 :trustworthy(title,abstract);alignment(abstract);分类 cs.CL

AI总结 该研究针对隐私受限场景下的长文本生成难题,提出基于本地语言模型的多智能体框架RH-RAG,通过三阶段协同生成与双层检索索引提升生成质量,且兼顾数据隐私。

Comments accepted in KDD 2026 SeT-LLM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24819 2026-06-24 cs.CR 新提交 82%

HelpBench: Assessing the Ability of LLMs to Provide Privacy, Safety, and Security Advice

HelpBench:评估LLM提供隐私、安全和安全建议的能力

Sarah Meiklejohn, Sunny Consolvo, Patrick Gage Kelley, Tara Matthews, Sai Teja Peddinti, Renee Shelby, Lenin Simicich, Kurt Thomas

专题命中 隐私与版权 :safety(title,abstract);trustworthy(abstract)

AI总结 提出HelpBench基准,通过450个真实用户问题评估18个LLM的隐私、安全建议准确性,发现平均得分82%但10%回答低于65%存在有害建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21710 2026-06-23 cs.CL cs.AI cs.IR 新提交 81%

PrivacyAlign: Contextual Privacy Alignment for LLM Agents

PrivacyAlign: LLM代理的上下文隐私对齐

Manveer Singh Tamber, Abhay Puri, Marc-Etienne Brunet, Perouz Taslakian, Jimmy Lin, Spandana Gella

机构 * University of Waterloo(滑铁卢大学) ServiceNow AI Research(ServiceNow AI 研究) McGill University(麦吉尔大学) Mila -- Quebec AI Institute(米拉——魁北克人工智能研究所)

专题命中 隐私与版权 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 提出PrivacyAlign数据集,通过人类标注对齐LLM代理的隐私决策,并引入基于标注的奖励建模以提升隐私对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15687 2026-07-20 cs.LG 新提交 79%

Toward Federated Multimodal Graph Foundation Models: A Topology-Aware Multimodal Alignment Framework

迈向联邦多模态图基础模型:一种拓扑感知多模态对齐框架

Xunkai Li, Guohao Fu, Yuming Ai, Zhengyu Wu, Hongchao Qin, Rong-Hua Li, Guoren Wang

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 隐私与版权 :alignment(title,abstract);分类 cs.LG

AI总结 研究针对多模态属性图分散在不同隐私受限孤岛的问题,提出FedGAMMA框架,将联邦多模态图基础学习视为两阶段语义结构对齐问题,经实验验证该框架在下游任务中表现出色,超越诸多基线,在少样本学习场景下也有优势。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25533 2026-06-25 cs.CR cs.CL 新提交 79%

Security and Privacy in Retrieval-Augmented Generation: Architectures, Threats, Defenses, and Future Directions for Building Trustworthy Systems

检索增强生成中的安全与隐私:构建可信系统的架构、威胁、防御与未来方向

Balamurugan Palanisamy, G S S Chalapathi, Vikas Hassija, Rajkumar Buyya

机构 * Department of Electrical and Electronics Engineering(电子与电气工程系) Birla Institute of Technology and Science, Pilani, Pilani Campus(比拉理工学院和科学学院,比拉校区) Department of Computer Engineering, KIIT University(计算机工程系,KIIT大学) Quantum Cloud Computing and Distributed Systems (qCLOUDS) Laboratory(量子云计算与分布式系统(qCLOUDS)实验室) Department of Computing and Information Systems(计算与信息系统系) The University of Melbourne(墨尔本大学)

专题命中 隐私与版权 :trustworthy(title,abstract);分类 cs.CL

AI总结 本文综述了检索增强生成系统在集中式、设备端、联邦和混合范式下的隐私与安全挑战,提出了涵盖检索、上下文构建和生成阶段的统一威胁分类,并分析了攻击类别及防御策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14442 2026-07-17 cs.CR 新提交 78%

Disclosure Divergence: Measuring Privacy Policy and Data Safety Misalignment at Scale

披露差异:大规模衡量隐私政策与数据安全的不一致性

Mst Eshita Khatun, Lamine Noureddine, Sideeq Bello, Aisha Ali-Gombe

专题命中 隐私与版权 :safety(title,abstract)

AI总结 针对移动应用隐私政策与数据安全标签表述不一致问题,通过对6051款安卓应用大规模实证研究,利用基于大语言模型的框架和统一模式,测量一致性并引入风险评分,发现敏感类别受影响大,凸显披露机制差距,强调加强验证与提高透明度。

Journal ref Proceedings on Privacy Enhancing Technologies (PoPETs) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13088 2026-07-16 cs.CR cs.LG 新提交 77%

Securing LLMs in the Wild: Privacy and Security Challenges at the Edge

保障野外大语言模型安全:边缘环境下的隐私与安全挑战

Ren-Yi Huang, Mingchen Li, Dumindu Samaraweera, Morris Chang

机构 * Department of Electrical and Computer Engineering, University of South Florida(电子与计算机工程系,佛罗里达州立大学) Department of Mathematics, Embry-Riddle Aeronautical University(数学系,埃默里-瑞德航空大学)

专题命中 隐私与版权 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.LG

AI总结 研究边缘大语言模型安全隐私挑战,围绕内存墙等架构约束引入分类法,得出统一约束模型,提出安全操作效率得分,给出决策程序和缓解措施,为联合评估安全、隐私和效率提供框架,保障边缘原生智能系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09867 2026-08-11 cs.CR cs.AI cs.LG 新提交 73%

Stealing Reasoning Traces from Proprietary LLM APIs

从专有大语言模型API窃取推理轨迹

Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer-Kellner, Joachim Schaeffer, Ameya Prabhu, Jonas Geiping, Maksym Andriushchenko

专题命中 隐私与版权 :jailbreak(abstract);prompt injection(abstract);分类 cs.AI、cs.LG

AI总结 该研究发现专有LLM API的加密推理轨迹存在跨会话、用户及模型的兼容性漏洞,开发了可扩展解密越狱方法,能提取模型推理、窃取PII等,还提出了对应缓解措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24523 2026-06-24 cs.CL cs.AI 新提交 73%

Poster: Exploring the Limits of Audio-Based Detection of Turkish Phone Call Scams

海报:探索基于音频的土耳其电话诈骗检测的极限

Arda Eren, Micheal Cheung, Youqian Zhang, Grace Ngai, Eugene Yujun Fu

机构 * The Hong Kong Polytechnic University(香港理工大学) The Education University of Hong Kong(香港教育大学)

专题命中 隐私与版权 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 针对土耳其语电话诈骗,构建首个多模态数据集(100对音频-文本),评估7个LLM在三种输入条件下的检测性能,发现基于文本的输入优于直接音频处理。

Comments Poster paper accepted at 47th IEEE Security & Privacy 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18847 2026-07-22 cs.CR cs.AI 新提交 70%

Data Leakage Prevention in Agentic Applications via Preemptive Hardening

通过先发制硬化防止智能应用中的数据泄露

Akansha Shukla, Emily Bellov, Parth Atulbhai Gandhi, Yuval Elovici, Asaf Shabtai

机构 * Faculty of Computer and Information Science(计算机与信息科学系) Ben-Gurion University of the Negev(内盖夫本· Gurion大学)

专题命中 隐私与版权 :jailbreak(abstract);prompt injection(abstract);分类 cs.AI

AI总结 研究智能应用数据泄露问题,提出预部署管道,通过分析提示模板等识别泄露模式并生成补丁,经硬化和验证确保应用功能不受影响,评估显示能有效减少数据泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16227 2026-07-21 cs.LG cs.CR 新提交 70%

LLM Unlearning for Cyber Defense: A Survey on Methods, Challenges, and Emerging Threats

用于网络防御的大语言模型遗忘:方法、挑战及新出现威胁的综述

Ruppikha Sree Shankar, Abhishek Bhardwaj, Arnav Doshi, Anusri Nagarajan, Troy Paulus Asia, Saptarshi Sengupta

机构 * Manipal Institute of Technology, Manipal Academy of Higher Education(马尼帕尔理工学院,马尼帕尔高等教育学院) San José State University(圣何塞州立大学)

专题命中 隐私与版权 :safety(abstract);jailbreak(abstract);分类 cs.LG

AI总结 综述聚焦于网络防御中LLM遗忘问题,探讨其面临风险,核心问题是现有方法能否真的去除知识。主要关注基于梯度的方法,因其与现有训练管道兼容且可扩展,从多方面审视LLM遗忘,为解决相关问题提供参考。

Comments 42 pages, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15980 2026-06-23 cs.LG cs.AI cs.CL 新提交 67%

Do Activation Monitors Survive Model Updates? Benchmarking, Predicting, and Repairing Activation-Monitor Staleness

安全监控器在更新后是否仍可靠?激活监控器陈旧性的基准测试与预测

Evan Duan

机构 * University of Michigan(密歇根大学)

专题命中 隐私与版权 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究语言模型更新后激活监控器是否仍可靠,发现量化更新影响小,微调更新常导致监控器失效,且可通过预部署特征预测退化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15948 2026-06-23 eess.SY cs.SY 新提交 67%

Artificial Intelligence for Power-Converter-Rich Electrical Systems: A Review

人工智能在富含电力电子变换器的电力系统中的应用综述

Pengfeng Lin, Yuan Gao, Yuxi Tang, Muhammad Waqas Qaisar, Peifeng Hui, Chuanlin Zhang, Miao Zhu, Xiaoyong, Cao, Chia-chi Chu, Peng Wang

专题命中 隐私与版权 :alignment(abstract);safety(abstract)

AI总结 本文综述了人工智能在富含电力电子变换器的电力系统全生命周期中的应用,涵盖设计、控制、运行和治理,并指出了部署关键差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07688 2026-06-09 cs.IR cs.AI cs.CL cs.LG 新提交 67%

TRACER: Token ReAssignment for Concept ERasure in Generative Recommendation

TRACER: 面向生成式推荐中概念擦除的令牌重分配

Ziheng Chen, Jiali Cheng, Zezhong Fan, Hadi Amiri, Diyuan Wu, Gabriele Tolomei, Yang Zhang

机构 * Stony Brook University(石英布鲁克大学) University of Massachusetts Lowell(马萨诸塞大学洛厄尔分校) Columbia University(哥伦比亚大学) Institute of Science and Technology Austria(奥地利科学技术研究院) Sapienza University of Rome(罗马大学 sapienza) National University of Singapore(新加坡国立大学)

专题命中 隐私与版权 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对生成式推荐中概念遗忘与推荐效用冲突的问题,提出基于令牌重分配的概念遗忘框架TRACER,通过将概念相关物品重分配给替代令牌并引入一致性正则化,有效移除目标概念同时保持推荐效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06265 2026-08-07 cs.AI cs.DB cs.LG 新提交 62%

Improving the Realism of Synthetic Clinical Benchmarks Under Utility Constraints

在效用约束下提升合成临床基准的真实性

Omid Bazgir, Md Nasir, Jacob Hoffman, Yang Yang, Manu Agrawal, Anusua Trivedi, Vinay Rao Dandin, Chris Gibbons, Christine Swisher

机构 * Oracle Health and Life Sciences(甲骨文健康与生命科学部门)

专题命中 隐私与版权 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文针对合成临床基准的结构不真实问题,提出在不破坏下游效用检查的前提下提升其真实性的方法,通过确定性修正改善基准指标,明确需将效用作为约束而非真实性的充分证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04772 2026-08-06 cs.CL cs.AI 新提交 62%

Guideline-as-Oracle: Zero-Annotation Training of an Ophthalmic Telephone Triage Agent

以指南为神谕:眼科电话分诊智能体的零标注训练

Chenyu Wang, Yi Liu, Baoqing Li, Min Tu, Diping Song

专题命中 隐私与版权 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出以指南为神谕(GAO)方法,将美国眼科学会指南转化为训练监督信号,零标注训练出GAO-Triage智能体,大幅提升眼科电话分诊的一致性与紧急案例召回率,且性能优于7个通用系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16660 2026-07-21 cs.SE cs.AI cs.CR cs.IR cs.LG 新提交 62%

How Do You Choose Your AI Component? An Interview Study of Secure AI Integration in Practice

你如何选择人工智能组件?关于安全人工智能集成实践的访谈研究

Mahzabin Tamanna, Elizabeth Lin, Sparsha Gowda, Laurie Williams, Dominik Wermke

机构 * North Carolina State University(北卡罗来纳州立大学)

专题命中 隐私与版权 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究通过访谈了解从业者选择和集成人工智能组件的决策及安全考量,发现其选模型多受功能标准驱动,安全常被忽视,集成过程缺安全关注,行业重蹈早期软件依赖管理覆辙,为此给出相关建议倡导安全设计方法。

Comments 18 pages, 3 figures/tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06963 2026-07-09 cs.CR cs.AI cs.CL 新提交 62%

Large Language Models (LLMs) and Generative AI in Cybersecurity and Privacy: A Survey of Dual-Use Risks, AI-Generated Malware, Explainability, and Defensive Strategies

大型语言模型(LLMs)和生成式人工智能在网络安全与隐私中的应用:两用风险、人工智能生成的恶意软件、可解释性及防御策略综述

Kiarash Ahi, Saeed Valizadeh

机构 * Virelya Intelligence Research Labs(Virelya智能研究实验室) Google(谷歌)

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 综述大型语言模型和生成式人工智能在网络安全中的应用,涵盖两用风险等多方面。通过回顾众多资料及实际案例研究,给出负责任部署建议与安全路线图,为应对人工智能驱动的网络安全挑战提供关键参考。

Comments Invited survey paper. 10 pages, 5 figures, 2 tables

Journal ref IEEE 6th Silicon Valley Cybersecurity Conference (SVCC), San Francisco, CA, USA, 2025, pp. 1-10

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03213 2026-07-07 cs.CV cs.AI cs.CL cs.HC 新提交 62%

OpenGlass: A Sensing-Computing Split Architecture for Local MLLM-Driven Real-Time Visual Assistance

OpenGlass:用于本地MLLM驱动的实时视觉辅助的传感-计算分离架构

Mengzhang Li, Yuan Yao

机构 * Shanghai Qizhi Institute(上海期智研究院) College of AI, Tsinghua University(清华大学人工智能学院)

专题命中 隐私与版权 :safety(abstract);分类 cs.CL、cs.AI

AI总结 针对视障和低视力用户,OpenGlass以传感-计算分离解决云MLLM辅助需上传数据、有网络延迟,以及可穿戴眼镜计算和电量受限问题,在本地设备实现低延迟多模态视觉辅助,并给出评估结果。

Comments Accepted to ACL 2026 System Demonstrations. 11 pages, 5 figures, 8 tables

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 3: System Demonstrations), pages 829-839, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02636 2026-07-07 cs.LG cs.AI cs.CV cs.DC 新提交 62%

Federated Learning for Object Detection: Enabling Collaborative Drone Learning Without Centralizing Data

用于目标检测的联邦学习:实现无需集中数据的协作式无人机学习

Daniel M. Jimenez-Gutierrez, Enrique Zuazua, Georgios Kellaris, Joaquin del Rio, Oleksii Sliusarenko, Xabi Uribe-Etxebarria

专题命中 隐私与版权 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究将联邦学习应用于无人机目标检测,通过本地保留图像数据实现隐私保护,在KIIT - MiTA数据集上实现联邦目标检测管道,对比单无人机和集中式基线,结果显示该方法可实现分布式无人机机群的可扩展、高性能且隐私保护的目标检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00010 2026-07-02 cs.IR cs.AI cs.CL 新提交 62%

Prompt Optimization for User Simulation in Conversational Recommender Systems: A Multi-Objective Framework

对话推荐系统中用户模拟的提示优化:一个多目标框架

Nipun B Nair, Tongtong Wu, Weiqing Wang

机构 * Monash University(莫纳什大学)

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出多目标框架自动优化LLM提示,以生成更真实、多样化的用户模拟行为,缓解对话推荐系统中的评估与数据获取难题。

Comments to be published in 2026 IEEE 42nd International Conference on Data Engineering Workshops (ICDEW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24783 2026-06-24 cs.CL cs.AI 新提交 62%

Paying to Know: Micro-Transaction Markets for Verified Product Information in Agentic E-Commerce

付费知情:代理型电商中已验证产品信息的微交易市场

Filippos Ventirozos, Matthew Shardlow

机构 * Manchester Metropolitan University(曼彻斯特城市大学)

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 提出代理型电商作为已验证信息的微交易市场,买家代理通过微支付逐步获取卖家与评论者提供的数据,以解决信息可信度瓶颈,并转化为具体NLP问题。

Comments 8 pages, 1 figure. Vision paper, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17122 2026-06-17 cs.CR cs.AI cs.LG 新提交 62%

TrustErase: Auditable Instant Machine Unlearning with Passport-Embedded Representations

TrustErase:基于护照嵌入表示的可审计即时机器遗忘

Rutger Hendrix, Leonardo G. Russo, Concetto Spampinato, Matteo Pennisi, Giovanni Bellitto

机构 * University of Catania(卡塔尼亚大学)

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 提出TrustErase框架,利用护照嵌入表示实现无需数据、可验证的即时遗忘,通过参数高效适配层中的护照作为密钥,仅需停用即可移除特定类别或数据集,无需重训练或微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15335 2026-06-16 cs.CL cs.AI 新提交 62%

Privacy-Preserving Text Sanitization for Distributed Agents Collaboration via Disentangled Representations

基于解耦表示的分布式智能体协作隐私保护文本净化

Xuan Liu, Hefeng Zhou, Sicheng Chen, Chao Yang, Xingcheng Xu, Jingjing Qu, Jiong Lou, Jie LI, Xia Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出DiSan框架,通过解耦文本为任务语义和风格子空间,结合联邦原型对齐与对抗正则化,在分布式多智能体协作中实现隐私保护,显著降低风格归因和PII泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10796 2026-06-10 cs.CL cs.AI 新提交 62%

Dep-LLM: Training-Free Depression Diagnosis via Evidence-Guided Structured Multi-factor with Reliable LLM Reasoning

Dep-LLM:基于证据引导的结构化多因素与可靠LLM推理的无训练抑郁症诊断

Yiqing Lyu, Xianbing Zhao, Buzhou Tang, Ronghuan Jiang

机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen, Guangdong, China(哈尔滨工业大学(深圳)计算机科学与技术学院) School of Artificial Intelligence and Computer Science, Jiangnan University, Wuxi, China(江南大学人工智能与计算机学院) Guangdong Provincial Key Laboratory of Intelligent Information Processing(广东省智能信息处理重点实验室) Pengcheng Laboratory(鹏城实验室) Chinese People’s Liberation Army General Hospital, Beijing, China(中国人民解放军总医院)

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 提出无训练框架Dep-LLM,通过思维链多因素分析、置信度调制和协作预测,在冻结LLM上实现抑郁症诊断,超越零样本和微调方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13394 2026-08-14 eess.SP cs.AI cs.MA 新提交 57%

Heterogeneity-Aware Belief Synchronization for Semantic Communication in AI-Native 6G Networks

面向AI原生6G网络中语义通信的异质性感知信念同步

Muhammad Hannan Akram, Muhammad Abubakar Rashid, Wassi Haider Kabir, Haejoon Jung, Kapal Dev, Syed Ali Hassan

专题命中 隐私与版权 :alignment(abstract);分类 cs.AI

AI总结 针对AI原生6G网络中异构AI模型导致的信念对齐难题,提出基于MEC服务器潜在翻译模型的异质性感知信念同步框架,可降低同步成本、保护隐私并维持低信念对齐误差。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10166 2026-08-12 cs.CR cs.AI 新提交 57%

MarkNull: Model-Agnostic Watermark Removal in AI-Generated Images via On-Manifold Latent Manipulation

MarkNull:通过流形上潜在空间操纵实现AI生成图像的模型无关水印去除

Jie Cao, Qi Li, Zelin Zhang, Xiaodong Wu, Lingshuang Liu, Xiangman Li, Jianbing Ni

专题命中 隐私与版权 :alignment(abstract);分类 cs.AI

AI总结 本文提出MarkNull及变体MarkNull-A,通过流形上潜在空间操纵实现AI生成图像的模型无关水印去除,可降低水印比特准确率至近随机猜测水平,还能破解谷歌SynthID-Image系统,为防御提供攻击检测机制。

Comments Accepted to the 35th USENIX Security Symposium (USENIX Security 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09278 2026-08-11 cs.SE cs.AI 新提交 57%

Software Engineering for and with GUI Agent

面向GUI智能体的软件工程及与GUI智能体协同的软件工程

Shengcheng Yu, Yuchen Ling, Junyang Xing, Quan Zhou, Chunrong Fang, Zhenyu Chen

专题命中 隐私与版权 :safety(abstract);分类 cs.AI

AI总结 该研究通过分析2018年1月至2026年4月的336篇GUI智能体论文,指出其在恢复机制、安全执行等方面的不足,提出需结合可靠执行与生命周期测试等以构建可部署的GUI智能体系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08245 2026-08-11 cs.CR cs.AI cs.HC 新提交 57%

Privacy-Preserving Data Drift Detection and Recovery for Large-Scale LLM Applications via Proxy Representations

基于代理表示的大规模大语言模型应用的隐私保护数据漂移检测与恢复

Michael Levit, Josh Ledgard, Haoyu Dong, Vishwas Suryanarayanan, Eyal Kolman, Sharon Tan, Qiang Gan, Vishal Chowdhary

专题命中 隐私与版权 :alignment(abstract);分类 cs.AI

AI总结 针对大规模LLM应用的隐私约束导致的评估与漂移追踪难题,提出ProxyDrift框架,基于非PII代理表示实现无敏感数据暴露的漂移监测与合成数据生成,实验验证其对齐度达RA~0.9。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08138 2026-08-11 cs.CV cs.LG 新提交 57%

EFFEKT: Efficient Federated Knowledge Transfer to Foundation Models

EFFEKT:面向基础模型的高效联邦知识迁移

Matteo Caligiuri, Francesco Barbato, Pietro Zanuttigh, Francesco Restuccia

机构 * Northeastern University(东北大学) University of Padua(帕多瓦大学)

专题命中 隐私与版权 :alignment(abstract);分类 cs.LG

AI总结 EFFEKT是一种联邦学习框架,通过双向跨蒸馏策略,结合轻量级客户端代理模型与服务器端基础模型,实现高效的领域特定LoRA适配器训练,在低功耗边缘设备上性能优于基线。

Comments 12 main content pages, 8 appendix pages; 3 main figures, 9 appendix figures; 8 main tables, 9 appendix tables; 1 main algorithm, 4 appendix algorithms; accepted at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏