arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 686 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 隐私与版权 686 篇

2605.11685 2026-05-13 cs.CL 57%

Robust LLM Unlearning Against Relearning Attacks: The Minor Components in Representations Matter

鲁棒的LLM去学习对抗重新学习攻击:表示中的次要成分至关重要

Zeguan Xiao, Xuanzhe Xu, Yun Chen, Yong Wang, Jian Yang, Yanqing Hu, Guanhua Chen

机构 * Shanghai University of Finance and Economics(上海金融学院) Alibaba Group(阿里巴巴集团) Southern University of Science and Technology(南方科技大学) Beihang University(北航)

专题命中 隐私与版权 :safety(abstract);分类 cs.CL

AI总结 本文研究了LLM去学习中对抗重新学习攻击的脆弱性,发现现有方法主要优化主导成分,而次要成分更抗反转。提出Minor Component Unlearning方法,通过聚焦稳健方向提升抗攻击能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05707 2026-05-12 cs.LG cs.CR 57%

Crowding Out The Noise: Algorithmic Collective Action Under Differential Privacy

消除噪声:在差分隐私下的算法集体行动

Rushabh Solanki, Meghana Bhange, Ulrich Aïvodji, Elliot Creager

机构 * University of Waterloo, Vector Institute(滑铁卢大学,向量研究所)

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.LG

AI总结 本文研究了在差分隐私下算法集体行动的挑战,分析了集体行动效果与隐私参数的关系,并通过实验验证了隐私成本对集体形成的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22868 2026-05-12 cs.CR cs.AI 57%

Agent-Sentry: Bounding LLM Agents via Execution Provenance

Agent-Sentry: 通过执行溯源界定了LLM代理

Rohan Sequeira, Stavros Damianakis, Umar Iqbal, Konstantinos Psounis

机构 * University of Southern California(南加州大学) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 隐私与版权 :safety(abstract);分类 cs.AI

AI总结 本文提出Agent Sentry,通过学习代理良性执行的边界来检测恶意行为,有效阻止注入攻击,同时允许良性执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06239 2026-05-08 cs.LG 57%

When Graph Language Models Go Beyond Memorization

图语言模型超越记忆

Masatsugu Yamada, Mahito Sugiyama

机构 * National Institute of Informatics(日本信息处理研究所) SOKENDAI

专题命中 隐私与版权 :alignment(abstract);分类 cs.LG

AI总结 研究通过诊断协议区分图语言模型的记忆与结构对齐,发现大规模下模型能学习超越记忆的结构规律,但稀有模式仍存在覆盖不足。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05718 2026-05-08 cs.LG 57%

Enabling Federated Inference via Unsupervised Consensus Embedding

通过无监督共识嵌入实现联邦推断

Yui Hashimoto, Takayuki Nishio, Yuichi Kitagawa, Takahito Tanimura

机构 * School of Engineering, Institute of Science Tokyo(东京科学研究院工程学院) Research & Development Group, Hitachi Ltd.(日立株式会社研发部)

专题命中 隐私与版权 :alignment(abstract);分类 cs.LG

AI总结 本文提出CE-FI框架,通过共识嵌入层和协作输出层实现无需共享模型参数或原始输入的联邦推断,实验表明其在图像分类任务中优于单独推断并在非IID条件下表现优异。

Comments 18 pages, 15 figures, submitted to IEEE Transactions on Mobile Computing (TMC) (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00364 2026-05-04 cs.CL 57%

Unlearning What Matters: Token-Level Attribution for Precise Language Model Unlearning

撤销重要信息:针对语言模型精确撤销的标记级归因

Jiawei Wu, DouDou Zhou

机构 * Department of Statistics and Data Science, National University of Singapore(统计与数据科学系,新加坡国立大学)

专题命中 隐私与版权 :safety(abstract);分类 cs.CL

AI总结 本文提出TokenUnlearn框架,通过标记级归因实现精确撤销,结合知识意识信号和熵意识信号生成重要性评分,改进梯度信噪比,实验显示在遗忘效果和效用保持方面优于序列级基线。

Comments 17 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14549 2026-04-28 cs.CR cs.AI 57%

Can Large Language Models Really Recognize Your Name?

大语言模型真的能识别你的名字吗?

Dzung Pham, Peter Kairouz, Niloofar Mireshghallah, Eugene Bagdasarian, Chau Minh Pham, Amir Houmansadr

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Google Research(谷歌研究) Carnegie Mellon University(卡内基梅隆大学) Google Research, University of Massachusetts Amherst(谷歌研究,马萨诸塞大学阿默斯特分校) University of Maryland, College Park(马里兰大学学院市分校)

专题命中 隐私与版权 :prompt injection(abstract);分类 cs.AI

AI总结 本文研究大语言模型在短文本中处理模糊人名的可靠性问题,构建AmBench基准测试集,发现模型对模糊人名的识别率下降20-40%,揭示隐私保护中的公平性问题。

Comments ACM FAccT '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00929 2026-04-23 cs.LG cs.CR 57%

Verification of Machine Unlearning is Fragile

验证机器去学习是脆弱的

Binchi Zhang, Zihan Chen, Cong Shen, Jundong Li

机构 * University of Virginia(弗吉尼亚大学)

专题命中 隐私与版权 :safety(abstract);分类 cs.LG

AI总结 本文探讨了机器去学习验证的脆弱性,提出两种对抗性去学习过程以绕过现有验证策略,揭示了验证方法的局限性。

Comments ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15220 2026-04-21 cs.CL 57%

Privacy Collapse: Benign Fine-Tuning Can Break Contextual Privacy in Language Models

隐私崩溃:良性微调可能在语言模型中破坏上下文隐私

Anmol Goel, Cornelius Emde, Sangdoo Yun, Seong Joon Oh, Martin Gubri

机构 * Parameter Lab(参数实验室) TU Darmstadt(图腾达姆斯塔特大学) University of Oxford(牛津大学) NAVER AI Lab(NAVER AI实验室) University of Tübingen(图宾根大学)

专题命中 隐私与版权 :safety(abstract);分类 cs.CL

AI总结 研究发现语言模型在良性微调过程中可能因训练数据中的细微模式导致上下文隐私崩溃,揭示了当前安全评估在专用代理部署中的关键缺口。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17133 2026-04-21 cs.AI cs.CR 57%

If Only My CGM Could Speak: A Privacy-Preserving Agent for Question Answering over Continuous Glucose Data

若我的连续葡萄糖监测仪能说话:一个隐私保护的问答代理

Yanjun Cui, Ali Emami, Temiloluwa Prioleau, Nikhil Singh

机构 * Dartmouth College(达特茅斯学院) Emory University(埃默里大学)

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出CGM-Agent框架,通过本地计算实现隐私保护的连续葡萄糖数据问答,评估显示顶级模型在合成和现实查询中准确率分别为94%和88%。

Comments Accepted by ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14705 2026-04-17 cs.AI 57%

SynHAT: A Two-stage Coarse-to-Fine Diffusion Framework for Synthesizing Human Activity Traces

SynHAT:一种两阶段粗到细的扩散框架用于合成人类活动轨迹

Rongchao Xu, Lin Jiang, Dahai Yu, Ximiao Li, Guang Wang

机构 * Florida State University(佛罗里达州立大学)

专题命中 隐私与版权 :alignment(abstract);分类 cs.AI

AI总结 SynHAT通过粗到细的扩散框架解决人类活动轨迹合成中的复杂时空依赖和计算效率问题,提升数据真实性与隐私保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12168 2026-04-15 cs.CR cs.AI 57%

Fully Homomorphic Encryption on Llama 3 model for privacy preserving LLM inference

在Llama 3模型上实现全同态加密以实现隐私保护的LLM推理

Anes Abdennebi, Nadjia Kara, Laaziz Lahlou

专题命中 隐私与版权 :prompt injection(abstract);分类 cs.AI

AI总结 本文通过在Llama 3模型推理管道中集成基于后量子密码学的格基同态加密,提高模型对数据隐私攻击的防护能力,实验显示在i9 CPU上实现98%的文本生成准确率和237 ms的延迟,验证了方法的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14968 2026-04-14 cs.CR cs.CL 57%

Rethinking LLM Watermark Detection in Black-Box Settings: A Non-Intrusive Third-Party Framework

重新思考黑盒环境下的LLM水印检测:一种非侵入性的第三方框架

Zhuoshang Wang, Yubing Ren, Yanan Cao, Fang Fang, Xiaoxue Li, Li Guo

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) National Computer Network Emergency Response Technical Team, Coordination Center of China (CNCERT/CC)(国家计算机网络应急技术处理协调中心)

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL

AI总结 本文提出TTP-Detect框架,通过解耦检测与注入,实现非侵入性的第三方水印验证,提升检测性能和抗攻击能力。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06899 2026-04-09 cs.CR cs.LG cs.SE 57%

Data Leakage in Automotive Perception: Practitioners' Insights

自动驾驶感知中的数据泄露:从业者洞察

Md Abu Ahammed Babu, Sushant Kumar Pandey, Darko Durisic, Andras Balint, Miroslaw Staron

机构 * Volvo Cars(沃尔沃汽车) University of Gothenburg(哥德堡大学) Chalmers University of Technology(查尔姆斯理工大学) University of Groningen(格罗宁根大学)

专题命中 隐私与版权 :safety(abstract);分类 cs.LG

AI总结 研究通过访谈探讨自动驾驶感知领域从业者对数据泄露的认知、经验及应对策略,揭示其作为社会技术协调问题的特性,强调需建立共享定义和跨角色沟通以提升ML可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15115 2026-04-08 cs.LG 57%

Towards Reliable Forgetting: A Survey on Machine Unlearning Verification

迈向可靠的遗忘:机器遗忘验证的综述

Lulu Xue, Shengshan Hu, Wei Lu, Yan Shen, Dongxu Li, Peijin Guo, Ziqi Zhou, Minghui Li, Yanjun Zhang, Leo Yu Zhang

机构 * Huazhong University of Science and Technology(华中科技大学) University of Technology Sydney(悉尼科技大学) Griffith University(格里菲斯大学)

专题命中 隐私与版权 :alignment(abstract);分类 cs.LG

AI总结 本文综述了机器遗忘验证方法,提出行为验证与参数验证两类分类,分析现有方法的假设、优缺点及实际部署中的漏洞,指出当前验证研究的开放问题。

Comments Accepted by ACM Computing Surveys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20791 2026-04-08 cs.SE cs.AI 57%

From Cool Demos to Production-Ready FMware: Core Challenges and a Technology Roadmap

从Cool演示到生产级FMware:核心挑战和技术路线图

Gopi Krishnan Rajbahadur, Gustavo A. Oliva, Dayi Lin, Jiho Shin, Ahmed E. Hassan

机构 * Centre for Software Excellence, Huawei Canada(华为加拿大软件卓越中心) Queen's University(女王大学)

专题命中 隐私与版权 :alignment(abstract);分类 cs.AI

AI总结 本文探讨了从演示级到生产级FMware的过渡挑战,分析了FMware选型、数据对齐、提示工程等关键问题,并提出技术路线图以指导其规模化应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15567 2026-04-07 cs.LG stat.ML 57%

Model Privacy: A Unified Framework for Understanding Model Stealing Attacks and Defenses

模型隐私:理解模型窃取攻击与防御的统一框架

Ganghua Wang, Yuhong Yang, Jie Ding

机构 * University of Minnesota(明尼苏达大学)

专题命中 隐私与版权 :safety(abstract);分类 cs.LG

AI总结 本文提出统一框架'模型隐私',用于分析模型窃取攻击与防御,探讨实用性和隐私间的根本权衡,并通过实验验证防御机制的有效性。

Comments Journal of the Royal Statistical Society Series B: Statistical Methodology, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00586 2026-04-02 cs.CL 57%

More Human, More Efficient: Aligning Annotations with Quantized SLMs

更人性化、更高效:将注释与量化小型语言模型对齐

Jiayu Wang, Junyoung Lee

机构 * Home Team Science and Technology Agency(内政团队科技局)

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL

AI总结 本文提出通过量化小型语言模型在有限人类注释数据上进行微调,以获得高对齐性和确定性的评估与注释方法,提升了注释一致性并展示了其在情感分类任务中的通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02966 2026-04-02 cs.PL cs.AI cs.MA 57%

Lumos: Let there be Language Model System Certification

Lumos: 让语言模型系统认证成为可能

Isha Chaudhary, Vedaant Jain, Prineet Parhar, Kavya Sachdeva, Avaljot Singh, Sayan Ranu, Gagandeep Singh

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Indian Institute of Technology Delhi(印度理工学院德里分校)

专题命中 隐私与版权 :safety(abstract);分类 cs.AI

AI总结 Lumos提出首个系统化框架,通过概率编程DSL实现语言模型系统行为的正式认证,支持复杂关系和时间规格,揭示了先进视觉语言模型在自动驾驶场景中的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27994 2026-03-31 cs.HC cs.CY 57%

Filipino Students' Willingness to Use AI for Mental Health Support: A Path Analysis of Behavioral, Emotional, and Contextual Factors

菲律宾学生使用AI进行心理健康支持的意愿:行为、情感和情境因素的路径分析

John Paul P. Miranda, Rhiziel P. Manalese, Ivan G. Liwanag, Rodel T. Alimurong, Alvin B. Roque

专题命中 隐私与版权 :safety(abstract);分类 cs.CY

AI总结 研究探讨了行为、情感和情境因素如何影响菲律宾学生使用AI进行心理健康支持的意愿,发现习惯对意愿影响最大,后续为舒适度、情感益处等因素,强调情感安全与常规使用对提升意愿的重要性。

Comments 24 pages, 5 figures, 1 table, book chapter

Journal ref Implications for Students' Mental Health in the Digital Age: AI and Cyber Behavior (2026) 381-404

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26135 2026-03-30 cs.LG 57%

TinyML for Acoustic Anomaly Detection in IoT Sensor Networks

TinyML用于物联网传感器网络中的声音异常检测

Amar Almaini, Jakob Folz, Ghadeer Ashour

机构 * Deggendorf Institute of Technology(代根多夫应用技术大学) University of West Bohemia(西波希米亚大学) King Abdulaziz University(阿卜杜勒阿齐兹国王大学)

专题命中 隐私与版权 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种紧凑的TinyML流程,用于在物联网传感器网络中检测环境声音异常,通过提取梅尔频率倒谱系数并训练轻量级神经网络分类器,实现了91%的测试准确率和平衡的F1分数。

Journal ref 2025 5th International Conference on Electrical, Computer, Communications and Mechatronics Engineering (ICECCME), Zanzibar, Tanzania, 2025, pp. 1-5

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21106 2026-03-26 cs.CY cs.HC 57%

Tracing Users' Privacy Concerns Across the Lifecycle of a Romantic AI Companion

追踪浪漫AI伴侣生命周期中的用户隐私关切

Kazi Ababil Azam, Imtiaz Karim, Dipto Das

专题命中 隐私与版权 :safety(abstract);分类 cs.CY

AI总结 本文通过分析Reddit讨论,揭示浪漫AI伴侣生命周期中隐私问题的四个特征,强调隐私治理需贯穿使用全过程,支持可逆性并考虑亲密人机交互的情感脆弱性。

Comments 16 pages, 1 figure, in submission at a conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11191 2026-03-25 cs.AI cs.RO 57%

Multi-Modal Multi-Task (M3T) Federated Foundation Models for Embodied AI: Potentials and Challenges for Edge Integration

多模态多任务(M3T)联邦基础模型用于具身AI:边缘整合的潜力与挑战

Kasra Borazjani, Payam Abdisarabshali, Fardis Nadimi, Naji Khosravan, Minghui Liwang, Xianbin Wang, Yiguang Hong, Seyyedali Hosseinalipour

专题命中 隐私与版权 :safety(abstract);分类 cs.AI

AI总结 本文提出多模态多任务联邦基础模型(M3T-FFMs)用于具身AI,结合M3T-FMs的任务泛化能力和FL的隐私保护分布式训练,解决边缘部署中的异构具身、模态不平衡、带宽限制等挑战。

Comments Accepted for Publication in IEEE Internet of Things Magazine, 2025

Journal ref IEEE Internet of Things Magazine, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22363 2026-03-25 cs.SE cs.AI 57%

Early Discoveries of Algorithmist I: Promise of Provable Algorithm Synthesis at Scale

算法主义I:大规模可证明算法合成的前景

Janardhan Kulkarni

机构 * Microsoft(微软)

专题命中 隐私与版权 :alignment(abstract);分类 cs.AI

AI总结 本文提出通过LLM生成可证明的算法,结合理论与实践,展示Algorithmist在隐私、近似和可解释性任务中的有效算法生成与验证。

Comments 75 pages, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05027 2026-03-24 cs.AI 57%

S5-SHB Agent: Society 5.0 enabled Multi-model Agentic Blockchain Framework for Smart Home

S5-SHB代理:面向社会5.0的多模型代理区块链框架用于智能家居

Janani Rangila, Akila Siriweera, Incheon Paik, Keitaro Naruse, Isuru Jayanada, Vishmika Devindi

机构 * KD University(KD大学) University of Aizu(东亚大学)

专题命中 隐私与版权 :safety(abstract);分类 cs.AI

AI总结 本文提出S5-SHB代理框架,通过多代理协调和居民控制治理,解决智能家居中适应性共识、智能多代理协调和居民可控治理的问题。

Comments 15 pages, 15 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18377 2026-03-23 cs.CR cs.AI cs.ET 57%

PlanTwin: Privacy-Preserving Planning Abstractions for Cloud-Assisted LLM Agents

PlanTwin: 云辅助规划中的隐私保护规划抽象

Guangsheng Yu, Qin Wang, Rui Lang, Shuai Su, Xu Wang

机构 * University of Technology Sydney(悉尼技术大学) CSIRO Data61(CSIRO数据61)

专题命中 隐私与版权 :safety(abstract);分类 cs.AI

AI总结 PlanTwin通过构建规划导向的数字孪生,实现云辅助规划中本地环境信息的隐私保护,同时保持规划质量接近全上下文系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19011 2026-03-20 cs.CR cs.AI 57%

Security awareness in LLM agents: the NDAI zone case

LLM代理中的安全意识:NDAI区域案例

Enrico Bottazzi, Pia Park

机构 * Leku

专题命中 隐私与版权 :safety(abstract);分类 cs.AI

AI总结 研究探讨LLM代理在安全环境识别中的能力差异,发现失败的证明会抑制披露,而成功的证明导致不同模型反应不一,揭示LLM在检测危险信号方面可靠但无法验证安全,需进一步改进以支持隐私保护代理协议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18013 2026-03-20 cs.CL 57%

Learned but Not Expressed: Capability-Expression Dissociation in Large Language Models

学会但未表达:大型语言模型中的能力-表达脱节

Toshiyuki Shigemura

机构 * Independent Researcher(独立研究员)

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL

AI总结 研究探讨了大型语言模型在特定条件下能重构训练数据内容,但无法在常规生成任务中表现的能力脱节现象,发现生成输出中未出现非因果解决方案框架。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16881 2026-03-19 cs.LG 57%

Federated Multi Agent Deep Learning and Neural Networks for Advanced Distributed Sensing in Wireless Networks

联邦多智能体深度学习与神经网络用于无线网络中的高级分布式传感

Nadine Muller, Stefano DeRosa, Su Zhang, Chun Lee Huan

机构 * Faculty of Information Technology and Electrical Engineering, University of Oulu(信息科技与电气工程学院,奥卢大学)

专题命中 隐私与版权 :safety(abstract);分类 cs.LG

AI总结 本文综述了多智能体深度学习在分布式传感和无线通信中的应用,涵盖学习框架、神经网络架构、高级技术及应用领域,分析了算法、训练拓扑及系统级权衡,并指出未来6G中的开放问题和研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16219 2026-03-18 cs.CL 57%

SpecSteer: Synergizing Local Context and Global Reasoning for Efficient Personalized Generation

SpecSteer:协同局部上下文与全局推理以实现高效个性化生成

Hang Lv, Sheng Liang, Hao Wang, Yongyue Zhang, Hongchao Gu, Wei Guo, Defu Lian, Yong Liu, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL

AI总结 本文提出SpecSteer框架,通过结合本地上下文与云端推理,解决个性化生成中的隐私与推理能力矛盾,实现高效生成并提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏