arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-17 至 2026-06-17 共收录 86 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3 篇

2605.09313 2026-06-17 cs.CV 版本更新 67%

Attention Sinks in Diffusion Transformers: A Causal Analysis

扩散变换器中的注意力 sinks:一种因果分析

Fangzheng Wu, Brian Summa

机构 * Department of Computer Science, Tulane University, New Orleans, LA, USA(路易斯安那州新奥尔良大学计算机科学系)

专题命中 偏好对齐 :alignment(abstract,abstract_cn)

AI总结 研究探讨了扩散变换器中注意力 sinks 的作用,通过动态识别并抑制注意力接收者,发现其对文本-图像对齐和偏好代理影响有限,但强干预下出现特定边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18005 2026-06-17 cs.AI econ.GN q-fin.EC 新提交 57%

LLM Consumer Behavior Theory: Foundations of a Novel Research Field

LLM消费者行为理论:一个新兴研究领域的基础

Manon Reusens, Sofie Goethals, David Martens

机构 * Department of Engineering Management, University of Antwerp(安特卫普大学工程管理系)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 本文提出LLM消费者行为理论,研究LLM代理在市场中代表人类消费决策的行为,整合经济学与自然语言处理,探讨偏好表达、市场聚合及理性假设的失效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17664 2026-06-17 cs.IR cs.AI 新提交 57%

Temporal Preference Optimization for Unsupervised Retrieval

面向无监督检索的时间偏好优化

HyunJin Kim, Jaejun Shim, Young Jin Kim, JinYeong Bak

机构 * Microsoft, Redmond, USA(微软公司,美国红mond) Sungkyunkwan University, Suwon, South Korea(成均馆大学,韩国首尔)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 提出TPOUR方法,通过时间检索偏好优化(TRPO)和可学习时间嵌入插值,使无监督稠密检索器能捕捉时间相关性,在时间信息检索任务上超越有监督和无监督基线。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 11 篇

2606.17872 2026-06-17 cs.LG cs.AI 新提交 86%

AnchorKV: Safety-Aware KV Cache Compression via Soft Penalty with a Refusal Anchor

AnchorKV: 通过拒绝锚点的软惩罚实现安全感知的KV缓存压缩

Ning Ni, Yingjie Lao

机构 * Department of Computer Science, Tufts University(塔夫茨大学计算机科学系) Department of Electrical and Computer Engineering, Tufts University(塔夫茨大学电气与计算机工程系)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 提出AnchorKV,一种通过软惩罚机制调整令牌保留分数以远离有害提示的KV缓存压缩方法,在保持实用性的同时显著提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16349 2026-06-17 cs.CR 新提交 82%

From Refusal Geometry to Safety Geometry: Harmfulness--Refusal Coupling under Dynamic Adversarial Fine-Tuning

从拒绝几何到安全几何:动态对抗微调下的有害性-拒绝耦合

Wenhao Lan, Shan Li, Xinhua Lai, Meiqi Wu, Junbin Yang, Haihua Shen

专题命中 安全训练 :safety(title,abstract);alignment(abstract)

AI总结 研究通过双安全几何协议测量语言模型在对抗微调中有害性与拒绝机制的耦合程度,发现R2D2训练早期高耦合带来强鲁棒性但牺牲实用性,后期低耦合恢复部分实用性但攻击成功率回升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08939 2026-06-17 cs.AI 版本更新 79%

CausalT5k: Diagnosing Refusal and Failure Modes in Trustworthy Causal Reasoning Across Causal Rungs

CausalT5k: 诊断可信因果推理中的拒绝与失败模式——跨越因果阶梯

Longling Geng, Andy Ouyang, Theodore Wu, Daphne Barretto, Matthew John Hayes, Rachael Cooper, Yuqiao Zeng, Sameer Vijay, Gia Ancone, Ankit Rai, Matthew Wolfman, Patrick Flanagan, Edward Y. Chang

机构 * Stanford University(斯坦福大学)

专题命中 安全训练 :trustworthy(title);safety(abstract);分类 cs.AI

AI总结 提出CTK基准,通过5,147个案例诊断大语言模型在因果推理中的失败模式,包括因果阶梯、陷阱类型、压力敏感性和拒绝质量等标注,揭示聚合准确率隐藏的缺陷。

Comments 12 pages, 17 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17526 2026-06-17 cs.LG 新提交 74%

MGUP: A Momentum-Gradient Alignment Update Policy for Stochastic Optimization

MGUP:一种用于随机优化的动量-梯度对齐更新策略

Da Chang, Ganzhao Yuan

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Shenzhen University of Advanced Technology(深圳理工大学) Pengcheng Laboratory(鹏城实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 安全训练 :alignment(title);分类 cs.LG

AI总结 提出MGUP机制,通过按固定比例选择参数施加大步长、其余参数用小步长,增强动量优化器,理论保证收敛,实验表明提升训练效率与稳定性。

Comments Published in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17062 2026-06-17 q-bio.QM cs.LG 新提交 57%

RadSEM: A Finding-by-Finding Metric for Clinical Consistency in Radiology Reports

RadSEM:放射学报告中临床一致性的逐发现指标

Zhenhong Yang, Zhuoyun Liu, Jintao Fei, Wen Tang, Shichao Quan, Jun Zhao, Jun Xu

机构 * JDH Algo, JD Health International Inc., China Department of Big Data in Health Science, The First Affiliated Hospital of Wenzhou Medical University, China Zhejiang Engineering Research Center for Hospital Emergency Department of Intensive Care Unit, The First Affiliated Hospital of Wenzhou Medical University, Wenzhou, Zhejiang, China

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 提出RadSEM指标,通过约束LLM辅助将报告重写为原子发现句,进行矛盾感知的多对多匹配,并计算异常加权的F1分数,在SSREE测试中优于现有指标,实现高一致性评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17539 2026-06-17 cs.CV cs.AI 新提交 57%

Reinforcing Dual-Path Reasoning in Spatial Vision Language Models

空间视觉语言模型中的双路径推理强化

Yatai Ji, An-Chieh Cheng, Yang Fu, Yukang Chen, Han Zhang, Zhaojing Yang, Wei Huang, Ka Chun Cheung, Song Han, Vidya Nariyambut Murali, Pavlo Molchanov, Jan Kautz, Simon See, Hongxu Yin, Ping Luo, Sifei Liu

机构 * The University of Hong Kong(香港大学) NVIDIA(英伟达) University of California, San Diego(加州大学圣迭戈分校)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 提出SR-REAL框架,通过强化学习融合语言推理和3D检测推理两条路径,显著提升空间VLM在复杂几何推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17405 2026-06-17 cs.AI 新提交 57%

Treatment Response Optimized Clinical Decision Support AI System via Digital Twin Simulation

基于数字孪生模拟的治疗响应优化临床决策支持AI系统

Xinyu Qin, Anil K. Sood, Ruiheng Yu, Sara Corvigno, Elaine Stur, Lu Wang

机构 * The Cancer Genome Atlas (TCGA)(癌症基因组图谱(TCGA))

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 提出在线自适应框架,结合治疗效果估计、患者数字孪生和强化学习,在安全约束下实时优化治疗推荐,经合成和真实临床数据验证有效且稳定。

Comments Accepted for presentation at the IEEE Engineering in Medicine and Biology Conference (EMBC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.25065 2026-06-17 cs.OS cs.AI cs.DC 版本更新 57%

Vulcan: Instance-specialized, Verifiable Systems Heuristics Through LLM-driven Search

Vulcan:通过LLM驱动的搜索实现实例特化的可验证系统启发式方法

Rohit Dwivedula, Divyanshu Saxena, Sujay Yadalam, Eric Hayden Campbell, Daehyeok Kim, Aditya Akella

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 提出Vulcan框架,利用LLM生成系统启发式方法,通过隔离决策逻辑和受限语言Anvil保证安全,在调度、缓存和内存管理上取得显著性能提升。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17246 2026-06-17 cs.CV cs.MA 新提交 50%

GeoDisaster: Benchmarking Orchestrated Agents for Operational Disaster Geo-Intelligence

GeoDisaster: 用于操作化灾害地理智能的编排智能体基准测试

Maram Hasan, Aman Verma, Savitra Roy, Hariseetharam Gunduboina, Daksh Jain, Muhammad Haris Khan, Subhasis Chaudhuri, Biplab Banerjee

机构 * Indian Institute of Technology Bombay(印度理工学院孟买分校) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 安全训练 :alignment(abstract)

AI总结 提出GeoDisaster基准,包含2921个实例和43种问题类型,用于评估遥感视觉语言模型在工具化空间推理和结构化决策方面的能力,并设计多智能体框架RCEA提升工具使用和证据基础。

Comments 28 pages, 11 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08650 2026-06-17 cs.HC 50%

Fast-Food Intimacy: How Chinese Women Navigate Soul's AI Boyfriend

快餐式亲密:中国女性如何与Soul的AI男友互动

Huiqian Lai, EunJeong Cheon

专题命中 安全训练 :safety(abstract)

AI总结 研究探讨中国女性在Soul平台与AI男友'With-you'建立亲密关系的过程,揭示其快速亲密与文化期望的冲突,以及技术问题和情感劳动分配的影响。

Comments Accepted by DIS 2026

Journal ref Proceedings of the 2026 ACM Designing Interactive Systems Conference (DIS '26), ACM, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06756 2026-06-17 eess.SY cs.SY 版本更新 50%

Generative AI Enabled Robust Sensor Placement in Cyber-Physical Power Systems: A Graph Diffusion Approach

生成式AI赋能的信息物理电力系统鲁棒传感器布置:一种图扩散方法

Changyuan Zhao, Guangyuan Liu, Bin Xiang, Benoit Delinchant, Dong In Kim

专题命中 安全训练 :safety(abstract)

AI总结 提出一种基于图扩散的生成式AI框架,通过经验反馈图扩散算法优化传感器布置,同时提升物理层异常检测和网络层通信韧性,解决信息物理电力系统的NP-hard优化问题。

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 7 篇

2606.14517 2026-06-17 cs.CR cs.AI 新提交 77%

From Shield to Target: Denial-of-Service Attacks on LLM-Based Agent Guardrails

从盾牌到靶心:针对基于LLM的智能体护栏的拒绝服务攻击

Yuguang Zhou, Xunguang Wang, Pingchuan Ma, Zhantong Xue, Zhaoyu Wang, Shuai Wang

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);prompt injection(abstract);分类 cs.AI

AI总结 本文揭示基于LLM的护栏易受拒绝服务攻击,通过束搜索优化框架和机制感知结构变异生成恶意负载,导致令牌放大13-63倍、延迟放大148倍,威胁系统可用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17223 2026-06-17 cs.CR 新提交 71%

Safety, Security, and Cognitive Risks in Neuro-Symbolic AI

神经符号AI中的安全性、安全性和认知风险

Manoj Parmar

专题命中 越狱攻击 :safety(title)

AI总结 本文系统分析了神经符号AI在五层架构中的攻击面,提出统一威胁模型、符号层威胁目录及认知风险分析,并通过三个实证基准验证了攻击的有效性与检测挑战。

Comments 28 pages, 1 figure, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19445 2026-06-17 cs.LG stat.ML 版本更新 70%

On Surjectivity of Neural Networks: Can you elicit any behavior from your model?

论神经网络的满射性:你能从模型中诱导出任何行为吗?

Haozhe Jiang, Nika Haghtalab

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.LG

AI总结 本文证明现代神经网络架构(如预层归一化和线性注意力模块)几乎总是满射,意味着任何输出(包括有害内容)原则上都可生成,揭示了模型在对抗攻击下的固有脆弱性。

Comments Blog: https://astro-eric.github.io/blogs/surjective/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08679 2026-06-17 cs.AI cs.CL cs.LG 67%

Chain-of-Thought Reasoning In The Wild Is Not Always Faithful

现实中的思维链推理并不总是忠实的

Iván Arcuschin, Jett Janiak, Robert Krzyzanowski, Senthooran Rajamanoharan, Neel Nanda, Arthur Conmy

机构 * Poseidon Research(Poseidon研究)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现,在自然语言提示下,模型有时会生成表面连贯但自相矛盾的思维链,揭示出隐含的事后合理化现象,且前沿模型也未能完全避免。

Comments Published at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18193 2026-06-17 cs.CR cs.AI cs.CL 新提交 62%

A Red-Team Study of Anthropic Fable 5 & Opus 4.8 Models

Anthropic Fable 5 与 Opus 4.8 模型的红队研究

Nicola Franco

机构 * AI4I

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 通过 HackAgent 框架对两个前沿大语言模型进行自动化越狱攻击,发现尽管模型抵抗大部分攻击,但自适应迭代攻击仍能成功,且残差表面比总体框架更大。

Comments White paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15531 2026-06-17 cs.LG cs.CR 新提交 57%

Greedy Coordinate Diffusion: Effective and Semantically Coherent Adversarial Attacks via Diffusion Guidance

贪婪坐标扩散:通过扩散引导实现有效且语义一致的对抗攻击

Bohdan Turbal, Blossom Metevier, Max Springer, Aleksandra Korolova

机构 * University of Maryland(马里兰大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 提出贪婪坐标扩散方法,利用扩散模型引导生成语义连贯的对抗样本,在保持自然性的同时实现高攻击成功率。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01359 2026-06-17 cs.CR cs.AI 版本更新 57%

Breaking the Code: Security Assessment of AI Code Agents Through Systematic Jailbreaking Attacks

破解代码:通过系统性越狱攻击对AI代码代理进行安全评估

Shoumik Saha, Jifan Chen, Sam Mayers, Sanjay Krishna Gouda, Zijian Wang, Varun Kumar

机构 * University of Maryland – College Park(马里兰大学-College Park) AWS AI Labs(AWS人工智能实验室) Meta Superintelligence Labs(Meta超智能实验室)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

AI总结 提出JAWS-Bench基准测试,通过三级工作区评估代码LLM代理的越狱风险,发现代理化使攻击成功率提升1.6倍,并揭示可执行攻击代码的高比例。

Comments 22 pages, 18 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 1 篇

2602.14211 2026-06-17 cs.CR cs.AI 版本更新 74%

SkillJect: Effectively Automating Skill-Based Prompt Injection for Skill-Enabled Agents

SkillJect:有效自动化基于技能的提示注入以针对具备技能的代理

Xiaojun Jia, Jie Liao, Simeng Qin, Jindong Gu, Wenqi Ren, Xiaochun Cao, Yang Liu, Philip Torr

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Chongqing University, China(重庆大学) Northeastern University, China(东北大学) Sun Yat-sen University, China(中山大学) University of Oxford, UK(牛津大学)

专题命中 提示注入 :prompt injection(title);分类 cs.AI

AI总结 SkillJect 是首个自动化生成有效中毒技能的框架,通过隐藏恶意负载和重写指令通道,提升攻击效果,揭示可重用技能生态中的持久性攻击向量。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 7 篇

2606.18021 2026-06-17 cs.AI cs.CL cs.LG cs.MA 新提交 83%

LegalHalluLens: Typed Hallucination Auditing and Calibrated Multi-Agent Debate for Trustworthy Legal AI

LegalHalluLens: 类型化幻觉审计与校准的多智能体辩论以实现可信赖的法律AI

Lalit Yadav, Akshaj Gurugubelli

机构 * Independent Researcher, Sunnyvale, CA, USA(独立研究者,美国加州太阳谷) Independent Researcher, San Diego, CA, USA(独立研究者,美国加州圣地亚哥)

专题命中 幻觉与事实性 :trustworthy(title,abstract);分类 cs.CL、cs.AI、cs.LG;safety(comments)

AI总结 针对法律AI中聚合指标掩盖的错误集中性和方向性问题,提出LegalHalluLens审计框架,通过类型化幻觉画像、风险方向指数(RDI)和校准辩论管道,将幻觉检测减少45%,并揭示聚合指标隐藏的失败模式。

Comments 15 pages, 5 figures; Published at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17791 2026-06-17 cs.CL cs.CV 新提交 79%

The Slop Paradox: How Synthetic Standardization Erodes Clinical Uncertainty and Cross-Modal Alignment in AI-Rewritten Radiology Reports

Slop悖论:合成标准化如何侵蚀AI重写放射学报告中的临床不确定性和跨模态对齐

Samar Ansari

机构 * School of Computing and Engineering Sciences, University of Chester(切斯特大学计算与工程科学学院)

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.CL

AI总结 本研究通过控制实验测量AI重写放射学报告导致的信息退化,发现电子健康记录摘要虽破坏内容但保留图像-文本对齐,而标准化重写和教学病例准备则相反,造成更大对齐损失,称为slop悖论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18068 2026-06-17 cs.AI 新提交 57%

Agentic AI-based Framework for Mitigating Premature Diagnostic Handoff and Silent Hallucination in Healthcare Applications

基于Agentic AI的框架:缓解医疗应用中的过早诊断交接和无声幻觉

Divyansh Srivastava, Shreya Ghosh, Anshul Verma, Rajkumar Buyya

机构 * Distributed Systems (qCLOUDS) Lab, School of Computing Information Systems, The University of Melbourne, Australia 2Department of Computer Science Engineering, School of Electrical Computer Sciences (SECS), Indian Institute of Technology Bhubaneswar, India 3Department of Computer Science Banaras Hindu University, Varanasi, India

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 提出多智能体框架,通过确定性编排约束和两个安全机制(神经符号状态跟踪门和语义熵不确定性量化门)解决LLM在医疗对话中的过早诊断交接和无声幻觉问题,诊断精度提升11.3个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17666 2026-06-17 cs.SE cs.AI 新提交 57%

FacProcessTwin: An LLM-Based System for Process Twin Development

FacProcessTwin: 一种基于LLM的流程孪生开发系统

Yash Pulse, Yong-Bin Kang, Abhik Banerjee, Prem Prakash Jayaraman

机构 * Swinburne University of Technology(斯winburne大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 提出FacProcessTwin系统,利用大语言模型从工厂文档和操作员自然语言输入中自动生成流程模型并绑定实时数据,通过交互式流程图实现人机协同治理,在食品制造案例中准确率达95.2%,开发时间缩短至人工的1/6。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17234 2026-06-17 cs.CL 新提交 57%

Speaking in Self-Assessing Tongues: On the Verbalized Confidence of LLMs in Machine Translation

自评之言:论大语言模型在机器翻译中的口头化置信度

Ali Marashian, Alexis Palmer, Katharina von der Wense

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校) Johannes Gutenberg University Mainz(美因茨约翰内斯·古腾堡大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 本研究设计了五种无需内部信号的口头化方法提取LLM逐词置信度,并与内部确定性信号比较,发现两者在细粒度错误检测和校准上表现相似但相关性低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17203 2026-06-17 cs.SE cs.AI 新提交 57%

Trust-Aware Multi-Agent Traceability: Confidence-Calibrated Knowledge Graphs for Consistent Software Artifact Management

信任感知的多智能体可追溯性:用于一致软件工件管理的置信度校准知识图谱

Mohamed Essam, Kareem Wael, Azza Hassan, Ahmed Haitham, Mahmoud Soliman, Samer Saber, Ibrahim Habib

机构 * CairoMotive Cairo, Egypt(开罗动力埃及)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 提出一种信任感知协调框架,通过共享知识图谱和校准置信度分数,结合嵌入检索与LLM多准则分析的两阶段可追溯性链接预测管道,解决多智能体系统中错误传播问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00330 2026-06-17 cs.LG 版本更新 57%

Conformalized Quantum DeepONet Ensembles for Scalable Operator Learning with Distribution-Free Uncertainty

conformalized 量子 deeponet 集团用于具有分布自由不确定性的可扩展操作学习

Purav Matlia, Christian Moya, Guang Lin

机构 * Department of Computer Science(计算机科学系) Purdue University(普渡大学) Department of Mathematics(数学系) Department of Mechanical Engineering(机械工程系)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 本文提出一种结合量子正交神经网络和适应性置信预测的框架,解决高维动态系统运算学习中的二次推断复杂度和不确定性量化问题,通过压缩多个模型到单个电路实现高效并行计算。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 隐私与版权 1 篇

2606.17122 2026-06-17 cs.CR cs.AI cs.LG 新提交 62%

TrustErase: Auditable Instant Machine Unlearning with Passport-Embedded Representations

TrustErase:基于护照嵌入表示的可审计即时机器遗忘

Rutger Hendrix, Leonardo G. Russo, Concetto Spampinato, Matteo Pennisi, Giovanni Bellitto

机构 * University of Catania(卡塔尼亚大学)

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 提出TrustErase框架,利用护照嵌入表示实现无需数据、可验证的即时遗忘,通过参数高效适配层中的护照作为密钥,仅需停用即可移除特定类别或数据集,无需重训练或微调。

详情

展开后加载摘要…

URL PDF HTML 收藏