arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-01 至 2026-07-01 共收录 89 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 3 篇

2606.30755 2026-07-01 cs.CR cs.AI 新提交 57%

Understanding and Evaluating Claw-like Agent Security Through a Computer-Systems Lens

通过计算机系统视角理解与评估爪类智能体安全性

Peizhi Niu, Wenjie Qu, Shangding Gu, Tianneng Shi, Yuankai Li, Ahmad Tawaha, Hend Alzahrani, Vincent Siu, Boyi Li, Chenguang Wang, Jiaheng Zhang, Basel Alomair, Ming Jin, Muhao Chen, Chi Wang, Costas Spanos, Dawn Song

机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) NUS(新加坡国立大学) UC Berkeley(加州大学伯克利分校) UC Davis(加州大学戴维斯分校) Virginia Tech(弗吉尼亚理工大学) KACST(阿卜杜勒阿齐兹国王科技城) UC Santa Cruz(加州大学圣克鲁兹分校) NVIDIA(英伟达) Google DeepMind(谷歌DeepMind) UW Seattle(华盛顿大学西雅图分校) HUMAIN(胡迈因研究所)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 针对爪类AI智能体安全漏洞,提出计算机系统类比,构建SafeClawArena基准测试,评估406个对抗任务,发现最高攻击成功率70%,恶意插件100%成功。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31016 2026-07-01 cs.NI 新提交 50%

Beyond Wireless Security: Covert Communications in Large Language Model-enabled Edge Networks

超越无线安全:大语言模型赋能边缘网络中的隐蔽通信

Yuanai Xie, Jiaxin Chen, Zhaozhi Liu

专题命中 提示注入 :prompt injection(abstract)

AI总结 针对大语言模型赋能边缘网络面临的安全威胁,提出一种隐蔽通信与计算方法,在严格安全约束下最小化总延迟,兼顾隐私保护与任务执行效率。

Comments Accepted for publication in IEEE Communications Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 幻觉与事实性 6 篇

2606.31916 2026-07-01 cs.CL 新提交 70%

Theory of Mind and Persuasion Beyond Conversation: Assessing the Capacity of LLMs to Induce Belief States via Planning and Action

超越对话的心智理论与说服:通过规划与行动评估LLMs诱导信念状态的能力

Ben Slater, Matteo G. Mecattaf, Lucy G. Cheke, John Burden, Winnie Street

机构 * Leverhulme Centre for the Future of Intelligence(勒沃霍姆未来智能中心) Prolific Google, Paradigms of Intelligence Team(谷歌智能范式团队)

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 提出非对话式规划心智理论(NCP-ToM)框架,评估LLMs通过行动而非对话诱导他人信念状态的能力,发现GPT-5在80%任务中优于人类,但鲁棒性不足。

Comments 29 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32032 2026-07-01 cs.CL cs.AI 新提交 62%

Reinforcement Learning with Metacognitive Feedback Elicits Faithful Uncertainty Expression in LLMs

基于元认知反馈的强化学习引发LLM忠实的不确定性表达

Gabrielle Kaili-May Liu, Avi Caciularu, Gal Yona, Idan Szpektor, Arman Cohan

机构 * Yale University(耶鲁大学) Google Research(谷歌研究院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出强化学习与元认知反馈(RLMF)和元认知数据选择方法,通过模型自我判断质量优化偏好学习,实现忠实校准(FC),在保持准确性的同时显著提升LLM不确定性表达的忠实度。

Comments Code: https://github.com/yale-nlp/RLMF

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31719 2026-07-01 cs.CL cs.AI 新提交 62%

Seeing Is Not Sharing: Some Vision-Language Models Overestimate Common Ground in Asymmetric Dialogue

看见不等于共享:一些视觉-语言模型在非对称对话中高估共同基础

Nan Li, Albert Gatt, Massimo Poesio

机构 * Utrecht University(乌得勒支大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究视觉-语言模型在对话中是否混淆潜在共享与已共享信息,发现模型过度依赖地图内容预测对齐,忽视对话历史中的基础建立过程。

Comments 17 pages, 9 figures, 8 tables; accepted to SIGDIAL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31804 2026-07-01 cs.LG stat.ML 新提交 57%

Relational and Sequential Conformal Inference for Energy Time Series over Graphs via Foundation Models

基于基础模型的图结构能源时间序列的关系与序列共形推断

Keivan Faghih Niresi, Alice Cicirello, Olga Fink

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 提出STOIC框架,结合图神经网络与表格基础模型,通过零样本校准实现图结构能源时间序列的共形预测,提供可靠的不确定性估计。

Comments Under-review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14171 2026-07-01 cs.AI 版本更新 57%

Paper2Rebuttal: A Multi-Agent Framework for Transparent Author Response Assistance

Paper2Rebuttal: 一种透明的作者回复辅助多智能体框架

Qianli Ma, Chang Guo, Zhiheng Tian, Siyu Wang, Jipeng Xiao, Yuanhao Yue, Zhipeng Zhang

机构 * AutoLab, School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院AutoLab)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 提出多智能体框架RebuttalAgent,将回复生成重构为以证据为中心的规划任务,通过分解反馈、构建混合上下文和外部搜索模块,提升覆盖度、忠实性和策略连贯性。

Comments Accepted by ACL2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08566 2026-07-01 cond-mat.soft cond-mat.stat-mech 版本更新 50%

Homing through Reinforcement Learning

通过强化学习实现归巢

Riya Singh, Pratikshya Jena, Anish Kumar, Shradha Mishra

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 提出强化学习框架模拟连续二维域中的自适应归巢,发现平均归巢时间随旋转扩散强度呈非单调变化,且RL智能体比主动布朗粒子更快、更定向。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 隐私与版权 1 篇

2606.31935 2026-07-01 econ.EM 新提交 50%

Delegation Rights: Property, Agency, and Investment Incentives in the Age of AI Agents

委托权:AI代理时代中的财产、代理与投资激励

Yukun Zhang, Kemu Xu

专题命中 隐私与版权 :safety(abstract)

AI总结 本文定义委托权为账户持有人授权代理执行的可撤销、身份保留、范围受限且模式特定的权限,通过三方不完全契约模型分析平台控制、用户控制与认证委托三种机制对投资激励和风险分配的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 安全评测 23 篇

2506.11094 2026-07-01 cs.CL cs.AI cs.CR 81%

The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs

正义的尺度:关于大语言模型安全评估的全面调查

Songyang Liu, Chaozhuo Li, Jiameng Qiu, Xi Zhang, Feiran Huang, Litian Zhang, Yiming Hei, Philip S. Yu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Jinan University(暨南大学) Beihang University(北京航空航天大学) China Academy of Information and Communications Technology(中国信息通信研究院)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本文系统调研了大语言模型的安全评估现状,提出四维分类框架,分析评估原因、内容、场景及方法,指出当前挑战并提出研究方向,强调安全评估对可靠部署的重要性。

Comments 20 pages, preprint

Journal ref Information Fusion 136 (2026) 104579

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31589 2026-07-01 cs.SE cs.LG 新提交 79%

From Failure to Alignment: A Requirements Engineering Framework for Machine Learning Systems

从失败到对齐:机器学习系统的需求工程框架

Amel Bennaceur, Gopi Krishnan Rajbahadur, Prince Mercy, Bashar Nuseibeh, Faeq Alrimawi

机构 * The Open University, United Kingdom(英国开放大学) University of Limerick, Ireland(爱尔兰利默里克大学)

专题命中 安全评测 :alignment(title);trustworthy(abstract);分类 cs.LG

AI总结 提出REAL框架,通过需求工程方法,结合数据、模型和系统需求,利用失败驱动探索替代需求,实现迭代可追溯的MLS需求细化,以对齐利益相关者需求。

Comments 12 pages

Journal ref RE 2026 - the 34th IEEE International Requirements Engineering Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28968 2026-07-01 cs.CR cs.HC 版本更新 78%

Beyond Her: Safety Dynamics in Role-play AI Companions

超越《她》:角色扮演AI伴侣中的安全动态

Zehang Deng, Zhaoyang Xie, Changzhou Han, Hiran Thabrew, Wanlun Ma, Yue Huang, Jason, Xue, Sheng Wen, Tianqing Zhu, Yang Xiang

专题命中 安全评测 :safety(title,abstract)

AI总结 通过混合方法研究,揭示角色扮演AI伴侣使用中用户内化问题、AI角色人格和风险互动模式共同塑造安全动态,并发现短期情绪缓解与长期恶化并存的趋势,提出自适应安全防护设计。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21173 2026-07-01 cs.RO cs.CV 版本更新 78%

Multimodal Benchmark for Safety Assessment in Industrial Inspection Scenarios

工业检测场景安全评估的多模态基准

Zeyi Liu, Shuang Liu, Jihai Min, Zhaoheng Zhang, Jun Cen, Pengyu Han, Songqiao Hu, Zihan Meng, Xiao He, Donghua Zhou

机构 * Department of Automation, Tsinghua University(清华大学自动化系) Institute for Embodied Intelligence and Robotics, Tsinghua University(清华大学具身智能与机器人研究所) TetraBOT Intelligence Co., Ltd.(天博智能科技有限公司) DAMO Academy, Alibaba Group(阿里巴巴达摩院) School of Automation, Southeast University(东南大学自动化学院)

专题命中 安全评测 :safety(title,abstract)

AI总结 针对工业现场多模态安全评估缺乏真实数据的问题,构建了首个包含真实机器人巡检数据、像素级标注和七种同步模态的基准数据集InspecSafe-V1,覆盖五个典型场景,支持多模态异常识别与安全评估。

Comments 14 pages, 6 figures, Accepted by Scientific Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31567 2026-07-01 cs.CY cs.AI 新提交 73%

FLARE-AI: Flaw Reporting for AI

FLARE-AI:AI缺陷报告

Shayne Longpre, Elaine Zhu, Carson Ezell, Avijit Ghosh, Sean McGregor, Kevin Paeth, Kevin Klyman, Sayash Kapoor, Rishi Bommasani, Ruth Appel, Gregory Strom, Lauren McIlvenny, Mark M. Jaycox, Peter Slattery, Nathan Butters, Arvind Narayanan, Percy Liang, Alex Pentland

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY

AI总结 针对AI系统缺陷报告生态碎片化问题,提出开源系统FLARE-AI,通过条件逻辑和早期分类简化报告创建,支持标准化机器可读报告分发,降低报告门槛并提升互操作性。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30810 2026-07-01 cs.SE 新提交 71%

Towards Knowledge Alignment in Code LLMs: Contrastive Unlearning for Evolving APIs

面向代码大语言模型的知识对齐:针对演化API的对比性遗忘

Huy Q. Tran, Dang H. Vu, Tuyen N. Dinh, Anh H. D. Nguyen, Anh N. H. Vu, Anh M. T. Bui, Phuong T. Nguyen

专题命中 安全评测 :alignment(title)

AI总结 提出对比性遗忘方法CURE,在抑制废弃API的同时鼓励正确替代,使代码LLM适应演化库,实验表明该方法优于现有基线。

Comments The paper has been peer reviewed and accepted to the 42nd International Conference on Software Maintenance and Evolution (ICSME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16271 2026-07-01 cs.CV 版本更新 71%

VIGOR: VIdeo Geometry-Oriented Reward for Temporal Generative Alignment

VIGOR: 面向视频几何的时序生成对齐奖励

Tengjiao Yin, Jinglei Shi, Heng Guo, Xi Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 安全评测 :alignment(title)

AI总结 提出基于几何的奖励模型,利用预训练几何基础模型通过跨帧重投影误差评估多视图一致性,以点方式计算误差,并引入几何感知采样策略,通过后训练和推理时优化对齐视频扩散模型,提升生成视频的几何一致性。

Comments Project Page: https://vigor-geometry-reward.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31272 2026-07-01 cs.CR cs.CL cs.LG 新提交 62%

The Decomposition Is the Fingerprint: Per-Component Identity for Agent Skills

分解即指纹:面向智能体技能的组件级身份标识

Hongliang Liu, Yuhao Wu, Tung-Ling Li

机构 * Palo Alto Networks

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.LG

AI总结 提出一种基于多组SimHash的局部敏感指纹,将技能分解为提示、代码和工具三元组,通过汉明距离比较实现技能家族识别与变更定位,AUC达0.974。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12164 2026-07-01 cs.CY cs.CL 版本更新 62%

The Language You Ask In: Language-Conditioned Ideological Divergence in LLM Analysis of Contested Political Documents

提问的语言:语言条件对LLM分析争议性政治文件时的意识形态分歧的影响

Oleg Smirnov

机构 * Microsoft(微软)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.CY

AI总结 研究通过俄语和乌克兰语语义等价提示,发现ChatGPT和Claude Opus在分析同一乌克兰公民社会文件时,输出出现系统性意识形态分歧,且分歧程度因模型而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11847 2026-07-01 cs.LG cs.CY 62%

Transparent and Fair Profiling in Employment Services: Evidence from Switzerland

透明且公平的就业服务中的 profiling:来自瑞士的证据

Tim Räz

专题命中 安全评测 :trustworthy(abstract);分类 cs.CY、cs.LG

AI总结 本文通过瑞士行政数据比较传统统计、可解释和黑箱模型,发现可解释 boosting 机器在预测性能上接近最佳黑箱模型,且通过模型稀疏性、特征平滑和公平性缓解可提升透明度和公平性。

Comments 35 pages including appendix

Journal ref Data & Policy 8 (2026) e30

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29672 2026-07-01 cs.CL 版本更新 57%

How LLMs See Creativity: Zero-Shot Scoring of Visual Creativity with Interpretable Reasoning

LLM如何看待创造力:具有可解释推理的视觉创造力零样本评分

William Orwig, Roger E. Beaty

机构 * Harvard University(哈佛大学) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 研究多模态大模型能否零样本评估视觉创造力,并分析其推理过程的可解释性。实验表明模型评分与人类高度一致,但推理并未提升评分准确性。

Comments 21 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31478 2026-07-01 cs.AI cs.CV 新提交 57%

One Reflection Is Not Enough: Self-Correcting Autonomous Research via Multi-Hypothesis Failure Attribution

一次反思不够:通过多假设失败归因进行自我修正的自主研究

Jie Ma, Binfei Chu, Jie Gao, Jinlu Zhang, Yiwei Ma, Yi Tan, Jiayi Ji, Xiaoshuai Sun, Rongrong Ji

机构 * Xiamen University(厦门大学) Hello Inc.(Hello公司) Xiaohongshu Inc.(小红书公司)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 提出SAGE框架,通过多假设失败归因(MHFA)机制将实验失败恢复转化为结构化因果诊断,显著提升自主研究代理的可靠性和产出质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31470 2026-07-01 cs.AI 新提交 57%

CLOUDADV: Decision-Aligned Instance Sizing with Zero-Shot Foundation Models under Drift

CLOUDADV: 漂移下基于零样本基础模型的决策对齐实例大小调整

Jack Bell, Giacomo Carfi, Gerlando Gramaglia, Andrea Simioni, Daniele Fontani, Vincenzo Lomonaco

机构 * University of Pisa(比萨大学) Independent Researcher(独立研究员) Sintra Consulting Limited(Sintra咨询有限公司) Luiss University(路易斯大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 提出CLOUDADV系统,结合零样本时间序列预测与有界推荐生成,在非平稳云环境中实现决策对齐的实例大小调整,通过参考推荐和成本节约评估,在7个生产VM案例中实现52.9%成本节省。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31334 2026-07-01 cs.AI 新提交 57%

Optimization Algorithms for Joint OFDM Waveform Design and RIS Configuration in 6G Networks: From Convex Relaxation to Foundation Models

面向6G网络的联合OFDM波形设计与RIS配置的优化算法:从凸松弛到基础模型

Ahmet Kaplan

机构 * Istanbul Medipol University(伊斯坦布尔梅迪波尔大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 综述2021-2026年间78篇联合OFDM-RIS优化工作,将其分为四类范式,发现基于ML的方法在推理速度上比模型方法快2-4个数量级,并指出六个开放挑战。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31325 2026-07-01 cs.AI 新提交 57%

HistoriQA-ThirdRepublic: Multi-Hop Question Answering Corpus for Historical Research, Parliamentary Debates from the French Third Republic (1870-1940)

HistoriQA-ThirdRepublic: 面向历史研究的多跳问答语料库——来自法兰西第三共和国(1870-1940)的议会辩论

Aurélien Pellet, Julien Perez, Marie Puren

机构 * LRE EPITA EPITECH Bpifrance CJM

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 提出一个法语多跳历史问答数据集,基于第三共和国议会辩论和报纸,由历史学家协作构建,涵盖跨源综合、时间推理等复杂推理模式,共1782个问题,用于评估检索增强和大型语言模型在特定领域的效果。

Journal ref LREC 2026: Language Resources and Evaluation Conference, ELRA Language Resources Association, May 2026, Palma de Mallorca, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31209 2026-07-01 cs.AI cs.RO 新提交 57%

Long-term Traffic Simulation via Structured Autoregressive Modeling

基于结构化自回归建模的长期交通仿真

Lingyu Xiao, Zexin Feng, Xintao Yan

机构 * The University of Hong Kong(香港大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 提出RosettaSim框架,利用大规模序列模型的归纳偏置和统计先验,通过结构化自回归流建模场景拓扑、智能体状态和生成意图,实现短期准确与长期稳定仿真;并引入基于检索的交通评估(RTE)解决长期评估难题。

Comments ECCV 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27154 2026-07-01 cs.AI 新提交 57%

OpenRCA 2.0: From Outcome Labels to Causal Process Supervision

OpenRCA 2.0:从结果标签到因果过程监督

Aoyang Fang, Yifan Yang, Jin'ao Shang, Qisheng Lu, Junjielung Xu, Rui Wang, Songhan Zhang, Yuzhong Zhang, Boxi Yu, Pinjia He

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 针对现有根因分析数据集仅标注结果而忽略因果传播路径的问题,提出PAVE协议重建因果路径,构建OpenRCA 2.0基准,发现LLM在根因定位中因果验证不足的缺陷。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24392 2026-07-01 cs.AI 新提交 57%

ATRIA: Adaptive Traceable ECG Reporting with Iterative Agents

ATRIA: 自适应可追溯心电图报告与迭代智能体

Donggyun Hong, Kyuhwan Lee, Junmyung Kwon, Yong-Yeon Jo

机构 * MedicalAI Co., Ltd.(MedicalAI有限公司)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 提出多智能体系统ATRIA,模拟临床医生迭代工作流,实现可追溯、可编辑的心电图报告生成,支持证据绑定和中间修正。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16783 2026-07-01 cs.CL 57%

SubData: Bridging Heterogeneous Datasets to Enable Theory-Driven Evaluation of Political and Demographic Perspectives in LLMs

SubData:连接异构数据集以实现对LLM政治和人口视角的理论驱动评估

Pietro Bernardelle, Leon Fröhling, Stefano Civelli, Gianluca Demartini

机构 * The University of Queensland(昆士兰大学) GESIS - Leibniz Institute for the Social Sciences(GESIS - 莱布尼茨社会科学研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出SubData框架,通过标准化异构数据集评估LLM视角对齐,并展示如何利用该工具测试不同对齐LLM对特定人口群体内容的分类差异。

Comments 14 pages, 2 figures, 3 tables

Journal ref Proceedings of the 5th Workshop on Perspectivist Approaches to NLP (NLPerspectives) at the 15th Language Resources and Evaluation Conference (LREC), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31219 2026-07-01 cs.CV 新提交 50%

CooperScene: Multi-Modal Cooperative Autonomy Benchmark with C-V2X Communication Characterization

CooperScene: 具有C-V2X通信特性的多模态协作自主基准

Bo Wu, Ruoshen Mo, Justin Yue, Yanyu Zhang, Janice Nguyen, Guoyuan Wu, Amit Roy-Chowdhury, Matthew J. Barth, Hang Qiu

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 安全评测 :alignment(abstract)

AI总结 提出CooperScene数据集,通过真实C-V2X通信特性、多模态传感器和3GPP标准,建立多车协作感知基准,包含59K帧、344K标注对象。

Comments Accepted to ECCV 2026. 15 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31082 2026-07-01 cs.CV 新提交 50%

Fleet: Few Shots Lead Effective AI-generated Image Detection

Fleet: 少量样本引导的有效AI生成图像检测

Jiaan Wang, Sirui Liu, Yu Li, Kaiyuan Yang, Juan Cao, Sheng Tang

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 安全评测 :alignment(abstract)

AI总结 针对AI生成图像检测中静态特征空间泛化能力不足的问题,提出动态适应框架Fleet,通过约束路由校正实现少量样本快速适应新兴生成器,在64模型基准上将性能从20.4%提升至73.1%。

Comments 25 pages, accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏