arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4211 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4211 篇

2511.20649 2026-03-20 cs.CV 57%

Infinity-RoPE: Action-Controllable Infinite Video Generation Emerges From Autoregressive Self-Rollout

Infinity-RoPE: 自动回归自回滚中涌现的无限视频生成

Hidir Yesiltepe, Tuna Han Salih Meral, Adil Kaan Akan, Kaan Oktay, Pinar Yanardag

机构 * Virginia Tech(弗吉尼亚理工学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Infinity-RoPE,通过Block-Relativistic RoPE、KV Flush和RoPE Cut三个组件解决自回归视频扩散模型的三个瓶颈,实现无限时域、可控和电影级视频生成。

Comments CVPR 2026 | Project Page: https://infinity-rope.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16711 2026-03-19 cs.CV 57%

Search2Motion: Training-Free Object-Level Motion Control via Attention-Consensus Search

Search2Motion: 基于注意力-共识搜索的无训练物体级运动控制

Sainan Liu, Tz-Ying Wu, Hector A Valdez, Subarna Tripathi

机构 * Intel Corporation(英特尔公司)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 Search2Motion通过注意力-共识搜索实现无训练的物体级运动编辑,利用首尾帧运动先验保持场景稳定性,引入ACE-Seed策略提升运动保真度,提出新的评估指标验证其优越性。

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15026 2026-03-19 cs.CV cs.LG 57%

Training-free Detection of Generated Videos via Spatial-Temporal Likelihoods

无需训练的生成视频检测方法:时空似然方法

Omer Ben Hayun, Roy Betser, Meir Yossef Levi, Levi Kassel, Guy Gilboa

机构 * Technion – Israel Institute of Technology(技术学院–以色列理工学院)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出STALL方法,通过时空似然建模实现无需训练的视频合成检测,优于传统图像和视频检测方法。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17375 2026-03-19 cs.CV 57%

Stereo World Model: Camera-Guided Stereo Video Generation

立体世界模型:基于摄像头的立体视频生成

Yang-Tian Sun, Zehuan Huang, Yifan Niu, Lin Ma, Yan-Pei Cao, Yuewen Ma, Xiaojuan Qi

机构 * The University of Hong Kong(香港大学) VAST ByteDance Pico(字节跳动Pico)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 本文提出StereoWorld,一种基于摄像头的立体世界模型,通过联合学习外观和双眼几何实现端到端的立体视频生成。该模型在RGB模态中操作,直接从视差中获取几何信息,通过统一的相机帧RoPE和立体感知注意力分解提升生成效率和一致性。

Comments Project Page: https://sunyangtian.github.io/StereoWorld-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17117 2026-03-19 cs.CV 57%

MosaicMem: Hybrid Spatial Memory for Controllable Video World Models

MosaicMem: 用于可控视频世界模型的混合空间记忆

Wei Yu, Runjia Qian, Yumeng Li, Liquan Wang, Songheng Yin, Sri Siddarth Chakaravarthy P, Dennis Anthony, Yang Ye, Yidi Li, Weiwei Wan, Animesh Garg

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) The University of Osaka(大阪大学) Georgia Institute of Technology(佐治亚理工学院) Mujin Inc.(Mujin公司) University of Texas at Austin(德克萨斯大学奥斯汀分校) Taiyuan University of Technology(太原本科技大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 MosaicMem提出一种混合空间记忆方法,通过提升片段至3D实现可靠定位与检索,结合模型原生条件化保留提示生成,提升姿态一致性与动态建模能力,支持细粒度导航与场景编辑。

Comments Project Page: https://mosaicmem.github.io/mosaicmem/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16195 2026-03-19 cs.CV cs.RO 57%

S-VAM: Shortcut Video-Action Model by Self-Distilling Geometric and Semantic Foresight

S-VAM:通过自蒸馏几何和语义前瞻性构建快捷视频动作模型

Haodong Yan, Zhide Zhong, Jiaguan Zhu, Junjie He, Weilin Yuan, Wenxuan Song, Xin Gong, Yingjie Cai, Guanyi Zhao, Xu Yan, Bingbing Liu, Ying-Cong Chen, Haoang Li

机构 * The Hong Kong University of Science Technology (Guangzhou) Huawei Foundation Model Department

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 S-VAM通过自蒸馏策略实现单次前向传递生成几何和语义表示,提升动作预测效率,实验证明在复杂环境中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23728 2026-03-19 cs.CV cs.AI 57%

M3DLayout: A Multi-Source Dataset of 3D Indoor Layouts and Structured Descriptions for 3D Generation

M3DLayout:一个多源的3D室内布局及结构描述数据集用于3D生成

Yiheng Zhang, Zhuojiang Cai, Mingdao Wang, Meitong Guo, Tianxiao Li, Li Lin, Yuwang Wang

机构 * Tsinghua University(清华大学) Beihang University(北京航空航天大学) Migu Beijing Research Institute(咪咕北京研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出M3DLayout数据集,包含21367个布局和433k个物体实例,整合真实扫描、专业CAD设计和程序生成场景,为3D生成模型提供多样化的空间和语义学习基础。

Comments CVPR 2026; Project Page: https://graphic-kiliani.github.io/M3DLayout/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16871 2026-03-18 cs.CV 57%

WorldCam: Interactive Autoregressive 3D Gaming Worlds with Camera Pose as a Unifying Geometric Representation

WorldCam: 交互式自回归3D游戏世界与相机姿态作为统一的几何表示

Jisu Nam, Yicong Hong, Chun-Hao Paul Huang, Feng Liu, JoungBin Lee, Jiyoung Kim, Siyoon Jin, Yunsung Lee, Jaeyoon Jung, Suhwan Choi, Seungryong Kim, Yang Zhou

机构 * Adobe Research(Adobe研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出WorldCam,通过将相机姿态作为统一的几何表示,解决交互式游戏世界中动作控制与长时序3D一致性问题,结合物理连续动作空间和全局相机姿态索引提升导航与视觉质量。

Comments Project page is available at https://cvlab-kaist.github.io/WorldCam/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16373 2026-03-18 cs.CV 57%

Semantic One-Dimensional Tokenizer for Image Reconstruction and Generation

语义一维分词器用于图像重建与生成

Yunpeng Qu, Kaidong Zhang, Yukang Ding, Ying Chen, Jian Wang

机构 * Tsinghua University, Beijing, China(清华大学,北京,中国) Alibaba Group, Beijing, China(阿里巴巴集团,北京,中国)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出SemTok,一种语义一维分词器,通过压缩2D图像为1D离散token实现高效图像重建,采用三重创新框架提升生成效果。

Comments 18 pages,12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16362 2026-03-18 cs.CV cs.AI 57%

$D^3$-RSMDE: 40$\times$ Faster and High-Fidelity Remote Sensing Monocular Depth Estimation

$D^3$-RSMDE:40倍更快且高保真度的遥感单目深度估计

Ruizhi Wang, Weihan Li, Zunlei Feng, Haofei Zhang, Mingli Song, Jiayu Wang, Jie Song, Li Sun

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出$D^3$-RSMDE框架,结合ViT快速生成初步深度图并利用轻量级U-Net进行细节优化,实现高效高保真度的遥感单目深度估计,比现有方法快40倍且LPIPS指标降低11.85%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16188 2026-03-18 cs.CV 57%

ECHO: Edge-Cloud Humanoid Orchestration for Language-to-Motion Control

ECHO:边缘-云计算人形机器人语言到动作控制

Haozhe Jia, Jianfei Song, Yuan Zhang, Honglei Jin, Youcheng Fan, Wenshuo Chen, Wei Zhang, Yutao Yue

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) LimX Dynamics Technology Co., Ltd.(LimX动力技术有限公司) Shandong University(山东大学) Institute of Deep Perception Technology, Jiangsu Industrial Technology Research Institute (JITRI)(江苏工业技术研究院深度感知技术研究所)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 ECHO提出边缘-云计算框架,通过云端扩散模型生成自然语言指令对应动作,边缘设备通过强化学习跟踪执行,采用紧凑的机器人本征动作表示实现高效控制,实现实时动作生成与安全执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16169 2026-03-18 cs.CV 57%

Gaze-guided Hand-Object Interaction Synthesis: Dataset and Method

引导注视的手-物体交互合成:数据集与方法

Jie Tian, Ran Ji, Lingxiao Yang, Suting Ni, Yuexin Ma, Lan Xu, Jingyi Yu, Ye Shi, Jingya Wang

机构 * School of Information Science and Technology, ShanghaiTech University(信息科学与技术学院,上海科技大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出 gaze-guided 手-物体交互合成任务,引入首个捕捉 gaze、手和物体交互的 GazeHOI 数据集,并提出 GHO-Diffusion 模型以解决高一致性与物理合理性问题。

Comments Accepted by IEEE Transactions on Multimedia (TMM), 2026. Project Page: https://takiee.github.io/gaze-hoi/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15555 2026-03-17 cs.CV 57%

Learning Latent Proxies for Controllable Single-Image Relighting

学习可控的单图像照明代理

Haoze Zheng, Zihao Wang, Xianfeng Wu, Yajing Bai, Yexin Liu, Yun Li, Xiaogang Xu, Harry Yang

机构 * HKUST(香港科技大学) HKPolyU(香港理工大学) CUHK(香港中文大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出LightCtrl,通过物理先验和稀疏提示实现可控单图像照明,利用DPO优化和ScaLight数据集提升光照控制精度与PSNR表现。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01535 2026-03-17 cs.CV 57%

Benchmarking Semantic Segmentation Models via Appearance and Geometry Attribute Editing

通过外观和几何属性编辑评估语义分割模型

Zijin Yin, Bing Li, Kongming Liang, Hao Sun, Zhongjiang He, Zhanyu Ma, Jun Guo

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Gen4Seg数据生成管道,通过生成具有不同属性变化的挑战样本来评估语义分割模型,构建了Pascal-EA和COCO-EA两个新基准,发现开放词汇模型在几何变化下不比封闭集方法更鲁棒,数据增强技术在提升外观变化鲁棒性上有限。

Comments Accepted to IEEE TPAMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18333 2026-03-17 cs.CV 57%

ConsistCompose: Unified Multimodal Layout Control for Image Composition

ConsistCompose:统一的多模态布局控制用于图像合成

Xuanke Shi, Boxuan Li, Xiaoyang Han, Zhongang Cai, Lei Yang, Quan Wang, Dahua Lin

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 ConsistCompose通过将布局坐标直接嵌入语言提示,实现布局可控的多实例图像生成,并构建了3.4M的多实例生成数据集,提升了布局控制的精度和多模态理解能力。

Comments Accepted to CVPR 2026; 23 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14151 2026-03-17 cs.CV 57%

Seeing Through the PRISM: Compound & Controllable Restoration of Scientific Images

通过PRISM:科学图像的复合与可控恢复

Rupa Kurinchi-Vendhan, Pratyusha Sharma, Antonio Torralba, Sara Beery

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 PRISM通过结合复合感知监督和加权对比度解纠缠目标,实现科学图像中复杂退化的同时恢复,支持通过自然语言提示选择性修复,提升下游科学准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14112 2026-03-17 cs.CV 57%

Revisiting the Perception-Distortion Trade-off with Spatial-Semantic Guided Super-Resolution

重新审视基于空间-语义引导的超分辨率中的感知-失真权衡

Dan Wang, Haiyan Sun, Shan Du, Z. Jane Wang, Zhaochong An, Serge Belongie, Xinrui Cui

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出SpaSemSR框架,通过空间-语义引导减少失真并提升感知质量,实验显示在多个基准上实现了更优的感知-失真平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09160 2026-03-17 cs.CV 57%

WonderVerse: Extendable 3D Scene Generation with Video Generative Models

WonderVerse:基于视频生成模型的可扩展3D场景生成

Hao Feng, Zhi Zuo, Jia-Hui Pan, Ka-Hei Hui, Qi Dou, Jingyu Hu, Zhengzhe Liu

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 本文提出WonderVerse框架,利用视频生成模型中的世界级先验知识生成沉浸式且几何一致的3D环境,并引入可控扩展技术与异常序列检测模块,实现高效高质量的可扩展3D场景生成。

Comments Accepted at CVM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13745 2026-03-17 cs.CV 57%

Multi-Object Advertisement Creative Generation

多对象广告创意生成

Jialu Gao, Mithun Das Gupta, Qun Li, Raveena Kshatriya, Andrew D. Wilson, Keng-hao Chang, Balasaravanan Thoravi Kumaravel

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出CreativeAds系统,通过多产品广告生成管道解决大规模广告创作中的产品配对、布局生成和背景生成挑战,实现自动化高质量广告生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13368 2026-03-17 cs.CV cs.AI cs.RO 57%

Real-Time Monocular Scene Analysis for UAV in Outdoor Environments

无人机在户外环境中实时单目场景分析

Yara AlaaEldin

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Co-SemDepth模型,用于无人机在低空非结构化环境中实时预测深度和语义图。通过合成数据集TopAir和图像风格迁移技术提升泛化能力,并在海洋领域验证模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13024 2026-03-16 cs.CV cs.AI cs.LG eess.IV 57%

SAW: Toward a Surgical Action World Model via Controllable and Scalable Video Generation

SAW:通过可控且可扩展的视频生成实现手术动作世界模型

Sampath Rapuri, Lalithkumar Seenivasan, Dominik Schneider, Roger Soberanis-Mukul, Yufan He, Hao Ding, Jiru Xu, Chenhao Yu, Chenyan Jing, Pengfei Guo, Daguang Xu, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学) NVIDIA

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SAW通过四个轻量信号条件的视频扩散模型生成真实手术动作视频,解决手术AI和模拟中的数据稀缺、稀有事件合成及仿真到现实的差距问题,实现高时间一致性和视觉质量。

Comments The manuscript is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23120 2026-03-16 cs.CV 57%

MMGT: Motion Mask Guided Two-Stage Network for Co-Speech Gesture Video Generation

MMGT:基于运动遮罩的两阶段网络用于语音手势视频生成

Siyuan Wang, Jiawei Liu, Wei Wang, Yeying Jin, Jinsong Du, Zhi Han

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出MMGT网络,通过结合音频、运动遮罩和姿态视频生成同步语音手势视频,解决单一音频控制导致的大动作缺失问题,提升视频质量与细节控制。

Comments Accepted by IEEE TCSVT

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12749 2026-03-16 cs.CV cs.CR cs.LG 57%

SLICE: Semantic Latent Injection via Compartmentalized Embedding for Image Watermarking

SLICE: 通过 compartmentalized 编码的语义潜在注入实现图像水印

Zheng Gao, Yifan Yang, Xiaoyu Li, Xiaoyan Feng, Haoran Fan, Yang Song, Jiaojiao Jiang

机构 * University of New South Wales(新南威尔士大学) Griffith University(格里菲斯大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SLICE通过将图像语义分解为四个因素并精确锚定到初始高斯噪声区域,实现鲁棒的语义水印验证,有效检测和定位语义篡改,实验表明其在对抗攻击中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12648 2026-03-16 cs.CV 57%

From Sparse to Dense: Multi-View GRPO for Flow Models via Augmented Condition Space

从稀疏到密集:通过增强条件空间的多视图GRPO用于流模型

Jiazi Bu, Pengyang Ling, Yujie Zhou, Yibin Wang, Yuhang Zang, Tianyi Wei, Xiaohang Zhan, Jiaqi Wang, Tong Wu, Xingang Pan, Dahua Lin

机构 * Shanghai Jiao Tong University(上海交通大学) S-Lab, Nanyang Technological University(南洋理工大学S实验室) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) Shanghai AI Laboratory(上海人工智能实验室) Adobe Research(Adobe研究实验室) Stanford University(斯坦福大学) Shanghai Innovation Institute(上海创新研究院) CPII under InnoHK Project(InnoHK项目下的CPII)

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出多视图GRPO,通过增强条件空间探索样本间关系,提升文本到图像流模型的对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12482 2026-03-16 cs.CV 57%

CalliMaster: Mastering Page-level Chinese Calligraphy via Layout-guided Spatial Planning

CalliMaster:通过布局引导的空间规划掌握页面级中文书法

Tianshuo Xu, Tiantian Hong, Zhifei Chen, Fei Chao, Ying-cong Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Faculty of Engineering and IT, University of Technology Sydney(悉尼大学工程与信息学院) Xiamen University(厦门大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出CalliMaster框架,通过解耦空间规划与内容合成,解决页面级书法生成中精度与布局的平衡问题,支持可控生成与编辑,扩展至文物修复与鉴定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00547 2026-03-16 cs.CV cs.AI 57%

Motion Dreamer: Boundary Conditional Motion Reasoning for Physically Coherent Video Generation

Motion Dreamer:基于物理一致视频生成的边界条件运动推理

Tianshuo Xu, Zhifei Chen, Leyi Wu, Hao Lu, Yuying Chen, Lihui Jiang, Bingbing Liu, Yingcong Chen

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 本文提出Motion Dreamer框架,通过分离运动推理与视觉合成,解决视频生成中边界条件运动推理的问题,提升运动合理性与视觉真实性。

Comments The authors have decided to withdraw this article due to the following reasons identified after publication: Experimental Errors: Significant inaccuracies were discovered in the experimental results concerning segmentation and depth estimation. Authorship Disputes: In addition to the technical issues, there are unresolved disagreements regarding the author sequence and contributions

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12250 2026-03-13 cs.CV 57%

DVD: Deterministic Video Depth Estimation with Generative Priors

DVD:利用生成先验的确定性视频深度估计

Hongfei Zhang, Harold Haodong Chen, Chenfei Liao, Jing He, Zixin Zhang, Haodong Li, Yihao Liang, Kanghao Chen, Bin Ren, Xu Zheng, Shuai Yang, Kun Zhou, Yinchuan Li, Nicu Sebe, Ying-Cong Chen

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 DVD通过确定性方法将预训练视频扩散模型转化为单次通过深度回归器,解决视频深度估计中的生成与判别模型权衡问题,实现零样本性能提升并释放开源训练套件。

Comments Project: https://dvd-project.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12108 2026-03-13 cs.CV 57%

EvoTok: A Unified Image Tokenizer via Residual Latent Evolution for Visual Understanding and Generation

EvoTok:通过残差潜在进化实现统一的图像分词器用于视觉理解和生成

Yan Li, Ning Liao, Xiangyu Zhao, Shaofeng Zhang, Xiaoxing Wang, Yifan Yang, Junchi Yan, Xue Yang

机构 * University of Science and Technology of China(中国科学技术大学) Microsoft Corporation(微软公司)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 EvoTok通过残差潜在进化统一图像理解和生成,实现高效视觉表征建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11695 2026-03-13 cs.CV cond-mat.mtrl-sci 57%

PolyCrysDiff: Controllable Generation of Three-Dimensional Computable Polycrystalline Material Structures

PolyCrysDiff: 可控生成三维可计算多晶材料结构

Chi Chen, Tianle Jiang, Xiaodong Wei, Yanming Wang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 PolyCrysDiff通过条件潜在扩散框架实现了可计算的多晶材料三维微结构可控生成,有效提升了晶粒属性控制精度,为多晶材料的优化设计提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09487 2026-03-13 cs.CV 57%

Semantic-Aware Reconstruction Error for Detecting AI-Generated Images

语义感知的重建误差用于检测AI生成图像

Ju Yeon Kang, Jaehong Park, Semin Kim, Ji Won Yoon, Nam Soo Kim

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出语义感知的重建误差(SARE)用于检测AI生成图像,通过分析图像与描述词引导重建间的语义差异,提升跨生成模型的检测鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏