arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2143 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2143 篇

2602.17909 2026-04-20 cs.CV 57%

A Single Image and Multimodality Is All You Need for Novel View Synthesis

单张图像与多模态信息足矣实现新视角合成

Amirhosein Javadi, Chi-Shiang Gau, Konstantinos D. Polyzos, Tara Javidi

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出利用稀疏多模态测距数据提升单图像新视角合成的几何一致性和视觉质量,通过多模态深度重建框架替代传统单目深度估计,增强扩散模型的生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15299 2026-04-17 cs.CV 57%

AnimationBench: Are Video Models Good at Character-Centric Animation?

AnimationBench: 视频模型在以角色为中心的动画生成中表现如何?

Leyi Wu, Pengjun Fang, Kai Sun, Yazhou Xing, Yinwei Wu, Songsong Wang, Ziqi Huang, Dan Zhou, Yingqing He, Ying-Cong Chen, Qifeng Chen

机构 * New AI Labs

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出AnimationBench,首个系统评估动画图像到视频生成的基准,结合动画十二基本原则和IP保护,评估语义一致性、运动合理性等质量维度,支持标准化和开放集评估,揭示现实主义基准忽视的动画特定质量差异。

Comments Project Page: https://animationbench.github.io Code: https://github.com/VideoVerses/AnimationBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15134 2026-04-17 cs.CV 57%

How to Correctly Make Mistakes: A Framework for Constructing and Benchmarking Mistake Aware Egocentric Procedural Videos

如何正确犯错:一个用于构建和基准测试错误感知第一人称视频的框架

Olga Loginova, Frank Keller

机构 * University of Trento(特伦托大学) University of Edinburgh(爱丁堡大学) Italy(意大利) United Kingdom(大不列颠岛)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出PIE-V框架,通过引入可控的人类合理偏差来构建和评估错误感知的第一人称视频,结合心理学启发的错误计划、纠正计划、LLM作家和评委,提升视频的合理性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13425 2026-04-16 cs.CV 57%

VibeFlow: Versatile Video Chroma-Lux Editing through Self-Supervised Learning

VibeFlow:通过自监督学习实现多功能视频色光编辑

Yifan Li, Pei Cheng, Bin Fu, Shuai Yang, Jiaying Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出VibeFlow框架,通过自监督学习实现视频色光编辑,解决光照和颜色修改的同时保持结构和时间保真的问题,无需昂贵训练资源,支持零样本应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13036 2026-04-15 cs.CV 57%

Lyra 2.0: Explorable Generative 3D Worlds

Lyra 2.0:可探索的生成3D世界

Tianchang Shen, Sherwin Bahmani, Kai He, Sangeetha Grama Srinivasan, Tianshi Cao, Jiawei Ren, Ruilong Li, Zian Wang, Nicholas Sharp, Zan Gojcic, Sanja Fidler, Jiahui Huang, Huan Ling, Jun Gao, Xuanchi Ren

机构 * NVIDIA

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 Lyra 2.0通过维持每帧3D几何和自增强历史训练,解决空间遗忘和时间漂移问题,实现大规模可探索的3D世界生成。

Comments Project Page: https://research.nvidia.com/labs/sil/projects/lyra2/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11792 2026-04-14 cs.CV 57%

LottieGPT: Tokenizing Vector Animation for Autoregressive Generation

LottieGPT:为自回归生成设计向量动画的标记化

Junhao Chen, Kejun Gao, Yuehan Cui, Mingze Sun, Mingjin Chen, Shaohui Wang, Xiaoxiao Long, Fei Ma, Qi Tian, Ruqi Huang, Hao Zhao

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) AIR, Tsinghua University(清华大学人工智能研究院) BAAI(百度人工智能研究院) The Hong Kong Polytechnic University(香港理工大学) Nanjing University(南京大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳))

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出首个向量动画标记化与自回归生成框架,基于Lottie标准设计标记器并构建大规模数据集,通过微调Qwen-VL生成可编辑的向量动画。

Comments Accepted by CVPR 2026. Project Page: https://lottiegpt.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20654 2026-04-14 cs.CV cs.AI 57%

AccidentSim: Generating Vehicle Collision Videos with Physically Realistic Collision Trajectories from Real-World Accident Reports

AccidentSim: 从真实世界事故报告生成具有物理真实碰撞轨迹的车辆碰撞视频

Xiangwen Zhang, Qian Zhang, Longfei Han, Qiang Qu, Xiaoming Chen, Weidong Cai

机构 * School of Computer and Artificial Intelligence, Beijing Technology and Business University(北京工商大学计算机与人工智能学院) The University of Sydney(悉尼大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 AccidentSim通过提取事故报告中的物理信息生成真实碰撞视频,结合物理模拟和NeRF技术提升视觉与物理真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04175 2026-04-13 cs.CV 57%

Beyond Flicker: Detecting Kinematic Inconsistencies for Generalizable Deepfake Video Detection

超越闪烁:检测可泛化深度伪造视频检测中的运动不一致

Alejandro Cobo, Roberto Valle, José Miguel Buenaposada, Luis Baumela

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出合成视频生成方法,通过引入微妙的运动不一致来训练模型,从而提升深度伪造视频检测的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06655 2026-04-09 cs.CV 57%

Controllable Generative Video Compression

可控生成视频压缩

Ding Ding, Daowen Li, Ying Chen, Yixin Gao, Ruixiao Dong, Kai Li, Li Li

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出可控生成视频压缩方法,通过多视觉条件引导生成细节,兼顾信号保真度与感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06339 2026-04-09 cs.CV 57%

Evolution of Video Generative Foundations

视频生成基础的演变

Teng Hu, Jiangning Zhang, Hongrui Huang, Ran Yi, Zihan Su, Jieyu Weng, Zhucun Xue, Lizhuang Ma, Ming-Hsuan Yang, Dacheng Tao

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文综述了视频生成技术的发展,从早期GAN到扩散模型,再到AR和多模态技术,探讨了核心原理、关键进展及未来趋势,旨在为视频生成及其应用提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04142 2026-04-07 cs.CV 57%

OP-GRPO: Efficient Off-Policy GRPO for Flow-Matching Models

OP-GRPO:用于流匹配模型的高效非策略GRPO

Liyu Zhang, Kehan Li, Tingrui Han, Tao Zhao, Yuxuan Sheng, Shibo He, Chao Li

机构 * College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院) Central Research Institute, Huawei(华为中央研究院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 OP-GRPO通过高效非策略训练方法提升流匹配模型生成质量,通过高质轨迹选择与重要采样修正,实现训练效率提升34.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04029 2026-04-07 cs.CV 57%

ATSS: Detecting AI-Generated Videos via Anomalous Temporal Self-Similarity

ATSS:通过异常时间自相似性检测AI生成视频

Hang Wang, Chao Shen, Lei Zhang, Zhi-Qi Cheng

机构 * Xi’an Jiaotong University(西安交通大学) The Hong Kong Polytechnic University(香港理工大学) University of Washington(华盛顿大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出ATSS方法,通过三重相似性表示和跨注意融合机制,检测AI生成视频的异常时间自相似性,优于现有方法,在多个基准上表现更优。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03305 2026-04-07 cs.CV 57%

HVG-3D: Bridging Real and Simulation Domains for 3D-Conditional Hand-Object Interaction Video Synthesis

HVG-3D: 联接真实与仿真领域用于3D条件手-物体交互视频合成

Mingjin Chen, Junhao Chen, Zhaoxin Fan, Yujian Lee, Zichen Dang, Lili Wang, Yawen Cui, Lap-Pui Chau, Yi Wang

机构 * Dept. of EEE, The Hong Kong Polytechnic University(香港理工大学电机及电子工程学系) Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院未来区块链与隐私计算北京高精尖创新中心) Tsinghua University(清华大学) Beijing Normal-Hong Kong Baptist University(北京师范大学-香港浸会大学联合国际学院) State Key Laboratory of Virtual Reality Technology and Systems, School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院虚拟现实技术与系统国家重点实验室)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 HVG-3D提出一种统一框架,通过显式3D表示条件生成3D-aware手-物体交互视频,结合3D ControlNet与扩散架构,实现高保真度与时空可控性。

Comments Project page: https://hvg3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07469 2026-04-07 cs.CV 57%

VideoCoF: Unified Video Editing with Temporal Reasoner

VideoCoF:基于时间推理的统一视频编辑

Xiangpeng Yang, Ji Xie, Yiyuan Yang, Yue Ma, Yan Huang, Min Xu, Qiang Wu

机构 * University of Technology Sydney(悉尼科技大学) Zhejiang University(浙江大学) HKUST(香港科技大学)

专题命中 视频生成 :video diffusion(abstract);分类 cs.CV

AI总结 VideoCoF通过引入时间推理机制,解决视频编辑中精度与统一性的矛盾,实现无需掩码的精确区域映射和细粒度编辑,验证了方法的高效性与有效性。

Comments Accepted by CVPR 2026, Project Page: https://videocof.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02867 2026-04-06 cs.CV 57%

HairOrbit: Multi-view Aware 3D Hair Modeling from Single Portraits

HairOrbit: 从单人像中基于多视角的3D毛发建模

Leyang Jin, Yujian Zheng, Bingkui Tong, Yuda Qiu, Zhenyu Xie, Hao Li

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) SSE, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)理工学院) Pinscreen

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出HairOrbit框架,利用视频生成模型的3D先验知识,将单视角毛发重建转化为校准的多视角重建任务,并设计两阶段毛发生长算法,实现高质量的3D毛发合成。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14674 2026-04-03 cs.CV cs.LG 57%

LaVR: Scene Latent Conditioned Generative Video Trajectory Re-Rendering using Large 4D Reconstruction Models

LaVR:基于大规模4D重建模型的场景潜在条件生成视频轨迹重绘

Mingyang Xie, Numair Khan, Tianfu Wang, Naina Dhingra, Seonghyeon Nam, Haitao Yang, Zhuo Hui, Christopher Metzler, Andrea Vedaldi, Hamed Pirsiavash, Lei Luo

机构 * Meta University of Maryland(马里兰大学) University of Oxford(牛津大学) UC Davis(加州大学戴维斯分校)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出LaVR模型,通过利用大规模4D重建模型的潜在空间中的隐式几何知识,解决视频重绘中几何未条件化模型的空间感知不足和几何条件化模型对深度不准确的依赖问题,实现状态-of-the-art结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24506 2026-04-02 cs.CV 57%

Toward Physically Consistent Driving Video World Models under Challenging Trajectories

迈向在挑战性轨迹下物理一致的驾驶视频世界模型

Jiawei Zhou, Zhenxin Zhu, Lingyi Du, Linye Lyu, Lijun Zhou, Zhanqian Wu, Hongcheng Luo, Zhuotao Tian, Bing Wang, Guang Chen, Hangjun Ye, Haiyang Sun, Yu Li

机构 * Zhejiang University(浙江大学) Xiaomi EV(小米电动汽车) The Hong Kong Polytechnic University(香港理工大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出PhyGenesis,通过物理条件生成器和物理增强视频生成器,解决挑战性轨迹下视频生成的物理不一致问题,实验表明其在复杂轨迹上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19979 2026-04-01 cs.CV cs.AI 57%

X-World: Controllable Ego-Centric Multi-Camera World Models for Scalable End-to-End Driving

X-World: 可控的以自身为中心的多摄像头世界模型用于可扩展的端到端驾驶

Chaoda Zheng, Sean Li, Jinhao Deng, Zhennan Wang, Shijia Chen, Liqiang Xiao, Ziheng Chi, Hongbin Lin, Kangjie Chen, Boyang Wang, Yu Zhang, Xianming Liu

机构 * GWM Team(长城汽车团队) XPeng Inc.(小鹏汽车)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 X-World通过可控的多摄像头生成世界模型,实现高质量多视角视频生成,支持跨摄像头一致性、长时间动态稳定性和严格动作遵循,为可扩展的端到端驾驶评估提供基础。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28366 2026-03-31 cs.CV 57%

AutoCut: End-to-end advertisement video editing based on multimodal discretization and controllable generation

AutoCut:基于多模态离散化和可控生成的端到端广告视频编辑

Milton Zhou, Sizhong Qin, Yongzhi Li, Quan Chen, Peng Jiang

机构 * Tsinghua University(清华大学) Kuaishou Technology(快手科技)

专题命中 视频生成 :long video(abstract);分类 cs.CV

AI总结 本文提出AutoCut框架,通过多模态离散化和可控生成实现广告视频编辑,提升一致性和可控性,降低生产成本和迭代时间。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12057 2026-03-31 cs.CV cs.AI 57%

Coarse-Guided Visual Generation via Weighted h-Transform Sampling

通过加权h变换采样实现粗引导的视觉生成

Yanghao Wang, Ziqi Jiang, Zhen Wang, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出一种基于h变换的粗引导视觉生成方法,通过调整采样步骤的概率过渡,结合噪声水平感知调度,提升生成质量与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27083 2026-03-31 cs.CV 57%

LightCtrl: Training-free Controllable Video Relighting

LightCtrl: 不需要训练的可控视频重照明

Yizuo Peng, Xuelin Chen, Kai Zhang, Xiaodong Cun

机构 * Tsinghua University(清华大学) GVC Lab, Great Bay University(大湾区大学GVC实验室) Adobe Research(Adobe研究院)

专题命中 视频生成 :video diffusion(abstract);分类 cs.CV

AI总结 LightCtrl是首个无需训练的可控视频重照明方法,通过用户提供的光照轨迹实现对视频光照的显式控制,结合预训练扩散模型提升时间一致性,实验显示其在光照变化多样性和可控性上优于基线方法。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25053 2026-03-31 cs.CV 57%

GaussFusion: Improving 3D Reconstruction in the Wild with A Geometry-Informed Video Generator

GaussFusion: 通过几何引导的视频生成提升野外3D重建

Liyuan Zhu, Manjunath Narayana, Michal Stary, Will Hutchcroft, Gordon Wetzstein, Iro Armeni

机构 * Stanford University(斯坦福大学) Zillow Group(Zillow集团)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 GaussFusion通过几何引导的视频生成技术改进3DGS重建,解决常见伪影问题,提供更鲁棒的3D重建方法,实现在新型视图合成中的最佳性能。

Comments CVPR 2026 main paper camera-ready. Project page: http://research.zhuliyuan.net/projects/GaussFusion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07455 2026-03-31 cs.CV cs.AI cs.CL cs.GR 57%

Image Generation Models: A Technical History

图像生成模型:技术史

Rouzbeh Shirvani

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文综述了过去十年图像生成模型的快速发展,涵盖VAEs、GANs、正常化流、自回归和Transformer模型以及扩散方法,分析其技术原理、训练方法及局限性,并讨论视频生成和模型鲁棒性等最新进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19623 2026-03-30 cs.CV cs.AI cs.HC 57%

PedaCo-Gen: Scaffolding Pedagogical Agency in Human-AI Collaborative Video Authoring

PedaCo-Gen:在人机协作视频制作中构建教学代理

Injun Baek, Yearim Kim, Nojun Kwak

机构 * Seoul National University(首尔大学)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

AI总结 PedaCo-Gen通过引入中间表示阶段,使教育者能与AI审查员互动审查和优化视频蓝图,提升视频质量与教学有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18746 2026-03-30 cs.CV cs.AI 57%

Any4D: Open-Prompt 4D Generation from Natural Language and Images

Any4D: 从自然语言和图像生成开放提示的4D生成

Hao Li, Qiao Sun

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出Primitive Embodied World Models,通过限制视频生成时间范围,实现语言与视觉表示的细粒度对齐,降低学习复杂度,提升数据效率,并减少推理延迟,支持复杂任务的组合泛化。

Comments The authors identified issues in the 4D generation pipeline and evaluation that affect result validity. To ensure scientific accuracy, we will revise the methodology and experiments thoroughly before resubmitting. This version should not be cited or relied upon

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00393 2026-03-27 cs.CV 57%

NeoVerse: Enhancing 4D World Model with in-the-wild Monocular Videos

NeoVerse:基于真实世界单目视频增强4D世界模型

Yuxue Yang, Lue Fan, Ziqi Shi, Junran Peng, Feng Wang, Zhaoxiang Zhang

机构 * NLPR & MAIS, CASIA(国家工程实验室与机器智能研究所,中国科学院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出NeoVerse,一种能实现4D重建、生成新颖轨迹视频及多种下游应用的 versatile 4D 世界模型。通过解决现有方法在可扩展性上的局限,NeoVerse 基于单目视频构建可扩展的全流程,实现高泛化能力与高性能。

Comments CVPR 2026; Project Page: https://neoverse-4d.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23960 2026-03-26 cs.CV 57%

Leave No Stone Unturned: Uncovering Holistic Audio-Visual Intrinsic Coherence for Deepfake Detection

不留死角:揭示深度伪造检测中的整体音频视觉内在一致性

Jielun Peng, Yabin Wang, Yaqi Li, Long Kong, Xiaopeng Hong

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

AI总结 本文提出HAVIC方法,通过学习模态特定的结构一致性及跨模态微/宏观一致性,提升深度伪造检测的鲁棒性和泛化能力,实验表明其在跨数据集场景中性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05848 2026-03-24 cs.CV cs.AI cs.RO 57%

Goal Force: Teaching Video Models To Accomplish Physics-Conditioned Goals

目标力:教视频模型实现物理条件化的目标

Nate Gillman, Yinghua Zhou, Zitian Tang, Evan Luo, Arjan Chakravarthy, Daksh Aggarwal, Michael Freeman, Charles Herrmann, Chen Sun

机构 * Brown University(布朗大学) Cornell University(康奈尔大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出Goal Force框架,通过显式力矢量和中间动力学定义目标,使视频模型能零样本泛化到复杂现实场景,实现基于物理的视频生成与规划。

Comments Camera ready version (CVPR 2026). Code and interactive demos at https://goal-force.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15700 2026-03-24 cs.CV 57%

First Frame Is the Place to Go for Video Content Customization

视频内容定制中的首帧至关重要

Jingxi Chen, Zongxia Li, Zhichao Liu, Guangyao Shi, Xiyang Wu, Fuxiao Liu, Cornelia Fermuller, Brandon Y. Feng, Yiannis Aloimonos

机构 * University of Maryland(马里兰大学) USC(南加州大学) MIT(麻省理工学院) NVIDIA(NVIDIA公司)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文揭示视频生成模型将首帧视为概念记忆缓冲区,通过少量训练示例实现鲁棒且通用的视频内容定制。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08536 2026-03-24 cs.CV 57%

SWIFT: Sliding Window Reconstruction for Few-Shot Training-Free Generated Video Attribution

SWIFT: 基于滑动窗口的少样本训练自由生成视频属性识别

Chao Wang, Zijin Yang, Yaofei Wang, Yuang Qi, Weiming Zhang, Nenghai Yu, Kejiang Chen

机构 * University of Science and Technology of China(中国科学技术大学) Hefei University of Technology(合肥工业大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出SWIFT方法,通过滑动窗口实现视频属性识别,无需额外训练即可在多种生成模型上达到90%以上的准确率,支持零样本识别。

Comments 8 pages. Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏