arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1204 信号源:cs.CV, cs.GR, cs.MM

1. 图像生成评测 1204 篇

2512.18181 2026-05-08 cs.CV 57%

MACE-Dance: Motion-Appearance Cascaded Experts for Music-Driven Dance Video Generation

MACE-Dance: 基于动作-外观级联专家的音乐驱动舞蹈视频生成

Kaixing Yang, Jiashu Zhu, Xulong Tang, Ziqiao Peng, Xiangyue Zhang, Puwei Wang, Jiahong Wu, Xiangxiang Chu, Hongyan Liu, Jun He

机构 * Renmin University of China(中国人民大学) AMAP, Alibaba Group(阿里集团AMAP) Wuhan University(武汉大学) Tsinghua University(清华大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文提出MACE-Dance框架,结合级联混合专家模型,实现音乐驱动的高质量舞蹈视频生成,通过动作和外观专家分别生成3D动作和视频,提升视觉一致性和动作真实感。

Comments Accepted by SIGGRAPH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10248 2026-05-08 cs.CV cs.AI 57%

RobustSora: De-Watermarked Benchmark for Robust AI-Generated Video Detection

RobustSora:用于鲁棒AI生成视频检测的去水印基准

Zhuo Wang, Xiliang Liu, Ligang Sun

机构 * College of Computer Science, Beijing University of Technology(北京理工大学计算机学院)

专题命中 图像生成评测 :inpainting(abstract);分类 cs.CV

AI总结 本文提出RobustSora基准,通过6500个手动验证的视频评估AI生成视频检测的鲁棒性,发现水印操控影响检测准确率,强调水印意识在训练中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00883 2026-05-05 cs.CV cs.AI 57%

Towards High Fidelity Face Swapping: A Comprehensive Survey and New Benchmark

迈向高保真人脸交换:全面综述与新基准

Qi Li, Weining Wang, Shuangjun Du, Bo Peng, Jing Dong, Kun Wang, Zhenan Sun, Ming-Hsuan Yang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Nanyang Technological University(南洋理工大学) Yonsei University(延世大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文综述了人脸交换方法,提出新基准CASIA FaceSwapping,通过系统分析设计原理和局限性,提供统一视角和评估框架以推动更稳健的人脸交换技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09896 2026-05-04 cs.HC cs.AI cs.CV 57%

The Algorithmic Gaze of Image Quality Assessment: An Audit and Trace Ethnography of the LAION-Aesthetics Predictor

图像质量评估的算法凝视:LAION-Aesthetics预测器的审计与踪迹民族志

Jordan Taylor, William Agnew, Maarten Sap, Sarah E. Fox, Haiyi Zhu

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文研究了广泛用于训练视觉生成图像模型的LAION-Aesthetics预测器,揭示其在筛选图像数据时对女性描述的偏向性,以及其对西方艺术史中帝国和男性凝视的强化,呼吁转向更多元的审美评估。

Comments To Appear at FAccT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21864 2026-05-04 cs.CV 57%

Deepfakes: we need to re-think the concept of "real" images

深度伪造:我们需要重新思考“真实”图像的概念

Janis Keuper, Margret Keuper

机构 * Institute for Machine Learning and Analytics, Offenburg University(机器学习与分析研究所,奥芬堡大学) University of Mannheim(曼海姆大学) Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息研究所,萨尔兰州信息校区)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 本文指出当前“伪造”检测方法依赖过时的低分辨率“真实”图像数据集,呼吁重新定义“真实”图像并建立新基准数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27958 2026-05-01 cs.CV 57%

TripVVT: A Large-Scale Triplet Dataset and a Coarse-Mask Baseline for In-the-Wild Video Virtual Try-On

TripVVT:一个大规模三元组数据集和一个粗略遮罩基线用于真实场景视频虚拟试穿

Dingbao Shao, Song Wu, Shenyi Wang, Ye Wang, Ziheng Tang, Fei Liu, Jiang Lin, Xinyu Chen, Qian Wang, Ying Tai, Jian Yang, Zili Yi

机构 * Nanjing University, China(南京大学) JIUTIAN Research, CMCC, China(JIUTIAN研究院,CMCC,中国) Jilin University, China(吉林大学) ByteDance Inc., China(字节跳动公司)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文提出TripVVT-10K数据集和TripVVT框架,通过改进的遮罩先验提升视频虚拟试穿的鲁棒性和质量,同时建立评估基准以验证其在复杂场景中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02494 2026-04-30 cs.CL cs.AI cs.CV 57%

MINOS: A Multimodal Evaluation Model for Bidirectional Generation Between Image and Text

MINOS:一种用于图像与文本双向生成的多模态评估模型

Junzhe Zhang, Huixuan Zhang, Xinyu Hu, Li Lin, Mingqi Gao, Shi Qiu, Xiaojun Wan

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王萱计算机技术研究所) School of Physics, Peking University(北京大学物理学院)

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出MINOS模型,通过严格质量控制策略构建Minos-57K多模态评估数据集,结合SFT和偏好对齐训练策略,在16个跨领域数据集中取得最佳性能。

Comments Accepted to the Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24952 2026-04-29 cs.CV cs.AI 57%

Learning from Noisy Preferences: A Semi-Supervised Learning Approach to Direct Preference Optimization

从噪声偏好学习:一种半监督学习方法用于直接偏好优化

Xinxin Liu, Ming Li, Zonglin Lyu, Yuzhang Shang, Chen Chen

机构 * University of Central Florida(中央佛罗里达大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Semi-DPO方法,通过半监督学习处理多维偏好噪声,提升复杂人类偏好对齐性能,无需额外人工标注或显式奖励模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02467 2026-04-29 cs.CV cs.AI 57%

VERTIGO: Visual Preference Optimization for Cinematic Camera Trajectory Generation

VERTIGO:用于电影摄像机轨迹生成的视觉偏好优化

Mengtian Li, Yuwei Lu, Feifei Li, Chenqi Gan, Zhifeng Xie, Xi Wang

机构 * Shanghai University Shanghai Engineering Research Center of Motion Picture Special Effects LIX, \'Ecole Polytechnique, CNRS, IPP magenta http://vertigo.magic-lab.tech/

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文提出VERTIGO,通过视觉偏好优化提升摄像机轨迹生成的质量,通过实时渲染和视觉语言模型优化,提高画面构图和视觉效果。

Comments 28 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17492 2026-04-29 cs.CV 57%

MMLANDMARKS: a Cross-View Instance-Level Benchmark for Geo-Spatial Understanding

MMLANDMARKS: 一种用于地理空间理解的跨视图实例级基准

Oskar Kristoffersen, Alba Reinders Sánchez, Morten Rieger Hannemose, Anders Bjorholm Dahl, Dim P. Papadopoulos

机构 * Technical University of Denmark(丹麦技术大学) Pioneer Center for AI(先锋人工智能中心)

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出MMLandmarks基准,包含四类数据:高分辨率航拍图、地面视图、文本信息和地理坐标,用于跨视图地物检索、定位及文本到图像等任务,揭示多模态数据对地理空间理解的重要性。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07348 2026-04-29 cs.CV 57%

MICo-150K: A Comprehensive Dataset Advancing Multi-Image Composition

MICo-150K:一个多图像合成的综合数据集

Xinyu Wei, Kangrui Cen, Hongyang Wei, Zhen Guo, Kai Cui, Bairui Li, Zeqing Wang, Jinrui Zhang, Lei Zhang

机构 * Hong Kong Polytechnic University(香港理工大学) Tsinghua University(清华大学) Peking University(北京大学) Sun Yat-Sen University(中山大学) OPPO Research Institute(OPPO研究院)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 本文提出MICo-150K数据集,通过系统研究多图像合成任务,构建高质量图像和多样提示,结合人类反馈生成平衡的合成图像,同时建立评估基准和新指标,验证了数据集对模型提升的有效性。

Comments Project Page: https://MICo-150K.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26158 2026-04-28 cs.CV cs.AI 57%

Towards Continual Expansion of Data Coverage: Automatic Text-guided Edge-case Synthesis

迈向数据覆盖的持续扩展:自动文本引导的边缘案例合成

Kyeongryeol Go

机构 * Superb AI Seoul, South Korea(首尔超凡AI研究所,韩国)

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出自动文本引导的边缘案例合成方法,通过预训练语言模型生成多样化提示,提升模型鲁棒性,优于传统增强方法。

Comments Accepted in CVPR 2026 Workshop on How Do Vision Models Work

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22296 2026-04-27 cs.CV 57%

Evaluation of image simulation open source solutions for simulation of synthetic images in lunar environment

月球环境下的图像模拟开源解决方案评估

Jai G Singla, Hinal B Patel, Nitant Dube

机构 * Space Applications centre(空间应用中心) Indian Space Research Organization(印度空间研究组织)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 本文评估了用于生成月球环境合成图像的开源解决方案,重点分析不同相机模型和光照条件对图像质量的影响,以提高自主导航和决策系统在月球探索中的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19829 2026-04-23 cs.CV 57%

TactileEval: A Step Towards Automated Fine-Grained Evaluation and Editing of Tactile Graphics

TactileEval: 向自动细粒度评估和编辑触觉图形迈出一步

Adnan Khan, Abbas Akkasi, Majid Komeili

机构 * School of Computer Science, Carleton University(卡莱顿大学计算机科学学院)

专题命中 图像生成评测 :image editing(abstract);分类 cs.CV

AI总结 本文提出TactileEval,通过三阶段流程实现触觉图形的自动细粒度评估与编辑,基于专家评论建立质量分类体系,并利用ViT模型实现高精度任务识别与针对性修正。

Comments Code, data, and models are available at https://TactileEval.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17736 2026-04-22 cs.CV 57%

IncreFA: Breaking the Static Wall of Generative Model Attribution

IncreFA: 破解生成模型归因的静态壁垒

Haotian Qin, Dongliang Chang, Yueying Gao, Yuexuan Tan, Lei Chen, Zhanyu Ma

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Tsinghua University(清华大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 IncreFA将归因重新定义为结构化增量学习问题,通过层级约束和潜在记忆库机制,在28个生成模型上实现最先进的归因准确率和未见检测率。

Comments Accepted to CVPR 2026, with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26278 2026-04-21 cs.CV cs.CL 57%

ProfVLM: A lightweight video-language model for multi-view proficiency estimation

ProfVLM:一种轻量级视频-语言模型用于多视角技能评估

Edoardo Bianchi, Jacopo Staiano, Antonio Liotta

机构 * Free University of Bozen-Bolzano(博洛尼亚-博兹纳自由大学) University of Trento(特伦托大学)

专题命中 图像生成评测 :generative vision(abstract);分类 cs.CV

AI总结 本文提出ProfVLM,一种轻量级视频-语言模型,通过生成式视觉-语言建模实现多视角技能评估,兼具生成自然语言反馈与定量评分,参数更少且训练更快。

Journal ref Computer Vision and Image Understanding, Volume 268, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20360 2026-04-21 cs.CV 57%

EditVerse: Unifying Image and Video Editing and Generation with In-Context Learning

EditVerse:通过上下文学习统一图像和视频编辑与生成

Xuan Ju, Tianyu Wang, Yuqian Zhou, He Zhang, Qing Liu, Nanxuan Zhao, Zhifei Zhang, Yijun Li, Yuanhao Cai, Shaoteng Liu, Daniil Pakhomov, Zhe Lin, Soo Ye Kim, Qiang Xu

机构 * Adobe Research(Adobe研究院) CUHK(中国香港大学) Johns Hopkins University(约翰霍普金斯大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 本文提出EditVerse框架,通过统一token序列实现图像和视频生成编辑,利用自注意力机制实现跨模态知识迁移,实验表明其在视频编辑任务中达到SOTA水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10466 2026-04-20 cs.CV 57%

Art3D: Training-Free 3D Generation from Flat-Colored Illustration

Art3D: 无需训练的从平面着色插图生成3D

Xiaoyan Cong, Jiayi Shen, Zekun Li, Rao Fu, Tao Lu, Srinath Sridhar

机构 * Brown University(布朗大学)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 Art3D通过结合预训练2D图像生成模型和基于VLM的现实感评估,将平面着色插图提升为3D,解决了传统方法在处理无3D illusion的参考图像时的局限性,展示了其在多种绘画风格中的适应性。

Comments Technical Report. Project Page: https://joy-jy11.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11653 2026-04-14 cs.CV 57%

GazeVaLM: A Multi-Observer Eye-Tracking Benchmark for Evaluating Clinical Realism in AI-Generated X-Rays

GazeVaLM:一个多观察者眼动基准测试,用于评估AI生成X光片的临床真实性

David Wong, Zeynep Isik, Bin Wang, Marouane Tliba, Gorkem Durak, Elif Keles, Halil Ertugrul Aktas, Aladine Chetouani, Cagdas Topel, Nicolo Gennaro, Camila Lopes Vendrami, Tugce Agirlar Trabzonlu, Amir Ali Rahsepar, Laetitia Perronne, Matthew Antalek, Onural Ozturk, Gokcan Okur, Andrew C. Gordon, Ayis Pyrros, Frank H. Miller, Amir Borhani, Hatice Savas, Eric Hart, Elizabeth Krupinski, Ulas Bagci

机构 * Northwestern University(西北大学) Loyola University Chicago(洛约拉大学芝加哥分校) DuPage Medical Group(杜佩奇医疗集团) Emory University(埃默里大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 GazeVaLM通过眼动数据和临床标签,评估AI生成X光片的临床真实性,对比人类专家与LLM的诊断准确性。

Comments This work appears in ACM ETRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22832 2026-04-13 cs.CV cs.AI 57%

Listener-Rewarded Thinking in VLMs for Image Preferences

图像偏好中的VLMs思考奖励

Alexander Gambashidze, Li Pengyi, Matvey Skripkin, Andrey Galichin, Anton Gusarov, Konstantin Sobolev, Andrey Kuznetsov, Ivan Oseledets

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出一种增强GRPO框架,通过引入独立的监听器模型来校准推理过程,提升图像偏好任务中的准确性和泛化能力。

Comments part of a different work

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26241 2026-04-10 cs.CV cs.CL 57%

Which Way Does Time Flow? A Psychophysics-Grounded Evaluation for Vision-Language Models

时间如何流逝?基于心理物理学的评估用于视觉-语言模型

Shiho Matta, Lis Kanashiro Pereira, Peitao Han, Fei Cheng, Shigeru Kitazawa

机构 * Kyoto University(京都大学) Center for Information and Neural Networks(信息与神经网络中心) National Institute of Information and Communications Technology(国立信息通信技术研究所) The University of Osaka(大阪大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文通过心理物理学验证的基准测试评估了视觉-语言模型对时间方向的理解能力,发现大多数模型表现接近随机,且在物理不可逆过程和因果手动动作上远低于人类水平。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.00638 2026-04-10 cs.LG cs.CV 57%

Tabular GANs for uneven distribution

用于不均衡分布的表格GANs

Insaf Ashrapov

机构 * Moscow Institute of Physics and Technology(莫斯科物理技术学院)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文综述了三种主要范式下的表格数据生成方法,提出统一框架支持GAN、扩散模型和大语言模型,并通过实验验证框架在分布偏移下的有效性。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19121 2026-04-09 cs.CV cs.AI 57%

MSG Score: Automated Video Verification for Reliable Multi-Scene Generation

MSG Score: 多场景生成的自动化视频验证

Daewon Yoon, Hyeongseok Lee, Wonsik Shin, Sangyu Han, Nojun Kwak

机构 * Seoul National University(首尔大学) Samsung Electronics(三星电子)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文提出MSG Score用于评估长视频生成的叙事和视觉一致性,结合Implicit Insight Distillation解决评估与推理速度的平衡,实现可靠且可扩展的视频生成。

Comments 8 pages, 5 figures, 1 table, Accepted AAAI 2026 CVM workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04997 2026-04-08 cs.IR cs.AI cs.CL cs.CV cs.LG 57%

Evaluation of Embedding-Based and Generative Methods for LLM-Driven Document Classification: Opportunities and Challenges

嵌入式与生成方法在LLM驱动文档分类中的评估:机遇与挑战

Rong Lu, Hao Liu, Song Hou

专题命中 图像生成评测 :generative vision(abstract);分类 cs.CV

AI总结 本文比较了基于嵌入和生成模型在地学技术文档分类中的表现,发现增强的生成视觉-语言模型在零样本准确率上表现更优,但监督微调对训练数据不平衡敏感。

Comments Accepted at the IMAGE'25 Workshop (PCW-11), Society of Exploration Geophysicists (SEG). Published version available at https://doi.org/10.1190/image2025-w11-03.1

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08336 2026-04-08 cs.CL cs.CV 57%

From Reasoning to Pixels: Benchmarking the Alignment Gap in Unified Multimodal Models

从推理到像素:统一多模态模型中对齐差距的基准测试

Cheng Yang, Chufan Shi, Bo Shui, Yaokang Wu, Muzi Tao, Huijuan Wang, Ivan Yee Lee, Yong Liu, Xuezhe Ma, Taylor Berg-Kirkpatrick

机构 * University of California San Diego(加利福尼亚大学圣迭戈分校) University of Southern California(南加利福尼亚大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 本文通过UReason基准测试,探讨统一多模态模型中模态对齐问题,发现去上下文生成在图像生成任务中表现更优,揭示了文本推理与生成图像之间存在对齐差距。

Comments Project page: https://ureason.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14949 2026-04-08 cs.CL cs.CV cs.LG 57%

DialectGen: Benchmarking and Improving Dialect Robustness in Multimodal Generation

DialectGen:多模态生成中方言鲁棒性评估与改进

Yu Zhou, Sohyun An, Haikang Deng, Da Yin, Clark Peng, Cho-Jui Hsieh, Kai-Wei Chang, Nanyun Peng

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文通过构建涵盖六种英语方言的大型基准,评估多模态生成模型在方言输入下的表现,提出一种通用编码器策略提升方言鲁棒性,同时保持标准美式英语性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14194 2026-04-07 cs.CV cs.AI 57%

VLBiasBench: A Comprehensive Benchmark for Evaluating Bias in Large Vision-Language Model

VLBiasBench: 一个用于评估大视觉-语言模型偏见的综合性基准

Sibo Wang, Xiangkui Cao, Jie Zhang, Zheng Yuan, Shiguang Shan, Xilin Chen, Wen Gao

机构 * Key Laboratory of AI Safety of CAS, Institute of Computing Technology (ICT)(中国科学院人工智能安全重点实验室,计算技术研究所) University of Chinese Academy of Sciences (UCAS)(中国科学院大学) Peking University(北京大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文提出VLBiasBench,通过覆盖九种社会偏见类别和两个交叉偏见类别的大规模数据集,评估大视觉-语言模型的偏见问题,基于15种开源和两种闭源模型进行广泛评估,揭示模型中的偏见特征。

Comments Accepted By TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03819 2026-04-07 cs.CV 57%

ActivityForensics: A Comprehensive Benchmark for Localizing Manipulated Activity in Videos

活动取证:一种全面的基准,用于定位视频中的篡改活动

Peijun Bao, Anwei Luo, Gang Pan, Alex C. Kot, Xudong Jiang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) School of Computing and Artificial Intelligence, Jiangxi University of Finance and Economics(江西财经大学计算机与人工智能学院) Jiangxi Provincial Key Laboratory of Multimedia Intelligent Processing(江西省多媒体智能处理重点实验室) Faculty of Engineering, Shenzhen MSU-BIT University(深圳北理莫斯科大学工程系) VinUniversity

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文提出ActivityForensics基准,用于定位视频中被篡改的活动。该基准包含6000多个无缝融合的篡改视频片段,并引入了Temporal Artifact Diffuser方法,评估了多种最先进的伪造定位器。

Comments [CVPR 2026] The first benchmark for action-level deepfake localization

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03064 2026-04-06 cs.CV 57%

Gram-MMD: A Texture-Aware Metric for Image Realism Assessment

Gram-MMD:一种纹理感知的图像真实感评估度量方法

Joé Napolitano, Pascal Nguyen

机构 * AMIAD

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Gram-MMD,通过预训练网络的中间激活计算Gram矩阵,捕捉特征图间的相关性,以更精细的粒度评估图像真实感,实验表明其在跨域场景中优于现有语义度量。

Comments 13 pages, 15 figures, 2 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16908 2026-04-02 cs.CV 57%

Q-REAL: Towards Realism and Plausibility Evaluation for AI-Generated Content

Q-REAL:迈向AI生成内容真实性和可信度评估

Shushi Wang, Zicheng Zhang, Chunyi Li, Wei Wang, Liya Ma, Fengjiao Chen, Xiaoyu Li, Xuezhi Cao, Guangtao Zhai, Xiaohong Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Meituan(美团) Shanghai AI Lab(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院)

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出Q-REAL数据集,用于细粒度评估AI生成图像的真实性和可信度,通过标注实体位置和设计判断问题,提升生成模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏