arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1204 信号源:cs.CV, cs.GR, cs.MM

1. 图像生成评测 1204 篇

2603.00526 2026-03-03 cs.CV 57%

Mesh-Pro: Asynchronous Advantage-guided Ranking Preference Optimization for Artist-style Quadrilateral Mesh Generation

Mesh-Pro: 异步优势引导的排名偏好优化用于艺术家风格的四边形网格生成

Zhen Zhou, Jian Liu, Biwen Lei, Jing Xu, Haohan Weng, Yiling Zhu, Zhuo Chen, Junfeng Fan, Yunkai Ma, Dazhao Du, Song Guo, Fengshui Jing, Chunchao Guo

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tencent Hunyuan(腾讯文元) Hong Kong University of Science and Technology(香港科技大学)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 Mesh-Pro通过异步优势引导的排名偏好优化提升3D网格生成的训练效率和生成质量,引入了新的标记化和奖励机制,实现了艺术家风格网格的先进性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21333 2026-03-03 cs.CV 57%

HorizonForge: Driving Scene Editing with Any Trajectories and Any Vehicles

HorizonForge: 通过任意轨迹和任意车辆驱动场景编辑

Yifan Wang, Francesco Pittaluga, Zaid Tasneem, Chenyu You, Manmohan Chandraker, Ziyu Jiang

机构 * NEC Labs America(NEC美国实验室) Stony Brook University(石溪大学) UC San Diego(圣地亚哥大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 HorizonForge通过任意轨迹和车辆实现驾驶场景的可控编辑,利用高斯溅射体和网格表示,结合视频扩散技术,提升生成场景的真实性和可控性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10980 2026-03-03 cs.CV 57%

TrueSkin: Towards Fair and Accurate Skin Tone Recognition and Generation

TrueSkin: 向公平和准确的皮肤色调识别与生成迈进

Haoming Lu

机构 * Topaz Labs(Topaz实验室)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 TrueSkin通过系统化的皮肤色调数据集,提升模型在公平性和准确性上的表现,验证了其在识别和生成任务中的有效性。

Comments The dataset is available for download at https://drive.google.com/file/d/1_ndw5uyY4h4DLL5iGTL4bVDKdE_g_H4B/view?usp=sharing

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02088 2026-02-27 cs.CV cs.AI 57%

Dual-IPO: Dual-Iterative Preference Optimization for Text-to-Video Generation

Dual-IPO: 双迭代偏好优化用于文本到视频生成

Xiaomeng Yang, Mengping Yang, Jia Gong, Luozheng Qin, Zhiyu Tan, Hao Li

机构 * Fudan University(复旦大学) Shanghai Academy of AI for Science(上海人工智能科学研究院)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 Dual-IPO通过迭代优化奖励模型和视频生成模型,提升文本到视频生成的质量和人类偏好对齐,无需手动标注即可提高合成效果。

Comments To appear in ICLR 2026, GitHub Code: https://github.com/SAIS-FUXI/IPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05236 2026-02-26 cs.CV 57%

Unified Reward Model for Multimodal Understanding and Generation

多模态理解和生成的统一奖励模型

Yibin Wang, Yuhang Zang, Hao Li, Cheng Jin, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Lab(上海人工智能实验室)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 本文提出统一奖励模型,通过联合学习多种视觉任务提升多模态理解和生成的性能。

Comments project page: https://codegoat24.github.io/UnifiedReward/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21015 2026-02-25 cs.CV 57%

From Perception to Action: An Interactive Benchmark for Vision Reasoning

从感知到行动:一个交互式基准测试用于视觉推理

Yuhao Wu, Maojia Song, Yihuai Lan, Lei Wang, Zhiqiang Hu, Yao Xiao, Heng Zhou, Weihua Zheng, Dylan Raharja, Soujanya Poria, Roy Ka-Wei Lee

机构 * Singapore University of Technology(新加坡科技设计大学) Singapore Management University (SMU), Singapore(新加坡管理学院) Nanyang Technological University (NTU), Singapore(南洋理工大学) University of Science(科学大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 CHAIN基准测试通过交互式3D物理驱动环境,评估模型在动态环境中理解、规划和执行基于物理约束的结构化动作序列的能力。

Comments Work in processing. Website: https://social-ai-studio.github.io/CHAIN/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18525 2026-02-24 cs.CV cs.LG 57%

Do Generative Metrics Predict YOLO Performance? An Evaluation Across Models, Augmentation Ratios, and Dataset Complexity

生成度量是否能预测YOLO性能?在不同模型、增强比例和数据集复杂度上的评估

Vasile Marian, Yong-Bin Kang, Alexander Buddery

机构 * School of Mechanical and Mining Engineering, The University of Queensland,Level 4, Mansergh Shaw Building (45), St Lucia, QLD 4072, Australia(昆士兰大学机械与采矿工程学院) Swinburne University of Technology, John Street, Hawthorn, VIC 3122, Australia(斯威本科技大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本研究评估了生成度量对YOLO性能的预测能力,发现合成增强在不同数据集和场景中对检测mAP有显著提升,但需结合增强量和场景特性进行分析。

Comments 23 pages, 13 figures, includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17793 2026-02-23 cs.CV eess.IV 57%

LGD-Net: Latent-Guided Dual-Stream Network for HER2 Scoring with Task-Specific Domain Knowledge

LGD-Net:基于任务特定领域知识的HER2评分潜变量引导双流网络

Peide Zhu, Linbin Lu, Zhiqin Chen, Xiong Chen

机构 * School of Mathematics and Statistics, Fujian Normal University(福建师范大学数学与统计学学院) Department of Oncology, Mengchao Hepatobiliary Hospital of Fujian Medical University(福建医科大学 Mengchao 肝胆医院肿瘤科)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 LGD-Net通过跨模态特征幻觉替代显式像素生成,利用任务特定领域知识提升HER2评分的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14237 2026-02-17 cs.CV cs.AI 57%

AbracADDbra: Touch-Guided Object Addition by Decoupling Placement and Editing Subtasks

AbracADDbra: 通过解耦放置和编辑子任务实现触控引导的对象添加

Kunal Swami, Raghu Chittersu, Yuvraj Rathore, Rajeev Irny, Shashavali Doodekula, Alok Shukla

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 AbracADDbra通过解耦放置和编辑子任务,利用触控先验实现高效精准的对象添加,提升了交互式编辑的用户体验和编辑质量。

Comments Accepted in IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13961 2026-02-17 cs.CV astro-ph.IM cs.CL 57%

MarsRetrieval: Benchmarking Vision-Language Models for Planetary-Scale Geospatial Retrieval on Mars

MarsRetrieval: 用于火星尺度地理空间检索的视觉-语言模型基准测试

Shuoyuan Wang, Yiran Wang, Hongxin Wei

机构 * Department of Statistics and Data Science(统计与数据科学系) Department of Earth and Space Sciences(地球与空间科学系)

专题命中 图像生成评测 :generative vision(abstract);分类 cs.CV

AI总结 MarsRetrieval提出了一种用于评估视觉-语言模型在火星地理空间发现中检索能力的基准测试,强调领域特定微调对可推广发现的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13066 2026-02-16 cs.CV 57%

A Calibrated Memorization Index (MI) for Detecting Training Data Leakage in Generative MRI Models

一种校准的记忆指数(MI)用于检测生成磁共振成像模型中的训练数据泄漏

Yash Deo, Yan Jia, Toni Lassila, Victoria J Hodge, Alejandro F Frang, Chenghao Qian, Siyuan Kang, Ibrahim Habli

机构 * Department of Computer Science, University of York(约克大学计算机科学系) School of Computer Science, University of Leeds(利兹大学计算机科学学院) Department of Computing and Mathematics, Manchester Metropolitan University(曼彻斯特 Metropolitan 大学计算与数学系) Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) Department of Cardiovascular Sciences, KU Leuven(鲁汶大学心血管科学系)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 本文提出了一种校准的记忆指数(MI)用于检测生成磁共振成像模型中的训练数据泄漏,通过图像特征提取和多层白化最近邻相似性分析,实现对复制数据的高效检测。

Comments Accepted in ISBI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12563 2026-02-16 cs.CV 57%

The Constant Eye: Benchmarking and Bridging Appearance Robustness in Autonomous Driving

恒定的眼睛:自动驾驶中外观鲁棒性的基准测试与弥合

Jiabao Wang, Hongyu Zhou, Yuanbo Yang, Jiahao Shao, Yiyi Liao

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文提出navdream基准测试,通过生成像素对齐的风格迁移,评估自动驾驶算法在极端天气等外观变化下的鲁棒性,并提出通用感知接口实现零样本泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09891 2026-02-11 cs.SD cs.LG cs.MM 57%

Stemphonic: All-at-once Flexible Multi-stem Music Generation

Stemphonic:一次生成灵活多音部音乐创作

Shih-Lun Wu, Ge Zhu, Juan-Pablo Caceres, Cheng-Zhi Anna Huang, Nicholas J. Bryan

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Adobe Research(Adobe研究院)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.MM

AI总结 Stemphonic通过一次生成灵活多音部音乐创作,提升音乐生成效率和质量。

Comments Accepted for publication at Int. Conf. on Acoustics, Speech, and Signal Processing (ICASSP) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07814 2026-02-10 cs.CV cs.AI 57%

How well are open sourced AI-generated image detection models out-of-the-box: A comprehensive benchmark study

开源生成图像检测模型的即插即用性能如何:一项全面的基准研究

Simiao Ren, Yuchen Zhou, Xingyu Shen, Kidus Zewde, Tommy Duong, George Huang, Hatsanai, Tiangratanakul, Tsang, Ng, En Wei, Jiayu Xue

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文评估了16种最新图像检测模型的即插即用性能,发现无统一最佳模型,训练数据对齐影响显著,现代生成器性能优异,揭示了跨数据集泛化中的系统性故障模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01666 2026-02-10 cs.CV 57%

Moonworks Lunara Aesthetic II: An Image Variation Dataset

月光作品 Lunara 美学 II:一个图像变化数据集

Yan Wang, Partho Hassan, Samiha Sadeka, Nada Soliman, Sayeef Abdullah, Sabit Hassan

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 Lunara Aesthetic II 是一个用于评估图像生成和编辑系统中上下文一致性的公开数据集,通过保持身份的上下文变换提供监督信号,具有高美学评分和稳定的身份特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06179 2026-02-09 cs.CV 57%

Unsupervised Anomaly Detection of Diseases in the Female Pelvis for Real-Time MR Imaging

对女性骨盆疾病进行实时MRI成像的无监督异常检测

Anika Knupfer, Johanna P. Müller, Jordina A. Verdera, Martin Fenske, Claudius S. Mathy, Smiti Tripathy, Sebastian Arndt, Matthias May, Michael Uder, Matthias W. Beckmann, Stefanie Burghaus, Jana Hutter

机构 * Radiological Institute, University Hospital Erlangen (UKER)(放射医学研究所,埃尔兰根大学医院(UKER)) Institute of Information Processing, Leibniz University Hannover(信息处理研究所,汉诺威莱布尼茨大学) Image Data Exploration and Analysis Lab, Friedrich-Alexander University Erlangen–Nürnberg (FAU)(图像数据探索与分析实验室,埃尔兰根-纽伦堡弗里德里希-亚历山大大学(FAU)) Institute of Women’s Health, UKER(妇女健康研究所,UKER)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出了一种基于残差变分自编码器的无监督异常检测方法,用于实时MRI中女性骨盆疾病的检测,通过健康数据训练实现对异常区域的自动识别。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16964 2026-02-04 cs.CV cs.CL 57%

MedFrameQA: A Multi-Image Medical VQA Benchmark for Clinical Reasoning

MedFrameQA: 一个多图像医学视觉问答基准用于临床推理

Suhao Yu, Haojin Wang, Juncheng Wu, Luyang Luo, Jingshen Wang, Cihang Xie, Pranav Rajpurkar, Carl Yang, Yang Yang, Kang Wang, Yannan Yu, Yuyin Zhou

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) UC Santa Cruz(加州大学圣克鲁兹分校) Harvard University(哈佛大学) UC Berkeley(加州大学伯克利分校) Emory University(埃默里大学) UC San Francisco(旧金山加州大学)

专题命中 图像生成评测 :image synthesis(abstract);分类 cs.CV

AI总结 MedFrameQA是一个多图像医学视觉问答基准,旨在评估多图像医学推理能力,揭示现有模型在处理复杂医学叙述时的不足。

Comments 27 pages, 15 Figures Benchmark data: https://huggingface.co/datasets/SuhaoYu1020/MedFrameQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01298 2026-02-03 cs.CV 57%

Interaction-Consistent Object Removal via MLLM-Based Reasoning

基于MLLM的交互一致物体移除

Ching-Kai Huang, Wen-Chieh Lin, Yan-Cen Lee

机构 * National Yang Ming Chiao Tung University(阳明交通大学)

专题命中 图像生成评测 :image editing(abstract);分类 cs.CV

AI总结 本文提出基于MLLM的REORM框架,通过多模态语言模型推断需共同删除的交互元素,解决交互一致物体移除问题,并在ICOREval基准上验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00414 2026-02-03 cs.CV cs.LG 57%

Toward Autonomous Laboratory Safety Monitoring with Vision Language Models: Learning to See Hazards Through Scene Structure

迈向自主实验室安全监控:通过场景结构学习识别危险

Trishna Chakraborty, Udita Ghosh, Aldair Ernesto Gongora, Ruben Glatt, Yue Dong, Jiachen Li, Amit K. Roy-Chowdhury, Chengyu Song

机构 * Electrical and Computer Engineering, University of California, Riverside, USA(加州大学河滨分校电气与计算机工程系) Computer Science and Engineering, University of California, Riverside, USA(加州大学河滨分校计算机科学与工程系) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 本文提出通过场景图引导对齐方法,利用视觉语言模型提升实验室安全监控中危险识别的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00249 2026-02-03 cs.CV cs.AI 57%

SANEval: Open-Vocabulary Compositional Benchmarks with Failure-mode Diagnosis

SANEval: 开放词汇组合评估基准与失败模式诊断

Rishav Pramanik, Ian E. Nielsen, Jeff Smith, Saurav Pandit, Ravi P. Ramachandran, Zhaozheng Yin

机构 * Stony Brook University(石溪大学) nd Set AI Corp.(第二集AI公司) Rowan University(罗文大学)

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

AI总结 SANEval提出一种开放词汇组合评估基准,结合大型语言模型和增强对象检测器,通过实验展示其在属性绑定、空间关系和数值任务上的评估效果优于现有基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23167 2026-02-02 cs.CV 57%

Hi-Light: A Path to high-fidelity, high-resolution video relighting with a Novel Evaluation Paradigm

Hi-Light: 一种高保真、高分辨率视频重照明的新路径,采用新颖的评估范式

Xiangrui Liu, Haoxiang Li, Yezhou Yang

机构 * Arizona State University(亚利桑那州立大学) Pixocial Technology(Pixocial技术公司)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 Hi-Light通过引入亮度先验引导扩散、混合运动自适应照明平滑滤波器和LAB细节融合模块,实现了高保真、高分辨率的视频重照明,并提出了光稳定性分数作为新的评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01496 2026-02-02 cs.CV cs.LG eess.IV stat.ML 57%

Fréchet Radiomic Distance (FRD): A Versatile Metric for Comparing Medical Imaging Datasets

Fréchet Radiomic Distance (FRD): 一种用于比较医学影像数据集的多功能度量

Nicholas Konz, Richard Osuala, Preeti Verma, Yuwen Chen, Hanxue Gu, Haoyu Dong, Yaqian Chen, Andrew Marshall, Lidia Garrucho, Kaisar Kushibar, Daniel M. Lang, Gene S. Kim, Lars J. Grimm, John M. Lewin, James S. Duncan, Julia A. Schnabel, Oliver Diaz, Karim Lekadir, Maciej A. Mazurowski

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 FRD是一种专为医学影像设计的感知度量标准,通过标准化且可解释的图像特征提升医学影像分析中的比较和评估能力。

Comments Codebase for FRD computation: https://github.com/RichardObi/frd-score. Codebase for medical image similarity metric evaluation framework: https://github.com/mazurowski-lab/medical-image-similarity-metrics

Journal ref Medical Image Analysis, 103943 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04589 2026-01-30 cs.CV 57%

MiLDEdit: Reasoning-Based Multi-Layer Design Document Editing

MiLDEdit: 基于推理的多层设计文档编辑

Zihao Lin, Wanrong Zhu, Jiuxiang Gu, Jihyung Kil, Christopher Tensmeyer, Lin Zhang, Shilong Liu, Ruiyi Zhang, Lifu Huang, Vlad I. Morariu, Tong Sun

机构 * University of California, Davis(加州大学戴维斯分校) Adobe(Adobe公司) UW-Madison(威斯康星大学麦迪逊分校) Princeton University(普林斯顿大学)

专题命中 图像生成评测 :image editing(abstract);分类 cs.CV

AI总结 MiLDEdit通过引入基于推理的多层文档编辑代理,实现了对多层设计文档的精准编辑,显著超越现有方法,建立了该领域的首个强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08470 2026-01-14 cs.CV 57%

Towards Safer Mobile Agents: Scalable Generation and Evaluation of Diverse Scenarios for VLMs

迈向更安全的移动代理:为视觉语言模型(VLMs)可扩展生成和评估多样化场景

Takara Taniguchi, Kuniaki Saito, Atsushi Hashimoto

机构 * OMRON SINIC X

专题命中 图像生成评测 :image editing(abstract);分类 cs.CV

AI总结 本研究提出HazardForge框架,用于生成多样化场景以评估VLM在复杂环境中的安全决策能力,构建MovSafeBench基准测试并验证VLM在异常场景下的性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19024 2026-01-13 cs.CV 57%

A Survey of Multimodal Hallucination Evaluation and Detection

多模态幻觉评估与检测综述

Zhiyuan Chen, Yuecong Min, Jie Zhang, Bei Yan, Jiahao Wang, Xiaozhen Wang, Shiguang Shan

机构 * State Key Laboratory of AI Safety(人工智能安全国家重点实验室) Institute of Computing Technology, Chinese Academy of Sciences (CAS)(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Trustworthy Technology and Engineering Laboratory(可信技术与工程实验室) Huawei(华为公司)

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

AI总结 本文综述了多模态幻觉评估与检测方法,分析了幻觉分类、评估基准、检测技术及未来研究方向。

Comments 40 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16303 2026-01-12 cs.CV cs.AI 57%

PixelArena: A benchmark for Pixel-Precision Visual Intelligence

PixelArena: 一个用于像素级视觉智能的基准测试

Feng Liang, Sizhe Cheng, Chenqi Yi, Yong Wang

机构 * Nanyang Technological University(南洋理工大学)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 PixelArena提出通过语义分割任务以像素精度评估多模态模型的细粒度生成能力,发现Gemini 3 Pro在零样本设置下展现高保真语义掩码生成能力,揭示了视觉智能的新进展。

Comments 8 pages, 11 figures, project page: https://pixelarena.reify.ing/project

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11041 2026-01-09 cs.CV 57%

Beyond Fixed Topologies: Unregistered Training and Comprehensive Evaluation Metrics for 3D Talking Heads

超越固定拓扑:用于3D说话人脸的无注册训练和综合评估指标

Federico Nocentini, Thomas Besnier, Claudio Ferrari, Sylvain Arguillere, Mohamed Daoudi, Stefano Berretti

机构 * MICC, University of Florence(佛罗伦萨大学MICC) CRIStAL, University of Lille, CNRS, Centrale Lille(里尔大学CRIStAL) IMT Nord Europe, University of Lille(里尔大学IMT Nord Europe) Dept. of Information Engineering and Mathematics, University of Siena(锡耶纳大学信息工程与数学系) Laboratoire Paul Painlevé, University of Lille, CNRS(里尔大学Paul Painlevé实验室)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种能够处理任意拓扑的3D说话人脸生成方法,通过热扩散预测鲁棒特征,并引入新的评估指标以提升唇同步效果。

Comments https://fedenoce.github.io/scantalk/

Journal ref International Journal of Computer Vision 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13718 2026-01-01 cs.CV 57%

A Mutual Information Perspective on Multiple Latent Variable Generative Models for Positive View Generation

从互信息角度探讨多潜在变量生成模型在正视图生成中的应用

Dario Serez, Marco Cristani, Alessio Del Bue, Vittorio Murino, Pietro Morerio

机构 * Istituto Italiano di Tecnologia(意大利技术研究院) Reykjavík University(雷克雅未克大学) University of Verona(威尼斯大学)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 本文从互信息角度探讨多潜在变量生成模型在正视图生成中的应用,提出量化潜在变量贡献的方法,并引入连续采样策略提升自监督学习效果。

Journal ref Transactions on Machine Learning Research (TMLR), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16582 2025-12-30 cs.CV cs.LG 57%

A Novel Metric for Detecting Memorization in Generative Models for Brain MRI Synthesis

一种用于检测生成模型中记忆的新型度量方法

Antonio Scardace, Lemuel Puglisi, Francesco Guarnera, Sebastiano Battiato, Daniele Ravì

机构 * University of Catania(卡塔尼亚大学) University of Messina(梅西纳大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文提出DeepSSIM,一种用于检测生成模型中记忆的新型自监督度量方法,通过学习嵌入空间和结构保持增强,有效提升记忆检测性能。

Comments Accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19990 2025-12-24 cs.CV 57%

A Dual-Branch Local-Global Framework for Cross-Resolution Land Cover Mapping

面向跨分辨率土地覆盖制图的双分支局部-全局框架

Peng Gao, Ke Li, Di Wang, Yongshan Zhu, Yiming Zhang, Xuemei Luo, Yifeng Wang

机构 * Guangzhou Institute of Technology(广州科技研究院) Xidian University(西安电子科技大学) School of Computer Science and Technology(计算机科学与技术学院) University of California(加州大学) Department of Mathematics(数学系)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 DDTM通过双分支框架解耦局部语义细化与全局上下文推理,提升跨分辨率土地覆盖制图的精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏