arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

共收录 4781
2606.30288 2026-06-30 cs.CV

VisReflect: Latent Visual Reflection for Fine-Grained Perception in Long Visual Context

VisReflect: 用于长视觉上下文中细粒度感知的潜在视觉反射

Xiaoqian Shen, Mohamed Elhoseiny

机构 * King Abdullah University of Science and Technology(卡布斯大学)

AI总结 针对长视觉上下文中细粒度感知的挑战,提出VisReflect框架,通过潜在空间中的连续视觉反射选择性强调相关区域,无需显式定位或额外前向传播,在图像和视频基准上分别提升4.1%和1.8%,并减少约44%推理时间。

Comments Accepted to ECCV 2026; Project page: https://xiaoqian-shen.github.io/VisReflect

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30262 2026-06-30 cs.CV

Intermediate Text Representation Guided Text-to-Image Generation for Enhancing One-and-Only Alignment

中间文本表示引导的文本到图像生成以增强唯一性对齐

Soyoun Won, Aryan Yazdan Parast, Basim Azam, Jean Honorio, Naveed Akhtar

机构 * The University of Melbourne(墨尔本大学)

AI总结 针对文本到图像扩散模型在生成唯一性对象时因概念关联偏差导致对齐失败的问题,提出中间文本表示引导扩散方法,无需额外训练即可恢复被抑制的概念,在OAO-AttackBench上VQAScore提升高达19.1个百分点。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30215 2026-06-30 cs.CV cs.AI

Efficient RGB-T Object Detection via Sparse Cross-Modality Fusion

高效RGB-T目标检测通过稀疏跨模态融合

Chao Tian, Zikun Zhou, Chao Yang, Guoqing Zhu, Zhenyu He

机构 * Harbin Institute of Technology(哈尔滨工业大学)

AI总结 提出稀疏融合机制,先快速扫描图像识别候选区域,再对稀疏候选进行特征融合,实现高效RGB-T目标检测,在降低计算成本的同时保持高精度。

Comments Accepted by ECCV-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30124 2026-06-30 cs.CV

SciIR: A Large-scale Training Dataset and Benchmark for Scientific Image Reasoning Generation

SciIR:面向科学图像推理生成的大规模训练数据集与基准

Zhiyuan Ma, Zhengfeng Shi, Yuning An, Peize Li, Jiabao Wei, Ruijie Li, Junhao Xiao, Jianjun Li, Bowen Zhou

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology, China(华中科技大学计算机科学与技术学院,中国) School of Airspace Science and Engineering, Shandong University, China(山东大学航空航天科学与工程学院,中国) Department of Electronic Engineering, Tsinghua University, China(清华大学电子工程系,中国)

AI总结 为解决文本到图像模型在科学图像生成中语义对齐与逻辑推理不足的问题,构建了包含8万+高质量科学图像-文本对的SciIR-82k数据集,并提出三层次科学推理框架及可验证评估基准SciIR-Bench,微调模型Qwen-Image-SciIR在基准上得分从35%提升至43%。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30045 2026-06-30 cs.CV

Walking in the Implicit: Interactive World Exploration via Neural Scene Representation

行走于隐空间:通过神经场景表示进行交互式世界探索

Zhiqi Li, Chengrui Dong, Zhenhua Du, Hangning Zhou, Cong Qiu, Hailong Qin, Mu Yang, Dongxu Wei, Peidong Liu

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Afari Intelligent Drive(Afari智能驾驶)

AI总结 提出以场景为中心的交互式视频生成范式,将生成变量从帧隐变量改为可渲染的固定长度隐状态(神经隐式场景),通过紧凑场景状态随机转移和确定性姿态条件渲染实现长程一致性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30030 2026-06-30 cs.CV

CogSENet: Blind Image Deblurring with Blur-Conditioned Semantic Routing and Explicit Frequency Fusion

CogSENet: 基于模糊条件语义路由和显式频率融合的盲图像去模糊

Pan Wang, Yihao Hu, Xiujin Liu

机构 * University of Science and Technology of China(中国科学技术大学) Westlake University(西交大学) University of Michigan(密歇根大学)

AI总结 提出CogSENet,通过模拟鹰视觉系统的语义驱动状态空间模块和双频融合块,实现空间变化模糊下的自适应恢复,在去模糊、去雾、去雨和去噪任务上优于现有方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30019 2026-06-30 cs.CV

OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data

OmniDance: 基于大规模互联网数据的多模态驱动舞蹈视频生成

Kaixing Yang, Jiashu Zhu, Xulong Tang, Ziqiao Peng, Xiangyue Zhang, Chubin Chen, Puwei Wang, Jiahong Wu, Xiangxiang Chu, Hongyan Liu, Jun He

机构 * Renmin University of China(中国人民大学) AMAP, Alibaba Group(AMAP,阿里巴巴集团) Tsinghua University(清华大学) Wuhan University(武汉大学) Malou Tech Inc(Malou科技公司)

AI总结 提出CIPE-Dance大规模舞蹈视频数据集和OmniDance框架,通过深度感知架构、课程学习和条件引导策略,实现文本、音乐及多模态驱动的舞蹈视频生成,达到最优性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30017 2026-06-30 cs.CV

Monte Carlo Energy Aggregation for Mobile 3D Gaussian Splatting

移动端3D高斯泼溅的蒙特卡洛能量聚合

Xiaobiao Du, YuAn Wang, Hao Li, Bosheng Wang, Xun Sun, Xin Yu

机构 * University of Technology Sydney(悉尼技术大学) Baidu Inc.(百度公司) Australian Institute for Machine Learning(澳大利亚机器学习研究所)

AI总结 针对移动端3D高斯泼溅中高阶球谐函数带来的计算和存储开销问题,提出Flux-GS方法,通过蒙特卡洛能量聚合和属性条件增强模块实现低阶表示下的高质量渲染,并采用多视图密度控制减少冗余高斯体。

Comments ECCV 2026, Project Page:https://xiaobiaodu.github.io/flux-gs-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30012 2026-06-30 cs.CV

SkelEM: Training-Signal Decoupling of Skeleton and Diffusion for Self-supervised Axial Super-Resolution in Volume Microscopy

SkelEM:用于体积显微镜中自监督轴向超分辨率的骨架与扩散训练信号解耦

Bohao Chen, Yanchao Zhang, Yanan Lv, Chenxun Deng, Hua Han, Xi Chen

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences, China(中国科学院大学先进交叉学科学院) State Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology, Institute of Automation, Chinese Academy of Sciences, China(中国科学院脑认知与脑启发智能技术国家重点实验室) School of Future Technology, University of Chinese Academy of Sciences, China(中国科学院大学未来技术学院) School of Artificial Intelligence, University of Chinese Academy of Sciences, China(中国科学院大学人工智能学院)

AI总结 提出SkelEM框架,通过解耦低频拓扑与高频细节的训练信号,结合确定性骨架与扩散精炼器,实现体积显微镜自监督轴向超分辨率,仅需≤5步即可恢复高保真细节,并在新基准BRAVE-ASR上取得最优平衡。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30003 2026-06-30 cs.CV

GeoEdit: Geometry-Aware Object Editing via Dual-Branch Denoising

GeoEdit: 基于几何感知的双分支去噪对象编辑

Yi He, Jiangming Wang, Xinyu Wang, Mark Fong, Songchun Zhang, Yuxuan Xue, Hai-Tao Zheng, Yue Ma

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Pengcheng Laboratory(鹏城实验室) Sun Yat-sen University(中山大学) Peking University(北京大学) HKUST(香港科技大学) University of Tübingen(图宾根大学)

AI总结 提出GeoEdit,一种无需训练的三阶段管道,通过3D解耦、点对应对齐和双分支去噪,实现单张照片中对象的刚性几何变换(平移、旋转、缩放),同时保持背景自然和身份一致性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30001 2026-06-30 cs.CV cs.GR cs.HC cs.SD

SICAGE: Speaker-Independent Culture-Aware Gesture Generation using TED4C-L Dataset

SICAGE: 使用TED4C-L数据集的说话人无关文化感知手势生成

Ariel Gjaci, Antonio Sgorbissa, Vittorio Murino

机构 * Italian Institute of Technology(意大利理工学院) University of Genoa(热那亚大学)

AI总结 提出SICAGE框架,通过域泛化学习说话人无关的文化表征,结合ALaDiT扩散模型生成文化适切手势,在TED4C-L数据集上验证了运动真实性、多样性和文化一致性提升。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29952 2026-06-30 cs.LG cs.AI cs.CV

Exploiting Local Flatness for Efficient Out-of-Distribution Detection

利用局部平坦性进行高效分布外检测

Seonghwan Park, Hyunji Jung, Dongyeop Lee, Namhoon Lee

机构 * Korea Electronics Technology Institute (KETI)(韩国电子技术研究所) Pohang University of Science and Technology (POSTECH)(浦项科学技术大学)

AI总结 提出Fold方法,利用特征Hessian和部分特征归一化,通过局部平坦性差异高效检测分布外数据,并引入AutoFold自动校准,在保持计算效率的同时提升检测性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29941 2026-06-30 cs.RO cs.CV

Seeing Touch from Motion: A Unified Modality-Aware Visuo-Tactile Policy with Tactile Motion Correlation

从运动感知触觉:一种具有触觉运动相关性的统一模态感知视觉-触觉策略

Shengqi Xu, Guojin Zhong, Yang Liu, Fanjie Wang, Hu Luo, Hanyu Zhou, Weiyao Zhang, Ziyi Ye, Zuxuan Wu, Yu-Gang Jiang

AI总结 提出基于触觉运动相关性的运动感知触觉表示,并利用混合Transformer架构实现统一模态感知的视觉-触觉策略,以解决接触丰富操作中的感知模糊和跨模态融合问题。

Comments Accepted by ECCV 2026. Project website: https://shengqi77.github.io/Seeing-Touch-from-Motion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29908 2026-06-30 cs.RO cs.AI

Pondering the Way: Spatial-perceiving World Action Model for Embodied Navigation

沉思之道:面向具身导航的空间感知世界动作模型

Hong Chen, Daqi Liu, Zehan Zhang, Haiguang Wang, Tianhao Lu, Longfei Yan, Haiyang Sun, Fangzhen Li, Hongwei Xie, Bing Wang, Guang Chen, Hangjun Ye, Yihua Tan

AI总结 提出SWAM,一种任务中心联合观测-动作生成框架,通过单次推理同时生成中间RGB-D序列和对应动作轨迹,解决现有世界模型规划器依赖候选、计算开销大和动作-视觉不一致的问题,在成功率、轨迹精度和推理效率上显著超越两阶段方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29880 2026-06-30 cs.CV

IREU: Identity-Related Encoder-Only Unlearning for Customized Portrait Generation

IREU:面向定制肖像生成的基于身份的仅编码器遗忘

Chaoyi Shi, Shanshan Zhang, Jian Yang

机构 * PCA Lab, School of Computer Science and Engineering, Nanjing University of Science and Technology(计算机科学与工程学院,南京理工大学PCA实验室) PCA Lab, School of Intelligence Science and Technology, Nanjing University(智能科学与技术学院,南京大学PCA实验室)

AI总结 针对定制肖像生成中的隐私风险,提出IREU方法,通过离线定位身份相关特征并仅扰动这些特征来实现身份遗忘,同时保持其他身份的高保真度。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29847 2026-06-30 cs.CV

See Only When Needed: Context-Aware Attention Intervention for Mitigating Hallucinations in LVLMs

仅在需要时看:用于缓解LVLM中幻觉的上下文感知注意力干预

Yuqing Lei, Wenbo Lyu, Yingjun Du, Xiantong Zhen, Cees G. M. Snoek, Ling Shao

机构 * University of Chinese Academy of Sciences(中国科学院大学) University of Amsterdam(阿姆斯特丹大学) United Imaging Healthcare Co., Ltd.(联合影像医疗科技股份有限公司)

AI总结 提出训练自由的上下文感知注意力干预(CAI),通过两轴选择性(看哪里和何时干预)在解码时针对性增强视觉 grounding,有效缓解物体幻觉并保持语言流畅性。

Journal ref ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29794 2026-06-30 cs.CV

UniTriSplat: A Unified 3D Gaussian Splatting Framework with Uniform Spherical Rasterization for Universal Cameras

UniTriSplat:统一球面光栅化的通用相机3D高斯泼溅框架

Yipeng Zhu, Huajian Huang, Tristan Braud, Sai-Kit Yeung

机构 * The Hong Kong University of Science and Technology(香港科技大学) Beijing Institute of Technology(北京理工大学)

AI总结 针对现有3DGS框架依赖相机特定光栅化导致跨相机模型性能下降的问题,提出UniTriSplat,利用HEALPix离散化在单位球面上统一高斯泼溅,实现从窄视场到全景的一致优化。

Comments 32 pages, 14 figures, 6 tables. Project page: https://yipengzhu0809.github.io/UniTriSplat/ . UniTriSplat was accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29786 2026-06-30 cs.CV cs.RO

OP3DSG: Open-Vocabulary Part-Aware 3D Scene Graph Generation for Real-World Environments

OP3DSG:面向真实环境的开放词汇部件感知3D场景图生成

Yirum Kim, Ue-Hwan Kim

机构 * Gwangju Institute of Science and Technology(全州科学技术院)

AI总结 提出OP3DSG框架,通过部件感知检测与融合、几何初始化先验图及LLM精炼,实现开放词汇下对象、交互部件、空间/功能关系及可供性的统一建模,在UniGraph3D基准上达到最优性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29600 2026-06-30 cs.CV cs.AI

One Scene, Two Depths: Probing Geometric Ambiguity in Monocular Foundation Models

一场景,两深度:探究单目基础模型中的几何歧义性

Xiaohao Xu, Feng Xue, Xiang Li, Haowei Li, Shusheng Yang, Tianyi Zhang, Matthew Johnson-Roberson, Xiaonan Huang

机构 * University of Michigan(密歇根大学) Carnegie Mellon University(卡内基梅隆大学) New York University(纽约大学) Vanderbilt University(范德比大学)

AI总结 本文提出稀疏双层序数基准MD-3k,用于测量单目深度基础模型的深度层偏好和多层空间关系准确性,发现不同模型对同一分层几何结构有不同解析,且拉普拉斯视觉提示可改变冻结模型的输出层。

Comments 49 pages, 25 figures; Accepted by European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29579 2026-06-30 cs.CV cs.AI cs.LG cs.MM

ScAle: Attention Head Scaling as a Minimal Adapter for Spatial Reasoning in Vision Language Models

ScAle: 注意力头缩放作为视觉语言模型中空间推理的最小适配器

Rahul Chowdhury, Timothy A Rupprecht, Xuan Shen, Pu Zhao, Yanzhi Wang

机构 * Northeastern University(东北大学) EmbodyX Inc.(EmbodyX公司) Zhejiang University(浙江大学)

AI总结 提出ScAle,一种超轻量适配方法,通过学习少量标量系数调节冻结骨干网络中的注意力头和MLP激活,仅用1K可训练参数在空间推理任务上实现高达134.1%的相对精度提升。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29531 2026-06-30 cs.CV cs.AI

MotionAtlas: Detailed Region Captioning for Motion-Centric Videos

MotionAtlas: 面向运动中心视频的详细区域描述

Weisong Liu, Haochen Wang, Kuan Gao, Yuhao Wang, Yikang Zhou, Zhongwei Ren, Jacky Mai, Anna Wang, Yanwei Li, Jason Li, Zhaoxiang Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Peking University(北京大学) Wuhan University(武汉大学) Beijing Jiaotong University(北京交通大学)

AI总结 提出MotionAtlas系统,通过区域感知运动描述、自举精炼数据管道和定制训练策略,在运动中心视频描述中显著提升细粒度理解,超越现有模型。

Comments Accepted to ECCV 2026. Project page: https://kagura-0001.github.io/projects/MotionAtlas

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29501 2026-06-30 cs.RO

Learning Transferable Dynamics Priors from Action to World Modeling

从动作到世界建模的可迁移动力学先验学习

Ze Huang, Jiahui Zhang, Hairuo Liu, Chenxi Zhang, Ran Cheng, Li Zhang

机构 * School of Data Science, Fudan University, Shanghai, China(复旦大学数据科学学院,上海,中国) Shanghai Innovation Institute, Shanghai, China(上海创新研究院,上海,中国) Shanghai Jiao Tong University, Shanghai, China(上海交通大学,上海,中国) McGill University, Montreal, QC, Canada(麦吉尔大学,蒙特利尔,魁北克,加拿大)

AI总结 提出A2World模型,通过大规模机器人操作数据预训练动作条件世界模型,学习可迁移的交互动力学先验,支持模拟器评估和策略学习。

Comments ECCV 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29464 2026-06-30 cs.CV cs.AI

Rank-Aware Hyperbolic Alignment for Vision-Language Dataset Distillation

秩感知双曲对齐用于视觉-语言数据集蒸馏

Jongoh Jeong, Sun-Kyung Lee, Kuk-Jin Yoon

AI总结 提出RAHA方法,利用双曲几何和显式对齐容量控制,通过非对称目标优化蒸馏对,在共享范围强制测地线对齐并正则化残差子空间,提升跨模态检索和迁移鲁棒性。

Comments Accepted for publication at ECCV 2026. Project Page: https://andyj1.github.io/raha

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29462 2026-06-30 cs.CV

MIRROR: Aligning Semantic Relations from Language to Image via Gromov--Wasserstein

MIRROR: 通过Gromov-Wasserstein对齐从语言到图像的语义关系

Hong-Han Wang, Yuntao Wang, Hu Ding

AI总结 提出MIRROR框架,通过半逆Gromov-Wasserstein问题将语言中的关系先验几何对齐到视觉表示,提升多模态大模型的关系一致性,无需额外参数或推理成本。

Comments Accepted to ECCV 2026. 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29461 2026-06-30 cs.CV

From Phase to Phenomenon: Self-Supervised Learning of Subsurface Scattering with Minimal Phase-shift Inputs

从相位到现象:基于最小相移输入的自监督次表面散射学习

Arjun Majumdar, Raphael Braun, Andreas Engelhardt, Hendrik PA. Lensch

AI总结 提出一种自监督预训练框架,利用仅八张高频相移轮廓测量图像预训练编码器,学习可泛化的次表面散射表示,有效迁移到重光照等下游任务,实现高保真重建。

Comments Accepted to ECCV 2026. 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29445 2026-06-30 cs.CV cs.AI

Bridging VideoQA and Video-Guided Agentic Tasks via Generalized Keyframe Extraction

通过通用关键帧提取桥接VideoQA和视频引导的智能体任务

Sunqi Fan, Qingle Liu, Runqi Yin, Meng-Hao Guo, Shuojin Yang

AI总结 提出VG-GUIBench基准和TASKER关键帧提取算法,联合考虑任务相关性和场景动态,在VideoQA和视频引导的GUI任务上提升性能。

Comments Accepted by ECCV 2026. Project Page: https://vg-gui-tasker.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29428 2026-06-30 cs.CV

Robust Zero-shot Anomaly Detection under Limited Auxiliary Anomaly Priors

有限辅助异常先验下的鲁棒零样本异常检测

Guanyu Lu, Fang Zhou, Cheqing Jin

AI总结 提出DIVE方法,通过浅深文本嵌入注入和视觉-文本解耦机制,在辅助异常模式有限时提升零样本异常检测性能,在12个数据集上分类指标提升达16.2%和28.5%,分割指标提升达23.4%、24.1%和47.0%。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29334 2026-06-30 cs.CV

Multi-scale Object-Aware Gaze Estimation via Geometric Reasoning

多尺度目标感知的注视估计:基于几何推理

Jiajie Mi, Xinyu Liu, Mengke Song, Chenglizhao Chen

机构 * Qingdao Institute of Software & School of Computer Science and Technology, China University of Petroleum (East China), China Shandong Key Laboratory of Intelligent Oil & Gas Industrial Software, China(青岛软件研究所及中国石油大学(华东)计算机科学与技术学院,山东智能油气工业软件重点实验室,中国)

AI总结 提出两阶段注视估计框架,通过对象语义引导和几何约束,将注视目标估计转化为层次推理,在多个基准上取得领先性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29329 2026-06-30 cs.CV

RAGA: Real Time Ray Traced Gaussian Shadow Casting for 3DGS Avatar-Scene Interaction

RAGA:面向3DGS化身-场景交互的实时光线追踪高斯阴影投射

Aymen Mir, Riza Alp Guler, Jian Wang, Peter Wonka, Bing Zhou, Gerard Pons-Moll

机构 * Tübingen AI Center, University of Tübingen, Germany(图宾根人工智能中心,图宾根大学,德国) Max Planck Institute for Informatics, Saarland Informatics Campus, Germany(马克斯·普朗克研究所信息学院,萨尔兰信息学院,德国) Imperial College London, UK(伦敦帝国理工学院,英国) King Abdullah University of Science and Technology (KAUST), Saudi Arabia(国王阿卜杜勒阿齐兹科技大学(KAUST),沙特阿拉伯) Snap Inc., USA(Snap公司,美国)

AI总结 提出RAGA方法,通过精确的射线-高斯线积分在纯高斯空间中实现阴影计算,无需网格重建,支持单/多化身及物体交互场景,达到约50 FPS的实时性能。

Comments ECCV 2026. Project Page at https://miraymen.github.io/raga/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29308 2026-06-30 cs.CV

MirrorPPR: Exemplar-Based Portrait Photo Retouching

MirrorPPR:基于示例的人像照片修图

Zhihong Liu, Zheng Li, Jiachun Jin, Siqi Kou, Yitao Jian, Fengpei Yu, Zhijie Deng

机构 * Shanghai Jiao Tong University(上海交通大学) Triverse AI

AI总结 提出MirrorPPR框架,通过修图操作提取器和LoRA模块将示例对中的细微结构修图操作迁移到新图像,并构建大规模数据集MirrorPPR47M实现渐进式学习,显著提升修图质量和身份保持。

Comments Accepted by ECCV 2026. 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏