arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1258 信号源:cs.CV, cs.GR, cs.MM

1. 图像编辑 1258 篇

2608.08487 2026-08-11 cs.CV 新提交 57%

RenderMatte: Exact-Alpha Rendering and Group-Relative Alignment for Image Matting

RenderMatte:用于图像抠图的精确Alpha渲染与组相对对齐

Zecheng Ren, Yafei Hu, Jianing Zhao, Ruichen Cong, Qun Jin, Yiren Song

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出RenderMatte框架,通过微调FLUX.1 Kontext实现精确Alpha渲染,引入组相对Alpha对齐优化,并构建专属数据集,在抠图基准测试中取得最优性能,解决开放世界场景的抠图难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07846 2026-08-11 cs.CV 版本更新 57%

BRIDGE: Background Routing and Isolated Discrete Gating for Coarse-Mask Local Editing

BRIDGE:背景路由与孤立离散门控用于粗掩膜局部编辑

Peilin Xiong, Honghui Yuan, Junwen Chen, Keiji Yanai

机构 * Department of Informatics, The University of Electro-Communications(信息学系,电通大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 BRIDGE通过背景路由和离散门控技术解决粗掩膜局部编辑中掩膜形状偏差问题,提升编辑区域与背景的稳定性与一致性。

Comments 24 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07066 2026-08-11 cs.CV cs.AI 版本更新 57%

PolypSteer: Counterfactual Endoscopic Synthesis via Training-Free Activation Steering

MedSteer: 通过无训练激活引导进行反事实内窥镜合成

Trong-Thang Pham, Loc Nguyen, Anh Nguyen, Hien V. Nguyen, Ngan Le

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 MedSteer通过无训练激活引导生成反事实内窥镜图像,提升医学影像数据增强效果

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19180 2026-08-11 cs.CV cs.AI 版本更新 57%

SNR-Edit: Structure-Aware Noise Rectification for Inversion-Free Flow-Based Editing

SNR-Edit: 基于结构的噪声校正用于无反向的流式编辑

Lifan Jiang, Boxi Wu, Yuhang Pei, Tianrun Wu, Yongyuan Chen, Yan Zhao, Shiyu Yu, Deng Cai

机构 * State Key lab of CAD\&CG, Zhejiang University(CAD与CG国家重点实验室,浙江大学) UniTTEC Co. Ltd.(UniTTEC有限公司) Research center, Ningbo Meidong Container Terminal Co.,Ltd.(宁波梅东集装箱码头有限公司研究中心)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 SNR-Edit通过自适应噪声控制实现无反向的流式编辑,提升潜在轨迹的结构保真度,同时保持高效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02841 2026-08-05 cs.CV 新提交 57%

Localize, Don't Beautify: Client-Side Control of Image-Editing APIs for Cosmetic Surgery Previews

聚焦定位,而非美化:面向整容预览的图像编辑API的客户端控制

Sukhrobbek Ilyosbekov

专题命中 图像编辑 :inpainting(abstract);分类 cs.CV

AI总结 本文针对公开图像编辑API无法提供模型内部信息的问题,提出客户端通过掩码合成可实现整容预览的区域定位,在保证身份保留的同时提升编辑区域的准确性,且效果优于仅用提示词的方式。

Comments 9 pages, 7 figures, 2 tables. Pilot study; no surgeon ratings. Code and paper source: https://github.com/suxrobGM/localize-dont-beautify

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01113 2026-08-04 cs.CV 新提交 57%

CoT-Edit: Let CoT Guide Instruction Video Editing

CoT-Edit:让思维链(CoT)指导指令视频编辑

Sen Liang, Fengbin Guan, Youliang Zhang, Xin Li, Zhibo Chen

机构 * University of Science and Technology of China(中国科学技术大学) Zhongguancun Academy(中关村学院) Tsinghua University(清华大学)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 本文提出CoT-Edit的plan--guide--edit框架,以CoT增强的MLLM为规划器生成空间先验,结合扩散编辑器实现高保真指令视频编辑,性能优于多个基准方法

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01207 2026-08-03 cs.CV 版本更新 57%

TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking

TRACE:通过可触觉重建和几何对齐的上下文视频遮罩实现高保真的3D场景编辑

Jiyuan Hu, Zechuan Zhang, Zongxin Yang, Yi Yang

机构 * ReLER Lab, CCAI, Zhejiang University(浙江大学计算机辅助设计与图形学全国重点实验室(CCAI)ReLER实验室) DBMI, HMS, Harvard University(哈佛大学医学院生物医学信息学系(DBMI))

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 TRACE通过可触觉重建和几何对齐的上下文视频遮罩,实现高保真的3D场景编辑,解决了现有方法在局部姿态调整和组件替换时结构完整性不足的问题。

Comments 9 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25537 2026-07-29 cs.CV cs.AI 新提交 57%

Visual prompt engineering for video models

视频模型的视觉提示工程

Robert Geirhos, Yuxuan Li, Thaddäus Wiedemer, Neha Kalibhat, Zi Wang, Mani Malek, Oyvind Tafjord, Kevin Swersky, Been Kim, Priyank Jaini

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 研究视频模型能否从视觉提示工程中受益,通过自动修改任务图像提升性能,如视觉物理推理任务。发现视觉提示工程(VIPE)能提高视频推理性能,比传统方法更有效,为提升视频模型视觉推理性能提供简单高效途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23920 2026-07-28 cs.CV 新提交 57%

What Can I Edit? Open-Ended Strategy Discovery and the Emotion Editability Landscape

我能编辑什么?开放式策略发现与情感可编辑性景观

Qing Li, Zeyu Dong, Yin Cui, Chuan Yan, Xiaojiang Peng

机构 * School of Artificial Intelligence, Shenzhen Technology University(深圳技术大学人工智能学院) School of Innovation Design, Shenzhen Technology University(深圳技术大学创新设计学院) Stanford University(斯坦福大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 研究情感图像编辑,EmoScope多智能体框架将任务转变为‘能编辑什么’,先发现可编辑空间,再平衡内容与情感,通过情感条件作用的可供性推理选择策略,在大规模评估中受青睐,还指出相关指标盲点及优势变化情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22864 2026-07-28 cs.CV cs.AI 新提交 57%

Spatial-IQ: Deconstructing Spatial Intelligence via Hierarchical Capability Tests

空间智商:通过分层能力测试解构空间智能

Patrick Rim, Tom Long, Ekta Prashnani, Ruth Rosenholtz, Ben Boudaoud, Peter Xenopoulos, Alex Wong, Joohwan Kim, Jae-Hyun Jung

机构 * NVIDIA Research(英伟达研究院) Yale University(耶鲁大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 研究针对多模态大语言模型空间推理能力不足问题,提出Spatial-IQ分层诊断框架,分解物体计数任务为子任务,生成数据集评估模型,发现模型存在问题,且用思维链监督和强化学习训练可提升模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19777 2026-07-23 cs.CV 新提交 57%

Look Before You Edit: Attention-Guided Camera Placement and Multi-View Alignment for 3D Gaussian Splatting Editing

编辑前先观察:用于3D高斯点渲染编辑的注意力引导相机放置和多视图对齐

Jaeyeon Park, Taeho Kang, Youngki Lee

机构 * Seoul National University(首尔国立大学)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 针对3D高斯点渲染编辑受固定相机限制的问题,提出LB-Edit框架。通过注意力引导相机放置确定编辑相机位置,多视图注意力对齐使视图编辑一致。实验表明该方法在多方面表现优,减少视图数量并降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18227 2026-07-21 cs.CV 新提交 57%

FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry

FlowMimic:基于像素对扭曲流场的无掩码视觉编辑与生成,用于在线视频编辑数据生成及模态模仿

Dingyun Zhang, Lixue Gong, Wei Liu

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 研究探索在单一模型中整合视频和图像模态的生成与编辑能力,开发像素对时间扭曲流场实时生成视频编辑样本,设计模态模仿损失对齐模态能力,引入相关任务及损失让模型内化基于语言的视觉编辑能力。

Comments Due to file size constraints, the figures in the arXiv file have been heavily lossy-compressed. Please visit the uncompressed file at: https://huggingface.co/datasets/FlowMimic/Uncompressed/blob/main/main.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14681 2026-07-17 cs.CV 新提交 57%

ReBind: Multi-Reference Video Editing via Structured Instructions with Explicit Reference Relationships

ReBind:通过具有显式参考关系的结构化指令进行多参考视频编辑

Xinyu Liu, Shihao Li, Weihong Lin, Xinlong Chen, Yang Shi, Yujin Han, Yiyang Cai, Yanghao Wang, Ruibin Yuan, Yuanxing Zhang, Pengfei Wan, Wenhan Luo, Yike Guo

机构 * HKUST(香港科技大学) Kling Team(克林团队) NJU(南京大学) UCAS(中国科学院大学) PKU(北京大学) HKU(香港大学)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 研究针对多参考图像条件视频编辑中现有方法难以协调多视觉源信息的问题,提出ReBind框架,通过带嵌入参考令牌的语义指令及两阶段渐进方案学习建立显式绑定,实现轻量级适配,在指令质量和性能上表现出色。

Comments Project Page: https://rebind-mrv2v.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12539 2026-07-15 cs.CV 新提交 57%

DiTailed: Ensuring Visual Object Consistency in Text-Image-to-Image Flow Matching Models

DiTailed:在文本-图像到图像流匹配模型中确保视觉对象一致性

Francesco Taioli, Daniel Coelho, Iaroslav Melekhov, Roberto Alcover-Couso, Jose Miguel Grande Saiz, Virginia Fernandez Arguedas, Artur Bekasov

机构 * Amazon(亚马逊) Faculty(学院)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 研究文本引导图像编辑中生成模型视觉对象一致性问题,提出ABO-Edit数据集,发现图像编辑整流流模型条件嵌入空间特性,进而提出FlowMirror无参数辅助损失,无需架构改变提升了生成质量。

Comments Accepted to ECCV 2026. Project page: https://francescotaioli.github.io/DiTailed/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11281 2026-07-14 cs.CV 新提交 57%

The Devil Is in the Leakage: A Disentangled Dual-Purification Framework for High-Fidelity Hairstyle Transfer

问题出在泄漏中:用于高保真发型转移的解缠双净化框架

Jijie Li, Jiankuo Zhao, Xiangyu Zhu, Zhen Lei

机构 * SAI, UCAS(中国科学院大学 模式识别国家重点实验室) MAIS, CASIA(中国科学院自动化所 模式识别国家重点实验室) CAIR, HKSIS, CAS(中国科学院香港创新研究院 计算机与信息工程实验室) SCSE, FIE, M.U.S.T(澳门科技大学 资讯科技学院)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 研究发型转移中参考发型与源身份纠缠及现有方法泄漏问题,提出双净化框架,含对抗发型净化和对比几何净化两个正则化器,实现高保真、身份保留的发型转移并达领先性能。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10301 2026-07-14 cs.CV cs.CL 新提交 57%

ChartSync: A Benchmark for Visuo-Logical Cascading Chart Editing

ChartSync:视觉逻辑级联图表编辑的基准测试

Jiakang Yu, Yixuan Chai, Tianci Wang, Rihui Jin, Guangkai Xu, Hongtao Deng, Xun Zhu, Wang Gao, Xinrun Guo, Haipang Wu

机构 * Jianghan University(江汉大学) HiThink Research(海思睿研) University of Science and Technology of China(中国科学技术大学) Southeast University(东南大学) Zhejiang University(浙江大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 研究针对生成式图像编辑模型处理结构化统计图的困难,提出视觉逻辑级联编辑任务。引入ChartSync基准测试,含多种图表类别和任务类型。通过两层框架评估模型,发现开源与专有模型能力差距,分析误差以指导多模态架构发展,数据集和代码已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08227 2026-07-10 cs.CV 新提交 57%

Multimodal 3D LUT Generation via StatLUT with Statistical Features for Photorealistic Style Transfer

通过具有统计特征的StatLUT进行多模态3D LUT生成以实现逼真的风格迁移

Yifan Wang, Zhixiang Hao, Yu Wang, Congchao Zhu

机构 * Honor Device Co., Ltd.(荣耀终端有限公司)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 研究针对逼真风格迁移中现有方法的瓶颈,提出StatLUT框架,通过提取统计特征、基于Transformer的Seq2Seq任务预测3D LUT及用H-Diffuser从自然语言提示合成特征,实现多模态逼真风格迁移,性能优于现有方法。

Comments 17 pages, 9 figures, 7 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06603 2026-07-09 cs.CV cs.AI 新提交 57%

Do Counterfactually Fair Image Classifiers Satisfy Group Fairness? -- A Theoretical and Empirical Study

反事实公平的图像分类器是否满足群体公平性?——理论与实证研究

Sangwon Jung, Sumin Yu, Sanghyuk Chun, Taesup Moon

机构 * Seoul National University(首尔国立大学) NAVER AI Lab(NAVER人工智能实验室) ASRI/INMC/IPAI/AIIS, Seoul National University(首尔国立大学ASRI/INMC/IPAI/AIIS)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 研究图像分类中反事实公平与群体公平的关系,构建新数据集评估二者,发现CF不意味着GF,原因是潜在属性G,提出CKD基线,实验表明减少对G的依赖可使实现CF的模型满足GF。

Comments NeurIPS 2024 Track Datasets and Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03562 2026-07-07 cs.CV 新提交 57%

XPlainVerse: A Million-Scale Benchmark for Explainable Deepfake Detection

XPlainVerse:用于可解释深度伪造检测的百万规模基准测试

Abhijeet Narang, Kartik Kuckreja, Shreya Ghosh, Muhammad Haris Khan, Jianfei Cai, Abhinav Dhall

机构 * Monash University(墨尔本大学) MBZUAI(穆斯林人工智能研究所) The University of Queensland(昆士兰大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 针对深度伪造检测模型解释缺乏视觉依据的问题,引入XPlainVerse基准测试,含百万图像及多阶段验证流程,提出新评估指标,能支持可信赖、可解释模型的研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19073 2026-07-07 cs.CV 新提交 57%

Taming I2V models for Image HOI Editing: A Cognitive Benchmark and Agentic Self-Correcting Framework

驯服I2V模型用于图像HOI编辑:认知基准与智能体自校正框架

Jiayi Gao, Qingchao Chen, Yuxin Peng, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University, Beijing, China(王轩计算机技术研究所,北京大学,北京,中国) National Institute of Health Data Science, Peking University, Beijing, China(国家健康数据科学研究院,北京大学,北京,中国)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 提出HOI-Edit基准和SCPE框架,利用I2V模型的时间生成能力进行动态人-物交互编辑,通过自校正提示迭代优化,实现与SOTA竞争的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22607 2026-07-07 cs.CV 版本更新 57%

Dress-ED: Instruction-Guided Editing for Virtual Try-On and Try-Off

Dress-ED:基于指令的虚拟试穿和试脱编辑

Davide Lobba, Fulvio Sanguigni, Bin Ren, Marcella Cornia, Rita Cucchiara, Nicu Sebe

机构 * University of Modena(摩德纳大学) University of Trento(特伦托大学) University of Pisa(比萨大学)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Dress-ED数据集,首次统一了虚拟试穿、试脱和文本引导的服装编辑,包含146k个样本,涵盖外观和结构修改,提供统一的多模态扩散框架作为指令驱动的VTON和VTOFF基线。

Comments Accepted at ECCV 2026. Project page at https://aimagelab.github.io/Dress-ED/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13770 2026-07-07 cs.CV 版本更新 57%

CDST: Color Disentangled Style Transfer for Universal Style Reference Customization

CDST:用于通用风格参考定制的颜色解缠风格迁移

Shiwen Zhang, Zhuowei Chen, Lang Chen, Yanze Wu

机构 * ByteDance(字节跳动)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 介绍CDST这种新颖高效的双流风格迁移训练范式,能分离颜色与风格,推理时免调参实现通用风格迁移,首次免调参解决带风格和内容参考的特征保留风格迁移问题,实验证明效果达最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.13771 2026-07-07 cs.CV 版本更新 57%

AppAgent: Multimodal Agents as Smartphone Users

AppAgent:作为智能手机用户的多模态智能体

Chi Zhang, Zhao Yang, Jiaxuan Liu, Yanda Li, Yucheng Han, Xin Chen, Zebiao Huang, Bin Fu, Gang Yu

机构 * Tencent(腾讯)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 介绍基于大语言模型的多模态智能体框架,通过简化动作空间操作智能手机应用,无需系统后端访问,经自主探索或观察人类示范学习,能执行复杂任务,测试验证其处理多种高级任务的能力。

Comments Accepted to CHI 2025, project page is https://appagent-official.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05778 2026-07-03 cs.CV 版本更新 57%

Beyond Absolute Scores: Relative Edit-induced Difference for Generalizable Image Aesthetic Assessment

超越绝对分数:基于编辑诱导差异的通用图像美学评估

Qifei Jia, Xintong Yao, Yasen Zhang, Minghao Li, Yajie Chai, Qiming Lu, Baoyue Shen, Runyu Shi, Ying Huang, Yue Zhang

机构 * Xiaomi Corporation, Beijing, China(小米公司,北京,中国)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 提出RED-Aes框架,利用可控图像编辑模型模拟人类审美推理,通过相对编辑诱导差异学习通用美学原则,实现跨场景泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01521 2026-07-03 cs.CV 版本更新 57%

MiraGe: Editable 2D Images using Gaussian Splatting

MiraGe: 使用高斯溅射的可编辑2D图像

Joanna Waczyńska, Tomasz Szczepanik, Piotr Borycki, Sławomir Tadeja, Thomas Bohné, Przemysław Spurek

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 提出MiraGe方法,利用镜面反射在3D空间中感知2D图像,并通过平面控制的高斯函数实现精确编辑,提升渲染质量并支持物理仿真修改。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18765 2026-07-02 cs.CV cs.AI 版本更新 57%

NI-Tex: Non-isometric Image-based Garment Texture Generation

NI-Tex: 基于非等距图像的服装纹理生成

Hui Shan, Ming Li, Haitao Yang, Kai Zheng, Sizhe Zheng, Yanwei Fu, Xiangru Huang

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) Fudan University(复旦大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 针对非等距图像与3D服装网格间的纹理生成问题,提出结合物理模拟数据集、非等距图像编辑和迭代烘焙的框架,生成高质量PBR纹理。

Comments Accepted to CVPR 2026 (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16711 2026-07-02 cs.CV eess.IV 57%

Motion Transfer-Enhanced StyleGAN for Generating Diverse Macaque Facial Expressions

增强型运动转移StyleGAN用于生成多样化猕猴面部表情

Takuya Igaue, Catia Correia-Caeiro, Akito Yoshida, Takako Miyabe-Nishiwaki, Ryusuke Hayashi

机构 * Human Informatics Research Institute, National Institute of Advanced Industrial Science and Technology (AIST)(国家先进工业科学与技术研究所(AIST)人类信息学研究所) Graduate School of Engineering, The University of Tokyo(东京大学工学研究科) Human Biology & Primate Cognition, Institute of Biology, Leipzig University(莱比锡大学生物研究所人类生物学与灵长类认知) Araya Inc.(Araya公司) Center for the Evolutionary Origins of Human Behavior (EHuB), Kyoto University(京都大学人类行为进化起源中心(EHuB))

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出利用StyleGAN2生成猕猴面部表情,通过运动转移增强数据,改进训练集多样性与精度,实现更丰富的表情生成。

Journal ref IEEE Access, vol. 14, pp. 95120-95136, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31637 2026-07-01 cs.GR cs.AI 新提交 57%

Intrinsic decomposition and editing of 3D Gaussian splats

3D高斯散点的本征分解与编辑

Alexandre Lanvin, Jeffrey Hu, Simon Lucas, Adrien Bousseau, George Drettakis

机构 * Inria, Université Côte d’Azur(法国国家信息与自动化研究所,蔚蓝海岸大学) Cambridge University(剑桥大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.GR

AI总结 提出将本征分解扩展到高斯散点辐射场的方法,通过独立高斯基元、数据驱动优化和单图纹理编辑实现场景的材质与光照分离及编辑。

Comments 18 pages

Journal ref Proc. ACM Comput. Graph. Interact. Tech. 9, 1, Article 10 (May 2026), 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29286 2026-06-30 cs.CV 57%

ASTAD: Asymmetric Style Transfer for Synthetic-to-Real Adaptation in Autonomous Driving

ASTAD:自动驾驶中合成到真实适应的非对称风格迁移

Dingyi Yao, Xinqi Zhang, Lihui Peng, Jianming Hu, Danya Yao, Yi Zhang

机构 * Department of Automation, Tsinghua University(自动化系,清华大学)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 提出ASTAD任务,针对合成数据有标注而真实数据无标注的不对称性,设计无训练两阶段框架ASTModel,通过粗语义先验提取和动态精炼实现类一致风格迁移,显著提升下游感知性能并加速推理。

Comments Accepted for publication at the 19th European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28724 2026-06-30 cs.CV cs.AI 57%

CCRC: A Change-Aware Captioning and Reasoning Chain for Image Change Captioning and Segmentation

CCRC:面向图像变化描述与分割的变化感知描述与推理链

Jinhong Hu, Xiaoping Wang, Shuyin Huang, Guojin Zhong, Kaitai Liu, Kai Lu

机构 * College of Computer Science and Electronic Engineering, Hunan University, China(湖南大学计算机科学与电子工程学院,中国) Guangxi Minzu University, China(广西民族大学,中国) National University of Defense Technology, China(国防科学技术大学,中国)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 提出变化感知描述与推理链(CCRC),通过双链框架解耦语义推理与空间分割,实现图像变化描述与分割(ICCS)任务,在合成和真实基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏