arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2839 信号源:cs.CV, cs.GR, cs.MM

1. 图像编辑 79 篇

2606.22304 2026-06-23 cs.LG 新提交 67%

Encoder-Decoder Manifold Alignment for Idempotent Generation

用于幂等生成的编码器-解码器流形对齐

Dareen Alharthi, Abdul Waheed, Bhiksha Raj

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 图像编辑 :image generation(abstract);image editing(abstract)

AI总结 针对生成模型中幂等性不足导致的重复应用不稳定问题,提出通过对齐编码器和解码器学习的流形来训练模型,显著降低幂等误差并提升生成稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12876 2026-08-14 cs.CV cs.AI 新提交 57%

SPARED: Reasoning-Based AI-Generated Image Detection via Adversarially Edited Data

SPARED:基于推理的AI生成图像检测方法,采用对抗编辑数据

Yicheng Bao, Xiahui Guo, Xuhong Wang, Xin Tan

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出对抗强化学习框架SPARED,通过扩散图像编辑器与推理型MLLM的交替博弈,训练出能抗捷径、泛化能力强的AI生成图像检测器,在三个外部基准上性能单调提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10870 2026-08-12 cs.CV 新提交 57%

NullEdit: Stealthy Image Protection via VLM Condition Redirection

NullEdit:通过视觉语言模型条件重定向实现隐秘图像保护

Weiyao Huang, Liqin Wang, Ziqi Sheng, Wei Lu

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 NullEdit针对VLM表示进行重定向,可隐秘抑制图像编辑且保留源内容,在基准模型上平均降低EditReward IF分数0.813,实现了高效的图像保护。

Comments 9 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08487 2026-08-11 cs.CV 新提交 57%

RenderMatte: Exact-Alpha Rendering and Group-Relative Alignment for Image Matting

RenderMatte:用于图像抠图的精确Alpha渲染与组相对对齐

Zecheng Ren, Yafei Hu, Jianing Zhao, Ruichen Cong, Qun Jin, Yiren Song

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出RenderMatte框架,通过微调FLUX.1 Kontext实现精确Alpha渲染,引入组相对Alpha对齐优化,并构建专属数据集,在抠图基准测试中取得最优性能,解决开放世界场景的抠图难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02841 2026-08-05 cs.CV 新提交 57%

Localize, Don't Beautify: Client-Side Control of Image-Editing APIs for Cosmetic Surgery Previews

聚焦定位,而非美化:面向整容预览的图像编辑API的客户端控制

Sukhrobbek Ilyosbekov

专题命中 图像编辑 :inpainting(abstract);分类 cs.CV

AI总结 本文针对公开图像编辑API无法提供模型内部信息的问题,提出客户端通过掩码合成可实现整容预览的区域定位,在保证身份保留的同时提升编辑区域的准确性,且效果优于仅用提示词的方式。

Comments 9 pages, 7 figures, 2 tables. Pilot study; no surgeon ratings. Code and paper source: https://github.com/suxrobGM/localize-dont-beautify

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01113 2026-08-04 cs.CV 新提交 57%

CoT-Edit: Let CoT Guide Instruction Video Editing

CoT-Edit:让思维链(CoT)指导指令视频编辑

Sen Liang, Fengbin Guan, Youliang Zhang, Xin Li, Zhibo Chen

机构 * University of Science and Technology of China(中国科学技术大学) Zhongguancun Academy(中关村学院) Tsinghua University(清华大学)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 本文提出CoT-Edit的plan--guide--edit框架,以CoT增强的MLLM为规划器生成空间先验,结合扩散编辑器实现高保真指令视频编辑,性能优于多个基准方法

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25537 2026-07-29 cs.CV cs.AI 新提交 57%

Visual prompt engineering for video models

视频模型的视觉提示工程

Robert Geirhos, Yuxuan Li, Thaddäus Wiedemer, Neha Kalibhat, Zi Wang, Mani Malek, Oyvind Tafjord, Kevin Swersky, Been Kim, Priyank Jaini

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 研究视频模型能否从视觉提示工程中受益,通过自动修改任务图像提升性能,如视觉物理推理任务。发现视觉提示工程(VIPE)能提高视频推理性能,比传统方法更有效,为提升视频模型视觉推理性能提供简单高效途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23920 2026-07-28 cs.CV 新提交 57%

What Can I Edit? Open-Ended Strategy Discovery and the Emotion Editability Landscape

我能编辑什么?开放式策略发现与情感可编辑性景观

Qing Li, Zeyu Dong, Yin Cui, Chuan Yan, Xiaojiang Peng

机构 * School of Artificial Intelligence, Shenzhen Technology University(深圳技术大学人工智能学院) School of Innovation Design, Shenzhen Technology University(深圳技术大学创新设计学院) Stanford University(斯坦福大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 研究情感图像编辑,EmoScope多智能体框架将任务转变为‘能编辑什么’,先发现可编辑空间,再平衡内容与情感,通过情感条件作用的可供性推理选择策略,在大规模评估中受青睐,还指出相关指标盲点及优势变化情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22864 2026-07-28 cs.CV cs.AI 新提交 57%

Spatial-IQ: Deconstructing Spatial Intelligence via Hierarchical Capability Tests

空间智商:通过分层能力测试解构空间智能

Patrick Rim, Tom Long, Ekta Prashnani, Ruth Rosenholtz, Ben Boudaoud, Peter Xenopoulos, Alex Wong, Joohwan Kim, Jae-Hyun Jung

机构 * NVIDIA Research(英伟达研究院) Yale University(耶鲁大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 研究针对多模态大语言模型空间推理能力不足问题,提出Spatial-IQ分层诊断框架,分解物体计数任务为子任务,生成数据集评估模型,发现模型存在问题,且用思维链监督和强化学习训练可提升模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19777 2026-07-23 cs.CV 新提交 57%

Look Before You Edit: Attention-Guided Camera Placement and Multi-View Alignment for 3D Gaussian Splatting Editing

编辑前先观察:用于3D高斯点渲染编辑的注意力引导相机放置和多视图对齐

Jaeyeon Park, Taeho Kang, Youngki Lee

机构 * Seoul National University(首尔国立大学)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 针对3D高斯点渲染编辑受固定相机限制的问题,提出LB-Edit框架。通过注意力引导相机放置确定编辑相机位置,多视图注意力对齐使视图编辑一致。实验表明该方法在多方面表现优,减少视图数量并降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18227 2026-07-21 cs.CV 新提交 57%

FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry

FlowMimic:基于像素对扭曲流场的无掩码视觉编辑与生成,用于在线视频编辑数据生成及模态模仿

Dingyun Zhang, Lixue Gong, Wei Liu

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 研究探索在单一模型中整合视频和图像模态的生成与编辑能力,开发像素对时间扭曲流场实时生成视频编辑样本,设计模态模仿损失对齐模态能力,引入相关任务及损失让模型内化基于语言的视觉编辑能力。

Comments Due to file size constraints, the figures in the arXiv file have been heavily lossy-compressed. Please visit the uncompressed file at: https://huggingface.co/datasets/FlowMimic/Uncompressed/blob/main/main.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14681 2026-07-17 cs.CV 新提交 57%

ReBind: Multi-Reference Video Editing via Structured Instructions with Explicit Reference Relationships

ReBind:通过具有显式参考关系的结构化指令进行多参考视频编辑

Xinyu Liu, Shihao Li, Weihong Lin, Xinlong Chen, Yang Shi, Yujin Han, Yiyang Cai, Yanghao Wang, Ruibin Yuan, Yuanxing Zhang, Pengfei Wan, Wenhan Luo, Yike Guo

机构 * HKUST(香港科技大学) Kling Team(克林团队) NJU(南京大学) UCAS(中国科学院大学) PKU(北京大学) HKU(香港大学)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 研究针对多参考图像条件视频编辑中现有方法难以协调多视觉源信息的问题,提出ReBind框架,通过带嵌入参考令牌的语义指令及两阶段渐进方案学习建立显式绑定,实现轻量级适配,在指令质量和性能上表现出色。

Comments Project Page: https://rebind-mrv2v.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12539 2026-07-15 cs.CV 新提交 57%

DiTailed: Ensuring Visual Object Consistency in Text-Image-to-Image Flow Matching Models

DiTailed:在文本-图像到图像流匹配模型中确保视觉对象一致性

Francesco Taioli, Daniel Coelho, Iaroslav Melekhov, Roberto Alcover-Couso, Jose Miguel Grande Saiz, Virginia Fernandez Arguedas, Artur Bekasov

机构 * Amazon(亚马逊) Faculty(学院)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 研究文本引导图像编辑中生成模型视觉对象一致性问题,提出ABO-Edit数据集,发现图像编辑整流流模型条件嵌入空间特性,进而提出FlowMirror无参数辅助损失,无需架构改变提升了生成质量。

Comments Accepted to ECCV 2026. Project page: https://francescotaioli.github.io/DiTailed/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11281 2026-07-14 cs.CV 新提交 57%

The Devil Is in the Leakage: A Disentangled Dual-Purification Framework for High-Fidelity Hairstyle Transfer

问题出在泄漏中:用于高保真发型转移的解缠双净化框架

Jijie Li, Jiankuo Zhao, Xiangyu Zhu, Zhen Lei

机构 * SAI, UCAS(中国科学院大学 模式识别国家重点实验室) MAIS, CASIA(中国科学院自动化所 模式识别国家重点实验室) CAIR, HKSIS, CAS(中国科学院香港创新研究院 计算机与信息工程实验室) SCSE, FIE, M.U.S.T(澳门科技大学 资讯科技学院)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 研究发型转移中参考发型与源身份纠缠及现有方法泄漏问题,提出双净化框架,含对抗发型净化和对比几何净化两个正则化器,实现高保真、身份保留的发型转移并达领先性能。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10301 2026-07-14 cs.CV cs.CL 新提交 57%

ChartSync: A Benchmark for Visuo-Logical Cascading Chart Editing

ChartSync:视觉逻辑级联图表编辑的基准测试

Jiakang Yu, Yixuan Chai, Tianci Wang, Rihui Jin, Guangkai Xu, Hongtao Deng, Xun Zhu, Wang Gao, Xinrun Guo, Haipang Wu

机构 * Jianghan University(江汉大学) HiThink Research(海思睿研) University of Science and Technology of China(中国科学技术大学) Southeast University(东南大学) Zhejiang University(浙江大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 研究针对生成式图像编辑模型处理结构化统计图的困难,提出视觉逻辑级联编辑任务。引入ChartSync基准测试,含多种图表类别和任务类型。通过两层框架评估模型,发现开源与专有模型能力差距,分析误差以指导多模态架构发展,数据集和代码已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08227 2026-07-10 cs.CV 新提交 57%

Multimodal 3D LUT Generation via StatLUT with Statistical Features for Photorealistic Style Transfer

通过具有统计特征的StatLUT进行多模态3D LUT生成以实现逼真的风格迁移

Yifan Wang, Zhixiang Hao, Yu Wang, Congchao Zhu

机构 * Honor Device Co., Ltd.(荣耀终端有限公司)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 研究针对逼真风格迁移中现有方法的瓶颈,提出StatLUT框架,通过提取统计特征、基于Transformer的Seq2Seq任务预测3D LUT及用H-Diffuser从自然语言提示合成特征,实现多模态逼真风格迁移,性能优于现有方法。

Comments 17 pages, 9 figures, 7 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06603 2026-07-09 cs.CV cs.AI 新提交 57%

Do Counterfactually Fair Image Classifiers Satisfy Group Fairness? -- A Theoretical and Empirical Study

反事实公平的图像分类器是否满足群体公平性?——理论与实证研究

Sangwon Jung, Sumin Yu, Sanghyuk Chun, Taesup Moon

机构 * Seoul National University(首尔国立大学) NAVER AI Lab(NAVER人工智能实验室) ASRI/INMC/IPAI/AIIS, Seoul National University(首尔国立大学ASRI/INMC/IPAI/AIIS)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 研究图像分类中反事实公平与群体公平的关系,构建新数据集评估二者,发现CF不意味着GF,原因是潜在属性G,提出CKD基线,实验表明减少对G的依赖可使实现CF的模型满足GF。

Comments NeurIPS 2024 Track Datasets and Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03562 2026-07-07 cs.CV 新提交 57%

XPlainVerse: A Million-Scale Benchmark for Explainable Deepfake Detection

XPlainVerse:用于可解释深度伪造检测的百万规模基准测试

Abhijeet Narang, Kartik Kuckreja, Shreya Ghosh, Muhammad Haris Khan, Jianfei Cai, Abhinav Dhall

机构 * Monash University(墨尔本大学) MBZUAI(穆斯林人工智能研究所) The University of Queensland(昆士兰大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 针对深度伪造检测模型解释缺乏视觉依据的问题,引入XPlainVerse基准测试,含百万图像及多阶段验证流程,提出新评估指标,能支持可信赖、可解释模型的研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19073 2026-07-07 cs.CV 新提交 57%

Taming I2V models for Image HOI Editing: A Cognitive Benchmark and Agentic Self-Correcting Framework

驯服I2V模型用于图像HOI编辑:认知基准与智能体自校正框架

Jiayi Gao, Qingchao Chen, Yuxin Peng, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University, Beijing, China(王轩计算机技术研究所,北京大学,北京,中国) National Institute of Health Data Science, Peking University, Beijing, China(国家健康数据科学研究院,北京大学,北京,中国)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 提出HOI-Edit基准和SCPE框架,利用I2V模型的时间生成能力进行动态人-物交互编辑,通过自校正提示迭代优化,实现与SOTA竞争的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31637 2026-07-01 cs.GR cs.AI 新提交 57%

Intrinsic decomposition and editing of 3D Gaussian splats

3D高斯散点的本征分解与编辑

Alexandre Lanvin, Jeffrey Hu, Simon Lucas, Adrien Bousseau, George Drettakis

机构 * Inria, Université Côte d’Azur(法国国家信息与自动化研究所,蔚蓝海岸大学) Cambridge University(剑桥大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.GR

AI总结 提出将本征分解扩展到高斯散点辐射场的方法,通过独立高斯基元、数据驱动优化和单图纹理编辑实现场景的材质与光照分离及编辑。

Comments 18 pages

Journal ref Proc. ACM Comput. Graph. Interact. Tech. 9, 1, Article 10 (May 2026), 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22042 2026-06-23 cs.CV 新提交 57%

IDAG-Edit: Multi-Object Video Editing via Instance-Decoupled Attention and Guidance

IDAG-Edit: 基于实例解耦注意力和引导的多对象视频编辑

Yuan-Zhih Lin, Huu-Thang Nguyen, Huu-Phu Do, Hong-Han Shuai, Ching-Chun Huang

机构 * Department of Computer Science, National Yang Ming Chiao Tung University, Taiwan(台湾阳明交通大学计算机科学系)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 提出IDAG-Edit框架,通过布局引导注意力调制和实例级掩码实现无训练的多对象视频编辑,解决注意力泄露和身份漂移问题,提升时间一致性和多对象可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20709 2026-06-23 cs.CV 新提交 57%

TeleStyle V2: Beyond Content-Preserving Style Transfer with Self-Distillation and Distribution-Matching-Distillation

TeleStyle V2:超越内容保持风格迁移的自蒸馏与分布匹配蒸馏

Shiwen Zhang, Yifan Xu, Haibin Huang, Chi Zhang, Xuelong Li

机构 * TeleAI

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 提出TeleStyle V2,通过自蒸馏数据合成和分布匹配蒸馏,支持四种内容-风格参考组合,解决内容一致性退化问题,性能与Qwen-Image-Edit和Gemini 3 Pro相当。

Comments https://github.com/Tele-AI/TeleStyleV2

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20556 2026-06-19 cs.CV 新提交 57%

Thinking in Boxes: 3D Editing in Real Images Made Easy

Thinking in Boxes: 真实图像中的3D编辑变得简单

Pradhaan S Bhat, Naveen Chandra R, Rishubh Parihar, Vaibhav Vavilala, R. Venkatesh Babu, D. A. Forsyth, Anand Bhattad

机构 * Indian Institute of Science(印度科学研究所) Apple(苹果公司) UIUC(伊利诺伊大学厄巴纳-香槟分校) Johns Hopkins University(约翰霍普金斯大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 提出使用3D盒子作为结构化规范,通过用户提供输入和输出盒子来精确控制真实图像中的平移、旋转、缩放和视角变化,同时保持场景和物体身份,恢复未见的物体区域。

Comments Project Page: https://thinking-in-boxes.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13558 2026-06-12 cs.CV cs.CL 新提交 57%

Edit the Bits, Diff the Codes: Bitwise Residual Editing for Visual Autoregressive Models

编辑比特,差异编码:面向视觉自回归模型的逐比特残差编辑

Shengqiang Zhang, Ruotong Liao, Volker Tresp, Barbara Plank, Hinrich Schütze

机构 * LMU Munich & Munich Center for Machine Learning (MCML)(慕尼黑大学 & 慕尼黑机器学习中心 (MCML))

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 提出BitResEdit,一种无需训练的视觉自回归图像编辑方法,通过比特级源负引导和残差编码注入,在保持背景的同时实现强文本对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07171 2026-06-08 cs.CV 新提交 57%

When Recovery Matters: The Blind Spot of Surrogate Privacy in MLLM Editing

当恢复至关重要时:MLLM编辑中替代隐私的盲点

Siyuan Xu, Yibing Liu, Peilin Chen, Yung-Hui LI, Shiqi Wang, Sam Kwong

机构 * City University of Hong Kong(香港城市大学) Hon Hai Research Institute(鸿海研究院) Lingnan University(岭南大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 针对多模态大模型编辑中的隐私风险,提出首个面向恢复的替代隐私保护编辑基准SPPE,涵盖36个细粒度隐私类别和65个编辑指令,并设计可编辑性评估与替代到源编辑恢复两个任务及对应方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24538 2026-07-28 cs.RO 新提交 50%

NEO: NeRF It Once, Edit It Many Times for Continuous Object Manipulation

NEO:一次性NeRF,多次编辑以进行连续物体操纵

Mikołaj Zieliński, David Hall, Dominik Belter, Peyman Moghadam

机构 * Institute of Robotics and Machine Intelligence, Poznan University of Technology(波兹南理工大学机器人与机器智能研究所) CSIRO Robotics, CSIRO(联邦科学与工业研究组织机器人部)

专题命中 图像编辑 :inpainting(abstract)

AI总结 本文提出NEO框架,用于机器人操纵的语言引导NeRF编辑。结合神经场重采样与多视图修复实现物体移除,利用知识蒸馏进行NeRF权重编辑,还创建了评估基准NEO-Dataset。该方法在场景编辑任务中表现出色,优于现有基线。

Comments Accepted to IEEE ROBOTICS AND AUTOMATION LETTERS (RA-L) JULY, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14531 2026-06-15 cs.RO 新提交 50%

AERMANI-PLACE: Language Guided Object Placement with Aerial Manipulators

AERMANI-PLACE: 基于语言引导的空中机械臂物体放置

Sarthak Mishra, Ritama Sanyal, Rishabh Dev Yadav, Wei Pan, Spandan Roy

机构 * Robotics Research Center, IIIT Hyderabad(海得拉巴国际信息技术学院机器人研究中心) Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) Newcastle University(纽卡斯尔大学)

专题命中 图像编辑 :image editing(abstract)

AI总结 提出AERMANI-PLACE框架,通过自然语言指令和图像编辑模型生成视觉标记,引导空中机械臂完成物体放置,在测试集和真实平台上分别达到87%和72%的平均成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 扩散模型 2168 篇

2607.03752 2026-07-07 cs.CV cs.AI cs.CL cs.MA 新提交 92%

EmCom-Diffusion: Probing Visual Reflection in Emergent Languages via Image Generation

EmCom-Diffusion:通过图像生成探究新兴语言中的视觉反射

Haruumi Omoto, Tadahiro Taniguchi

机构 * Graduate School of Informatics, Kyoto University, Kyoto, Japan(京都大学信息学研究科) Research Organization of Science and Technology, Ritsumeikan University, Shiga, Japan(立命馆大学科学技术研究机构)

专题命中 扩散模型 :diffusion(title,title_cn);image generation(title);text-to-image(abstract);分类 cs.CV

AI总结 研究新兴语言编码输入视觉内容程度的问题,提出EmCom-Diffusion框架,直接测量视觉反射,通过微调文本到图像扩散模型,以重建图像与原图的感知相似性评分,验证其优于现有指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07053 2026-06-08 cs.CV cs.LG 新提交 92%

TrioPose: Native Triple-Stream Diffusion Transformers for Pose-Guided Text-to-Image Generation

TrioPose: 用于姿态引导文本到图像生成的原生三流扩散变换器

Dian Gu, Zhengyi Yang

机构 * Institute of Automation Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 扩散模型 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 提出TrioPose,基于SD3.5M架构的原生三流姿态感知DiT,通过逐层激活和零初始化双残差注入保持预训练稳定性,并设计可学习关系偏置掩码和姿态引导空间损失加权,在多人姿态引导生成中实现SOTA性能,Human-Art上AP达64.33。

Comments 15 pages (9 pages main body, 6 pages references and appendix), 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07079 2026-06-08 cs.CV 新提交 91%

AsyncPatch Diffusion: spatially-flexible image generation

异步补丁扩散:空间灵活的图像生成

Samuele Papa, Valentin De Bortoli, Guillaume Couairon, Daniel Sýkora, Romuald Elie, Klaus Greff

机构 * Google DeepMind(谷歌DeepMind) University of Amsterdam(阿姆斯特丹大学) The Netherlands Cancer Institute(荷兰癌症研究所)

专题命中 扩散模型 :diffusion(title,summary_cn);image generation(title);inpainting(abstract);分类 cs.CV

AI总结 提出AsyncPatch Diffusion框架,通过为不同空间区域分配不同噪声水平实现异质去噪轨迹,在保持生成质量的同时原生支持图像修复和自适应生成。

Comments 36 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏