arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-23 至 2026-06-23 共收录 5 信号源:cs.CV, cs.GR, cs.MM

1. 图像编辑 5 篇

2606.23270 2026-06-23 cs.CV 新提交 79%

BoxCtrl: 3D-Aware Visual Prompting for Geometric Image Editing

BoxCtrl: 面向几何图像编辑的3D感知视觉提示

Feifei Wang, Shiyuan Yang, Xiaoyu Li, Jing Liao

机构 * City University of Hong Kong(香港城市大学) Tencent(腾讯)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 提出BoxCtrl框架,通过投影到2D的RGB 3D边界框作为视觉提示,结合监督微调与强化学习两阶段训练,实现精确的3D几何编辑(平移、旋转、缩放等),达到最先进性能。

Comments Accepted by SIGGRAPH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23221 2026-06-23 cs.CV cs.AI 新提交 79%

RS-Gen: A Multi-Stage Agentic Framework for Reasoning and Search-Augmented Image Generation

RS-Gen:用于推理和搜索增强图像生成的多阶段智能体框架

Feifei Bian, Zhimin Zheng, Wei Deng, Daiguo Zhou, Jian Luan

机构 * MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus)

专题命中 图像编辑 :image generation(title,abstract);分类 cs.CV

AI总结 提出RS-Gen,一种即插即用、无需训练的多阶段图像智能体框架,通过“提问-解决”闭环机制进行逻辑推理和知识补全,显著提升基础图像生成与编辑模型在模糊意图和分布外知识场景下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22304 2026-06-23 cs.LG 新提交 67%

Encoder-Decoder Manifold Alignment for Idempotent Generation

用于幂等生成的编码器-解码器流形对齐

Dareen Alharthi, Abdul Waheed, Bhiksha Raj

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 图像编辑 :image generation(abstract);image editing(abstract)

AI总结 针对生成模型中幂等性不足导致的重复应用不稳定问题,提出通过对齐编码器和解码器学习的流形来训练模型,显著降低幂等误差并提升生成稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22042 2026-06-23 cs.CV 新提交 57%

IDAG-Edit: Multi-Object Video Editing via Instance-Decoupled Attention and Guidance

IDAG-Edit: 基于实例解耦注意力和引导的多对象视频编辑

Yuan-Zhih Lin, Huu-Thang Nguyen, Huu-Phu Do, Hong-Han Shuai, Ching-Chun Huang

机构 * Department of Computer Science, National Yang Ming Chiao Tung University, Taiwan(台湾阳明交通大学计算机科学系)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 提出IDAG-Edit框架,通过布局引导注意力调制和实例级掩码实现无训练的多对象视频编辑,解决注意力泄露和身份漂移问题,提升时间一致性和多对象可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20709 2026-06-23 cs.CV 新提交 57%

TeleStyle V2: Beyond Content-Preserving Style Transfer with Self-Distillation and Distribution-Matching-Distillation

TeleStyle V2:超越内容保持风格迁移的自蒸馏与分布匹配蒸馏

Shiwen Zhang, Yifan Xu, Haibin Huang, Chi Zhang, Xuelong Li

机构 * TeleAI

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 提出TeleStyle V2,通过自蒸馏数据合成和分布匹配蒸馏,支持四种内容-风格参考组合,解决内容一致性退化问题,性能与Qwen-Image-Edit和Gemini 3 Pro相当。

Comments https://github.com/Tele-AI/TeleStyleV2

详情

展开后加载摘要…

URL PDF HTML 收藏