arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-30 至 2026-06-30 共收录 7 信号源:cs.CV, cs.GR, cs.MM

1. 图像编辑 7 篇

2606.30054 2026-06-30 cs.CV 79%

Illuminating Unified Multimodal Model for Free-form Interleaved Text-Image Generation

照亮统一多模态模型以实现自由形式交错文本-图像生成

Chonghuinan Wang, Zhikai Chen, Chunwei Wang, Yecong Wan, Junwei Yang, Zhixin Wang, Wei Zhang, Jiaqi Xu, Renjing Pei, Xiaohe Wu, Fan Li, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Zhengzhou Advanced Research Institute of Harbin Institute of Technology(哈尔滨工业大学郑州先进研究院) Nankai University(南开大学)

专题命中 图像编辑 :image generation(title,abstract);分类 cs.CV

AI总结 提出ILLUME-X统一多模态模型,通过改进数据效率和稳定训练,实现高质量自由形式交错文本-图像生成,在风格迁移等任务上超越先前模型。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12175 2026-06-30 cs.CV 79%

Redefining Quality Criteria and Distance-Aware Score Modeling for Image Editing Assessment

重新定义质量标准与距离感知评分建模用于图像编辑评估

Xinjie Zhang, Qiang Li, Xiaowen Ma, Axi Niu, Li Yan, Qingsen Yan

机构 * Northwestern Polytechnical University(西北工业大学) Shenzhen Research Institute of Northwestern Polytechnical University(西北工业大学深圳研究院)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出DS-IEQA框架,通过反馈驱动指标优化和令牌解耦距离回归损失,改进图像编辑质量评估的指标定义与评分连续性建模。

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 2812-2820

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29286 2026-06-30 cs.CV 57%

ASTAD: Asymmetric Style Transfer for Synthetic-to-Real Adaptation in Autonomous Driving

ASTAD:自动驾驶中合成到真实适应的非对称风格迁移

Dingyi Yao, Xinqi Zhang, Lihui Peng, Jianming Hu, Danya Yao, Yi Zhang

机构 * Department of Automation, Tsinghua University(自动化系,清华大学)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 提出ASTAD任务,针对合成数据有标注而真实数据无标注的不对称性,设计无训练两阶段框架ASTModel,通过粗语义先验提取和动态精炼实现类一致风格迁移,显著提升下游感知性能并加速推理。

Comments Accepted for publication at the 19th European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28724 2026-06-30 cs.CV cs.AI 57%

CCRC: A Change-Aware Captioning and Reasoning Chain for Image Change Captioning and Segmentation

CCRC:面向图像变化描述与分割的变化感知描述与推理链

Jinhong Hu, Xiaoping Wang, Shuyin Huang, Guojin Zhong, Kaitai Liu, Kai Lu

机构 * College of Computer Science and Electronic Engineering, Hunan University, China(湖南大学计算机科学与电子工程学院,中国) Guangxi Minzu University, China(广西民族大学,中国) National University of Defense Technology, China(国防科学技术大学,中国)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 提出变化感知描述与推理链(CCRC),通过双链框架解耦语义推理与空间分割,实现图像变化描述与分割(ICCS)任务,在合成和真实基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13082 2026-06-30 cs.CV cs.RO eess.IV 57%

InterEdit: Navigating Text-Guided 3D Dyadic Human Motion Editing

InterEdit:文本引导的3D双人运动编辑

Yebin Yang, Di Wen, Lei Qi, Weitong Kong, Junwei Zheng, Ruiping Liu, Yufan Chen, Chengzhi Wu, Kailun Yang, Yuqian Fu, Danda Pani Paudel, Luc Van Gool, Kunyu Peng

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Hunan University(湖南大学) KAUST(韩国国立大学) INSAIT

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 本文提出InterEdit3D数据集和TMME基准,基于文本引导的双人3D运动编辑方法,通过语义感知计划令牌对齐和交互感知频率令牌对齐策略提升编辑一致性与保真度。

Comments Accepted to ECCV 2026. The dataset and code will be released at https://github.com/YNG916/InterEdit

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03143 2026-06-30 cs.CV cs.AI 57%

Edit in 2D, Verify in 3D: Reinforcement Learning for Multi-view Consistent Scene Editing

二维编辑,三维验证:强化学习用于多视角一致场景编辑

Jiyuan Wang, Chunyu Lin, Lei Sun, Zhi Cao, Yuyang Yin, Lang Nie, Zhenlong Yuan, Xiangxiang Chu, Yunchao Wei, Kang Liao, Guosheng Lin

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 本文提出RL3DEdit框架,利用强化学习优化多视角一致的3D场景编辑,通过VGGT模型生成的置信度图和姿态误差作为奖励信号,提升编辑质量与效率。

Comments Accepted by ECCV 2026, 32 pages, 10 figures, with Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28732 2026-06-30 eess.AS 50%

CTC-Seeded Token Edit Refinement for Non-Autoregressive Speech Recognition

基于CTC初始化的标记编辑精炼用于非自回归语音识别

Wanting Huang, Weiran Wang

专题命中 图像编辑 :diffusion(abstract)

AI总结 提出一种非自回归语音识别方法,利用CTC假设作为初始序列,通过编辑流解码器并行预测插入、删除和替换操作,仅需两步编辑即可显著降低词错误率。

Comments Submitted to IEEE SLT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏