Element-Aware Group Learning for E-Commerce Image Generation
面向电商图像生成的元素感知组学习
专题命中 图像编辑 :image generation(title,abstract);分类 cs.CV
AI总结 针对电商图像生成中GRPO仅在完整提示层面分配信用的缺陷,提出EAGLE-GRPO,通过分解奖励并推导闭式解实现元素级信用分配,提升提示质量与生成图像性能。
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
面向电商图像生成的元素感知组学习
专题命中 图像编辑 :image generation(title,abstract);分类 cs.CV
AI总结 针对电商图像生成中GRPO仅在完整提示层面分配信用的缺陷,提出EAGLE-GRPO,通过分解奖励并推导闭式解实现元素级信用分配,提升提示质量与生成图像性能。
iMontage:统一、多功能、高度动态的多对多图像生成
机构 * Nanyang Technological University(南洋理工大学) ; StepFun ; Shanghai Jiao Tong University(上海交通大学)
专题命中 图像编辑 :image generation(title,abstract);分类 cs.CV
AI总结 iMontage通过整合视频模型的先验知识与图像数据的多样性,实现了统一、多功能且动态的多对多图像生成。
Comments Our homepage: https://kr1sjfu.github.io/iMontage-web/
漫画图像编辑中的推理时间轨迹优化
机构 * Mantra Inc.(Mantra公司) ; The University of Tokyo(东京大学)
专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV
AI总结 本文提出一种在推理时适应预训练图像编辑模型的方法,通过仅使用输入漫画图像来调整模型,以提高对漫画图像的编辑效果,同时减少计算开销。
RS-RIE-Bench:推理引导的遥感图像编辑基准测试
机构 * Huawei(华为)
专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV
AI总结 该研究针对遥感图像编辑,引入RS-RIE-Bench基准,将任务分类,通过特定评估协议和方法评估模型,经实验发现当前模型在推理引导的遥感编辑中有局限,为未来模型提供了基准和研究方向。
连续上下文:基于指令的图像编辑的连续强度控制
机构 * Snap Research ; Tel Aviv University(特拉维夫大学) ; IISc Bangalore(班加罗尔IISc)
专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV
AI总结 研究基于指令的图像编辑中编辑强度控制问题,提出连续上下文模型,通过扩展先进模型并引入标量编辑强度,训练轻量级投影网络,合成多样数据集,实现对多种图像编辑操作的编辑强度统一细粒度控制。
Comments Project Page: https://snap-research.github.io/kontinuouskontext/, Accepted at CVPR 2026
为了融入,首先解耦:通过上下文解耦表示重新思考伪装图像生成
机构 * Beihang University(北京航空航天大学) ; Geely Automobile Research Institute (Ningbo) Co., Ltd(吉利汽车研究院(宁波)有限公司)
专题命中 图像编辑 :image generation(title,abstract);分类 cs.CV
AI总结 研究伪装图像生成问题,提出上下文解耦生成范式CamoDreamer,通过设计对比感知上下文桥等方法,将潜在伪装特征解耦为物体和背景控制流,实验证明其显著优于现有方法且设计轻量。
Comments 14 pages, 11 figures, ACMMM 2026
WeEdit:一个数据集、基准和基于字形引导的文本中心图像编辑框架
专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV
AI总结 WeEdit通过构建大规模数据集和定制训练策略,提升文本中心图像编辑的精度与多样性,优于现有开源模型。
Comments Accepted by ECCV2026
图像编辑模型是否理解光照?
机构 * Heidelberg University(海德堡大学) ; Technical University of Munich(慕尼黑工业大学) ; Zuse School ELIZA
专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV
AI总结 提出3D锚定光探针基准(3DLP),通过真实世界HDR数据集评估图像编辑模型对光照变化的编辑准确性,发现模型在镜面高光区域表现较好,但整体仍有改进空间。
Comments Project page: https://tim-kuechler.github.io/3DLP/
弥合流形差距:黎曼残差线搜索用于一步图像编辑
机构 * UCAS(中国科学院大学) ; WashU(华盛顿大学) ; SHU(上海大学)
专题命中 图像编辑 :image editing(title);diffusion(abstract);分类 cs.CV
AI总结 针对一步扩散编辑中固定更新强度无法兼顾目标提示和源图像保真度的问题,提出黎曼残差线搜索方法,通过局部时间曲率估计和残差路径选择,在PIE-Bench++上达到SOTA。
用于时尚姿势对齐和归一化的无训练、身份保留图像编辑
机构 * Polytechnic University of Bari(巴里理工大学)
专题命中 图像编辑 :image editing(title);diffusion(abstract);分类 cs.CV
AI总结 针对时尚行业非刚性姿势调整难题,提出无训练的FashionRepose管道,结合预训练模型,通过零样本方法在保留服装身份特征的同时实现近实时编辑,已成功为OVS处理大量长袖服装。
Journal ref Expert Systems With Applications, 293, 128579 (2025)
在对话式图像编辑中明确隐式保留意图
机构 * Sogang University(西江大学) ; Korea University(高丽大学) ; Chung-Ang University(中央大学)
专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV
AI总结 研究对话式图像编辑中隐式保留意图的问题,提出无需训练的ReSpec框架,通过配对恢复感知指令与历史视觉参考使隐式保留明确化,实验显示该框架提升了恢复保真度和时间一致性。
小波引导的语义信号补偿用于无反转图像编辑
机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院)
专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV
AI总结 针对无反转图像编辑中全局属性编辑不足的问题,提出基于小波的频率感知语义补偿策略,在生成早期增强有效信号,提升全局编辑能力同时保持背景保真度。
Comments Accepted to ECCV 2026
一次学习,随处编辑:扩散模型的视觉方向迁移
机构 * Virginia Tech(弗吉尼亚理工大学)
专题命中 图像编辑 :diffusion(title,abstract);分类 cs.CV
AI总结 提出ViDiT框架,通过从图像编辑对中学习连续编辑方向,实现无需微调的零样本图像属性编辑,在保持输入保真度的同时实现精确、可扩展的属性控制。
Comments ECCV 2026, Project page: http://vidit-edit.github.io
通过具有代理执行的自适应任务重构使图像编辑更易于实现
机构 * Nanjing University(南京大学) ; Beijing Institute of Technology(北京理工大学) ; College of Artificial Intelligence, China University of Petroleum (Beijing)(中国石油大学(北京)人工智能学院) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Fudan University(复旦大学)
专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV
AI总结 本文提出通过自适应任务重构框架提升图像编辑性能,通过代理分析和反馈优化任务描述,改进编辑效果,尤其在复杂案例中表现显著。
Comments 9pages
照亮统一多模态模型以实现自由形式交错文本-图像生成
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Huawei Noah’s Ark Lab(华为诺亚实验室) ; Zhengzhou Advanced Research Institute of Harbin Institute of Technology(哈尔滨工业大学郑州先进研究院) ; Nankai University(南开大学)
专题命中 图像编辑 :image generation(title,abstract);分类 cs.CV
AI总结 提出ILLUME-X统一多模态模型,通过改进数据效率和稳定训练,实现高质量自由形式交错文本-图像生成,在风格迁移等任务上超越先前模型。
Comments Accepted by ECCV2026
重新定义质量标准与距离感知评分建模用于图像编辑评估
机构 * Northwestern Polytechnical University(西北工业大学) ; Shenzhen Research Institute of Northwestern Polytechnical University(西北工业大学深圳研究院)
专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV
AI总结 本文提出DS-IEQA框架,通过反馈驱动指标优化和令牌解耦距离回归损失,改进图像编辑质量评估的指标定义与评分连续性建模。
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 2812-2820
SpatialFlow-GRPO:空间信用驱动图像编辑
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Kuaishou Technology(快手科技)
专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV
AI总结 提出SpatialFlow-GRPO框架,通过引入空间细粒度奖励反馈,将区域感知奖励转化为语义区域级优化信号,解决图像编辑中空间均匀性假设问题,显著提升编辑质量。
PhyEditBench: 一个用于物理感知图像编辑的真实世界多阶段基准
机构 * Nanjing University(南京大学) ; SDU(山东大学) ; HRBEU(哈尔滨工程大学) ; SDUTCM(山东中医药大学) ; USTC(中国科学技术大学)
专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV
AI总结 提出PhyEditBench基准,通过分层分类和真实/反物理实例评估编辑模型的物理理解能力,并引入训练无关基线PhyWorld利用视频生成推理。
Comments 19 pages, 6 figures, 2 tables. Accepted to ECCV 2026
当提示变为视觉:面向大型图像编辑模型的以视觉为中心的越狱攻击
专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV
AI总结 提出首个视觉到视觉的越狱攻击VJA,通过纯视觉输入传递恶意指令,并构建安全基准IESBench,在商业模型上攻击成功率高达80.9%,同时提出无需训练的内省多模态推理防御方法。
Comments Accepted for spotlight and oral presentation at ICML 2026 (Project: https://csu-jpg.github.io/vja.github.io/)
BoxCtrl: 面向几何图像编辑的3D感知视觉提示
机构 * City University of Hong Kong(香港城市大学) ; Tencent(腾讯)
专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV
AI总结 提出BoxCtrl框架,通过投影到2D的RGB 3D边界框作为视觉提示,结合监督微调与强化学习两阶段训练,实现精确的3D几何编辑(平移、旋转、缩放等),达到最先进性能。
Comments Accepted by SIGGRAPH 2026
RS-Gen:用于推理和搜索增强图像生成的多阶段智能体框架
机构 * MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus)
专题命中 图像编辑 :image generation(title,abstract);分类 cs.CV
AI总结 提出RS-Gen,一种即插即用、无需训练的多阶段图像智能体框架,通过“提问-解决”闭环机制进行逻辑推理和知识补全,显著提升基础图像生成与编辑模型在模糊意图和分布外知识场景下的性能。
ImageWAM:世界动作模型真的需要视频生成,还是只需要图像编辑?
机构 * Shanghai Jiao Tong University(上海交通大学) ; Eastern Institute of Technology(东方理工学院) ; Tencent Robotics X(腾讯机器人X) ; Tsinghua University(清华大学) ; Zhongguancun Academy(中关村学院)
专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV
AI总结 提出ImageWAM框架,利用预训练图像编辑模型替代视频生成进行机器人动作预测,通过编辑去噪的KV缓存作为世界动作上下文,在多个模拟和真实实验中优于基线,计算量降至1/6,延迟降至1/4。
Comments Project Page: https://zhangwenyao1.github.io/ImageWAM/
ProductConsistency:通过SFT和RL改进基于指令的图像编辑中的产品身份保持
机构 * Fractal Analytics
专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV
AI总结 针对基于指令的图像编辑中产品特征保持不足的问题,提出ProductConsistency数据集和循环一致性奖励,结合监督微调与强化学习,显著提升产品一致性、文本渲染和视觉质量。
Comments CVPR HiGen 2026
CAMEO: 一种条件感知与质量驱动的多智能体图像编辑编排器
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Harbin Institute of Technology(哈尔滨工业大学) ; Shenzhen University(深圳大学) ; Claremont McKenna College(克莱蒙特麦肯纳学院) ; Research Institute of Petroleum Exploration and Development, CNPC(石油勘探开发研究院,中石油)
专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV
AI总结 提出CAMEO多智能体框架,将条件图像编辑重构为质量感知的反馈驱动过程,通过分解编辑阶段、嵌入评估循环,在异常插入和人体姿态切换任务中平均胜率提升20%。
文本-视觉协同指导的图像编辑
机构 * The Hong Kong Polytechnic University(香港理工大学) ; OPPO Research Institute(OPPO研究院)
专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV
AI总结 提出TV-Edit框架,联合文本指令的语义表达与稀疏视觉指令的空间引导,实现精确且忠实于意图的图像编辑,显著优于现有方法。
SceneCraft: 基于场景图的交互式图像编辑系统
机构 * University of Science, Ho Chi Minh, Vietnam(胡志明市理科大学) ; Vietnam National University, Ho Chi Minh, Vietnam(越南国家大学胡志明市) ; University of Dayton, Dayton, Ohio, USA(代顿大学)
专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV
AI总结 提出SceneCraft框架,通过场景图表示图像,用户直接操作图结构进行复杂编辑,自动生成精确提示,降低语言歧义,提升编辑质量和用户控制。
注意差距:诊断图像内文本编辑中的约束发现失败
专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV
AI总结 通过图像内文本编辑的受控诊断,研究多模态模型在发现未明确指定的视觉依赖约束时的失败,发现模型仅能自行发现46%的约束,而明确提供时可达94%。
单轮与多轮指令式图像编辑的广泛基准
机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室) ; National University of Singapore(新加坡国立大学)
专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV
AI总结 提出I2EBench2.0基准,通过16个单轮和7个多轮维度评估指令式图像编辑模型,结合用户研究确保与人类判断一致,并基于八种模型分析提供研究指导。
Comments Accepted by International Journal of Computer Vision (IJCV), 2026
自适应推理时间缩放:基于早期步骤潜在验证的图像编辑
机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) ; Microsoft Research Asia(微软亚洲研究院) ; Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所)
专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV
AI总结 提出VeriLatent框架,通过早期步骤潜在空间编辑激活图验证初始噪声,实现自适应推理时间缩放,提升图像编辑质量和效率。
通过ChordEdit重新思考一步图像编辑:复现、简化与新见解
机构 * Harvard AI and Robotics Lab(哈佛人工智能与机器人实验室)
专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV
AI总结 本文通过复现、消融和简化ChordEdit,揭示其机制:和弦窗口作为时间步偏移,和弦传输执行低频语义编辑,近端对齐补充高频细节,从而将编辑分解为粗低频传输和细高频对齐两个阶段,为自适应编辑提供新路径。
Comments 9 pages