arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-07 至 2026-07-07 共收录 5 信号源:cs.CV, cs.GR, cs.MM

1. 图像编辑 5 篇

2607.03562 2026-07-07 cs.CV 新提交 57%

XPlainVerse: A Million-Scale Benchmark for Explainable Deepfake Detection

XPlainVerse:用于可解释深度伪造检测的百万规模基准测试

Abhijeet Narang, Kartik Kuckreja, Shreya Ghosh, Muhammad Haris Khan, Jianfei Cai, Abhinav Dhall

机构 * Monash University(墨尔本大学) MBZUAI(穆斯林人工智能研究所) The University of Queensland(昆士兰大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 针对深度伪造检测模型解释缺乏视觉依据的问题,引入XPlainVerse基准测试,含百万图像及多阶段验证流程,提出新评估指标,能支持可信赖、可解释模型的研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19073 2026-07-07 cs.CV 新提交 57%

Taming I2V models for Image HOI Editing: A Cognitive Benchmark and Agentic Self-Correcting Framework

驯服I2V模型用于图像HOI编辑:认知基准与智能体自校正框架

Jiayi Gao, Qingchao Chen, Yuxin Peng, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University, Beijing, China(王轩计算机技术研究所,北京大学,北京,中国) National Institute of Health Data Science, Peking University, Beijing, China(国家健康数据科学研究院,北京大学,北京,中国)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 提出HOI-Edit基准和SCPE框架,利用I2V模型的时间生成能力进行动态人-物交互编辑,通过自校正提示迭代优化,实现与SOTA竞争的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22607 2026-07-07 cs.CV 版本更新 57%

Dress-ED: Instruction-Guided Editing for Virtual Try-On and Try-Off

Dress-ED:基于指令的虚拟试穿和试脱编辑

Davide Lobba, Fulvio Sanguigni, Bin Ren, Marcella Cornia, Rita Cucchiara, Nicu Sebe

机构 * University of Modena(摩德纳大学) University of Trento(特伦托大学) University of Pisa(比萨大学)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Dress-ED数据集,首次统一了虚拟试穿、试脱和文本引导的服装编辑,包含146k个样本,涵盖外观和结构修改,提供统一的多模态扩散框架作为指令驱动的VTON和VTOFF基线。

Comments Accepted at ECCV 2026. Project page at https://aimagelab.github.io/Dress-ED/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13770 2026-07-07 cs.CV 版本更新 57%

CDST: Color Disentangled Style Transfer for Universal Style Reference Customization

CDST:用于通用风格参考定制的颜色解缠风格迁移

Shiwen Zhang, Zhuowei Chen, Lang Chen, Yanze Wu

机构 * ByteDance(字节跳动)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 介绍CDST这种新颖高效的双流风格迁移训练范式,能分离颜色与风格,推理时免调参实现通用风格迁移,首次免调参解决带风格和内容参考的特征保留风格迁移问题,实验证明效果达最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.13771 2026-07-07 cs.CV 版本更新 57%

AppAgent: Multimodal Agents as Smartphone Users

AppAgent:作为智能手机用户的多模态智能体

Chi Zhang, Zhao Yang, Jiaxuan Liu, Yanda Li, Yucheng Han, Xin Chen, Zebiao Huang, Bin Fu, Gang Yu

机构 * Tencent(腾讯)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 介绍基于大语言模型的多模态智能体框架,通过简化动作空间操作智能手机应用,无需系统后端访问,经自主探索或观察人类示范学习,能执行复杂任务,测试验证其处理多种高级任务的能力。

Comments Accepted to CHI 2025, project page is https://appagent-official.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏