arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-15 至 2026-06-15 共收录 4 信号源:cs.CV, cs.GR, cs.MM

1. 图像编辑 4 篇

2606.14125 2026-06-15 cs.CV cs.AI 新提交 88%

Conditioning Matters: Stabilizing Inversion and Attention in Diffusion Image Editing

条件至关重要:稳定扩散图像编辑中的反演与注意力

Zheyuan Zhan, Hongchen Li, Can Wang, Yinfei Ma, Mingzhen Huang, Ruoshi Bai, Jiawei Chen, Siwei Lyu, Defang Chen

机构 * State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全全国重点实验室) HangZhou High-Tech Zong (Binjiang) Institute of Blockchain and Data Security(杭州高新技术产业开发区(滨江)区块链与数据安全研究院) College of Computer Science, Zhejiang University(浙江大学计算机科学与技术学院) University at Buffalo, State University of New York(纽约州立大学布法罗分校)

专题命中 图像编辑 :diffusion(title,abstract);image editing(title,abstract);分类 cs.CV

AI总结 本文提出SimEdit框架,通过优化文本条件精度和令牌级跨分支注意力控制,提升扩散模型反演稳定性和编辑保真度,在PIE-Bench上显著优于先前方法。

Comments Accepted to ECML PKDD 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13898 2026-06-15 cs.CV cs.AI 新提交 83%

HiLo-Token: Input-Adaptive High-Low Frequency Token Compression for Efficient Image Editing

HiLo-Token: 输入自适应的高低频令牌压缩用于高效图像编辑

Haoran You, Yotam Nitzan, Lingzhi Zhang, Yifan Gong, Mang-Tik Chiu, Connelly Barnes, Yan Kang, Yuqian Zhou, Eli Shechtman, Sohrab Amirghodsi

机构 * Adobe ART AI Lab(Adobe ART AI实验室) Adobe Research(Adobe研究院)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 针对扩散变换器(DiT)在图像编辑中延迟高的问题,提出输入自适应的令牌压缩框架HiLo-Token,根据空间频率分配令牌预算,在保持生成质量的同时实现高达3.13倍加速。

Comments 14 pages, 10 figures, Patent filled

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14042 2026-06-15 cs.CV 新提交 79%

Rethinking One-Step Image Editing through ChordEdit: Reproduction, Simplification, and New Insights

通过ChordEdit重新思考一步图像编辑:复现、简化与新见解

Minghan Li, Jeremy Moebel, Mengyu Wang

机构 * Harvard AI and Robotics Lab(哈佛人工智能与机器人实验室)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 本文通过复现、消融和简化ChordEdit,揭示其机制:和弦窗口作为时间步偏移,和弦传输执行低频语义编辑,近端对齐补充高频细节,从而将编辑分解为粗低频传输和细高频对齐两个阶段,为自适应编辑提供新路径。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14531 2026-06-15 cs.RO 新提交 50%

AERMANI-PLACE: Language Guided Object Placement with Aerial Manipulators

AERMANI-PLACE: 基于语言引导的空中机械臂物体放置

Sarthak Mishra, Ritama Sanyal, Rishabh Dev Yadav, Wei Pan, Spandan Roy

机构 * Robotics Research Center, IIIT Hyderabad(海得拉巴国际信息技术学院机器人研究中心) Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) Newcastle University(纽卡斯尔大学)

专题命中 图像编辑 :image editing(abstract)

AI总结 提出AERMANI-PLACE框架,通过自然语言指令和图像编辑模型生成视觉标记,引导空中机械臂完成物体放置,在测试集和真实平台上分别达到87%和72%的平均成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏