arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-11 至 2026-03-11 共收录 4 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4 篇

2603.09484 2026-03-11 cs.CV 85%

Component-Aware Sketch-to-Image Generation Using Self-Attention Encoding and Coordinate-Preserving Fusion

基于组件意识的草图到图像生成:使用自注意力编码和坐标保持融合

Ali Zia, Muhammad Umer Ramzan, Usman Ali, Muhammad Faheem, Abdelwahed Khamis, Shahnawaz Qureshi

专题命中 可控生成 :image generation(title,abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出了一种基于自注意力编码和坐标保持融合的组件意识框架,用于提升草图到图像生成的逼真度和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07871 2026-03-11 cs.CV cs.MM cs.SD eess.AS 84%

Controllable Dance Generation with Style-Guided Motion Diffusion

具有风格引导的舞动生成

Hongsong Wang, Ying Zhu, Xin Geng, Liang Wang

专题命中 可控生成 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV、cs.MM

AI总结 本文提出Style-Guided Motion Diffusion方法,通过整合Transformer架构与风格调制模块,实现风格引导的舞蹈生成,提升舞蹈生成的可控性和风格一致性。

Journal ref Machine Intelligence Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09031 2026-03-11 cs.RO 78%

ImpedanceDiffusion: Diffusion-Based Global Path Planning for UAV Swarm Navigation with Generative Impedance Control

阻抗扩散:基于扩散的全局路径规划用于无人机群导航的生成阻抗控制

Faryal Batool, Yasheerah Yaqoot, Muhammad Ahsan Mustafa, Roohan Ahmed Khan, Aleksey Fedoseev, Dzmitry Tsetserukou

机构 * Intelligent Space Robotics Laboratory, Center for Digital Engineering, Skolkovo Institute of Science and Technology(智能空间机器人实验室,数字工程中心,斯克尔科夫科学与技术研究所)

专题命中 可控生成 :diffusion(title,abstract)

AI总结 ImpedanceDiffusion通过结合扩散模型和人工势场跟踪,实现无人机群在复杂环境中的可靠路径规划与自适应阻抗控制。

Comments This is paper is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09759 2026-03-11 cs.CV 77%

LogoDiffuser: Training-Free Multilingual Logo Generation and Stylization via Letter-Aware Attention Control

LogoDiffuser: 无需训练的多语言标志生成与风格化通过字母感知注意力控制

Mingyu Kang, Hyein Seo, Yuna Jeong, Junhyeong Park, Yong Suk Choi

机构 * Department of Artificial Intelligence, Hanyang University(翰阳大学人工智能系) Department of Computer Science, Hanyang University(翰阳大学计算机科学系)

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 LogoDiffuser通过字母感知注意力控制,无需训练实现多语言标志生成与风格化,通过多模态扩散变换器整合字符结构与视觉设计,提升多语言标志生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏