arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-16 至 2026-03-16 共收录 10 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 10 篇

2603.12829 2026-03-16 cs.CV 83%

coDrawAgents: A Multi-Agent Dialogue Framework for Compositional Image Generation

coDrawAgents:一种用于组合图像生成的多智能体对话框架

Chunhan Li, Qifeng Wu, Jia-Hui Pan, Ka-Hei Hui, Jingyu Hu, Yuming Jiang, Bin Sheng, Xihui Liu, Wenjuan Gong, Zhengzhe Liu

机构 * Lingnan University(岭南大学) CMU(卡内基梅隆大学) CUHK(香港中文大学) Alibaba DAMO Academy(阿里巴巴达摩院) SJTU(上海交通大学) HKU(香港大学) China University of Petroleum(中国石油大学)

专题命中 可控生成 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 coDrawAgents通过四类智能体协作提升复杂场景中多对象生成的准确性与属性保持,实验表明其在文本-图像对齐、空间准确性和属性绑定方面表现更优。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24980 2026-03-16 cs.CV 79%

SDPose: Exploiting Diffusion Priors for Out-of-Domain and Robust Pose Estimation

SDPose:利用扩散先验进行跨域和鲁棒姿态估计

Shuang Liang, Jing He, Chuanmeizhi Wang, Lejun Liao, Guo Zhang, Yingcong Chen, Yuan Yuan

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 SDPose通过分析不同上采样层次的潜在特征,提取鲁棒的U-Net特征并融合轻量级模块,结合关键点热图监督和辅助潜变量重建损失,实现跨域姿态估计的鲁棒性和泛化能力。

Comments 22 pages, 10 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12793 2026-03-16 cs.CV cs.AI 70%

Cheers: Decoupling Patch Details from Semantic Representations Enables Unified Multimodal Comprehension and Generation

Cheers:解耦补丁细节与语义表示以实现统一的多模态理解和生成

Yichen Zhang, Da Peng, Zonghao Guo, Zijian Zhang, Xuesong Yang, Tong Sun, Shichu Sun, Yidan Zhang, Yanghao Li, Haiyan Zhao, Wang Xu, Qi Shi, Yangang Sun, Chi Chen, Shuo Wang, Yukun Yan, Xu Han, Qiang Ma, Wei Ke, Liang Wang, Zhiyuan Liu, Maosong Sun

机构 * Tsinghua University(清华大学) Xi’an Jiaotong University(西安交通大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 Cheers通过解耦补丁细节与语义表示,实现统一的多模态理解和生成,提升图像生成的保真度,并在多个基准测试中表现优异,同时实现4倍的token压缩效率。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13024 2026-03-16 cs.CV cs.AI cs.LG eess.IV 57%

SAW: Toward a Surgical Action World Model via Controllable and Scalable Video Generation

SAW:通过可控且可扩展的视频生成实现手术动作世界模型

Sampath Rapuri, Lalithkumar Seenivasan, Dominik Schneider, Roger Soberanis-Mukul, Yufan He, Hao Ding, Jiru Xu, Chenhao Yu, Chenyan Jing, Pengfei Guo, Daguang Xu, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学) NVIDIA

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SAW通过四个轻量信号条件的视频扩散模型生成真实手术动作视频,解决手术AI和模拟中的数据稀缺、稀有事件合成及仿真到现实的差距问题,实现高时间一致性和视觉质量。

Comments The manuscript is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23120 2026-03-16 cs.CV 57%

MMGT: Motion Mask Guided Two-Stage Network for Co-Speech Gesture Video Generation

MMGT:基于运动遮罩的两阶段网络用于语音手势视频生成

Siyuan Wang, Jiawei Liu, Wei Wang, Yeying Jin, Jinsong Du, Zhi Han

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出MMGT网络,通过结合音频、运动遮罩和姿态视频生成同步语音手势视频,解决单一音频控制导致的大动作缺失问题,提升视频质量与细节控制。

Comments Accepted by IEEE TCSVT

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12749 2026-03-16 cs.CV cs.CR cs.LG 57%

SLICE: Semantic Latent Injection via Compartmentalized Embedding for Image Watermarking

SLICE: 通过 compartmentalized 编码的语义潜在注入实现图像水印

Zheng Gao, Yifan Yang, Xiaoyu Li, Xiaoyan Feng, Haoran Fan, Yang Song, Jiaojiao Jiang

机构 * University of New South Wales(新南威尔士大学) Griffith University(格里菲斯大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SLICE通过将图像语义分解为四个因素并精确锚定到初始高斯噪声区域,实现鲁棒的语义水印验证,有效检测和定位语义篡改,实验表明其在对抗攻击中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12648 2026-03-16 cs.CV 57%

From Sparse to Dense: Multi-View GRPO for Flow Models via Augmented Condition Space

从稀疏到密集:通过增强条件空间的多视图GRPO用于流模型

Jiazi Bu, Pengyang Ling, Yujie Zhou, Yibin Wang, Yuhang Zang, Tianyi Wei, Xiaohang Zhan, Jiaqi Wang, Tong Wu, Xingang Pan, Dahua Lin

机构 * Shanghai Jiao Tong University(上海交通大学) S-Lab, Nanyang Technological University(南洋理工大学S实验室) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) Shanghai AI Laboratory(上海人工智能实验室) Adobe Research(Adobe研究实验室) Stanford University(斯坦福大学) Shanghai Innovation Institute(上海创新研究院) CPII under InnoHK Project(InnoHK项目下的CPII)

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出多视图GRPO,通过增强条件空间探索样本间关系,提升文本到图像流模型的对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12482 2026-03-16 cs.CV 57%

CalliMaster: Mastering Page-level Chinese Calligraphy via Layout-guided Spatial Planning

CalliMaster:通过布局引导的空间规划掌握页面级中文书法

Tianshuo Xu, Tiantian Hong, Zhifei Chen, Fei Chao, Ying-cong Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Faculty of Engineering and IT, University of Technology Sydney(悉尼大学工程与信息学院) Xiamen University(厦门大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出CalliMaster框架,通过解耦空间规划与内容合成,解决页面级书法生成中精度与布局的平衡问题,支持可控生成与编辑,扩展至文物修复与鉴定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00547 2026-03-16 cs.CV cs.AI 57%

Motion Dreamer: Boundary Conditional Motion Reasoning for Physically Coherent Video Generation

Motion Dreamer:基于物理一致视频生成的边界条件运动推理

Tianshuo Xu, Zhifei Chen, Leyi Wu, Hao Lu, Yuying Chen, Lihui Jiang, Bingbing Liu, Yingcong Chen

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 本文提出Motion Dreamer框架,通过分离运动推理与视觉合成,解决视频生成中边界条件运动推理的问题,提升运动合理性与视觉真实性。

Comments The authors have decided to withdraw this article due to the following reasons identified after publication: Experimental Errors: Significant inaccuracies were discovered in the experimental results concerning segmentation and depth estimation. Authorship Disputes: In addition to the technical issues, there are unresolved disagreements regarding the author sequence and contributions

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15369 2026-03-16 eess.IV cs.AI 50%

OpenVision 3: A Family of Unified Visual Encoder for Both Understanding and Generation

OpenVision 3: 一种用于理解和生成的统一视觉编码器家族

Letian Zhang, Sucheng Ren, Yanqing Liu, Xianhang Li, Zeyu Wang, Yuyin Zhou, Huaxiu Yao, Zeyu Zheng, Weili Nie, Guilin Liu, Zhiding Yu, Cihang Xie

机构 * UC Santa Cruz(加州大学圣克ruz分校) JHU(约翰霍普金斯大学) UNC-Chapel Hill(北卡罗来纳大学教堂山分校) UC Berkeley(加州大学伯克利分校) NVIDIA(英伟达)

专题命中 可控生成 :image generation(abstract)

AI总结 本文提出OpenVision 3,通过统一视觉表示实现图像理解和生成。核心架构将VAE压缩的图像潜在特征输入ViT编码器,同时训练其输出以支持重建和语义学习,从而在共享潜在空间中实现良好泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏