arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-15 至 2026-05-15 共收录 8 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 8 篇

2504.01571 2026-05-15 cs.GR cs.AI cs.CV cs.LG 84%

Pro-DG: Procedural Diffusion Guidance for Architectural Facade Generation

Pro-DG:基于过程扩散引导的建筑立面生成

Aleksander Plocharski, Jan Swidzinski, Przemyslaw Musialski

机构 * Warsaw University of Technology(华沙技术大学) Akces NCBR Imperial College London(伦敦帝国理工学院) New Jersey Institute of Technology(新泽西理工学院)

专题命中 可控生成 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV、cs.GR

AI总结 本文提出Pro-DG方法,通过层次化过程规则生成控制图,实现建筑立面的真实感生成,支持结构编辑如楼层复制和窗户重排,经评估验证其在保持建筑身份和精确编辑方面的优越性。

Comments 17 pages, 15 figures, Computer Graphics Forum 2026 Journal Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15167 2026-05-15 cs.CV 57%

Does Synthetic Layered Design Data Benefit Layered Design Decomposition?

合成分层设计数据是否有助于分层设计分解?

Kam Man Wu, Haolin Yang, Qingyu Chen, Yihu Tang, Jingye Chen, Qifeng Chen

机构 * HKUST(香港理工大学) Webank(网商银行)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文研究合成分层数据对图形设计分解的影响,发现纯合成数据能有效替代传统方法,且训练数据规模增加时性能提升,但5万样本后趋于饱和。

Comments 22 pages, 10 figures. Code is available at https://github.com/YangHaolin0526/SynLayers

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12624 2026-05-15 cs.RO cs.CV 57%

MindVLA-U1: VLA Beats VA with Unified Streaming Architecture for Autonomous Driving

MindVLA-U1:统一流架构使VLA超越VA用于自动驾驶

Yuzhou Huang, Benjin Zhu, Hengtong Lu, Victor Shea-Jay Huang, Haiming Zhang, Wei Chen, Jifeng Dai, Yan Xie, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多模态实验室) Li Auto Tsinghua University(清华大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 MindVLA-U1通过统一流架构实现自动驾驶中VLA超越VA,采用统一视觉语言模型骨干和流匹配连续动作轨迹,在保持各模态自然输出形式的同时,实现高效规划和低延迟。

Comments Work in progress. Project page: https://mind-omni.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14935 2026-05-15 cs.CV 57%

Multi-scale Coarse-to-fine Modeling for Test-time Human Motion Control

多尺度粗到细建模用于测试时的人体运动控制

Nhat Le, Daochang Liu, Anh Nguyen, Ajmal Mian

机构 * The University of Western Australia(西澳大学) The University of Liverpool(利物浦大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出MSCoT模型,通过多尺度粗到细方法实现测试时的人体运动合成与控制,采用高效多尺度令牌引导策略提升控制精度与效率,实验显示其在运动质量和控制准确性方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14815 2026-05-15 cs.CV 57%

Probing into Camera Control of Video Models

探究视频模型的摄像机控制

Chen Hou, Christian Rupprecht

机构 * Visual Geometry Group University of Oxford(视觉几何组牛津大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出通过几何引导而非隐式映射实现摄像机控制,有效提升视频生成模型的几何表现力,并揭示了基础模型的摄像机控制偏见与差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14626 2026-05-15 cs.CV 57%

UniTriGen: Unified Triplet Generation of Aligned Visible-Infrared-Label for Few-Shot RGB-T Semantic Segmentation

UniTriGen: 一致的可见-红外-标签三元组生成用于少样本RGB-T语义分割

Ping Zhou, Haoyu Wang, Mengmeng Zheng, Lei Zhang, Wei Wei, Chen Ding, Fei Zhou

机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院) School of Computer Science & Technology, Xi’an University of Posts & Telecommunications(西安邮电大学计算机科学与技术学院) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 UniTriGen提出统一三元组生成框架,通过共享潜在空间和扩散过程生成一致的可见-红外-标签三元组,解决少样本RGB-T语义分割中的对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09304 2026-05-15 cs.CV 57%

GeRM: A Generative Rendering Model From Physically Realistic to Photorealistic

GeRM:从物理真实到照片级的生成渲染模型

Jiayuan Lu, Rengan Xie, Xuancheng Jin, Zhizhen Wu, Qi Ye, Tian Xie, Hujun Bao, Rui Wang. Yuchi Huo

机构 * State Key Lab of CAD\&CG, Zhejiang University Zhejiang Lab China State Key Laboratory of Industrial Control Technology, Zhejiang University China Zhejiang University China Zhejiang Lab State Key Laboratory of Industrial Control Technology, Zhejiang University Zhejiang University

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

AI总结 GeRM是首个多模态生成渲染模型,通过学习分布转移向量场实现从物理真实到照片级的过渡,结合控制网络和多代理框架提升图像生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14135 2026-05-15 cs.CV 57%

PanoPlane: Plane-Aware Panoramic Completion for Sparse-View Indoor 3D Gaussian Splatting

PanoPlane:基于平面感知的稀疏视角室内3D高斯散点完成

Adil Qureshi, Dongki Jung, Jaehoon Choi, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 PanoPlane通过全景场景完成重建封闭房间几何,利用360度全景完成条件生成过程,通过Layout Anchored Attention Steering机制引导扩散模型注意力至检测到的平面表面,实现基于几何一致性的表面外推,提升稀疏视角下的新型视图合成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏