arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-17 至 2026-03-17 共收录 22 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 22 篇

2603.13386 2026-03-17 cs.CV 88%

Layout-Guided Controllable Pathology Image Generation with In-Context Diffusion Transformers

基于布局的可控病理图像生成与上下文扩散变换器

Yuntao Shou, Xiangyong Cao, Qian Zhao, Deyu Meng

机构 * Xi'an Jiaotong University(西安交通大学)

专题命中 可控生成 :diffusion(title,abstract);image generation(title);image synthesis(abstract);分类 cs.CV

AI总结 本文提出基于布局的可控病理图像生成方法,通过多代理LVLM注释框架构建精细临床对齐的监督数据,提出IC-DiT模型整合空间布局、文本描述和视觉嵌入,实现高保真生成与强空间可控性。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14741 2026-03-17 cs.CV 81%

PHAC: Promptable Human Amodal Completion

PHAC: 可提示的人形不可见区域补全

Seung Young Noh, Ju Yong Chang

专题命中 可控生成 :image generation(abstract);diffusion(abstract);inpainting(abstract);image synthesis(abstract)

AI总结 本文提出PHAC任务,通过满足可见外观约束和多用户提示完成遮挡人像,使用ControlNet模块编码提示信号并微调交叉注意力块以提升提示对齐性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15614 2026-03-17 cs.CV 79%

Tri-Prompting: Video Diffusion with Unified Control over Scene, Subject, and Motion

Tri-Prompting:具有统一场景、主体和运动控制的视频扩散

Zhenghong Zhou, Xiaohang Zhan, Zhiqin Chen, Soo Ye Kim, Nanxuan Zhao, Haitian Zheng, Qing Liu, He Zhang, Zhe Lin, Yuqian Zhou, Jiebo Luo

机构 * Adobe Research(Adobe研究院) University of Rochester(罗切斯特大学)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 Tri-Prompting提出统一框架,整合场景、多视角主体一致性和运动控制,提升视频生成的可控性和真实感。

Comments Project page: https://zhouzhenghong-gt.github.io/Tri-Prompting-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14957 2026-03-17 cs.CV 79%

CyCLeGen: Cycle-Consistent Layout Prediction and Image Generation in Vision Foundation Models

CyCLeGen:视觉基础模型中的循环一致布局预测与图像生成

Xiaojun Shan, Haoyu Shen, Yucheng Mao, Xiang Zhang, Abhay Anand, Bingnan Li, Haiyang Xu, Zhuowen Tu

机构 * UC San Diego(加州大学圣迭戈分校)

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 CyCLeGen是一种统一的视觉-语言基础模型,通过单一自回归框架实现图像理解和生成,采用循环一致学习确保生成与布局之间的双向一致性,提升模型的自我反思能力和数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14241 2026-03-17 cs.CV 79%

CamLit: Unified Video Diffusion with Explicit Camera and Lighting Control

CamLit:统一的视频扩散模型,具有显式相机和光照控制

Zhiyi Kuang, Chengan He, Egor Zakharov, Yuxuan Xue, Shunsuke Saito, Olivier Maury, Timur Bagautdinov, Youyi Zheng, Giljoo Nam

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 CamLit首次提出统一的视频扩散模型,结合生成新视角和光照重置,通过单张图像、相机轨迹和环境映射生成高质量视频,实现高精度的相机姿态和光照控制。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14063 2026-03-17 cs.CV 77%

Semantic Context Matters: Improving Conditioning for Autoregressive Models

语义上下文至关重要:改进自回归模型的条件化

Dongyang Jin, Ryan Xu, Jianhao Zeng, Rui Lan, Yancheng Bai, Lei Sun, Xiangxiang Chu

专题命中 可控生成 :image generation(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出SCAR方法,通过压缩语义前缀和语义对齐指导提升自回归模型的条件化能力,实现更高质量的图像编辑和可控生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00782 2026-03-17 cs.GR cs.AI cs.CV cs.MM cs.SD eess.AS 67%

SpA2V: Harnessing Spatial Auditory Cues for Audio-driven Spatially-aware Video Generation

SpA2V: 利用空间听觉线索进行音频驱动的空间感知视频生成

Kien T. Pham, Yingqing He, Yazhou Xing, Qifeng Chen, Long Chen

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR、cs.MM

AI总结 SpA2V通过利用空间听觉线索生成与输入音频在语义和空间上一致的视频,改进了现有方法对语义信息的依赖,提出两阶段框架实现视频场景布局生成与生成。

Comments The 33rd ACM Multimedia Conference (MM '25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13233 2026-03-17 cs.HC cs.AI 67%

From Prompts to Worlds: How Users Iterate, Explore, and Make Sense of AI-Generated 3D Environments

从提示到世界:用户如何迭代、探索和理解AI生成的3D环境

Aung Pyae

专题命中 可控生成 :image generation(abstract);text-to-image(abstract)

AI总结 研究探讨用户如何通过迭代和探索理解AI生成的3D环境,发现语言到空间表达的不对称性、沉浸感的间歇性以及结构迭代中的障碍,强调需要混合输入方式和透明反馈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15546 2026-03-17 cs.CV cs.GR cs.RO 62%

Kimodo: Scaling Controllable Human Motion Generation

Kimodo:可控制的人体运动生成

Davis Rempe, Mathis Petrovich, Ye Yuan, Haotian Zhang, Xue Bin Peng, Yifeng Jiang, Tingwu Wang, Umar Iqbal, David Minor, Michael de Ruyter, Jiefeng Li, Chen Tessler, Edy Lim, Eugene Jeong, Sam Wu, Ehsan Hassani, Michael Huang, Jin-Bey Yu, Chaeyeon Chung, Lina Song, Olivier Dionne, Jan Kautz, Simon Yuen, Sanja Fidler

机构 * NVIDIA

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出Kimodo模型,通过大规模动作捕捉数据训练,实现高质量可控的人体运动生成,结合文本输入和多种运动约束条件,提升生成质量和泛化能力。

Comments Project page: https://research.nvidia.com/labs/sil/projects/kimodo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15555 2026-03-17 cs.CV 57%

Learning Latent Proxies for Controllable Single-Image Relighting

学习可控的单图像照明代理

Haoze Zheng, Zihao Wang, Xianfeng Wu, Yajing Bai, Yexin Liu, Yun Li, Xiaogang Xu, Harry Yang

机构 * HKUST(香港科技大学) HKPolyU(香港理工大学) CUHK(香港中文大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出LightCtrl,通过物理先验和稀疏提示实现可控单图像照明,利用DPO优化和ScaLight数据集提升光照控制精度与PSNR表现。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01535 2026-03-17 cs.CV 57%

Benchmarking Semantic Segmentation Models via Appearance and Geometry Attribute Editing

通过外观和几何属性编辑评估语义分割模型

Zijin Yin, Bing Li, Kongming Liang, Hao Sun, Zhongjiang He, Zhanyu Ma, Jun Guo

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Gen4Seg数据生成管道,通过生成具有不同属性变化的挑战样本来评估语义分割模型,构建了Pascal-EA和COCO-EA两个新基准,发现开放词汇模型在几何变化下不比封闭集方法更鲁棒,数据增强技术在提升外观变化鲁棒性上有限。

Comments Accepted to IEEE TPAMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18333 2026-03-17 cs.CV 57%

ConsistCompose: Unified Multimodal Layout Control for Image Composition

ConsistCompose:统一的多模态布局控制用于图像合成

Xuanke Shi, Boxuan Li, Xiaoyang Han, Zhongang Cai, Lei Yang, Quan Wang, Dahua Lin

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 ConsistCompose通过将布局坐标直接嵌入语言提示,实现布局可控的多实例图像生成,并构建了3.4M的多实例生成数据集,提升了布局控制的精度和多模态理解能力。

Comments Accepted to CVPR 2026; 23 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14151 2026-03-17 cs.CV 57%

Seeing Through the PRISM: Compound & Controllable Restoration of Scientific Images

通过PRISM:科学图像的复合与可控恢复

Rupa Kurinchi-Vendhan, Pratyusha Sharma, Antonio Torralba, Sara Beery

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 PRISM通过结合复合感知监督和加权对比度解纠缠目标,实现科学图像中复杂退化的同时恢复,支持通过自然语言提示选择性修复,提升下游科学准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14112 2026-03-17 cs.CV 57%

Revisiting the Perception-Distortion Trade-off with Spatial-Semantic Guided Super-Resolution

重新审视基于空间-语义引导的超分辨率中的感知-失真权衡

Dan Wang, Haiyan Sun, Shan Du, Z. Jane Wang, Zhaochong An, Serge Belongie, Xinrui Cui

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出SpaSemSR框架,通过空间-语义引导减少失真并提升感知质量,实验显示在多个基准上实现了更优的感知-失真平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09160 2026-03-17 cs.CV 57%

WonderVerse: Extendable 3D Scene Generation with Video Generative Models

WonderVerse:基于视频生成模型的可扩展3D场景生成

Hao Feng, Zhi Zuo, Jia-Hui Pan, Ka-Hei Hui, Qi Dou, Jingyu Hu, Zhengzhe Liu

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 本文提出WonderVerse框架,利用视频生成模型中的世界级先验知识生成沉浸式且几何一致的3D环境,并引入可控扩展技术与异常序列检测模块,实现高效高质量的可扩展3D场景生成。

Comments Accepted at CVM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13745 2026-03-17 cs.CV 57%

Multi-Object Advertisement Creative Generation

多对象广告创意生成

Jialu Gao, Mithun Das Gupta, Qun Li, Raveena Kshatriya, Andrew D. Wilson, Keng-hao Chang, Balasaravanan Thoravi Kumaravel

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出CreativeAds系统,通过多产品广告生成管道解决大规模广告创作中的产品配对、布局生成和背景生成挑战,实现自动化高质量广告生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13368 2026-03-17 cs.CV cs.AI cs.RO 57%

Real-Time Monocular Scene Analysis for UAV in Outdoor Environments

无人机在户外环境中实时单目场景分析

Yara AlaaEldin

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Co-SemDepth模型,用于无人机在低空非结构化环境中实时预测深度和语义图。通过合成数据集TopAir和图像风格迁移技术提升泛化能力,并在海洋领域验证模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15292 2026-03-17 stat.ML cs.AI cs.LG 50%

Scalable Simulation-Based Model Inference with Test-Time Complexity Control

可扩展的基于模拟的模型推断与测试时间复杂度控制

Manuel Gloeckler, J. P. Manzano-Patrón, Stamatios N. Sotiropoulos, Cornelius Schröder, Jakob H. Macke

机构 * Machine Learning in Science, University of Tübingen Tübingen AI Center, Tübingen, Germany Max Planck Institute for Intelligent Systems, Department Empirical Inference, Tübingen, Germany Sir Peter Mansfield Imaging Centre, School of Medicine, University of Nottingham, UK National Institute for Health Research (NIHR) Nottingham Biomedical Research Centre, Queens Medical Centre, Nottingham, United Kingdom

专题命中 可控生成 :diffusion(abstract)

AI总结 PRISM通过模拟基于编码器-解码器结构,在大规模模型家族中推断联合后验,同时通过可调模型先验实现测试时间复杂度控制,适用于符号回归和生物物理建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15152 2026-03-17 cs.RO 50%

Master Micro Residual Correction with Adaptive Tactile Fusion and Force-Mixed Control for Contact-Rich Manipulation

通过自适应触觉融合和力混合控制实现接触密集操作的主微残差校正

Xingting Li, Yifan Xie, Han Liu, Wei Hou, Guangyu Chen, Shoujie Li, Wenbo Ding

机构 * Shenzhen Ubiquitous Data Enabling Key Lab, Shenzhen International Graduate School, Tsinghua University, Shenzhen 518055, China(深圳智能数据赋能重点实验室,深圳国际研究生院,清华大学,深圳518055,中国) School of Electronics and Communication Engineering, Sun Yat-sen University, Shenzhen 518107, China(电子与通信工程学院,中山大学,深圳518107,中国) School of Mechanical and Aerospace Engineering, Nanyang Technological University, Singapore 639956, Singapore(机械与航空航天工程学院,南洋理工大学,新加坡639956,新加坡)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出M2-ResiPolicy,结合高阶动作指导与低阶校正,通过触觉强度驱动的自适应融合机制和力混合PBIC执行层,提升接触密集操作的精度与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14277 2026-03-17 math.OC 50%

Second order necessary conditions for quantum stochastic optimal control problems

二阶必要条件用于量子随机最优控制问题

Penghui Wang, Shan Wang

专题命中 可控生成 :diffusion(abstract)

AI总结 本文通过变分方法建立量子随机系统的最优控制二阶必要条件,研究了受费米布朗运动驱动的量子随机微分方程中的控制问题,为量子随机控制的优化研究提供理论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11920 2026-03-17 cs.RO 50%

H2R: A Human-to-Robot Data Augmentation for Robot Pre-training from Videos

H2R: 一种从视频中为机器人预训练的人到机器人的数据增强

Guangrun Li, Yaoxu Lyu, Zhuoyang Liu, Chengkai Hou, Jieyu Zhang, Shanghang Zhang

专题命中 可控生成 :inpainting(abstract)

AI总结 H2R通过将人类视角视频转换为机器人视角数据,弥合人机视觉差距,提升机器人预训练效果,实验显示在模拟和现实场景中均显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12511 2026-03-17 cs.LG 50%

Trust Region Constrained Measure Transport in Path Space for Stochastic Optimal Control and Inference

路径空间中的信任区域约束度量传输用于随机最优控制与推断

Denis Blessing, Julius Berner, Lorenz Richter, Carles Domingo-Enrich, Yuanqi Du, Arash Vahdat, Gerhard Neumann

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出基于信任区域约束的路径空间度量传输方法,通过系统性逐步逼近目标测度,提升随机最优控制与推断的性能,应用于扩散采样、过渡路径采样和扩散模型微调等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏