arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-10 至 2026-04-10 共收录 7 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 7 篇

2604.07664 2026-04-10 cs.CV eess.IV 79%

Monocular Depth Estimation From the Perspective of Feature Restoration: A Diffusion Enhanced Depth Restoration Approach

单目深度估计:从特征修复的角度出发:一种扩散增强的深度修复方法

Huibin Bai, Shuai Li, Hanxiao Zhai, Yanbo Gao, Chong Lv, Yibo Wang, Haipeng Ping, Wei Hua, Xingyu Gao

机构 * School of Software, Shandong University(山东大学软件学院) Shandong University-WeiHai Research Institute of Industrial Technology(山东大学威海工业技术研究院) School of Control Science and Engineering, Shandong University(山东大学控制科学与工程学院) Shandong Institute of Information Technology Industry Development(山东省信息技术产业发展研究院) Research Institute of Interdisciplinary Innovation, Zhejiang Lab(之江实验室交叉创新研究院) Institute of Microelectronics, Chinese Academy of Sciences(中国科学院微电子研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 本文从特征修复角度提出扩散增强深度修复方法,通过改进编码器特征提升深度估计性能,在KITTI基准上取得显著提升。

Comments Accepted by IEEE TMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12623 2026-04-10 cs.CV cs.CL 57%

Reasoning Within the Mind: Dynamic Multimodal Interleaving in Latent Space

思维中的推理:潜在空间中的动态多模态交错

Chengzhi Liu, Yuzhe Yang, Yue Fan, Qingyue Wei, Sheng Liu, Xin Eric Wang

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) Stanford University(斯坦福大学) University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出DMLR框架,通过动态潜在策略梯度优化和视觉注入策略,在潜在空间中实现视觉与文本的动态交错推理,提升多模态推理性能并保持高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07966 2026-04-10 cs.CV 57%

Lighting-grounded Video Generation with Renderer-based Agent Reasoning

基于渲染的视频生成与基于代理的推理

Ziqi Cai, Taoyu Yang, Zheng Chang, Si Li, Han Jiang, Shuchen Weng, Boxin Shi

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) National Engineering Research Center of Visual Technology, School of Computer Science, Peking University(北京大学计算机学院国家视觉技术工程研究中心) Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) OpenBayes Information Technology Co., Ltd.(北京开贝信息技术有限公司) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出LiVER框架,通过显式3D场景属性条件生成可控视频,结合轻量条件模块和渐进训练策略,实现高保真和精确控制,适用于图像到视频和视频到视频的合成。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07900 2026-04-10 cs.CV cs.AI 57%

AnomalyAgent: Agentic Industrial Anomaly Synthesis via Tool-Augmented Reinforcement Learning

AnomalyAgent:通过工具增强强化学习进行代理工业异常合成

Jiaming Su, Tengchao Yang, Ruikang Zhang, Zhengan Yan, Haoyu Sun, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tongji University(同济大学) Fudan University(复旦大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出AnomalyAgent,通过工具增强强化学习生成高语义真实性的工业异常样本,采用闭环优化和两阶段训练框架,实现自我反思与迭代改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11633 2026-04-10 cs.CV 57%

MV-SAM3D: Adaptive Multi-View Fusion for Layout-Aware 3D Generation

MV-SAM3D:面向布局感知的多视图融合3D生成

Baicheng Li, Dong Wu, Jun Li, Shunkai Zhou, Zecui Zeng, Lusong Li, Hongbin Zha

机构 * Peking University(北京大学) JD Explore Academy(京东探索研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 MV-SAM3D通过多视图一致性与物理合理性提升3D生成质量,无需额外训练,实现更可信的布局生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17445 2026-04-10 cs.CV 57%

LangDriveCTRL: Natural Language Controllable Driving Scene Editing with Multi-modal Agents

LangDriveCTRL: 通过多模态代理实现自然语言可控的驾驶场景编辑

Yun He, Francesco Pittaluga, Ziyu Jiang, Matthias Zwicker, Manmohan Chandraker, Zaid Tasneem

机构 * University of Maryland, College Park(马里兰大学帕克分校) NEC Labs America(NEC美国实验室) UC San Diego(加州大学圣迭戈分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 LangDriveCTRL通过多模态代理实现驾驶视频的自然语言可控编辑,生成多样化的交通场景,提升真实感和交通场景的真实性。

Comments Project Page: https://yunhe24.github.io/langdrivectrl/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07409 2026-04-10 cs.LG eess.IV 50%

GAN-based Domain Adaptation for Image-aware Layout Generation in Advertising Poster Design

基于GAN的领域适应用于广告海报设计中的图像感知布局生成

Chenchen Xu, Min Zhou, Tiezheng Ge, Weiwei Xu

机构 * Anhui Normal University(安徽师范大学) Zhejiang University(浙江大学) Shenzhen Bay Laboratory(深圳湾实验室) Alibaba Group(阿里巴巴集团)

专题命中 可控生成 :inpainting(abstract)

AI总结 本文提出基于GAN的模型,利用图像生成广告海报布局,引入CGL数据集并设计PDA-GAN模型以提升图像感知布局生成效果。

Comments arXiv admin note: text overlap with arXiv:2303.14377

详情

展开后加载摘要…

URL PDF HTML 收藏