arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-10 至 2026-07-10 共收录 4 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4 篇

2607.08741 2026-07-10 cs.GR cs.CV cs.LG cs.RO 新提交 76%

ARDY: Autoregressive Diffusion with Hybrid Representation for Interactive Human Motion Generation

ARDY:用于交互式人体运动生成的具有混合表示的自回归扩散

Kaifeng Zhao, Mathis Petrovich, Haotian Zhang, Tingwu Wang, Siyu Tang, Davis Rempe

机构 * NVIDIA(英伟达) ETH Zürich(苏黎世联邦理工学院)

专题命中 可控生成 :diffusion(title);分类 cs.CV、cs.GR

AI总结 研究旨在解决交互式应用中人体运动生成问题,提出ARDY框架,采用混合表示和两阶段自回归变压器去噪器,能通过在线文本提示和运动学约束实现高保真运动生成,经评估验证了有效性和实用性。

Comments ACM Transactions on Graphics (SIGGRAPH 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27071 2026-07-10 cs.CV 新提交 57%

PanoImager: Geometry-Guided Novel View Synthesis and Reconstruction from Sparse Panoramic Views

PanoImager:基于几何引导的稀疏全景视图新视角合成与重建

Zhisong Xu, Takeshi Oishi

机构 * Institute of Industrial Science, The University of Tokyo(东京大学生产技术研究所)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出PanoImager框架,无需SfM,结合前馈位姿/深度先验、几何条件扩散视图补全和深度引导3DGS优化,从稀疏全景图像实现稳定新视角合成与重建。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14236 2026-07-10 cs.CV 版本更新 57%

Elastic3D: Controllable Stereo Video Conversion with Guided Latent Decoding

Elastic3D:基于引导潜解码的可控立体视频转换

Nando Metzger, Prune Truong, Goutam Bhat, Konrad Schindler, Federico Tombari

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 针对沉浸式3D内容需求,提出Elastic3D方法,基于(条件)潜扩散,用引导VAE解码器确保高质量立体视频输出,能让用户在推理时控制立体效果强度,实验表明其优于传统及现有基线。

Comments Project page: elastic3d.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07896 2026-07-10 math.OC 新提交 50%

On the Approximation of Optimal Control in Regime-Switching Diffusions

关于状态切换扩散中最优控制的逼近

Somnath Pradhan, Dinesh Rathia

专题命中 可控生成 :diffusion(abstract)

AI总结 研究状态切换扩散中最优控制策略的逼近与简化问题,利用方程正则性、策略密度结果等,构建Euler - Maruyama逼近和有限状态逼近,证明相关收敛性,为该类控制问题提供系统逼近框架及数值实现依据。

详情

展开后加载摘要…

URL PDF HTML 收藏