arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-26 至 2026-05-26 共收录 10 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 10 篇

2506.19117 2026-05-26 cs.CV 70%

PrITTI: Primitive-based Generation of Controllable and Editable 3D Semantic Urban Scenes

PrITTI: 基于基元的可控可编辑3D语义城市场景生成

Christina Ourania Tze, Daniel Dauner, Yiyi Liao, Dzmitry Tsishkou, Andreas Geiger

机构 * University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) Zhejiang University(浙江大学) Noah’s Ark Lab, Huawei(华为诺亚实验室) KE:SAI - Kyutai ELLIS Scalable Autonomous Intelligence(KE:SAI - 韩国ELLIS可扩展自主智能)

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 提出PrITTI,一种利用矢量化对象基元和栅格化地面表面的混合表示,通过潜在扩散模型实现高质量、可控且可编辑的3D语义城市场景生成。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26113 2026-05-26 cs.RO cs.CV 57%

AnyScene: Towards Highly Controllable Driving Scene Generation at Anywhere and Beyond

AnyScene: 迈向高度可控的任意位置驾驶场景生成及超越

Haiming Zhang, Junfei Zhou, Feng Jiang, Jingzhong Li, Zhenglong Guo, Penglin Dai, Jifeng Dai, Yan Xie, Benjin Zhu

机构 * Li Auto(利汽车) Southwest Jiaotong University(西南交通大学) Tsinghua University(清华大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出AnyScene框架,通过时空占用扩散Transformer和几何引导视图扩展模块,实现从BEV布局生成语义占用序列和参考无关的多视角驾驶视频,支持精确可控和长时生成。

Comments Work in progress. Project page: https://mind-omni.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25266 2026-05-26 cs.CV 57%

DeltaCam: Differential Intrinsic Camera Modeling for Video Generation

DeltaCam: 用于视频生成的差分内参相机建模

Debabrata Mandal, Zhihan Peng, Yujie Wang, Praneeth Chakravarthula

机构 * UNC, Chapel Hill USA(北卡罗来纳大学教堂山分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出DeltaCam视频扩散框架,通过差分参数化神经相机适配器学习相对变化,实现焦距、光圈、ISO等内参的平滑可控视频生成,并扩展到真实场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13597 2026-05-26 cs.CV 57%

Lighting in Motion: Spatiotemporal HDR Lighting Estimation

运动中的光照:时空高动态范围光照估计

Christophe Bolduc, Julien Philip, Li Ma, Mingming He, Paul Debevec, Jean-François Lalonde

机构 * Université Laval(拉瓦尔大学) Eyeline Labs(Eyeline实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出基于扩散的时空光照估计方法LiMo,通过生成不同曝光下的镜面与漫反射球体,结合深度与几何条件,实现高精度高频细节预测与照度估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12425 2026-05-26 cs.CV 57%

Boosting Monocular Metric Depth Estimation via Bokeh Rendering

通过散景渲染提升单目度量深度估计

Hangwei Zhang, Armando Fortes, Tianyi Wei, Xingang Pan

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) Beihang University(北航大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出BokehDepth两阶段框架,利用物理生成模型产生校准散景堆栈作为无监督几何信号,通过散景感知聚合模块提升单目深度估计的度量精度。

Comments Project Page: https://fogradio.github.io/BokehDepth_Project/

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25012 2026-05-26 cs.CV 57%

Learning from Semantic Dictionaries: Discriminative Codebook Contrastive Learning for Unified Visual Representation and Generation

从语义字典中学习:面向统一视觉表示与生成的判别式码本对比学习

Imanol G. Estepa, Jesús M Rodríguez-de-Vera, Bhalaji Nagarajan, Petia Radeva

机构 * Universitat de Barcelona(巴塞罗那大学) Barcelona Supercomputing Center (BSC)(巴塞罗那超级计算中心)

专题命中 可控生成 :generative vision(abstract);分类 cs.CV

AI总结 提出LEASE框架,通过配对生成-判别码本设计,在离散标记空间中联合优化掩码重建损失和码本对比损失,实现统一视觉表示与生成,在ImageNet-1K上达到最先进性能。

Comments Accepted at CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24074 2026-05-26 cs.CV cs.RO 57%

WideDepth: Millimeter-Accurate Benchmark for Fisheye Depth Estimation

WideDepth: 用于鱼眼深度估计的毫米级精度基准

Ilia Indyk, Ignat Penshin, Ivan Sosin, Maxim Monastyrny, Aleksei Valenkov, Ilya Makarov

机构 * Robotics Center(机器人中心) AXXX Trusted AI Research Center, RAS(可信人工智能研究中心,俄罗斯科学院)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 提出首个室内鱼眼深度估计数据集WideDepth,包含101个场景的5K高分辨率立体对和毫米级真值,并引入基于LiDAR的立体鱼眼图像生成方法,评估多种模型,微调后性能提升高达62%。

Comments Accepted to IEEE International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20583 2026-05-26 math.NA cs.NA 50%

Multilevel Isogeometric Projection Stabilization via Quasi-Interpolation for Advection-Dominated Problems

基于拟插值的多水平等几何投影稳定化方法用于对流主导问题

Zakaria El Hasnaoui, Ahmed Ratnani

专题命中 可控生成 :diffusion(abstract)

AI总结 针对对流主导的对流扩散问题,提出一种基于连续B样条拟插值的多水平投影稳定化方法,通过提取和惩罚细尺度波动,避免残差型方法的参数敏感性和局部投影稳定化的不连续辅助空间,理论推导先验误差估计并数值验证稳定性,显著减少非物理振荡。

Comments 28 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22414 2026-05-26 math.OC cs.NA math.NA 50%

Computational Control of Nonlinear Partial Differential Equations Using Machine Learning

使用机器学习对非线性偏微分方程进行计算控制

Maximilian Kurbanov, Minh-Nhat Phung, Minh-Binh Tran

专题命中 可控生成 :diffusion(abstract)

AI总结 提出WeightedPINN框架,通过算子分解和独立自适应时空权重,解决非线性偏微分方程中内部和双线性控制问题的数值重构,并给出收敛分析和数值实验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11534 2026-05-26 cs.LG cs.AI 50%

Krause Synchronization Transformers

Krause同步变换器

Jingkun Liu, Yisong Yue, Max Welling, Yue Song

机构 * Shanghai Qi Zhi Institute(上海启智研究院) College of AI, Tsinghua University(清华大学人工智能学院) Shanghai Jiao Tong University(上海交通大学) California Institute of Technology(加州理工学院) University of Amsterdam(阿姆斯特丹大学)

专题命中 可控生成 :image generation(abstract)

AI总结 提出基于有界置信共识动力学的Krause注意力机制,通过局部化稀疏交互替代全局softmax归一化,缓解表示坍缩和注意力汇聚现象,实现线性复杂度并提升性能。

Comments ICML 2026, Project page: https://jingkun-liu.github.io/krause-sync-transformers/

详情

展开后加载摘要…

URL PDF HTML 收藏