arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4210 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4210 篇

2511.06644 2026-06-09 cs.CV 版本更新 57%

UniADC: A Unified Framework for Anomaly Detection and Classification

UniADC:统一异常检测与分类框架

Ximiao Zhang, Min Xu, Zheng Zhang, Yap-Peng Tan, Xiuzhuang Zhou

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) China University of Mining(中国矿业大学) VinUniversity(文理大学)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 提出UniADC模型,通过无训练可控修复网络和隐式正态判别器,同时实现异常区域检测与类别识别,在少样本甚至零样本下超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03256 2026-06-09 cs.CV 版本更新 57%

Muses: Designing, Composing, Generating Nonexistent Fantasy 3D Creatures without Training

Muses: 无需训练的设计、组合与生成不存在的幻想3D生物

Hexiao Lu, Xiaokun Sun, Zeyu Cai, Hao Guo, Ying Tai, Jian Yang, Zhenyu Zhang

机构 * Nanjing University(南京大学) China Agricultural University(中国农业大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 提出Muses,首个无需训练的馈送式幻想3D生物生成方法,利用3D骨架实现结构感知的设计、组合与生成,在视觉保真度和文本对齐方面达到最优。

Comments Project page: https://luhexiao.github.io/Muses.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07244 2026-06-08 cs.RO cs.AI cs.CV 新提交 57%

Beyond Waypoints: A Trajectory-Centric Waypointing Paradigm for Vision-Language Navigation

超越航点:面向视觉语言导航的轨迹中心航点范式

Haoxiang Shi, Xiang Deng, Haoyu Zhang, Qiaohui Chu, Yaowei Wang, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Pengcheng Laboratory(鹏城实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出轨迹航点范式,通过TSDF引导的扩散策略预测可执行轨迹,解决VLN-CE中航点不可达与规划控制不一致问题,在基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07117 2026-06-08 cs.CV cs.AI 新提交 57%

Native3D: End-to-End 3D Scene Generation via Unified Mesh-Texture Modeling and Semantic Alignment

Native3D: 通过统一网格纹理建模与语义对齐的端到端3D场景生成

Yibo Liu, Ziwei Zhang, Haozhou Pang, Menghao Li, Lanshan He, Gan Qi

机构 * Kuaishou GameMind Lab(快手游戏大脑实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出Native3D,首个完全绕过2D中间表示的端到端3D场景生成框架,通过统一网格纹理联合表示和3D表示对齐损失,解决几何结构失真和纹理细节退化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06901 2026-06-08 cs.CV 新提交 57%

LUCID: Learning Unified Control for Image Deflaring and Exposure Mastery in Nighttime Photography

LUCID:夜间摄影中图像去眩光与曝光控制的统一学习

Tingyu Yang, Yuan Cheng, Xiaoyun Yuan

机构 * MoE Key Lab of Artificial Intelligence(人工智能混合专家实验室) AI Institute(人工智能研究所) School of Computer Science(计算机科学学院) School of Biomedical Engineering(生物医学工程学院) School of Artificial Intelligence(人工智能学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出LUCID统一框架,通过眩光解缠模块和扩散驱动模块联合处理夜间图像中的眩光和噪声,并引入四模式训练实现可控恢复,支持HDR重建,性能优于现有方法。

Comments Accepted by SIGGRAPH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06390 2026-06-05 cs.CV cs.AI 57%

HomeWorld: A Unified Floorplan-to-Furnished Framework for Generating Controllable, Densely Interactive Whole-Home Scenes

HomeWorld:一个统一的从平面图到家具的框架,用于生成可控、密集交互的全屋场景

Wenbo Li, Xiaoliang Ju, Zipeng Qin, Rongyao Fang, Hongsheng Li

机构 * Ace Robotics(Ace机器人公司) CUHK MMLab(香港大学多模态实验室) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 提出一个统一的分层框架,通过大规模真实平面图数据集训练大语言模型生成全屋平面图,结合图像生成模型和VLM优化器生成家具及小物体布局,并附加物理属性和纹理光照,实现可控、高真实感的全屋场景生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01935 2026-06-05 cs.CV 57%

Unified Driving Tokens: Representation- and Geometry-Guided Discrete Tokenizer for Driving World Models and Planning

统一驾驶令牌:面向驾驶世界模型和规划的表示与几何引导的离散分词器

Ziyang Yao, Zeyu Zhu, YunCheng Jiang, Zibin Guo, Huijing Zhao

机构 * Peking University(北京大学) Xiaomi EV(小米电动车)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 提出一种表示引导与几何增强的离散分词器,通过联合监督学习紧凑令牌,同时优化重建保真度、表示一致性和规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10055 2026-06-03 cs.CV 57%

Physical Plausibility Reasoning via HCM-GRPO: Empowering Compact Model for Superior Performance

通过 HCM-GRPO 实现物理合理性推理:赋能紧凑模型以获得卓越性能

Zhiyuan Hu, Zheng Sun, Yi Wei, Long Yu

机构 * Tsinghua University(清华大学) Alibaba Health Information Technology Limited(阿里巴巴健康信息技术有限公司)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 针对多模态大语言模型在物理合理性推理中数据缺乏和推理能力弱的问题,提出包含大规模数据集和 HCM-GRPO 方法的完整解决方案,以紧凑模型超越大规模开源和闭源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01608 2026-06-02 cs.CV 57%

Exploiting Semantic and Pixel Representations for Ultra-Low Bitrate Image Compression

利用语义和像素表示进行超低比特率图像压缩

Hao Wei, Yanhui Zhou, Chenyang Ge, Saeed Anwar, Ajmal Mian

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(人机混合增强智能国家重点实验室,人工智能与机器人研究院,西安交通大学) School of Information and Telecommunication, Xi’an Jiaotong University(信息与电信学院,西安交通大学) Department of Computer Science and Software Engineering, The University of Western Australia(计算机科学与软件工程系,西澳大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出SPRDiff扩散压缩方法,通过三重编码器架构和失真感知重建模块,在超低比特率下同时保持语义一致性和像素级保真度,实现率-失真-感知权衡最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00954 2026-06-02 cs.CV 57%

COLLAR: Cascaded Object-Level Latent Refinement for High-Fidelity Conditional Generation

COLLAR: 级联对象级潜在精化用于高保真条件生成

Xinlong Zhang, Jia Wei, Xiaoyu Zhang, Teng Zhou, Chengyu Lin, Yongchuan Tang

机构 * College of Computer Science, Zhejiang University(浙江大学计算机科学学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出COLLAR框架,通过视场扩展和级联对象级潜在精化,在扩散Transformer中实现无训练的高保真对象级控制,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25195 2026-06-02 cs.CV 57%

Baton: Explicit Semantic Blueprints for Joint Video-Audio Generation

Baton: 用于联合视频-音频生成的显式语义蓝图

Shuyuan Tu, Qi Tian, Zihan Yang, Yue Wu, Xintong Han, Weijie Kong, Jiangfeng Xiong, Jian-Wei Zhang, Zhao Zhong, Liefeng Bo, Zuxuan Wu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Tencent Hunyuan(腾讯幻元)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出Baton框架,通过VA-Planner生成语义对齐的模态感知规划令牌作为蓝图,注入扩散骨干以协调视频和音频去噪,解决现有方法因缺乏共享长期规划导致的跨模态对齐脆弱问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09877 2026-06-02 cs.CV cs.AI cs.RO 57%

Genie 4D: Semantic-Prior-Guided 4D Dynamic Scene Reconstruction

Genie 4D:语义先验引导的4D动态场景重建

Yiru Yang, Zhuojie Wu, Nishant Kumar Singh, Max Schulthess

机构 * University of Zurich(苏黎世大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出Genie 4D框架,结合实时视觉惯性高斯泼溅前端和前馈4D骨干网络,利用冻结的DINOv3特征作为结构先验抑制身份漂移,并通过条件扩散精炼器恢复高频细节,最终通过轻量级潜在动作头实现用户可控的4D世界模型重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09390 2026-06-02 cs.CV 57%

Training-Free Coverless Multi-Image Steganography with Access Control

免训练的无载体多图像隐写术与访问控制

Minyeol Bae, Si-Hyeon Lee

机构 * Department of Computer Science, Seoul National University(首尔国立大学计算机科学系)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出MIDAS框架,通过潜在级融合实现免训练的多图像隐写与用户特定访问控制,引入随机基机制抑制残差结构信息,并理论分析信息泄露。

Comments Accepted (Poster) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03938 2026-06-02 physics.optics cs.CV cs.NE physics.app-ph 57%

Super-resolution image projection over an extended depth of field using a diffractive decoder

使用衍射解码器实现扩展景深上的超分辨率图像投影

Hanlong Chen, Cagatay Isil, Tianyi Gan, Mona Jarrahi, Aydogan Ozcan

机构 * Electrical and Computer Engineering Department, University of California, Los Angeles, California 90095, USA(加州大学洛杉矶分校电子与计算机工程系) Bioengineering Department, University of California, Los Angeles, California 90095, USA(加州大学洛杉矶分校生物工程系) California NanoSystems Institute (CNSI), University of California, Los Angeles, California 90095, USA(加州大学洛杉矶分校加州纳米系统研究所)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

AI总结 提出一种混合图像投影系统,结合CNN编码器和全光学衍射解码器,实现扩展景深和像素超分辨率,提升空间带宽积。

Comments 18 Pages, 6 Figures

Journal ref Light: Science & Applications (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30750 2026-06-01 cs.CV 57%

SLAP: The Semantic Least Action Principle for Variational Video-Language Modeling

SLAP: 用于变分视频-语言建模的语义最小作用原理

Xiang Fang, Wanlong Fang

机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件学院) Nanyang Technological University, Singapore(新加坡南洋理工大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出语义最小作用原理(SLAP),将视频插值建模为黎曼流形上的边界值问题,通过离散欧拉-拉格朗日方程保持对象持久性,解决大视频语言模型中的时间间隙问题。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09632 2026-06-01 cs.CV cs.CL 57%

X-GS: An Extensible Framework for Perceiving and Thinking via 3D Gaussian Splatting

X-GS:基于3D高斯溅射的感知与思考可扩展框架

Yueen Ma, Zenglin Xu, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) Shanghai Academy of AI for Science(上海人工智能科学研究院)

专题命中 可控生成 :generative vision(abstract);分类 cs.CV

AI总结 提出X-GS框架,包含感知器和思考器,统一多种3DGS技术实现实时在线SLAM与语义蒸馏,并支持多模态模型完成下游任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06137 2026-06-01 cs.CV cs.AI cs.LG 57%

Autoregressive Visual Generation Needs a Prologue

自回归视觉生成需要一个序幕

Bowen Zheng, Weijian Luo, Guang Yang, Colin Zhang, Tianyang Hu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) hi-Lab, Xiaohongshu Inc(小红书实验室)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 提出Prologue方法,通过生成前置的序幕令牌来弥合自回归图像生成中的重建-生成差距,在不影响重建质量的前提下显著提升生成性能。

Comments Code: https://github.com/Zyriix/prologue Demo: https://huggingface.co/spaces/Zyriix/prologue-demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06022 2026-05-29 cs.CV 57%

CamC2V: Context-aware Controllable Video Generation

CamC2V: 上下文感知的可控视频生成

Luis Denninger, Sina Mokhtarzadeh Azar, Juergen Gall

机构 * University of Bonn(波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出CamC2V模型,通过集成多图像条件与3D约束及相机控制,实现上下文感知的连贯视频生成,在RealEstate10K数据集上FVD提升24.09%。

Comments Published at 3DV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21876 2026-05-29 cs.CV cs.AI 57%

EPiC: Efficient Video Camera Control Learning with Precise Anchor-Video Guidance

EPiC: 基于精确锚点视频引导的高效视频摄像机控制学习

Zun Wang, Jaemin Cho, Jialu Li, Han Lin, Jaehong Yoon, Yue Zhang, Mohit Bansal

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出EPiC框架,通过基于首帧可见性掩码构建精确对齐的锚点视频,并引入轻量模块Anchor-ControlNet,以极低参数实现高效、精确的3D摄像机控制,在RealEstate10K和MiraData上达到最先进性能。

Comments Accepted to ICML 2026. Project website: https://zunwang1.github.io/Epic

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28816 2026-05-28 cs.CV 57%

Gamma-World: Generative Multi-Agent World Modeling Beyond Two Players

Gamma-World: 超越双玩家的生成式多智能体世界建模

Fangfu Liu, Kai He, Tianchang Shen, Tianshi Cao, Sanja Fidler, Yueqi Duan, Jun Gao, Igor Gilitschenski, Zian Wang, Xuanchi Ren

机构 * NVIDIA Tsinghua University(清华大学) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出一种生成式多智能体世界模型,通过Simplex Rotary Agent Encoding实现智能体置换等价性,并采用Sparse Hub Attention降低跨智能体注意力成本,支持多玩家交互视频生成。

Comments Project Page: https://research.nvidia.com/labs/sil/projects/gamma-world

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27348 2026-05-28 cs.CV cs.AI 57%

When Eyes Betray AI: Social Gaze Consistency as a Semantic Cue for AI-Generated Image Detection

当眼睛背叛AI:社交注视一致性作为AI生成图像检测的语义线索

Jihyeon Kim, Sohee Kim, Soosan Lee, Souhwan Jung, James Matthew Rehg, Hyesong Choi

机构 * School of Computer Engineering(计算机工程学院) Hoseo University(Hoseo大学) School of Electronic Engineering(电子工程学院) Soongsil University(Soongsil大学) School of Computer Science(计算机科学学院) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出社交注视一致性作为高层语义线索,通过构建诊断数据集、块组合描述监督和跨架构验证,证明该线索能有效检测AI生成图像,并解释其跨生成器迁移的机制。

Comments 23 pages, 2 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23192 2026-05-28 cs.CV 57%

Occlusion-Aware Physics-Semantic Keyframe Selection for Robust Video Editing

遮挡感知的物理-语义关键帧选择用于鲁棒视频编辑

Lin Liu, Zhihan Xiao, Haohang Xu, Rong Cong, Zhibo Zhang, Xiaopeng Zhang, Qi Tian

机构 * Huawei(华为) Tsinghua University(清华大学) East China Normal University(华东师范大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出一种遮挡感知的物理-语义关键帧选择框架,通过从结构完整性、跟踪稳定性和属性可见性三个角度评估候选帧,自动选择最优锚定帧,并利用双向跟踪生成时空掩码,实现鲁棒且时序一致的视频编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06928 2026-05-28 cs.CV 57%

IAR2: Improving Autoregressive Visual Generation with Semantic-Detail Associated Token Prediction

IAR2:通过语义-细节关联令牌预测改进自回归视觉生成

Ran Yi, Teng Hu, Zihan Su, Jiangning Zhang, Lizhuang Ma

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 提出IAR2框架,通过语义-细节关联双码本和分层预测机制,实现从粗到细的图像生成,在ImageNet上取得FID 1.50的领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26944 2026-05-27 cs.RO cs.CV 57%

Object Pose and Shape Estimation for Grasping: Does it Work?

用于抓取的目标姿态与形状估计:有效吗?

Pavan Karke, Kushal Shah, Gaurav Singh, Md Faizal Karim, K Madhava Krishna, Rajat Talak

机构 * Robotics Research Center, IIIT Hyderabad(IIIT海得拉巴机器人研究中心) National University of Singapore(新加坡国立大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文通过对比端到端抓取合成方法与模块化方法(先估计目标姿态和形状再采样抓取),评估现有姿态和形状估计方法在抓取任务中的有效性。

Comments 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26316 2026-05-27 cs.CV cs.AI 57%

E$^3$C: Video Generation with 3D Environmental Memory and Ego-Exo Human Pose Control

E$^3$C: 具有3D环境记忆和自我-外部人体姿态控制的视频生成

Qiao Gu, Lingni Ma, Adam W Harley, Richard Newcombe, Florian Shkurti, Julian Straub

机构 * Meta Reality Labs(Meta现实实验室) University of Toronto(多伦多大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出E$^3$C可控视频扩散框架,通过3D点云记忆和双通道人体控制(自我与外骨骼),实现物理一致的自我中心视频生成。

Comments Preprint. Project Page: https://e3c-videogen.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.09344 2026-05-27 cs.CV cs.LG 57%

DreamSim: Learning New Dimensions of Human Visual Similarity using Synthetic Data

DreamSim: 使用合成数据学习人类视觉相似性的新维度

Stephanie Fu, Netanel Tamir, Shobhita Sundaram, Lucy Chai, Richard Zhang, Tali Dekel, Phillip Isola

机构 * MIT(麻省理工学院) Weizmann Institute of Science(魏茨曼科学研究所) Adobe Research(Adobe研究)

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出DreamSim指标,通过合成数据训练,在图像布局、对象姿态和语义内容等中高层面上对齐人类感知,并在检索和重建任务中优于现有指标。

Comments Website: https://dreamsim-nights.github.io/ Code: https://github.com/ssundaram21/dreamsim

Journal ref Advances in Neural Information Processing Systems 36 (NeurIPS 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26113 2026-05-26 cs.RO cs.CV 57%

AnyScene: Towards Highly Controllable Driving Scene Generation at Anywhere and Beyond

AnyScene: 迈向高度可控的任意位置驾驶场景生成及超越

Haiming Zhang, Junfei Zhou, Feng Jiang, Jingzhong Li, Zhenglong Guo, Penglin Dai, Jifeng Dai, Yan Xie, Benjin Zhu

机构 * Li Auto(利汽车) Southwest Jiaotong University(西南交通大学) Tsinghua University(清华大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出AnyScene框架,通过时空占用扩散Transformer和几何引导视图扩展模块,实现从BEV布局生成语义占用序列和参考无关的多视角驾驶视频,支持精确可控和长时生成。

Comments Work in progress. Project page: https://mind-omni.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25266 2026-05-26 cs.CV 57%

DeltaCam: Differential Intrinsic Camera Modeling for Video Generation

DeltaCam: 用于视频生成的差分内参相机建模

Debabrata Mandal, Zhihan Peng, Yujie Wang, Praneeth Chakravarthula

机构 * UNC, Chapel Hill USA(北卡罗来纳大学教堂山分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出DeltaCam视频扩散框架,通过差分参数化神经相机适配器学习相对变化,实现焦距、光圈、ISO等内参的平滑可控视频生成,并扩展到真实场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13597 2026-05-26 cs.CV 57%

Lighting in Motion: Spatiotemporal HDR Lighting Estimation

运动中的光照:时空高动态范围光照估计

Christophe Bolduc, Julien Philip, Li Ma, Mingming He, Paul Debevec, Jean-François Lalonde

机构 * Université Laval(拉瓦尔大学) Eyeline Labs(Eyeline实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出基于扩散的时空光照估计方法LiMo,通过生成不同曝光下的镜面与漫反射球体,结合深度与几何条件,实现高精度高频细节预测与照度估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12425 2026-05-26 cs.CV 57%

Boosting Monocular Metric Depth Estimation via Bokeh Rendering

通过散景渲染提升单目度量深度估计

Hangwei Zhang, Armando Fortes, Tianyi Wei, Xingang Pan

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) Beihang University(北航大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出BokehDepth两阶段框架,利用物理生成模型产生校准散景堆栈作为无监督几何信号,通过散景感知聚合模块提升单目深度估计的度量精度。

Comments Project Page: https://fogradio.github.io/BokehDepth_Project/

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏