arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11876
2603.26167 2026-04-09 cs.CV cs.CR

Gaussian Shannon: High-Precision Diffusion Model Watermarking Based on Communication

高斯香农:基于通信的高精度扩散模型水印技术

Yi Zhang, Hongbo Huang, Liang-Jie Zhang

AI总结 本文提出Gaussian Shannon水印框架,通过将扩散过程视为噪声通信信道,实现鲁棒追踪和精确位恢复,适用于无损元数据应用。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20284 2026-04-09 cs.CV cs.GR eess.IV

STAC: Plug-and-Play Spatio-Temporal Aware Cache Compression for Streaming 3D Reconstruction

STAC:用于流式3D重建的时空感知缓存压缩

Runze Wang, Yuxuan Song, Youcheng Cai, Ligang Liu

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出STAC框架,通过时空感知缓存机制提升流式3D重建的内存效率和重建质量,减少内存消耗并加速推理。

Comments 10 pages, 6 figures. Accepted by CVPR 2026. This version includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07527 2026-04-09 cs.CV cs.GR

From Orbit to Ground: Generative City Photogrammetry from Extreme Off-Nadir Satellite Images

从轨道到地面:从极端俯仰角卫星图像生成城市光束摄影测量

Fei Yu, Yu Liu, Luyang Tang, Mingchao Sun, Zengye Ge, Rui Bu, Yuchao Jin, Haisen Zhao, He Sun, Yangyan Li, Mu Xu, Wenzheng Chen, Baoquan Chen

机构 * Peking University(北京大学) AMAP(高德地图) Ant Group(蚂蚁集团) Shandong University(山东大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 本文提出两种设计选择,通过2.5D高度图和可微渲染技术,解决从稀疏轨道图像合成地面视图的挑战,实现大规模城市重建。

Comments Accepted by CVPR 2026 Findings. Project page: https://pku-vcl-geometry.github.io/Orbit2Ground/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22396 2026-04-09 cs.CV cs.AI

Asking like Socrates: Socrates helps VLMs understand remote sensing images

像苏格拉底提问:苏格拉底帮助VLMs理解遥感图像

Run Shao, Ziyu Li, Zhaoyang Zhang, Linrui Xu, Xinran He, Hongyuan Yuan, Bolei He, Yongxing Dai, Yiming Yan, Yijun Chen, Wang Guo, Haifeng Li

机构 * School of Geosciences and Info-Physics, Central South University(中南大学地球科学与信息物理学院) Baidu Inc.(百度公司) School of Earth Sciences, Zhejiang University(浙江大学地球科学学院)

AI总结 本文提出RS-EoT方法,通过迭代视觉证据寻求机制和两阶段强化学习策略,解决遥感图像中伪推理问题,提升视觉证据基础的推理能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15510 2026-04-09 cs.CV cs.RO

Exploring Conditions for Diffusion models in Robotic Control

探索扩散模型在机器人控制中的条件

Heeseong Shin, Byeongho Heo, Dongyoon Han, Seungryong Kim, Taekyung Kim

机构 * KAIST AI(韩国科学技术院人工智能学院) NAVER AI Lab(NAVER人工智能实验室)

AI总结 本文研究利用预训练文本到图像扩散模型获取任务适应的视觉表示,提出ORCA方法以动态视觉信息提升机器人控制性能。

Comments Accepted to CVPR 2026. Project page: https://orca-rc.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04880 2026-04-09 cs.CV eess.IV

MozzaVID: Mozzarella Volumetric Image Dataset

MozzaVID:莫扎瑞拉奶酪体积分类数据集

Pawel Tomasz Pieta, Peter Winkel Rasmussen, Anders Bjorholm Dahl, Jeppe Revall Frisvad, Siavash Arjomand Bigdeli, Carsten Gundlach, Anders Nymark Christensen

机构 * Technical University of Denmark(丹麦技术大学)

AI总结 本文提出MozzaVID数据集,用于体积分类任务,包含25种奶酪类型和149个样本,提供三种分辨率的数据,旨在促进体积分类算法的发展和食品结构研究。

Comments Accepted at MetaFood (CVPR 2026 Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16240 2026-04-09 cs.LG

AFL: A Single-Round Analytic Approach for Federated Learning with Pre-trained Models

AFL:基于预训练模型的联邦学习单轮分析方法

Run He, Kai Tong, Di Fang, Han Sun, Ziqian Zeng, Haoran Li, Tianyi Chen, Huiping Zhuang

机构 * South China University of Technology(华南理工大学) Tsinghua University(清华大学) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心) The Hong Kong University of Science and Technology(香港科技大学) Microsoft(微软)

AI总结 本文提出AFL,一种利用分析解的联邦学习方法,通过单轮训练和绝对聚合法则,减少通信开销并提升收敛速度,具有数据分区不变性。

Comments Published in CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07306 2026-04-09 cs.CV cs.LG

Beyond Loss Values: Robust Dynamic Pruning via Loss Trajectory Alignment

超越损失值:通过损失轨迹对齐实现鲁棒动态剪枝

Huaiyuan Qin, Muli Yang, Gabriel James Goenawan, Kai Wang, Zheng Wang, Peng Hu, Xi Peng, Hongyuan Zhu

机构 * National University of Singapore(新加坡国立大学) Wuhan University(武汉大学) Sichuan University(四川大学)

AI总结 本文提出AlignPrune模块,通过动态对齐得分改进动态剪枝在标签噪声下的鲁棒性,实验表明其在多个基准上提升精度达6.3%。

Comments Published in CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07220 2026-04-09 cs.IR

HIVE: Query, Hypothesize, Verify An LLM Framework for Multimodal Reasoning-Intensive Retrieval

HIVE:一种用于多模态推理密集检索的LLM框架

Mahmoud Abdalla, Mahmoud SalahEldin Kasem, Mohamed Mahmoud, Mostafa Farouk Senussi, Abdelrahman Abdallah, Hyun-Soo Kang

AI总结 HIVE通过引入LLM进行显式视觉-文本推理,提升多模态检索效果,达到41.7的nDCG@10,优于现有文本和多模态模型。

Comments accepted at CVPR 2026 Workshop GRAIL-V

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07201 2026-04-09 cs.IR cs.CV

BRIDGE: Multimodal-to-Text Retrieval via Reinforcement-Learned Query Alignment

BRIDGE:通过强化学习查询对齐实现多模态到文本检索

Mohamed Darwish Mounis, Mohamed Mahmoud, Shaimaa Sedek, Mahmoud Abdalla, Mahmoud SalahEldin Kasem, Abdelrahman Abdallah, Hyun-Soo Kang

机构 * High institute for computer & information systems(高等计算机与信息系统学院) Chungbuk National University(忠北大学) Assiut University(艾斯尤特大学) University of Innsbruck(因斯布鲁克大学)

AI总结 BRIDGE通过强化学习查询对齐模型和增强神经搜索检索器,解决多模态查询在文本库中的检索问题,实现优于多模态编码器的nDCG@10性能。

Comments Accepted at CVPR 2026 Workshop GRAIL-V

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07198 2026-04-09 cs.LG cs.ET

Beyond the Mean: Modelling Annotation Distributions in Continuous Affect Prediction

超越均值:在连续情感预测中建模注释分布

Kosmas Pinitas, Ilias Maglogiannis

AI总结 本文提出了一种基于Beta分布的框架,用于建模注释共识,以捕捉情感感知的中心趋势、变异性、不对称性和不确定性。

Comments This paper has been accepted at the CVPR 2026 Workshop on Affective Behavior Analysis in-the-wild (ABAW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07193 2026-04-09 cs.CL cs.ET

LaScA: Language-Conditioned Scalable Modelling of Affective Dynamics

LaScA:语言条件下的可扩展情感动态建模

Kosmas Pinitas, Ilias Maglogiannis

机构 * University of Piraeus(比雷埃夫斯大学)

AI总结 本文提出LaScA框架,利用语言模型作为语义上下文条件器,结合手工制作的情感描述符建模情感变化,通过可解释的面部和声音特征提升预测准确性。

Comments This paper has been accepted at the CVPR 2026 Workshop on Affective Behavior Analysis in-the-wild (ABAW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07166 2026-04-09 cs.CV cs.HC cs.LG

DINO-QPM: Adapting Visual Foundation Models for Globally Interpretable Image Classification

DINO-QPM:为全球可解释的图像分类适应视觉基础模型

Robert Zimmermann, Thomas Norrenbrock, Bodo Rosenhahn

机构 * Institute for Information Processing, L3S - Leibniz University Hannover(信息处理研究所,L3S - 莱布尼茨汉诺威大学)

AI总结 DINO-QPM通过将复杂特征转换为可解释的对比表示,提升图像分类的可解释性,同时在准确性和解释质量上优于DINOv2线性探针。

Comments Accepted to the 5th Explainable AI for Computer Vision (XAI4CV) Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07132 2026-04-09 cs.CV cs.AI cs.LG

CSA-Graphs: A Privacy-Preserving Structural Dataset for Child Sexual Abuse Research

CSA-Graphs: 一种保护隐私的结构数据集用于儿童性虐待研究

Carlos Caetano, Camila Laranjeira, Clara Ernesto, Artur Barros, João Macedo, Leo S. F. Ribeiro, Jefersson A. dos Santos, Sandra Avila

机构 * Universidade Estadual de Campinas (UNICAMP)(坎皮纳斯州立大学) Instituto Federal de Educação, Ciência e Tecnologia de Minas Gerais (IFMG)(米纳斯吉拉斯联邦教育、科学和技术研究所) Universidade de São Paulo (USP)(圣保罗大学) Universidade Federal de Minas Gerais (UFMG)(米纳斯吉拉斯联邦大学) Polícia Federal (PF)(联邦警察) University of Sheffield(谢菲尔德大学)

AI总结 本文提出CSA-Graphs数据集,通过结构化表示替代原始图像,保留上下文信息以实现儿童性虐待图像分类,同时遵守法律和伦理限制。

Comments Conference on Computer Vision and Pattern Recognition (CVPR 2026), in the Workshop on Computer Vision for Children (CV4CHL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02945 2026-04-09 cs.CL

ACE-Merging: Data-Free Model Merging with Adaptive Covariance Estimation

ACE-Merging:无数据模型融合与自适应协方差估计

Bo Xu, Haotian Wu, Hehai Lin, Weiquan Huang, Beier Zhu, Yao Shu, Chengwei Qin

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出ACE-Merging方法,通过自适应协方差估计实现无数据模型融合,解决专家模型间干扰问题,实验表明其在视觉和语言基准上优于现有方法。

Comments Accepted to CVPR 2026 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01558 2026-04-09 cs.CV

TopoMaskV3: 3D Mask Head with Dense Offset and Height Predictions for Road Topology Understanding

TopoMaskV3:用于道路拓扑理解的3D掩码头:具有密集偏移和高度预测

Muhammet Esat Kalfaoglu, Halil Ibrahim Ozturk, Ozsel Kilinc, Alptekin Temizel

机构 * Graduate School of Informatics, Middle East Technical University(中东技术大学信息学研究生院) Togg/Trutek AI Team(Togg/Trutek 人工智能团队)

AI总结 TopoMaskV3通过引入密集偏移场和高度图,实现了3D道路拓扑理解的稳健预测,同时解决了地理数据泄露问题,取得了新的性能突破。

Comments Accepted to CVPR 2026 Workshops (AUTOPILOT 2026): 3rd Workshop on Autonomous Understanding Through Open-world Perception and Integrated Language Models for On-road Tasks

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21105 2026-04-09 cs.CV

BrepGaussian: CAD reconstruction from Multi-View Images with Gaussian Splatting

BrepGaussian:从多视角图像中通过高斯点划进行CAD重建

Jiaxing Yu, Dongyang Ren, Hangyu Xu, Zhouyuxiao Yang, Yuanqi Li, Jie Guo, Zhengkang Zhou, Yanwen Guo

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) Nanjing Urban Construction Tunnel& Bridge Intelligent Management Co., Ltd.(南京城建隧道桥梁智能管理有限公司)

AI总结 本文提出BrepGaussian框架,通过学习2D图像中的3D参数化表示,实现从多视角图像中重建CAD模型,其核心方法是结合可学习特征的高斯点划渲染器和特定拟合策略,有效分离了几何重建与特征学习。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15599 2026-04-09 cs.CV

FlexAvatar: Learning Complete 3D Head Avatars with Partial Supervision

FlexAvatar:通过部分监督学习完整的3D头像

Tobias Kirschstein, Simon Giebenhain, Matthias Nießner

机构 * Technical University of Munich(慕尼黑工业大学)

AI总结 FlexAvatar通过结合单目和多视角数据,解决单目数据不足和多视角数据获取困难的问题,实现高质量的3D头像生成。

Comments Accepted to CVPR 2026, Project website: https://tobias-kirschstein.github.io/flexavatar/ , Video: https://youtu.be/g8wxqYBlRGY

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06581 2026-04-09 cs.CV

MedGRPO: Multi-Task Reinforcement Learning for Heterogeneous Medical Video Understanding

MedGRPO:异构医学视频理解的多任务强化学习

Yuhao Su, Anwesa Choudhuri, Zhongpai Gao, Benjamin Planche, Van Nguyen Nguyen, Meng Zheng, Yuhan Shen, Arun Innanje, Terrence Chen, Ehsan Elhamifar, Ziyan Wu

机构 * Northeastern University(东北大学) United Imaging Intelligence(联影智能)

AI总结 本文提出MedGRPO框架,通过跨数据集奖励归一化和医学LLM评判器提升医学视频理解的训练效果,建立基础基准和训练方法。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06129 2026-04-08 cs.CV cs.AI

PoM: A Linear-Time Replacement for Attention with the Polynomial Mixer

PoM:一种线性时间的注意力替代方案:多项式混合器

David Picard, Nicolas Dufour, Lucas Degeorge, Arijit Ghosh, Davide Allegro, Tom Ravaud, Yohann Perron, Corentin Sautier, Zeynep Sonat Baltaci, Fei Meng, Syrine Kalleli, Marta López-Rauhut, Thibaut Loiseau, Ségolène Albouy, Raphael Baena, Elliot Vincent, Loic Landrieu

机构 * LIGM, CNRS, Univ Gustave Eiffel, ENPC, Institut Polytechnique de Paris(LIGM,法国国家科学研究中心,古斯塔夫·埃菲尔大学,巴黎高科路桥学院,巴黎综合理工学院) LIX, École Polytechnique, CNRS, IP Paris(LIX,巴黎综合理工学院,法国国家科学研究中心,巴黎综合理工学院) Department of Information Engineering, Università degli Studi di Padova(帕多瓦大学信息工程系) AMIAD, Pole recherche, EFEO(AMIAD,法国远东学院研究部) LASTIG, Univ Gustave Eiffel, IGN, Géodata Paris(LASTIG,古斯塔夫·埃菲尔大学,法国国家地理与森林信息研究所,巴黎地理数据)

AI总结 本文提出PoM,一种线性复杂度的替代注意力机制,通过学习多项式函数聚合输入令牌,实现高效序列处理,减少长序列计算成本。

Comments Accepted to CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06099 2026-04-08 cs.CV

Extending ZACH-ViT to Robust Medical Imaging: Corruption and Adversarial Stress Testing in Low-Data Regimes

扩展ZACH-ViT以实现鲁棒医学影像:在低数据环境下对损坏和对抗性压力测试

Athanasios Angelakis, Marta Gomez-Barrero

机构 * BioML Lab, RI CODE, UniBw, Munich, Germany(慕尼黑联邦国防军大学,RI CODE,BioML实验室,德国慕尼黑) AUMC, Amsterdam, Netherlands(阿姆斯特丹大学医学中心,荷兰阿姆斯特丹)

AI总结 本文扩展ZACH-ViT,评估其在低数据环境下对常见图像损坏和对抗扰动的鲁棒性,发现其在清洁数据和常见损坏下表现优异,在对抗性压力下仍保持竞争力,但对抗鲁棒性仍是挑战。

Comments Accepted at CVPR 2026 Workshop (PHAROS-AIF-MIH)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22844 2026-04-08 cs.AI

PhySe-RPO: Physics and Semantics Guided Relative Policy Optimization for Diffusion-Based Surgical Smoke Removal

PhySe-RPO:物理与语义引导的相对策略优化用于基于扩散的手术烟雾去除

Zining Fang, Cheng Xue, Chunhui Liu, Bin Xu, Ming Chen, Xiaowei Hu

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) School of Future Technology, South China University of Technology(华南理工大学未来技术学院)

AI总结 本文提出PhySe-RPO框架,通过物理和语义引导的相对策略优化,解决手术烟雾去除中配对监督不足的问题,实现物理一致、语义忠实且临床可解释的扩散修复。

Comments 12 pages,7figures,published to CVPR

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00503 2026-04-08 cs.CV

Diff4Splat: Controllable 4D Scene Generation with Latent Dynamic Reconstruction Models

Diff4Splat:基于潜在动态重建模型的可控4D场景生成

Panwang Pan, Chenguo Lin, Jingjing Zhao, Chenxin Li, Yuchen Lin, Haopeng Li, Honglei Yan, Kairun Wen, Yunlong Lin, Yixuan Yuan, Yadong Mu

机构 * Peking University(北京大学) Xiamen University(厦门大学) CUHK(香港中文大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 Diff4Splat通过单张图像和相机轨迹生成可控的4D场景,结合视频扩散模型的生成先验与大规模4D数据集学习的几何和运动约束,在单次前向传递中直接预测可变形3D高斯场,无需测试时优化。

Comments Accepted to CVPR 2026. Project page: https://paulpanwang.github.io/Diff4Splat

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18601 2026-04-08 cs.GR cs.AI cs.CV cs.LG

BulletGen: Improving 4D Reconstruction with Bullet-Time Generation

BulletGen: 通过子弹时间生成提升4D重建

Denis Rozumny, Jonathon Luiten, Numair Khan, Johannes Schönberger, Peter Kontschieder

机构 * Meta Reality Labs(Meta 现实实验室)

AI总结 BulletGen利用生成模型在Gaussian动态场景表示中校正错误并补全缺失信息,通过对扩散视频生成模型输出与4D重建在单个冻结子弹时间步骤的对齐,实现新颖视角合成和2D/3D跟踪任务的最先进结果。

Comments Accepted at CVPR 2026 Workshop "4D World Models: Bridging Generation and Reconstruction"

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05780 2026-04-08 cs.CV

Sparsity-Aware Voxel Attention and Foreground Modulation for 3D Semantic Scene Completion

稀疏感知体素注意力与前景调节用于3D语义场景补全

Yu Xue, Longjun Gao, Yuanqi Su, HaoAng Lu, Xiaoning Zhang

AI总结 本文提出VoxSAMNet,通过稀疏感知和语义引导设计,解决单目语义场景补全中体素分布不平衡和泛化能力差的问题,实现更高效准确的3D场景补全。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05748 2026-04-08 cs.CV

SVC 2026: the Second Multimodal Deception Detection Challenge and the First Domain Generalized Remote Physiological Measurement Challenge

SVC 2026: 第二届多模态欺骗检测挑战赛及首个领域通用远程生理测量挑战

Dongliang Zhu, Zhiyi Niu, Bo Zhao, Jiajian Huang, Shuo Ye, Xun Lin, Hui Ma, Taorui Wang, Jiayu Zhang, Chunmei Zhu, Junzhe Cao, Yingjie Ma, Rencheng Song, Albert Clapés, Sergio Escalera, Dan Guo, Zitong Yu

机构 * Wuhan University(武汉大学) Great Bay University(大湾区大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Sun Yat-sen University(中山大学) Hefei University of Technology(合肥工业大学) University of Barcelona(巴塞罗那大学)

AI总结 本文提出SVC 2026挑战赛,旨在通过多模态欺骗检测和远程脉搏波测速估计任务,推动对细微视觉信号的鲁棒表示学习研究。

Comments Accepted by the SVC workshop @ CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05730 2026-04-08 cs.LG

Controllable Image Generation with Composed Parallel Token Prediction

通过组合并行令牌预测实现可控图像生成

Jamie Stirling, Noura Al-Moubayed, Chris G. Willcocks, Hubert P. H. Shum

机构 * Durham University(杜伦大学)

AI总结 本文提出一种理论指导的离散生成过程组合方法,通过掩码生成(吸收扩散)实现多输入条件的精确组合,相比现有方法在误差率和FID上均有显著提升,并实现高效的文本到图像生成控制。

Comments 8 pages + references, 7 figures, accepted to CVPR Workshops 2026 (LoViF). arXiv admin note: substantial text overlap with arXiv:2405.06535

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05724 2026-04-08 cs.CV

Beyond Semantics: Disentangling Information Scope in Sparse Autoencoders for CLIP

超越语义:在稀疏自编码器中解构信息范围以用于CLIP

Yusung Ro, Jaehyun Choi, Junmo Kim

机构 * KAIST(韩国科学技术院) Korea AI Safety Institute, ETRI(韩国电子通信研究院人工智能安全研究所)

AI总结 本文提出信息范围作为理解CLIP表示的新维度,通过Contextual Dependency Score量化稀疏自编码器特征的广度,揭示不同信息范围特征对CLIP预测和置信度的影响差异。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05721 2026-04-08 cs.CV

GaussianGrow: Geometry-aware Gaussian Growing from 3D Point Clouds with Text Guidance

GaussianGrow:基于3D点云与文本引导的几何感知Gaussian生成

Weiqi Zhang, Junsheng Zhou, Haotian Geng, Kanle Shi, Shenkun Xu, Yi Fang, Yu-Shen Liu

机构 * School of Software, Tsinghua University(清华大学软件学院) Kuaishou Technology(快手科技) CAIR and CIDSAI, NYU Abu Dhabi(纽约大学阿布扎比分校CAIR和CIDSAI)

AI总结 本文提出GaussianGrow,通过学习从3D点云中生长Gaussian,结合多视角扩散模型和文本引导,提升生成几何精度与质量。

Comments Accepted by CVPR 2026. Project page: https://weiqi-zhang.github.io/GaussianGrow

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05715 2026-04-08 cs.CV

In Depth We Trust: Reliable Monocular Depth Supervision for Gaussian Splatting

深入信赖:为高斯散射可靠的单目深度监督

Wenhui Xiao, Ethan Goan, Rodrigo Santa Cruz, David Ahmedt-Aristizabal, Olivier Salvado, Clinton Fookes, Leo Lebrat

机构 * Queensland University of Technology(昆士兰科技大学)

AI总结 本文提出一种整合模糊和噪声深度先验的训练框架,以提升高斯散射的几何监督,从而提高渲染质量。

Comments accepted to CVPR 3DMV Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏