arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

共收录 4393 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 4393 篇

2511.19172 2026-04-14 cs.CV 57%

MetroGS: Efficient and Stable Reconstruction of Geometrically Accurate High-Fidelity Large-Scale Scenes

MetroGS: 高精度大规模场景高效稳定重建

Kehua Chen, Tianlu Mao, Xinzhu Ma, Hao Jiang, Zehao Li, Zihan Liu, Shuqin Gao, Honglong Zhao, Feng Dai, Yucheng Zhang, Zhaoqi Wang

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Beihang University(北京航空航天大学)

专题命中 三维重建 :Gaussian Splatting(abstract);分类 cs.CV

AI总结 本文提出MetroGS框架,通过分布式2D高斯点扩散表示和结构密集增强方案,结合单目与多视图优化策略,实现复杂城市环境中的高效高精度场景重建。

Comments Accepted by CVPR26; Project page: https://m3phist0.github.io/MetroGS

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10273 2026-04-14 cs.CV cs.LG 57%

How to Spin an Object: First, Get the Shape Right

如何旋转一个物体:首先,确保形状正确

Rishabh Kabra, Drew A. Hudson, Sjoerd van Steenkiste, Joao Carreira, Niloy J. Mitra

机构 * Google DeepMind(谷歌DeepMind) University College London(伦敦大学学院)

专题命中 三维重建 :point cloud(abstract);分类 cs.CV

AI总结 本文提出unPIC框架,通过多视图几何先验和外观解码器分析图像到3D流程,发现CROCS表示在几何预测和多视图一致性方面优于其他方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10789 2026-04-14 cs.CV 57%

ReplicateAnyScene: Zero-Shot Video-to-3D Composition via Textual-Visual-Spatial Alignment

ReplicateAnyScene:通过文本-视觉-空间对齐实现零样本视频到3D场景的合成

Mingyu Dong, Chong Xia, Mingyuan Jia, Weichen Lyu, Long Xu, Zheng Zhu, Yueqi Duan

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出ReplicateAnyScene框架,通过五阶段流水线实现视频到结构化3D场景的零样本合成,引入C3DR基准评估重建质量,实验表明其在生成高质量3D场景方面优于现有方法。

Comments Project Page: https://xiac20.github.io/ReplicateAnyScene/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07413 2026-04-14 cs.CV cs.AI cs.LG 57%

FORGE: Fine-grained Multimodal Evaluation for Manufacturing Scenarios

FORGE:面向制造场景的细粒度多模态评估

Xiangru Jian, Hao Xu, Wei Pang, Xinjian Zhao, Chengyu Tao, Qixin Zhang, Xikun Zhang, Chao Zhang, Guanzhi Deng, Alex Xue, Juan Du, Tianshu Yu, Garth Tarr, Linqi Song, Qiuzhuang Sun, Dacheng Tao

机构 * University of Waterloo(滑铁卢大学) University of Sydney(悉尼大学) Singapore Management University(新加坡管理大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Hunan University(湖南大学) Nanyang Technological University(南洋理工大学) Royal Melbourne Institute of Technology(皇家墨尔本理工大学) City University of Hong Kong(香港城市大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) City University of Hong Kong Shenzhen Research Institute(香港城市大学深圳研究院)

专题命中 三维重建 :point cloud(abstract);分类 cs.CV

AI总结 本文提出FORGE,构建高质量多模态数据集并评估18种先进MLLM在制造任务中的表现,揭示领域知识不足是主要瓶颈,展示结构化标注可提升模型精度。

Comments Project Page:https://ai4manufacturing.github.io/forge-web

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09211 2026-04-14 cs.CV 57%

Affostruction: 3D Affordance Grounding with Generative Reconstruction

构形:基于生成重建的3D构形定位

Chunghyun Park, Seunghyeon Lee, Minsu Cho

机构 * Pohang University of Science and Technology (POSTECH)(浦项科技大学) RLWRLD

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出Affostruction框架,通过生成式重建完整物体几何并基于全形体进行构形定位,优于现有方法,在构形定位和3D重建上取得显著成绩。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09886 2026-04-14 cs.CV cs.AI cs.LG cs.MM eess.IV 57%

Not Your Stereo-Typical Estimator: Combining Vision and Language for Volume Perception

非典型立体视觉估计器:结合视觉与语言进行体积感知

Gautham Vinod, Bruce Coburn, Siddeshwar Raghavan, Fengqing Zhu

机构 * Purdue University(普渡大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出融合立体视觉隐式3D线索与自然语言显式先验知识的方法,通过多模态表示提升体积估计精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09643 2026-04-14 cs.CV 57%

PA-SFM: Tracker-free differentiable acoustic radiation for freehand 3D photoacoustic imaging

PA-SFM:无需跟踪器的可微声辐射用于自由手3D光声成像

Shuang Li, Jian Gao, Chulhong Kim, Seongwook Choi, Qian Chen, Yibing Wang, Shuang Wu, Yu Zhang, Tingting Huang, Yucheng Zhou, Boxin Yao, Yao Yao, Changhui Li

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出PA-SFM,通过可微声辐射建模实现无需外部传感器的自由手3D光声成像,实现了高精度3D重建和低成本解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27222 2026-04-13 cs.CV 57%

HD-VGGT: High-Resolution Visual Geometry Transformer

HD-VGGT:高分辨率视觉几何变换器

Tianrun Chen, Yuanqi Hu, Yidong Han, Hanjie Xu, Deyi Ji, Qi Zhu, Chunan Yu, Xin Zhang, Cheng Chen, Chaotao Ding, Ying Zang, Xuanfu Li, Jin Ma, Lanyun Zhu

机构 * Zhejiang University(浙江大学) Huzhou University(湖州师范学院) Nanjing University of Science and Technology(南京理工大学) Huawei(华为) Tongji University(同济大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 HD-VGGT通过双分支架构实现高效稳定的高分辨率3D重建,利用低分辨率分支生成全局一致的几何结构,高分辨率分支通过学习的特征上采样模块细化细节,采用特征调制技术抑制不稳定特征,提升重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08042 2026-04-10 cs.CV cs.AI 57%

3DrawAgent: Teaching LLM to Draw in 3D with Early Contrastive Experience

3DrawAgent:通过早期对比经验教LLM进行3D绘制

Hongcan Xiao, Xinyue Xiao, Yilin Wang, Yue Zhang, Yonggang Qi

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Jiangnan University(江南大学) HaoHan Data(浩瀚数据)

专题命中 三维重建 :spatial understanding(abstract);分类 cs.CV

AI总结 3DrawAgent通过几何反馈利用大语言模型生成3D贝塞尔曲线,引入相对经验优化策略,无需参数更新提升3D空间理解与绘制质量,实现免训练的3D草图智能发展。

Comments CVPR 2026 Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07890 2026-04-10 cs.CV 57%

Sampling-Aware 3D Spatial Analysis in Multiplexed Imaging

多维成像中考虑采样几何的3D空间分析

Ido Harlev, Tamar Oukhanov, Raz Ben-Uri, Leeat Keren, Shai Bagon

机构 * Weizmann Institute of Science(魏茨曼科学研究所)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文研究采样几何对常用空间统计稳定性的影响,提出一种几何感知重建模块,通过连续切片实现稀疏但一致的3D分析,验证了在有限预算下稀疏3D重建的实用价值。

Comments Accepted to The 11th IEEE Workshop on Computer Vision for Multimodal Microscopy Image Analysis (CVMI), a CVPR 2026 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07664 2026-04-10 cs.CV eess.IV 57%

Monocular Depth Estimation From the Perspective of Feature Restoration: A Diffusion Enhanced Depth Restoration Approach

单目深度估计:从特征修复的角度出发:一种扩散增强的深度修复方法

Huibin Bai, Shuai Li, Hanxiao Zhai, Yanbo Gao, Chong Lv, Yibo Wang, Haipeng Ping, Wei Hua, Xingyu Gao

机构 * School of Software, Shandong University(山东大学软件学院) Shandong University-WeiHai Research Institute of Industrial Technology(山东大学威海工业技术研究院) School of Control Science and Engineering, Shandong University(山东大学控制科学与工程学院) Shandong Institute of Information Technology Industry Development(山东省信息技术产业发展研究院) Research Institute of Interdisciplinary Innovation, Zhejiang Lab(之江实验室交叉创新研究院) Institute of Microelectronics, Chinese Academy of Sciences(中国科学院微电子研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 三维重建 :3D vision(abstract);分类 cs.CV

AI总结 本文从特征修复角度提出扩散增强深度修复方法,通过改进编码器特征提升深度估计性能,在KITTI基准上取得显著提升。

Comments Accepted by IEEE TMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07010 2026-04-09 cs.CV 57%

Synthetic Dataset Generation for Partially Observed Indoor Objects

部分观测室内物体的合成数据集生成

Jelle Vermandere, Maarten Bassier, Maarten Vergauwen

机构 * KU Leuven, Department of Civil Engineering, Ghent, Belgium(鲁汶大学土木工程系,根特,比利时)

专题命中 三维重建 :point cloud(abstract);分类 cs.CV

AI总结 本文提出基于Unity的虚拟扫描框架,生成包含部分扫描和完整几何的真实合成数据集,用于训练场景重建和物体补全方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06576 2026-04-09 cs.CV eess.IV 57%

LiftFormer: Lifting and Frame Theory Based Monocular Depth Estimation Using Depth and Edge Oriented Subspace Representation

LiftFormer:基于提升理论和框架理论的单目深度估计:利用深度和边缘导向的子空间表示

Shuai Li, Huibin Bai, Yanbo Gao, Chong Lv, Hui Yuan, Chuankun Li, Wei Hua, Tian Xie

机构 * School of Control Science and Engineering, Shandong University(山东大学控制科学与工程学院) Key Laboratory of Machine Intelligence and System Control, Ministry of Education(教育部机器智能与系统控制重点实验室) School of Software, Shandong University(山东大学软件学院) Shandong University-WeiHai Research Institute of Industrial Technology(山东大学威海工业技术研究院) State Key Laboratory of Dynamic Testing Technology(动态测试技术国家重点实验室) School of Information and Communication Engineering, North University of China(中北大学信息与通信工程学院) Research Institute of Interdisciplinary Innovation, Zhejiang Lab(之江实验室跨学科创新研究院)

专题命中 三维重建 :3D vision(abstract);分类 cs.CV

AI总结 本文提出LiftFormer,通过构建连接图像颜色特征与深度值的中间子空间及增强边缘深度预测的子空间,解决单目深度估计的高 ill-posed 问题,实现从颜色值到几何深度值的学习转换。

Comments Accepted by IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27105 2026-04-09 cs.CV 57%

UniDAC: Universal Metric Depth Estimation for Any Camera

UniDAC:面向任何相机的通用度量深度估计

Girish Chandar Ganesan, Yuliang Guo, Liu Ren, Xiaoming Liu

机构 * Michigan State University(密歇根州立大学) Bosch Research North America & Bosch Center for AI (BCAI)(博世北美研究院与博世人工智能中心) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 三维重建 :spatial understanding(abstract);分类 cs.CV

AI总结 本文提出UniDAC框架,通过分离度量深度估计为相对深度预测和空间变化尺度估计,实现跨不同相机类型的通用鲁棒性,采用轻量级Depth-Guided Scale Estimation模块和RoPE-ϕ位置嵌入提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03468 2026-04-09 cs.CV 57%

D-Garment: Physically Grounded Latent Diffusion for Dynamic Garment Deformations

D-Garment:基于物理的潜在扩散模型用于动态服装变形

Antoine Dumoulin, Adnane Boukhayma, Laurence Boissieux, Bharath Bhushan Damodaran, Pierre Hellier, Stefanie Wuhrer

机构 * Inria Centre at the University Grenoble Alpes(格勒诺布尔阿尔卑斯大学Inria研究中心) Inria, University of Rennes, CNRS, IRISA-UMR 6074(雷恩大学Inria、CNRS、IRISA-UMR 6074) InterDigital Inc.(InterDigital公司)

专题命中 三维重建 :point cloud(abstract);分类 cs.CV

AI总结 本文提出D-Garment,通过基于物理的模拟器生成新数据,学习基于物理材料属性的3D生成模型,实现更准确的服装变形和动态皱纹模拟。

Comments 18 pages, 11 figures

Journal ref Transactions on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00503 2026-04-08 cs.CV 57%

Diff4Splat: Controllable 4D Scene Generation with Latent Dynamic Reconstruction Models

Diff4Splat:基于潜在动态重建模型的可控4D场景生成

Panwang Pan, Chenguo Lin, Jingjing Zhao, Chenxin Li, Yuchen Lin, Haopeng Li, Honglei Yan, Kairun Wen, Yunlong Lin, Yixuan Yuan, Yadong Mu

机构 * Peking University(北京大学) Xiamen University(厦门大学) CUHK(香港中文大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 三维重建 :novel view synthesis(abstract);分类 cs.CV

AI总结 Diff4Splat通过单张图像和相机轨迹生成可控的4D场景,结合视频扩散模型的生成先验与大规模4D数据集学习的几何和运动约束,在单次前向传递中直接预测可变形3D高斯场,无需测试时优化。

Comments Accepted to CVPR 2026. Project page: https://paulpanwang.github.io/Diff4Splat

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05884 2026-04-07 cs.CV cs.AI cs.CE 57%

Neural Implicit 3D Cardiac Shape Reconstruction from Sparse CT Angiography Slices Mimicking 2D Transthoracic Echocardiography Views

从稀疏CT血管造影切片重建神经隐式3D心脏形状:模拟2D胸骨超声心动图视图

Gino E. Jansen, Carolina Brás, R. Nils Planken, Mark J. Schuuring, Berto J. Bouma, Ivana Išgum

机构 * Department of Biomedical Engineering & Physics, Amsterdam UMC(阿姆斯特丹大学医学中心生物医学工程与物理系) qurAI group, Informatics Institute, University of Amsterdam(阿姆斯特丹大学信息研究所qurAI组) Department of Radiology, Mayo Clinic(梅奥诊所放射科) Department of Biomedical Signals and Systems, University of Twente(特温特大学生物医学信号与系统系) Department of Cardiology, Amsterdam UMC(阿姆斯特丹大学医学中心心脏病科) Department of Radiology & Nuclear Medicine, Amsterdam UMC(阿姆斯特丹大学医学中心放射与核医学科)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出利用稀疏CT血管造影切片重建3D心脏结构的方法,通过神经隐式函数和多层感知机学习形状先验,实现比临床标准更精确的3D心脏量化。

Journal ref Proc. SPIE 13925 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.13096 2026-04-07 cs.CV 57%

3D Magic Mirror: Clothing Reconstruction from a Single Image via a Causal Perspective

3D魔镜:通过因果视角从单张图像进行衣物重建

Zhedong Zheng, Jiayin Zhu, Wei Ji, Yi Yang, Tat-Seng Chua

机构 * Sea-NExT Joint Lab, National University of Singapore(新加坡国立大学Sea-NExT联合实验室) Zhejiang University(浙江大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出一种自监督学习方法,通过因果视角从单张图像重建3D非刚性物体,解决3D标注困难、模板限制和内在模糊性问题,实验表明其在时尚数据集上能实现高质量重建。

Comments Update results. Report person re-id performance. Add details in Appendix

Journal ref npj Artif. Intell. 2, 29 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04276 2026-04-06 cs.CV 57%

PAOLI: Pose-free Articulated Object Learning from Sparse-view Images

PAOLI:无需姿态的稀疏视角图像中的人体姿态学习

Jianning Deng, Kartic Subr, Hakan Bilen

机构 * University of Edinburgh(爱丁堡大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出了一种利用稀疏视角图像建模可变形物体的方法,通过四视角独立重建并学习变形场,分离静态与运动部件,实现鲁棒的跨视角和跨姿态一致性优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04728 2026-04-06 eess.IV cs.CV physics.ins-det 57%

Neural Field-Based 3D Surface Reconstruction of Microstructures from Multi-Detector Signals in Scanning Electron Microscopy

基于神经场的多探测器信号扫描电子显微镜微结构三维表面重建

Shuo Chen, Yijin Li, Xi Zheng, Guofeng Zhang

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) Alibaba Group(阿里巴巴集团) Analysis Center of Agriculture, Life and Environment Sciences, Zhejiang University(浙江大学农业、生命与环境科学分析中心)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出NFH-SEM框架,利用神经场整合多视图几何与探测器信号光度立体线索,实现高保真三维表面重建,展示了在不同材料上的精确恢复能力。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00862 2026-04-02 cs.CV 57%

Shape Representation using Gaussian Process mixture models

基于高斯过程混合模型的形状表示

Panagiotis Sapoutzoglou, George Terzakis, Georgios Floros, Maria Pateraki

机构 * Laboratory of Photogrammetry, School of Rural, Surveying

专题命中 三维重建 :point cloud(abstract);分类 cs.CV

AI总结 本文提出了一种基于高斯过程混合模型的物体特定功能性形状表示方法,通过学习连续方向距离场来高效表示复杂几何结构。

Comments To appear in ISPRS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00682 2026-04-02 cs.CV 57%

MoonAnything: A Vision Benchmark with Large-Scale Lunar Supervised Data

MoonAnything: 一个具有大规模月球监督数据的视觉基准

Clémentine Grethen, Yuang Shi, Simone Gasparini, Géraldine Morin

机构 * IRIT - Université de Toulouse(图卢兹第三大学-计算机科学研究所) National University of Singapore(新加坡国立大学) IPAL, IRL2955

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出MoonAnything基准,基于真实月球地形和物理渲染,提供首个全面的几何和光度监督。包含LunarGeo和LunarPhoto两个子数据集,共13万+样本,适用于低纹理、高对比条件下的算法测试。

Comments Accepted to ACM MMSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00548 2026-04-02 cs.CV 57%

Reliev3R: Relieving Feed-forward Reconstruction from Multi-View Geometric Annotations

Reliev3R: 从多视角几何注释中解脱的前馈重建

Youyu Chen, Junjun Jiang, Yueru Luo, Kui Jiang, Xianming Liu, Xu Yan, Dave Zhenyu Chen

机构 * Harbin Institute of Technology(哈尔滨工业大学) Huawei(华为) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 Reliev3R通过弱监督方法训练前馈重建模型,无需昂贵的多视角几何注释,利用单目相对深度和图像稀疏对应关系进行3D知识学习,提升重建效率与可扩展性。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.30045 2026-04-01 cs.CV 57%

OmniRoam: World Wandering via Long-Horizon Panoramic Video Generation

OmniRoam:通过长视界全景视频生成实现世界漫游

Yuheng Liu, Xin Lin, Xinke Li, Baihan Yang, Chen Wang, Kalyan Sunkavalli, Yannick Hold-Geoffroy, Hao Tan, Kai Zhang, Xiaohui Xie, Zifan Shi, Yiwei Hu

机构 * University of California, Irvine(加州大学尔湾分校) University of California, San Diego(加州大学圣地亚哥分校) City University of Hong Kong(香港城市大学) University of Pennsylvania(宾夕法尼亚大学) Adobe Research(Adobe研究院)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出OmniRoam框架,利用全景视频生成实现长视界场景漫游,通过预览和精炼阶段提升视频质量和一致性,实验表明其在视觉质量、可控性和长期一致性方面优于现有方法。

Comments Code is available at https://github.com/yuhengliu02/OmniRoam

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01142 2026-04-01 cs.CV 57%

ArtLLM: Generating Articulated Assets via 3D LLM

ArtLLM: 通过3D语言模型生成拟合资产

Penghao Wang, Siyuan Xie, Hongyu Yan, Xianghui Yang, Jingwei Huang, Chunchao Guo, Jiayuan Gu

机构 * ShanghaiTech University(上海科技大学) Tencent Hunyuan(腾讯混元) HKUST(香港科技大学)

专题命中 三维重建 :point cloud(abstract);分类 cs.CV

AI总结 ArtLLM通过3D语言模型直接从完整3D网格生成高质量拟合资产,解决了传统方法在关节拟合和部分检索中的局限,提升了部分布局和关节预测的准确性。

Comments CVPR 2026. Project page: https://authoritywang.github.io/artllm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09082 2026-04-01 cs.CV cs.AI cs.LG 57%

AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models

AVA-Bench:用于视觉基础模型的原子视觉能力基准

Zheda Mai, Arpita Chowdhury, Zihe Wang, Sooyoung Jeon, Lemeng Wang, Jiacheng Hou, Wei-Lun Chao

机构 * The Ohio State University(俄亥俄州立大学) Adobe Research(Adobe研究院) Boston University(波士顿大学)

专题命中 三维重建 :spatial understanding(abstract);分类 cs.CV

AI总结 AVA-Bench通过解耦14种原子视觉能力,揭示视觉基础模型的性能差异,提升模型选择的科学性与效率。

Comments Accepted by CVPR 2026. The first two authors contribute equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28064 2026-03-31 cs.CV 57%

\textit{4DSurf}: High-Fidelity Dynamic Scene Surface Reconstruction

4DSurf:高保真动态场景表面重建

Renjie Wu, Hongdong Li, Jose M. Alvarez, Miaomiao Liu

机构 * Australian National University(澳大利亚国立大学) NVIDIA(英伟达) Amazon(亚马逊)

专题命中 三维重建 :Gaussian Splatting(abstract);分类 cs.CV

AI总结 本文提出4DSurf框架,解决动态场景表面重建问题,通过高斯变形和重叠分段策略实现大变形和时间一致性,实验显示在Chamfer距离上优于现有方法。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08282 2026-03-31 cs.CV cs.MM cs.SD 57%

PAVAS: Physics-Aware Video-to-Audio Synthesis

PAVAS:物理感知的视频到音频合成

Oh Hyun-Bin, Yuhta Takida, Toshimitsu Uesaka, Tae-Hyun Oh, Yuki Mitsufuji

机构 * POSTECH(浦项科技大学) Sony AI(索尼人工智能) Sony Group Corporation(索尼集团公司) KAIST(韩国科学技术院)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 PAVAS通过引入物理推理,结合物理参数估计器和物理驱动音频适配器,生成符合物理规律的音频,优于现有视频到音频生成模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12378 2026-03-31 cs.CV 57%

M4Human: A Large-Scale Multimodal mmWave Radar Benchmark for Human Mesh Reconstruction

M4Human: 一种大规模多模态毫米波雷达基准用于人体网格重建

Junqiao Fan, Yunjiao Zhou, Yizhuo Yang, Xinyuan Cui, Jiarui Zhang, Lihua Xie, Jianfei Yang, Chris Xiaoxuan Lu, Fangqiang Ding

机构 * NTU(南洋理工大学) University of Edinburgh(爱丁堡大学) UPenn(宾夕法尼亚大学) UCL(伦敦大学学院) MIT(麻省理工学院)

专题命中 三维重建 :point cloud(abstract);分类 cs.CV

AI总结 本文提出M4Human,首个大规模多模态毫米波雷达基准,提供高分辨率雷达、RGB和深度数据,用于解决传统视觉传感的遮挡、光照和隐私问题,推动人体建模研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14015 2026-03-31 cs.CV 57%

Prompting Depth Anything for 4K Resolution Accurate Metric Depth Estimation

通过提示深度任何事实现4K分辨率的准确度量深度估计

Haotong Lin, Sida Peng, Jingxiao Chen, Songyou Peng, Jiaming Sun, Minghuan Liu, Hujun Bao, Jiashi Feng, Xiaowei Zhou, Bingyi Kang

机构 * Zhejiang University(浙江大学) ByteDance Seed(字节跳动Seed) Shanghai Jiao Tong University(上海交通大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出Prompt Depth Anything,利用低成本LiDAR作为提示,通过多尺度融合设计实现4K分辨率的度量深度估计,并在ARKitScenes和ScanNet++数据集上取得新突破。

Comments CVPR 2025; Project page: https://PromptDA.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏