arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-05-19 至 2026-05-19 共收录 51 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 13 篇

2605.16873 2026-05-19 cs.CV 83%

HAD: Hallucination-Aware Diffusion Priors for 3D Reconstruction

HAD:面向3D重建的幻觉感知扩散先验

Xi Liu, Weiwei Sun, Zhou Ren, Chris Broaddus, Siyu Huang, Laurent Guigues

机构 * Amazon AWS(亚马逊AWS) Clemson University(克莱姆森大学)

专题命中 三维重建 :3D reconstruction(title,abstract);novel view synthesis(abstract);分类 cs.CV

AI总结 本文提出HAD,一种面向3D重建的幻觉感知扩散先验,通过利用预训练在大规模3D数据上的馈送式新视角合成(NVS)网络的多视角推理能力,估计增强图像的像素级幻觉分数图,从而在逐步3D重建过程中选择性地屏蔽不可靠像素,减少幻觉伪影,提升3D重建质量。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00392 2026-05-19 cs.RO cs.AI cs.CV 81%

SonarSweep: Fusing Sonar and Vision for Robust 3D Reconstruction via Plane Sweeping

SonarSweep: 通过平面扫描融合声纳与视觉以实现鲁棒的3D重建

Lingpeng Chen, Jiakun Tang, Apple Pui-Yi Chui, Ziyang Hong, Junfeng Wu

机构 * Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Chinese University of Hong Kong, Hong Kong(香港中文大学) Department of Automation, Harbin Institute of Technology(哈尔滨工业大学自动化系)

专题命中 三维重建 :3D reconstruction(title,abstract);分类 cs.CV、cs.RO

AI总结 本文提出SonarSweep,一种端到端的深度学习框架,通过将平面扫描算法应用于声纳与视觉数据的跨模态融合,克服了单一模态方法在 underwater 环境中3D重建的局限性,实现了更精确和稳定的深度图生成。

Comments 8 pages, 9 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16981 2026-05-19 cs.CV 79%

Rethinking the State Update Gate for Long-Sequence Recurrent 3D Reconstruction

重新思考长序列递归3D重建中的状态更新门

Kejun Ren, Lei Jin, Tianxin Huang, Lianming Xu, Li Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) School of Computing and Data Science, The University of Hong Kong(香港大学计算机与数据科学学院)

专题命中 三维重建 :3D reconstruction(title,abstract);分类 cs.CV

AI总结 本文针对长序列递归3D重建中状态更新门的结构瓶颈问题,提出一个基于帧级的门控机制,通过闭式解推导出无需参数、训练和额外前向传递的标量帧级门,从而在多个基准测试中显著提升了精度并保持了常量内存使用。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18052 2026-05-19 cs.CV 77%

Efficient 3D Content Reconstruction and Generation

高效3D内容重建与生成

Jiahao Li

机构 * TOYOTA TECHNOLOGICAL INSTITUTE AT CHICAGO(丰田技术研究所芝加哥分校)

专题命中 三维重建 :3D reconstruction(abstract);novel view synthesis(abstract);3D generation(abstract);分类 cs.CV

AI总结 本文提出了一种高效的3D内容生成和重建方法,通过结合多视图扩散和稀疏视图3D重建,实现了高质量的3D资产生成,并开发了FastMap算法以提高3D重建的速度和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20353 2026-05-19 cs.RO 74%

Quality-guided UAV Surface Exploration for 3D Reconstruction

基于质量引导的无人机表面探索用于3D重建

Benjamin Sportich, Kenza Boubakri, Olivier Simonin, Alessandro Renzaglia

机构 * Inria(法国国家信息与自动化技术研究所) INSA Lyon(里昂国立应用科学学院) CITI(信息与通信技术研究所)

专题命中 三维重建 :3D reconstruction(title);分类 cs.RO

AI总结 本文提出了一种新的模块化Next-Best-View规划框架,通过使用重建质量目标来指导探索规划,以提高3D重建的效率和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16795 2026-05-19 cs.CV cs.AI cs.GR 73%

3DPhysVideo: Consistency-Guided Flow SDE for Video Generation via 3D Scene Reconstruction and Physical Simulation

3DPhysVideo: 通过3D场景重建和物理模拟的一致性引导流SDE用于视频生成

Hwidong Kim, Yunho Kim, Tae-Kyun Kim

机构 * KAIST(韩国科学技术院)

专题命中 三维重建 :3D reconstruction(abstract);point cloud(abstract);分类 cs.CV、cs.GR

AI总结 本文提出了一种无需训练的管道,通过3D场景重建和物理模拟生成逼真视频,利用一致性引导流SDE分解预测速度以确保条件输入的一致性,从而在多物体和流体交互场景中实现从单张图像到物理合理视频的过渡。

Comments Project page: https://hwidong-kim.github.io/projects/3DPhysVideo

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18735 2026-05-19 cs.CV cs.GR cs.LG 62%

PIXLRelight: Controllable Relighting via Intrinsic Conditioning

PIXLRelight: 通过内在条件实现可控的图像重照明

Miguel Farinha, Ronald Clark

机构 * Department of Computer Science(计算机科学系) University of Oxford(牛津大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV、cs.GR

AI总结 PIXLRelight通过内在条件将物理基础渲染与学习图像合成相结合,实现对单图像重照明的可控性,其核心方法是利用真实照片或PBR渲染得到的内在条件进行训练和推理,从而在保证图像细节的同时实现高质量的重照明效果。

Comments Project page: https://mlfarinha.github.io/pixl-relight/. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18197 2026-05-19 cs.RO cs.AI cs.CV 62%

RGB-only Active 3D Scene Graph Generation for Indoor Mobile Robots

仅RGB的主动3D场景图生成用于室内移动机器人

Giorgia Modi, Davide Buoso, Giuseppe Averta, Daniele De Martini

机构 * Mobile Robotics Group (MRG)(移动机器人小组) Visual and Multimodal Applied Learning Lab (VANDAL)(视觉与多模态应用学习实验室)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV、cs.RO

AI总结 本文提出了一种仅使用RGB输入的主动3D场景图生成方法,通过统一感知与规划的结构化表示,解决了传统方法对专用传感器的依赖问题,并在Replica数据集上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18184 2026-05-19 cs.RO cs.AI cs.CV 62%

Fixed External Cameras as Common Prior Maps for Active 3D Scene Graph Generation

固定外部摄像头作为主动3D场景图生成的共同先验地图

Giorgia Modi, Davide Buoso, Giuseppe Averta, Daniele De Martini

机构 * Mobile Robotics Group (MRG)(移动机器人组) Visual and Multimodal Applied Learning Lab (VANDAL)(视觉与多模态应用学习实验室)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV、cs.RO

AI总结 本文提出利用固定外部RGB摄像头作为共同先验地图,以实现主动、渐进式的3D场景图生成,通过融合机器人 onboard 摄像头和固定外部摄像头的数据,提高场景理解的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16266 2026-05-19 cs.GR cs.CV cs.LG 62%

Patchwork: A compact representation for 3D polygonal shapes

Patchwork: 3D多边形形状的紧凑表示

Ruichen Zheng, Biao Zhang, Michael Birsak, Mikhail Skopenkov, Peter Wonka

机构 * King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹大学)

专题命中 三维重建 :3D generation(abstract);分类 cs.CV、cs.GR

AI总结 Patchwork提出了一种新的通用形状表示方法,通过少量参数建模2D和3D几何,提供可证明的复杂度界和任意精度近似能力,结合高效梯度优化和新型正则化损失,实现高紧凑性,适用于几何学习与重建任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17593 2026-05-19 cs.RO 57%

Motion-Uncertainty-Aware Next-Best-View Planning for Moving Object Reconstruction

考虑运动不确定性的移动物体重建最佳下视角规划

Karen Li, Mattia Mantovani, Robert J. Wood, Lorenzo Sabattini, Stephanie Gil

机构 * Harvard University(哈佛大学) University of Modena and Reggio Emilia(摩德纳和雷焦艾米利亚大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.RO

AI总结 本文提出了一种考虑运动不确定性的最佳下视角规划框架,用于重建未知的刚体目标,该框架利用噪声的平面位置测量和移动机器人深度观测,通过固定滞后高斯过程平滑器估计和预测目标状态,从而生成候选视角并提高重建完整性。

Comments This paper is accepted for publication for Robotics: Science and Systems (RSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16775 2026-05-19 cs.CV cs.AI cs.LG 57%

VolTA-3D: Self-Supervised Learning for Brain MRI using 3D Volumetric Token Alignment

VolTA-3D: 基于3D体积分块对齐的脑MRI自监督学习

Amy Makawana, Abhijeet Parida, Marius George Linguraru, Julia Ive, Syed Muhammad Anwar

机构 * Institute of Health Informatics(健康信息学研究所) Sheikh Zayed Institute for Pediatric Surgical Innovation(谢赫扎耶德儿童外科创新研究所) School of Medicine and Health Sciences(医学与健康科学学院)

专题命中 三维重建 :3D vision(abstract);分类 cs.CV

AI总结 本文提出VolTA-3D,一种用于脑MRI自监督学习的3D视觉Transformer框架,通过联合对齐全局类风格标记和局部块标记,增强体积分块表示的可迁移性,从而在多个下游任务中表现出更好的泛化能力和鲁棒性。

Comments Accepted at EMBC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16628 2026-05-19 cs.CV 57%

SCARED-C: Corrected Camera Poses for Endoscopic Depth Estimation

SCARED-C:用于内窥镜深度估计的修正相机姿态

John J. Han, Adam Schmidt, Max Allan, Jie Ying Wu, Omid Mohareri

机构 * Vanderbilt University(范德比大学) Intuitive Surgical, Inc.(Intuitive Surgical公司)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 SCARED-C通过修正相机姿态,将可靠RGB-D配对数从35增加到17135,采用COLMAP和尺度恢复步骤提升内窥镜深度估计的精度与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. NeRF 1 篇

2605.18054 2026-05-19 eess.IV cs.CV cs.MM 70%

CATRF: Codec-Adaptive TriPlane Radiance Fields for Volumetric Content Delivery

CATRF:用于体积分发的编码自适应三平面辐射场

Tung-I Chen, Lingdong Wang, Subhransu Maji, Ramesh K. Sitaraman

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 NeRF :3DGS(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出CATRF,一种用于体积分发的编码自适应三平面辐射场方法,通过在训练过程中将二维特征平面量化和打包到编码器友好的画布中,并利用标准编码器进行回程处理,从而在训练循环中插入非可微的编码器管道,使辐射场特征能够直接适应客户端侧的编码器失真,而无需引入任何学习的编码器参数。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. Gaussian Splatting 13 篇

2605.17002 2026-05-19 cs.GR cs.MM eess.IV 89%

A Single Atlas is All You Need: Decoder-Side Gaussian Splatting for Immersive Video

一个Atlas就足够了:解码器侧的高斯点云渲染用于沉浸式视频

Dawid Mieloch, Stuart Perry

专题命中 Gaussian Splatting :3DGS(summary_cn,abstract);Gaussian Splatting(title,abstract);分类 cs.GR

AI总结 本文提出了解码器侧高斯点云渲染(DSGS)框架,通过将深度估计阶段替换为前馈3DGS推理,优化整个体积场景,从而在解码器侧从压缩纹理和元数据中实现高质量的沉浸式视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18263 2026-05-19 cs.CV 87%

RT-Splatting: Joint Reflection-Transmission Modeling with Gaussian Splatting

RT-Splatting:基于高斯点散布的联合反射-透射建模

Ji Shi, Xianghua Ying, Bowei Xing, Ruohao Guo, Wenzhen Yue

机构 * State Key Laboratory of General Artificial Intelligence(国家一般人工智能重点实验室) School of Intelligence Science and Technology(智能科学与技术学院)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);novel view synthesis(abstract);分类 cs.CV

AI总结 本文提出RT-Splatting方法,通过将高斯点的几何占用与光学不透明度分离,实现对半透明表面复杂反射和清晰透射的联合建模,从而在实时渲染中获得高质量的反射和透射效果。

Comments CVPR 2026 Highlight, Project Page: https://sjj118.github.io/RT-Splatting/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18334 2026-05-19 cs.CV cs.GR 86%

3D Skew Gaussian Splatting with Any Camera Trajectory Visualization Engine

具有任意相机轨迹可视化引擎的3D斜高斯散射

Beizhen Zhao, Yifan Zhou, Gaochao Song, Ziran Yin, Hao Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Zhejiang University(浙江大学) The University of Hong Kong(香港大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);分类 cs.CV、cs.GR

AI总结 本文提出3D斜高斯散射(3DSGS),通过引入斜高斯分布来提升3D高斯散射的结构保真度和紧凑性,以解决对称高斯分布在捕捉形状和颜色不连续性方面的不足,从而提高可视化效果和空间数据探索的准确性。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17011 2026-05-19 cs.GR cs.CV cs.LG 86%

Topo-GS: Continuous Volumetric Embedding of High-Dimensional Data via Topological Gaussian Splatting

Topo-GS: 通过拓扑高斯散射实现高维数据的连续体积分嵌入

João Paulo Gois, Luis Gustavo Nonato

机构 * Universidade Federal do ABC (UFABC)(巴西圣安德烈大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);分类 cs.CV、cs.GR

AI总结 本文提出Topo-GS方法,利用拓扑感知策略将高维数据转换为连续体积分表示,通过局部几何约束优化,保持局部拓扑保真度,同时显式表现投影扭曲。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10239 2026-05-19 cs.CV 85%

AdaptSplat: Adapting Vision Foundation Models for Feed-Forward 3D Gaussian Splatting

AdaptSplat: 为前馈3D高斯点划法适应视觉基础模型

Mingwei Xing, Xinliang Wang, Yifeng Shi

机构 * Ke Holdings Inc.(凯控股公司)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出AdaptSplat,通过在通用架构中引入一个仅含1.5M参数的轻量级适配器,有效提升了前馈3D高斯点划法在跨领域泛化和高频几何保真度方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20155 2026-05-19 cs.CV 85%

GSCompleter: A Distillation-Free Plugin for Metric-Aware 3D Gaussian Splatting Completion in Seconds

GSCompleter: 一种无需蒸馏的插件,用于在几秒钟内进行基于度量的3D高斯溅射完成

Ao Gao, Jingyu Gong, Xin Tan, Zhizhong Zhang, Lizhuang Ma, Yuan Xie

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Shanghai Innovation Institute(上海创新研究院) Chongqing Key Laboratory of Precision Optics, Chongqing Institute of East China Normal University(重庆精密光学重点实验室,东华大学重庆研究院) Shanghai Key Laboratory of Computer Software Evaluating and Testing(上海计算机软件评测测试重点实验室) Department of Computer Science and Engineering, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出了一种无需蒸馏的GSCompleter插件,通过稳定的'生成-注册'流程实现基于度量的3D高斯溅射完成,提高了完成质量和效率,并在三个基准上取得了新的最先进的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16925 2026-05-19 cs.CV 85%

P2GS: Physical Prior-guided Gaussian Splatting for Photometrically Consistent Urban Reconstruction

P2GS: 基于物理先验的高斯点云法用于光度一致的城市重建

Kota Shimomura, Hidehisa Arai, Tsubasa Takahashi, Takayoshi Yamashita, Hironobu Fujiyoshi

机构 * Chubu University(名古屋大学) Turing Inc.(图灵公司)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出P2GS,一种基于物理先验的高斯点云法,用于解决自动驾驶中由于异质相机管道和动态户外照明导致的光度不一致问题,通过联合分解视图不变的线性HDR光场、每视图曝光尺度和色调映射函数,提升光度一致性与光照一致性。

Comments Accepted CVPR2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16582 2026-05-19 cs.CV 84%

ArtMesh: Part-Aware Articulated Mesh Fields with Motion-Consistent Dynamics

ArtMesh:带有运动一致动态的部件感知可变形网格场

Sylvia Yuan, Dan Wang, Ravi Ramamoorthi, Xinrui Cui

机构 * University of California San Diego(加州大学圣地亚哥分校) University of North Texas(北卡罗来纳州立大学)

专题命中 Gaussian Splatting :3DGS(summary_cn,abstract);Gaussian Splatting(abstract);分类 cs.CV

AI总结 ArtMesh通过构建基于网格的可微渲染基础,实现了从多视角图像中重建可变形物体的连接三角网格,并在100个新基准数据集上超越了现有3DGS方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18252 2026-05-19 cs.CV 79%

GaussianZoom: Progressive Zoom-in Generative 3D Gaussian Splatting with Geometric and Semantic Guidance

GaussianZoom: 一种结合几何和语义引导的渐进式缩放生成3D高斯点云

Jiale Shi, Jiarui Hu, Zesong Yang, Kaixuan Luan, Hujun Bao, Zhaopeng Cui

机构 * State Key Lab of CAD & CG(计算机辅助设计与图形学国家重点实验室)

专题命中 Gaussian Splatting :Gaussian Splatting(title);3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出GaussianZoom,一种结合几何一致场景建模和多尺度语义推理的生成式缩放3D重建系统,通过迭代渐进框架实现从低分辨率输入生成高保真的极端缩放渲染。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00952 2026-05-19 cs.CV 79%

Decoupling Motion and Geometry in 4D Gaussian Splatting

分离运动与几何的4D高斯点散射

Yi Zhang, Yulei Kang, Jiangxin Sun, Beihao Xia, Jisheng Dang, Jian-Fang Hu

机构 * Sun Yat-sen University(中山大学) University of Trento(特伦特大学) Huazhong University of Science and Technology(华中科技大学) Lanzhou University(兰州大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);分类 cs.CV

AI总结 本文提出VeGaS框架,通过引入伽利略剪切矩阵和几何变形网络,分离高斯运动与几何属性,提升复杂非线性运动建模能力,实验表明其在公开数据集上达到最先进的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17777 2026-05-19 cs.CV 77%

Efficient Sparse-to-Dense Visual Localization via Compact Gaussian Scene Representation and Accelerated Dense Pose Estimation

通过紧凑的高斯场景表示和加速的密集姿态估计实现高效的稀疏到密集视觉定位

Zizhuo Li, Songchu Deng, Linfeng Tang, Jiayi Ma

机构 * Electronic Information School, Wuhan University(武汉大学电子信息学院) School of Robotics, Wuhan University(武汉大学机器人学院) Electronic Information School and the School of Robotics, Wuhan University(武汉大学电子信息学院和机器人学院)

专题命中 Gaussian Splatting :3DGS(abstract,abstract_cn);Gaussian Splatting(abstract);分类 cs.CV

AI总结 本文提出了一种高效的视觉定位方法LiteLoc,通过去除冗余的色彩字段和优化密集姿态估计,显著提升了内存和计算效率,同时保持了定位性能。

Comments IEEE/CAA JAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14009 2026-05-19 cs.RO 77%

GRaD-Nav++: Vision-Language Model Enabled Visual Drone Navigation with Gaussian Radiance Fields and Differentiable Dynamics

GRaD-Nav++: 基于视觉-语言模型的视觉无人机导航:高斯辐射场与可微动力学

Qianzhong Chen, Naixiang Gao, Suning Huang, JunEn Low, Timothy Chen, Jiankai Sun, Mac Schwager

机构 * Department of Mechanical Engineering, Stanford University(斯坦福大学机械工程系) Department of Aeronautics and Astronautics, Stanford University(斯坦福大学航空航天工程系)

专题命中 Gaussian Splatting :3DGS(abstract,abstract_cn);Gaussian Splatting(abstract);分类 cs.RO

AI总结 GRaD-Nav++提出一种轻量级视觉-语言-动作框架,通过可微强化学习在3D高斯点云模拟器中训练,实现基于自然语言指令的实时无人机导航,展示在多任务和多环境下的高效导航能力。

Comments Published in: IEEE Robotics and Automation Letters ( Volume: 11, Issue: 2, February 2026)

Journal ref Chen, Qianzhong, et al. "Grad-nav++: Vision-language model enabled visual drone navigation with gaussian radiance fields and differentiable dynamics." IEEE Robotics and Automation Letters 11.2 (2025): 1418-1425

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09668 2026-05-19 cs.CV 57%

DiffWind: Physics-Informed Differentiable Modeling of Wind-Driven Object Dynamics

DiffWind: 基于物理的可微风驱物体动力学建模

Yuanhang Lei, Boming Zhao, Zesong Yang, Xingxuan Li, Tao Cheng, Haocheng Peng, Ru Zhang, Yang Yang, Siyuan Huang, Yujun Shen, Ruizhen Hu, Hujun Bao, Zhaopeng Cui

机构 * State Key Laboratory of CAD & CG(CAD与计算机图形学国家重点实验室) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) Ant Group(蚂蚁集团) Shenzhen University(深圳大学)

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);分类 cs.CV

AI总结 本文提出DiffWind,一种基于物理的可微框架,统一了风-物体相互作用建模、基于视频的重建和正向模拟。通过将风表示为基于网格的物理场,物体表示为从3D高斯点散布派生的粒子系统,并利用材料点方法(MPM)建模其相互作用,从而实现了对风驱物体动力学的重建。此外,本文还引入了WD-Objects数据集,通过大量实验证明了该方法在重建精度和模拟保真度方面显著优于现有动态场景建模方法。

Comments Accepted by ICLR 2026. Project page: https://zju3dv.github.io/DiffWind/

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 点云 18 篇

2605.18006 2026-05-19 eess.IV cs.CV cs.MM 79%

Inter-LPCM: Learning-based Inter-Frame Predictive Coding for LiDAR Point Cloud Compression

Inter-LPCM: 基于学习的帧间预测编码用于激光雷达点云压缩

Chang Sun, Hui Yuan, Shiqi Jiang, Chongzhen Tian, Guanghui Zhang, Raouf Hamzaoui

机构 * School of Control Science and Engineering, Shandong University(控制科学与工程学院,山东大学) Key Laboratory of Machine Intelligence and System Control, Ministry of Education(教育部机器智能与系统控制重点实验室) School of Computer Science and Technology, Shandong University(计算机科学与技术学院,山东大学) School of Engineering and Sustainable Development, De Montfort University(工程与可持续发展学院,德蒙福特大学)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 本文提出Inter-LPCM,一种基于学习的帧间预测编码方法,用于改进激光雷达点云压缩中的几何冗余去除,通过引入delta编码策略、帧间半径预测模型和轻量级注意力预测模型,结合RD优化的量化方法和针对每个球坐标分量的熵编码模型,提高压缩效率和质量。

Comments 14 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17742 2026-05-19 cs.CV cs.HC 79%

UST-Hand: An Uncertainty-aware Spatiotemporal Point Cloud Interaction Network for 3D Self-supervised Hand Pose Estimation

UST-Hand: 一种面向3D自监督手姿态估计的不确定性感知时空点云交互网络

Tianhao Han, Haoyang Zhang, Liang Xie, Haochen Chang, Kun Gao, Yuan Cheng, Pengfei Ren, Erwei Yin

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Beijing University of Posts and Telecommunications(北京邮电大学) Sun Yat-sen University(中山大学) Peking University(北京大学) Defense Innovation Institute, Academy of Military Sciences(国防科技创新院,军事科学学院) Tianjin Artificial Intelligence Innovation Center(天津人工智能创新中心)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 本文提出UST-Hand,一种通过估计手姿态不确定性分布并构建概率点云特征空间的自监督学习框架,以更稳定地建模复杂的时空关系,从而在三个具有挑战性的数据集上实现了最先进的性能,比现有自监督方法在均位点误差(MPVPE)上高出37.8%。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17566 2026-05-19 cs.CV 79%

Rethinking Point Clouds as Sequences: A Causal Next-Token Predictive Learning Framework

重新思考点云作为序列:一种因果性下一标记预测学习框架

Yumeng Yao, Jingzhi Dong, Haowen Gu, Tao Chen, Zonghan Wu, Xiaoshui Huang, Yazhou Yao

机构 * Nanjing University of Science and Technology(南京理工大学) Shanghai Jiao Tong University(上海交通大学) Hangzhou City University(杭州城市学院) East China Normal University(华东师范大学)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 本文提出PointNTP,将点云预训练重新定义为全因果、无解码器的潜在下一标记预测问题,通过局部补丁分割和结构化3D标记序列生成,实现对点云结构依赖的直接建模,无需重建解码器或显式几何恢复,实验表明其在多个下游任务中表现优异。

Comments 10 pages, 2 figures. Code will be released upon acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏