arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-05-21 至 2026-05-21 共收录 29 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 3 篇

2605.20940 2026-05-21 cs.CV 83%

3D Reconstruction and Knowledge Distillation to Improve Multi-View Image Models to Explore Spike Volume Estimation in Wheat

3D重建与知识蒸馏以改进多视角图像模型以探索小麦籽粒体积估计

Olivia Zumsteg, Jannis Widmer, Yann Bourdé, Norbert Kirchgessner, Andreas Hund, Lukas Roth, Paraskevi Nousi

机构 * ETH Zurich(苏黎世联邦理工学院) Swiss Data Science Center(瑞士数据科学中心)

专题命中 三维重建 :3D reconstruction(title,abstract);point cloud(abstract);分类 cs.CV

AI总结 本文提出了一种混合2D-3D方法,通过训练过程中知识蒸馏,使模型能够高效地进行图像-only推理。该方法结合了基于距离直方图特征的刚性不变点云网络和提出的多视角图像基于调节Transformer(RT)的集成架构,最终通过特征或标签蒸馏将知识转移到纯图像模型中,从而提高了籽粒体积估计的精度和效率。

Comments 8 pages, 6 figures (Appendix: 4 pages, 5 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20827 2026-05-21 cs.CV 74%

HyDAR-Pano3D: A Hybrid Disentangled Anatomical Recovery Framework for Panoramic-to-3D Reconstruction

HyDAR-Pano3D: 一种用于全景到3D重建的混合解耦解剖恢复框架

Yaoyao Yue, Jérôme Schmid, Xiaoshuang Li, Eduardo Delamare, Jinman Kim

机构 * School of Computer Science, the University of Sydney(悉尼大学计算机科学学院) Geneva School of Health Sciences, HES-SO University of Applied Sciences and Arts Western Switzerland(日内瓦健康科学学院,HES-SO应用科学和艺术西瑞士大学) Department of Computer Science and Engineering, Shanghai Jiao Tong University(上海交通大学计算机科学与工程系) Sydney Dental School, Faculty of Medicine and Health, The University of Sydney(悉尼牙科学院,医学与健康学院,悉尼大学)

专题命中 三维重建 :3D reconstruction(title);分类 cs.CV

AI总结 本文提出HyDAR-Pano3D框架,通过解耦解剖恢复问题来解决全景影像到CBCT重建中的模糊问题,实验表明其在PSNR、SSIM和Dice评分上均优于基线方法,能够有效恢复临床相关的解剖结构。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20274 2026-05-21 cs.GR cs.AI 57%

PolycubeNet: A Dual-latent Diffusion Model for Polycube-Based Hexahedral Mesh Generation

PolycubeNet: 一种基于多立方体的双潜在扩散模型用于六面体网格生成

Lu He, Qitao Deng, Junjiang Deng, Liangbin Deng, Yanjun Liang, Wenting Yang, Guoqiang Wang, Na Lei

机构 * Dalian University of Technology(大连理工大学) Jiangxi University of Science and Technology(江西理工大学) School of Mathematical Sciences, Guangxi Minzu University(广西民族大学数学与计算机科学学院) Caohejing Hi-Tech Park Development Co., Ltd.(曹家京高科技园发展有限公司) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 三维重建 :point cloud(abstract);分类 cs.GR

AI总结 本文提出了一种基于条件扩散模型的端到端框架,用于生成基于多立方体的六面体网格,通过双潜在条件扩散架构有效解耦了计算复杂度与输入输出分辨率,提高了生成效率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. NeRF 3 篇

2605.18447 2026-05-21 cs.CV 91%

NeRF-based Spacecraft Reconstruction from Monocular Imagery Under Illumination Variability and Pose Uncertainty

基于NeRF的在轨航天器单目影像重建:在光照变化和姿态不确定性下的应用

Antoine Legrand, Renaud Detry, Christophe De Vleeschouwer

机构 * ICTEAM, UCLouvain(ICTEAM,乌得勒支大学) ESAT, KU Leuven(ESAT,鲁汶大学) MECH, KU Leuven(机械工程系,鲁汶大学) Aerospacelab(航天实验室) UCLouvain(乌得勒支大学)

专题命中 NeRF :NeRF(title,title_cn);3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出一种基于NeRF的方法,通过引入图像特定的外观嵌入和姿态修正项,提升在光照变化和姿态不确定性下的航天器重建鲁棒性,验证了其在离线重建中的有效性,并展示了其在在线重建中的潜力。

Comments (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19649 2026-05-21 cs.CV 90%

CAD-Free Learning of Spacecraft Pose Estimators via NeRF-Based Augmentations

无需CAD的基于NeRF的航天器姿态估计器学习方法

Antoine Legrand, Renaud Detry, Christophe De Vleeschouwer

机构 * Department of Electrical Engineering (ELEN), ICTEAM, UCLouvain(电子工程系(ELEN),ICTEAM,鲁汶大学) Department of Electrical Engineering (ESAT), KU Leuven(电子工程系(ESAT),鲁汶大学) Department of Mechanical Engineering (MECH), KU Leuven(机械工程系(MECH),鲁汶大学) Aerospacelab(航天实验室)

专题命中 NeRF :NeRF(title,title_cn);分类 cs.CV

AI总结 本文提出了一种基于NeRF的图像增强方法,使航天器姿态估计器的学习不再依赖大量CAD渲染图像,仅需几十到几百张真实图像即可训练出准确的姿态估计器,同时提升了对实际轨道条件的鲁棒性。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10830 2026-05-21 cs.CV cs.LG 84%

Predicting 3D structure by latent posterior sampling

通过潜在后验采样预测3D结构

Azmi Haider, Dan Rosenbaum

机构 * Department of Computer Science(计算机科学系) University of Haifa(海法大学) Department of Computational Science(计算科学系)

专题命中 NeRF :NeRF(summary_cn,abstract);3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出了一种结合NeRF表示和扩散模型的概率建模方法,用于从不同类型的观测数据(如单视角、多视角、噪声图像、稀疏像素和稀疏深度数据)中准确预测3D结构。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. Gaussian Splatting 10 篇

2605.21051 2026-05-21 eess.IV 92%

Transcoding a 3D Gaussian Splatting Model from a Plenoptic Point Cloud or Mesh without the Original Multi-view Images

从视光点云或网格无原始多视角图像转码3D高斯点播模型

Maja Krivokuća, Riad Bendouro, Neus Sabater

专题命中 Gaussian Splatting :3DGS(summary_cn,abstract);Gaussian Splatting(title,abstract);point cloud(title,abstract)

AI总结 本文提出了一种端到端的转码流程,用于从现有的3D视光点云或网格模型生成3D高斯点播(3DGS)模型,当原始多视角图像不可用时。还提出了一种定制的初始化方法,以引导3DGS模型学习,并通过约束确保最终的3DGS模型与输入点云或网格表面紧密对齐。在高质量的标准视光点云数据集上的测试表明,我们的流程生成高质量的3DGS模型,其点数远少于原始密集点云中的点数。此外,我们的定制初始化方法比通常用于3DGS模型学习的基于SfM的默认初始化方法,导致更快的收敛速度和更干净的表面表示。

Comments Submitted to an ICIP 2026 satellite workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13482 2026-05-21 cs.CV 89%

Improving 3D Gaussian Splatting Compression by Scene-Adaptive Lattice Vector Quantization

通过场景自适应晶格向量量化改进3D高斯散射压缩

Hao Xu, Xiaolin Wu, Xi Zhang

机构 * Department of Electrical & Computer Engineering, McMaster University(麦卡特尼大学电气与计算机工程系) School of Computing and Artificial Intelligence, Southwest Jiaotong University(西南交通大学计算机与人工智能学院) School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

专题命中 Gaussian Splatting :3DGS(summary_cn,abstract);Gaussian Splatting(title,abstract);分类 cs.CV

AI总结 本文提出了一种场景自适应晶格向量量化(SALVQ)方法,用于改进3D高斯散射(3DGS)的压缩性能,通过优化晶格基矢来提高适应性和R-D效率,同时减少计算开销和训练时间。

Comments Accepted by IEEE TIP. Code available at https://github.com/hxu160/SALVQ

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14978 2026-05-21 cs.CV 89%

E2GS: Event Enhanced Gaussian Splatting

E2GS:事件增强的高斯点撒法

Hiroyuki Deguchi, Mana Masuda, Takuya Nakabayashi, Hideo Saito

机构 * Keio University(庆应大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);NeRF(abstract,abstract_cn);3D reconstruction(abstract);novel view synthesis(abstract)

AI总结 本文提出E2GS方法,结合事件数据与高斯点撒法,提升图像去模糊和高质量视角合成效果,实验表明其在合成和真实数据集上均能生成视觉吸引人的渲染结果,且训练和渲染速度更快(140 FPS)

Comments 7pages, Accepted at ICIP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20566 2026-05-21 cs.RO 85%

Conflict-Aware Active Perception and Control in 3D Gaussian Splatting Fields via Control Barrier Functions

基于控制屏障函数的3D高斯点云场中冲突感知与控制

Amirhossein Mollaei Khass, Athanasios Cosse, Vivek Pandey, Nader Motee

机构 * Department of Mechanical Engineering and Mechanics, Lehigh University(机械工程与力学系,莱恩大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);分类 cs.RO

AI总结 本文提出了一种基于控制屏障函数的冲突感知与控制框架,用于在3D高斯点云场环境中安全导航并获取信息以减少地图不确定性,通过统一的安全关键和感知感知二次规划程序解决安全与感知目标的冲突。

Comments Project website: https://sircesoc.github.io/Conflict_Aware_Active_Perception/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21032 2026-05-21 cs.CV 81%

Towards Physically Consistent 4D Scene Reconstruction for Closed-loop Autonomous Driving Simulation

迈向物理一致的闭环自动驾驶模拟中的4D场景重建

Bowyn Tan, Yutong Xie, Bai Huang, Fan Luo, Xiao Li, Naizheng Wang, Yang Guan, Shengbo Eben Li

机构 * Tsinghua University(清华大学) Meituan(美团) Central University of Finance and Economics(中央财经大学)

专题命中 Gaussian Splatting :3DGS(summary_cn,abstract);分类 cs.CV

AI总结 本文提出了一种信息几何诊断框架,解决3DGS方法在同时实现空间和时间参数建模时的信用分配难题,通过引入正交投影梯度(OPG)和时间正则化策略,提升了4D场景重建的物理一致性。

Comments 20 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20820 2026-05-21 cs.CV 79%

AIR: Amortized Image Reconstruction Framework for Self-Supervised Feed-Forward 2D Gaussian Splatting

AIR: 一种用于自监督前馈2D高斯点散射的 amortized 图像重建框架

Zhaojie Zeng, Yuesong Wang, Yawei Luo, Tao Guan

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) School of Software Technology, Zhejiang University(浙江大学软件学院)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);分类 cs.CV

AI总结 本文提出了一种自监督前馈框架AIR,通过将迭代高斯拟合 amortized 到单次网络传递中,消除了每张图像测试时的优化需求。该框架采用分阶段残差架构,逐步从重建残差中预测额外的高斯原始体,并结合显式的阶段控制机制,仅在欠重建区域激活新的原始体。通过预测-优化-蒸馏训练策略,稳定了多阶段预测,最终实现了更高效的图像重建。

Comments preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20872 2026-05-21 cs.LG cs.AI cs.GR 77%

CAdam: Context-Adaptive Moment Estimation for 3D Gaussian Densification in Generative Distillation

CAdam: 3D高斯密度细化中的上下文自适应矩估计

SeungJeh Chung, Geonho Park, Misong Kim, HyeongYeop Kang

机构 * IIIXR Lab, Kyung Hee University(庆尚大学IIIXR实验室) IIIXR Lab, Korea University(韩国大学IIIXR实验室)

专题命中 Gaussian Splatting :3DGS(abstract,abstract_cn);Gaussian Splatting(abstract);分类 cs.GR

AI总结 本文提出CAdam方法,通过将密度细化问题转化为统计信号验证问题,解决生成式蒸馏中密度估计的瓶颈,从而在保持视觉质量的同时显著减少高斯点数量。

Comments Accepted to SIGGRAPH 2026 Conference Papers. 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21258 2026-05-21 cs.RO cs.AI 70%

Learning Structural Latent Points for Efficient Visual Representations in Robotic Manipulation

为机器人操作中的高效视觉表征学习结构潜在点

Yicheng Jiang, Jiaxu Wang, Junhao He, Zesen Gan, Junhao Li, Qiang Zhang, Jingkai Sun, Jiahang Cao, Mingyuan Sun, Xiangyu Yue, Qiming Shao

机构 * The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab) X-Humanoid Robots(X-Humanoid机器人) The University of Hong Kong(香港大学) Tsinghua University(清华大学)

专题命中 Gaussian Splatting :3DGS(abstract,abstract_cn);分类 cs.RO

AI总结 本文提出了一种新的预训练框架,通过学习混合表示-结构潜在点,结合隐式表示的表达能力和显式表示的结构先验,以提高机器人操作中的视觉表征效率和鲁棒性。

Journal ref International Conference on Robotics and Automation 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21112 2026-05-21 cs.CV 70%

RCGDet3D: Rethinking 4D Radar-Camera Fusion-based 3D Object Detection with Enhanced Radar Feature Encoding

RCGDet3D: 重新思考基于增强雷达特征编码的4D雷达-相机融合3D目标检测

Weiyi Xiong, Bing Zhu

机构 * School of Automation Science and Electrical Engineering, Beihang University(北京航空航天大学自动化科学与电气工程学院)

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);point cloud(abstract);分类 cs.CV

AI总结 本文提出RCGDet3D,通过增强雷达特征编码而非复杂的多模态融合策略,实现了在3D目标检测中更高的准确性和实时性,为实时部署设定了新标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20910 2026-05-21 cs.CV 70%

FlowLong: Inference-time Long Video Generation via Manifold-constrained Tweedie Matching

FlowLong: 通过流形约束的 Tweedie 匹配实现推理时的长视频生成

Jangho Park, Geon Yeong Park, Gihyun Kwon, Jong Chul Ye

机构 * KAIST(韩国科学技术院) Amazon(亚马逊)

专题命中 Gaussian Splatting :3DGS(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出了一种新的推理时长视频生成方法,通过流形约束的Tweedie匹配在重叠滑动窗口中生成长视频,同时保持时间和空间一致性,并且无需额外训练。

Comments Project Page: https://flowlong-video.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 点云 12 篇

2605.20978 2026-05-21 cs.LG 82%

Point Cloud Sequence Encoding for Material-conditioned Graph Network Simulators

用于材料条件化图网络模拟器的点云序列编码

Philipp Dahlinger, Balázs Gyenes, Niklas Freymuth, Luca Geminiani, Tobias Würth, Johannes Mitsch, Nadja Klein, Luise Kärger, Gerhard Neumann

机构 * Autonomous Learning Robots(自主学习机器人) Methods for Big Data(大数据方法) Institute of Vehicle System Technology(车辆系统技术研究所)

专题命中 点云 :point cloud(title,abstract)

AI总结 本文提出PEACH框架,通过点云序列编码实现对未知物理属性的适应,提高了模拟到现实的零样本转移精度,并在实际部署中更具实用性。

Comments 9 pages + appendix, 7 figures. Submitted to the 40th Conference on Neural Information Processing Systems (NeurIPS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20973 2026-05-21 cs.CV 79%

Towards Integrated Rock Support Visualisation in 3D Point Cloud of Underground Mines

向地下矿山3D点云中的集成岩支可视化迈进

Dibyayan Patra, Simit Raval, Pasindu Ranasinghe, Bikram Banerjee, Ismet Canbulat

机构 * School of Minerals and Energy Resources Engineering, University of New South Wales(新南威尔士大学矿物与能源资源工程学院) School of Surveying and Built Environment, University of Southern Queensland(南方昆士兰大学测绘与环境工程学院)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 本文提出了一种自动化框架,用于利用地下矿山开掘的3D点云进行集成岩支可视化,通过结构映射、岩钉识别、断层面拟合和岩钉方向估计的统一工作流,实现了对断层面和岩钉向量的集成3D可视化,以评估其空间交集和几何关系,同时通过互补的立体分析评估整体锚固几何有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20737 2026-05-21 cs.CV 79%

Resolving Long-Tail Ambiguity in Unsupervised 3D Point Cloud Segmentation with Language Priors

通过语言先验解决无监督3D点云分割中的长尾歧义

Siqi Wei, Hongbin Xu, Feng Xiao, Tian Lan, Chun Li, Ming Li, Qiuxia Wu

机构 * South China University of Technology(华南理工大学) Bytedance(字节跳动) Tsinghua University(清华大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学) Guangming Laboratory(光明实验室)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 本文提出LangTail框架,利用语言模型中的平衡世界知识来缓解无监督3D分割中的长尾歧义问题,通过建立语言衍生语义先验与视觉上不常见的小类之间的多级关联,提升小类的表示能力,实验表明在ScanNet-v2、S3DIS和nuScenes数据集上均取得显著提升。

Comments In submission. The code will be released at: https://github.com/Whisky0129/langtail_official

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21414 2026-05-21 cs.RO cs.CV 62%

PointACT: Vision-Language-Action Models with Multi-Scale Point-Action Interaction

PointACT: 多尺度点-动作交互的视觉-语言-动作模型

Shizhe Chen, Paul Pacaud, Cordelia Schmid

机构 * Inria(法国国家信息与自动化研究所) École normale supérieure(法国高等科学研究院) CNRS(法国国家科学研究中心) PSL Research University(巴黎综合理工研究院)

专题命中 点云 :point cloud(abstract);分类 cs.CV、cs.RO

AI总结 本文提出PointACT,一种集成层次化3D点云表示的3D感知视觉-语言-动作政策,通过多尺度点-动作交互机制提升机器人在3D环境中的精细几何推理和空间定位能力。

Comments Accepted to RSS 2026; project webpage: https://cshizhe.github.io/projects/pointact.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20390 2026-05-21 cs.CV cs.AI cs.LG cs.RO 62%

STELLAR: Scaling 3D Perception Large Models for Autonomous Driving

STELLAR: 为自动驾驶扩展3D感知大模型

Yingwei Li, Xin Huang, Yang Liu, Yang Fu, Alex Zihao Zhu, Chen Song, Junwen Yao, Anant Subramanian, Hao Xiang, Weijing Shi, Yuliang Zou, Tom Hoddes, Zhaoqi Leng, Govind Thattai, Dragomir Anguelov, Mingxing Tan

机构 * Waymo UCSD(加州大学圣地亚哥分校)

专题命中 点云 :spatial understanding(abstract);分类 cs.CV、cs.RO

AI总结 本文研究了大规模训练在自动驾驶感知系统中的应用,通过扩展输入模态并训练大规模模型,实现了在Waymo数据集上的新状态-of-the-art性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21460 2026-05-21 cs.RO cs.AI cs.HC 57%

HITL-D: Human In The Loop Diffusion Assisted Shared Control

HITL-D: 有人参与的扩散辅助共享控制

Riley Zilka, Sergey Khlynovskiy, Allie Wang, Martin Jagersand

机构 * Department of Computing Science, University of Alberta(阿尔伯塔大学计算机科学系)

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 本文提出HITL-D框架,通过结合扩散策略和人类控制,提升多步骤、插入和精细操作任务的用户表现,减少 joystick 控制轴数量,降低认知负荷,并在多任务用户研究中显著提高任务完成速度和用户满意度。

Comments Accepted for presentation at ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21308 2026-05-21 cs.CV cs.AI 57%

Deformba: Vision State Space Model with Adaptive State Fusion

Deformba:具有自适应状态融合的视觉状态空间模型

Hongyu Ke, Jack Morris, Yongkang Liu, Satoshi Kitai, Kentaro Oguchi, Yi Ding, Haoxin Wang

机构 * Department of Computer Science, Georgia State University(佐治亚州立大学计算机科学系) University of Tennessee Knoxville(田纳西大学肯纳邦克分校)

专题命中 点云 :3D vision(abstract);分类 cs.CV

AI总结 本文提出Deformba,一种能够动态增强空间结构信息并保持状态空间模型线性复杂度的自适应方法,通过多模态融合(如交叉注意力)提升视觉任务的性能,展示了在2D和3D视觉任务中的广泛适用性。

Journal ref Forty-Third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21059 2026-05-21 cs.CV cs.LG 57%

Multimodal LLMs under Pairwise Modalities

基于成对模态的多模态大语言模型

Yan Li, Yunlong Deng, Yuewen Sun, Gongxu Luo, Kun Zhang, Guangyi Chen

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出了一种基于成对模态训练多模态大语言模型的方法,通过理论分析和表示学习框架,实现了跨模态对齐和重构,提升了模型的跨模态性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20889 2026-05-21 cs.CV 57%

Map-Mono-Ego: Map-Grounded Global Human Pose Estimation from Monocular Egocentric Video

Map-Mono-Ego: 从单目第一视角视频实现基于地图的全局人体姿态估计

Hiroyuki Deguchi, Ryosuke Hori, Kotaro Amaya, Tsubasa Maruyama, Mitsunori Tada, Hideo Saito

机构 * Keio University(庆应大学) National Institute of Advanced Industrial Science and Technology(国家先进工业科学与技术研究院)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出Map-MonoEgo框架,通过利用预扫描的3D点云实现从单目摄像头获得的全局一致的人体姿态估计,并引入AIST-Living数据集,证明该方法在无需专用硬件的情况下能有效提升日常监控任务的实用性。

Comments Accepted at ICIP 2026, Project page: https://deguchihiroyuki.github.io/Map-Mono-Ego-Project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18743 2026-05-21 cs.AI 50%

WorldString: Actionable World Representation

WorldString: 可行动态世界表征

Kunqi Xu, Jitao Li, Jianglong Ye, Tianshu Tang, Isabella Liu, Sifei Liu, Xueyan Zou

机构 * CalTech(加州理工学院) UC San Diego(南加州大学) Tsinghua University - IEI Lab(清华大学-IEI实验室) NVIDIA(英伟达)

专题命中 点云 :point cloud(abstract)

AI总结 本文提出WorldString,一种能够通过点云或RGB-D视频流直接学习现实物体状态流形的神经架构,为构建可行动态世界模型提供基础构建块。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07213 2026-05-21 cs.LG math.PR 50%

Diffusion Processes on Implicit Manifolds

隐式流形上的扩散过程

Victor Kawasaki-Borruat, Clara Grotehans, Pierre Vandergheynst, Adam Gosztolai

机构 * Signal Processing Laboratory 2(信号处理实验室2) Institute of Artificial Intelligence(人工智能研究所) EPFL(瑞士联邦理工学院) Medical University of Vienna(维也纳医学大学)

专题命中 点云 :point cloud(abstract)

AI总结 本文研究如何仅使用点云样本在数据流形上构建扩散过程,提出隐式流形估值扩散(IMDs)方法,通过近似扩散过程的无穷小生成元和carré-du-champ来定义高维空间中的随机微分方程,实现流形内在过程的外推,并通过实验验证其在数据流形上的约束性和探索性。

Comments Comments are more than welcome!

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14088 2026-05-21 math.NA cs.NA 50%

Geometric local parameterization for solving Hele-Shaw problems with surface tension

具有表面张力的Hele-Shaw问题的几何局部参数化

Zengyan Zhang, Wenrui Hao, John Harlim

专题命中 点云 :point cloud(abstract)

AI总结 本文提出了一种新的计算框架,用于求解具有表面张力的二维Hele-Shaw自由边界问题。通过点云表示移动边界,消除了全局参数化的需要。利用广义移动最小二乘法(GMLS)构建局部几何图表,能够从点云数据中高阶近似曲率等几何量。该局部参数化系统地用于离散边界积分方程,包括奇异积分的解析公式。提供了所提出空间离散化的严格收敛分析,建立了在某些条件下的一致性和稳定性。所得误差界以移动边界上均匀采样点云数据的大小、边界的光滑性和数值求积规则的阶数来表示。数值实验验证了理论发现,展示了高阶空间收敛性和预期的时间收敛速率。通过模拟复杂初始形状的仿真进一步展示了方法的有效性,包括由各向异性表面张力驱动的界面,这些界面在表面张力的影响下正确演变为圆形平衡状态,突显了该方法在复杂几何依赖界面动力学中的通用性。

Comments 23 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 3D生成 1 篇

2605.21121 2026-05-21 cs.CV cs.GR 81%

ROAR-3D: Routing Arbitrary Views for High-Fidelity 3D Generation

ROAR-3D: 为高保真3D生成实现任意视角路由

Hanxiao Sun, Mingxin Yang, Shuhui Yang, Zebin He, Xintong Han, Hongbo Fu, Chunchao Guo, Wenhan Luo

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Tencent Hunyuan(腾讯文生)

专题命中 3D生成 :3D generation(title,abstract);分类 cs.CV、cs.GR

AI总结 本文提出ROAR-3D方法,通过改进预训练单视角模型以支持任意数量的未置位图像,利用视图路由和双流注意力设计实现高效的多视角3D生成,显著提升生成质量并支持测试时视角扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏