arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-05-22 至 2026-05-22 共收录 21 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 3 篇

2605.05749 2026-05-22 cs.CV 79%

Ray-Aware Pointer Memory with Adaptive Updates for Streaming 3D Reconstruction

具有自适应更新的射线感知指针记忆用于流式3D重建

Feifei Li, Qi Song, Chi Zhang, Rui Huang

机构 * The Chinese University of HongKong, Shenzhen(香港中文大学(深圳)) Tsinghua University(清华大学)

专题命中 三维重建 :3D reconstruction(title,abstract);分类 cs.CV

AI总结 本文提出了一种射线感知指针记忆,用于流式3D重建,通过统一的记忆表示模型同时建模空间位置和视角方向,采用自适应指针更新策略以保留信息性指针并丢弃冗余指针,从而提高长期重建稳定性和相机姿态精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22359 2026-05-22 cs.CV 57%

GazePrior: Zero-Shot AR/VR Eye Tracking via Learned 3D Gaze Reconstruction

GazePrior: 通过学习的3D注视重建实现零样本AR/VR注视跟踪

Corentin Dumery, David Colmenares, Alexander Fix, Pascal Fua, Ali Behrooz, Jogendra Kundu

机构 * Meta Reality Labs(Meta现实实验室) EPFL(苏黎世联邦理工学院)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出GazePrior,一种数据驱动的3D注视先验模型,用于在无需额外数据收集的情况下实现高质量的AR/VR注视跟踪,通过合成数据提高模型的准确性和鲁棒性。

Comments Project page: https://corentindumery.github.io/projects/gazeprior.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22814 2026-05-22 cs.LG 50%

Remember to be Curious: Episodic Context and Persistent Worlds for 3D Exploration

记住保持好奇:用于3D探索的片段上下文和持久世界

Lily Goli, Justin Kerr, Daniele Reda, Alec Jacobson, Andrea Tagliasacchi, Angjoo Kanazawa

机构 * University of Toronto(多伦多大学) UC Berkeley(加州大学伯克利分校) Wayve Vector Institute(向量研究所) Simon Fraser University(西蒙 Fraser大学)

专题命中 三维重建 :3D reconstruction(abstract)

AI总结 本研究提出了一种基于好奇心驱动强化学习的方法,通过引入持久世界模型和片段上下文来解决3D环境中稀疏奖励长周期任务中的探索问题,实验表明该方法在HM3D数据集上优于基于强化学习的主动映射基线,并能泛化到Gibson和AI生成的世界。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Gaussian Splatting 7 篇

2605.02784 2026-05-22 cs.CV 85%

HumanSplatHMR: Closing the Loop Between Human Mesh Recovery and Gaussian Splatting Avatar

HumanSplatHMR: 闭合人体网格恢复与高斯点绘肖像之间的循环

Yeheng Zong, Pou-Chun Kung, Yike Pan, Seth Isaacson, Yizhou Chen, Ram Vasudevan, Katherine A. Skinner

机构 * University of Michigan(密歇根大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);NeRF(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出HumanSplatHMR方法,通过闭合几何姿态估计与可微渲染之间的循环,改进人体姿态恢复和高斯点绘肖像的生成,提升在新视角和新姿态下的渲染质量。

Comments Project page: https://scottyehengz.github.io/HumanSplat/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17855 2026-05-22 cs.GR 85%

Accelerating 3D Gaussian Splatting using Tensor Cores

利用张量核心加速3D高斯散射

Sheng Li, Yang Sui, Yue Wu, Zhuoran Song, Bo Yuan, Xulong Tang, Yue Dai

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);分类 cs.GR

AI总结 本文提出TensorGS框架,通过将3D高斯散射的主导渲染计算转换为张量核心兼容的矩阵运算,并引入跨瓷砖分组以提高高斯重用率,从而在保持图像质量的同时提升端到端渲染性能1.65倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01466 2026-05-22 cs.CV cs.LG 83%

SplAttN: Bridging 2D and 3D with Gaussian Soft Splatting and Attention for Point Cloud Completion

SplAttN: 通过高斯软溅射和注意力在2D和3D之间架桥以实现点云补全

Zhaoyang Li, Zhichao You, Tianrui Li

机构 * School of Computing and Artificial Intelligence(计算与人工智能学院) Southwest Jiaotong University(西南交通大学) Chengdu, China(中国成都)

专题命中 Gaussian Splatting :point cloud(title,abstract);Gaussian Splatting(abstract);分类 cs.CV

AI总结 本文提出SplAttN方法,通过高斯软溅射和注意力机制解决点云补全中2D和3D模态连接问题,改进了传统硬投影导致的跨模态熵塌陷问题,实现了更有效的跨模态连接学习。

Comments Accepted as a Spotlight paper at ICML 2026; camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22342 2026-05-22 cs.CV cs.AI 79%

4D-GSW: Kinematic-Aware Spatio-Temporal Consistent Watermarking for 4D Gaussian Splatting

4D-GSW: 4D高斯点散布的运动感知空间-时间一致水印技术

Sifan Zhou, Hang Zhang, Yuhang Wang, Ming Li

机构 * Southeast University(东南大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy(广东人工智能与数字经济实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);分类 cs.CV

AI总结 本文提出4D-GSW,一种运动感知的空间-时间一致水印技术,用于在4D高斯点散布中嵌入鲁棒的版权信息,同时保持高空间-时间一致性。

Comments 9 pages main paper, 7 figures, 18 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22147 2026-05-22 cs.CV 79%

Flow-based Gaussian Splatting for Continuous-Scale Remote Sensing Image Super-Resolution

基于流的高斯点散射用于连续尺度遥感图像超分辨率

Jiangwei Mo, Xi Lu, Hanlin Wu

机构 * School of Information Science and Technology, Beijing Foreign Studies University(信息科学与技术学院,北京外国语大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);分类 cs.CV

AI总结 本文提出FlowGS框架,通过流匹配和高斯点散射实现任意尺度的遥感图像超分辨率,提升生成效率和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21935 2026-05-22 cs.RO 77%

Learning to Evolve: Multi-modal Interactive Fields for Robust Humanoid Navigation in Dynamic Environments

学习进化:多模态交互场用于动态环境中的稳健双足机器人导航

Peifeng Jiang, Hong Liu, Jin Jin, Wenshuai Wang, Xia Li

机构 * State Key Laboratory of General Artificial Intelligence, Peking University, Shenzhen Graduate School(一般人工智能国家重点实验室,北京大学深圳研究生院) Oxford Robotics Institute, University of Oxford(牛津大学机器人研究所) Institute for Machine Learning, Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系机器学习研究所)

专题命中 Gaussian Splatting :3DGS(abstract,abstract_cn);Gaussian Splatting(abstract);分类 cs.RO

AI总结 本文提出多模态交互场(MIF)系统,通过结合置信度感知的语义3D高斯溅射、差异触发的空间记忆更新和任务驱动的几何重建,在闭环感知-适应管道中实现稳健的双足机器人导航,显著提高了非静态环境中的重定位成功率并减少了语义内存足迹。

Comments Accepted by Robotics: Science and Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22190 2026-05-22 cs.CV 57%

No Pose, No Problem in 4D: Feed-Forward Dynamic Gaussians from Unposed Multi-View Videos

无需姿态,无问题:从未姿态多视角视频中馈送动态高斯

Matteo Balice, Yanik Kunzi, Chenyangguang Zhang, Matteo Matteucci, Marc Pollefeys, Sungwhan Hong

机构 * Politecnico di Milano(米兰理工大学) ETH Zürich(苏黎世联邦理工学院) ETH AI Center(苏黎世联邦理工学院人工智能中心)

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);分类 cs.CV

AI总结 本文提出NoPo4D,一种首个无需姿态的馈送式系统,能够处理动态内容、多视角输入和未知相机姿态,通过速度分解和双向运动编码提升性能,优于现有方法。

Comments https://bralani.github.io/nopo4d_html/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 点云 8 篇

2605.22013 2026-05-22 cs.CV cs.GR cs.LG 81%

PointLLM-R: Enhancing 3D Point Cloud Reasoning via Chain-of-Thought

PointLLM-R: 通过链式推理增强3D点云推理

Chaoqi Chen, Qile Xu, Wenjun Zhou, Hui Huang

机构 * Visual Computing Research Center (VCC), College of Computer Science(视觉计算研究中心(VCC),计算机科学学院) Software Engineering (CSSE) Shenzhen University China(软件工程(CSSE)深圳大学中国) VCC, CSSE Shenzhen University China(VCC,CSSE 深圳大学中国) Shenzhen University(深圳大学)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV、cs.GR

AI总结 本文提出了一种数据驱动的框架,用于构建大规模链式推理监督,以改进3D点云理解。通过两阶段流程优化点文本指令数据,并合成高质量推理路径,构建了包含55K样本的PoCoTI数据集,训练PointLLM-R实现3D多模态语言模型的推理能力,实验表明其在生成3D分类和描述任务中达到最先进的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02098 2026-05-22 cs.CV 79%

From Spherical to Gaussian: A Comparative Analysis of Point Cloud Cropping Strategies in Large-Scale 3D Environments

从球形到高斯:在大规模3D环境中点云裁剪策略的比较分析

Maximilian Kellner, Dominik Merkle, Michael Brunklaus, Alexander Reiterer

机构 * Fraunhofer Institute for Physical Measurement Techniques IPM(弗劳恩霍夫物理测量技术研究所IPM) University of Freiburg, Department of Sustainable Systems Engineering INATECH(弗赖堡大学可持续系统工程系INATECH)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 本文比较了点云裁剪策略,提出了一种新的方法以提高大规模3D环境中的模型性能,特别是在户外场景中取得了新的最佳成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05307 2026-05-22 cs.CV cs.RO 62%

4D Radar Semantic Segmentation of People in Field Conditions Using Temporal Multi-View Networks

利用时序多视角网络进行野外条件下4D雷达的人体语义分割

Mikael Skog, Oleksandr Kotlyar, Vladimír Kubelka, Martin Magnusson

机构 * Center for Advanced Autonomous Sensor Systems (AASS)(先进自主传感器系统中心)

专题命中 点云 :point cloud(abstract);分类 cs.CV、cs.RO

AI总结 本文提出TMVA4D网络,利用4D雷达数据进行人体语义分割,通过多视角投影区分背景与人体,在低能见度条件下实现75.9%的Dice系数和61.2%的IoU指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22328 2026-05-22 cs.CV 57%

3D LULC classification using multispectral LiDAR and deep learning: current and prospective schemes

基于多光谱LiDAR和深度学习的3D土地利用/覆盖分类:当前和未来方案

Narges Takhtkeshha, Aldino Rizaldy, Markus Hollaus, Juha Hyyppä, Fabio Remondino, Gottfried Mandlburger

机构 * D Optical Metrology (3DOM) Unit, Bruno Kessler Foundation (FBK)(3D光学计量(3DOM)单元,布鲁诺·凯塞尔基金会(FBK)) Department of Geodesy and Geoinformation, TU Wien(测绘与地理信息系,维也纳技术大学) Helmholtz-ZentrumDresden-Rossendorf (HZDR), Helmholtz Institute Freiberg for Resource Technology (HIF)(德累斯顿-罗斯托克赫尔姆霍尔茨研究中心(HZDR),资源技术赫尔姆霍尔茨研究所(HIF)) Freie Universität Berlin, Remote Sensing and Geoinformatics(柏林自由大学,遥感与地理信息学) Department of Remote Sensing and Photogrammetry, Finnish Geospatial Research Institute FGI, The National Land Survey of Finland(芬兰地理研究所(FGI),芬兰国家土地测绘局)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出了一种基于多光谱LiDAR和深度学习的3D土地利用/覆盖分类方法,介绍了NMCA对齐的L1和L2分类方案,并引入了一个新的多光谱LiDAR基准数据集,评估了七种最先进的深度学习模型,并展示了光谱信息对分类性能的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18507 2026-05-22 cs.CV 57%

Weakly Supervised Cross-Modal Learning for 4D Radar Scene Flow Estimation

弱监督跨模态学习用于4D雷达场景流估计

Jingyun Fu, Zhiyu Xiang, Na Zhao

机构 * Zhejiang University, Hangzhou, Zhejiang, China(浙江大学) Zhejiang Provincial Key Laboratory of Multi-Modal Communication Networks and Intelligent Information Processing(浙江省多模态通信网络与智能信息处理重点实验室) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出了一种弱监督的雷达场景流学习框架,利用图像和里程计进行辅助监督,通过实例感知的自监督损失和静态区域的刚性损失,实现了更高效的场景流估计。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22182 2026-05-22 cs.LG 50%

IKNO: Infinite-order Kernel Neural Operators

IKNO:无限阶核神经算子

Pengyuan Zhu, Ivor W. Tsang, Yueming Lyu

机构 * Nanyang Technological University(南洋理工大学) Centre for Frontier AI Research(CFAR), Agency for Science, Technology and Research (A*STAR)(前沿人工智能研究中心(CFAR),科技研究局(A*STAR))

专题命中 点云 :point cloud(abstract)

AI总结 本文提出IKNO,一种通过无限阶核积分构建的神经算子,解决了传统模型因依赖一阶核积分而限制表达能力的问题,通过两种互补的构造方法实现了高效的全局信息聚合,并在多个基准数据集上取得了SOTA精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21636 2026-05-22 cs.CG math.AT 50%

Bifunction and Interlevel Delaunay Trifiltrations

双函数与互级Delaunay三滤波

Ángel Javier Alonso, Michael Kerber, Tung Lam, Michael Lesnick, Abhishek Rathod

专题命中 点云 :point cloud(abstract)

AI总结 本文研究了基于实值函数的点云的三参数Delaunay滤波,提出了一种计算方法并实现了该算法,展示了其在三维空间中处理数千个点的能力。

Comments 37 pages, 7 figures. Full version of a paper to appear in the Proceedings of the 42nd International Symposium on Computational geometry (SoCG 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28280 2026-05-22 eess.SP 50%

Multimodal-NF: A Wireless Dataset for Near-Field Low-Altitude Sensing and Communications

Multimodal-NF: 一种用于近场低空传感与通信的无线数据集

Mengyuan Li, Qianfan Lu, Jiachen Tian, Hongjun Hu, Yu Han, Xiao Li, Chao-Kai Wen, Shi Jin

专题命中 点云 :point cloud(abstract)

AI总结 本文提出Multimodal-NF数据集,用于近场低空极端大规模多输入多输出系统,通过融合多种模态数据提升无线传感与通信任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 新视角合成 2 篇

2605.07287 2026-05-22 cs.CV 83%

SplatWeaver: Learning to Allocate Gaussian Primitives for Generalizable Novel View Synthesis

SplatWeaver: 学习分配高斯原语以实现可泛化的新型视角合成

Yecong Wan, Fan Li, Mingwen Shao, Wangmeng Zuo

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) Zhengzhou Advanced Research Institute of Harbin Institute of Technology(哈尔滨工业大学郑州先进研究院) Huawei Noah’s Ark Lab(华为诺亚实验室) Artificial Intelligence Research Institute, Shenzhen University of Advanced Technology(深圳先进技术大学人工智能研究院)

专题命中 新视角合成 :novel view synthesis(title,abstract);Gaussian Splatting(abstract);分类 cs.CV

AI总结 本文提出SplatWeaver框架,通过动态分配高斯原语实现可泛化的新型视角合成,解决传统方法中固定分配导致的资源浪费和表达不足问题。

Comments Project Page: https://yecongwan.github.io/SplatWeaver/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16258 2026-05-22 cs.CV cs.AI cs.RO 73%

IVGT: Implicit Visual Geometry Transformer for Neural Scene Representation

IVGT:隐式视觉几何变换器用于神经场景表示

Yuqi Wu, Tianyu Hu, Wenzhao Zheng, Yuanhui Huang, Haowen Sun, Jie Zhou, Jiwen Lu

机构 * Intelligent Vision Group, Tsinghua University(清华大学智能视觉组)

专题命中 新视角合成 :point cloud(abstract);novel view synthesis(abstract);分类 cs.CV、cs.RO

AI总结 本文提出IVGT,一种隐式视觉几何变换器,通过无姿态多视角图像隐式建模连续且一致的几何结构,从而实现神经场景表示,支持在任意3D位置进行连续空间查询,以预测签名距离和颜色,并在多个任务中表现出色。

Comments Code: https://github.com/wzzheng/IVGT/

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 3D生成 1 篇

2605.21572 2026-05-22 cs.CV cs.RO 84%

PhysX-Omni: Unified Simulation-Ready Physical 3D Generation for Rigid, Deformable, and Articulated Objects

PhysX-Omni: 为刚体、变形体和关节物体统一的模拟准备物理3D生成

Ziang Cao, Yinghao Liu, Haitian Li, Runmao Yao, Fangzhou Hong, Zhaoxi Chen, Liang Pan, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室)

专题命中 3D生成 :3D generation(title,abstract);分类 cs.CV、cs.RO

AI总结 本文提出PhysX-Omni,一种统一的模拟准备物理3D生成框架,通过开发针对视觉-语言模型的高效几何表示和首个通用模拟准备3D数据集PhysXVerse,以及评估生成和理解能力的PhysX-Bench,显著提升了生成和理解性能,推动下游应用如具身AI和物理模拟的发展。

Comments Project page: https://physx-omni.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏