arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-05-21 至 2026-05-21 共收录 12 信号源:cs.CV, cs.GR, cs.RO

1. 点云 12 篇

2605.20978 2026-05-21 cs.LG 82%

Point Cloud Sequence Encoding for Material-conditioned Graph Network Simulators

用于材料条件化图网络模拟器的点云序列编码

Philipp Dahlinger, Balázs Gyenes, Niklas Freymuth, Luca Geminiani, Tobias Würth, Johannes Mitsch, Nadja Klein, Luise Kärger, Gerhard Neumann

机构 * Autonomous Learning Robots(自主学习机器人) Methods for Big Data(大数据方法) Institute of Vehicle System Technology(车辆系统技术研究所)

专题命中 点云 :point cloud(title,abstract)

AI总结 本文提出PEACH框架,通过点云序列编码实现对未知物理属性的适应,提高了模拟到现实的零样本转移精度,并在实际部署中更具实用性。

Comments 9 pages + appendix, 7 figures. Submitted to the 40th Conference on Neural Information Processing Systems (NeurIPS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20973 2026-05-21 cs.CV 79%

Towards Integrated Rock Support Visualisation in 3D Point Cloud of Underground Mines

向地下矿山3D点云中的集成岩支可视化迈进

Dibyayan Patra, Simit Raval, Pasindu Ranasinghe, Bikram Banerjee, Ismet Canbulat

机构 * School of Minerals and Energy Resources Engineering, University of New South Wales(新南威尔士大学矿物与能源资源工程学院) School of Surveying and Built Environment, University of Southern Queensland(南方昆士兰大学测绘与环境工程学院)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 本文提出了一种自动化框架,用于利用地下矿山开掘的3D点云进行集成岩支可视化,通过结构映射、岩钉识别、断层面拟合和岩钉方向估计的统一工作流,实现了对断层面和岩钉向量的集成3D可视化,以评估其空间交集和几何关系,同时通过互补的立体分析评估整体锚固几何有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20737 2026-05-21 cs.CV 79%

Resolving Long-Tail Ambiguity in Unsupervised 3D Point Cloud Segmentation with Language Priors

通过语言先验解决无监督3D点云分割中的长尾歧义

Siqi Wei, Hongbin Xu, Feng Xiao, Tian Lan, Chun Li, Ming Li, Qiuxia Wu

机构 * South China University of Technology(华南理工大学) Bytedance(字节跳动) Tsinghua University(清华大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学) Guangming Laboratory(光明实验室)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 本文提出LangTail框架,利用语言模型中的平衡世界知识来缓解无监督3D分割中的长尾歧义问题,通过建立语言衍生语义先验与视觉上不常见的小类之间的多级关联,提升小类的表示能力,实验表明在ScanNet-v2、S3DIS和nuScenes数据集上均取得显著提升。

Comments In submission. The code will be released at: https://github.com/Whisky0129/langtail_official

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21414 2026-05-21 cs.RO cs.CV 62%

PointACT: Vision-Language-Action Models with Multi-Scale Point-Action Interaction

PointACT: 多尺度点-动作交互的视觉-语言-动作模型

Shizhe Chen, Paul Pacaud, Cordelia Schmid

机构 * Inria(法国国家信息与自动化研究所) École normale supérieure(法国高等科学研究院) CNRS(法国国家科学研究中心) PSL Research University(巴黎综合理工研究院)

专题命中 点云 :point cloud(abstract);分类 cs.CV、cs.RO

AI总结 本文提出PointACT,一种集成层次化3D点云表示的3D感知视觉-语言-动作政策,通过多尺度点-动作交互机制提升机器人在3D环境中的精细几何推理和空间定位能力。

Comments Accepted to RSS 2026; project webpage: https://cshizhe.github.io/projects/pointact.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20390 2026-05-21 cs.CV cs.AI cs.LG cs.RO 62%

STELLAR: Scaling 3D Perception Large Models for Autonomous Driving

STELLAR: 为自动驾驶扩展3D感知大模型

Yingwei Li, Xin Huang, Yang Liu, Yang Fu, Alex Zihao Zhu, Chen Song, Junwen Yao, Anant Subramanian, Hao Xiang, Weijing Shi, Yuliang Zou, Tom Hoddes, Zhaoqi Leng, Govind Thattai, Dragomir Anguelov, Mingxing Tan

机构 * Waymo UCSD(加州大学圣地亚哥分校)

专题命中 点云 :spatial understanding(abstract);分类 cs.CV、cs.RO

AI总结 本文研究了大规模训练在自动驾驶感知系统中的应用,通过扩展输入模态并训练大规模模型,实现了在Waymo数据集上的新状态-of-the-art性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21460 2026-05-21 cs.RO cs.AI cs.HC 57%

HITL-D: Human In The Loop Diffusion Assisted Shared Control

HITL-D: 有人参与的扩散辅助共享控制

Riley Zilka, Sergey Khlynovskiy, Allie Wang, Martin Jagersand

机构 * Department of Computing Science, University of Alberta(阿尔伯塔大学计算机科学系)

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 本文提出HITL-D框架,通过结合扩散策略和人类控制,提升多步骤、插入和精细操作任务的用户表现,减少 joystick 控制轴数量,降低认知负荷,并在多任务用户研究中显著提高任务完成速度和用户满意度。

Comments Accepted for presentation at ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21308 2026-05-21 cs.CV cs.AI 57%

Deformba: Vision State Space Model with Adaptive State Fusion

Deformba:具有自适应状态融合的视觉状态空间模型

Hongyu Ke, Jack Morris, Yongkang Liu, Satoshi Kitai, Kentaro Oguchi, Yi Ding, Haoxin Wang

机构 * Department of Computer Science, Georgia State University(佐治亚州立大学计算机科学系) University of Tennessee Knoxville(田纳西大学肯纳邦克分校)

专题命中 点云 :3D vision(abstract);分类 cs.CV

AI总结 本文提出Deformba,一种能够动态增强空间结构信息并保持状态空间模型线性复杂度的自适应方法,通过多模态融合(如交叉注意力)提升视觉任务的性能,展示了在2D和3D视觉任务中的广泛适用性。

Journal ref Forty-Third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21059 2026-05-21 cs.CV cs.LG 57%

Multimodal LLMs under Pairwise Modalities

基于成对模态的多模态大语言模型

Yan Li, Yunlong Deng, Yuewen Sun, Gongxu Luo, Kun Zhang, Guangyi Chen

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出了一种基于成对模态训练多模态大语言模型的方法,通过理论分析和表示学习框架,实现了跨模态对齐和重构,提升了模型的跨模态性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20889 2026-05-21 cs.CV 57%

Map-Mono-Ego: Map-Grounded Global Human Pose Estimation from Monocular Egocentric Video

Map-Mono-Ego: 从单目第一视角视频实现基于地图的全局人体姿态估计

Hiroyuki Deguchi, Ryosuke Hori, Kotaro Amaya, Tsubasa Maruyama, Mitsunori Tada, Hideo Saito

机构 * Keio University(庆应大学) National Institute of Advanced Industrial Science and Technology(国家先进工业科学与技术研究院)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出Map-MonoEgo框架,通过利用预扫描的3D点云实现从单目摄像头获得的全局一致的人体姿态估计,并引入AIST-Living数据集,证明该方法在无需专用硬件的情况下能有效提升日常监控任务的实用性。

Comments Accepted at ICIP 2026, Project page: https://deguchihiroyuki.github.io/Map-Mono-Ego-Project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18743 2026-05-21 cs.AI 50%

WorldString: Actionable World Representation

WorldString: 可行动态世界表征

Kunqi Xu, Jitao Li, Jianglong Ye, Tianshu Tang, Isabella Liu, Sifei Liu, Xueyan Zou

机构 * CalTech(加州理工学院) UC San Diego(南加州大学) Tsinghua University - IEI Lab(清华大学-IEI实验室) NVIDIA(英伟达)

专题命中 点云 :point cloud(abstract)

AI总结 本文提出WorldString,一种能够通过点云或RGB-D视频流直接学习现实物体状态流形的神经架构,为构建可行动态世界模型提供基础构建块。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07213 2026-05-21 cs.LG math.PR 50%

Diffusion Processes on Implicit Manifolds

隐式流形上的扩散过程

Victor Kawasaki-Borruat, Clara Grotehans, Pierre Vandergheynst, Adam Gosztolai

机构 * Signal Processing Laboratory 2(信号处理实验室2) Institute of Artificial Intelligence(人工智能研究所) EPFL(瑞士联邦理工学院) Medical University of Vienna(维也纳医学大学)

专题命中 点云 :point cloud(abstract)

AI总结 本文研究如何仅使用点云样本在数据流形上构建扩散过程,提出隐式流形估值扩散(IMDs)方法,通过近似扩散过程的无穷小生成元和carré-du-champ来定义高维空间中的随机微分方程,实现流形内在过程的外推,并通过实验验证其在数据流形上的约束性和探索性。

Comments Comments are more than welcome!

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14088 2026-05-21 math.NA cs.NA 50%

Geometric local parameterization for solving Hele-Shaw problems with surface tension

具有表面张力的Hele-Shaw问题的几何局部参数化

Zengyan Zhang, Wenrui Hao, John Harlim

专题命中 点云 :point cloud(abstract)

AI总结 本文提出了一种新的计算框架,用于求解具有表面张力的二维Hele-Shaw自由边界问题。通过点云表示移动边界,消除了全局参数化的需要。利用广义移动最小二乘法(GMLS)构建局部几何图表,能够从点云数据中高阶近似曲率等几何量。该局部参数化系统地用于离散边界积分方程,包括奇异积分的解析公式。提供了所提出空间离散化的严格收敛分析,建立了在某些条件下的一致性和稳定性。所得误差界以移动边界上均匀采样点云数据的大小、边界的光滑性和数值求积规则的阶数来表示。数值实验验证了理论发现,展示了高阶空间收敛性和预期的时间收敛速率。通过模拟复杂初始形状的仿真进一步展示了方法的有效性,包括由各向异性表面张力驱动的界面,这些界面在表面张力的影响下正确演变为圆形平衡状态,突显了该方法在复杂几何依赖界面动力学中的通用性。

Comments 23 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏