arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-05-05 至 2026-05-05 共收录 9 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 2 篇

2602.10101 2026-05-05 cs.RO 83%

Robo3R: Enhancing Robotic Manipulation with Accurate Feed-Forward 3D Reconstruction

Robo3R:通过精确的前馈3D重建增强机器人操作

Sizhe Yang, Linning Xu, Hao Li, Juncheng Mu, Jia Zeng, Dahua Lin, Jiangmiao Pang

机构 * Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 三维重建 :3D reconstruction(title,abstract);point cloud(abstract);分类 cs.RO

AI总结 Robo3R通过前馈3D重建模型,直接从RGB图像和机器人状态实时预测高精度场景几何,提升机器人操作的精度与一致性。

Comments Published at Robotics: Science and Systems (RSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12237 2026-05-05 eess.IV 50%

Constructed Realities? Technical and Contextual Anomalies in a High-Profile Image

构建的现实?高关注度图像中的技术与语境异常

Matthias Wjst

专题命中 三维重建 :3D reconstruction(abstract)

AI总结 研究分析了一张广泛传播的图片中出现的不一致现象,指出其可能为数字合成,但因缺乏原始原件和证据链,无法得出确切结论。

Comments 45 pages, 11 figures, 44 references

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Gaussian Splatting 2 篇

2507.18713 2026-05-05 cs.CV cs.RO 85%

SaLF: Sparse Local Fields for Multi-Sensor Rendering in Real-Time

SaLF:用于实时多传感器渲染的稀疏局部场

Yun Chen, Matthew Haines, Jingkang Wang, Sahil Jain, Krzysztof Baron-Lis, Sivabalan Manivasagam, Ze Yang, Raquel Urtasun

机构 * Waabi University of Toronto(多伦多大学) University of Waterloo(滑铁卢大学)

专题命中 Gaussian Splatting :NeRF(abstract,abstract_cn);3DGS(abstract,abstract_cn);Gaussian Splatting(abstract);分类 cs.CV、cs.RO

AI总结 本文提出SaLF,一种高效的体素表示方法,支持多传感器仿真,具备快速训练和渲染能力,适用于多传感器自主系统评估。

Comments ICRA 2026. Project page: https://waabi.ai/salf/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01232 2026-05-05 cs.RO 77%

A Principled Approach for Creating High-fidelity Synthetic Demonstrations for Imitation Learning

为模仿学习创建高保真合成演示的原理性方法

Moniruzzaman Akash, Momotaz Begum

机构 * Spot mobile manipulator(Spot移动机械臂)

专题命中 Gaussian Splatting :3DGS(abstract,abstract_cn);Gaussian Splatting(abstract);分类 cs.RO

AI总结 本文提出基于动态运动基元的框架,通过保留专家轨迹结构生成多样化演示,实现高保真渲染与几何推理的统一。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 点云 2 篇

2605.01498 2026-05-05 cs.CV 57%

Towards Visual Query Localization in the 3D World

面向3D世界的视觉查询定位

Liang Peng, Bohan Tan, Zhipeng Zhang, Haobo Li, Yifan Jiao, Xingping Dong, Libo Zhang

机构 * Wuhan University(武汉大学) AutoLab, SAI, Shanghai Jiao Tong University(AutoLab、SAI、上海交通大学) Anyverse Dynamics University of Chinese Academy of Sciences(中国科学院大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文首次提出3D多模态视觉查询定位基准3DVQL,包含2002个序列和17万帧数据,通过点云、RGB图像和深度图像多模态数据提升研究灵活性,并提出LaF算法提升性能。

Comments Accepted to CVPR 2026. 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00837 2026-05-05 cs.LG 50%

Fast Log-Domain Sinkhorn Optimal Transport with Warp-Level GPU Reductions

快速对数域Sinkhorn最优传输与 warp 级 GPU 减少

Hao Xiao

机构 * ATLAS AI Lab(ATLAS人工智能实验室)

专题命中 点云 :point cloud(abstract)

AI总结 本文提出FastSinkhorn,通过warp级shuffle减少和共享内存分块实现高效GPU利用,解决小正则化参数下的数值不稳定性问题,实现12倍速度提升。

Comments 14 pages, 7 figures, code at https://github.com/xiao98/Fast-Sinkhorn-CUDA

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 空间理解 3 篇

2605.01365 2026-05-05 cs.CV cs.RO 62%

VoxAfford: Multi-Scale Voxel-Token Fusion for Open-Vocabulary 3D Affordance Detection

VoxAfford:多尺度体素-标记融合用于开放词汇3D affordance检测

Haowen Sun, Shaolong Zhang, Mingyang Li, Chengzhong Ma, Xinzhe Chen, Qiongjie Cui, Xingyu Chen, Zeyang Liu, Xuguang Lan

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(人机混合增强智能国家级实验室,人工智能与机器人研究所,西安交通大学)

专题命中 空间理解 :point cloud(abstract);分类 cs.CV、cs.RO

AI总结 本文提出VoxAfford,通过多尺度几何特征增强输出标记,提升3D affordance检测的定位精度,实验显示mIoU提升8%,并验证了零样本迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27437 2026-05-05 cs.CV 57%

SpatialStack: Layered Geometry-Language Fusion for 3D VLM Spatial Reasoning

SpatialStack:用于3D VLM空间推理的分层几何-语言融合

Jian Zhang, Shijie Zhou, Bangya Liu, Achuta Kadambi, Zhiwen Fan

机构 * XMU(厦门大学) UCLA(美国大学) Google(谷歌) UW-Madison(威斯康星大学麦迪逊分校) TAMU(德克萨斯农工大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 本文提出SpatialStack框架,通过分层融合视觉、几何和语言表征,提升3D空间推理能力,实验表明其在多个基准上表现优异。

Comments CVPR 2026, Project Website: https://spatial-stack.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07557 2026-05-05 cs.RO 57%

AutoSpatial: Visual-Language Reasoning for Social Robot Navigation through Efficient Spatial Reasoning Learning

AutoSpatial: 通过高效空间推理学习实现社交机器人导航的视觉-语言推理

Yangzhe Kong, Daeun Song, Jing Liang, Dinesh Manocha, Ziyu Yao, Xuesu Xiao

机构 * George Mason University(乔治·马歇尔大学) University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.RO

AI总结 本文提出AutoSpatial方法,通过结构化空间接地和大规模VQA对自动生成标签,提升VLMs在社交导航中的空间推理能力,实现更准确的空间感知、运动预测、推理、行动和解释。

详情

展开后加载摘要…

URL PDF HTML 收藏