arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-06-23 至 2026-06-23 共收录 11 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 11 篇

2606.22787 2026-06-23 cs.CV 新提交 83%

Visual Geometry Transformer in the Wild: Distractor-Free 3D Reconstruction

野外视觉几何变换器:无干扰物的三维重建

Tianbo Pan, Xingyi Yang, Shizun Wang, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 三维重建 :3D reconstruction(title,abstract);point cloud(abstract);分类 cs.CV

AI总结 提出VGTW框架,通过干扰物感知训练策略分离并抑制干扰区域,实现从不一致视角进行鲁棒的三维重建,无需额外三维监督。

Comments Project page: https://tianbo-pan.github.io/vgt-w/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23688 2026-06-23 cs.CV 新提交 70%

Lift4D: Harmonizing Single-View 3D Estimation for 4D Reconstruction In-the-Wild

Lift4D: 协调单视图3D估计以实现野外4D重建

Yehonathan Litman, Xiaoxuan Ma, Manan Shah, Nicolas Ugrinovic, Kris Kitani, Fernando De la Torre, Shubham Tulsiani

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 三维重建 :Gaussian Splatting(abstract);3D reconstruction(abstract);分类 cs.CV

AI总结 提出Lift4D框架,通过因果潜在条件化单视图3D模型获得时域一致的初始化,再结合遮挡感知优化和扩散先验,实现从单目视频重建动态非刚体4D场景,显著优于现有方法。

Comments Webpage, Demos: https://lift4d.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08262 2026-06-23 cs.RO cs.AI cs.CV 版本更新 62%

CLAR: Learning 3D Representations for Robotic Manipulation by Fusing Masked Reconstruction with Multi-Level Contrastive Alignment

CLAR: 通过融合掩码重建与多层级对比对齐学习用于机器人操作的3D表示

Wenbo Cui, Chengyang Zhao, Yuhui Chen, Haoran Li, Zhizheng Zhang, Dongbin Zhao, He Wang

机构 * SKL-MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所SKL-MAIS) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Carnegie Mellon University(卡内基梅隆大学) Galbot CFCS, School of Computer Science, Peking University(北京大学计算机科学与技术学院CFCS)

专题命中 三维重建 :point cloud(abstract);分类 cs.CV、cs.RO

AI总结 提出CLAR框架,融合掩码自编码与全局跨模态对比学习,并引入基于可变形注意力的局部自适应对齐机制,解决3D预训练中空间几何与语义细节的权衡问题,在视觉运动策略学习中达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23653 2026-06-23 cs.CV 新提交 57%

Lightweight Neural Framework for Robust 3D Volume and Surface Estimation from Multi-View Images

轻量级神经框架:从多视图图像稳健估计3D体积和表面积

Diego E. Farchione, Ramzi Idoughi, Peter Wonka

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学)

专题命中 三维重建 :point cloud(abstract);分类 cs.CV

AI总结 提出一种全前馈框架,通过图解码器融合3D点云与2D特征,直接从多视图图像回归尺度归一化的体积、表面积及其不确定性,在稀疏视图下优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22856 2026-06-23 cs.CV 新提交 57%

G-MASt3R-SfM: Graph-based View Pruning and Multi-stage Optimization for Robust SfM

G-MASt3R-SfM:基于图的视图剪枝与多阶段优化实现鲁棒SfM

Toshiki Watanabe, Shintaro Ito, Natsuki Takama, Koichi Ito, Takafumi Aoki

机构 * Graduate School of Information Sciences, Tohoku University, Japan(东北大学信息科学研究生院)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 提出G-MASt3R-SfM管道,通过基于图的视图剪枝(GVP)和多阶段优化(MSO)模块,抑制非重叠图像对导致的错误匹配,在ETH3D数据集上实现相机位姿和三维重建的最先进精度。

Comments accepted to ICIP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22182 2026-06-23 cs.CV cs.AI 新提交 57%

Dual-Stream EEG Decoding for 3D Visual Perception

用于3D视觉感知的双流脑电解码

Ninon Lizé Masclef, Taisija Demcenko, Antonella Catanzaro, Nataliya Kosmyna

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 提出一种模仿生物视觉腹侧和背侧通路的双流脑电解码模型,通过圆形回归预测角度和EEG条件多视图扩散实现3D重建,揭示了时间动态的通道参与模式。

Comments 17 pages, 4 figures. Accepted at the Symmetry and Geometry in Neural Representations Workshop (NeurReps), NeurIPS 2025. To appear in Proceedings of Machine Learning Research (PMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21501 2026-06-23 cs.RO 新提交 57%

UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling

UniviewVLA:统一的多视图视觉-语言-动作模型与世界建模

Tao Xu, Runhao Zhang, Zhijian Huang, Jiayi Guan, Jiaxin Wang, Yifan Ding, Yong-Lu Li, Long Chen, Guang Chen, Jinghui Lu

机构 * Tongji University(同济大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Xiaomi EV(小米汽车)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.RO

AI总结 提出UniviewVLA,利用世界模型生成多视图未来帧,从标准双摄像头观测中预测动作,解决遮挡问题,无需额外硬件或显式重建,并通过运动信息令牌压缩和动作熵视图选择提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21027 2026-06-23 cs.CV 新提交 57%

Self-Supervised Dual-Frequency Phase Decomposition for Single-Shot Composite Fringe Projection Profilometry

自监督双频相位分解用于单帧复合条纹投影轮廓术

Jin-Hyuk Seok, Yatong An, Jae-Sang Hyun

机构 * Department of Mechanical Engineering, Yonsei University(延世大学机械工程系) Yonsei Institute for Embodied Intelligence, Yonsei University(延世大学具身智能研究所) Meta Reality Labs

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 提出自监督双频相位细化框架,利用低高频相位梯度关系及软边缘一致性损失,实现无标签的单帧复合条纹3D重建,精度优于变换方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07690 2026-06-23 cs.CV 版本更新 57%

FrameVGGT: Coherence-Preserving Memory for Bounded Streaming Geometry

FrameVGGT:几何对齐的帧级内存用于有界流式VGGT

Zhisong Xu, Takeshi Oishi

机构 * Institute of Industrial Science(工业科学研究所) The University of Tokyo(东京大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 FrameVGGT从几何支持角度重新审视有界内存流式处理,通过组织帧级增量KV贡献为连贯段,实现稳定几何支持与内存平衡。

Comments 23pages including appendix checklist

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03962 2026-06-23 cs.CV 版本更新 57%

A Linear Fractional Transformation Model and Calibration Method for Light Field Camera

光场相机的线性分式变换模型与标定方法

Zhong Chen, Changfeng Chen

机构 * School of Mechanical and Automotive Engineering, South China University of Technology(机械与自动化工程学院,华南理工大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 提出一种线性分式变换模型,通过单一参数解耦主透镜与微透镜阵列成像,实现独立标定,在物理与模拟数据集上达到2.1%的平均平移误差,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18276 2026-06-23 cs.RO cs.AI 版本更新 57%

GAPartManip: A Large-scale Part-centric Dataset for Material-Agnostic Articulated Object Manipulation

GAPartManip:面向材料无关铰接物体操作的大规模部件中心数据集

Wenbo Cui, Chengyang Zhao, Songlin Wei, Jiazhao Zhang, Haoran Geng, Yaran Chen, Haoran Li, He Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) CFCS, School of Computer Science, Peking University(北京大学计算机科学系) Carnegie Mellon University(卡内基梅隆大学) University of California, Berkeley(加州大学伯克利分校) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) Galbot

专题命中 三维重建 :3D vision(abstract);分类 cs.RO

AI总结 提出大规模部件中心数据集GAPartManip,结合照片级材质随机化和部件级交互姿态标注,通过模块化框架提升深度估计与交互姿态预测,在仿真和真实场景中实现鲁棒的铰接物体操作。

Comments Accepted by ICRA 2025. Project page: https://pku-epic.github.io/GAPartManip/

详情

展开后加载摘要…

URL PDF HTML 收藏