arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

共收录 497 信号源:cs.CV, cs.GR, cs.RO

1. 空间理解 497 篇

2511.16454 2025-11-21 cs.CV 57%

LLaVA$^3$: Representing 3D Scenes like a Cubist Painter to Boost 3D Scene Understanding of VLMs

LLaVA$^3$:像立体主义画家一样表示3D场景以提升VLM的3D场景理解

Doriand Petit, Steve Bourgeois, Vincent Gay-Bellile, Florian Chabot, Loïc Barthe

专题命中 空间理解 :3D reconstruction(abstract);分类 cs.CV

AI总结 LLaVA$^3$通过立体主义方法提升VLM对3D场景的理解能力,利用多视角2D图像无需微调实现更优的3D场景理解。

Comments Accepted at AAAI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15333 2025-11-20 cs.RO 57%

C2F-Space: Coarse-to-Fine Space Grounding for Spatial Instructions using Vision-Language Models

Nayoung Oh, Dohyun Kim, Junhyeong Bang, Rohan Paul, Daehyung Park

专题命中 空间理解 :spatial understanding(abstract);分类 cs.RO

Comments 16 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22242 2025-11-19 cs.CV 57%

4D-VLA: Spatiotemporal Vision-Language-Action Pretraining with Cross-Scene Calibration

Jiahui Zhang, Yurui Chen, Yueming Xu, Ze Huang, Yanpeng Zhou, Yu-Jie Yuan, Xinyue Cai, Guowei Huang, Xingyue Quan, Hang Xu, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13798 2025-11-19 cs.AI cs.CV cs.LG 57%

KANGURA: Kolmogorov-Arnold Network-Based Geometry-Aware Learning with Unified Representation Attention for 3D Modeling of Complex Structures

Mohammad Reza Shafie, Morteza Hajiabadi, Hamed Khosravi, Mobina Noori, Imtiaz Ahmed

机构 * Department of Electrical Engineering, Iran University of Science and Technology(伊朗科学技术大学电气工程系) Department of Computer Engineering, Iran University of Science and Technology(伊朗科学技术大学计算机工程系) Department of Industrial & Management Systems Engineering, West Virginia University(西弗吉尼亚大学工业与管理系统工程系) H. Milton Stewart School of Industrial and Systems Engineering, Georgia Institute of Technology(佐治亚理工学院H.米尔顿·斯图尔特工业与系统工程学院) Department of Computer Science, University of California, Davis(加州大学戴维斯分校计算机科学系)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17663 2025-11-17 cs.CV 57%

Cam4DOcc: Benchmark for Camera-Only 4D Occupancy Forecasting in Autonomous Driving Applications

Junyi Ma, Xieyuanli Chen, Jiawei Huang, Jingyi Xu, Zhen Luo, Jintao Xu, Weihao Gu, Rui Ai, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) HAOMO.AI Technology Co., Ltd.(HAOMO.AI技术有限公司) National University of Defense Technology(国防科技大学) Beijing Institute of Technology(北京理工大学)

专题命中 空间理解 :point cloud(abstract);分类 cs.CV

Comments Accepted to CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21538 2025-11-14 cs.CV cs.AI 57%

Caption This, Reason That: VLMs Caught in the Middle

Zihan Weng, Lucas Gomez, Taylor Whittington Webb, Pouya Bashivan

机构 * Integrated Program in Neuroscience (IPN) McGill University(神经科学联合计划 麦吉尔大学) Mila, University of Montreal(蒙特利尔大学Mila) Microsoft Research USA(微软研究院美国总部) Department of Physiology McGill University(生理学系 麦吉尔大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

Comments Paper accepted by nips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05936 2025-11-11 cs.RO cs.AI 57%

10 Open Challenges Steering the Future of Vision-Language-Action Models

Soujanya Poria, Navonil Majumder, Chia-Yu Hung, Amir Ali Bagherzadeh, Chuan Li, Kenneth Kwok, Ziwei Wang, Cheston Tan, Jiajun Wu, David Hsu

专题命中 空间理解 :spatial understanding(abstract);分类 cs.RO

Comments AAAI 2026 (Senior Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04976 2025-11-10 cs.RO 57%

iFlyBot-VLM Technical Report

Xin Nie, Zhiyuan Cheng, Yuan Zhang, Chao Ji, Jiajia Wu, Yuhan Zhang, Jia Pan

机构 * iFlyTek Reasearch and Development Group(iFlyTek 研发部)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10509 2025-11-04 cs.CV cs.LG 57%

TESGNN: Temporal Equivariant Scene Graph Neural Networks for Efficient and Robust Multi-View 3D Scene Understanding

Quang P. M. Pham, Khoi T. N. Nguyen, Lan C. Ngo, Truong Do, Dezhen Song, Truong-Son Hy

机构 * Department of Robotics(机器人学系) Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎伊德人工智能大学) College of Engineering and Computer Science(工程与计算机科学学院) VinUniversity(文大学) Department of Computer Science(计算机科学系) The University of Alabama at Birmingham(阿拉巴马大学伯明翰分校)

专题命中 空间理解 :point cloud(abstract);分类 cs.CV

Comments arXiv admin note: text overlap with arXiv:2407.00609

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05051 2025-10-27 cs.CV 57%

SegMASt3R: Geometry Grounded Segment Matching

Rohit Jayanti, Swayam Agrawal, Vansh Garg, Siddharth Tourani, Muhammad Haris Khan, Sourav Garg, Madhava Krishna

机构 * IIIT Hyderabad(海得拉巴印度理工学院) University of Heidelberg(海德堡大学) MBZUAI

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

Comments Accepted to The 39th Annual Conference on Neural Information Processing Systems (NeurIPS 2025) as a Spotlight (top 3.5%)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08636 2025-10-20 cs.CV cs.AI 57%

Spatial457: A Diagnostic Benchmark for 6D Spatial Reasoning of Large Multimodal Models

Xingrui Wang, Wufei Ma, Tiezheng Zhang, Celso M de Melo, Jieneng Chen, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

Comments Published in CVPR 2025 as Highlight. Data and code are released at https://github.com/XingruiWang/Spatial457

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13375 2025-10-16 cs.CV 57%

DepthVLA: Enhancing Vision-Language-Action Models with Depth-Aware Spatial Reasoning

Tianyuan Yuan, Yicheng Liu, Chenhao Lu, Zhuoguang Chen, Tao Jiang, Hang Zhao

机构 * IIIS, Tsinghua University(清华大学智能技术学部)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12095 2025-10-15 cs.CV 57%

IL3D: A Large-Scale Indoor Layout Dataset for LLM-Driven 3D Scene Generation

Wenxu Zhou, Kaixuan Nie, Hang Du, Dong Yin, Wei Huang, Siqiang Guo, Xiaobo Zhang, Pengbo Hu

机构 * University of Science and Technology of China(中国科学技术大学) Songying Technology(宋英科技)

专题命中 空间理解 :point cloud(abstract);分类 cs.CV

Comments 9 pages main paper; 15 pages references and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08531 2025-10-10 cs.CV cs.AI cs.CL 57%

SpatialLadder: Progressive Training for Spatial Reasoning in Vision-Language Models

Hongxing Li, Dingming Li, Zixuan Wang, Yuchen Yan, Hang Wu, Wenqi Zhang, Yongliang Shen, Weiming Lu, Jun Xiao, Yueting Zhuang

机构 * Zhejiang University(浙江大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

Comments Project Page: https://zju-real.github.io/SpatialLadder/ Code: https://github.com/ZJU-REAL/SpatialLadder

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13367 2025-10-09 cs.RO 57%

Uncertainty-Informed Active Perception for Open Vocabulary Object Goal Navigation

Utkarsh Bajpai, Julius Rückin, Cyrill Stachniss, Marija Popović

机构 * Center for Robotics, University of Bonn(波恩大学机器人中心) MAVLab, TU Delft(代尔夫特理工大学MAVLab) Lamarr Institute for Machine Learning and Artificial Intelligence(机器学习与人工智能拉马尔研究所)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.RO

Comments 7 pages, 3 figures

Journal ref Proceedings of the 2025 European Conference on Mobile Robots (ECMR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03441 2025-10-07 cs.CV cs.AI cs.LG 57%

Spatial-ViLT: Enhancing Visual Spatial Reasoning through Multi-Task Learning

Chashi Mahiul Islam, Oteo Mamo, Samuel Jacob Chacko, Xiuwen Liu, Weikuan Yu

机构 * Florida State University(佛罗里达州立大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02464 2025-10-06 cs.RO cs.HC 57%

ERUPT: An Open Toolkit for Interfacing with Robot Motion Planners in Extended Reality

Isaac Ngui, Courtney McBeth, André Santos, Grace He, Katherine J. Mimnaugh, James D. Motes, Luciano Soares, Marco Morales, Nancy M. Amato

机构 * Parasol Lab, Siebel School of Computing and Data Science, University of Illinois Urbana-Champaign(Parasol实验室,Siebel计算与数据科学学院,伊利诺伊大学厄巴纳-香槟分校) Insper Department of Computer Science at Instituto Tecnológico Autónomo de México (ITAM)(墨西哥自主技术学院计算机科学系)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16162 2025-10-03 cs.CV cs.CL 57%

Sparkle: Mastering Basic Spatial Capabilities in Vision Language Models Elicits Generalization to Spatial Reasoning

Yihong Tang, Ao Qu, Zhaokai Wang, Dingyi Zhuang, Zhaofeng Wu, Wei Ma, Shenhao Wang, Yunhan Zheng, Zhan Zhao, Jinhua Zhao

机构 * McGill University(麦吉尔大学) Massachusetts Institute of Technology(麻省理工学院) Shanghai Jiao Tong University(上海交通大学) The Hong Kong Polytechnic University(香港理工大学) University of Florida(佛罗里达大学) The University of Hong Kong(香港大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25966 2025-10-01 cs.RO 57%

MUVLA: Learning to Explore Object Navigation via Map Understanding

Peilong Han, Fan Jia, Min Zhang, Yutao Qiu, Hongyao Tang, Yan Zheng, Tiancai Wang, Jianye Hao

机构 * Dexmal

专题命中 空间理解 :spatial understanding(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06266 2025-10-01 cs.CV 57%

Spatial Reasoning with Vision-Language Models in Ego-Centric Multi-View Scenes

Mohsen Gholami, Ahmad Rezaei, Zhou Weimin, Sitong Mao, Shunbo Zhou, Yong Zhang, Mohammad Akbari

机构 * Huawei Technologies Canada(华为技术加拿大分公司) Huawei Cloud Project Page Code Ego3D-Bench(华为云项目页面代码Ego3D-Bench)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25190 2025-09-30 cs.CV 57%

Visual Jigsaw Post-Training Improves MLLMs

Penghao Wu, Yushan Zhang, Haiwen Diao, Bo Li, Lewei Lu, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) Linköping University(_linköping大学) SenseTime Research(商汤科技研究院)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21388 2025-09-29 cs.CV eess.IV 57%

TUN3D: Towards Real-World Scene Understanding from Unposed Images

Anton Konushin, Nikita Drozdov, Bulat Gabdullin, Alexey Zakharov, Anna Vorontsova, Danila Rukhovich, Maksim Kolodiazhnyi

机构 * Lomonosov Moscow State University(罗蒙诺索夫莫斯科国立大学) Higher School of Economics(高等经济学院) Institute of Mechanics, Armenia(亚美尼亚力学研究所)

专题命中 空间理解 :point cloud(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19973 2025-09-26 cs.CV 57%

OmniScene: Attention-Augmented Multimodal 4D Scene Understanding for Autonomous Driving

Pei Liu, Hongliang Lu, Haichao Liu, Haipeng Liu, Xin Liu, Ruoyu Yao, Shengbo Eben Li, Jun Ma

机构 * The Hong Kong University of Science and Technology(香港科技大学) Li Auto Inc. the School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动系统学院)

专题命中 空间理解 :3D reconstruction(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18778 2025-09-24 cs.RO cs.AI 57%

VGGT-DP: Generalizable Robot Control via Vision Foundation Models

Shijia Ge, Yinxin Zhang, Shuzhao Xie, Weixiang Zhang, Mingcai Zhou, Zhi Wang

专题命中 空间理解 :spatial understanding(abstract);分类 cs.RO

Comments submitted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17664 2025-09-23 cs.CV cs.AI 57%

SD-VLM: Spatial Measuring and Understanding with Depth-Encoded Vision-Language Models

Pingyi Chen, Yujing Lou, Shen Cao, Jinhui Guo, Lubin Fan, Yue Wu, Lin Yang, Lizhuang Ma, Jieping Ye

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Alibaba Cloud Computing(阿里云 computing) Shanghai Jiao Tong University(上海交通大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07842 2025-09-23 cs.RO cs.AI 57%

DETACH: Cross-domain Learning for Long-Horizon Tasks via Mixture of Disentangled Experts

Yutong Shen, Hangxu Liu, Lei Zhang, Penghui Liu, Ruizhe Xia, Tianyi Yao, Tongtong Feng

机构 * Beijing University of Technology(北京理工大学) Fudan University(复旦大学) University of Hamburg(汉堡大学) Tsinghua University(清华大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.RO

Comments 14 pages,8 figures. Submitted to ICRA'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15880 2025-09-22 cs.RO 57%

Improving Robotic Manipulation with Efficient Geometry-Aware Vision Encoder

An Dinh Vuong, Minh Nhat Vu, Ian Reid

机构 * Department of Computer Vision, Mohammed bin Zayed University of Artificial Intelligence(计算机视觉系,穆罕默德·本·扎耶德人工智能大学) AIT Austrian Institute of Technology GmbH(奥地利技术研究所)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.RO

Comments 9 figures, 7 tables. Project page: https://evggt.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18131 2025-09-18 cs.CV 57%

UniPLV: Towards Label-Efficient Open-World 3D Scene Understanding by Regional Visual Language Supervision

Yuru Wang, Pei Liu, Songtao Wang, Zehan Zhang, Xinyan Lu, Changwei Cai, Hao Li, Fu Liu, Peng Jia, Xianpeng Lang

机构 * Li Auto Inc.(力汽车公司) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 空间理解 :point cloud(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02029 2025-09-16 cs.RO 57%

RoboBrain 2.0 Technical Report

BAAI RoboBrain Team, Mingyu Cao, Huajie Tan, Yuheng Ji, Xiansheng Chen, Minglan Lin, Zhiyu Li, Zhou Cao, Pengwei Wang, Enshen Zhou, Yi Han, Yingbo Tang, Xiangqi Xu, Wei Guo, Yaoxu Lyu, Yijie Xu, Jiayu Shi, Mengfei Du, Cheng Chi, Mengdi Zhao, Xiaoshuai Hao, Junkai Zhao, Xiaojie Zhang, Shanyu Rong, Huaihai Lyu, Zhengliang Cai, Yankai Fu, Ning Chen, Bolun Zhang, Lingfeng Zhang, Shuyi Zhang, Dong Liu, Xi Feng, Songjing Wang, Xiaodan Liu, Yance Jiao, Mengsi Lyu, Zhuo Chen, Chenrui He, Yulong Ao, Xue Sun, Zheqi He, Jingshu Zheng, Xi Yang, Donghai Shi, Kunchang Xie, Bochao Zhang, Shaokai Nie, Chunlei Men, Yonghua Lin, Zhongyuan Wang, Tiejun Huang, Shanghang Zhang

机构 * BAAI RoboBrain Team(百度人工智能研究院RoboBrain团队)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01364 2025-09-03 cs.RO 57%

TopoNav: Topological Graphs as a Key Enabler for Advanced Object Navigation

Peiran Liu, Qiang Zhang, Daojie Peng, Lingfeng Zhang, Yihao Qin, Hang Zhou, Jun Ma, Renjing Xu, Yiding Ji

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Beijing Innovation Center of Humanoid Robotics Co., Ltd.(北京人形机器人创新中心有限公司) Shenzhen International Graduate School, Tsinghua University(深圳国际研究生学院,清华大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏