arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

共收录 499 信号源:cs.CV, cs.GR, cs.RO

1. 空间理解 499 篇

2502.06338 2025-02-11 cs.CV 57%

Zero-shot Depth Completion via Test-time Alignment with Affine-invariant Depth Prior

Lee Hyoseok, Kyeong Seon Kim, Kwon Byung-Ki, Tae-Hyun Oh

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

Comments AAAI 2025, Project page: https://hyoseok1223.github.io/zero-shot-depth-completion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01292 2025-02-04 cs.CV 57%

LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences

Hongyan Zhi, Peihao Chen, Junyan Li, Shuailei Ma, Xinyu Sun, Tianhang Xiang, Yinjie Lei, Mingkui Tan, Chuang Gan

专题命中 空间理解 :3D vision(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11409 2025-01-16 cs.CV cs.AI cs.MM 57%

Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech

Rui Liu, Shuwei He, Yifan Hu, Haizhou Li

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

Comments 9 pages,2 figures, Accepted by AAAI'2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07819 2025-01-15 cs.CV 57%

3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding

Haomiao Xiong, Yunzhi Zhuge, Jiawen Zhu, Lu Zhang, Huchuan Lu

专题命中 空间理解 :point cloud(abstract);分类 cs.CV

Comments Accepted to IEEE Transactions on Multimedia (TMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14965 2025-01-14 cs.CV cs.AI cs.CL 57%

Movie2Story: A framework for understanding videos and telling stories in the form of novel text

Kangning Li, Zheyang Jia, Anyu Ying

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20927 2024-12-31 cs.CV 57%

Enhanced Multimodal RAG-LLM for Accurate Visual Question Answering

Junxiao Xue, Quan Deng, Fei Yu, Yanhao Wang, Jun Wang, Yuehua Li

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

Comments 6 pages, 3 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20473 2024-12-31 cs.CV 57%

Toward Scene Graph and Layout Guided Complex 3D Scene Generation

Yu-Hsiang Huang, Wei Wang, Sheng-Yu Huang, Yu-Chiang Frank Wang

专题命中 空间理解 :3D generation(abstract);分类 cs.CV

Comments 13 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05985 2024-12-30 cs.RO 57%

Topo-Field: Topometric mapping with Brain-inspired Hierarchical Layout-Object-Position Fields

Jiawei Hou, Wenhao Guan, Longfei Liang, Jianfeng Feng, Xiangyang Xue, Taiping Zeng

专题命中 空间理解 :3D reconstruction(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13772 2024-12-19 cs.CV 57%

An Efficient Occupancy World Model via Decoupled Dynamic Flow and Image-assisted Training

Haiming Zhang, Ying Xue, Xu Yan, Jiacheng Zhang, Weichao Qiu, Dongfeng Bai, Bingbing Liu, Shuguang Cui, Zhen Li

专题命中 空间理解 :point cloud(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11198 2024-12-17 cs.CV 57%

GEM: A Generalizable Ego-Vision Multimodal World Model for Fine-Grained Ego-Motion, Object Dynamics, and Scene Composition Control

Mariam Hassan, Sebastian Stapf, Ahmad Rahimi, Pedro M B Rezende, Yasaman Haghighi, David Brüggemann, Isinsu Katircioglu, Lin Zhang, Xiaoran Chen, Suman Saha, Marco Cannici, Elie Aljalbout, Botao Ye, Xi Wang, Aram Davtyan, Mathieu Salzmann, Davide Scaramuzza, Marc Pollefeys, Paolo Favaro, Alexandre Alahi

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08388 2024-12-12 cs.CV 57%

LOMA: Language-assisted Semantic Occupancy Network via Triplane Mamba

Yubo Cui, Zhiheng Li, Jiaqiang Wang, Zheng Fang

专题命中 空间理解 :3D vision(abstract);分类 cs.CV

Comments Accepted by AAAI2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12177 2024-11-20 cs.CV 57%

Robust 3D Semantic Occupancy Prediction with Calibration-free Spatial Transformation

Zhuangwei Zhuang, Ziyin Wang, Sitao Chen, Lizhao Liu, Hui Luo, Mingkui Tan

专题命中 空间理解 :point cloud(abstract);分类 cs.CV

Comments 13 pages, 11 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10370 2024-11-19 cs.CV 57%

Grounded 3D-LLM with Referent Tokens

Yilun Chen, Shuai Yang, Haifeng Huang, Tai Wang, Runsen Xu, Ruiyuan Lyu, Dahua Lin, Jiangmiao Pang

专题命中 空间理解 :3D vision(abstract);分类 cs.CV

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06048 2024-11-12 cs.CV cs.AI 57%

An Empirical Analysis on Spatial Reasoning Capabilities of Large Multimodal Models

Fatemeh Shiri, Xiao-Yu Guo, Mona Golestan Far, Xin Yu, Gholamreza Haffari, Yuan-Fang Li

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03540 2024-11-07 cs.RO 57%

VLA-3D: A Dataset for 3D Semantic Scene Understanding and Navigation

Haochen Zhang, Nader Zantout, Pujith Kachana, Zongyuan Wu, Ji Zhang, Wenshan Wang

专题命中 空间理解 :point cloud(abstract);分类 cs.RO

Comments Accepted and presented at the 1st Workshop on Semantic Reasoning and Goal Understanding in Robotics (SemRob), Robotics Science and Systems Conference (RSS 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19079 2024-10-30 cs.CV cs.LG 57%

BIFRÖST: 3D-Aware Image compositing with Language Instructions

Lingxiao Li, Kaixiong Gong, Weihong Li, Xili Dai, Tao Chen, Xiaojun Yuan, Xiangyu Yue

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

Comments NeurIPS 2024, Code Available: https://github.com/lingxiao-li/Bifrost

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.01107 2024-10-17 cs.RO cs.MA cs.SY eess.SY 57%

CoViS-Net: A Cooperative Visual Spatial Foundation Model for Multi-Robot Applications

Jan Blumenkamp, Steven Morad, Jennifer Gielis, Amanda Prorok

专题命中 空间理解 :spatial understanding(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01584 2024-10-16 cs.CV 57%

SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models

An-Chieh Cheng, Hongxu Yin, Yang Fu, Qiushan Guo, Ruihan Yang, Jan Kautz, Xiaolong Wang, Sifei Liu

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

Comments NeurIPS 2024, Project Page: https://www.anjiecheng.me/SpatialRGPT

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10319 2024-10-15 cs.CV cs.MM 57%

Spatial-Aware Efficient Projector for MLLMs via Multi-Layer Feature Aggregation

Shun Qian, Bingquan Liu, Chengjie Sun, Zhen Xu, Baoxun Wang

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04576 2024-09-10 cs.RO cs.AI 57%

ActionFlow: Equivariant, Accurate, and Efficient Policies with Spatially Symmetric Flow Matching

Niklas Funk, Julen Urain, Joao Carvalho, Vignesh Prasad, Georgia Chalvatzaki, Jan Peters

专题命中 空间理解 :spatial understanding(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14594 2024-08-28 cs.CV 57%

MMR: Evaluating Reading Ability of Large Multimodal Models

Jian Chen, Ruiyi Zhang, Yufan Zhou, Ryan Rossi, Jiuxiang Gu, Changyou Chen

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06926 2024-08-14 cs.CV 57%

SceneGPT: A Language Model for 3D Scene Understanding

Shivam Chandhok

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

Comments UBC Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02718 2024-08-07 cs.CV 57%

MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models

Fanqing Meng, Jin Wang, Chuanhao Li, Quanfeng Lu, Hao Tian, Jiaqi Liao, Xizhou Zhu, Jifeng Dai, Yu Qiao, Ping Luo, Kaipeng Zhang, Wenqi Shao

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

Comments Project Page: https://mmiu-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15771 2024-07-23 cs.RO cs.AI 57%

Local Occupancy-Enhanced Object Grasping with Multiple Triplanar Projection

Kangqi Ma, Hao Dong, Yadong Mu

专题命中 空间理解 :point cloud(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13920 2024-07-22 cs.CV cs.AI 57%

DuoFormer: Leveraging Hierarchical Visual Representations by Local and Global Attention

Xiaoya Tang, Bodong Zhang, Beatrice S. Knudsen, Tolga Tasdizen

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00609 2024-07-02 cs.CV cs.LG 57%

ESGNN: Towards Equivariant Scene Graph Neural Network for 3D Scene Understanding

Quang P. M. Pham, Khoi T. N. Nguyen, Lan C. Ngo, Truong Do, Truong Son Hy

专题命中 空间理解 :point cloud(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.01442 2024-07-02 cs.RO eess.SP 57%

Deformable Radar Polygon: A Lightweight and Predictable Occupancy Representation for Short-range Collision Avoidance

Gao Xiangyu, Ding Sihao, Dasari Harshavardhan Reddy

专题命中 空间理解 :point cloud(abstract);分类 cs.RO

Comments 11 pages

Journal ref IEEE Sensors Journal 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09418 2024-06-14 cs.CV 57%

VideoGPT+: Integrating Image and Video Encoders for Enhanced Video Understanding

Muhammad Maaz, Hanoona Rasheed, Salman Khan, Fahad Khan

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.03866 2024-06-07 cs.CV 57%

LLplace: The 3D Indoor Scene Layout Generation and Editing via Large Language Model

Yixuan Yang, Junru Lu, Zixiang Zhao, Zhen Luo, James J. Q. Yu, Victor Sanchez, Feng Zheng

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17005 2024-05-24 cs.CV 57%

MVBench: A Comprehensive Multi-modal Video Understanding Benchmark

Kunchang Li, Yali Wang, Yinan He, Yizhuo Li, Yi Wang, Yi Liu, Zun Wang, Jilan Xu, Guo Chen, Ping Luo, Limin Wang, Yu Qiao

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

Comments CVPR 2024 highlight: updated version with Mistral and better performances for MVBench/NExT-QA/STAR/TVQA/EgoSchema/IntentQA

详情

展开后加载摘要…

URL PDF HTML 收藏