arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

共收录 499 信号源:cs.CV, cs.GR, cs.RO

1. 空间理解 499 篇

2507.02029 2025-09-16 cs.RO 57%

RoboBrain 2.0 Technical Report

BAAI RoboBrain Team, Mingyu Cao, Huajie Tan, Yuheng Ji, Xiansheng Chen, Minglan Lin, Zhiyu Li, Zhou Cao, Pengwei Wang, Enshen Zhou, Yi Han, Yingbo Tang, Xiangqi Xu, Wei Guo, Yaoxu Lyu, Yijie Xu, Jiayu Shi, Mengfei Du, Cheng Chi, Mengdi Zhao, Xiaoshuai Hao, Junkai Zhao, Xiaojie Zhang, Shanyu Rong, Huaihai Lyu, Zhengliang Cai, Yankai Fu, Ning Chen, Bolun Zhang, Lingfeng Zhang, Shuyi Zhang, Dong Liu, Xi Feng, Songjing Wang, Xiaodan Liu, Yance Jiao, Mengsi Lyu, Zhuo Chen, Chenrui He, Yulong Ao, Xue Sun, Zheqi He, Jingshu Zheng, Xi Yang, Donghai Shi, Kunchang Xie, Bochao Zhang, Shaokai Nie, Chunlei Men, Yonghua Lin, Zhongyuan Wang, Tiejun Huang, Shanghang Zhang

机构 * BAAI RoboBrain Team(百度人工智能研究院RoboBrain团队)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01364 2025-09-03 cs.RO 57%

TopoNav: Topological Graphs as a Key Enabler for Advanced Object Navigation

Peiran Liu, Qiang Zhang, Daojie Peng, Lingfeng Zhang, Yihao Qin, Hang Zhou, Jun Ma, Renjing Xu, Yiding Ji

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Beijing Innovation Center of Humanoid Robotics Co., Ltd.(北京人形机器人创新中心有限公司) Shenzhen International Graduate School, Tsinghua University(深圳国际研究生学院,清华大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17439 2025-09-03 cs.CV 57%

Investigating Domain Gaps for Indoor 3D Object Detection

Zijing Zhao, Zhu Xu, Qingchao Chen, Yuxin Peng, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王宣计算机技术研究所) National Institute of Health Data Science, Peking University(北京大学国家健康数据科学研究院)

专题命中 空间理解 :point cloud(abstract);分类 cs.CV

Comments Accepted to ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15312 2025-09-03 cs.CV cs.AI 57%

Synergistic Dual Spatial-aware Generation of Image-to-Text and Text-to-Image

Yu Zhao, Hao Fei, Xiangtai Li, Libo Qin, Jiayi Ji, Hongyuan Zhu, Meishan Zhang, Min Zhang, Jianguo Wei

机构 * Tianjin University(天津大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Central South University(中南大学) I 2 R & CFAR, A*STAR(I 2 R与CFAR,A*STAR) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20488 2025-08-29 cs.CV 57%

Adaptive Dual Uncertainty Optimization: Boosting Monocular 3D Object Detection under Test-Time Shifts

Zixuan Hu, Dongxiao Li, Xinzhu Ma, Shixiang Tang, Xiaotong Li, Wenhan Yang, Ling-Yu Duan

机构 * School of Computer Science, Peking University(北京大学计算机学院) Peng Cheng Laboratory(鹏城实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

Comments Accepted by ICCV 2025 (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17595 2025-08-26 cs.CV 57%

TinyGiantVLM: A Lightweight Vision-Language Architecture for Spatial Reasoning under Resource Constraints

Vinh-Thuan Ly, Hoang M. Truong, Xuan-Huong Nguyen

机构 * University of Science, VNU-HCM(越南胡志明市国家大学) Vietnam National University(越南国家大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

Comments Accepted for presentation at the IEEE/CVF International Conference on Computer Vision (ICCV) Workshops, 2025

Journal ref IEEE/CVF International Conference on Computer Vision (ICCV) Workshops, Hawaii, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17259 2025-08-26 cs.CV cs.AI 57%

ResLink: A Novel Deep Learning Architecture for Brain Tumor Classification with Area Attention and Residual Connections

Sumedha Arya, Nirmal Gaud

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11350 2025-08-18 cs.CV 57%

HOID-R1: Reinforcement Learning for Open-World Human-Object Interaction Detection Reasoning with Multimodal Large Language Model

Zhenhao Zhang, Hanqing Wang, Xiangyu Zeng, Ziyu Cheng, Jiaxin Liu, Haoyu Yan, Zhirui Liu, Kaiyang Ji, Tianxiang Gui, Ke Hu, Kangyi Chen, Yahao Fan, Mokai Pan

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11058 2025-08-18 cs.CV cs.MM 57%

Advancing 3D Scene Understanding with MV-ScanQA Multi-View Reasoning Evaluation and TripAlign Pre-training Dataset

Wentao Mo, Qingchao Chen, Yuxin Peng, Siyuan Huang, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(计算机技术王先院,北京大学) National Institute of Health Data Science, Peking University(健康数据科学国家研究院,北京大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

专题命中 空间理解 :3D vision(abstract);分类 cs.CV

Comments Accepeted to ACM MM 25

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15485 2025-08-15 cs.CV cs.AI cs.CL 57%

CAPTURe: Evaluating Spatial Reasoning in Vision Language Models via Occluded Object Counting

Atin Pothiraj, Elias Stengel-Eskin, Jaemin Cho, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11055 2025-08-12 cs.CV 57%

Crane: Context-Guided Prompt Learning and Attention Refinement for Zero-Shot Anomaly Detection

Alireza Salehi, Mohammadreza Salehi, Reshad Hosseini, Cees G. M. Snoek, Makoto Yamada, Mohammad Sabokrou

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15384 2025-08-11 cs.CV cs.AI 57%

MetaOcc: Spatio-Temporal Fusion of Surround-View 4D Radar and Camera for 3D Occupancy Prediction with Dual Training Strategies

Long Yang, Lianqing Zheng, Wenjin Ai, Minghao Liu, Sen Li, Qunshu Lin, Shengyu Yan, Jie Bai, Zhixiong Ma, Tao Huang, Xichan Zhu

机构 * School of Automotive Studies, Tongji University(同济大学汽车学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) School of Automobile, Chang'an University(长安大学汽车学院) School of Information and Electrical Engineering, Hangzhou City University(杭州城市学院信息与电气工程学院) College of Science and Engineering, James Cook University(詹姆斯库克大学科学与工程学院)

专题命中 空间理解 :point cloud(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04059 2025-08-07 cs.CV 57%

Beyond the Visible: Benchmarking Occlusion Perception in Multimodal Large Language Models

Zhaochen Liu, Kaiwen Gao, Shuyi Liang, Bin Xiao, Limeng Qiao, Lin Ma, Tingting Jiang

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18450 2025-08-07 cs.CV 57%

3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding

Tatiana Zemskova, Dmitry Yudin

机构 * AIRI MIPT(莫斯科国立普希金俄语学院)

专题命中 空间理解 :3D vision(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.13922 2025-08-05 cs.RO cs.LG 57%

Equivariant Map and Agent Geometry for Autonomous Driving Motion Prediction

Yuping Wang, Jier Chen

机构 * University of Michigan(密歇根大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16072 2025-07-31 cs.CV 57%

Language Driven Occupancy Prediction

Zhu Yu, Bowen Pang, Lizhe Liu, Runmin Zhang, Qiang Li, Si-Yuan Cao, Maochun Luo, Mingxia Chen, Sheng Yang, Hui-Liang Shen

机构 * Zhejiang University(浙江大学) Unmanned Vehicle Dept., CaiNiao Inc., Alibaba Group(无人车辆部门,菜鸟公司,阿里巴巴集团) Ningbo Global Innovation Center, Zhejiang University(宁波全球创新中心,浙江大学)

专题命中 空间理解 :point cloud(abstract);分类 cs.CV

Comments ICCV 2025; Project Page: https://github.com/pkqbajng/LOcc

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20529 2025-07-29 cs.CV cs.AI 57%

Enhancing Spatial Reasoning through Visual and Textual Thinking

Xun Liang, Xin Guo, Zhongming Jin, Weihang Pan, Penghui Shang, Deng Cai, Binbin Lin, Jieping Ye

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09540 2025-07-28 cs.CV 57%

EmbodiedOcc++: Boosting Embodied 3D Occupancy Prediction with Plane Regularization and Uncertainty Sampler

Hao Wang, Xiaobao Wei, Xiaoan Zhang, Jianing Li, Chengyu Bai, Ying Li, Ming Lu, Wenzhao Zheng, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) School of electronic science and engineering, Nanjing University(电子科学与工程学院,南京大学) Berkeley Artificial Intelligence Research Lab, Department of EECS, University of California, Berkeley(伯克利人工智能研究实验室,电子工程与计算机科学系,加州大学伯克利分校)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18531 2025-07-25 cs.CV 57%

IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning

Tianheng Qiu, Jingchun Gao, Jingyu Li, Huiyi Leong, Xuan Huang, Xi Wang, Xiaocheng Zhang, Kele Xu, Lan Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Hefei Institutes of Physical Science,Chinese Academy of Sciences(合肥物理研究所,中国科学院) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(人工智能研究所,合肥综合性国家科学中心) State Key Lab. for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) University of Chicago(芝加哥大学) National University of Defense Technology(国防科技大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12916 2025-07-18 cs.CV cs.AI 57%

Argus: Leveraging Multiview Images for Improved 3-D Scene Understanding With Large Language Models

Yifan Xu, Chao Zhang, Hanqi Jiang, Xiaoyan Wang, Ruifei Ma, Yiwei Li, Zihao Wu, Zeju Li, Xiangde Liu

机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Beijing Digital Native Digital City Research Center(北京数字原生数字城市研究院) School of Computing, The University of Georgia(佐治亚大学计算机学院) School of Computer and Communication Engineering, University of Science and Technology Beijing(北京科技大学计算机与通信工程学院) Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学(深圳)计算机科学与工程系)

专题命中 空间理解 :point cloud(abstract);分类 cs.CV

Comments Accepted by TNNLS2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12795 2025-07-18 cs.CV cs.AI 57%

City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning

Penglei Sun, Yaoxian Song, Xiangru Zhu, Xiang Liu, Qiang Wang, Yue Liu, Changqun Xia, Tiefeng Li, Yang Yang, Xiaowen Chu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Zhejiang University(浙江大学) Fudan University(复旦大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Terminus Technologies Co., Ltd. Pengcheng Laboratory(鹏城实验室)

专题命中 空间理解 :point cloud(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.10527 2025-07-17 cs.CV 57%

SPOT: Scalable 3D Pre-training via Occupancy Prediction for Learning Transferable 3D Representations

Xiangchao Yan, Runjian Chen, Bo Zhang, Hancheng Ye, Renqiu Xia, Jiakang Yuan, Hongbin Zhou, Xinyu Cai, Botian Shi, Wenqi Shao, Ping Luo, Yu Qiao, Tao Chen, Junchi Yan

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学) School of Information Science and Technology(信息科学与技术学院) Fudan University(复旦大学) School of Artificial Intelligence(人工智能学院) Shanghai Jiao Tong University(上海交通大学)

专题命中 空间理解 :point cloud(abstract);分类 cs.CV

Comments SPOT has been accepted as a Regular Paper in T-PAMI, and code is available at https://github.com/PJLab-ADG/3DTrans

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01652 2025-07-03 cs.CV cs.AI cs.MM 57%

Autoregressive Image Generation with Linear Complexity: A Spatial-Aware Decay Perspective

Yuxin Mao, Zhen Qin, Jinxing Zhou, Hui Deng, Xuyang Shen, Bin Fan, Jing Zhang, Yiran Zhong, Yuchao Dai

机构 * Northwestern Polytechnical University(西北工业大学) TapTap OpenNLPLab Hefei University of Technology(合肥工业大学) Australian National University(澳大利亚国立大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21250 2025-06-27 cs.RO 57%

ACTLLM: Action Consistency Tuned Large Language Model

Jing Bi, Lianggong Bruce Wen, Zhang Liu, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) Corning Inc.(康宁公司)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19269 2025-06-26 cs.RO cs.AI 57%

AnchorDP3: 3D Affordance Guided Sparse Diffusion Policy for Robotic Manipulation

Ziyan Zhao, Ke Fan, He-Yang Xu, Ning Qiao, Bo Peng, Wenlong Gao, Dongjiang Li, Hui Shen

机构 * Jingdong Technology Information Technology Co., Ltd(京东科技信息技术有限公司) Tsinghua University(清华大学) Fudan University(复旦大学) Southeast University(东南大学) University of Science and Technology of China(中国科学技术大学)

专题命中 空间理解 :point cloud(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19498 2025-06-25 cs.RO cs.AI 57%

T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models

Yiteng Chen, Wenbo Li, Shiyi Wang, Huiping Zhuang, Qingyao Wu

机构 * School of Software Engineering, South China University of Technology(软件工程学院,华南理工大学) School of Future Technology, South China University of Technology(未来技术学院,华南理工大学) Shien-Ming Wu School of Intelligent Engineering, South China University of Technology(智能工程学院,华南理工大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.RO

Comments submitted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19312 2025-06-25 cs.CV cs.AI 57%

Capturing Fine-Grained Alignments Improves 3D Affordance Detection

Junsei Tokumitsu, Yuiga Wada

机构 * Keio AI Research Center(庆应AI研究中心)

专题命中 空间理解 :point cloud(abstract);分类 cs.CV

Comments MVA 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18385 2025-06-24 cs.CV 57%

InternSpatial: A Comprehensive Dataset for Spatial Reasoning in Vision-Language Models

Nianchen Deng, Lixin Gu, Shenglong Ye, Yinan He, Zhe Chen, Songze Li, Haomin Wang, Xingguang Wei, Tianshuo Yang, Min Dou, Tong He, Wenqi Shao, Kaipeng Zhang, Yi Wang, Botian Shi, Yanting Zhang, Jifeng Dai, Yu Qiao, Hongjie Zhang, Wenhai Wang

机构 * Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Donghua University(东华大学) Nanjing University(南京大学) Tsinghua University(清华大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13277 2025-06-18 cs.LG cs.AI cs.CL cs.CV 57%

SeqPE: Transformer with Sequential Position Encoding

Huayang Li, Yahui Liu, Hongyu Sun, Deng Cai, Leyang Cui, Wei Bi, Peilin Zhao, Taro Watanabe

机构 * Nara Institute of Science and Technology(奈良科学技术研究所) Kuaishou Technology(快手科技) Tencent(腾讯)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12982 2025-06-17 cs.CV 57%

DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer

Xiaoya Tang, Bodong Zhang, Man Minh Ho, Beatrice S. Knudsen, Tolga Tasdizen

机构 * Scientific Computing and Imaging Institute, University of Utah(科学计算与成像研究所,犹他大学) Kahlert School of Computing, University of Utah(计算学院,犹他大学) Electrical and Computer Engineering, University of Utah(电气与计算机工程,犹他大学) Department of Pathology, University of Utah(病理学系,犹他大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏