arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

共收录 107 信号源:cs.CV, cs.GR, cs.RO

1. 其他3D视觉 107 篇

2501.16698 2025-01-29 cs.CL cs.CV cs.RO 81%

3D-MoE: A Mixture-of-Experts Multi-modal LLM for 3D Vision and Pose Diffusion via Rectified Flow

Yueen Ma, Yuzheng Zhuang, Jianye Hao, Irwin King

专题命中 其他3D视觉 :3D vision(title,abstract);分类 cs.CV、cs.RO

Comments Preprint. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05579 2026-08-07 cs.RO 新提交 79%

ARGUS: Aligning Robot Scene Geometry Under Shifting Views with Large 3D Vision Models

ARGUS:利用大规模3D视觉模型在视角变化下对齐机器人场景几何结构

Rishik Sathua, Haonan Chen, Katherine Driggs-Campbell

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Harvard University(哈佛大学)

专题命中 其他3D视觉 :3D vision(title,abstract);分类 cs.RO

AI总结 本研究提出ARGUS,一种利用大规模3D视觉模型对齐机器人场景几何结构的观测预处理流水线,可提升机器人操纵策略在视角多样化场景下的性能与学习效率。

Comments Project webpage: https://rsathua.github.io/ARGUS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09935 2026-03-24 cs.CV 79%

LEO-VL: Efficient Scene Representation for Scalable 3D Vision-Language Learning

LEO-VL:面向可扩展3D视觉-语言学习的高效场景表示

Jiangyong Huang, Xiaojian Ma, Xiongkun Linghu, Junchao He, Qing Li, Song-Chun Zhu, Yixin Chen, Baoxiong Jia, Siyuan Huang

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 其他3D视觉 :3D vision(title,abstract);分类 cs.CV

AI总结 本文提出LEO-VL,一种基于高效场景表示CFG的3D视觉-语言模型,通过改进训练数据和引入SceneDPO提升鲁棒性,在多个3D-VL基准测试中取得最佳性能。

Comments Project page: https://leo-vl.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00545 2026-03-03 cs.CV 79%

Multiple Inputs and Mixwd data for Alzheimer's Disease Classification Based on 3D Vision Transformer

基于3D视觉变换器的阿尔茨海默病分类的多输入和混合数据

Juan A. Castro-Silva, Maria N. Moreno Garcia, Diego H. Peluffo-Ordoñez

专题命中 其他3D视觉 :3D vision(title,abstract);分类 cs.CV

AI总结 本研究提出MIMD-3DVT方法,通过多输入和混合数据提升阿尔茨海默病分类准确率至97.14%

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05091 2025-04-28 cs.CV 79%

DCFormer: Efficient 3D Vision-Language Modeling with Decomposed Convolutions

Gorkem Can Ates, Yu Xin, Kuang Gong, Wei Shao

机构 * Department of Medicine, University of Florida(医学系,佛罗里达大学) Department of Electrical and Computer Engineering, University of Florida(电气与计算机工程系,佛罗里达大学) Department of Biomedical Engineering, University of Florida(生物医学工程系,佛罗里达大学) Intelligent Clinical Care Center, University of Florida(智能临床护理中心,佛罗里达大学)

专题命中 其他3D视觉 :3D vision(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22420 2025-04-02 cs.CV 79%

Unveiling the Mist over 3D Vision-Language Understanding: Object-centric Evaluation with Chain-of-Analysis

Jiangyong Huang, Baoxiong Jia, Yan Wang, Ziyu Zhu, Xiongkun Linghu, Qing Li, Song-Chun Zhu, Siyuan Huang

专题命中 其他3D视觉 :3D vision(title,abstract);分类 cs.CV

Comments CVPR 2025. Project page: https://beacon-3d.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.06084 2024-07-09 cs.CV 79%

3D Vision and Language Pretraining with Large-Scale Synthetic Data

Dejie Yang, Zhu Xu, Wentao Mo, Qingchao Chen, Siyuan Huang, Yang Liu

专题命中 其他3D视觉 :3D vision(title,abstract);分类 cs.CV

Comments accepted by IJCAI2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14760 2024-07-04 cs.CV 79%

Can 3D Vision-Language Models Truly Understand Natural Language?

Weipeng Deng, Jihan Yang, Runyu Ding, Jiahui Liu, Yijiang Li, Xiaojuan Qi, Edith Ngai

专题命中 其他3D视觉 :3D vision(title,abstract);分类 cs.CV

Comments https://github.com/VincentDENGP/3D-LR

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07544 2024-06-27 cs.CV cs.AI cs.CL cs.LG 79%

Situational Awareness Matters in 3D Vision Language Reasoning

Yunze Man, Liang-Yan Gui, Yu-Xiong Wang

专题命中 其他3D视觉 :3D vision(title,abstract);分类 cs.CV

Comments CVPR 2024. Project Page: https://yunzeman.github.io/situation3d

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.04352 2023-08-09 cs.CV 79%

3D-VisTA: Pre-trained Transformer for 3D Vision and Text Alignment

Ziyu Zhu, Xiaojian Ma, Yixin Chen, Zhidong Deng, Siyuan Huang, Qing Li

专题命中 其他3D视觉 :3D vision(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.06542 2023-03-14 cs.RO 79%

StereoTac: a Novel Visuotactile Sensor that Combines Tactile Sensing with 3D Vision

Etienne Roberge, Guillaume Fornes, Jean-Philippe Roberge

专题命中 其他3D视觉 :3D vision(title,abstract);分类 cs.RO

Comments 8 pages, 11 figures, submitted to IEEE Robotics and Automation Letters (RA-L) on March 11 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.12034 2019-09-27 cs.CV 79%

Convex Relaxations for Consensus and Non-Minimal Problems in 3D Vision

Thomas Probst, Danda Pani Paudel, Ajad Chhatkuli, Luc Van Gool

专题命中 其他3D视觉 :3D vision(title,abstract);分类 cs.CV

Comments Accepted to ICCV'19

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06504 2026-02-09 cs.RO cs.CV 76%

MultiGraspNet: A Multitask 3D Vision Model for Multi-gripper Robotic Grasping

MultiGraspNet:一种多任务3D视觉模型用于多机械手抓取

Stephany Ortuno-Chanelo, Paolo Rabino, Enrico Civitelli, Tatiana Tommasi, Raffaello Camoriano

机构 * VANDAL Laboratory, Department of Control and Computer Engineering, Politecnico di Torino(沃纳达实验室,控制与计算机工程系,都灵理工大学) Comau S.p.A., Advanced Automation Solutions(Comau S.p.A.,先进自动化解决方案) Istituto Italiano di Tecnologia(意大利技术研究所)

专题命中 其他3D视觉 :3D vision(title);分类 cs.CV、cs.RO

AI总结 MultiGraspNet是一种多任务3D视觉模型,通过统一框架同时预测平行和真空机械手的抓取姿态,提升机器人在复杂环境中的抓取能力和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12143 2025-11-05 cs.CV cs.AI 74%

3DViT-GAT: A Unified Atlas-Based 3D Vision Transformer and Graph Learning Framework for Major Depressive Disorder Detection Using Structural MRI Data

Nojod M. Alotaibi, Areej M. Alhothali, Manar S. Ali

机构 * Department of Computer Science, Faculty of Computing and Information Technology, King Abdulaziz University(计算机科学系,计算与信息技术学院,国王阿卜杜勒阿齐兹大学)

专题命中 其他3D视觉 :3D vision(title);分类 cs.CV

Comments 17 pages, 3 figure, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.04651 2023-09-12 eess.IV cs.AI cs.CV 74%

Video and Synthetic MRI Pre-training of 3D Vision Architectures for Neuroimage Analysis

Nikhil J. Dhinagar, Amit Singh, Saket Ozarkar, Ketaki Buwa, Sophia I. Thomopoulos, Conor Owens-Walton, Emily Laltoo, Yao-Liang Chen, Philip Cook, Corey McMillan, Chih-Chien Tsai, J-J Wang, Yih-Ru Wu, Paul M. Thompson

专题命中 其他3D视觉 :3D vision(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.03026 2022-11-08 cs.RO cs.SY eess.SY 74%

Automated Rendezvous & Docking Using 3D Vision

Farhad Aghili

专题命中 其他3D视觉 :3D vision(title);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08990 2024-07-15 cs.AR cs.AI cs.ET cs.NE 71%

Dynamic neural network with memristive CIM and CAM for 2D and 3D vision

Yue Zhang, Woyu Zhang, Shaocong Wang, Ning Lin, Yifei Yu, Yangu He, Bo Wang, Hao Jiang, Peng Lin, Xiaoxin Xu, Xiaojuan Qi, Zhongrui Wang, Xumeng Zhang, Dashan Shang, Qi Liu, Kwang-Ting Cheng, Ming Liu

专题命中 其他3D视觉 :3D vision(title)

Comments In press

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.02608 2019-04-05 physics.optics eess.IV 71%

LED illumination faceted Fresnel DOEs generating perceived virtual 3D vision

Qiang Song, Yoran Eli Pigeon, Kevin Heggarty

专题命中 其他3D视觉 :3D vision(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14935 2026-07-17 cs.CV 新提交 70%

VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding

VideoChat3:用于高效通用视频理解的全开放视频多模态语言模型

Xinhao Li, Yuhan Zhu, Xiangyu Zeng, Yuhao Dong, Haoning Wu, Zhiqiu Zhang, Yuandong Yang, Changlian Ma, Qingyu Zhang, Yansong Shi, Xinyu Chen, Haoran Chen, Zizheng Huang, Jun Zhang, Kun Ouyang, Lin Sui, Ziang Yan, Yicheng Xu, Chenting Wang, Yinan He, Hongjie Zhang, Yi Wang, Yu Qiao, Yali Wang, Ziwei Liu, Kai Chen, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学) Peking University(北京大学)

专题命中 其他3D视觉 :3D vision(abstract,abstract_cn);分类 cs.CV

AI总结 研究针对视频理解开源模型局限,提出VideoChat3。通过I3D-ViT等提升效率,利用可扩展视频数据合成管道生成训练数据集提升泛化性,以4B参数在多基准测试中超越同等或更多参数的开源模型,实现泛化与计算效率平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03782 2026-01-08 cs.RO cs.AI cs.CV 62%

PointWorld: Scaling 3D World Models for In-The-Wild Robotic Manipulation

PointWorld: 为真实世界机器人操作扩展3D世界模型

Wenlong Huang, Yu-Wei Chao, Arsalan Mousavian, Ming-Yu Liu, Dieter Fox, Kaichun Mo, Li Fei-Fei

机构 * Stanford University(斯坦福大学) NVIDIA(英伟达)

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV、cs.RO

AI总结 PointWorld通过统一状态和动作的3D点流模型,实现了在真实世界中机器人操作的高效预测与控制,无需额外演示或训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09423 2025-09-09 cs.RO cs.CV 62%

Efficient Alignment of Unconditioned Action Prior for Language-conditioned Pick and Place in Clutter

Kechun Xu, Xunlong Xia, Kaixuan Wang, Yifei Yang, Yunxuan Mao, Bing Deng, Jieping Ye, Rong Xiong, Yue Wang

机构 * Zhejiang University and Alibaba Cloud(浙江大学和阿里云) Alibaba Cloud(阿里云) Zhejiang University(浙江大学)

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV、cs.RO

Comments Accepted by T-ASE and CoRL25 GenPriors Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2102.02886 2021-04-06 cs.LG cs.AI cs.CV cs.NE cs.RO 62%

Ivy: Templated Deep Learning for Inter-Framework Portability

Daniel Lenton, Fabio Pardo, Fabian Falck, Stephen James, Ronald Clark

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV、cs.RO

Comments Code at https://github.com/ivy-dl/ivy

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.13358 2020-04-29 cs.RO cs.CV 62%

Transferable Active Grasping and Real Embodied Dataset

Xiangyu Chen, Zelin Ye, Jiankai Sun, Yuda Fan, Fang Hu, Chenxi Wang, Cewu Lu

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV、cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
1806.08756 2018-09-10 cs.RO cs.CV cs.LG 62%

Dense Object Nets: Learning Dense Visual Object Descriptors By and For Robotic Manipulation

Peter R. Florence, Lucas Manuelli, Russ Tedrake

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV、cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10115 2026-02-11 cs.CV 61%

Quantum Multiple Rotation Averaging

量子多旋转平均

Shuteng Wang, Natacha Kuete Meli, Michael Möller, Vladislav Golyanik

机构 * Max Planck Institute for Informatics, SIC(马克斯·普朗克信息研究所,SIC) University of Siegen(施普伦次大学)

专题命中 其他3D视觉 :3D vision(abstract,journal_ref);分类 cs.CV

AI总结 本文提出IQARS算法,通过量子退火器解决多旋转平均问题,实现更高的旋转同步精度。

Comments 16 pages, 13 figures, 4 tables; project page: https://4dqv.mpi-inf.mpg.de/QMRA/

Journal ref International Conference on 3D Vision (3DV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13226 2026-08-14 cs.CV cs.AI 新提交 57%

CoverPrune: Coverage-Driven Token Pruning for 3D VLMs via Optimal Transport

CoverPrune:基于最优传输的3D视觉语言模型的覆盖驱动型令牌剪枝

Peng Ling, Yingda Yin, Lingting Zhu, Weikai Chen, Shengju Qian, Zeyu Hu, Xin Wang, Wenming Yang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) LIGHTSPEED

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV

AI总结 针对3D VLMs因大量视觉令牌导致的计算瓶颈,提出CoverPrune框架,将剪枝转化为最优传输问题,结合FST成本与SGS算法,实现高效剪枝且性能优异。

Comments Accepted to ECCV 2026 as an Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00633 2026-08-11 cs.CV cs.AI 版本更新 57%

From Alignment to Synthesis Contrastive Volumetric Grounding for Text-to-CT Generation

从对齐到合成:用于文本到CT生成的对比体 grounding

Daniele Molino, Camillo Maria Caruso, Filippo Ruffini, Paolo Soda, Valerio Guarrasi

机构 * Unit of Artificial Intelligence and Computer Systems, Department of Engineering, Università Campus Bio-Medico di Roma(人工智能与计算机系统单位,工程系,罗马生物医学大学) Department of Diagnostics and Intervention, Biomedical Engineering and Radiation Physics, Umeå University(诊断与干预部门,生物医学工程与放射物理学,乌梅拉大学)

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV

AI总结 该研究针对文本到CT生成的视觉-语言对齐瓶颈,提出带结构化难负样本的3D-CLIP编码器,结合端到端潜在扩散模型,在CT-RATE数据集上实现了优于现有方法的性能。

Comments Accepted at BMVC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01185 2026-08-04 cs.CV cs.LG 新提交 57%

3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question Answering

3DZip:面向3D视觉问答的空间感知特征多样性引导的Token压缩方法

Changwoo Baek, Kyeongbo Kong

机构 * Pusan National University(釜山国立大学)

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV

AI总结 本文针对3D视觉问答中Token压缩忽略空间特性的问题,提出三阶段框架3DZip,在三个基准上以128个Token保留94.7%性能、提速1.92倍,优于现有方法。

Comments Accepted to ECCV 2026. Project page: https://cvsp-lab.github.io/3DZip

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06216 2026-08-04 cs.CV 版本更新 57%

MoWorld: A Flash World Model

MoWorld:一种快速世界模型

Team Moxin, Deyi Ji, Tianrun Chen, Xin Zhang, Jiale Yang, Qi Zhu, An Zhao, Zihao Xie, Han Wang, Xuanyi Liu, Yixiang Zhou, Pei Liu, Yi Tan, Cheng Chen, Dayi Zhu, Mingyu Wei, Hanjie Xu, Jun Liao, Siqi Li, Lingyu Lu, Hongye Fang, Hongming Tan, Youjiang Zhu, Taiyu Zhang, Zejian Li, Chaotao Ding, Zhipeng Liang, Wenxuan Song, Yi Li, Baochuan Yang, Xin Jiang, Ben Feng, Jingyuan Zou, Yanlin Liu, Rong Shi, Lingfeng Li, Liyi Yao, Lanyun Zhu, Yunhe Pan, Lingyun Sun

机构 * Moxin Technology(魔心科技)

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV

AI总结 研究旨在提升世界模型实用性与推理效率。提出MoWorld,基于3D原生数据引擎,有课程跨帧预训练等策略,能在NPU上达50 FPS实时交互,平均推理成本低,为世界模型大规模应用提供基础并展示多种应用。

Comments Project Page: https://moxin-tech.github.io/moworld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11924 2026-08-04 cs.CV cs.LG 交叉投稿 57%

Enriched text-guided variational multimodal knowledge distillation network (VMD) for automated diagnosis of plaque vulnerability in 3D carotid artery MRI

用于3D颈动脉MRI斑块易损性自动诊断的增强文本引导变分多模态知识蒸馏网络(VMD)

Bo Cao, Fan Yu, Mengmeng Feng, SenHao Zhang, Xin Meng, Yue Zhang, Zhen Qian, Jie Lu

机构 * department of Radiology and Nuclear Medicine, Xuanwu Hospital, Capital Medical University(放射医学与核医学科,宣武医院,首都医科大学) Beijing Key Laboratory of Magnetic Resonance Imaging and Brain Informatics(北京磁共振成像与脑信息学重点实验室) Beijing United Imaging Research Institute of Intelligent Imaging(北京智能成像联合研究院)

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV

AI总结 该研究针对3D颈动脉MRI斑块易损性自动诊断难题,提出VMD网络,利用跨模态先验知识提升未标注图像诊断准确率,经内部数据集实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏