3D-MoE: A Mixture-of-Experts Multi-modal LLM for 3D Vision and Pose Diffusion via Rectified Flow
专题命中 其他3D视觉 :3D vision(title,abstract);分类 cs.CV、cs.RO
Comments Preprint. Work in progress
视觉与机器人
三维重建、NeRF、Gaussian Splatting、点云和空间智能。
专题命中 其他3D视觉 :3D vision(title,abstract);分类 cs.CV、cs.RO
Comments Preprint. Work in progress
ARGUS:利用大规模3D视觉模型在视角变化下对齐机器人场景几何结构
机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Harvard University(哈佛大学)
专题命中 其他3D视觉 :3D vision(title,abstract);分类 cs.RO
AI总结 本研究提出ARGUS,一种利用大规模3D视觉模型对齐机器人场景几何结构的观测预处理流水线,可提升机器人操纵策略在视角多样化场景下的性能与学习效率。
Comments Project webpage: https://rsathua.github.io/ARGUS/
LEO-VL:面向可扩展3D视觉-语言学习的高效场景表示
机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) ; State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) ; School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) ; Department of Automation, Tsinghua University(清华大学自动化系)
专题命中 其他3D视觉 :3D vision(title,abstract);分类 cs.CV
AI总结 本文提出LEO-VL,一种基于高效场景表示CFG的3D视觉-语言模型,通过改进训练数据和引入SceneDPO提升鲁棒性,在多个3D-VL基准测试中取得最佳性能。
Comments Project page: https://leo-vl.github.io
基于3D视觉变换器的阿尔茨海默病分类的多输入和混合数据
专题命中 其他3D视觉 :3D vision(title,abstract);分类 cs.CV
AI总结 本研究提出MIMD-3DVT方法,通过多输入和混合数据提升阿尔茨海默病分类准确率至97.14%
机构 * Department of Medicine, University of Florida(医学系,佛罗里达大学) ; Department of Electrical and Computer Engineering, University of Florida(电气与计算机工程系,佛罗里达大学) ; Department of Biomedical Engineering, University of Florida(生物医学工程系,佛罗里达大学) ; Intelligent Clinical Care Center, University of Florida(智能临床护理中心,佛罗里达大学)
专题命中 其他3D视觉 :3D vision(title,abstract);分类 cs.CV
专题命中 其他3D视觉 :3D vision(title,abstract);分类 cs.CV
Comments CVPR 2025. Project page: https://beacon-3d.github.io
专题命中 其他3D视觉 :3D vision(title,abstract);分类 cs.CV
Comments accepted by IJCAI2024
专题命中 其他3D视觉 :3D vision(title,abstract);分类 cs.CV
专题命中 其他3D视觉 :3D vision(title,abstract);分类 cs.CV
Comments CVPR 2024. Project Page: https://yunzeman.github.io/situation3d
专题命中 其他3D视觉 :3D vision(title,abstract);分类 cs.CV
专题命中 其他3D视觉 :3D vision(title,abstract);分类 cs.RO
Comments 8 pages, 11 figures, submitted to IEEE Robotics and Automation Letters (RA-L) on March 11 2023
专题命中 其他3D视觉 :3D vision(title,abstract);分类 cs.CV
Comments Accepted to ICCV'19
MultiGraspNet:一种多任务3D视觉模型用于多机械手抓取
机构 * VANDAL Laboratory, Department of Control and Computer Engineering, Politecnico di Torino(沃纳达实验室,控制与计算机工程系,都灵理工大学) ; Comau S.p.A., Advanced Automation Solutions(Comau S.p.A.,先进自动化解决方案) ; Istituto Italiano di Tecnologia(意大利技术研究所)
专题命中 其他3D视觉 :3D vision(title);分类 cs.CV、cs.RO
AI总结 MultiGraspNet是一种多任务3D视觉模型,通过统一框架同时预测平行和真空机械手的抓取姿态,提升机器人在复杂环境中的抓取能力和适应性。
机构 * Department of Computer Science, Faculty of Computing and Information Technology, King Abdulaziz University(计算机科学系,计算与信息技术学院,国王阿卜杜勒阿齐兹大学)
专题命中 其他3D视觉 :3D vision(title);分类 cs.CV
Comments 17 pages, 3 figure, 9 tables
专题命中 其他3D视觉 :3D vision(title);分类 cs.CV
专题命中 其他3D视觉 :3D vision(title);分类 cs.RO
专题命中 其他3D视觉 :3D vision(title)
Comments In press
专题命中 其他3D视觉 :3D vision(title)
VideoChat3:用于高效通用视频理解的全开放视频多模态语言模型
机构 * Nanjing University(南京大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Nanyang Technological University(南洋理工大学) ; Peking University(北京大学)
专题命中 其他3D视觉 :3D vision(abstract,abstract_cn);分类 cs.CV
AI总结 研究针对视频理解开源模型局限,提出VideoChat3。通过I3D-ViT等提升效率,利用可扩展视频数据合成管道生成训练数据集提升泛化性,以4B参数在多基准测试中超越同等或更多参数的开源模型,实现泛化与计算效率平衡。
PointWorld: 为真实世界机器人操作扩展3D世界模型
机构 * Stanford University(斯坦福大学) ; NVIDIA(英伟达)
专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV、cs.RO
AI总结 PointWorld通过统一状态和动作的3D点流模型,实现了在真实世界中机器人操作的高效预测与控制,无需额外演示或训练。
机构 * Zhejiang University and Alibaba Cloud(浙江大学和阿里云) ; Alibaba Cloud(阿里云) ; Zhejiang University(浙江大学)
专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV、cs.RO
Comments Accepted by T-ASE and CoRL25 GenPriors Workshop
专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV、cs.RO
Comments Code at https://github.com/ivy-dl/ivy
专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV、cs.RO
专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV、cs.RO
量子多旋转平均
机构 * Max Planck Institute for Informatics, SIC(马克斯·普朗克信息研究所,SIC) ; University of Siegen(施普伦次大学)
专题命中 其他3D视觉 :3D vision(abstract,journal_ref);分类 cs.CV
AI总结 本文提出IQARS算法,通过量子退火器解决多旋转平均问题,实现更高的旋转同步精度。
Comments 16 pages, 13 figures, 4 tables; project page: https://4dqv.mpi-inf.mpg.de/QMRA/
Journal ref International Conference on 3D Vision (3DV) 2026
CoverPrune:基于最优传输的3D视觉语言模型的覆盖驱动型令牌剪枝
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; LIGHTSPEED
专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV
AI总结 针对3D VLMs因大量视觉令牌导致的计算瓶颈,提出CoverPrune框架,将剪枝转化为最优传输问题,结合FST成本与SGS算法,实现高效剪枝且性能优异。
Comments Accepted to ECCV 2026 as an Oral Presentation
从对齐到合成:用于文本到CT生成的对比体 grounding
机构 * Unit of Artificial Intelligence and Computer Systems, Department of Engineering, Università Campus Bio-Medico di Roma(人工智能与计算机系统单位,工程系,罗马生物医学大学) ; Department of Diagnostics and Intervention, Biomedical Engineering and Radiation Physics, Umeå University(诊断与干预部门,生物医学工程与放射物理学,乌梅拉大学)
专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV
AI总结 该研究针对文本到CT生成的视觉-语言对齐瓶颈,提出带结构化难负样本的3D-CLIP编码器,结合端到端潜在扩散模型,在CT-RATE数据集上实现了优于现有方法的性能。
Comments Accepted at BMVC 2026
3DZip:面向3D视觉问答的空间感知特征多样性引导的Token压缩方法
机构 * Pusan National University(釜山国立大学)
专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV
AI总结 本文针对3D视觉问答中Token压缩忽略空间特性的问题,提出三阶段框架3DZip,在三个基准上以128个Token保留94.7%性能、提速1.92倍,优于现有方法。
Comments Accepted to ECCV 2026. Project page: https://cvsp-lab.github.io/3DZip
MoWorld:一种快速世界模型
机构 * Moxin Technology(魔心科技)
专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV
AI总结 研究旨在提升世界模型实用性与推理效率。提出MoWorld,基于3D原生数据引擎,有课程跨帧预训练等策略,能在NPU上达50 FPS实时交互,平均推理成本低,为世界模型大规模应用提供基础并展示多种应用。
Comments Project Page: https://moxin-tech.github.io/moworld/
用于3D颈动脉MRI斑块易损性自动诊断的增强文本引导变分多模态知识蒸馏网络(VMD)
机构 * department of Radiology and Nuclear Medicine, Xuanwu Hospital, Capital Medical University(放射医学与核医学科,宣武医院,首都医科大学) ; Beijing Key Laboratory of Magnetic Resonance Imaging and Brain Informatics(北京磁共振成像与脑信息学重点实验室) ; Beijing United Imaging Research Institute of Intelligent Imaging(北京智能成像联合研究院)
专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV
AI总结 该研究针对3D颈动脉MRI斑块易损性自动诊断难题,提出VMD网络,利用跨模态先验知识提升未标注图像诊断准确率,经内部数据集实验验证其有效性。