arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-06-02 至 2026-06-02 共收录 63 信号源:cs.CV, cs.GR, cs.RO

1. Gaussian Splatting 18 篇

2512.07806 2026-06-02 cs.CV 57%

Multi-view Pyramid Transformer: Look Coarser to See Broader

多视角金字塔变换器:看得更粗以看得更广

Gyeongjin Kang, Seungkwon Yang, Seungtae Nam, Younggeun Lee, Jungwoo Kim, Eunbyung Park

机构 * Sungkyunkwan University(成均馆大学) Yonsei University(延世大学)

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);分类 cs.CV

AI总结 提出MVP,一种可扩展的多视角变换器架构,通过局部到全局的视角层次和细到粗的空间层次,实现从数十到数百张图像中单次前向重建大型3D场景,结合3D高斯泼溅达到最先进的可泛化重建质量。

Comments Project page: see https://gynjn.github.io/MVP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17499 2026-06-02 eess.SY cs.SY eess.SP 50%

A Tutorial on Learning-Based Radio Map Construction: Data, Paradigms, and Physics-Awareness

基于学习的无线电地图构建教程:数据、范式和物理感知

Xiucheng Wang, Yuhao Pan, Nan Cheng, Çağkan Yapar, Ruijin Sun, Zhisheng Yin, Conghao Zhou, Wenchao Xu, Yuxiang Zhang, Jianhua Zhang, Shuguang Cui, Xuemin Shen

专题命中 Gaussian Splatting :Gaussian Splatting(abstract)

AI总结 本文系统综述了基于学习的无线电地图构建方法,从数据、范式和物理感知三个维度展开,并讨论了未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 点云 20 篇

2606.01604 2026-06-02 cs.CV 79%

Paving the Way for Point Cloud Video Representation Learning Using A PDE Model

使用PDE模型为点云视频表示学习铺平道路

Zhuoxu Huang, Zhenkun Fan, Jungong Han, Josef Kittler

机构 * Department of Computer Science, Aberystwyth University(阿伯里斯يث大学计算机科学系) Department of Automation, Beijing National Research Center for Information Science and Technology, Tsinghua University(自动化系、北京信息科学与技术国家研究中心、清华大学) Department of Electrical Engineering, Surrey University(Surrey大学电子工程系)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 提出MotionPDE方法,通过将时空相关性学习建模为可解的偏微分方程(PDE),并利用对比学习结构优化,作为即插即用模块提升点云视频表示学习性能。

Comments Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (T-PAMI) in 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01549 2026-06-02 cs.CV 79%

ForestMamba: Sparse Mamba with Geometry-guided Queries for 3D Forest Point Cloud Segmentation

ForestMamba: 基于几何引导查询的稀疏Mamba用于3D森林点云分割

Trung Thanh Nguyen, Tuan-Anh Vu, Duc Viet Le, Yasutomo Kawanishi, Takahiro Komamizu, Ichiro Ide, Teja Kattenborn

机构 * Nagoya University(名古屋大学) RIKEN Seika(日本理化学研究所Seika研究中心) University of California, Los Angeles(加州大学洛杉矶分校) University of Twente(埃因霍温理工大学) Ritsumeikan University(立命馆大学)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 提出ForestMamba方法,通过稀疏编码器、几何引导查询初始化和Mamba查询解码器,实现高效且结构感知的森林点云分割,在七个森林区域上优于现有方法,推理速度提升3倍,GPU内存降低2.3倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00688 2026-06-02 cs.CV 79%

Shape-Prior-Based Point Cloud Completion for Single-Stage Fully Sparse 3D Object Detection

基于形状先验的点云补全用于单阶段全稀疏3D目标检测

Kaizheng Wang, Mingqian Ji, Jian Yang, Shanshan Zhang

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 针对单阶段全稀疏3D检测器中点云稀疏和不完整的问题,提出一种基于形状先验的点云补全方法,通过实例选择和对齐补全模块显著提升检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13621 2026-06-02 cs.CV cs.LG cs.MM 79%

Attack on Scene Flow using Point Clouds

使用点云对场景流进行攻击

Haniyeh Ehsani Oskouie, Mohammad-Shahram Moin, Shohreh Kasaei

机构 * Sharif University of Technology(谢里弗大学) ICT Research Institute(信息与通信技术研究所)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 针对场景流网络提出白盒对抗攻击方法,在KITTI和FlyingThings3D数据集上实现平均端点误差相对下降33.7%,并揭示单维度或单颜色通道攻击的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10716 2026-06-02 cs.AR 78%

L-PCN: A Point Cloud Accelerator Exploiting Spatial Locality through Octree-based Islandization

L-PCN: 一种利用八叉树岛屿化挖掘空间局部性的点云加速器

Yiming Gao, Jieming Yin, Yuxiang Wang, Xiangru Chen, Zhilei Chai, Bowen Jiang, Jiliang Zhang, Herman Lam

专题命中 点云 :point cloud(title,abstract)

AI总结 针对点云网络中数据整理步骤的空间局部性,L-PCN通过八叉树岛屿化划分点云并采用枢纽调度实现数据重用,显著减少重复操作,理论特征获取减少55.2%-93.8%,计算减少45.4%-80.6%,在FPGA上实现1.2x-3.2x额外加速。

Comments Accepted by ISCA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01261 2026-06-02 eess.IV 67%

RFDT-Channel: RGB-LiDAR-Based RF Digital Twin Scene Construction for 28 GHz Indoor Ray-Tracing Channel Simulation

RFDT-Channel:基于RGB-LiDAR的RF数字孪生场景构建用于28 GHz室内射线追踪信道仿真

Chengyang Yao, Cunhua Pan, Jiaming Zeng, Yuquan Sun, Haoyang Weng, Haojian Wang, Hong Ren, Jiangzhou Wang

专题命中 点云 :Gaussian Splatting(abstract);point cloud(abstract)

AI总结 提出RFDT-Channel工作流,利用RGB图像和LiDAR点云自动构建射频可计算几何与电磁材料属性的数字孪生场景,用于28 GHz射线追踪仿真,通过材料绑定将有效路径数从约742降至约52,同时保持主路径幅度不变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01277 2026-06-02 cs.RO cs.AI cs.CV cs.SY eess.IV eess.SY 62%

DeepIPCv3: Event-Aware Multi-Modal Sensor Fusion for Sudden Pedestrian Crossing Avoidance

DeepIPCv3: 面向突发行人穿越避让的事件感知多模态传感器融合

Oskar Natan, Andi Dharmawan, Aufaclav Zatu Kusuma Frisky, Jazi Eko Istiyanto, Jun Miura

机构 * Department of Computer Science and Electronics, Universitas Gadjah Mada(计算机科学与电子系,加雅马达大学) Department of Computer Science and Engineering, Toyohashi University of Technology(计算机科学与工程系,东福士大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV、cs.RO

AI总结 提出DeepIPCv3框架,通过Transformer交叉模态注意力融合LiDAR点云与DVS事件流,实现突发行人穿越场景下的高反应性避让,在自定义多模态数据集上达到最优轨迹与控制精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.06647 2026-06-02 cs.RO cs.AI cs.CV 62%

DeepIPCv2: LiDAR-powered Robust Environmental Perception and Navigational Control for Autonomous Vehicle

DeepIPCv2: 基于LiDAR的鲁棒环境感知与自动驾驶导航控制

Oskar Natan, Jun Miura

机构 * Department of Computer Science and Electronics, Universitas Gadjah Mada(计算机科学与电子系,加查马达大学) Department of Computer Science and Engineering, Toyohashi University of Technology(计算机科学与工程系,toyohashi技术大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV、cs.RO

AI总结 提出DeepIPCv2端到端自动驾驶框架,通过融合LiDAR点云分割与多视图投影构建鲁棒场景表示,结合门控循环单元、命令特定多层感知器和PID控制器实现路径点与导航控制命令的联合估计,在光照变化下取得最低总指标误差和最少驾驶干预。

Comments This work has been accepted for publication in IEEE Access. https://ieeexplore.ieee.org/document/11313052

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04343 2026-06-02 cs.CV 61%

Finding NeMO: A Geometry-Aware Representation of Template Views for Few-Shot Perception

寻找NeMO:面向少样本感知的模板视图几何感知表示

Sebastian Jung, Leonard Klüpfel, Rudolph Triebel, Maximilian Durner

机构 * German Aerospace Center (DLR)(德国航空航天中心(DLR))

专题命中 点云 :point cloud(abstract);分类 cs.CV;3D vision(journal_ref)

AI总结 提出NeMO(神经记忆对象)表示,通过少量RGB模板视图编码生成稀疏点云,实现未见对象的检测、分割和6DoF姿态估计,无需重训练。

Comments 17 pages including supplement, published in 3DV 2026, Project website: https://sebastian-jung.github.io/nemo/

Journal ref Proceedings of the International Conference on 3D Vision (3DV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02463 2026-06-02 cs.CV cs.AI 57%

MASER: Modality-Adaptive Specialist Routing for Embodied 3D Spatial Intelligence

MASER: 面向具身3D空间智能的模态自适应专家路由

Hilton Raj, Vishnuram AV

机构 * Boston University(波士顿大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 提出MASER框架,通过训练共享VLM骨干的五个模态适配器并学习基于问题选择最佳适配器的神经路由策略,解决具身代理在3D环境中多模态推理时忽略问题语义的问题。

Comments Accepted to CVPR 2026 Foundation Models Meet Embodied Agents Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02406 2026-06-02 cs.CV 57%

Edge Prediction for Roof Wireframe Reconstruction with Transformers

基于Transformer的屋顶线框重建边预测

Gustav Hanning, Ludvig Dillén, Jonathan Astermark, Johanna Lidholm, Viktor Larsson

机构 * Centre for Mathematical Sciences, Lund University(卢德大学数学科学中心)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 提出一种端到端Transformer编码器-解码器架构,利用稀疏SfM点云和语义分割图重建3D屋顶线框,在HoHo 22k数据集上取得0.6476的混合结构分数,位列挑战赛第二名。

Comments Presented at the 3rd Urban Scene Modeling (USM3D) Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02370 2026-06-02 cs.RO 57%

A Simulation Platform for Flapping-Wing Vehicles

扑翼飞行器仿真平台

Haichuan Li, Tomi Westerlund

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 针对扑翼飞行器仿真与现实差距大的问题,提出FWAV-Sim高保真仿真平台,集成复合气动模型、湍流生成和真实传感器模拟,提升自主系统开发效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01757 2026-06-02 cs.CV 57%

PillarDETR: YOLO-Backbone and RT-DETR Head for Real-Time 3D Object Detection

PillarDETR:基于YOLO骨干和RT-DETR头的实时3D目标检测

Smit Kadvani, Shriya Gumber, Kriti Faujdar, Harsh Dave

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 提出PillarDETR架构,结合YOLOv8的CSP骨干和RT-DETR解码器,实现无需NMS的端到端实时3D目标检测,在KITTI和nuScenes上取得精度与速度的良好平衡。

Comments 6 pages, 1 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01545 2026-06-02 cs.RO 57%

Hierarchical Object Representation for Spatial Robot Perception: Points, Meshes, and Superquadrics

用于空间机器人感知的层次化物体表示:点云、网格和超二次曲面

Ceng Zhang, Wan Su, Mohamed Samshad, Gregory S. Chirikjian, Rajat Talak

机构 * National University of Singapore (NUS)(新加坡国立大学) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 提出一种层次化物体表示方法,从原始传感器数据逐步抽象为稠密网格和超二次曲面,用于高保真重建、鲁棒重定位和高效碰撞检测,并在室内外场景中验证其有效性。

Comments 18 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01334 2026-06-02 cs.CV 57%

HOLA: Holistic Multi-Modal Alignment for Open-Set 3D Recognition

HOLA: 面向开放集3D识别的全息多模态对齐

Koby Aharonov, Oren Shrout, Ayellet Tal

机构 * Technion – Israel Institute of Technology(技术ion-以色列理工学院)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 提出HOLA方法,通过解耦多正例对比损失和对齐点云与多视图图像及文本描述,实现开放集3D识别中的全息多模态对齐,在长尾基准上取得最先进零样本性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00449 2026-06-02 cs.RO 57%

ROG-Grasp: Root-Oriented Geometry for Robotic Grasping and Placement

ROG-Grasp:面向根部的几何方法用于机器人抓取与放置

Zijian An, Augustus Sroka, Ran Yang, Bill Cai, Satoru Eto, Brian Poon, Kelvin Cai, Shijie Geng, Feng Liu, Yiming Feng, Lifeng Zhou

机构 * Department of Electrical and Computer Engineering, Drexel University(德雷塞尔大学电气与计算机工程系) Virginia Seafood Agricultural Research and Extension Center, and Department of Biological Systems Engineering, Virginia Tech(弗吉尼亚理工学院生物系统工程系和弗吉尼亚海鲜农业研究与推广中心) Amazon Store Foundation AI (SFAI)(亚马逊商店基金会人工智能(SFAI))

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 提出基于根部表面几何的ROG-Grasp框架,通过RGB-D感知估计农产品朝向,结合YOLO检测器和点云平面拟合生成稳定抓取姿态,在番茄和洋葱实验中实现高成功率与快速执行。

Comments Comments: 7 pages, 6 figures. Video: https://youtu.be/Ir2UtGODdMo

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12689 2026-06-02 cs.RO 57%

3D RL-DWA: A Hybrid Reinforcement Learning and Dynamic Window Approach for Goal-Directed Local Navigation in Multi-DoF Robots

3D RL-DWA:一种用于多自由度机器人目标导向局部导航的混合强化学习与动态窗口方法

Chiara Castellani, Enrico Turco, Domenico Prattichizzo

机构 * European Union’s Horizon Europe Research and Innovation Programme(欧洲联盟的地平线欧洲研究与创新计划)

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 提出结合强化学习与动态窗口方法的混合框架,利用稀疏点云数据动态调整可变形微型机器人的运动和形状,在复杂受限环境中实现目标导航并最大化占据体积,实验表明该方法在变形和导航能力上优于纯强化学习和基于模型的方法。

Comments Accepted for publication in the Proceedings of the IEEE/ASME International Conference on Advanced Intelligent Mechatronics (AIM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06720 2026-06-02 cs.CV 57%

Relative Energy Learning for LiDAR Out-of-Distribution Detection

面向激光雷达离群点检测的相对能量学习

Zizhao Li, Zhengkang Xiang, Jiayang Ao, Joseph West, Kourosh Khoshelham

机构 * The University of Melbourne(墨尔本大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 提出相对能量学习(REL)框架,利用正负逻辑之间的能量差距作为相对评分函数,并结合轻量级数据合成策略Point Raise,有效提升激光雷达点云中离群点检测性能。

Comments Project Page: https://github.com/343gltysprk/rel

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02047 2026-06-02 stat.ML cs.LG math.ST stat.ME stat.TH 50%

Convex Distance Operator Transport: A Convex and Geometry-Preserving Formulation

凸距离算子传输:一种凸且保持几何的公式

Junhyoung Chung, Euijong Song, Won Hwa Kim, Gunwoong Park

机构 * KAIST(韩国科学技术院)

专题命中 点云 :point cloud(abstract)

AI总结 提出凸距离算子传输(CDOT),通过算子正则化联合保持特征对应与内在几何结构,实现异质分布对齐,并证明其伪度量性质及与Gromov-Wasserstein的关系。

Comments This paper is 41 pages long, contains 6 figures, and has been accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01231 2026-06-02 eess.SP cs.ET 50%

SweetFruit: A Two-Stage Mobile Sensing System for Real-Time Fruit Sugar Estimation

SweetFruit:一种用于实时水果糖分估计的两阶段移动传感系统

Mark Cardamis, Yanxiang Wang, Chun Tung Chou, Wen Hu

专题命中 点云 :point cloud(abstract)

AI总结 提出一种两阶段移动传感系统SweetFruit,结合ToF深度相机和近红外光谱仪,通过3D深度学习分类和回归网络实现水果糖分无接触实时估计,分类准确率超90%,糖度估计RMSE为0.57 Brix。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 新视角合成 7 篇

2606.02068 2026-06-02 cs.CV cs.AI 90%

Fast and Lightweight Novel View Synthesis with Differentiable Multiplane Image

基于可微多平面图像的快速轻量级新视角合成

Kaidi Zhang, Guanxu Zhu

机构 * Universiti Malaya(马来大学) Wuhan University(武汉大学)

专题命中 新视角合成 :novel view synthesis(title,abstract);NeRF(abstract,abstract_cn);3DGS(abstract,abstract_cn);Gaussian Splatting(abstract)

AI总结 针对现有方法在速度、模型大小和稀疏视角下的不足,提出基于可微多平面图像(MPI)的快速轻量级新视角合成方法,利用点图进行几何初始化并引入一步扩散处理空洞和伪影。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01315 2026-06-02 cs.CV 90%

DeblurNVS: Geometric Latent Diffusion for Novel View Synthesis from Sparse Motion-Blurred Images

DeblurNVS:基于几何潜在扩散的稀疏运动模糊图像新视角合成

Changyue Shi, Wangbo Yu, Chaoran Feng, Li Yuan

机构 * School of AI for Science, Peking University Shenzhen Graduate School(人工智能科学学院,北京大学深圳研究生院) School of Electronic and Computer Engineering, Peking University Shenzhen Graduate School(电子与计算机工程学院,北京大学深圳研究生院)

专题命中 新视角合成 :novel view synthesis(title,abstract);NeRF(abstract,abstract_cn);3DGS(abstract,abstract_cn);Gaussian Splatting(abstract)

AI总结 提出DeblurNVS框架,利用几何潜在扩散从稀疏运动模糊图像中直接合成高保真新视角,无需逐场景优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20176 2026-06-02 cs.CV 83%

LagerNVS: Latent Geometry for Fully Neural Real-time Novel View Synthesis

LagerNVS:用于全神经实时新视角合成的潜在几何

Stanislaw Szymanowicz, Minghao Chen, Jianyuan Wang, Christian Rupprecht, Andrea Vedaldi

机构 * Visual Geometry Group, University of Oxford(牛津大学视觉几何组) Meta AI

专题命中 新视角合成 :novel view synthesis(title,abstract);3D reconstruction(abstract);分类 cs.CV

AI总结 提出LagerNVS,一种基于3D感知潜在特征的编码器-解码器神经网络,通过显式3D监督预训练初始化编码器,结合轻量解码器和光度损失端到端训练,实现实时、泛化的新视角合成,在Re10k上达到31.4 PSNR。

Comments IEEE CVF Conference on Computer Vision and Pattern Recognition 2026. Project page with code, models and examples: szymanowiczs.github.io/lagernvs

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01419 2026-06-02 cs.CV 80%

DENSER: Depth-Guided Ensemble with Staged EFA-GS Reconstruction for Soccer Novel View Synthesis

DENSER:面向足球新视角合成的深度引导集成与分阶段EFA-GS重建

Parthsarthi Rawat

机构 * GameChanger by Dick’s Sporting Goods(Dick’s Sporting Goods 游戏变革)

专题命中 新视角合成 :novel view synthesis(title,abstract);分类 cs.CV

AI总结 提出DENSER方法,通过深度引导集成和分阶段EFA-GS重建,结合相机高度损失加权、单目深度监督和三模型像素平均集成,提升足球场景新视角合成质量。

Comments CVPR 2026 SoccerNet Novel View Synthesis Challenge, Rank 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01590 2026-06-02 cs.CV cs.GR 62%

Effective Multi-sensor Conditioning for Street-view Novel-view Synthesis

面向街景新视角合成的有效多传感器条件控制

Zhengfei Kuang, Adam Sun, Liyuan Zhu, Tong Wu, Shengqu Cai, Jonathan Tremblay, Iro Armeni, Ehsan Adeli, Lior Yariv, Gordon Wetzstein

机构 * Stanford Univerity(斯坦福大学) NVIDIA

专题命中 新视角合成 :point cloud(abstract);分类 cs.CV、cs.GR

AI总结 提出StreetNVS视频扩散框架,通过参考增强相机注意力模块和相对射线级位置编码联合利用LiDAR、环视图像和相机位姿,实现稀疏LiDAR条件下的高质量街景新视角合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02226 2026-06-02 cs.GR 57%

Composable function systems as a general-purpose rendering framework

可组合函数系统作为通用渲染框架

James Schloss

专题命中 新视角合成 :point cloud(abstract);分类 cs.GR

AI总结 提出基于函数系统的通用(非分形)可视化与模拟新方法,并介绍Quibble元编程框架,实现GPU上的高效组合,具有运行时性能优越、可创建非平凡拓扑对象及与其他图形算法互操作等优势。

Comments 7 pages; 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09035 2026-06-02 cs.CV 57%

Princeton365: A Diverse Dataset with Accurate Camera Pose

Princeton365: 一个具有精确相机位姿的多样化数据集

Karhan Kayan, Stamatis Alexandropoulos, Rishabh Jain, Yiming Zuo, Erich Liang, Jia Deng

机构 * Princeton University(普林斯顿大学)

专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV

AI总结 提出Princeton365数据集,包含365个视频和精确相机位姿,通过校准板和360度相机的新颖真值采集框架弥合精度与多样性差距,并引入基于光流的尺度感知评估指标及新颖视图合成基准。

Comments Update v2: Match the ICCV 2025 camera-ready version. Fix typos

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 3D生成 2 篇

2605.28995 2026-06-02 cs.CV 74%

GAP3D: Generative Alignment of VLM Latents to Patch-Level Embeddings for 3D Generation

GAP3D: 将VLM潜在表示与补丁级嵌入进行生成式对齐以实现3D生成

Polytimi Anna Gkotsi, Andrii Zadaianchuk, Mohammad Mahdi Derakhshani

机构 * Polytimi Anna Gkotsi Andrii Zadaianchuk Mohammad Mahdi Derakhshani

专题命中 3D生成 :3D generation(title);分类 cs.CV

AI总结 提出GAP3D,一种基于扩散的模块化方法,将VLM生成的潜在表示直接对齐到预训练图像编码器的完整补丁级特征空间,使冻结的下游生成模型能够利用VLM作为提示编码器,同时保持空间结构化的条件信号,在3D资产生成中无需大规模3D数据训练,并展现出多模态提示的零样本能力。

详情

展开后加载摘要…

URL PDF HTML 收藏