arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-05-29 至 2026-05-29 共收录 28 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 5 篇

2605.30310 2026-05-29 cs.CV cs.AI cs.GR 82%

City-Mesh3R: Simulation-Ready City-Scale 3D Mesh Reconstruction from Multi-View Images

City-Mesh3R:面向仿真就绪的城市级多视图三维网格重建

Sayan Paul, Sourav Ghosh, Siddharth Katageri, Soumyadip Maity, Sanjana Sinha, Brojeshwar Bhowmick

机构 * Visual Computing & Embodied AI Lab, TCS Research(视觉计算与具身人工智能实验室,TCS研究)

专题命中 三维重建 :NeRF(abstract,abstract_cn);Gaussian Splatting(abstract);3D reconstruction(abstract);分类 cs.CV、cs.GR

AI总结 提出City-Mesh3R框架,通过分治策略从大规模无序图像集合端到端重建水密表面网格,解决城市尺度重建中几何不完整、表面不规则及计算复杂性问题。

Comments Accepted to the USM3D Workshop Proceedings at the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026 as an Oral Presentation. Project page: https://citymesh3r.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15852 2026-05-29 cs.CV 79%

GHOST: Geometry-Hierarchical Online Streaming Token Eviction for Efficient 3D Reconstruction

GHOST: 用于高效3D重建的几何层次化在线流式令牌驱逐

Leyang Chen, Junyi Wu, Zhiteng Li, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 三维重建 :3D reconstruction(title,abstract);分类 cs.CV

AI总结 提出GHOST框架,利用模型自身的3D几何输出在线驱逐冗余令牌,在保持重建质量的同时将KV缓存减半并实现1.75倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30347 2026-05-29 cs.CV cs.GR 62%

NeuROK: Generative 4D Neural Object Kinematics

NeuROK:生成式4D神经物体运动学

Chen Geng, Guangzhao He, Yue Gao, Yunzhi Zhang, Shangzhe Wu, Jiajun Wu

机构 * Stanford University(斯坦福大学) University of Cambridge(剑桥大学) Cornell University(康奈尔大学)

专题命中 三维重建 :3D vision(abstract);分类 cs.CV、cs.GR

AI总结 提出基于Transformer的编码器-解码器模型NeuROK,通过学习物体潜在运动学参数化,实现从静态3D物体生成逼真的4D动态变形,克服了传统方法对预定义物理模型和特定类别的依赖。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29997 2026-05-29 cs.CV 57%

FRUC: Feedforward Dynamic Scene Reconstruction from Uncalibrated Collaborative Driving Views

FRUC:来自未标定协作驾驶视图的前馈动态场景重建

Yihang Tao, Yu Guo, Zhengru Fang, Haonan An, Yuguang Fang

机构 * Hong Kong JC STEM Lab of Smart City City University of Hong Kong(香港JC STEM实验室,城市大学)

专题命中 三维重建 :Gaussian Splatting(abstract);分类 cs.CV

AI总结 提出FRUC框架,基于前馈3D高斯泼溅和视觉几何Transformer,从未标定的多车协作视图实现动态场景的一次性、免标定重建,通过自中心因果遮挡场和零初始化残差去噪实现非破坏性几何补充。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24670 2026-05-29 cs.CE 50%

Fractional-gradient Sparsity with Autoencoding Sequential Deep Image Prior for 3D CT Reconstruction

分数阶梯度稀疏性与自编码顺序深度图像先验用于三维CT重建

Haijie Yuan, Chaoyan Huang, Srijita Bandopadhyay, Liyue Shen, Saiprasad Ravishankar

专题命中 三维重建 :3D reconstruction(abstract)

AI总结 提出FAST-DIP框架,结合输入自适应顺序深度图像先验和分数阶梯度稀疏正则化,实现三维CT重建,并证明交替最小化算法的收敛性。

Comments 16 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Gaussian Splatting 12 篇

2605.29583 2026-05-29 cs.CV 92%

BitC-3DGS: High-Capacity 3D Gaussian Splatting Watermarking via Bit Compression

BitC-3DGS: 基于位压缩的高容量3D高斯泼溅水印技术

Yuquan Bi, Baosheng Yu, Yingke Lei, Jianwei Yang, Hongsong Wang, Jie Gui, Yuan Yan Tang, James Tin-Yau Kwok

机构 * School of Cyber Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Lee Kong Chian School of Medicine, Nanyang Technological University(南洋理工大学李科金医学院) College of Electronic Engineer, National University of Defense and Technology(国防科技大学电子工程学院) Institute of AI for Industries, Chinese Academy of Sciences(中国科学院人工智能产业研究所) School of Computer Science and Engineering, Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Ministry of Education, Southeast University(东南大学计算机科学与工程学院,教育部新一代人工智能技术及其交叉应用重点实验室) Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系) Faculty of Science and Technology, UOW College Hong Kong(UOW学院香港科技学院理学院) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科学与技术大学计算机科学与工程学院)

专题命中 Gaussian Splatting :3DGS(title,title_cn);Gaussian Splatting(title,abstract);分类 cs.CV

AI总结 提出BitC-3DGS框架,通过位压缩令牌化、双分支架构和硬消息采样策略,突破CLIP文本编码器77位消息限制,实现高容量3DGS水印嵌入与恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29136 2026-05-29 cs.CV cs.LG 92%

Eulerian Gaussian Splatting using Hashed Probability Pyramids

使用哈希概率金字塔的欧拉高斯溅射

Mia Gaia Polansky, George Kopanas, Stephan Garbin, Todd Zickler, Dor Verbin

机构 * Harvard University(哈佛大学) Google DeepMind(谷歌DeepMind) Google(谷歌)

专题命中 Gaussian Splatting :NeRF(summary_cn,abstract);3DGS(summary_cn,abstract);Gaussian Splatting(title,abstract);分类 cs.CV

AI总结 提出一种基于概率溅射的辐射场框架,用梯度优化的体积概率密度替代启发式操作,通过多尺度哈希网格实现端到端优化,在mip-NeRF 360上达到SOTA重建质量并保持3DGS渲染速度。

Comments CVPR 2026. Project Page: https://euleriansplatting.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30342 2026-05-29 cs.CV cs.RO 89%

Uncertainty-driven 3D Gaussian Splatting Active Mapping via Anisotropic Visibility Field

基于各向异性可见性场的不确定性驱动的3D高斯溅射主动建图

Shangjie Xue, Jesse Dill, Dhruv Ahuja, Frank Dellaert, Panagiotis Tsiotras, Danfei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 Gaussian Splatting :3DGS(summary_cn,abstract);Gaussian Splatting(title,abstract);分类 cs.CV、cs.RO

AI总结 提出GAVIS框架,通过各向异性可见性场量化3DGS的不确定性,并基于最大信息增益实现主动建图,在精度和效率上显著优于现有方法。

Comments Accepted to CVPR 2026. Project page https://gatech-rl2.github.io/GAVIS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29452 2026-05-29 cs.CV 89%

Comparative evaluation of photogrammetric reconstruction methods and 3D Gaussian Splatting for road surface roughness analysis

摄影测量重建方法与3D高斯泼溅用于路面粗糙度分析的比较评估

Marouane Elmegdar, Teng Xiao

机构 * School of International Education, Hubei University of Technology(湖北工业大学国际教育学院) School of Computer Science, Hubei University of Technology(湖北工业大学计算机科学学院)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);3D reconstruction(abstract);point cloud(abstract)

AI总结 本研究比较了COLMAP、Meshroom、Metashape和3D高斯泼溅四种重建方法,评估它们从智能手机图像估计路面粗糙度的能力,结果表明COLMAP对微纹理最敏感,而开源方法适用于低成本路面监测。

Comments accepted by RSMIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30328 2026-05-29 cs.CV 85%

Supercharging Thermal Gaussian Splatting with Depth Estimation

利用深度估计增强热高斯泼溅

Manoj Biswanath, Chenxin Cai, Hannah Schieber, Daniel Roth, Benjamin Busam

机构 * Technical University of Munich(技术大学慕尼黑) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Munich Institute of Robotics and Machine Intelligence (MIRMI)(慕尼黑机器人与人工智能研究所) Human-Centered Computing and Extended Reality Lab(以人为本计算与扩展现实实验室) TUM University Hospital(技术大学慕尼黑医院)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3D reconstruction(abstract);novel view synthesis(abstract);分类 cs.CV

AI总结 提出一种仅使用热红外图像和深度估计的单模态方法TDg,通过热到深度高斯泼溅推导辐射场,在渲染质量和训练时间上优于多模态基线。

Comments 8 pages, 4 figures. Accepted and will be published in ISPRS proceedings (ISPRS Congress 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05155 2026-05-29 cs.CV cs.AI 85%

Aes3D: Aesthetic Assessment in 3D Gaussian Splatting

Aes3D: 3D高斯泼溅中的美学评估

Chuanzhi Xu, Boyu Wei, Haoxian Zhou, Xuanhua Yin, Zihan Deng, Haodong Chen, Qiang Qu, Weidong Cai

机构 * The University of Sydney(悉尼大学) The University of Hong Kong(香港大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);分类 cs.CV

AI总结 针对3D高斯泼溅场景缺乏美学评估的问题,提出首个系统框架Aes3D,包含专用数据集Aesthetic3D和轻量级模型Aes3DGSNet,直接预测场景级美学分数,无需渲染多视图图像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29549 2026-05-29 cs.CV 81%

Learning Representations from 3D Gaussian Splats

从3D高斯溅射中学习表示

Julia Farganus, Krzysztof Żurawicki, Arkadiusz Gaweł, Weronika Jakubowska, Halina Kwaśnicka

机构 * Department of Artificial Intelligence, Wroc aw University of Science

专题命中 Gaussian Splatting :3DGS(abstract,abstract_cn);Gaussian Splatting(abstract);point cloud(abstract);分类 cs.CV

AI总结 本研究通过比较多种几何深度学习架构,评估了基于3D高斯溅射的场景表示在分类任务中的有效性,揭示了不同架构和输入特征对表示质量的影响。

Comments 5 figures, 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25975 2026-05-29 cs.GR cs.CV 79%

F-RNG: Feed-Forward Relightable Neural Gaussians

F-RNG: 前馈可重光照神经高斯

Guangming Fu, Jiahui Fan, Jian Yang, Miloš Hašan, Beibei Wang

机构 * Nankai University(南开大学) Nanjing University(南京大学) NVIDIA

专题命中 Gaussian Splatting :3DGS(abstract,abstract_cn);Gaussian Splatting(abstract);分类 cs.CV、cs.GR

AI总结 提出前馈框架F-RNG,利用现有大型重建模型和内在分解模型先验,从稀疏视图直接生成可重光照的3D高斯资产,实现快速高质量重光照。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30268 2026-05-29 cs.CV cs.AI 70%

PhyGenHOI: Physically-Aware 4D Generation of Dynamic Human-Object Interactions

PhyGenHOI:物理感知的动态人-物交互4D生成

Omer Benishu, Gal Fiebelman, Sagie Benaim

机构 * Hebrew University of Jerusalem(耶路撒冷希伯来大学)

专题命中 Gaussian Splatting :3DGS(abstract,abstract_cn);分类 cs.CV

AI总结 提出PhyGenHOI框架,结合运动扩散模型和物质点方法,通过窗口吸引损失、接触驱动重模拟和掩码视频SDS目标,生成物理一致且视觉逼真的4D人-物交互动态场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15151 2026-05-29 eess.IV cs.CV 70%

Zero-shot CT Super-Resolution using Diffusion-based 2D Projection Priors and Signed 3D Gaussians

基于扩散的二维投影先验和有符号三维高斯的零样本CT超分辨率

Jeonghyun Noh, Hyun-Jic Oh, Won-Ki Jeong

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Korea University(韩国大学) Seoul, Korea(韩国首尔)

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);3D reconstruction(abstract);分类 cs.CV

AI总结 提出一种零样本三维CT超分辨率框架,通过扩散模型上采样二维投影先验并结合有符号三维高斯溅射(NAB-GS)重建高分辨率CT体积,在公开数据集上实现4倍超分辨率的优越性能。

Comments MICCAI 2026 early accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30320 2026-05-29 cs.CV 57%

MonoPhysics: Estimating Geometry, Appearance, and Physical Parameters from Monocular Videos

MonoPhysics: 从单目视频估计几何、外观和物理参数

Daniel Rho, Jun Myeong Choi, Matthew Thornton, Biswadip Dey, Roni Sengupta

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Meta

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);分类 cs.CV

AI总结 提出MonoPhysics框架,通过可微分MPM模拟和3D高斯泼溅,从单目视频联合优化可变形物体的几何、外观和物理参数,解决尺度模糊和几何不准确问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30065 2026-05-29 cs.CV 57%

Boosting Zero-Shot 3D Style Transfer with 2D Pre-trained Priors

利用二维预训练先验提升零样本三维风格迁移

Xin Dong, Yunzhi Teng, Wenfeng Deng, Yansong Tang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Pengcheng Laboratory(鹏城实验室)

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);分类 cs.CV

AI总结 提出Data-Sufficient StyleGaussian模型,通过集成大规模2D图像数据集预训练的解码器,结合特征高斯溅射与延迟风格化,在数据稀缺条件下实现零样本3D风格迁移的高质量多视图一致渲染。

Comments Accepted by IEEE IVMSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 点云 8 篇

2512.03010 2026-05-29 cs.CV cs.GR cs.RO 85%

SurfFill: Completion of LiDAR Point Clouds via Gaussian Surfel Splatting

SurfFill: 通过高斯曲面元填充完成LiDAR点云

Svenja Strobel, Matthias Innmann, Bernhard Egger, Marc Stamminger, Linus Franke

机构 * NavVis GmbH(NavVis公司) Inria, Université Côte d'Azur(Inria与阿尔卑斯海岸大学)

专题命中 点云 :point cloud(title,abstract);3D reconstruction(abstract);分类 cs.CV、cs.GR、cs.RO

AI总结 针对LiDAR点云缺失薄结构和边缘细节的问题,提出基于高斯曲面元(Gaussian surfel)的补全方案SurfFill,利用光束发散启发式识别模糊区域并优化曲面元重建以生长新点,在合成和真实场景中优于先前方法。

Comments Project page: https://lfranke.github.io/surffill

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29704 2026-05-29 cs.RO 79%

FLIP: Real-Time and Resilient Formation Planning for Large-Scale DIstributed Swarms via Point Cloud Registration

FLIP:通过点云配准实现大规模分布式集群的实时弹性编队规划

Yuan Zhou, Guangtong Xu, Zhenyu Hou, Jialiang Hou, Fei Gao

机构 * Institute of Cyber-Systems and Control, College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院智能系统与控制研究所) Huzhou Institute, Zhejiang University(浙江大学湖州研究院)

专题命中 点云 :point cloud(title,abstract);分类 cs.RO

AI总结 提出将最优编队位置序列计算转化为时空点云配准问题,利用带离群点剔除的PCR方法实现大规模分布式集群的弹性、高效轨迹规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00324 2026-05-29 math.OC cs.CV cs.RO eess.SP 62%

Dual Quaternion SE(3) Synchronization with Recovery Guarantees

对偶四元数 SE(3) 同步及其恢复保证

Jianing Zhao, Linglingzhi Zhu, Anthony Man-Cho So

机构 * Department of Systems Engineering and Engineering Management, The Chinese University of Hong Kong, Shatin, NT, Hong Kong(系统工程与工程管理系,香港中文大学(深圳)) H. Milton Stewart School of Industrial and Systems Engineering, Georgia Institute of Technology, Atlanta, GA, USA(H. Milton Stewart工业与系统工程学院,佐治亚理工学院)

专题命中 点云 :3D vision(abstract);分类 cs.CV、cs.RO

AI总结 采用对偶四元数表示,通过谱初始化和对偶四元数广义幂法实现 SE(3) 同步,并给出误差界和线性收敛保证。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30111 2026-05-29 cs.CV cs.AI 57%

xModel-KD: Cross-modal Knowledge Distillation for 3D Scene Perception using LiDAR

xModel-KD:基于LiDAR的3D场景感知跨模态知识蒸馏

Thenukan Pathmanathan, Kanchan Keisham, Thangarajah Akilan

机构 * Dept. of Computer Science Lakehead University Thunder Bay, Canada School of Computer Science Engg. \& Info. Systems Vellore Institute of Technology Tamil Nadu, India Dept. of Software Engg. Lakehead University Thunder Bay, Canada

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 提出跨模态知识蒸馏框架xModel-KD,通过对比学习对齐2D图像纹理与3D点云几何特征,在无额外标注下提升LiDAR点云分割性能。

Comments 3 figures, and 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29505 2026-05-29 cs.CV 57%

ESAM++: Efficient Online 3D Perception on the Edge

ESAM++:边缘上的高效在线3D感知

Qin Liu, Lavisha Aggarwal, Saptarashmi Bandyopadhyay, Vikas Bahirwani, Marc Niethammer, Ehsan Adeli, Andrea Colaco

机构 * Stanford University(斯坦福大学) Google(谷歌) UC San Diego(圣地亚哥大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 提出ESAM++,一种轻量级可扩展的在线3D场景感知方法,通过3D稀疏特征金字塔网络(SFPN)在边缘设备上实现高效、准确的3D实例分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29298 2026-05-29 cs.RO 57%

MonoDuo: Using One Robot Arm to Learn Bimanual Policies

MonoDuo: 使用单机械臂学习双臂策略

Sandeep Bajamahal, Lawrence Yunliang Chen, Toru Lin, Zehan Ma, Jitendra Malik, Ken Goldberg

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 提出MonoDuo框架,利用单臂机器人演示和人类协作数据,通过数据增强生成合成演示,训练双臂机器人策略,在五项任务中实现零样本部署和少样本微调,成功率高达70%。

Comments Accepted to appear in the 2026 IEEE International Conference on Robotics and Automation (ICRA), Vienna, Austria, 1-5 June 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21876 2026-05-29 cs.CV cs.AI 57%

EPiC: Efficient Video Camera Control Learning with Precise Anchor-Video Guidance

EPiC: 基于精确锚点视频引导的高效视频摄像机控制学习

Zun Wang, Jaemin Cho, Jialu Li, Han Lin, Jaehong Yoon, Yue Zhang, Mohit Bansal

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 提出EPiC框架,通过基于首帧可见性掩码构建精确对齐的锚点视频,并引入轻量模块Anchor-ControlNet,以极低参数实现高效、精确的3D摄像机控制,在RealEstate10K和MiraData上达到最先进性能。

Comments Accepted to ICML 2026. Project website: https://zunwang1.github.io/Epic

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29749 2026-05-29 physics.soc-ph cond-mat.stat-mech physics.data-an 50%

Community detection in subject-subject networks from psychometrics data

心理测量学数据中主体-主体网络的社区检测

Arianna Armanetti, Luca Cecchetti, Eiko Fried, Diego Garlaschelli, Miguel Ibáñez-Berganza

专题命中 点云 :point cloud(abstract)

AI总结 针对心理测量数据中潜在类别分析的局限性,提出基于主体相似性网络的社区检测方法,通过因子得分空间和修正零模型抑制结构伪影,并利用四种互补指标评估社区显著性。

Comments 30 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 新视角合成 1 篇

2605.29891 2026-05-29 cs.CV 70%

DVSM: Decoder-only View Synthesis Model Done Right

DVSM: 正确的仅解码器视图合成模型

Cheng Sun, Jaesung Choe, Min-Hung Chen, Ryo Hachiuma, Yu-Chiang Frank Wang

机构 * NVIDIA National Taiwan University(国立台湾大学)

专题命中 新视角合成 :3DGS(abstract,abstract_cn);分类 cs.CV

AI总结 提出仅解码器架构DVSM,通过隐式KV-cache表示场景,在相同渲染复杂度下以更少参数超越编码器-解码器变体,并利用共享权重、基础模型先验和分阶段块大小优化效率与质量,在多个基准上实现新视点合成的最优结果。

Comments Code at https://github.com/NVLabs/dvsm

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 空间理解 2 篇

2605.30307 2026-05-29 cs.CV 57%

Grounded 3D-Aware Spatial Vision-Language Modeling

基于三维感知的空间视觉语言建模

An-Chieh Cheng, Yang Fu, Yatai Ji, Ligeng Zhu, Guanqi Zhan, Zhuoyang Zhang, Zhaojing Yang, Song Han, Yao Lu, Pavlo Molchanov, Vidya Nariyambut Murali, Jan Kautz, Xiaolong Wang, Hongxu Yin, Sifei Liu

机构 * UCSD(加州大学圣迭戈分校) MIT(麻省理工学院) NVIDIA(英伟达)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 提出GR3D模型,通过显式2D定位、隐式2D定位和单目3D定位三种互补定位能力,在单一框架内实现空间链式推理,并在定位与非定位空间基准上取得一致提升。

Comments CVPR 2026 https://www.anjiecheng.me/gr3d

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30231 2026-05-29 cs.CV cs.AI 57%

Beyond 3D VQAs: Injecting 3D Spatial Priors into Vision-Language Models for Enhanced Geometric Reasoning

超越3D VQA:将3D空间先验注入视觉-语言模型以增强几何推理

Chun-Hsiao Yeh, Shengyi Qian, Manchen Wang, Yi Ma, Joseph Tighe, Fanyi Xiao

机构 * FAIR at Meta(Meta的FAIR)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 提出GASP框架,通过将几何先验注入LLM的Transformer层,利用对比损失和深度一致性监督训练,显著提升VLM的3D空间推理能力,在多个基准上取得大幅提升。

Comments CVPR 2026. Project page: https://danielchyeh.github.io/GASP/

详情

展开后加载摘要…

URL PDF HTML 收藏