arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

共收录 4393 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 4393 篇

2602.21820 2026-03-03 cs.CV 57%

Joint Shadow Generation and Relighting via Light-Geometry Interaction Maps

基于光-几何交互映射的阴影生成与光照恢复

Shan Wang, Peixia Li, Chenchen Xu, Ziang Cheng, Jiayu Yang, Hongdong Li, Pulak Purkait

机构 * Amazon(亚马逊公司) Australian National University(澳大利亚国立大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出光-几何交互映射,通过联合阴影生成与光照恢复的统一流程,实现高效且物理一致的阴影处理。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00990 2026-03-03 cs.CV 57%

MLRecon: Robust Markerless Freehand 3D Ultrasound Reconstruction via Coarse-to-Fine Pose Estimation

MLRecon: 通过粗到细的姿态估计实现鲁棒的无标记自由手3D超声重建

Yi Zhang, Puxun Tu, Kun Wang, Yulin Yan, Tao Ying, Xiaojun Chen

机构 * Institute of Biomedical Manufacturing and Life Quality Engineering, School of Mechanical Engineering, Shanghai Jiao Tong University, Shanghai, China(生物医学制造与生命质量工程学院,机械工程学院,上海交通大学,上海,中国) Department of Ultrasound in Medicine, Shanghai Sixth People's Hospital Affiliated to Shanghai Jiao Tong University School of Medicine, Shanghai, China(医学超声科,上海第六人民医院(隶属于上海交通大学医学院)) Institute of Medical Robotics, Shanghai Jiao Tong University, Shanghai, China(医学机器人研究院,上海交通大学,上海,中国)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 MLRecon通过粗到细姿态估计实现无标记自由手3D超声重建,有效解决漂移问题,实现高精度的6D探头跟踪与高质量3D成像。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00908 2026-03-03 cs.CV 57%

UD-SfPNet: An Underwater Descattering Shape-from-Polarization Network for 3D Normal Reconstruction

UD-SfPNet: 一种用于水下散射消除的偏振形状从偏振网络用于3D法线重建

Puyun Wang, Kaimin Yu, Huayang He, Feng Huang, Xianyu Wu, Yating Chen

机构 * School of Mechanical Engineering and Automation, Fuzhou University(福州大学机械与自动化学院) The Research Institute of Highway, Ministry of Transport(交通部高速公路研究 institute) The State Key Laboratory of Precision Measurement Technology and Instruments, Department of Precision Instruments, Tsinghua University(清华大学精密测量技术与仪器国家重点实验室)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 UD-SfPNet通过结合偏振成像的散射消除与形状从偏振技术,实现了水下3D法线重建的高精度与高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00526 2026-03-03 cs.CV 57%

Mesh-Pro: Asynchronous Advantage-guided Ranking Preference Optimization for Artist-style Quadrilateral Mesh Generation

Mesh-Pro: 异步优势引导的排名偏好优化用于艺术家风格的四边形网格生成

Zhen Zhou, Jian Liu, Biwen Lei, Jing Xu, Haohan Weng, Yiling Zhu, Zhuo Chen, Junfeng Fan, Yunkai Ma, Dazhao Du, Song Guo, Fengshui Jing, Chunchao Guo

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tencent Hunyuan(腾讯文元) Hong Kong University of Science and Technology(香港科技大学)

专题命中 三维重建 :3D generation(abstract);分类 cs.CV

AI总结 Mesh-Pro通过异步优势引导的排名偏好优化提升3D网格生成的训练效率和生成质量,引入了新的标记化和奖励机制,实现了艺术家风格网格的先进性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21893 2026-02-27 cs.CV 57%

EndoDDC: Learning Sparse to Dense Reconstruction for Endoscopic Robotic Navigation via Diffusion Depth Completion

EndoDDC: 通过扩散深度补全学习稀疏到密集重建以实现内窥镜机器人导航

Yinheng Lin, Yiming Huang, Beilei Cui, Long Bai, Huxin Gao, Hongliang Ren, Jiewen Lai

机构 * Department of Electronic Engineering, The Chinese University of Hong Kong(电子工程系,香港中文大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 EndoDDC通过扩散模型整合图像、稀疏深度信息和深度梯度特征,提升内窥镜环境下深度重建的准确性和鲁棒性。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21929 2026-02-26 cs.CV 57%

Geometry-as-context: Modulating Explicit 3D in Scene-consistent Video Generation to Geometry Context

几何作为上下文:调节显式3D以在场景一致视频生成中利用几何上下文

JiaKui Hu, Jialun Liu, Liying Yang, Xinliang Zhang, Kaiwen Li, Shuang Zeng, Yuanwei Li, Haibin Huang, Chi Zhang, Yanye Lu

机构 * Institute of Medical Technology, Peking University(北京大学医学技术学院) TeleAI MUST

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出几何作为上下文的方法,通过自回归模型迭代生成3D场景,提升视频生成的场景一致性和相机控制能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21780 2026-02-26 cs.CV 57%

XStreamVGGT: Extremely Memory-Efficient Streaming Vision Geometry Grounded Transformer with KV Cache Compression

XStreamVGGT: 极端内存高效的流式视觉几何 grounded Transformer 与 KV 缓存压缩

Zunhai Su, Weihao Ye, Hansen Feng, Keyu Fan, Jing Zhang, Dahai Yu, Zhengwu Liu, Ngai Wong

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能学院) China Star Optoelectronics Technology(中国星电科技) TCL Corporate Research (HK) Co., Ltd.(TCL香港企业研究有限公司) Department of Electrical and Electronic Engineering, The University of Hong Kong(香港大学电子与电气工程系)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 XStreamVGGT通过剪枝和量化技术,实现极内存高效的流式3D重建,显著降低内存消耗并加速推理。

Comments Submission to the Journal of the Society for Information Display

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15487 2026-02-26 cs.LG cs.CV 57%

NTK-Guided Implicit Neural Teaching

NTK引导的隐式神经教学

Chen Zhang, Wei Zuo, Bingyang Cheng, Yikun Wang, Wei-Bin Kou, Yik Chung WU, Ngai Wong

机构 * The University of Hong Kong(香港大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出NTK引导的隐式神经教学方法,通过动态选择坐标加速训练,显著减少训练时间并保持表示质量。

Comments CVPR 2026 (18 pages, 10 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20943 2026-02-25 cs.CV 57%

UFO: Unifying Feed-Forward and Optimization-based Methods for Large Driving Scene Modeling

UFO: 为大驾驶场景建模统一前馈和基于优化的方法

Kaiyuan Tan, Yingying Shen, Mingfei Tu, Haohui Zhu, Bing Wang, Guang Chen, Hangjun Ye, Haiyang Sun

机构 * Xiaomi EV(小米电动车) UIUC(伊利诺伊大学香槟分校)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 UFO通过结合优化和前馈方法,实现了高效长距离4D驾驶场景重建,能够在0.5秒内高质量重建16秒驾驶日志。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19679 2026-02-24 cs.CV cs.AI 57%

TeHOR: Text-Guided 3D Human and Object Reconstruction with Textures

TeHOR:基于文本的3D人体和物体重建与纹理

Hyeongjin Nam, Daniel Sungho Jung, Kyoung Mu Lee

机构 * Dept. of ECE&ASRI(电子工程与先进科学研究院) IPAI(人工智能研究所)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 TeHOR通过结合文本描述和外观信息,实现更准确的3D人体和物体重建,提升非接触互动的重建能力。

Comments Published at CVPR 2026, 20 pages including the supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06336 2026-02-24 cs.CV cs.LG eess.IV 57%

MEt3R: Measuring Multi-View Consistency in Generated Images

MEt3R:测量生成图像的多视图一致性

Mohammad Asim, Christopher Wewer, Thomas Wimmer, Bernt Schiele, Jan Eric Lenssen

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所) Saarland Informatics Campus(萨尔州信息校园) ETH Zurich(苏黎世联邦理工学院)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 MEt3R是一种用于评估生成图像多视图一致性的新指标,通过密集3D重建和特征比较,独立于场景和采样过程,评估生成模型的质量。

Comments Project website: https://geometric-rl.mpi-inf.mpg.de/met3r/ Updated to Camera-Ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13897 2026-02-23 cs.LG cs.CV 57%

Data-Efficient Inference of Neural Fluid Fields via SciML Foundation Model

通过SciML基础模型实现神经流场的高效推理

Yuqiu Liu, Jingxuan Xu, Mauricio Soroco, Yunchao Wei, Wuyang Chen

专题命中 三维重建 :3D vision(abstract);分类 cs.CV

AI总结 本文提出利用SciML基础模型实现神经流场的高效推理,通过协同训练策略提升流体动力学重建的PSNR和泛化能力。

Comments Accepted by 3DV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17556 2026-02-20 eess.SP cs.CV 57%

Neural Implicit Representations for 3D Synthetic Aperture Radar Imaging

神经隐式表示用于3D合成孔径雷达成像

Nithin Sugavanam, Emre Ertin

机构 * Ohio State University(俄亥俄州立大学)

专题命中 三维重建 :point cloud(abstract);分类 cs.CV

AI总结 本文提出利用神经隐式表示建模3D合成孔径雷达成像中的表面散射,通过学习有符号距离函数以提高重建图像质量,并探讨未来复值神经表示的学习方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17473 2026-02-20 cs.CV 57%

4D Monocular Surgical Reconstruction under Arbitrary Camera Motions

在任意摄像机运动下进行4D单目手术重建

Jiwei Shan, Zeyu Cai, Cheng-Tai Hsieh, Yirui Li, Hao Liu, Lijun Han, Hesheng Wang, Shing Shin Cheng

机构 * Department of Mechanical and Automation Engineering(机械与自动化工程系) T Stone Robotics Institute, The Chinese University of Hong Kong, Hong Kong(T Stone机器人研究院,香港中文大学,香港) Shenyang Institute of Automation, Chinese Academy of Sciences, Shenyang, China(沈阳自动化研究所,中国科学院,沈阳,中国) State Key Laboratory of Robotics and Intelligent Systems, Shenyang, China(机器人与智能系统国家重点实验室,中国,沈阳) School of Integrated Circuits, Shanghai Jiao Tong University, Shanghai, China(集成电路学院,上海交通大学,中国,上海) School of Automation and Intelligent Sensing, Shanghai Jiao Tong University, Shanghai, China(自动化与智能感知学院,上海交通大学,中国,上海) Key Laboratory of System Control and Information Processing, Ministry of Education of China, Shanghai, China(系统控制与信息处理重点实验室,中国教育部,中国,上海)

专题命中 三维重建 :Gaussian Splatting(abstract);分类 cs.CV

AI总结 本文提出Local-EndoGS框架,通过局部可变形场景模型和多视图几何优化,实现任意摄像机运动下的高质量4D单目手术重建。

Comments Due to the limitation "The abstract field cannot be longer than 1,920 characters", the abstract here is shorter than that in the PDF file Subjects

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16915 2026-02-20 cs.CV 57%

StereoAdapter-2: Globally Structure-Consistent Underwater Stereo Depth Estimation

StereoAdapter-2: 基于全局结构一致性的水下立体深度估计

Zeyu Ren, Xiang Li, Yiran Wang, Zeyu Zhang, Hao Tang

机构 * The University of Melbourne(墨尔本大学) Peking University(北京大学) Australian Centre for Robotics(澳大利亚机器人中心)

专题命中 三维重建 :novel view synthesis(abstract);分类 cs.CV

AI总结 StereoAdapter-2通过引入基于选择性状态空间模型的ConvSS2D操作符,实现了高效的水下立体深度估计,提升了水下基准测试的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16744 2026-02-20 cs.RO 57%

ICP-Based Pallet Tracking for Unloading on Inclined Surfaces by Autonomous Forklifts

基于ICP的自主叉车在倾斜表面卸货的托盘跟踪

Takuro Kato, Mitsuharu Morisawa

机构 * TICO-AIST Cooperative Research Laboratory for Advanced Logistics, National Institute of Advanced Industrial Science and Technology (AIST), Tsukuba, Japan(先进工业科学技术国家研究所(AIST))

专题命中 三维重建 :point cloud(abstract);分类 cs.RO

AI总结 本文提出基于ICP算法的自主叉车在倾斜表面卸货的托盘跟踪方法,通过实时跟踪实现叉子与托盘的对齐,从而避免拖拽并提高卸货效率。

Comments Accepted and published in IEEE/SICE SII 2024

Journal ref Proc. IEEE/SICE International Symposium on System Integration (SII), 2024, pp.1504-1510

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15733 2026-02-18 cs.RO cs.AI 57%

MeshMimic: Geometry-Aware Humanoid Motion Learning through 3D Scene Reconstruction

MeshMimic: 通过3D场景重建实现几何感知的人形运动学习

Qiang Zhang, Jiahao Ma, Peiran Liu, Shuai Shi, Zeran Su, Zifan Wang, Jingkai Sun, Wei Cui, Jialin Yu, Gang Han, Wen Zhao, Pihai Sun, Kangning Yin, Jiaxu Wang, Jiahang Cao, Lingfeng Zhang, Hao Cheng, Xiaoshuai Hao, Yiding Ji, Junwei Liang, Jian Tang, Renjing Xu, Yijie Guo

机构 * X-Humanoid The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The University of Hong Kong(香港大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) The Australian National University(澳大利亚国立大学)

专题命中 三维重建 :3D vision(abstract);分类 cs.RO

AI总结 MeshMimic通过3D场景重建实现人形机器人学习与地形耦合的运动交互,利用消费级传感器低成本训练复杂物理交互。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22914 2026-02-18 cs.CV cs.LG 57%

cadrille: Multi-modal CAD Reconstruction with Reinforcement Learning

cadrille: 多模态CAD重建与强化学习

Maksim Kolodiazhnyi, Denis Tarasov, Dmitrii Zhemchuzhnikov, Alexander Nikulin, Ilya Zisman, Anna Vorontsova, Anton Konushin, Vladislav Kurenkov, Danila Rukhovich

机构 * Lomonosov Moscow State University(罗蒙诺索夫莫斯科国立大学) AXXX ETH Zurich(苏黎世联邦理工学院) Innopolis University(因诺波利斯大学) Institute of Mechanics, Armenia(亚美尼亚力学研究所)

专题命中 三维重建 :point cloud(abstract);分类 cs.CV

AI总结 cadrille通过强化学习实现多模态CAD重建,首次在CAD任务中应用RL微调,提升重建性能并设定新基准。

Comments ICLR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14228 2026-02-17 cs.CV 57%

Learning Significant Persistent Homology Features for 3D Shape Understanding

学习显著持久同调特征以理解3D形状

Prachi Kudeshia, Jiju Poovvancheri

机构 * Saint Mary's University(圣玛丽大学)

专题命中 三维重建 :point cloud(abstract);分类 cs.CV

AI总结 本文提出TopoGAT方法,通过学习显著持久同调特征提升3D形状分析的性能。

Comments 17 pages, 10 figures, Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00220 2026-02-17 eess.IV cs.CV 57%

Deep learning Based Correction Algorithms for 3D Medical Reconstruction in Computed Tomography and Macroscopic Imaging

基于深度学习的3D医学重建在计算机断层扫描和宏观成像中的校正算法

Tomasz Les, Tomasz Markiewicz, Malgorzata Lorent, Miroslaw Dziekiewicz, Krzysztof Siwek

机构 * University of Technology(技术大学) Military Institute of Medicine(军事医学研究院) Institute of Tuberculosis and Lung Diseases(肺结核和肺病研究所)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出了一种混合两阶段配准框架,结合几何先验和深度学习,提升3D医学重建的精度和解剖真实感。

Comments 23 pages, 9 figures, submitted to Applied Sciences (MDPI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11673 2026-02-13 cs.CV 57%

RI-Mamba: Rotation-Invariant Mamba for Robust Text-to-Shape Retrieval

RI-Mamba:用于鲁棒文本到形状检索的旋转不变Mamba

Khanh Nguyen, Dasith de Silva Edirimuni, Ghulam Mubashar Hassan, Ajmal Mian

机构 * The University of Western Australia(西澳大学)

专题命中 三维重建 :point cloud(abstract);分类 cs.CV

AI总结 RI-Mamba是一种旋转不变的状态空间模型,用于提升文本到形状检索的鲁棒性和表现力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11440 2026-02-13 cs.CV 57%

Ctrl&Shift: High-Quality Geometry-Aware Object Manipulation in Visual Generation

Ctrl&Shift: 视觉生成中高质量的几何感知物体操控

Penghui Ruan, Bojia Zi, Xianbiao Qi, Youze Huang, Rong Xiao, Pichao Wang, Jiannong Cao, Yuhui Shi

机构 * The Hong Kong Polytechnic University(香港理工大学) Southern University of Science and Technology(南方科技大学) The Chinese University of Hong Kong(香港中文大学) IntelliFusion Inc.(IntelliFusion公司) University of Electronic Science and Technology of China(电子科技大学) NVIDIA

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 Ctrl&Shift通过端到端扩散框架实现高质量几何感知物体操控,无需显式3D建模,兼顾细粒度控制与现实泛化能力。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11433 2026-02-13 cs.GR 57%

Filmsticking++: Rapid Film Sticking for Explicit Surface Reconstruction

Filmsticking++: 快速薄膜贴合用于显式表面重建

Pengfei Wang, Jian Liu, Qiujie Dong, Shiqing Xin, Yuanfeng Zhou, Changhe Tu, Caiming Zhang, Wenping Wang

专题命中 三维重建 :point cloud(abstract);分类 cs.GR

AI总结 Filmsticking++通过改进的受限幂图和虚拟站点技术,实现无需法线的显式表面重建,提高效率与鲁棒性。

Comments 15 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06503 2026-02-10 cs.CV cs.LG 57%

Forest canopy height estimation from satellite RGB imagery using large-scale airborne LiDAR-derived training data and monocular depth estimation

利用大范围航空激光雷达衍生的训练数据和单目深度估计进行森林冠高估计

Yongkang Lai, Xihan Mu, Dasheng Fan, Donghui Xie, Shanxin Guo, Wenli Huang, Tianjie Zhao, Guangjian Yan

专题命中 三维重建 :point cloud(abstract);分类 cs.CV

AI总结 本研究利用航空激光雷达数据训练单目深度估计模型,实现从卫星RGB影像高精度估计森林冠高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04162 2026-02-10 cs.CV cs.AI eess.IV 57%

Improving 2D Diffusion Models for 3D Medical Imaging with Inter-Slice Consistent Stochasticity

通过跨切片一致的随机性改进2D扩散模型用于3D医学影像

Chenhe Du, Qing Wu, Xuanyu Tian, Jingyi Yu, Hongjiang Wei, Yuyao Zhang

机构 * ShanghaiTech University(上海科技大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 通过引入跨切片一致的随机性策略,改进2D扩散模型以提升3D医学影像重建的保真度与一致性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.09322 2026-02-10 cs.CV 57%

Fast Image-based Neural Relighting with Translucency-Reflection Modeling

基于图像的快速神经光照与透明-反射建模

Shizhan Zhu, Shunsuke Saito, Aljaz Bozic, Carlos Aliaga, Trevor Darrell, Christoph Lassner

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出了一种快速神经3D重建和光照模型,能够利用IBL重新照明复杂材料,如透明和光泽反射,实现逼真效果。

Comments v2: Major revision and bug fix: New method with significantly improved results. Corrects an error in v1 (arXiv:2306.09322v1) in the evaluation of baseline NRTF due to an implementation bug. Results in v2 supersede those in v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07658 2026-02-10 cs.CV 57%

Influence of Geometry, Class Imbalance and Alignment on Reconstruction Accuracy -- A Micro-CT Phantom-Based Evaluation

几何形状、类别不平衡与对齐对重建精度的影响——基于微CT仿真的评估

Avinash Kumar K M, Samarth S. Raut

专题命中 三维重建 :point cloud(abstract);分类 cs.CV

AI总结 本研究通过微CT仿真实验,探讨了几何形状、类别不平衡和对齐对3D重建精度的影响,发现Otsu方法在多数几何中表现最佳,而Jaccard指数更适合评估薄壁结构精度。

Comments 22 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06419 2026-02-09 cs.CV 57%

Learning Human Visual Attention on 3D Surfaces through Geometry-Queried Semantic Priors

通过几何查询的语义先验学习人类在3D表面上的视觉注意

Soham Pahari, Sandeep C. Kumain

机构 * UPES Dehradun(德里敦大学)

专题命中 三维重建 :point cloud(abstract);分类 cs.CV

AI总结 本文提出SemGeo-AttentionNet,通过几何查询语义先验,有效建模人类在3D表面的视觉注意,实现了显著性检测与扫描路径生成的改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11924 2026-02-09 cs.CV 57%

Aligned Novel View Image and Geometry Synthesis via Cross-modal Attention Instillation

通过跨模态注意力安装实现对齐的新视角图像和几何合成

Min-Seop Kwak, Junho Kim, Sangdoo Yun, Dongyoon Han, Taekyung Kim, Seungryong Kim, Jin-Hwa Kim

机构 * NAVER AI Lab(NAVER AI实验室) KAIST AI(韩国科学技术院人工智能学院) SNU AIIS(首尔国立大学人工智能研究所)

专题命中 三维重建 :point cloud(abstract);分类 cs.CV

AI总结 本文提出了一种基于扩散的框架,通过跨模态注意力蒸馏实现新视角图像和几何的对齐生成,提升几何鲁棒性和重建质量。

Comments Project page at https://cvlab-kaist.github.io/MoAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08194 2026-02-06 cs.CV 57%

GIQ: Benchmarking 3D Geometric Reasoning of Vision Foundation Models with Simulated and Real Polyhedra

GIQ:基于模拟和真实多面体的3D几何推理视觉基础模型基准测试

Mateusz Michalkiewicz, Anekha Sokhal, Tadeusz Michalkiewicz, Piotr Pawlikowski, Mahsa Baktashmotlagh, Varun Jampani, Guha Balakrishnan

机构 * Rice University(里士大学) The University of Queensland(昆士兰大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 GIQ通过模拟和真实多面体评估视觉基础模型的3D几何推理能力,揭示了现有模型在几何理解上的不足。

Comments Accepted to ICLR 2026. Camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏