arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

共收录 74 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 74 篇

2605.02347 2026-07-01 cs.RO 版本更新 57%

ShapeGrasp: Simultaneous Visuo-Haptic Shape Completion and Grasping for Improved Robot Manipulation

ShapeGrasp: 同时进行视觉-触觉形状补全与抓取以改进机器人操作

Lukas Rustler, Matej Hoffmann

机构 * Czech Technical University in Prague(捷克布拉格技术大学)

专题命中 三维重建 :point cloud(abstract);分类 cs.RO

AI总结 提出ShapeGrasp迭代抓取与补全流程,结合隐式表面视觉-触觉形状补全与基于物理的抓取规划,从单RGB-D视图推断完整形状并生成候选抓取,利用抓取反馈更新形状,在真实机器人上实现高抓取成功率并改善3D形状重建质量。

Comments Submitted for peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04349 2026-06-26 cs.CV cs.AI 版本更新 57%

VecSet-Edit: Unleashing Pre-trained LRM for Mesh Editing from Single Image

VecSet-Edit:利用预训练的LRM进行单图像网格编辑

Teng-Fang Hsiao, Bo-Kai Ruan, Yu-Lun Liu, Hong-Han Shuai

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 三维重建 :Gaussian Splatting(abstract);分类 cs.CV

AI总结 本文提出VecSet-Edit,利用VecSet LRM进行单图像网格编辑,通过Mask引导的token播种和注意力对齐的token门控策略,结合漂移感知的token修剪和细节保留的纹理烘焙模块,实现高精度网格编辑。

Comments Accepted by SIGGRAPH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17916 2026-06-26 cs.CV 版本更新 57%

EndoUFM: Utilizing Foundation Models for Monocular depth estimation of endoscopic images

EndoUFM:利用基础模型进行内窥镜图像的单目深度估计

Xinning Yao, Bo Liu, Bojian Li, Jingjing Wang, Jinghua Yue, Fugen Zhou

机构 * Image Processing Center, Beihang University(北京航空航天大学图像处理中心) State Key Laboratory of High-Efficiency Reusable Aerospace Transportation Technology(高效可重复航天运输技术国家重点实验室)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 提出EndoUFM框架,通过双基础模型和自适应微调策略(RVLoRA和Res-DSC)提升内窥镜图像单目深度估计性能,在多个数据集上达到最优。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14915 2026-06-25 cs.CV 版本更新 57%

ILV: Iterative Latent Volumes for Fast and Accurate Sparse-View CT Reconstruction

ILV: 用于快速准确稀疏视角CT重建的迭代潜在体

Seungryong Lee, Woojeong Baek, Joosang Lee, Eunbyung Park

机构 * Sungkyunkwan University(成均馆大学) Yonsei University(延世大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 提出迭代潜在体(ILV)框架,结合数据驱动先验与经典迭代重建原理,通过构建并迭代更新显式3D潜在体,实现稀疏视角CBCT的快速高精度重建,在约14,000个CT体积的大规模数据集上显著优于现有方法。

Comments Project page: https://sngryonglee.github.io/ILV/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07690 2026-06-23 cs.CV 版本更新 57%

FrameVGGT: Coherence-Preserving Memory for Bounded Streaming Geometry

FrameVGGT:几何对齐的帧级内存用于有界流式VGGT

Zhisong Xu, Takeshi Oishi

机构 * Institute of Industrial Science(工业科学研究所) The University of Tokyo(东京大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 FrameVGGT从几何支持角度重新审视有界内存流式处理,通过组织帧级增量KV贡献为连贯段,实现稳定几何支持与内存平衡。

Comments 23pages including appendix checklist

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03962 2026-06-23 cs.CV 版本更新 57%

A Linear Fractional Transformation Model and Calibration Method for Light Field Camera

光场相机的线性分式变换模型与标定方法

Zhong Chen, Changfeng Chen

机构 * School of Mechanical and Automotive Engineering, South China University of Technology(机械与自动化工程学院,华南理工大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 提出一种线性分式变换模型,通过单一参数解耦主透镜与微透镜阵列成像,实现独立标定,在物理与模拟数据集上达到2.1%的平均平移误差,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18276 2026-06-23 cs.RO cs.AI 版本更新 57%

GAPartManip: A Large-scale Part-centric Dataset for Material-Agnostic Articulated Object Manipulation

GAPartManip:面向材料无关铰接物体操作的大规模部件中心数据集

Wenbo Cui, Chengyang Zhao, Songlin Wei, Jiazhao Zhang, Haoran Geng, Yaran Chen, Haoran Li, He Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) CFCS, School of Computer Science, Peking University(北京大学计算机科学系) Carnegie Mellon University(卡内基梅隆大学) University of California, Berkeley(加州大学伯克利分校) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) Galbot

专题命中 三维重建 :3D vision(abstract);分类 cs.RO

AI总结 提出大规模部件中心数据集GAPartManip,结合照片级材质随机化和部件级交互姿态标注,通过模块化框架提升深度估计与交互姿态预测,在仿真和真实场景中实现鲁棒的铰接物体操作。

Comments Accepted by ICRA 2025. Project page: https://pku-epic.github.io/GAPartManip/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03199 2026-06-19 cs.CV 版本更新 57%

Does Head Pose Correction Improve Biometric Facial Recognition?

姿态校正是否能提升生物特征面部识别?

Justin Norman, Hany Farid

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 研究探讨了AI驱动的头部姿态校正与图像修复对面部识别准确率的影响,发现选择性应用CFR-GAN与CodeFormer可提升识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10873 2026-06-19 cs.CV cs.AI 版本更新 57%

CADBench: A Multimodal Benchmark for AI-Assisted CAD Program Generation

CADBench:一个用于AI辅助CAD程序生成的多模态基准

Anna C. Doris, Jacob Thomas Sony, Ghadi Nehme, Era Syla, Amin Heyrani Nobari, Faez Ahmed

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出CADBench,一个统一的多模态CAD程序生成基准,包含18000个样本和六类基准,评估11种视觉语言模型,揭示了CAD程序生成中的三种常见失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09439 2026-06-18 cs.CV 版本更新 57%

SuperCarver: Texture-Consistent 3D Geometry Super-Resolution for High-Fidelity Surface Detail Generation

SuperCarver: 纹理一致的3D几何超分辨率用于高保真表面细节生成

Qijian Zhang, Xiaozheng Jian, Xuan Zhang, Wenping Wang, Junhui Hou

机构 * Tencent Games, China(腾讯游戏,中国) Department of Computer Science & Engineering, Texas A & M University(电子与计算机工程系,德克萨斯A&M大学) Department of Computer Science, City University of Hong Kong(计算机科学系,香港城市大学)

专题命中 三维重建 :3D generation(abstract);分类 cs.CV

AI总结 提出SuperCarver,一种3D几何超分辨率管线,通过先验引导的法线扩散模型和噪声鲁棒的逆渲染,为粗糙网格补充纹理一致的表面细节,实现高保真细节生成。

Comments Accepted in IEEE TVCG

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01171 2026-06-09 cs.CV cs.LG 版本更新 57%

CADFit: Precise Mesh-to-CAD Program Generation with Hybrid Optimization

CADFit:基于混合优化的精确网格到CAD程序生成

Ghadi Nehme, Eamon Whalen, Faez Ahmed

机构 * Department of Mechanical Engineering, Massachusetts Institute of Technology, Cambridge, MA 02139, USA(麻省理工学院机械工程系)

专题命中 三维重建 :point cloud(abstract);分类 cs.CV

AI总结 提出CADFit框架,通过基于几何反馈的增量拟合和验证参数化操作,从网格中恢复复杂可编辑的CAD构造序列,在多个基准上优于现有方法,并显著降低无效比率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17519 2026-07-28 cs.MM 版本更新 50%

GEAR: Reconstruction of Classical Paintings via Geometry Grounding and Appearance Restitution

GEAR:通过几何定位和外观还原重建古典绘画

Qinyu Zhang, Xinda Liu, Yunchen Li, Yunzhuo Liu, Chenxi Hu, Kang Li, Guohua Geng

专题命中 三维重建 :3D reconstruction(abstract)

AI总结 研究旨在解决从单幅古典绘画重建3D场景的难题,提出免训练的GEAR框架,先通过几何定位增强3D高斯重建稳定性,再在空间约束下恢复外观,经实验验证其在多方面优于基线,还构建了相关基准。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20317 2026-07-16 cs.AR 版本更新 50%

VersaQ-3D: Architecture Support for Visual Geometry Grounded Transformers via Versatile Quantization

VersaQ-3D:通过通用量化对视觉几何基础变压器的架构支持

Yipu Zhang, Jintao Cheng, Xingyu Liu, Zeyu Li, Carol Jingyi Li, Jin Wu, Lin Jiang, Ceyu Xu, Yuan Xie, Jiang Xu, Wei Zhang

专题命中 三维重建 :3D reconstruction(abstract)

AI总结 研究针对视觉几何基础变压器(VGGT)因参数规模大及量化困难限制设备部署的问题,提出VersaQ-3D算法-架构协同设计框架,算法上有无校准量化方法,架构上设计可重构加速器,实现低比特高精度及显著加速,能在边缘设备高效进行3D重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18884 2026-07-09 cs.NE 版本更新 50%

MEGO: Learning Mixture-of-Experts for General-Purpose Binary Optimization

MEGO:学习用于通用二进制优化的专家混合模型

Shengcai Liu, Zhiyuan Wang, Yew-Soon Ong, Xin Yao, Ke Tang

专题命中 三维重建 :3D reconstruction(abstract)

AI总结 研究针对离散优化问题,提出MEGO这一通用神经优化器,它由无需领域知识训练的专家混合模型构成,通过路由策略解决新问题。在多类问题上展现强大泛化能力,优于现有优化器,还提供了量化问题相似性及分类的新方法。

Comments 33 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏