arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-07-27 至 2026-07-27 共收录 15 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 3 篇

2607.22534 2026-07-27 cs.CV cs.AI cs.RO 新提交 62%

SM4RT: Learning Structured Motion Geometry for 4D Reconstruction

SM4RT:学习用于4D重建的结构化运动几何

Shing Ho J. Lin, Wenzhao Zheng, Dong Zhuo, Yuqi Wu, Jie Zhou, Jiwen Lu

机构 * Intelligent Vision Group, Tsinghua University(清华大学智能视觉组)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV、cs.RO

AI总结 针对将单目3D重建能力扩展到4D动态理解的挑战,提出SM4RT,通过引入运动结构表示场景动态,利用并行运动几何编码器和解码器,从单目RGB视频中联合推断相关信息,实现强大运动重建性能并保留场景运动几何结构。

Comments Code is available at: https://github.com/wzzheng/SM4RT

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00713 2026-07-27 cs.CV 版本更新 57%

RAD: A Dataset and Benchmark for Real-Life Anomaly Detection with Robotic Observations

RAD:面向机器人观测的真实异常检测数据集与基准

Kaichen Zhou, Xinhai Chang, Taewhan Kim, Jiadong Zhang, Yang Cao, Chufei Peng, Fangneng Zhan, Hao Zhao, Hao Dong, Kai Ming Ting, Ye Zhu

机构 * Massachusetts Institute of Technology(麻省理工学院) Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) Great Bay University(大湾大学) Harvard University(哈佛大学) Tsinghua University(清华大学) Nanjing University(南京大学) Deakin University(德克萨斯大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 提出RAD数据集,包含13类日常物体和4种缺陷,从60多个机器人视角在非受控光照下采集,用于评估2D特征、3D重建和视觉语言模型在姿态无关的异常检测中的表现,发现2D方法优于3D和VLM方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13826 2026-07-27 eess.IV cs.CV 版本更新 57%

Latent Interpolation Learning Using Diffusion Models for Cardiac Volume Reconstruction

使用扩散模型进行心脏容积重建的潜在插值学习

Niklas Bubeck, Suprosanna Shit, Chen Chen, Can Zhao, Pengfei Guo, Dong Yang, Georg Zitzlsberger, Daguang Xu, Bernhard Kainz, Daniel Rueckert, Jiazhen Pan

机构 * School of Computation, Information and Technology, Technical University Munich(技术大学慕尼黑计算信息学院) Munich Center for Machine Learning(慕尼黑机器学习中心) Department of Quantitative Biomedicine, University of Zurich(苏黎世大学定量生物医学系) Institute of Biomedical Engineering, Department of Engineering Science, University of Oxford(牛津大学生物医学工程研究所) Imperial College London(伦敦帝国学院) University of Sheffield(谢菲尔德大学) NVIDIA(英伟达) Department of Computing, Imperial College London(伦敦帝国学院计算机系) Department AIBE of Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔兰根-纽伦堡大学AIBE系) School of Medicine, Klinikum Rechts der Isar, Technical University of Munich(慕尼黑技术大学医学院,莱纳特医院)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 针对心脏磁共振成像二维切片采集稀疏致容积信息不完整、现有重建方法有局限的问题,提出CaLID框架,创新采用基于扩散模型的插值方案、潜在空间高效计算法,仅用稀疏二维图像输入达SOTA,扩展到二维加时间数据,提升了重建质量和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. NeRF 1 篇

2607.21675 2026-07-27 quant-ph cs.CV 新提交 77%

Hash-QNeRF: Multiresolution Hash Encoding for Quantum Neural Radiance Fields

Hash-QNeRF:用于量子神经辐射场的多分辨率哈希编码

Digonto Biswas, Tana Ballove, Anjan Bandyopadhyay, Sutanu Mangal, Arun Kumar Pati

机构 * Centres of Innovation and Research(创新与研究中心) KIIT Deemed to be University(KIIT大学)

专题命中 NeRF :NeRF(abstract,abstract_cn);novel view synthesis(abstract);分类 cs.CV

AI总结 研究针对QNeRF中空间坐标正弦位置编码扩展性差的问题,提出用多分辨率哈希编码取代其空间坐标正弦位置编码,设计出Hash-QNeRF,实现快速收敛和内存高效,在合成场景有良好训练损失及PSNR表现,且不降低量子电路噪声容限。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. Gaussian Splatting 1 篇

2607.21448 2026-07-27 cs.CV 版本更新 88%

GrainGS: Gradient-Decoupled Gaussian Splatting for Efficient Dynamic Novel View Synthesis

GrainGS:用于高效动态新视图合成的梯度解耦高斯点云渲染

Jiahao He, Yihua Shao, Zhengkai Zhao, Pan Gao, Fei Ma, Jingcai Guo, Hao Tang, Nicu Sebe, Qi Tian

机构 * College of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics(南京航空航天大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Department of Computing, Hong Kong Polytechnic University(香港理工大学计算学系) School of Computer Science, Peking University(北京大学计算机科学学院) Guangdong Laboratory of Artificial Intelligence and Digital Economy(广东省人工智能与数字经济实验室) Huawei Consumer Business Group, Huawei(华为消费者业务集团) Department of Information Engineering and Computer Science, University of Trento(特伦托大学信息工程与计算机科学系)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);novel view synthesis(title,abstract);分类 cs.CV

AI总结 针对动态场景重建问题,GrainGS结合分层锚点框架与高斯变形,通过静态预热、停止梯度操作等实现各高斯独立预测时间偏移及规范-残差外观分解,在合成和真实多视图基准测试中展现出高重建质量、实时渲染及紧凑存储等优势。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 点云 7 篇

2605.08971 2026-07-27 cs.CV cs.AI 79%

Extrusion Segmentation Strategy to improve CAD Reconstruction from Point Cloud

挤压分割策略以提升点云的CAD重建

Said Harb, Mehdi Maboudi, Markus Gerke

机构 * Institute of Geodesy and Photogrammetry(测绘院)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 本文提出一种挤压分割策略,通过将点云分割为独立的挤压部分,提高CAD重建的泛化能力和鲁棒性,从而提升深度学习模型的重建性能。

Comments Conference: ISPRS Toronto 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19596 2026-07-27 cs.CV 79%

PC2Model: ISPRS benchmark on 3D point cloud to model registration

PC2Model:ISPRS基准在点云到模型配准

Mehdi Maboudi, Said Harb, Jackson Ferrao, Kourosh Khoshelham, Yelda Turkan, Karam Mawas

机构 * 1 Institute of Geodesy

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 本文提出PC2Model基准,通过结合模拟点云与真实扫描数据,解决点云到模型配准中的稀疏性、噪声等问题,提升跨领域模型泛化能力。

Comments ISPRS Congress 2026, Toronto

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03424 2026-07-27 cs.CV 版本更新 79%

DM3D: Dynamic Mamba via Offset-Guided Feature Resampling for Point Cloud Understanding

DM3D:通过偏移引导的可微扫描实现点云理解的可变形Mamba

Bin Liu, Chunyang Wang, Xuelian Liu, Xuemei Li, Ge Zhang

机构 * Xi'an Key Laboratory of Active Photoelectric Imaging Detection Technology(西安市主动光电成像探测技术重点实验室)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 DM3D提出了一种可变形Mamba架构,通过偏移引导的可微扫描机制实现点云的结构自适应序列化,结合可变形空间采样和可微重新排序,提升点云理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22129 2026-07-27 cs.CV 新提交 57%

A Framework for Individual Tree Growth Reconstruction Using Multi-Platform Laser Scanning

一种使用多平台激光扫描进行单棵树木生长重建的框架

Daniella Tavi, Valtteri Soininen, Lassi Ruoppa, Jesse Muhojoki, Juha Hyyppä

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 该研究提出一种利用多平台激光扫描数据的框架来估计单棵树木胸径和树干体积生长。通过深度学习分割勾勒树木轮廓,结合多平台数据得出树干曲线和高度估计,利用缩放模型重建属性及估计生长,提供了无需多次冠层下扫描的可靠生长估计框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14021 2026-07-27 cs.RO 版本更新 57%

Industrial Dexterity Benchmark: A Hardware-Software Benchmarking Platform for Industrial Dexterous Manipulation

工业灵巧性基准测试:一个用于工业灵巧操作的硬件-软件基准测试平台

Honglu He, Jacob Laufer, Zhiwu Zheng, David Elkan-gonzalez, Raman Goyal, Xinyi Li, Su Lu, Mishek Musa, Berke Saat, Nicolas Tan, Colm Prendergast

机构 * Analog Devices, Inc.(亚德诺半导体技术有限公司)

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 针对工业灵巧操作瓶颈,提出从经典流程到端到端多模态模仿学习框架的转变,介绍了IDB板、DAG-ROS框架和AG-iDP3策略框架,通过数据中心电缆操作实验表明新策略在多方面优于传统方法,推动向可扩展机器人自动化发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03499 2026-07-27 eess.IV cs.CV 版本更新 57%

GeoDiff-SAR: A Geometric Prior Guided Diffusion Model for SAR Image Generation

GeoDiff-SAR:一种基于几何先验的扩散模型用于SAR图像生成

Fan Zhang, Xuanting Wu, Fei Ma, Qiang Yin, Yuxin Hu

机构 * College of Information Science and Technology, Beijing University of Chemical Technology(信息科学与技术学院,北京化工大学) Aerospace Information Research Institute, Chinese Academy of Sciences(航天信息研究所,中国科学院)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 GeoDiff-SAR通过引入几何先验引导扩散模型,提升SAR图像生成的保真度和分类准确性,尤其在不同方位角识别性能上有显著提升。

Comments 3 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20577 2026-07-27 cs.LG cs.AI 版本更新 50%

AI-Driven Surrogate Models for Predicting Electrode-Scale Discharge Behavior in Lithium-Ion Batteries

用于预测锂离子电池电极尺度放电行为的人工智能驱动替代模型

Mengda Xing, Jean-Marie Lagniez, Alejandro Franco

专题命中 点云 :point cloud(abstract)

AI总结 研究锂离子电池电极尺度放电行为预测难题,提出基于Swin3D Transformer的深度学习替代管道,集成高斯位置编码和时间编码模块,实验表明其预测准确且大幅降低计算开销,为电池设计优化提供高效框架。

Journal ref Lecture Notes in Computer Science, 2027, Lecture Notes in Artificial Intelligence, 16615, pp.120-131

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 新视角合成 1 篇

2607.22147 2026-07-27 cs.CV 新提交 85%

Visual Relocalization from Sparse Views in Aliased and Low-Texture Environments via Novel View Synthesis

通过新视图合成在别名和低纹理环境中从稀疏视图进行视觉重定位

Maria Peribañez, Javier Civera, Rudolph Triebel, Riccardo Giubilato

机构 * University of Zaragoza(萨拉戈萨大学) German Aerospace Center (DLR)(德国航空航天中心) Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院)

专题命中 新视角合成 :novel view synthesis(title);3DGS(abstract,abstract_cn);Gaussian Splatting(abstract);分类 cs.CV

AI总结 针对类行星地形中视觉定位难题,提出基于 3D 高斯溅射构建可微地图表示估计相机姿态的方法,采用结合光度与几何损失的几何感知训练策略,经实验验证能有效提升定位准确性与姿态估计鲁棒性。

Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 空间理解 1 篇

2607.22293 2026-07-27 cs.CV 新提交 57%

RadSight: Towards Perceptually Reliable Multimodal Radiology Image Understanding

RadSight:迈向感知可靠的多模态放射学图像理解

Jianqin Liu, Weiwei Cao, Wanxing Chang, Ruifeng Yuan, Bowen Shi, Zhilin Zheng, Xianjie Zhang, Ling Zhang, Peng Wang, Jianpeng Zhang

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hupan Lab(湖畔实验室) University of Electronic Science and Technology of China(电子科技大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 该研究针对医学多模态大语言模型视觉解释可靠性低的问题,引入Perception-Bench基准分析问题。提出基于双2D/3D编码器架构的RadSight模型,经渐进课程学习训练,在多维度评估中优于现有模型,凸显低级视觉感知对可靠临床理解的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. SLAM与定位 1 篇

2504.19345 2026-07-27 cs.HC 版本更新 67%

Navigating the Last Mile: Evaluating Head- and Cane-Mounted Cameras for Egocentric Spatial Awareness

解决最后一公里问题:评估用于自我中心空间感知的头戴式和手杖式摄像头

Apurv Varshney, Lucas Nadolskis, Tobias Höllerer, Michael Beyeler

专题命中 SLAM与定位 :NeRF(abstract);3D reconstruction(abstract)

AI总结 研究盲人行人“最后一公里”导航问题,通过混合方法,调查盲人使用者习惯并进行案例研究,用SLAM和NeRFs比较头戴与手杖式摄像头,发现核心权衡,为混合XR系统架构提供考量。

详情

展开后加载摘要…

URL PDF HTML 收藏