arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-07-22 至 2026-07-22 共收录 19 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 2 篇

2607.18630 2026-07-22 cs.CV 新提交 79%

Seeing Before Generating: Object Perception Enhances Single-View 3D Reconstruction

生成前的观察:物体感知增强单视图3D重建

Y Huynh, Duc Thanh Nguyen, Mohamed Abdelrazek

机构 * Deakin University(迪肯大学) Applied Artificial Intelligence Initiative(应用人工智能倡议组织) School of Information Technology(信息技术学院)

专题命中 三维重建 :3D reconstruction(title,abstract);分类 cs.CV

AI总结 研究单视图3D物体重建问题,提出利用预训练感知模型提取的感知信号驱动重建的方法,该方法与模型无关且可即插即用,实验验证其能显著提升重建效果,为3D重建提供新思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19228 2026-07-22 cs.CV 新提交 57%

IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer

IGGT4D:流式4D实例关联几何变换器

Zhengyu Zou, Hao Li, Kuixuan Jiao, Liu Liu, Tingyang Xiao, Xiaolin Zhou, Fangzhou Hong, Zhizhong Su, Dingwen Zhang, Ziwei Liu

机构 * Horizon Robotics(地平线机器人公司) S-Lab, Nanyang Technological University(南洋理工大学S-Lab) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 针对现实世界空间智能中视频流场景理解问题,提出IGGT4D流式实例关联几何变换器,通过因果时空建模更新统一表示,还构建数据集。实验证明其在长动态序列在线推理上优于现有基线。

Comments Project Page: https://iggt4d.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Gaussian Splatting 5 篇

2606.03254 2026-07-22 cs.CV 版本更新 87%

OF$^3$GS: On-the-Fly Feed-Forward 3D Gaussian Splatting from Unposed Images

FreeStreamGS: 来自无位姿流式输入的在线前馈3D高斯泼溅

Ruiyang Chen, Feiran Li, Chu Zhou, Zonglin Li, Zhanyu Ma, Heng Guo

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) National Institute of Informatics(日本信息处理研究所)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);novel view synthesis(abstract);分类 cs.CV

AI总结 提出FreeStreamGS,一种在线前馈框架,通过解耦内参恢复头和动态点精炼偏移策略,实现从无位姿流式输入的高效高质量新视角合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18539 2026-07-22 cs.CV 新提交 84%

AniGS: Bridging Rendering and Diffusion Prior for 3D Scene Animation

AniGS:弥合3D场景动画的渲染与扩散先验

Yen-Chi Cheng, Chen Gao, Chuhan Chen, Tuotuo Li, Rajvi Shah, Ayush Saraf, Changil Kim, Liangyan Gui, Alexander Schwing, Johannes Kopf, Hung-Yu Tseng

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Waymo(Waymo公司) Carnegie Mellon University(卡内基梅隆大学) Meta

专题命中 Gaussian Splatting :3DGS(summary_cn,abstract);Gaussian Splatting(abstract);分类 cs.CV

AI总结 AniGS旨在为3DGS重建的大型场景添加动画,用规范3DGS表示场景,借时间条件变形场建模运动,利用预训练视频扩散模型及迭代更新策略,防止静态区域运动伪影,实验证明该方法能产生自然动态和高质量新视图视频。

Comments Preprint. Project page: https://yccyenchicheng.github.io/AniGS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18801 2026-07-22 cs.CV 新提交 83%

ZeroSplat: Generalized Referring Segmentation in 3D Gaussian Splatting

ZeroSplat:3D高斯点云渲染中的广义指代分割

Jiayu Ding, Meilu Song, Xiaoyi Zhang, Hongbo Jin, Yichen Jin, Xiangtian Si

机构 * Peking University(北京大学) North China Electric Power University(华北电力大学) China University of Geosciences(中国地质大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract);分类 cs.CV

AI总结 针对现有指代3D高斯点云渲染方法局限,提出ZeroSplat框架,通过多视图几何约束将2D视觉语言模型先验提升至3D空间,无需额外特征存储,在广义和单目标场景中显著优于现有方法,且效率高。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18466 2026-07-22 cs.CV cs.GR 新提交 62%

ECoNGS: Efficient Compressive Neural Gaussian Splats for Volume Visualization

ECoNGS:用于体数据可视化的高效压缩神经高斯点云

Kaiyuan Tang, Chaoli Wang

机构 * University of Notre Dame(圣母大学)

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);分类 cs.CV、cs.GR

AI总结 研究针对大型数据集体数据可视化,提出ECoNGS框架,用轻量级神经网络从显式锚点预测隐式高斯点云,结合联合学习策略、神经熵模型压缩及特定初始化策略,相比iVR-GS在多方面性能更优。

Comments To be published in Proceedings of IEEE VIS 2026, IEEE Transactions on Visualization and Computer Graphics

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19100 2026-07-22 cs.CV 新提交 57%

FlexiAvatar: Unified 3D Gaussian Human Avatars Under Arbitrary Body Visibility

FlexiAvatar:任意身体可见性下的统一3D高斯人体头像

Yihalem Yimolal Tiruneh, Muhammad Salman Ali, Uyoung Jeong, Muneeb A. Khan, MD Khalequzzaman Chowdhury Sayem, Allanur Bayramgeldiyev, Binod Bhattarai, Seungryul Baek

机构 * UNIST(韩国蔚山科学技术院) University of Aberdeen(阿伯丁大学) University College London(伦敦大学学院) Fogsphere(雾球公司)

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);分类 cs.CV

AI总结 研究从单目视频重建3D人体头像问题,提出FlexiAvatar框架,结合遮挡鲁棒跟踪与特定部分残差细化捕捉细节,用扩散方法处理不可见区域,实验表明其重建质量高,还能减少运行时和内存开销。

Comments Accepted in ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 点云 7 篇

2601.06442 2026-07-22 cs.CV cs.RO 版本更新 81%

WHU-PCPR: A cross-platform heterogeneous point cloud dataset for place recognition in complex urban scenes

WHU-PCPR:用于复杂城市场景中地点识别的跨平台异构点云数据集

Xianghong Zou, Jianping Li, Yandi Yang, Weitong Wu, Yuan Wang, Qiegen Liu, Zhen Dong

机构 * School of Advanced Manufacturing, Nanchang University(南昌大学先进制造学院) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) Department of Geomatics Engineering, University of Calgary(卡尔加里大学测绘工程系) School of Earth Sciences and Engineering, Hohai University(河海大学地球科学与工程学院) School of Geography and Environment, Jiangxi Normal University(江西师范大学地理与环境学院) School of Information Engineering, Nanchang University(南昌大学信息工程学院) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室) Hubei Luojia Laboratory(湖北省珞珈实验室)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV、cs.RO

AI总结 针对现有PCPR数据集在场景、平台和传感器方面缺乏多样性的问题,建立跨平台异构点云数据集WHU-PCPR,其具备独特特征。基于此对几种PCPR方法评估分析,讨论关键挑战与未来方向,推动相关研究发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13869 2026-07-22 cs.RO cs.AI 版本更新 79%

TransDex: Pre-training Visuo-Tactile Policy with Point Cloud Reconstruction for Dexterous Manipulation of Transparent Objects

TransDex:基于点云重建的视觉-触觉政策预训练用于透明物体的精细操作

Fengguan Li, Yifan Ma, Chen Qian, Wentao Rao, Weiwei Shang

专题命中 点云 :point cloud(title,abstract);分类 cs.RO

AI总结 TransDex通过点云重建预训练实现视觉-触觉融合政策,解决透明物体操作中的自遮挡和深度噪声问题,提升真实机器人系统中精细操作性能。

Comments Project page: https://transdex.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03262 2026-07-22 cs.CV 79%

PI3DETR: Parametric Instance Detection of 3D Point Cloud Edges With a Geometry-Aware 3DETR

PI3DETR:基于几何感知的3D点云边缘参数实例检测

Fabio F. Oberweger, Michael Schwingshackl, Vanessa Staderini

机构 * AIT Austrian Institute of Technology Center for Vision, Automation & Control(奥地利技术研究院视觉、自动化与控制中心)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 PI3DETR通过几何感知的匹配策略和专用损失函数,实现对多种参数化曲线的统一检测,提升3D点云边缘检测的鲁棒性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19171 2026-07-22 cs.CV 新提交 74%

Point Ladder Tuning: Parameter-Efficient Hierarchical Adaptation for 3D Point Cloud Understanding

点阶梯调优:用于3D点云理解的参数高效分层适配

Junlin Chang, Longhao Zou, Rui Li

机构 * Beihang University(北京航空航天大学) Pengcheng Laboratory(鹏城实验室)

专题命中 点云 :point cloud(title);分类 cs.CV

AI总结 研究针对3D点云理解中微调预训练主干参数效率低的问题,提出点阶梯调优框架PLT,通过构建分层网络、融合局部与全局特征、生成动态提示等进行参数高效分层适配,实验表明其以极少参数达最优性能。

Comments Accepted to ECCV 2026. Code: https://github.com/JunLinChang/ECCV2026-PLT

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18578 2026-07-22 cs.RO eess.SP 新提交 57%

Two-Stage Extrinsic Calibration of a Static Line-Scanning Lidar with a Rotary Platform

基于旋转平台的静态线扫描激光雷达的两阶段外部校准

Vikram Shree, Hike Danakian, Long Nguyen, Rajanish Gokidi, Patrick Nercessian

机构 * SiLC Technologies(SiLC技术公司)

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 研究基于旋转平台的静态线扫描激光雷达校准问题,探索自动方法静态和动态估计旋转轴变换,通过真实数据集验证算法并研究其收敛特性。

Comments 8 pages, 13 figures. Manuscript accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08541 2026-07-22 cs.RO 版本更新 57%

EquiBim: Learning Symmetry-Equivariant Policy for Bimanual Manipulation

EquiBim: 学习双臂操作的对称等变策略

Zhiyuan Zhang, Aditya Mohan, Seungho Han, Wan Shou, Dongyi Wang, Yu She

机构 * Purdue University(普渡大学) University of Arkansas(阿肯色大学)

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 本文提出EquiBim框架,通过强制对称性等变性提升双臂操作的性能和鲁棒性,适用于多种感知与动作表示。

Comments Accepted to IROS 2026. Project page: https://zhangzhiyuanzhang.github.io/equibim-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08635 2026-07-22 stat.ME 版本更新 50%

Online Change-Point Detection with Persistent Laplacian Features

用于在线变点检测的校准持久拉普拉斯累积和

Shiheng Nie, Yunguang Yue

专题命中 点云 :point cloud(abstract)

AI总结 针对高维非线性时间序列在线变点检测,提出PL-CUSUM方法,将滑动窗口转为点云,用持久拉普拉斯谱构建监测分数,分析关键性能标准,给出阶段程序,实验表明其能稳定控制误报且检测性能有竞争力。

Comments 51 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 3D生成 1 篇

2607.19120 2026-07-22 cs.CV 新提交 57%

Latent Riemannian Flow Matching for Geometry-Grounded 3D Foundation Models

用于几何基础3D基础模型的潜在黎曼流匹配

Lisa Weijler, Irene Ballester, Guofeng Mei, Tolga Birdal, Pedro Hermosilla

机构 * TU Wien(维也纳工业大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会) Imperial College London(伦敦帝国理工学院)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 研究如何弥合几何基础模型与3D场景生成模型的范式差异,通过在VGGT潜在空间进行黎曼流匹配,利用其3D先验,不依赖明确下游表示,在多个数据集上取得良好性能,确立该方法为3D生成的可行范式。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 空间理解 1 篇

2607.15176 2026-07-22 cs.AI cs.CL cs.HC 版本更新 50%

Benchmarking Multimodal Large Language Models for Scientific Visualization Literacy

用于科学可视化素养的多模态大语言模型基准测试

Patrick Phuoc Do, Chau M. Ta, Chaoli Wang

机构 * University of Notre Dame(圣母大学)

专题命中 空间理解 :spatial understanding(abstract)

AI总结 研究对六个多模态大语言模型进行科学可视化素养基准测试,涵盖多种技术和任务类型。通过封闭世界协议评估闭源和开源模型,与人类参与者数据对比。发现模型表现不均,Gemini最强,开源模型低于人类基线,明确SciVis素养对评估多模态AI系统的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. SLAM与定位 3 篇

2607.19306 2026-07-22 cs.RO cs.AI cs.CV cs.SY eess.SY 新提交 62%

From Distances to Trajectories: Real-Time Signed Distance Function Mapping and Distance-Accelerated Motion Planning for UAVs

从距离到轨迹:无人机的实时带符号距离函数映射与距离加速运动规划

Jason Stanley, Zhirui Dai, Qihao Qian, Tzu-Chin Ho, Tianxing Fan, Siddharth Saha, Christopher Barngrover, Ki Myung Brian Lee, Nikolay Atanasov

机构 * UC San Diego(加州大学圣地亚哥分校) Shield AI(护盾人工智能公司)

专题命中 SLAM与定位 :point cloud(abstract);分类 cs.CV、cs.RO

AI总结 研究针对无人机在杂乱环境中的自主飞行,提出围绕带符号距离函数协同设计映射与规划阶段。开发OREN重建SDF,Bubble$^\star$基于距离信息规划,减少碰撞检查。集成方法在四旋翼飞行器上实时导航,提升SDF估计并快速找到长轨迹。

Comments 25 pages, 10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18875 2026-07-22 cs.CV 新提交 57%

Wave2Body: Rethinking mmWave Human Pose Estimation as Radar-to-Body Token Translation

Wave2Body:将毫米波人体姿态估计重新思考为雷达到身体的令牌转换

Bo Liang, Chen Gong, Wei Gao, Chenren Xu

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) University of Pittsburgh(匹兹堡大学) Key Laboratory of High Confidence Software Technologies, Ministry of Education (PKU)(教育部高可信软件技术重点实验室(北京大学))

专题命中 SLAM与定位 :point cloud(abstract);分类 cs.CV

AI总结 针对毫米波雷达人体姿态估计问题,提出Wave2Body框架,通过自监督毫米波令牌器等解耦学习目标,在M4Human和mmBody实验中展现出比以往方法更强的跨域泛化能力及更低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18779 2026-07-22 cs.CV 新提交 57%

CGMap: A Geospatially Aware Deep Learning Framework for Crop Gap Mapping Using UAV

CGMap:一种使用无人机进行作物间隙映射的地理空间感知深度学习框架

Karan Sharma, Rajiv Ranjan, Dinesh Kumar, Shashank Tamaskar

机构 * Plaksha University(普拉卡沙大学)

专题命中 SLAM与定位 :point cloud(abstract);分类 cs.CV

AI总结 针对印度作物发芽监测易出错的问题,提出基于深度学习的CGMap框架,利用YOLOV8架构和无人机图像,结合最小生成树技术,精确计算甘蔗发芽情况,输出地理空间发芽图,助力提高产量和资源合理分配。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏