arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-08-21 至 2026-08-21 共收录 12 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 3 篇

2608.20000 2026-08-21 cs.CV 新提交 85%

Point-Based 3D Reconstruction from Sparse Views under Known Illumination

已知光照条件下基于点的稀疏视图三维重建

Magnus Kaufmann Gjerde, Joakim Bruslund Haurum, Jeppe Revall Frisvad, Markus Worchel, J. Andreas Bærentzen, Thomas B. Moeslund

机构 * Aalborg University(奥尔堡大学) Centre for Software Technology, University of Southern Denmark(南丹麦大学软件技术中心) Pioneer Centre for Artificial Intelligence(先锋人工智能中心) Technical University of Denmark(丹麦技术大学) Technische Universität Berlin(柏林工业大学)

专题命中 三维重建 :3D reconstruction(title,abstract);Gaussian Splatting(abstract,abstract_cn);分类 cs.CV

AI总结 提出带不透明度的β表面元可微点渲染方法,在5个合成物体的10个位姿视图重建中,平均 chamfer 距离比最强基线低28.5%,仅需267个表面元,实现高效高精度三维重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22531 2026-08-21 cs.CV 版本更新 57%

UrbanVGGT: Scalable Sidewalk Width Estimation from Street View Images

UrbanVGGT:从街景图像中可扩展的人行道宽度估计

Kaizhen Tan, Fan Zhang

机构 * Heinz College of Information Systems and Public Policy(信息系统与公共政策学院) Carnegie Mellon University(卡内基梅隆大学) Institute of Remote Sensing and Geographical Information System(遥感与地理信息系统研究所)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出UrbanVGGT方法,通过单张街景图像估算人行道宽度,结合语义分割、3D重建、地面平面拟合等技术,在华盛顿特区基准测试中达到0.252米的均方误差,展示了其在大规模城市中的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02088 2026-08-21 cs.CV 版本更新 57%

PhysSFI-Net: Physics-informed Geometric Learning of Skeletal and Facial Interactions for Orthognathic Surgical Outcome Prediction

PhysSFI-Net:基于物理的几何学习用于正颌手术结果预测的颅面和面部相互作用

Jiahao Bao, Huazhen Liu, Yu Zhuang, Leran Tao, Xinyu Xu, Yongtao Shi, Mengjia Cheng, Yiming Wang, Congshuang Ku, Ting Zeng, Yilang Du, Siyi Chen, Shunyao Shen, Suncheng Xiang, Hongbo Yu

专题命中 三维重建 :point cloud(abstract);分类 cs.CV

AI总结 PhysSFI-Net通过结合物理指导的几何深度学习,实现高精度的正颌手术术后面部形态预测,优于现有方法。

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Gaussian Splatting 3 篇

2608.18388 2026-08-21 cs.CV 版本更新 83%

Depth Anything V4: Dynamic 4D Scene Reconstruction via Riemannian Flow Matching on 4D Gaussian Splatting

Depth Anything V4:基于4D高斯溅射的黎曼流匹配的动态4D场景重建

Jiaming Fan, Jian Lu, Jinling Jia, Chenbin Zhang

机构 * College of Artificial Intelligence, Nanjing University of Posts and Telecommunications(南京邮电大学人工智能学院) College of Automation, Nanjing University of Posts and Telecommunications(南京邮电大学自动化学院)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);分类 cs.CV

AI总结 本研究提出DAV4框架,将RFM应用于4D高斯溅射参数实现动态4D场景重建,其F分数较基线提升0.044,在相关任务上优于现有模型且无需人工标注深度标签。

Comments Major errors in research

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20335 2026-08-21 cs.CV 新提交 57%

4DAnyone: Create Anyone in 4D from a Casual Monocular Video

4DAnyone:从随意的单目视频中创建4D虚拟人物

Yudong Jin, Tao Xie, Qihang Zhang, Zehong Shen, Zhen Xu, Yujun Shen, Hujun Bao, Xiaowei Zhou, Yinghao Xu

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) Robbyant Chinese University of Hong Kong(香港中文大学) Ant Group(蚂蚁集团) Hong Kong University of Science and Technology(香港科技大学)

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);分类 cs.CV

AI总结 4DAnyone是一种从单目视频重建4D人体的框架,通过RCP和TCR解决多视图一致性问题,在相关数据集上优于现有方法且泛化性好。

Comments Project page: this https URL (https://4danyone.github.io)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19556 2026-08-21 cs.CV cs.AI 新提交 57%

Stream4D: 4D-Consistency for Streaming Autoregressive Diffusion Video Models

Stream4D:面向流式自回归扩散视频模型的4D一致性

Yuanhao Ban, Jiaqi Feng, Hengguang Zhou, Xiaohuan Pei, Justin Cui, Cho-Jui Hsieh

机构 * UCLA(加州大学洛杉矶分校) Tsinghua University(清华大学)

专题命中 Gaussian Splatting :3D reconstruction(abstract);分类 cs.CV

AI总结 Stream4D用显式建模场景动力学的前馈4D重建奖励替代静态评判器,结合运动先验与感知锚,提升流式自回归扩散视频模型的4D重建质量、运动保留效果及人类对齐偏好。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 点云 4 篇

2608.19232 2026-08-21 cs.NE cs.AI cs.LG 新提交 78%

Active Spiking Perception: The Membrane Potential as a Belief State for Anytime 3D Point Cloud Recognition

主动脉冲感知:作为任何时刻3D点云识别置信状态的膜电位

Akarsh Jain, Arya Pawa, Ayush Debnath, Smera Rawal, Sayeed Shafayet Chowdhury

专题命中 点云 :point cloud(title,abstract)

AI总结 提出主动脉冲感知(ASP),以LIF膜电位为置信状态实现3D点云识别的迭代决策,在ModelNet等数据集取得结果,机制可迁移至密集预测,能耗可降2.8倍至1.35倍。

Comments 28 pages, 9 figures, 17 tables. Supplementary material included as appendices A-J

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19536 2026-08-21 cs.CV cs.AI cs.RO 新提交 62%

CVSD-Reg: Cross-Modal Visual Semantic Prior Distillation for Robust LiDAR Registration

CVSD-Reg:用于鲁棒激光雷达配准的跨模态视觉语义先验蒸馏

Eunsoo Im, Junghun Suh, Gyeonggwan Lee, Seunghwan Hong

专题命中 点云 :point cloud(abstract);分类 cs.CV、cs.RO

AI总结 本文提出CVSD-Reg框架,通过蒸馏视觉基础模型的语义先验提升激光雷达配准的鲁棒性,在多数据集上的成功率优于现有方法,且无需相机输入或事后ICP精修。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19357 2026-08-21 eess.SP 新提交 50%

Untangling Dense Crowds with mmWave Radar: From Crowd Semantics to Individual Spatial Behaviors

用毫米波雷达解耦密集人群:从人群语义到个体空间行为

Aaditya Prakash Kattekola, Anurag Pallaprolu, Yasamin Mostofi

专题命中 点云 :point cloud(abstract)

AI总结 该研究提出毫米波雷达解耦密集人群的新框架,结合宏微观结构与语义引导多假设推理,经18项实验验证,在行人足迹恢复上显著优于当前最优方法,鲁棒性强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19384 2026-08-21 math.NA 新提交 50%

A high-order, meshless, Lagrangian--Eulerian RBF-FD method for advection--diffusion--reaction on moving manifolds

用于移动流形上平流-扩散-反应问题的高阶无网格拉格朗日-欧拉RBF-FD方法

Matthew Lowery, Grady B. Wright, Varun Shankar

专题命中 点云 :point cloud(abstract)

AI总结 该研究提出一种高阶无网格拉格朗日-欧拉RBF-FD方法,用于求解三维移动流形上的平流-扩散-反应偏微分方程,通过多种策略提升稳定性与效率,数值实验验证了其收敛性、守恒性与长期积分稳定性。

Comments 27 pages + 12 page appendix, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 3D生成 1 篇

2608.19567 2026-08-21 cs.CV 新提交 79%

Block3D: Efficient Text-to-3D Generation via Block-Wise Diffusion

Block3D:基于分块扩散的高效文本到3D生成

Bowen Cui, Weijie Wang, Zeyu Zhang, Yefei He, Mingda Lin, Haoyu Zhao, Yuanyu He, Donny Y. Chen, Feng Chen, Bohan Zhuang

机构 * ZipLab, Zhejiang University(浙江大学ZipLab) University of California, Berkeley(加州大学伯克利分校) Wuhan University(武汉大学) Monash University(莫纳什大学) University of Adelaide(阿德莱德大学)

专题命中 3D生成 :3D generation(title,abstract);分类 cs.CV

AI总结 针对文本到3D生成成本高的问题,提出Block3D分块扩散框架,通过分块生成、联合去噪及置信度引导的块内修正,在保持几何保真度的同时实现5.15倍的速度提升。

Comments Project page: this https URL (https://alexandertsui.github.io/block3d/)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 空间理解 1 篇

2510.14357 2026-08-21 cs.RO cs.AI 版本更新 83%

SUM-AgriVLN: Spatial Understanding Memory for Agricultural Vision-and-Language Navigation

SUM-AgriVLN:面向农业视觉语言导航的空间理解记忆

Xiaobei Zhao, Xingqi Lyu, Xin Chen, Xiang Li

机构 * China Agricultural University(中国农业大学)

专题命中 空间理解 :spatial understanding(title,abstract);3D reconstruction(abstract);分类 cs.RO

AI总结 针对现有农业视觉语言导航方法忽视重复指令的空间记忆潜力的局限,提出SUM模块并集成至AgriVLN构建SUM-AgriVLN,在A2A基准上将SR从0.47提至0.54,NE仅微增,达领域顶尖性能。

详情

展开后加载摘要…

URL PDF HTML 收藏