arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-05-08 至 2026-05-08 共收录 13 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 3 篇

2605.05014 2026-05-08 cs.CV 74%

CARD: A Multi-Modal Automotive Dataset for Dense 3D Reconstruction in Challenging Road Topography

CARD: 一种用于复杂道路地形密集3D重建的多模态汽车数据集

Gasser Elazab, Frank Neuhaus, Tilman Koß, Malte Splietker, Aditya Date, Michael Unterreiner, Maximilian Jansen, Olaf Hellwich

机构 * CARIAD SE(CARIAD公司) Technische Universität Berlin(柏林技术大学) Vision & Robotics GmbH(视觉与机器人技术有限公司)

专题命中 三维重建 :3D reconstruction(title);分类 cs.CV

AI总结 CARD数据集通过提供连续序列中的近密3D地面真实信息,解决了现有数据集在复杂道路地形下深度估计和补全的不足,支持更精确的几何和感知任务评估。

Comments Accepted at CVPR 2026 (Highlight). Project page: https://card.content.cariad.digital

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26694 2026-05-08 cs.RO cs.AI cs.CV 62%

Unified 4D World Action Modeling from Video Priors with Asynchronous Denoising

从视频先验构建统一的4D世界动作模型

Jun Guo, Qiwei Li, Peiyan Li, Zilong Chen, Nan Sun, Yifei Su, Heyun Wang, Yuan Zhang, Xinghang Li, Huaping Liu

机构 * Tsinghua University(清华大学) Xiaomi Robotics(小米机器人) Peking University(北京大学) CASIA

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV、cs.RO

AI总结 本文提出X-WAM,统一了实时机器人动作执行与高保真的4D世界合成,在单一框架中解决传统统一世界模型仅建模2D像素空间且无法平衡动作效率与世界建模质量的问题。

Comments Project website: https://sharinka0715.github.io/X-WAM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05664 2026-05-08 cs.CV 57%

Sparse-to-Complete: From Sparse Image Captures to Complete 3D Scenes

稀疏到完整:从稀疏图像捕获到完整3D场景

Yiyang Shen, Yin Yang, Kun Zhou, Tianjia Shao

机构 * State Key Lab of CAD\&CG, Zhejiang University(浙江大学CAD与CG国家重点实验室) University of Utah(犹他大学) Hangzhou Research Institute of Holographic and AI Technology(杭州全息与人工智能技术研究院)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出S2C-3D框架,通过六到八张图像实现高保真完整场景重建,结合专用扩散模型、视图一致性条件采样和相机轨迹规划,提升3D重建质量与鲁棒性。

Journal ref SIGGRAPH 2026 Conf. Proc

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Gaussian Splatting 2 篇

2604.26799 2026-05-08 cs.CV cs.GR cs.MM 88%

MesonGS++: Post-training Compression of 3D Gaussian Splatting with Hyperparameter Searching

MesonGS++: 3D高斯散射的后训练压缩与超参数搜索

Shuzhao Xie, Junchen Ge, Weixiang Zhang, Jiahang Liu, Chen Tang, Yunpeng Bai, Shijia Ge, Jingyan Jiang, Yuzhi Huang, Fengnian Yang, Cong Zhang, Xiaoyi Fan, Zhi Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) The Hong Kong University of Science and Technology(香港科技大学) Harbin Institute of Technology(哈尔滨工业大学) The Chinese University of Hong Kong(香港中文大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Shenzhen Technology University(深圳技术大学) Xiamen University(厦门大学) Simon Fraser University(西蒙弗雷泽大学) Jiangxing Intelligence Inc.(江兴智能有限公司)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);novel view synthesis(abstract);分类 cs.CV、cs.GR

AI总结 MesonGS++提出了一种基于超参数搜索的3D高斯散射后训练压缩方法,通过联合重要性剪枝、八叉树几何编码等技术,实现34倍压缩并保持渲染质量,优于现有方法并精准满足目标存储预算。

Comments https://github.com/mmlab-sigs/mesongs_plus

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13549 2026-05-08 cs.CV 57%

KFC-W: Generating 3D-Consistent Videos from Unposed Internet Photos

KFC-W: 从未经摆拍的互联网照片生成3D一致的视频

Gene Chou, Kai Zhang, Sai Bi, Hao Tan, Zexiang Xu, Fujun Luan, Bharath Hariharan, Noah Snavely

机构 * Cornell University(康奈尔大学) Adobe Research(Adobe研究)

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);分类 cs.CV

AI总结 本文提出KFC-W模型,通过自监督学习从未经摆拍的互联网照片生成3D一致的视频,无需3D标注,优于现有方法,在几何和外观一致性上表现更佳,适用于3D高斯点扩散等应用。

Comments project page: https://genechou.com/kfcw/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 点云 6 篇

2605.05897 2026-05-08 cs.RO 83%

Generating Roadside LiDAR Datasets from Vehicle-Side Datasets via Novel View Synthesis

通过新颖视角合成从车辆侧数据生成道路侧LiDAR数据集

Yuhan Xia, Runxin Zhao, Hanyang Zhuang, Chunxiang Wang, Ming Yang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University, Shanghai 200240, China(自动化与智能感知学院,上海交通大学,上海200240,中国) Key Laboratory of System Control and Information Processing, Ministry of Education of China, Shanghai 200240, China(系统控制与信息处理重点实验室,中华人民共和国教育部,上海200240,中国) Global College, Shanghai Jiao Tong University, Shanghai 200240, China(全球学院,上海交通大学,上海200240,中国)

专题命中 点云 :novel view synthesis(title,abstract);point cloud(abstract);分类 cs.RO

AI总结 本文提出VRS框架,通过LiDAR新颖视角合成从车辆侧数据生成标注道路侧LiDAR数据集,缓解车辆到道路域差距,提升道路侧感知模型的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01746 2026-05-08 cs.CV 57%

Point-SRA: Self-Representation Alignment for 3D Representation Learning

点-SRA:用于3D表示学习的自表示对齐

Lintong Wei, Jian Lu, Haozhe Cheng, Jihua Zhu, Kaibing Zhang

机构 * School of Electronics and Information, Xi’an Polytechnic University(西安理工大学电子与信息学院) School of Software, Xi’an Jiaotong University(西安交通大学软件学院) School of Computer Science, Xi’an Polytechnic University(西安理工大学计算机科学学院)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 Point-SRA通过自蒸馏和概率建模对齐表示,改进3D表示学习,通过不同掩码比例和MeanFlow Transformer实现互补信息提取,优于Point-MAE并在多个任务中取得优异性能。

Comments This is an AAAI 2026 accepted paper titled "Point-SRA: Self-Representation Alignment for 3D Representation Learning", spanning 13 pages in total. The submission includes 7 figures (fig1 to fig7) that visually support the technical analysis

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 2026, Vol. 40, No. 13

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05572 2026-05-08 cs.CV 57%

Text-to-CAD Retrieval: a Strong Baseline

基于文本的CAD检索:一个强大的基线

Honghu Pan, Zibo Du, Daxiang Liu, Chengliang Liu, Xiaoling Luo

机构 * School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) College of Computer Science and Software Engineer, Shenzhen University(深圳大学计算机科学与软件工程学院) Faculty of Science and Technology, University of Macau(澳门大学科学与技术学院)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出文本到CAD检索任务,通过多模态嵌入框架实现CAD模型的语义检索,为下游CAD生成奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06409 2026-05-08 cs.CV 57%

LiCamPose: Combining Multi-View LiDAR and RGB Cameras for Robust Single-timestamp 3D Human Pose Estimation

LiCamPose:结合多视角LiDAR和RGB相机实现鲁棒的单帧3D人体姿态估计

Zhiyu Pan, Zhicheng Zhong, Wenxuan Guo, Yifan Chen, Jianjiang Feng, Jie Zhou

机构 * Department of Automation, BNRist, Tsinghua University, China(自动化系、北京人工智能研究院、清华大学、中国)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出LiCamPose,结合多视角RGB和稀疏点云数据,通过单帧实现鲁棒的3D人体姿态估计,并设计了合成数据生成器和无监督域适应策略,验证了方法在多种数据集上的泛化能力。

Comments Accepted by WACV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06352 2026-05-08 cs.LG cs.AI stat.ML 50%

Topological Signatures of Grokking

Grokking 的拓扑特征

Yifan Tang, Qiquan Wang, Inés García-Redondo, Anthea Monod

机构 * Imperial College London(帝国学院伦敦) Queen Mary University of London(女王玛丽大学伦敦) University of Fribourg(弗里堡大学)

专题命中 点云 :point cloud(abstract)

AI总结 通过拓扑学视角研究Grokking现象,利用持久同调分析嵌入矩阵的点云,发现H1同调的持久性显著增加,揭示了任务的循环结构。持久同调为表示学习提供了统一的几何和拓扑描述,且与泛化而非记忆相关。

Comments 19 pages, 14 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06381 2026-05-08 quant-ph cs.LG 50%

HyQuRP: Hybrid quantum-classical neural network with rotational and permutational equivariance

HyQuRP:具有旋转和置换等价性的混合量子-经典神经网络

Semin Park, Chae-Yeun Park

机构 * School of Integrated Technology, Yonsei University, Seoul 03722, Korea(整合技术学院,延世大学,首尔03722,韩国) Department of Quantum Information, Yonsei University, Seoul 03722, Korea(量子信息系,延世大学,首尔03722,韩国)

专题命中 点云 :point cloud(abstract)

AI总结 本文提出HyQuRP,一种具有旋转和置换等价性的混合量子-经典神经网络,通过组表示理论分析门空间维度,实验证明其在稀疏点云分类中优于经典和量子基线模型。

Comments 12+41 pages; 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 3D生成 1 篇

2605.04412 2026-05-08 cs.CV 57%

Structured 3D Latents Are Surprisingly Powerful: Unleashing Generalizable Style with 2D Diffusion

结构化3D潜在空间出人意料地强大:通过2D扩散模型释放可泛化的风格

Yiran Qiao, Yiren Lu, Yunlai Zhou, Disheng Liu, Linlin Hou, Rui Yang, Yu Yin, Jing Ma

机构 * Case Western Reserve University(凯斯西储大学)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 本文提出DiLAST方法,利用预训练的2D扩散模型生成通用风格先验,通过扩散引导对齐渲染视角与目标风格,优化结构化3D潜在表示,实现对Out-of-distribution风格的有效生成。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 空间理解 1 篇

2603.17980 2026-05-08 cs.CV 57%

Feeling the Space: Egomotion-Aware Video Representation for Efficient and Accurate 3D Scene Understanding

感知空间:面向高效准确3D场景理解的自我运动感知视频表示

Shuyao Shi, Kang G. Shin

机构 * Department of Computer Science(计算机科学系) University of Michigan(密歇根大学) University of Michigan Ann Arbor(密歇根大学安阿伯分校)

专题命中 空间理解 :point cloud(abstract);分类 cs.CV

AI总结 本文提出Motion-MLLM框架,结合IMU数据与视觉特征,通过运动-视觉关键帧过滤模块和异构跨模态融合模块,提升3D场景理解与空间推理的效率和准确性。

Comments 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏