arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-07-09 至 2026-07-09 共收录 15 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 4 篇

2607.07139 2026-07-09 cs.RO 新提交 79%

Disturbance-aware Motion Planning for Over-actuated Underwater Vehicles Exploiting Actuation Redundancy for High-fidelity 3D Reconstruction

利用驱动冗余进行高保真 3D 重建的过驱动水下航行器的干扰感知运动规划

Yuer Gao, Tongqing Xu, Qingyang Liu, Yi Cai

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 三维重建 :3D reconstruction(title,abstract);分类 cs.RO

AI总结 研究水下机器人驱动对感知的影响,利用过驱动平台冗余,通过搜索零空间最小化目标区域干扰,采用基于致动盘理论的尾流代理及冗余解决分配器,降低粒子速度,提高 3D 重建精度,支持自主扫描与辅助检查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06600 2026-07-09 cs.CV cs.AI cs.RO 新提交 62%

MiLSD: A Micro Line-Segment Detector for Resource-Constrained Devices

MiLSD:一种用于资源受限设备的微线段检测器

Parsa Hassani Shariat Panahi, Amir Hossein Jalilvand, M. Hassan Najafi

机构 * School of Computer Engineering, Iran University of Science and Technology(伊朗科技大学计算机工程学院) Case Western Reserve University(凯斯西储大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV、cs.RO

AI总结 研究在资源受限设备上线段检测精度与内存的权衡,提出MiLSD检测器,通过比较三种输出表示,发现F-Clip公式在小模型下学习有效,8位量化可保性能,4位量化有损失,经推理增强,MiLSD在1MB内提升了上海科技线框数据集sAP10指标。

Comments 10 pages, 12 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02707 2026-07-09 cs.CV 新提交 57%

VLRC: Vision-Language Reprojection Consistency as a scalable signal for better feed-forward 3D pretraining

VLRC:视觉语言重投影一致性作为用于更好的前馈3D预训练的可扩展信号

Marwane Hariat, David Filliat, Antoine Manzanera

机构 * U2IS, ENSTA – Institut Polytechnique de Paris(U2IS,法国国立高等先进技术学校 - 巴黎综合理工学院) Pôle Recherche, Agence Ministérielle pour l’IA de Défense(军事人工智能部研究中心)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 研究提出视觉语言重投影一致性(VLRC),利用冻结的视觉语言表征作为语义多视图监督,无需额外3D标注,能提升3D重建精度等,为前馈3D预训练提供可扩展辅助目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18884 2026-07-09 cs.NE 版本更新 50%

MEGO: Learning Mixture-of-Experts for General-Purpose Binary Optimization

MEGO:学习用于通用二进制优化的专家混合模型

Shengcai Liu, Zhiyuan Wang, Yew-Soon Ong, Xin Yao, Ke Tang

专题命中 三维重建 :3D reconstruction(abstract)

AI总结 研究针对离散优化问题,提出MEGO这一通用神经优化器,它由无需领域知识训练的专家混合模型构成,通过路由策略解决新问题。在多类问题上展现强大泛化能力,优于现有优化器,还提供了量化问题相似性及分类的新方法。

Comments 33 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Gaussian Splatting 4 篇

2607.07452 2026-07-09 cs.RO 新提交 89%

GeoGS-SLAM: Geometry-Only Gaussian Splatting for Dense Monocular SLAM

GeoGS-SLAM:用于密集单目 SLAM 的仅几何高斯点云法

Lipu Zhou, Yaoyun Kang, Junxiang Pang, Shengkai Sun, Tingting Bao, Kehan Wang

机构 * School of Instrument Science and Opto-electronics Engineering, Beihang University(仪器科学与光电工程学院,北京航空航天大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);3D reconstruction(abstract);novel view synthesis(abstract)

AI总结 研究针对密集视觉 SLAM 问题,提出仅几何高斯点云法(GeoGS)及基于此的 GeoGS-SLAM 系统。该方法仅保留空间参数减少基元参数,专注几何重建,通过有效训练框架和地图更新策略,提升在线映射效率与几何重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07015 2026-07-09 cs.SD 新提交 83%

EscFOA: Enhancing Spatial Learning for Visually Impaired Learners via Generative Spatial Audio in 360-Degree Educational Environments

EscFOA:通过360度教育环境中的生成性空间音频增强视障学习者的空间学习

Ziyu Luo, Xiaowei Dai, Siying Zhu, Xiaoming Chen

机构 * Ziyu Luo ∗ , Xiaowei Dai ∗ , Siying Zhu † (Correspondence), Xiaoming Chen ∗ (Correspondence)(无)

专题命中 Gaussian Splatting :3DGS(summary_cn,abstract);Gaussian Splatting(abstract)

AI总结 研究针对360度教育环境中视障学习者空间学习受限问题,提出EscFOA框架,通过整合3DGS与条件扩散模型生成空间音频,在支持蒙眼参与者空间学习行为上优于传统音频,证明其能助力视障者访问复杂空间学习材料。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02915 2026-07-09 cs.CV 版本更新 79%

GP-4DGS: Probabilistic 4D Gaussian Splatting from Monocular Video via Variational Gaussian Processes

GP-4DGS:通过变分高斯过程从单目视频中进行概率性4D高斯点溅射

Mijeong Kim, Jungtaek Kim, Bohyung Han

机构 * IPAI, Seoul National University(首尔大学IPAI) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);分类 cs.CV

AI总结 本文提出GP-4DGS框架,结合高斯过程与4D高斯点溅射,实现动态场景的概率建模。通过引入不确定性量化、运动估计和时间外推,提升重建质量与预测可靠性。

Comments CVPR 2026, Page: https://cv.snu.ac.kr/research/GP4DGS

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06699 2026-07-09 cs.RO 新提交 57%

RoboSnap: One-Shot Real-to-Sim Scene Generation for Generalizable Robot Learning and Evaluation

RoboSnap:用于可泛化机器人学习与评估的一次性真实到模拟场景生成

Shujie Zhang, Jingkun Yi, Weipeng Zhong, Zirui Zhou, Yangkun Zhu, Hanqing Wang, Xudong Xu, Weinan Zhang, Chunhua Shen

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Tsinghua University(清华大学)

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);分类 cs.RO

AI总结 针对构建物理稳定且视觉逼真场景缓慢昂贵的问题,提出RoboSnap框架,通过分层设计将单张RGB图像转为模拟场景,实验证明其能实现轨迹重放等,还引入DROID-Sim数据集,凸显真实到模拟方法对机器人学习评估的价值。

Comments 24 pages, 16 figures, Project page: https://robosnap.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 点云 5 篇

2607.06782 2026-07-09 cs.RO cs.CV 新提交 81%

G-PROBE: Cross-FOV Place Recognition and Certainty-Coupled Localization for 3D Point Clouds

G-PROBE:用于3D点云的跨视场位置识别和确定性耦合定位

Jinseop Lee

机构 * SK Intellix(SK智能科技)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV、cs.RO

AI总结 研究针对3D点云在有限或不对称视场下全局定位难的问题,提出G-PROBE框架。通过虚拟传感器分解、跨视场分支集合等方法,结合确定性耦合定位,无需学习。在多数据集和模式上评估,该框架性能出色,端到端可用性高,在不对称视场下优势明显。

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06948 2026-07-09 cs.CV cs.AI 新提交 79%

Self-Supervised Pretraining Improves Cross-Site and Cross-Scale Robustness of Point Cloud Leaf-Wood Segmentation

自监督预训练提高点云树叶-木材分割的跨站点和跨尺度鲁棒性

Heeju Mun, Tackang Yang, Yunsoo Nam, Changhyun Choi

机构 * Department of Landscape Architecture and Rural Systems Engineering, Seoul National University, Seoul, South Korea(景观建筑与乡村系统工程系,首尔国立大学,首尔,韩国) Interdisciplinary Program in Landscape Architecture, Seoul National University, South Korea(景观建筑跨学科项目,首尔国立大学,韩国) Integrated Major in Smart City Global Convergence, Seoul National University, Seoul, Republic of Korea(智能城市全球融合整合专业,首尔国立大学,首尔,韩国) Research Institute of Agriculture and Life Sciences, Seoul National University, Seoul, Republic of Korea(农业与生命科学研究院,首尔国立大学,首尔,韩国)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 研究树木点云树叶-木材分割方法跨森林类型和地点准确性差异问题,采用自监督预训练Point-M2AE并结合递归体素细分,提升了分割精度,在跨站点和跨尺度上表现良好,还改善了下游木材体积估计的性能。

Comments 30 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06829 2026-07-09 cs.CV 新提交 79%

Rail Track Extraction from Rasterized Classified Point Clouds Using a Full-Resolution, Fully Convolutional Recurrent Neural Network

使用全分辨率全卷积递归神经网络从光栅化分类点云提取铁轨

Alexander Gribov, Jie Chang

机构 * Esri(环境系统研究所公司)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 介绍利用全卷积递归神经网络从分类3D点云提取铁轨的新方法,先光栅化点,经神经网络、形态学操作、平滑处理等步骤,用动态时间规整算法找中心线,人工干预少,实验验证了该方法提取铁轨的有效性。

Comments 15 pages, 8 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06896 2026-07-09 cs.RO cs.CV 新提交 73%

Dynamic Object Detection and Tracking in Construction: A Fisheye Camera and LiDAR Sensor Fusion Model

建筑中的动态目标检测与跟踪:一种鱼眼相机与激光雷达传感器融合模型

Yilong Chen, Huili Huang, Yong K. Cho

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 点云 :3D vision(abstract);point cloud(abstract);分类 cs.CV、cs.RO

AI总结 针对建筑等复杂环境中机器人动态目标检测与跟踪问题,提出融合鱼眼相机与激光雷达传感器的框架,通过在配准点云里识别移动物体、投影坐标分配语义标签并结合图像检测更新卡尔曼滤波器观测,具有高精度、简单且鲁棒的特点。

Comments 4 pages, 8 figures, submitted to IEEE International Conference on Robotics and Automation (ICRA) 2025 Future of Construction Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07680 2026-07-09 math.ST cs.LG math.PR stat.TH 新提交 50%

Any-Dimensional Learning by Sampling

通过采样进行任意维度学习

Eitan Levin, Venkat Chandrasekaran

机构 * Department of Statistics University of Chicago(统计学系芝加哥大学) Department of Computing and Mathematical Sciences Department of Electrical Engineering California Institute of Technology(计算与数学科学系电气工程系加州理工学院)

专题命中 点云 :point cloud(abstract)

AI总结 研究不同大小输入的机器学习模型泛化及评估问题,提出用随机采样映射比较不同大小输入的统一方法,刻画各采样适用领域,为相关函数类给出泛化和草图绘制率

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 新视角合成 1 篇

2607.07320 2026-07-09 cs.CV 新提交 57%

SoccerNet 2026 Challenges Results

SoccerNet 2026挑战结果

Anthony Cioppa, Silvio Giancola, Håkan Ardö, Mohamad Dalal, Jan Held, Jérémie Ochin, Jiayuan Rao, Karen Sanchez, Renaud Vandeghen, Artur Xarles, Olivier Barnich, Albert Clapés, Mathieu Delvaux, Sergio Escalera, Bernard Ghanem, Cédric Hons, Antoine Houet, Sotiris Manitsaris, Tom Michel, Pierre Miralles, Thomas B. Moeslund, Mikael Nilsson, Bogdan Stanciulescu, Marc Van Droogenbroeck, Yanfeng Wang, Weidi Xie, Faisal Altawijri, Mohamed Atef, Semen Budennyy, Vasiliy Chelpanov, Puhua Chen, Yixin Chen, Lechao Cheng, Jianling Chu, Ju-Seong Do, Oleg Durygin, Omar Fetouh, Mirco Fuchs, Youssef Ghallab, Falguni Ghosh, Wonjun Heo, Yufeng Hu, Weixuan Huang, Phuong-Linh Huynh-Ha, Matvey Isupov, Yangguang Ji, Siyuan Jiang, Zhenxiang Jiang, Wonyong Jo, Ho-Young Jung, SeongHeon Kang, MinJae Kim, Youngseon Kim, Jakub Komosa, Artem Konshin, Trung-Hoang Le, Jongmin Lee, Lingling Li, Litao Li, Vadim Linkov, Fang Liu, Haoxuan Ma, Shun Makino, Ismail Mathkour, Konstantin Mitin, Mikhail Moiseev, Takumi Nagaya, Yuki Nakamura, Thanh-Khoi Nguyen, Hoang-Phuc Nguyen, Trong-Thuan Nguyen, Christian Orduz, Kwanyong Park, Fabian Perez, Parthsarthi Rawat, SuHyun Rim, Hoover Rueda-Chacón, Atom Scott, Minori Sugimura, Yuyang Sun, Shengeng Tang, Minh-Triet Tran, Ikuma Uchida, Juan Vanegas, Thanh-Nhan Vo, Jiangtao Wang, Yaxiong Wang, Xiaogang Wang, Ruifeng Wang, Rio Watanabe, Jiali Wen, Yongliang Wu, Di Yang, Xu Yang, Zhuo Yang, Xinyu Ye, Yibo Yu, Zihan Zhai, Yu Zhang, Zhenyu Zhao, Zhun Zhong, Yixi Zhou, Xingyu Zhu, Wenbo Zhu, Julian Ziegler

机构 * University of Liège(列日大学) King Abdullah University of Science and Technology(阿卜杜拉国王科技大学) Spiideo(斯皮迪奥公司) Aalborg University(奥尔堡大学) SpAItial(斯帕蒂亚尔公司) Center for Robotics, Mines Paris, PSL(巴黎矿业学院机器人中心(巴黎文理研究大学)) Footovision(Footovision公司) Shanghai Jiao Tong University(上海交通大学) Universitat de Barcelona(巴塞罗那大学) Computer Vision Center(计算机视觉中心) EVS Broadcast Equipment(EVS广播设备公司) Pioneer Center for Artificial Intelligence(先锋人工智能中心) Lund University(隆德大学) TAHAKOM(TAHAKOM公司) Mohamed Bin Zayed University for Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) Sber AI(Sber人工智能公司) Salute For Business(Salute For Business公司) Intelligent Perception and Image Understanding Lab, Xidian University(西安电子科技大学智能感知与图像理解实验室) South China University of Technology(华南理工大学) Hefei University of Technology(合肥工业大学) Kyungpook National University(庆北国立大学) Leipzig University of Applied Sciences(莱比锡应用科学大学) Friedrich-Alexander University Erlangen-Nuremberg(埃尔朗根-纽伦堡大学) University of Seoul(首尔大学) Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(电子科技大学深圳高等研究院) Nanjing University(南京大学) University of Science, Ho Chi Minh City(胡志明市科技大学) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学)

专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV

AI总结 SoccerNet 2026挑战涵盖五项体育视频理解视觉任务,为每项任务提供数据、协议和基线。众多团队参与,本文介绍任务、评估协议,展示排行榜并总结领先提交内容,记录各任务当前状态。

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 空间理解 1 篇

2605.21133 2026-07-09 cs.RO 版本更新 57%

Humanoid Whole-Body Manipulation via Active Spatial Brain and Generalizable Action Cerebellum

通过主动空间大脑和可泛化动作小脑的人形全身 manipulation

Zhizhao Liang, Yi-Lin Wei, Xuhang Chen, Mu Lin, Yi-Xiang He, Zhexi Luo, Jun-Hui Liu, Kun-Yu Lin, Wei-Shi Zheng

机构 * School of Computer Science(计算机科学学院) Engineering, Sun Yat-sen University(工程学院,中山大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.RO

AI总结 本文提出了一种通用的人形 locomotion-manipulation 框架,通过主动空间大脑和可泛化动作小脑来解决复杂3D环境中空间理解困难和动作生成泛化困难的问题,展示了在多种任务和环境中的强性能。

Comments Project page: https://leungchaos.github.io/Humanoid-Whole-Body-Manipulation-via-Active-Spatial-Brain-and-Generalizable-Action-Cerebellum/

详情

展开后加载摘要…

URL PDF HTML 收藏