arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-06-30 至 2026-06-30 共收录 56 信号源:cs.CV, cs.GR, cs.RO

1. Gaussian Splatting 29 篇

2606.28820 2026-06-30 cs.CV 74%

CoGS: Compositional Dynamic Human-Object Scenes Gaussian Splatting from Monocular Video

CoGS: 从单目视频中构建组合式动态人-物场景高斯泼溅

Jerrin Bright, John Zelek

机构 * Vision and Image Processing Lab, University of Waterloo, Canada(滑铁卢大学视觉与图像处理实验室)

专题命中 Gaussian Splatting :Gaussian Splatting(title);分类 cs.CV

AI总结 提出CoGS框架,通过组合式高斯泼溅将单目视频分解为人体、刚体物体和静态场景三个分支,并采用六阶段优化实现动态人-物交互场景的忠实重建。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29976 2026-06-30 cs.CV 70%

Learning Efficient 4D Gaussian Representations from Monocular Videos with Flow Splatting

利用流溅射从单目视频学习高效4D高斯表示

Shengjun Zhang, Jinzhao Li, Xin Fei, Yueqi Duan

机构 * Tsinghua University(清华大学) National University of Singapore(新加坡国立大学)

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);novel view synthesis(abstract);分类 cs.CV

AI总结 提出Flow Splatting方法,通过构建速度场并扩展溅射技术渲染光流,从单目视频中高效学习4D高斯表示,实现高质量动态场景重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04860 2026-06-30 cs.CV 70%

DivAS: Interactive 3D Segmentation by Depth-Weighted Voxel Aggregation

DivAS:通过深度加权体素聚合实现交互式3D分割

Ayush Pande, Mayank Vatsa

机构 * Indian Institute of Technology Kanpur(印度理工学院坎普尔分校) Indian Institute of Technology Jodhpur(印度理工学院焦特布尔分校)

专题命中 Gaussian Splatting :NeRF(abstract);Gaussian Splatting(abstract);分类 cs.CV

AI总结 DivAS通过深度加权体素聚合实现交互式3D分割,无需优化循环,基于GAussian Splatting和NeRF框架,实现高效且高质量的3D分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30645 2026-06-30 cs.RO cs.AI cs.GR cs.SY eess.SY 62%

VLK: Learning Humanoid Loco-Manipulation from Synthetic Interactions in Reconstructed Scenes

VLK:从重建场景中的合成交互学习人形机器人全身操控

Yen-Jen Wang, Jiaman Li, Sirui Chen, Takara E. Truong, Pei Xu, Pieter Abbeel, Rocky Duan, Koushil Sreenath, Angjoo Kanazawa, Carmelo Sferrazza, Guanya Shi, Karen Liu

机构 * Amazon FAR(亚马逊FAR) UC Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);分类 cs.GR、cs.RO

AI总结 提出VLK方法,通过3D高斯泼溅重建室内场景并合成视觉-语言-运动学数据,训练人形机器人全身操控策略,实现从仿真到真实的迁移。

Comments 19 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29783 2026-06-30 cs.RO cs.AI cs.CV 62%

FalconTrack: Photorealistic Auto-Labeled Perception and Physics-Aware Vision-Based Aerial Tracking

FalconTrack: 逼真自动标注感知与物理感知的视觉空中跟踪

Yan Miao, Karteek Gandiboyina, Noah Giles, Hideki Okamoto, Bardh Hoxha, Georgios Fainekos, Sayan Mitra

机构 * Department of Electrical and Computer Engineering, University of Illinois at Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校电子与计算机工程系) Toyota Motor North America R&D(丰田北美研发)

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);分类 cs.CV、cs.RO

AI总结 提出FalconTrack框架,利用高斯泼溅模拟器自动生成标注数据,结合多头感知与物理感知跟踪,实现零样本模拟到真实迁移,在硬件闭环跟踪中达到100%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29400 2026-06-30 cs.CV cs.AI cs.GR 62%

Learning to Adaptively Allocate Gaussians for Arbitrary-Scale Image Super-Resolution

学习自适应分配高斯体以实现任意尺度图像超分辨率

Giulio Federico, Giuseppe Amato, Claudio Gennaro, Fabio Carrara, Marco Di Benedetto

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);分类 cs.CV、cs.GR

AI总结 提出QuADA-GS,通过神经路由架构自适应分配高斯体,结合分层指针卷积实现高效任意尺度超分辨率,达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29379 2026-06-30 cs.CV cs.AI cs.GR 62%

DR-GS: Physically-Based Deformable and Relightable 2D Gaussians

DR-GS: 基于物理的可变形与可重光照的2D高斯泼溅

Jiaxin Li, Tong Wu, Yi Wei, Tailin Wu, Li Zhang

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);分类 cs.CV、cs.GR

AI总结 提出DR-GS框架,通过显式解耦几何、光照和材质,实现可变形物体的物理一致重光照与后编辑,在静态重建、动态变形和重光照中达到领先视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08811 2026-06-30 cs.CV cs.RO 62%

TUGS: Physics-based Compact Representation of Underwater Scenes by Tensorized Gaussian

TUGS: 基于物理的紧凑表示法用于水下场景的张量高斯表示

Shijie Lian, Ziyi Zhang, Hua Li, Laurence Tianruo Yang, Mengyu Ren, Debin Liu, Wenhui Wu

机构 * Huazhong University of Science and Technology(华中科技大学) Zhongguancun Academy(中关村学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Zhengzhou University(郑州大学) Hainan University(海南大学) Shenzhen University(深圳大学)

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);分类 cs.CV、cs.RO

AI总结 本文提出TUGS,一种基于物理模型的紧凑水下3D表示法,通过物理建模复杂水下光场,实现高效高质量的水下图像渲染,实验表明其在有限参数下能取得优越的重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 点云 10 篇

2606.30309 2026-06-30 cs.CV 79%

A Point Cloud Transformer for Remote Monitoring and Automated Assessment of Physical Rehabilitation Exercises

用于远程监测和自动评估物理康复锻炼的点云Transformer

Kazi Rafat, Md. Ismail Hossain, M M Lutfe Elahi, Sifat Momen, Fuad Rahman, Nabeel Mohammed, Shafin Rahman

机构 * Department of Electrical and Computer Engineering, North South University(北南大学电气与计算机工程系) Apurba Technologies Limited(阿普尔巴技术有限公司)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 提出基于Transformer的点云框架,利用RGBD数据中的关节位置自动评估康复锻炼质量,通过曲线特征聚合和轴向自注意力提升性能,在三个数据集上优于现有方法。

Comments Accepted for publication in IEEE Journal of Biomedical and Health Informatics (JBHI), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06168 2026-06-30 cs.CV 79%

JOPP-3D: Joint Open Vocabulary Semantic Segmentation on Point Clouds and Panoramas

JOPP-3D:联合开放词汇语义分割点云与全景图像

Sandeep Inuganti, Hideaki Kanayama, Kanta Shimizu, Mahdi Chamseddine, Soichiro Yokota, Didier Stricker, Jason Rambach

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 本文提出JOPP-3D框架,通过联合利用点云和全景图像数据实现语言驱动的场景理解,提升开放词汇下点云和全景图像的语义分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03142 2026-06-30 cs.RO cs.CV 62%

MM-Nav: Multi-View VLA Model for Robust Visual Navigation via Multi-Expert Learning

MM-Nav:基于多专家学习的多视角VLA模型用于鲁棒视觉导航

Tianyu Xu, Jiawei Chen, Jiazhao Zhang, Wenyao Zhang, Zekun Qi, Minghan Li, Zhizheng Zhang, He Wang

机构 * Peking University(北京大学) Galbot Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV、cs.RO

AI总结 本文提出MM-Nav模型,通过多专家学习从合成数据中学习多样化的导航能力,展示模型在合成环境中的强泛化能力,并在现实世界实验中验证其有效性。

Comments Project page: https://pku-epic.github.io/MM-Nav-Web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30166 2026-06-30 cs.RO 57%

Self-supervised Geometry Reasoning for LiDAR Simultaneous Localization and Mapping

自监督几何推理用于LiDAR同时定位与地图构建

Jiwoo Kim, Jinwoo Lee, Woojae Shin, Giseop Kim, Hyondong Oh

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国高级科学研究院) Daegu Gyeongbuk Institute of Science and Technology (DGIST)(大邱庆北科学技术院)

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 提出自监督框架,通过学习局部几何的显式符号表示(高斯分布协方差)并递归优化LiDAR SLAM,无需密集标签,提升低分辨率或稀疏点云下的定位与建图精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29181 2026-06-30 cs.CV cs.AI 57%

Anomaly Factory 3D: A Modular Framework for Diverse Pseudo-Anomaly Synthesis in Unsupervised 3D Anomaly Detection

Anomaly Factory 3D:无监督3D异常检测中多样化伪异常合成的模块化框架

Ali Balapour, Faraz Hach

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 提出模块化框架AF3AD,通过局部PCA框架中的参数化变形模型合成多样化伪异常,增强无监督3D异常检测训练数据,在多个数据集上提升检测与定位性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28371 2026-06-30 cs.CV 57%

GeoISF: Instance Semantic Forest Inspired Large-Scale Cross-View Geo-Localization via Ground LiDAR-to-Satellite Image

GeoISF:基于实例语义森林的通过地面激光雷达到卫星图像的大规模跨视角地理定位

Di Hu, Xia Yuan, Chunxia Zhao

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 提出GeoISF管道,利用WordNet构建实例语义森林增强语义表示,弥合点云与卫星图像模态差异,在KITTI数据集上R@10指标比并行方法提升13.22倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02149 2026-06-30 cs.CV eess.SP 57%

3D Field of Junctions: A Noise-Robust, Training-Free Structural Prior for Volumetric Inverse Problems

3D 立体接点场:一种噪声鲁棒、无需训练的结构先验用于体积分量逆问题

Narges Moeini, Namhoon Kim, Justin Romberg, Sara Fridovich-Keil

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出3D FoJ方法,通过优化3D楔形接点来实现体积分量逆问题的去噪,无需训练数据,保留和增强3D边缘和角结构,适用于低信噪比下的多种3D成像任务。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21256 2026-06-30 cs.CV 57%

LaGen: Towards Autoregressive LiDAR Scene Generation

LaGen:迈向自主驾驶的自回归激光雷达场景生成

Sizhuo Zhou, Xiaosong Jia, Fanrui Zhang, Junjie Li, Juyong Zhang, Yukang Feng, Jianwen Sun, Songbur Wong, Junqi You, Junchi Yan

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出LaGen,首个支持长时交互生成的自回归框架,能基于单帧输入生成高保真4D激光雷达场景,并通过场景解耦和噪声调节模块提升生成质量。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30184 2026-06-30 cs.DM math.AG math.CO math.MG 50%

Stable complete coordinates for multisets of points via basic $r$-symmetric tropical polynomials

通过基本 $r$-对称热带多项式实现多点集稳定完备坐标

Susumu Kubo

专题命中 点云 :point cloud(abstract)

AI总结 针对 $\mathbb{R}^r$ 中 $n$ 个无序点的多重集(点云或持久性条形码),提出使用 $\binom{n+r}{r}$ 个基本 $r$-对称热带多项式作为完备、稳定且显式的坐标,解决了长期未决问题,并证明该坐标映射是双Lipschitz嵌入。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30095 2026-06-30 math.GN 50%

A Systematic Framework for Evaluating Topological Representations in Single-Cell Classification

单细胞分类中拓扑表示评估的系统框架

Rocío Picón-González, Salvador Chulián, Ana Niño-López, Álvaro Martínez-Rubio, María Rosa Durán

专题命中 点云 :point cloud(abstract)

AI总结 提出一个双层框架,通过统计筛选和预测效用评估拓扑表示在单细胞分类中的性能,并在白血病数据上验证了不同表示方法的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 新视角合成 2 篇

2606.29513 2026-06-30 cs.CV cs.GR 62%

Scenes as Objects, Not Primitives: Instance-Structured 3D Tokenization from Unposed Views

场景即对象,而非基元:来自无位姿视图的实例结构化3D标记化

Mijin Yoo, In Cho, Subin Jeon, Jiwoo Lee, Eunbyung Park, Seon Joo Kim

机构 * Yonsei University(延世大学) Seoul National University(首尔国立大学)

专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV、cs.GR

AI总结 提出一种前馈框架,直接从无位姿多视图图像将场景分解为实例结构化的3D标记组,实现重建、分割和操作,无需3D标注。

Comments Project page: https://yoomimi.github.io/instok3d

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26520 2026-06-30 cs.CV 57%

3D-LENS: A 3D Lifting-based Elevated Novel-view Synthesis method for Single-View Aerial-Ground Re-Identification

3D-LENS:一种基于3D提升的单视角空地重识别方法

William Grolleau, Astrid Sabourin, Guillaume Lapouge, Catherine Achard

机构 * Université Paris-Saclay, CEA, List(巴黎萨克雷大学、CEA、List) Sorbonne University, CNRS, Institute of Intelligent Systems and Robotics (ISIR)(索邦大学、CNRS、智能系统与机器人研究所)

专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV

AI总结 本文提出3D-LENS方法,通过结合几何一致的新型视角合成与鲁棒表示学习,解决单视角空地重识别中的视角域差距问题,实现跨视角检索。

Comments 15 pages, 2 figures, accepted to the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 3D生成 1 篇

2603.14152 2026-06-30 cs.CV 79%

SK-Adapter: Skeleton-Based Structural Control for Native 3D Generation

SK-Adapter:基于骨架的结构控制用于原生3D生成

Anbang Wang, Yuzhuo Ao, Shangzhe Wu, Chi-Keung Tang

专题命中 3D生成 :3D generation(title,abstract);分类 cs.CV

AI总结 本文提出SK-Adapter框架,通过将3D骨架作为第一类控制信号,实现原生3D生成的精确结构控制,同时保留几何与纹理质量,优于现有基线方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 空间理解 1 篇

2606.30367 2026-06-30 cs.RO 57%

FutureNav: Unified World-Action Modeling for Vision-and-Language Navigation

FutureNav: 面向视觉与语言导航的统一世界-动作建模

Lingfeng Zhang, Zeying Gong, Xiaoshuai Hao, Haoxiang Fu, Qiang Zhang, Mingliang Zhou, Hangjun Ye, Xiaojun Liang, Junwei Liang, Wenbo Ding

机构 * Tsinghua University(清华大学) Pengcheng Laboratory(鹏城实验室) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Xiaomi EV(小米电动车) National University of Singapore(新加坡国立大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.RO

AI总结 提出FutureNav,一种基于VLM的统一世界-动作建模框架,通过联合优化动作策略、逆/前向动力学和未来状态预测四个目标,在4B规模骨干上实现多VLN基准的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. SLAM与定位 4 篇

2606.29738 2026-06-30 cs.RO 77%

MyGO-Splat: Multi-Objective Closed-Loop Geometric Feedback for RGB-Only Gaussian SLAM

MyGO-Splat:面向仅RGB高斯SLAM的多目标闭环几何反馈

Fan Zhu, Ziyu Chen, Zhenjun Zhao, Zhisong Xu, Hui Zhu, Mingrui Li, Chunmao Jiang, Javier Civera

机构 * HFIPS, Chinese Academy of Sciences(中国科学院合肥智能机械研究所) University of Science and Technology of China(中国科学技术大学) Tohoku University(东北大学) University of Zaragoza(阿斯图里亚大学) University of Tokyo(东京大学) Dalian University of Technology(大连理工大学)

专题命中 SLAM与定位 :3DGS(abstract,abstract_cn);Gaussian Splatting(abstract);分类 cs.RO

AI总结 提出MyGO-Splat闭环高斯SLAM框架,通过解析光栅化高斯原语为像素深度和法线,实现地图主动监督位姿优化,并引入尺度感知自适应对齐形成自校正循环,仅用单目输入达到RGB-D方法性能。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29237 2026-06-30 cs.RO cs.AI 57%

MoPe: Motion Permanence for Robust Monocular Gaussian Mapping in Dynamic Environments

MoPe:动态环境中鲁棒单目高斯建图的运动持久性

Qixin Xiao

专题命中 SLAM与定位 :Gaussian Splatting(abstract);分类 cs.RO

AI总结 针对动态场景中单目高斯建图因缺乏时间记忆导致动态物体残留鬼影的问题,提出运动持久性原理,通过贝叶斯对数几率更新融合历史动态后验,实现鲁棒跟踪与建图。

Comments RSS 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28899 2026-06-30 cs.RO 57%

You Only Touch Once: 6-DoF Object Pose Estimation from Single Tactile Contact

一次触碰:单次触觉接触的6自由度物体姿态估计

Pengfei Ye, Yuxiang Ma, Haonan Chen, Guangming Wang, Yixiong Jing, Brian Sheil, Yilun Du, Edward Adelson

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Harvard University(哈佛大学) University of Cambridge(剑桥大学)

专题命中 SLAM与定位 :point cloud(abstract);分类 cs.RO

AI总结 提出YOTO系统,利用单次双点触觉接触通过粗到细网络定位接触点并闭式SVD求解器恢复6自由度物体姿态,在视觉失效场景下优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28607 2026-06-30 cs.RO cs.AI 57%

Fast and Accurate Outlier-Aware LiDAR Super-Resolution for SLAM Applications

快速且准确的异常点感知激光雷达超分辨率方法用于SLAM应用

Christos Anagnostopoulos, Alexandros Gkillas, Nikos Piperigkos, Aris S. Lalos

机构 * Industrial Systems Institute(工业系统研究所) Dpt. of Informatics & Telecom.(信息与电信系)

专题命中 SLAM与定位 :point cloud(abstract);分类 cs.RO

AI总结 提出一种基于深度展开的超分辨率模型,集成异常点移除模块,在保持实时性能的同时高效重建高分辨率点云,显著提升SLAM中的位姿估计精度。

Comments 6 pages, 2 figures

Journal ref Proc. 2025 IEEE International Conference on Image Processing (ICIP), Anchorage, AK, USA, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏