arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-08-04 至 2026-08-04 共收录 57 信号源:cs.CV, cs.GR, cs.RO

1. Gaussian Splatting 21 篇

2607.11500 2026-08-04 cs.CV 版本更新 57%

HyperGS: Fast and Generalizable Gaussian Video Representation

HyperGS:快速且通用的高斯视频表示

Fatimah Zohra, Chen Zhao, Shuming Liu, Yahya Al Malallah, Bernard Ghanem

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);分类 cs.CV

AI总结 研究针对高斯视频表示中现有方法依赖单视频优化、编码慢且通用性受限的问题,提出HyperGS方法,通过设计特定Transformer提取令牌和获得高斯表示,结合正则化器解决退化问题,实现快速编码及跨视频通用,提升了PSNR。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 点云 16 篇

2608.02432 2026-08-04 cs.CV 新提交 79%

Learning to Tessellate: Point Cloud Generation via Recursive Spectral Partitioning

学习镶嵌:通过递归谱划分生成点云

Monan Sun, Bangzhen Liu, Huaidong Zhang, Shengfeng He

机构 * South China University of Technology(华南理工大学) University of Chinese Academy of Sciences(中国科学院大学) City University of Hong Kong(香港城市大学) Singapore Management University(新加坡管理大学)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 该研究提出自回归框架PointRSP,通过拓扑保留的递归谱划分实现点云生成,引入拓扑感知划分自编码器与双流级联生成器,在生成质量、多样性及复杂3D拓扑泛化上达最优性能。

Comments Accepted by ECCV2026, project page: https://huggingface.co/Mo-nan/PointRSP

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05372 2026-08-04 cs.CV cs.AI 79%

Two Steps Are All You Need: Efficient 3D Point Cloud Anomaly Detection with Consistency Models

两步即可:基于一致性模型的高效3D点云异常检测

Pranav A, Shashank B, Pranav Siddappa, Dominik Seuss, Minal Moharir, Subramanya KN

机构 * R.V. College of Engineering(R.V. 工程学院) Technical University of Applied Sciences Würzburg-Schweinfurt(Würzburg-Schweinfurt 应用科学大学)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 本文提出基于一致性学习的重建异常检测方法,通过简化推理过程提升效率,实现低延迟的3D点云异常检测,适用于资源受限设备。

Comments Accepted to CVPR 2026, at the 9th Workshop on Efficient Deep Learning for Computer Vision (ECV). To be published in the IEEE/CVF CVPR 2026 Workshop Proceedings

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 3479-3487

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00495 2026-08-04 cs.PF cs.DB cs.DC 新提交 78%

Error-bounded Point Cloud Compression Using Truncated Octahedron Quantization

基于截角八面体量化的误差受限点云压缩

Youyuan Liu, Longtao Zhang, Ruoyu Li, Bo Jiang, Taolue Yang, Kai Zhao, Sheng Di, Eduard Dragut, Sian Jin

专题命中 点云 :point cloud(title,abstract)

AI总结 针对现有点云压缩技术不适用于密集科学数据的问题,提出基于截角八面体量化的XnYZip压缩器,可提升压缩比与处理速度,降低存储开销。

Comments accepted by VLDB 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02285 2026-08-04 cs.CV 新提交 57%

Sen-Cap: Sensor-Flexible and Noise-Resilient Human Motion Capture via LiDAR-Camera Integration

Sen-Cap:基于激光雷达-相机融合的传感器灵活且抗噪的人体运动捕捉框架

Aoru Xue, Yujing Sun, Yiming Ren, Kwok-Yan Lam, Mao Ye, Yuexin Ma

机构 * ShanghaiTech University(上海科技大学) Digital Trust Centre, Nanyang Technological University(南洋理工大学数字信托中心)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 Sen-Cap是一种无需传感器间校准的激光雷达-相机融合人体运动捕捉框架,通过跨传感器运动估计器与抗噪轨迹跟踪器实现灵活部署与强鲁棒性,在多数据集上达最优性能,适用于真实场景。

Comments 16 pages, 8 figures, 4 tables. Accepted at ECCV 2026. Aoru Xue and Yujing Sun contributed equally. Yuexin Ma is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02129 2026-08-04 cs.CV 新提交 57%

PromptPath: Prompt-Adaptive Computational Pathways for In-Context Learning

PromptPath:用于上下文学习的提示自适应计算路径

Hangrui Zhang, Feifei Shao, Yawei Luo, Ping Liu, Jiaxiang Liu, Zuoqi Tang, Zhao Wang, Hongwei Wang, Jun Xiao

机构 * Zhejiang University(浙江大学) University of Nevada, Reno(内华达大学雷诺分校) Guangdong Institute of Intelligence Science and Technology(广东省智能科学与技术研究院)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 该研究针对现有ICL方法的浅层任务适配问题,提出PromptPath框架,通过提示驱动的路由机制动态重构模型计算,在视觉识别基准上性能优于现有ICL基线且泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01470 2026-08-04 cs.CV cs.AI 新提交 57%

VGER: Voxel-Guided Global Event Ranking for Event Cloud Attribution

VGER:体素引导的全局事件排序,用于事件云归因

Youxin Jiang, Baoheng Fu, Hongwei Ren, Xiangqian Wu

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 针对事件云归因的点级显著性方法忽略事件时空结构的局限,提出无训练框架VGER,结合梯度与扰动证据实现事件级归因,在9种设置下均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00687 2026-08-04 cs.CV 新提交 57%

Proteus: A Truncation-Robust Entropy Model for Progressive LiDAR Compression

Proteus:适用于渐进式激光雷达压缩的抗截断熵模型

Yihan Qiu, Xiaodong Lin, Baoquan Zhao, Hailong Jiao, Ge Li

机构 * Peking University(北京大学) Sun Yat-sen University(中山大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 提出名为Proteus的激光雷达压缩编解码器,通过解耦编码实现抗70%比特流截断,在理想信道下优于G-PCC、Draco等标准及Unicorn,可用于安全关键感知场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00652 2026-08-04 cs.RO 新提交 57%

Assistant Placement Aria: A Benchmark for Egocentric Placement Assistance

助手放置基准Aria:面向以自我为中心的放置辅助任务的基准

Amir Belder, Gonçalo Dias Pais, Refael Vivanti, Omri Carmi, Daniel DeTone, Oren Shrout, Ido Gattegno, Ayellet Tal

机构 * Reality Labs, Meta inc.(Meta公司现实实验室) Technion, institute of technology(以色列理工学院) Sensei

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 本文提出首个虚拟放置基准Assistant Placement Aria,涵盖三类以人为中心的放置任务,在基准上评估了多个基础模型,推动虚拟放置领域研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21611 2026-08-04 cs.CV 版本更新 57%

SARe: Structure-Aware Generative 3D Fragment Reassembly

SARe: 基于结构的大规模3D碎片重组

Hanze Jia, Chunshi Wang, Yuxiao Yang, Zhonghua Jiang, Yawei Luo, Shuainan Ye, Tan Tang

机构 * State Key Lab of CAD\&CG, Zhejiang University(浙江大学CAD与计算机图形学国家重点实验室) School of Software Technology, Zhejiang University(浙江大学软件学院) Laboratory of Art and Archaeology Image, Zhejiang University(浙江大学艺术与考古图像实验室)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出SARe框架,通过生成式方法解决大规模3D碎片重组问题,通过显式接触建模提高接触推理的稳定性与一致性,实验证明在碎片数量增加时具有更优的性能。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02457 2026-08-04 cs.CV 版本更新 57%

PatchAlign3D: Local Feature Alignment for Dense 3D Shape Understanding

PatchAlign3D: 本地特征对齐用于密集3D形状理解

Souhail Hadgi, Bingchen Gong, Ramana Sundararaman, Emery Pierson, Lei Li, Peter Wonka, Maks Ovsjanikov

机构 * École polytechnique(巴黎政治学院) University of Virginia(弗吉尼亚大学) KAUST(王国立阿联酋科技大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 PatchAlign3D通过点云直接生成语言对齐的片段特征,实现高效零样本3D部分分割,优于传统渲染方法。

Comments CVPR 2026. Project website: https://souhail-hadgi.github.io/patchalign3dsite/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03011 2026-08-04 cs.RO 版本更新 57%

3D-CovDiffusion: 3D-Aware Diffusion Policy for Coverage Path Planning

3D-CovDiffusion:面向覆盖路径规划的三维感知扩散策略

Chenyuan Chen, Haoran Ding, Ran Ding, Tianyu Liu, Zewen He, Anqing Duan, Yoshihiko Nakamura

机构 * IEEE

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 本文提出 3D-CovDiffusion,将覆盖路径规划转化为条件序列生成问题,采用几何条件扩散框架从三维点云合成轨迹,相比基线方法在轨迹平滑度、覆盖率等指标上实现显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18819 2026-08-04 cs.CV 版本更新 57%

Parameter-Efficient CLIP Adaptation for 3D Understanding via Unified Tokenization

用于3D理解的参数高效CLIP适配:通过统一分词实现

Guofeng Mei, Qinfeng Xiao, Bin Ren, Luigi Riz, Juan Liu, Xiaoshui Huang, Xu Zheng, Nicu Sebe, Ming-Hsuan Yang, Fabio Poiesi

机构 * Fondazione Bruno Kessler(布鲁诺·科塞拉基金会) University of Trento(特伦托大学) University of Pisa(比萨大学) Beijing Forestry University(北京林业大学) Shanghai Jiao Tong University(上海交通大学) Hong Kong University of Science and Technology (GZ)(香港科技大学) Shandong University(山东大学) University of California, Merced(加州大学默塞德分校)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出参数高效框架UTok3D,通过学习尺度归一化3D分词器,实现冻结CLIP视觉主干在无标注情况下对不同尺度点云的复用,完成3D分割任务。

Comments 14 pages, tokenizer

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01852 2026-08-04 cs.DB cs.IR 新提交 50%

Multimodal Embeddings for 3D Similarity Search in Semantic Web-of-Things Digital-Twin Platforms

面向语义物联网数字孪生平台中三维相似度搜索的多模态嵌入

Oussama Zaid, Romaric Gaudel, Hassan Thomas, Maria Massri, Philippe Raipin-Parv{é}dy

专题命中 点云 :point cloud(abstract)

AI总结 本文针对语义物联网数字孪生平台缺乏三维相似度搜索能力的问题,提出多模态嵌入框架,在Thing'in平台实现后经S3DIS验证,可支持混合本体-向量查询,满足相关领域的三维相似度搜索需求。

Journal ref 4th International Workshop on the Semantic WEb of EveryThing (SWEET 2026), co-located with ICWE 2026, Jun 2026, Lyon, France

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01498 2026-08-04 math.NA cs.NA 版本更新 50%

Geometric Generalization of Neural Operators from a Kernel Integral Perspective

从核积分视角看神经算子的几何泛化

Mingyu Han, Daniel Zhengyu Huang, Yuhan Wang, Yanshu Zhang, Jiayi Zhou

专题命中 点云 :point cloud(abstract)

AI总结 本文提出一种基于核积分视角的多尺度神经算子,用于解决变量几何下的神经算子泛化问题,并提供理论保证和实验验证。

Comments 37 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07760 2026-08-04 quant-ph 50%

Quantum Semantic Communication Beyond the Shannon-Wyner Channel Capacity

Min Wang, Gui-Fa Zhu, Guo-Fei Long, Jianxing Guo, Yu-Chen Liu, Dong Pan, Li-Ping Nong, Gui-Lu Long

专题命中 点云 :point cloud(abstract)

Journal ref Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.17494 2026-08-04 math.AT math.OC 版本更新 50%

Topological feature selection for time series data

面向时间序列数据的拓扑特征选择

Peter Bubenik, Johnathan Bush

专题命中 点云 :point cloud(abstract)

AI总结 该研究将应用拓扑学工具用于时间序列数据的特征选择,提出一种基于拓扑特征贡献的变量评分方法,以秀丽隐杆线虫神经元数据为背景,选出优化协同动力学的神经元子集。

Comments 31 pages. Numerous improvements based on referee comments. We now use stochastic subgradient descent which has guarantees of convergence

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 3D生成 3 篇

2608.01825 2026-08-04 cs.CV cs.AI cs.GR 新提交 62%

PartMat: Material-Aware 3D Part Decomposition with a Single Global Latent

PartMat:基于单个全局隐变量的材质感知三维部件分解

Guangming Fu, Jin Song, Yiyun Fei, Guoqiu Li, Ruigao Yang, Jianan Jiang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV、cs.GR

AI总结 该研究提出PartMat,一种用单个全局隐变量的材质感知三维部件分解流水线,可按材质边界分解物体,推理高效且分解准确率优于基线,几何质量相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01605 2026-08-04 cs.GR 新提交 57%

ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech

ETHead:从语音生成富有表现力的3D面部动画与头部运动

Jiu-Cheng Xie, Jiwang Zheng, Yongkang Xia, Jian Xiong, Chi-Man Pun, Hao Gao, Feng Xu

专题命中 3D生成 :3D generation(abstract);分类 cs.GR

AI总结 本文提出ETHead方法,通过自蒸馏框架与情感调制概率掩码机制,从语音生成与情感匹配的3D面部及头部运动,性能优于现有最优方法,其编码器可迁移增强其他动画框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01335 2026-08-04 cs.HC 新提交 50%

PartInteractor: Intent-Driven Part-Aware 3D Authoring for Continuous Co-Creation in XR

PartInteractor:面向XR中持续协同创作的意图驱动、部件感知的三维创作工具

Jianan Jiang, Bin Li

专题命中 3D生成 :3D generation(abstract)

AI总结 PartInteractor是支持语音、草图、图像输入的部件感知三维创作框架,将语义部件层级作为可操控单元,提升生成后控制与意图一致性,助力XR中持续人机协同创作。

Comments Accepted to ACM UIST 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 空间理解 2 篇

2607.17999 2026-08-04 cs.AI cs.CV 版本更新 79%

Do Maps Still Matter for Machines: Revisiting the Role of Choropleth Maps in Foundation Model Spatial Understanding

地图对机器来说仍然重要吗:重新审视分级统计图在基础模型空间理解中的作用

Zhiwei Wei, Yonghe Sun, Zhenjia Liu, Wenjia Xu, Chao He, Weihua Dong, Chunbo Liu, Hua Liao

专题命中 空间理解 :spatial understanding(title,abstract);分类 cs.CV

AI总结 研究探讨分级统计图对基础模型空间理解的作用,引入ChoroplethMap-Bench基准,在三种输入条件下评估22个模型,发现地图能显著提升空间推理,尤其结合符号数据及高层次空间模式理解任务时,证明地图是基础模型空间推理的重要外部表示。

Comments 34 pages, 4 figures, and 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02257 2026-08-04 cs.RO 新提交 57%

Learning Panorama-Aware VLA for Mobile Manipulation with Whole-Body Teleoperation

面向全身遥操作移动操作的全景感知VLA学习

Donglin Yang, Haoran Chen, Xingyu Chen, Lixing Liu, Manyi Li, Changhe Tu, Ke Xu, Xiaojian Ma, Si Liu

机构 * Beihang University(北京航空航天大学) Shandong University(山东大学) Johns Hopkins University(约翰斯·霍普金斯大学) Delta Intelligence(delta智能公司)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.RO

AI总结 针对移动操作VLA策略的局部视野与全身演示数据收集难题,开发全身遥操作系统与PanoVLA全景感知VLA策略,基于5.5小时多模态数据集,在四项真实任务中平均阶段完成率91.3%、端到端成功率73.4%,性能优于局部视角基线。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. SLAM与定位 2 篇

2608.01914 2026-08-04 cs.CV 新提交 70%

CHOW-SLAM: Compact Hybrid Representation with Complementary Overlap Window Optimization for RGB-D SLAM

CHOW-SLAM:面向RGB-D SLAM的结合互补重叠窗口优化的紧凑混合表示方法

Wenxuan Ji, Jin Xiao, Xiaoguang Hu, Jiaqi Shi, Zichong Jia, Baochang Zhang

机构 * School of Automation Science and Electrical Engineering, Beihang University(北京航空航天大学自动化科学与电气工程学院)

专题命中 SLAM与定位 :NeRF(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出CHOW-SLAM框架,通过紧凑P-H混合表示与互补重叠窗口策略构建空间、时间约束,结合ORB初始化与神经渲染优化,在多数据集上优于现有最优RGB-D SLAM方法。

Comments 33 pages, 8 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01509 2026-08-04 cs.CV 新提交 57%

Rolling Shutter Camera Self-Calibration

卷帘快门相机自校准

Yongcong Zhang, Navid Rabbani, Bangyan Liao, Chengbo Wang, Yizhen Lao, Adrien Bartoli

机构 * CHU Clermont-Ferrand(克莱蒙费朗大学中心医院) SURGAR, Surgical Augmented Reality(外科增强现实研究组) School of Engineering, Westlake University(西湖大学工程学院) School of Design, Hunan University(湖南大学设计学院)

专题命中 SLAM与定位 :3D vision(abstract);分类 cs.CV

AI总结 本文提出了首个无需校准靶标的卷帘快门相机自校准方法,通过结合两种互补成像模型构建统一双投影模型,经仿真与真实数据实验验证了方法的准确性与有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他3D视觉 3 篇

2608.01185 2026-08-04 cs.CV cs.LG 新提交 57%

3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question Answering

3DZip:面向3D视觉问答的空间感知特征多样性引导的Token压缩方法

Changwoo Baek, Kyeongbo Kong

机构 * Pusan National University(釜山国立大学)

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV

AI总结 本文针对3D视觉问答中Token压缩忽略空间特性的问题,提出三阶段框架3DZip,在三个基准上以128个Token保留94.7%性能、提速1.92倍,优于现有方法。

Comments Accepted to ECCV 2026. Project page: https://cvsp-lab.github.io/3DZip

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06216 2026-08-04 cs.CV 版本更新 57%

MoWorld: A Flash World Model

MoWorld:一种快速世界模型

Team Moxin, Deyi Ji, Tianrun Chen, Xin Zhang, Jiale Yang, Qi Zhu, An Zhao, Zihao Xie, Han Wang, Xuanyi Liu, Yixiang Zhou, Pei Liu, Yi Tan, Cheng Chen, Dayi Zhu, Mingyu Wei, Hanjie Xu, Jun Liao, Siqi Li, Lingyu Lu, Hongye Fang, Hongming Tan, Youjiang Zhu, Taiyu Zhang, Zejian Li, Chaotao Ding, Zhipeng Liang, Wenxuan Song, Yi Li, Baochuan Yang, Xin Jiang, Ben Feng, Jingyuan Zou, Yanlin Liu, Rong Shi, Lingfeng Li, Liyi Yao, Lanyun Zhu, Yunhe Pan, Lingyun Sun

机构 * Moxin Technology(魔心科技)

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV

AI总结 研究旨在提升世界模型实用性与推理效率。提出MoWorld,基于3D原生数据引擎,有课程跨帧预训练等策略,能在NPU上达50 FPS实时交互,平均推理成本低,为世界模型大规模应用提供基础并展示多种应用。

Comments Project Page: https://moxin-tech.github.io/moworld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11924 2026-08-04 cs.CV cs.LG 交叉投稿 57%

Enriched text-guided variational multimodal knowledge distillation network (VMD) for automated diagnosis of plaque vulnerability in 3D carotid artery MRI

用于3D颈动脉MRI斑块易损性自动诊断的增强文本引导变分多模态知识蒸馏网络(VMD)

Bo Cao, Fan Yu, Mengmeng Feng, SenHao Zhang, Xin Meng, Yue Zhang, Zhen Qian, Jie Lu

机构 * department of Radiology and Nuclear Medicine, Xuanwu Hospital, Capital Medical University(放射医学与核医学科,宣武医院,首都医科大学) Beijing Key Laboratory of Magnetic Resonance Imaging and Brain Informatics(北京磁共振成像与脑信息学重点实验室) Beijing United Imaging Research Institute of Intelligent Imaging(北京智能成像联合研究院)

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV

AI总结 该研究针对3D颈动脉MRI斑块易损性自动诊断难题,提出VMD网络,利用跨模态先验知识提升未标注图像诊断准确率,经内部数据集实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏