arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

共收录 428 信号源:cs.CV, cs.GR, cs.RO

1. 3D生成 19 篇

2608.02711 2026-08-14 cs.CV 版本更新 83%

Hunyuan3D-Buffalo 1.0: A Unified Multimodal Model for Scalable 3D Generation, Understanding, and Editing

Hunyuan3D-Buffalo 1.0:用于可扩展3D生成、理解与编辑的统一多模态模型

Junliang Ye, Kenkun Liu, Guocun Wang, Yang Li, Yansong Qu, Chunshi Wang, Jingwei Xu, Yunhan Yang, Zibo Zhao, Jiachen Xu, Jiaao Yu, Lifu Wang, Zhihao Liang, Xin Huang, Zhuo Chen, Chunchao Guo

机构 * Tencent Hunyuan(腾讯混元)

专题命中 3D生成 :3D generation(title,abstract);spatial understanding(abstract);分类 cs.CV

AI总结 Hunyuan3D-Buffalo 1.0是支持3D理解、文本到3D生成等功能的统一多模态模型,构建87M规模语料库训练,在相关基准上达SOTA或领先性能,验证了统一训练的有效性。

Comments Project Page: https://tencent-hunyuan.github.io/Hunyuan3D-Buffalo1.0

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14271 2026-06-29 cs.CV 版本更新 83%

Let Language Constrain Geometry: Vision-Language Models as Semantic and Spatial Critics for 3D Generation

让语言约束几何:视觉-语言模型作为3D生成的语义和空间评判者

Weimin Bai, Yubo Li, Weijian Luo, Zeqiang Lai, Yequan Wang, Wenzheng Chen, He Sun

机构 * Peking University(北京大学) hi-lab, Xiaohongshu Inc.(小红书科技公司 hi-lab) MMLab, CUHK(香港中文大学 MMLab) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 3D生成 :3D generation(title,abstract);spatial understanding(abstract);分类 cs.CV

AI总结 提出VLM3D框架,利用视觉-语言模型作为可微分的语义和空间评判者,通过双查询评判信号改善文本到3D生成的语义对齐和几何一致性。

Comments arXiv admin note: substantial text overlap with arXiv:2509.15772

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15228 2026-06-19 cs.CV 版本更新 83%

Collaborative Multi-Modal Coding for High-Quality 3D Generation

协作多模态编码用于高质量3D生成

Ziang Cao, Zhaoxi Chen, Liang Pan, Ziwei Liu

机构 * S-Lab, Nanyang Technological University, Singapore(南洋理工大学S实验室) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 3D生成 :3D generation(title,abstract);point cloud(abstract);分类 cs.CV

AI总结 提出TriMM,首个前馈式3D原生生成模型,通过协作多模态编码融合RGB、RGBD和点云特征,结合辅助2D/3D监督和三平面潜在扩散模型,实现高质量3D资产生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19216 2026-07-08 cs.CV cs.AI cs.LG 版本更新 79%

DreamPartGen: Semantically Grounded Part-Level 3D Generation via Collaborative Latent Denoising

DreamPartGen: 通过协作潜在去噪实现语义引导的部件级3D生成

Tianjiao Yu, Xinzhuo Li, Muntasir Wahed, Jerry Xiong, Yifan Shen, Ying Shen, Ismini Lourentzou

机构 * University of Illinois Urbana - Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 3D生成 :3D generation(title,abstract);分类 cs.CV

AI总结 DreamPartGen通过协作潜在去噪实现语义引导的部件级3D生成,引入双部件潜在和关系语义潜在,提升几何和语义一致性,实现高质量文本对齐的3D合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16085 2026-07-02 cs.CV cs.AI 版本更新 79%

Interact3D: Compositional 3D Generation of Interactive Objects

Interact3D: 交互式物体的组合3D生成

Hui Shan, Keyang Luo, Ming Li, Sizhe Zheng, Yanwei Fu, Zhen Chen, Xiangru Huang

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) Adobe Fudan University(复旦大学)

专题命中 3D生成 :3D generation(title,abstract);分类 cs.CV

AI总结 提出Interact3D框架,通过统一3D引导场景、两阶段组合流水线(全局到局部几何对齐和基于SDF的优化)以及闭环智能体修正策略,从单张图像生成物理合理的交互式3D组合物体,解决遮挡和空间关系保持问题。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19876 2026-06-16 cs.CV 版本更新 79%

Structural Energy Guidance for View-Consistent Text-to-3D Generation

基于结构能量的视图一致文本到3D生成

Qing Zhang, Jinguang Tong, Jing Zhang, Jie Hong, Xuesong Li

机构 * Australian National University(澳大利亚国立大学) CSIRO(澳大利亚国家科学委员会) The University of Hong Kong(香港大学)

专题命中 3D生成 :3D generation(title,abstract);分类 cs.CV

AI总结 本文针对基于扩散模型的文本到3D生成中视图不一致问题,提出无需训练的SEGS框架,通过在U-Net特征的PCA子空间中构建结构能量并注入去噪过程,提升多视图一致性,实验表明有效降低Janus率并提升视图一致性评分。

Comments arXiv admin note: substantial text overlap with arXiv:2508.16917

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11152 2026-06-11 cs.CV 版本更新 79%

P3D-Bench: Benchmarking MLLMs for Parametric 3D Generation and Structural Reasoning

P3D-Bench:用于参数化3D生成与结构推理的多模态大语言模型基准

Yikang Yang, Zhanpeng Hu, Youtian Lin, Mengqi Zhou, Jingxi Xu, Feihu Zhang, Jiaheng Liu, Yao Yao

机构 * Nanjing University(南京大学) Envision

专题命中 3D生成 :3D generation(title,abstract);分类 cs.CV

AI总结 提出P3D-Bench基准,通过参数化3D程序评估多模态大语言模型在几何精度、语义对齐和装配一致性上的表现,涵盖文本到3D、图像到3D和装配3D三类任务。

Comments Project page: https://spatiaos.github.io/projects/P3D-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21472 2026-08-05 cs.CV 版本更新 76%

Stream3D: Sequential Multi-View 3D Generation via Evidential Memory

Stream3D: 基于证据记忆的序列多视角3D生成

Kaichen Zhou, Zeyang Bai, Xinhai Chang, Mengyu Wang, Paul Liang, Fangneng Zhan

机构 * World Mind Lab, HKUST(世界心智实验室,香港科技大学) Media Lab and EECS, MIT(媒体实验室和电子工程与计算机科学系,麻省理工学院) Kempner Institute, Harvard University(凯普纳研究所,哈佛大学)

专题命中 3D生成 :3D generation(title,comments);分类 cs.CV

AI总结 提出Stream3D,一种无需训练的流式机制,通过维护紧凑的证据记忆缓存关键历史帧,将冻结的视角条件3D生成器转换为流式生成器,解决单目视频流中3D生成的时间不一致问题。

Comments Multi-view 3D Generation, Streaming 3D Generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07971 2026-06-17 cs.CV cs.LG 版本更新 74%

DVD: Discrete Voxel Diffusion for 3D Generation and Editing

DVD: 用于3D生成和编辑的离散体素扩散

Zhengrui Xiang, Jiaqi Wu, Fupeng Sun, Heliang Zheng, Yingzhen Li

机构 * Imperial College London(伦敦帝国学院) Math Magic Hitem3D

专题命中 3D生成 :3D generation(title);分类 cs.CV

AI总结 提出离散体素扩散框架(DVD),通过将体素占用视为离散变量,实现稀疏体素的生成、不确定性估计和编辑,避免连续到离散的阈值处理,并提供可解释的生成动态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30429 2026-07-01 cs.LG 版本更新 71%

Arko-T: A Foundation Model for Text-to-Structured 3D Generation

Arko-T: 面向文本到结构化3D生成的基础模型

Liang Wang, Zhaoyang Xi, Zekai Xiang, Heng Meng, Qishan Zhang, Pingyi Zhou, Jin Liu, Litao Chen

机构 * Spatial Design Intelligence Lab, BitInf Ltd.(BitInf有限公司空间设计智能实验室) School of Computer Science, Wuhan University(武汉大学计算机学院) College of Computer and Information Engineering, Nanjing Tech University(南京工业大学计算机与信息工程学院)

专题命中 3D生成 :3D generation(title)

AI总结 提出4B参数文本到设计模型Arko-T,通过设计状态对齐实现从自然语言到可编辑参数化CAD程序的生成,在12项指标中8项最优,成本仅为前沿模型的十分之一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29655 2026-07-08 cs.CV cs.GR 版本更新 62%

SuperVoxelGPT: Adaptive and Ordered 3D Tokenization for Autoregressive Shape Generation

SuperVoxelGPT: 自适应有序3D令牌化用于自回归形状生成

Yuan Li, Congyi Zhang, Xifeng Gao, Xiaohu Guo

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) Tencent America(腾讯美国)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV、cs.GR

AI总结 提出SuperVoxelGPT框架,通过自适应且有序的超体素令牌化解决自回归3D生成中序列长度与空间顺序的矛盾,实现高质量、高效率的形状生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21076 2026-07-31 cs.CV 版本更新 57%

PoseMaster: A Unified 3D Native Framework for Stylized Pose Generation

PoseMaster: 一个统一的3D原生框架用于风格化姿态生成

Hongyu Yan, Kunming Luo, Weiyu Li, Kaiyi Zhang, Yixun Liang, Jingwei Huang, Chunchao Guo, Ping Tan

机构 * Hong Kong University of Science and Technology(香港科技大学) Tencent Hunyuan(腾讯文脉)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 本文提出PoseMaster框架,通过统一姿态风格化与3D生成,提升3D姿态风格化的精度和多样性,采用3D骨架直接指导生成,增强模型在姿态风格化中的表现。

Comments Accepted by CVPR 2026, Code: https://github.com/hanryyan/PoseMaster

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18953 2026-07-21 cs.CV 版本更新 57%

Symmetry Matters: Auditing and Symmetrizing 3D Generative Models

对称性至关重要:审计和对称化3D生成模型

Nicolas Caytuiro, Ivan Sipiran

机构 * University of Chile(智利大学)

专题命中 3D生成 :point cloud(abstract);分类 cs.CV

AI总结 本文研究了无条件点云生成中对称性的保持问题,通过审计多个3D生成模型的对称性并计算基于Chamfer距离的归一化对称性分数,发现现有模型在对称性意识评估协议下存在持续的对称性差距。通过分析训练数据和引入对称性意识干预,作者提出了在半对象数据集上训练生成模型并在采样时进行反射重建的方法,从而提高几何一致性和视觉合理性。

Comments 12 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12752 2026-07-16 cs.CV cs.AI 版本更新 57%

Hallo4D: Multi-Modal Hallucination Mitigation for Consistent Spatio-Temporal Generation

Hallo4D:用于一致时空生成的多模态幻觉缓解

Hongbo Wang, Huaibo Huang, Jie Cao, Jin Liu, Haoyang Tong, Ran He

机构 * Institute of Automation, Chinese Academy of Science(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Shanghaitech University(上海科技大学)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 研究针对3D和4D内容生成中的时空幻觉问题,提出Hallo4D框架,利用多模态语言模型,通过生成-检测-校正范式及多种技术提升一致性,实验证明其在多样生成设置下优于基线,提供了可扩展通用的一致性感知内容生成方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11470 2026-07-15 cs.CV 版本更新 57%

Sat2RealCity: Geometry-Aware and Appearance-Controllable 3D Urban Generation from Satellite Imagery

Sat2RealCity:基于卫星图像的几何感知与外观可控的3D城市生成

Xinliang Wang, Yijie Kang, Zhenyu Wu, Yifeng Shi

机构 * KE Holdings Inc.(KE控股公司) Beijing, China(中国北京)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 针对卫星图像3D城市生成问题,Sat2RealCity框架利用对象级3D生成先验,通过分解城市为地理定位建筑实体,结合构建的数据集,引入空间定位策略、设计外观引导机制及构建语义管道,实现良好的地理对齐、风格一致和资产合成。

Comments The first two authors contributed equally. The fourth author is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12770 2026-07-03 cs.CV 版本更新 57%

One-Shot Feed-Forward 360$^{\circ}$ Animatable Avatar via Inpainted UV-Space Gaussian Modeling

通过修补UV空间高斯建模的一次前馈360度可动画化头像

Shuling Zhao, Dan Xu

机构 * The Hong Kong University of Science and Technology(香港科技大学) Zeekr Automobile R&D Co., Ltd(Zeekr汽车研发有限公司)

专题命中 3D生成 :3D reconstruction(abstract);分类 cs.CV

AI总结 提出一种基于UV空间高斯建模的一次前馈框架,利用预训练3D GAN的先验知识修补缺失区域,实现360度全头可动画化头像的高质量重建与实时动画。

Comments Accepted by ECCV 2026. Project page: https://shaelynz.github.io/fhavatar/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21945 2026-06-24 cs.CV 版本更新 57%

GENA3D: Generative Amodal 3D Modeling by Bridging 2D Priors and 3D Coherence

GENA3D:通过桥接2D先验和3D一致性的生成式非完整3D建模

Junwei Zhou, Yu-Wing Tai

机构 * Dartmouth College(达特茅斯学院)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 提出GENA3D框架,结合2D生成先验与3D几何推理,在部分遮挡下生成完整且几何一致的3D物体,优于现有方法。

Comments Paper accepted by ECCV 2026. Project page: https://colezwhy.github.io/gena3d/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07704 2026-06-08 cs.CV 版本更新 57%

PARSE: Part-Aware Relational Spatial Modeling

PARSE: 部件感知的关系空间建模

Yinuo Bai, Peijun Xu, Kuixiang Shao, Yuyang Jiao, Jingxuan Zhang, Kaixin Yao, Jiayuan Gu, Jingyi Yu

机构 * ShanghaiTech University(上海科技大学) Deemos Technology(德莫斯科技)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 提出PARSE框架,通过部件级部件中心装配图(PAG)和空间配置求解器,实现几何约束下的无碰撞物理有效场景组装,并构建PARSE-10K数据集,提升3D场景布局推理和生成的真实感。

Comments Project Page: https://otanaaa.github.io/PARSE-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24395 2026-07-16 cs.LG 版本更新 50%

AvAtar: Learning to Align via Active Optimal Transport

AvAtar: 通过主动最优输运学习对齐

Qi Yu, Ruizhong Qiu, Zhichen Zeng, My T. Thai, Huan Liu, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Florida(佛罗里达大学) Arizona State University(亚利桑那州立大学)

专题命中 3D生成 :point cloud(abstract)

AI总结 提出AvAtar框架,利用主动学习策略通过熵正则化最优输运的梯度影响量化候选点信息量,并采用伴随状态法高效求解,以提升对齐性能。

Comments Published as a conference paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 空间理解 31 篇

2510.14357 2026-08-11 cs.RO cs.AI 版本更新 83%

SUM-AgriVLN: Spatial Understanding Memory for Agricultural Vision-and-Language Navigation

SUM-AgriVLN:面向农业视觉语言导航的空间理解记忆

Xiaobei Zhao, Xingqi Lyu, Xin Chen, Xiang Li

机构 * China Agricultural University(中国农业大学)

专题命中 空间理解 :spatial understanding(title,abstract);3D reconstruction(abstract);分类 cs.RO

AI总结 针对现有农业视觉语言导航方法忽视重复指令的空间记忆潜力的局限,提出SUM模块并集成至AgriVLN构建SUM-AgriVLN,在A2A基准上将SR从0.47提至0.54,NE仅微增,达领域顶尖性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08991 2026-08-12 cs.CV cs.AI 版本更新 79%

PinpointQA: A Benchmark for Small Object-Centric Spatial Understanding in Indoor Videos

PinpointQA: 一个用于室内视频中微小物体中心空间理解的数据集和基准

Zhiyu Zhou, Peilin Liu, Ruoxuan Zhang, Luyang Zhang, Cheng Zhang, Hongxia Xie, Wen-Huang Cheng

机构 * Jilin University(吉林大学) National Taiwan University(国立台湾大学)

专题命中 空间理解 :spatial understanding(title,abstract);分类 cs.CV

AI总结 本文提出PinpointQA数据集,用于评估多模态大语言模型在室内视频中对微小物体空间定位的精准理解能力,通过四个递进任务验证模型性能,并展示其作为诊断基准和训练数据集的效果。

Comments Accepted at the ECCV 2026 Workshop on Embodied Multimodal Reasoning in Physical Environments (EMR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17999 2026-08-04 cs.AI cs.CV 版本更新 79%

Do Maps Still Matter for Machines: Revisiting the Role of Choropleth Maps in Foundation Model Spatial Understanding

地图对机器来说仍然重要吗:重新审视分级统计图在基础模型空间理解中的作用

Zhiwei Wei, Yonghe Sun, Zhenjia Liu, Wenjia Xu, Chao He, Weihua Dong, Chunbo Liu, Hua Liao

专题命中 空间理解 :spatial understanding(title,abstract);分类 cs.CV

AI总结 研究探讨分级统计图对基础模型空间理解的作用,引入ChoroplethMap-Bench基准,在三种输入条件下评估22个模型,发现地图能显著提升空间推理,尤其结合符号数据及高层次空间模式理解任务时,证明地图是基础模型空间推理的重要外部表示。

Comments 34 pages, 4 figures, and 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18011 2026-07-02 cs.CV 版本更新 79%

RoadBench: Benchmarking MLLMs on Fine-Grained Spatial Understanding and Reasoning under Urban Road Scenarios

RoadBench: 在城市道路场景下对多模态大语言模型进行细粒度空间理解与推理的基准测试

Jun Zhang, Xin Zhang, Jie Feng, Long Chen, Junhui Wang, Zhicheng Liu, Depeng Jin, Yong Li

机构 * Department of Electronic Engineering, BNRist, Tsinghua University(清华大学电子工程系、北京信息科学与技术国家研究中心) Zhongguancun Academy(中关村学院) Amap, Alibaba Group(阿里巴巴集团高德地图)

专题命中 空间理解 :spatial understanding(title,abstract);分类 cs.CV

AI总结 针对城市复杂场景中多模态大语言模型在细粒度空间理解与推理能力上的不足,提出RoadBench基准,包含8个任务、3040个测试用例,通过鸟瞰图和第一人称视角图像评估模型性能,揭示现有模型在此类任务上的显著缺陷。

Comments Accepted by ECCV 2026, the code and data are publicly available at: https://github.com/tsinghua-fib-lab/RoadBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14609 2026-06-25 cs.CV 版本更新 79%

GroundSet: A Cadastral-Grounded Dataset for Spatial Understanding with Vector Data

GroundSet: 基于地籍数据的空间理解向量数据集

Roger Ferrod, Maël Lecene, Krishna Sapkota, George Leifman, Vered Silverman, Genady Beryozkin, Sylvain Lobry

专题命中 空间理解 :spatial understanding(title,abstract);分类 cs.CV

AI总结 针对多模态大模型在遥感精细空间理解上的不足,提出基于地籍矢量数据的大规模数据集,含510k高分辨率图像和380万标注对象,通过指令微调基准验证,标准架构可掌握细粒度空间定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13454 2026-07-29 cs.CV cs.AI 版本更新 74%

GeoAnchor: Collaborative Reasoning via Latent Decomposition for 3D Spatial Understanding

GeoAnchor:通过潜在分解进行协作推理以实现3D空间理解

Hao Li, Han Fang, Zixin Pan, Xin Wei, Hongbo Sun, Jinglin Xu, Zhiyu Lin, Ye Yuan, Zhongjiang He, Yu Yu, Hao Sun

机构 * Shanghai Jiao Tong University(上海交通大学) Xingchen AGI Lab, China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(星辰通用人工智能实验室,中国电信人工智能技术(北京)有限公司) University of Science and Technology Beijing(北京科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 空间理解 :spatial understanding(title);分类 cs.CV

AI总结 针对从2D图像理解3D空间关系的挑战,提出GeoAnchor框架,通过分解3D空间信息为互补组件并结合协作训练策略,实现动态可解释推理,在复杂3D推理任务中优于现有技术。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08787 2026-06-23 cs.CV 版本更新 74%

Lost in Volume: The CT-SpatialVQA Benchmark for Evaluating Semantic-Spatial Understanding of 3D Medical Vision-Language Models

迷失于体积:CT-SpatialVQA基准用于评估3D医学视觉-语言模型的语义-空间理解

Mashrafi Monon, Umaima Rahman, Asif Hanif, Numan Saeed, Mohammad Yaqub

机构 * Mohamed Bin Zayed University of Artificial Intelligence(莫扎德人工智能大学) New York University Abu Dhabi(纽约大学阿布扎克分校)

专题命中 空间理解 :spatial understanding(title);分类 cs.CV

AI总结 本文提出CT-SpatialVQA基准,评估3D医学视觉-语言模型对3DCT数据的语义-空间理解能力,发现现有模型在语义-空间推理任务中表现不佳,需更深入整合体积证据以确保临床可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05774 2026-06-15 cs.CV 版本更新 70%

LiAuto-GeoX: Efficient Grounded Driving Transformer

LiAuto-GeoX: 高效接地驾驶Transformer

Jiawei Lian, Haoyi Sun, Yang Wu, Lifu Mu, Siyuan Wang, Le Hui, Ning Mao, Tao Wei, Pan Zhou, Kun Zhan, Jian Yang

机构 * Nanjing University of Science and Technology(南京理工大学) Li Auto Inc.(Li Auto公司) Northwestern Polytechnical University(西北工业大学) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算学院)

专题命中 空间理解 :3D reconstruction(abstract);spatial understanding(abstract);分类 cs.CV

AI总结 提出LiAuto-GeoX,通过稀疏激光雷达先验和几何保持蒸馏框架,实现高效、实时的自车中心密集3D重建,并显著提升下游自动驾驶任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27412 2026-07-21 cs.CV cs.AI cs.GR eess.IV 版本更新 62%

From Scene-Centric to Observer-Centric: Modeling Observer-Aware Relations for 3D Scene Graph Generation

并非所有关系都同样旋转:面向视角鲁棒的3D场景图生成的变换感知解耦

Jingjun Sun, Chaowei Wang, Zhirui Liu, Jiaxu Tian, Ming Yang, Yaoxing Wang, Yan Di, Shan Gao

机构 * Northwestern Polytechnical University(西北工业大学) ShanghaiTech University(上海科技大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV、cs.GR

AI总结 提出变换感知解耦(TAD)框架,通过将关系推理分解为视角稳定和视角变化两部分,结合视角稳定的对象表示,实现3D场景图生成在偏航视角变化下的鲁棒性,无需训练时旋转增强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13660 2026-07-07 cs.RO cs.CV 版本更新 62%

Towards Spatial Trace with Reasoning in Vision-Language Models for Robotics

面向机器人视觉-语言模型的具有推理能力的空间轨迹

Enshen Zhou, Yibo Li, Jingkun An, Jiayuan Zhang, Shanyu Rong, Mengzhen Liu, Yi Han, Yuheng Ji, Huajie Tan, Jiawei He, Pengwei Wang, Zhongyuan Wang, Cheng Chi, Lu Sheng, Shanghang Zhang

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV、cs.RO

AI总结 本文提出RoboTracer,一种3D感知的视觉语言模型,通过空间编码器和回归监督解码器提升空间推理能力,并结合强化学习训练实现多步度量推理,最终在复杂场景中实现高效空间轨迹生成。

Comments Accepted to ECCV 2026. Project page: https://zhoues.github.io/RoboTracer

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17221 2026-06-12 cs.CV cs.RO 版本更新 62%

QueryOcc: Query-based Self-Supervision for 3D Semantic Occupancy

QueryOcc:基于查询的3D语义占据自监督方法

Adam Lilja, Ji Lan, Junsheng Fu, Lars Hammarstrand

机构 * Chalmers University of Technology(查尔姆斯理工大学) Zenseact

专题命中 空间理解 :point cloud(abstract);分类 cs.CV、cs.RO

AI总结 提出QueryOcc,一种基于查询的自监督框架,通过相邻帧的4D时空查询直接学习连续3D语义占据,利用视觉基础模型或激光雷达数据提供监督,并引入收缩场景表示以在恒定内存下实现远程监督,在Occ3D-nuScenes基准上语义RayIoU提升26%。

详情

展开后加载摘要…

URL PDF HTML 收藏