arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

共收录 19 信号源:cs.CV, cs.GR, cs.RO

1. 3D生成 19 篇

2608.02711 2026-08-14 cs.CV 版本更新 83%

Hunyuan3D-Buffalo 1.0: A Unified Multimodal Model for Scalable 3D Generation, Understanding, and Editing

Hunyuan3D-Buffalo 1.0:用于可扩展3D生成、理解与编辑的统一多模态模型

Junliang Ye, Kenkun Liu, Guocun Wang, Yang Li, Yansong Qu, Chunshi Wang, Jingwei Xu, Yunhan Yang, Zibo Zhao, Jiachen Xu, Jiaao Yu, Lifu Wang, Zhihao Liang, Xin Huang, Zhuo Chen, Chunchao Guo

机构 * Tencent Hunyuan(腾讯混元)

专题命中 3D生成 :3D generation(title,abstract);spatial understanding(abstract);分类 cs.CV

AI总结 Hunyuan3D-Buffalo 1.0是支持3D理解、文本到3D生成等功能的统一多模态模型,构建87M规模语料库训练,在相关基准上达SOTA或领先性能,验证了统一训练的有效性。

Comments Project Page: https://tencent-hunyuan.github.io/Hunyuan3D-Buffalo1.0

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14271 2026-06-29 cs.CV 版本更新 83%

Let Language Constrain Geometry: Vision-Language Models as Semantic and Spatial Critics for 3D Generation

让语言约束几何:视觉-语言模型作为3D生成的语义和空间评判者

Weimin Bai, Yubo Li, Weijian Luo, Zeqiang Lai, Yequan Wang, Wenzheng Chen, He Sun

机构 * Peking University(北京大学) hi-lab, Xiaohongshu Inc.(小红书科技公司 hi-lab) MMLab, CUHK(香港中文大学 MMLab) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 3D生成 :3D generation(title,abstract);spatial understanding(abstract);分类 cs.CV

AI总结 提出VLM3D框架,利用视觉-语言模型作为可微分的语义和空间评判者,通过双查询评判信号改善文本到3D生成的语义对齐和几何一致性。

Comments arXiv admin note: substantial text overlap with arXiv:2509.15772

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15228 2026-06-19 cs.CV 版本更新 83%

Collaborative Multi-Modal Coding for High-Quality 3D Generation

协作多模态编码用于高质量3D生成

Ziang Cao, Zhaoxi Chen, Liang Pan, Ziwei Liu

机构 * S-Lab, Nanyang Technological University, Singapore(南洋理工大学S实验室) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 3D生成 :3D generation(title,abstract);point cloud(abstract);分类 cs.CV

AI总结 提出TriMM,首个前馈式3D原生生成模型,通过协作多模态编码融合RGB、RGBD和点云特征,结合辅助2D/3D监督和三平面潜在扩散模型,实现高质量3D资产生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19216 2026-07-08 cs.CV cs.AI cs.LG 版本更新 79%

DreamPartGen: Semantically Grounded Part-Level 3D Generation via Collaborative Latent Denoising

DreamPartGen: 通过协作潜在去噪实现语义引导的部件级3D生成

Tianjiao Yu, Xinzhuo Li, Muntasir Wahed, Jerry Xiong, Yifan Shen, Ying Shen, Ismini Lourentzou

机构 * University of Illinois Urbana - Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 3D生成 :3D generation(title,abstract);分类 cs.CV

AI总结 DreamPartGen通过协作潜在去噪实现语义引导的部件级3D生成,引入双部件潜在和关系语义潜在,提升几何和语义一致性,实现高质量文本对齐的3D合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16085 2026-07-02 cs.CV cs.AI 版本更新 79%

Interact3D: Compositional 3D Generation of Interactive Objects

Interact3D: 交互式物体的组合3D生成

Hui Shan, Keyang Luo, Ming Li, Sizhe Zheng, Yanwei Fu, Zhen Chen, Xiangru Huang

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) Adobe Fudan University(复旦大学)

专题命中 3D生成 :3D generation(title,abstract);分类 cs.CV

AI总结 提出Interact3D框架,通过统一3D引导场景、两阶段组合流水线(全局到局部几何对齐和基于SDF的优化)以及闭环智能体修正策略,从单张图像生成物理合理的交互式3D组合物体,解决遮挡和空间关系保持问题。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19876 2026-06-16 cs.CV 版本更新 79%

Structural Energy Guidance for View-Consistent Text-to-3D Generation

基于结构能量的视图一致文本到3D生成

Qing Zhang, Jinguang Tong, Jing Zhang, Jie Hong, Xuesong Li

机构 * Australian National University(澳大利亚国立大学) CSIRO(澳大利亚国家科学委员会) The University of Hong Kong(香港大学)

专题命中 3D生成 :3D generation(title,abstract);分类 cs.CV

AI总结 本文针对基于扩散模型的文本到3D生成中视图不一致问题,提出无需训练的SEGS框架,通过在U-Net特征的PCA子空间中构建结构能量并注入去噪过程,提升多视图一致性,实验表明有效降低Janus率并提升视图一致性评分。

Comments arXiv admin note: substantial text overlap with arXiv:2508.16917

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11152 2026-06-11 cs.CV 版本更新 79%

P3D-Bench: Benchmarking MLLMs for Parametric 3D Generation and Structural Reasoning

P3D-Bench:用于参数化3D生成与结构推理的多模态大语言模型基准

Yikang Yang, Zhanpeng Hu, Youtian Lin, Mengqi Zhou, Jingxi Xu, Feihu Zhang, Jiaheng Liu, Yao Yao

机构 * Nanjing University(南京大学) Envision

专题命中 3D生成 :3D generation(title,abstract);分类 cs.CV

AI总结 提出P3D-Bench基准,通过参数化3D程序评估多模态大语言模型在几何精度、语义对齐和装配一致性上的表现,涵盖文本到3D、图像到3D和装配3D三类任务。

Comments Project page: https://spatiaos.github.io/projects/P3D-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21472 2026-08-05 cs.CV 版本更新 76%

Stream3D: Sequential Multi-View 3D Generation via Evidential Memory

Stream3D: 基于证据记忆的序列多视角3D生成

Kaichen Zhou, Zeyang Bai, Xinhai Chang, Mengyu Wang, Paul Liang, Fangneng Zhan

机构 * World Mind Lab, HKUST(世界心智实验室,香港科技大学) Media Lab and EECS, MIT(媒体实验室和电子工程与计算机科学系,麻省理工学院) Kempner Institute, Harvard University(凯普纳研究所,哈佛大学)

专题命中 3D生成 :3D generation(title,comments);分类 cs.CV

AI总结 提出Stream3D,一种无需训练的流式机制,通过维护紧凑的证据记忆缓存关键历史帧,将冻结的视角条件3D生成器转换为流式生成器,解决单目视频流中3D生成的时间不一致问题。

Comments Multi-view 3D Generation, Streaming 3D Generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07971 2026-06-17 cs.CV cs.LG 版本更新 74%

DVD: Discrete Voxel Diffusion for 3D Generation and Editing

DVD: 用于3D生成和编辑的离散体素扩散

Zhengrui Xiang, Jiaqi Wu, Fupeng Sun, Heliang Zheng, Yingzhen Li

机构 * Imperial College London(伦敦帝国学院) Math Magic Hitem3D

专题命中 3D生成 :3D generation(title);分类 cs.CV

AI总结 提出离散体素扩散框架(DVD),通过将体素占用视为离散变量,实现稀疏体素的生成、不确定性估计和编辑,避免连续到离散的阈值处理,并提供可解释的生成动态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30429 2026-07-01 cs.LG 版本更新 71%

Arko-T: A Foundation Model for Text-to-Structured 3D Generation

Arko-T: 面向文本到结构化3D生成的基础模型

Liang Wang, Zhaoyang Xi, Zekai Xiang, Heng Meng, Qishan Zhang, Pingyi Zhou, Jin Liu, Litao Chen

机构 * Spatial Design Intelligence Lab, BitInf Ltd.(BitInf有限公司空间设计智能实验室) School of Computer Science, Wuhan University(武汉大学计算机学院) College of Computer and Information Engineering, Nanjing Tech University(南京工业大学计算机与信息工程学院)

专题命中 3D生成 :3D generation(title)

AI总结 提出4B参数文本到设计模型Arko-T,通过设计状态对齐实现从自然语言到可编辑参数化CAD程序的生成,在12项指标中8项最优,成本仅为前沿模型的十分之一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29655 2026-07-08 cs.CV cs.GR 版本更新 62%

SuperVoxelGPT: Adaptive and Ordered 3D Tokenization for Autoregressive Shape Generation

SuperVoxelGPT: 自适应有序3D令牌化用于自回归形状生成

Yuan Li, Congyi Zhang, Xifeng Gao, Xiaohu Guo

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) Tencent America(腾讯美国)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV、cs.GR

AI总结 提出SuperVoxelGPT框架,通过自适应且有序的超体素令牌化解决自回归3D生成中序列长度与空间顺序的矛盾,实现高质量、高效率的形状生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21076 2026-07-31 cs.CV 版本更新 57%

PoseMaster: A Unified 3D Native Framework for Stylized Pose Generation

PoseMaster: 一个统一的3D原生框架用于风格化姿态生成

Hongyu Yan, Kunming Luo, Weiyu Li, Kaiyi Zhang, Yixun Liang, Jingwei Huang, Chunchao Guo, Ping Tan

机构 * Hong Kong University of Science and Technology(香港科技大学) Tencent Hunyuan(腾讯文脉)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 本文提出PoseMaster框架,通过统一姿态风格化与3D生成,提升3D姿态风格化的精度和多样性,采用3D骨架直接指导生成,增强模型在姿态风格化中的表现。

Comments Accepted by CVPR 2026, Code: https://github.com/hanryyan/PoseMaster

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18953 2026-07-21 cs.CV 版本更新 57%

Symmetry Matters: Auditing and Symmetrizing 3D Generative Models

对称性至关重要:审计和对称化3D生成模型

Nicolas Caytuiro, Ivan Sipiran

机构 * University of Chile(智利大学)

专题命中 3D生成 :point cloud(abstract);分类 cs.CV

AI总结 本文研究了无条件点云生成中对称性的保持问题,通过审计多个3D生成模型的对称性并计算基于Chamfer距离的归一化对称性分数,发现现有模型在对称性意识评估协议下存在持续的对称性差距。通过分析训练数据和引入对称性意识干预,作者提出了在半对象数据集上训练生成模型并在采样时进行反射重建的方法,从而提高几何一致性和视觉合理性。

Comments 12 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12752 2026-07-16 cs.CV cs.AI 版本更新 57%

Hallo4D: Multi-Modal Hallucination Mitigation for Consistent Spatio-Temporal Generation

Hallo4D:用于一致时空生成的多模态幻觉缓解

Hongbo Wang, Huaibo Huang, Jie Cao, Jin Liu, Haoyang Tong, Ran He

机构 * Institute of Automation, Chinese Academy of Science(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Shanghaitech University(上海科技大学)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 研究针对3D和4D内容生成中的时空幻觉问题,提出Hallo4D框架,利用多模态语言模型,通过生成-检测-校正范式及多种技术提升一致性,实验证明其在多样生成设置下优于基线,提供了可扩展通用的一致性感知内容生成方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11470 2026-07-15 cs.CV 版本更新 57%

Sat2RealCity: Geometry-Aware and Appearance-Controllable 3D Urban Generation from Satellite Imagery

Sat2RealCity:基于卫星图像的几何感知与外观可控的3D城市生成

Xinliang Wang, Yijie Kang, Zhenyu Wu, Yifeng Shi

机构 * KE Holdings Inc.(KE控股公司) Beijing, China(中国北京)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 针对卫星图像3D城市生成问题,Sat2RealCity框架利用对象级3D生成先验,通过分解城市为地理定位建筑实体,结合构建的数据集,引入空间定位策略、设计外观引导机制及构建语义管道,实现良好的地理对齐、风格一致和资产合成。

Comments The first two authors contributed equally. The fourth author is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12770 2026-07-03 cs.CV 版本更新 57%

One-Shot Feed-Forward 360$^{\circ}$ Animatable Avatar via Inpainted UV-Space Gaussian Modeling

通过修补UV空间高斯建模的一次前馈360度可动画化头像

Shuling Zhao, Dan Xu

机构 * The Hong Kong University of Science and Technology(香港科技大学) Zeekr Automobile R&D Co., Ltd(Zeekr汽车研发有限公司)

专题命中 3D生成 :3D reconstruction(abstract);分类 cs.CV

AI总结 提出一种基于UV空间高斯建模的一次前馈框架,利用预训练3D GAN的先验知识修补缺失区域,实现360度全头可动画化头像的高质量重建与实时动画。

Comments Accepted by ECCV 2026. Project page: https://shaelynz.github.io/fhavatar/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21945 2026-06-24 cs.CV 版本更新 57%

GENA3D: Generative Amodal 3D Modeling by Bridging 2D Priors and 3D Coherence

GENA3D:通过桥接2D先验和3D一致性的生成式非完整3D建模

Junwei Zhou, Yu-Wing Tai

机构 * Dartmouth College(达特茅斯学院)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 提出GENA3D框架,结合2D生成先验与3D几何推理,在部分遮挡下生成完整且几何一致的3D物体,优于现有方法。

Comments Paper accepted by ECCV 2026. Project page: https://colezwhy.github.io/gena3d/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07704 2026-06-08 cs.CV 版本更新 57%

PARSE: Part-Aware Relational Spatial Modeling

PARSE: 部件感知的关系空间建模

Yinuo Bai, Peijun Xu, Kuixiang Shao, Yuyang Jiao, Jingxuan Zhang, Kaixin Yao, Jiayuan Gu, Jingyi Yu

机构 * ShanghaiTech University(上海科技大学) Deemos Technology(德莫斯科技)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 提出PARSE框架,通过部件级部件中心装配图(PAG)和空间配置求解器,实现几何约束下的无碰撞物理有效场景组装,并构建PARSE-10K数据集,提升3D场景布局推理和生成的真实感。

Comments Project Page: https://otanaaa.github.io/PARSE-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24395 2026-07-16 cs.LG 版本更新 50%

AvAtar: Learning to Align via Active Optimal Transport

AvAtar: 通过主动最优输运学习对齐

Qi Yu, Ruizhong Qiu, Zhichen Zeng, My T. Thai, Huan Liu, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Florida(佛罗里达大学) Arizona State University(亚利桑那州立大学)

专题命中 3D生成 :point cloud(abstract)

AI总结 提出AvAtar框架,利用主动学习策略通过熵正则化最优输运的梯度影响量化候选点信息量,并采用伴随状态法高效求解,以提升对齐性能。

Comments Published as a conference paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏