arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

共收录 421 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 74 篇

2607.02075 2026-08-14 cs.CV 版本更新 57%

HandsOnWorld: Unconstrained Egocentric Video Generation with Camera-Disentangled Hand Control

HandsOnWorld: 无约束的自我中心视频生成,具有相机解耦的手部控制

Yushuo Chen, Xiaoyu Shi, Xiaoshi Wu, Xintao Wang, Pengfei Wan, Yebin Liu

机构 * Tsinghua University(清华大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Chinese University of Hong Kong(香港中文大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 提出HandsOnWorld框架,通过单目重建从无约束视频中学习手部控制,利用Plücker手部映射解耦相机与手部运动,生成高保真自我中心视频。

Comments Project Page: https://shad0wta9.github.io/handsonworld-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11729 2026-08-14 cs.CV cs.LG 版本更新 57%

SpaRRTa: A Synthetic Benchmark for Evaluating Spatial Intelligence in Visual Foundation Models

SpaRRTa:用于评估视觉基础模型空间智能的合成基准

Turhan Can Kargin, Wojciech Jasiński, Adam Pardyl, Bartosz Zieliński, Marcin Przewięźlikowski

机构 * AGH University of Krakow(克拉科夫AGH大学) IDEAS NCBR

专题命中 三维重建 :spatial understanding(abstract);分类 cs.CV

AI总结 SpaRRTa通过评估视觉基础模型的空间推理能力,揭示其在不同空间任务中的表现差异,旨在推动更高效的空间意识视觉模型发展。

Comments Project page is available at https://sparrta.gmum.net/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14615 2026-08-13 cs.CV 版本更新 57%

CalibAnyView: Beyond Single-View Camera Calibration in the Wild

CalibAnyView:超越单视角相机校准的野外应用

Boying Li, Cheng Zhang, Weirong Chen, Guyuan Chen, Daniel Cremers, Jianfei Cai, Ian Reid, Hamid Rezatofighi

机构 * Monash University(蒙纳士大学) Technical University of Munich(慕尼黑技术大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 CalibAnyView通过多视角几何一致性建模,提升野外多视角相机校准的鲁棒性和精度,适用于复杂场景下的3D重建和机器人感知。

Comments 27 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08813 2026-08-11 cs.RO 版本更新 57%

Calib3R: Hand-Eye Calibration and 3D Metric-Scaled Scene Reconstruction with 3D Foundation Models

Calib3R:基于三维基础模型的手眼标定与三维度量尺度场景重建

Davide Allegro, Matteo Terreran, Stefano Ghidoni

机构 * Department of Information Engineering (DEI) at the University of Padova(帕多瓦大学信息工程系)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.RO

AI总结 Calib3R是一种基于3D基础模型的无标定板方法,通过统一优化联合完成手眼标定与度量尺度三维重建,仅用不到10张图像即可实现精确标定,性能优于同类方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06923 2026-08-07 cs.CV 版本更新 57%

Bi-PT: Bidirectional Cross-Attention Point Transformers for Four-Chamber Heart Reconstruction from Sparse Cardiac MRI Data

Bi-PT:用于从稀疏心脏MRI数据重建四腔心的双向交叉注意力点变换器

Chenchuhui Hu, Shaoming Pan, Leon Axel, Meng Ye

机构 * University of Texas at Arlington(德克萨斯大学阿灵顿分校) New York University(纽约大学)

专题命中 三维重建 :point cloud(abstract);分类 cs.CV

AI总结 针对从稀疏心脏MRI数据重建四腔心的问题,Bi-PT通过双向点交叉注意力学习点特征,结合逐点语义标签改进对应估计,将变形场公式化为神经常微分方程,集成语义标签损失和添加平滑正则化,实验证明其性能准确且稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03387 2026-08-06 cs.RO 版本更新 57%

RoboReact: Agentic Skill Distillation from Generated Egocentric Videos for Generalizable Whole-Body Manipulation

RoboReact:基于生成的自我中心视频的智能体技能蒸馏,实现通用全身操控

Shuliang He, Shuai Wang, Bo Yue, Junchi Teng, Changyu Wang, Guiliang Liu

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.RO

AI总结 本研究提出RoboReact框架,通过生成自我中心视频并结合视觉语言引导的闭环控制,实现人形机器人全身操控技能的通用获取,可在多样场景中稳健执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00238 2026-08-05 cs.GR cs.LG 版本更新 57%

Robust Biharmonic Skinning Using Geometric Fields

基于几何场的鲁棒双调和蒙皮技术

Ana Dodik, Vincent Sitzmann, Justin Solomon, Oded Stein

专题命中 三维重建 :point cloud(abstract);分类 cs.GR

AI总结 本文提出一种基于几何场的无网格鲁棒自动蒙皮技术,借助硬件光线追踪实现的拉格朗日表示优化双调和能量,可在开放曲面等现有方法失效的场景生成与最优方法相当的权重,经全面评估验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28261 2026-08-04 cs.CV 版本更新 57%

TARS: Timestep-Aware Data Scaling for 3D-Free Video Re-Shooting

TARS:用于无3D视频重拍摄的时间步感知数据缩放

Jiwen Liu, Shujuan Li, Xiaohan Li, Zijie Meng, Xinyue Liu, Yulong Xu, Yan Zhou, Guoxin Zhang

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 该研究提出无3D的视频重拍摄范式TARS,通过自监督学习结合数据缩放与文本-相机联合条件设置,实现稳健的相机与视角控制,在大运动下合成未见区域的表现优于现有方法。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24024 2026-08-04 cs.CV 版本更新 57%

GeoStereo: A Unified Stereo Geometry Estimation Framework for Disparity and Surface Normal

用于视差和表面法线的统一立体几何估计框架

Qizhe Wei, Xianda Guo, Shaocong Xu, Hong Li, Runyi Yang, Hao Zhao

机构 * Beijing Institute of Technology(北京理工大学) School of Computer Science, Wuhan University(武汉大学计算机科学学院) Beihang University(北京航空航天大学) INSAIT, Sofia University(索非亚大学INSAIT) BAAI AIR, Tsinghua University(清华大学BAAI AIR)

专题命中 三维重建 :3D vision(abstract);分类 cs.CV

AI总结 本文针对立体匹配和表面法线估计问题,提出统一框架GeoStereo,结合前馈立体匹配与基于扩散的法线估计分支,引入初始化策略与扭曲条件,实现有效交互,在多场景表现可靠,零样本设置下视差和法线估计精度高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11257 2026-08-03 cs.CV 版本更新 57%

Towards Automated Initial Probe Placement in Transthoracic Teleultrasound Using Human Mesh and Skeleton Recovery

面向经胸远程超声的自动初始探头放置方法

Yu Chung Lee, David G. Black, Ryan S. Yeung, Septimiu E. Salcudean

专题命中 三维重建 :point cloud(abstract);分类 cs.CV

AI总结 本文提出了一种基于RGB图像的远程超声自动初始探头放置方法,通过混合现实设备捕捉患者并重建体表模型,从而实现精确的探头位置指导。

Comments 10 pages, 5 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18801 2026-07-31 cs.CV 版本更新 57%

PartDiffuser: Part-wise 3D Mesh Generation via Discrete Diffusion

PartDiffuser:通过离散扩散实现部件级3D网格生成

Yichen Yang, Hong Li, Haodong Zhu, Linin Yang, Guojun Lei, Sheng Xu, Baochang Zhang

机构 * Beihang University(北航) Communication University of China(中国通信大学) Zhejiang University(浙江大学)

专题命中 三维重建 :point cloud(abstract);分类 cs.CV

AI总结 PartDiffuser提出一种半自回归扩散框架,通过部件级方法生成高保真3D网格,有效平衡全局结构与局部细节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27084 2026-07-30 cs.CV 版本更新 57%

SceneExpander: Text-Guided 3D Scene Expansion via Free-Form View Insertion

SceneExpander:通过自由形式插入视图扩展3D场景

Zijian He, Renjie Liu, Yihao Wang, Weizhi Zhong, Huan Yuan, Kun Gai, Guangrun Wang, Guanbin Li

机构 * Sun Yat-sen University(中山大学) KlingAI Research, Kuaishou Technology(快手科技 KlingAI 研究)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出SceneExpander,通过在用户控制下插入合成视图扩展3D场景,解决几何偏移和一致性问题,提升重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18634 2026-07-29 cs.CV cs.LG 版本更新 57%

SwiftGS: Episodic Priors for Immediate Satellite Surface Recovery

SwiftGS: 基于事件的先验知识用于即时卫星表面恢复

Rong Fu, Jiekai Wu, Xiaowen Ma, Shiyin Lin, Kangan Qian, Chuang Liu, Simon James Fong

机构 * University of Macau(澳门大学) Juntendo University(顺天堂大学) Tongji University(同济大学) Zhejiang University(浙江大学) University of Florida(佛罗里达大学) Tsinghua University(清华大学) Wuhan University(武汉大学) Juniata College(朱尼亚塔学院)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 SwiftGS通过元学习方法实现单次前向传递的3D重建,结合几何-辐射解耦的高斯基元和轻量SDF,降低单场景优化成本,实现高效准确的数字表面模型重建和视图一致渲染。

Comments 23 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00713 2026-07-27 cs.CV 版本更新 57%

RAD: A Dataset and Benchmark for Real-Life Anomaly Detection with Robotic Observations

RAD:面向机器人观测的真实异常检测数据集与基准

Kaichen Zhou, Xinhai Chang, Taewhan Kim, Jiadong Zhang, Yang Cao, Chufei Peng, Fangneng Zhan, Hao Zhao, Hao Dong, Kai Ming Ting, Ye Zhu

机构 * Massachusetts Institute of Technology(麻省理工学院) Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) Great Bay University(大湾大学) Harvard University(哈佛大学) Tsinghua University(清华大学) Nanjing University(南京大学) Deakin University(德克萨斯大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 提出RAD数据集,包含13类日常物体和4种缺陷,从60多个机器人视角在非受控光照下采集,用于评估2D特征、3D重建和视觉语言模型在姿态无关的异常检测中的表现,发现2D方法优于3D和VLM方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13826 2026-07-27 eess.IV cs.CV 版本更新 57%

Latent Interpolation Learning Using Diffusion Models for Cardiac Volume Reconstruction

使用扩散模型进行心脏容积重建的潜在插值学习

Niklas Bubeck, Suprosanna Shit, Chen Chen, Can Zhao, Pengfei Guo, Dong Yang, Georg Zitzlsberger, Daguang Xu, Bernhard Kainz, Daniel Rueckert, Jiazhen Pan

机构 * School of Computation, Information and Technology, Technical University Munich(技术大学慕尼黑计算信息学院) Munich Center for Machine Learning(慕尼黑机器学习中心) Department of Quantitative Biomedicine, University of Zurich(苏黎世大学定量生物医学系) Institute of Biomedical Engineering, Department of Engineering Science, University of Oxford(牛津大学生物医学工程研究所) Imperial College London(伦敦帝国学院) University of Sheffield(谢菲尔德大学) NVIDIA(英伟达) Department of Computing, Imperial College London(伦敦帝国学院计算机系) Department AIBE of Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔兰根-纽伦堡大学AIBE系) School of Medicine, Klinikum Rechts der Isar, Technical University of Munich(慕尼黑技术大学医学院,莱纳特医院)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 针对心脏磁共振成像二维切片采集稀疏致容积信息不完整、现有重建方法有局限的问题,提出CaLID框架,创新采用基于扩散模型的插值方案、潜在空间高效计算法,仅用稀疏二维图像输入达SOTA,扩展到二维加时间数据,提升了重建质量和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05182 2026-07-24 cs.CV cs.AI 版本更新 57%

LSRM: High-Fidelity Object-Centric Reconstruction via Scaled Context Windows

LSRM:通过扩展上下文窗口实现高保真对象中心重建

Zhengqin Li, Cheng Zhang, Jakob Engel, Zhao Dong

机构 * Meta Reality Labs Research(Meta现实实验室)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 LSRM通过扩展上下文窗口提升3D重建精度,采用高效粗到细流程和3D感知空间路由机制,实现高质量纹理和外观恢复,优于现有最先进方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16461 2026-07-21 cs.CV 版本更新 57%

GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models

GAP-MLLM:几何对齐预训练以激活多模态大语言模型中的3D空间感知

Jiaxin Zhang, Junjun Jiang, Haijie Li, Youyu Chen, Kui Jiang, Dave Zhenyu Chen

机构 * Harbin Institute of Technology(哈尔滨工业大学) School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) Huawei(华为)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出GAP-MLLM,通过几何对齐预训练激活多模态大语言模型中的3D空间感知,改进了传统方法在3D空间感知上的不足。

Comments Accepted by ECCV 2026. Project page: https://gapmllm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16592 2026-07-20 cs.RO 版本更新 57%

ContactFusion: Stochastic Poisson Surface Maps from Visual and Contact Sensing

ContactFusion:基于视觉和接触传感的随机泊松曲面地图

Aditya Kamireddypalli, Joao Moura, Russell Buchanan, Matias Mattamala, Sethu Vijayakumar, Subramanian Ramamoorthy

机构 * School of Informatics, University of Edinburgh(信息学院,爱丁堡大学) Department of Mechanical and Mechatronics Engineering, University of Waterloo(机械与机电工程系,滑铁卢大学)

专题命中 三维重建 :point cloud(abstract);分类 cs.RO

AI总结 研究针对机器人装配中场景理解噪声影响插入成功率的问题,提出ContactFusion方法,结合全局映射与局部接触信息,通过拒绝采样程序估计接触位置,将接触与视觉信息融合到SPSMap,验证了方法有效性并改善孔位估计。

Comments Version accepted to IROS2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09076 2026-07-13 cs.CV 版本更新 57%

ProSGNeRF: Progressive Dynamic Neural Scene Graph with Frequency Modulated Foundation Model in Urban Scenes

ProSGNeRF:城市场景中基于频率调制基础模型的渐进式动态神经场景图

Tianchen Deng, Yanbo Wang, Yejia Liu, Chenpeng Su, Jingchuan Wang, Danwei Wang, Shao-Yuan Lo, Weidong Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) National Taiwan University(国立台湾大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 针对大规模城市场景中快速移动对象建模及相机自我运动处理难题,提出ProSGNeRF,通过渐进式场景图网络架构学习局部场景表示,利用基础模型网络编码潜码并引入频率调制模块,提升视图合成等能力。

Comments Accepted by IJCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08645 2026-07-13 cs.RO 版本更新 57%

Re$^3$Sim: Generating High-Fidelity Simulation Data via 3D-Photorealistic Real-to-Sim for Robotic Manipulation

Re$^3$Sim:通过用于机器人操作的3D逼真的真实到模拟生成高保真模拟数据

Xiaoshen Han, Junqiu Yu, Minghuan Liu, Yilun Chen, Xiaoyang Lyu, Yang Tian, Bolun Wang, Weinan Zhang, Jiangmiao Pang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.RO

AI总结 针对机器人真实数据收集难题,提出RE$^3$Sim系统,运用3D重建和神经渲染技术重现真实场景,利用特权信息收集专家演示并训练策略,验证管道有效性,仅用模拟数据实现零样本转移,还生成大规模数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21046 2026-07-08 cs.CV cs.AI 版本更新 57%

SpatialFly: Implicit 3D Prior-Guided Visual Reparameterization for Continuous UAV Vision-and-Language Navigation

SpatialFly:基于几何的表示对齐用于城市环境中无人机视觉与语言导航

Wen Jiang, Kangyao Huang, Li Wang, Wang Xu, Wei Fan, Jinyuan Liu, Shaoyu Liu, Hanfang Liang, Hongwei Duan, Bin Xu, Xiangyang Ji, Huaping Liu

机构 * School of Mechanical Engineering, Beijing Institute of Technology(北京理工大学机械工程学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Tsinghua University(清华大学) Department of Automation, Tsinghua University(清华大学自动化系) School of Artificial Intelligence, Xidian University(西安电子科技大学人工智能学院) Jianghan University(江汉大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出SpatialFly框架,通过几何引导的2D表示对齐机制,解决无人机在复杂3D环境中的视觉与语言导航问题,实验表明其在路径对齐和运动稳定性方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15275 2026-07-08 cs.CV cs.LG 版本更新 57%

RayRoPE: Projective Ray Positional Encoding for Multi-view Attention

RayRoPE: 多视角注意力的投影位置编码

Yu Wu, Minsik Jeon, Jen-Hao Rick Chang, Oncel Tuzel, Shubham Tulsiani

机构 * Carnegie Mellon University(卡内基梅隆大学) Apple(苹果公司)

专题命中 三维重建 :3DGS(abstract);分类 cs.CV

AI总结 本文提出RayRoPE,一种基于投影坐标的位置编码方法,用于多视角Transformer,实现SE(3)不变的注意力机制,并能适应3D场景几何。

Comments Project page: https://rayrope.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02716 2026-07-08 cs.CV 版本更新 57%

MorphGS: Morphology-Adaptive Articulated 3D Motion Transfer from Videos

MorphGS:基于形态的 articulated 3D 动作迁移从视频

Taeyeon Kim, Youngju Na, Jumin Lee, Sebin Lee, Minhyuk Sung, Sung-Eui Yoon

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出MorphGS框架,通过图像空间监督直接优化目标形态和姿态,解决视频到3D角色动作迁移中的形态差异和姿态模糊问题,实验显示优于基线方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21245 2026-07-08 cs.CV 版本更新 57%

FIELDS: Face reconstruction with accurate Inference of Expression using Learning with Direct Supervision

FIELDS:通过直接监督学习进行表情精确推断的面部重建

Chen Ling, Henglin Shi, Hedvig Kjellström

机构 * KTH Royal Institute of Technology(皇家理工学院) Linköping University(林奈大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 研究单目3D面部重建,提出FIELDS框架,通过直接监督学习在几何合理性约束下获取FLAME表情代码用于面部表情识别,采用混合2D/3D监督,提升情感预测且保持几何保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05207 2026-07-07 cs.CV 版本更新 57%

Syn4D: A Multiview Synthetic 4D Dataset

Syn4D:多视图合成4D数据集

Zeren Jiang, Yushi Lan, Yihang Luo, Yufan Deng, Zihang Lai, Edgar Sucar, Christian Rupprecht, Iro Laina, Diane Larlus, Chuanxia Zheng, Andrea Vedaldi

机构 * VGG University of Oxford(牛津大学) Nanyang Technological University(南洋理工大学) Naver Labs Europe(Naver欧洲实验室)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 针对动态场景稠密3D重建跟踪缺高质量标注数据集的问题,构建含多类真值标注的Syn4D数据集,支撑多下游任务,助力相关研究。

Comments 33 pages, 11 figures, project page: https://jzr99.github.io/Syn4D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28896 2026-07-03 cs.CV 版本更新 57%

Fisheye3R: Adapting Unified 3D Feed-Forward Foundation Models to Fisheye Lenses

Fisheye3R:将统一的3D前馈基础模型适应于鱼眼镜头

Ruxiao Duan, Erin Hong, Dongxu Zhao, Eric Turner, Alex Wong, Yunwen Zhou

机构 * Yale University(耶鲁大学) Google XR(谷歌XR)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出Fisheye3R框架,通过灵活学习方案在不退化性能的前提下,使多视角3D重建模型适应高径向畸变的鱼眼图像。

Comments European Conference on Computer Vision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01204 2026-07-03 cs.CV 版本更新 57%

TabletopGen: Tabletop Scene Generation and Interactive Simulation for Robotic Manipulation

TabletopGen: 桌面场景生成与机器人操作的交互式仿真

Ziqian Wang, Yonghao He, Licheng Yang, Wei Zou, Hongxuan Ma, Liu Liu, Wei Sui, Yuxin Guo, Hu Su

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(中国科学院多模态人工智能系统国家重点实验室) D-Robotics Horizon Robotics

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 提出TabletopGen,一种无需训练的全自动桌面场景生成与交互仿真引擎,通过实例提取、位姿对齐和物理仿真生成可交互场景,用于机器人操作数据合成。

Comments Project page: https://d-robotics-ai-lab.github.io/TabletopGen.project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23365 2026-07-02 cs.CV 版本更新 57%

SpatialMosaic: A Multiview VLM Dataset for Partial Visibility

SpatialMosaic:一个多视角VLM数据集用于部分可见性

Kanghee Lee, Jungi Hong, Sion Lee, Injae Lee, Minseok Kwak, Kwonyoung Ryu, Jaesik Park

机构 * Seoul National University(首尔大学) University College London(伦敦大学学院) Kyung Hee University(庆熙大学) POSTECH(浦项科技大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出SpatialMosaic数据集,通过多视角图像生成2M问答对,引入SpatialMosaic-Bench基准测试,结合3D重建模型的混合框架提升空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13859 2026-07-02 cs.CV 版本更新 57%

Geo-ID: Test-Time Geometric Consensus for Cross-View Consistent Intrinsics

Geo-ID: 测试时几何一致性用于跨视角一致本征分解

Alara Dirik, Stefanos Zafeiriou

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 提出Geo-ID框架,利用稀疏几何对应关系在测试时耦合单视角本征预测,实现跨视角一致分解,无需重训练或逆渲染。

Comments Accepted to ECCV 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08279 2026-07-02 cs.CV 版本更新 57%

OSCAR: Occupancy-based Shape Completion via Acoustic Neural Implicit Representations

OSCAR: 基于占用率的声学神经隐式表示形状补全

Magdalena Wysocki, Kadir Burak Buldu, Miruna-Alexandra Gafencu, Mohammad Farid Azampour, Nassir Navab

机构 * Chair for Computer Aided Medical Procedures (CAMP) Technical University of Munich(慕尼黑工业大学计算机辅助医疗程序教席(CAMP)) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML)) Konrad Zuse School of Excellence in Reliable AI (relAI)(康拉德·楚泽可靠人工智能卓越学校(relAI))

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 提出基于占用率的形状补全方法,利用声学神经隐式表示从部分超声观测中重建完整3D解剖结构,无需标签,在HD95指标上优于现有方法80%。

详情

展开后加载摘要…

URL PDF HTML 收藏