arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

共收录 4393 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 4393 篇

2608.03387 2026-08-06 cs.RO 版本更新 57%

RoboReact: Agentic Skill Distillation from Generated Egocentric Videos for Generalizable Whole-Body Manipulation

RoboReact:基于生成的自我中心视频的智能体技能蒸馏,实现通用全身操控

Shuliang He, Shuai Wang, Bo Yue, Junchi Teng, Changyu Wang, Guiliang Liu

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.RO

AI总结 本研究提出RoboReact框架,通过生成自我中心视频并结合视觉语言引导的闭环控制,实现人形机器人全身操控技能的通用获取,可在多样场景中稳健执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03851 2026-08-05 cs.CV 新提交 57%

LiteMVS: Efficient Multi-View Stereo with Foundation Distillation and Expert Aggregation

LiteMVS:结合基础模型蒸馏与专家聚合的高效多视图立体匹配

Tianbao Zhang, Zeyu Liu, Shuyu Wu, Fanxing Li, Zhaoxin Fan, Wenjun Wu, Danping Zou

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 LiteMVS是集成平面扫描几何推理与单目先验的轻量多视图深度模型,通过MoE和基础模型蒸馏提升重建质量与效率,在ScanNetv2等数据集上表现优异。

Comments CVPR 2026 Workshop accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03423 2026-08-05 cs.CV 新提交 57%

SGFormer: Structure-Guided Transformer for Robust Local Feature Matching

SGFormer:用于鲁棒局部特征匹配的结构引导Transformer

Runyu Zhu

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 针对局部特征匹配中Transformer注意力发散的问题,提出SGFormer结构引导Transformer,通过三重结构注意力模块增强显著结构区域的注意力,有效提升了匹配精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00238 2026-08-05 cs.GR cs.LG 版本更新 57%

Robust Biharmonic Skinning Using Geometric Fields

基于几何场的鲁棒双调和蒙皮技术

Ana Dodik, Vincent Sitzmann, Justin Solomon, Oded Stein

专题命中 三维重建 :point cloud(abstract);分类 cs.GR

AI总结 本文提出一种基于几何场的无网格鲁棒自动蒙皮技术,借助硬件光线追踪实现的拉格朗日表示优化双调和能量,可在开放曲面等现有方法失效的场景生成与最优方法相当的权重,经全面评估验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02598 2026-08-04 cs.CV 新提交 57%

VR3D: View-Robust 3D Representation Learning for Aerial-Ground Person Re-Identification

VR3D:面向空地行人重识别的视角鲁棒3D表示学习

Chao Ji, Shiyu Xuan, Zechao Li

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文针对空地行人重识别的视角偏差问题,提出VR3D框架,通过视角鲁棒3D表示交互与可靠性感知融合技术,在三个基准数据集上实现了优于现有方法的性能,CARGO数据集Rank-1提升5.63%。

Comments 12 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02016 2026-08-04 cs.CV 新提交 57%

Beyond Global Latents: Chunk-Based Sparse Grid VAE for Scalable 3D Modeling

超越全局隐变量:面向可扩展3D建模的基于块的稀疏网格变分自编码器

Kaiyi Zhang, Zhihao Liang, Haolin Liu, Qingxiang Lin, Zeqiang Lai, Yunfei Zhao, Bowen Zhang, Xianghui Yang, Zibo Zhao, Chunchao Guo, Long Quan

机构 * Hong Kong University of Science and Technology(香港科技大学) Tencent Hunyuan(腾讯混元) The Chinese University of Hong Kong(香港中文大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 该研究针对稀疏体素网格内存随分辨率快速增长的问题,提出基于块的ChunkVAE,通过局部算子和互补数据算子实现可扩展3D建模,在多基准测试中性能优于或相当基线,且内存与推理效率更优。

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01950 2026-08-04 cs.RO 新提交 57%

FRA-NBV: A Fast and Reflectivity-Aware Next-Best-View Strategy

FRA-NBV:一种快速且感知反射特性的最优下一个视点策略

G. F. Preziosa, E. Setti, M. Faroni, A. M. Zanchettin, P. Rocco

机构 * Politecnico di Milano(米兰理工大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.RO

AI总结 FRA-NBV策略针对反射表面导致的深度损失问题,通过识别反射区域并调整传感器位姿,提升工业场景下自主三维重建的覆盖率。

Comments 8 pages, 5 figures

Journal ref IEEE Robotics and Automation Letter, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00074 2026-08-04 cs.CV 新提交 57%

Explainable Multimodal AI for Adaptive Calibration of Archaeological Sensing Workflows

面向考古传感工作流自适应校准的可解释多模态人工智能

Nevio Dubbini, Daniel P. van Helden, Claudia Sciuto, Martina Naso, Arthur Leck, Clement Joubert, Heeli C. Schechter, Remy Chapoulie, Gabriele Gattiglia

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出一种可解释多模态AI框架,用于考古传感工作流的自适应校准、质量评估与采集支持,经多模态考古数据集验证可实现跨模态稳健质量评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28261 2026-08-04 cs.CV 版本更新 57%

TARS: Timestep-Aware Data Scaling for 3D-Free Video Re-Shooting

TARS:用于无3D视频重拍摄的时间步感知数据缩放

Jiwen Liu, Shujuan Li, Xiaohan Li, Zijie Meng, Xinyue Liu, Yulong Xu, Yan Zhou, Guoxin Zhang

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 该研究提出无3D的视频重拍摄范式TARS,通过自监督学习结合数据缩放与文本-相机联合条件设置,实现稳健的相机与视角控制,在大运动下合成未见区域的表现优于现有方法。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24024 2026-08-04 cs.CV 版本更新 57%

GeoStereo: A Unified Stereo Geometry Estimation Framework for Disparity and Surface Normal

用于视差和表面法线的统一立体几何估计框架

Qizhe Wei, Xianda Guo, Shaocong Xu, Hong Li, Runyi Yang, Hao Zhao

机构 * Beijing Institute of Technology(北京理工大学) School of Computer Science, Wuhan University(武汉大学计算机科学学院) Beihang University(北京航空航天大学) INSAIT, Sofia University(索非亚大学INSAIT) BAAI AIR, Tsinghua University(清华大学BAAI AIR)

专题命中 三维重建 :3D vision(abstract);分类 cs.CV

AI总结 本文针对立体匹配和表面法线估计问题,提出统一框架GeoStereo,结合前馈立体匹配与基于扩散的法线估计分支,引入初始化策略与扭曲条件,实现有效交互,在多场景表现可靠,零样本设置下视差和法线估计精度高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29627 2026-08-03 cs.CV 新提交 57%

FlexComposer: Unified Video Compositing from Images to Dynamic Footage with Flexible Trajectory Control

FlexComposer:支持灵活轨迹控制的从图像到动态素材的统一视频合成框架

Songchun Zhang, Sitong Guo, Xianghao Kong, Pengwei Liu, Yuwei Guo, Lvmin Zhang, Anyi Rao

机构 * HKUST(香港科技大学) ZJU(浙江大学) CUHK(香港中文大学) Stanford University(斯坦福大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 FlexComposer是支持灵活轨迹控制的统一视频合成框架,通过三项关键设计实现静态图像与动态素材的无缝整合,在视觉质量等指标上优于现有SOTA方法。

Comments 30 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28995 2026-08-03 cs.RO 新提交 57%

Receding-Horizon Next-Best-View Planner for Autonomous Leaf Surface Reconstruction

面向自主叶片表面重建的滚动时域次最佳视点规划器

Arif Ahmed, Sajal K. Das, Parikshit Maini

机构 * University of Nevada, Reno(内华达大学雷诺分校) Missouri University of Science and Technology(密苏里科技大学)

专题命中 三维重建 :point cloud(abstract);分类 cs.RO

AI总结 本研究针对自主叶片表面重建的规划预算与计算资源限制,提出滚动时域次最佳视点规划器,通过基于质心的信息增益函数优化视点效用,在草莓数据集上使重建精度较基线最高提升10%。

Comments Accepted at IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11257 2026-08-03 cs.CV 版本更新 57%

Towards Automated Initial Probe Placement in Transthoracic Teleultrasound Using Human Mesh and Skeleton Recovery

面向经胸远程超声的自动初始探头放置方法

Yu Chung Lee, David G. Black, Ryan S. Yeung, Septimiu E. Salcudean

专题命中 三维重建 :point cloud(abstract);分类 cs.CV

AI总结 本文提出了一种基于RGB图像的远程超声自动初始探头放置方法,通过混合现实设备捕捉患者并重建体表模型,从而实现精确的探头位置指导。

Comments 10 pages, 5 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28442 2026-07-31 cs.CV 新提交 57%

ViewMind3D: Modular View-Aware Inference for Training-Free 3D-QA

ViewMind3D:用于无需训练的3D问答的模块化视图感知推理

Ping-Kun Chiang, Kun-Ru Wu, Po-han Li, Sandeep Chinchali, Ufuk Topcu, Yu-Chee Tseng

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 该研究提出无需训练的模块化框架ViewMind3D,将3D-QA分解为四个组件,在ScanQA和SQA3D上实现竞争力性能,证明通用LLMs与VLMs的模块化编排可实现有效3D推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28416 2026-07-31 cs.RO 新提交 57%

FasTac: A Curved Multispectral Vision-Based Tactile Sensor for High-Speed High-Precision 3D Shape and Force Perception

FasTac:一种用于高速高精度3D形状与力感知的曲面多光谱视觉触觉传感器

Xiaofan Lu, Kaiji Huang, Jiahui Chen, Yuankai Lin, Hua Yang, Zhouping Yin

机构 * State Key Laboratory of Intelligent Manufacturing Equipment and Technology, School of Mechanical Science and Engineering, Huazhong University of Science and Technology(华中科技大学机械科学与工程学院智能制造装备与技术国家重点实验室) National Innovation Institute of Digital Design and Manufacturing(国家数字化设计与制造创新中心)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.RO

AI总结 FasTac是一款集成多光谱光度立体、动态卷积力估计及FPGA加速的曲面多光谱视觉触觉传感器,可实现高精度3D形状与力感知,兼具高速处理能力,经实验验证其性能优于现有方案。

Comments 13 pages, 11 figures, including 2 pages of supplementary material. Submitted to IEEE/ASME Transactions on Mechatronics

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18801 2026-07-31 cs.CV 版本更新 57%

PartDiffuser: Part-wise 3D Mesh Generation via Discrete Diffusion

PartDiffuser:通过离散扩散实现部件级3D网格生成

Yichen Yang, Hong Li, Haodong Zhu, Linin Yang, Guojun Lei, Sheng Xu, Baochang Zhang

机构 * Beihang University(北航) Communication University of China(中国通信大学) Zhejiang University(浙江大学)

专题命中 三维重建 :point cloud(abstract);分类 cs.CV

AI总结 PartDiffuser提出一种半自回归扩散框架,通过部件级方法生成高保真3D网格,有效平衡全局结构与局部细节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27139 2026-07-30 cs.CV 新提交 57%

SeasonStereo: Robust Dense Stereo Matching for Multi-Date Satellite Imagery via Generative AI

SeasonStereo:基于生成式AI的多日期卫星图像鲁棒密集立体匹配

Álvaro Díaz-Laureano, Roger Marí, Elías Masquil, Pablo Arias, Gabriele Facciolo

机构 * Eurecat(欧罗卡特技术中心) IIE, Facultad de Ingeniería, Universidad de la República(乌拉圭共和国大学工程学院IIE) Universitat Pompeu Fabra(庞培法布拉大学) Université Paris-Saclay(巴黎萨克雷大学) CNRS(法国国家科学研究中心) ENS Paris-Saclay(巴黎萨克雷高等师范学校) Institut Universitaire de France(法国大学研究院)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 SeasonStereo框架利用带可控季节外观变化的合成图像对训练并结合基础模型零样本几何先验,实现低成本、高精度的多日期卫星图像密集立体匹配,支持大规模三维重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26646 2026-07-30 cs.CV 新提交 57%

Genie Sim PanoWorld: An Infinite Indoor 3D World Generation Pipeline via Panoramic Scene Modeling and Simulation

Genie Sim PanoWorld:基于全景场景建模与仿真的无限室内3D世界生成流水线

Yongxin Su, Linjie Hou, Feng Wang, Jialin Tang, Zhijun Li, Qian Wang, Maoqing Yao

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 Genie Sim PanoWorld是两阶段前馈流水线,从单张360°全景生成可自由导航的高保真3D高斯场景,优于几何条件基线,且能零样本泛化至未见室内场景

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27084 2026-07-30 cs.CV 版本更新 57%

SceneExpander: Text-Guided 3D Scene Expansion via Free-Form View Insertion

SceneExpander:通过自由形式插入视图扩展3D场景

Zijian He, Renjie Liu, Yihao Wang, Weizhi Zhong, Huan Yuan, Kun Gai, Guangrun Wang, Guanbin Li

机构 * Sun Yat-sen University(中山大学) KlingAI Research, Kuaishou Technology(快手科技 KlingAI 研究)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出SceneExpander,通过在用户控制下插入合成视图扩展3D场景,解决几何偏移和一致性问题,提升重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18634 2026-07-29 cs.CV cs.LG 版本更新 57%

SwiftGS: Episodic Priors for Immediate Satellite Surface Recovery

SwiftGS: 基于事件的先验知识用于即时卫星表面恢复

Rong Fu, Jiekai Wu, Xiaowen Ma, Shiyin Lin, Kangan Qian, Chuang Liu, Simon James Fong

机构 * University of Macau(澳门大学) Juntendo University(顺天堂大学) Tongji University(同济大学) Zhejiang University(浙江大学) University of Florida(佛罗里达大学) Tsinghua University(清华大学) Wuhan University(武汉大学) Juniata College(朱尼亚塔学院)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 SwiftGS通过元学习方法实现单次前向传递的3D重建,结合几何-辐射解耦的高斯基元和轻量SDF,降低单场景优化成本,实现高效准确的数字表面模型重建和视图一致渲染。

Comments 23 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24591 2026-07-28 cs.CV 新提交 57%

CameraAnything: Refilming Videos with Arbitrary Camera Control

CameraAnything:使用任意相机控制重新拍摄视频

Yixuan Li, Yanhong Zeng, Ka Leong Cheng, Jiayi Zhu, Hanlin Wang, Wen Wang, Yihao Meng, Hao Ouyang, Qiuyu Wang, Yue Yu, ZiDong Wang, Yiyuan Zhang, Yujun Shen, Dahua Lin

机构 * The Chinese University of Hong Kong(香港中文大学) Ant Group(蚂蚁集团) Tsinghua University(清华大学) Zhejiang University(浙江大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 CameraAnything是用于相机控制视频编辑的统一框架,采用逐像素普吕克光线注入等方法联合控制相机参数,开发合成管道克服数据稀缺,能在单过程中实现多种视频编辑操作,为视频制作提供实用价值。

Comments Project page: https://yixuanli98.github.io/cameraanything/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23758 2026-07-28 cs.CV 新提交 57%

RoadVGGT: Road-Structure-Aware Feed-Forward Road Surface Reconstruction

RoadVGGT:基于道路结构感知的前馈式路面重建

Han Jiao, Chen Liu, Jiakai Sun, Zhanjie Zhang, Mengyuan Yang, Yimeng Li, Mofan Zhou, Kun Zhan, Lei Zhao

专题命中 三维重建 :novel view synthesis(abstract);分类 cs.CV

AI总结 针对现有道路重建方法需逐场景训练及场景依赖覆盖设计的局限,提出RoadVGGT框架,利用几何基础模型结合多视图图像等,经高斯头预测、坐标对齐及融合等重建紧凑高斯路面,提升多方面性能,证明几何基础模型在路面重建中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22773 2026-07-28 eess.IV cs.CV physics.med-ph 新提交 57%

Metric Surface Reconstruction of Neurosurgical Scenes from Monocular Operating Microscope Images and Microscope Pose

从单目手术显微镜图像和显微镜位姿重建神经外科场景的度量曲面

Thomas Bucher, Didier Neuenschwander, Thomas Petutschnigg, Michael Murek, David Bervini, Andreas Raabe, Manuela Eugster

专题命中 三维重建 :point cloud(abstract);分类 cs.CV

AI总结 研究能否从单目手术显微镜图像和位姿数据重建神经外科场景的三维几何度量,利用预训练模型估计深度、泊松曲面重建点云成网格,结果显示该方法在模型设置中有技术可行性,支持相关手术技术进一步发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00713 2026-07-27 cs.CV 版本更新 57%

RAD: A Dataset and Benchmark for Real-Life Anomaly Detection with Robotic Observations

RAD:面向机器人观测的真实异常检测数据集与基准

Kaichen Zhou, Xinhai Chang, Taewhan Kim, Jiadong Zhang, Yang Cao, Chufei Peng, Fangneng Zhan, Hao Zhao, Hao Dong, Kai Ming Ting, Ye Zhu

机构 * Massachusetts Institute of Technology(麻省理工学院) Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) Great Bay University(大湾大学) Harvard University(哈佛大学) Tsinghua University(清华大学) Nanjing University(南京大学) Deakin University(德克萨斯大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 提出RAD数据集,包含13类日常物体和4种缺陷,从60多个机器人视角在非受控光照下采集,用于评估2D特征、3D重建和视觉语言模型在姿态无关的异常检测中的表现,发现2D方法优于3D和VLM方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13826 2026-07-27 eess.IV cs.CV 版本更新 57%

Latent Interpolation Learning Using Diffusion Models for Cardiac Volume Reconstruction

使用扩散模型进行心脏容积重建的潜在插值学习

Niklas Bubeck, Suprosanna Shit, Chen Chen, Can Zhao, Pengfei Guo, Dong Yang, Georg Zitzlsberger, Daguang Xu, Bernhard Kainz, Daniel Rueckert, Jiazhen Pan

机构 * School of Computation, Information and Technology, Technical University Munich(技术大学慕尼黑计算信息学院) Munich Center for Machine Learning(慕尼黑机器学习中心) Department of Quantitative Biomedicine, University of Zurich(苏黎世大学定量生物医学系) Institute of Biomedical Engineering, Department of Engineering Science, University of Oxford(牛津大学生物医学工程研究所) Imperial College London(伦敦帝国学院) University of Sheffield(谢菲尔德大学) NVIDIA(英伟达) Department of Computing, Imperial College London(伦敦帝国学院计算机系) Department AIBE of Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔兰根-纽伦堡大学AIBE系) School of Medicine, Klinikum Rechts der Isar, Technical University of Munich(慕尼黑技术大学医学院,莱纳特医院)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 针对心脏磁共振成像二维切片采集稀疏致容积信息不完整、现有重建方法有局限的问题,提出CaLID框架,创新采用基于扩散模型的插值方案、潜在空间高效计算法,仅用稀疏二维图像输入达SOTA,扩展到二维加时间数据,提升了重建质量和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21438 2026-07-24 cs.CV 新提交 57%

DAPM: UAV Monocular Depth Estimation from Any Height, Pitch, Roll and FOV

DAPM:从任意高度、俯仰、横滚和视场角进行无人机单目深度估计

Tong Ling, Wenhui Diao, Yingchao Feng, Hanbo Bi, Zhongyan Hou, Xian Sun

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) University of Chinese Academy of Sciences(中国科学院大学) Key Laboratory of Target Cognition and Application Technology (TCAT), Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院目标认知与应用技术重点实验室)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 研究针对无人机单目深度估计在多样视角和大尺度深度分布下的难题,提出DAPM模型,通过建立视角定量表示,引入IGD和PQB模块,在UAPD数据集上实验,该模型在深度和相机姿态估计方面达最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05182 2026-07-24 cs.CV cs.AI 版本更新 57%

LSRM: High-Fidelity Object-Centric Reconstruction via Scaled Context Windows

LSRM:通过扩展上下文窗口实现高保真对象中心重建

Zhengqin Li, Cheng Zhang, Jakob Engel, Zhao Dong

机构 * Meta Reality Labs Research(Meta现实实验室)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 LSRM通过扩展上下文窗口提升3D重建精度,采用高效粗到细流程和3D感知空间路由机制,实现高质量纹理和外观恢复,优于现有最先进方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19986 2026-07-23 cs.CV 新提交 57%

STEREOFLOW: Progressive Stereo Matching with StereoDiT and Transition Flow Matching

STEREOFLOW:基于StereoDiT和过渡流匹配的渐进式立体匹配

Hao Wang, Haoran Geng, Xiaotong Yang, Jing Tang, Songlin Wei, Linlong Lang, Yeying Jin, Zheng Zhu, Zhaoxin Fan, Biao Leng

机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) University of California, Berkeley(加州大学伯克利分校) University of Southern California(南加州大学) Google(谷歌公司) State Key Laboratory of Intelligent Manufacturing Equipment and Technology, Huazhong University of Science and Technology(华中科技大学智能制造装备与技术国家重点实验室) Tencent(腾讯公司) GigaAI(未知(可能是公司或组织,由于未找到确切对应中文名,按原文保留))

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 研究针对立体匹配问题,提出先验引导的生成框架StereoFlow,通过两阶段渐进级联匹配网络、像素扩散变压器StereoDiT和过渡流匹配实现高效优化,在多基准测试中取得多个最新结果,提升了立体匹配效果。

Comments 10 pages, 6 figures, submitted to TVCG

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19517 2026-07-23 cs.CV 新提交 57%

Crowd4D: Scene-Aware Monocular 4D Crowd Reconstruction

Crowd4D:场景感知单目4D人群重建

Hongbo Kang, Tianyi Zhou, Qingyang Yang, Hongwei Wen, Jing Huang, Yu-Kun Lai, Kun Li

专题命中 三维重建 :point cloud(abstract);分类 cs.CV

AI总结 针对单目视频恢复大规模场景下4D人群运动的难题,提出Crowd4D框架,通过多阶段优化联合优化人群与场景,引入HSIP解决对齐问题、CSCR提升时间稳定性,实验证明其性能优于现有方法,可实现复杂场景下单目4D人群稳健重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19228 2026-07-22 cs.CV 新提交 57%

IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer

IGGT4D:流式4D实例关联几何变换器

Zhengyu Zou, Hao Li, Kuixuan Jiao, Liu Liu, Tingyang Xiao, Xiaolin Zhou, Fangzhou Hong, Zhizhong Su, Dingwen Zhang, Ziwei Liu

机构 * Horizon Robotics(地平线机器人公司) S-Lab, Nanyang Technological University(南洋理工大学S-Lab) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 针对现实世界空间智能中视频流场景理解问题,提出IGGT4D流式实例关联几何变换器,通过因果时空建模更新统一表示,还构建数据集。实验证明其在长动态序列在线推理上优于现有基线。

Comments Project Page: https://iggt4d.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏