arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-08-14 至 2026-08-14 共收录 8 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 3 篇

2607.03612 2026-08-14 cs.CV cs.LG 版本更新 79%

SAF3R: Dynamic Sparse Attention for Feed-Forward 3D Reconstruction Transformers

SAF3R:用于前馈3D重建Transformer的动态稀疏注意力

Jianing Deng, Yuanzhe Li, Jialu Wang, Song Wang, Tianlong Chen, Huanrui Yang, Jingtong Hu

机构 * University of Pittsburgh(匹兹堡大学) University of Arizona(亚利桑那大学) Tongji University(同济大学) University of Central Florida(中佛罗里达大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 三维重建 :3D reconstruction(title,abstract);分类 cs.CV

AI总结 研究前馈3D重建Transformer,分析其全局注意力模式,提出SAF3R框架,集成稀疏注意力机制、离线头部分析和在线适应策略,在保持质量同时提高稀疏率加速端到端速度。

Comments ECCV 2026. Updated related work

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02075 2026-08-14 cs.CV 版本更新 57%

HandsOnWorld: Unconstrained Egocentric Video Generation with Camera-Disentangled Hand Control

HandsOnWorld: 无约束的自我中心视频生成,具有相机解耦的手部控制

Yushuo Chen, Xiaoyu Shi, Xiaoshi Wu, Xintao Wang, Pengfei Wan, Yebin Liu

机构 * Tsinghua University(清华大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Chinese University of Hong Kong(香港中文大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 提出HandsOnWorld框架,通过单目重建从无约束视频中学习手部控制,利用Plücker手部映射解耦相机与手部运动,生成高保真自我中心视频。

Comments Project Page: https://shad0wta9.github.io/handsonworld-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11729 2026-08-14 cs.CV cs.LG 版本更新 57%

SpaRRTa: A Synthetic Benchmark for Evaluating Spatial Intelligence in Visual Foundation Models

SpaRRTa:用于评估视觉基础模型空间智能的合成基准

Turhan Can Kargin, Wojciech Jasiński, Adam Pardyl, Bartosz Zieliński, Marcin Przewięźlikowski

机构 * AGH University of Krakow(克拉科夫AGH大学) IDEAS NCBR

专题命中 三维重建 :spatial understanding(abstract);分类 cs.CV

AI总结 SpaRRTa通过评估视觉基础模型的空间推理能力,揭示其在不同空间任务中的表现差异,旨在推动更高效的空间意识视觉模型发展。

Comments Project page is available at https://sparrta.gmum.net/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 点云 3 篇

2512.17897 2026-08-14 cs.CV cs.AI cs.LG cs.RO 版本更新 81%

RadarGen: Automotive Radar Point Cloud Generation from Cameras

RadarGen:从摄像头生成汽车雷达点云

Tomer Borreda, Fangqiang Ding, Sanja Fidler, Shengyu Huang, Or Litany

机构 * Technion(技术学院) MIT(麻省理工学院) NVIDIA(英伟达) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV、cs.RO

AI总结 RadarGen通过扩散模型从摄像头图像生成逼真的雷达点云,结合BEV对齐的深度、语义和运动线索,提升雷达生成的物理合理性与多模态模拟能力。

Comments ECCV 2026. Project page: https://radargen.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15577 2026-08-14 cs.CV 版本更新 74%

Shortest-Path Decomposition for Foliage-Robust 3D Tree Modeling and Above-Ground Biomass Estimation from Point Clouds

适用于点云的抗 foliage 三维树木建模与地上生物量估算的最短路径分解方法

Di Wang, Shi Li

机构 * School of Software Engineering, Xi'an Jiaotong University, Xi'an 710049, China(软件工程学院,西安交通大学,西安710049,中国) Shaanxi Joint (Key) Laboratory for Artificial Intelligence (Xi’an Jiaotong University), Xi'an 710049, China(陕西省人工智能联合(重点)实验室(西安交通大学),西安710049,中国)

专题命中 点云 :point cloud(title);分类 cs.CV

AI总结 该研究提出拓扑驱动的 foliage 抑制最短路径分解方法,从单一点云恢复树木分支层次,在有叶条件下的AGB估算精度优于传统QSM方法,为相关森林清查业务应用消除了障碍。

Comments 14 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10383 2026-08-14 cs.RO 版本更新 57%

Real-World Cooperative Bimanual Dexterous Grasp of Large Objects from Single-View Observations

基于单视图观测的真实场景中大型物体的双臂协同灵巧抓取

Ziming Li, Mingxuan Wu, Jiaqi Zhang, Hongfei Li, Yan Gan, Deqiang Ouyang, Ning Wang

机构 * The University of Auckland(奥克兰大学) Chongqing University(重庆大学) Southwest University(西南大学)

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 本文针对机器人双臂抓取大型物体的挑战,提出含多模态数据集、DDPM模块及执行策略的真实场景双臂抓取框架,实验表明其对未见物体抓取成功率高。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 3D生成 1 篇

2608.02711 2026-08-14 cs.CV 版本更新 83%

Hunyuan3D-Buffalo 1.0: A Unified Multimodal Model for Scalable 3D Generation, Understanding, and Editing

Hunyuan3D-Buffalo 1.0:用于可扩展3D生成、理解与编辑的统一多模态模型

Junliang Ye, Kenkun Liu, Guocun Wang, Yang Li, Yansong Qu, Chunshi Wang, Jingwei Xu, Yunhan Yang, Zibo Zhao, Jiachen Xu, Jiaao Yu, Lifu Wang, Zhihao Liang, Xin Huang, Zhuo Chen, Chunchao Guo

机构 * Tencent Hunyuan(腾讯混元)

专题命中 3D生成 :3D generation(title,abstract);spatial understanding(abstract);分类 cs.CV

AI总结 Hunyuan3D-Buffalo 1.0是支持3D理解、文本到3D生成等功能的统一多模态模型,构建87M规模语料库训练,在相关基准上达SOTA或领先性能,验证了统一训练的有效性。

Comments Project Page: https://tencent-hunyuan.github.io/Hunyuan3D-Buffalo1.0

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 空间理解 1 篇

2508.08199 2026-08-14 cs.CV 版本更新 57%

Generalizable Operating Room Expert with Multimodal Enhancement

具备多模态增强能力的可泛化手术室专家

Peiqi He, Zhenhao Zhang, Yixiang Zhang, Jiaxin Liu, Xiongjun Zhao, Shaoliang Peng

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 针对手术室空间建模的局限,提出仅用RGB图像推理的多模态大语言模型OR-Expert,通过内部推导空间线索实现三维推理,在手术室基准上达SOTA且泛化性良好。

Comments Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏