arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-08-14 至 2026-08-14 共收录 23 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 6 篇

2607.03612 2026-08-14 cs.CV cs.LG 版本更新 79%

SAF3R: Dynamic Sparse Attention for Feed-Forward 3D Reconstruction Transformers

SAF3R:用于前馈3D重建Transformer的动态稀疏注意力

Jianing Deng, Yuanzhe Li, Jialu Wang, Song Wang, Tianlong Chen, Huanrui Yang, Jingtong Hu

机构 * University of Pittsburgh(匹兹堡大学) University of Arizona(亚利桑那大学) Tongji University(同济大学) University of Central Florida(中佛罗里达大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 三维重建 :3D reconstruction(title,abstract);分类 cs.CV

AI总结 研究前馈3D重建Transformer,分析其全局注意力模式,提出SAF3R框架,集成稀疏注意力机制、离线头部分析和在线适应策略,在保持质量同时提高稀疏率加速端到端速度。

Comments ECCV 2026. Updated related work

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13541 2026-08-14 cs.CV cs.GR 新提交 62%

SCULPT: Subtractive Composition for 3D Part Generation

SCULPT:用于3D部件生成的减法组合方法

Sikuang Li, Chen Yang, Jiemin Fang, Jiazhong Cen, Yuhe Wei, Jichen Pang, Wei Shen, Qi Tian

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei(华为)

专题命中 三维重建 :3D generation(abstract);分类 cs.CV、cs.GR

AI总结 SCULPT是一种3D部件生成框架,通过减法组合方式生成部件,解决了现有方法的边界问题,在PartObjaverse上实现了最优几何性能,还能完成细粒度纹理部件分解。

Comments Project page: https://sculpt-part.github.io/ Code: https://github.com/sculpt-part/SCULPT

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02075 2026-08-14 cs.CV 版本更新 57%

HandsOnWorld: Unconstrained Egocentric Video Generation with Camera-Disentangled Hand Control

HandsOnWorld: 无约束的自我中心视频生成,具有相机解耦的手部控制

Yushuo Chen, Xiaoyu Shi, Xiaoshi Wu, Xintao Wang, Pengfei Wan, Yebin Liu

机构 * Tsinghua University(清华大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Chinese University of Hong Kong(香港中文大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 提出HandsOnWorld框架,通过单目重建从无约束视频中学习手部控制,利用Plücker手部映射解耦相机与手部运动,生成高保真自我中心视频。

Comments Project Page: https://shad0wta9.github.io/handsonworld-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11729 2026-08-14 cs.CV cs.LG 版本更新 57%

SpaRRTa: A Synthetic Benchmark for Evaluating Spatial Intelligence in Visual Foundation Models

SpaRRTa:用于评估视觉基础模型空间智能的合成基准

Turhan Can Kargin, Wojciech Jasiński, Adam Pardyl, Bartosz Zieliński, Marcin Przewięźlikowski

机构 * AGH University of Krakow(克拉科夫AGH大学) IDEAS NCBR

专题命中 三维重建 :spatial understanding(abstract);分类 cs.CV

AI总结 SpaRRTa通过评估视觉基础模型的空间推理能力,揭示其在不同空间任务中的表现差异,旨在推动更高效的空间意识视觉模型发展。

Comments Project page is available at https://sparrta.gmum.net/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12881 2026-08-14 astro-ph.SR 新提交 50%

Elemental Composition Evolution during the 2024 September 30 Solar Eruption: A Comparison of Hot and Cool Plasma Components with Solar Orbiter/SPICE, Hinode/EIS, and Chandrayaan-2/XSM

2024年9月30日太阳爆发期间的元素组成演化:利用Solar Orbiter/SPICE、Hinode/EIS和Chandrayaan-2/XSM对高温与低温等离子体成分的比较

Momchil Molnar, Joseph Plowman, Amir Caspi, Ritesh Patel, Arpit Shrivastav, Tania Varesano, Don Hassler, Ryan French, Biswajit Mondal, L. P. Chitta

专题命中 三维重建 :3D reconstruction(abstract)

AI总结 该研究利用Solar Orbiter、Hinode、Chandrayaan-2的相关仪器,观测2024年9月30日M7.6级太阳耀斑,发现高低温等离子体成分丰度演化模式不同,揭示了FIP偏差变化与日冕重联外流和色球层等离子体混合相关的机制。

Comments Accepted in the Astrophysical Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18269 2026-08-14 cond-mat.mtrl-sci physics.ins-det 50%

Table-top three-dimensional photoemission orbital tomography with a femtosecond extreme ultraviolet light source

Wiebke Bennecke, Thi Lan Dinh, Jan Philipp Bange, David Schmitt, Marco Merboldt, Lennart Weinhagen, Bent van Wingerden, Fabio Frassetto, Luca Poletto, Marcel Reutzel, Daniel Steil, D. Russell Luke, Stefan Mathias, G. S. Matthijs Jansen

专题命中 三维重建 :3D reconstruction(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Gaussian Splatting 6 篇

2608.12825 2026-08-14 cs.CV 新提交 89%

LocusGS: Spatially Grounded Tokens for Feed-Forward 3D Gaussian Splatting

LocusGS:用于前馈三维高斯溅射的空间锚定令牌

Wenyu Li, Sidun Liu, Tongrui Hu, Peng Qiao, Yong Dou

机构 * National University of Defence Technology(国防科技大学)

专题命中 Gaussian Splatting :3DGS(summary_cn,abstract);Gaussian Splatting(title);novel view synthesis(abstract);分类 cs.CV

AI总结 LocusGS为前馈3DGS的高斯查询添加三维锚定状态,提升查询空间连贯性,在相同高斯预算下改善新视图合成的渲染质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09045 2026-08-14 cs.CV 89%

Scene-Agnostic Object-Centric Representation Learning for 3D Gaussian Splatting

面向3D高斯散射的场景无关物体感知表示学习

Tsuheng Hsu, Guiyu Liu, Juho Kannala, Janne Heikkilä

机构 * Aalto University(阿尔托大学) University of Oulu(奥卢大学)

专题命中 Gaussian Splatting :3DGS(summary_cn,abstract);Gaussian Splatting(title,abstract);分类 cs.CV

AI总结 本文提出一种场景无关的物体感知监督方案,通过预训练的slot attention基Global Object Centric Learning模块,学习一致的物体代码本,提升3DGS的表示结构和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13502 2026-08-14 cs.CV 新提交 85%

GS$^{2}$CI: Robust Gaussian Splatting For Snapshot Compressive Imaging via Large Vision Model Priors

GS²CI:基于大视觉模型先验的快照压缩成像鲁棒高斯溅射方法

Yanming Yang, Chenxi Song, Ping Wang, Xin Yuan, Chi Zhang

机构 * Westlake University(西湖大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);分类 cs.CV

AI总结 该研究针对快照压缩成像的三维重建难题,提出结合三维高斯溅射与大视觉模型先验的框架,引入专属致密化策略提升稳定性,在多基准实验中实现了最优整体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13159 2026-08-14 cs.CV cs.GR 新提交 82%

Splat-based Metal Artifact Reduction in Cone-Beam CT via Polychromatic Modeling

基于多色建模的锥束CT中基于Splat的金属伪影减少方法

Kiseok Choi, Inchul Kim, Jaemin Cho, Hyeongjun Cho, Min H. Kim

机构 * KAIST(韩国科学技术院)

专题命中 Gaussian Splatting :Gaussian Splatting(summary_cn,abstract);分类 cs.CV、cs.GR

AI总结 提出一种集成多色X射线投影模型等的Gaussian Splatting框架,无需手动金属掩码,联合优化参数与光谱,发布相关数据集,在CBCT金属伪影减少上性能优于现有最优方法。

Journal ref Computer Graphics forum, Volume 45 (2026), Number 2

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13143 2026-08-14 cs.ET 新提交 78%

ProbSplat: Efficient Probabilistic Hardware for Gaussian Splatting in 3D Scene Reconstruction

ProbSplat:面向三维场景重建中高斯溅射的高效概率硬件

Siddarth Gottumukkula, M P Samartha, Vedant Pahariya, Priyanshi Jain, Amit Ranjan Trivedi, Priyesh Shukla

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract)

AI总结 本文提出一种存算一体启发的概率硬件ProbSplat,可独立控制高斯混合分量的均值与方差,在三维场景重建中实现低复杂度、低功耗的高斯溅射计算,获21.99dB PSNR的重建保真度,适用于边缘端AR/VR与机器人场景。

Comments Accepted for publication in the 2026 IEEE Computer Society Annual Symposium on VLSI (ISVLSI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12860 2026-08-14 cs.RO 新提交 70%

HumanoidVLN: A Physics-Grounded Simulator and Benchmark for Vision-Language Navigation Across Diverse Humanoid Embodiments

HumanoidVLN:面向多种人形机器人形态的基于物理的视觉语言导航模拟器与基准

Quan-Dung Pham, Anh Dao, The-Anh Nguyen, Minh Nguyen-Dinh, Phuong Nam Dang, Tri Pham, Hung Tran, Bach Dao, Tuyen P. Le, Truong Nguyen, Quan Nguyen

机构 * VinMotion, Inc.(VinMotion公司) University of Southern California(南加州大学)

专题命中 Gaussian Splatting :Gaussian Splatting(abstract,abstract_cn);分类 cs.RO

AI总结 本研究针对人形机器人VLN的物理约束与形态差异问题,提出基于NVIDIA Isaac Sim的HumanoidVLN模拟器与基准,验证其与多种模型、机器人的兼容性,实验揭示了VLN模型、控制器与人形形态的交互关系。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 点云 6 篇

2512.17897 2026-08-14 cs.CV cs.AI cs.LG cs.RO 版本更新 81%

RadarGen: Automotive Radar Point Cloud Generation from Cameras

RadarGen:从摄像头生成汽车雷达点云

Tomer Borreda, Fangqiang Ding, Sanja Fidler, Shengyu Huang, Or Litany

机构 * Technion(技术学院) MIT(麻省理工学院) NVIDIA(英伟达) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV、cs.RO

AI总结 RadarGen通过扩散模型从摄像头图像生成逼真的雷达点云,结合BEV对齐的深度、语义和运动线索,提升雷达生成的物理合理性与多模态模拟能力。

Comments ECCV 2026. Project page: https://radargen.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12620 2026-08-14 math.AT 新提交 78%

Distance Matrices of Ordered Point Clouds and Their Persistent Homology

有序点云的距离矩阵及其持续同调

David Hien

专题命中 点云 :point cloud(title,abstract)

AI总结 该研究建立了时间序列的距离矩阵滤过与其状态空间嵌入的Čech/Vietoris–Rips滤过的一次链映射关系,简化了时间序列分析的循环特征计算,可用于分析循环运动的转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15577 2026-08-14 cs.CV 版本更新 74%

Shortest-Path Decomposition for Foliage-Robust 3D Tree Modeling and Above-Ground Biomass Estimation from Point Clouds

适用于点云的抗 foliage 三维树木建模与地上生物量估算的最短路径分解方法

Di Wang, Shi Li

机构 * School of Software Engineering, Xi'an Jiaotong University, Xi'an 710049, China(软件工程学院,西安交通大学,西安710049,中国) Shaanxi Joint (Key) Laboratory for Artificial Intelligence (Xi’an Jiaotong University), Xi'an 710049, China(陕西省人工智能联合(重点)实验室(西安交通大学),西安710049,中国)

专题命中 点云 :point cloud(title);分类 cs.CV

AI总结 该研究提出拓扑驱动的 foliage 抑制最短路径分解方法,从单一点云恢复树木分支层次,在有叶条件下的AGB估算精度优于传统QSM方法,为相关森林清查业务应用消除了障碍。

Comments 14 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13284 2026-08-14 cs.RO 新提交 57%

Predictive Relative-Velocity Steering for Safe Robotic Manipulator Teleoperation in Dynamic Environments

动态环境下安全机器人操纵器遥操作的预测相对速度转向方法

Changhao Hu, Zeyi Liu, Songqiao Hu, Shuang Liu, Zihan Meng, Xiao He

机构 * Zhejiang University(浙江大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Tsinghua University(清华大学) Institute for Embodied Intelligence and Robotics, Tsinghua University(清华大学具身智能与机器人研究所) TetraBOT

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 针对动态环境下机器人遥操作的安全问题,提出轻量级模块化预测相对速度转向框架,可提升末端执行器避障率并缓解死锁,仿真与物理实验验证了其有效性。

Comments 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12537 2026-08-14 cs.CV 新提交 57%

Surface-to-Skeleton 3D Cephalometry: Estimating Hidden Skeletal Landmarks from CT-Derived External Soft-Tissue Surfaces

表面到骨骼的3D头影测量:从CT衍生的外部软组织表面估计隐藏的骨骼标志点

Tomoki Abe, Taiki Kanaya, Kazuki Saita, Mao Noda, Chie Tachiki, Yasushi Nishii, Hideo Saito

机构 * Keio University(庆应义塾大学) Tokyo Dental College(东京齿科大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 该研究构建表面到骨骼任务,用集成层次化点云模型从CT衍生外部软组织表面估计隐藏骨骼标志点,在40个留存患者中取得2.97mm的骨骼标志点平均径向误差,证实了隐藏骨骼标志点推断的可行性。

Comments Accepted to AI4M3D Workshop at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10383 2026-08-14 cs.RO 版本更新 57%

Real-World Cooperative Bimanual Dexterous Grasp of Large Objects from Single-View Observations

基于单视图观测的真实场景中大型物体的双臂协同灵巧抓取

Ziming Li, Mingxuan Wu, Jiaqi Zhang, Hongfei Li, Yan Gan, Deqiang Ouyang, Ning Wang

机构 * The University of Auckland(奥克兰大学) Chongqing University(重庆大学) Southwest University(西南大学)

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 本文针对机器人双臂抓取大型物体的挑战,提出含多模态数据集、DDPM模块及执行策略的真实场景双臂抓取框架,实验表明其对未见物体抓取成功率高。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 新视角合成 1 篇

2608.12442 2026-08-14 cs.CV 新提交 79%

MV2: Multi-View Multi-Vehicle Driving Dataset for Novel View Synthesis

MV2:用于新视角合成的多视角多车辆驾驶数据集

Sanjay Bhargav Dharavath, Hanvitha Saraswathi Mukkamala, Faizan Farooq Khan, Ioannis Kakogeorgiou, Aditya Arun, C V Jawahar, Zakaria Laskar

机构 * International Institute of Information Technology, Hyderabad(海得拉巴国际信息技术学院) King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) IIT, National Centre for Scientific Research “Demokritos”(德谟克利特国家科学研究中心 IIT) Adobe MDSR, India(奥多比印度MDSR部门) Indian Institute of Science Education and Research, Thiruvananthapuram(特里凡得琅印度科学教育与研究学院)

专题命中 新视角合成 :novel view synthesis(title,abstract);分类 cs.CV

AI总结 针对驾驶场景新视角合成的难题,提出含50个场景12000张图像的MV2多车辆数据集,经严格配准验证,基准测试显示视角差异增大NVS性能下降,前馈位姿估计器弱于优化方法。

Comments 18 pages, 7 figures, ECCV accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 3D生成 2 篇

2608.02711 2026-08-14 cs.CV 版本更新 83%

Hunyuan3D-Buffalo 1.0: A Unified Multimodal Model for Scalable 3D Generation, Understanding, and Editing

Hunyuan3D-Buffalo 1.0:用于可扩展3D生成、理解与编辑的统一多模态模型

Junliang Ye, Kenkun Liu, Guocun Wang, Yang Li, Yansong Qu, Chunshi Wang, Jingwei Xu, Yunhan Yang, Zibo Zhao, Jiachen Xu, Jiaao Yu, Lifu Wang, Zhihao Liang, Xin Huang, Zhuo Chen, Chunchao Guo

机构 * Tencent Hunyuan(腾讯混元)

专题命中 3D生成 :3D generation(title,abstract);spatial understanding(abstract);分类 cs.CV

AI总结 Hunyuan3D-Buffalo 1.0是支持3D理解、文本到3D生成等功能的统一多模态模型,构建87M规模语料库训练,在相关基准上达SOTA或领先性能,验证了统一训练的有效性。

Comments Project Page: https://tencent-hunyuan.github.io/Hunyuan3D-Buffalo1.0

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12997 2026-08-14 cs.CV 新提交 57%

PixSDS: Why Latent SDS Makes Noisy Pixels

PixSDS:潜在SDS为何会产生带噪像素

Vsevolod Skorokhodov

机构 * EPFL(洛桑联邦理工学院)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 针对潜在SDS生成3D时的像素漂移问题,提出轻量级VAE一致性梯度修复方法PixSDS,减少结构化伪影并保留语义内容。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 空间理解 1 篇

2508.08199 2026-08-14 cs.CV 版本更新 57%

Generalizable Operating Room Expert with Multimodal Enhancement

具备多模态增强能力的可泛化手术室专家

Peiqi He, Zhenhao Zhang, Yixiang Zhang, Jiaxin Liu, Xiongjun Zhao, Shaoliang Peng

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 针对手术室空间建模的局限,提出仅用RGB图像推理的多模态大语言模型OR-Expert,通过内部推导空间线索实现三维推理,在手术室基准上达SOTA且泛化性良好。

Comments Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 其他3D视觉 1 篇

2608.13226 2026-08-14 cs.CV cs.AI 新提交 57%

CoverPrune: Coverage-Driven Token Pruning for 3D VLMs via Optimal Transport

CoverPrune:基于最优传输的3D视觉语言模型的覆盖驱动型令牌剪枝

Peng Ling, Yingda Yin, Lingting Zhu, Weikai Chen, Shengju Qian, Zeyu Hu, Xin Wang, Wenming Yang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) LIGHTSPEED

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV

AI总结 针对3D VLMs因大量视觉令牌导致的计算瓶颈,提出CoverPrune框架,将剪枝转化为最优传输问题,结合FST成本与SGS算法,实现高效剪枝且性能优异。

Comments Accepted to ECCV 2026 as an Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏