arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-07-07 至 2026-07-07 共收录 77 信号源:cs.CV, cs.GR, cs.RO

1. 点云 23 篇

2106.15277 2026-07-07 cs.CV 版本更新 57%

EPMF: Efficient Perception-aware Multi-sensor Fusion for 3D Semantic Segmentation

EPMF: 高效感知感知多传感器融合用于3D语义分割

Mingkui Tan, Zhuangwei Zhuang, Sitao Chen, Rong Li, Kui Jia, Qicheng Wang, Yuanqing Li

机构 * School of Software Engineering, South China University of Technology(南方科技大学软件工程学院) Pazhou Laboratory, Guangzhou, China(广州帕佐实验室) School of Electronic and Information Engineering, South China University of Technology(南方科技大学电子与信息工程学院) Minieye, Shenzhen, Guangdong, China(深圳Minieye公司)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 提出一种高效感知多传感器融合方法EPMF,通过透视投影对齐点云与RGB图像,利用残差融合模块和感知损失提升3D语义分割性能,在nuScenes上mIoU超越RangeFormer 0.9%。

Comments 16 pages, 12 figures, 14 tables, IEEE TPAMI 2024, extended version of the ICCV2021 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03826 2026-07-07 eess.SP 新提交 50%

LAMBDA: A Low-Altitude Multimodal Base Dataset for UAV Sensing and Communication

LAMBDA:用于无人机传感与通信的低空多模态基础数据集

Lin Zhou, Peichuan Rao, Chenshuo Zhang, Jianhua Mo, Shu Sun, Zhiyong Chen, Meixia Tao

专题命中 点云 :point cloud(abstract)

AI总结 研究低空综合传感与通信需对齐多模态数据,为此引入LAMBDA数据集,通过高保真数字孪生管道生成,具有多种特性,涵盖多场景多条件,支持多种参数设置,经评估有可靠性与可用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20783 2026-07-07 stat.ME math.ST stat.TH 50%

Ordinal Patterns Based Testing of Spatial Independence in Irregular Spatial Structures

基于序模式的不规则空间结构中空间独立性的检验

Giorgio Micali, David Garnés-Galindo, Mariano Matilla-García, Manuel Ruiz-Marín

专题命中 点云 :point cloud(abstract)

AI总结 本文提出一种非参数空间独立性检验方法,通过序模式编码局部空间配置,构建基于加法对数比变换的检验统计量,证明其收敛于χ²_{m!-1}分布,适用于不规则点云数据,展示序模式方法的鲁棒性与广泛应用前景。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 新视角合成 6 篇

2607.05243 2026-07-07 cs.CV 新提交 84%

GUSH3R: Everyone Everywhere All at Once as Gaussians

GUSH3R:将各处所有人物统一表示为高斯体的方法

Keito Abe, Kaede Shiohara, Takashi Otonari, Toshihiko Yamasaki

机构 * The University of Tokyo(东京大学)

专题命中 新视角合成 :Gaussian Splatting(abstract);3DGS(abstract);3D reconstruction(abstract);point cloud(abstract)

AI总结 该研究面向单目视频动态人-场景重建难题,提出前馈框架GUSH3R,单次前向即可输出几何一致的3D高斯基元,兼顾新视角渲染质量与推理效率。

Comments Project page: https://abkeito.github.io/gush3r-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13416 2026-07-07 cs.CV cs.AI 版本更新 83%

DF3DV-1K: A Large-Scale Dataset and Benchmark for Distractor-Free Novel View Synthesis

DF3DV-1K:用于无干扰新视角合成的大规模数据集与基准

Cheng-You Lu, Yi-Shan Hung, Wei-Ling Chi, Hao-Ping Wang, Charlie Li-Ting Tsai, Yu-Cheng Chang, Yu-Lun Liu, Thomas Do, Chin-Teng Lin

机构 * University of Technology Sydney(悉尼科技大学) University of Sydney(悉尼大学) National Yang Ming Chiao Tung University(阳明交通大学)

专题命中 新视角合成 :novel view synthesis(title,abstract);Gaussian Splatting(abstract);分类 cs.CV

AI总结 为弥补无干扰辐射场领域缺乏大规模真实世界数据集的空白,构建了包含1048个场景、每场景提供干净和杂乱图像集的DF3DV-1K数据集,并基于此基准测试了九种最新方法,识别出最鲁棒的方法和最具挑战的场景。

Comments ECCV 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29496 2026-07-07 cs.CV 版本更新 79%

Rectifying Mask via Entropy for Distractor-Free 3DGS in Ambiguous Scenarios

通过熵修正掩码实现模糊场景中无干扰的3D高斯泼溅

Wongi Park, Jiyeon Lim, Minjae Lee, Myeongseok Nam, Seongjun Choi, Jungwoo Kim, Soomok Lee, William J. Beksi, Sang-Hyun Lee

机构 * Samsung Electronics(三星电子) Georgia Institute of Technology(佐治亚理工学院) GenGenAI Yonsei University(延世大学) Seoul National University(首尔国立大学) Kennesaw State University(肯纳邦州立大学) University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 新视角合成 :3DGS(title);novel view synthesis(abstract);分类 cs.CV

AI总结 提出RefineSplat框架,利用熵感知自适应掩码和密度控制方法,有效识别并移除模糊场景中的动态干扰物,实现无干扰的新视角合成。

Comments 28 pages, 30 figures, and 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17918 2026-07-07 cs.CV 版本更新 79%

Do Flat Minima Improve Sparse Novel View Synthesis?

平坦最小值能改善稀疏新视图合成吗?

Youngsik Yun, Dongjun Gu, Youngjung Uh

机构 * Yonsei University(延世大学)

专题命中 新视角合成 :novel view synthesis(title,abstract);分类 cs.CV

AI总结 研究新视图合成中损失锐度与泛化的关系,提出结构感知锐度并根据局部图像结构自适应调整锐度正则化权重,可在保持细节重建所需锐度的同时促进泛化,提升多种基线方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02712 2026-07-07 cs.CV 新提交 57%

Global Pose Control for Generative View Synthesis in Normalized Object Coordinate Space

归一化物体坐标空间中用于生成视图合成的全局姿态控制

Zhibing Li, Amogh Gupta, Behnoosh Parsa, Dan Casas

机构 * The Chinese University of Hong Kong(香港中文大学) Amazon(亚马逊)

专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV

AI总结 针对现有生成模型在目标视图全局控制上的不足,提出在归一化物体坐标空间中精确相机控制的新方法,以单张或少量无姿态图像为输入,将视图合成视为图像编辑问题,提升了视图生成质量和保真度。

Comments Accepted to ECCV 2026. Project page https://lizb6626.github.io/GlobalNVS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05672 2026-07-07 cs.CV cs.AI cs.LG 版本更新 57%

InverseCrafter: Efficient Video ReCapture as a Latent Domain Inverse Problem

InverseCrafter:作为潜在域逆问题的高效视频重新捕捉

Yeobin Hong, Suhyeon Lee, Hyungjin Chung, Jong Chul Ye

机构 * Graduate School of AI, KAIST, South Korea(韩国釜山国立大学人工智能研究生院) EverEx, South Korea(韩国EverEx公司) Korea University, South Korea(韩国国立庆熙大学)

专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV

AI总结 提出InverseCrafter框架,将新视角视频生成转化为潜在空间基于图像修复的逆问题,通过轻量级潜在掩码编码器建立算子等价,无需标注4D训练数据,实现高效合成与编辑。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 3D生成 4 篇

2607.00832 2026-07-07 cs.CV cs.AI 新提交 74%

Pano2World: End-to-End 3D Generation via Unified Multi-View Sequences

Pano2World: 通过统一多视图序列进行端到端三维生成

Zhenjia Li, Jinrang Jia, Yifeng Shi

机构 * Ke Holdings Inc.(贝壳找房)

专题命中 3D生成 :3D generation(title);分类 cs.CV

AI总结 提出Pano2World方法,利用全景扩散模型和视图感知注意力路由,从单张室内全景图直接生成可探索的三维高斯场景,解决多步管道误差累积和视频模型灵活性不足的问题。

Comments 10 pages, 3 figures, 3 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03990 2026-07-07 cs.CV 新提交 57%

InSpace: Structure-Aware 3D Indoor Scene Generation from a Single 360° Image

InSpace:从单张360°图像生成具有结构感知的3D室内场景

Gwanhyeong Koo, Hyunsu Kim, Youngji Kim, Taejae Lee, Siwoo Lim, Sunjae Yoon, Suyong Yeon, Chang D. Yoo

机构 * KAIST(韩国科学技术院) NAVER LABS(NAVER实验室) Chung-Ang University(中央大学)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 针对单图像到3D生成扩展到室内场景有挑战的问题,提出InSpace框架,利用360°图像,经估计部分场景几何、生成粗结构、产生详细布局和资产几何三阶段,还建数据集,实验表明其性能强。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03731 2026-07-07 cs.HC cs.AI 新提交 50%

CoGen3D: An Agentic Human-AI Co-Design Pipeline for 3D Asset Generation for Virtual Reality

CoGen3D:用于虚拟现实3D资产生成的智能人机协同设计管道

Weiwei Jiang, Wanyu He, Zheyu Tan, Zheyuan Kuang, Difeng Yu, Shinobu Hasegawa, Sven Mayer, Zhanna Sarsenbayeva

机构 * Nanjing University of Information Science and Technology(南京信息工程大学) Japan Advanced Institute of Science and Technology(日本科学技术大学) The University of Sydney(悉尼大学) University of Copenhagen(哥本哈根大学) TU Dortmund University(多特蒙德技术大学) Research Center Trustworthy Data Science and Security(可信数据科学与安全研究中心)

专题命中 3D生成 :3D generation(abstract)

AI总结 研究针对虚拟现实3D资产创作需建模专业知识的问题,引入CoGen3D智能人机协同设计管道,经用户研究评估,发现其可促进创作、改变情感反应,推动创作从技术执行转向协作空间设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15220 2026-07-07 physics.comp-ph 新提交 50%

Atomic Design Transformer: xTB-Validated 3D Molecule Generation from Scaffolds

原子设计变换器:基于xTB验证的从骨架生成3D分子

Takao Kotani

专题命中 3D生成 :3D generation(abstract)

AI总结 提出SE(3)不变的原子设计变换器(ADT),通过自回归逐原子放置和局部坐标编码实现不变性,引入xTB验证率(XVR)评估分子拓扑保持,在QM9和GEOM-Drugs上达到竞争性能。

Comments I have to make a major revision

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 空间理解 3 篇

2512.13660 2026-07-07 cs.RO cs.CV 版本更新 62%

Towards Spatial Trace with Reasoning in Vision-Language Models for Robotics

面向机器人视觉-语言模型的具有推理能力的空间轨迹

Enshen Zhou, Yibo Li, Jingkun An, Jiayuan Zhang, Shanyu Rong, Mengzhen Liu, Yi Han, Yuheng Ji, Huajie Tan, Jiawei He, Pengwei Wang, Zhongyuan Wang, Cheng Chi, Lu Sheng, Shanghang Zhang

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV、cs.RO

AI总结 本文提出RoboTracer,一种3D感知的视觉语言模型,通过空间编码器和回归监督解码器提升空间推理能力,并结合强化学习训练实现多步度量推理,最终在复杂场景中实现高效空间轨迹生成。

Comments Accepted to ECCV 2026. Project page: https://zhoues.github.io/RoboTracer

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03614 2026-07-07 cs.CV 新提交 57%

IDEAL-Bench: Indoor Dataset and Evaluation suite for Analyzing 3D Layout reasoning

IDEAL-Bench:用于分析3D布局推理的室内数据集和评估套件

Yuening Cai, Junwei Zhou, Youran Qu, Yu-Wing Tai

机构 * Department of Computer Science Dartmouth College(达特茅斯学院计算机科学系)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 介绍IDEAL-Bench评估套件,让视觉语言模型预测室内场景结构化3D布局,基于IDEAL-Scenes数据集,评估15个模型发现任务待解、模型存在不对称性及排名差异,为下一代模型空间智能评估铺路。

Comments 36 pages. Project page: https://ideal3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03530 2026-07-07 cs.AI 新提交 50%

MentalThink: Shaping Thoughts in Mental SVG World

MentalThink:在心理SVG世界中塑造思想

Kangheng Lin, Jisheng Yin, Dingming Li, En Yu, Yana Wei, Han Zhou, Liang Zhao, Hongyu Zhou, Hongbo Peng, Jianjian Sun, Zheng Ge, Xiangyu Zhang, Daxin Jiang, Jingyu Wang

专题命中 空间理解 :spatial understanding(abstract)

AI总结 介绍MentalThink视觉符号推理范式,核心是think-with-SVG管道,通过两阶段训练框架实例化,在空间理解和推理基准测试中性能优越,为动态视角获取等提供可视化工作区。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. SLAM与定位 1 篇

2607.02611 2026-07-07 cs.CV cs.LG 新提交 57%

Privacy-Preserving Industrial Ergonomics: mmWave-Based Automated REBA Scoring and Pose Estimation

隐私保护的工业工效学:基于毫米波的自动化REBA评分与姿态估计

Xuhan Zhang, Zhuangzhuang Dai, Luis J. Mans, Victor Chang

机构 * Dept. of Applied AI and Robotics(应用人工智能与机器人学系) Aston University(阿斯顿大学) Birmingham, United Kingdom(英国伯明翰)

专题命中 SLAM与定位 :point cloud(abstract);分类 cs.CV

AI总结 针对工作相关肌肉骨骼疾病评估难题,提出基于毫米波雷达的端到端多任务学习框架,含时空骨架重建与回归头,用多目标损失函数及过采样策略,实验验证其高效准确。

Comments 6 pages, 4 figures. To appear in the Proceedings of the 2026 International Conference on Automation and Computing (ICAC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏