arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-07-07 至 2026-07-07 共收录 26 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 3 篇

2606.30047 2026-07-07 cs.CV 版本更新 83%

Argus: Metric Panoramic 3D Reconstruction for Indoor Scenes

Argus:室内场景的度量全景三维重建

Xi Li, Linyuan Li, Yan Wu, Tong Rao, Kai Zhang, Xinchen Hui, Cihui Pan

机构 * Realsee, China(Realsee中国)

专题命中 三维重建 :3D reconstruction(title,abstract);point cloud(abstract);分类 cs.CV

AI总结 提出混合数据集Realsee3D和端到端网络Argus,通过可学习的共视模块解决全景稀疏捕获中的位姿漂移,并分解像素到世界映射以增强几何一致性,在相机位姿、深度和点云重建上达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04931 2026-07-07 cs.CV 版本更新 70%

LoMa: Local Feature Matching Revisited

LoMa:局部特征匹配的再审视

David Nordström, Johan Edstedt, Georg Bökman, Jonathan Astermark, Anders Heyden, Viktor Larsson, Mårten Wadenbäck, Michael Felsberg, Fredrik Kahl

机构 * Chalmers University of Technology(查尔姆斯理工大学) Linköping University(林雪平大学) University of Amsterdam(阿姆斯特丹大学) Centre for Mathematical Sciences, Lund University(隆德大学数学科学中心)

专题命中 三维重建 :3D vision(abstract);3D reconstruction(abstract);分类 cs.CV

AI总结 本文从数据驱动角度重新审视局部特征匹配,提出LoMa方法,通过结合大规模数据混合、现代训练方案和模型容量,提升了性能,并在新数据集HardMatch上取得显著成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05207 2026-07-07 cs.CV 版本更新 57%

Syn4D: A Multiview Synthetic 4D Dataset

Syn4D:多视图合成4D数据集

Zeren Jiang, Yushi Lan, Yihang Luo, Yufan Deng, Zihang Lai, Edgar Sucar, Christian Rupprecht, Iro Laina, Diane Larlus, Chuanxia Zheng, Andrea Vedaldi

机构 * VGG University of Oxford(牛津大学) Nanyang Technological University(南洋理工大学) Naver Labs Europe(Naver欧洲实验室)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 针对动态场景稠密3D重建跟踪缺高质量标注数据集的问题,构建含多类真值标注的Syn4D数据集,支撑多下游任务,助力相关研究。

Comments 33 pages, 11 figures, project page: https://jzr99.github.io/Syn4D/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. NeRF 1 篇

2507.23033 2026-07-07 cs.CV cs.NE 版本更新 57%

Adaptive Time-step Training for Enhancing Spike-Based Neural Radiance Fields

用于增强基于脉冲的神经辐射场的自适应时间步长训练

Ranxi Lin, Canming Yao, Jiayi Li, Weihang Liu, Xin Lou, Pingqiang Zhou

机构 * School of Information Science and Technology, ShanghaiTech University(信息科学与技术学院,上海科技大学) Guangdong Institute of Intelligence Science and Technology(广东智能科学与技术研究院)

专题命中 NeRF :NeRF(abstract);分类 cs.CV

AI总结 研究针对基于脉冲的神经辐射场模型固定推理时间步长效率低的问题,提出PATA框架,通过参数化目标推理时间步长并两阶段训练,结合多种策略降低推理成本并保持渲染质量。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. Gaussian Splatting 7 篇

2606.30545 2026-07-07 cs.CV 版本更新 87%

StereoGS: Sparse-View 3D Gaussian Splatting via Stereo Priors

StereoGS: 基于立体先验的稀疏视角3D高斯泼溅

Wenhao Yuan, Yiyuan Ge, Deli Cai

机构 * South China University of Technology, China(华南理工大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);novel view synthesis(abstract);分类 cs.CV

AI总结 提出StereoGS框架,利用立体深度正则化和梯度感知不透明度衰减策略,在稀疏视角下实现高质量3D重建和新视角合成,无需额外推理开销。

Comments 15 pages, 6 figures, accepted to ECCV 2026, project page: https://stringerywh00.github.io/StereoGS_project_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28720 2026-07-07 cs.RO 版本更新 85%

CubifyGS: Object-Centric 3D Gaussian Splatting for Lifelong Dynamic Scene Maintenance

CubifyGS: 面向对象的3D高斯泼溅用于终身动态场景维护

Bohan Ren, Dianyi Yang, Shiyang Liu, Yu Gao, Jiadong Tang, Zhilin Lai, Yi Yang, Mengyin Fu

机构 * School of Automation, Beijing Institute of Technology, Beijing, China(北京理工大学自动化学院,北京,中国) Guangzhou Saite Intelligent Technology Co., Ltd.(广州赛泰智能科技有限公司)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);分类 cs.RO

AI总结 提出CubifyGS,一种面向对象的映射框架,通过将可移动实例建模为可重用高斯资产,并采用事件触发自适应优化,实现刚性物体重排下的高效动态场景维护。

Comments Accepted to IROS 2026. 8 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03024 2026-07-07 cs.CV 版本更新 83%

SA-ResGS: Self-Augmented Residual 3D Gaussian Splatting for Next Best View Selection

SA-ResGS:用于下一个最佳视图选择的自增强残差3D高斯点云绘制

Kim Jun-Seong, Tae-Hyun Oh, Eduardo Pérez-Pellitero, Youngkyoon Jang

机构 * POSTECH(POSTECH大学) KAIST(韩国科学技术院) Huawei Noah’s Ark Lab(华为诺亚实验室) Rivian

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);point cloud(abstract);分类 cs.CV

AI总结 提出SA-ResGS框架,通过生成自增强点云稳定不确定性量化,增强不确定性感知监督。采用残差学习策略应对高斯分布监督不足问题,贡献包括物理视图选择策略、不确定性感知残差监督方案等,实验表明其性能优于基线。

Comments Accepted at ECCV 2026. Project page: https://saresgs.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19834 2026-07-07 cs.CV 版本更新 81%

Fourier Splatting: Generalized Fourier encoded primitives for scalable radiance fields

傅里叶点绘:通用傅里叶编码原语用于可扩展辐射场

Mihnea-Bogdan Jurca, Bert Van hauwermeiren, Adrian Munteanu

机构 * Vrije Universiteit Brussel(布鲁塞尔自由大学) Technical University of Cluj-Napoca(克卢日-纳波卡技术大学)

专题命中 Gaussian Splatting :3DGS(abstract,abstract_cn);Gaussian Splatting(abstract);novel view synthesis(abstract);分类 cs.CV

AI总结 本文提出傅里叶点绘,一种可扩展的辐射场渲染原语,通过参数化平面点云的傅里叶编码描述获得任意封闭形状的原语,实现不同细节层次的渲染。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17547 2026-07-07 cs.CV 版本更新 79%

G3Splat: Geometrically Consistent Generalizable Gaussian Splatting

G3Splat:几何一致的可推广高斯点渲染

Mehdi Hosseinzadeh, Shin-Fang Chng, Yi Xu, Simon Lucey, Ian Reid, Ravi Garg

机构 * Australian Institute for Machine Learning(澳大利亚机器学习研究所) Goertek Alpha Labs(科大讯飞Alpha实验室) MBZUAI(马克斯·普朗克人工智能研究所)

专题命中 Gaussian Splatting :Gaussian Splatting(title);3DGS(abstract);分类 cs.CV

AI总结 研究3D高斯点渲染,指出多数方法仅用视图合成损失训练有局限。提出G3Splat框架,通过可微几何先验解决问题,提升高斯点几何保真度,兼顾多任务性能。

Comments Project page: https://m80hz.github.io/g3splat/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19822 2026-07-07 cs.CV 版本更新 77%

HUGE-Bench: A Benchmark for High-Level UAV Vision-Language-Action Tasks

HUGE-Bench: 面向高级无人机视觉-语言-动作任务的基准测试

Jingyu Guo, Ziye Chen, Ziwen Li, Zhengqing Gao, Jiaxin Huang, Hanlue Zhang, Fengming Huang, Yu Yao, Tongliang Liu, Mingming Gong

机构 * The University of Melbourne(墨尔本大学) Melsy Tech(Melsy科技) MBZUAI Navlyn The University of Sydney(悉尼大学)

专题命中 Gaussian Splatting :3DGS(abstract,abstract_cn);Gaussian Splatting(abstract);分类 cs.CV

AI总结 提出HUGE-Bench基准,通过4个数字孪生场景和8个高级任务,评估无人机在简洁语言指令下执行安全、过程导向的复杂轨迹能力,并引入过程导向和碰撞感知指标,揭示现有VLA模型在高级语义完成和安全执行上的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27422 2026-07-07 cs.CV 版本更新 74%

Difix3D-W: Distractor-Free Few-Shot 3D Gaussian Splatting in the Wild

野外稀疏视角3D高斯点云生成

Wongi Park, Jordan A. James, Myeongseok Nam, Minjae Lee, Soomok Lee, Sang-Hyun Lee, William J. Beksi

机构 * University of Texas at Arlington(德克萨斯大学阿灵顿分校) GenGenAI Seoul National University(首尔国立大学) Kennesaw State University(肯纳邦斯州立大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title);分类 cs.CV

AI总结 本文提出一种针对无约束真实场景的3D稀疏视角合成框架,通过引入扩散模型和瞬时掩码提升3D表示质量,实现高保真3D渲染。

Comments 16 pages, 16 figures, and 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 点云 10 篇

2603.28660 2026-07-07 cs.CV 版本更新 79%

Industrial3D: A Water-Treatment TLS Point Cloud Dataset and Cross-Paradigm Benchmark for MEP Scene Understanding

Industrial3D: 一个用于工业基础设施的地面激光雷达点云数据集和跨范式基准

Chao Yin, Hongzhe Yue, Qing Han, Difeng Hu, Zhenyu Liang, Fangzhou Lin, Bing Sun, Boyu Wang, Mingkai Li, Wei Yao, Jack C. P. Cheng

机构 * Department of Civil and Environmental Engineering, The Hong Kong University of Science and Technology(香港科技大学土木与环境工程系) Guangzhou Institute of Geography, Guangdong Academy of Sciences(广东省科学院广州地理研究所) School of Civil Engineering, Southeast University(东南大学土木工程学院) College of Geography and Tourism, Hengyang Normal University(衡阳师范学院地理与旅游学院) Department of Architecture and Civil Engineering, City University of Hong Kong(香港城市大学建筑与土木工程系) S.M.A.R.T. Construction Research Group, New York University Abu Dhabi(纽约大学阿布扎比分校S.M.A.R.T.建筑研究组) Department of the Built Environment, National University of Singapore(新加坡国立大学建筑环境系) Spatial Intelligence and Urban Computing, Institute of Urban Environment, Chinese Academy of Sciences(中国科学院城市环境研究所空间智能与城市计算) State Key Lab of Ecological Security of Regions and Cities, Institute of Urban Environment, Chinese Academy of Sciences(中国科学院城市环境研究所区域与城市生态安全国家重点实验室)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 本文提出Industrial3D数据集,包含6.12亿个高精度标注点云,用于解决工业设施中密集点云的语义理解难题,并建立首个跨范式基准,揭示了工业TLS数据中统计稀有性和几何模糊性带来的领域迁移挑战。

Comments 52 pages, 8 figure, 14 tables

Journal ref 2026, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03283 2026-07-07 cs.CV 版本更新 79%

Utonia: Toward One Encoder for All Point Clouds

Utonia:迈向适用于所有点云的单一编码器

Yujia Zhang, Xiaoyang Wu, Yunhan Yang, Xianzhe Fan, Han Li, Yuechen Zhang, Zehao Huang, Naiyan Wang, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Xiaomi(小米)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 研究旨在训练跨多领域的单自监督点变压器编码器Utonia,其能学习一致表征空间实现跨域转移,统一各领域点云,提升感知能力,还对具身和多模态推理有益,有望成为稀疏3D数据基础模型。

Comments produced by Pointcept, project page: https://pointcept.github.io/Utonia

Journal ref International Conference on Machine Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19128 2026-07-07 cs.CV 版本更新 79%

Resolving Primitive-Sharing Ambiguity in Long-Tailed TLS-Based Industrial MEP Point Cloud Segmentation via Spatial Context Constraints

通过空间上下文约束解决基于长尾巴TLS的工业MEP点云分割中的原始共享模糊性

Chao Yin, Qing Han, Zhiwei Hou, Yue Liu, Anjin Dai, Hongda Hu, Ji Yang, Wei Yao

机构 * Chao Yin, Qing Han, Zhiwei Hou, Yue Liu, Anjin Dai, Hongda Hu, Ji Yang, Wei Yao(未知)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 针对基于地面激光扫描的工业MEP点云分割中安全关键组件易误分类问题,提出利用邻域预测一致性的空间上下文约束,扩展类平衡损失,提升尾类性能并保持头类精度。

Comments 46 pages, 11 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28637 2026-07-07 cs.RO 版本更新 57%

PinNet: Keypoint-Aware Learned Local Descriptors with Geometric Embedding for Loop Closure in LiDAR SLAM

PinNet:用于LiDAR SLAM回环检测的具有几何嵌入的关键点感知局部描述符

Yanlong Ma, Nakul S. Joshi, Christa S. Robison, Philip R. Osteen, Brett T. Lopez

机构 * University of California, Los Angeles(加州大学洛杉矶分校) DEVCOM Army Research Laboratory (ARL)(陆军研究实验室(ARL))

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 提出PinNet网络,通过关键点生成和平面几何自注意力模块增强描述符判别性,实现基于点云的回环检测与配准,在多个数据集上验证了优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23087 2026-07-07 cs.RO 版本更新 57%

CoLA-Flow Policy: Temporally Coherent Imitation Learning via Continuous Latent Action Flow Matching for Robotic Manipulation

CoLA-Flow Policy: 通过连续潜在动作流匹配实现机器人操作的时序一致模仿学习

Wu Songwei, Jiang Zhiduo, Sun Wandong, Xie Guanghu, Zhao Rui, Liu Hong, Liu Yang

机构 * State Key Laboratory of Robotics and System, Harbin Institute of Technology(机器人系统国家重点实验室,哈尔滨工业大学) The University of Sydney(悉尼大学) Honor Device Co., Ltd.(荣耀设备有限公司)

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 本文提出CoLA-Flow Policy,一种基于连续潜在动作空间的轨迹级模仿学习框架,通过学习显式的潜在空间流,解耦全局运动结构与低层控制噪声,从而实现平滑可靠的长时程执行,并结合几何感知点云条件和执行时多模态调节,提升现实环境的鲁棒性。

Comments 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24847 2026-07-07 cs.CV 版本更新 57%

CORA: Generalizable coronary artery disease assessment and risk stratification from coronary CT angiography using pathology-centric representation learning

CORA:一种由病理合成驱动的冠状动脉CT血管造影分析和MACE风险评估基础模型

Jinkui Hao, Gorkem Durak, Halil Ertugrul Aktas, Ulas Bagci, Bradley D. Allen, Nilay S. Shah, Bo Zhou

机构 * Department of Radiology, Northwestern University(西北大学放射学系) Department of Biomedical Engineering, Northwestern University(西北大学生物医学工程系) Department of Cardiology, Northwestern University(西北大学心脏病学系) Department of Preventive Medicine, Northwestern University(西北大学预防医学系)

专题命中 点云 :3D vision(abstract);分类 cs.CV

AI总结 CORA通过病理合成驱动的自监督框架,直接从体积CT血管造影数据中学习,提升冠状动脉疾病分析和MACE风险评估性能,实现29%的性能提升。

Comments Code is available at: https://github.com/Advanced-AI-in-Medicine-and-Physics-Lab/CORA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07866 2026-07-07 cs.RO cs.LG cs.SY eess.SY 版本更新 57%

Language-Guided Grasping under Partial Observation for Mobile Manipulation in Field Inspection and Maintenance

用于现场检查和维护中移动操作的部分观察下语言引导抓取

Dilermando Almeida, Juliano Negri, Guilherme Lazzarini, Thiago H. Segreto, Ranulfo Bezerra, Gustavo J. G. Lahr, Ricardo V. Godoy, Marcelo Becker

机构 * Department of Mechanical Engineering, Federal University of Uberlândia(联邦大学伯南迪利亚机械工程系) Department of Mechanical Engineering, University of São Paulo(圣保罗大学机械工程系) Graduate School of Information Sciences, Tohoku University(东北大学信息科学研究生院) Faculdade Israelita de Ensino e Pesquisa Albert Einstein, Hospital Israelita Albert Einstein(艾伯特·爱因斯坦以色列教学与研究学院,艾伯特·爱因斯坦医院)

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 提出用于腿部移动操纵器在部分观察下的语言引导抓取流程,经多步骤处理,在四足机器人上实现并评估,相比基线提高抓取成功率,提升语言引导抓取可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03695 2026-07-07 cs.RO 版本更新 57%

TreeLoc++: Robust 6-DoF LiDAR Localization in Forests with a Compact Digital Forest Inventory

TreeLoc++:利用紧凑数字森林清单在森林中进行稳健的6自由度激光雷达定位

Minwoo Jung, Dongjae Lee, Nived Chebrolu, Haedam Oh, Maurice Fallon, Ayoung Kim

机构 * Department of Mechanical Engineering, Seoul National University, Seoul, South Korea(首尔国立大学机械工程系,韩国首尔) Department of Computer Science and Engineering, Indian Institute of Technology Bombay, India(印度班加罗尔印度理工学院计算机科学与工程系) Oxford Robotics Institute, Department of Engineering Science, University of Oxford, Oxford, UK(牛津大学奥克斯福德机器人研究所,英国牛津)

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 研究提出TreeLoc++框架,直接基于数字森林清单定位,以紧凑几何属性编码树干。通过距离直方图等减少误匹配,优化估计姿态,不依赖密集点云数据,实现厘米级精度定位,具长期部署扩展性。

Comments 30 pages, 33 figures and 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15379 2026-07-07 cs.CV 版本更新 57%

The P$^3$ Dataset: Pixels, Points and Polygons for Multimodal Building Vectorization

P$^3$数据集:用于多模态建筑物矢量化的像素、点和多边形

Raphael Sulzer, Liuyun Duan, Nicolas Girard, Florent Lafarge

机构 * Université Côte d’Azur, INRIA(法国里沃利大学、INRIA) LuxCarta Technology(LuxCarta技术公司)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 介绍用于建筑物矢量化的多模态P$^3$数据集,由多源数据构建,含大量高精度激光雷达点等。证明激光雷达点云可用于预测建筑物多边形,融合激光雷达和图像能提高预测精度与几何质量,数据集公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.15277 2026-07-07 cs.CV 版本更新 57%

EPMF: Efficient Perception-aware Multi-sensor Fusion for 3D Semantic Segmentation

EPMF: 高效感知感知多传感器融合用于3D语义分割

Mingkui Tan, Zhuangwei Zhuang, Sitao Chen, Rong Li, Kui Jia, Qicheng Wang, Yuanqing Li

机构 * School of Software Engineering, South China University of Technology(南方科技大学软件工程学院) Pazhou Laboratory, Guangzhou, China(广州帕佐实验室) School of Electronic and Information Engineering, South China University of Technology(南方科技大学电子与信息工程学院) Minieye, Shenzhen, Guangdong, China(深圳Minieye公司)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 提出一种高效感知多传感器融合方法EPMF,通过透视投影对齐点云与RGB图像,利用残差融合模块和感知损失提升3D语义分割性能,在nuScenes上mIoU超越RangeFormer 0.9%。

Comments 16 pages, 12 figures, 14 tables, IEEE TPAMI 2024, extended version of the ICCV2021 paper

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 新视角合成 4 篇

2604.13416 2026-07-07 cs.CV cs.AI 版本更新 83%

DF3DV-1K: A Large-Scale Dataset and Benchmark for Distractor-Free Novel View Synthesis

DF3DV-1K:用于无干扰新视角合成的大规模数据集与基准

Cheng-You Lu, Yi-Shan Hung, Wei-Ling Chi, Hao-Ping Wang, Charlie Li-Ting Tsai, Yu-Cheng Chang, Yu-Lun Liu, Thomas Do, Chin-Teng Lin

机构 * University of Technology Sydney(悉尼科技大学) University of Sydney(悉尼大学) National Yang Ming Chiao Tung University(阳明交通大学)

专题命中 新视角合成 :novel view synthesis(title,abstract);Gaussian Splatting(abstract);分类 cs.CV

AI总结 为弥补无干扰辐射场领域缺乏大规模真实世界数据集的空白,构建了包含1048个场景、每场景提供干净和杂乱图像集的DF3DV-1K数据集,并基于此基准测试了九种最新方法,识别出最鲁棒的方法和最具挑战的场景。

Comments ECCV 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29496 2026-07-07 cs.CV 版本更新 79%

Rectifying Mask via Entropy for Distractor-Free 3DGS in Ambiguous Scenarios

通过熵修正掩码实现模糊场景中无干扰的3D高斯泼溅

Wongi Park, Jiyeon Lim, Minjae Lee, Myeongseok Nam, Seongjun Choi, Jungwoo Kim, Soomok Lee, William J. Beksi, Sang-Hyun Lee

机构 * Samsung Electronics(三星电子) Georgia Institute of Technology(佐治亚理工学院) GenGenAI Yonsei University(延世大学) Seoul National University(首尔国立大学) Kennesaw State University(肯纳邦州立大学) University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 新视角合成 :3DGS(title);novel view synthesis(abstract);分类 cs.CV

AI总结 提出RefineSplat框架,利用熵感知自适应掩码和密度控制方法,有效识别并移除模糊场景中的动态干扰物,实现无干扰的新视角合成。

Comments 28 pages, 30 figures, and 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17918 2026-07-07 cs.CV 版本更新 79%

Do Flat Minima Improve Sparse Novel View Synthesis?

平坦最小值能改善稀疏新视图合成吗?

Youngsik Yun, Dongjun Gu, Youngjung Uh

机构 * Yonsei University(延世大学)

专题命中 新视角合成 :novel view synthesis(title,abstract);分类 cs.CV

AI总结 研究新视图合成中损失锐度与泛化的关系,提出结构感知锐度并根据局部图像结构自适应调整锐度正则化权重,可在保持细节重建所需锐度的同时促进泛化,提升多种基线方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05672 2026-07-07 cs.CV cs.AI cs.LG 版本更新 57%

InverseCrafter: Efficient Video ReCapture as a Latent Domain Inverse Problem

InverseCrafter:作为潜在域逆问题的高效视频重新捕捉

Yeobin Hong, Suhyeon Lee, Hyungjin Chung, Jong Chul Ye

机构 * Graduate School of AI, KAIST, South Korea(韩国釜山国立大学人工智能研究生院) EverEx, South Korea(韩国EverEx公司) Korea University, South Korea(韩国国立庆熙大学)

专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV

AI总结 提出InverseCrafter框架,将新视角视频生成转化为潜在空间基于图像修复的逆问题,通过轻量级潜在掩码编码器建立算子等价,无需标注4D训练数据,实现高效合成与编辑。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 空间理解 1 篇

2512.13660 2026-07-07 cs.RO cs.CV 版本更新 62%

Towards Spatial Trace with Reasoning in Vision-Language Models for Robotics

面向机器人视觉-语言模型的具有推理能力的空间轨迹

Enshen Zhou, Yibo Li, Jingkun An, Jiayuan Zhang, Shanyu Rong, Mengzhen Liu, Yi Han, Yuheng Ji, Huajie Tan, Jiawei He, Pengwei Wang, Zhongyuan Wang, Cheng Chi, Lu Sheng, Shanghang Zhang

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV、cs.RO

AI总结 本文提出RoboTracer,一种3D感知的视觉语言模型,通过空间编码器和回归监督解码器提升空间推理能力,并结合强化学习训练实现多步度量推理,最终在复杂场景中实现高效空间轨迹生成。

Comments Accepted to ECCV 2026. Project page: https://zhoues.github.io/RoboTracer

详情

展开后加载摘要…

URL PDF HTML 收藏