Optimizing Rank for High-Fidelity Implicit Neural Representations
优化秩以实现高保真隐式神经表示
机构 * University of Cambridge(剑桥大学)
专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV
AI总结 本文通过训练中稳定秩的调控,证明简单MLP也能实现高保真隐式神经表示,使用Muon优化器可显著提升性能,在多种任务上PSNR提升高达9 dB。
视觉与机器人
三维重建、NeRF、Gaussian Splatting、点云和空间智能。
优化秩以实现高保真隐式神经表示
机构 * University of Cambridge(剑桥大学)
专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV
AI总结 本文通过训练中稳定秩的调控,证明简单MLP也能实现高保真隐式神经表示,使用Muon优化器可显著提升性能,在多种任务上PSNR提升高达9 dB。
群对称下通过流匹配的等变潜在对齐
机构 * University of Illinois Urbana-Champaign, Illinois, USA(伊利诺伊大学厄巴纳-香槟分校) ; Seoul National University, Seoul, Korea(首尔国立大学)
专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV
AI总结 针对现有方法在潜在空间中存在的等变错位问题,提出基于流的残差潜在流框架,通过纠正错位潜在表示来增强旋转群SO(n)下的等变一致性,提升新视角合成质量。
可组合函数系统作为通用渲染框架
专题命中 新视角合成 :point cloud(abstract);分类 cs.GR
AI总结 提出基于函数系统的通用(非分形)可视化与模拟新方法,并介绍Quibble元编程框架,实现GPU上的高效组合,具有运行时性能优越、可创建非平凡拓扑对象及与其他图形算法互操作等优势。
Comments 7 pages; 4 figures
Princeton365: 一个具有精确相机位姿的多样化数据集
机构 * Princeton University(普林斯顿大学)
专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV
AI总结 提出Princeton365数据集,包含365个视频和精确相机位姿,通过校准板和360度相机的新颖真值采集框架弥合精度与多样性差距,并引入基于光流的尺度感知评估指标及新颖视图合成基准。
Comments Update v2: Match the ICCV 2025 camera-ready version. Fix typos
FLAIR: 频率与位置感知的隐式神经表示
专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV
AI总结 针对隐式神经表示缺乏频率选择性和空间定位导致频谱偏差的问题,提出带限局部激活和小波能量引导编码,提升2D图像表示、3D形状重建和新视角合成性能。
Comments CVPR Findings 2026 (camera ready ver.). Please visit our project page at https://cmlab-korea.github.io/FLAIR/
RadarSim: 通过多模态神经场模拟单芯片雷达
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Bosch Research(博世研究) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV
AI总结 提出RadarSim,一种利用RGB相机高角分辨率从相机初始化的神经场生成多普勒雷达距离图像的统一可微渲染器,以解决雷达空间分辨率低的问题,并产生比纯雷达重建更清晰的几何和多普勒距离帧。
Comments Accepted to 3DV 2026. Project website: https://sally-chen.github.io/radar-sim/
统一3D场景理解:通过物理世界建模
机构 * Stanford University(斯坦福大学) ; OpenAI
专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV
AI总结 提出一个概率图模型3WM,将深度估计、新视角合成和物体操作等3D视觉任务统一为单一模型,通过不同推理路径实现零样本任务执行,无需微调即达到最先进性能。
Comments Published as a conference paper at ICLR 2026
UniFixer:一种通用参考引导的扩散基视图合成修复器
机构 * ETH Zürich(苏黎世联邦理工学院) ; DisneyResearch|Studios(迪士尼研究实验室)
专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV
AI总结 本文提出UniFixer,通过粗到细策略修复扩散基视图合成中的多种退化问题,包括空间、时间及模型相关的退化,通过参考预对齐、全局结构锚定和局部细节注入模块实现高质量视图合成。
Reshoot-Anything:一种用于真实视频重拍的自监督模型
机构 * Morphic Inc.(Morphic公司)
专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV
AI总结 本文提出一种自监督框架,通过生成伪多视角训练三元组实现动态视频重拍,利用互联网级单目视频提升模型泛化能力,解决多视角数据稀缺问题。
Comments CVPRW 2026, Project page: https://adithyaiyer1999.github.io/reshoot-anything/, Code: https://github.com/morphicfilms/video-to-video
DyTact:在手-物体操作中捕捉动态接触
机构 * Brown University(布朗大学) ; IIT Delhi(德里理工学院)
专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV
AI总结 本文提出DyTact方法,通过动态、可变形的2D高斯surfels表示,实现非侵入式手-物体动态接触捕捉,提升新型视角合成质量。
Comments 3DV 2026 Oral, Webpage: https://ivl.cs.brown.edu/research/dytact
LiveStre4m: 从无姿态多视角视频中实时生成新视角的前馈直播
机构 * AIMSGroup, Department of Electrical Engineering, Eindhoven University of Technology(埃因霍温理工大学电气工程系AIMSGroup)
专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV
AI总结 本文提出LiveStre4m方法,通过多视角视觉Transformer和扩散-Transformer插值模块实现实时新视角视频直播,无需姿态参数,每帧重建时间仅0.07秒,显著优于传统优化方法。
EventHub:无需主动传感器的通用事件基立体网络数据工厂
机构 * Advanced Research Center on Electronic System (ARCES)(电子系统高级研究中心 (ARCES)) ; TU Berlin, Robotics Institute Germany(柏林工业大学德国机器人研究所) ; Einstein Center Digital Future(爱因斯坦数字未来中心) ; SCIoI Excellence Cluster(SCIoI卓越集群)
专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV
AI总结 EventHub利用标准彩色图像生成代理标注和事件,无需主动传感器的地面真实标注,重新利用先进RGB立体模型处理事件数据,提升立体网络的泛化能力。
Comments CVPR 2026. Project Page: https://bartn8.github.io/eventhub/ Code: https://github.com/bartn8/eventhub
UltraG-Ray:基于物理的高斯射线投射用于新型超声成像合成
机构 * Chair for Computer Aided Medical Procedures (CAMP), Technical University of Munich(慕尼黑工业大学计算机辅助医疗程序教席) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)
专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV
AI总结 本文提出UltraG-Ray,通过学习3D高斯场和物理模块生成更真实的超声B模图像,提升成像真实性与质量。
Comments Accepted at MIDL 2026 / to appear in PMLR
MACRO:通过结构化长上下文数据推进多参考图像生成
机构 * HKU MMLab(香港大学多媒体实验室) ; Meituan(美团)
专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV
AI总结 本文提出MACRO数据集和基准,解决多参考图像生成中参考数量增加导致性能下降的问题,通过结构化长上下文数据提升生成质量。
Comments Project Page: https://macro400k.github.io/
GO-Renderer: 基于3D感知的可控视频扩散模型生成物体渲染
机构 * HKUST(香港科技大学) ; VAST(中国航空无线电电子研究所) ; Nanyang Technological University(南洋理工大学) ; Tsinghua University(清华大学) ; ShanghaiTech University(上海交通大学)
专题命中 新视角合成 :3D reconstruction(abstract);分类 cs.CV
AI总结 本文提出GO-Renderer框架,结合重建的3D模型引导视频生成模型,实现高质物体在任意视角和光照下的渲染,无需显式建模复杂材质和光照。
Comments Project page: https://igl-hkust.github.io/GO-Renderer
将几何基础模型重新利用于多视图扩散
机构 * KAIST AI(韩国科学技术院人工智能实验室) ; New York University(纽约大学) ; Intel Labs(英特尔实验室)
专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV
AI总结 本文提出Geometric Latent Diffusion框架,利用几何一致的特征空间作为多视图扩散的潜在空间,提升多视角生成的几何一致性和图像质量。
Comments project website: https://cvlab-kaist.github.io/GLD/
Memory-V2V: 通过记忆增强的视频到视频扩散模型实现一致的多轮编辑
机构 * Adobe Research(Adobe研究实验室) ; KAIST AI(韩国科学技术院人工智能研究所) ; Adobe Internship(Adobe实习) ; Project Lead(项目负责人)
专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV
AI总结 Memory-V2V通过引入外部记忆模块,解决多轮视频编辑中的跨轮一致性问题,提升编辑连贯性并保持视觉质量,优于现有基线模型。
Comments Project page: https://dohunlee1.github.io/MemoryV2V
DriveFix:时空一致的驾驶场景修复
机构 * Zhejiang University(浙江大学) ; Huawei(华为)
专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV
AI总结 DriveFix提出一种多视角修复框架,通过交错扩散变换器架构和几何感知损失,实现驾驶场景时空一致性,提升4D世界建模的鲁棒性。
CamLit:统一的视频扩散模型,具有显式相机和光照控制
专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV
AI总结 CamLit首次提出统一的视频扩散模型,结合生成新视角和光照重置,通过单张图像、相机轨迹和环境映射生成高质量视频,实现高精度的相机姿态和光照控制。
Comments 11 pages, 6 figures
Ego-1K -- 一个大规模多视角视频数据集用于第一人称视觉
专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV
AI总结 Ego-1K数据集通过12个同步相机采集近1000个短视频,用于推动神经3D视频合成和动态场景理解,其核心挑战在于近距离动态物体和设备自身运动导致的大视差和图像运动。
Comments To appear in CVPR 2026
Dark3R: 在黑暗中学习结构从运动
机构 * University of Toronto(多伦多大学) ; Vector Institute(向量研究所) ; York University(约克大学) ; Sony Corporation of America(美国索尼公司) ; Harvard University(哈佛大学) ; Purdue University(普渡大学)
专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV
AI总结 Dark3R通过教师-学生蒸馏适应大规模3D基础模型以应对极低光照条件,无需3D监督,仅需噪声-清洁原始图像对进行训练,实现低信噪比下的鲁棒特征匹配和相机姿态估计。
Comments CVPR 2026, Project Page: https://andrewguo.com/pub/dark3r
关注你所注视的地方
专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV
AI总结 本文提出了一种自适应视角加权机制,通过调整源视角的重要性来提升少样本NVS的合成质量与真实感。
Comments ICIP 2025 Workshop on Generative AI for World Simulations and Communications
Journal ref International Conference on Image Processing 2025
视图合成变换器的扩展
机构 * MIT(麻省理工学院) ; Adobe(Adobe公司)
专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV
AI总结 本文提出了一种可扩展的视图合成模型,通过系统研究扩展规律,实现了计算最优的NVS模型,并在减少训练计算的情况下超越了现有最先进方法。
Comments Project page: https://www.evn.kim/research/svsm
Journal ref Conference on Computer Vision and Pattern Recognition (CVPR), 2026
Efficient-LVSM: 通过解耦共细化注意力实现更高效、更经济、更优质的大型视角合成模型
机构 * Institute of Trustworthy Embodied AI (TEAI)(可信具身人工智能研究院) ; Sch. of Computer Science & Sch. of Artificial Intelligence(计算机科学学院与人工智能学院) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV
AI总结 Efficient-LVSM通过解耦共细化注意力机制,实现了更高效、更经济、更优质的大型视角合成模型,提升了PSNR性能并加快了训练和推理速度。
Comments Accepted at ICLR 2026
Omni-View: 通过多视角图像解锁生成如何促进理解的统一3D模型
机构 * Institute of Medical Technology(医学技术研究所) ; Alibaba International Digital Commerce Group(阿里巴巴国际数字商务集团) ; CASIA ; TeleAI
专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV
AI总结 Omni-View通过多视角图像实现3D场景的理解与生成,结合纹理和几何模块,提升3D场景建模性能。
Comments Accepted by ICLR 2026
FLARE:从未校准的稀疏视角推断前馈几何、外观和相机姿态
机构 * Zhejiang University(浙江大学) ; Ant Group(蚂蚁集团) ; University of Oxford(牛津大学) ; Stanford University(斯坦福大学)
专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV
AI总结 FLARE通过前馈模型从少量未校准稀疏视角图像中高效推断出高质量的相机姿态、3D几何和新视角合成。
OmniView: 一种用于3D和4D视图合成的全视角扩散模型
机构 * University of Washington(华盛顿大学) ; Snap Inc.(Snap公司)
专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV
AI总结 OmniView是一种统一的扩散模型,能够泛化多种4D一致性任务,通过空间、时间和视图条件的灵活组合提升视频生成质量与相机控制精度。
Comments Project page: https://snap-research.github.io/OmniView/
WildRayZer: 动态环境中自监督的多视角合成
机构 * University of Virginia(弗吉尼亚大学)
专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV
AI总结 WildRayZer通过分析-合成测试和动态环境下的自监督方法,实现了高效的多视角合成,优于现有基线。
Comments Project Page: https://wild-rayzer.cs.virginia.edu/
通过稀疏扩散和3D渲染实现静态场景的高效摄像机控制视频生成
机构 * University of Cambridge(剑桥大学)
专题命中 新视角合成 :3D reconstruction(abstract);分类 cs.CV
AI总结 本文提出SRENDER方法,通过稀疏扩散和3D渲染生成静态场景的高效视频,使视频生成速度提升40倍,保持高质量和稳定性。
Comments Project page: https://ayushtewari.com/projects/srender/
从射线到投影:更优质的输入用于前馈视图合成
机构 * HKUST (GZ)(香港科技大学(广州)) ; University of Oxford(牛津大学) ; University of Amsterdam(阿姆斯特丹大学) ; HKUST(香港科技大学)
专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV
AI总结 本文提出投影条件化方法,通过稳定的2D输入提升视图合成的鲁棒性和一致性,优于传统射线条件化方法。
Comments Project Page: https://wuzirui.github.io/pvsm-web