MeSS: City Mesh-Guided Outdoor Scene Generation with Cross-View Consistent Diffusion
MeSS: 基于城市网格的户外场景生成与跨视角一致扩散
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 MeSS通过改进跨视角一致性,利用城市网格模型生成高质量且风格一致的户外场景,并结合3D高斯点划重建技术提升生成质量。
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
MeSS: 基于城市网格的户外场景生成与跨视角一致扩散
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 MeSS通过改进跨视角一致性,利用城市网格模型生成高质量且风格一致的户外场景,并结合3D高斯点划重建技术提升生成质量。
ARGen:基于情感强化的生成增强方法用于基于视觉的动态情绪感知
机构 * Fudan University(复旦大学) ; East China Normal University(华东师范大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 本文提出ARGen框架,通过情感语义注入和自适应强化扩散阶段,解决野外动态表情识别中的数据稀缺问题,提升情绪感知的生成质量和识别性能。
镜像学习
机构 * University of British Columbia(不列颠哥伦比亚大学) ; Inverted AI ; Amii
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 该研究提出镜像学习框架,通过视频扩散模型的视角变换与逆动力学模型合成镜像数据,用其增强行为克隆训练可提升策略性能,为数据收集提供替代方案。
TRACE:通过可触觉重建和几何对齐的上下文视频遮罩实现高保真的3D场景编辑
机构 * ReLER Lab, CCAI, Zhejiang University(浙江大学计算机辅助设计与图形学全国重点实验室(CCAI)ReLER实验室) ; DBMI, HMS, Harvard University(哈佛大学医学院生物医学信息学系(DBMI))
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 TRACE通过可触觉重建和几何对齐的上下文视频遮罩,实现高保真的3D场景编辑,解决了现有方法在局部姿态调整和组件替换时结构完整性不足的问题。
Comments 9 pages, 9 figures
Chimera:设计与遵循Chinchilla缩放规律的混合视觉扩散Transformer
机构 * Adobe Research(奥多比研究院)
专题命中 视频扩散模型 :long video(abstract);分类 cs.CV
AI总结 Chimera是一款混合视觉扩散骨干网络,结合KDA、MLA等模块与HeteroP缩放方案,训练出11B参数(2B激活)的模型,在计算效率、视频泛化等方面优于基线,为长上下文扩散架构设计提供基础。
Comments 40 pages
从静止状态观测的关节对象重建
机构 * Seoul National University(首尔大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 该研究针对需多关节状态运动观测的现有关节对象重建方法的局限,提出从单一静止闭合配置重建关节对象的方法,通过显式网格融合多模型输出,结合视频扩散模型实现无运动观测下的关节参数估计,性能与多种基线相当。
Comments ECCV 2026
I2VShield:一种针对基于DiT的图像到视频模型的高效主动防御框架
机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院)
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
AI总结 针对I2V模型被滥用问题,提出I2VShield主动防御框架。其包含文本自适应扰动生成框架和非目标多模态注意力干扰攻击两部分。该方法在多数据集和模型上保护性能优,能破坏时空连贯性且降低计算成本。
BiWM:利用双向自回归推进开源交互式视频世界模型
机构 * LynnReal AI ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Jiao Tong University(上海交通大学) ; Fudan University(复旦大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 提出BiWM框架,通过双向自回归范式将预训练视频骨干转化为交互式世界模型,仅需两阶段训练(微调+分布匹配蒸馏),支持多尺度模型和长程生成,优于现有因果流水线。
基于地理空间扩散的风暴中心天气增强演化合成(GeoDES)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 研究针对机器学习天气模型预测风暴结构难题,提出基于地理空间扩散的演化合成(GeoDES)模型,该模型能合成高保真天气事件,经评估在关键指标上优于先前方法,可用于测试预测模型和扩展气象数据集。
Comments 31 pages, 11 figures
AniGS:弥合3D场景动画的渲染与扩散先验
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Waymo(Waymo公司) ; Carnegie Mellon University(卡内基梅隆大学) ; Meta
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 AniGS旨在为3DGS重建的大型场景添加动画,用规范3DGS表示场景,借时间条件变形场建模运动,利用预训练视频扩散模型及迭代更新策略,防止静态区域运动伪影,实验证明该方法能产生自然动态和高质量新视图视频。
Comments Preprint. Project page: https://yccyenchicheng.github.io/AniGS/
Uni-AdaVD:通过正交值分解实现视觉生成的通用概念擦除
机构 * School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息工程学院) ; School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络空间安全学院) ; School of Artificial Intelligence and Data Science, University of Science and Technology of China(中国科学技术大学人工智能与数据科学学院) ; Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)
专题命中 视频扩散模型 :text-to-video(abstract);分类 cs.CV
AI总结 针对视觉生成模型吸收不良概念问题,提出Uni-AdaVD框架,将多模态注意力值空间作为干预空间,结合正交值分解与自适应擦除移位抑制目标语义方向,实验证明其在单多概念擦除且保留非目标先验方面性能强大,为视觉生成模型提供安全机制。
Cyclone:基于未配对驱动数据的循环一致天气编辑扩散模型
机构 * Huawei Paris Research Center(华为巴黎研究中心) ; Gustave Eiffel University(古斯塔夫·埃菲尔大学) ; IGN-ENSG(法国国家地理信息与森林和环境信息研究所)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 针对自动驾驶系统在不同天气条件下可靠感知的挑战,提出Cyclone框架,基于潜在扩散,利用循环一致约束和图像-文本模型知识,无需配对数据生成多种天气条件,实验表明其输出更优,还可提炼为视频扩散模型。
Comments Project page: https://ntaquan0125.github.io/weather-cyclone/
从低重叠度捕获中进行4D人体场景重建
机构 * Seoul National University(首尔国立大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 针对现实场景中低重叠度相机的4D人体场景重建问题,提出StudioRecon方法,通过解耦背景和人体,利用视频扩散模型强化背景监督,结合跨视图关联等初始化人体,经递归增强模块避免伪影,实现了高水准新视图合成及相关应用。
Comments Accepted to SIGGRAPH Conference Papers '26. First two authors contributed equally. Project page: https://sisyphm.github.io/studiorecon-page/
PhyMAGIC:基于置信度引导的大语言模型的物理运动感知生成推理
机构 * Department of Computer Science \& Engineering, University of Nevada, Reno, USA School of Software Technology, Zhejiang University, China
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 针对3D内容生成中动态模型物理一致性问题,PhyMAGIC提出无需训练的框架,整合图像到视频扩散模型、大语言模型置信度引导推理及可微物理模拟器,通过迭代优化和模拟反馈生成物理一致的运动,性能优于现有方法。
Comments This work is accepted by ECCV 2026
通过角色感知联合训练和模态解耦去噪增强视频物理一致性
机构 * University of Science and Technology of China(中国科学技术大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Fudan University(复旦大学) ; Georgia Institute of Technology(佐治亚理工学院) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 研究针对视频扩散模型长程物理一致性挑战,提出VPT微调框架。通过角色感知信号清晰建模不同物理角色,采用模态解耦去噪策略及损失权重衰减,引入跨步自动引导,增强物理动力学,提升物理一致性与视觉质量。
ProxyPose:通过视频到视频转换进行六自由度姿态跟踪
机构 * University of Toronto(多伦多大学) ; Vector Institute(向量研究所)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 研究旨在解决单目视频中6-DoF姿态跟踪问题,核心方法是将其转化为视频到视频转换,利用视频扩散模型生成代理视频,通过现成求解器恢复姿态。主要贡献是在无额外输入下实现高精度,且可扩展到多种场景。
Comments 23 pages, 6 figures
用于少步生成建模的感知流匹配
机构 * Joy Future Academy(京东探索研究院) ; Fudan University(复旦大学) ; Tsinghua University(清华大学) ; USTC(中国科学技术大学)
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
AI总结 提出感知流匹配框架,在感知特征空间监督流匹配,改进少步生成能力,减少采样步骤,无需教师模型和辅助分数网络,实验表明其能产生高质量结果。
RetailSMV:零售场景中基础视频世界模型的外视角与内视角适应
机构 * DreamVu
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 研究零售场景下基础视频世界模型的外视角与内视角适应,发现仅用外视角数据训练的模型在多项指标上优于或等同于联合训练。
VIGOR: 面向视频几何的时序生成对齐奖励
机构 * Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 提出基于几何的奖励模型,利用预训练几何基础模型通过跨帧重投影误差评估多视图一致性,以点方式计算误差,并引入几何感知采样策略,通过后训练和推理时优化对齐视频扩散模型,提升生成视频的几何一致性。
Comments Project Page: https://vigor-geometry-reward.com/
跨分辨率分布匹配的扩散蒸馏
机构 * Huawei(华为) ; Nanjing University of Science and Technology(南京理工大学) ; HiThink Research(海康研究院)
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
AI总结 提出跨分辨率分布匹配蒸馏(RMD)框架,通过logSNR映射和分布匹配弥合分辨率间隙,实现高保真、少步数多分辨率级联推理,在SDXL和Wan2.1-14B上分别加速33.4倍和25.6倍。
VS3R:基于深度三维重建的鲁棒全帧视频稳定
机构 * Hunan University(湖南大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 提出VS3R框架,结合前馈三维重建与生成式视频扩散,通过联合估计相机参数、深度和掩码,并引入混合稳定渲染模块和稳定驱动扩散模型,实现高保真全帧视频稳定,在鲁棒性和视觉质量上显著优于现有方法。
PA-VAD: 基于扩散的伪异常视频异常检测通过域对齐记忆更新
机构 * KDDI Research, Inc.(KDDI研究所)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 提出PA-VAD框架,仅用真实正常视频和扩散合成伪异常视频训练检测器,通过域对齐正则化模块(DARM)消除伪异常特征偏差,在多个基准上超越使用真实异常视频的方法。
Comments Accepted to ECCV 2026
相位对齐的混合分辨率扩散Transformer旋转位置编码
机构 * Stony Brook University(石溪大学) ; UNC-Charlotte(北卡罗来纳大学夏洛特分校)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 针对混合分辨率token在RoPE中注意力分数异常的问题,提出无训练机制PMA,通过统一位置尺度稳定注意力,并引入边界细化模块提升局部连贯性,在图像和视频扩散模型中提升视觉质量与计算效率。
Comments Accepted to ECCV 2026. Project page: https://hao-yu-wu.github.io/mixed_res/
GeoEdit: 基于几何感知的双分支去噪对象编辑
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Pengcheng Laboratory(鹏城实验室) ; Sun Yat-sen University(中山大学) ; Peking University(北京大学) ; HKUST(香港科技大学) ; University of Tübingen(图宾根大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 提出GeoEdit,一种无需训练的三阶段管道,通过3D解耦、点对应对齐和双分支去噪,实现单张照片中对象的刚性几何变换(平移、旋转、缩放),同时保持背景自然和身份一致性。
Comments Accepted to ECCV 2026
HorizonRelight: 通过扩散变换器一致地重照明长时域视频
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 针对长视频重照明中的时间不连续问题,提出基于扩散变换器的框架,通过掩码目标域自条件化和热启动提示实现跨块一致重照明,显著提升时间一致性。
Comments https://research.nvidia.com/labs/sil/projects/horizonrelight/
FAIL: 流匹配对抗模仿学习用于图像生成
机构 * Shanghai Jiao Tong University(上海交通大学) ; Xi’an Jiaotong University(西安交通大学) ; Tencent(腾讯)
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
AI总结 本文提出FAIL方法,通过对抗训练最小化策略-专家差异,无需显式奖励或配对比较,在图像生成中实现高效训练与泛化。
InsertAnywhere:基于几何和光学的视频物体插入
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
AI总结 本文提出InsertAnywhere框架,通过4D感知遮罩生成模块实现几何准确的物体放置,并引入光学感知表示对齐策略生成逼真光学效果,结合开放的ROSE++数据集提升复杂场景下的视频物体插入效果。
Comments 16 pages, project page: https://myyzzzoooo.github.io/InsertAnywhere/
绝对尺度下的场景生成:利用文本的语义和几何引导实现精确且可解释的3D室内场景生成
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 提出GuidedSceneGen框架,通过文本预测全局3D布局并利用全景扩散模型和视频扩散模型生成绝对尺度的室内场景,实现高一致性、可导航的3D重建。
即时表达性高斯头部虚拟化身,帧率超过100 FPS
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; NVIDIA(英伟达)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 提出一种前馈编码器流水线,将单张野外图像转换为3D一致、快速且富有表现力的可动画化表示,通过轻量级局部融合策略实现高动画表现力,运行速度达107.31 FPS。
Comments Project website is https://research.nvidia.com/labs/amri/projects/instant4d
EO-WM: 一种用于概率性地球观测预测的物理信息世界模型
机构 * The University of Hong Kong(香港大学) ; Wuhan University(武汉大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 提出EO-WM,一种视频扩散变换器,通过物理信息条件框架(气候基线、天气异常和累积应力)实现多光谱地球观测的概率性预测,在极端天气和季节匹配基准上优于现有方法。
Comments 28 pages, 5 figures, 11 tables