arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 47 信号源:cs.CV, cs.GR, cs.MM

1. 图像修复 47 篇

2607.20789 2026-07-24 cs.CV cs.GR 新提交 84%

3D-GIMP: When 3D Gaussian Inpainting Meets PatchMatch

3D-GIMP:当3D高斯图像修复与PatchMatch相遇

Xuening Tian, Dieter Schmalstieg, Shohei Mori

机构 * University of Stuttgart(斯图加特大学)

专题命中 图像修复 :inpainting(title,abstract);diffusion(abstract);分类 cs.CV、cs.GR

AI总结 针对3D场景编辑中迭代扩散模型的问题,提出3D-GIMP混合范式,通过在关键参考视图进行图像修复并利用3D感知PatchMatch算法传播纹理,优先保证重建一致性,在渲染速度和视图一致性上表现更优。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29133 2026-08-03 cs.GR 新提交 83%

Interactive Generative Motion Editing via Scheduled Inpainting

基于调度补全的交互式生成运动编辑

Dhruv Agrawal, Dominik Borer, Luca Vögeli, Robert Sumner, Martin Guay, Jakob Buhmann

专题命中 图像修复 :inpainting(title,abstract);分类 cs.GR

AI总结 本研究提出调度补全方法,实现交互式生成运动编辑,结合运动合成与编辑,可优化现有动画并支持多类编辑应用,经多组实验验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10140 2026-07-14 cs.CV cs.AI 新提交 83%

FlowPainter: Inpainting Optical Flow via Confidence-Guided Completion

FlowPainter:通过置信度引导完成来修复光流

Yuang Meng, Chenyang Wu, Xianshun Liu, Chun-Le Guo, Zichen Liang, Lina Lei, Jie Liang, Hui Zeng, Chongyi Li, Lei Zhang

机构 * Nankai University(南开大学) The Hong Kong Polytechnic University(香港理工大学) OPPO Research Institute(OPPO研究院)

专题命中 图像修复 :inpainting(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 研究光流估计问题,提出FlowPainter框架,结合迭代优化和扩散估计范式,用轻量级置信度感知网络区分区域,通过置信度引导完成光流修复,实验表明其在可比训练下精度高、收敛快。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27584 2026-06-29 cs.CV cs.AI 新提交 83%

CoIn: Comprehensive 2D-3D Inpainting with Gaussian Splatting Guidance

CoIn:基于高斯泼溅引导的全面2D-3D修复

Hana Kim, Minje Kim, Tae-Kyun Kim

机构 * LG Electronics(LG电子) KAIST(韩国科学技术院)

专题命中 图像修复 :inpainting(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出CoIn框架,通过多阶段一致性流水线桥接2D修复模型与3D高斯泼溅,支持任意形状掩码的物体移除与插入,实现双向信息流引导的3D场景修复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19195 2026-06-18 cs.CV 新提交 83%

Moebius: 0.2B Lightweight Image Inpainting Framework with 10B-Level Performance

Moebius: 0.2B轻量级图像修复框架,性能达10B级别

Kangsheng Duan, Ziyang Xu, Wenyu Liu, Xiaohu Ruan, Xiaoxin Chen, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) VIVO AI Lab(VIVO人工智能实验室)

专题命中 图像修复 :inpainting(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出Moebius轻量级图像修复框架,通过局部-λ混合交互模块和自适应多粒度蒸馏策略,以0.22B参数实现与10B级模型FLUX.1-Fill-Dev相当甚至更优的生成质量,推理速度提升15倍以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07250 2026-07-09 eess.SP 新提交 82%

Flow-PIN: A Two-Stage Power-Flow-Guided Method for System-Wide Multivariate Profile Inpainting in Distribution Networks

Flow-PIN:一种用于配电网全系统多变量剖面修复的两阶段潮流引导方法

Zhenghao Zhou, Yiyan Li, Yike Guo, Xinyi Ma, Zheng Yan, Mo-Yuen Chow

专题命中 图像修复 :inpainting(title,abstract);diffusion(abstract)

AI总结 针对配电网数据缺失恢复问题,提出两阶段物理引导框架Flow-PIN。第一阶段用条件流匹配模型结合物理惩罚生成候选值,第二阶段用拓扑感知潮流引导细化器校正偏差,实现了高精度、捕捉波动及保留相关性的多变量剖面修复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21506 2026-06-23 eess.IV 新提交 82%

Optimising Inpainting Data with Delaunay Averages

基于Delaunay平均值的图像修复数据优化

Vassillen Chizhov, Joachim Weickert

专题命中 图像修复 :inpainting(title,abstract);diffusion(abstract)

AI总结 提出一种新的特征类型:存储Delaunay三角剖分的顶点位置及三角形内平均颜色值,结合均匀扩散修复实现正定线性系统,并开发高效数据优化策略,在图像压缩中显著优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16581 2026-06-16 eess.IV 新提交 82%

Optimizing Multiple Feature Types for Image Inpainting in the Linear and Nonlinear Setting

线性和非线性设置下优化多种特征类型的图像修复

Vassillen Chizhov, Ferdinand Jost, Joachim Weickert

专题命中 图像修复 :inpainting(title,abstract);diffusion(abstract)

AI总结 提出一种通用理论和框架,允许在线性或非线性修复中优化任意特征(如导数、局部积分),自动选择特征位置和类型,实验表明增加特征类型可显著提升压缩重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13186 2026-08-14 cs.CV 新提交 79%

SketchSense: Learning to Interpret Imperfect Sketch Guidance for Image Inpainting

SketchSense:学习解释用于图像修复的不完美草图引导

Zian Yang

机构 * Fudan University(复旦大学)

专题命中 图像修复 :inpainting(title,abstract);分类 cs.CV

AI总结 SketchSense是同步去噪RGB与结构流的框架,通过双向注意力融合等技术解释不完美草图引导,在图像修复的质量和结构保真度上较现有方法有显著提升。

Comments 10 pages, 11 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08819 2026-08-11 cs.CV physics.med-ph 新提交 79%

MRI super-resolution in ten sampling steps using a diffusion bridge model

基于扩散桥模型的十步采样MRI超分辨率

Mojtaba Safari, Hang Yu, Zach Eidex, Mingzhe Hu, Ryan J. Sanford, Alexandru Florea, Shansong Wang, Chih-Wei Chang, Erik H Middlebrooks, Aditya Juloori, Stanley L. Liauw, Ralph Weichselbaum, Xiaofeng Yang

机构 * The University of Chicago(芝加哥大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Emory University(埃默里大学) Georgia Institute of Technology(佐治亚理工学院) Mayo Clinic(梅奥诊所)

专题命中 图像修复 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对MRI扫描时间与分辨率的权衡问题,提出仅需十步采样的超分辨率扩散桥模型SR-DBM,在7T脑和前列腺MRI数据集上的量化指标与视觉效果均优于九种对比方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24140 2026-07-28 cs.CV 新提交 79%

Image Inpainting via Stochastic Dynamics

基于随机动力学的图像修复

Jiaqi Kuang, Zihao Guo, Zhongmin Qian

机构 * Oxford Suzhou Centre for Advanced Research, University of Oxford(牛津大学牛津 - 苏州高等研究院) Institute for Advanced Research, Great Bay University(大湾区大学高等研究院) Mathematical Institute, University of Oxford(牛津大学数学研究所)

专题命中 图像修复 :inpainting(title,abstract);分类 cs.CV

AI总结 研究图像修复问题,提出基于数据引导随机动力学的非参数方法,无需网络训练,通过反向随机微分方程及核加权校正引导重建,在多个数据集实验中表现优于其他方法,证明经验参考统计对图像修复的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15711 2026-07-20 cs.CV cs.AI 新提交 79%

Efficient Difficulty-Aware Dynamic Routing for Diffusion-Based Real-World Image Super-Resolution

基于扩散的真实世界图像超分辨率的高效难度感知动态路由

Xue Wu, Kang Zhao, Kafeng Wang, Jianfei Chen, Jingwei Xin, Nannan Wang, Xinbo Gao

专题命中 图像修复 :diffusion(title,abstract);分类 cs.CV

AI总结 研究基于扩散的真实世界图像超分辨率方法的局限,提出难度感知动态路由(DDR)策略,设计难度估计器并构建不同容量网络,实验证明该模型相比现有方法在效率和有效性上更具优势。

Comments ICML 2026 under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02560 2026-07-07 cs.CV 新提交 79%

Inpainting U-Net for seamless pedestrian-level wind prediction across urban morphologies

用于跨城市形态的无缝行人级风速预测的修复U-Net

Jingzi Huang, Claire E. Heaney, Tao Li, Xinzhe Li, Graham O. Hughes, Maarten van Reeuwijk

机构 * Department of Civil and Environmental Engineering, Imperial College London(伦敦帝国理工学院土木与环境工程系) Department of Earth Science and Engineering, Applied Modelling and Computation Group, Imperial College London(伦敦帝国理工学院地球科学与工程系应用建模与计算组)

专题命中 图像修复 :inpainting(title,abstract);分类 cs.CV

AI总结 研究针对行人级风速预测,开发两阶段U-Net框架。先由基线U-Net逐块预测,再用基于修复的U-Net改进,减少块边界不连续性,为跨城市形态的高分辨率行人级风速预测提供了高效灵活的替代模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15482 2026-07-20 cs.LG 新提交 78%

Inpainting Insights: Elevating Visual XAI with Photorealistic Perturbations

图像修复见解:通过逼真的扰动提升视觉可解释人工智能

Josef Lindl, Mariana Chaves, Damien Garreau

机构 * Julius-Maximilians-Universität Würzburg(维尔茨堡大学) University of Groningen(格罗宁根大学)

专题命中 图像修复 :inpainting(title,abstract)

AI总结 针对机器学习模型行为难解释问题,通过调整LIME,利用生成式图像修复改进基于扰动的图像解释,获得更逼真样本,提升了解释质量。

Comments Preprint accepted at XAIE4 (ICPR 2026). 15 pages, 5 figures, 4 tables. Code available at: https://github.com/jo01123/LILI and https://github.com/m-chaves/LIME

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07176 2026-08-10 cs.CV cs.AI 新提交 77%

Representation-driven Endoscopic Visual Embedding Alignment for Latent Generation

面向隐空间生成的表征驱动型内窥镜视觉嵌入对齐

Francisco Caetano, Tim J. M. Jaspers, Haiko Middeljans, Martijn R. Jong, Rixta A. H. van Eijck van Heslinga, Floor Slooter, Albert J. de Groof, Jacques J. Bergman, Peter H. N. De With, Fons van der Sommen

机构 * Eindhoven University of Technology(埃因霍温理工大学) Amsterdam University Medical Centers(阿姆斯特丹大学医学中心) University of Amsterdam(阿姆斯特丹大学)

专题命中 图像修复 :image generation(abstract);diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 本研究针对内窥镜生成模型的领域差距与计算成本问题,提出REVEAL模型,基于500万帧内窥镜数据训练,在多任务中性能优于同类模型,为临床智能工具开发提供基础。

Comments Accepted at the DCA-MI Workshop (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04821 2026-08-06 cs.CV 新提交 70%

Global Attention-Fused Image Cropping with Attention-Guided and Global-Aligned Crop Evaluator

融合全局注意力的图像裁剪方法:基于注意力引导与全局对齐的裁剪评估器

Haotian Yang, Zhile Yang, Kin-Man Lam, Patrick Le Callet, Xin Sun

机构 * Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院) Shenzhen University of Advanced Technology(深圳理工大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) The Hong Kong Polytechnic University(香港理工大学) Nantes Université(南特大学) Ecole Centrale Nantes(南特中央理工学院) CAPACITES SAS(CAPACITES SAS公司) CNRS(法国国家科学研究中心) LS2N, UMR 6004(LS2N实验室(UMR 6004))

专题命中 图像修复 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 该研究提出GAFIC图像裁剪方法,通过AGFF与GACE模块结合多尺度排序损失,在GAIC、CPC数据集上性能优于现有方法,适用于需保证像素完整性与高效批量处理的场景。

Comments The source code is available at https://github.com/AIVRC/GAFIC.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22696 2026-06-23 cs.CV 新提交 70%

NullFlow: One-Step Generative Reconstruction

NullFlow: 一步生成式重建

Xiao Shi, Edward P. Chandler, Chicago Y. Park, Shirin Shoushtari, Ulugbek S. Kamilov

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 图像修复 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 提出NullFlow框架,通过将生成流限制在测量一致子空间实现一步图像重建,无需数据保真校正,学习平均速度避免逐步积分,在图像修复中达到SOTA性能且仅需一次网络评估。

Comments 9 pages, 3 figures. Xiao Shi and Edward P. Chandler contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07115 2026-06-08 cs.CV cs.GR 新提交 62%

3DMorph: Single-Image-Guided Local 3D Shape Editing and Morphing

3DMorph: 单图引导的局部3D形状编辑与变形

Tobias Preintner, Yunfei Deng, Phillip Müller, Sebastian Illing, Adrian König, Thomas Bäck, Elena Raponi, Niki van Stein

机构 * ETH Zürich(苏黎世联邦理工学院)

专题命中 图像修复 :inpainting(abstract);分类 cs.CV、cs.GR

AI总结 提出无训练框架3DMorph,通过单张编辑图像自动定位并转移2D修改到3D局部区域,同时支持中间形状生成,在Delta3D基准上优于现有方法。

Comments Accepted to IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12725 2026-08-14 cs.CV 新提交 57%

A Generative Approach for Improving Multi-Label Defect Classification in Photovoltaic Modules

一种用于改进光伏组件多标签缺陷分类的生成式方法

Abdul Mueez, Yogesh S. Rawat, Shruti Vyas

机构 * University of Central Florida(中佛罗里达大学)

专题命中 图像修复 :inpainting(abstract);分类 cs.CV

AI总结 本文针对光伏组件EL图像多标签缺陷分类的挑战,提出生成式缺陷隔离(GDI)方法,利用带快速傅里叶卷积的LaMa模型生成单缺陷样本,在多种模型上使罕见缺陷F1分数最高提升63.6%,共存分类错误降低26%,为该领域多标签分类设定新基准。

Journal ref Solar Energy 317 (2026) 114943

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11747 2026-08-13 cs.CV 新提交 57%

Making Every Step Count: Spatio-Temporal Information Allocation for Imaging Inverse Problems

让每一步都有价值:面向成像逆问题的时空信息分配

Yi Cao, Xiangyong Cao, Pei Liu, Yong-Jin Liu, Deyu Meng

专题命中 图像修复 :inpainting(abstract);分类 cs.CV

AI总结 该研究针对基于流的成像逆求解器在固定函数评估次数下的时空信息分配缺陷,提出SAS与MPA组件,可即插即用提升超分辨率等任务的图像恢复质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10423 2026-08-12 cs.GR 新提交 57%

Amulet: Frame Extrapolation Through Sparse Layered Scene Representation and Adaptive Shading

Amulet:基于稀疏分层场景表示与自适应着色的帧外推方法

Sebastian Künzel, Fabian Schmierer, Sergej Geringer, Guido Reina, Daniel Weiskopf, Dieter Schmalstieg

专题命中 图像修复 :inpainting(abstract);分类 cs.GR

AI总结 Amulet是一种基于稀疏分层图像空间缓存的非神经帧外推渲染方法,可实现高频帧生成,在4K分辨率下最高达250Hz,性能可与DLSS等最先进方法媲美,能准确处理新露出区域且质量高。

Comments Corresponding Author: Sebastian Künzel

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10286 2026-08-12 cs.CV 新提交 57%

TRACE-GS: On-Policy Trajectory Distillation with Privileged Geometric Conditioning for Sparse-View 3DGS Restoration

TRACE-GS:用于稀疏视图3D高斯溅射(3DGS)恢复的带特权几何条件的在线策略轨迹蒸馏

Linlian Jiang, Yuchen Xi, Sadman Rakib Pinon, Ruigang Yang, Yang Wang, Xinxin Zuo

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 TRACE-GS是首个利用训练时的特权几何条件,将扩散先验适配到稀疏视图3DGS恢复的在线策略轨迹蒸馏框架,在各设置下实现了一致性能提升与强泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09405 2026-08-11 cs.CV 新提交 57%

MeanSR: Restoration Trajectory Learning for One-Step Perceptual Super-Resolution

MeanSR:用于单步感知超分辨率的恢复轨迹学习

Axi Niu, Jiawei Kou, Kang Zhang, Qingsen Yan, Jinqiu Sun, Yanning Zhang

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 MeanSR是一种单步感知超分辨率方法,通过学习LR条件平均速度场并引入阶段感知时间采样策略,在CLIPIQA等指标上优于CTMSR,同时降低计算成本与延迟,提升了重建质量。

Comments 7 pages, 8 figures. Submitted to AAAI 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06981 2026-08-10 cs.CV 新提交 57%

Local Epistemic Uncertainty Guided Active Sampling for Plug-and-play Diffusive Image Restoration

面向即插即用扩散式图像复原的局部认知不确定性引导主动采样

Jiaqi Zhang, Zheng Pang, Rongrong Gao, Qiyuan Zhang, Yang Yang

机构 * Jiangsu University(江苏大学)

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对现有DMIR方法忽略生成过程动态性的局限,提出LEADer框架,通过空间域逐像素不确定性调节与时间域自适应轨迹剪枝,提升图像复原性能并减少采样时间,且可即插即用集成至多种DMIR基线。

Comments 12 Pages, 7 Figures, 5 Tables. Accepted to ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04525 2026-08-06 cs.CV 新提交 57%

Coupled Continuous-Discrete Generation for Scene Text Image Super-Resolution

面向场景文本图像超分辨率的耦合连续-离散生成方法

Axi Niu, Knag Zhang, Qingsen Yan, Hao Jin, Jinqiu Sun, Yanning Zhang

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 针对现有场景文本图像超分辨率(STISR)方法误差传播、成本高的问题,提出统一框架DualTSR,通过耦合连续-离散生成实现高效准确的STISR,在多数据集上表现优于对比方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26641 2026-07-30 cs.CV cs.AI 新提交 57%

FakeIDet3-DB: Refining Digital Attacks and Patch Extraction for Secure ID Benchmarking

FakeIDet3-DB:用于安全身份基准测试的数字攻击与补丁提取优化

Muñoz-Haro Javier, Teruel Andres, Tolosana Ruben, DeAlcala Daniel, Vera-Rodriguez Ruben, Morales Aythami, Fierrez Julian

机构 * School of Engineering, Universidad Autónoma de Madrid(马德里自治大学工程学院)

专题命中 图像修复 :inpainting(abstract);分类 cs.CV

AI总结 针对真实ID数字篡改检测的领域差距,构建首个含520万补丁的FakeIDet3-DB数据库,提出PACE算法,评估显示现有模型对其攻击检测定位性能不佳。

Comments 13 Pages, Database, Pipeline, Algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22793 2026-07-28 eess.IV cs.CV 新提交 57%

Small, Bias-Free, Blind and Convolutional Denoiser: A compact ConvNeXt U-Net for blind Gaussian color-image denoising

小型、无偏差、盲态和卷积去噪器:用于盲高斯彩色图像去噪的紧凑型ConvNeXt U-Net

Nikolas Markou

专题命中 图像修复 :inpainting(abstract);分类 cs.CV

AI总结 研究针对盲高斯彩色图像去噪,提出结合多种要素的紧凑型无偏差ConvNeXt U-Net即BF-ConvUNeXt。通过特殊设计使其具有齐次性,能盲态泛化。训练单一模型,在多数据集多噪声水平下评估表现良好,虽略落后于最优技术,但参数少,还推动相关逆问题研究。

Comments 15 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22924 2026-07-28 cs.CV 新提交 57%

Layering Virtual Try-On

分层虚拟试穿

Chun Feng, Bowei Chen, Mengyi Shan, Ira Kemelmacher-Shlizerman

机构 * University of Washington(华盛顿大学)

专题命中 图像修复 :inpainting(abstract);分类 cs.CV

AI总结 研究针对现实中服装分层搭配的虚拟试穿难题,提出LVTON方法。先通过自动数据生成管道训练获取一般VTON先验知识,再在专用数据集微调学习分层逻辑,在LVTON基准及传统VTON基准上取得优异成果,展现零样本能力。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13460 2026-07-16 cs.CV 新提交 57%

LPM: Industrial-Scale Generative Video Restoration

LPM:工业规模的生成式视频修复

Bichuan Zhu, Fulin Li, Jiachao Gong, Jinhua Hao, Kai Zhao, Kun Yuan, Pengcheng Xu, Qiang Wang, Qiao Mo, Yanlong Yuan, Yizhen Shao, Yuxiao Hu, Zixi Tuo, Ming Sun, Chao Zhou, Bin Chen, Bin Yu

机构 * Kuaishou Technology(快手科技)

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 研究提出工业规模的LPM用于视频修复,通过统一系统解决UGC退化问题,含数据工程、模型训练和推理。其架构等机制实现高保真修复,已在快手生产应用,节省带宽成本,还能集成产品,证明该方法实用、可扩展且具成本效益。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08514 2026-07-10 cs.CV 新提交 57%

Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?

以自我为中心的视频-语言模型是否捕捉了以手和物体为中心的线索?

Masatoshi Tateno, Alexandros Stergiou, Risa Shinoda, Yoichi Sato, Dima Damen

机构 * The University of Tokyo(东京大学) University of Twente(特温特大学) University of Bristol(布里斯托大学)

专题命中 图像修复 :inpainting(abstract);分类 cs.CV

AI总结 研究手部-物体交互识别中现有视频-语言模型的局限,提出结合手部-物体掩码训练与HOI-动态感知解码器的新范式,构建DEHOI测试平台评估,证明该方法更有效利用相关信息,在多方面优于现有模型,提升HOI理解。

详情

展开后加载摘要…

URL PDF HTML 收藏