arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 47 信号源:cs.CV, cs.GR, cs.MM

1. 图像修复 47 篇

2607.05354 2026-07-07 cs.CV 新提交 57%

Geometric Reciprocity: Unlocking Self-Supervision for Stereoscopic Video Generation

几何互易性:解锁立体视频生成的自监督能力

Jingyi Lu, Kai Han

机构 * Visual AI Lab, The University of Hong Kong, Hong Kong, China(香港大学视觉人工智能实验室)

专题命中 图像修复 :inpainting(abstract);分类 cs.CV

AI总结 针对单目转立体任务中立体修复依赖稀缺标注数据的问题,提出几何互易性定理,构建自监督框架,从海量单目视频学习,性能远超现有无监督、监督SOTA方法。

Comments Accepted to ICML 2026. Project page: https://visual-ai.github.io/grt/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02952 2026-07-07 cs.CV cs.AI 新提交 57%

Pooling-Based Context Modeling for Convolution-Free Deep Image Prior

基于池化的无卷积深度图像先验的上下文建模

Gihyun Kim, Jong-Seok Lee

机构 * Yonsei University(延世大学)

专题命中 图像修复 :inpainting(abstract);分类 cs.CV

AI总结 研究提出Pool-DIP,一种无卷积架构,通过基于池化的对比建模捕捉空间上下文,提升去噪性能,减少参数和计算复杂度,在多数据集表现良好,还能用于其他图像恢复任务。

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00522 2026-07-02 cs.CV 新提交 57%

Restore3D: Breathing Life into Broken Objects with Shape and Texture Restoration

Restore3D:通过形状和纹理修复为破损物体注入生机

Xiaolong Shen, Zongxin Yang, Yi Yang

机构 * ReLER, CCAI, Zhejiang University(ReLER、CCAI、浙江大学)

专题命中 图像修复 :inpainting(abstract);分类 cs.CV

AI总结 提出Restore3D框架,利用多视图图像同时修复破损物体的几何形状和纹理,通过自动数据生成、掩码自感知模块和深度感知掩码修正器生成高分辨率多视图图像,再经粗到细重建获得带纹理的3D网格。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27576 2026-06-29 cs.CV 新提交 57%

DeLux: Cross-Modal Local Artifact Restoration in Video Using Neuromorphic Data

DeLux: 利用神经形态数据进行视频中的跨模态局部伪影修复

Bartosz Stachowiak, Dariusz Brzezinski

机构 * Institute of Computing Science, Poznan University of Technology(波兹南技术大学计算机科学学院)

专题命中 图像修复 :inpainting(abstract);分类 cs.CV

AI总结 提出DeLux,一种利用神经形态事件流作为结构先验,引导RGB视频中光照伪影检测与修复的跨模态修复方法,在合成和真实数据上优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21910 2026-06-23 cs.CV 新提交 57%

Fidelity- and Perception-Aware Local Implicit Attention for Arbitrary-Scale Image Super-Resolution

保真度与感知感知的局部隐式注意力用于任意尺度图像超分辨率

Yu-Syuan Xu, Hao-Lun Sun, Hao-Wei Chen, Hsien-Kai Kuo, Chun-Yi Lee

机构 * National Taiwan University(国立台湾大学) MediaTek Inc.(联发科技股份有限公司)

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 提出FPLIA框架,通过融合保真度导向特征与扩散管道,结合FPAM和FPSM模块,在任意尺度超分辨率中实现高感知真实度与重建精度。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17557 2026-06-17 cs.CV 新提交 57%

Universal Image Restoration via Internalized Chain-of-Thought Reasoning

通过内化思维链推理的通用图像恢复

Yu Guo, Zhengru Fang, Shengfeng He, Senkang Hu, Yihang Tao, Phone Lin, Yuguang Fang

机构 * Hong Kong JC Lab of Smart City and Department of Computer Science, City University of Hong Kong(香港城市大学智慧城市香港联合实验室及计算机科学系) School of Computing and Information Systems, Singapore Management University(新加坡管理大学计算与信息系统学院) Computer Science and Information Engineering, National Taiwan University(国立台湾大学计算机科学与信息工程学系)

专题命中 图像修复 :image editing(abstract);分类 cs.CV

AI总结 提出CoTIR框架,将思维链推理内化到单个预训练编辑模型中,通过可微拉格朗日优化实现混合退化下的通用图像恢复,在5.2M样本基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16396 2026-06-16 cs.CV eess.IV 新提交 57%

SP$^3$: Spherical Priors for Plug-and-Play Restoration

SP$^3$:用于即插即用恢复的球面先验

Sean Man, Ron Raphaeli, Matan Kleiner, Or Ronai

机构 * Technion – Israel Institute of Technology(以色列理工学院) Independent Researcher(独立研究员)

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 提出SP$^3$算法,用球面编码器替代去噪器作为生成先验,通过半二次分裂实现快速图像恢复,速度比零样本扩散方法快3-630倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15158 2026-06-16 cs.CV 新提交 57%

RefGC-SR$^2$: Reference-guided Generated Content Super-Resolution and Refinement

RefGC-SR$^2$: 参考引导的生成内容超分辨率与精炼

Jeahun Sung, Dahyeon Kye, Soo Ye Kim, Jihyong Oh

机构 * CMLab, Chung-Ang University(Chung-Ang 大学 CMLab) Adobe Research(Adobe 研究院)

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 针对生成管道中参考图像下采样导致细节丢失和伪影问题,提出RefGC-SR$^2$任务,利用原始高分辨率参考图像同时恢复细节、精炼伪影并提升分辨率,构建首个真实三元组数据生成管道并设计频率感知扩散Transformer模型。

Comments The first two authors contributed equally to this work. The last two authors are co-corresponding authors. Please visit our project page at https://cmlab-korea.github.io/RefGC-SR2/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09516 2026-06-09 cs.CV 新提交 57%

SwiftVR: Real-Time One-Step Generative Video Restoration

SwiftVR:实时一步生成式视频恢复

Jiaqi Yan, Xiangyu Chen, Xinlin Zhong, Haibin Huang, Chi Zhang, Jie Liu, Jiantao Zhou, Xuelong Li

机构 * State Key Laboratory of Internet of Things for Smart City, Department of Computer and Information Science, University of Macau(澳门大学智慧城市物联网国家重点实验室) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院(TeleAI)) State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 提出SwiftVR,一种流式一步生成式视频恢复框架,通过因果分块协议、无掩码移位窗口自注意力和轻量级恢复感知自编码器,在消费级GPU上实现实时高清视频恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07090 2026-06-08 cs.CV 新提交 57%

Detecting Temporally Localized Manipulations in Authentic Video Streams

检测真实视频流中的时间局部操纵

Okan Umur, Ali Emre Güşlü, Ibrahim Delibasoglu

机构 * Okan Umur Ali Emre Güşlü Ibrahim Delibasoglu

专题命中 图像修复 :inpainting(abstract);分类 cs.CV

AI总结 针对真实视频中插入短时逼真操纵片段难以检测的问题,提出新数据集并评估两种方法:基于DINOv3特征的线性探针和连续帧相似性方法,建立初步基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11572 2026-08-13 cs.LG physics.comp-ph 新提交 50%

RECAST: A Machine-Learning Framework for Correction and Super-Resolution of Coarse-Grid PDE Solvers

RECAST:用于粗网格PDE求解器校正与超分辨率的机器学习框架

Maryam Reza, Farbod Faraji

专题命中 图像修复 :diffusion(abstract)

AI总结 该研究提出机器学习框架RECAST,可在保留粗网格PDE演化的同时降低约50%-92%的时间平均相对误差,实现更粗网格的高精度PDE模拟,为高维数值模拟加速提供概念验证。

Comments 29 pages, 24 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04378 2026-08-06 cs.SD cs.LG eess.AS 新提交 50%

Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation

助力音乐协同创作智能体“良好聆听”:用于理解与生成的分层自监督世界模型

Scott H. Hawley

机构 * Belmont University(贝尔蒙特大学)

专题命中 图像修复 :inpainting(abstract)

AI总结 本研究提出分层自监督世界模型,通过Swin V2编码器与条件流匹配模型构建协同音乐创作智能体,提升了和弦与调式检测准确率,可快速生成音乐建议并支持交互演示。

Comments 20 pages, 14 figures. A 6-page version was submitted to the NeurIPS 2026 Creative AI Track. Supplemental website with listening examples: https://drscotthawley.github.io/midi-rae-jepa-son/. Live demo: https://drscotthawley-midi-rae-jepa-son.hf.space/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27308 2026-07-31 cs.LG q-bio.NC 新提交 50%

ZUNA1.1: A more flexible EEG foundation model for Denoising and Super-resolution

ZUNA1.1:一种更灵活的用于去噪和超分辨率的脑电图(EEG)基础模型

Christopher Warner, Jonas Mago, JR Huml, Beren Millidge

机构 * Zyphra

专题命中 图像修复 :diffusion(abstract)

AI总结 研究推出3.8亿参数的EEG基础模型ZUNA1.1,其灵活性远超原模型ZUNA1,在EEG去噪与重建任务中性能达标且显著优于MNE包的球形样条插值,已以Apache 2.0许可开源发布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25147 2026-07-29 cs.AI 新提交 50%

Inferring Missing Trajectory Data with Temporal Convolutional Networks

使用时间卷积网络推断缺失的轨迹数据

Ilinca Tiriblecea, Gabriel Turinici

机构 * CEREMADE, Université Paris Dauphine - PSL, CNRS(巴黎第九大学 - 巴黎文理研究大学、法国国家科学研究中心决策数学与经济实验室)

专题命中 图像修复 :inpainting(abstract)

AI总结 针对现实中轨迹数据常缺失的问题,提出用带对称扩张的时间卷积网络进行轨迹修复,放宽因果关系约束,利用组合损失训练,在含随机掩码片段的合成数据集上训练,取得良好的R²、MSE和MAE指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12571 2026-07-15 cs.RO 新提交 50%

TrustVLA: Mechanism-Guided Inference-Time Defense Against Vision-Language-Action Backdoors

TrustVLA:针对视觉-语言-动作后门的机制引导推理时防御

Pinhan Fu, Xianda Guo, Xuetao Li, Wenke Huang, Ruilin Wang, Weiheng Zhao, Wei Sui, Mang Ye

机构 * School of Computer Science, Wuhan University(武汉大学计算机科学学院) D-Robotics(D-机器人公司) HUST(华中科技大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 图像修复 :inpainting(abstract)

AI总结 研究视觉-语言-动作模型中毒后门问题,通过两种攻击识别出紧凑因果足迹机制,基于此提出TrustVLA防御,能检测异常证据演变、定位支持并恢复观测,在多评估中降低攻击成功率且保持干净任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19161 2026-06-18 cs.RO 新提交 50%

HT-Bench: Benchmarking and Learning Dexterous Full-Hand Tactile Representations with Egocentric Vision

HT-Bench:基于自我中心视觉的灵巧全手触觉表示基准与学习

Yuzhe Huang, Jiaping Wu, Jiaming Jiang, Hezhe Lin, Aikebaier Aierken, Yunlong Wang, Kun Cheng, Ziyuan Jiao, Yuanxin Zhong

机构 * Beihang University(北航) Rimbot BUPT(北邮) ShanghaiTech University(上海科技大学) Tsinghua University(清华大学) CAS(中国科学院)

专题命中 图像修复 :inpainting(abstract)

AI总结 提出HT-Bench多任务基准和HandTouch编码器,通过大规模自我中心视觉与全手触觉数据,在触觉相似性检索、掩码修复、视觉到触觉合成等任务上验证了触觉表示的有效性。

Comments 9pages, 4figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14800 2026-06-16 stat.ME cs.LG eess.IV stat.ML 新提交 50%

Bridging data-driven priors via the score function for posterior sampling -- Comparative review and experimental study

通过得分函数桥接数据驱动先验进行后验采样——比较综述与实验研究

Elhadji Cisse Faye, Mame Diarra Fall, Sylvain Delchini, Nicolas Dobigeon

机构 * IDP, Univ Orléans(IDP,奥尔良大学) LITIS, Univ Rouen Normandie(LITIS,鲁昂-诺曼底大学) Bureau de Recherches Géologiques et Minières Orléans, France(奥尔良地质与矿业研究局,法国) IRIT, Univ Toulouse(图卢兹大学IRIT)

专题命中 图像修复 :inpainting(abstract)

AI总结 本文综述了贝叶斯逆问题中多种数据驱动先验如何通过得分函数统一,并展示其在采样算法中的有效集成,通过图像修复和超分辨率实验验证了方法的效率与通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏