arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2962 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 2264 篇

2608.05776 2026-08-07 cs.CV 新提交 57%

Vorch-Director: Interactive World Story Model via Noise-Aware Error Rectification

Vorch-Director:基于噪声感知误差校正的交互式世界故事模型

Lisai Zhang, Yidi Wu, Qi Liu, Xin Ma, Yang Ding, Gang Yue, Siqian Yang, Jingyuan Chen, Lin Ma, Yaohui Wang

机构 * Vorch Team(Vorch团队) Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 Vorch-Director是一种噪声感知残差校正策略,基于LTX-2扩散Transformer,可提升视听长视频生成的稳定性与保真度,支持多镜头、多主体的参考引导生成。

Comments Project page: https://vorch-project.github.io/Vorch-Director-project

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05626 2026-08-07 cs.CV 新提交 57%

Dual-Output Multi-Exposure HDR Reconstruction via SDR Fusion and Gain Map Inverse Tone Mapping

通过SDR融合与增益图逆色调映射实现双输出多曝光HDR重建

Jinho Kim, Jinwoo Kim, Seon Joo Kim

机构 * Yonsei University(延世大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出DOME-HDR框架,通过LoRA适配的潜在扩散模型与双交叉注意力融合模块生成SDR,结合HPGM网络预测增益图实现多曝光HDR重建,在多个数据集上达到最优性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05557 2026-08-07 cs.CV 新提交 57%

Hierarchical Flow Matching for 3D Point Cloud Generation

用于三维点云生成的分层流匹配

Linhao Wang, Qichang Zhang, Ye Su, Hao Wang

机构 * Shandong Normal University(山东师范大学) University of Macau(澳门大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对现有三维点云生成方法的缺陷,提出分层流匹配(HFM),将流匹配扩展为双级结构,在ShapeNet等基准上实现了有竞争力的生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05450 2026-08-07 cs.CV 新提交 57%

MOSAIK: Multi-Patch Content-Aware Spatial Allocation of Image Tokens for Efficient Generation

MOSAIK:用于高效生成的图像令牌多补丁内容感知空间分配

Mohammadreza Hami, Mohammadreza Samadi, Chao Gao, Negar Hassanpour

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 MOSAIK是一种损伤引导的异构补丁布局框架,适配PixelDiT骨干,通过区域分配补丁大小,在大幅降低计算量和令牌数的同时,保持与全计算PixelDiT相当的生成性能,且在高计算约束下优于其他效率方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05728 2026-08-07 cs.CV cs.LG physics.optics 新提交 57%

Engram-E2VID: Reference-Based Event-to-Video Reconstruction via Generative Activation of Appearance Engrams

Engram-E2VID:基于外观印迹生成激活的参考式事件到视频重建方法

Feiyu Ji, Xiang Li, Hao Ma, Tianxiang Huang, Qingxin Lu, Mengqi Ji, Lei Han, Xiaokang Yang, Xiaoyun Yuan

机构 * Shanghai Jiao Tong University(上海交通大学) Beihang University(北京航空航天大学) DISCOVER Robotics(DISCOVER机器人公司)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出Engram-E2VID框架,通过外观印迹生成激活实现参考式事件到视频重建,在三个基准测试中PSNR最高提升3.29 dB、LPIPS最高降低0.08,性能随重建间隔增加下降更慢。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05471 2026-08-07 eess.IV cs.CV cs.LG physics.med-ph 新提交 57%

A Foundational EDM2-Based Generative Model for High-Resolution Synthetic Fetal Ultrasound Imaging from Open Datasets

基于EDM2的高分辨率合成胎儿超声成像基础生成模型,源自开放数据集

Harvey Mannering, Yilin Zhang, Ziao Liu, Zhiwu Huang, Jacqueline Matthew, Miguel Xochicale

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对胎儿超声AI数据稀缺问题,提出基于EDM2的合成框架,生成512×512图像,在分类任务中准确率达93.36%,优于真实数据训练结果,为胎儿超声AI提供开放资源。

Comments Short paper for the 30th Conference on Medical Image Understanding and Analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04902 2026-08-06 cs.CV cs.LG cs.SD 新提交 57%

Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation

视觉表示很重要:利用视频到音频生成中的时间差异

Zehua Chen, Junyou Wang, Yuxuan Jiang, Zhenying Fang, Yusheng Dai, Jianfei Chen, Ziwei Liu, Jun Zhu

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对现有基于条件扩散的视频到音频(V2A)生成方法需额外网络或强归纳偏置的问题,提出TD-V2A框架,利用时间差异(TD)增强视觉条件,提升了V2A生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04818 2026-08-06 cs.CV 新提交 57%

Rethinking Pixel Mean Flows via Interval Denoiser

通过区间去噪器重新思考像素均值流

Alexander Zaytsev, Dmitry Baranchuk, Alexander Korotin, Aibek Alanov

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对扩散与流模型的计算及重建瓶颈,提出Interval Denoiser框架,经训练在ImageNet 256x256上实现少步生成的低FID值,提升了少步生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04557 2026-08-06 cs.CV 新提交 57%

VoxStruct3D: Structure-Leading Flow Matching for Voxel-Space 3D MRI Synthesis

VoxStruct3D:用于体素空间3D MRI合成的结构引导流匹配方法

Fang Li, Yang Gao, Shihao Zou, Weixin Si, Hongyu Wu, Qing Xia, Shuai Li, Aimin Hao

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出VoxStruct3D,一种体素空间流匹配框架,通过结构优先策略引导,在T1加权脑MRI合成任务上实现了特征分布对齐、样本多样性等指标的最优性能,生成的体积解剖连贯且视觉真实。

Comments Project page: https://neesky.github.io/VoxStruct3D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03517 2026-08-05 cs.CV 新提交 57%

GVCCTurbo: Rate-Compute Quality Scheduling for Codebook Driven Generative Compression

GVCCTurbo:基于码本驱动生成压缩的码率-计算量质量调度

Ziyue Zeng, Dingjie Peng, Xun Su, Hiroshi Watanabe

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 GVCCTurbo是一种BPP驱动的调度器,分离生成压缩的先验刷新与码本校正,降低解码时间,在低码率下提升压缩性能且兼容多种生成压缩模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03422 2026-08-05 cs.CV 新提交 57%

HyperbolicDiffusion: Sharp & Scalable Tiled Generation on the Hyperbolic Plane

HyperbolicDiffusion:双曲平面上的清晰且可扩展的平铺生成

Hugo Caselles-Dupré

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出无需训练的HyperbolicDiffusion方法,通过Hyperbolic Blooming Cover与几何修复阶段,在双曲平面H²上生成清晰、可重投影且跨视点一致的视觉场,为埃舍尔《圆极限》系列提供生成对应物。

Comments Work in progress. Updated version incoming

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03198 2026-08-05 cs.CV cs.RO 新提交 57%

Bridging Online and Offline Handwriting via Differentiable Physical Rendering

通过可微物理渲染连接在线与离线手写文字

Seonmi Park, Seunghyun Shin, Vihaan Misra, Dongmin Shin, Ukcheol Shin, Jean Oh, Hae-Gon Jeon

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出统一在线-离线手写生成框架,通过物理画笔模型与可微渲染模块解决两类手写生成范式的缺陷,经实验验证实现了结构与视觉保真度。

Comments Accepted at ECCV 2026, Project page: https://seonmip.github.io/onoff

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03046 2026-08-05 cs.CV 新提交 57%

CAPE-T2V: Captioner-Anchored Prompt Enhancement toward Two-Sided Conditioning Alignment in Text-to-Video Generation

CAPE-T2V:面向文本到视频生成中双侧条件对齐的以字幕生成器为锚点的提示增强方法

Yizhuo Jia, Jingyun Hua, Yuanxing Zhang

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对文本到视频生成中存在的PE-字幕 gap,提出CAPE-T2V框架,通过两步微调PE与DiT,在多个基准数据集上实现了更高的生成综合得分,有效缩小了训练与推理间的条件不匹配。

Comments Includes appendix; 11 figures. Project page: https://github.com/yizzz927/CAPE-T2V

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02053 2026-08-04 eess.IV cs.CV 新提交 57%

Protocol generalisation for brain tissue microstructure estimation via hypernetwork-controlled geometric deep learning

基于超网络控制的几何深度学习的脑组织微结构估计的协议泛化

Andrea Brigliadori, Leevi Kerkela, Hui Zhang

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种融入b-值依赖的超网络控制SCNN架构,实现b-值与b-向量泛化及旋转等变性,提升了脑组织微结构估计的鲁棒性与临床适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00137 2026-08-04 eess.IV cs.CV 新提交 57%

RPL-UIE: Reliable Prior Learning for Underwater Image Enhancement

RPL-UIE:面向水下图像增强的可靠先验学习

Yifan Chen, Jiaming Liu, Ye Zheng, Zhe Sun, Tao Chen

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对水下图像增强的语义漂移问题,提出RPL-UIE两阶段教师-学生框架,结合RPRD与FPRD缩小师生模型先验学习差异,在基准测试、下游视觉任务及真实ROV数据上表现良好。

Comments 14 pages, 10 figures, and 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02177 2026-08-04 cs.CV 新提交 57%

GSRAIN: Physically Calibrated High-/Low-Frequency Rainfall Synthesis for 3D Gaussian Driving Scenes

GSRAIN:面向3D高斯溅射(3DGS)驾驶场景的物理校准高低频降雨合成方法

Fanyu Wang, Longgao Zhang, Junyi Chen

机构 * College of Automotive and Energy Engineering, Tongji University(同济大学汽车与能源工程学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 GSRAIN针对自动驾驶降雨模拟的物理可控性与多视图一致性局限,结合实测数据与几何感知扩散模型生成可控降雨场景,在FID指标上优于现有方法,可用于自动驾驶算法的雨天测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01990 2026-08-04 cs.CV cs.AI 新提交 57%

SPARE: Structural Parameter-Free Affinity Regularization for Flow Matching

SPARE:用于流匹配的无结构参数亲和力正则化

Zong-Wei Hong, Jinglun Li, Shen Zhang, Yuhan Liu, Linze Li, Yao Tang

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对去噪扩散Transformer训练收敛慢的问题,提出无结构参数亲和力正则化SPARE,利用跨图像标记对的结构实现正则化,在ImageNet数据集上取得优异生成性能,内存开销极小。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01896 2026-08-04 cs.CV 新提交 57%

GeoCore-9B: Towards Geo-Aware Generative Foundation Models in Earth Observation

GeoCore-9B:面向地球观测的地理感知生成基础模型

Jeonghyeok Do, Munchurl Kim

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文针对现有EO生成模型的地理空间约束冲突问题,推出90亿参数的GeoCore-9B,采用Flow Matching的DiT与地理空间元数据条件生成,结合地理空间语义对齐损失,在多项EO任务上实现最优性能。

Comments Please visit our project page at https://kaist-viclab.github.io/GeoCore-9B_site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01771 2026-08-04 cs.CV 新提交 57%

LiveLight: Real-time Streaming Video Relighting with Interactive Control

LiveLight:具备交互式控制的实时流视频重光照

Yue Ma, Jiangming Wang, Yucheng Wang, Xilai Wang, Zhiyuan Li, Xinyu Wang, Hongyu Liu, Ruofan Liang, Songchun Zhang, Yuxuan Xue, Qifeng Chen

机构 * HKUST(香港科技大学) University of Macau(澳门大学) THU(清华大学) UoT(多伦多大学) University of Tuebingen(蒂宾根大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出首个基于扩散模型的实时流视频重光照框架LiveLight,通过三项关键设计解决三大挑战,在实时速度下达到最优重光照质量,将公开发布相关资源以推动该领域研究。

Comments Accepted by TOG 2026. Project page: https://living-lighting.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01306 2026-08-04 cs.CV 新提交 57%

SPAE: Spectrally Guided Autoencoder for Pretrained Visual Latents

SPAE:用于预训练视觉隐层的频谱引导自编码器

Yibin Huang, Jixiang Hong, Zongzhao Li, Yuhan Dai, Zhibin Wang, Chunwei Wang, Jun Song, Chen Wang, Xiaofei Sun, Xiaoxiao Xu, Conghui Zhu

机构 * Alibaba Group(阿里巴巴集团) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)

专题命中 扩散模型 :image generation(abstract);分类 cs.CV

AI总结 针对DiT生成隐层与编码器隐层的频谱不匹配问题,提出SPAE框架,通过紧凑瓶颈结构与通道级掩码策略实现隐层适配,在视觉理解、生成质量与重建保真度间取得良好平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00079 2026-08-04 cs.CV cs.SD 新提交 57%

LeapTalk: Breaking the Latency-Quality Trade-off in Talking Head Generation

LeapTalk:打破说话头生成中的延迟-质量权衡

Rongxiang Zhang, Songhua Liu

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 LeapTalk是一种新型说话头生成框架,通过单步前向传播结合数据到数据传输、异质蒸馏与音频驱动无分类器引导,实现了200 FPS的稳定实时生成,打破了延迟-质量权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29545 2026-08-03 cs.CV 新提交 57%

MoRoute: Dynamic Routing for In-Context Multimodal Video Generation

MoRoute:面向上下文多模态视频生成的动态路由

Chong Gao, Jie Ma, Zhan Peng, Chongxiao Wang, Haoxue Wu, Jun Liang, Guanbin Li, Jing Li

机构 * Sun Yat-sen University(中山大学) HUJING Digital Media & Entertainment Group(沪景数字媒体娱乐集团) Huazhong University of Science and Technology(华中科技大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 MoRoute是采用动态层路由连接VLM与视频DiT的多模态视频生成框架,在三个基准数据集上均优于现有最优方法,提升了视频生成与编辑的性能。

Comments Project page: https://orange-3dv-team.github.io/MoRoute/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28760 2026-08-03 cs.CV cs.AI cs.LG stat.ML 新提交 57%

WaiT for the Signal: Simple Frequency-Aware Flow-Matching

面向信号的WaiT:简单的频率感知流匹配

Krunoslav Lehman Pavasovic, Théophane Vallaeys, Stéphane Mallat, Giulio Biroli, Luke Zettlemoyer, Brian Karrer, Jakob Verbeek

机构 * FAIR, Meta(FAIR(Meta旗下研究机构)) École Normale Supérieure(巴黎高等师范学院) Sorbonne University(索邦大学)

专题命中 扩散模型 :image generation(abstract);分类 cs.CV

AI总结 该研究提出频率感知流匹配模型WaiT,通过无损小波分解生成过程,引入三轴评估协议,在ImageNet等数据集上实现SOTA生成性能,采样计算量降低50%,还可无缝扩展至视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28737 2026-08-03 cs.LG cs.CV cs.RO 新提交 57%

Mirror Learning

镜像学习

Yunpeng Liu, Matthew Niedoba, Oluwanifemi A. Adekanye, Jason Yoo, Yingchen He, Berend Zwartsenberg, Frank Wood

机构 * University of British Columbia(不列颠哥伦比亚大学) Inverted AI Amii

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出镜像学习框架,通过视频扩散模型的视角变换与逆动力学模型合成镜像数据,用其增强行为克隆训练可提升策略性能,为数据收集提供替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28581 2026-07-31 cs.CV 新提交 57%

ROAD: Reciprocal-Objective Alignment of Discriminative Semantics for 3D Shape Generation

ROAD:用于3D形状生成的判别式语义的互目标对齐

Xiao Luo, Mingyang Du, Xin Zhou, Tianrui Feng, Xiwu Chen, Xiaofan Li, Jiangning Zhang, Dingkang Liang

机构 * Huazhong University of Science and Technology(华中科技大学) Megvii(旷视科技) Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 ROAD框架通过迁移判别式3D基础模型的先验,采用互目标对齐策略,仅用1.5%训练数据就实现了高保真3D生成,大幅降低了计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28470 2026-07-31 cs.AI cs.CV 新提交 57%

Towards Autonomous Aircraft Surveillance from Nanosatellites through On-Board Inference and Generative Data Augmentation

基于星上推理与生成式数据增强的纳卫星自主飞机监视技术研究

Antonio Delgado-Rosa, David Muñoz-Valero, Enrique Adrian Villarrubia-Martin, Juan Moreno-Garcia

机构 * Universidad de Castilla–La Mancha(卡斯蒂利亚-拉曼恰大学) Universidad de Castilla-La Mancha(卡斯蒂利亚-拉曼恰大学) Escuela de Ingeniería Industrial y Aeroespacial de Toledo(托莱多工业与航空航天工程学院) Escuela Superior de Informática(高等信息学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对纳卫星机载监视的下行链路瓶颈与数据集类别不平衡问题,提出结合星上推理与生成式数据增强的工作流,提升了检测精度与帧率,可作为实时自主监视的决策支持工具。

Comments 43 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28039 2026-07-31 cs.CV 新提交 57%

TongueReenact: Geometry-Anchored Tongue Synthesis for Face Reenactment

TongueReenact:几何锚定的人脸重演舌部合成

MD Wahiduzzaman Khan, Mingshan Jia, Xiaolin Zhang, En Yu, Kaska Musial-Gabrys

机构 * University of Technology Sydney(悉尼科技大学) Shandong University of Science and Technology(山东科技大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出首个跨身份舌部动态迁移框架,结合 foundation model 辅助的自举流水线与空间约束潜在掩码扩散模型,在舌部指标上较基线提升超两倍,且 VLM 评估证实其感知优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27749 2026-07-31 cs.CV cs.RO 新提交 57%

Articulated Object Reconstruction from Rest-State Observation

从静止状态观测的关节对象重建

Daeun Lee, Jaeah Lee, Woosung Kim, Haebeom Jung, Jaesik Park

机构 * Seoul National University(首尔大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对需多关节状态运动观测的现有关节对象重建方法的局限,提出从单一静止闭合配置重建关节对象的方法,通过显式网格融合多模型输出,结合视频扩散模型实现无运动观测下的关节参数估计,性能与多种基线相当。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27634 2026-07-31 cs.CV 新提交 57%

4DHumanDiff: Direct Text-to-4DGS Generation for Consistent 360-Degree Dynamic Humans

4DHumanDiff:直接基于文本生成4DGS以实现一致的360度动态人类

Renlong Wu, Haoran Chen, Yuxiang Wei, Xiaowei Jin, Wangmeng Zuo, Hui Li

机构 * School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对文本生成360度动态人类的现有方法存在成本高、一致性差的问题,本文提出4DHumanDiff扩散框架,直接基于文本生成4DGS表示的动态人类,结合新数据集与技术,实现高效且一致性更好的生成。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27372 2026-07-31 cs.LG cs.AI cs.CL cs.CV 新提交 57%

Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation

探索式建模:解锁第三大预训练轴与端到端生成

Alexi Gladstone, Heng Ji, Yilun Du

机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) Harvard(哈佛大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出探索式建模(XMs),为生成式模型增添第三预训练轴,可提升多域性能与效率,还能实现端到端重构生成建模,推理步骤大幅减少。

详情

展开后加载摘要…

URL PDF HTML 收藏