arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2289 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 2289 篇

2607.29545 2026-08-03 cs.CV 新提交 57%

MoRoute: Dynamic Routing for In-Context Multimodal Video Generation

MoRoute:面向上下文多模态视频生成的动态路由

Chong Gao, Jie Ma, Zhan Peng, Chongxiao Wang, Haoxue Wu, Jun Liang, Guanbin Li, Jing Li

机构 * Sun Yat-sen University(中山大学) HUJING Digital Media & Entertainment Group(沪景数字媒体娱乐集团) Huazhong University of Science and Technology(华中科技大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 MoRoute是采用动态层路由连接VLM与视频DiT的多模态视频生成框架,在三个基准数据集上均优于现有最优方法,提升了视频生成与编辑的性能。

Comments Project page: https://orange-3dv-team.github.io/MoRoute/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28760 2026-08-03 cs.CV cs.AI cs.LG stat.ML 新提交 57%

WaiT for the Signal: Simple Frequency-Aware Flow-Matching

面向信号的WaiT:简单的频率感知流匹配

Krunoslav Lehman Pavasovic, Théophane Vallaeys, Stéphane Mallat, Giulio Biroli, Luke Zettlemoyer, Brian Karrer, Jakob Verbeek

机构 * FAIR, Meta(FAIR(Meta旗下研究机构)) École Normale Supérieure(巴黎高等师范学院) Sorbonne University(索邦大学)

专题命中 扩散模型 :image generation(abstract);分类 cs.CV

AI总结 该研究提出频率感知流匹配模型WaiT,通过无损小波分解生成过程,引入三轴评估协议,在ImageNet等数据集上实现SOTA生成性能,采样计算量降低50%,还可无缝扩展至视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28737 2026-08-03 cs.LG cs.CV cs.RO 新提交 57%

Mirror Learning

镜像学习

Yunpeng Liu, Matthew Niedoba, Oluwanifemi A. Adekanye, Jason Yoo, Yingchen He, Berend Zwartsenberg, Frank Wood

机构 * University of British Columbia(不列颠哥伦比亚大学) Inverted AI Amii

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出镜像学习框架,通过视频扩散模型的视角变换与逆动力学模型合成镜像数据,用其增强行为克隆训练可提升策略性能,为数据收集提供替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28581 2026-07-31 cs.CV 新提交 57%

ROAD: Reciprocal-Objective Alignment of Discriminative Semantics for 3D Shape Generation

ROAD:用于3D形状生成的判别式语义的互目标对齐

Xiao Luo, Mingyang Du, Xin Zhou, Tianrui Feng, Xiwu Chen, Xiaofan Li, Jiangning Zhang, Dingkang Liang

机构 * Huazhong University of Science and Technology(华中科技大学) Megvii(旷视科技) Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 ROAD框架通过迁移判别式3D基础模型的先验,采用互目标对齐策略,仅用1.5%训练数据就实现了高保真3D生成,大幅降低了计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28470 2026-07-31 cs.AI cs.CV 新提交 57%

Towards Autonomous Aircraft Surveillance from Nanosatellites through On-Board Inference and Generative Data Augmentation

基于星上推理与生成式数据增强的纳卫星自主飞机监视技术研究

Antonio Delgado-Rosa, David Muñoz-Valero, Enrique Adrian Villarrubia-Martin, Juan Moreno-Garcia

机构 * Universidad de Castilla–La Mancha(卡斯蒂利亚-拉曼恰大学) Universidad de Castilla-La Mancha(卡斯蒂利亚-拉曼恰大学) Escuela de Ingeniería Industrial y Aeroespacial de Toledo(托莱多工业与航空航天工程学院) Escuela Superior de Informática(高等信息学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对纳卫星机载监视的下行链路瓶颈与数据集类别不平衡问题,提出结合星上推理与生成式数据增强的工作流,提升了检测精度与帧率,可作为实时自主监视的决策支持工具。

Comments 43 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28039 2026-07-31 cs.CV 新提交 57%

TongueReenact: Geometry-Anchored Tongue Synthesis for Face Reenactment

TongueReenact:几何锚定的人脸重演舌部合成

MD Wahiduzzaman Khan, Mingshan Jia, Xiaolin Zhang, En Yu, Kaska Musial-Gabrys

机构 * University of Technology Sydney(悉尼科技大学) Shandong University of Science and Technology(山东科技大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出首个跨身份舌部动态迁移框架,结合 foundation model 辅助的自举流水线与空间约束潜在掩码扩散模型,在舌部指标上较基线提升超两倍,且 VLM 评估证实其感知优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27749 2026-07-31 cs.CV cs.RO 新提交 57%

Articulated Object Reconstruction from Rest-State Observation

从静止状态观测的关节对象重建

Daeun Lee, Jaeah Lee, Woosung Kim, Haebeom Jung, Jaesik Park

机构 * Seoul National University(首尔大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对需多关节状态运动观测的现有关节对象重建方法的局限,提出从单一静止闭合配置重建关节对象的方法,通过显式网格融合多模型输出,结合视频扩散模型实现无运动观测下的关节参数估计,性能与多种基线相当。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27634 2026-07-31 cs.CV 新提交 57%

4DHumanDiff: Direct Text-to-4DGS Generation for Consistent 360-Degree Dynamic Humans

4DHumanDiff:直接基于文本生成4DGS以实现一致的360度动态人类

Renlong Wu, Haoran Chen, Yuxiang Wei, Xiaowei Jin, Wangmeng Zuo, Hui Li

机构 * School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对文本生成360度动态人类的现有方法存在成本高、一致性差的问题,本文提出4DHumanDiff扩散框架,直接基于文本生成4DGS表示的动态人类,结合新数据集与技术,实现高效且一致性更好的生成。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27372 2026-07-31 cs.LG cs.AI cs.CL cs.CV 新提交 57%

Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation

探索式建模:解锁第三大预训练轴与端到端生成

Alexi Gladstone, Heng Ji, Yilun Du

机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) Harvard(哈佛大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出探索式建模(XMs),为生成式模型增添第三预训练轴,可提升多域性能与效率,还能实现端到端重构生成建模,推理步骤大幅减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26646 2026-07-30 cs.CV 新提交 57%

Genie Sim PanoWorld: An Infinite Indoor 3D World Generation Pipeline via Panoramic Scene Modeling and Simulation

Genie Sim PanoWorld:基于全景场景建模与仿真的无限室内3D世界生成流水线

Yongxin Su, Linjie Hou, Feng Wang, Jialin Tang, Zhijun Li, Qian Wang, Maoqing Yao

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 Genie Sim PanoWorld是两阶段前馈流水线,从单张360°全景生成可自由导航的高保真3D高斯场景,优于几何条件基线,且能零样本泛化至未见室内场景

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25948 2026-07-29 cs.CV cs.AI cs.LG 新提交 57%

MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities

MODUS:仅解码器的多模态任意到任意建模

Mingqiao Ye, Zhaochong An, Zhitong Gao, Xian Liu, François Fleuret, Chuan Li, Amir Zadeh, Serge Belongie, Afshin Dehghan, Jesse Allardice, David Mizrahi, Oğuzhan Fatih Kar, Roman Bachmann, Amir Zamir

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究任意到任意多模态建模,提出仅解码器的对称多模态建模方法Modus,无需特定模态组件,支持多种应用,在各基准测试中用单模型展现强大性能且与基线竞争,材料开源。

Comments Accepted at ICML 2026. Project page: https://modus-multimodal.epfl.ch

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22772 2026-07-28 eess.IV cs.CV 新提交 57%

Generative Video Compression with Adaptive Score Distillation

基于自适应分数蒸馏的生成式视频压缩

Naifu Xue, Zhaoyang Jia, Haosen Li, Zihan Zheng, Jiahao Li, Bin Li, Xiaoyi Zhang, Qi Meng, Yuan Zhang, Yan Lu

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对视频压缩探索专门设计的扩散模型,提出GenVC,通过全局到局部层次结构恢复时空细节,用自适应分数蒸馏加速推理,在超低比特率下实现高质量重建,参数少且解码速度快。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22765 2026-07-28 eess.IV cs.CV 新提交 57%

Frequency-Aware Dual-Stream Learning for Balanced Realism and Fidelity in Electron Microscopy Imaging

电子显微镜成像中用于平衡真实感和保真度的频率感知双流学习

Longmi Gao, Zhengkai Zhao, Pan Gao, Manoranjan Paul

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对电子显微镜成像分辨率与采集速度权衡问题,提出频率自适应双流架构,利用离散小波变换分解图像,通过条件扩散模型和变压器网络分别进行全局合成与细节恢复,实验表明该方法性能优越且泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24436 2026-07-28 cs.CV 新提交 57%

MSVS-VAE: Multi-Scale Anchored VecSet for High-Fidelity 3D Reconstruction

MSVS-VAE:用于高保真3D重建的多尺度锚定向量集

Dehao Hao, Kaiyi Zhang, Tanghui Jia, Xiangjun Gao, Dongyu Yan, Weikai Chen, Zeyu Hu, Lingting Zhu, Yingda Yin, Runze Zhang, Li Yuan, Xin Wang, Long Quan

机构 * The Hong Kong University of Science and Technology(香港科技大学) Peking University(北京大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Lightspeed Studios(光速工作室)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对高保真3D重建中VAE的瓶颈问题,提出MSVS-VAE。通过分层点洗牌上采样 densify 锚定向量集潜在特征,用AVS-Conv取代全局交叉注意力,引入多尺度查询解码融合特征,实验表明其性能优于现有方法,解码速度和紧凑性有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24027 2026-07-28 cs.CV 新提交 57%

Sol-Attn: Accelerating Video Generation Inference via On-the-Fly Attention Sparsification

Sol-Attn:通过即时注意力稀疏化加速视频生成推理

Haopeng Li, Yitong Li, Junsong Chen, Tian Ye, Haozhe Liu, Jincheng Yu, Duomin Wang, Ruihua Zhang, Zeke Xie, Enze Xie, Song Han

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对扩散变压器视频生成中注意力推理瓶颈,提出无训练的Sol-Attn方法,通过即时块阈值处理和代理分数重用统一动态路由等,在图像和视频生成任务实验中实现质量-效率提升,加速视频生成和编辑。

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23493 2026-07-28 cs.CV cs.AI 新提交 57%

Token-Region Guided Cross-Attention Fusion for Multimodal Affect Interpretation

用于多模态情感解释的令牌-区域引导交叉注意力融合

Musa Tur Farazi, Nufayer Jahan Reza

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对孟加拉语模因政治意图检测难题,引入多模态交叉注意力融合框架,利用视觉语言模型提取文本,经跨模态多头注意力机制合成特征,还整合政治词汇表,实验表明该方法显著优于基线,Macro-F1达0.94,有效实现文本语义基于视觉证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23189 2026-07-28 cs.CV cs.AI 新提交 57%

Fashion-3DLR: A Controllable 3D Garment Generation Using Pairwise Fashion Elements for Intelligent Design

Fashion-3DLR:一种使用成对时尚元素进行智能设计的可控3D服装生成方法

Shenghao Yang, Hongtao Zhang, Yuhan Yi, Zhihao Tang, Zihao Cui, Lian Wen, Han Yan, Yuan Gao, Mingbo Zhao

机构 * Donghua University(东华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对3D服装生成难题,提出Fashion-3DLR框架,通过GFF-DiT模块融合2D时尚设计元素,利用整流流Transformer生成几何潜在值,实现多种3D服装表示,并集成到下游任务,实验证明其超越现有方法,有成为通用3D服装设计工具的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22740 2026-07-28 cs.CV 新提交 57%

A Diagnostic Gap Framework for Evaluating Reconstruction Fidelity in Weakly Supervised Mammography

用于评估弱监督乳腺X线摄影中重建保真度的诊断差距框架

Vinceline Bertrand, Ionut Cardei

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对弱监督医学成像系统各阶段临床信息保留评估有限的问题,提出诊断差距框架,通过对特定病变ROI作物评估三个重建器,依重建保真度衡量决策与解释保留,能识别多阶段管道何时何地丢失诊断信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21592 2026-07-24 cs.CV 新提交 57%

Unified Video Dense Prediction from Disjoint Data

从不相交数据进行统一视频密集预测

Yihong Sun, Seoung Wug Oh, Jiahui Huang, Bharath Hariharan, Joon-Young Lee

机构 * Adobe Research(Adobe 研究院) Cornell University(康奈尔大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究旨在解决现有任务特定注释分散问题,提出统一视频模型UniD,从不相交特定领域数据集联合预测八个密集场景属性。通过简单蒸馏步骤,利用预训练扩散模型视觉先验弥合领域差距,性能优于特定任务专家和多任务基线,泛化能力强。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20984 2026-07-24 cs.CV 新提交 57%

Distribution-Alignment Bridge for Uncertainty-Aware Text-to-Video Retrieval

用于不确定性感知文本到视频检索的分布对齐桥

Kyeongmo Chae, Jihoon Lee, Sangtae Ahn

机构 * School of Electronic and Electrical Engineering, Kyungpook National University(庆北国立大学电子与电气工程学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究文本到视频检索问题,提出分布对齐桥(DAB)框架,将其视为分布对齐任务,通过高斯分布建模考虑不确定性,用受扩散启发的桥和分布感知对比损失优化,在多基准测试中显著优于现有基线并提供校准排名。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20692 2026-07-24 cs.CV cs.AI 新提交 57%

DS@GT ARC at ImageCLEFmed GANs 2026: Geometric Filtering for Privacy-Preserving CT Slice Generation

图像CLEFmed GANs 2026竞赛中的DS@GT ARC:用于隐私保护CT切片生成的几何滤波

Eric Regina, Richard Arnaud, Samir Hadi Cisneros

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 扩散模型 :image generation(abstract);分类 cs.CV

AI总结 为Image-CLEFmed GANs 2026挑战赛开发隐私保护框架,结合最优传输条件流匹配等,在几何潜在空间过滤候选切片。官方结果显示有真实感与隐私权衡,虽减少泄漏,但防止直接图像复制仍不足以消除患者特定解剖特征,凸显未来隐私保护医学图像生成的重要前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20660 2026-07-24 cs.CV 新提交 57%

Axolotl3D: a Unified Framework for Faithful 3D Shape Completion

Axolotl3D:用于精确3D形状完成的统一框架

Anita Hu, Maria Shugrina

机构 * NVIDIA(英伟达)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对3D生成模型在多场景适用性有限及缺乏统一框架的问题,提出Axolotl3D模型,它基于多种模态条件设定,利用点云和相机参数,通过统一训练策略实现精确3D形状完成,实验验证其在多方面性能出色。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20159 2026-07-23 cs.CV 新提交 57%

SHFormer: Dynamic Spectral Filtering Convolutional Neural Network and High-pass Kernel Generation Transformer for Adaptive MRI Reconstruction

SHFormer:用于自适应MRI重建的动态频谱滤波卷积神经网络和高通内核生成变压器

Sriprabha Ramanarayanan, Rahul G. S., Mohammad Al Fahim, Keerthi Ram, Ramesh Venkatesan, Mohanasankar Sivaprakasam

机构 * Indian Institute of Technology Madras (IITM)(印度理工学院马德拉斯分校) Healthcare Technology Innovation Centre(医疗技术创新中心) GE John F Welch Technology Center(通用电气约翰·F·韦尔奇技术中心)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对基于注意力机制的MRI重建模型在高频表示和多模态数据处理上的不足,提出含频谱滤波CNN和动态高通内核生成变压器的网络进行可扩展MRI重建,在未见场景下有良好重建效果,提升了PSNR和SSIM。

Comments Published in Neural Networks (Elsevier), Vol. 187, Article 107334, July 2025. DOI: 10.1016/j.neunet.2025.107334

Journal ref Neural Networks, Vol. 187, Article 107334, July 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20125 2026-07-23 cs.CV cs.LG 新提交 57%

HeadCast: Casting Attention Heads for Efficient Autoregressive Video Generation

HeadCast:为高效自回归视频生成分配注意力头

Jinliang Shen, Lianghao Su, Zheming Li, Kang He, ZiLiang Lai, Yanbing Jiang, Chengru Song

机构 * KlingAI Research(克林人工智能研究公司)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对自回归视频扩散模型注意力成本高的问题,提出HeadCast框架,基于预训练模型注意力头行为进行一次性分类,重组KV缓存,保留全局头,在不同分辨率下有效加速推理且保持质量,减少闪烁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19986 2026-07-23 cs.CV 新提交 57%

STEREOFLOW: Progressive Stereo Matching with StereoDiT and Transition Flow Matching

STEREOFLOW:基于StereoDiT和过渡流匹配的渐进式立体匹配

Hao Wang, Haoran Geng, Xiaotong Yang, Jing Tang, Songlin Wei, Linlong Lang, Yeying Jin, Zheng Zhu, Zhaoxin Fan, Biao Leng

机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) University of California, Berkeley(加州大学伯克利分校) University of Southern California(南加州大学) Google(谷歌公司) State Key Laboratory of Intelligent Manufacturing Equipment and Technology, Huazhong University of Science and Technology(华中科技大学智能制造装备与技术国家重点实验室) Tencent(腾讯公司) GigaAI(未知(可能是公司或组织,由于未找到确切对应中文名,按原文保留))

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对立体匹配问题,提出先验引导的生成框架StereoFlow,通过两阶段渐进级联匹配网络、像素扩散变压器StereoDiT和过渡流匹配实现高效优化,在多基准测试中取得多个最新结果,提升了立体匹配效果。

Comments 10 pages, 6 figures, submitted to TVCG

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19332 2026-07-22 cs.LG cs.CV 新提交 57%

ROMS-IMLE: A Minimalist Approach to Competitive Single-Step Generative Modelling

ROMS-IMLE:一种用于竞争性单步生成建模的极简方法

Chirag Vashist, Ke Li

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 质疑生成模型中逐步变换噪声分布的必要性,采用极简方法,选IMLE为训练目标、卷积网络为模型,经添加关键要素得到单步参数高效生成模型,在ImageNet 256上取得良好效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19100 2026-07-22 cs.CV 新提交 57%

FlexiAvatar: Unified 3D Gaussian Human Avatars Under Arbitrary Body Visibility

FlexiAvatar:任意身体可见性下的统一3D高斯人体头像

Yihalem Yimolal Tiruneh, Muhammad Salman Ali, Uyoung Jeong, Muneeb A. Khan, MD Khalequzzaman Chowdhury Sayem, Allanur Bayramgeldiyev, Binod Bhattarai, Seungryul Baek

机构 * UNIST(韩国蔚山科学技术院) University of Aberdeen(阿伯丁大学) University College London(伦敦大学学院) Fogsphere(雾球公司)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究从单目视频重建3D人体头像问题,提出FlexiAvatar框架,结合遮挡鲁棒跟踪与特定部分残差细化捕捉细节,用扩散方法处理不可见区域,实验表明其重建质量高,还能减少运行时和内存开销。

Comments Accepted in ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18770 2026-07-22 cs.CR cs.CV 新提交 57%

GLID: Gated Local Intrinsic Dimension Repairs the Blind Spots of Face-Forgery Detectors

GLID:门控局部内在维度修复面部伪造检测器的盲点

Guang Yang, Fengchen Liu

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of California, Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对微调基础模型面部伪造检测器对训练外生成器家族有盲点的问题,提出GLID检测器,通过估计图像补丁令牌局部内在维度,经置信门进入微调检测器,在基准测试中表现出色,揭示相关经验法则并降低准确率跨种子传播。

Comments 21 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18436 2026-07-22 cs.CV 新提交 57%

Surprise Forcing: What to Remember, When to Skip in Long Video Generation

惊喜强制:长视频生成中该记住什么、何时跳过

Shuwei Shi, Zhen Li, Muyao Niu, Chuanhao Li, Bo Zheng, Kaipeng Zhang, Yinqiang Zheng

机构 * Alaya Lab(阿莱雅实验室) The University of Tokyo(东京大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究长视频生成中资源分配问题,提出惊喜强制框架,含惊喜门控内存库、基于优先级的替换和相关性感知路由,以及惊喜感知去噪,实验证明该框架提高了长时一致性、视觉质量并保持实时流吞吐量。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18198 2026-07-21 cs.LG cs.CV 新提交 57%

Three-Body Scattering for Generative Modeling

用于生成建模的三体散射

Peng Sun, Zhenglin Cheng, Deyuan Liu, Jun Xie, Xinyi Shang, Tao Lin

机构 * Westlake University(西湖大学) Zhejiang University(浙江大学) University College London(伦敦大学学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究提出三体散射建模(TBSM)用于生成,将能量距离转化为特定相互作用,为单步生成器提供监督。通过在线跟踪条件期望减少噪声,在ImageNet-256上训练单步生成器取得良好结果,确立了跟踪散射作为高维单步生成的途径。

Comments 31 pages, 5 figures, and 4 tables. Code: https://github.com/sp12138/TBSM

详情

展开后加载摘要…

URL PDF HTML 收藏