arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-12 至 2026-06-12 共收录 57 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 4 篇

2606.13676 2026-06-12 cs.CV 新提交 70%

Modality Forcing for Scalable Spatial Generation

模态强制实现可扩展的空间生成

Bardienus Pieter Duisterhof, Deva Ramanan, Jeffrey Ichnowski, Justin Johnson, Keunhong Park

机构 * Carnegie Mellon University(卡内基梅隆大学) World Labs

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出Modality Forcing方法,通过为每个模态分配独立噪声水平,实现单DiT的联合图像-深度生成,利用稀疏深度数据训练,继承T2I预训练的可扩展性,在深度估计上取得竞争性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13288 2026-06-12 cs.CV cs.AI cs.CL 新提交 70%

Cross-Modal Masked Compositional Concept Modeling for Enhancing Visio-Linguistic Compositionality

跨模态掩码组合概念建模以增强视觉-语言组合性

Wei Li, Zhen Huang, Xinmei Tian

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(中国科学技术大学,教育部脑启发智能感知与认知重点实验室) Independent Researcher(独立研究员)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出MACCO框架,通过掩码一个模态的组合概念并从另一模态完整上下文重建,增强视觉-语言模型的组合理解能力,在五个基准上显著提升。

Comments Accepted to ACL 2026 Main Conference, 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13341 2026-06-12 cs.CV cs.AI physics.med-ph 新提交 57%

Dual-Domain Equivariant Generative Adversarial Network for Multimodal CT-PET Synthesis

双域等变生成对抗网络用于多模态CT-PET合成

Gabriel Steele, Alzahra Altalib, Alessandro Perelli

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 提出双域等变生成对抗网络(DDE-GAN),联合空间与频域学习并融入旋转等变性,实现高保真多模态CT-PET图像合成。

Comments 4 pages, 3 figures, 1 table, 2026 IEEE 23rd International Symposium on Biomedical Imaging (ISBI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12972 2026-06-12 cs.HC 新提交 50%

From Prompts to Preferences: An Open-Source Platform for Generative AI-Enhanced Conjoint Analysis

从提示到偏好:生成式AI增强联合分析的开源平台

Philipp Brauner

专题命中 文生图 :text-to-image(abstract)

AI总结 提出一个开源、自托管的联合分析调查平台,利用生成式AI(大语言模型和文本到图像模型)创建集成刺激格式,降低研究门槛,并通过概念验证研究展示其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 1 篇

2606.13558 2026-06-12 cs.CV cs.CL 新提交 57%

Edit the Bits, Diff the Codes: Bitwise Residual Editing for Visual Autoregressive Models

编辑比特,差异编码:面向视觉自回归模型的逐比特残差编辑

Shengqiang Zhang, Ruotong Liao, Volker Tresp, Barbara Plank, Hinrich Schütze

机构 * LMU Munich & Munich Center for Machine Learning (MCML)(慕尼黑大学 & 慕尼黑机器学习中心 (MCML))

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 提出BitResEdit,一种无需训练的视觉自回归图像编辑方法,通过比特级源负引导和残差编码注入,在保持背景的同时实现强文本对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 43 篇

2606.13247 2026-06-12 cs.AI 新提交 86%

EPIG: Emotion-Based Prompting for Personalised Image Generation

EPIG:基于情感提示的个性化图像生成

Emna Othmen, Mohamed Yassine Landolsi, Lotfi Ben Romdhane

机构 * MARS Research Lab LR17ES05, ISITCom, University of Sousse(苏塞大学ISITCom学院MARS研究实验室LR17ES05)

专题命中 扩散模型 :image generation(title,abstract);text-to-image(abstract,comments);diffusion(abstract,comments)

AI总结 提出EPIG方法,利用心理学效价-唤醒模型在提示层面增强情感表达,无需训练即可控制生成图像的唤醒度,在10个多样化提示上平均唤醒误差降低14%-17%。

Comments Submitted to arXiv. 20 pages, 4 figures. Work on emotion-based prompt engineering for text-to-image diffusion models with applications in personalized image generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12987 2026-06-12 cs.CV cs.AI cs.LG cs.RO 新提交 83%

Diffusion Transformer World-Action Model for AV Scene Prediction

扩散Transformer世界-动作模型用于自动驾驶场景预测

Ruslan Sharifullin, Benjamin Jiang, Kai Xi Chew

机构 * Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出紧凑潜世界模型,结合扩散Transformer(DiT)预测未来场景,在nuScenes上实现4.8倍更好的KID,并实现动作可控性(转向ρ=0.81)。

Comments 10 pages, 9 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12977 2026-06-12 cs.CV cs.AI cs.CR cs.LG 新提交 83%

Efficient, Robust, and Anti-Collusion Fingerprinting of Image Diffusion Models

图像扩散模型的高效、鲁棒且抗共谋指纹识别

Jianwei Fei, Yunshu Dai, Zhihua Xia, Xiaochun Cao, Jiantao Zhou, Alessandro Piva, Benedetta Tondi

机构 * University of Florence(佛罗伦萨大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) College of Cyber Security, Jinan University(暨南大学网络空间安全学院) State Key Laboratory of Internet of Things for Smart City, University of Macau(澳门大学智慧城市物联网国家重点实验室) Department of Computer and Information Science, Faculty of Science and Technology, University of Macau(澳门大学科技学院计算机与信息科学系) University of Siena(锡耶纳大学)

专题命中 扩散模型 :diffusion(title);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 针对生成式文本到图像模型指纹识别缺乏抗共谋攻击鲁棒性的问题,提出基于个性化归一化模块的编码方法,并引入无损函数不变参数变换的抗共谋机制,实现高保真、高鲁棒且首次主动抵御共谋攻击的指纹识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13347 2026-06-12 cs.LG 新提交 82%

Enhanced Low-Density Region Exploration in Classifier-Guided Diffusion Models Through Modified Reverse Diffusion Sampling

改进反向扩散采样在分类器引导扩散模型中的低密度区域探索

Jagriti Singh, Shekhar Verma, Muneendra Ojha

机构 * University of Allahabad(阿拔斯大学)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract)

AI总结 提出一种无需额外训练的采样时间密度感知方法,通过修改分类器梯度引导轨迹朝向低置信区域并引导采样朝向预测真实图像,以增强扩散模型对低密度区域的探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13366 2026-06-12 cs.CV cs.MM 新提交 81%

Dual-Constrained Diffusion Image Compression for Operational Rate-Distortion-Perception Optimization

双约束扩散图像压缩用于操作率失真感知优化

Sanxin Jiang, Jiro Katto, Heming Sun

机构 * Shanghai University of Electric Power(上海电力大学) Waseda University(早稻田大学) Institute of Science Tokyo(东京科学大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 提出DCIC框架,结合学习编解码器和基于扩散的解码器,通过联合失真和等幂约束实现率失真感知帕累托前沿的连续导航,无需额外码率开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13496 2026-06-12 cs.CV 新提交 79%

Budget-Constrained Step-Level Diffusion Caching

预算约束的步骤级扩散缓存

Mingkun Lei, Tong Zhao, Liangyu Yuan, Chi Zhang

机构 * Westlake-AGI-Lab(西湖大学AGI实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出BudCache方法,通过离线搜索(模拟退火+爬山)在固定计算预算下优化缓存策略,并引入缓存感知调度对齐,以提升扩散模型生成质量。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13240 2026-06-12 cs.LG cs.AI cs.CV stat.ME stat.ML 新提交 79%

Towards More General Control of Diffusion Models Using Jeffrey Guidance

使用 Jeffrey 引导实现扩散模型的更通用控制

Raphaël Razafindralambo, Rémy Sun, Frédéric Precioso, Jes Frellsen, Pierre-Alexandre Mattei

机构 * Inria, CNRS, I3S, Maasai Université Côte d’Azur(法国国家信息与自动化研究所、法国国家科学研究中心、信息与系统科学实验室、马赛·蔚蓝海岸大学) Technical University of Denmark(丹麦技术大学) Inria, CNRS, LJAD, Maasai Université Côte d’Azur(法国国家信息与自动化研究所、法国国家科学研究中心、雅克-路易·利翁实验室、马赛·蔚蓝海岸大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出 Jeffrey 引导框架,通过 Jeffrey 条件规则更新边缘分布,扩展扩散模型控制到标准引导无法表达的应用,在 CIFAR-10 和 FFHQ 上显著降低 FID,并在 CelebA-HQ 上实现公平性控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12263 2026-06-12 cs.CV 新提交 79%

VOID: Defeating Unauthorized Mimicry in Latent Diffusion Models

VOID: 击败潜在扩散模型中的未授权模仿

Chunlin Qiu, Ang Li, Tianxiao Huang, Ruilin Gan, Yunjie Ge, Shenyi Zhang, Huayi Duan, Lingchen Zhao, Chao Shen, Qian Wang

机构 * School of Cyber Science and Engineering, Wuhan University(武汉大学网络空间安全学院) School of Computer Science, Wuhan University(武汉大学计算机学院) Institute for Math&AI, Wuhan University(武汉大学数学与人工智能研究所) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) School of Cyber Science and Engineering, Xi’an Jiaotong University(西安交通大学网络空间安全学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对潜在扩散模型被用于未授权模仿的问题,提出VOID防御框架,通过操纵模型内在随机性,放大潜在编码误差并抵消目标引导信号,实现语义破坏,阻止未授权模仿,同时将扰动限制在人眼不可感知区域。

Comments Extended full version with more comprehensive experimental results. To appear in the 35th USENIX Security Symposium (USENIX Security 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13565 2026-06-12 cs.LG 新提交 78%

A2D2: Fine-Tuning Any-Length Discrete Diffusion for Adaptive Decoding

A2D2: 任意长度离散扩散模型的自适应解码微调

Sophia Tang, Yuchen Zhu, Molei Tao, Pranam Chatterjee

机构 * Department of Computer and Information Science, University of Pennsylvania(宾夕法尼亚大学计算机与信息科学系) Department of Bioengineering, University of Pennsylvania(宾夕法尼亚大学生物工程系) School of Mathematics, Georgia Institute of Technology(佐治亚理工学院数学学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出A2D2框架,通过联合优化插入和去掩蔽策略及基于质量的推理调度,实现任意长度离散扩散模型的奖励引导微调,理论上保证收敛到奖励倾斜分布,实验提升奖励优化与生成灵活性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13451 2026-06-12 cs.LG 新提交 78%

Uncertainty Estimation for Molecular Diffusion Models

分子扩散模型的不确定性估计

Paul Seij, Christian A. Naesseth, Stephan Mandt, Metod Jazbec

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出一种事后方法,利用去噪网络的拉普拉斯近似估计预训练分子扩散模型中每个样本的不确定性,该分数与样本质量负相关,可用于过滤生成样本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12841 2026-06-12 cs.LG cs.AI 新提交 78%

TimeROME-DLM: Temporal Causal Tracing and Low-Rank Inference-Time Knowledge Editing for Masked Diffusion Language Models

TimeROME-DLM:掩码扩散语言模型的时间因果追踪与低秩推理时知识编辑

Zhengtao Yao, Liuyang Song, Hongbo Zhang, Chenhao Wei, Haoyan Xu, Guang Yang, Siheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出TimeROME-DLM,首个无需训练和梯度的推理时知识编辑框架,通过时间因果追踪定位关键坐标并应用低秩残差编辑,在保持模型性能的同时高效删除事实。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12807 2026-06-12 cs.CL 新提交 78%

Detect, Remask, Repair: Diffusion Editing for Faithful Summarization of Evolving Contexts

检测、重掩、修复:面向动态上下文忠实摘要的扩散编辑

Hao Zou, Zachary Horvitz, Chandhru Karthick, Zhou Yu, Kathleen McKeown

机构 * Columbia University(哥伦比亚大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出DETECT-REMASK-REPAIR框架,利用掩码扩散语言模型识别并修复摘要中过时内容,在保持支持内容的同时实现局部忠实性修复,并引入StreamSum基准评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12640 2026-06-12 cs.LG cs.RO cs.SY eess.SY 新提交 78%

Individual Control Barrier Functions-Guided Diffusion Model for Safe Offline Multi-Agent Reinforcement Learning

个体控制障碍函数引导的扩散模型用于安全离线多智能体强化学习

Qingyun Guo, Junyi Shi, Jianuo Huang, Tianyu Shi

机构 * Department of Electrical Engineering and Automation, Aalto University(阿尔托大学电气工程与自动化系) School of Computing and Data Science, Xiamen University Malaysia(厦门大学马来西亚分校计算与数据科学学院) Department of Computer Science, University of Toronto(多伦多大学计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出一种将神经个体控制障碍函数嵌入扩散模型的离线多智能体强化学习算法,通过逆动力学恢复控制策略,在保证奖励的同时显著提升轨迹生成的安全性。

Comments Accepted to the 23rd IFAC World Congress, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12879 2026-06-12 cs.DS math.ST stat.ML stat.TH 新提交 78%

Diffusion-Network Alignment: An Efficient Algorithm and Explicit Probability Bounds

扩散-网络对齐:一种高效算法与显式概率界

Ziao Wang, Lei Ying

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出扩散-网络对齐问题,基于树相关性测试设计高效算法,在稀疏图下证明高概率正确匹配,并给出顶点正确匹配的显式下界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12710 2026-06-12 cs.LG math.OC 新提交 78%

A Stabilized Path-Space Approach to Diffusion-Based Posterior Sampling

一种稳定的路径空间方法用于基于扩散的后验采样

Evan Scope Crafts, Umberto Villa, Saviz Mowlavi, Yanting Ma, Hassan Mansour, Wael H. Ali

机构 * Oden Institute for Computational Engineering and Sciences, The University of Texas at Austin(德克萨斯大学奥斯汀分校奥登计算工程与科学研究所) Mitsubishi Electric Research Laboratories (MERL)(三菱电机研究实验室) Department of Biomedical Engineering, The University of Texas at Austin(德克萨斯大学奥斯汀分校生物医学工程系) Mitsubishi Electric Research Laboratories(三菱电机研究实验室)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出一种稳定的路径空间框架,通过随机最优控制与信任域优化,实现非线性逆问题中准确且鲁棒的后验采样。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13615 2026-06-12 math.PR stat.ME 新提交 78%

Data-driven subsampling rates for diffusion parameter estimation of SDEs

数据驱动的扩散参数估计子采样率选择

Felix Lindner, Andre Schmeißer, Felipe Trolldenier, Raimund Wegener

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出基于单调游程统计的自动子采样率选择方法,确保子采样数据与SDE模型在无穷小尺度上一致,无需多尺度扩散渐近框架。

Comments 30 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13050 2026-06-12 math.AP 新提交 78%

Propagation Dynamics for Multidimensional Nonlocal Diffusion Equations: A General Freidlin-Gärtner Formula

多维非局部扩散方程的传播动力学:一个广义的Freidlin-Gärtner公式

Hongjun Guo, Wan-Tong Li, Biao Liu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文通过将经典Freidlin-Gärtner框架推广到一般非对称非局部算子,建立了多维非局部扩散方程传播行为的统一几何描述,揭示了有偏传播机制,并证明了传播集作为Minkowski和表示及水平集的局部Hausdorff收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13398 2026-06-12 astro-ph.IM physics.plasm-ph 新提交 78%

A robust super-time-stepping scheme for Ohmic and ambipolar diffusion

欧姆和双极扩散的鲁棒超时间步进方案

Giancarlo Mattia, Mario Flock, David Melon Fuksman, Anastasia Tzouvanou, Vittoria Berta, Daniele Crocco

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对非理想磁流体力学中欧姆和双极扩散的时间步长限制和不稳定性问题,提出基于盖根鲍尔多项式的鲁棒超时间步进方法,在PLUTO代码中实现,通过磁重联和磁旋转不稳定性测试验证了其精度、效率和稳定性。

Comments 14 pages, 15 figures (+ appendix, 5 pages, 5 figures), under revision for A&A

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13433 2026-06-12 stat.ME 新提交 71%

Smoothed-KL Reweighting: A Principled Account and Matching Rule for SNR-Based Diffusion Training

平滑KL重加权:基于信噪比的扩散训练的原则性解释与匹配规则

Lei Li

专题命中 扩散模型 :diffusion(title)

AI总结 提出平滑KL重加权方法,从扩散散度推导出闭式权重,建立与Min-SNR家族的匹配规则,在CIFAR-10和CelebA-64上验证,最终FID相当但迭代效率因数据集而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13191 2026-06-12 cs.LG 新提交 67%

The Geometry of Phase Transitions in Generative Dynamics via Projection Caustics

生成动力学中相变的几何:投影焦散视角

Ryosuke Sakamoto, Kotaro Sakamoto

机构 * Institute for the Advanced Study of Human Biology, Institute for Advanced Study, Kyoto University(京都大学高等研究院人类生物学高等研究所) Graduate School of Engineering, The University of Tokyo(东京大学大学院工学系研究科)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract)

AI总结 本文通过投影焦散几何解释生成动力学中的相变行为,提出临界边界检测器(CBD)诊断分数方向不稳定性,定位模式承诺并支持敏感区域控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13652 2026-06-12 cs.CV cs.GR 新提交 62%

World Tracing: Generative Pixel-Aligned Geometry Beyond the Visible

世界追踪:超越可见表面的生成式像素对齐几何

Hao Zhang, Mohamed El Banani, Jen-Hao Cheng, Paul Zhang, Yi Hua, Ben Mildenhall, Christoph Lassner, Narendra Ahuja, Gengshan Yang

机构 * World Labs University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 提出世界追踪(World Tracing),一种生成式像素对齐几何表示,通过扩散变压器预测有序点栈,同时重建可见表面和生成遮挡几何,在多个基准上超越深度预测和图像到3D方法。

Comments World Labs Technical Report; Page: https://haoz19.github.io/world-tracing-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13494 2026-06-12 cs.RO cs.CV 新提交 57%

NavWAM: A Navigation World Action Model for Goal-Conditioned Visual Navigation

NavWAM:用于目标条件视觉导航的导航世界动作模型

Daichi Azuma, Taiki Miyanishi, Koya Sakamoto, Shuhei Kurita, Yaonan Zhu, Petr Khrapchenkov, Motoaki Kawanabe, Yusuke Iwasawa, Yutaka Matsuo

机构 * The University of Tokyo(东京大学) National Institute of Informatics(国立信息学研究所) AIRoA ATR

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出NavWAM,一种扩散变换器策略,通过联合学习未来观测、目标进度值和动作块,将导航世界模型预测直接转化为可执行动作,在离线基准和真实机器人部署中优于基于规划的世界模型基线。

Comments Project page: https://dachii-azm.github.io/navwam/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13432 2026-06-12 cs.CV cs.AI 新提交 57%

OmniDirector: General Multi-Shot Camera Cloning without Cross-Paired Data

OmniDirector: 无需配对数据的通用多镜头相机克隆

Jiwen Liu, Shujuan Li, Zhixue Fang, Xiaohan Li, Yan Zhou, Zijie Meng, Zhimin Zhang, Yawen Luo, Guoxin Zhang, Yu-Shen Liu, Pengfei Wan

机构 * Kuaishou Technology(快手科技) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出OmniDirector框架,通过将相机参数编码为网格运动视频,并利用百万级配对数据训练,实现无需交叉配对数据的多镜头相机运动克隆,具备卓越的控制性能。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13364 2026-06-12 cs.LG cs.CV 新提交 57%

VideoMDM: Towards 3D Human Motion Generation From 2D Supervision

VideoMDM: 从2D监督走向3D人体运动生成

Amir Mann, Gal Michael Harari, Merav Keidar, Or Litany

机构 * Technion(以色列理工学院) NVIDIA(英伟达)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出VideoMDM框架,利用单目视频的2D姿态通过扩散模型学习3D运动先验,使用深度加权的2D重投影损失近似3D监督,在HumanML3D上接近全3D监督性能。

Comments https://videomdm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13035 2026-06-12 cs.CV cs.AI 新提交 57%

TetherCache: Stabilizing Autoregressive Long-Form Video Generation with Gated Recall and Trusted Alignment

TetherCache: 基于门控召回与可信对齐的自回归长视频生成稳定性方法

Yu Meng, Xiangyang Luo, Letian Li, Wenyuan Jiang, Chen Gao, Xinlei Chen, Yong Li, Xiao-Ping Zhang

机构 * Tsinghua University(清华大学) D-INFK, ETH Zürich(苏黎世联邦理工学院计算机科学系)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出TetherCache,一种无需训练、即插即用的缓存管理策略,通过门控召回(GRAB)和可信对齐编辑(TAME)缓解自回归视频扩散模型中的上下文漂移,实现稳定长视频生成。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏