arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2962 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 2264 篇

2607.00047 2026-07-08 cs.MM cs.CV cs.GR 新提交 67%

Vertigo Vertigo: Reconstructing a Cinematic Ideal through its Predictive AI Double

眩晕眩晕:通过其预测性AI双重重建电影理想

Adam Cole, Mick Grierson

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR、cs.MM

AI总结 使用仅2.78%原始帧通过视频扩散模型重建希区柯克《迷魂记》,验证生成系统编码的经典电影规范,73.1%帧可识别,3.6%严重失败。

Comments Accepted to Ars Electronica EXPANDED 2026 - Conference on Animation and Interactive Art (in cooperation with ACM SIGGRAPH), Ars Electronica Festival, Linz. 7 pages, 7 figures. Authors' version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31093 2026-07-01 cs.DC 新提交 67%

Omni-Flow: A Unified Workflow Orchestration and Distributed KV Cache Sharing Framework for Multimodal Inference

Omni-Flow:面向多模态推理的统一工作流编排与分布式KV缓存共享框架

Bin Xiao, Jingfu Dong, Changran Wang, Yitian Chen, Xiaoyu Zhao, Yuqi Peng, Jianping Lin, Yuchen Xie

专题命中 扩散模型 :image generation(abstract);diffusion(abstract)

AI总结 提出Omni-Flow框架,通过三层抽象(控制流、数据流、计算流)统一编排多模态推理工作流,实现异构单元协同、分布式KV缓存共享与高效传输,支持多种多模态场景。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24025 2026-06-24 cs.LG 新提交 67%

Information-Theoretic Classifier-Free Guidance with Adaptive Schedule Optimization

信息论分类器自由引导与自适应调度优化

Haobo Chen, Xiangxiang Xu, Yuheng Bu

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) University of Rochester(罗彻斯特大学)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract)

AI总结 针对扩散模型中分类器自由引导(CFG)导致的多样性-覆盖权衡问题,提出基于信息论的CFG调度优化框架,通过清洁端点参考优化实际分布,在ImageNet-512和COCO上实现竞争性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23872 2026-06-24 cs.LG cs.AI 新提交 67%

MGI: Member vs Generated Inference

MGI:成员与生成推断

Bihe Zhao, Michel Meintz, Juangui Xu, Franziska Boenisch, Adam Dziedzic

机构 * CISPA Helmholtz Center for Information Security(CISPA亥姆霍兹信息安全中心)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract)

AI总结 针对生成模型输出与训练样本难以区分的问题,提出MGI任务,并设计数据断路器(DCB)方法,结合自编码器和潜在生成器的互补信号,有效区分训练成员与生成样本。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21960 2026-06-23 cs.LG 新提交 67%

A Standard Processing Pipeline for High-accuracy Measurement of Few-shot Regression on Laser Induced Breakdown Spectroscopy

激光诱导击穿光谱小样本回归高精度测量的标准处理流程

Hao Li

机构 * University of Arizona(亚利桑那大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 提出集成扩散去噪、注意力自编码器降维、组混洗数据增强和普通最小二乘回归的标准流程,在LIBS小样本回归中实现平均RMAE 0.2847,较基线提升37.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17090 2026-06-17 cs.PL cs.AI cs.MS 新提交 67%

ANEForge: Python for direct computation on the Apple Neural Engine

ANEForge: 用于直接在Apple Neural Engine上进行计算的Python工具

Spencer H. Bryngelson

机构 * School of Computational Science \& Engineering, Georgia Institute of Technology, Atlanta, GA 30332, USA -0.35cm Daniel Guggenheim School of Aerospace Engineering, Georgia Institute of Technology, Atlanta, GA 30332, USA -0.35cm George W. Woodruff School of Mechanical Engineering, Georgia Institute of Technology, Atlanta, GA 30332, USA

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 ANEForge是一个Python包,通过编译惰性张量图直接编程Apple Neural Engine,无需CoreML,支持推理和训练,性能接近引擎硬件极限。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13191 2026-06-12 cs.LG 新提交 67%

The Geometry of Phase Transitions in Generative Dynamics via Projection Caustics

生成动力学中相变的几何:投影焦散视角

Ryosuke Sakamoto, Kotaro Sakamoto

机构 * Institute for the Advanced Study of Human Biology, Institute for Advanced Study, Kyoto University(京都大学高等研究院人类生物学高等研究所) Graduate School of Engineering, The University of Tokyo(东京大学大学院工学系研究科)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract)

AI总结 本文通过投影焦散几何解释生成动力学中的相变行为,提出临界边界检测器(CBD)诊断分数方向不稳定性,定位模式承诺并支持敏感区域控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13929 2026-08-17 cs.CV cs.GR 新提交 62%

RGBX-Next: Towards Realistic Generative Rendering from G-Buffers

RGBX-Next:基于G-buffers的真实感生成式渲染

Zheng Zeng, Marco Salvi, Lifan Wu, Jan Novák, Daqi Lin, Saeed Hadadan, Yichen Sheng, Robert Pottorff, Shiqiu Liu, Ravi Ramamoorthi, Ling-Qi Yan, Miloš Hašan

机构 * University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校) NVIDIA(英伟达公司) University of California, San Diego(加利福尼亚大学圣迭戈分校) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出RGBX-Next框架,将扩散Transformer(DiT)微调为正向与反向渲染器,可从图像等估算G-buffers或从G-buffers渲染真实感内容,在相关任务中表现优异,将公开模型并推动领域研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09110 2026-08-11 cs.CV cs.GR 新提交 62%

View-Adaptive Renderer for View-Consistent 2D-to-3D Generation

适用于视图一致的2D到3D生成的视图自适应渲染器

U-Chae Jun, Jaeeun Ko, Jiwoo Kang

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 针对单目2D转3D生成的视图不一致与计算负担问题,提出视图自适应神经渲染框架,结合自注意力融合模块,在无扩散SDS监督下实现高效高保真3D重建,性能接近当前最优。

Journal ref Multimedia Systems, vol.32, pp. 511, Aug 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01825 2026-08-04 cs.CV cs.AI cs.GR 新提交 62%

PartMat: Material-Aware 3D Part Decomposition with a Single Global Latent

PartMat:基于单个全局隐变量的材质感知三维部件分解

Guangming Fu, Jin Song, Yiyun Fei, Guoqiu Li, Ruigao Yang, Jianan Jiang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 该研究提出PartMat,一种用单个全局隐变量的材质感知三维部件分解流水线,可按材质边界分解物体,推理高效且分解准确率优于基线,几何质量相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22674 2026-07-28 cs.GR cs.CV cs.HC 新提交 62%

Text-based Tactile Graphics Generation for the Visually Impaired

为视障人士生成基于文本的触觉图形

Ruihan Gao, Joonghyuk Shin, Ava Pun, Jaesik Park, Wenzhen Yuan, Jun-Yan Zhu

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 研究为视障人士开发基于文本生成触觉图形的集成系统,引入制作感知技术,能联合生成多种元素,经评估和用户研究,结果优于基线,拓宽了生成式AI对视障群体及其他人的可及性。

Comments ECCV 2026, Project webpage: https://ruihangao.github.io/Text2TactileGraphics/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19437 2026-07-23 eess.IV cs.CV cs.MM 新提交 62%

Group-of-Latents: Perceptual Video Compression at Extreme Bitrates via Masked Latent Generative Modeling

潜在组:通过掩码潜在生成建模实现极端比特率下的感知视频压缩

Shaokang Wang, Jinchang Xu, Peidong Jia, Zhijian Hao, Siyuan Qian, Fei Zhao, Rui Ma, Xiaozhu Ju, Jian Tang, Xiaodong Xie, Shanghang Zhang, Huizhu Jia

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, Beijing, China(多媒体信息处理国家重点实验室,计算机科学学院,北京大学,北京,中国) State Key Discipline Laboratory of Wide Band-Gap Semiconductor Technology, School of Microelectronics, Xidian University, Xi'an, China(宽带隙半导体技术重点学科实验室,微电子学院,西安电子科技大学,西安,中国)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 针对极低比特率视频压缩未充分探索的问题,提出统一生成框架,通过潜在组策略、深度压缩模块和统一潜在去噪模块,在极低比特率下实现高感知质量,有丰富空间细节和强大时间一致性,达到最新水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05376 2026-07-07 cs.CV cs.GR 新提交 62%

MV-Forcing: Long Multi-View Video Generation via 4D-Grounded Spatio-Temporal Self-Forcing

MV-Forcing:基于4D锚定时空自强制的长时长多视角视频生成

Gal Fiebelman, Hadar Averbuch-Elor, Sagie Benaim

机构 * The Hebrew University of Jerusalem(耶路撒冷希伯来大学) Cornell University(康奈尔大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 针对动态场景长时多视角一致视频生成难题,提出MV-Forcing框架,融合时序与视角自回归,实现任意时长视角数的高一致性多视角视频生成。

Comments Accepted to ECCV 2026. Project webpage: https://galfiebelman.github.io/mv-forcing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02798 2026-07-07 cs.CV cs.GR 新提交 62%

Track the Noise, Move the World:3D-Grounded Motion-Consistent Noise for Controllable Video Generation

追踪噪声,移动世界:用于可控视频生成的3D地面运动一致噪声

Long Vu, Tan Ngo, Animesh Karnewar, Amir Habibian, Binh-Son Hua, Hung Bui, Minh Hoai Nguyen, Phong Nguyen-Ha

机构 * Qualcomm AI Research(高通人工智能研究中心) Trinity College Dublin(都柏林三一学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 研究如何在视频生成中实现对物体和相机运动的精确统一控制。核心方法是构建统一框架UniCaMo,直接构造扩散模型输入噪声。主要贡献是在视频质量和运动可控性上取得先进成果,且无需对基础模型做大改动。

Comments Project Page: https://phongnhhn.info/Unicamo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14721 2026-07-07 cs.GR cs.CV cs.RO 新提交 62%

DC-Motion: Decoupling Structure and Details via Discrete-Continuous Tokens for Human Motion Generation

DC-Motion: 通过离散-连续令牌解耦语义与细节以生成人体运动

Hequan Wang, Xuean Chen, Jiaxu Zhang, Zhengbo Zhang, Zhigang Tu

机构 * Wuhan University(武汉大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 提出DC-Motion框架,通过离散-连续VAE将运动分解为语义离散令牌和细节连续残差,结合掩码自回归模型和残差扩散模型,实现复杂文本指令下的高质量运动生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30673 2026-07-01 cs.GR cs.CV 新提交 62%

PolyFlow: Continuous Topology Embedding Flow Matching for Artist-style Mesh Generation

PolyFlow: 连续拓扑嵌入流匹配用于艺术家风格网格生成

Chunshi Wang, Haohan Weng, Junliang Ye, Biwen Lei, Yang Li, Zibo Zhao, Zeqiang Lai, Kaiyi Zhang, Yunhan Yang, Zhuo Chen, Chunchao Guo, Yawei Luo

机构 * ZJU(浙江大学) Tencent(腾讯) THU(清华大学) CUHK(香港中文大学) HKUST(香港科技大学) HKU(香港大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 提出PolyFlow,通过连续拓扑嵌入将离散网格转换为连续顶点状态空间,结合Transformer流匹配实现并行去噪,在保持高质量拓扑的同时大幅提升生成速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24232 2026-06-24 cs.CV cs.GR 新提交 62%

FiCA: Feed-forward instant Gaussian Codec Avatars from a Single Portrait Image

FiCA:基于单张肖像图像的前馈即时高斯编解码器化身

Kim Youwang, Zhengyu Yang, Liuhao Ge, Yu Rong, Timur Bagautdinov, Su Zhaoen, Nir Sopher, Jovan Popović, Teng Deng, Tae-Hyun Oh, Chen Cao

机构 * Codec Avatars Lab, Meta(Meta编解码虚拟化身实验室) Dept. of Electrical Engineering, POSTECH(浦项科技大学电气工程系) School of Computing, KAIST(韩国科学技术院计算机学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 提出FiCA,一种结合人类视觉基础模型和扩散模型的前馈管道,从单张图像生成逼真、可驱动的3D高斯化身,无需测试时优化。

Comments Project page: https://kim-youwang.github.io/FiCA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23489 2026-06-23 cs.GR cs.CV 新提交 62%

MeshFlow: Mesh Generation with Equivariant Flow Matching

MeshFlow: 基于等变流匹配的网格生成

Qi Sun, Kiyohiro Nakayama, Jing Nathan Yan, Qixing Huang, Alexander Rush, Leonidas Guibas, Gordon Wetzstein, Jing Liao, Guandao Yang

机构 * City University of Hong Kong(香港城市大学) Stanford University(斯坦福大学) The University of Texas, Austin(德克萨斯大学奥斯汀分校)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 提出MeshFlow,利用等变最优传输流匹配模型直接生成三角网格,避免序列化,通过改进扩散变压器架构实现等变性,推理速度提升约18倍。

Comments SIGGRAPH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22481 2026-06-23 cs.GR cs.CV 新提交 62%

Lighting-Consistent Object Transfer Across Radiance Fields

跨辐射场的一致光照物体迁移

Nicolás Violante, George Kopanas, Linus Franke, Julien Philip, George Drettakis

机构 * Inria Université Côte d’Azur(大学皮埃尔-皮埃尔·德·科蒂尔) Google DeepMind(谷歌DeepMind) Eyeline Labs(Eyeline实验室)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 针对3D高斯泼溅中物体迁移时光照不一致的问题,提出一种扩散模型调和合成图像,结合合成、生成和真实数据训练,并通过后优化整合为3DGS表示,实现高质量物体迁移。

Comments Project page: https://repo-sam.inria.fr/nerphys/dot3d

Journal ref Computer Graphics Forum (EGSR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18243 2026-06-17 cs.CV cs.GR cs.RO 新提交 62%

MOCHI: Motion Enhancement of Collaborative Human-object Interactions

MOCHI: 协作人-物交互的运动增强

Jiye Lee, Yonghun Choi, Jungdam Won

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Seoul National University(首尔国立大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 针对多人-物交互数据中手物接触错位、运动抖动和手指细节缺失等问题,提出两阶段框架MOCHI,先通过优化生成物理合理的手部抓取,再基于扩散模型优化全身运动,有效增强噪声数据。

Comments SIGGRAPH 2026 Journal (ACM TOG); Project page: https://jiyewise.github.io/projects/MOCHI/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13652 2026-06-12 cs.CV cs.GR 新提交 62%

World Tracing: Generative Pixel-Aligned Geometry Beyond the Visible

世界追踪:超越可见表面的生成式像素对齐几何

Hao Zhang, Mohamed El Banani, Jen-Hao Cheng, Paul Zhang, Yi Hua, Ben Mildenhall, Christoph Lassner, Narendra Ahuja, Gengshan Yang

机构 * World Labs University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 提出世界追踪(World Tracing),一种生成式像素对齐几何表示,通过扩散变压器预测有序点栈,同时重建可见表面和生成遮挡几何,在多个基准上超越深度预测和图像到3D方法。

Comments World Labs Technical Report; Page: https://haoz19.github.io/world-tracing-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13336 2026-07-16 cs.CV cs.CR cs.LG 新提交 61%

Delving into the Temporal Challenges of Unified Video Protection Against Image-to-Video and Fine-Tuning-based Customization

深入探讨统一视频保护在图像到视频和基于微调的定制方面的时间挑战

Yuxin Huang, Ziming Hong, Mingming Gong, Wanyu Wang, Jing Zhang, Tongliang Liu

机构 * The University of Sydney(悉尼大学) University of Melbourne(墨尔本大学) City University of Hong Kong(香港城市大学) Wuhan University(武汉大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 扩散模型 :diffusion(abstract,comments);分类 cs.CV

AI总结 研究针对基于扩散模型的视频定制引发的隐私等保护问题,提出TC-UAP方法,通过优化身份级多帧UAP并引入相关时间建模和损失,使其在时间上一致且鲁棒,在多种视频定制及攻击下实现强身份保护。

Comments This work provides a basis for the ECCV 2026 LifeGenIP Challenge on Unlearnable Videos against Diffusion-based Customization. Challenge page: https://lifegenip.cc/competition. Evaluation code: ECCV26_LifeGenIP_starting_kit" target="_blank" rel="noopener">https://github.com/tmllab/ECCV26_LifeGenIP_starting_kit. Project page: https://saythe17.github.io/TC-UAP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15734 2026-08-18 eess.AS cs.MM cs.SD 新提交 57%

CineDub: Scaling End-to-End Video Dubbing to Multi-Speaker Dialogues with Coherent Sound Effects

CineDub:将端到端视频配音扩展至带连贯音效的多说话人对话场景

Yusheng Dai, Kangdi Wang, Baolong Gao, Yuxuan Jiang, Weiqiang Wang, Qiuhong Ke, Jianfei Cai

专题命中 扩散模型 :diffusion(abstract);分类 cs.MM

AI总结 本研究提出基于扩散模型的统一架构CineDub,无需人脸裁剪或说话人分割即可实现精准多说话人对话配音,还引入两项训练策略并发布两个野外基准,在相关任务中取得最优性能。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14758 2026-08-18 eess.IV cs.AI cs.CV 新提交 57%

Synthesizing Post-Acetazolamide Cerebral Blood Flow Maps from Baseline MRI in Moyamoya Using 3D Generative AI

利用3D生成AI从烟雾病患者的基线MRI合成乙酰唑胺给药后脑血流量图

Julia Huang, Camila Gonzalez, Rydham Goyal, Aja Zou, Sasha Alexander, Michael Moseley, Moss Y. Zhao, Gary K. Steinberg

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出CAE3D模型,可从烟雾病患者基线MRI合成乙酰唑胺后脑血流量图,在多指标上优于对比方法,为ACZ禁忌患者的血流动力学评估提供可行方案。

Comments 25 pages. Accepted at Machine Learning for Healthcare (MLHC 2026). To appear in Proceedings of Machine Learning Research (PMLR), volume 340

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16457 2026-08-18 cs.CV cs.AI 新提交 57%

Contrastive Energy Fields for Inference-Time Procedure Planning in Instructional Videos

用于教学视频中推理时流程规划的对比能量场(CEFITO)

Mohamed Afham, Christoph Reich, Oliver Hahn, Daniel Cremers, Stefan Roth

机构 * TU Darmstadt(达姆施塔特工业大学) TU Munich(慕尼黑工业大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对现有流程规划方法缺乏任务逻辑约束的问题,提出CEFITO方法,将流程规划构建为任务约束优化问题,在两个基准上取得最先进准确率。

Comments To appear at GCPR 2026 (oral paper). Project page: https://visinf.github.io/cefito

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16380 2026-08-18 cs.CV cs.AI 新提交 57%

Synthetic Data Augmentation for Satellite-Based Analysis of Battle-Damaged Agricultural Fields in Ukraine

用于乌克兰战区受损农田卫星分析的合成数据增强方法

Marta Sumyk, Oleksandr Kosovan, Iryna Voitsitska

机构 * Ukrainian Catholic University(乌克兰天主教大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究针对乌克兰受损农田卫星分析的标注数据稀缺问题,采用类别条件GAN与DDPM生成合成农田样本,结合真实数据训练视觉Transformer,使分类性能显著提升,验证了合成卫星图像在数据稀缺地理空间应用的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16354 2026-08-18 cs.AI cs.CV 新提交 57%

DriveCache: Action-Aware Caching for Driving World Model Inference

DriveCache:面向驾驶世界模型推理的动作感知缓存

Jianchun Yang, Jian Liang, Xianda Guo, Pinhan Fu, Yanlun Peng, Conglang Zhang, Wenke Huang, Mang Ye

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对扩散驾驶生成器吞吐量受限的问题,提出动作感知的DriveCache控制器,利用规划运动与动态规划优化缓存,提升保真度-效率权衡,代码将公开。

Comments 9 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15690 2026-08-18 cs.SD cs.AI cs.LG cs.MM 新提交 57%

Adding Voice Cloning to Text-to-Audio-Video Models with a Single Zero-Initialised Layer

为文本-音频-视频模型添加带单个零初始化层的语音克隆功能

Ivan Mikheev, Viacheslav Vasilev, Anna Dmitrienko, Alexey Letunovskiy, Ivan Kirillov, Kirill Chernyshev, Denis Dimitrov

机构 * Kandinsky Lab(坎丁斯基实验室)

专题命中 扩散模型 :diffusion(abstract);分类 cs.MM

AI总结 本文在基础文本-音频-视频模型上添加单个零初始化线性层,经微调后实现语音克隆,在674个说话人-文本对基准上优于5个基线,且推理时可跳过视频路径提速约30倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15555 2026-08-18 cs.CV cs.LG 新提交 57%

RigidBench: Evaluating Rigid-Body Physics in Video Generation Models

RigidBench:评估视频生成模型中的刚体物理效果

Swarnim Jain, Shangzhe Wu

机构 * University of Cambridge(剑桥大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出基于模拟器的RigidBench基准,评估视频生成模型的刚体物理效果,分析8个模型的表现,用5000个训练视频微调Wan 2.2 TI2V-5B并揭示其表征物体位置的机制。

Comments 30 pages, including appendices. Code: https://github.com/swarnim-j/RigidBench. Dataset: https://doi.org/10.5281/zenodo.21649156

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15298 2026-08-18 cs.CV 新提交 57%

Image Denoising via the Adaptive Rank-Cluster Filter

基于自适应秩聚类滤波器的图像去噪方法

Dmitry Pozdnyakov

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出自适应秩聚类滤波器,经Otsu聚类、模糊融合处理像素强度,在混合噪声场景下对图像去噪的鲁棒性优于多种基线滤波算法。

Comments 18 pages; 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏