arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2962 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 2264 篇

2608.15296 2026-08-18 cs.CV 新提交 57%

FMReward: Aligning and Evaluating Audio-Driven 3D Facial Animation with Human Preferences

FMReward:基于人类偏好的音频驱动三维面部动画对齐与评估框架

Sijing Wu, Yunhao Li, Zhilin Gao, Huiyu Duan, Yucheng Zhu, Guangtao Zhai, Patrick Le Callet

机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(上海交通大学图像通信与网络工程研究所) USC-SJTU Institute of Cultural and Creative Industry, Shanghai Jiao Tong University(上海交通大学 USC-文化创意产业学院) Institut Universitaire de France (IUF)(法国大学研究院) University of Nantes(南特大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文构建首个音频驱动三维面部动画人类偏好数据集FMPair,提出FMReward奖励模型与FMFL微调算法,可更好对齐人类偏好,提升该类动画的感知质量。

Comments Accepted for publication in IEEE TVCG, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15141 2026-08-18 cs.CV 新提交 57%

HOIMask: Towards Generative Masked Modeling for Human Object Interaction Generation

HOIMask:面向用于人机交互生成的生成式掩码建模

Yihong Ji, Jinsong Zhang, He Hu, Hongbo Xu

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机与软件学院) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Fuzhou University(福州大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 HOIMask作为首个用于离散空间HOI运动建模的生成式掩码框架,通过HOI VQ编码、Transformer架构及接触感知重构引导,生成的HOI运动优于现有扩散方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14740 2026-08-18 cs.CV 新提交 57%

From Dense Prediction to Visual Editing: Structured Supervision for Unified Image and Video Creation

从密集预测到视觉编辑:用于统一图像与视频创作的结构化监督

Zhefan Rao, Bin Zou, Haoxuan Che, Xuanhua He, Chong Hou Choi, Yanheng Li, Rui Liu, Qifeng Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学) Celia Research HK City University of Hong Kong(香港城市大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出基于深度与表面法向量预测的结构化视觉监督框架,共享MMDiT主干实现统一图像视频创作,提升了相关基准任务分数,证明密集监督对下游创作的结构知识迁移价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14706 2026-08-18 cs.CV cs.AI cs.LG 新提交 57%

Equilibrium Forcing: Adaptive Video Generation Without Noise Conditioning

均衡强迫:无需噪声条件的自适应视频生成

Hansen Jin Lillemark, Alex Rojas, Zachary Novack, Runqian Wang, Yilun Du, Yian Ma, Taylor Berg-Kirkpatrick, Rose Yu

机构 * UC San Diego(加州大学圣地亚哥分校) MIT(麻省理工学院) Harvard University(哈佛大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出无需噪声条件的均衡强迫(EqF)框架,解耦去噪场学习与采样,实现自适应闭环推理,提升自回归视频生成的质量与一致性,性能优于传统噪声条件方法。

Comments Project page: https://equilibriumforcing.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14070 2026-08-17 cs.CV 新提交 57%

InstructVVT: Instruction-Driven Video Virtual Try-On without Auxiliary Spatial Priors

InstructVVT:无需辅助空间先验的指令驱动视频虚拟试穿

Dingbao Shao, Song Wu, Xinyu Chen, Qian Wang, Jiahang Li, Kuai Jiang, Jiang Lin, Yuhang Liu, Ziyu Chen, Duo Li, Jiaxin Hu, Shengrong Gu, Ziheng Tang, Rongrong Liu, Yanlun Peng, Liang Li, Junlan Feng, Lujia Jin, Ting Zhang, Jian Yang, Zili Yi

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 InstructVVT是基于DiT的视频虚拟试穿框架,通过双层级参考调控方案无需推理时空间先验,在ViViD-S等数据集上优于现有开源方法,解决了现有方法依赖辅助先验的问题。

Comments 23 pages, 10 figures. Dingbao Shao and Song Wu contributed equally. Zili Yi is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14046 2026-08-17 cs.CV 新提交 57%

Source-Agnostic Image Translation Based on Latent Aware Adaptive Masking

基于潜在感知自适应掩码的源无关图像翻译

Tomislav Dobrički, Byung-Woo Hong

机构 * Chung-Ang University(中央大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出一种源无关图像翻译框架,通过潜在感知自适应掩码方案,在AFHQ、Celeba-HQ数据集上优于现有无监督图像到图像方法,无需专门训练即可实现跨源分布的无缝翻译。

Comments This paper has been accepted for publication at the European Conference on Computer Vision (ECCV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13460 2026-08-14 cs.CV 新提交 57%

SNM-VFI: Symmetric Nonlinear Motion-Guided Generative Video Frame Interpolation

SNM-VFI:对称非线性运动引导的生成式视频帧插值

Jisoo Jeong, Hong Cai, Jamie Menjay Lin, Hanno Ackermann, Hyeonjun Sim, Yinhao Zhu, Yunxiao Shi, Fatih Porikli

机构 * Qualcomm(高通公司)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出无需训练的SNM-VFI框架,结合预训练光流与视频扩散模型,用对称非线性运动模型引导生成过程,经多基准评估实现了优质视频帧插值效果。

Comments ECCVW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13028 2026-08-14 cs.CV cs.RO 新提交 57%

RGB-D Video Generation for Improving Human-to-Robot Object Handover Prediction

用于改进人机物体交接预测的RGB-D视频生成

Tianyu Sun, Zhoujie Fu, Zihui Gao, Bang Zhang, Guosheng Lin

机构 * Nanyang Technological University(南洋理工大学) College of Computing and Data Science(计算与数据科学学院) Zhejiang University(浙江大学) College of Computer Science and Technology(计算机科学与技术学院) Alibaba Group(阿里巴巴集团)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对人机物体交接数据集稀缺及现实-模拟差距问题,提出Hand2Bot数据集与PassGen生成流水线,实现高意图识别准确率与低误触发率,支持机器人稳健零样本迁移与早期意图预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12997 2026-08-14 cs.CV 新提交 57%

PixSDS: Why Latent SDS Makes Noisy Pixels

PixSDS:潜在SDS为何会产生带噪像素

Vsevolod Skorokhodov

机构 * EPFL(洛桑联邦理工学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对潜在SDS生成3D时的像素漂移问题,提出轻量级VAE一致性梯度修复方法PixSDS,减少结构化伪影并保留语义内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12780 2026-08-14 cs.CV 新提交 57%

SCOPE: Subspace Clustering with Online Per-Head Top-K Estimation for Sparse Video Attention

SCOPE:用于稀疏视频注意力的在线分头Top-K估计的子空间聚类

Qi Zhao, Qirui Li, Hanlin Tang, Yiduo Li, Zhen Guo, Cuifeng Shen, Chao Xu, Zhaosheng Chi, Xiaojin Lu, Kan Liu, Tao Lan, Lin Qu, Xi Li

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 SCOPE是一种无训练稀疏注意力框架,通过子空间聚类与在线分头Top-k估计解决视频DiTs的高成本问题,在6种配置中优于基线,实现1.99倍加速且保持28.46 dB PSNR。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12209 2026-08-13 cs.CV 新提交 57%

Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction

作为辅助监督的生成:通过解耦嵌入预测以零推理开销增强视觉理解

Zhongbin Guo, Jiahao Xie, Dongling Xiao, Qianle Wang, Ruiqi Lu, Xiaomin He, Wanxuan Sun, Cheng Yang

机构 * ByteDance(字节跳动)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出GAS框架,将视觉生成作为辅助监督,通过解耦MoT架构的NEP实现零推理开销,提升了多模态理解尤其是感知与空间理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11618 2026-08-13 cs.CV 新提交 57%

Generative Video Compression Based on Hierarchical Referencing

基于分层参考的生成式视频压缩

Daowen Li, Ding Ding, Zifu Zhang, Kai Li, Ying Chen

机构 * Alibaba Group(阿里巴巴集团)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于分层参考的生成式视频压缩方法GVCHR,通过分层结构优化潜在编码与生成重建,在多个基准数据集上较现有最优方法实现LPIPS和DISTS指标下50.5%、54.0%的BD-rate增益,视觉质量显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10000 2026-08-12 eess.IV cs.CV 新提交 57%

Pre- to Post-Contrast Synthesis of Breast DCE-MRI using Latent Bridge Matching

基于潜在桥匹配的乳腺动态对比增强MRI从造影前到造影后合成

Sina Amirrajab, Zohaib Salahuddin, Henry C Woodruff, Philippe Lambin

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出潜在桥匹配框架,在MAMA-SYNTH挑战中从乳腺DCE-MRI造影前图像合成峰值增强图像,肿瘤条件变体性能优于造影前条件及LDM基线,为虚拟造影增强提供新方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11205 2026-08-12 cs.CV 新提交 57%

AdvFD: Boosting Visual Generation via Adversarial Fr'echet Distance Loss

AdvFD:通过对抗性Fréchet距离损失提升视觉生成性能

Mingju Gao, Jingkai Zhou, Kun Gai, Changqian Yu, Hao Tang

机构 * Peking University(北京大学) KlingAI(可灵AI)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出AdvFD算法,通过补充静态Fréchet损失的对抗学习表示并引入真实特征白化,解决Fréchet攻击问题,提升了JiT、pMF等骨干网络的单步生成器后训练性能。

Comments Project Page: https://gasaiyu.github.io/AdvFD-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10933 2026-08-12 cs.CV 新提交 57%

SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense

SafeCA:用于文本到视频越狱防御的安全交叉注意力定位与调控

Siyuan Liang, Yupeng Qiu, Junfeng Fang, Rong-Cheng Tu, Jiaxing Huang, Dacheng Tao

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 SafeCA是一种特征级T2V越狱防御机制,通过分析交叉注意力特征差异提出,可降低主流模型越狱成功率约20%,仅增0.1s推理开销且保持语义一致性,提供架构级可部署防护范式。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10744 2026-08-12 cs.CV 新提交 57%

Beyond Pixels: From Video Priors to 4D Worlds

超越像素:从视频先验到4D世界

Zihao Liu, Xiaolong Shen, Zhenglin Zhou, Ruijie Quan, Yi Yang

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Latent-to-4D方法,利用共享VAE的视频模型去噪潜在变量作为接口实现4D生成,在两个数据集上的DINO-F1指标优于对比方法,且受人类评估者认可。

Comments Project page: https://hayd-zju.github.io/Beyond-Pixels

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10519 2026-08-12 cs.CV 新提交 57%

SparSTAR: Sparse Attention for SpaceTime AutoRegressive Video Synthesis

SparSTAR:用于时空自回归视频合成的稀疏注意力机制

Jongbeom Lee, Hyunwoo Yu, Jincheol Yang, Jaemin Choi, Suk-Ju Kang

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对InfinityStar视频合成中高成本注意力与不可靠稀疏模式问题,提出无需训练的SparSTAR块稀疏注意力,在720p生成任务中实现约1.6倍加速且保持高保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10439 2026-08-12 cs.CV 新提交 57%

Stream Forcing: Constructing Unified Training Trajectory for Robust Streaming Video Generation

流强制:构建用于鲁棒流视频生成的统一训练轨迹

Yueting Zhu, Yuehao Song, Kaicheng Zhang, Bao Tang, Shaoyu Chen, Qian Zhang, Wenyu Liu, Xinggang Wang

机构 * Huazhong University of Science & Technology(华中科技大学) Horizon Robotics(地平线机器人) Anyverse Dynamics

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对流视频扩散模型的训练-推理不匹配问题,提出Stream Forcing统一训练框架,通过构建训练轨迹及相关算法,在UCF-101基准测试中FVD分别提升36.6%、27.9%,提升了生成质量与长时序泛化能力。

Comments 15 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10435 2026-08-12 cs.CV 新提交 57%

DynaPPI: A Large-scale Dynamic Protein Dataset for AI-driven Advances in Protein Interactomics

DynaPPI:面向AI驱动蛋白质互作组学进展的大规模动态蛋白质数据集

Jiabao Wei, Zilong Geng, Yuze Wang, Jianjun Li, Ning Ding, Bowen Zhou, Bing Zhang, Zhiyuan Ma

机构 * BIT(北京理工大学) HUST(华中科技大学) SJTU(上海交通大学) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出DynaPPI动态蛋白质数据集,填补现有数据集忽略多体结合动态过程的空白,助力扩散模型预测未知蛋白质复合物结构,推动AI驱动的蛋白质互作组学发展。

Comments 9 pages, 1 figure, 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: AI4Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09926 2026-08-11 cs.CV 新提交 57%

Learning How the World Evolves: Extrapolative Video World Models via Latent Dynamics Reasoning

学习世界如何演化:基于潜动态推理的外推视频世界模型

Haodong Li, Shaoteng Liu, Tianyu Wang, Chongjian Ge, Sihui Ji, Jiahan Zhang, Xin Lin, Haolin Lu, Zhe Lin, Manmohan Chandraker

机构 * UCSD(加利福尼亚大学圣迭戈分校) Adobe(奥多比公司)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对主流视频扩散模型未建模像素时间转换的问题,提出LDR方法,在PhyWorld基准上实现更优动态外推,参数更少、速度更快,是首个能泛化至训练分布外的视频世界模型

Comments Project page: https://lat-dyn-reason.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09691 2026-08-11 cs.CV 新提交 57%

Diffuse the object, keep its label: curating detector training data from a few unlabeled photographs via VLM-built 3D vegetation scenes

扩散目标,保留其标签:通过VLM构建的3D植被场景从少量未标记照片中整理检测器训练数据

Mario Malizia, Marnix Enting, Rob Haelterman, Ken Hasselmann

机构 * Royal Military Academy(皇家军事学院) KU Leuven(鲁汶大学) Flanders Make(佛兰德制造研究院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究针对植被中小物体标记图像稀缺导致检测器跨站点泛化差的问题,通过VLM构建3D植被场景合成标记训练图像,实现无监督站点适应,在排雷基准上性能优于传统跨站点标签复用。

Comments Accepted at the Curated Data for Efficient Learning (CDEL) Workshop @ ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09579 2026-08-11 cs.CV 新提交 57%

You Only Flow Once: Calibrated and Real-Time Radar Pose Estimation with Multi-Hypothesis Normalizing Flows

仅一次流:基于多假设归一化流的校准且实时雷达位姿估计

Jonas Leo Mueller, Sebastian Hoefler, Dario Zanca, Naga Venkata Sai Jitin Jami, Thomas Altstidl, Bjoern M. Eskofier

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(弗里德里希-亚历山大-埃尔兰根-纽伦堡大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) LMU München(慕尼黑大学) Helmholtz Zentrum München(慕尼黑亥姆霍兹中心)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对雷达位姿估计的歧义问题,提出MH-NFPG方法,结合时空Transformer与归一化流,实现高效实时的校准位姿估计,性能优于扩散模型。

Comments Accepted at the Winter Conference on Applications of Computer Vision (WACV) 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09493 2026-08-11 cs.CV 新提交 57%

GeoRoute: Geometry-Aware Hybrid Inference for Traffic Future-Frame Prediction

GeoRoute:面向交通未来帧预测的几何感知混合推理方法

Khang Minh Le, Hieu Dinh Trung Pham, Luu Thanh Danh, Nam-Tien Le, Hieu Anh Ngo, Phuong Huu Vu Tran, Son Nguyen Minh Le, Nguyen Trong Nghia, Tu Tran Thi Cam, Huy Minh Nhat Nguyen, Cuong Tuan Nguyen

机构 * Vietnamese-German University(越南-德国大学) University of Science, Ho Chi Minh City(胡志明市科学大学) Ho Chi Minh City University of Technology(胡志明市技术大学) University of Information Technology, Ho Chi Minh City(胡志明市信息技术大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 GeoRoute是一种无需训练的几何感知混合推理框架,通过多帧深度分层渲染器和视角条件选择预测器,在AI City Challenge Track 5基准上实现了具有竞争力的交通未来帧预测性能,提升了静态几何稳定性。

Comments accepted to the ECCV 2026 AI City Challenge Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08167 2026-08-11 cs.CV cs.LG 新提交 57%

Wiener Representation Filtering for VLM Hallucination Suppression

用于抑制视觉语言模型幻觉的维纳表示滤波

Ameen Ali, Tamim Zoabi, Lidor Brami, Lior Wolf

机构 * Tel Aviv University(特拉维夫大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出一种无需训练的事后维纳表示滤波技术,通过离线校准校正视觉语言模型深层前馈输出投影,可在保持运行速度的同时降低其对象幻觉,在多类模型及基准上均验证了有效性与通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08125 2026-08-11 cs.CV 新提交 57%

Staying True to the Origin: Continuous Image Stylization with Smooth Transitions

忠于本源:具有平滑过渡的连续图像风格化

Rui Xu, Hanmo Zhang, Songhua Liu

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对图像风格化的内容保留与过渡问题,提出两阶段训练策略及风格强度感知样条插值方法,让基于DiT的模型实现精确连续的风格强度控制,生成高保真结果。

Comments 14 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08115 2026-08-11 cs.CV 新提交 57%

SUMI: Scalable Unified Model for 3D Point Cloud Inference

SUMI:用于三维点云推理的可扩展统一模型

Yanlong LI, Kanchana Thilakarathna

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对点云补全由粗到精范式中局部细节重构不足的问题,提出扩散增强细化模块SUMI,可集成到现有模型,在多个基准数据集上实现性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07863 2026-08-11 cs.CV eess.IV 新提交 57%

LHSDet: High-Resolution AI-Generated Image Detection via Visual Question Answering

LHSDet:基于视觉问答的高分辨率AI生成图像检测方法

Qian Yao, Jun-Jie Huang, Yongjun Wang, Luming Yang

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机学院) Academy of Military Science(军事科学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对现有AI生成图像检测方法忽略高分辨率细节、难以应对未知生成模型的问题,提出LHSDet,将检测任务转为视觉问答,采用三分支架构,在各类生成模型上实现高检测准确率与稳健性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06729 2026-08-10 cs.RO cs.CV 新提交 57%

AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models

AtlasVLA:面向视觉-语言-动作模型的持久化世界-自我状态建模

Guiyu Zhao, Longteng Guo, Yanghong Mei, Zilin Zhu, Yu Zhang, Bin Cao, Mingming Yu, Xingjian He, Jie Jiang, Jing Liu

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 AtlasVLA是一种新型VLA模型框架,通过双记忆架构实现持久化世界-自我状态建模,在仅用腕部单目相机的情况下,在LIBERO等基准及真实世界长时序任务中性能超越多视图基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06240 2026-08-07 cs.CV cs.AI 新提交 57%

PRISM: Distribution-Gated Flow Matching for Controllable Unpaired Image Translation

PRISM:用于可控非配对图像翻译的分布门控流匹配

Elad Yoshai, Natan T. Shaked

机构 * Tel Aviv University(特拉维夫大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 PRISM是一种无GAN的流匹配框架,通过分布门控实现可控非配对图像翻译,在5个自然与生物医学基准上,其在多数任务的Inception FID、KID及组织病理学细胞核计数比上表现优异,平衡了目标逼真度与结构保留。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05798 2026-08-07 cs.CV cs.LG cs.SD 新提交 57%

KVAE: Family of Tokenizers for Multimodal Generative Models

KVAE:用于多模态生成模型的分词器家族

Andrey Shutkin, Denis Parkhomenko, Ivan Kirillov, Kirill Chernyshev, Kirill Malakhov, Ilia Vasiliev, Ilia Trushkin, Valeriya Kobenko, David Chikovani, Alexander Ivanov, Azat Saginbaev, Egor Silvestrov, Ivan Mikheev, Konstantin Zakharov

机构 * Kandinsky Lab(坎丁斯基实验室)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出用于多模态生成模型的KVAE分词器家族,含音频、图像、视频专用型号,性能优于多款前沿开源分词器,公开了训练细节与代码。

详情

展开后加载摘要…

URL PDF HTML 收藏