arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2289 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 2289 篇

2608.18035 2026-08-19 cs.CV 新提交 57%

Plug-and-Play Traffic Element Awareness for End-to-End Autonomous Driving

用于端到端自动驾驶的即插即用交通元素感知

Zongzheng Zhang, Jijun Wang, Saining Zhang, Shuo Wang, Yiru Wang, Hai Yang, Yang Chen, Yuwen Heng, Hao Sun, Anqing Jiang, Hao Zhao

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) Bosch Corporate Research(博世企业研究中心)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究首次系统探究端到端自动驾驶的交通元素感知,通过补充标注构建统一基础设施,以即插即用方式集成信号,在多范式多数据集上提升性能,在NAVSIM-v2上达到新SOTA。

Comments Accepted by ECCV 2026; Project Page: https://zzongzheng0918.github.io/TE-Aware-E2E-AD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17420 2026-08-19 cs.CV 新提交 57%

SPVC: Structured and Panoptic Video Fixing for Cross-Dataset Driving Scene Rendering

SPVC:面向跨数据集驾驶场景渲染的结构化全景视频修复

Gen Li, Shu Han, Yun Xi Qiao, Hua Chen, Xuyang Dai, Bohan Li, Hao Zhao, Chaojian Li

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Zhejiang University(浙江大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Great Wall Motor Company Limited(长城汽车股份有限公司) Shanghai Jiao Tong University(上海交通大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出SPVC框架,通过结构化、全景、视频及跨数据集修复原则,训练两阶段可控视频扩散模型,解决驾驶场景渲染的伪影问题,实现跨数据集的高效修复。

Comments Project page: https://li00147.github.io/SPVC-Project-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17095 2026-08-19 cs.CV 新提交 57%

Inference-Time Attention Steering for Vision-Language-Action Driving Models

面向视觉-语言-动作驾驶模型的推理时注意力引导

Darshan Nagendra Prasad, Lars Ullrich, Knut Graichen

机构 * FAU Erlangen-Nürnberg(埃尔朗根-纽伦堡大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对VLA驾驶模型无法在推理时重定向注意力的问题,在Qwen3-VL主干上添加预softmax注意力偏差,实验验证了其对轨迹的引导效果及层相关特性。

Comments Attention Steering, Vision-Language-Action, AutonomousDriving, Inference-Time Intervention

Journal ref European Conference on Computer Vision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15734 2026-08-18 eess.AS cs.MM cs.SD 新提交 57%

CineDub: Scaling End-to-End Video Dubbing to Multi-Speaker Dialogues with Coherent Sound Effects

CineDub:将端到端视频配音扩展至带连贯音效的多说话人对话场景

Yusheng Dai, Kangdi Wang, Baolong Gao, Yuxuan Jiang, Weiqiang Wang, Qiuhong Ke, Jianfei Cai

专题命中 扩散模型 :diffusion(abstract);分类 cs.MM

AI总结 本研究提出基于扩散模型的统一架构CineDub,无需人脸裁剪或说话人分割即可实现精准多说话人对话配音,还引入两项训练策略并发布两个野外基准,在相关任务中取得最优性能。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14758 2026-08-18 eess.IV cs.AI cs.CV 新提交 57%

Synthesizing Post-Acetazolamide Cerebral Blood Flow Maps from Baseline MRI in Moyamoya Using 3D Generative AI

利用3D生成AI从烟雾病患者的基线MRI合成乙酰唑胺给药后脑血流量图

Julia Huang, Camila Gonzalez, Rydham Goyal, Aja Zou, Sasha Alexander, Michael Moseley, Moss Y. Zhao, Gary K. Steinberg

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出CAE3D模型,可从烟雾病患者基线MRI合成乙酰唑胺后脑血流量图,在多指标上优于对比方法,为ACZ禁忌患者的血流动力学评估提供可行方案。

Comments 25 pages. Accepted at Machine Learning for Healthcare (MLHC 2026). To appear in Proceedings of Machine Learning Research (PMLR), volume 340

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16457 2026-08-18 cs.CV cs.AI 新提交 57%

Contrastive Energy Fields for Inference-Time Procedure Planning in Instructional Videos

用于教学视频中推理时流程规划的对比能量场(CEFITO)

Mohamed Afham, Christoph Reich, Oliver Hahn, Daniel Cremers, Stefan Roth

机构 * TU Darmstadt(达姆施塔特工业大学) TU Munich(慕尼黑工业大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对现有流程规划方法缺乏任务逻辑约束的问题,提出CEFITO方法,将流程规划构建为任务约束优化问题,在两个基准上取得最先进准确率。

Comments To appear at GCPR 2026 (oral paper). Project page: https://visinf.github.io/cefito

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16380 2026-08-18 cs.CV cs.AI 新提交 57%

Synthetic Data Augmentation for Satellite-Based Analysis of Battle-Damaged Agricultural Fields in Ukraine

用于乌克兰战区受损农田卫星分析的合成数据增强方法

Marta Sumyk, Oleksandr Kosovan, Iryna Voitsitska

机构 * Ukrainian Catholic University(乌克兰天主教大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究针对乌克兰受损农田卫星分析的标注数据稀缺问题,采用类别条件GAN与DDPM生成合成农田样本,结合真实数据训练视觉Transformer,使分类性能显著提升,验证了合成卫星图像在数据稀缺地理空间应用的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16354 2026-08-18 cs.AI cs.CV 新提交 57%

DriveCache: Action-Aware Caching for Driving World Model Inference

DriveCache:面向驾驶世界模型推理的动作感知缓存

Jianchun Yang, Jian Liang, Xianda Guo, Pinhan Fu, Yanlun Peng, Conglang Zhang, Wenke Huang, Mang Ye

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对扩散驾驶生成器吞吐量受限的问题,提出动作感知的DriveCache控制器,利用规划运动与动态规划优化缓存,提升保真度-效率权衡,代码将公开。

Comments 9 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15690 2026-08-18 cs.SD cs.AI cs.LG cs.MM 新提交 57%

Adding Voice Cloning to Text-to-Audio-Video Models with a Single Zero-Initialised Layer

为文本-音频-视频模型添加带单个零初始化层的语音克隆功能

Ivan Mikheev, Viacheslav Vasilev, Anna Dmitrienko, Alexey Letunovskiy, Ivan Kirillov, Kirill Chernyshev, Denis Dimitrov

机构 * Kandinsky Lab(坎丁斯基实验室)

专题命中 扩散模型 :diffusion(abstract);分类 cs.MM

AI总结 本文在基础文本-音频-视频模型上添加单个零初始化线性层,经微调后实现语音克隆,在674个说话人-文本对基准上优于5个基线,且推理时可跳过视频路径提速约30倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15555 2026-08-18 cs.CV cs.LG 新提交 57%

RigidBench: Evaluating Rigid-Body Physics in Video Generation Models

RigidBench:评估视频生成模型中的刚体物理效果

Swarnim Jain, Shangzhe Wu

机构 * University of Cambridge(剑桥大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出基于模拟器的RigidBench基准,评估视频生成模型的刚体物理效果,分析8个模型的表现,用5000个训练视频微调Wan 2.2 TI2V-5B并揭示其表征物体位置的机制。

Comments 30 pages, including appendices. Code: https://github.com/swarnim-j/RigidBench. Dataset: https://doi.org/10.5281/zenodo.21649156

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15298 2026-08-18 cs.CV 新提交 57%

Image Denoising via the Adaptive Rank-Cluster Filter

基于自适应秩聚类滤波器的图像去噪方法

Dmitry Pozdnyakov

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出自适应秩聚类滤波器,经Otsu聚类、模糊融合处理像素强度,在混合噪声场景下对图像去噪的鲁棒性优于多种基线滤波算法。

Comments 18 pages; 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15296 2026-08-18 cs.CV 新提交 57%

FMReward: Aligning and Evaluating Audio-Driven 3D Facial Animation with Human Preferences

FMReward:基于人类偏好的音频驱动三维面部动画对齐与评估框架

Sijing Wu, Yunhao Li, Zhilin Gao, Huiyu Duan, Yucheng Zhu, Guangtao Zhai, Patrick Le Callet

机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(上海交通大学图像通信与网络工程研究所) USC-SJTU Institute of Cultural and Creative Industry, Shanghai Jiao Tong University(上海交通大学 USC-文化创意产业学院) Institut Universitaire de France (IUF)(法国大学研究院) University of Nantes(南特大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文构建首个音频驱动三维面部动画人类偏好数据集FMPair,提出FMReward奖励模型与FMFL微调算法,可更好对齐人类偏好,提升该类动画的感知质量。

Comments Accepted for publication in IEEE TVCG, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15141 2026-08-18 cs.CV 新提交 57%

HOIMask: Towards Generative Masked Modeling for Human Object Interaction Generation

HOIMask:面向用于人机交互生成的生成式掩码建模

Yihong Ji, Jinsong Zhang, He Hu, Hongbo Xu

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机与软件学院) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Fuzhou University(福州大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 HOIMask作为首个用于离散空间HOI运动建模的生成式掩码框架,通过HOI VQ编码、Transformer架构及接触感知重构引导,生成的HOI运动优于现有扩散方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14740 2026-08-18 cs.CV 新提交 57%

From Dense Prediction to Visual Editing: Structured Supervision for Unified Image and Video Creation

从密集预测到视觉编辑:用于统一图像与视频创作的结构化监督

Zhefan Rao, Bin Zou, Haoxuan Che, Xuanhua He, Chong Hou Choi, Yanheng Li, Rui Liu, Qifeng Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学) Celia Research HK City University of Hong Kong(香港城市大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出基于深度与表面法向量预测的结构化视觉监督框架,共享MMDiT主干实现统一图像视频创作,提升了相关基准任务分数,证明密集监督对下游创作的结构知识迁移价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14706 2026-08-18 cs.CV cs.AI cs.LG 新提交 57%

Equilibrium Forcing: Adaptive Video Generation Without Noise Conditioning

均衡强迫:无需噪声条件的自适应视频生成

Hansen Jin Lillemark, Alex Rojas, Zachary Novack, Runqian Wang, Yilun Du, Yian Ma, Taylor Berg-Kirkpatrick, Rose Yu

机构 * UC San Diego(加州大学圣地亚哥分校) MIT(麻省理工学院) Harvard University(哈佛大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出无需噪声条件的均衡强迫(EqF)框架,解耦去噪场学习与采样,实现自适应闭环推理,提升自回归视频生成的质量与一致性,性能优于传统噪声条件方法。

Comments Project page: https://equilibriumforcing.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14070 2026-08-17 cs.CV 新提交 57%

InstructVVT: Instruction-Driven Video Virtual Try-On without Auxiliary Spatial Priors

InstructVVT:无需辅助空间先验的指令驱动视频虚拟试穿

Dingbao Shao, Song Wu, Xinyu Chen, Qian Wang, Jiahang Li, Kuai Jiang, Jiang Lin, Yuhang Liu, Ziyu Chen, Duo Li, Jiaxin Hu, Shengrong Gu, Ziheng Tang, Rongrong Liu, Yanlun Peng, Liang Li, Junlan Feng, Lujia Jin, Ting Zhang, Jian Yang, Zili Yi

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 InstructVVT是基于DiT的视频虚拟试穿框架,通过双层级参考调控方案无需推理时空间先验,在ViViD-S等数据集上优于现有开源方法,解决了现有方法依赖辅助先验的问题。

Comments 23 pages, 10 figures. Dingbao Shao and Song Wu contributed equally. Zili Yi is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14046 2026-08-17 cs.CV 新提交 57%

Source-Agnostic Image Translation Based on Latent Aware Adaptive Masking

基于潜在感知自适应掩码的源无关图像翻译

Tomislav Dobrički, Byung-Woo Hong

机构 * Chung-Ang University(中央大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出一种源无关图像翻译框架,通过潜在感知自适应掩码方案,在AFHQ、Celeba-HQ数据集上优于现有无监督图像到图像方法,无需专门训练即可实现跨源分布的无缝翻译。

Comments This paper has been accepted for publication at the European Conference on Computer Vision (ECCV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13460 2026-08-14 cs.CV 新提交 57%

SNM-VFI: Symmetric Nonlinear Motion-Guided Generative Video Frame Interpolation

SNM-VFI:对称非线性运动引导的生成式视频帧插值

Jisoo Jeong, Hong Cai, Jamie Menjay Lin, Hanno Ackermann, Hyeonjun Sim, Yinhao Zhu, Yunxiao Shi, Fatih Porikli

机构 * Qualcomm(高通公司)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出无需训练的SNM-VFI框架,结合预训练光流与视频扩散模型,用对称非线性运动模型引导生成过程,经多基准评估实现了优质视频帧插值效果。

Comments ECCVW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13028 2026-08-14 cs.CV cs.RO 新提交 57%

RGB-D Video Generation for Improving Human-to-Robot Object Handover Prediction

用于改进人机物体交接预测的RGB-D视频生成

Tianyu Sun, Zhoujie Fu, Zihui Gao, Bang Zhang, Guosheng Lin

机构 * Nanyang Technological University(南洋理工大学) College of Computing and Data Science(计算与数据科学学院) Zhejiang University(浙江大学) College of Computer Science and Technology(计算机科学与技术学院) Alibaba Group(阿里巴巴集团)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对人机物体交接数据集稀缺及现实-模拟差距问题,提出Hand2Bot数据集与PassGen生成流水线,实现高意图识别准确率与低误触发率,支持机器人稳健零样本迁移与早期意图预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12997 2026-08-14 cs.CV 新提交 57%

PixSDS: Why Latent SDS Makes Noisy Pixels

PixSDS:潜在SDS为何会产生带噪像素

Vsevolod Skorokhodov

机构 * EPFL(洛桑联邦理工学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对潜在SDS生成3D时的像素漂移问题,提出轻量级VAE一致性梯度修复方法PixSDS,减少结构化伪影并保留语义内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12780 2026-08-14 cs.CV 新提交 57%

SCOPE: Subspace Clustering with Online Per-Head Top-K Estimation for Sparse Video Attention

SCOPE:用于稀疏视频注意力的在线分头Top-K估计的子空间聚类

Qi Zhao, Qirui Li, Hanlin Tang, Yiduo Li, Zhen Guo, Cuifeng Shen, Chao Xu, Zhaosheng Chi, Xiaojin Lu, Kan Liu, Tao Lan, Lin Qu, Xi Li

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 SCOPE是一种无训练稀疏注意力框架,通过子空间聚类与在线分头Top-k估计解决视频DiTs的高成本问题,在6种配置中优于基线,实现1.99倍加速且保持28.46 dB PSNR。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12209 2026-08-13 cs.CV 新提交 57%

Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction

作为辅助监督的生成:通过解耦嵌入预测以零推理开销增强视觉理解

Zhongbin Guo, Jiahao Xie, Dongling Xiao, Qianle Wang, Ruiqi Lu, Xiaomin He, Wanxuan Sun, Cheng Yang

机构 * ByteDance(字节跳动)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出GAS框架,将视觉生成作为辅助监督,通过解耦MoT架构的NEP实现零推理开销,提升了多模态理解尤其是感知与空间理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11618 2026-08-13 cs.CV 新提交 57%

Generative Video Compression Based on Hierarchical Referencing

基于分层参考的生成式视频压缩

Daowen Li, Ding Ding, Zifu Zhang, Kai Li, Ying Chen

机构 * Alibaba Group(阿里巴巴集团)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于分层参考的生成式视频压缩方法GVCHR,通过分层结构优化潜在编码与生成重建,在多个基准数据集上较现有最优方法实现LPIPS和DISTS指标下50.5%、54.0%的BD-rate增益,视觉质量显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10000 2026-08-12 eess.IV cs.CV 新提交 57%

Pre- to Post-Contrast Synthesis of Breast DCE-MRI using Latent Bridge Matching

基于潜在桥匹配的乳腺动态对比增强MRI从造影前到造影后合成

Sina Amirrajab, Zohaib Salahuddin, Henry C Woodruff, Philippe Lambin

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出潜在桥匹配框架,在MAMA-SYNTH挑战中从乳腺DCE-MRI造影前图像合成峰值增强图像,肿瘤条件变体性能优于造影前条件及LDM基线,为虚拟造影增强提供新方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11205 2026-08-12 cs.CV 新提交 57%

AdvFD: Boosting Visual Generation via Adversarial Fr'echet Distance Loss

AdvFD:通过对抗性Fréchet距离损失提升视觉生成性能

Mingju Gao, Jingkai Zhou, Kun Gai, Changqian Yu, Hao Tang

机构 * Peking University(北京大学) KlingAI(可灵AI)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出AdvFD算法,通过补充静态Fréchet损失的对抗学习表示并引入真实特征白化,解决Fréchet攻击问题,提升了JiT、pMF等骨干网络的单步生成器后训练性能。

Comments Project Page: https://gasaiyu.github.io/AdvFD-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10933 2026-08-12 cs.CV 新提交 57%

SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense

SafeCA:用于文本到视频越狱防御的安全交叉注意力定位与调控

Siyuan Liang, Yupeng Qiu, Junfeng Fang, Rong-Cheng Tu, Jiaxing Huang, Dacheng Tao

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 SafeCA是一种特征级T2V越狱防御机制,通过分析交叉注意力特征差异提出,可降低主流模型越狱成功率约20%,仅增0.1s推理开销且保持语义一致性,提供架构级可部署防护范式。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10744 2026-08-12 cs.CV 新提交 57%

Beyond Pixels: From Video Priors to 4D Worlds

超越像素:从视频先验到4D世界

Zihao Liu, Xiaolong Shen, Zhenglin Zhou, Ruijie Quan, Yi Yang

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Latent-to-4D方法,利用共享VAE的视频模型去噪潜在变量作为接口实现4D生成,在两个数据集上的DINO-F1指标优于对比方法,且受人类评估者认可。

Comments Project page: https://hayd-zju.github.io/Beyond-Pixels

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10519 2026-08-12 cs.CV 新提交 57%

SparSTAR: Sparse Attention for SpaceTime AutoRegressive Video Synthesis

SparSTAR:用于时空自回归视频合成的稀疏注意力机制

Jongbeom Lee, Hyunwoo Yu, Jincheol Yang, Jaemin Choi, Suk-Ju Kang

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对InfinityStar视频合成中高成本注意力与不可靠稀疏模式问题,提出无需训练的SparSTAR块稀疏注意力,在720p生成任务中实现约1.6倍加速且保持高保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10439 2026-08-12 cs.CV 新提交 57%

Stream Forcing: Constructing Unified Training Trajectory for Robust Streaming Video Generation

流强制:构建用于鲁棒流视频生成的统一训练轨迹

Yueting Zhu, Yuehao Song, Kaicheng Zhang, Bao Tang, Shaoyu Chen, Qian Zhang, Wenyu Liu, Xinggang Wang

机构 * Huazhong University of Science & Technology(华中科技大学) Horizon Robotics(地平线机器人) Anyverse Dynamics

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对流视频扩散模型的训练-推理不匹配问题,提出Stream Forcing统一训练框架,通过构建训练轨迹及相关算法,在UCF-101基准测试中FVD分别提升36.6%、27.9%,提升了生成质量与长时序泛化能力。

Comments 15 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10435 2026-08-12 cs.CV 新提交 57%

DynaPPI: A Large-scale Dynamic Protein Dataset for AI-driven Advances in Protein Interactomics

DynaPPI:面向AI驱动蛋白质互作组学进展的大规模动态蛋白质数据集

Jiabao Wei, Zilong Geng, Yuze Wang, Jianjun Li, Ning Ding, Bowen Zhou, Bing Zhang, Zhiyuan Ma

机构 * BIT(北京理工大学) HUST(华中科技大学) SJTU(上海交通大学) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出DynaPPI动态蛋白质数据集,填补现有数据集忽略多体结合动态过程的空白,助力扩散模型预测未知蛋白质复合物结构,推动AI驱动的蛋白质互作组学发展。

Comments 9 pages, 1 figure, 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: AI4Science

详情

展开后加载摘要…

URL PDF HTML 收藏