arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2127 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2127 篇

2605.19728 2026-05-20 cs.CV 79%

Aero-World: Action-Conditioned Aerial Video Generation from Inertial Controls

Aero-World: 从惯性控制生成动作条件的空中视频

Abdul Mohaimen Al Radi, Kunyang Li, Yuzhang Shang, Mubarak Shah, Yu Tian

机构 * Institute of Artificial Intelligence, University of Central Florida(中央佛罗里达大学人工智能研究所)

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 本文提出Aero-World,一种将预训练图像到视频扩散模型转换为可控空中视频生成器的方法,通过注入加速度和角速度序列,利用冻结的物理探测器提供惯性一致性监督,从而提高生成视频对低级动作信号的符合度和时间稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18396 2026-05-20 cs.CV 79%

NEWTON: Agentic Planning for Physically Grounded Video Generation

NEWTON:面向物理基础视频生成的代理规划

Yuxiang Feng, Juncheng Wang, Chao Xu, Yijie Qian, Huihan Wang, Wenlong Hou, Yang Liu, Baigui Sun, Yong Liu, Shujun Wang

机构 * Zhejiang University(浙江大学) The Hong Kong Polytechnic University(香港理工大学) IROOTECH TECHNOLOGY(IROOTECH技术公司) Sany Group(三一集团)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出NEWTON,通过将视频生成从系统输出降级为代理工具箱中的一个动作,利用学习的规划器协调物理感知工具,提高视频生成的物理合理性,从而在VideoPhy-2数据集上显著提升联合准确性。

Comments project page: https://Newton026.github.io/newton

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08503 2026-05-20 cs.CV 79%

Phantom: Physics-Infused Video Generation via Joint Modeling of Visual and Latent Physical Dynamics

Phantom:通过联合建模视觉和潜在物理动态实现物理 infused 的视频生成

Ying Shen, Jerry Xiong, Tianjiao Yu, Ismini Lourentzou

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出Phantom模型,通过联合建模视觉内容和潜在物理动态,使视频生成过程具备物理一致性,从而生成既视觉真实又物理合理的视频。

Comments 15 pages, 6 figures, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22292 2026-05-20 cs.CV cs.AI 79%

Jailbreaking on Text-to-Video Models via Scene Splitting Strategy

通过场景分割策略对文本到视频模型进行劫持

Wonjun Lee, Haon Park, Doehyeon Lee, Bumsub Ham, Suhyun Kim

机构 * Yonsei University(延世大学) Korea Institute of Science and Technology(韩国科学技术院) AIM Intelligence(AIM智能) Seoul National University(首尔国立大学) Kyung Hee University(庆熙大学)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

AI总结 本文提出了一种新的黑盒劫持方法SceneSplit,通过将有害叙述分割成多个良性场景,利用场景组合作为约束来引导最终输出,从而提高生成有害视频的可能性,验证了当前文本到视频模型的安全机制存在漏洞。

Comments ICLR 2026. Project page at https://velpegor.github.io/SceneSplit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01099 2026-05-19 cs.CV cs.AI cs.LG cs.RO 79%

Geometry-aware 4D Video Generation for Robot Manipulation

面向机器人操作的几何感知4D视频生成

Zeyi Liu, Shuang Li, Eric Cousineau, Siyuan Feng, Benjamin Burchfiel, Shuran Song

机构 * Stanford University(斯坦福大学) Toyota Research Institute(丰田研究院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出了一种几何感知的4D视频生成模型,通过跨视角点图对齐进行训练,以确保生成视频在多视角下的3D一致性,从而在单个RGB-D图像输入下生成时空一致的未来视频序列,并在不依赖相机姿态的情况下实现稳定的视觉和空间对齐预测。

Comments ICLR 2026; Project website: https://robot4dgen.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16795 2026-05-19 cs.CV cs.AI cs.GR 79%

3DPhysVideo: Consistency-Guided Flow SDE for Video Generation via 3D Scene Reconstruction and Physical Simulation

3DPhysVideo: 通过3D场景重建和物理模拟的一致性引导流SDE用于视频生成

Hwidong Kim, Yunho Kim, Tae-Kyun Kim

机构 * KAIST(韩国科学技术院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出了一种无需训练的管道,通过3D场景重建和物理模拟生成逼真视频,利用一致性引导流SDE分解预测速度以确保条件输入的一致性,从而在多物体和流体交互场景中实现从单张图像到物理合理视频的过渡。

Comments Project page: https://hwidong-kim.github.io/projects/3DPhysVideo

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16420 2026-05-19 cs.CV cs.LG 79%

Video Reconstruction using Diffusion-based Image-to-Video Generation with Trajectory Guidance

基于扩散模型的图像到视频生成与轨迹引导的视频重建

Stelio Bompai, Ioannis Kontopoulos, Giannis Spiliopoulos, Dimitris Zissis, Konstantinos Tserpes

机构 * Department of Electrical and Computer Engineering, National Technical University of Athens, Greece(电气与计算机工程系,希腊国家技术大学雅典分校) Department of Product and Systems Design Engineering, University of the Aegean, Syros, Greece(产品与系统设计工程系,爱琴海大学锡罗斯分校)

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 本文提出利用预训练的图像到视频扩散模型,通过GPS轨迹引导生成无人机视频的缺失或丢失帧,无需领域特定微调,展示了在低纹理和小目标条件下视频重建的有效性。

Comments Accepted at the 1st Workshop on Multi-Sensor Trajectory Knowledge Discovery and Extraction (MuseKDE 2026), co-located with the 27th IEEE International Conference on Mobile Data Management (IEEE MDM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00678 2026-05-18 cs.CV 79%

Pixel-to-4D: Camera-Controlled Image-to-Video Generation with Dynamic 3D Gaussians

像素到4D:通过动态3D高斯进行相机控制的图像到视频生成

Melonie de Almeida, Daniela Ivanova, Tong Shi, John H. Williamson, Paul Henderson

机构 * University of Glasgow(格拉斯哥大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出一种基于动态3D高斯的图像到视频生成框架,通过单次前向传递构建3D场景表示并采样合理物体运动,实现高效且可控的视频生成,实验表明其在多个数据集上均达到SOTA视频质量和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15199 2026-05-15 cs.CV cs.AI 79%

EntityBench: Towards Entity-Consistent Long-Range Multi-Shot Video Generation

EntityBench:迈向实体一致的长程多次视频生成

Ruozhen He, Meng Wei, Ziyan Yang, Vicente Ordonez

机构 * ByteDance(字节跳动) ByteDance Seed(字节跳动种子) Rice University(罗切斯特大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 EntityBench通过140集(2491个镜头)的真实叙事媒体,构建了包含实体调度的评估基准,结合三支柱评估体系和fidelity gate,评估实体一致性。EntityMem作为基线方法,通过存储验证的实体视觉参考提升生成质量。

Comments Project page: https://catherine-r-he.github.io/EntityBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15182 2026-05-15 cs.CV 79%

Warp-as-History: Generalizable Camera-Controlled Video Generation from One Training Video

Warp-as-History:从单个训练视频生成可泛化的相机控制视频

Yifan Wang, Tong He

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出Warp-as-History方法,通过将相机诱导的变形转化为相机变形的伪历史,实现无需训练的零样本相机轨迹生成,提升视频生成的相机顺应性和视觉质量。

Comments Project page: https://yyfz.github.io/warp-as-history/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15116 2026-05-15 cs.CV 79%

DriveCtrl: Conditioned Sim-to-Real Driving Video Generation

DriveCtrl: 基于条件的仿真到现实驾驶视频生成

Haonan Zhao, Yiting Wang, Jingkun Chen, Valentina Donzella, Thomas Bashford-Rogers, Kurt Debattista

机构 * University of Warwick(沃里克大学) Northwestern Polytechnical University(西北工业大学) Queen Mary University of London(伦敦大学玛丽女王学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出DriveCtrl框架,通过深度条件生成逼真的驾驶视频,保留场景结构和运动模式,提升生成视频的现实感和时序一致性,同时引入可扩展的数据生成管道和Driving Video Realism Score评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14843 2026-05-15 cs.CV 79%

MechVerse: Evaluating Physical Motion Consistency in Video Generation Models

MechVerse:评估视频生成模型中物理运动一致性

Rahul Jain, Mayank Patel, Asim Unmesh, Karthik Ramani

机构 * School of Electrical and Computer Engineering, Purdue University(普渡大学电气与计算机工程学院) School of Mechanical Engineering, Purdue University(普渡大学机械工程学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 MechVerse通过机械一致的图像到视频生成基准,评估视频生成模型在物理运动一致性上的不足,发现现有模型在复杂耦合中表现不佳。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14487 2026-05-15 cs.CV cs.AI 79%

Head Forcing: Long Autoregressive Video Generation via Head Heterogeneity

强制头部:通过头部异质性实现长自回归视频生成

Jiahao Tian, Yiwei Wang, Gang Yu, Chi Zhang

机构 * AGI Lab, Westlake University University of California at Merced StepFun

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 本文提出Head Forcing框架,通过差异化分配KV缓存策略提升长视频生成质量,实现分钟级生成并支持多提示交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14269 2026-05-15 cs.CV cs.AI 79%

PhyMotion: Structured 3D Motion Reward for Physics-Grounded Human Video Generation

PhyMotion: 结构化3D运动奖励用于物理基础的人体视频生成

Yidong Huang, Zun Wang, Han Lin, Dong-Ki Kim, Shayegan Omidshafiei, Jaehong Yoon, Jaemin Cho, Yue Zhang, Mohit Bansal

机构 * UNC Chapel Hill(UNC夏洛特希尔大学) FieldAI NTU Singapore(新加坡国立大学) AI2 Johns Hopkins University(约翰霍普金斯大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出PhyMotion,一种结构化的3D运动奖励机制,通过物理模拟器评估人体运动的物理可行性,提升视频生成中人体动作的真实感。

Comments First two authors contributed equally, website: https://phy-motion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12938 2026-05-14 cs.CV cs.AI cs.LG 79%

CRePE: Curved Ray Expectation Positional Encoding for Unified-Camera-Controlled Video Generation

CRePE:曲率射线期望位置编码用于统一相机控制的视频生成

Seonghyun Jin, Youngmin Kim, Sunwoo Park, Jong Chul Ye

机构 * Graduate School of AI(人工智能研究生院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出CRePE,一种基于曲率射线期望的位置编码,用于统一相机模型下的视频生成,通过几何注意力适配器稳定相机控制,提升几何感知和感知质量指标。

Comments 17 pages, 8 figures, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12480 2026-05-13 cs.CV cs.AI 79%

OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation

OmniNFT: 多模态联合音频视频生成的模态感知强化学习

Guohui Zhang, XiaoXiao Ma, Jie Huang, Hang Xu, Hu Yu, Siming Fu, Yuming Li, Zeyue Xue, Lin Song, Haoyang Huang, Nan Duan, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) JD Explore Academy(京东探索研究院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出OmniNFT,通过模态感知强化学习框架解决多模态联合生成中的模态一致性、梯度不平衡和信用分配问题,提升音频视频感知质量与同步性能。

Comments Project page: https://zghhui.github.io/OmniNFT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12038 2026-05-13 cs.CV 79%

OmniHumanoid: Streaming Cross-Embodiment Video Generation with Paired-Free Adaptation

OmniHumanoid: 流式跨躯体视频生成与配对自由适应

Yiren Song, Xiyao Deng, Pei Yang, Yihan Wang, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(展示实验室,新加坡国立大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出OmniHumanoid框架,通过分离可迁移运动学习与躯体特定适应,实现跨躯体视频生成,利用无配对视频进行适应,并通过分支隔离注意力设计提升运动与躯体适应的分离度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10079 2026-05-12 cs.CV 79%

SocialDirector: Training-Free Social Interaction Control for Multi-Person Video Generation

SocialDirector: 无训练的社会互动控制多人物视频生成

Liangyang Ouyang, Ruicong Liu, Caixin Kang, Yifei Huang, Yoichi Sato

机构 * The University of Tokyo(东京大学) Shanda AI Research Tokyo(Shanda AI东京研究所)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 SocialDirector通过调节交叉注意力图提升多人物视频生成的社会互动准确性,解决演员动作不匹配和社交动态紊乱问题,实验表明其能显著提升互动真实度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09378 2026-05-12 cs.CV cs.AI cs.CL 79%

EduStory: A Unified Framework for Pedagogically-Consistent Multi-Shot STEM Instructional Video Generation

EduStory: 一个统一框架,用于教学一致的多镜头STEM教学视频生成

Xinyi Wu, Jayant Teotia, Shuai Zhao, Erik Cambria

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出EduStory框架,通过整合教学状态建模、脚本引导的结构控制和学习导向评估指标,解决多镜头STEM教学视频中知识一致性与教学叙事连贯性的问题,并引入EduVideoBench基准测试以评估生成视频的质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03652 2026-05-12 cs.CV cs.AI 79%

AniMatrix: An Anime Video Generation Model that Thinks in Art, Not Physics

AniMatrix:一个以艺术而非物理思考的动画视频生成模型

Tencent HY Team

机构 * Tencent HY Team(腾讯HY团队)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 AniMatrix通过双通道条件机制和三步过渡,以艺术正确性替代物理正确性,实现动画视频生成,其在五个动画生产维度上获得专业动画师的认可。

Comments 37 pages, 1 main figure (qualitative comparison), 1 TikZ architecture diagram; technical report. Model weights and inference code to be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08712 2026-05-12 cs.CV 79%

From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation

从运动学至路由视觉控制:用于动作条件化外科视频生成

Bohan Li, Shuojue Yang, Baorui Peng, Xianda Guo, Erli Zhang, Youqi Tao, Junfeng Duan, Daguang Xu, Qi Dou, Xin Jin, Wenjun Zeng, Hao Zhao, Yueming Jin

机构 * SJTU(上海交通大学) NUS(国立新加坡大学) THU(清华大学) EIT(欧洲研究所) WHU(武汉大学) Harvard(哈佛大学) NVIDIA(NVIDIA公司) CUHK(香港大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出一种运动学至视觉提升范式,通过五种图像对齐的控制模态生成动作条件化外科视频,采用分层路由框架提升控制精度与效率,构建新基准并验证方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08115 2026-05-12 cs.GR cs.CV cs.LG 79%

Alice v1: Distillation-Enhanced Video Generation Surpassing Closed-Source Models

Alice v1:通过一致性蒸馏增强的视频生成超越闭源模型

Wang Xiaoyu, Phong Nguyen, Chen Zhao

机构 * Mirage Team Open Source Research(Mirage团队开源研究)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 Alice v1通过一致性蒸馏与分数正则化实现视频生成质量突破,其在自动化基准测试中超越闭源系统,且在人类偏好研究中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18636 2026-05-11 cs.CV 79%

Attention Sparsity is Input-Stable: Training-Free Sparse Attention for Video Generation via Offline Sparsity Profiling and Online QK Co-Clustering

注意力稀疏性是输入稳定的:通过离线稀疏性分析和在线QK共聚类实现训练自由的视频生成稀疏注意力

Jiayi Luo, Jiayu Chen, Jiankun Wang, Cong Wang, Hanxin Zhu, Qingyun Sun, Chen Gao, Zhibo Chen, Jianxin Li

机构 * SKLCCSE, School of Computer Science and Engineering, Beihang University(软件学院,北京航空航天大学) Beihang University(北京航空航天大学) School of Computer Science, Peking University(北京大学计算机学院) the State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,中国科学院自动化研究所) School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学) BNRist, Tsinghua University(北京理工大学,清华大学) Zhongguancun Academy(中关村学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出SVOO框架,通过离线层间稀疏性分析和在线双向共聚类实现训练自由的视频生成稀疏注意力,解决传统方法中层异质性和查询-键耦合问题,提升生成质量与速度的平衡。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16748 2026-05-11 cs.CV 79%

Multimodal Diffusion Transformer with Memory Bank for Scalable Long-Duration Talking Video Generation

具有内存库的多模态扩散变换器用于可扩展的长时谈话视频生成

Haojie Zhang, Zhihao Liang, Ruibo Fu, Bingyan Liu, Zhengqi Wen, Xuefei Liu, Jianhua Tao, Yaling Liang

机构 * South China University of Technology(南方科技大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing National Research Center for Information Science and Technology, Tsinghua University(北京信息科学研究中心,清华大学) Department of Automation, BNRist, Tsinghua University(清华大学自动化系,北京信息科学研究中心)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出 LetsTalk 框架,通过多模态指导和内存库机制解决长时谈话视频生成中的质量、一致性、时间连贯性和计算效率问题,实验表明其在生成质量和效率上达到新水平。

Comments 16 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18181 2026-05-08 cs.CV 79%

MACE-Dance: Motion-Appearance Cascaded Experts for Music-Driven Dance Video Generation

MACE-Dance: 基于动作-外观级联专家的音乐驱动舞蹈视频生成

Kaixing Yang, Jiashu Zhu, Xulong Tang, Ziqiao Peng, Xiangyue Zhang, Puwei Wang, Jiahong Wu, Xiangxiang Chu, Hongyan Liu, Jun He

机构 * Renmin University of China(中国人民大学) AMAP, Alibaba Group(阿里集团AMAP) Wuhan University(武汉大学) Tsinghua University(清华大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出MACE-Dance框架,结合级联混合专家模型,实现音乐驱动的高质量舞蹈视频生成,通过动作和外观专家分别生成3D动作和视频,提升视觉一致性和动作真实感。

Comments Accepted by SIGGRAPH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18875 2026-05-08 cs.CV 79%

Sparse VideoGen2: Accelerate Video Generation with Sparse Attention via Semantic-Aware Permutation

稀疏视频生成2:通过语义感知排列加速视频生成

Shuo Yang, Haocheng Xi, Yilong Zhao, Muyang Li, Jintao Zhang, Han Cai, Yujun Lin, Xiuyu Li, Chenfeng Xu, Jianfei Chen, Song Han, Kurt Keutzer, Ion Stoica

机构 * University of California, Berkeley(加州大学伯克利分校) MIT(麻省理工学院) NVIDIA(英伟达) Stanford University(斯坦福大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出SVG2框架,通过语义感知排列提升视频生成的准确性和效率,实现生成质量与效率的帕累托最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15689 2026-05-08 cs.CV 79%

DOLLAR: Few-Step Video Generation via Distillation and Latent Reward Optimization

DOLLAR: 通过蒸馏和潜在奖励优化实现少步视频生成

Zihan Ding, Chi Jin, Difan Liu, Haitian Zheng, Krishna Kumar Singh, Qiang Zhang, Yan Kang, Zhe Lin, Yuchen Liu

机构 * Princeton University(普林斯顿大学) Adobe Research(Adobe研究)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出结合变分分数蒸馏和一致性蒸馏的方法,实现高质量且多样化的少步视频生成,并通过潜在奖励模型微调提升生成性能,实现高效生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00607 2026-05-01 cs.MM cs.SD 79%

MTAVG-Bench: A Diagnostic Benchmark for Multi-Talker Dialogue-Centric Audio-Video Generation

MTAVG-Bench: 多说话人对话中心音频视频生成的诊断基准

Yang-Hao Zhou, Haitian Li, Rexar Lin, Heyan Huang, Jinxing Zhou, Changsen Yuan, Tian Lan, Ziqin Zhou, Yudong Li, Jiajun Xu, Jingyun Liao, Yi-Ming Cheng, Xuefeng Chen, Xian-Ling Mao, Yousheng Feng

机构 * Beijing Institute of Technology(北京理工大学) Shanghai University(上海大学) OpenNLP Lab(OpenNLP实验室) Beijing University of Technology(北京工业大学) The University of Adelaide(阿德莱德大学) Tsinghua University(清华大学) Inkeverse Group Limited(Inkeverse集团)

专题命中 视频生成 :video generation(title,abstract);分类 cs.MM

AI总结 本文提出MTAVG-Bench,用于评估多说话人对话中心音频视频生成的失败模式诊断,通过半自动化流程生成1.8k视频并标注2.4k问答对,评估音频视频信号保真度、时间属性一致性、社交互动和电影表现四个层面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26232 2026-04-30 cs.CV cs.AI 79%

DepthPilot: From Controllability to Interpretability in Colonoscopy Video Generation

DepthPilot:从可控性到可解释性在结肠镜视频生成中

Junhu Fu, Ke Chen, Weidong Guo, Shuyu Liang, Jie Xu, Chen Ma, Kehao Wang, Shengli Lin, Zeju Li, Yuanyuan Wang, Yi Guo, Shuo Li

机构 * College of Biomedical Engineering, Fudan University, Shanghai 200433, China(复旦大学生物医学工程学院) Key Laboratory of Medical Imaging Computing and Computer Assisted Intervention of Shanghai, Shanghai 200032, China(上海医学影像计算与计算机辅助干预重点实验室) Endoscopy Research Institute, Zhongshan Hospital, Fudan University, Shanghai 200032, China(复旦大学中山医院内窥镜研究所) Shanghai Collaborative Innovation Center of Endoscopy, Shanghai 200032, China(上海内窥镜协同创新中心) Department of Biomedical Engineering, Case Western Reserve University, Cleveland, OH 44106, USA(凯斯西储大学生物医学工程系) Department of Computer and Data Science, Case Western Reserve University, Cleveland, OH 44106, USA(凯斯西储大学计算机与数据科学系)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出DepthPilot框架,通过几何对齐策略和自适应样条去噪模块,实现结肠镜视频生成的可控性与可解释性,取得高FID分数和临床评估领先成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05811 2026-04-30 cs.CV 79%

Video Compression Meets Video Generation: Latent Inter-Frame Pruning with Attention Recovery

视频压缩与视频生成的交汇:具有注意力恢复的潜在帧剪枝

Dennis Menn, Yuedong Yang, Bokun Wang, Xiwen Wei, Mustafa Munir, Feng Liang, Radu Marculescu, Chenfeng Xu, Diana Marculescu

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Meta

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出LIPAR框架,通过利用视频潜在补丁中的时间冗余性,减少计算延迟,提升视频编辑效率,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏