arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-03-24 至 2026-03-24 共收录 41 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 11 篇

2603.21493 2026-03-24 cs.CV cs.MM 81%

StreamingEval: A Unified Evaluation Protocol towards Realistic Streaming Video Understanding

StreamingEval: 一种面向真实流媒体视频理解的统一评估协议

Guowei Tang, Tianwen Qian, Huanran Zheng, Yifei Wang, Xiaoling Wang

机构 * East China Normal University(华东师范大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出StreamingEval评估框架,用于评估视频大语言模型在真实资源约束下的流媒体视频理解能力,通过标准化协议测试效率、存储与准确性的平衡,揭示当前模型与实际应用需求的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21647 2026-03-24 cs.CV cs.LG 79%

FedCVU: Federated Learning for Cross-View Video Understanding

FedCVU: 联邦学习用于跨视图视频理解

Shenghan Zhang, Run Ling, Ke Cao, Ao Ma, Zhanjie Zhang

机构 * Software College, Northeastern University, Shenyang, China(东北大学软件学院) University of Science and Technology of China, Hefei, China(中国科学技术大学) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) Zhejiang University, Hangzhou, China(浙江大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 FedCVU通过VS-Norm、CV-Align和SLA解决联邦学习在跨视图视频理解中的异质视角、分布偏差和通信开销问题,提升未见视角性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21488 2026-03-24 cs.CV 79%

Learning Trajectory-Aware Multimodal Large Language Models for Video Reasoning Segmentation

学习轨迹感知的多模态大语言模型用于视频推理分割

Jingnan Luo, Mingqi Gao, Jun Liu, Bin-Bin Gao, Feng Zheng

机构 * Southern University of Science and Technology(南方科技大学) Tencent YouTu Lab(腾讯优图实验室)

专题命中 视频理解 :video reasoning(title,abstract);分类 cs.CV

AI总结 本文提出TrajSeg框架,通过双向文本轨迹对齐提升视频对象轨迹感知能力,采用帧级内容整合模块和统一掩码解码器实现端到端训练,实验表明其在视频推理分割任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20422 2026-03-24 cs.CV cs.AI cs.IR 79%

PEARL: Personalized Streaming Video Understanding Model

PEARL:个性化流视频理解模型

Yuanhong Zheng, Ruichuan An, Xiaopeng Lin, Yuxing Liu, Sihan Yang, Huanyu Zhang, Haodong Li, Qintong Zhang, Renrui Zhang, Guopeng Li, Yifan Zhang, Yuheng Li, Wentao Zhang

机构 * Peking University(北京大学) Adobe CASIA Stepfun CUHK(香港中文大学) Zhongguancun Academy(中关村学院)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文提出个性化流视频理解任务PSVU,并引入PEARL-Bench基准测试,通过帧级和视频级两种模式评估模型对个性化概念的响应能力,提出无需训练的PEARL策略,实现先进性能。

Comments Arxiv Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21957 2026-03-24 cs.CV 57%

Unified Spatiotemporal Token Compression for Video-LLMs at Ultra-Low Retention

面向超低保留率的视频大语言模型统一时空令牌压缩

Junhao Du, Jialong Xue, Anqi Li, Jincheng Dai, Guo Lu

机构 * Shanghai Jiao Tong University(上海交通大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出统一的时空令牌压缩方法,通过全局令牌保留池整合注意力权重和语义相似性,实现高效令牌选择与合并,保留90.1%性能并降低计算量至2.6%。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19610 2026-03-24 cs.CV 57%

ParallelVLM: Lossless Video-LLM Acceleration with Visual Alignment Aware Parallel Speculative Decoding

ParallelVLM: 无损视频-大语言模型加速与视觉对齐感知并行推测解码

Quan Kong, Yuhao Shen, Yicheng Ji, Huan Li, Cong Wang

机构 * Zhejiang University(浙江大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 ParallelVLM通过并行化阶段和无偏验证器引导剪枝策略,有效提升视频理解任务的解码效率,实现3.36倍的加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13406 2026-03-24 cs.CV cs.AI 57%

Nuanced Emotion Recognition Based on a Segment-based MLLM Framework Leveraging Qwen3-Omni for AH Detection

基于段落式MLLM框架的细致情绪识别:利用Qwen3-Omni进行AH检测

Liang Tang, Hongda Li, Jiayu Zhang, Long Chen, Shuxian Li, Siqi Pei, Tiaonan Duan, Yuhao Cheng

机构 * Qwen3-Omni

专题命中 视频理解 :long video(abstract);分类 cs.CV

AI总结 本文提出基于段落式MLLM框架的细致情绪识别方法,利用Qwen3-Omni模型在AH检测中实现85.1%的准确率,验证了多模态大语言模型在捕捉复杂情绪冲突中的优势。

Comments 5 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02845 2026-03-24 cs.CV 57%

Go Beyond Earth: Understanding Human Actions and Scenes in Microgravity Environments

超越地球:理解微重力环境中的人类行为与场景

Di Wen, Lei Qi, Kunyu Peng, Kailun Yang, Fei Teng, Ao Luo, Jia Fu, Yufan Chen, Ruiping Liu, Yitian Shi, M. Saquib Sarfraz, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology, Germany(卡尔斯鲁厄大学,德国) Hunan University, China(湖南大学,中国) INSAIT, Sofia University, Bulgaria(INSAIT,索菲亚大学,保加利亚) Waseda University, Japan(早稻田大学,日本) KTH Royal Institute of Technology, Sweden(瑞典皇家理工学院,瑞典) RISE Research Institutes of Sweden, Sweden(瑞典RISE研究机构,瑞典)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出MicroG-4M数据集,用于微重力环境下的人类行为和场景理解,包含50种动作、1238个丰富描述和7000多个问答对,支持动作识别、视频captioning和视觉问答任务。

Comments 16 pages, 4 figures, code are available at https://github.com/LEI-QI-233/HAR-in-Space

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05175 2026-03-24 cs.CV 57%

VideoAuto-R1: Video Auto Reasoning via Thinking Once, Answering Twice

VideoAuto-R1:通过一次推理、两次回答实现视频自动推理

Shuming Liu, Mingchen Zhuge, Changsheng Zhao, Jun Chen, Lemeng Wu, Zechun Liu, Chenchen Zhu, Zhipeng Cai, Chong Zhou, Haozhe Liu, Ernie Chang, Saksham Suri, Hongyu Xu, Qi Qian, Wei Wen, Balakrishnan Varadarajan, Zhuang Liu, Hu Xu, Florian Bordes, Raghuraman Krishnamoorthi, Bernard Ghanem, Vikas Chandra, Yunyang Xiong

机构 * Meta AI King Abdullah University of Science and Technology (KAUST)(卡布斯大学) Princeton University(普林斯顿大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出VideoAuto-R1框架,通过一次推理两次回答策略提升视频理解效率,实现准确率和效率的双重提升。

Comments Accepted to CVPR 2026. Project page: https://ivul-kaust.github.io/projects/videoauto-r1/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21778 2026-03-24 cs.CV 57%

Scene-VLM: Multimodal Video Scene Segmentation via Vision-Language Models

Scene-VLM:通过视觉-语言模型进行多模态视频场景分割

Nimrod Berman, Adam Botach, Emanuel Ben-Baruch, Shunit Haviv Hakimi, Asaf Gendler, Ilan Naiman, Erez Yosef, Igor Kviatkovsky

机构 * Ben-Gurion University(本·古里安大学) Amazon Prime Video(亚马逊Prime视频) Tel-Aviv University(特拉维夫大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出Scene-VLM,首个基于视觉-语言模型的视频场景分割框架,通过融合视觉与文本信息实现多模态推理,提升场景分割的准确性和可解释性。

Comments Accepted for publication at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16975 2026-03-24 cs.CV cs.AI 57%

InfoTok: Adaptive Discrete Video Tokenizer via Information-Theoretic Compression

InfoTok: 通过信息论压缩实现自适应离散视频分块器

Haotian Ye, Qiyuan He, Jiaqi Han, Puheng Li, Jiaojiao Fan, Zekun Hao, Fitsum Reda, Yogesh Balaji, Huayu Chen, Sheng Liu, Angela Yao, James Zou, Stefano Ermon, Haoxiang Wang, Ming-Yu Liu

机构 * NVIDIA Stanford University(斯坦福大学) National University of Singapore(新加坡国立大学)

专题命中 视频理解 :long video(abstract);分类 cs.CV

AI总结 本文提出InfoTok框架,通过信息论压缩实现视频分块的自适应优化,实验证明在不损失性能的情况下,压缩率提升2.3倍,节省20%的token。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 9 篇

2602.23956 2026-03-24 cs.CV 85%

SwitchCraft: Training-Free Multi-Event Video Generation with Attention Controls

SwitchCraft: 无需训练的多事件视频生成与注意力控制

Qianxun Xu, Chenxi Song, Yujun Cai, Chi Zhang

机构 * Westlake University(西湖大学) Duke Kunshan University(杜克-昆山大学) The University of Queensland(昆士兰大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 SwitchCraft通过引入事件对齐查询引导和自动平衡强度求解器,提升多事件视频生成的提示对齐、事件清晰度和场景一致性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21872 2026-03-24 cs.CV cs.AI 79%

Manifold-Aware Exploration for Reinforcement Learning in Video Generation

面向流形的探索用于视频生成的强化学习

Mingzhe Zheng, Weijie Kong, Yue Wu, Dengyang Jiang, Yue Ma, Xuanhua He, Bin Lin, Kaixiong Gong, Zhao Zhong, Liefeng Bo, Qifeng Chen, Harry Yang

机构 * Tencent Hunyuan(腾讯文脉)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出SAGE-GRPO方法,通过在微和宏观层面约束探索,确保在视频数据流形附近进行,提升视频生成的质量和奖励估计的可靠性。

Comments 17 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11438 2026-03-24 cs.CV cs.AI 79%

Flowception: Temporally Expansive Flow Matching for Video Generation

Flowception:用于视频生成的时序扩展流匹配

Tariq Berrada Ifriqi, John Nguyen, Karteek Alahari, Jakob Verbeek, Ricky T. Q. Chen

机构 * FAIR at Meta Univ.\ Grenoble Alpes, Inria, CNRS, Grenoble INP, LJK, France

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 Flowception提出了一种非自回归且可变长度的视频生成框架,通过交替插入离散帧与连续去噪帧学习概率路径,减少误差积累并提升长序列处理效率,实验显示其在FVD和VBench指标上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21299 2026-03-24 cs.CV 74%

Identity-Consistent Video Generation under Large Facial-Angle Variations

在大面部角度变化下实现身份一致的视频生成

Bin Hu, Zipeng Qi, Guoxi Huang, Zunnan Xu, Ruicheng Zhang, Chongjie Ye, Jun Zhou, Xiu Li, Jingdong Wang

机构 * Tsinghua University(清华大学) Baidu Inc., China(百度公司) University of Bristol(布里斯托大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 本文提出Mv²ID框架,通过区域遮蔽训练策略和参考解耦RoPE机制,解决大角度变化下的身份一致性与自然运动平衡问题,并构建大规模数据集和评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22091 2026-03-24 cs.CV 70%

P-Flow: Prompting Visual Effects Generation

P-Flow:提示视觉效果生成

Rui Zhao, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 P-Flow通过测试时提示优化,基于参考视频与生成输出的视觉效果差异,迭代改进提示,实现高保真且多样化的动态视觉效果定制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05848 2026-03-24 cs.CV cs.AI cs.RO 57%

Goal Force: Teaching Video Models To Accomplish Physics-Conditioned Goals

目标力:教视频模型实现物理条件化的目标

Nate Gillman, Yinghua Zhou, Zitian Tang, Evan Luo, Arjan Chakravarthy, Daksh Aggarwal, Michael Freeman, Charles Herrmann, Chen Sun

机构 * Brown University(布朗大学) Cornell University(康奈尔大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出Goal Force框架,通过显式力矢量和中间动力学定义目标,使视频模型能零样本泛化到复杂现实场景,实现基于物理的视频生成与规划。

Comments Camera ready version (CVPR 2026). Code and interactive demos at https://goal-force.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15700 2026-03-24 cs.CV 57%

First Frame Is the Place to Go for Video Content Customization

视频内容定制中的首帧至关重要

Jingxi Chen, Zongxia Li, Zhichao Liu, Guangyao Shi, Xiyang Wu, Fuxiao Liu, Cornelia Fermuller, Brandon Y. Feng, Yiannis Aloimonos

机构 * University of Maryland(马里兰大学) USC(南加州大学) MIT(麻省理工学院) NVIDIA(NVIDIA公司)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文揭示视频生成模型将首帧视为概念记忆缓冲区,通过少量训练示例实现鲁棒且通用的视频内容定制。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08536 2026-03-24 cs.CV 57%

SWIFT: Sliding Window Reconstruction for Few-Shot Training-Free Generated Video Attribution

SWIFT: 基于滑动窗口的少样本训练自由生成视频属性识别

Chao Wang, Zijin Yang, Yaofei Wang, Yuang Qi, Weiming Zhang, Nenghai Yu, Kejiang Chen

机构 * University of Science and Technology of China(中国科学技术大学) Hefei University of Technology(合肥工业大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出SWIFT方法,通过滑动窗口实现视频属性识别,无需额外训练即可在多种生成模型上达到90%以上的准确率,支持零样本识别。

Comments 8 pages. Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19402 2026-03-24 cs.RO cs.CV cs.GR 57%

Real2Edit2Real: Generating Robotic Demonstrations via a 3D Control Interface

Real2Edit2Real:通过3D控制界面生成机器人演示

Yujie Zhao, Hongwei Fan, Di Chen, Shengcong Chen, Liliang Chen, Xiaoqi Li, Guanghui Ren, Hao Dong

机构 * CFCS, School of Computer Science, Peking University(计算机学院,北京大学) PKU-AgiBot Lab(北大AgiBot实验室) AgiBot

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出Real2Edit2Real框架,通过3D可编辑性与2D视觉数据结合,减少重复数据收集,提升空间泛化能力,实验表明其数据效率提升显著。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 12 篇

2603.21547 2026-03-24 cs.CV 86%

PROBE: Diagnosing Residual Concept Capacity in Erased Text-to-Video Diffusion Models

PROBE: 诊断 erased 文本到视频扩散模型中的残余概念容量

Yiwei Xie, Zheng Zhang, Ping Liu

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) Department of Computer Science and Engineering, University of Nevada(内华达大学计算机科学与工程系)

专题命中 视频扩散模型 :text-to-video(title,abstract);video diffusion(title);分类 cs.CV

AI总结 PROBE 通过多级评估框架揭示文本到视频扩散模型中被擦除概念的残余容量,发现所有测试方法留有可测量的残余能力,且其鲁棒性与干预深度相关,指出当前擦除方法仅实现输出级抑制而非表征移除。

Comments This preprint was posted after submission to IEEE Transactions

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16296 2026-03-24 cs.CV cs.AI cs.LG 83%

Memory-V2V: Memory-Augmented Video-to-Video Diffusion for Consistent Multi-Turn Editing

Memory-V2V: 通过记忆增强的视频到视频扩散模型实现一致的多轮编辑

Dohun Lee, Chun-Hao Paul Huang, Xuelin Chen, Jong Chul Ye, Duygu Ceylan, Hyeonho Jeong

机构 * Adobe Research(Adobe研究实验室) KAIST AI(韩国科学技术院人工智能研究所) Adobe Internship(Adobe实习) Project Lead(项目负责人)

专题命中 视频扩散模型 :video diffusion(title,abstract);long video(abstract);分类 cs.CV

AI总结 Memory-V2V通过引入外部记忆模块,解决多轮视频编辑中的跨轮一致性问题,提升编辑连贯性并保持视觉质量,优于现有基线模型。

Comments Project page: https://dohunlee1.github.io/MemoryV2V

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02284 2026-03-24 cs.CV cs.AI cs.LG 83%

Learning to Generate Rigid Body Interactions with Video Diffusion Models

通过视频扩散模型学习生成刚体交互

David Romero, Ariana Bermudez, Viacheslav Iablochnikov, Hao Li, Fabio Pizzati, Ivan Laptev

机构 * MBZUAI

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 本文提出KineMask方法,通过视频生成实现刚体交互的逼真控制与模拟,结合低级运动控制与高级文本条件,提升动态现象合成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21856 2026-03-24 cs.CV 79%

Climate Prompting: Generating the Madden-Julian Oscillation using Video Diffusion and Low-Dimensional Conditioning

气候提示:利用视频扩散和低维条件生成 Madden-Julian 振荡

Sulian Thual, Feiyang Cai, Jingjing Wang, Feng Luo

机构 * School of Computing(计算学院)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 本文提出利用视频扩散模型生成MJO序列,通过低维指标条件化生成MJO,并通过理想化条件分析其物理驱动机制,为热带大气预测提供新框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04619 2026-03-24 cs.CV 79%

Denoise to Track: Harnessing Video Diffusion Priors for Robust Correspondence

去噪以跟踪:利用视频扩散先验进行鲁棒对应

Tianyu Yuan, Yuanbo Yang, Lin-Zhuo Chen, Yao Yao, Zhuzhong Qian

机构 * Nanjing University(南京大学) Zhejiang University(浙江大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 本文提出HeFT框架,利用预训练视频扩散模型的视觉先验进行零样本点跟踪,通过分析内部表示揭示注意力头在匹配、语义理解和位置编码中的不同专长,并提出基于头和频率的特征选择策略提升跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20382 2026-03-24 cs.CV 79%

Uni-Classifier: Leveraging Video Diffusion Priors for Universal Guidance Classifier

Uni-Classifier: 利用视频扩散先验进行通用引导分类器

Yujie Zhou, Pengyang Ling, Jiazi Bu, Bingjie Gao, Li Niu

机构 * Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Uni-Classifier,通过利用视频扩散先验引导前序模型的去噪过程,提升生成质量,适用于视频和3D生成任务。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11289 2026-03-24 cs.CV cs.MM 76%

UniAnimate-DiT: Human Image Animation with Large-Scale Video Diffusion Transformer

UniAnimate-DiT:基于大规模视频扩散变换器的人像图像动画

Xiang Wang, Shiwei Zhang, Longxiang Tang, Yingya Zhang, Changxin Gao, Yuehuan Wang, Nong Sang

机构 * Key Laboratory of Image Processing and Intelligent Control, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学图像处理与智能控制重点实验室,人工智能与自动化学院) Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV、cs.MM

AI总结 本文提出UniAnimate-DiT,利用Wan2.1模型实现一致的人像动画,通过LoRA技术优化参数,设计轻量姿态编码器并整合参考外观,实验表明其能生成高质量且时间一致的动画,支持从480p到720P的超分辨率。

Comments The training and inference code (based on Wan2.1) is available at https://github.com/ali-vilab/UniAnimate-DiT

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21864 2026-03-24 cs.CV cs.AI 70%

Adaptive Video Distillation: Mitigating Oversaturation and Temporal Collapse in Few-Step Generation

自适应视频蒸馏:缓解少步生成中的过饱和与时间崩溃

Yuyang You, Yongzhi Li, Jiahui Li, Yadong Mu, Quan Chen, Peng Jiang

机构 * Peking University(北京大学) Kuaishou Technology(快手科技)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出针对视频扩散模型的自适应蒸馏框架,通过动态回归损失、时间正则化损失和推理时帧插值策略,提升少步视频生成的稳定性和感知真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10448 2026-03-24 cs.RO 67%

DiT4DiT: Jointly Modeling Video Dynamics and Actions for Generalizable Robot Control

DiT4DiT:联合建模视频动态与动作以实现通用机器人控制

Teli Ma, Jia Zheng, Zifan Wang, Chunli Jiang, Andy Cui, Junwei Liang, Shuo Yang

机构 * Mondo Robotics(Mondo机器人公司) HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract)

AI总结 本文提出DiT4DiT模型,通过结合视频扩散变换器与动作扩散变换器,实现视频动态与动作的联合建模,提升机器人控制的泛化能力与样本效率。

Comments https://dit4dit.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20307 2026-03-24 cs.CV cs.AI cs.MM cs.SD 62%

EARTalking: End-to-end GPT-style Autoregressive Talking Head Synthesis with Frame-wise Control

EARTalking:端到端的GPT风格自回归说话头合成与帧级控制

Yuzhe Weng, Haotian Wang, Yuanhong Yu, Jun Du, Shan He, Xiaoyan Wu, Haoran Xu

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK Zhejiang University(浙江大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV、cs.MM

AI总结 本文提出EARTalking,一种端到端的GPT风格自回归模型,用于交互式音频驱动说话头生成,通过引入帧级流式生成范式和Sink Frame Window Attention机制,实现高效可控的视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏