arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 470 信号源:cs.CV, eess.IV, cs.MM

1. 动作与事件理解 470 篇

2606.27504 2026-06-29 cs.CV 新提交 57%

ReWorld: Learning Better Representations for World Action Models

ReWorld:为世界动作模型学习更好的表示

Tianze Xia, Lijun Zhou, Kaixin Xiong, Jingfeng Yao, Yu Zhu, Zhenxin Zhu, Bing Wang, Guang Chen, Hangjun Ye, Wenyu Liu, Haiyang Sun, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi EV(小米汽车)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 提出ReWorld框架,通过优化中间表示(未来预测监督、跨模态对齐、难负样本监督)提升自动驾驶世界动作模型的规划性能,在nuScenes和NAVSIM上取得显著提升。

Comments 19 pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26942 2026-06-26 cs.CV 新提交 57%

TraMP-LLaMA: Generative Interpretability with Decoupled Instruction Tuning for Facial Expression Quality Assessment

TraMP-LLaMA: 基于解耦指令微调的生成式可解释性用于面部表情质量评估

Shuchao Duan, Alan Whone, Hossein Rahmani, Jun Liu, Majid Mirmehdi

机构 * School of Computer Science University of Bristol(布里斯托大学计算机科学学院) Translational Health Sciences University of Bristol(布里斯托大学转化健康科学学院) School of Computing and Communications Lancaster University(兰卡斯特大学计算与通信学院)

专题命中 动作与事件理解 :video-language(abstract);分类 cs.CV

AI总结 提出TraMP-LLaMA多模态框架,融合外观和轨迹特征,采用解耦指令微调策略,联合预测严重度并生成结构化文本报告,在PFED5-plus数据集上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17796 2026-06-25 cs.CV cs.AI 版本更新 57%

CustomX: Unified Character, Action, and Scene Customization in Video World Models

CustomX: 视频世界模型中的统一角色、动作与场景定制

Yitong Wang, Fangyun Wei, Hongyang Zhang, Bo Dai, Yan Lu

机构 * Fudan University(复旦大学) Microsoft Research(微软研究院) University of Waterloo(滑铁卢大学) The University of Hong Kong(香港大学)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 提出CustomX,结合静态世界生成与可控实体模型,支持用户指定角色在3D场景中执行开放动作,通过条件自回归视频生成保持视觉保真度。

Comments Accepted to ECCV 2026. Project page: https://snowflakewang.github.io/CustomX_Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22131 2026-06-23 cs.CV 新提交 57%

Feed-forward Motion In-betweening for Any 4D

任意4D的前馈运动插值

Hiroki Nishizawa, Hubert P. H. Shum, Yoshihiro Fukuhara, Hirokatsu Kataoka, Shigeo Morishima

机构 * Waseda University(早稻田大学) AIST(产业技术综合研究所) Durham University(杜伦大学)

专题命中 动作与事件理解 :video diffusion(abstract);分类 cs.CV

AI总结 提出一种基于关键帧条件的前馈插值框架,利用网格VAE和MMDiT骨干的整流流模型,实现任意4D网格的快速运动插值,在DyMesh16和DyMesh32上表现优异。

Comments Video: https://youtu.be/jZAjPUtSq38?si=aXtDMDviFdfkjKUU

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21579 2026-06-23 cs.CV cs.AI 新提交 57%

The Unreasonable Effectiveness of VLMs for Zero-shot Procedural Mistake Detection

VLM在零样本程序性错误检测中的惊人有效性

Serdar Ozsoy, Lars Doorenbos, Federico Spurio, Gianpiero Francesca, Juergen Gall

机构 * University of Bonn(波恩大学) Toyota Motor Europe(丰田欧洲公司) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习和人工智能研究所)

专题命中 动作与事件理解 :video-language(abstract);分类 cs.CV

AI总结 提出ZeProM框架,利用单个预训练VLM同时解决零样本程序性错误检测和时间动作分割,在EgoPER和CaptainCook4D基准上接近或超越全监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20781 2026-06-23 cs.RO cs.CV 新提交 57%

World Action Models: A Survey

世界行动模型:综述

Qiuhong Shen, Shihua Zhang, Yue Liao, Qi Li, Zhenxiong Tan, Shizun Wang, Shuicheng Yan, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 本文综述世界行动模型(WAMs),通过两种互补视角组织现有工作,揭示其设计权衡与未来趋势。

Comments 57 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20731 2026-06-23 cs.CV cs.AI 新提交 57%

XmoPipe: A Pipeline for Large-Scale In-the-Wild Human Motion Dataset Construction

XmoPipe:大规模野外人体运动数据集构建流水线

Nathan Salazar, Emmanuel Dellandréa, Mathieu Lefort, Alexandre Meyer

机构 * Ecole Centrale de Lyon, CNRS, INSA Lyon, Universite Claude Bernard Lyon 1, LIRIS, UMR5205(里昂中央理工学院, 法国国家科学研究中心, 国立应用科学学院里昂, 克洛德·贝尔纳里昂第一大学, 里昂信息与系统研究实验室, UMR5205) Univ Rennes, Inria, CNRS, IRISA - UMR 6074(雷恩大学, 法国国家信息与自动化研究所, 法国国家科学研究中心, 雷恩计算机科学研究所 - UMR 6074) Universite Claude Bernard Lyon 1, CNRS, INSA Lyon, LIRIS, UMR5205(克洛德·贝尔纳里昂第一大学, 法国国家科学研究中心, 国立应用科学学院里昂, 里昂信息与系统研究实验室, UMR5205)

专题命中 动作与事件理解 :video-language(abstract);分类 cs.CV

AI总结 提出可扩展的流水线,从关键词检索视频、提取3D身体和面部运动并生成文本描述,用于构建野外人体运动数据集,训练的运动模型性能与基于传统动捕数据集训练的模型相当。

Comments 12 pages, presented at CASAXR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20711 2026-06-23 cs.CV cs.AI 新提交 57%

Video2Code: Generating Interactive Webpages from UI Videos via Action-Aware Revisit

Video2Code: 通过动作感知重访从UI视频生成交互式网页

Mingde Xu, Zhen Yang, Yan Wang, Yu Wang, Xijun Liu, Zijun Dou, Wenyi Hong, Xiaotao Gu, Bin Xu, Jie Tang

机构 * University of Waterloo(滑铁卢大学) Tsinghua University(清华大学) Zhipu AI(智谱AI) Beihang University(北京航空航天大学)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

AI总结 提出Video2Code方法,通过动作感知重访UI视频中的关键区域,恢复可执行的状态转换,生成HTML/CSS/JavaScript代码,提升多步交互的代码功能正确性。

Comments 31 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19676 2026-06-19 cs.CV cs.AI 新提交 57%

TeleMorpher: Toward Robust Simultaneous Motion-Location Editing

TeleMorpher: 迈向鲁棒的同步运动-位置编辑

Haengbok Chung

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 提出TeleMorpher,一种基于扩散模型的一步式框架,通过运动先验、姿态扭曲和基线运动编辑器注入,实现视频中主角运动与位置的同步编辑,在定量和定性评估中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13674 2026-06-16 cs.CV 新提交 57%

RepWAM: World Action Modeling with Representation Visual-Action Tokenizers

RepWAM:基于表示视觉-动作分词器的世界动作建模

Junke Wang, Qihang Zhang, Shuai Yang, Yiming Luo, Yujun Shen, Zuxuan Wu, Yu-Gang Jiang, Yinghao Xu

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) Robbyant, Ant Group(蚂蚁集团 Robbyant) Hongkong University of Science and Technology(香港科技大学)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 提出RepWAM,一种基于表示视觉-动作分词器的世界动作模型,通过联合建模未来视觉状态和潜在动作,在真实和仿真机器人操作任务中取得优异性能。

Comments Project page: https://wdrink.github.io/RepWAM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12033 2026-06-11 cs.CV 新提交 57%

SpikeTAD: Spiking Neural Networks for End-to-End Temporal Action Detection

SpikeTAD:用于端到端时序动作检测的脉冲神经网络

Min Yang, Mi Zhou, Limin Wang

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

AI总结 提出首个基于脉冲神经网络的端到端时序动作检测架构SpikeTAD,在保持极低功耗的同时,在THUMOS14和ActivityNet-1.3上分别达到67.2%和37.42%的平均mAP。

Comments Accepted by Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05769 2026-06-05 cs.CV 57%

Imagine Before You Predict: Interleaved Latent Visual Reasoning for Video Event Prediction

在预测之前想象:用于视频事件预测的交错潜在视觉推理

Tianxiang Jiang, Linquan Wu, Sheng Xia, Songze Li, Ziang Yan, Haoyu Yang, Yu Qiao, Yi Wang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) City University of Hong Kong(香港城市大学) Nanjing University(南京大学) Fudan University(复旦大学) Zhejiang University(浙江大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 动作与事件理解 :video reasoning(abstract);分类 cs.CV

AI总结 提出Future-L1框架,通过交错潜在视觉推理在自回归解码中交替语言token和连续潜在视觉跨度,结合LA-DAPO强化学习优化,在视频事件预测任务上取得最先进结果。

Comments https://github.com/OpenGVLab/Future-L1

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15153 2026-06-05 cs.CV 57%

Explainable Action Form Assessment by Exploiting Multimodal Chain-of-Thoughts Reasoning

通过利用多模态链式推理解释可解释的动作形式评估

Mengshi Qi, Yeteng Wu, Wulian Yun, Xianlin Zhang, Huadong Ma

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出了一种新的动作形式评估任务,并引入了一个包含大量健身和武术视频的多级标注数据集CoT-AFA,通过引入新的链式思维解释方法,提出了可解释性健身评估框架,以提升动作分析能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03402 2026-06-04 cs.CV 57%

Mamba-Enhanced Implicit Motion Learning for Audio-Driven Portrait Animation

Mamba增强的隐式运动学习用于音频驱动肖像动画

Xuan Wei, Jiahui Chen, Kaiheng Li, Mingyu Shao, Qingqi Hong

机构 * Fujian Provincial Natural Science Foundation of China(福建省自然科学基金委员会) Giant Interactive Group Inc.(巨匠互动集团有限公司) National Natural Science Foundation of China(国家自然科学基金委员会)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 提出一种两阶段隐式运动框架,结合区域感知注意力机制和Mamba增强扩散模型,从单张静态图像和音频生成逼真且时间一致的人体运动视频,在多个基准上达到最先进性能。

Comments accepted by 2026 IEEE International Conference on Multimedia and Expo (ICME)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31069 2026-06-01 cs.CV cs.CL 57%

Towards Effective Long-Video Event Prediction via Multi-Level Event Semantics Mining

面向有效长视频事件预测的多级事件语义挖掘

Bo Peng, YuanJie Lyu, PengGang Qin, Tong Xu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 动作与事件理解 :video language model(abstract);分类 cs.CV

AI总结 提出VISTA框架,通过多级事件语义挖掘(细节级、事件级、未来级)实现长视频事件预测,解决现有模型无法精确提取事件细节和进行细粒度分析的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17543 2026-05-26 cs.CV cs.GR 57%

HL-OutPaint: Coarse-to-Fine Video Outpainting for High-Resolution Long-Range Videos

HL-OutPaint:面向高分辨率长范围视频的粗到细视频外绘

Jeongeun Park, Janghyeok Han, Geonung Kim, Hyun-Seung Lee, Kyuha Choi, Youngseok Han, Sunghyun Cho

机构 * POSTECH Visual Display Business, Samsung Electronics(三星电子视觉显示事业部)

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

AI总结 提出HL-OutPaint框架,采用粗到细两阶段流程,通过全局-局部帧交换机制构建全局粗引导,实现高分辨率长视频的大空间外推和时空一致生成。

Comments Supplementary material and video included. Project page: https://koyy001.github.io/Publications/hl-outpaint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22823 2026-05-22 cs.CV 57%

Which Way Did It Move? Diagnosing and Overcoming Directional Motion Blindness in Video-LLMs

它往哪个方向移动?视频大语言模型中方向运动盲症的诊断与克服

Jongseo Lee, Hyuntak Lee, Sunghun Kim, Sooa Kim, Jihoon Chung, Jinwoo Choi

机构 * Kyung Hee University(庆熙大学) Princeton University(普林斯顿大学)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

AI总结 本文研究了视频大语言模型在理解方向运动时的盲点,提出MoDirect数据集和DeltaDirect方法,通过改进模型对方向运动的感知能力,显著提升了模型在合成和真实场景中的方向识别性能。

Comments Preprint. 59 pages, including appendix. Code: https://github.com/KHU-VLL/DeltaDirect

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22538 2026-05-22 cs.CV 57%

Segment Anything with Motion, Geometry, and Semantic Adaptation for Complex Nonlinear Visual Object Tracking

基于运动、几何和语义适应的复杂非线性视觉目标跟踪

Deyi Zhu, Yuji Wang, Yong Liu, Yansong Tang, Bingyao Yu, Jiwen Lu, Jie Zhou

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出SAMOSA框架,通过显式利用运动、几何和语义线索,改进SAM 2在复杂非线性视觉目标跟踪中的表现,实现了更鲁棒和通用的跟踪方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02955 2026-05-13 cs.CV 57%

MotionBench: Benchmarking and Improving Fine-grained Video Motion Understanding for Vision Language Models

MotionBench: 视觉语言模型视频细粒度运动理解的基准测试与改进

Wenyi Hong, Yean Cheng, Zhuoyi Yang, Weihan Wang, Lefan Wang, Xiaotao Gu, Shiyu Huang, Yuxiao Dong, Jie Tang

机构 * Tsinghua University(清华大学) Zhipu AI(智谱AI)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

AI总结 MotionBench针对视觉语言模型在细粒度视频运动理解方面的不足,提出综合评估基准,通过六类运动导向问题类型评估模型运动层面感知能力,并提出Through-Encoder融合方法提升模型对有限序列长度内细粒度运动的感知。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09534 2026-05-12 cs.CV 57%

AUHead: Realistic Emotional Talking Head Generation via Action Units Control

AUHead: 通过动作单元控制实现逼真的情感谈话头生成

Jiayi Lyu, Leigang Qu, Wenjing Zhang, Hanyu Jiang, Kai Liu, Zhenglin Zhou, Xiaobo Xia, Jian Xue, Tat-Seng Chua

机构 * University of the Chinese Academy of Sciences(中国科学院大学) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学) State Key Laboratory of Communication Content Cognition, People’s Daily Online(人民日報網通信內容認知重點實驗室)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 本文提出AUHead方法,通过动作单元控制实现逼真的谈话头生成,解决现有方法在情感表达细腻度上的不足。

Comments https://openreview.net/forum?id=dmzlAUkulz&referrer=%5BAuthor%20Console%5D(%2Fgroup%3Fid%3DICLR.cc%2F2026%2FConference%2FAuthors%23your-submissions) Accepted at the 14th International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00496 2026-05-04 cs.CV cs.RO 57%

High-Speed Vision Improves Zero-Shot Semantic Understanding of Human Actions

高速视觉提升人类动作的零样本语义理解

Yongpeng Cao, Yuji Yamakawa

机构 * Institute of Industrial Science, The University of Tokyo(东京大学工业科学研究所) Interfaculty Initiative in Information Studies, Graduate School of Interdisciplinary Information Studies, The University of Tokyo(东京大学跨学科信息研究 graduate school)

专题命中 动作与事件理解 :video-language(abstract);分类 cs.CV

AI总结 本文研究高速视觉对人类动作零样本语义理解的影响,提出无需训练的管道结合预训练视频-语言模型与大语言模型进行动作比较,实验显示高帧率提升语义分离度,验证了高速感知对语义理解的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06394 2026-05-01 cs.CV cs.AI 57%

Context Matters: Peer-Aware Student Behavioral Engagement Measurement via VLM Action Parsing and LLM Sequence Classification

语境至关重要:通过VLM动作解析和LLM序列分类进行同伴感知的学生行为参与度测量

Ahmed Abdelkawy, Ahmed Elsayed, Asem Ali, Aly Farag, Thomas Tretter, Michael McIntyre

机构 * University of Louisville(路易斯维尔大学)

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

AI总结 本文提出一种三阶段框架,通过VLM动作识别和LLM序列分类,结合课堂语境中的同伴行为,有效测量学生参与度。

Comments accepted to the Computer Vision for Education (CV4Edu) workshop, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14953 2026-04-17 cs.CV 57%

Prompt-to-Gesture: Measuring the Capabilities of Image-to-Video Deictic Gesture Generation

Prompt-to-Gesture:测量图像到视频指称手势生成的能力

Hassan Ali, Doreen Jirak, Luca Müller, Stefan Wermter

机构 * Knowledge Technology Group, Department of Informatics, University of Hamburg(汉堡大学信息学院知识技术组) Behavioral Lab, Department of Product Development, University of Antwerp(安特卫普大学产品开发学院行为实验室)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 本文提出通过提示生成视频来构建逼真指称手势数据集,评估其在下游任务中的有效性,展示了合成手势在视觉质量和多样性上的优势。

Comments Accepted at 2026 International Conference on Automatic Face and Gesture Recognition (FG)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12944 2026-04-15 cs.CV cs.AI 57%

Distorted or Fabricated? A Survey on Hallucination in Video LLMs

扭曲或伪造?视频大语言模型中幻觉的调查

Yiyang Huang, Yitian Zhang, Yizhou Wang, Mingyuan Zhang, Liang Shi, Huimin Zeng, Yun Fu

机构 * Department of Electrical and Computer Engineering, Northeastern University(东北大学电气与计算机工程系) Khoury College of Computer Science, Northeastern University(东北大学科赫里计算机科学学院)

专题命中 动作与事件理解 :video-language(abstract);分类 cs.CV

AI总结 本文调查视频大语言模型中的幻觉问题,提出动态扭曲和内容伪造两大类,分析其成因并提出改进方向,如开发运动感知视觉编码器和整合反事实学习技术。

Comments ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07951 2026-04-06 cs.CV 57%

Preserving Source Video Realism: High-Fidelity Face Swapping for Cinematic Quality

保留源视频真实性:面向电影质量的高保真面部交换

Zekai Luo, Zongze Du, Zhouhang Zhu, Hao Zhong, Muzhi Zhu, Wen Wang, Yuling Xi, Chenchen Jing, Hao Chen, Chunhua Shen

机构 * Zhejiang University, State Key Laboratory of CAD & CG(浙江大学,计算机辅助设计与图形学国家重点实验室) Zhejiang University of Technology(浙江工业大学) Ant Group(蚂蚁集团)

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

AI总结 本文提出LivingSwap模型,通过关键帧和视频参考引导实现高保真面部交换,提升视频真实感与时间一致性,减少生产流程中的手动工作量。

Comments Accepted to CVPR 2026. Project webpage: https://aim-uofa.github.io/LivingSwap

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01994 2026-04-03 cs.CV 57%

Resonance4D: Frequency-Domain Motion Supervision for Preset-Free Physical Parameter Learning in 4D Dynamic Physical Scene Simulation

Resonance4D: 频域运动监督用于预设-free 物理参数学习的4D动态物理场景模拟

Changshe Zhang, Jie Feng, Siyu Chen, Guanbin Li, Ronghua Shang, Junpeng Zhang

机构 * Xidian University(西安电子科技大学) Jimei University(集美大学) Sun Yat-sen University(中山大学)

专题命中 动作与事件理解 :video diffusion(abstract);分类 cs.CV

AI总结 Resonance4D通过结合3D高斯散射与物质点方法,提出轻量且物理表达的监督策略,解决动态一致性问题,减少训练成本和内存开销,实现高保真的4D物理模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01666 2026-04-03 cs.CV 57%

DynaVid: Learning to Generate Highly Dynamic Videos using Synthetic Motion Data

DynaVid: 通过合成运动数据学习生成高度动态视频

Wonjoon Jin, Jiyun Won, Janghyeok Han, Qi Dai, Chong Luo, Seung-Hwan Baek, Sunghyun Cho

机构 * POSTECH(浦项科技大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 动作与事件理解 :video diffusion(abstract);分类 cs.CV

AI总结 DynaVid通过合成运动数据训练视频合成框架,解决动态视频生成中真实数据不足的问题,采用两阶段生成方法提升动态运动和摄像机运动的现实感与可控性。

Comments Accepted to CVPR 2026. Website: https://jinwonjoon.github.io/DynaVid/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01043 2026-04-02 cs.CV 57%

ONE-SHOT: Compositional Human-Environment Video Synthesis via Spatial-Decoupled Motion Injection and Hybrid Context Integration

ONE-SHOT:通过空间解耦的运动注入与混合上下文整合进行组合人类-环境视频合成

Fengyuan Yang, Luying Huang, Jiazhi Guan, Quanwei Yang, Dongwei Pan, Jianglin Fu, Haocheng Feng, Wei He, Kaisiyuan Wang, Hang Zhou, Angela Yao

机构 * National University of Singapore(新加坡国立大学) Baidu Inc.(百度公司)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 本文提出ONE-SHOT框架,通过空间解耦运动注入和混合上下文整合,实现高效的人类-环境视频合成,优于现有方法,具有更好的结构控制和创意多样性。

Comments 23 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07732 2026-03-31 cs.RO cs.AI cs.CL cs.CV cs.LG 57%

ViPRA: Video Prediction for Robot Actions

ViPRA:用于机器人动作的视频预测

Sandeep Routray, Hengkai Pan, Unnat Jain, Shikhar Bahl, Deepak Pathak

机构 * Carnegie Mellon University(卡内基梅隆大学) Skild AI University of California, Irvine(加州大学尔湾分校)

专题命中 动作与事件理解 :video-language(abstract);分类 cs.CV

AI总结 ViPRA通过预训练和微调框架,从无标注视频中学习连续机器人控制,利用视频语言模型预测视觉观察和运动中心潜在动作,支持跨机器人形态的泛化和高频率连续控制。

Comments In ICLR 2026. Website: https://vipra-project.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05207 2026-03-31 cs.CV 57%

Follow-Your-Motion: Video Motion Transfer via Efficient Spatial-Temporal Decoupled Finetuning

跟随你的动作:通过高效的时空解耦微调实现视频动作迁移

Yue Ma, Yulong Liu, Qiyuan Zhu, Ayden Yang, Kunyu Feng, Xinhua Zhang, Zexuan Yan, Zhifeng Li, Sirui Han, Chenyang Qi, Qifeng Chen

机构 * HKUST(香港科技大学) HKUST(GZ)(香港科技大学(广州)) Tsinghua University(清华大学) XIntelligence Technology Co., Limited(星云科技股份有限公司) SJTU(上海交通大学)

专题命中 动作与事件理解 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出Follow-Your-Motion框架,通过高效的时空解耦微调方法,解决视频扩散变换器在动作迁移中的不一致性和效率问题,并引入MotionBench基准进行验证。

Comments Accepted by ICLR 2026, project page: https://follow-your-motion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏