arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6781 信号源:cs.CV, eess.IV, cs.MM

1. 动作与事件理解 473 篇

2512.07951 2026-04-06 cs.CV 57%

Preserving Source Video Realism: High-Fidelity Face Swapping for Cinematic Quality

保留源视频真实性:面向电影质量的高保真面部交换

Zekai Luo, Zongze Du, Zhouhang Zhu, Hao Zhong, Muzhi Zhu, Wen Wang, Yuling Xi, Chenchen Jing, Hao Chen, Chunhua Shen

机构 * Zhejiang University, State Key Laboratory of CAD & CG(浙江大学,计算机辅助设计与图形学国家重点实验室) Zhejiang University of Technology(浙江工业大学) Ant Group(蚂蚁集团)

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

AI总结 本文提出LivingSwap模型,通过关键帧和视频参考引导实现高保真面部交换,提升视频真实感与时间一致性,减少生产流程中的手动工作量。

Comments Accepted to CVPR 2026. Project webpage: https://aim-uofa.github.io/LivingSwap

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01994 2026-04-03 cs.CV 57%

Resonance4D: Frequency-Domain Motion Supervision for Preset-Free Physical Parameter Learning in 4D Dynamic Physical Scene Simulation

Resonance4D: 频域运动监督用于预设-free 物理参数学习的4D动态物理场景模拟

Changshe Zhang, Jie Feng, Siyu Chen, Guanbin Li, Ronghua Shang, Junpeng Zhang

机构 * Xidian University(西安电子科技大学) Jimei University(集美大学) Sun Yat-sen University(中山大学)

专题命中 动作与事件理解 :video diffusion(abstract);分类 cs.CV

AI总结 Resonance4D通过结合3D高斯散射与物质点方法,提出轻量且物理表达的监督策略,解决动态一致性问题,减少训练成本和内存开销,实现高保真的4D物理模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01666 2026-04-03 cs.CV 57%

DynaVid: Learning to Generate Highly Dynamic Videos using Synthetic Motion Data

DynaVid: 通过合成运动数据学习生成高度动态视频

Wonjoon Jin, Jiyun Won, Janghyeok Han, Qi Dai, Chong Luo, Seung-Hwan Baek, Sunghyun Cho

机构 * POSTECH(浦项科技大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 动作与事件理解 :video diffusion(abstract);分类 cs.CV

AI总结 DynaVid通过合成运动数据训练视频合成框架,解决动态视频生成中真实数据不足的问题,采用两阶段生成方法提升动态运动和摄像机运动的现实感与可控性。

Comments Accepted to CVPR 2026. Website: https://jinwonjoon.github.io/DynaVid/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01043 2026-04-02 cs.CV 57%

ONE-SHOT: Compositional Human-Environment Video Synthesis via Spatial-Decoupled Motion Injection and Hybrid Context Integration

ONE-SHOT:通过空间解耦的运动注入与混合上下文整合进行组合人类-环境视频合成

Fengyuan Yang, Luying Huang, Jiazhi Guan, Quanwei Yang, Dongwei Pan, Jianglin Fu, Haocheng Feng, Wei He, Kaisiyuan Wang, Hang Zhou, Angela Yao

机构 * National University of Singapore(新加坡国立大学) Baidu Inc.(百度公司)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 本文提出ONE-SHOT框架,通过空间解耦运动注入和混合上下文整合,实现高效的人类-环境视频合成,优于现有方法,具有更好的结构控制和创意多样性。

Comments 23 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07732 2026-03-31 cs.RO cs.AI cs.CL cs.CV cs.LG 57%

ViPRA: Video Prediction for Robot Actions

ViPRA:用于机器人动作的视频预测

Sandeep Routray, Hengkai Pan, Unnat Jain, Shikhar Bahl, Deepak Pathak

机构 * Carnegie Mellon University(卡内基梅隆大学) Skild AI University of California, Irvine(加州大学尔湾分校)

专题命中 动作与事件理解 :video-language(abstract);分类 cs.CV

AI总结 ViPRA通过预训练和微调框架,从无标注视频中学习连续机器人控制,利用视频语言模型预测视觉观察和运动中心潜在动作,支持跨机器人形态的泛化和高频率连续控制。

Comments In ICLR 2026. Website: https://vipra-project.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05207 2026-03-31 cs.CV 57%

Follow-Your-Motion: Video Motion Transfer via Efficient Spatial-Temporal Decoupled Finetuning

跟随你的动作:通过高效的时空解耦微调实现视频动作迁移

Yue Ma, Yulong Liu, Qiyuan Zhu, Ayden Yang, Kunyu Feng, Xinhua Zhang, Zexuan Yan, Zhifeng Li, Sirui Han, Chenyang Qi, Qifeng Chen

机构 * HKUST(香港科技大学) HKUST(GZ)(香港科技大学(广州)) Tsinghua University(清华大学) XIntelligence Technology Co., Limited(星云科技股份有限公司) SJTU(上海交通大学)

专题命中 动作与事件理解 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出Follow-Your-Motion框架,通过高效的时空解耦微调方法,解决视频扩散变换器在动作迁移中的不一致性和效率问题,并引入MotionBench基准进行验证。

Comments Accepted by ICLR 2026, project page: https://follow-your-motion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27449 2026-03-31 cs.CV 57%

LOME: Learning Human-Object Manipulation with Action-Conditioned Egocentric World Model

LOME:基于动作条件的视点世界模型学习人类-物体操控

Quankai Gao, Jiawei Yang, Qiangeng Xu, Le Chen, Yue Wang

机构 * University of Southern California(南加州大学)

专题命中 动作与事件理解 :text-to-video(abstract);分类 cs.CV

AI总结 LOME通过结合空间人类动作与环境上下文,生成逼真的人-物交互视频,提升动作跟随精度与泛化能力,实现物理效果如液体倒出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27060 2026-03-31 cs.CV 57%

VIRST: Video-Instructed Reasoning Assistant for SpatioTemporal Segmentation

VIRST:用于时空分割的视频指导推理助手

Jihwan Hong, Jaeyoung Do

专题命中 动作与事件理解 :video reasoning(abstract);分类 cs.CV

AI总结 VIRST提出一种端到端框架,统一全局视频推理与像素级分割预测,通过时空融合模块和时间动态锚点更新器,提升动态场景下的分割性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23487 2026-03-25 cs.CV 57%

TETO: Tracking Events with Teacher Observation for Motion Estimation and Frame Interpolation

TETO:利用教师观察进行事件跟踪以实现运动估计和帧插值

Jini Yang, Eunbeen Hong, Soowon Son, Hyunkoo Lee, Sunghwan Hong, Sunok Kim, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能实验室) ETH Zurich(苏黎世联邦理工学院) Korea Aerospace University(韩国航空航天大学)

专题命中 动作与事件理解 :video diffusion(abstract);分类 cs.CV

AI总结 TETO提出一种教师-学生框架,通过知识蒸馏从预训练的RGB跟踪器中学习事件运动估计,仅用25分钟未标注真实数据实现高精度点跟踪和光流估计,提升帧插值质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17240 2026-03-24 cs.CV 57%

GigaWorld-Policy: An Efficient Action-Centered World--Action Model

GigaWorld-Policy: 一种高效的以动作为中心的世界-动作模型

Angen Ye, Boyuan Wang, Chaojun Ni, Guan Huang, Guosheng Zhao, Hao Li, Hengtao Li, Jie Li, Jindi Lv, Jingyu Liu, Min Cao, Peng Li, Qiuping Deng, Wenjun Mei, Xiaofeng Wang, Xinze Chen, Xinyu Zhou, Yang Wang, Yifan Chang, Yifan Li, Yukun Zhou, Yun Ye, Zhichao Liu, Zheng Zhu

机构 * GigaAI Project Page(GigaAI项目页) GigaWorld Team(GigaWorld团队)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 本文提出GigaWorld-Policy,通过高效动作解码和可选视频生成,解决世界-动作模型在机器人策略学习中的性能瓶颈问题,实验显示其在实际机器人平台上的运行速度提升9倍,任务成功率提高7%。

Comments Added references

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17998 2026-03-19 cs.CV 57%

The Unreasonable Effectiveness of Text Embedding Interpolation for Continuous Image Steering

文本嵌入插值在连续图像操控中的不合理有效性

Yigit Ekin, Yossi Gandelsman

机构 * Reve

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 本文提出一种无需训练的连续可控图像编辑框架,通过文本嵌入空间的简单操控实现平滑编辑控制,引入弹性范围搜索确保连续性,并在文本条件模态间实现泛化。

Comments Project Page: https://yigitekin.github.io/diffusion-sliders

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16711 2026-03-19 cs.CV 57%

Search2Motion: Training-Free Object-Level Motion Control via Attention-Consensus Search

Search2Motion: 基于注意力-共识搜索的无训练物体级运动控制

Sainan Liu, Tz-Ying Wu, Hector A Valdez, Subarna Tripathi

机构 * Intel Corporation(英特尔公司)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 Search2Motion通过注意力-共识搜索实现无训练的物体级运动编辑,利用首尾帧运动先验保持场景稳定性,引入ACE-Seed策略提升运动保真度,提出新的评估指标验证其优越性。

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16195 2026-03-19 cs.CV cs.RO 57%

S-VAM: Shortcut Video-Action Model by Self-Distilling Geometric and Semantic Foresight

S-VAM:通过自蒸馏几何和语义前瞻性构建快捷视频动作模型

Haodong Yan, Zhide Zhong, Jiaguan Zhu, Junjie He, Weilin Yuan, Wenxuan Song, Xin Gong, Yingjie Cai, Guanyi Zhao, Xu Yan, Bingbing Liu, Ying-Cong Chen, Haoang Li

机构 * The Hong Kong University of Science Technology (Guangzhou) Huawei Foundation Model Department

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 S-VAM通过自蒸馏策略实现单次前向传递生成几何和语义表示,提升动作预测效率,实验证明在复杂环境中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25857 2026-03-19 cs.GR cs.AI cs.CV 57%

Vector sketch animation generation with differentiable motion trajectories

基于可微运动轨迹的向量草图动画生成

Xinding Zhu, Xinye Yang, Shuyang Zheng, Zhexin Zhang, Fei Gao, Jing Huang, Jiazhou Chen

机构 * Zhejiang University of Technology(浙江工业大学) Hangzhou Dianzi University(杭州电子科技大学) Zhejiang Gongshang University(浙江工商大学)

专题命中 动作与事件理解 :text-to-video(abstract);分类 cs.CV

AI总结 本文提出一种端到端的向量草图动画生成方法,通过可微运动轨迹解决闪烁问题,提升语义一致性和时间连续性,实现在DAVIS和LVOS数据集上的优越性能。

Comments 14 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14948 2026-03-17 cs.CV 57%

Bridging Scene Generation and Planning: Driving with World Model via Unifying Vision and Motion Representation

弥合场景生成与规划:通过统一视觉与运动表示进行驾驶世界模型

Xingtai Gui, Meijie Zhang, Tianyi Yan, Wencheng Han, Jiahao Gong, Feiyang Tan, Cheng-zhong Xu, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学SKL-IOTSC、CIS) Afari Intelligent Drive(Afari智能驾驶)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 本文提出WorldDrive框架,通过统一视觉与运动表示弥合场景生成与规划之间的差距,利用轨迹感知驾驶世界模型和未来感知奖励器提升自动驾驶规划性能。

Comments 16 pages, 9 figures. The code is available at https://github.com/TabGuigui/WorldDrive

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14073 2026-03-17 cs.CV cs.AI cs.LG 57%

MotionCFG: Boosting Motion Dynamics via Stochastic Concept Perturbation

MotionCFG: 通过随机概念扰动提升运动动态

Byungjun Kim, Soobin Um, Jong Chul Ye

专题命中 动作与事件理解 :text-to-video(abstract);分类 cs.CV

AI总结 本文提出MotionCFG框架,通过对比目标概念与其噪声扰动版本,提升文本到视频合成中的运动动态,同时减少语义偏移和对象完整性损害。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11975 2026-03-16 cs.CV cs.AI cs.CR 57%

HomeSafe-Bench: Evaluating Vision-Language Models on Unsafe Action Detection for Embodied Agents in Household Scenarios

HomeSafe-Bench:评估视觉-语言模型在家庭场景中对不安全行为检测的性能

Jiayue Pu, Zhongxiang Sun, Zilu Zhang, Xiao Zhang, Jun Xu

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 本文提出HomeSafe-Bench,用于评估视觉-语言模型在家庭场景中检测不安全行为的能力,同时引入HD-Guard架构提升实时安全监控效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01000 2026-03-16 cs.CV 57%

Let Your Image Move with Your Motion! -- Implicit Multi-Object Multi-Motion Transfer

让您的图像随您的动作移动!-- 隐式多对象多动作转移

Yuze Li, Dong Gong, Xiao Cao, Junchao Yuan, Dongsheng Li, Lei Zhou, Yun Sing Koh, Cheng Yan, Xinyu Zhang

机构 * Tianjin University(天津大学) University of New South Wales(新南威尔士大学) University of Electronic Science and Technology of China(电子科技大学) Hainan University(海南大学) University of Auckland(奥克兰大学)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 本文提出FlexiMMT框架,实现多对象多动作的隐式图像到视频转换,通过解耦注意力机制和改进的掩码传播机制,实现精确且高质量的多对象动作迁移。

Comments 15 pages, 11 figures, cvpr 2026, see https://ethan-li123.github.io/FlexiMMT_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12257 2026-03-13 cs.CV 57%

DreamVideo-Omni: Omni-Motion Controlled Multi-Subject Video Customization with Latent Identity Reinforcement Learning

DreamVideo-Omni: 基于潜在身份强化学习的多主体视频定制与 Omni-运动控制

Yujie Wei, Xinyu Liu, Shiwei Zhang, Hangjie Yuan, Jinbo Xing, Zhekai Chen, Xiang Wang, Haonan Qiu, Rui Zhao, Yutong Feng, Ruihang Chu, Yingya Zhang, Yike Guo, Xihui Liu, Hongming Shan

机构 * Fudan University(复旦大学) The Hong Kong University of Science and Technology(香港科技大学) Tongyi Lab, Alibaba Group(阿里云实验室) Zhejiang University(浙江大学) MMLab, The University of Hong Kong(香港大学MMLab) Nanyang Technological University(南洋理工大学) Show Lab, National University of Singapore(新加坡国立大学Show Lab)

专题命中 动作与事件理解 :video diffusion(abstract);分类 cs.CV

AI总结 DreamVideo-Omni通过渐进式两阶段训练范式,实现多主体视频定制与Omni-运动控制,采用条件感知嵌入和分层运动注入策略,提升身份保持与运动控制精度。

Comments Project Page: https://dreamvideo-omni.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10238 2026-03-10 cs.CV 57%

MTVCraft: Tokenizing 4D Motion for Arbitrary Character Animation

MTVCraft: 4D运动分词用于任意角色动画

Yanbo Ding, Xirui Hu, Zhizhi Guo, Yan Zhang, Xinrui Wang, Zhixiang He, Chi Zhang, Yali Wang, Xuelong Li

机构 * Shenzhen Key Laboratory of Computer Vision and Pattern Recognition, Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, Shenzhen, China(深圳计算机视觉与模式识别重点实验室,深圳先进技术研究院,中国科学院,深圳,中国) Institute of Artificial Intelligence (TeleAI), China Telecom, Beijing, China(人工智能研究所(TeleAI),中国电信,北京,中国) School of Computer Science and Technology, Xi’an Jiaotong University, Xi’an, China(计算机科学与技术学院,西安交通大学,西安,中国) School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(人工智能学院,中国科学院大学,北京,中国) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 MTVCraft通过直接建模4D运动序列,实现任意角色动画,提升运动控制灵活性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00825 2026-03-03 cs.CV 57%

COMBAT: Conditional World Models for Behavioral Agent Training

COMBAT:基于行为代理训练的条件世界模型

Anmol Agarwal, Pranay Meshram, Sumer Singh, Saurav Suman, Andrew Lapp, Shahbuland Matiana, Louis Castricato, Spencer Frazier

机构 * Overworld AI Indian Institute of Science Education and Research Bhopal(印度科学教育与研究学院博帕尔分校)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 COMBAT通过在Tekken 3中训练实时动作控制的世界模型,利用扩散模型模拟动态对手,实现对玩家行为的响应性训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24275 2026-03-02 cs.CV 57%

Hierarchical Action Learning for Weakly-Supervised Action Segmentation

分层动作学习用于弱监督动作分割

Junxian Huang, Ruichu Cai, Hao Zhu, Juntao Fang, Boyan Xu, Weilin Chen, Zijian Li, Shenghua Gao

机构 * Guangdong University of Technology(广东技术大学) Carnegie Mellon University(卡内基梅隆大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Hong Kong(香港大学)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

AI总结 HAL模型通过分层因果数据生成和稀疏转换约束,提升弱监督动作分割的识别能力。

Journal ref CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15922 2026-02-19 cs.RO cs.CV cs.LG 57%

World Action Models are Zero-shot Policies

世界动作模型是零样本策略

Seonghyeon Ye, Yunhao Ge, Kaiyuan Zheng, Shenyuan Gao, Sihyun Yu, George Kurian, Suneel Indupuru, You Liang Tan, Chuning Zhu, Jiannan Xiang, Ayaan Malik, Kyungmin Lee, William Liang, Nadun Ranawaka, Jiasheng Gu, Yinzhen Xu, Guanzhi Wang, Fengyuan Hu, Avnish Narayan, Johan Bjorck, Jing Wang, Gwanghyun Kim, Dantong Niu, Ruijie Zheng, Yuqi Xie, Jimmy Wu, Qi Wang, Ryan Julian, Danfei Xu, Yilun Du, Yevgen Chebotar, Scott Reed, Jan Kautz, Yuke Zhu, Linxi "Jim" Fan, Joel Jang

机构 * NVIDIA

专题命中 动作与事件理解 :video diffusion(abstract);分类 cs.CV

AI总结 DreamZero通过世界动作模型实现零样本策略,有效提升机器人在新任务和环境中的泛化能力,同时支持跨身体转移和少样本适应。

Comments Project page: https://dreamzero0.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09146 2026-02-11 cs.CV 57%

SemanticMoments: Training-Free Motion Similarity via Third Moment Features

语义时刻:通过第三时刻特征实现免训练的运动相似性

Saar Huberman, Kfir Goldberg, Or Patashnik, Sagie Benaim, Ron Mokady

机构 * BRIA AI(BRIA人工智能研究中心) Tel Aviv University(特拉维夫大学) Hebrew University of Jerusalem(耶路撒冷希伯来大学)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

AI总结 SemanticMoments通过计算语义特征的高阶矩,无需训练即可提升基于运动的视频理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21797 2026-02-11 cs.CV 57%

MoWM: Mixture-of-World-Models for Embodied Planning via Latent-to-Pixel Feature Modulation

MoWM: 通过潜在到像素特征调制的混合世界模型实现具身规划

Yangcheng Yu, Xin Jin, Yu Shang, Xin Zhang, Haisheng Su, Wei Wu, Yong Li

机构 * Tsinghua University(清华大学) Manifold AI Shanghai Jiao Tong University(上海交通大学)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 MoWM通过融合潜在世界模型与像素特征,提升具身规划中动作解码的精度与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07498 2026-02-10 cs.CV 57%

IM-Animation: An Implicit Motion Representation for Identity-decoupled Character Animation

IM-Animation: 一种隐式运动表示用于身份解耦的角色动画

Zhufeng Xu, Xuan Gao, Feng-Lin Liu, Haoxian Zhang, Zhixue Fang, Yu-Kun Lai, Xiaoqiang Liu, Pengfei Wan, Lin Gao

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Kling Team, Kuaishou Technology(快手技术 Kling 团队) Cardiff University(卡迪夫大学)

专题命中 动作与事件理解 :video diffusion(abstract);分类 cs.CV

AI总结 IM-Animation通过隐式运动表示和时间一致的遮罩令牌重定向模块,实现身份解耦的角色动画生成,提升动画质量和训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22039 2026-01-30 cs.CV 57%

Understanding Multimodal Complementarity for Single-Frame Action Anticipation

理解单帧动作预测中的多模态互补性

Manuel Benavent-Lledo, Konstantinos Bacharidis, Konstantinos Papoutsakis, Antonis Argyros, Jose Garcia-Rodriguez

机构 * Department of Computer Technology, University of Alicante(阿尔瓦雷斯大学计算机技术系) Institute of Computer Science, FORTH(福蒂研究所) Computer Science Department, University of Crete(克里特大学计算机科学系) Department of Management, Science and Technology, Hellenic Mediterranean University(希腊地中海大学管理、科学与技术系)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

AI总结 本研究通过单帧动作预测框架AAG+,探索多模态互补性对动作预测的影响,验证单帧信息在动作预测中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20504 2026-01-29 cs.CV 57%

Latent Temporal Discrepancy as Motion Prior: A Loss-Weighting Strategy for Dynamic Fidelity in T2V

潜在时间差异作为运动先验:一种用于动态保真的损失加权策略

Meiqi Wu, Bingze Song, Ruimin Lin, Chen Zhu, Xiaokun Feng, Jiahong Wu, Xiangxiang Chu, Kaiqi Huang

机构 * University of Chinese Academy of Sciences(中国科学院大学) AMAP, Alibaba Group(阿里云实验室) Southeast University(东南大学) CRISE, Institute of Automation Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 本文提出了一种基于潜在时间差异的损失加权策略,用于提升动态保真度,通过引入运动先验来优化模型训练,从而在运动视频生成任务中取得显著性能提升。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.11551 2026-01-23 cs.CV cs.IR cs.LG 57%

Multi-event Video-Text Retrieval

多事件视频-文本检索

Gengyuan Zhang, Jisen Ren, Jindong Gu, Volker Tresp

机构 * LMU Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心) University of Oxford(牛津大学)

专题命中 动作与事件理解 :text-to-video(abstract);分类 cs.CV

AI总结 本文提出多事件视频-文本检索任务,设计Me-Retriever模型,通过关键事件表示和新损失函数提升视频-文本检索性能。

Comments [fixed typos in equations] accepted to ICCV2023 Poster; some figures are not supported when viewed online, please download the file and view locally

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14086 2026-01-21 cs.CV cs.AI cs.LG 57%

Two-Stream temporal transformer for video action classification

双流时间转换器用于视频动作分类

Nattapong Kurpukdee, Adrian G. Bors

机构 * Department of Computer Science, University of York, York YO10 5GH, UK(约克大学计算机科学系)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出双流时间转换器模型,通过提取时空信息和光流特征,实现视频动作的高效分类。

详情

展开后加载摘要…

URL PDF HTML 收藏