arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 470 信号源:cs.CV, eess.IV, cs.MM

1. 动作与事件理解 470 篇

2603.27449 2026-03-31 cs.CV 57%

LOME: Learning Human-Object Manipulation with Action-Conditioned Egocentric World Model

LOME:基于动作条件的视点世界模型学习人类-物体操控

Quankai Gao, Jiawei Yang, Qiangeng Xu, Le Chen, Yue Wang

机构 * University of Southern California(南加州大学)

专题命中 动作与事件理解 :text-to-video(abstract);分类 cs.CV

AI总结 LOME通过结合空间人类动作与环境上下文,生成逼真的人-物交互视频,提升动作跟随精度与泛化能力,实现物理效果如液体倒出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27060 2026-03-31 cs.CV 57%

VIRST: Video-Instructed Reasoning Assistant for SpatioTemporal Segmentation

VIRST:用于时空分割的视频指导推理助手

Jihwan Hong, Jaeyoung Do

专题命中 动作与事件理解 :video reasoning(abstract);分类 cs.CV

AI总结 VIRST提出一种端到端框架,统一全局视频推理与像素级分割预测,通过时空融合模块和时间动态锚点更新器,提升动态场景下的分割性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23487 2026-03-25 cs.CV 57%

TETO: Tracking Events with Teacher Observation for Motion Estimation and Frame Interpolation

TETO:利用教师观察进行事件跟踪以实现运动估计和帧插值

Jini Yang, Eunbeen Hong, Soowon Son, Hyunkoo Lee, Sunghwan Hong, Sunok Kim, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能实验室) ETH Zurich(苏黎世联邦理工学院) Korea Aerospace University(韩国航空航天大学)

专题命中 动作与事件理解 :video diffusion(abstract);分类 cs.CV

AI总结 TETO提出一种教师-学生框架,通过知识蒸馏从预训练的RGB跟踪器中学习事件运动估计,仅用25分钟未标注真实数据实现高精度点跟踪和光流估计,提升帧插值质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17240 2026-03-24 cs.CV 57%

GigaWorld-Policy: An Efficient Action-Centered World--Action Model

GigaWorld-Policy: 一种高效的以动作为中心的世界-动作模型

Angen Ye, Boyuan Wang, Chaojun Ni, Guan Huang, Guosheng Zhao, Hao Li, Hengtao Li, Jie Li, Jindi Lv, Jingyu Liu, Min Cao, Peng Li, Qiuping Deng, Wenjun Mei, Xiaofeng Wang, Xinze Chen, Xinyu Zhou, Yang Wang, Yifan Chang, Yifan Li, Yukun Zhou, Yun Ye, Zhichao Liu, Zheng Zhu

机构 * GigaAI Project Page(GigaAI项目页) GigaWorld Team(GigaWorld团队)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 本文提出GigaWorld-Policy,通过高效动作解码和可选视频生成,解决世界-动作模型在机器人策略学习中的性能瓶颈问题,实验显示其在实际机器人平台上的运行速度提升9倍,任务成功率提高7%。

Comments Added references

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17998 2026-03-19 cs.CV 57%

The Unreasonable Effectiveness of Text Embedding Interpolation for Continuous Image Steering

文本嵌入插值在连续图像操控中的不合理有效性

Yigit Ekin, Yossi Gandelsman

机构 * Reve

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 本文提出一种无需训练的连续可控图像编辑框架,通过文本嵌入空间的简单操控实现平滑编辑控制,引入弹性范围搜索确保连续性,并在文本条件模态间实现泛化。

Comments Project Page: https://yigitekin.github.io/diffusion-sliders

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16711 2026-03-19 cs.CV 57%

Search2Motion: Training-Free Object-Level Motion Control via Attention-Consensus Search

Search2Motion: 基于注意力-共识搜索的无训练物体级运动控制

Sainan Liu, Tz-Ying Wu, Hector A Valdez, Subarna Tripathi

机构 * Intel Corporation(英特尔公司)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 Search2Motion通过注意力-共识搜索实现无训练的物体级运动编辑,利用首尾帧运动先验保持场景稳定性,引入ACE-Seed策略提升运动保真度,提出新的评估指标验证其优越性。

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16195 2026-03-19 cs.CV cs.RO 57%

S-VAM: Shortcut Video-Action Model by Self-Distilling Geometric and Semantic Foresight

S-VAM:通过自蒸馏几何和语义前瞻性构建快捷视频动作模型

Haodong Yan, Zhide Zhong, Jiaguan Zhu, Junjie He, Weilin Yuan, Wenxuan Song, Xin Gong, Yingjie Cai, Guanyi Zhao, Xu Yan, Bingbing Liu, Ying-Cong Chen, Haoang Li

机构 * The Hong Kong University of Science Technology (Guangzhou) Huawei Foundation Model Department

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 S-VAM通过自蒸馏策略实现单次前向传递生成几何和语义表示,提升动作预测效率,实验证明在复杂环境中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25857 2026-03-19 cs.GR cs.AI cs.CV 57%

Vector sketch animation generation with differentiable motion trajectories

基于可微运动轨迹的向量草图动画生成

Xinding Zhu, Xinye Yang, Shuyang Zheng, Zhexin Zhang, Fei Gao, Jing Huang, Jiazhou Chen

机构 * Zhejiang University of Technology(浙江工业大学) Hangzhou Dianzi University(杭州电子科技大学) Zhejiang Gongshang University(浙江工商大学)

专题命中 动作与事件理解 :text-to-video(abstract);分类 cs.CV

AI总结 本文提出一种端到端的向量草图动画生成方法,通过可微运动轨迹解决闪烁问题,提升语义一致性和时间连续性,实现在DAVIS和LVOS数据集上的优越性能。

Comments 14 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14948 2026-03-17 cs.CV 57%

Bridging Scene Generation and Planning: Driving with World Model via Unifying Vision and Motion Representation

弥合场景生成与规划:通过统一视觉与运动表示进行驾驶世界模型

Xingtai Gui, Meijie Zhang, Tianyi Yan, Wencheng Han, Jiahao Gong, Feiyang Tan, Cheng-zhong Xu, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学SKL-IOTSC、CIS) Afari Intelligent Drive(Afari智能驾驶)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 本文提出WorldDrive框架,通过统一视觉与运动表示弥合场景生成与规划之间的差距,利用轨迹感知驾驶世界模型和未来感知奖励器提升自动驾驶规划性能。

Comments 16 pages, 9 figures. The code is available at https://github.com/TabGuigui/WorldDrive

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14073 2026-03-17 cs.CV cs.AI cs.LG 57%

MotionCFG: Boosting Motion Dynamics via Stochastic Concept Perturbation

MotionCFG: 通过随机概念扰动提升运动动态

Byungjun Kim, Soobin Um, Jong Chul Ye

专题命中 动作与事件理解 :text-to-video(abstract);分类 cs.CV

AI总结 本文提出MotionCFG框架,通过对比目标概念与其噪声扰动版本,提升文本到视频合成中的运动动态,同时减少语义偏移和对象完整性损害。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11975 2026-03-16 cs.CV cs.AI cs.CR 57%

HomeSafe-Bench: Evaluating Vision-Language Models on Unsafe Action Detection for Embodied Agents in Household Scenarios

HomeSafe-Bench:评估视觉-语言模型在家庭场景中对不安全行为检测的性能

Jiayue Pu, Zhongxiang Sun, Zilu Zhang, Xiao Zhang, Jun Xu

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 本文提出HomeSafe-Bench,用于评估视觉-语言模型在家庭场景中检测不安全行为的能力,同时引入HD-Guard架构提升实时安全监控效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01000 2026-03-16 cs.CV 57%

Let Your Image Move with Your Motion! -- Implicit Multi-Object Multi-Motion Transfer

让您的图像随您的动作移动!-- 隐式多对象多动作转移

Yuze Li, Dong Gong, Xiao Cao, Junchao Yuan, Dongsheng Li, Lei Zhou, Yun Sing Koh, Cheng Yan, Xinyu Zhang

机构 * Tianjin University(天津大学) University of New South Wales(新南威尔士大学) University of Electronic Science and Technology of China(电子科技大学) Hainan University(海南大学) University of Auckland(奥克兰大学)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 本文提出FlexiMMT框架,实现多对象多动作的隐式图像到视频转换,通过解耦注意力机制和改进的掩码传播机制,实现精确且高质量的多对象动作迁移。

Comments 15 pages, 11 figures, cvpr 2026, see https://ethan-li123.github.io/FlexiMMT_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12257 2026-03-13 cs.CV 57%

DreamVideo-Omni: Omni-Motion Controlled Multi-Subject Video Customization with Latent Identity Reinforcement Learning

DreamVideo-Omni: 基于潜在身份强化学习的多主体视频定制与 Omni-运动控制

Yujie Wei, Xinyu Liu, Shiwei Zhang, Hangjie Yuan, Jinbo Xing, Zhekai Chen, Xiang Wang, Haonan Qiu, Rui Zhao, Yutong Feng, Ruihang Chu, Yingya Zhang, Yike Guo, Xihui Liu, Hongming Shan

机构 * Fudan University(复旦大学) The Hong Kong University of Science and Technology(香港科技大学) Tongyi Lab, Alibaba Group(阿里云实验室) Zhejiang University(浙江大学) MMLab, The University of Hong Kong(香港大学MMLab) Nanyang Technological University(南洋理工大学) Show Lab, National University of Singapore(新加坡国立大学Show Lab)

专题命中 动作与事件理解 :video diffusion(abstract);分类 cs.CV

AI总结 DreamVideo-Omni通过渐进式两阶段训练范式,实现多主体视频定制与Omni-运动控制,采用条件感知嵌入和分层运动注入策略,提升身份保持与运动控制精度。

Comments Project Page: https://dreamvideo-omni.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10238 2026-03-10 cs.CV 57%

MTVCraft: Tokenizing 4D Motion for Arbitrary Character Animation

MTVCraft: 4D运动分词用于任意角色动画

Yanbo Ding, Xirui Hu, Zhizhi Guo, Yan Zhang, Xinrui Wang, Zhixiang He, Chi Zhang, Yali Wang, Xuelong Li

机构 * Shenzhen Key Laboratory of Computer Vision and Pattern Recognition, Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, Shenzhen, China(深圳计算机视觉与模式识别重点实验室,深圳先进技术研究院,中国科学院,深圳,中国) Institute of Artificial Intelligence (TeleAI), China Telecom, Beijing, China(人工智能研究所(TeleAI),中国电信,北京,中国) School of Computer Science and Technology, Xi’an Jiaotong University, Xi’an, China(计算机科学与技术学院,西安交通大学,西安,中国) School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(人工智能学院,中国科学院大学,北京,中国) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 MTVCraft通过直接建模4D运动序列,实现任意角色动画,提升运动控制灵活性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00825 2026-03-03 cs.CV 57%

COMBAT: Conditional World Models for Behavioral Agent Training

COMBAT:基于行为代理训练的条件世界模型

Anmol Agarwal, Pranay Meshram, Sumer Singh, Saurav Suman, Andrew Lapp, Shahbuland Matiana, Louis Castricato, Spencer Frazier

机构 * Overworld AI Indian Institute of Science Education and Research Bhopal(印度科学教育与研究学院博帕尔分校)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 COMBAT通过在Tekken 3中训练实时动作控制的世界模型,利用扩散模型模拟动态对手,实现对玩家行为的响应性训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24275 2026-03-02 cs.CV 57%

Hierarchical Action Learning for Weakly-Supervised Action Segmentation

分层动作学习用于弱监督动作分割

Junxian Huang, Ruichu Cai, Hao Zhu, Juntao Fang, Boyan Xu, Weilin Chen, Zijian Li, Shenghua Gao

机构 * Guangdong University of Technology(广东技术大学) Carnegie Mellon University(卡内基梅隆大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Hong Kong(香港大学)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

AI总结 HAL模型通过分层因果数据生成和稀疏转换约束,提升弱监督动作分割的识别能力。

Journal ref CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15922 2026-02-19 cs.RO cs.CV cs.LG 57%

World Action Models are Zero-shot Policies

世界动作模型是零样本策略

Seonghyeon Ye, Yunhao Ge, Kaiyuan Zheng, Shenyuan Gao, Sihyun Yu, George Kurian, Suneel Indupuru, You Liang Tan, Chuning Zhu, Jiannan Xiang, Ayaan Malik, Kyungmin Lee, William Liang, Nadun Ranawaka, Jiasheng Gu, Yinzhen Xu, Guanzhi Wang, Fengyuan Hu, Avnish Narayan, Johan Bjorck, Jing Wang, Gwanghyun Kim, Dantong Niu, Ruijie Zheng, Yuqi Xie, Jimmy Wu, Qi Wang, Ryan Julian, Danfei Xu, Yilun Du, Yevgen Chebotar, Scott Reed, Jan Kautz, Yuke Zhu, Linxi "Jim" Fan, Joel Jang

机构 * NVIDIA

专题命中 动作与事件理解 :video diffusion(abstract);分类 cs.CV

AI总结 DreamZero通过世界动作模型实现零样本策略,有效提升机器人在新任务和环境中的泛化能力,同时支持跨身体转移和少样本适应。

Comments Project page: https://dreamzero0.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09146 2026-02-11 cs.CV 57%

SemanticMoments: Training-Free Motion Similarity via Third Moment Features

语义时刻:通过第三时刻特征实现免训练的运动相似性

Saar Huberman, Kfir Goldberg, Or Patashnik, Sagie Benaim, Ron Mokady

机构 * BRIA AI(BRIA人工智能研究中心) Tel Aviv University(特拉维夫大学) Hebrew University of Jerusalem(耶路撒冷希伯来大学)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

AI总结 SemanticMoments通过计算语义特征的高阶矩,无需训练即可提升基于运动的视频理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21797 2026-02-11 cs.CV 57%

MoWM: Mixture-of-World-Models for Embodied Planning via Latent-to-Pixel Feature Modulation

MoWM: 通过潜在到像素特征调制的混合世界模型实现具身规划

Yangcheng Yu, Xin Jin, Yu Shang, Xin Zhang, Haisheng Su, Wei Wu, Yong Li

机构 * Tsinghua University(清华大学) Manifold AI Shanghai Jiao Tong University(上海交通大学)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 MoWM通过融合潜在世界模型与像素特征,提升具身规划中动作解码的精度与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07498 2026-02-10 cs.CV 57%

IM-Animation: An Implicit Motion Representation for Identity-decoupled Character Animation

IM-Animation: 一种隐式运动表示用于身份解耦的角色动画

Zhufeng Xu, Xuan Gao, Feng-Lin Liu, Haoxian Zhang, Zhixue Fang, Yu-Kun Lai, Xiaoqiang Liu, Pengfei Wan, Lin Gao

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Kling Team, Kuaishou Technology(快手技术 Kling 团队) Cardiff University(卡迪夫大学)

专题命中 动作与事件理解 :video diffusion(abstract);分类 cs.CV

AI总结 IM-Animation通过隐式运动表示和时间一致的遮罩令牌重定向模块,实现身份解耦的角色动画生成,提升动画质量和训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22039 2026-01-30 cs.CV 57%

Understanding Multimodal Complementarity for Single-Frame Action Anticipation

理解单帧动作预测中的多模态互补性

Manuel Benavent-Lledo, Konstantinos Bacharidis, Konstantinos Papoutsakis, Antonis Argyros, Jose Garcia-Rodriguez

机构 * Department of Computer Technology, University of Alicante(阿尔瓦雷斯大学计算机技术系) Institute of Computer Science, FORTH(福蒂研究所) Computer Science Department, University of Crete(克里特大学计算机科学系) Department of Management, Science and Technology, Hellenic Mediterranean University(希腊地中海大学管理、科学与技术系)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

AI总结 本研究通过单帧动作预测框架AAG+,探索多模态互补性对动作预测的影响,验证单帧信息在动作预测中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20504 2026-01-29 cs.CV 57%

Latent Temporal Discrepancy as Motion Prior: A Loss-Weighting Strategy for Dynamic Fidelity in T2V

潜在时间差异作为运动先验:一种用于动态保真的损失加权策略

Meiqi Wu, Bingze Song, Ruimin Lin, Chen Zhu, Xiaokun Feng, Jiahong Wu, Xiangxiang Chu, Kaiqi Huang

机构 * University of Chinese Academy of Sciences(中国科学院大学) AMAP, Alibaba Group(阿里云实验室) Southeast University(东南大学) CRISE, Institute of Automation Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 本文提出了一种基于潜在时间差异的损失加权策略,用于提升动态保真度,通过引入运动先验来优化模型训练,从而在运动视频生成任务中取得显著性能提升。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.11551 2026-01-23 cs.CV cs.IR cs.LG 57%

Multi-event Video-Text Retrieval

多事件视频-文本检索

Gengyuan Zhang, Jisen Ren, Jindong Gu, Volker Tresp

机构 * LMU Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心) University of Oxford(牛津大学)

专题命中 动作与事件理解 :text-to-video(abstract);分类 cs.CV

AI总结 本文提出多事件视频-文本检索任务,设计Me-Retriever模型,通过关键事件表示和新损失函数提升视频-文本检索性能。

Comments [fixed typos in equations] accepted to ICCV2023 Poster; some figures are not supported when viewed online, please download the file and view locally

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14086 2026-01-21 cs.CV cs.AI cs.LG 57%

Two-Stream temporal transformer for video action classification

双流时间转换器用于视频动作分类

Nattapong Kurpukdee, Adrian G. Bors

机构 * Department of Computer Science, University of York, York YO10 5GH, UK(约克大学计算机科学系)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出双流时间转换器模型,通过提取时空信息和光流特征,实现视频动作的高效分类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10592 2026-01-16 cs.CV 57%

Action100M: A Large-scale Video Action Dataset

Action100M:一个大规模视频动作数据集

Delong Chen, Tejaswi Kasarla, Yejin Bang, Mustafa Shukor, Willy Chung, Jade Yu, Allen Bolourchi, Theo Moutakanni, Pascale Fung

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

AI总结 Action100M通过自动化流程生成大规模视频动作数据集,用于提升视频理解和世界建模的可扩展研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09452 2026-01-15 cs.CV 57%

MAD: Motion Appearance Decoupling for efficient Driving World Models

MAD:用于高效驾驶世界模型的运动外观解耦

Ahmad Rahimi, Valentin Gerard, Eloi Zablocki, Matthieu Cord, Alexandre Alahi

机构 * Sorbonne Université(索邦大学)

专题命中 动作与事件理解 :video diffusion(abstract);分类 cs.CV

AI总结 MAD通过解耦运动学习与外观合成,高效地将通用视频扩散模型转化为可控的驾驶世界模型,实现低计算成本和高性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23649 2026-01-06 cs.RO cs.CV 57%

RoboMirror: Understand Before You Imitate for Video to Humanoid Locomotion

RoboMirror: 在模仿之前理解以实现视频到仿人运动

Zhe Li, Cheng Chi, Boan Zhu, Yangyang Wei, Shuanghao Bai, Yuheng Ji, Yibo Peng, Tao Huang, Pengwei Wang, Zhongyuan Wang, S. -H. Gary Chan, Chang Xu, Shanghang Zhang

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

AI总结 RoboMirror通过视觉语言模型将视频提炼为视觉运动意图,直接生成物理合理的仿人运动,无需姿态重建,实现远程存在并提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00504 2026-01-05 cs.CV cs.AI cs.GR 57%

MotionPhysics: Learnable Motion Distillation for Text-Guided Simulation

MotionPhysics: 通过自然语言引导的模拟学习可学习的运动蒸馏

Miaowei Wang, Jakub Zadrożny, Oisin Mac Aodha, Amir Vaxman

专题命中 动作与事件理解 :video diffusion(abstract);分类 cs.CV

AI总结 MotionPhysics通过自然语言引导模拟,利用可学习的运动蒸馏损失实现对3D物体物理参数的自动学习,提升动态模拟的逼真度和效率。

Comments AAAI2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24323 2026-01-01 cs.CV 57%

Robust Egocentric Referring Video Object Segmentation via Dual-Modal Causal Intervention

通过双模态因果干预实现鲁棒的自我参照视频目标分割

Haijing Liu, Zhiyuan Song, Hefeng Wu, Tao Pu, Keze Wang, Liang Lin

机构 * Sun Yat-sen University(中山大学)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

AI总结 CERES通过双模态因果干预方法,在自我参照视频中实现鲁棒的目标分割,提升对快速运动和遮挡的鲁棒性。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05822 2025-12-30 cs.CV 57%

Video Event Reasoning and Prediction by Fusing World Knowledge from LLMs with Vision Foundation Models

通过融合来自LLM的世界知识与视觉基础模型进行视频事件推理与预测

L'ea Dubois, Klaus Schmidt, Chengyu Wang, Ji-Hoon Park, Lin Wang, Santiago Munoz

机构 * INRIA(法国国家信息与自动化研究所) Max Planck Institute for Intelligent Systems(人工智能研究所) San Francisco State University(旧金山州立大学) Seoul AI Institute (SAII)(首尔人工智能研究所) Vision & Robotics Center, Tsinghua University(清华大学视觉与机器人中心) Polytechnic University of Madrid(马德里理工大学)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出融合视觉基础模型与LLM的世界知识,以提升视频事件推理与预测能力,实现从简单识别到高级认知理解的突破。

Comments 22 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏