arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 646 信号源:cs.CV, eess.IV, cs.MM

1. 长视频与时序推理 646 篇

2512.00891 2026-02-12 cs.CV 57%

Accelerating Streaming Video Large Language Models via Hierarchical Token Compression

通过分层令牌压缩加速流式视频大型语言模型

Yiyu Wang, Xuyang Liu, Xiyan Gui, Xinying Lin, Boxue Yang, Chenfei Liao, Tailai Chen, Linfeng Zhang

机构 * EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) Sichuan University(四川大学) Huazhong University of Science and Technology(华中科技大学) Sun Yat-sen University(中山大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.CV

AI总结 STC通过分层令牌压缩技术,显著降低流式视频大语言模型的处理延迟,同时保持高精度。

Comments Code is avaliable at \url{https://github.com/lern-to-write/STC}

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09816 2026-02-11 cs.CV 57%

CompSplat: Compression-aware 3D Gaussian Splatting for Real-world Video

CompSplat: 为真实世界视频设计的压缩感知3D高斯点散布

Hojun Song, Heejung Choi, Aro Kim, Chae-yeong Song, Gahyeon Kim, Soo Ye Kim, Jaehyup Lee, Sang-hyo Park

机构 * Kyungpook National University(Kyungpook国立大学) Adobe Research(Adobe研究院)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 CompSplat是一种针对真实世界视频压缩感知的3D高斯点散布框架,通过建模帧级压缩特性来减少帧间不一致性和累积几何误差,实现了在高压缩条件下更高质量的视角合成。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09022 2026-02-10 cs.CV 57%

WorldCompass: Reinforcement Learning for Long-Horizon World Models

WorldCompass:用于长周期世界模型的强化学习

Zehan Wang, Tengfei Wang, Haiyu Zhang, Xuhui Zuo, Junta Wu, Haoyuan Wang, Wenqiang Sun, Zhenwei Wang, Chenjie Cao, Hengshuang Zhao, Chunchao Guo, Zhou Zhao

机构 * Zhejiang University(浙江大学) Tencent Hunyuan(腾讯混元) The University of Hong Kong(香港大学)

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

AI总结 WorldCompass通过三种创新提升长周期世界模型的交互准确性和视觉保真度。

Comments Project page: \url{https://3d-models.hunyuan.tencent.com/world/}

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20540 2026-01-29 cs.CV 57%

Advancing Open-source World Models

推进开源世界模型

Robbyant Team, Zelin Gao, Qiuyu Wang, Yanhong Zeng, Jiapeng Zhu, Ka Leong Cheng, Yixuan Li, Hanlin Wang, Yinghao Xu, Shuailei Ma, Yihang Chen, Jie Liu, Yansong Cheng, Yao Yao, Jiayi Zhu, Yihao Meng, Kecheng Zheng, Qingyan Bai, Jingye Chen, Zehong Shen, Yue Yu, Xing Zhu, Yujun Shen, Hao Ouyang

机构 * Robbyant Team(Robbyant 团队)

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

AI总结 LingBot-World是一个开源世界模拟器,具备高保真度、长期记忆和实时交互能力,旨在推动内容创作、游戏和机器人学习等领域的应用。

Comments Project page: https://technology.robbyant.com/lingbot-world; Code: https://github.com/robbyant/lingbot-world

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09098 2026-01-21 cs.CV 57%

Causal-Ex: Causal Graph-based Micro and Macro Expression Spotting

Causal-Ex: 基于因果图的微表情和宏观表情定位

Pei-Sze Tan, Sailaja Rajanala, Arghya Pal, Raphaël C. -W. Phan, Huey-Fang Ong

机构 * CyPhi AI Lab, Monash University, Malaysia campus(CyPhi AI实验室,墨尔本大学,马来西亚校区)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 Causal-Ex通过构建面部动作单元的因果图,有效消除训练中的偏见,提升情绪定位的F1分数。

Comments 7 pages, 6 figures. The paper is under consideration at Pattern Recognition Letters

Journal ref Pattern Recognition Letters 200, 52--59 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10323 2026-01-16 cs.CV cs.CL 57%

ROMA: Real-time Omni-Multimodal Assistant with Interactive Streaming Understanding

ROMA: 实时多模态助手与交互式流式理解

Xueyun Tian, Wei Li, Bingbing Xu, Heng Dong, Yuanzhuo Wang, Huawei Shen

机构 * CAS Key Laboratory of AI Safety, Institute of Computing Technology, CAS, Beijing, China(中国科学院人工智能安全重点实验室,计算技术研究所,中国科学院,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) Tsinghua University, Beijing, China(清华大学,北京,中国)

专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.CV

AI总结 ROMA通过实时多模态处理和交互式流式理解,实现统一的反应性和主动性交互,展现强大的多模态处理能力。

Comments Our project page is available at https://eureka-maggie.github.io/ROMA_show

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09350 2026-01-15 cs.CV 57%

See More, Store Less: Memory-Efficient Resolution for Video Moment Retrieval

看清更多,存储更少:视频时刻检索的内存高效解决方案

Mingyu Jeon, Sungjin Han, Jinkwon Hwang, Minchol Kwon, Jonghee Kim, Junyeong Kim

机构 * Department of Artificial Intelligence, Chung-Ang University(人工智能系, Chung-Ang 大学) Electronics and Telecommunications Research Institute (ETRI)(电子与电信研究院)

专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.CV

AI总结 SMORE通过查询引导的描述和自适应压缩技术,在视频时刻检索中实现高信息分辨率与内存效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12646 2026-01-14 cs.CV 57%

Reconstruct, Inpaint, Test-Time Finetune: Dynamic Novel-view Synthesis from Monocular Videos

重建、修复、测试时微调:从单目视频动态生成新视角

Kaihua Chen, Tarasha Khurana, Deva Ramanan

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 长视频与时序推理 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出CogNVS模型,通过自监督学习和测试时微调,实现从单目视频动态场景生成新视角的高效方法。

Comments NeurIPS 2025. Project page: https://cog-nvs.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01192 2026-01-06 cs.CV 57%

Crowded Video Individual Counting Informed by Social Grouping and Spatial-Temporal Displacement Priors

受社交分组和时空位移先验信息启发的拥挤视频个体计数

Hao Lu, Xuhui Zhu, Wenjing Zhang, Yanan Li, Xiang Bai

机构 * State Key Laboratory of Multispectral Information Intelligent Processing Technology(多谱信息智能处理技术国家重点实验室;人工智能与自动化学院,华中科技大学) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(湖北省智能机器人重点实验室;计算机科学与工程人工智能学院,武汉理工大学) Hubei Key Laboratory of Intelligent Robot(软件工程学院,华中科技大学) School of Computer Science & Engineering Artificial Intelligence, Wuhan Institute of Technology School of Software Engineering, Huazhong University of Science and Technology

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 本文提出OMAN++方法,通过引入社交分组和时空位移先验信息,提升拥挤场景下视频个体计数的准确性。

Comments Journal Extension of arXiv:2506.13067

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00051 2026-01-05 cs.CV 57%

TeleWorld: Towards Dynamic Multimodal Synthesis with a 4D World Model

TeleWorld:面向动态多模态合成的4D世界模型

Yabo Chen, Yuanzhi Liang, Jiepeng Wang, Tingxi Chen, Junfei Cheng, Zixiao Gu, Yuyang Huang, Zicheng Jiang, Wei Li, Tian Li, Weichen Li, Zuoxin Li, Guangce Liu, Jialun Liu, Junqi Liu, Haoyuan Wang, Qizhen Weng, Xuan'er Wu, Xunzhi Xiang, Xiaoyan Yang, Xin Zhang, Shiwen Zhang, Junyu Zhou, Chengcheng Zhou, Haibin Huang, Chi Zhang, Xuelong Li

机构 * TeleWorld Team(TeleWorld团队)

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

AI总结 TeleWorld提出了一种实时多模态4D世界建模框架,通过生成-重建-引导范式实现动态场景重建与长期记忆,提升世界模型的交互性和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.25075 2026-01-01 cs.CV cs.AI cs.RO 57%

SpaceTimePilot: Generative Rendering of Dynamic Scenes Across Space and Time

SpaceTimePilot: 动态场景在时空上的生成渲染

Zhening Huang, Hyeonho Jeong, Xuelin Chen, Yulia Gryaditskaya, Tuanfeng Y. Wang, Joan Lasenby, Chun-Hao Huang

机构 * University of Cambridge(剑桥大学) Adobe Research(Adobe研究院)

专题命中 长视频与时序推理 :video diffusion(abstract);分类 cs.CV

AI总结 SpaceTimePilot通过解耦空间和时间实现动态场景的可控生成渲染,结合时序扭曲训练和CamxTime数据集提升时间控制精度。

Comments Project page: https://zheninghuang.github.io/Space-Time-Pilot/ Code: https://github.com/ZheningHuang/spacetimepilot

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18113 2026-01-01 cs.CV 57%

Chrono: A Simple Blueprint for Representing Time in MLLMs

Chrono: 一种用于多模态大语言模型中表示时间的简单蓝图

Hector Rodriguez, Boris Meinardus, Anil Batra, Anna Rohrbach, Marcus Rohrbach

专题命中 长视频与时序推理 :video-language(abstract);分类 cs.CV

AI总结 Chrono提出了一种简单通用的序列蓝图,用于提升多模态大语言模型在视频时间定位和 grounded 视频问答任务中的性能。

Comments Code: https://github.com/sudo-Boris/mr-Blip. Submitted to IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI). Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16397 2025-12-19 cs.CV cs.AI cs.GR 57%

Using Gaussian Splats to Create High-Fidelity Facial Geometry and Texture

利用高斯散点创建高质量的面部几何和纹理

Haodi He, Jihun Yu, Ronald Fedkiw

机构 * Epic Games, Stanford University(Epic Games、斯坦福大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 本文提出利用高斯散点重建高质量面部几何与纹理,通过约束三角化表面并解耦纹理与光照,实现高保真视觉效果。

Comments Submitted to CVPR 2026. 21 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14284 2025-12-17 cs.CV 57%

SS4D: Native 4D Generative Model via Structured Spacetime Latents

SS4D:通过结构化时空潜在变量实现的原生4D生成模型

Zhibing Li, Mengchen Zhang, Tong Wu, Jing Tan, Jiaqi Wang, Dahua Lin

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai AI Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) Stanford University(斯坦福大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 SS4D通过结构化时空潜在变量实现原生4D生成模型,直接从单目视频合成动态3D物体,提升时间一致性和结构一致性。

Comments ToG(Siggraph Asia 2025)

Journal ref ACM Transactions on Graphics, 44(6): Article 244, 12 pages, December 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01826 2025-12-11 cs.CV 57%

RELOCATE: A Simple Training-Free Baseline for Visual Query Localization Using Region-Based Representations

RELOCATE:一种用于基于区域的视觉查询定位的简单无训练基线

Savya Khosla, Sethuraman T, Alexander Schwing, Derek Hoiem

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 RELOCATE通过基于区域的表示和双向跟踪实现长视频中视觉查询定位,无需训练并在Ego4D数据集上取得49%的精度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03534 2025-12-04 cs.CV cs.AI 57%

Rethinking Prompt Design for Inference-time Scaling in Text-to-Visual Generation

重新思考推理时的提示设计以实现文本到视觉生成的扩展

Subin Kim, Sangwoo Mo, Mamshad Nayeem Rizve, Yiran Xu, Difan Liu, Jinwoo Shin, Tobias Hinz

专题命中 长视频与时序推理 :text-to-video(abstract);分类 cs.CV

AI总结 PRIS通过自适应修改提示以实现文本到视觉生成的推理时扩展,提高生成质量并解决提示固定导致的质量停滞问题。

Comments Visualizations are available at the website: https://subin-kim-cv.github.io/PRIS

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08015 2025-12-02 cs.CV 57%

4DGT: Learning a 4D Gaussian Transformer Using Real-World Monocular Videos

4DGT: 基于4D高斯变换器的学习用于动态场景重建

Zhen Xu, Zhengqin Li, Zhao Dong, Xiaowei Zhou, Richard Newcombe, Zhaoyang Lv

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 4DGT通过基于4D高斯的变换器模型,在真实世界单目视频上实现高效动态场景重建,显著提升重建速度并优于现有方法。

Comments NeurIPS 2025 (Spotlight); Project Page: https://4dgt.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16901 2025-12-01 cs.CV 57%

R-AVST: Empowering Video-LLMs with Fine-Grained Spatio-Temporal Reasoning in Complex Audio-Visual Scenarios

R-AVST:通过细粒度时空推理增强视频大语言模型以应对复杂音频视觉场景

Lu Zhu, Tiantian Geng, Yangye Chen, Teng Wang, Ping Lu, Feng Zheng

专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.CV

AI总结 R-AVST通过细粒度时空推理提升视频大语言模型,构建首个真实世界音频视觉时空推理数据集,并提出AVST-Zero模型增强推理能力。

Comments Accepted by AAAI 2026. Project page: https://github.com/zhlllau/R-AVST

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10510 2025-11-25 cs.NI cs.AI cs.HC cs.MM 57%

Chat with AI: The Surprising Turn of Real-time Video Communication from Human to AI

与AI聊天:从人类到AI的实时视频通信惊人转变

Jiangkai Wu, Zhiyuan Ren, Liming Liu, Xinggong Zhang

机构 * Peking University(北京大学)

专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.MM

AI总结 本文提出了一种面向AI的实时视频通信方法,通过上下文感知视频流技术降低延迟并提升AI理解视频的准确性。

Comments 9 pages, 10 figures, Proceedings of the 24th ACM Workshop on Hot Topics in Networks (HotNets 2025), College Park, Maryland, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17932 2025-11-25 cs.CV cs.GR 57%

Novel View Synthesis from A Few Glimpses via Test-Time Natural Video Completion

通过测试时自然视频补全实现从少量视角合成新视角

Yan Xu, Yixing Wang, Stella X. Yu

专题命中 长视频与时序推理 :video diffusion(abstract);分类 cs.CV

AI总结 通过测试时自然视频补全方法,从少量视角生成高质量新视角,无需场景特定训练,有效提升稀疏输入下的场景重建与视角生成质量。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10866 2025-11-17 cs.CV cs.AI 57%

Short-Window Sliding Learning for Real-Time Violence Detection via LLM-based Auto-Labeling

Seoik Jung, Taekyung Song, Yangro Lee, Sungjun Lee

机构 * PIA-SPACE Inc.(PIA-SPACE公司)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

Comments 5 pages, 2 figures. Accepted paper for the IEIE (Institute of Electronics and Information Engineers) Fall Conference 2025. Presentation on Nov 27, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24838 2025-11-11 cs.CV cs.AI 57%

VideoCAD: A Dataset and Model for Learning Long-Horizon 3D CAD UI Interactions from Video

Brandon Man, Ghadi Nehme, Md Ferdous Alam, Faez Ahmed

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03929 2025-11-10 cs.LG cs.AI cs.CV 57%

NVIDIA Nemotron Nano V2 VL

NVIDIA, :, Amala Sanjay Deshmukh, Kateryna Chumachenko, Tuomas Rintamaki, Matthieu Le, Tyler Poon, Danial Mohseni Taheri, Ilia Karmanov, Guilin Liu, Jarno Seppanen, Guo Chen, Karan Sapra, Zhiding Yu, Adi Renduchintala, Charles Wang, Peter Jin, Arushi Goel, Mike Ranzinger, Lukas Voegtle, Philipp Fischer, Timo Roman, Wei Ping, Boxin Wang, Zhuolin Yang, Nayeon Lee, Shaokun Zhang, Fuxiao Liu, Zhiqi Li, Di Zhang, Greg Heinrich, Hongxu Yin, Song Han, Pavlo Molchanov, Parth Mannan, Yao Xu, Jane Polak Scowcroft, Tom Balough, Subhashree Radhakrishnan, Paris Zhang, Sean Cha, Ratnesh Kumar, Zaid Pervaiz Bhat, Jian Zhang, Darragh Hanley, Pritam Biswas, Jesse Oliver, Kevin Vasques, Roger Waleffe, Duncan Riach, Oluwatobi Olabiyi, Ameya Sunil Mahabaleshwarkar, Bilal Kartal, Pritam Gundecha, Khanh Nguyen, Alexandre Milesi, Eugene Khvedchenia, Ran Zilberstein, Ofri Masad, Natan Bagrov, Nave Assaf, Tomer Asida, Daniel Afrimi, Amit Zuker, Netanel Haber, Zhiyu Cheng, Jingyu Xin, Di Wu, Nik Spirin, Maryam Moosaei, Roman Ageev, Vanshil Atul Shah, Yuting Wu, Daniel Korzekwa, Unnikrishnan Kizhakkemadam Sreekumar, Wanli Jiang, Padmavathy Subramanian, Alejandra Rico, Sandip Bhaskar, Saeid Motiian, Kedi Wu, Annie Surla, Chia-Chih Chen, Hayden Wolff, Matthew Feinberg, Melissa Corpuz, Marek Wawrzos, Eileen Long, Aastha Jhunjhunwala, Paul Hendricks, Farzan Memarian, Benika Hall, Xin-Yu Wang, David Mosallanezhad, Soumye Singhal, Luis Vega, Katherine Cheung, Krzysztof Pawelec, Michael Evans, Katherine Luna, Jie Lou, Erick Galinkin, Akshay Hazare, Kaustubh Purandare, Ann Guan, Anna Warno, Chen Cui, Yoshi Suhara, Shibani Likhite, Seph Mard, Meredith Price, Laya Sleiman, Saori Kaji, Udi Karpas, Kari Briski, Joey Conway, Michael Lightstone, Jan Kautz, Mohammad Shoeybi, Mostofa Patwary, Jonathen Cohen, Oleksii Kuchaiev, Andrew Tao, Bryan Catanzaro

机构 * NVIDIA

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04670 2025-11-07 cs.CV 57%

Cambrian-S: Towards Spatial Supersensing in Video

Shusheng Yang, Jihan Yang, Pinzhi Huang, Ellis Brown, Zihao Yang, Yue Yu, Shengbang Tong, Zihan Zheng, Yifan Xu, Muhan Wang, Daohan Lu, Rob Fergus, Yann LeCun, Li Fei-Fei, Saining Xie

机构 * New York University(纽约大学) Stanford University(斯坦福大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

Comments Website: https://cambrian-mllm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12508 2025-11-04 cs.CV cs.AI cs.RO 57%

MindJourney: Test-Time Scaling with World Models for Spatial Reasoning

Yuncong Yang, Jiageng Liu, Zheyuan Zhang, Siyuan Zhou, Reuben Tan, Jianwei Yang, Yilun Du, Chuang Gan

机构 * UMass Amherst(马萨诸塞大学阿默斯特分校) JHU(约翰·霍普金斯大学) HKUST(香港科技大学) Microsoft Research(微软研究院) Harvard(哈佛大学)

专题命中 长视频与时序推理 :video diffusion(abstract);分类 cs.CV

Comments Project Page: https://umass-embodied-agi.github.io/MindJourney

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20726 2025-10-24 cs.CV 57%

AutoScape: Geometry-Consistent Long-Horizon Scene Generation

Jiacheng Chen, Ziyu Jiang, Mingfu Liang, Bingbing Zhuang, Jong-Chyi Su, Sparsh Garg, Ying Wu, Manmohan Chandraker

机构 * NEC Labs America(NEC美国实验室) Simon Fraser University(西蒙弗雷泽大学) Northwestern University(西北大学) UC San Diego(加州大学圣地亚哥分校)

专题命中 长视频与时序推理 :video diffusion(abstract);分类 cs.CV

Comments ICCV 2025. Project page: https://auto-scape.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04290 2025-10-20 cs.CV 57%

ChronoEdit: Towards Temporal Reasoning for Image Editing and World Simulation

Jay Zhangjie Wu, Xuanchi Ren, Tianchang Shen, Tianshi Cao, Kai He, Yifan Lu, Ruiyuan Gao, Enze Xie, Shiyi Lan, Jose M. Alvarez, Jun Gao, Sanja Fidler, Zian Wang, Huan Ling

机构 * NVIDIA University of Toronto(多伦多大学)

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

Comments Project Page: https://research.nvidia.com/labs/toronto-ai/chronoedit

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09182 2025-10-13 cs.CV 57%

Online Video Depth Anything: Temporally-Consistent Depth Prediction with Low Memory Consumption

Johann-Friedrich Feiden, Tim Küchler, Denis Zavadski, Bogdan Savchynskyy, Carsten Rother

机构 * Heidelberg University(海德堡大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03198 2025-10-06 cs.CV 57%

Memory Forcing: Spatio-Temporal Memory for Consistent Scene Generation on Minecraft

Junchao Huang, Xinting Hu, Boyao Han, Shaoshuai Shi, Zhuotao Tian, Tianyu He, Li Jiang

专题命中 长视频与时序推理 :video diffusion(abstract);分类 cs.CV

Comments 19 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01183 2025-10-02 cs.CV 57%

EvoWorld: Evolving Panoramic World Generation with Explicit 3D Memory

Jiahao Wang, Luoxin Ye, TaiMing Lu, Junfei Xiao, Jiahan Zhang, Yuxiang Guo, Xijun Liu, Rama Chellappa, Cheng Peng, Alan Yuille, Jieneng Chen

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

Comments Code available at: https://github.com/JiahaoPlus/EvoWorld

详情

展开后加载摘要…

URL PDF HTML 收藏