arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 646 信号源:cs.CV, eess.IV, cs.MM

1. 长视频与时序推理 646 篇

2607.27924 2026-08-10 cs.LG cs.CV cs.RO 版本更新 57%

ODEWorld: A Continuous Predictive Architecture via Physical-Time Flow

ODEWorld:一种基于物理时间流的连续预测架构

Dongxiu Liu, Haoyi Niu, Peng Cheng, Yuan Gao, Xirui Kang, Sangli Teng, Koushil Sreenath, Xianyuan Zhan

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) Berkeley Artificial Intelligence Research (BAIR), University of California, Berkeley(加州大学伯克利分校伯克利人工智能研究院(BAIR))

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

AI总结 研究针对现有世界建模机器学习范式局限于离散时间预测的问题,提出基于PT-Flow的连续时间潜在世界模型ODEWorld,解决表示崩溃问题,在视频生成和机器人控制任务中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05631 2026-08-07 cs.CV 新提交 57%

ChronoVision: Temporal Reasoning via Latent State Reconstruction

ChronoVision:基于潜在状态重构的时序推理

Yifan Shen, Jian Xu, Boyi Li, Yuner Zhang, Tianjiao Yu, Bingxuan Li, Houze Yang, Rushi Wang, Xu Cao

专题命中 长视频与时序推理 :video reasoning(abstract);分类 cs.CV

AI总结 针对多模态大语言模型时序推理不足的问题,本文提出ChronoVision框架,引入Vbvr-VQA数据集,实验显示其在相关基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04132 2026-08-06 cs.CV 新提交 57%

RUTA: Principled Visual Token Allocation via Rate-Utility Optimization

RUTA:基于率-效用优化的原则性视觉令牌分配方法

Jian Zou, Xiaoyu Xu, Zhihua Wang, Yilin Wang, Balu Adsumilli, Kede Ma

机构 * City University of Hong Kong(香港城市大学) Google Inc.(谷歌公司)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 针对视觉语言模型因长视觉令牌序列导致的LLM侧计算和内存成本过高问题,提出RUTA方法,仅用2.0%、4.2%的视觉令牌,分别在LLaVA-NeXT-7B、Qwen3-VL-8B上保留88.2%、94.4%的任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03974 2026-08-05 cs.CV 新提交 57%

JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion

JoyAI-Video-Edit:基于自回归扩散的实时开放式视频编辑

Yicheng Xiao, Wenxun Dai, Xinran Qin, Lin Song, Maoquan Zhang, Hang Xu, Yukang Chen, Yitong Li, Guohui Zhang, Yuan Zhang, Xuying Zhang, Tommy Zhang, Jianlong Yuan, Peihao Li, Shuai Lu, Siming Fu, Chuyang Zhao, Xin Han, Jie Huang, Wenbo Li, Guoqing Ma, Wei Huang, Xiaojuan Qi, Haoyang Huang, Nan Duan

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 研究针对实时视频编辑的低延迟、时序一致等需求,提出160亿参数的JoyAI-Video-Edit自回归扩散框架,结合多种蒸馏技术,在单张Nvidia B200 GPU上实现约30 FPS的720p视频编辑,性能优于现有流式编辑器且与离线系统相当。

Comments Code: https://github.com/jd-opensource/JoyAI-Video-Edit

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02980 2026-08-05 cs.CV 新提交 57%

Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding

Qwen-3D:用于空间理解的通用三维视觉语言模型

Lucy Lin, Ayush Jain, Yifan Liu, Katerina Fragkiadaki

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 本研究提出 Qwen-3D 三维视觉语言模型,通过多视角几何线索与三维旋转位置嵌入提升空间推理,在三维任务上超越现有 3D LMM,还保持二维任务性能。

Comments Project Page: https://qwen-3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.17257 2026-08-05 cs.CV 版本更新 57%

Modeling Long-Term Memory and Temporal Attention Shifts for Video Salient Object Ranking with a New Benchmark

用于视频显著对象排序的长期记忆与时间注意力转移建模及新基准

Jiaying Lin, Rui Song, Huankang Guan, Shuanglin Li, Shuquan Ye, Rynson W. H. Lau

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 该研究针对视频显著对象排序(VSOR)缺乏长期时间建模的问题,提出LoTAS长期记忆框架及含124个视频的新数据集,通过TCD、RSSE及排序转移监督提升性能,效果优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01771 2026-08-04 cs.CV 新提交 57%

LiveLight: Real-time Streaming Video Relighting with Interactive Control

LiveLight:具备交互式控制的实时流视频重光照

Yue Ma, Jiangming Wang, Yucheng Wang, Xilai Wang, Zhiyuan Li, Xinyu Wang, Hongyu Liu, Ruofan Liang, Songchun Zhang, Yuxuan Xue, Qifeng Chen

机构 * HKUST(香港科技大学) University of Macau(澳门大学) THU(清华大学) UoT(多伦多大学) University of Tuebingen(蒂宾根大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 本研究提出首个基于扩散模型的实时流视频重光照框架LiveLight,通过三项关键设计解决三大挑战,在实时速度下达到最优重光照质量,将公开发布相关资源以推动该领域研究。

Comments Accepted by TOG 2026. Project page: https://living-lighting.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23413 2026-08-03 cs.CV 版本更新 57%

I3DM: Implicit 3D-aware Memory Retrieval and Injection for Consistent Video Scene Generation

I3DM:隐式3D-aware记忆检索与注入用于一致的视频场景生成

Jia Li, Han Yan, Yihang Chen, Siqi Li, Xibin Song, Yifu Wang, Jianfei Cai, Tien-Tsin Wong, Pan Ji

机构 * Monash University(莫纳什大学) Vertex Lab(Vertex实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

AI总结 本文提出I3DM,一种隐式3D-aware记忆机制,通过预训练FF-NVS模型的中间特征进行视图相关性评分,提升复杂遮挡下的场景一致性生成效果。

Comments Project page: https://riga2.github.io/i3dm

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28627 2026-07-31 cs.CV cs.AI cs.LG 新提交 57%

ReToken: One Token to Improve Vision-Language Models for Visual Retrieval

ReToken:用一个标记改进用于视觉检索的视觉-语言模型

Yao Xiao, Reuben Tan, Zhen Zhu, Yuqun Wu, Jianfeng Gao, Derek Hoiem

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft Research(微软研究院) Google DeepMind(谷歌DeepMind)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 该研究提出轻量级ReToken,通过选择视觉键值缓存中与查询相关的稀疏标记解决长视觉上下文的视觉检索难题,在多基准测试中提升Qwen3VL-8B等模型性能,且可在单H100运行。

Comments Code: https://github.com/avaxiao/ReToken

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25537 2026-07-29 cs.CV cs.AI 新提交 57%

Visual prompt engineering for video models

视频模型的视觉提示工程

Robert Geirhos, Yuxuan Li, Thaddäus Wiedemer, Neha Kalibhat, Zi Wang, Mani Malek, Oyvind Tafjord, Kevin Swersky, Been Kim, Priyank Jaini

专题命中 长视频与时序推理 :video reasoning(abstract);分类 cs.CV

AI总结 研究视频模型能否从视觉提示工程中受益,通过自动修改任务图像提升性能,如视觉物理推理任务。发现视觉提示工程(VIPE)能提高视频推理性能,比传统方法更有效,为提升视频模型视觉推理性能提供简单高效途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24359 2026-07-28 cs.CV 新提交 57%

TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation

TaoMate:用于实时音频-视频数字人生成的锚点引导内存桥接演化和参考状态

Qijun Gan, Chenwei Zhang, Meiguang Jin, Junfeng Ma, Qiu Shen

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

AI总结 研究实时长格式数字人生成问题,提出TaoMate框架,通过锚点引导、内存桥接等方法,在保持稳定外观和视听同步下,实现少步联合音频-视频生成,且能跨块并行执行加速自回归推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13460 2026-07-16 cs.CV 新提交 57%

LPM: Industrial-Scale Generative Video Restoration

LPM:工业规模的生成式视频修复

Bichuan Zhu, Fulin Li, Jiachao Gong, Jinhua Hao, Kai Zhao, Kun Yuan, Pengcheng Xu, Qiang Wang, Qiao Mo, Yanlong Yuan, Yizhen Shao, Yuxiao Hu, Zixi Tuo, Ming Sun, Chao Zhou, Bin Chen, Bin Yu

机构 * Kuaishou Technology(快手科技)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 研究提出工业规模的LPM用于视频修复,通过统一系统解决UGC退化问题,含数据工程、模型训练和推理。其架构等机制实现高保真修复,已在快手生产应用,节省带宽成本,还能集成产品,证明该方法实用、可扩展且具成本效益。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12592 2026-07-15 cs.CV 新提交 57%

WanToFight: Real-Time Generative Game Engine for Multi-Player Combat Interaction

WanToFight:用于多人战斗交互的实时生成游戏引擎

Li Hu, Guangyuan Wang, Peng Zhang, Bang Zhang

机构 * Alibaba Tongyi Lab(阿里巴巴通义实验室)

专题命中 长视频与时序推理 :video diffusion(abstract);分类 cs.CV

AI总结 WanToFight是用于多人战斗交互的实时生成游戏引擎,基于Wan-1.3B视频扩散变换器构建三个组件,解决了先前引擎未共同处理的问题,能结合多种玩法,在特定配置下维持30FPS,是首个此类集成系统。

Comments Project Page: https://humanaigc.github.io/wantofight/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11798 2026-07-14 cs.CV cs.AI 新提交 57%

StoryTeller: Training-Free Narrative Grounding for Long-Form Audio Description

StoryTeller:用于长格式音频描述的免训练叙事接地

Seung Hyun Hahm, Minh T. Dinh, SouYoung Jin

机构 * Dartmouth College(达特茅斯学院)

专题命中 长视频与时序推理 :video-language(abstract);分类 cs.CV

AI总结 研究针对长格式音频描述问题,提出免训练的StoryTeller框架。它通过维护叙事记忆跨场景传递信息,仅用原始视频和标题,经语义过滤等确保信息准确。引入StoryAD-QA基准测试,实验证明该框架显著提升了叙事相关能力。

Comments Accepted to the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11078 2026-07-14 cs.CV cs.AI 新提交 57%

Do Video-LLMs Actually Watch? Diagnosing Character-Tracking Failures in Long-Form Video

视频语言模型真的在观看吗?诊断长视频中的角色跟踪失败

Mohammad Al-Ratrout, Shayla Sharmin, Aditya Raikwar, Roghayeh Leila Barmaki

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 研究视频语言模型在长视频中跟踪角色的能力,通过九条件诊断协议测试三个开源模型及Gemini,发现模型准确性非来自角色跟踪,存在性别线索利用问题,还发布诊断工具包揭示基准分数衡量的实际情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22226 2026-07-14 cs.CV 版本更新 57%

Towards Temporal Compositional Reasoning in Long-Form Sports Videos

长期体育视频中的时间组成推理方法

Siyu Cao, Lu Zhang, Ruizhe Zeng, Zhi-yong Liu

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS)

专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.CV

AI总结 本文提出SportsTime基准和CoTR方法,通过时间接地证据组成提升体育视频长期推理能力,优于现有多模态大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05240 2026-07-10 cs.RO cs.CV 版本更新 57%

StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling

StreamVLN:通过快慢上下文建模实现流式视觉与语言导航

Meng Wei, Chenyang Wan, Xiqian Yu, Tai Wang, Yuqiang Yang, Xiaohan Mao, Chenming Zhu, Wenzhe Cai, Hanqing Wang, Yilun Chen, Xihui Liu, Jiangmiao Pang

机构 * Shanghai AI Lab(上海人工智能实验室) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 研究现实世界中视觉与语言导航问题,提出StreamVLN框架,采用混合快慢上下文建模策略,通过快速流式对话上下文与缓慢更新内存上下文配合,实现实时对话,在VLN-CE基准实验中展现低延迟最优性能。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17649 2026-07-08 cs.CV cs.AI cs.RO 版本更新 57%

SWITCH: Benchmarking Modeling and Handling of Tangible Interfaces in Long-horizon Embodied Scenarios

SWITCH:在长时程具身场景中评估和处理具象接口的基准测试

Juntao Cheng, Wanyue Zhang, Zhiwei Yu, Shuo Ren, Zheqi He, Shaoxuan Xie, Guocai Yao, Jieru Lin, Börje F. Karlsson, Jiajun Zhang

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

AI总结 SWITCH基准测试通过1170个时间交互视频,评估具象接口在真实第一人称环境中的闭环交互推理,揭示多模态模型在细粒度视觉-时间感知、结果验证和错误恢复方面的不足。

Comments The dataset is available at https://huggingface.co/datasets/BAAI-Agents/SWITCH

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27318 2026-07-07 cs.CV 版本更新 57%

Q-GeoMem: Question-Guided Geometric Memory for Video Spatial Reasoning

Q-GeoMem:面向视频空间推理的问题引导几何记忆

Xianqiang Gao, Qizhi Chen, Delin Qu, Haoming Song, Zhigang Wang, Bin Zhao, Dong Wang, Xuelong Li

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Lab(上海人工智能实验室) Northwestern Polytechnical University(西北工业大学) TeleAI

专题命中 长视频与时序推理 :video-language(abstract);分类 cs.CV

AI总结 提出Q-GeoMem框架,通过问题引导的几何记忆机制,结合细粒度上下文库和语义几何证据库,在视频空间推理任务中实现最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00375 2026-07-02 cs.CV 新提交 57%

LIST3R: Long-sequence Instance-aware 3D Reconstruction

LIST3R: 长序列实例感知三维重建

Jing Gao, Wei Wang, Feiran Wang, Yan Yan

机构 * Beijing Jiaotong University(北京交通大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 提出LIST3R框架,通过实例锚点组织长序列三维重建,将子序列局部观测整合为全局一致场景,在长序列基准上实现更优轨迹与重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23294 2026-06-30 cs.CV 57%

Towards Long-Form Spatio-Temporal Video Grounding

面向长形式时空视频定位

Xin Gu, Bing Fan, Jiali Yao, Zhipeng Zhang, Yan Huang, Cheng Han, Heng Fan, Libo Zhang

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 本文提出ART-STVG方法,针对长时视频中的目标定位问题,通过自回归Transformer架构和记忆银行设计,提升对长视频中时空信息的处理能力,实验表明其在长形式STVG任务中优于现有方法。

Comments 22 pages, 11 figures. Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22960 2026-06-30 cs.CV 57%

UCM: Unified Modeling of Camera Control and Memory with Time-aware Positional Encoding Warping for World Models

UCM:基于时间感知位置编码变形的相机控制与内存统一建模

Tianxing Xu, Zixuan Wang, Guangyuan Wang, Li Hu, Zhongyi Zhang, Peng Zhang, Bang Zhang, Songhai Zhang

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

AI总结 UCM通过时间感知位置编码变形机制实现相机控制与长期记忆的统一建模,在真实和合成基准测试中显著提升场景一致性并实现高保真视频生成的精确控制。

Comments Project Page: https://humanaigc.github.io/ucm-webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15632 2026-06-18 cs.CV 新提交 57%

Open-World Video Segmentation

开放世界视频分割

Qing Su, Kaiyang Li, Yuan Zhuang, Fei Miao, Shihao Ji

机构 * University of Connecticut(康涅狄格大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 提出Savvy系统,结合分层掩码发现、延迟接纳和轨迹整合,实现零样本开放世界长时视频分割;并设计粒度感知评估套件OGA,采用n:1匹配协议,解决传统1:1匹配对开放世界方法的不公平惩罚问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15824 2026-06-18 cs.CV 版本更新 57%

FashionChameleon: Towards Real-Time and Interactive Human-Garment Video Customization

FashionChameleon:迈向实时和交互式的人体服装视频定制

Quanjian Song, Yefeng Shen, Mengting Chen, Hao Sun, Jinsong Lan, Xiaoyong Zhu, Bo Zheng, Liujuan Cao

机构 * Xiamen University(厦门大学) Alibaba Group(阿里巴巴集团)

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

AI总结 本文提出FashionChameleon框架,通过单件服装视频数据实现交互式多服装视频定制,保留动作一致性,实现实时生成23.8FPS,比现有方法快30-180倍。

Comments Project Page: https://quanjiansong.github.io/projects/FashionChameleon/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17800 2026-06-17 cs.CV 新提交 57%

MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model

MaineCoon: 追求实时音视频社交世界模型

Lichen Bai, Tianhao Zhang, Shitong Shao, Dingwei Tan, Qiyu Zhong, Zhengpeng Xie, Haopeng Li, Qinghao Huang, Dandan Shen, Tengjiao Ji, Wei Wang, Peicheng Wu, Yuxuan Zhao, Xiangyu Zhu, Welly Luo, Shurui Yang, Zeke Xie

机构 * Catnip AI Team(Catnip AI团队)

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

AI总结 提出MaineCoon,首个22B参数的实时音视频自回归模型,支持单GPU上高达47.5 FPS的流式生成和亚秒级交互,专为社交互动应用优化,引入自重采样、跨模态对齐、领域偏好优化和强化在线策略蒸馏等技术。

Comments 32 pages, 13 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17590 2026-06-17 cs.CV 新提交 57%

TivTok: Broadcasting Time-Invariant Tokens for Scalable Video Tokenization

TivTok:广播时间不变令牌以实现可扩展视频分词

Weiliang Chen, Yuanhui Huang, Xuebo Wang, Yueqi Duan

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Department of Automation, Tsinghua University(清华大学自动化系) Kuaishou Technology(快手科技)

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

AI总结 提出TivTok,一种可重用感知的视频分词器,通过时间不变(TIV)和时间变化(TV)令牌分解视频,实现高效压缩和长视频建模,在标准基准上rFVD达12.65,压缩效率提升2.91倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08436 2026-06-12 cs.CV 新提交 57%

CACR:Reinforcing Temporal Answer Grounding in Instructional Video via Candidate-Aware Causal Reasoning

通过候选感知因果推理增强教学视频中的时间答案定位

Muge Qi, Rong Fu, Pengbin Feng, Xianda Li, Yu Cai, Yifu Guo, Shizhe Zhang, Simon James Fong, Lei Ma, Bin Li

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 提出候选感知因果推理框架,通过视觉-语言预训练候选选择和基于GRPO的时序逻辑推理,解决教学视频中复杂问题理解和长视频片段定位挑战,在六个基准上取得最优mIoU。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11576 2026-06-11 cs.CV cs.AI 新提交 57%

AVIS: Adaptive Test-Time Scaling for Vision-Language Models

AVIS: 视觉语言模型的自适应测试时缩放

Ahmadreza Jeddi, Minh Ngoc Le, Amirhossein Kazerouni, Hakki Can Karaimer, Hue Nguyen, Iqbal Mohomed, Michael Brudno, Alex Levinshtein, Konstantinos G. Derpanis, Babak Taati, Radek Grzeszczuk

机构 * AI Center-Toronto, Samsung Electronics(三星电子多伦多AI中心) University of Toronto(多伦多大学) Vector Institute(向量研究所) York University(约克大学)

专题命中 长视频与时序推理 :video reasoning(abstract);分类 cs.CV

AI总结 提出AVIS,通过轻量策略联合优化视觉上下文缩放和推理缩放,利用无训练的关键多样性剪枝和自适应自一致性,在多种基准上提升精度-计算权衡。

Comments Project page: https://avis-vlm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14614 2026-06-10 cs.CV cs.GR 版本更新 57%

WorldPlay: Towards Long-Term Geometric Consistency for Real-Time Interactive World Modeling

WorldPlay:面向实时交互式世界建模的长期几何一致性

Wenqiang Sun, Haiyu Zhang, Haoyuan Wang, Junta Wu, Zehan Wang, Zhenwei Wang, Yunhong Wang, Jun Zhang, Tengfei Wang, Chunchao Guo

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 长视频与时序推理 :video diffusion(abstract);分类 cs.CV

AI总结 提出WorldPlay流式视频扩散模型,通过双重动作表示、重构上下文记忆和上下文强制蒸馏方法,实现实时交互式世界建模并保持长期几何一致性,生成24 FPS的720p长视频。

Comments project page: https://3d-models.hunyuan.tencent.com/world/, demo: https://3d.hunyuan.tencent.com/sceneTo3D, code: https://github.com/Tencent-Hunyuan/HY-WorldPlay

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09803 2026-06-09 cs.CV cs.GR cs.LG 新提交 57%

Echo-Memory: A Controlled Study of Memory in Action World Models

Echo-Memory:动作世界模型中记忆的受控研究

Wayne King, Zeyue Xue, Yuxuan Bian, Jie Huang, Haoran Li, Yaowei Li, Yaofeng Su, Yuming Li, Haoyu Wang, Shiyi Zhang, Songchun Zhang, Yuwei Niu, Sihan Xu, Junhao Zhuang, Haoyang Huang, Nan Duan

机构 * Joy Future Academy(京东探索研究院)

专题命中 长视频与时序推理 :video diffusion(abstract);分类 cs.CV

AI总结 提出Echo-Memory框架,通过控制变量法研究动作条件世界模型中的记忆机制,发现原始上下文容量和块状状态空间递归对开放域返回任务至关重要。

Comments 9 figures and 28 pages, Code at \href{https://github.com/Echo-Team-Joy-Future-Academy-JD/Echo-Memory}{this URL}

详情

展开后加载摘要…

URL PDF HTML 收藏