arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 646 信号源:cs.CV, eess.IV, cs.MM

1. 长视频与时序推理 646 篇

2604.04184 2026-04-07 cs.CV 57%

AURA: Always-On Understanding and Real-Time Assistance via Video Streams

AURA: 通过视频流实现始终在线的理解与实时协助

Xudong Lu, Yang Bo, Jinpeng Chen, Shuhan Li, Xintong Guo, Huankang Guan, Fang Liu, Dunyuan Xu, Peiwen Sun, Heyang Sun, Rui Liu, Hongsheng Li

机构 * Huawei Research(华为研究院) CUHK MMLab(香港中文大学多媒体实验室)

专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.CV

AI总结 AURA提出一个端到端的视频流交互框架,实现视频大语言模型持续处理视频流并支持实时问答与主动响应,达到流式基准的最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01966 2026-04-03 cs.CV cs.AI cs.RO 57%

Ego-Grounding for Personalized Question-Answering in Egocentric Videos

面向第一视角视频的个性化问答中的自我定位

Junbin Xiao, Shenglang Zhang, Pengxiang Zhu, Angela Yao

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 本文提出MyEgo数据集,用于评估多模态大语言模型在需要自我定位的个性化问答中的能力,发现现有模型在自我记忆和推理方面存在显著不足。

Comments To appear at CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23043 2026-04-01 cs.CV 57%

HieraMamba: Video Temporal Grounding via Hierarchical Anchor-Mamba Pooling

HieraMamba:通过分层锚点-Mamba池化实现视频时间接地

Joungbin An, Kristen Grauman

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 HieraMamba通过分层锚点-Mamba池化结构,在长视频中实现精确的时间定位,解决了视频时间接地中的全局上下文与细粒度时间细节捕捉难题。

Comments CVPR 2026. Project Page: https://vision.cs.utexas.edu/projects/hieramamba/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28082 2026-03-31 cs.CV cs.MA 57%

LogiStory: A Logic-Aware Framework for Multi-Image Story Visualization

LogiStory: 一个多图像故事可视化逻辑感知框架

Chutian Meng, Fan Ma, Chi Zhang, Jiaxu Miao, Yi Yang, Yueting Zhuang

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

AI总结 本文提出LogiStory框架,通过显式建模视觉逻辑提升多图像故事可视化中的叙事逻辑与视觉质量,引入多智能体系统和LogicTale基准测试集进行评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11417 2026-03-31 cs.CV 57%

Robust Ego-Exo Correspondence with Long-Term Memory

具有长期记忆的鲁棒自体-外体对应

Yijun Hu, Bing Fan, Xin Gu, Haiqing Ren, Dongfang Liu, Heng Fan, Libo Zhang

机构 * University of Chinese Academy of Sciences(中国科学院大学) University of North Texas(北德克萨斯大学) Institute of Software Chinese Academy of Sciences(中国科学院软件研究所) Rochester Institute of Technology(罗切斯特理工学院)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 本文提出基于SAM 2的新型EEC框架,通过双记忆架构和自适应特征路由模块提升长期记忆能力,实现更鲁棒的自体-外体对应。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22120 2026-03-27 cs.CV 57%

StreamingClaw Technical Report

流式Claw技术报告

Jiawei Chen, Zhe Chen, Chaoqun Du, Maokui He, Wei He, Hengtao Li, Qizhen Li, Zide Liu, Hao Ma, Xuhao Pan, Chang Ren, Xudong Rao, Xintian Shen, Chenfeng Wang, Tao Wei, Chengjun Yu, Pengfei Yu, Shengyu Yao, Chunpeng Zhou, Kun Zhan, Lihao Zheng, Pan Zhou, Xuhan Zhu, Yufei Zheng

机构 * Li Auto Inc.(理想汽车)

专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.CV

AI总结 本文提出StreamingClaw框架,解决流式视频理解与具身智能中的实时推理、多模态记忆和闭环控制问题,提升复杂环境下的自主决策能力。

Comments Under Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22815 2026-03-25 cs.CV 57%

Captain Safari: A World Engine with Pose-Aligned 3D Memory

Captain Safari: 一种具有姿态对齐3D记忆的世界引擎

Yu-Cheng Chou, Xingrui Wang, Yitong Li, Jiahao Wang, Hanting Liu, Cihang Xie, Alan Yuille, Junfei Xiao

机构 * Johns Hopkins University(约翰霍普金斯大学) Tsinghua University(清华大学) UC Santa Cruz(加州大学圣克ruz分校)

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

AI总结 本文提出Captain Safari,一种基于姿态条件的世界引擎,通过持久化世界记忆生成视频,提升了复杂场景下的3D一致性与轨迹跟踪能力,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18298 2026-03-20 cs.RO cs.AI cs.CV 57%

Sparse3DTrack: Monocular 3D Object Tracking Using Sparse Supervision

Sparse3DTrack: 基于稀疏监督的单目3D物体跟踪

Nikhil Gosala, B. Ravi Kiran, Senthil Yogamani, Abhinav Valada

机构 * University of Freiburg, Germany(弗赖堡大学) Qualcomm SARL France(法国高通公司) Automated Driving, Qualcomm Technologies, Inc., USA(美国高通技术公司自动驾驶部门)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 本文提出首个稀疏监督的单目3D物体跟踪框架,通过分解为2D查询匹配和3D几何估计两阶段任务,利用时空一致性增强稀疏标注样本,生成高质量3D伪标签,提升极端稀疏标注下的跟踪性能。

Comments 22 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11746 2026-03-20 cs.CV 57%

SoulX-LiveAct: Towards Hour-Scale Real-Time Human Animation with Neighbor Forcing and ConvKV Memory

SoulX-LiveAct: 向小时级实时人体动画迈进:通过邻居强制和ConvKV内存

Dingcheng Zhen, Xu Zheng, Ruixin Zhang, Zhiqi Jiang, Yichao Yan, Ming Tao, Shunshun Yin

机构 * Soul AI Lab, China(中国灵魂AI实验室) HKUST(GZ)(香港科技大学(广州)) Soochow University(苏州大学)

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

AI总结 本文提出Neighbor Forcing和ConvKV内存机制,解决小时级实时人体动画中样本不一致和历史表示无结构的问题,提升训练收敛性、生成质量和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18004 2026-03-19 cs.CV cs.AI cs.LG 57%

Unified Spatio-Temporal Token Scoring for Efficient Video VLMs

统一的空间时间令牌评分用于高效的视频视觉-语言模型

Jianrui Zhang, Yue Yang, Rohun Tripathi, Winson Han, Ranjay Krishna, Christopher Clark, Yong Jae Lee, Sangho Lee

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Allen Institute for AI(人工智能研究所)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 本文提出STTS,一种高效的统一空间时间令牌评分方法,通过辅助损失和LLM下游梯度学习,在不依赖文本条件或令牌合并的情况下,对视频中50%的视觉令牌进行修剪,提升训练和推理效率62%,性能下降仅0.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17117 2026-03-19 cs.CV 57%

MosaicMem: Hybrid Spatial Memory for Controllable Video World Models

MosaicMem: 用于可控视频世界模型的混合空间记忆

Wei Yu, Runjia Qian, Yumeng Li, Liquan Wang, Songheng Yin, Sri Siddarth Chakaravarthy P, Dennis Anthony, Yang Ye, Yidi Li, Weiwei Wan, Animesh Garg

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) The University of Osaka(大阪大学) Georgia Institute of Technology(佐治亚理工学院) Mujin Inc.(Mujin公司) University of Texas at Austin(德克萨斯大学奥斯汀分校) Taiyuan University of Technology(太原本科技大学)

专题命中 长视频与时序推理 :video diffusion(abstract);分类 cs.CV

AI总结 MosaicMem提出一种混合空间记忆方法,通过提升片段至3D实现可靠定位与检索,结合模型原生条件化保留提示生成,提升姿态一致性与动态建模能力,支持细粒度导航与场景编辑。

Comments Project Page: https://mosaicmem.github.io/mosaicmem/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17051 2026-03-19 cs.CV 57%

Astrolabe: Steering Forward-Process Reinforcement Learning for Distilled Autoregressive Video Models

Astrolabe:为蒸馏自回归视频模型设计的前向过程强化学习框架

Songchun Zhang, Zeyue Xue, Siming Fu, Jie Huang, Xianghao Kong, Y Ma, Haoyang Huang, Nan Duan, Anyi Rao

机构 * HKUST(香港科技大学) JD Explore Academy(JD探索学院) HKU(香港大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 Astrolabe通过前向过程强化学习方法提升蒸馏自回归视频模型的生成质量,采用滚动KV缓存实现流式训练,结合多奖励目标和不确定性感知正则化,有效解决对齐问题。

Comments 53 pages, 37 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12372 2026-03-17 cs.CV 57%

STAGE: Storyboard-Anchored Generation for Cinematic Multi-shot Narrative

STAGE:基于故事板的电影多镜头叙事生成

Peixuan Zhang, Zijian Jia, Kaiqi Liu, Shuchen Weng, Si Li, Boxin Shi

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

AI总结 STAGE提出基于故事板的生成方法,通过结构化故事板和多镜头记忆包提升叙事控制与跨镜头一致性,引入ConStoryBoard数据集进行实验验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12938 2026-03-16 cs.CV cs.AI 57%

Thinking in Streaming Video

流式视频思考

Zikang Liu, Longteng Guo, Handong Li, Ru Zhen, Xingjian He, Ruyi Ji, Xiaoming Ren, Yanhao Zhang, Haonan Lu, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) OPPO AI Center, OPPO Inc.(OPPO人工智能中心,OPPO公司)

专题命中 长视频与时序推理 :video reasoning(abstract);分类 cs.CV

AI总结 本文提出ThinkStream框架,通过Watch-Think-Speak范式实现流式视频推理,采用RCSM压缩内存和流式强化学习提升效率,实验表明其在多个流式视频基准上性能优越且低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08620 2026-03-10 cs.CV 57%

StreamReady: Learning What to Answer and When in Long Streaming Videos

StreamReady: 在长视频流中学习何时回答

Shehreen Azad, Vibhav Vineet, Yogesh Singh Rawat

机构 * Center for Research in Computer Vision, University of Central Florida(计算机视觉研究中心,中央佛罗里达大学) Microsoft Research(微软研究院)

专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.CV

AI总结 StreamReady通过引入答案准备度评分,统一时间推理与及时回答,实现对长视频流中何时回答的高效学习与准确判断。

Comments Accepted in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06971 2026-03-10 cs.CV 57%

SurgCUT3R: Surgical Scene-Aware Continuous Understanding of Temporal 3D Representation

SurgCUT3R: 术场景感知的连续时间3D表示理解

Kaiyuan Xu, Fangzhou Hong, Daniel Elson, Baoru Huang

机构 * The Hamlyn Centre for Robotic Surgery, Imperial College London(机器人手术中心,帝国理工学院伦敦分校) S-Lab, College of Computing and Data Science, Nanyang Technological University(S实验室, computing and Data Science学院,南洋理工大学) Department of Computer Science, University of Liverpool(计算机科学系,利物浦大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 SurgCUT3R通过数据生成、混合监督和分层推理框架,解决手术场景中3D重建的准确性和效率问题,实现稳健的重建性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14895 2026-03-09 cs.CV cs.AI 57%

SpatialMem: Metric-Aligned Long-Horizon Video Memory for Language Grounding and QA

SpatialMem: 用于语言定位和问答的度量对齐长周期视频记忆

Xinyi Zheng, Yunze Liu, Chi-Hao Wu, Fan Zhang, Hao Zheng, Wenqi Zhou, Walterio W. Mayol-Cuevas, Junxiao Shen

机构 * University of Bristol(布里斯托大学) Memories.ai Research(Memories.ai研究院)

专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.CV

AI总结 SpatialMem通过构建度量对齐的空间支架,实现长周期视频记忆的可解释检索与问答,支持语言引导的检索和离线导航任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03985 2026-03-05 cs.CV 57%

RIVER: A Real-Time Interaction Benchmark for Video LLMs

RIVER:面向视频大语言模型的实时交互基准

Yansong Shi, Qingsong Zhao, Tianxiang Jiang, Xiangyu Zeng, Yi Wang, Limin Wang

机构 * School of Information Science And Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学) State Key Lab of Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学)

专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.CV

AI总结 RIVER基准通过引入实时交互任务框架,改进视频大语言模型的实时交互能力,提升长期记忆与未来感知表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08862 2026-03-04 cs.CV cs.LG 57%

StreamSplat: Towards Online Dynamic 3D Reconstruction from Uncalibrated Video Streams

StreamSplat: 向动态3D重建的在线方法:从未校准视频流中

Zike Wu, Qi Yan, Xuanyu Yi, Lele Wang, Renjie Liao

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute for AI(人工智能向量研究所) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席) Nanyang Technological University(南洋理工大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 StreamSplat通过在线动态3D重建方法,实现从未校准视频流中快速生成高精度3DGS表示,支持任意长度视频的实时重建。

Comments Accepted by ICLR 2026, Project page: https://streamsplat3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01804 2026-03-03 cs.CV cs.AI 57%

Non-verbal Real-time Human-AI Interaction in Constrained Robotic Environments

非语言实时人机交互在受限机器人环境中

Dragos Costea, Alina Marcu, Cristina Lazar, Marius Leordeanu

机构 * National University of Science Princeton University, Princeton NJ 08544, USA, , WWW home page: http://users/ iekeland/web/welcome.html Universit\' e de Paris-Sud, Laboratoire d'Analyse Num\' e rique, B\ a timent 425, F-91405 Orsay Cedex, France

专题命中 长视频与时序推理 :text-to-video(abstract);分类 cs.CV

AI总结 本文提出首个实时生成非语言人机交互的框架,通过对比合成与真实数据发现时间一致性对实际性能的影响,揭示了人类与AI运动间的统计差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03905 2026-03-03 cs.CV 57%

EchoMimicV3: 1.3B Parameters are All You Need for Unified Multi-Modal and Multi-Task Human Animation

EchoMimicV3:13亿参数足矣实现统一的多模态和多任务人类动画

Rang Meng, Yan Wang, Weipeng Wu, Ruobing Zheng, Yuming Li, Chenguang Ma

机构 * Terminal Technology Department, Alipay, Ant Group(蚂蚁集团支付宝终端技术部)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 EchoMimicV3通过统一多任务和多模态人类动画,以13亿参数实现高效且稳定的多任务和多模态动画生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10553 2026-03-02 cs.CV 57%

Inference-time Physics Alignment of Video Generative Models with Latent World Models

视频生成模型的推理时间物理对齐:基于潜在世界模型

Jianhao Yuan, Xiaofeng Zhang, Felix Friedrich, Nicolas Beltran-Velez, Melissa Hall, Reyhane Askari-Hemmat, Xiaochuang Han, Nicolas Ballas, Michal Drozdzal, Adriana Romero-Soriano

机构 * FAIR, Meta Superintelligence Labs University of Oxford Mila - Qu\' e bec AI Institute Columbia University McGill University Canada CIFAR AI Chair

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

AI总结 本文提出WMReward方法,通过潜在世界模型提升视频生成的物理合理性,实验表明在多个生成设置中显著提高物理合理性,并在ICCV 2025挑战中取得第一名。

Comments 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20685 2026-02-26 cs.CV 57%

RAYNOVA: Scale-Temporal Autoregressive World Modeling in Ray Space

RAYNOVA:在射线空间中实现尺度-时间自回归世界建模

Yichen Xie, Chensheng Peng, Mazen Abdelfattah, Yihan Hu, Jiezhi Yang, Eric Higgins, Ryan Brigden, Masayoshi Tomizuka, Wei Zhan

机构 * Applied Intuition UC Berkeley(加州大学伯克利分校)

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

AI总结 RAYNOVA通过双因果自回归框架实现尺度-时间自回归世界建模,在驾驶场景中实现多视角视频生成,具有更高的吞吐量和可控性。

Comments Accepted by CVPR 2026; Project website: https://raynova-ai.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18434 2026-02-23 cs.CV 57%

Going Down Memory Lane: Scaling Tokens for Video Stream Understanding with Dynamic KV-Cache Memory

回溯记忆:通过动态KV缓存内存扩展令牌实现视频流理解

Vatsal Agarwal, Saksham Suri, Matthew Gwilliam, Pulkit Kumar, Abhinav Shrivastava

机构 * University of Maryland, College Park(马里兰大学 College Park 分校)

专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.CV

AI总结 MemStream通过扩展令牌预算和自适应选择策略,提升视频流理解的准确性和细粒度信息保留能力。

Comments Project page: see https://vatsalag99.github.io/memstream/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16160 2026-02-23 cs.CV 57%

Uncertainty-Guided Inference-Time Depth Adaptation for Transformer-Based Visual Tracking

不确定性引导的推理时间深度适应用于基于变换器的视觉跟踪

Patrick Poggi, Divake Kumar, Theja Tulabandhula, Amit Ranjan Trivedi

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 本文提出UncL-STARK,通过动态不确定性引导的深度适应,在不修改网络的情况下,提升基于变换器的视觉跟踪效率,实现计算开销降低和能耗节省。

Comments Submitted to IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15899 2026-02-20 cs.RO eess.IV 57%

SceneVGGT: VGGT-based online 3D semantic SLAM for indoor scene understanding and navigation

SceneVGGT: 基于VGGT的在线3D语义SLAM用于室内场景理解和导航

Anna Gelencsér-Horváth, Gergely Dinya, Dorka Boglárka Erős, Péter Halász, Islam Muhammad Muqsit, Kristóf Karacs

机构 * Pázmány Péter Catholic University(帕梅尼·彼得天主教大学) Eötvös Loránd University(欧多尼·洛兰德大学)

专题命中 长视频与时序推理 :long video(abstract);分类 eess.IV

AI总结 SceneVGGT基于VGGT实现高效的在线3D语义SLAM,用于室内场景理解和导航,通过滑动窗口管道实现长视频流处理,结合语义映射与SLAM,提升导航的鲁棒性和交互性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15318 2026-02-18 cs.CV cs.AI 57%

Sparrow: Text-Anchored Window Attention with Visual-Semantic Glimpsing for Speculative Decoding in Video LLMs

Sparrow: 一种基于文本锚定窗口注意力与视觉语义窥视的推测解码方法用于视频大语言模型

Libo Zhang, Zhaoning Zhang, Wangyang Hong, Peng Qiao, Dongsheng Li

机构 * National Key Laboratory of Parallel and Distributed Computing(平行与分布式计算国家重点实验室) College of Computer Science and Technology(计算机科学与技术学院) National University of Defense Technology(国防科技大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 Sparrow通过文本锚定窗口注意力与视觉语义窥视方法,解决视频大语言模型中推测解码的性能下降问题,实现2.82倍加速。

Comments 15 pages , 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12641 2026-02-16 cs.NI cs.AI cs.HC cs.MM 57%

Artic: AI-oriented Real-time Communication for MLLM Video Assistant

Artic: 面向AI的实时通信用于多模态大语言模型视频助手

Jiangkai Wu, Zhiyuan Ren, Junquan Zhong, Liming Liu, Xinggong Zhang

机构 * Peking University(北京大学)

专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.MM

AI总结 Artic提出了一种面向AI的实时通信框架,通过自适应比特率、上下文感知流式传输和退化视频理解基准提升多模态大语言模型视频助手的准确性和降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07449 2026-02-12 cs.CV 57%

SoulX-FlashHead: Oracle-guided Generation of Infinite Real-time Streaming Talking Heads

SoulX-FlashHead: 基于Oracle的无限实时流式谈话头生成

Tan Yu, Qian Qiao, Le Shen, Ke Zhou, Jincheng Hu, Dian Sheng, Bo Hu, Haoming Qin, Jun Gao, Changhai Zhou, Shunshun Yin, Siyuan Liu

机构 * AIGC Team, Soul AI Lab(AIGC团队,Soul AI实验室)

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

AI总结 SoulX-FlashHead通过引入流式感知预训练和Oracle引导蒸馏,实现了高保真实时流式谈话头生成,达到最先进的性能并支持超快交互。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00891 2026-02-12 cs.CV 57%

Accelerating Streaming Video Large Language Models via Hierarchical Token Compression

通过分层令牌压缩加速流式视频大型语言模型

Yiyu Wang, Xuyang Liu, Xiyan Gui, Xinying Lin, Boxue Yang, Chenfei Liao, Tailai Chen, Linfeng Zhang

机构 * EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) Sichuan University(四川大学) Huazhong University of Science and Technology(华中科技大学) Sun Yat-sen University(中山大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.CV

AI总结 STC通过分层令牌压缩技术,显著降低流式视频大语言模型的处理延迟,同时保持高精度。

Comments Code is avaliable at \url{https://github.com/lern-to-write/STC}

详情

展开后加载摘要…

URL PDF HTML 收藏