LongVALE: Vision-Audio-Language-Event Benchmark Towards Time-Aware Omni-Modal Perception of Long Videos
专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);分类 cs.CV、cs.MM
Comments Accepted by CVPR2025
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);分类 cs.CV、cs.MM
Comments Accepted by CVPR2025
专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);分类 cs.CV、cs.MM
Comments Code & models will be released at https://github.com/sming256/TimeLoc. The first 4 authors contributes equally
自梯度强制:原生长视频外推
机构 * Joy Future Academy(京东探索研究院)
专题命中 长视频与时序推理 :long video(title);video generation(abstract);video diffusion(abstract);分类 cs.CV
AI总结 研究针对自回归视频扩散方法的历史上下文梯度差距问题,提出自梯度强制(SGF)两阶段训练策略,利用未来视频潜变量损失监督模型将上下文编码为有效因果记忆,在长视频外推实验中效果优于自强制。
Comments Project page: https://zhuang2002.github.io/SelfGradientForcing/
EC-Bench:超长视频的枚举与计数基准
机构 * The University of Tokyo, Japan(东京大学) ; Institute of Science Tokyo, Japan(东京科学大学) ; National Institute of Informatics, Japan(国立信息学研究所)
专题命中 长视频与时序推理 :long video(title,abstract);video reasoning(abstract);分类 cs.CV
AI总结 EC-Bench针对超长视频的枚举与计数问题,通过152部超过30分钟的视频和1699个查询,评估多模态大语言模型的性能,揭示模型在时间推理和计数任务中的局限性。
Comments The first two authors are equally contributed. The data and code are publicly available at: https://github.com/matsuolab/EC-Bench
LiveStarPro: 具有分层记忆的主动式流视频理解用于长时域流
机构 * IEEE
专题命中 长视频与时序推理 :video understanding(title,abstract);video-language(abstract);分类 cs.CV
AI总结 提出LiveStarPro,通过流验证解码、流因果注意力掩码和树结构分层记忆三个组件,实现长时域流媒体视频的主动理解,在语义正确性和时序误差上分别提升28.9%和降低18.2%。
时间回溯搜索:测试时生成式视频推理
机构 * Northeastern University(东北大学) ; Independent Researcher(独立研究者) ; Harvard & Kempner(哈佛大学与肯普纳研究所) ; MIT(麻省理工学院)
专题命中 长视频与时序推理 :video reasoning(title,abstract);video generation(abstract);分类 cs.CV
AI总结 提出时间回溯搜索(TBS),通过将搜索空间转移到时间轴,在扩散过程中定位失败点并回溯重启,显著提升视频模型在测试时的推理能力。
未修剪长视频中被操纵片段的可解释取证
机构 * MoE Key Laboratory of Brain-Machine Intelligence Technology, College of Artificial Intelligence, Nanjing University of Aeronautics(脑机智能技术关键实验室、人工智能学院、南京航空航天大学) ; Dalian University of Technology(大连理工大学) ; Nanjing University(南京大学) ; National University of Singapore(新加坡国立大学)
专题命中 长视频与时序推理 :long video(title,abstract);video generation(abstract);分类 cs.CV
AI总结 针对长视频中AI生成片段的定位与解释任务,提出TASLE基准数据集和MSLoc粗到细取证方法,实现时序定位、真实性检测与可解释分析。
Comments Accepted to ICML 2026
VISD: 通过结构化自蒸馏增强视频推理
机构 * HUST(华中科技大学) ; Wuhan University(武汉大学) ; Peking University(北京大学) ; Tsinghua University(清华大学)
专题命中 长视频与时序推理 :video reasoning(title,abstract);long video(abstract);分类 cs.CV
AI总结 提出VISD框架,利用结构化自蒸馏和方向-幅度解耦机制,实现细粒度信用分配,提升视频推理准确性和训练效率。
VideoTIR:通过高效工具集成推理实现长视频的准确理解
机构 * Nanjing University(南京大学) ; Nankai University(南开大学) ; East China Normal University(华东师范大学) ; Tencent(腾讯) ; MiroMind ; Nanyang Technological University(南洋理工大学)
专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);分类 cs.CV
AI总结 本文提出VideoTIR,通过强化学习优化工具调用策略,提升长视频理解的准确性和效率,结合零样本RL和SFT冷启动方法,减少冗余调用并生成高质量轨迹数据。
图到帧RAG:面向无训练和可审计的视频推理的视觉空间知识融合
机构 * National University of Defense Technology(国防科技大学) ; Sun Yat-sen University(中山大学)
专题命中 长视频与时序推理 :video reasoning(title,abstract);long video(abstract);分类 cs.CV
AI总结 本文提出G2F-RAG,通过视觉空间知识融合提升视频推理的可解释性和效率,减少认知负担并保留可追溯的证据轨迹。
Comments Accepted at CVPR 2026. Camera-ready version
TTA-Vid: 视频推理的通用测试时间适应
机构 * University of Tübingen(蒂宾根大学) ; MIT(麻省理工学院) ; IBM Research(IBM研究院) ; MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) ; Tuebingen AI Center(蒂宾根人工智能中心) ; Max Planck Institute for Informatics(马克斯·普朗克信息学研究所)
专题命中 长视频与时序推理 :video reasoning(title,abstract);video-language(abstract);分类 cs.CV
AI总结 本文提出TTA-Vid方法,通过测试时间强化学习实现视频推理模型的适应,无需标注数据即可在测试时泛化至新领域。
MemCam:用于一致视频生成的记忆增强摄像机控制
机构 * Guilin University of Electronic Technology(桂林电子科技大学)
专题命中 长视频与时序推理 :video generation(title,abstract);long video(abstract);分类 cs.CV
AI总结 MemCam通过利用先前生成帧作为外部记忆,提升动态摄像机控制下的视频生成一致性,实验表明其在长视频场景中表现优异。
Comments 6 pages, 3 figures, 3 tables, accepted by IJCNN 2026
PackForcing:短视频训练足以支持长视频采样和长上下文推理
机构 * Alaya Studio, Shanda AI Research Tokyo(Alaya工作室,盛大AI研究东京) ; Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 长视频与时序推理 :long video(title);video generation(abstract);video diffusion(abstract);分类 cs.CV
AI总结 本文提出PackForcing框架,通过三部分KV缓存策略有效管理生成历史,实现高效内存使用和长视频生成,展示短视频监督足以支持高质量长视频合成。
基于记忆反馈的问题引导视觉压缩用于长期视频理解
机构 * Fujitsu Research(富士通研究实验室) ; Macquarie University(麦考瑞大学)
专题命中 长视频与时序推理 :video understanding(title,abstract);long video(abstract);分类 cs.CV
AI总结 本文提出QViC-MF框架,通过问题引导的多模态选择性注意力和记忆反馈提升长期视频理解性能,在多个基准测试中取得显著提升。
Comments Accepted to CVPR 2026. The first two authors contributed equally to this work
VideoChat-A1: 通过镜头链推理实现长视频的思考
专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);分类 cs.CV
AI总结 VideoChat-A1通过镜头链推理方法,有效解决长视频理解难题,实现优于现有方法的性能,同时在效率上更具优势。
边看边想:多轮视频推理的在线流式段级内存
专题命中 长视频与时序推理 :video reasoning(title,abstract);video understanding(abstract);分类 cs.CV
AI总结 本文提出Think While Watching框架,通过段级内存保持多轮视频推理连续性,提升流式视频理解的准确率和效率。
通过全局时间索引的序列-并行3D位置编码加速视频生成推理
专题命中 长视频与时序推理 :video generation(title,abstract);long video(abstract);分类 cs.CV
AI总结 通过全局时间索引的序列-并行3D位置编码优化视频生成推理,实现亚秒首帧延迟和近实时性能。
QMAVIS:利用大多模态模型融合实现长视频音频理解
机构 * National University of Singapore(新加坡国立大学) ; Nanyang Technological University, Singapore(南洋理工大学)
专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);分类 cs.MM
AI总结 QMAVIS通过融合大型多模态模型、大型语言模型和语音识别模型,实现了长视频音频理解,展示了在VideoMME数据集上38.75%的性能提升,并在其他数据集上表现出竞争力。
视频侦探:通过反复寻找关键线索来回答长视频中的问题
机构 * Gaoling School of Artificial Intelligence(北京中国人民大学人工智能学院) ; Renmin University of China(中国人民大学) ; AI Technology Center Online Video Business Unit(人工智能技术中心在线视频业务部) ; Tencent PCG(腾讯PCG)
专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);分类 cs.CV
AI总结 VideoDetective通过问题感知的记忆机制,使大语言模型能高效处理长视频问答任务,减少计算资源消耗并提升关键信息提取能力。
TV-RAG:一种具有时间意识和语义熵权的长视频检索与理解框架
机构 * Researcher(研究者)
专题命中 长视频与时序推理 :long video(title);video language model(abstract);video reasoning(abstract);分类 cs.CV
AI总结 TV-RAG通过时间衰减检索和熵加权关键帧采样,提升长视频检索与理解性能,无需重新训练即可集成至现有模型。
记忆与生成:迈向实时视频生成中的长期一致性
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学)
专题命中 长视频与时序推理 :video generation(title,abstract);long video(abstract);分类 cs.CV
AI总结 MAG通过分离内存压缩与帧生成任务,提升实时视频生成的长期一致性与效率。
Comments Code will be released at https://github.com/Xilluill/MAG
StoryMem: 基于记忆的多镜头长视频叙事
机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室)
专题命中 长视频与时序推理 :long video(title,abstract);video diffusion(abstract);分类 cs.CV
AI总结 StoryMem通过基于记忆的迭代镜头合成,实现了高质量多镜头视频叙事,提升了跨镜头一致性与审美质量。
Comments Project page: https://kevin-thu.github.io/StoryMem
TimeScope: 向长视频中面向任务的时序定位迈进
机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) ; University of Trento(特伦多大学) ; Singapore Management University(新加坡管理大学)
专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);分类 cs.CV
AI总结 TimeScope通过逐步推理实现长视频中面向任务的时序定位,提升定位精度并增强下游任务表现。
EgoLCD:基于长上下文扩散的自体视频生成
机构 * Peking University(北京大学) ; Sun Yat-sen University(中山大学) ; Zhejiang University(浙江大学) ; Chinese Academy of Sciences(中国科学院) ; Tsinghua University(清华大学)
专题命中 长视频与时序推理 :video generation(title,abstract);long video(abstract);分类 cs.CV
AI总结 EgoLCD通过结合长时稀疏KV缓存和LoRA扩展的注意力机制,实现了高效稳定的自体长上下文视频生成,提升了感知质量和时间一致性。
测试时时间采样用于高效多模态大语言模型视频理解
机构 * SenseTime, China(深睿时代,中国) ; Rakuten, Singapore(拉结恩,新加坡)
专题命中 长视频与时序推理 :video understanding(title,abstract);long video(abstract);分类 cs.CV
AI总结 T3S通过测试时时间采样提高多模态大语言模型处理长视频的效率和准确性。
机构 * Integrated Vision and Language Lab., School of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(整合视觉与语言实验室,电气工程学院,韩国科学技术院(KAIST)) ; Visual Intelligence Research Section, Superintelligence Creative Research Laboratory, Electronics and Telecommunications Research Institute (ETRI)(视觉智能研究部,超智能创意研究实验室,电子电信研究院)
专题命中 长视频与时序推理 :video understanding(title,abstract);video reasoning(abstract);分类 cs.CV
专题命中 长视频与时序推理 :video understanding(title,abstract);long video(abstract);分类 eess.IV
Comments NeurIPS 2025
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Minzu University of China(民族大学)
专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);分类 cs.CV
Comments Accepted by ICCV 2025
机构 * School of Electronic Engineering, Xidian University(西安电子科技大学电子工程学院) ; Department of Computer Science and Engineering, Hong Kong University of Science and Technology(香港理工大学计算机科学与工程系) ; College of Computer and Information, Hohai University(河海大学计算机与信息学院)
专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);分类 cs.CV
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; SpreeAI
专题命中 长视频与时序推理 :long video(title,abstract);video generation(abstract);分类 cs.CV
Comments Project Page: https://immortalco.github.io/VirtualFittingRoom/