Espresso: High Compression For Rich Extraction From Videos for Your Vision-Language Model
专题命中 长视频与时序推理 :video understanding(abstract);video-language(abstract);long video(abstract);分类 cs.CV
Comments 16 pages
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 长视频与时序推理 :video understanding(abstract);video-language(abstract);long video(abstract);分类 cs.CV
Comments 16 pages
专题命中 长视频与时序推理 :video generation(abstract);video understanding(abstract);long video(abstract);分类 cs.CV
专题命中 长视频与时序推理 :video generation(abstract);video diffusion(abstract);long video(abstract)
MedClaw:用于长程手术视频推理的启发式智能体框架
机构 * School of Automation and Intelligence, Beijing Jiaotong University(北京交通大学自动化与智能学院) ; University of Maryland(马里兰大学) ; Suzhou Institute for Advanced Research, University of Science and Technology of China(中国科学技术大学苏州高等研究院) ; University of British Columbia(不列颠哥伦比亚大学) ; Beijing Tiantan Hospital, Capital Medical University(首都医科大学附属北京天坛医院)
专题命中 长视频与时序推理 :video reasoning(title);分类 cs.CV
AI总结 本研究提出MedClaw智能体框架,通过分离推理与感知、启发式技能蒸馏循环,在仅需约100个标注示例的情况下,于自建及公开手术视频基准MedClawBench上,显著优于现有一次性VLM和通用视频智能体。
长视频中端到端面部表情检测
机构 * Hong Kong University of Science and Technology(香港科技大学) ; University of Edinburgh(爱丁堡大学) ; Ydentity Organization(Ydentity组织)
专题命中 长视频与时序推理 :long video(title);分类 cs.CV
AI总结 本文提出FEDN网络,将面部表情识别与检测统一为端到端任务,通过时间注意力模块提升多时间尺度表现,优于现有基准。
Comments ICANN 2026 accepted paper
视频语言模型何时停止观看?多模态RLVR中视觉捷径的形成与逆转受奖励强度控制
机构 * Zekun Xu(徐泽坤)
专题命中 长视频与时序推理 :video-language(title);分类 cs.CV
AI总结 研究多模态强化学习中视觉捷径的形成与逆转机制,发现惩罚强度可控制其出现和消除,且存在关键干预窗口。
Comments 11 pages, 4 figures
CutClaw:通过音乐同步实现代理长时间视频编辑
机构 * Beijing Jiaotong University(北京交通大学) ; GVC Lab, Great Bay University(大湾区大学GVC实验室) ; ARC Lab, Tencent(腾讯ARC实验室)
专题命中 长视频与时序推理 :long video(title);分类 cs.CV
AI总结 本文提出CutClaw,一种多代理框架,利用多模态语言模型自动编辑长时间原始素材为有意义的短视频,通过音乐同步和视觉优化提升视频质量。
Comments Project Code: https://github.com/GVCLab/CutClaw
MemRoPE:通过演化记忆标记实现无训练的无限视频生成
专题命中 长视频与时序推理 :video generation(title);分类 cs.CV
AI总结 MemRoPE通过演化记忆标记和在线RoPE索引机制,解决长视频生成中的时间一致性、视觉保真度和主体一致性问题,实现无训练的无限视频生成。
Comments 9 pages main, 3 pages references, 6 pages appendix. Project page: https://memrope.github.io
长时间视频中的自监督动物识别
机构 * University of Bristol(布里斯托大学)
专题命中 长视频与时序推理 :long video(title);分类 cs.CV
AI总结 本研究提出了一种高效的自监督方法,通过全局聚类任务实现长时间视频中动物个体的高精度识别,准确率超过97%,且内存消耗低,适用于资源受限环境。
Comments 11 pages, 1 figure
LongVideoAgent: 多智能体推理与长视频
机构 * Hong Kong University of Science and Technology(香港理工大学)
专题命中 长视频与时序推理 :long video(title);分类 cs.CV
AI总结 LongVideoAgent通过多智能体框架实现长视频的多模态推理,利用强化学习提升多智能体协作效率,优于现有基线方法。
基于可及性的分解方法用于视频-语言理解中的持续学习
机构 * University of Sydney(悉尼大学) ; University of California, Santa Barbara(加州大学圣巴巴拉分校) ; Nanjing Normal University(南京师范大学) ; Nanyang Technological University(南洋理工大学) ; Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区)
专题命中 长视频与时序推理 :video-language(title);分类 cs.CV
AI总结 AFD通过显式分解视频-语言理解中的稳定性与适应性,实现了在持续学习中的高性能表现。
Comments Under review
机构 * Carnegie Mellon University(卡内基梅隆大学) ; PAII Inc.(PAII公司)
专题命中 长视频与时序推理 :video generation(title);分类 cs.CV
Comments Project Page: https://beijia11.github.io/IASA
机构 * University of Science and Technology of China(中国科学技术大学) ; ByteDance China(字节跳动中国)
专题命中 长视频与时序推理 :long video(title);分类 cs.CV
Comments Accepted by EMNLP 2025 Industry Track
机构 * The Chinese University of Hong Kong(香港中文大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; CPII under InnoHK(创新香港下的CPII)
专题命中 长视频与时序推理 :long video(title);分类 cs.CV
Comments ICCV 2025, Project page: https://mark12ding.github.io/project/SAM2Long/ ; github page: https://github.com/Mark12Ding/SAM2Long/
机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)
专题命中 长视频与时序推理 :video generation(title);分类 cs.CV
Comments Project Page https://humanaigc.github.io/omnitalker
专题命中 长视频与时序推理 :video generation(title);分类 cs.CV
Comments CVPR 2025
专题命中 长视频与时序推理 :long video(title);分类 cs.CV
专题命中 长视频与时序推理 :long video(title);分类 cs.CV
Comments 15 pages, 9 figures, ACM IUI 2025
专题命中 长视频与时序推理 :long video(title);分类 cs.CV
Comments ECCV 2024 LSVOS Challenge Report: https://lsvos.github.io/
专题命中 长视频与时序推理 :video-language(title);分类 cs.CV
专题命中 长视频与时序推理 :long video(title);分类 cs.CV
专题命中 长视频与时序推理 :long video(title);分类 cs.CV
Comments 4 pages, 3 figures and 3 tables
Journal ref The 14th IEEE International Conference on Automatic Face & Gesture Recognition (FG 2019)
专题命中 长视频与时序推理 :long video(title);分类 cs.CV
Comments 6 pages, 6 figures and 1 table
专题命中 长视频与时序推理 :text-to-video(abstract);long video(abstract);分类 cs.CV;video-language(comments)
重新思考长视频中的RAG:检索什么以及如何使用?
机构 * Department of Computer Science, Cranberry-Lemon University(蔓越莓柠檬大学计算机科学系)
专题命中 长视频与时序推理 :long video(title)
AI总结 针对视频检索增强生成中检索粒度单一和基准测试缺陷,提出V-RAGBench基准和CARVE方法,通过分块自适应重排序实现多配置交错证据,显著提升性能。
EgoMonth:面向长期时空记忆的月级自我中心视频基准
机构 * Nanjing University(南京大学) ; Huawei Technologies Co., Ltd.(华为技术有限公司) ; Tianjin University(天津大学)
专题命中 长视频与时序推理 :video understanding(abstract);long video(abstract);分类 cs.CV
AI总结 研究人员推出首个月级自我中心视频基准EgoMonth,评估发现当前主流MLLMs的长期时空记忆能力远逊于人类,仅为有损总结器而非忠实记忆器。
Comments 21 pages, 4 figures, 6 tables, including appendices
TelePhysics: 从单张图像生成物理一致的多物体场景 with 实时交互
机构 * Fudan University(复旦大学) ; Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院(TeleAI))
专题命中 长视频与时序推理 :video generation(abstract,abstract_cn);分类 cs.CV
AI总结 本文提出TelePhysics,一种无需训练的框架,通过整体场景级3D重建将单张图像转换为物理一致且可控的视频。该方法通过统一的空间坐标系统表示完整场景几何,解决物体穿透和对齐模糊问题,实现准确的多物体交互和更丰富的复杂控制类型,从而在保持逼真视觉保真度的同时实现实时物理交互预览。
Comments ACMMM 2026. Project page: https://physomni.github.io/
原生主动感知作为全模态理解的推理
机构 * The Chinese University of Hong Kong(香港中文大学) ; Shanghai Jiao Tong University(上海交通大学) ; Nanyang Technological University(南洋理工大学) ; Qwen Team, Alibaba Group(阿里巴巴集团Qwen团队)
专题命中 长视频与时序推理 :video understanding(abstract);long video(abstract);分类 cs.CV
AI总结 提出OmniAgent,一种基于POMDP迭代观察-思考-行动循环的原生全模态智能体,通过主动感知将推理复杂度与视频时长解耦,在多个基准上达到开源模型最优性能。
Comments Accepted at ICML 2026. Code and models: https://github.com/harryhsing/omniagent
SLVMBench:从视频记忆中学习技能
机构 * Tsinghua University(清华大学) ; University of Cambridge(剑桥大学)
专题命中 长视频与时序推理 :video understanding(abstract);long video(abstract);分类 cs.CV
AI总结 SLVMBench是首个用于评估视频大语言模型从长视频记忆学习技能并应用于实时任务能力的基准测试,通过特定视频流和人工标注进行测试,发现现有视频LLMs在此方面有局限。
PhysMRV:用于物理合理性推理的物理内存检索与验证
专题命中 长视频与时序推理 :video understanding(abstract);video-language(abstract);分类 cs.CV
AI总结 针对视频语言模型物理合理性推理不可靠的问题,提出免训练的PhysMRV框架,通过将训练视频转化为分层内存库,利用结构化物理证据指导VLM验证物理合理性,在多基准测试中取得一致改进,有效增强该推理能力。