NeuS-QA: Grounding Long-Form Video Understanding in Temporal Logic and Neuro-Symbolic Reasoning
专题命中 视频问答 :video understanding(title);long video(abstract);分类 cs.CV
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频问答 :video understanding(title);long video(abstract);分类 cs.CV
机构 * Alibaba Group(阿里巴巴集团)
专题命中 视频问答 :video reasoning(title,abstract);分类 cs.CV
机构 * School of Automation, Northwestern Polytechnical University(自动化学院,西北工业大学) ; The University of Hong Kong(香港大学) ; School of Software, Northwestern Polytechnical University(软件学院,西北工业大学) ; Unmanned System Research Institute, Northwestern Polytechnical University(无人系统研究院,西北工业大学)
专题命中 视频问答 :video understanding(title,abstract);分类 cs.CV
Comments ACM MM 2025
机构 * Sun Yat-sen University(中山大学) ; Lanzhou University(兰州大学) ; University of Hong Kong(香港大学) ; Hefei University of Technology(合肥工业大学) ; National University of Singapore(新加坡国立大学)
专题命中 视频问答 :video reasoning(title,abstract);分类 cs.CV
机构 * School of Computer Science, Duy Tan University(计算机科学学院,杜益坦大学) ; School of Computer Sciences, Universiti Sains Malaysia(计算机科学学院,马来亚大学)
专题命中 视频问答 :video-language(title,abstract);分类 cs.CV
专题命中 视频问答 :video-language(title,abstract);分类 cs.CV
Comments CVPR 2025 camera-ready version
专题命中 视频问答 :video understanding(title);video reasoning(abstract);分类 cs.CV
专题命中 视频问答 :video-language(title,abstract);分类 cs.CV
Comments Accept to CVPR 2025, Project page: https://github.com/JiuTian-VL/LION-FS
专题命中 视频问答 :video language model(title);video-language(abstract);分类 cs.CV
专题命中 视频问答 :video understanding(title,abstract);分类 cs.CV
专题命中 视频问答 :video-language(title,abstract);分类 cs.CV
Comments Accepted to ECCV 2024
专题命中 视频问答 :video-language(title,abstract);分类 cs.CV
Comments ECCV 2024
专题命中 视频问答 :video-language(title,abstract);分类 cs.CV
Comments under review
专题命中 视频问答 :long video(title,abstract);分类 cs.CV
Comments Published in BMVC 2023
专题命中 视频问答 :video-language(title,abstract);分类 cs.CV
Comments 16 pages, 9 figures, code is available at https://github.com/RenShuhuai-Andy/TESTA
专题命中 视频问答 :video-language(title,abstract);分类 cs.CV
Comments 13 pages, 6 figures, accepted by EMNLP 2022 main conference
专题命中 视频问答 :video-language(title,abstract);分类 cs.CV
Comments 18 pages. 11 figures. Code: https://github.com/showlab/all-in-one
专题命中 视频问答 :video reasoning(title,abstract);分类 cs.CV
Comments Accepted to ICCV 2021 Workshops
专题命中 视频问答 :video reasoning(title,abstract);分类 cs.CV
Comments Accepted by CVPR 2021
机构 * University of Trento(特伦托大学) ; Gran Sasso Science Institute(格兰萨索科学研究所) ; University of Essex(埃塞克斯大学) ; University of Bath(巴斯大学)
专题命中 视频问答 :video language model(title,abstract)
先构建图!通过场景图实现长视频第一人称视频推理
机构 * Politecnico di Milano(米兰理工大学) ; Bocconi University(博科尼大学)
专题命中 视频问答 :video understanding(abstract);video reasoning(abstract);long video(abstract);分类 cs.CV
AI总结 提出利用第一人称场景图(EgoSGs)将长视频压缩为紧凑文本表示,在保持语义丰富性的同时大幅减少输入长度,使多模态大模型能在令牌预算内高效推理,在HD-EPIC VQA上取得最优结果。
推理前的感知:面向视频理解与问答的动态隐式推理
机构 * Rice University(莱斯大学) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 视频问答 :video understanding(title);分类 cs.CV
AI总结 该研究针对视频问答现有方法依赖长文本思维链的问题,提出DyLaR模型,通过动态调整感知与推理隐式变量的使用,在9个视频基准上提升准确率且缩短响应长度。
HiMu: 面向长视频问答的分层多模态帧选择
机构 * INSIGHT Lab, Ben-Gurion University of the Negev, Israel(本-古里安内盖夫大学INSIGHT实验室,以色列) ; Ben-Gurion University of the Negev, Israel(本-古里安内盖夫大学,以色列)
专题命中 视频问答 :long video(title);分类 cs.CV
AI总结 提出HiMu框架,通过文本LLM将查询分解为层次逻辑树,由视觉和音频专家处理原子谓词,经模糊逻辑算子组合生成连续帧满意度曲线,在16帧预算下达到帧选择方法的最优精度,并作为即插即用模块提升多种MLLM性能。
SER: 用语义证据奖励学习视频推理定位
机构 * Nanjing University(南京大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai AI Laboratory(上海人工智能实验室) ; Harbin Institute of Technology(哈尔滨工业大学) ; Shenzhen Institutes of Advanced Technology(深圳先进技术研究院)
专题命中 视频问答 :video reasoning(title);分类 cs.CV
AI总结 提出语义证据奖励(SER),通过将时空证据定位重构为约束验证任务,利用裁判VLM评估证据的相关性和定位质量,在V-STAR基准上提升3.0点mLGM。
当思考带来痛苦:通过帧重复缓解视频推理中的视觉遗忘
机构 * University of Science and Technology of China(中国科学技术大学) ; State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)
专题命中 视频问答 :video reasoning(title);分类 cs.CV
AI总结 本文提出FrameRepeat框架,通过轻量级重复评分模块和Add-One-In策略,有效增强视频推理中的视觉线索,提升模型性能和泛化能力。
HyperTokens: 通过控制令牌动态实现连续视频-语言理解
专题命中 视频问答 :video-language(title);分类 cs.CV
AI总结 本文提出HyperTokens,通过按需生成微调令牌,控制提示更新并保持内存固定,通过元启发式正则化抑制遗忘,提升连续视频问答任务的准确率与保留率。
基于空间代码的物理世界视频推理
专题命中 视频问答 :video reasoning(title);分类 cs.CV
AI总结 基于空间代码的物理世界视频推理方法,通过空间编码器生成3D表示并提升大语言模型的推理能力。
Comments Code at https://github.com/Beckschen/spatialcode
机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; Microsoft Research(微软研究院) ; Columbia University(哥伦比亚大学) ; University of Southern California(南加州大学) ; Fudan University(复旦大学)
专题命中 视频问答 :long video(title);分类 cs.CV
机构 * Brown University(布朗大学) ; Samsung Electronics(三星电子)
专题命中 视频问答 :video-language(title);分类 cs.CV
VideoZeroBench: 通过时空证据验证探测视频多模态大语言模型的极限
机构 * PKU(北京大学) ; WHU(武汉大学) ; CASIA(中国科学院自动化研究所) ; BJTU(北京交通大学) ; CUHK(香港中文大学)
专题命中 视频问答 :video understanding(abstract);video reasoning(abstract);分类 cs.CV、cs.MM
AI总结 VideoZeroBench通过严格验证时空证据,揭示视频多模态大语言模型在长视频问答中的不足,发现即使在标准设置下,模型正确率也低于17%,且在严格约束下性能显著下降,凸显了基于证据的视频理解仍是瓶颈。