SMILE: Multimodal Dataset for Understanding Laughter in Video with Language Models
专题命中 视频多模态 :multimodal(title);分类 cs.CL、cs.AI
Comments 19 pages, 14 figures
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 视频多模态 :multimodal(title);分类 cs.CL、cs.AI
Comments 19 pages, 14 figures
专题命中 视频多模态 :multimodal(title);分类 cs.CV、cs.CL
专题命中 视频多模态 :multimodal(title);分类 cs.CV、cs.AI
专题命中 视频多模态 :multimodal(title);分类 cs.CV、cs.AI
专题命中 视频多模态 :multimodal(title);分类 cs.CV、cs.AI
Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV) 2023
专题命中 视频多模态 :multimodal(title);分类 cs.CV、cs.AI
专题命中 视频多模态 :cross-modal(title);分类 cs.CV、cs.CL
专题命中 视频多模态 :multimodal(title);分类 cs.MM、eess.AS
专题命中 视频多模态 :cross-modal(title);分类 cs.CV、cs.AI
Comments Accepted by IEEE Sensor Array and Multichannel Signal Processing Workshop (SAM 2022)
专题命中 视频多模态 :multimodal(title);分类 cs.CV、cs.CL
专题命中 视频多模态 :multi-modal(title);分类 cs.AI、cs.MM
专题命中 视频多模态 :multimodal(title);分类 cs.CV、cs.AI
专题命中 视频多模态 :multi-modal(title);分类 cs.CV、cs.AI
专题命中 视频多模态 :multimodal(title);分类 cs.CV、cs.AI
专题命中 视频多模态 :multi-modal(title);分类 cs.CV、eess.AS
专题命中 视频多模态 :multimodal(title);分类 cs.CV、cs.CL
Comments Accepted to CoNLL 2019. The project website with code and demo is available at https://hucvl.github.io/prn/
专题命中 视频多模态 :multi-modal(title);分类 cs.CV、cs.AI
Comments Presented in IEEE ICPR 2018
专题命中 视频多模态 :multimodal(title);分类 cs.CV、cs.AI
Comments Published at ECCV 2018
专题命中 视频多模态 :multi-modal(title);分类 cs.CL、eess.AS
Comments Proceedings of the 7th Audio/Visual Emotion Challenge and Workshop (AVEC). (Official Depression Challenge Winner)
专题命中 视频多模态 :multimodal(title);分类 cs.AI、cs.MM
Comments 11 pages, 5 figures, ICDM 2017
专题命中 视频多模态 :multimodal(title);分类 cs.CV、cs.MM
保持简洁:用于超长视频理解的多键情景记忆检索
机构 * Yonsei University(延世大学) ; Adobe Research(奥多比研究院)
专题命中 视频多模态 :multi-modal(abstract);MLLM(abstract_cn);分类 cs.CV、cs.CL、cs.AI
AI总结 针对超长视频理解的两阶段范式需求,提出MERIT框架,通过多键表示与按需时间扩展实现精准检索,在三个长视频基准数据集上取得最优性能。
Comments Accepted to ECCV 2026 (Oral). Project Page: https://choi-yeeun.github.io/MERIT/
主动视频感知:用于代理长视频理解的迭代证据寻求
机构 * Salesforce AI Research(Salesforce AI研究院) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 视频多模态 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.CL、cs.AI
AI总结 本文提出了一种主动视频感知框架AVP,通过迭代计划-观察-反思过程,主动决定视频内容的观察目标和时间,以提高长视频理解的准确性和效率。
Comments Website: https://activevideoperception.github.io/
通过儿童自我中心输入进行持续的视觉与语言学习
机构 * Agentic Learning AI Lab, New York University(代理学习人工智能实验室,纽约大学) ; Department of Psychology, Princeton University(心理学系,普林斯顿大学)
专题命中 视频多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 提出BabyCL持续多模态学习框架,在单一时间顺序处理SAYCam数据集,通过流式视觉表示学习和图像-文本对比目标,在SAYCam Labeled-S 4AFC基准上优于流式学习基线,缩小了与离线训练上限的差距。
Comments 15 pages, 4 figures
PaSBench-Video: 面向主动安全预警的流式视频基准
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Tsinghua University(清华大学)
专题命中 视频多模态 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV、cs.CL、cs.AI
AI总结 提出PaSBench-Video基准,包含740个视频,评估多模态大模型在危险发生前及时发出预警的能力,发现现有模型在时序精度和低误报率上表现不佳。
层次化局部-全局Transformer用于时间语句定位
机构 * Hubei Engineering Research Center on Big Data Security, School of Cyber Science and Engineering, Huazhong University of Science and Technology(大数据安全湖北工程研究中心,华中科技大学网络安全科学与工程学院) ; Wangxuan Institute of Computer fTechnology, Peking University(王宣计算机技术研究院,北京大学) ; School of software, Dalian University of Technology(软件学院,大连理工大学) ; School of Computer Science, and Technology, Huazhong University of Science, and Technology(计算机科学与技术学院,华中科技大学)
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.MM
AI总结 提出层次化局部-全局Transformer(HLGT),通过建模视频和查询的不同粒度层次及跨模态交互,实现更细粒度的多模态表示,并在三个数据集上取得最先进性能。
Comments Publish in IEEE Transactions on Multimedia
DisImpact:通过社交媒体量化自然灾害的生理-社会影响
专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract)
AI总结 本文提出DisImpact框架,利用多模态大语言模型系统量化自然灾害的生理和社会影响,通过社交媒体内容分类和构建灾害影响指数,实现对灾害影响的统一表示和分析。
Comments Accepted by ICWSM 2026
LPM 1.0:基于视频的角色表现模型
专题命中 视频多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 本文提出LPM 1.0模型,通过构建多模态数据集和训练扩散变换器,实现高可控性和身份一致性的角色表现生成,支持实时交互和无限长度生成。
Comments 43 pages, 15 figures, 2 tables. Project page: https://large-performance-model.github.io
小视觉-语言模型是长视频理解的智能压缩器
机构 * Meta AI ; King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学)
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文提出Tempo框架,利用小视觉-语言模型压缩长视频,通过自适应令牌分配实现高效压缩,实验显示其在极端长视频任务中表现优异。
Comments Project page and demo are available at https://FeiElysia.github.io/tempo-page/
EVA: 为端到端视频代理的高效强化学习
机构 * SenseTime Research(商汤科技研究院)
专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 EVA通过迭代总结-计划-行动-反思推理实现先规划后感知,提升长视频理解效率,采用三阶段学习流程和高质量数据集,在六个视频理解基准上取得显著提升。
Comments CVPR2026