Can multimodal sensing detect and localize transient events?
专题命中 视频多模态 :multimodal(title,abstract)
Journal ref SPIE Defense+Security 2018
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 视频多模态 :multimodal(title,abstract)
Journal ref SPIE Defense+Security 2018
专题命中 视频多模态 :multimodal(title,abstract)
专题命中 视频多模态 :multimodal(title,abstract)
专题命中 视频多模态 :multimodal(title,abstract)
Comments 25 pages, 6 figures
专题命中 视频多模态 :multimodal(title,abstract)
Comments IEEE Transactions on Affective Computing 2018
专题命中 视频多模态 :multi-modal(title,abstract)
Comments Published in IEEE 40th International Engineering in Medicine and Biology Conference (EMBC) 2018
专题命中 视频多模态 :multimodal(title,abstract)
专题命中 视频多模态 :multimodal(title,abstract)
Comments 14 pages, 14 figures, IEEE Transactions on Cognitive and Developmental Systems, 2017
专题命中 视频多模态 :multi-modal(title,abstract)
Comments Paper accepted to NIPS 2017
专题命中 视频多模态 :multi-modal(title,abstract)
Comments Video: https://www.youtube.com/watch?v=N1IhHHkUzYg Dataset: http://www2.informatik.uni-freiburg.de/~radwann/freiburg_street_crossing_dataset.html
专题命中 视频多模态 :multimodal(title,abstract)
Comments 11 pages, 4 figures
Journal ref Journal of Next Generation Information Technology (JNIT), Volume 3, Number 1, November 2012
专题命中 视频多模态 :multimodal(title,abstract)
Comments 15 pages, 11 figures
专题命中 视频多模态 :multimodal(title,abstract)
专题命中 视频多模态 :multimodal(title,abstract)
专题命中 视频多模态 :multimodal(title,abstract)
专题命中 视频多模态 :multimodal(title,abstract)
Comments The 30th AAAI Conference on Artificial Intelligence (AAAI-16)
专题命中 视频多模态 :multimodal(title,abstract)
Comments 9 pages, 7 figures +supplementary information (9 pages and 9 figures)
Journal ref Scientific Reports 4:6911 (2014)
专题命中 视频多模态 :multimodal(title,abstract)
Comments NIPS 2013
CRAFT: 基于批评的自适应关键帧目标定位用于多模态视频问答
机构 * University at Buffalo(布法罗大学) ; New York University(纽约大学)
专题命中 视频多模态 :multimodal(title,comments);分类 cs.CV、cs.AI
AI总结 该研究提出CRAFT方法,通过动态关键帧选择、每视频ASR与多语言回退以及混合批评循环,迭代验证和修复声明,最终实现多模态视频问答的准确证据聚合。
Comments Accepted at ACL 2026 Multimodal Augmented Generation via MultimodAl Retrieval Workshop
ReQuest:基于重新思考的问题感知帧选择用于长视频问答
专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 提出ReQuest,一种不确定性驱动的、问题自适应的关键帧选择方法,通过轻量级选择器、重新思考路由和不确定性引导的NMS,在固定token预算下提升长视频问答准确率。
Comments Accepted at ECCV 2026
HumanMoveVQA:视频多模态大语言模型能否推理视频中的人类运动?
机构 * CVSSP, University of Surrey, Guildford, UK(萨里大学视觉、语音与信号处理中心,英国吉尔福德) ; Tesco, UK(乐购,英国)
专题命中 视频多模态 :MLLM(summary_cn);multimodal(abstract);分类 cs.CV
AI总结 提出HumanMoveVQA基准,通过世界坐标系下的3D运动轨迹生成问答对,评估视频MLLM在全局轨迹和方向推理上的能力,发现现有模型存在显著差距。
推理即交集:视频多模态大语言模型中视觉焦点的一致性帧对齐
机构 * School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Cloud and AI BU, Huawei(华为云与AI业务部) ; School of Computing, National University of Singapore(新加坡国立大学计算机学院)
专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 提出无时间标注的过程级奖励框架CF-GRPO,通过视频内在线索构建一致性帧先验,并利用一致性帧奖励优化模型帧使用与先验的对齐,提升视频推理性能。
Kwai Keye-VL-2.0 技术报告
机构 * Kuaishou Group(快手集团)
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.CV
AI总结 提出开源MoE多模态基础模型Keye-VL-2.0,首次将DeepSeek稀疏注意力适配到GQA架构,支持无损256K上下文处理,并通过跨模态多教师策略蒸馏和上下文/视频强化学习解决多任务对齐中的灾难性遗忘,在长视频理解和智能体任务上达到同类最优。
Comments 31 pages, 11 figures
StreamOV: 通过证据引导记忆与响应触发的流式全视频理解
机构 * Shanghai Innovation Institute(上海创新研究院) ; Fudan University(复旦大学) ; Nanjing University(南京大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Huazhong University of Science and Technology(华中科技大学)
专题命中 视频多模态 :multimodal(abstract);audio-visual(abstract);omni-modal(abstract);分类 cs.CV
AI总结 提出StreamOV框架,利用多模态证据引导的长短期记忆和隐状态驱动的触发机制,实现流式全视频理解中的在线推理与主动响应,并在新基准SOVBench上取得最优性能。
Hi-GaTA:用于外科视频报告生成的分层门控时间聚合适配器
机构 * School of Engineering, College of Engineering and Physical Sciences, University of Birmingham, Birmingham, UK(英国伯明翰大学工程学院) ; School of Computer Science, University of Birmingham, Birmingham, UK(英国伯明翰大学计算机科学学院) ; Department of Applied Health Sciences, University of Birmingham, Birmingham, UK(英国伯明翰大学应用健康科学系)
专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 本文提出Hi-GaTA框架,通过时间聚合压缩长视频序列生成LLM兼容的视觉前缀令牌,结合预训练的外科专用视频编码器和LoRA微调,实现高质量外科报告生成。
Comments 11 pages, 2 figures
GraphThinker: 通过事件图思维强化时间感知的视频推理
机构 * Queen Mary University of London(伦敦玛丽女王大学) ; Samsung AI Centre Cambridge(剑桥三星人工智能中心) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Nanyang Technological University(南洋理工大学)
专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 本文提出GraphThinker,通过构建结构化事件表示并强化视觉 grounding,减少视频推理中的时间幻觉。在RexTime和VidHalluc数据集上取得显著提升。
Comments Under review
思考,然后评分:视频奖励建模中的解耦推理与评分
机构 * University of Science and Technology of China(中国科学技术大学) ; Kling Team, Kuaishou Technology(快手科技 Kling 团队) ; Institute of Software Chinese Academy of Sciences(中国科学院软件研究所)
专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 本文提出DeScore模型,通过解耦推理与评分机制提升视频奖励建模的泛化能力,结合冷启动和强化学习优化,实现更稳定的性能。
GuardAD: 通过马尔可夫安全逻辑保障自动驾驶MLLMs
机构 * Beihang University(北航大学) ; Zhongguancun Laboratory(中关村实验室) ; Peking University(北京大学)
专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.AI
AI总结 GuardAD通过马尔可夫逻辑形式化提升自动驾驶MLLMs的安全性,减少事故率并提升任务性能,经实验验证其有效性。
FLARE:全模态长视频音频视觉检索基准测试与用户模拟查询
专题命中 视频多模态 :multimodal(abstract);MLLM(abstract_cn);cross-modal(abstract);分类 cs.MM
AI总结 FLARE基准测试通过全模态长视频和用户模拟查询,评估视频检索在多模态大语言模型中的表现,揭示用户查询对模型行为的影响及音频语言对齐的关键瓶颈。
SpaceMind++:迈向空间感知认知地图的视频多模态大语言模型
机构 * Fudan University(复旦大学) ; Huawei(华为) ; Shenzhen Loop Area Institute(深圳河套学院)
专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 SpaceMind++通过构建体素化认知地图,实现空间一致性的视觉推理,提升视频多模态大语言模型在3D环境中的表现。
Comments 14 pages, 3 figures