Embracing Consistency: A One-Stage Approach for Spatio-Temporal Video Grounding
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
Comments 18 pages, 7 figures, Accepted by Neurips 2022, Spotlight Presentation
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
Comments 18 pages, 7 figures, Accepted by Neurips 2022, Spotlight Presentation
专题命中 视频多模态 :multi-modal(abstract);audio-visual(abstract);分类 cs.CV
Comments Accepted in IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2023 (10 Pages, 5 Figures)
专题命中 视频多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV
Comments Accepted for publication in International Journal of Computer Vision
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
Comments Accepted by ACMMM 2022
专题命中 视频多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CV
Comments Accepted by ACM MM 2022
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
Comments 20 pages, 27 figures
专题命中 视频多模态 :multi-modal(abstract);audio-visual(abstract);分类 cs.CV
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
Comments 5 pages, 3 figures, Accepted at ICIP-2022
专题命中 视频多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
Comments 12 pages, 10 figures
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
Comments Accepted by AAAI2022
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
专题命中 视频多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
Comments This work has been accepted by SIGIR 2021
专题命中 视频多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
Comments arXiv admin note: substantial text overlap with arXiv:2004.08515
专题命中 视频多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CV
Journal ref IEEE Transactions on Medical Imaging 36 (2017) 1542-1549
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments EMNLP 2017
专题命中 视频多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CV
专题命中 视频多模态 :multi-modal(abstract,comments);分类 cs.CV、cs.AI、cs.MM
Comments Keywords: Multi-Modal Neural Networks, Deep Learning, Large Language Models, Depression Diagnosis, Biomedical Informatics, DAIC-WOZ
EEG2MOTION:面向基于无创脑信号的开放词汇人体动作合成
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract)
AI总结 研究人员推出首个EEG-动作-文本数据集EEG2MOTION,提出EEG条件掩码动作模型EMMM,实现从无创脑信号生成多样连贯的全身体人体动作,为生成式开放词汇运动BCI开辟新方向。
深度思维对齐:面向视频推理的轨迹级潜在知识蒸馏
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 针对视频推理LMMs的高计算成本问题,提出Latent-OPD方法,通过轨迹级潜在知识蒸馏与渐进式教师前瞻策略提升轻量模型性能,在6个基准上优于仅输出监督的OPD。
MobileMem:从一年的移动体验中学习
机构 * OPPO ; OpenKG
专题命中 视频多模态 :multimodal(abstract);分类 cs.CL、cs.AI、cs.MM
AI总结 该研究推出MobileMem基准与框架,基于一年移动体验构建,用于设备端长期记忆研究,支持多类推理,推动智能体从信息检索向体验智能发展。
Comments Technical Report; Project Page: http://mobilemem.openkg.cn/
从提示到路面通过时间:代理场景到计划推理中的时间定位
机构 * Computer Science & Engineering Department, German University in Cairo (GUC), Egypt(德国亚历山大大学(GUC)计算机科学与工程系,埃及) ; C-DRiVeS Lab: Cognitive Driving Research in Vehicular Systems, Cairo, Egypt(认知驾驶系统实验室,埃及开罗,C-DRiVeS) ; M.Eng. Robotics Candidate at Deggendorf Institute of Technology, Germany(德国德格多夫技术学院机器人硕士候选人) ; IAV GmbH, Berlin, Germany(德国柏林IAV GmbH公司)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本研究探讨了在代理间通信中引入时间条件是否能保持或增强推理的一致性,而不会降低语义或逻辑一致性,并通过BDD-X数据集的curated子集评估了三种具有递增时间整合的规划器架构。结果表明,时间条件改变了推理风格,但并未在标准NLP正确性指标上产生统计显著改进,但定性分析揭示了预测危险推理、稳定纠正行为和战略分歧。
面向专家级的实时视频问诊医疗AI
机构 * Google Research(谷歌研究院) ; Google DeepMind(谷歌DeepMind)
专题命中 视频多模态 :audio-visual(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本研究开发了基于Gemini的多智能体系统AMIE(视频版),在随机OSCE研究中其临床问诊表现与初级保健医生相当或更优,为专家级实时视频问诊医疗AI的发展奠定了重要基础。
BioKD:通过可靠性门实现面向情感识别的选择性生理信号到视频的知识蒸馏
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; New York University(纽约大学)
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract)
AI总结 本文提出BioKD框架,以生理信号为训练特权信息指导视频学生模型,通过可靠性门控抑制负迁移,在DEAP、AMIGOS数据集上的情感识别任务中优于基线,且推理无额外开销。
一种混合确定性框架用于广播新闻视频中的命名实体提取
机构 * Dept. of Artificial Intelligence University of Malta Msida, Malta(人工智能系 马耳他大学 Msida)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 本文提出一种混合确定性框架,用于自动提取广播新闻视频中的个人姓名,通过可解释的模块化管道实现高精度和可追溯性,适用于新闻媒体信息提取任务。
Comments 7 pages, 5 figures. Accepted for publication at the 2026 IEEE Conference on Artificial Intelligence (CAI)
Journal ref 2026 IEEE Conference on Artificial Intelligence (CAI), 2026, pp. 1134-1139
VisTR:将可视化作为时间序列表推理的表示
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract)
AI总结 针对时间序列表推理难题,VisTR框架以可视化核心,利用其连接数据与认知,通过多模态大语言模型对齐输入,集成机制处理大数据,实现交互式可视化,经评估和案例验证了其在时间序列推理任务中的有效性和适用性。
Comments 15 pages, 10 figures