Seq2Seq RNN based Gait Anomaly Detection from Smartphone Acquired Multimodal Motion Data
专题命中 视频多模态 :multimodal(title)
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 视频多模态 :multimodal(title)
专题命中 视频多模态 :multimodal(title)
专题命中 视频多模态 :multimodal(title)
Comments 12 pages, 7 figures
Journal ref Phys. Rev. E 99, 032217 (2019)
专题命中 视频多模态 :multimodal(title)
Comments To appear in the proceedings of the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2018
专题命中 视频多模态 :multimodal(title)
Comments Paper describing dataset. 11 pages; 4 figures
专题命中 视频多模态 :multimodal(title)
Comments 11 pages
超越视觉思维链:用于主动视频推理的内化视觉思维
机构 * Apple(苹果公司)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 该研究提出后训练框架IVT,在训练时内化视觉预测能力,推理时直接生成答案,相较Visual CoT性能相当或更优且延迟降低5倍以上,可实现更高效准确的主动视频推理。
InstructVVT:无需辅助空间先验的指令驱动视频虚拟试穿
专题命中 视频多模态 :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 InstructVVT是基于DiT的视频虚拟试穿框架,通过双层级参考调控方案无需推理时空间先验,在ViViD-S等数据集上优于现有开源方法,解决了现有方法依赖辅助先验的问题。
Comments 23 pages, 10 figures. Dingbao Shao and Song Wu contributed equally. Zili Yi is the corresponding author
GenEraser:通过平衡文本-掩码引导和解耦定位器-保持器实现可泛化的视频对象移除
机构 * Tsinghua University(清华大学) ; Pengcheng National Laboratory(鹏城实验室) ; Huawei(华为) ; Southeast University(东南大学) ; Harbin Institute of Technology(哈尔滨工业大学)
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 提出GenEraser框架,通过多条件混合专家、可学习深度CFG融合机制和解耦专家架构,解决视频对象移除中目标与物理效应同时消除的泛化难题,在ROSE和VOR-Eval上分别提升2.16 dB和1.44 dB。
VidForensics-M1:用于AI生成视频取证的、具备可验证时间定位的元检测强化学习
机构 * Tsinghua University(清华大学) ; Peking University(北京大学) ; Renmin University of China(中国人民大学) ; Microsoft(微软公司)
专题命中 视频多模态 :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 该研究针对AI生成视频检测泛化性不足的问题,首次将元检测引入该领域,提出结合可验证时间证据的VidForensics-M1模型及相关机制,实现了鲁棒可泛化的检测。
Comments 27 pages, 15 figures
基于旅游视频先验的面向目标的导航指令生成
机构 * Uni-Ubi AI(优必爱人工智能) ; Zhejiang University(浙江大学) ; Tongji University(同济大学)
专题命中 视频多模态 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV
AI总结 本研究提出面向目标的视频 grounding 导航指令生成任务VideoNIG,设计两阶段课程学习框架解决该任务,实验表明其可提升指令质量,集成VLN智能体后可实现端到端导航。
StreamArena:面向连续、交互式且长视界的智能体流媒体视频理解
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Xiaohongshu Inc.(小红书公司) ; The University of Hong Kong(香港大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 视频多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV
AI总结 针对当前智能体流媒体视频理解评估的缺陷,提出StreamArena基准,设计StreamMind架构解决连续交互与长视界理解的张力,在四项能力上优于现有基线并降低延迟。
视觉表示很重要:利用视频到音频生成中的时间差异
专题命中 视频多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV
AI总结 针对现有基于条件扩散的视频到音频(V2A)生成方法需额外网络或强归纳偏置的问题,提出TD-V2A框架,利用时间差异(TD)增强视觉条件,提升了V2A生成质量。
FORGE:用于长视频理解的相关几何中的帧正交性
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Center for Signal and Information Processing (CSIP)(信号与信息处理中心 (CSIP)) ; School of Electrical and Computer Engineering(电气与计算机工程学院)
专题命中 视频多模态 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV
AI总结 研究长视频理解中推理时最大化查询相关信息问题,提出FORGE模型无关方法,通过在预训练嵌入空间引入查询条件几何统一相关性和多样性,实验证明该方法在关键帧选择和问答上有显著提升。
Comments Under Review
超越帧选择:用于长视频理解的生成式潜在证据聚合
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Baidu Inc.(百度公司) ; Alibaba Group(阿里巴巴集团) ; Xidian University(西安电子科技大学)
专题命中 视频多模态 :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 该研究针对长视频理解的帧选择局限,提出GenEvA框架,通过查询条件化分布聚合跨帧潜在证据,在四个基准和两个视频多模态大语言模型主干上显著提升性能且开销极低。
稀疏超图增强的帧事件目标检测与细粒度MoE
机构 * BNRist, THUIBCS, BLBCI, School of Software, Tsinghua University(清华大学软件学院,北京信息科学与技术国家研究中心,清华-英特尔先进移动计算中心,北京国家信息科学与技术实验室) ; State Key Laboratory of Heavy Oil Processing, China University of Petroleum (Beijing)(中国石油大学(北京)重质油国家重点实验室)
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出Hyper-FEOD框架,通过稀疏超图增强交叉模态融合和细粒度MoE增强模块,实现高效的多模态交互优化,提升动态环境下目标检测的准确率与效率。
OmniReasoner:通过原生工具使用进行长音频-视频推理
专题命中 视频多模态 :cross-modal(abstract);omni-modal(abstract);分类 cs.CV
AI总结 针对长音频-视频推理难题,OmniReasoner提出工具使用后训练框架,通过监督微调与强化学习让全模态语言模型学会调用放大工具,利用TimeAnchor保持时间参数一致性,借助时间增强数据引擎实现可训练,提升了答案准确性与时间定位能力。
缓解零样本视频时刻检索中的模态和语言风格差距
机构 * Sungkyunkwan University(成均馆大学)
专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV
AI总结 研究零样本视频时刻检索中模态和语言风格差距问题,提出基于自相似性的时刻提议和评分方法及查询感知的多模态大语言模型推理阶段,有效缓解差距,在相关基准测试中达最优性能。
Comments ECCV 2026 (* These authors contributed equally.)
认识自我,理解世界:用于基于多模态大语言模型的无人机时空推理的双认知基准测试
机构 * Northwestern Polytechnical University(西北工业大学) ; China University of Petroleum(中国石油大学)
专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV
AI总结 该研究针对多模态大语言模型在无人机场景双认知能力评估不足的问题,提出UAV-DualCog基准测试,涵盖图像和视频任务,通过自动化管道构建数据,评估发现现有模型存在瓶颈,该基准测试有价值。
Comments 11 pages, 4 figures, 7 tables. Project website: https://uav-dualcog.lozumi.com
视频 = 世界 + 事件流
机构 * Alibaba Group(阿里巴巴集团)
专题命中 视频多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV
AI总结 研究提出Wan-Streamer v0.3,将视频视为世界加事件流,据此有通用预训练任务,应用于实时全双工视听交互,保留v0.2运行点,为实时下游任务提供能力。
Comments website: https://wan-streamer.com/v0.3/
迈向可预测、对齐且可扩展的机器人学习
机构 * Astribot Team(Astribot团队)
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.AI
AI总结 研究旨在实现可预测、对齐且可扩展的机器人学习。核心方法是引入Lumo - 2潜在世界 - 动作模型,提出多阶段模态预对齐策略。主要贡献是该模型在实证研究中表现出色,优于基线,验证了结构化多模态对齐和预测推理对具身智能的重要性。
长期体育视频中的时间组成推理方法
机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS)
专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV
AI总结 本文提出SportsTime基准和CoTR方法,通过时间接地证据组成提升体育视频长期推理能力,优于现有多模态大语言模型。
通过多尺度卷积和动态路由实现下一代网络的语义视频通信
机构 * Graduate School of Fundamental Science and Engineering, Waseda University(早稻田大学基础科学与工程研究生院) ; Generative AI Innovation Center, Amazon Web Services(亚马逊网络服务生成人工智能创新中心) ; Amazon(亚马逊)
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 针对视频流量增长需求,提出语义视频通信框架,用多尺度时间卷积编码器捕捉运动模式,基于胶囊的动态路由机制优化关联,多任务学习统一组件,在实验中取得显著改进。
Comments Accepted at the AAAI 2026 Workshop on AI for Time Series (AI4TS)
EVA-Net: 基于视频衍生运动先验的跨被试脑电运动解码
机构 * South China University of Technology(华南理工大学)
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.AI
AI总结 提出EVA-Net两阶段框架,利用动作视频作为语义先验,通过跨模态对比学习和对齐减少个体差异,实现跨被试脑电运动解码,在EEGMMI上取得8.66%的LOSO准确率提升。
GuideMe:流视频中的多域任务指导与干预
机构 * City University of Hong Kong(香港城市大学) ; Huawei Research(华为研究院) ; University of Science and Technology of China(中国科学技术大学) ; Chinese University of Hong Kong(香港中文大学) ; City University of Hong Kong (Dongguan)(香港城市大学(东莞))
专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV
AI总结 构建流视频多域基准GuideMe,支持训练和评估用于闭环交互任务指导的MLLMs,设计评估框架衡量模型能力,实验发现现有MLLMs虽擅提供指令,但难识别执行错误并反馈。
Comments ECCV 2026
MoVA: 面向模块化长视频-文本对齐的非对称双投影学习
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 视频多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV
AI总结 针对视频-文本对比学习中时间错位和语义不对称问题,提出MoVA框架,通过非对称双投影(文本侧自适应选择帧感知子空间,视频侧解缠文本相关视觉概念)实现灵活对齐,在多个任务上超越现有方法。
Comments ECCV 2026
MAVFusion: 基于运动感知稀疏交互的高效红外与可见光视频融合
机构 * Foshan University(佛山大学) ; Kunming University of Science and Technology(昆明理工大学) ; China University of Mining and Technology(中国矿业大学)
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 提出MAVFusion端到端视频融合框架,通过运动感知稀疏交互机制,利用光流识别动态区域并分配跨模态注意力,对静态区域使用轻量弱交互模块,在保持时间一致性和细节的同时加速推理,达到14.16 FPS。
Comments Accepted at ECCV 2026
面向机器的对称熵约束视频编码
专题命中 视频多模态 :MLLM(abstract,abstract_cn);分类 cs.MM
AI总结 提出SEC-VCM框架,通过双向熵约束机制对称对齐视频编解码器与视觉骨干网络,保留语义并丢弃无关信息,结合语义-像素双路径融合提升机器视觉任务性能,在多项任务上显著优于H.266/VVC。
Comments Accepted by IEEE Transactions on Image Processing. This is the author's accepted manuscript (AAM)
面向高效流式视频理解的动态固定预算记忆库
机构 * Xiamen University(厦门大学)
专题命中 视频多模态 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV
AI总结 提出无训练方法CausalMem,通过在线语义基动态更新记忆库,在有限预算下最大化流式视频信息量,实现20倍视觉令牌压缩和82MB存储。
FeVOS:前瞻性表达视频目标分割
机构 * Institute of Big Data, College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与技术学院大数据研究所)
专题命中 视频多模态 :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 提出前瞻性表达视频目标分割任务,通过推理时空线索预测未来目标,并构建FeVOS数据集和FeVOS-R1模型,实现最先进性能。
Comments Accepted by ECCV 2026. Homepage: https://henghuiding.com/FeVOS/