FibVLA: An Efficient Temporal Vision-Language-Action Model with Fibonacci Sampling
FibVLA:一种采用斐波那契采样的高效时序视觉-语言-动作模型
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出FibVLA框架,通过对数事后采样和流匹配等技术,解决了视觉-语言-动作模型时序信息捕捉与推理效率的矛盾,提升了动作性能与实时响应能力。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
FibVLA:一种采用斐波那契采样的高效时序视觉-语言-动作模型
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出FibVLA框架,通过对数事后采样和流匹配等技术,解决了视觉-语言-动作模型时序信息捕捉与推理效率的矛盾,提升了动作性能与实时响应能力。
LENS:用于长视频关键帧采样的自适应时空缩放
机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV
AI总结 研究针对长视频理解受限于上下文窗口的问题,提出无需训练的关键帧采样框架LENS,它能基于文本查询动态分配帧预算,在时空缩放间平衡,提升关键帧采样效果,优于现有方法,提高了Video-MME准确率。
Comments Accepted at ECCV 2026. Project page: https://zhangce01.github.io/LENS/
扩展现实作为人机协作中情境化人类控制的中介层
专题命中 视频多模态 :multimodal(abstract);分类 cs.AI
AI总结 研究探讨扩展现实在人机协作中作为情境化人类控制中介层的作用,通过床边护理等场景阐述观点,确定四种中介功能和六个设计维度,为使机器人自主性在动态环境中更具操作性和问责性的XR系统规划研究议程。
Comments Accepted to 2026 IEEE International Symposium on Mixed and Augmented Reality Adjunct (ISMAR-Adjunct)
用于模态缺失的RGBT跟踪的时空条件去噪Transformer
机构 * School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) ; School of Artificial Intelligence, Anhui University(安徽大学人工智能学院)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 针对RGBT跟踪中模态缺失致性能下降问题,提出时空条件去噪Transformer(SCDT)。它整合时空线索,通过利用不同时间线索及噪声调制适应机制,在统一框架下实现缺失模态信息重建等,实验证明其性能优于现有方法。
Comments Accepted by CVPR2026
ReflexTrack:一种用于无训练的引用视频对象分割的反馈驱动智能体
机构 * School of Artificial Intelligence and Computer Science, Jiangnan University(江南大学人工智能与计算机科学学院) ; Centre for Vision, Speech and Signal Processing, University of Surrey(萨里大学视觉、语音和信号处理中心)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 研究针对引用视频对象分割问题,提出无训练、反馈驱动的ReflexTrack智能体。通过掩码引导空间细化和视频级掩码反射实现空间与时间层面反馈,提升预测可靠性,在Ref-VPS和ReasonVOS上取得较好分数。
CALMRec:用于长期推荐的因果对齐语言记忆
机构 * Shenzhen University(深圳大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.AI
AI总结 研究针对当前大语言模型推荐器的问题,提出CALMRec框架,利用冻结多模态语言模型转换信息,维护多种记忆,通过倾向加权更新等减少偏差,在多环境评估中表现良好,提升了折扣长期价值,释义基准上语义原子NDCG显著提高。
神经形态目标检测:深入研究与未来方向
机构 * Peking University(北京大学) ; Peng Cheng Laboratory(鹏城实验室) ; Harbin Institute of Technology(哈尔滨工业大学) ; Chinese Academy of Sciences(中国科学院) ; Italian Institute of Technology(意大利理工学院) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Pittsburgh(匹兹堡大学) ; Sorbonne Université(索邦大学) ; INSERM(法国国家健康与医学研究院) ; CNRS(法国国家科学研究中心) ; Institut de la Vision(视觉研究所)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 针对传统相机在特定条件下目标检测的挑战,本文对神经形态目标检测算法进行全面调查和基准测试,从多视角探索现有方法,评估多种模型并分析结果,讨论未解决问题,为该领域研究提供资源与方向。
Comments Accepted by Proceedings of the IEEE
基于迁移学习的视频游戏状态异构预测多任务学习
专题命中 视频多模态 :multimodal(abstract);分类 cs.AI
AI总结 研究视频游戏状态异构预测,通过适配多模态架构,采用跨任务联合训练共享模型,结合多种信息,经实验比较单多任务训练、评估策略及测试预训练等,还研究游戏内迁移,以降低成本并提升泛化能力。
ViSTR-Bench:多模态大语言模型能否从动态场景中的连续视觉线索进行推理?
机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) ; Zhongguancun Academy(中关村科学城) ; School of Engineering, Westlake University(西湖大学工学院) ; School of Transportation Science and Engineering, Beihang University(北京航空航天大学交通科学与工程学院)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 研究聚焦多模态大语言模型在动态场景中从连续视觉线索推理的能力,提出ViSTR-Bench评估套件,基于相关原则建立四维评估,含15个子任务和1340个问答对,经评估发现当前模型在复杂时空推理上有瓶颈,远不及人类。
Comments 37 pages, 37 figures
ChronoStitch:用于长时程时间推理的视觉键值记忆的免训练组合
机构 * KGraph AI Solutions Pvt. Ltd.(KGraph人工智能解决方案私人有限公司)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 针对长视频问答中视觉KV记忆组合问题,ChronoStitch提出免训练方法,先将键值重基于全局坐标系,解决几何不一致问题,再处理残余内容差距,通过选择性重新计算部分视觉令牌,提升事件排序准确性且运行速度更快。
Comments 6 pages, 4 tables
SkyEV:RGB-事件无人机检测与跟踪数据集及基线
机构 * ETH Zurich(苏黎世联邦理工学院)
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV
AI总结 针对无人机检测数据集存在的问题,引入开源数据集SkyEV,其含高度同步的未压缩RGB和基于事件的数据,能捕捉复杂现实条件。提供统一数据加载器,用多模态架构建立实验基线,证明该数据集对检测小尺度目标有效。
ConsiSpace:学习几何一致性对视频空间推理很重要
机构 * School of Intelligent Science and Technology, Nanjing University(南京大学智能科学与技术学院) ; School of Computer Science, Peking University(北京大学计算机科学学院) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 针对视频空间推理中现有模型难以聚合一致空间证据的问题,提出ConsiSpace框架,通过构建几何一致内存及采用统一一致性自监督强化学习,在三个空间推理基准测试上取得成绩提升,平均得分比最强基线高12.6分。
Comments ECCV 2026
RainDancer:基于面向降雨的脉冲动力学的RGB-事件视频去雨
机构 * School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) ; School of Computer Science and Technology, Harbin University of Science and Technology(哈尔滨理工大学计算机科学与技术学院)
专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV
AI总结 研究针对视频去雨问题,提出RainDancer框架,基于分解-交互范式,在RGB和事件分支分别处理,分离雨和背景成分,进行组件级融合,并引入事件域监督,实验表明该方法在多方面性能优越。
迈向野外空间超感知
机构 * Tsinghua University(清华大学) ; NVIDIA(英伟达) ; Stanford University(斯坦福大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 研究针对空间超感知中多模态模型基准测试局限于合成视频和家庭场景的问题,引入VSI-Super-Wild基准,受人类认知启发探究世界状态三元组,通过大量真实视频问答对测试发现模型不足及失败模式,为空间超感知发展指明方向。
Comments Accepted to ECCV 2026. Project page: https://vsi-super-wild.github.io/
TRACE-PCa:在主动监测期间从纵向MRI预测前列腺癌进展
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 研究提出TRACE-PCa模型,无需病变分割,通过预训练3D MRI模型编码序列扫描,引入时间注意力门,融合临床变量,在纵向AS队列验证中表现出色,能减少不必要活检,有预测前列腺癌进展的潜力。
Comments 7 pages, 4 figures
MiMo-V2.5系列的全流程推理优化:将混合滑动窗口注意力效率推向极限
专题命中 视频多模态 :multimodal(abstract);分类 cs.AI
AI总结 针对MiMo-V2.5模型家族,结合Hybrid SWA、MoE和多模态编码器进行全流程推理优化。通过多种策略优化KVCache系统,构建GCache并开发路由器,还优化多模态输入,构成首个有效涵盖该复合架构的大规模LLM生产服务系统。
Comments technical report
用于夜间高速公路感知的事件-RGB自适应跟踪
机构 * School of Intelligent Systems Engineering, Sun Yat-sen University(中山大学智能系统工程学院) ; School of Intelligence Science and Engineering, Harbin Institute of Technology(哈尔滨工业大学智能科学与工程学院)
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV
AI总结 针对高速公路夜间低光条件下RGB感知性能差的问题,提出JEAT框架,通过自适应扩展卡尔曼滤波器动态融合事件流与RGB帧,还创建SEHN数据集,为多模态融合研究提供支持。
TreeSoc:用于足球视频理解的树状结构动态推理与工具协同
机构 * University of Science, VNU-HCM(胡志明市越南国立大学科学大学)
专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV
AI总结 针对当代视觉语言模型理解足球视频的挑战,提出TreeSoc框架,通过动态深度优先搜索机制分解查询,支持自适应工具路由,在多个数据集上取得优异成绩,证明其为视频理解的有效范式。
Comments Accepted to ICMV 2026
VINE:驯服强化学习中的生成控制策略
机构 * AgiBot(未知机构) ; The Hong Kong University of Science and Technology(香港科技大学) ; Peking University(北京大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.AI
AI总结 研究针对流匹配策略在值梯度强化学习中训练不稳定的问题,提出VINE方法。该方法通过在去噪步骤重建插值状态,创建稳定可微路径,实现稳定的端到端值梯度优化,在相关基准和任务中表现优于现有方法。
DynaFilter:用于卫星边缘智能的云驱动动态过滤
机构 * Politecnico di Milano(米兰理工大学) ; Harbin Institute of Technology Shenzhen(哈尔滨工业大学(深圳))
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 针对卫星边缘系统带宽受限等问题,设计DynaFilter动态过滤技术,通过建立云查询语义与压缩域特征的映射,让边缘设备在压缩域直接进行选择性RoI推理,实现减少数据量、节省带宽、降低能耗及加快推理延迟等效果。
Comments 15 pages, 23 figures, accepted by ACM MobiCom 2026
四足机器人的行为基础:ABot-C0技术报告
机构 * Alibaba Group(阿里巴巴集团)
专题命中 视频多模态 :multimodal(abstract);分类 cs.AI
AI总结 该研究聚焦四足机器人运动控制,提出ABot-C0通用系统,构建数据金字塔生成运动片段,训练流匹配通用策略展示跟踪缩放定律,采用特定框架推动全地形遍历运动,经实验验证其能让四足机器人迈向产品级行为智能。
Comments Abot-C0 project page will be released soon
学习统一可变形形状和纹理表示用于心脏视频分类
机构 * University of Virginia(弗吉尼亚大学)
专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV
AI总结 针对心脏视频分类,现有方法简单拼接形状与纹理特征未充分利用互补性。本文提出新模型,在综合空间学习时间特征,设计双向交叉注意力融合特征,能动态调整贡献,在CMR视频数据集上达最优性能,提高了可解释性。
基于3D感知语言模型的自我-人类运动预测
机构 * Visual Intelligence Lab., KAIST(视觉智能实验室,韩国科学技术院)
专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV
AI总结 研究从自我中心视角预测人类运动问题,提出Ego3DLM模型,基于准确运动预测需3D环境理解及姿势语言整体预测原则,通过三阶段训练,在相关任务中取得领先性能,实现跨模态和时间一致的运动预测。
Comments Accepted to ECCV 2026
Video2Reaction:将视频映射到自然环境中的观众反应分布
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; Dolby Laboratories(杜比实验室)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 研究旨在通过Video2Reaction数据集实现视频到观众反应分布预测,开发仅用开源语言模型的两阶段多智能体管道,建立基准,发现预训练模型零样本失败,微调可提升性能,但任务仍具挑战。
SparseCtrl-HOI:用于人机交互视频生成的稀疏时间控制
机构 * South China University of Technology(华南理工大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 研究针对人机交互视频生成中建模物理动力学及时空协调复杂、现有方法依赖密集指导成本高且影响多样性的问题,提出SparseCtrl-HOI框架,用关键帧结合新机制和模块控制,构建数据集,降低标注开销,提升直播电商视频质量。
Comments ECCV 2026, Project Page: https://mpi-lab.github.io/SparseCtrl-HOI
通过行为和语言模式对信息操作用户进行无监督异常检测
机构 * RMIT University(皇家墨尔本理工大学) ; Macquarie University(麦考瑞大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.AI
AI总结 研究针对社交媒体网络信息操作检测难题,提出无监督方法TENSOR,利用多模态数据,通过训练时间点过程捕捉异常行为模式,并引入新证据函数调整输出,在五个真实数据集上表现优于基线。
Comments Accepted at ECML/PKDD 2026
QSVideo:用于视频理解的查询条件语义时间检索
机构 * Michigan State University(密歇根州立大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 针对视频理解中视觉语言模型性能随视频时长下降问题,提出QSVideo框架,通过查询条件语义排序器、联合优化相关性和多样性及时间对齐策略,提升视频VLM性能。
Comments ECCV 2026
PRISM3D:极端运动模糊下物理一致场景建模的概率细化与鲁棒初始化
机构 * Computational Imaging Lab, Dept. of Electrical Engineering, IIT Madras(印度理工学院马德拉斯分校电气工程系计算成像实验室)
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV
AI总结 研究从极端运动模糊图像进行盲3D场景重建问题,提出PRISM3D框架,用鲁棒初始化策略结合概率物理方法,还介绍多模态扩展PRISM3D-E及基准,实验表明其达新的最优性能。
Comments Accepted to ECCV-26
一种成本感知的配对协议,用于审计智能视频问答中的动态工具合成
机构 * Texas A&M University(德克萨斯农工大学) ; Hamad Bin Khalifa University(哈马德·本·哈利法大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 提出成本感知的配对协议,联合评估准确性与成本,揭示动态工具合成在视频问答中的效率与代价。
学习演化场景:用场景图推理人类活动
机构 * Politecnico di Torino(托斯托大学)
专题命中 视频多模态 :MLLM(abstract_cn);分类 cs.CV
AI总结 提出SG-Ego标注集和GLEN模型,通过时空场景图显式建模人-环境交互的动态演化,实现活动驱动的场景变化推理与预测。
Comments Project page at https://francescapistilli.github.io/GLEN