VideoChat-A1: Thinking with Long Videos by Chain-of-Shot Reasoning
VideoChat-A1: 通过镜头链推理实现长视频的思考
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV
AI总结 VideoChat-A1通过镜头链推理方法,有效解决长视频理解难题,实现优于现有方法的性能,同时在效率上更具优势。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
VideoChat-A1: 通过镜头链推理实现长视频的思考
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV
AI总结 VideoChat-A1通过镜头链推理方法,有效解决长视频理解难题,实现优于现有方法的性能,同时在效率上更具优势。
基于面部引导的弱监督时间情感定位边界增强
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出FSENet框架,通过面部特征引导情感定位,解决弱监督时间情感定位中的边界不精确问题,实现跨不同标注设置的高泛化能力。
一种具备技能的代理框架和多视频理解基准
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出MVX-Bench多视频跨维基准和SAMA框架,通过整合视觉工具和技能实现结构化推理,实验显示其在多视频理解任务中优于现有基线模型。
OCRA:基于3D和触觉先验的人到机器人动作迁移的物体中心学习
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 OCRA通过结合3D和触觉先验,利用多视角视频和先进模型重建物体中心3D点云,生成稳健的机器人操作动作,实验表明其在视觉和视觉-触觉任务中优于现有方法。
Comments Project page: https://sressers.github.io/OCRA/
BROTHER: 通过异质性集成正则化优化行为识别以应对矛盾与犹豫
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出BROTHER框架,通过异质集成正则化方法,结合视觉、音频和语言数据,提升对矛盾与犹豫等复杂行为状态的识别能力,采用PSO硬投票集成策略,实现宏F1分数达0.7465。
Comments 5 pages, 2 figures, 3 tables, Ambivalence/Hesitancy (AH) Video Recognition Challenge, ABAW10th, CVPR2026
展示时间与地点:迈向野外的指称视频对象分割
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出了一种新的野外指称视频对象分割任务,引入了包含更多时长和场景的YoURVOS数据集,并提出OMFormer方法以实现高效的时空定位。
GoldenStart: 基于Q引导先验和熵控制的流策略蒸馏
专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI
AI总结 本文提出GoldenStart方法,通过Q引导先验和显式熵控制,改进流匹配策略的生成起点和探索能力,实现在连续控制任务中高效且具有探索性的策略。
Comments 23 pages, 13 figures
V-CORE:面向视频大语言模型的时序一致视频理解
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 V-CORE通过引入显式时序约束提升视频理解性能,采用可学习空间聚合和因果感知时间投影器,有效解决视频时序一致性问题,在多个基准测试中取得显著成果。
Comments 7 pages, 4 figures
通过高效后预训练收获视频基础模型
专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV
AI总结 本文提出一种高效框架,通过随机丢弃视频片段和遮蔽文本来从图像基础模型中获取视频基础模型,提升了训练效率并强化了跨模态融合,实验表明其在多种视频-语言任务中达到SOTA性能。
WAT:在线视频理解需要先观看再思考
机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(国家人类-机器混合增强智能重点实验室,人工智能与机器人研究院,西安交通大学) ; Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) ; University of Science and Technology Beijing(北京科技大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 WAT提出双阶段框架,通过分阶段处理实现在线视频理解,结合查询与短期记忆进行跨时间推理,实验显示在多个基准上表现优异。
VLD:用于强化学习导航的视觉语言目标距离
机构 * ETH Zurich(苏黎世联邦理工学院) ; EPFL(瑞士联邦理工学院) ; Stanford University(斯坦福大学) ; UC Berkeley(伯克利大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出VLD学习框架,通过解耦感知学习与策略学习,利用大规模视频数据训练距离预测器,提升机器人导航性能与现实迁移能力。
一步流策略:用于快速视觉-运动策略的自蒸馏
专题命中 视频多模态 :multimodal(abstract);分类 cs.AI
AI总结 本文提出一步流策略,通过自蒸馏实现高保真单步动作生成,无需预训练教师模型,有效提升动作生成速度和控制精度。
提示低估了LLM在时间序列分类中的能力
机构 * The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CL
AI总结 研究通过对比提示输出与线性探针,揭示LLM在时间序列分类中的实际能力被提示评估低估,且早期Transformer层能有效捕捉时间序列信息。
Comments 8 pages + Appendix and References, 9 figures
Stay in your Lane: 角色特定查询与重叠抑制损失用于密集视频描述
机构 * Konkuk University(韩国康 kuk 大学) ; Sejong University(世宗大学) ; KAIST(韩国科学技术院)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出角色特定查询与重叠抑制损失,用于解决密集视频描述中的多任务干扰和时间冗余问题,通过分离定位与描述任务并增强语义一致性,提升描述精度。
Comments Accepted to CVPR 2026
超越单样本:面向视频理解的可靠多样本蒸馏
机构 * University of Electronic Science and Technology of China & Robotics Center(电子科技大学 & 机器人中心)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出R-MSD方法,通过任务自适应教师池和对抗蒸馏目标提升视频理解任务的蒸馏稳定性,实验显示在多个基准上优于单样本蒸馏方法。
SkeletonAgent: 一种基于骨架的动作识别代理交互框架
机构 * NLPR, Institute of Automation, Chinese Academy of Sciences(神经信息处理研究室,自动化研究所,中国科学院) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV
AI总结 SkeletonAgent通过Questioner和Selector两个代理连接识别模型与LLM,提升基于骨架的动作识别性能。
VirtueBench: 在长视频理解中评估在不确定性下的可信度
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 VirtueBench通过评估模型在不确定性下的可信度,揭示了长视频理解中模型拒绝行为的差异及可靠性问题。
Comments Accepted to CVPR 2026
Holi-Spatial: 将视频流转化为整体3D空间智能
机构 * Shanghai AI Lab(上海人工智能实验室) ; Northwestern Polytechnical University(西北工业大学) ; Shanghai Jiao Tong University(上海交通大学) ; Peking University(北京大学) ; Nanyang Technological University(南洋理工大学) ; Beihang University(北京航空航天大学) ; Sichuan University(四川大学) ; Tsinghua University(清华大学) ; The Chinese University of Hong Kong(香港中文大学) ; Fudan University(复旦大学) ; Hong Kong University of Science and Technology(香港科技大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 Holi-Spatial通过自动化方法构建大规模多模态3D空间数据集,提升空间推理任务的模型性能。
Comments project page: https://visionary-laboratory.github.io/holi-spatial/
时间之流中的语言:将时间序列配对文本编织成统一的时间叙事
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Meta ; IBM Research(IBM研究院)
专题命中 视频多模态 :multimodal(abstract);分类 cs.AI
AI总结 本文提出TaTS框架,将时间序列配对文本作为辅助变量,提升多模态时间序列预测性能。
Comments ICLR 2026, 47 pages
HERO: 分层嵌入-细化用于视频中开放词汇时间句接地
机构 * Laboratory of Complex Systems Modeling and Simulation, School of Computer Science and Technology, Hangzhou Dianzi University(电子科技大学复杂系统建模与仿真实验室,计算机科学与技术学院) ; Zhejiang Key Laboratory of Space Information Sensing and Transmission, Hangzhou Dianzi University(浙江省空间信息感知与传输重点实验室,电子科技大学) ; Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理与认知科学系)
专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV
AI总结 HERO提出一种分层嵌入-细化框架,用于视频中开放词汇时间句接地,通过多级语义建模和跨模态细化提升视频与语言的对齐能力。
从人机交互中学习下一步动作预测器
机构 * Stanford University(斯坦福大学) ; Hasso Plattner Institute(哈索普拉特纳研究所) ; New York University(纽约大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CL
AI总结 本文提出LongNAP模型,通过结合参数化和上下文学习,从用户行为的完整上下文中预测下一步动作,显著优于传统方法。
Comments 32 pages, 10 figures, see https://generalusermodels.github.io/nap
UniTS:面向遥感的统一时空生成模型
机构 * Jockey Club STEM Laboratory of Quantitative Remote Sensing(裘英俊STEM实验室(定量遥感)) ; Department of Geography, the University of Hong Kong(香港大学地理系) ; School of Information and Electronics, Beijing Institute of Technology(北京理工大学信息电子学院) ; Beijing Key Laboratory of Fractional Signals and Systems(北京分数信号与系统重点实验室) ; Department of Electrical and Computer Engineering, University of Delaware(德雷塞尔大学电气与计算机工程系)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 UniTS提出了一种统一时空生成模型,整合时间序列重建、云去除、语义变化检测和预测等任务,通过自适应条件注入和时空感知调节器提升多模态生成质量,有效应对复杂环境挑战。
RED: 基于事件引导的鲁棒运动去模糊化与模态特定解耦
机构 * Xidian University(西安电子科技大学) ; vivo Mobile Communication Co., Ltd.(vivo移动通信有限公司)
专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV
AI总结 RED通过事件引导的鲁棒运动去模糊化方法,结合模态特定解耦与选择性融合,提升模糊图像的清晰度和鲁棒性。
NarrLV: 向长视频生成的综合性叙事导向评估迈进
机构 * UCAS ; CASIA(中国科学院自动化研究所) ; AMAP, Alibaba Group(阿里云实验室) ; NTU(国立科技大学) ; PKU(北京大学)
专题命中 视频多模态 :MLLM(abstract);分类 cs.CV
AI总结 NarrLV是首个针对长视频生成模型的综合性叙事评估基准,通过引入时间叙事原子和基于MLLM的评估指标,全面评估模型在叙事表达上的能力。
Comments Project Page: https://amap-ml.github.io/NarrLV-Website/
VidGuard-R1: 通过推理MLLMs和RL进行AI生成视频检测与解释
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Microsoft Research(微软研究院)
专题命中 视频多模态 :MLLM(abstract);分类 cs.CV
AI总结 VidGuard-R1通过推理MLLMs和强化学习,实现AI生成视频的高准确检测与可解释性分析。
Comments Accepted to ICLR 2026
PRAM-R:一种具有LLM引导模态路由的感知-推理-行动-记忆框架,用于自适应自动驾驶
专题命中 视频多模态 :multimodal(abstract);分类 cs.AI
AI总结 PRAM-R通过LLM引导的模态路由和分层记忆模块,实现高效自适应的多模态感知,提升自动驾驶的稳定性和效率。
Sim2Sea: 用于拥挤水域船舶导航的仿真到现实策略迁移
机构 * Institute of Automation, CAS(中国科学院自动化研究所) ; School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) ; Zhongguancun Academy(中关村学院) ; University College London(伦敦大学学院)
专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI
AI总结 Sim2Sea通过GPU加速模拟器、双流时空策略和领域随机化方案,实现了拥挤水域中船舶自主导航的仿真到现实策略迁移。
RIVER:面向视频大语言模型的实时交互基准
机构 * School of Information Science And Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学) ; State Key Lab of Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 RIVER基准通过引入实时交互任务框架,改进视频大语言模型的实时交互能力,提升长期记忆与未来感知表现。
基于动作的视频分割:面向具身智能的标签噪声鲁棒动作引导分割
机构 * School of Artificial Intelligence and Robotics and the National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University, China(人工智能与机器人学院及机器人视觉感知与控制技术国家工程研究中心,湖南大学,中国) ; Institute for Anthropomatics and Robotics, Karlsruhe Institute of Technology, Germany(人机学与机器人研究所,卡尔斯鲁厄理工学院,德国)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 本研究首次探索基于动作的视频对象分割在标签噪声下的鲁棒性,引入两种噪声类型并提出并行掩码头机制以提升分割性能。
Comments Accepted to ICRA 2026. The established benchmark and source code will be made publicly available at https://github.com/mylwx/ActiSeg-NL
视频令牌通信:基于UEP的自适应源信道编码的文本意图引导多速率视频令牌通信
机构 * GIC & 6GIC, Institute for Communication Systems (ICS), University of Surrey(5GIC与6GIC,通信系统研究所(ICS),塞夫尔大学) ; Smart Internet Lab, University of Bristol(智能互联网实验室,布里斯托尔大学) ; British Telecom Research Lab, BT Group plc(英国电信研究实验室,BT集团)
专题命中 视频多模态 :multimodal(abstract);分类 cs.MM
AI总结 本文提出基于UEP的自适应源信道编码的视频令牌通信框架,通过文本意图引导的多速率视频通信提升语义保真度和传输效率。