MM-VID: Advancing Video Understanding with GPT-4V(ision)
专题命中 视频多模态 :multimodal(abstract,comments);分类 cs.CV
Comments Project page at https://multimodal-vid.github.io/
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 视频多模态 :multimodal(abstract,comments);分类 cs.CV
Comments Project page at https://multimodal-vid.github.io/
专题命中 视频多模态 :multimodal(abstract,comments);分类 cs.CV
Comments To appear in CVPR 2023; The code will be released at https://github.com/XudongLinthu/upgradable-multimodal-intelligence
迈向通用的基于骨骼的动作识别
机构 * School of Cyber Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院,南京,中国) ; School of Computer Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院,南京,中国)
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV
AI总结 本文提出了一种基于Transformer的模型,通过统一骨骼表示、动作编码器和多粒度动作-文本对齐,解决异构骨骼动作识别的挑战,实验验证了方法的有效性和泛化能力。
通过结构化奖励强化视频MLLMs的一致性
机构 * Rutgers University(罗格斯大学) ; University of Toronto(多伦多大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 研究通过结构化奖励提升视频MLLMs的一致性,发现传统监督不足,提出结合事实和时间单元的奖励机制,提升视频理解准确性。
Comments Accepted by COLM 2026
解锁表达中的运动:用于指称视频目标分割的时间校准
专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV
AI总结 针对指称视频目标分割中运动语义依赖未显式建模的问题,提出EMC框架,通过MSP、MIC、STSC模块校准运动线索,在6个基准上验证了方法的优越性。
Comments Accept by ACM MM2026
你所问即你所定位:连接问题意图与时序证据以实现定位视频问答
机构 * KAIST(韩国科学技术院) ; Ewha Womans University(梨花女子大学)
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV
AI总结 针对定位视频问答中问题不变定位的失效模式,提出GroundFormer模型,通过可学习通信令牌、因子化MIL交叉注意力等技术,在NExT-GQA和STAR数据集上实现最优性能,提升时序定位的问题区分性。
Comments Accepted at ECCV2026. Code: https://github.com/jinhseo/GroundFormer. Project page: https://jinhseo.github.io/groundformer/groundformer.html
MM-BEV:通过计算关键的位置与时刻提升时效性
机构 * Texas Tech University(德克萨斯理工大学) ; University of Michigan(密歇根大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 MM-BEV是一种遵循「计算关键位置与时刻」的实时多模态BEV系统,通过四种机制优化,在nuScenes数据集和Clearpath Husky A300平台上显著降低延迟,且性能损失极小。
Comments 12 pages, 20 figures
用于稳健光学-SAR目标检测的边界对齐贡献路由
机构 * Tianjin University(天津大学) ; School of Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院)
专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV
AI总结 该研究针对光学-SAR融合目标检测中的负跨模态迁移问题,提出边界对齐贡献路由方法,在M4-SAR和SpaceNet6-OTD实验中提升了检测性能并降低了负迁移率。
PersonaDrive:基于多维驾驶 personas 的可控轨迹预测
机构 * Kyung Hee University(庆熙大学) ; ETRI(韩国电子通信研究院)
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV
AI总结 针对现有轨迹预测方法可控性不足的问题,提出 PCT 数据集与 PersonaDrive 框架,通过多轴设计实现可控轨迹生成,性能优于基线。
Comments Accepted to ECCV 2026
为何视觉无法作为通用桥梁:修正多语言多模态大语言模型(MLLMs)中的模态异步性
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Shenzhen Loop Area Institute(深圳河套学院) ; National Health Data Institute (Shenzhen)(国家健康数据研究院(深圳))
专题命中 视频多模态 :multimodal(abstract);分类 cs.CL
AI总结 针对多语言MLLMs在非英语视觉推理中的性能下降问题,该研究发现其源于“幽灵锚点”模态异步性,提出ANCHOR训练框架,经实验验证可提升跨语言视觉推理性能。
MEDR:基于多信号事件建模与动态重评分的查询无关帧选择
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 该研究提出无需训练的MEDR帧选择方法,通过多信号事件建模与动态重评分实现查询无关,在Video-MME等基准上提升了多模态大语言模型的长视频处理准确率,且帧集可跨问题复用。
Comments 9 pages, 2 figures, 3 tables
从密集预测到视觉编辑:用于统一图像与视频创作的结构化监督
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Celia Research HK ; City University of Hong Kong(香港城市大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 该研究提出基于深度与表面法向量预测的结构化视觉监督框架,共享MMDiT主干实现统一图像视频创作,提升了相关基准任务分数,证明密集监督对下游创作的结构知识迁移价值。
HumanForge:一个具有多智能体伪造原理的以人类为中心的深度伪造视频基准
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 针对视频伪造给数字内容取证带来的挑战,引入HumanForge数据集,提出基于LangGraph的Gen2Anno多智能体管道构建并注释数据集,经测试展现了零样本泛化和细粒度推理的重大挑战,代码和数据集将公开。
Comments 18 pages, 8 figures
基于点监督的骨架人类动作分割
机构 * Southeast University(东南大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出了一种点监督框架,通过多模态骨架数据和新型原型相似性方法,实现了高效的基于骨架的人类动作分割,减少了注释工作量并提升了性能。
RbFT-Net:用于4D雷达-相机深度补全的融合前校正时间雷达锚点
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV
AI总结 本文提出RbFT-Net框架,通过图像条件校正模块校正雷达锚点并选择性传播,解决雷达测量的稀疏与干扰问题,在相关数据集上的深度补全性能优于对比方法。
用于内容推荐的反向心智理论建模:从网页浏览到动态智能界面
机构 * JPMorganChase(摩根大通)
专题命中 视频多模态 :cross-modal(abstract);分类 cs.AI
AI总结 本研究提出反向心智理论(IToM)流程,从用户交互反向推理推断信念与偏好,在OPeRA数据集上验证其画像推断效果,并通过VisionOS应用展示跨模态迁移能力,提升内容推荐的用户理解精度。
Comments Preprint for conference full paper at 20th ACM Conference on Recommender Systems (RecSys '26), Minneapolis, MN, USA
社会对偶性:用于人机交互的关系过程框架
专题命中 视频多模态 :multimodal(abstract);分类 cs.AI
AI总结 本文提出社会对偶性这一关系过程框架,通过嵌套单元定义人机交互过程,经实验验证其可用于分析人机交互中贡献的形成及路径信息。
具身融合智能体:以人为中心的智能体人工智能新范式
机构 * Université de Montréal(蒙特利尔大学) ; Mila – Quebec Artificial Intelligence Institute(米拉-魁北克人工智能研究所) ; Institute of Advanced Intelligence and Computing (IAIC), A*STAR(新加坡科技研究局高级智能与计算研究所) ; Nanjing Medical University(南京医科大学) ; Nanjing University(南京大学) ; Renmin University of China(中国人民大学) ; University of Cambridge(剑桥大学) ; University of Oxford(牛津大学) ; Tsinghua University(清华大学) ; National University of Singapore(新加坡国立大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; The Hong Kong Polytechnic University(香港理工大学) ; Southern University of Science and Technology(南方科技大学) ; Southeast University(东南大学) ; University of Glasgow(格拉斯哥大学) ; Nanyang Technological University(南洋理工大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.AI
AI总结 该研究提出以人为中心的 Combodied Agents 新范式,整合多类智能体能力形成闭环,聚焦人类状态轨迹建模,推动智能体 AI 从任务完成转向人类持续福祉。
Comments 38 pages, 6 figures, 10 tables
迈向能量前沿异质中微子探测器的风格化模型:通过自监督预训练
机构 * IPA, ETH Zürich(瑞士苏黎世联邦理工学院IPA研究所)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出一种稀疏ViT框架,通过自监督预训练学习异质探测器数据的可重用表示,提升中微子风味和charm夸克识别、动量回归和顶点重建性能。
Comments 18 pages, 6 figures
SAR2Agri:学习SAR强度表征用于农业监测
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 本研究提出首个仅用SAR强度影像的自监督学习流水线,通过改进时间预文本任务提升物候特征捕捉能力,在SICKLE基准上的作物类型制图任务中,其IoU较光学基线和现有SAR基线均有显著提升,验证了SAR强度编码器预训练的有效性。
SapiensID 2.0:将人类识别基础模型与人类感知对齐
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 该研究针对现有人类识别模型与人类感知脱节的问题,提出兼具语义与时间感知的SapiensID 2.0框架,通过多项技术实现最优识别性能。
网格是否抹去了事件?用于审计医疗世界模型流程的EndoClock
机构 * Diastole Medical R&D(Diastole医疗研发机构)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 本研究针对医疗世界模型同步预处理可能抹去任务相关证据的问题,提出EndoClock审计方法及四分类法,以超声心动图为例验证其有效性,为医疗AI流程审计提供可执行方案。
Comments Accepted for publication at the 1st MICCAI Workshop on Medical World Models (MWM 2026)
GALA:用于微服务根本原因分析和事件响应的图增强大语言模型智能体
专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI
AI总结 针对微服务RCA的现有方法存在局限,提出图增强LLM智能体框架GALA+,结合STRIX与SURE-Score,在基准测试中性能优于最佳LLM基线,获SRE专家认可。
Comments Proceedings of the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE '26), October 12--16, 2026, Munich, Germany
FemWear:面向女性健康的专用可穿戴设备基础模型
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 视频多模态 :multimodal(abstract);分类 cs.AI
AI总结 本文提出面向女性健康的专用可穿戴基础模型FemWear,通过参数高效方式改造预训练主干,在女性健康相关指标上取得性能提升,但未确立普遍优势与临床有效性。
Comments 11 pages, 4 figures
SportsGrounder:用于密集体育视频推理的提案辅助交错定位框架
机构 * Zhejiang University(浙江大学) ; Beijing Jiaotong University(北京交通大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 针对LMMs难以处理密集体育视频细粒度推理的问题,提出SportsGrounder框架,结合IGF机制与AAS模块,在SoccerNet等数据集上实现最优准确率。
Comments ACMMM 2026
学习物理交互:触觉与力感知机器人学习综述
机构 * Nanyang Technological University(南洋理工大学) ; Stanford University(斯坦福大学) ; University of California, Berkeley(加利福尼亚大学伯克利分校) ; Massachusetts Institute of Technology(麻省理工学院) ; National University of Singapore(新加坡国立大学) ; Georgia Institute of Technology(佐治亚理工学院) ; The University of Tokyo(东京大学) ; ETH Zurich(苏黎世联邦理工学院) ; Harvard University(哈佛大学) ; Imperial College London(伦敦帝国学院) ; KTH Royal Institute of Technology(瑞典皇家理工学院) ; Technical University of Darmstadt(达姆施塔特工业大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 本综述针对力与触觉感知机器人学习研究的空白,提出TF-ART分类法,整合多模态感知与多阶段系统设计视角,兼具算法与实践意义。
Comments 53 pages, 7 figures
单一排序,任意预算:用于长视频理解的套娃式证据到上下文帧选择框架
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出MEC帧选择框架,将长视频帧选择建模为套娃式排序问题,构建单一可复用排序适配任意预算,提升了长视频理解的准确率并降低了选择延迟。
Comments 21 pages, 7 figures, 7 tables
ChronoVision:基于潜在状态重构的时序推理
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 针对多模态大语言模型时序推理不足的问题,本文提出ChronoVision框架,引入Vbvr-VQA数据集,实验显示其在相关基准上取得最优性能。
超越帧选择:用多模态大语言模型重新思考长视频理解
机构 * National Institute of Informatics(信息学研究所)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 针对 MLLMs 长视频理解的帧选择策略难以兼顾全局与局部信息的问题,提出 VideoRouter 模型,通过时间层次结构和验证引导路由器协调全局与局部推理,在 VideoMME 数据集上实现性能提升。
EffectLearner:面向真实世界视频物体移除的世界感知物体-效应推理
专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV
AI总结 该研究提出EffectLearner框架,结合VLM物体-效应推理器与DiT视频擦除器,构建专属数据集EffectWorld并采用渐进式训练,在视频物体移除任务上实现更优性能。
Comments Project: https://morleyolsen.github.io/EffectLearner/