arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 2861 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 320 篇

2607.29596 2026-08-03 cs.RO cs.CV 新提交 57%

FibVLA: An Efficient Temporal Vision-Language-Action Model with Fibonacci Sampling

FibVLA:一种采用斐波那契采样的高效时序视觉-语言-动作模型

Li Lin, Wujun Xu, Weiwei Meng, Kaiwen Xia, Kang Hao Cheong, Shuai Wang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出FibVLA框架,通过对数事后采样和流匹配等技术,解决了视觉-语言-动作模型时序信息捕捉与推理效率的矛盾,提升了动作性能与实时响应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25125 2026-07-29 cs.CV 新提交 57%

LENS: Adaptive Spatio-Temporal Zooming for Keyframe Sampling in Long-Form Videos

LENS:用于长视频关键帧采样的自适应时空缩放

Ce Zhang, Jinxi He, Katia Sycara, Yaqi Xie

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 研究针对长视频理解受限于上下文窗口的问题,提出无需训练的关键帧采样框架LENS,它能基于文本查询动态分配帧预算,在时空缩放间平衡,提升关键帧采样效果,优于现有方法,提高了Video-MME准确率。

Comments Accepted at ECCV 2026. Project page: https://zhangce01.github.io/LENS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25047 2026-07-29 cs.HC cs.AI cs.RO 新提交 57%

Extended Reality as a Mediation Layer for Situated Human Control in Human-Robot Teaming

扩展现实作为人机协作中情境化人类控制的中介层

Jens Grubert, John Dudley, Eyal Ofek, Per Ola Kristensson

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 研究探讨扩展现实在人机协作中作为情境化人类控制中介层的作用,通过床边护理等场景阐述观点,确定四种中介功能和六个设计维度,为使机器人自主性在动态环境中更具操作性和问责性的XR系统规划研究议程。

Comments Accepted to 2026 IEEE International Symposium on Mixed and Augmented Reality Adjunct (ISMAR-Adjunct)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24701 2026-07-28 cs.CV 新提交 57%

Spatio-Temporal Conditional Denoising Transformer for Modality-Missing RGBT Tracking

用于模态缺失的RGBT跟踪的时空条件去噪Transformer

Andong Lu, Ziyi Zha, Jiandong Jin, Shihao Li, Chenglong Li, Jin Tang, Bin Luo

机构 * School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) School of Artificial Intelligence, Anhui University(安徽大学人工智能学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对RGBT跟踪中模态缺失致性能下降问题,提出时空条件去噪Transformer(SCDT)。它整合时空线索,通过利用不同时间线索及噪声调制适应机制,在统一框架下实现缺失模态信息重建等,实验证明其性能优于现有方法。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24098 2026-07-28 cs.CV 新提交 57%

ReflexTrack: A Feedback-Driven Agent for Training-Free Referring Video Object Segmentation

ReflexTrack:一种用于无训练的引用视频对象分割的反馈驱动智能体

Yuanjia Li, Tianyang Xu, Tao Zhou, Zhangyong Tang, Xiao-Jun Wu, Josef Kittler

机构 * School of Artificial Intelligence and Computer Science, Jiangnan University(江南大学人工智能与计算机科学学院) Centre for Vision, Speech and Signal Processing, University of Surrey(萨里大学视觉、语音和信号处理中心)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究针对引用视频对象分割问题,提出无训练、反馈驱动的ReflexTrack智能体。通过掩码引导空间细化和视频级掩码反射实现空间与时间层面反馈,提升预测可靠性,在Ref-VPS和ReasonVOS上取得较好分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23647 2026-07-28 cs.LG cs.AI 新提交 57%

CALMRec: Causally Aligned Language Memory for Long-Horizon Recommendation

CALMRec:用于长期推荐的因果对齐语言记忆

Gengyu Zhan

机构 * Shenzhen University(深圳大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 研究针对当前大语言模型推荐器的问题,提出CALMRec框架,利用冻结多模态语言模型转换信息,维护多种记忆,通过倾向加权更新等减少偏差,在多环境评估中表现良好,提升了折扣长期价值,释义基准上语义原子NDCG显著提高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23576 2026-07-28 cs.CV 新提交 57%

Neuromorphic Object Detection: An In-Depth Study and Future Directions

神经形态目标检测:深入研究与未来方向

Jianing Li, Dianze Li, Arren Glover, Xiaopeng Fan, Guoqi Li, Chiara Bartolozzi, Ryad B. Benosman, Yonghong Tian

机构 * Peking University(北京大学) Peng Cheng Laboratory(鹏城实验室) Harbin Institute of Technology(哈尔滨工业大学) Chinese Academy of Sciences(中国科学院) Italian Institute of Technology(意大利理工学院) Carnegie Mellon University(卡内基梅隆大学) University of Pittsburgh(匹兹堡大学) Sorbonne Université(索邦大学) INSERM(法国国家健康与医学研究院) CNRS(法国国家科学研究中心) Institut de la Vision(视觉研究所)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对传统相机在特定条件下目标检测的挑战,本文对神经形态目标检测算法进行全面调查和基准测试,从多视角探索现有方法,评估多种模型并分析结果,讨论未解决问题,为该领域研究提供资源与方向。

Comments Accepted by Proceedings of the IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21290 2026-07-24 cs.LG cs.AI 新提交 57%

Multi-Task Learning for Heterogeneous Prediction from Video Game State with Transfer Learning

基于迁移学习的视频游戏状态异构预测多任务学习

Jonas Peché, Aliaksei Tsishurou, Alexander Zap, Günter Wallner

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 研究视频游戏状态异构预测,通过适配多模态架构,采用跨任务联合训练共享模型,结合多种信息,经实验比较单多任务训练、评估策略及测试预训练等,还研究游戏内迁移,以降低成本并提升泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20868 2026-07-24 cs.CV 新提交 57%

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?

ViSTR-Bench:多模态大语言模型能否从动态场景中的连续视觉线索进行推理?

Han Li, Si Liu, Zehao Huang, Dongxin Lyu, Longfei Xu, Jiahui Fu, Daxin Tian, Yuliang Xiu, Naiyan Wang

机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) Zhongguancun Academy(中关村科学城) School of Engineering, Westlake University(西湖大学工学院) School of Transportation Science and Engineering, Beihang University(北京航空航天大学交通科学与工程学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究聚焦多模态大语言模型在动态场景中从连续视觉线索推理的能力,提出ViSTR-Bench评估套件,基于相关原则建立四维评估,含15个子任务和1340个问答对,经评估发现当前模型在复杂时空推理上有瓶颈,远不及人类。

Comments 37 pages, 37 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19547 2026-07-23 cs.CV eess.IV 新提交 57%

ChronoStitch: Training-Free Composition of Visual KV Memories for Long-Horizon Temporal Reasoning

ChronoStitch:用于长时程时间推理的视觉键值记忆的免训练组合

Santiram Tiwari, Nishant Sinha, Kunal Kislay

机构 * KGraph AI Solutions Pvt. Ltd.(KGraph人工智能解决方案私人有限公司)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对长视频问答中视觉KV记忆组合问题,ChronoStitch提出免训练方法,先将键值重基于全局坐标系,解决几何不一致问题,再处理残余内容差距,通过选择性重新计算部分视觉令牌,提升事件排序准确性且运行速度更快。

Comments 6 pages, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18747 2026-07-22 cs.CV 新提交 57%

SkyEV: RGB-Event UAV detection and tracking dataset and baseline

SkyEV:RGB-事件无人机检测与跟踪数据集及基线

Jakub Mandula, Sebastian Heusinger, Julian Moosmann, Christian Vogt, Michele Magno

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 针对无人机检测数据集存在的问题,引入开源数据集SkyEV,其含高度同步的未压缩RGB和基于事件的数据,能捕捉复杂现实条件。提供统一数据加载器,用多模态架构建立实验基线,证明该数据集对检测小尺度目标有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17599 2026-07-21 cs.CV 新提交 57%

ConsiSpace: Learning Geometric Consistency Matters for Video Spatial Reasoning

ConsiSpace:学习几何一致性对视频空间推理很重要

Ting Huang, Zhenyu Zhang, Wenyuan Huang, Jian Yang, Hao Tang

机构 * School of Intelligent Science and Technology, Nanjing University(南京大学智能科学与技术学院) School of Computer Science, Peking University(北京大学计算机科学学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对视频空间推理中现有模型难以聚合一致空间证据的问题,提出ConsiSpace框架,通过构建几何一致内存及采用统一一致性自监督强化学习,在三个空间推理基准测试上取得成绩提升,平均得分比最强基线高12.6分。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13802 2026-07-16 cs.CV 新提交 57%

RainDancer: RGB-Event Video Deraining with Rain-Oriented Spiking Dynamics

RainDancer:基于面向降雨的脉冲动力学的RGB-事件视频去雨

Kui Jiang, Runzhe Li, Zhaocheng Yu, Guanglu Sun, Junjun Jiang, Xianming Liu

机构 * School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) School of Computer Science and Technology, Harbin University of Science and Technology(哈尔滨理工大学计算机科学与技术学院)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 研究针对视频去雨问题,提出RainDancer框架,基于分解-交互范式,在RGB和事件分支分别处理,分离雨和背景成分,进行组件级融合,并引入事件域监督,实验表明该方法在多方面性能优越。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13681 2026-07-16 cs.CV 新提交 57%

Towards Spatial Supersensing in the Wild

迈向野外空间超感知

Tianjun Gu, Tianyu Xin, Kuan Zhang, Bowen Yang, Kok-Chung Chua, Peize Li, Xinran Zhang, Yupeng Chen, Qiyue Zhao, Qinlei Xie, Jianhang Liu, Yucheng Lu, Yinan Han, Marco Pavone, Yiming Li

机构 * Tsinghua University(清华大学) NVIDIA(英伟达) Stanford University(斯坦福大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究针对空间超感知中多模态模型基准测试局限于合成视频和家庭场景的问题,引入VSI-Super-Wild基准,受人类认知启发探究世界状态三元组,通过大量真实视频问答对测试发现模型不足及失败模式,为空间超感知发展指明方向。

Comments Accepted to ECCV 2026. Project page: https://vsi-super-wild.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13506 2026-07-16 cs.CV 新提交 57%

TRACE-PCa: Predicting Prostate Cancer Progression from Longitudinal MRI During Active Surveillance

TRACE-PCa:在主动监测期间从纵向MRI预测前列腺癌进展

Hongye Zeng, Shreeram Athreya, Dingyuan Dai, Steve Raman, Leonard Marks, William Speier, Corey Arnold

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究提出TRACE-PCa模型,无需病变分割,通过预训练3D MRI模型编码序列扫描,引入时间注意力门,融合临床变量,在纵向AS队列验证中表现出色,能减少不必要活检,有预测前列腺癌进展的潜力。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13095 2026-07-16 cs.AR cs.AI 新提交 57%

Full-Pipeline Inference Optimization for MiMo-V2.5 Series: Pushing Hybrid SWA Efficiency to the Limit

MiMo-V2.5系列的全流程推理优化:将混合滑动窗口注意力效率推向极限

Xiaomi MiMo Team, Anqi Liu, Aoxin Ma, Bo Chen, Bo Yang, Chen Wang, Chen Zhang, Chengda Tang, Chengwei Wang, Chiheng Lou, Depeng Yan, Fuli Luo, Gang Wang, Hailin Zhang, Jiale Sun, Kang Zhou, Rui Huang, Shaohui Liu, Shen Huang, Shijie Cao, Shuaishuai Fan, Tianling Zhou, Xiangwei Deng, Xueyang Xie, Xuli Wang, Yingchun Lai, Yu Yang, Yuan Zhang, Zhen Tang, Zhonghua Deng, Zihan Jiang

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 针对MiMo-V2.5模型家族,结合Hybrid SWA、MoE和多模态编码器进行全流程推理优化。通过多种策略优化KVCache系统,构建GCache并开发路由器,还优化多模态输入,构成首个有效涵盖该复合架构的大规模LLM生产服务系统。

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11646 2026-07-14 cs.CV cs.RO 新提交 57%

Event-RGB Adaptive Tracking for Nighttime Highway Perception

用于夜间高速公路感知的事件-RGB自适应跟踪

Haidong Wang, Hengxing Cai, Wanlei Li, Xiaogang Xiong, Renxin Zhong

机构 * School of Intelligent Systems Engineering, Sun Yat-sen University(中山大学智能系统工程学院) School of Intelligence Science and Engineering, Harbin Institute of Technology(哈尔滨工业大学智能科学与工程学院)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 针对高速公路夜间低光条件下RGB感知性能差的问题,提出JEAT框架,通过自适应扩展卡尔曼滤波器动态融合事件流与RGB帧,还创建SEHN数据集,为多模态融合研究提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10990 2026-07-14 cs.CV 新提交 57%

TreeSoc: Tree-Structured Dynamic Reasoning and Tool Synergy for Soccer Video Understanding

TreeSoc:用于足球视频理解的树状结构动态推理与工具协同

Thanh-Nhan Vo, Thanh-Khoi Nguyen, Trong-Thuan Nguyen, Trung-Hoang Le, Minh-Triet Tran

机构 * University of Science, VNU-HCM(胡志明市越南国立大学科学大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 针对当代视觉语言模型理解足球视频的挑战,提出TreeSoc框架,通过动态深度优先搜索机制分解查询,支持自适应工具路由,在多个数据集上取得优异成绩,证明其为视频理解的有效范式。

Comments Accepted to ICMV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10369 2026-07-14 cs.RO cs.AI 新提交 57%

VINE: Taming Generative Control Policies for Reinforcement Learning

VINE:驯服强化学习中的生成控制策略

Rushuai Yang, Zhuo Han, Houlin Li, Hecheng Wang, Zhichao Wu, Rui Zhang, Zhaowei Zhang, Zihong Chen, Xiaohan Yan, Chiming Liu, Yi Chen, Wei Shan, Maoqing Yao

机构 * AgiBot(未知机构) The Hong Kong University of Science and Technology(香港科技大学) Peking University(北京大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 研究针对流匹配策略在值梯度强化学习中训练不稳定的问题,提出VINE方法。该方法通过在去噪步骤重建插值状态,创建稳定可微路径,实现稳定的端到端值梯度优化,在相关基准和任务中表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10098 2026-07-14 cs.CV cs.LG 新提交 57%

DynaFilter: Cloud-driven Dynamic Filtering for Satellite Edge Intelligence

DynaFilter:用于卫星边缘智能的云驱动动态过滤

Ziyang Zhang, Jie Liu, Luca Mottola

机构 * Politecnico di Milano(米兰理工大学) Harbin Institute of Technology Shenzhen(哈尔滨工业大学(深圳))

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对卫星边缘系统带宽受限等问题,设计DynaFilter动态过滤技术,通过建立云查询语义与压缩域特征的映射,让边缘设备在压缩域直接进行选择性RoI推理,实现减少数据量、节省带宽、降低能耗及加快推理延迟等效果。

Comments 15 pages, 23 figures, accepted by ACM MobiCom 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07370 2026-07-10 cs.RO cs.AI cs.HC cs.LG 新提交 57%

Behavior Foundations for Quadruped Robots: ABot-C0 Technical Report

四足机器人的行为基础:ABot-C0技术报告

Xufeng Zhao, Fuzhi Yang, Jianhui Chen, Li Gao, Zhang Meng, Jie Gao, Yao Zheng, Congyang Zhao, Tianxiong Lv, Menglin Yang, Minqi Gu, Yaru Zhao, Wenyu Liu, Honglin Han, Shihui Su, Zixiao Tang, Liu Liu, Mu Xu, Yang Cai, Wenbin Tang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 该研究聚焦四足机器人运动控制,提出ABot-C0通用系统,构建数据金字塔生成运动片段,训练流匹配通用策略展示跟踪缩放定律,采用特定框架推动全地形遍历运动,经实验验证其能让四足机器人迈向产品级行为智能。

Comments Abot-C0 project page will be released soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07518 2026-07-09 cs.CV 新提交 57%

Learning to Unify Deformable Shape and Texture Representations for Cardiac Video Classification

学习统一可变形形状和纹理表示用于心脏视频分类

Tonmoy Hossain, Miaomiao Zhang

机构 * University of Virginia(弗吉尼亚大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 针对心脏视频分类,现有方法简单拼接形状与纹理特征未充分利用互补性。本文提出新模型,在综合空间学习时间特征,设计双向交叉注意力融合特征,能动态调整贡献,在CMR视频数据集上达最优性能,提高了可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07001 2026-07-09 cs.CV 新提交 57%

Ego-Human Motion Prediction with 3D-Aware LLM

基于3D感知语言模型的自我-人类运动预测

Yujin Bae, Jaewoo Jeong, Hyeonseong Kim, Kuk-Jin Yoon

机构 * Visual Intelligence Lab., KAIST(视觉智能实验室,韩国科学技术院)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 研究从自我中心视角预测人类运动问题,提出Ego3DLM模型,基于准确运动预测需3D环境理解及姿势语言整体预测原则,通过三阶段训练,在相关任务中取得领先性能,实现跨模态和时间一致的运动预测。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06875 2026-07-09 cs.CV cs.LG 新提交 57%

Video2Reaction: Mapping Video to Audience Reaction Distribution in the Wild

Video2Reaction:将视频映射到自然环境中的观众反应分布

Trang Nguyen, Sidong Zhang, Shiv Shankar, Gauri Jagatap, Deepak Chandran, Andrea Fanelli, Madalina Fiterau

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Dolby Laboratories(杜比实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究旨在通过Video2Reaction数据集实现视频到观众反应分布预测,开发仅用开源语言模型的两阶段多智能体管道,建立基准,发现预训练模型零样本失败,微调可提升性能,但任务仍具挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05994 2026-07-08 cs.CV 新提交 57%

SparseCtrl-HOI: Sparse Temporal Control for Human-Object Interaction Video Generation

SparseCtrl-HOI:用于人机交互视频生成的稀疏时间控制

Shenbo Xie, Mingrui Cai, Xu Yang, Yifei Liu, Changxing Ding

机构 * South China University of Technology(华南理工大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究针对人机交互视频生成中建模物理动力学及时空协调复杂、现有方法依赖密集指导成本高且影响多样性的问题,提出SparseCtrl-HOI框架,用关键帧结合新机制和模块控制,构建数据集,降低标注开销,提升直播电商视频质量。

Comments ECCV 2026, Project Page: https://mpi-lab.github.io/SparseCtrl-HOI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05855 2026-07-08 cs.LG cs.AI 新提交 57%

Unsupervised Anomaly Detection of Information Operations Users via Behavioral and Language Patterns

通过行为和语言模式对信息操作用户进行无监督异常检测

Sishun Liu, Sajal Halder, Ke Deng, Yan Wang, Xiuzhen Zhang

机构 * RMIT University(皇家墨尔本理工大学) Macquarie University(麦考瑞大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 研究针对社交媒体网络信息操作检测难题,提出无监督方法TENSOR,利用多模态数据,通过训练时间点过程捕捉异常行为模式,并引入新证据函数调整输出,在五个真实数据集上表现优于基线。

Comments Accepted at ECML/PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04559 2026-07-07 cs.CV 新提交 57%

QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding

QSVideo:用于视频理解的查询条件语义时间检索

Wei Ao, Lan Wang, Vishnu Naresh Boddeti

机构 * Michigan State University(密歇根州立大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对视频理解中视觉语言模型性能随视频时长下降问题,提出QSVideo框架,通过查询条件语义排序器、联合优化相关性和多样性及时间对齐策略,提升视频VLM性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03855 2026-07-07 cs.CV 新提交 57%

PRISM3D: Probabilistic Refinement and Robust Initialization for Physically Consistent Scene Modeling under Extreme Motion Blur

PRISM3D:极端运动模糊下物理一致场景建模的概率细化与鲁棒初始化

Gopi Raju Matta, Reddypalli Trisha, Vemunuri Divya Madhuri, Kaushik Mitra

机构 * Computational Imaging Lab, Dept. of Electrical Engineering, IIT Madras(印度理工学院马德拉斯分校电气工程系计算成像实验室)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 研究从极端运动模糊图像进行盲3D场景重建问题,提出PRISM3D框架,用鲁棒初始化策略结合概率物理方法,还介绍多模态扩展PRISM3D-E及基准,实验表明其达新的最优性能。

Comments Accepted to ECCV-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01469 2026-07-07 cs.CV 新提交 57%

A Cost-Aware, Paired Protocol for Auditing Dynamic Tool Synthesis in Agentic Video Question Answering

一种成本感知的配对协议,用于审计智能视频问答中的动态工具合成

Aseel Mohamed, Rama AlHamidi, Mohamed Rayan Barhdadi, Rasul Khanbayov, Erchin Serpedin, Hasan Kurban

机构 * Texas A&M University(德克萨斯农工大学) Hamad Bin Khalifa University(哈马德·本·哈利法大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出成本感知的配对协议,联合评估准确性与成本,揭示动态工具合成在视频问答中的效率与代价。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02425 2026-07-03 cs.CV 新提交 57%

Learning to Evolve Scenes: Reasoning about Human Activities with Scene Graphs

学习演化场景:用场景图推理人类活动

Francesca Pistilli, Simone Alberto Peirone, Giuseppe Averta

机构 * Politecnico di Torino(托斯托大学)

专题命中 视频多模态 :MLLM(abstract_cn);分类 cs.CV

AI总结 提出SG-Ego标注集和GLEN模型,通过时空场景图显式建模人-环境交互的动态演化,实现活动驱动的场景变化推理与预测。

Comments Project page at https://francescapistilli.github.io/GLEN

详情

展开后加载摘要…

URL PDF HTML 收藏