arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4728 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4728 篇

2608.04939 2026-08-06 cs.CL 新提交 57%

Reading Between the Frames: Interpreting Implicit and Non-literal Meaning in Social Media Videos

帧间解读:社交媒体视频中隐含与非字面意义的理解

Yang Wang, Yanan Ma, Yiqi Liu, Zi Yan Chang, Chi-Li Chen, Chia-Yi Hsiao, Tyler Loakman, Aline Villavicencio, Chenghao Xiao, Chenghua Lin

机构 * University of Manchester(曼彻斯特大学) Durham University(杜伦大学) University of Sheffield(谢菲尔德大学) University of Exeter(埃克塞特大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出DrivelHub+基准,评估视频-语言模型推断社交媒体视频隐含意义的能力,从解释和表征两方面开展实验,衡量模型多模态感知与语用理解的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04587 2026-08-06 cs.CV 新提交 57%

MetaVideoAgent: Automated Video-Agent Evolution for Long-Form Video Understanding

MetaVideoAgent:面向长视频理解的自动视频智能体进化框架

Benlei Cui, Ruize Wang, Junjie Li, Jinhao Chen, Longtao Huang, Yinghao Chen, Yuwen Zhai, Jingqun Tang, Ruijian Jia, Weiwei Wu, Pengfei Sun, Haiwen Hong

机构 * Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) ByteDance(字节跳动)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 MetaVideoAgent是自动进化视频智能体的框架,在VA-EvoBench上经4次迭代后将宏平均准确率从38.44%提至51.47%,性能优于现有最优固定设计智能体且成本更低。

Comments 16 pages, 7 figures. Code: https://github.com/Alibaba-VELLDEPTH/MetaVideoAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04130 2026-08-06 cs.CV 新提交 57%

Radar4D-VLM: Proposal-Grounded Temporal 4D Radar Reasoning Across Frozen Language Models

Radar4D-VLM:基于提议的跨冻结语言模型的时序4D雷达推理

Jiaju Han, Xuemeng Sun, Qike Zhang, Xiang Chen, Luwei Yang, Jiahuan Long, Yiwei Wei, Jiujiang Guo, Chengyin Hu

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出仅用雷达的时序视觉-语言模型Radar4D-VLM,结合提议的时序目标标记等,在K-Radar验证集上表现优异,且雷达标记接口兼容多款冻结语言骨干,为雷达多模态推理奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07558 2026-08-06 cs.HC cs.AI 版本更新 57%

Generative Experiences for Digital Mental Health Interventions: Evidence from a Randomized Study

生成体验用于数字心理健康干预:来自随机研究的证据

Ananya Bhattacharjee, Michael Liut, Matthew Jörke, Diyi Yang, Emma Brunskill

机构 * Stanford University(斯坦福大学) University of Toronto Mississauga(多伦多大学滑铁卢分校)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出生成体验范式,通过动态构建干预体验提升数字心理健康干预效果,实验显示GUIDE在减压和用户体验方面显著优于基线对照。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03176 2026-08-05 cs.CV cs.HC 新提交 57%

Frequency-Decorrelated Temporal Ensembles for EEG--fNIRS Imagined-Handwriting Decoding

用于EEG-fNIRS想象手写解码的频率去相关时间集成

Xiao Fan, Hongbin Guo, Yubo Han, Yi Zhang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本研究针对EEG-fNIRS想象手写解码难题,提出FRED系统,采用频率去相关时间集成等方法,在多模态脑机接口挑战赛中取得较好成绩,揭示了关键性能来源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25242 2026-08-05 cs.CV 版本更新 57%

Medical world models in healthcare: foundations, applications, and challenges for trustworthy clinical translation

医疗保健中的医学世界模型:可信临床翻译的基础、应用与挑战

Zhaoyan Chen, Zhongxiu Cong, Zhuanfeng Jin, Wanshu Fan, Dongsheng Zhou, Qi Ai, Haifan Gong, Congyu Liao, Xiaofeng Liu, Cong Wang

机构 * National and Local Joint Engineering Laboratory of Computer Aided Design, School of Software Engineering, Dalian University(大连大学软件工程学院计算机辅助设计国家地方联合工程实验室) Department of Radiology, Xinhua Hospital Affiliated to Dalian University(大连大学附属新华医院放射科) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of California, San Francisco(加州大学旧金山分校) Yale University(耶鲁大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 探讨医学世界模型在医疗保健中的应用,通过结构化综合定义其领域相关内容,围绕四种能力组织,涵盖多方面证据,虽有早期可行性证据,但受多种因素限制,临床翻译需多方面保障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17674 2026-08-05 cs.CV 版本更新 57%

SVL: Empowering Spiking Neural Networks for Efficient 3D Open-World Understanding

SVL:基于脉冲的视觉-语言预训练用于高效的3D开放世界理解

Xuerui Qiu, Peixi Wu, Yaozhi Wen, Shaowei Gu, Yuqi Pan, Xinhao Luo, Bo XU, Guoqi Li

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Future Technology, University of Chinese Academy of Sciences(中国科学院大学未来技术学院) Zhongguancun Academy(中关村学院) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 SVL提出基于脉冲的视觉-语言预训练框架,通过多尺度三元组对齐和可重参数化的视觉-语言整合,提升SNN在3D开放世界理解中的性能,实现高效零样本3D分类和多模态问答。

Comments ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01354 2026-08-04 cs.CV 新提交 57%

PixVL: Self-Supervised Training of Pixel-Level MLLMs via a Unified Mask--Text Consistency Cycle

PixVL:通过统一掩码-文本一致性循环进行像素级多模态大语言模型的自监督训练

Yicheng Xiao, Haoxuan Ma, Caorui Li, Yucheng Wu, Weijie Wang, Haoxiao Wang, Shuang Chen, Fan Yang, Haiyun Guo, Jinqiao Wang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 PixVL作为自监督后训练框架,通过统一掩码-文本一致性循环及语义验证等策略,解决像素级MLLMs的优化干扰问题,同时提升区域理解与分割任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01302 2026-08-04 cs.CV 新提交 57%

Beyond Symmetric Fusion: Exploiting Task-Dependent Modality Strengths for RGB-Event Small Object Detection

超越对称融合:利用任务相关的模态优势进行RGB-事件小目标检测

Ziheng Wang, Chaolang Li, Yutong Yang, Xiaohan Xu, Chongxiang Yang, Hengxuan Zhong, Zhen Liang, Pengwen Dai

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 该研究针对现有RGB-事件检测器的对称融合设计缺陷,提出AERODet模型,通过SURE和TDSR实现任务相关的模态利用,在FRED和NeRDD数据集上取得最优性能,FRED挑战性拆分提升10.7 mAP点。

Comments 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00371 2026-08-04 cs.CV 新提交 57%

Decoding Children's Gait Behavior

儿童步态行为解码

Yifan Shen, Boyi Li, Meihuan Huang, Yuanzhe Liu, Xu Cao, Jinyang Jin, Zhengyuan Li, Anglin Liu, Junho Kim, Jingyuan Zhu, Lan Fangzhou, Jianguo Cao, Jintai Chen, Ismini Lourentzou, James Matthew Rehg

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) PediaMed AI Shenzhen Children’s Hospital(深圳市儿童医院) Hong Kong Polytechnic University(香港理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对儿童步态分析的临床需求,本文构建含110名受试者的1100余条高帧率视频数据集,指出现有先进模型难以解析其临床细节,提出统一端到端框架并建立自动化儿童步态评估基线。

Journal ref ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22973 2026-08-04 cs.CV 版本更新 57%

mmSimPrior: Learning Simulation Priors for Data-Efficient and Generalizable Real-World Radar-based Human Motion Reconstruction

mmSimPrior:学习用于数据高效的真实世界可泛化雷达人体运动重建的模拟先验

Cheng Guo, Qiming Cao, Shengkai Xu, Haoyu Xie, Kaixiang Su, Pu Wang, Hongfei Xue

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究针对毫米波雷达人体运动重建中数据收集成本高及模拟训练模型迁移差的问题,提出mmSimPrior框架,将知识分解为先验,经多模态编码器等训练,构建数据集并设无重叠设置,实验证明其在降低MPJPE上有显著效果。

Comments 19 pages, 11 figures, including supplementary material. Project page: https://ch3ngguo.github.io/mmsimprior/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06872 2026-08-04 cs.CV 版本更新 57%

Ensemble Deep Learning Approaches for AI-Altered Video Detection

用于人工智能篡改视频检测的集成深度学习方法

Laiba Khan, Hung-Mao Wu, Wei Lin, Frank Bi, Yousef Abdelhadi, Joshua Jung

机构 * Department of Mathematical and Computational Sciences, University of Toronto Mississauga(多伦多大学密西沙加分校数学与计算科学系) Department of Mathematical and Computational Sciences, University of Toronto(多伦多大学数学与计算科学系) University of Toronto(多伦多大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究针对人工智能篡改视频检测难题,开发多模态深度伪造检测系统,结合音频视觉分析,用模型集成及均值平均、堆叠等策略组合分数,提升检测鲁棒性与性能,凸显对未见篡改泛化的挑战,平均准确率约70%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01095 2026-08-04 cs.CV cs.LG 版本更新 57%

NarrativeTrack: Evaluating Entity-Centric Reasoning for Narrative Understanding

NarrativeTrack: 评估实体中心推理在叙事理解中的表现

Hyeonjeong Ha, Jinjin Ge, Bo Feng, Kaixin Ma, Gargi Chakraborty

机构 * Apple(苹果公司) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 NarrativeTrack通过细粒度实体中心推理评估多模态大语言模型的叙事理解能力,揭示了感知接地与时间推理之间的根本权衡。

Comments Project Page: https://github.com/apple/ml-NarrativeTrack

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12147 2026-08-04 cs.CV 版本更新 57%

EgoIntent: A Pre-Outcome Micro-Step Benchmark for Understanding What, Why, and Next

EgoIntent: 一种用于理解‘是什么、为什么和下一步’的以自我为中心的步级基准

Ye Pan, Chi Kit Wong, Yuanhuiyi Lyu, Hanqian Li, Chenfei Liao, Jiahao Huo, Lutao Jiang, Zixin Zhang, Jiacheng Chen, Yuqian Fu, Xu Zheng

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 EgoIntent基准旨在通过步级意图理解解决以自我为中心视频中对‘是什么、为什么和下一步’的细粒度理解难题,包含15种日常生活场景,评估模型在三个维度上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15038 2026-08-04 cs.AI 版本更新 57%

LADY: Linear Attention for Autonomous Driving Efficiency without Transformers

LADY:用于自动驾驶效率的线性注意力,无需Transformer

Jihao Huang, Xi Xia, Zhiyuan Li, Tianle Liu, Jingke Wang, Junbo Chen, Tengju Ye

机构 * Udeer AI Zhejiang University(浙江大学) Yuanshi Intelligence(元世智能)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.AI

AI总结 LADY是首个基于线性注意力的端到端自动驾驶生成模型,通过常数时间与内存复杂度实现高效长时序建模与跨模态交互。

Comments Accepted by IEEE RAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08065 2026-08-04 cs.AI 57%

STGDPM:Vessel Trajectory Prediction with Spatio-Temporal Graph Diffusion Probabilistic Model

Jin Wenzhe, Tang Haina, Zhang Xudong

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

Comments This paper has been ACCEPTED as a FULL PAPER at DASFAA 2025

Journal ref Database Systems for Advanced Applications (DASFAA 2025), Lecture Notes in Computer Science, vol. 15987, pp. 571-586, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29596 2026-08-03 cs.RO cs.CV 新提交 57%

FibVLA: An Efficient Temporal Vision-Language-Action Model with Fibonacci Sampling

FibVLA:一种采用斐波那契采样的高效时序视觉-语言-动作模型

Li Lin, Wujun Xu, Weiwei Meng, Kaiwen Xia, Kang Hao Cheong, Shuai Wang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出FibVLA框架,通过对数事后采样和流匹配等技术,解决了视觉-语言-动作模型时序信息捕捉与推理效率的矛盾,提升了动作性能与实时响应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15336 2026-07-30 cs.HC cs.AI 版本更新 57%

Facial-Expression-Aware Prompting for Empathetic LLM Tutoring

面向情感的提示方法用于共情LLM辅导

Shuangquan Feng, Laura Fleig, Ruisen Tu, Philip Chi, Edmund Bu, Melinda Ozel, Junhua Ma, Teng Fei, Virginia R. de Sa

机构 * Neurosciences Graduate Program, University of California San Diego(加州大学圣地亚哥分校神经科学研究生项目) Department of Cognitive Science, University of California San Diego(加州大学圣地亚哥分校认知科学系) Department of Computer Science and Engineering, University of California San Diego(加州大学圣地亚哥分校计算机科学与工程系) Department of Electrical and Computer Engineering, University of California San Diego(加州大学圣地亚哥分校电气与计算机工程系) Department of Mathematics, University of California San Diego(加州大学圣地亚哥分校数学系) Face the FACS Halıcıoğlu Data Science Institute, University of California San Diego(Halıcıoğlu数据科学研究所)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文研究了在LLM辅导中整合面部表情信号以提升共情响应的效果,通过四种不同方法对比发现,基于动作单元的条件化能提升对面部表情的共情响应,而引导峰值帧选择优于随机帧输入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25125 2026-07-29 cs.CV 新提交 57%

LENS: Adaptive Spatio-Temporal Zooming for Keyframe Sampling in Long-Form Videos

LENS:用于长视频关键帧采样的自适应时空缩放

Ce Zhang, Jinxi He, Katia Sycara, Yaqi Xie

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 研究针对长视频理解受限于上下文窗口的问题,提出无需训练的关键帧采样框架LENS,它能基于文本查询动态分配帧预算,在时空缩放间平衡,提升关键帧采样效果,优于现有方法,提高了Video-MME准确率。

Comments Accepted at ECCV 2026. Project page: https://zhangce01.github.io/LENS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25047 2026-07-29 cs.HC cs.AI cs.RO 新提交 57%

Extended Reality as a Mediation Layer for Situated Human Control in Human-Robot Teaming

扩展现实作为人机协作中情境化人类控制的中介层

Jens Grubert, John Dudley, Eyal Ofek, Per Ola Kristensson

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 研究探讨扩展现实在人机协作中作为情境化人类控制中介层的作用,通过床边护理等场景阐述观点,确定四种中介功能和六个设计维度,为使机器人自主性在动态环境中更具操作性和问责性的XR系统规划研究议程。

Comments Accepted to 2026 IEEE International Symposium on Mixed and Augmented Reality Adjunct (ISMAR-Adjunct)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24701 2026-07-28 cs.CV 新提交 57%

Spatio-Temporal Conditional Denoising Transformer for Modality-Missing RGBT Tracking

用于模态缺失的RGBT跟踪的时空条件去噪Transformer

Andong Lu, Ziyi Zha, Jiandong Jin, Shihao Li, Chenglong Li, Jin Tang, Bin Luo

机构 * School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) School of Artificial Intelligence, Anhui University(安徽大学人工智能学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对RGBT跟踪中模态缺失致性能下降问题,提出时空条件去噪Transformer(SCDT)。它整合时空线索,通过利用不同时间线索及噪声调制适应机制,在统一框架下实现缺失模态信息重建等,实验证明其性能优于现有方法。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24098 2026-07-28 cs.CV 新提交 57%

ReflexTrack: A Feedback-Driven Agent for Training-Free Referring Video Object Segmentation

ReflexTrack:一种用于无训练的引用视频对象分割的反馈驱动智能体

Yuanjia Li, Tianyang Xu, Tao Zhou, Zhangyong Tang, Xiao-Jun Wu, Josef Kittler

机构 * School of Artificial Intelligence and Computer Science, Jiangnan University(江南大学人工智能与计算机科学学院) Centre for Vision, Speech and Signal Processing, University of Surrey(萨里大学视觉、语音和信号处理中心)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究针对引用视频对象分割问题,提出无训练、反馈驱动的ReflexTrack智能体。通过掩码引导空间细化和视频级掩码反射实现空间与时间层面反馈,提升预测可靠性,在Ref-VPS和ReasonVOS上取得较好分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23647 2026-07-28 cs.LG cs.AI 新提交 57%

CALMRec: Causally Aligned Language Memory for Long-Horizon Recommendation

CALMRec:用于长期推荐的因果对齐语言记忆

Gengyu Zhan

机构 * Shenzhen University(深圳大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 研究针对当前大语言模型推荐器的问题,提出CALMRec框架,利用冻结多模态语言模型转换信息,维护多种记忆,通过倾向加权更新等减少偏差,在多环境评估中表现良好,提升了折扣长期价值,释义基准上语义原子NDCG显著提高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23576 2026-07-28 cs.CV 新提交 57%

Neuromorphic Object Detection: An In-Depth Study and Future Directions

神经形态目标检测:深入研究与未来方向

Jianing Li, Dianze Li, Arren Glover, Xiaopeng Fan, Guoqi Li, Chiara Bartolozzi, Ryad B. Benosman, Yonghong Tian

机构 * Peking University(北京大学) Peng Cheng Laboratory(鹏城实验室) Harbin Institute of Technology(哈尔滨工业大学) Chinese Academy of Sciences(中国科学院) Italian Institute of Technology(意大利理工学院) Carnegie Mellon University(卡内基梅隆大学) University of Pittsburgh(匹兹堡大学) Sorbonne Université(索邦大学) INSERM(法国国家健康与医学研究院) CNRS(法国国家科学研究中心) Institut de la Vision(视觉研究所)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对传统相机在特定条件下目标检测的挑战,本文对神经形态目标检测算法进行全面调查和基准测试,从多视角探索现有方法,评估多种模型并分析结果,讨论未解决问题,为该领域研究提供资源与方向。

Comments Accepted by Proceedings of the IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21290 2026-07-24 cs.LG cs.AI 新提交 57%

Multi-Task Learning for Heterogeneous Prediction from Video Game State with Transfer Learning

基于迁移学习的视频游戏状态异构预测多任务学习

Jonas Peché, Aliaksei Tsishurou, Alexander Zap, Günter Wallner

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 研究视频游戏状态异构预测,通过适配多模态架构,采用跨任务联合训练共享模型,结合多种信息,经实验比较单多任务训练、评估策略及测试预训练等,还研究游戏内迁移,以降低成本并提升泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20868 2026-07-24 cs.CV 新提交 57%

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?

ViSTR-Bench:多模态大语言模型能否从动态场景中的连续视觉线索进行推理?

Han Li, Si Liu, Zehao Huang, Dongxin Lyu, Longfei Xu, Jiahui Fu, Daxin Tian, Yuliang Xiu, Naiyan Wang

机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) Zhongguancun Academy(中关村科学城) School of Engineering, Westlake University(西湖大学工学院) School of Transportation Science and Engineering, Beihang University(北京航空航天大学交通科学与工程学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究聚焦多模态大语言模型在动态场景中从连续视觉线索推理的能力,提出ViSTR-Bench评估套件,基于相关原则建立四维评估,含15个子任务和1340个问答对,经评估发现当前模型在复杂时空推理上有瓶颈,远不及人类。

Comments 37 pages, 37 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19547 2026-07-23 cs.CV eess.IV 新提交 57%

ChronoStitch: Training-Free Composition of Visual KV Memories for Long-Horizon Temporal Reasoning

ChronoStitch:用于长时程时间推理的视觉键值记忆的免训练组合

Santiram Tiwari, Nishant Sinha, Kunal Kislay

机构 * KGraph AI Solutions Pvt. Ltd.(KGraph人工智能解决方案私人有限公司)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对长视频问答中视觉KV记忆组合问题,ChronoStitch提出免训练方法,先将键值重基于全局坐标系,解决几何不一致问题,再处理残余内容差距,通过选择性重新计算部分视觉令牌,提升事件排序准确性且运行速度更快。

Comments 6 pages, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18747 2026-07-22 cs.CV 新提交 57%

SkyEV: RGB-Event UAV detection and tracking dataset and baseline

SkyEV:RGB-事件无人机检测与跟踪数据集及基线

Jakub Mandula, Sebastian Heusinger, Julian Moosmann, Christian Vogt, Michele Magno

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 针对无人机检测数据集存在的问题,引入开源数据集SkyEV,其含高度同步的未压缩RGB和基于事件的数据,能捕捉复杂现实条件。提供统一数据加载器,用多模态架构建立实验基线,证明该数据集对检测小尺度目标有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13715 2026-07-22 cs.CV 版本更新 57%

MVGD-Net: A Novel Motion-aware Video Glass Surface Detection Method

MVGD-Net: 一种新颖的运动感知视频玻璃表面检测网络

Yiwei Lu, Hao Huang, Tao Yan

机构 * Tao Yan(谭燕)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 MVGD-Net通过利用视频中运动不一致特性,提出新颖网络检测玻璃表面,结合多模块融合与大规模数据集提升检测性能。

Comments This paper has been accepted by the 40th AAAI Conference on Artificial Intelligence (AAAI-26). It contians 9 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17599 2026-07-21 cs.CV 新提交 57%

ConsiSpace: Learning Geometric Consistency Matters for Video Spatial Reasoning

ConsiSpace:学习几何一致性对视频空间推理很重要

Ting Huang, Zhenyu Zhang, Wenyuan Huang, Jian Yang, Hao Tang

机构 * School of Intelligent Science and Technology, Nanjing University(南京大学智能科学与技术学院) School of Computer Science, Peking University(北京大学计算机科学学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对视频空间推理中现有模型难以聚合一致空间证据的问题,提出ConsiSpace框架,通过构建几何一致内存及采用统一一致性自监督强化学习,在三个空间推理基准测试上取得成绩提升,平均得分比最强基线高12.6分。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏