arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 320 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 320 篇

2607.05093 2026-07-08 cs.CV 新提交 70%

Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing

通过多尺度卷积和动态路由实现下一代网络的语义视频通信

Gengtian Shi, Jinze Yu, Chenhao Wu, Shaofei Wang, Eiji Fukuzawa, Junjie Tang, Hiroshi Onoda, Jiang Liu

机构 * Graduate School of Fundamental Science and Engineering, Waseda University(早稻田大学基础科学与工程研究生院) Generative AI Innovation Center, Amazon Web Services(亚马逊网络服务生成人工智能创新中心) Amazon(亚马逊)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对视频流量增长需求,提出语义视频通信框架,用多尺度时间卷积编码器捕捉运动模式,基于胶囊的动态路由机制优化关联,多任务学习统一组件,在实验中取得显著改进。

Comments Accepted at the AAAI 2026 Workshop on AI for Time Series (AI4TS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02991 2026-07-07 cs.CV 新提交 70%

GuideMe: Multi-Domain Task Guidance and Intervention in Streaming Video

GuideMe:流视频中的多域任务指导与干预

Fang Liu, Jinpeng Chen, Ke Xu, Yuhao Liu, Huankang Guan, Xudong Lu, Bo Yang, Gerhard Hancke, Rui Liu, Rynson W. H. Lau

机构 * City University of Hong Kong(香港城市大学) Huawei Research(华为研究院) University of Science and Technology of China(中国科学技术大学) Chinese University of Hong Kong(香港中文大学) City University of Hong Kong (Dongguan)(香港城市大学(东莞))

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 构建流视频多域基准GuideMe,支持训练和评估用于闭环交互任务指导的MLLMs,设计评估框架衡量模型能力,实验发现现有MLLMs虽擅提供指令,但难识别执行错误并反馈。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00858 2026-07-02 cs.CV cs.LG 新提交 70%

MoVA: Learning Asymmetric Dual Projections for Modular Long Video-Text Alignment

MoVA: 面向模块化长视频-文本对齐的非对称双投影学习

Peiyuan Zhu, Shaoan Xie, Zijian Li, Yifan Shen, Namrata Deka, Harsh Shrivastava, Guangyi Chen, Kun Zhang

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视频多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 针对视频-文本对比学习中时间错位和语义不对称问题,提出MoVA框架,通过非对称双投影(文本侧自适应选择帧感知子空间,视频侧解缠文本相关视觉概念)实现灵活对齐,在多个任务上超越现有方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25658 2026-06-25 cs.CV 新提交 70%

Towards a Dynamic and Fixed-budget Memory Bank for Efficient Streaming Video Understanding

面向高效流式视频理解的动态固定预算记忆库

Baiyang Song, Yuli Lin, Qiong Wu, Tao Chen, Jun Peng, Xiao Chen, Yiyi Zhou, Rongrong Ji

机构 * Xiamen University(厦门大学)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 提出无训练方法CausalMem,通过在线语义基动态更新记忆库,在有限预算下最大化流式视频信息量,实现20倍视觉令牌压缩和82MB存储。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25585 2026-06-25 cs.CV 新提交 70%

FeVOS: Foresight Expression Video Object Segmentation

FeVOS:前瞻性表达视频目标分割

Kehan Lan, Kaining Ying, Henghui Ding

机构 * Institute of Big Data, College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与技术学院大数据研究所)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出前瞻性表达视频目标分割任务,通过推理时空线索预测未来目标,并构建FeVOS数据集和FeVOS-R1模型,实现最先进性能。

Comments Accepted by ECCV 2026. Homepage: https://henghuiding.com/FeVOS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11129 2026-06-24 cs.CV 新提交 70%

WorldOlympiad: Can Your World Model Survive a Triathlon?

WorldOlympiad:你的世界模型能经受铁人三项考验吗?

Yuke Zhao, Wangbo Zhao, Weijie Wang, Zeyu Zhang, Dakai An, Akide Liu, Yinghao Yu, Jiasheng Tang, Fan Wang, Wei Wang, Bohan Zhuang

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) The Hong Kong University of Science and Technology(香港科技大学) Monash University(莫纳什大学) TRE, Alibaba Group(阿里巴巴TRE)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出WorldOlympiad基准,从物理忠实性、几何一致性和交互保真度三个维度诊断视频世界模型,揭示现有模型在物理推理、3D一致性和长程交互方面的显著不足。

Comments Project Page: https://alibaba-damo-academy.github.io/WorldOlympiad/, Code: https://github.com/alibaba-damo-academy/WorldOlympiad

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23058 2026-06-23 cs.CV 新提交 70%

Three-Step Hierarchical Transformer for Multi-Pedestrian Trajectory Prediction

三步层次Transformer用于多人轨迹预测

Raphaël Delécluse, Hazem Wannous, Laurent Grisoni, Laurent Guimas

机构 * IMT Nord Europe, University of Lille, CNRS UMR 9189 - CRIStAL(IMT 北欧洲、里尔大学、法国国家科学研究中心 UMR 9189 - CRIStAL) University of Lille, CNRS UMR 9189 - CRIStAL(里尔大学、法国国家科学研究中心 UMR 9189 - CRIStAL) Explain

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出三步层次Transformer,通过分离时间编码、多模态融合和场景交互推理,在JRDB和城市数据集上达到最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22550 2026-06-23 cs.CV cs.AI cs.CL cs.MM 新提交 70%

Training-Free Semantic Correction for Autoregressive Visual Models

自回归视觉模型的免训练语义校正

Junhao Chen, Chanyu Zhu, Zheqi Lv, Keting Yin, Shengyu Zhang

机构 * Zhejiang University(浙江大学) Shandong University(山东大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出Gazer框架,通过多模态大语言模型反馈在自回归视觉模型采样循环中进行语义诊断与校正,无需额外训练即可提升语义对齐和组合准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20715 2026-06-23 cs.CV 新提交 70%

CDER-SME: A Cross-Device Event-RGB Micro-Expression Dataset under Multi-Level Stress Induction

CDER-SME:多级压力诱导下的跨设备事件-RGB微表情数据集

Jingting Li, Hui Sha, Su-Jing Wang

机构 * State Key Laboratory of Cognitive Science and Mental Health, Institute of Psychology, Chinese Academy of Sciences(中国科学院心理研究所认知科学与心理健康国家重点实验室) Department of Psychology, University of the Chinese Academy of Sciences(中国科学院大学心理学系) School of Computer Science, Jiangsu University of Science and Technology(江苏科技大学计算机科学学院)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出CDER-SME数据集,通过多级压力诱导框架收集跨设备事件-RGB数据,提供硬件无关的对齐流程,包含92名受试者和1963个专家标注样本,验证了跨模态融合提升微表情识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15320 2026-06-16 cs.CV 新提交 70%

Conditional Multi-Event Temporal Grounding in Long-Form Video

长视频中的条件多事件时间定位

Yuanhao Zou, Arthad Kulkarni, Lucas Tonanez, Lincoln Spencer, Guangyu Sun, Tianxingjian Ding, Andong Deng, Yi Li, Shuangjun Liu, Yuan Li, Dashan Gao, Ning Bi, Taotao Jing, Shuai Zhang, Chen Chen

机构 * University of Central Florida(中佛罗里达大学) Qualcomm AI Research(高通人工智能研究院)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 提出CoMET-Bench基准和CoMET-Agent框架,解决长视频中基于组合时空条件定位所有事件的任务,F1@0.5提升6.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11186 2026-06-10 cs.CV 新提交 70%

AnyMod-LLVE: Low-Light Video Enhancement with Modality-Agnostic Inference

AnyMod-LLVE: 模态无关推理的低光照视频增强

Hangfeng Liang, Yutao Hu, Yanhan Hu, Xiaohan Wu, Wenqi Shao, Ying Fu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出AMNet统一多模态框架,通过空间-频谱双门控转换器学习辅助模态与RGB输入的对应关系,支持推理时任意模态组合,解决低光照视频增强中辅助模态缺失问题。

Comments Accepted at ICML 2026; Project page and code: https://lhfgghc.github.io/LLVE-AMNet

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08572 2026-06-09 cs.CV 新提交 70%

OmniCap-IF: Benchmarking and Improving Instruction Following Abilities for Omni-Video Captioning

OmniCap-IF:全视频字幕遵循指令能力的基准测试与改进

Jiahao Wang, An Ping, Yanghai Wang, Yuanxing Zhang, Shihao Li, Hanyan Bian, Yichi Ren, Yize Zhang, Han Wang, Haowen Chen, Junze Li, Jiaqi Wang, Yiyang Hu, Zhuze Xu, Zijie Zhang, Jiaheng Liu

机构 * NJU-LINK Team, Nanjing University(南京大学 NJU-LINK 团队) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 视频多模态 :audio-visual(abstract);omni-modal(abstract);分类 cs.CV

AI总结 提出首个全模态字幕指令遵循基准OmniCap-IF,通过格式与内容正确性评估50种约束类型,揭示格式-内容权衡,并构建54K指令微调数据集OmniCap-IF-54K及模型OmniCaptioner-IF。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08393 2026-06-09 eess.AS 新提交 70%

SMC-ITA: Sequential Monte Carlo Inference-Time Alignment for Video-to-Audio Generation

SMC-ITA:面向视频到音频生成的序列蒙特卡洛推理时对齐

Haoyu Zhang, Yuta Oshima, Xingjian Du, Chunfeng Wang, Irene Li, Yusuke Iwasawa, Yutaka Matsuo

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 eess.AS

AI总结 提出SMC-ITA方法,通过前瞻奖励估计和序列蒙特卡洛重采样,在推理时优化流匹配V2A生成,显著降低不同步率并提升音频质量。

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07924 2026-06-09 cs.CV cs.AI cs.CL cs.LG cs.MM 新提交 70%

Decoupling Semantics and Logic: A Training-Free Coarse-to-Fine Pipeline for Video Retrieval-Augmented Generation

解耦语义与逻辑:一种无需训练的从粗到精的视频检索增强生成流水线

Jiaxin Dai, Zehang Wei, Jiamin Yan, Xiang Xiang

机构 * School of Computer Science & Tech, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) School of AI and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出一种无需训练的两阶段级联视频RAG流水线,通过解耦语义检索与逻辑推理,实现跨语言长视频理解、严格角色遵循和零幻觉时间定位。

Comments To be presented at ACL 2026 MAGMAR Workshop (Oral; Retrieval leaderboard No.1)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13606 2026-08-17 cs.AI cs.CL cs.LG cs.MA cs.MM 新提交 67%

MobileMem: Learning from a Year of Mobile Experiences

MobileMem:从一年的移动体验中学习

Xinle Deng, Yida Xue, Xiangyuan Ru, Haoming Xu, Shuofei Qiao, Mengru Wang, Yijun Chen, Buqiang Xu, Chen Jiang, Yuchen Eleanor Jiang, Lizhong Wang, Jianfeng Wang, Li Zeng, Haofen Wang, Guilin Qi, Huajun Chen, Ningyu Zhang

机构 * OPPO OpenKG

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL、cs.AI、cs.MM

AI总结 该研究推出MobileMem基准与框架,基于一年移动体验构建,用于设备端长期记忆研究,支持多类推理,推动智能体从信息检索向体验智能发展。

Comments Technical Report; Project Page: this http URL (http://mobilemem.openkg.cn/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09861 2026-08-11 cs.AI cs.CL cs.CV 新提交 67%

Towards Expert-level Medical AI for Real-time Video Consultations

面向专家级的实时视频问诊医疗AI

Mahvish Nagda, Jihyeon Lee, Matthew Thompson, Chunjong Park, Tim Strother, Valentin Liévin, Roma Ruparel, Akshay Goel, Teya Bergamaschi, Suhana Bedi, Meet Shah, Pavel Dubov, Liviu Panait, Toshiyuki Fukuzawa, Sam Schmidgall, Craig Schiff, Joseph Xu, Aliya Rysbek, Yana Lunts, Jan Freyberg, Rebecca Hemengway, Sunny Virmani, David Racz, Carey Radebaugh, Joëlle Barral, Kavi Goel, Dale R. Webster, Katherine Chou, Avinatan Hassidim, Yossi Matias, James Manyika, Gregory Wayne, Tao Tu, Yun Liu, Ethan Goh, Christina Chen, Ryutaro Tanno, Po-Hsuan Cameron Chen, Mike Schaekermann, Anil Palepu

机构 * Google Research(谷歌研究院) Google DeepMind(谷歌DeepMind)

专题命中 视频多模态 :audio-visual(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本研究开发了基于Gemini的多智能体系统AMIE(视频版),在随机OSCE研究中其临床问诊表现与初级保健医生相当或更优,为专家级实时视频问诊医疗AI的发展奠定了重要基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06023 2026-08-07 cs.LG 新提交 67%

BioKD: Selective Physiology-to-Video Knowledge Distillation via Reliability Gate for Emotion Recognition

BioKD:通过可靠性门实现面向情感识别的选择性生理信号到视频的知识蒸馏

Bojing Hou, Ruohao Li, Yitong Zhu, Hongjun Liu, Luwen Yu, Yuyang Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) New York University(纽约大学)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract)

AI总结 本文提出BioKD框架,以生理信号为训练特权信息指导视频学生模型,通过可靠性门控抑制负迁移,在DEAP、AMIGOS数据集上的情感识别任务中优于基线,且推理无额外开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17523 2026-07-21 cs.CV cs.AI cs.CL 新提交 67%

Thinking in Video: Can Video Generators Really Reason About the Real World?

视频中的思考:视频生成器真的能对现实世界进行推理吗?

Yongheng Zhang, Guang Yang, Ruihan Hou, Qiguang Chen, Ziang Liu, Xiaolong Liu, Manman Zhang, Yanchao Hao, Zheng Wei, Hao Wu, Libo Qin, Peishan Dai, Yinghui Li, Di Yin, Xing Sun

机构 * Central South University(中南大学) Tencent(腾讯) Tsinghua University(清华大学)

专题命中 视频多模态 :audio-visual(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 探讨视频生成器能否对现实世界推理,引入因果生成双判断(CGDJ)评估,发现开源模型无明确因果感知却有合理动态,先进闭源系统推理与生成一致性有限,还揭示了视听失调问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16651 2026-07-21 cs.CR 新提交 67%

VIGIL: Verifying Identity via Gated Intermittent Likelihoods for Continuous Biometric Authentication

VIGIL:通过门控间歇似然性进行连续生物特征认证的身份验证

Aldridge Fonseca, Udayan Atreya, Amith Kamath Belman, Frank Sicong Chen

专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract)

AI总结 针对连续多模态认证中现有技术在低信号强度下难以区分真实用户与攻击者的问题,提出VIGIL框架,通过可配置跨模态融合、改进时间融合及采用三区验证决策模型等方法,有效解决现有局限并减少入侵检测时间。

Comments 16 pages, 6 figures, Supplementary Material Included

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04112 2026-07-07 cs.LG cs.AI cs.CL cs.CV 新提交 67%

DynaVieW: Schema-Guided World Modeling for Understanding Hierarchical Visual Dynamics

DynaVieW:用于理解分层视觉动态的模式引导世界建模

Silin Gao, Hao Zhao, Zeming Chen, Sepideh Mamooler, Antara Raaghavi Bhattacharya, Qiyu Wu, Hiromi Wakaki, Yuki Mitsufuji, Li Mi, Syrielle Montariol, Antoine Bosselut

机构 * EPFL, Switzerland(瑞士联邦理工学院) Harvard University(哈佛大学) Sony Group Corporation(索尼集团) ETH Zurich, Switzerland(瑞士苏黎世联邦理工学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 针对多模态语言模型难以系统建模视频视觉场景时间演变的问题,提出DynaVieW模型,通过学习交错状态转换序列理解视觉动态,在多架构下联合建模,提升下游视觉叙事创作等任务表现。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02588 2026-07-07 cs.CV cs.AI cs.CL 新提交 67%

Homer: Understanding Long-form Videos with Hierarchical Memory and Agentic Reasoning

荷马:通过分层记忆和智能推理理解长视频

Yixin Ji, Fanghua Ye, Juntao Li, Bo Zhao, Zexuan Qiu, Zhaopeng Tu, Liefeng Bo, Min Zhang

机构 * Soochow University(苏州大学) Tencent Hunyuan Multimodal Department(腾讯混元多模态部)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究长视频理解问题,提出荷马分层在线记忆探索与推理框架,其记忆反映视频多尺度结构,智能推理器按人类方式探索记忆,通过多轮检索组合答案,性能优于此前最佳方法。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27807 2026-06-29 cs.RO 新提交 67%

SpikeVLA: Vision-Language-Action Models with Spiking Neural Networks

SpikeVLA:基于脉冲神经网络的视觉-语言-动作模型

Ruiqi Song, Dujun Nie, Siyu Teng, Baiyong Ding, Xiaotong Zhang, Dong Li, Chenming Zhang, Yuchen Li, Hangbin Wu, Long Chen

专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract)

AI总结 提出SpikeVLA,一种脉冲VLA架构,通过事件驱动稀疏计算降低能耗,在导航和机器人控制任务中保持竞争力,适用于低功耗实时具身智能。

Comments Accepted by ICML 2026. 16 pages, 9 figures

Journal ref Proceedings of the 43rd International Conference on Machine Learning, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07512 2026-06-25 cs.CV cs.AI cs.CL 新提交 67%

MemDreamer: Decoupling Perception and Reasoning for Long Video Understanding via Hierarchical Graph Memory and Agentic Retrieval Mechanism

MemDreamer: 通过分层图记忆和智能体检索机制解耦感知与推理以实现长视频理解

Cong Chen, Guo Gan, Kaixiang Ji, ZhaoYang Zhang, Zhen Yang, Guangming Yao, Hao Chen, Jingdong Chen, Yi Yuan, Chunhua Shen

机构 * Ant Group(蚂蚁集团) Zhejiang University(浙江大学) Central South University(中南大学) HKUST(GZ)(香港科技大学(广州))

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出MemDreamer框架,通过分层图记忆和智能体检索机制解耦感知与推理,将长视频理解转化为智能体探索过程,在四个基准上达到SOTA,推理上下文窗口仅占全量2%且准确率提升12.5点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19161 2026-06-18 cs.RO 新提交 67%

HT-Bench: Benchmarking and Learning Dexterous Full-Hand Tactile Representations with Egocentric Vision

HT-Bench:基于自我中心视觉的灵巧全手触觉表示基准与学习

Yuzhe Huang, Jiaping Wu, Jiaming Jiang, Hezhe Lin, Aikebaier Aierken, Yunlong Wang, Kun Cheng, Ziyuan Jiao, Yuanxin Zhong

机构 * Beihang University(北航) Rimbot BUPT(北邮) ShanghaiTech University(上海科技大学) Tsinghua University(清华大学) CAS(中国科学院)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract)

AI总结 提出HT-Bench多任务基准和HandTouch编码器,通过大规模自我中心视觉与全手触觉数据,在触觉相似性检索、掩码修复、视觉到触觉合成等任务上验证了触觉表示的有效性。

Comments 9pages, 4figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08239 2026-06-09 cs.AI cs.CL cs.CV 新提交 67%

When No Answer Is Correct: Diagnosing Absent Answer Detection for MLLMs in Video Understanding

当没有正确答案时:诊断视频理解中多模态大语言模型的缺失答案检测

Yiheng Wang, Yueqian Lin, Lichen Zhu, Yudong Liu, Hai "Helen" Li, Yiran Chen

机构 * Duke University(杜克大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究多模态大语言模型在视频理解中检测缺失答案的能力,发现模型倾向于选择干扰项而非识别无正确答案,时间推理任务中问题更严重,链式思维提示虽提升检测率但仍不理想。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13113 2026-08-14 cs.CV cs.AI 新提交 62%

EgoMonth: A Month-Level Egocentric Video Benchmark for Long-Term Spatiotemporal Memory

EgoMonth:面向长期时空记忆的月级自我中心视频基准

Weitao Chen, Hu Jiaxin, Xie Tianyidan, Yang Li, Yuyi Qian, Banghao Xu, Ziheng Tang, Shenyi Wang, Mingyue Yu, Duo Li, Jiacheng Shi, Gao Wang, Zhan Xu, Zhicheng Qiu, Xuanfu Li, Jian Yang, Lanjun Wang, Zili Yi

机构 * Nanjing University(南京大学) Huawei Technologies Co., Ltd.(华为技术有限公司) Tianjin University(天津大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究人员推出首个月级自我中心视频基准EgoMonth,评估发现当前主流MLLMs的长期时空记忆能力远逊于人类,仅为有损总结器而非忠实记忆器。

Comments 21 pages, 4 figures, 6 tables, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11260 2026-08-13 cs.AI cs.CV 新提交 62%

Glance, Scrutinize, and Think: Advancing Video Anomaly Detection from Training-Free to Agentic Reasoning

扫视、审视与思考:将视频异常检测从无训练推进到智能体推理

Shibo Gao, Peipei Yang, Xu-Yao Zhang, Linlin Huang

机构 * Beijing Jiaotong University(北京交通大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对视频异常检测的“何时-何事”脱节问题,提出无训练框架GtS及工具增强型智能体方法,扩展基准并引入联合评估指标,实现了更高的异常检测准确性与推理速度。

Comments 34 pages, 8 figures, 8 tables. Journal extension of our AAAI 2026 paper (arXiv:2507.21507)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10949 2026-08-12 cs.CV cs.CL 新提交 62%

StreamFlow: Dynamic Memory Flows for Streaming Video Understanding

StreamFlow:用于流视频理解的动态内存流

Muxin Fu, Yifan Zhang, Wentao Zhang, Fangming Guo, Qian Chen, Guibin Zhang, Shuicheng Yan, Bo An

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 StreamFlow是一种动态视觉内存框架,通过中期内存过滤冗余、长期内存整合潜变量及注意力检索,在流视频理解任务中实现最优性能,同时提升视觉依据性并降低延迟与内存。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10932 2026-08-12 cs.CV cs.AI 新提交 62%

Temporally Grounded Compositional Camera Motion Understanding via Geometric Knowledge Distillation

基于几何知识蒸馏的时序锚定组合式相机运动理解

Dazhao Du, Shiyan Du, Jian Liu, Yongjian Yu, Bohai Gu, Tao Han, Hualuo Liu, Eric Liu, Yujia Zhang, Xi Chen, Song Guo

机构 * The Hong Kong University of Science and Technology(香港科技大学) Tencent(腾讯)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出CamDistill方法,通过几何知识蒸馏实现时序锚定的组合式相机运动理解,推出含4229个片段的CamChoreo基准,提升了相机运动识别的细粒度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10908 2026-08-12 cs.CV cs.CL 新提交 62%

Order Matters: LVLMs as Judges for Temporal Reasoning in Image Sequences

顺序很重要:LVLMs作为图像序列时间推理的评判者

Martina Ianaro, Guilherme Fernandes, Maurizio Gabbrielli, Joao Magalhaes

机构 * University of Bologna(博洛尼亚大学) NOVA School of Science and Technology(NOVA科技学院) NOVA Laboratory for Computer Science and Informatics(NOVA计算机科学与信息实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本研究发现大视觉语言模型(LVLMs)作为多模态评判者存在时间顺序判别缺陷,受首因、近因等结构性偏差影响,呼吁构建时间感知的视觉序列评估范式。

Comments 34 pages, camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏