arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 533 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 116 篇

2608.04866 2026-08-06 cs.CV 新提交 79%

Persistent Object Narratives for Token-Efficient Video Language Models

用于令牌高效视频语言模型的持久对象叙事

Junzhe Chen, Siyuan Meng, Xiaojie Guo

专题命中 视频理解 :video language model(title);video understanding(abstract);分类 cs.CV

AI总结 本文提出SlotNarrative,一种用于Video-LLM的紧凑结构化视觉接口,通过持久对象叙事减少视觉令牌数量,在多数据集上实现准确率与令牌数的良好权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04587 2026-08-06 cs.CV 新提交 79%

MetaVideoAgent: Automated Video-Agent Evolution for Long-Form Video Understanding

MetaVideoAgent:面向长视频理解的自动视频智能体进化框架

Benlei Cui, Ruize Wang, Junjie Li, Jinhao Chen, Longtao Huang, Yinghao Chen, Yuwen Zhai, Jingqun Tang, Ruijian Jia, Weiwei Wu, Pengfei Sun, Haiwen Hong

机构 * Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) ByteDance(字节跳动)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 MetaVideoAgent是自动进化视频智能体的框架,在VA-EvoBench上经4次迭代后将宏平均准确率从38.44%提至51.47%,性能优于现有最优固定设计智能体且成本更低。

Comments 16 pages, 7 figures. Code: https://github.com/Alibaba-VELLDEPTH/MetaVideoAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03112 2026-08-05 cs.CV cs.AI 新提交 79%

Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models

用于视频-语言模型高效推理的自适应两阶段视觉令牌剪枝

Paribesh Regmi, Qingshuang Chen, Chi Zhang, Heba Aly, Yelin Kim, Hongda Mao

专题命中 视频理解 :video-language(title);video understanding(abstract);分类 cs.CV

AI总结 针对视频-语言模型推理延迟高的问题,提出两阶段自适应令牌剪枝策略,先剪去视频冗余帧,再根据视频内容自适应剪去保留帧中的冗余令牌,无需额外训练微调,在10%令牌保留率下提升准确率7%并降低95%计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00714 2026-08-04 cs.CV cs.AI 新提交 79%

Coverage-Driven Adaptive Keyframe Selection for Video Understanding

面向视频理解的覆盖驱动型自适应关键帧选择

Junyang Zhang, Puhan Luo, Chen Tang, Yuxi Shi, Xiang-Yang Li

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文针对视频理解中LVLM处理大量帧计算开销大的问题,提出无需训练的CSES关键帧选择器,通过覆盖驱动的自适应策略减少需评分和选择的帧数量,同时保持准确率并提升选择速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28516 2026-07-31 cs.CV 新提交 79%

Beyond Frame Selection: Generative Latent Evidence Aggregation for Long-Video Understanding

超越帧选择:用于长视频理解的生成式潜在证据聚合

Bowen Liu, Shuning Wang, Xinpeng Ding, Zhiheng Wu, Bodong Du, Xiaomeng Li

机构 * The Hong Kong University of Science and Technology(香港科技大学) Baidu Inc.(百度公司) Alibaba Group(阿里巴巴集团) Xidian University(西安电子科技大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 该研究针对长视频理解的帧选择局限,提出GenEvA框架,通过查询条件化分布聚合跨帧潜在证据,在四个基准和两个视频多模态大语言模型主干上显著提升性能且开销极低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24064 2026-07-28 cs.CV cs.AI 新提交 79%

MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning

MarineEVT:通过视觉工具推理推进以事件为中心的海洋视频理解

Tuan-An To, Yuk-Kwan Wong, Tuan-Anh Vu, Ziqiang Zheng, Sai-Kit Yeung

机构 * The Hong Kong University of Science and Technology(香港科技大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) University of Electronic Science and Technology of China(电子科技大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 针对海洋视频理解面临的挑战,构建MarineEVT数据集,将其理解分解为EVT-R1过程,利用视觉工具驱动模型。实验显示EVT-R1优于多个SOTA VLMs,为海洋相关发展奠定基础并推动VLMs进步。

Comments Accepted to The 19th European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17386 2026-07-21 cs.CV 新提交 79%

SkyVLaM: Multimodal Large Language Model for UAV Video Understanding in Remote Sensing

SkyVLaM:用于遥感中无人机视频理解的多模态大语言模型

Kaiwen Jing, Ruixu Jia, Bingyao Li, Ruizhe Ou, Ming Wu, Chuang Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) Beijing Wuzi University(北京物资学院)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 针对无人机视频理解任务,提出多模态大语言模型SkyVLaM,通过时间基感知器构建稀疏令牌,正则化稀疏基,自适应选择密集段,联合大语言模型处理,还构建SkyVid,实验证明其能有效分配视觉令牌预算,提升语言条件视频分割效果。

Comments Accepted by WAICA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13298 2026-07-16 cs.CV 新提交 79%

FOLIO: Focused Semantic Memory for Streaming Video Understanding

FOLIO:用于流视频理解的聚焦语义记忆

Haoyang Fan, Dhruv Parikh, Anvitha Ramachandran, Sameh Gobriel, Nilesh Jain, Rajgopal Kannan, Viktor Prasanna

机构 * University of Southern California (USC)(南加州大学) Intel Labs(英特尔实验室) DEVCOM Army Research Office(陆军研究办公室)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 研究在线流视频理解中如何保留信息及组织历史记录的挑战,提出FOLIO聚焦语义记忆系统,通过动态聚焦状态更新记忆,结合短期视觉缓冲区与长期语义记忆,实现轻量级混合检索,提升性能并降低流记忆维护成本。

Comments 28 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10990 2026-07-14 cs.CV 新提交 79%

TreeSoc: Tree-Structured Dynamic Reasoning and Tool Synergy for Soccer Video Understanding

TreeSoc:用于足球视频理解的树状结构动态推理与工具协同

Thanh-Nhan Vo, Thanh-Khoi Nguyen, Trong-Thuan Nguyen, Trung-Hoang Le, Minh-Triet Tran

机构 * University of Science, VNU-HCM(胡志明市越南国立大学科学大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 针对当代视觉语言模型理解足球视频的挑战,提出TreeSoc框架,通过动态深度优先搜索机制分解查询,支持自适应工具路由,在多个数据集上取得优异成绩,证明其为视频理解的有效范式。

Comments Accepted to ICMV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08514 2026-07-10 cs.CV 新提交 79%

Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?

以自我为中心的视频-语言模型是否捕捉了以手和物体为中心的线索?

Masatoshi Tateno, Alexandros Stergiou, Risa Shinoda, Yoichi Sato, Dima Damen

机构 * The University of Tokyo(东京大学) University of Twente(特温特大学) University of Bristol(布里斯托大学)

专题命中 视频理解 :video-language(title,abstract);分类 cs.CV

AI总结 研究手部-物体交互识别中现有视频-语言模型的局限,提出结合手部-物体掩码训练与HOI-动态感知解码器的新范式,构建DEHOI测试平台评估,证明该方法更有效利用相关信息,在多方面优于现有模型,提升HOI理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24477 2026-07-10 cs.CV cs.AI cs.SD 新提交 79%

video-SALMONN-R$^3$: Learning to ReWatch, ReAsk, and ReAnswer for Efficient Video Understanding

video-SALMONN-R$^3$: 学习重看、重问和重答以实现高效视频理解

Yixuan Li, Guangzhi Sun, Yudong Yang, Chao Zhang

机构 * Tsinghua University(清华大学) ByteDance(字节跳动) University of Cambridge(剑桥大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 提出video-SALMONN-R$^3$,首个通过强化学习实现重看机制的视频大语言模型,无需链式思维冷启动,采用重答和重问策略提升视频问答效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05511 2026-07-08 cs.CV 新提交 79%

Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory

Light-Omni:基于长期记忆的智能视频理解中的反射优于推理

Chang Nie, Jiaju Wei, Junlan Feng, Chaoyou Fu, Caifeng Shan

机构 * Nanjing University(南京大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 研究针对智能视频理解中先进智能体依赖迭代推理成本高的问题,提出Light-Omni框架,通过双重上下文状态实现反射式轻量级视频理解,经实验验证其有效性,性能优于M3-Agent且能增强现有MLLMs。

Comments Project Page: https://clare-nie.github.io/Light-Omni

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04559 2026-07-07 cs.CV 新提交 79%

QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding

QSVideo:用于视频理解的查询条件语义时间检索

Wei Ao, Lan Wang, Vishnu Naresh Boddeti

机构 * Michigan State University(密歇根州立大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 针对视频理解中视觉语言模型性能随视频时长下降问题,提出QSVideo框架,通过查询条件语义排序器、联合优化相关性和多样性及时间对齐策略,提升视频VLM性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23327 2026-07-07 cs.CV cs.AI 新提交 79%

VideoAgent: All-in-One Framework for Video Understanding and Editing

VideoAgent: 视频理解与编辑的全能框架

Hengji Zhou, Lingxuan Huang, Jian Wang, Bing Zhou, Si Wu, Lianghao Xia, Chao Huang

机构 * South China University of Technology(华南理工大学) The University of Hong Kong(香港大学) Snap Inc(Snap公司) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 提出VideoAgent,一种基于多智能体编排的全能框架,通过自动镜头创建和30多个专业编辑智能体,解决现有系统在长视频理解和多样化编辑操作上的局限,在VideoEdit基准上实现87-95%编排成功率并降低60% API成本。

Comments Preprint. Code available at https://github.com/HKUDS/VideoAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01751 2026-07-03 cs.CV cs.AI 新提交 79%

MedStreamBench: A Time-Aware Benchmark for Streaming and Proactive Medical Video Understanding

MedStreamBench: 面向流式与主动式医疗视频理解的时间感知基准

Yuan Wang, Shujian Gao, Songtao Jiang, Zhengyu Hu, Zuozhu Liu

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Department of Electrical and Computer Engineering, Carnegie Mellon University(卡内基梅隆大学电气与计算机工程系)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 提出MedStreamBench基准,通过时间受限证据窗口和主动监控设置,评估模型在流式与主动式医疗视频理解中的回答时机与正确性,发现离线识别与时间感知决策间存在显著差距。

Comments 10 Pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31245 2026-07-01 cs.CV 新提交 79%

HyperVLP: Enhancing Hierarchical Surgical Video-Language Pre-training in Hyperbolic Space

HyperVLP: 在双曲空间中增强层次化手术视频-语言预训练

Yaojun Hu, Kun Yuan, Nassir Navab, Haochao Ying, Jian Wu, Nicolas Padoy

机构 * Zhejiang University(浙江大学) University of Strasbourg, CNRS, INSERM, ICube, UMR7357(斯特拉斯堡大学,CNRS,INSERM,ICube,UMR7357) IHU Strasbourg(斯特拉斯堡IHU) Technical University of Munich(慕尼黑工业大学)

专题命中 视频理解 :video-language(title,abstract);分类 cs.CV

AI总结 提出双曲空间手术视频-语言预训练框架HyperVLP,通过保留层次结构、缓解结构假负例并强制父子语义一致性,提升零样本和少样本手术阶段识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27187 2026-06-26 cs.CV cs.CL 新提交 79%

HarmVideoBench: Benchmarking Harmful Video Understanding in Large Multimodal Models

HarmVideoBench:大型多模态模型中有害视频理解的基准测试

Jiajun Wu, Haoyu Kang, Yining Sun, Jiacheng Hou, Heng Zhang, Danyang Zhang, Zhenjun Zhao, Haochi Zhang, Leixin Sun, Eric Hanchen Jiang, Yushan Li, Ruiyu Li, Mengkai Huang, Yan Gao, Xu Zhang, Guancheng Wan

机构 * Central South University(中南大学) Tsinghua University(清华大学) South China Normal University(华南师范大学) ByteDance Inc(字节跳动公司) University of Zaragoza(阿拉维达大学) CosmosMind Wuhan University(武汉大学) University of California, Los Angeles(加州大学洛杉矶分校) Southeast University(东南大学) Tencent(腾讯公司) Nankai University(南开大学) Supermicro Computer Inc(Supermicro计算机公司) Huazhong University of Science and Technology(华中科技大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 提出HarmVideoBench,一个包含1379个视频和4137道选择题的多层次诊断基准,从三个维度评估模型对有害视频的深层理解,并引入BCR方法将宏平均准确率从61.7%提升至84.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26762 2026-06-26 cs.CV cs.LG 新提交 79%

ProtoKV: Streaming Video Understanding under Delayed Query with Summary-State Memory

ProtoKV: 延迟查询下的流式视频理解与摘要状态记忆

Le Tu Ngoc Minh, Jinyeong Lim, Dongsu Han

机构 * KAIST(韩国科学技术院)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 提出ProtoKV,一种固定内存的流式视频理解记忆机制,通过摘要状态表示远历史,在长延迟查询下准确率提升高达12.5点。

Comments 20 pages, 4 figures, Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25658 2026-06-25 cs.CV 新提交 79%

Towards a Dynamic and Fixed-budget Memory Bank for Efficient Streaming Video Understanding

面向高效流式视频理解的动态固定预算记忆库

Baiyang Song, Yuli Lin, Qiong Wu, Tao Chen, Jun Peng, Xiao Chen, Yiyi Zhou, Rongrong Ji

机构 * Xiamen University(厦门大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 提出无训练方法CausalMem,通过在线语义基动态更新记忆库,在有限预算下最大化流式视频信息量,实现20倍视觉令牌压缩和82MB存储。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24286 2026-06-24 cs.CL cs.CV 新提交 79%

AVOC: Enhancing Hour-Level Audio-Video Understanding in Omni-Modal LLMs via Retrieval-Inspired Token Compression

AVOC:通过检索启发的令牌压缩增强全模态大语言模型中的小时级音视频理解

Yijing Chen, Wenhui Tan, Xiaoyi Yu, Yuyue Wang, Xin Cheng, Kaisi Guan, Hao Jiang, Xiangyang Li, Guojie Zhu, Ruihua Song

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Huawei Inc.(华为技术有限公司)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 提出AVOC框架,通过检索启发的令牌压缩模块,将多模态令牌压缩视为top-K检索问题,结合相关性、重要性和多样性三个标准,实现长时音视频理解,在小时级基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18586 2026-06-18 cs.CV cs.AI 新提交 79%

APT: Atomic Physical Transitions for Causal Video-Language Understanding

APT: 用于因果视频语言理解的原子物理转变

Shang Wu, Haoran Lu, Songling Liu, Chenwei Xu, Lie Lu, Pranav Maneriker, Fan Du, Manling Li, Zhaoran Wang, Han Liu

机构 * Northwestern University(西北大学) Dolby Laboratories(杜比实验室)

专题命中 视频理解 :video-language(title);video understanding(abstract);分类 cs.CV

AI总结 提出原子物理转变(APT)作为视频中因果状态变化的显式表示,并构建混合来源数据集,通过APT-Tune微调方法使VLM学习物理转变而不遗忘事件级知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16470 2026-06-16 cs.CV cs.RO 新提交 79%

Decoupled Object-Centric Video Understanding for Generating Robotic Manipulation Commands

解耦的以对象为中心的视频理解用于生成机器人操作指令

Thanh Nguyen Canh, Thanh-Tuan Tran, Haolan Zhang, Ziyan Gao, Xiem HoangVan, Nak Young Chong

机构 * School of Information Science, Japan Advanced Institute of Science and Technology(日本北陆先端科学技术大学院大学信息科学学院) University of Engineering and Technology, Vietnam National University(越南国立大学工程与技术大学) Department of Robotics, Hanyang University(汉阳大学机器人学系)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 提出解耦动作识别与对象选择的框架,通过TSM分类动作和对象选择算法识别任务相关对象,结合VLM生成精确指令,在Something-Something V2上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08239 2026-06-09 cs.AI cs.CL cs.CV 新提交 79%

When No Answer Is Correct: Diagnosing Absent Answer Detection for MLLMs in Video Understanding

当没有正确答案时:诊断视频理解中多模态大语言模型的缺失答案检测

Yiheng Wang, Yueqian Lin, Lichen Zhu, Yudong Liu, Hai "Helen" Li, Yiran Chen

机构 * Duke University(杜克大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 研究多模态大语言模型在视频理解中检测缺失答案的能力,发现模型倾向于选择干扰项而非识别无正确答案,时间推理任务中问题更严重,链式思维提示虽提升检测率但仍不理想。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07639 2026-06-09 cs.CV cs.AI 新提交 79%

MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention

MOSS-Video-Preview: 通过交叉注意力实现实时视频理解

Pengyu Wang, Chenkun Tan, Shaojun Zhou, Wei Huang, Qirui Zhou, Zhan Huang, Zhen Ye, Jijun Cheng, Xiaomeng Qian, Yanxin Chen, Xingyang He, Huazheng Zeng, Chenghao Wang, Pengfei Wang, Hongkai Wang, Shanqing Gao, Yixian Tian, Chenghao Liu, Xinghao Wang, Botian Jiang, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 提出双通道交叉注意力架构MOSS-Video-Preview,通过非阻塞感知与生成实现实时视频理解,在单H200上实现5倍首词加速和2.7倍解码吞吐提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07959 2026-08-11 cs.AI 新提交 78%

SCOUT: Self-Checking and Recovery-Aware Tool-Thought Agents for Ultra-Long Egocentric Video Reasoning

SCOUT:面向超长时长自我中心视频推理的自检查与恢复感知工具思维智能体

Keyang Zhong, Kuo Wang, Peng Liu, Quanlong Zheng, Junlin Xie, Zhijia Liang, Yanhao Zhang, Guanbin Li

机构 * Sun Yat-sen University(中山大学) Shenzhen Loop Area Institute(深圳河套学院) Guangdong OPPO Mobile Telecommunications Corp., Ltd.(广东欧珀移动通信有限公司) OPPO AI Center(OPPO人工智能中心) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 视频理解 :video reasoning(title);video understanding(abstract)

AI总结 本研究提出SCOUT智能体框架,结合自适应策略与UPS-GRPO方法,解决超长自我中心视频推理的错误传播及信用分配问题,在对应基准上达最优性能且短时长场景仍具竞争力。

Comments Accepted by ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04939 2026-08-06 cs.CL 新提交 75%

Reading Between the Frames: Interpreting Implicit and Non-literal Meaning in Social Media Videos

帧间解读:社交媒体视频中隐含与非字面意义的理解

Yang Wang, Yanan Ma, Yiqi Liu, Zi Yan Chang, Chi-Li Chen, Chia-Yi Hsiao, Tyler Loakman, Aline Villavicencio, Chenghao Xiao, Chenghua Lin

机构 * University of Manchester(曼彻斯特大学) Durham University(杜伦大学) University of Sheffield(谢菲尔德大学) University of Exeter(埃克塞特大学)

专题命中 视频理解 :video understanding(abstract);text-to-video(abstract);video-language(abstract)

AI总结 本文提出DrivelHub+基准,评估视频-语言模型推断社交媒体视频隐含意义的能力,从解释和表征两方面开展实验,衡量模型多模态感知与语用理解的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28678 2026-08-03 cs.AI cs.CV 新提交 74%

ViSAGE: Constructing Self-Correcting Memories for Long-Form Video Understanding

ViSAGE:为长视频理解构建自修正记忆

Xinkui Zhao, Enbo Chen, Yifan Zhang, Chang Liu, Guanjie Cheng, Naibo Wang, Yueshen Xu

机构 * Zhejiang University(浙江大学) Xidian University(西安电子科技大学)

专题命中 视频理解 :video understanding(title);分类 cs.CV

AI总结 ViSAGE是一种多模态智能体记忆框架,通过跨模态绑定、双向记忆精调及多智能体交叉验证解决长视频理解中的实体混淆等问题,较最强基线准确率提升5.9%。

Comments Accept by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06468 2026-07-08 cs.CV 新提交 74%

EgoPolice: A Benchmark for Egocentric Video Understanding in High-Stakes Police Body-Worn Camera Footage

EgoPolice:用于高风险警察随身摄像机视频中自我中心视频理解的基准

Max Gonzalez Saez-Diez, Jihoon Chung, Adam D. Wolsky, Gregory Lanzalotto, Dean Knox, Jonathan Mummolo, Brandon M. Stewart, Olga Russakovsky

机构 * Princeton University(普林斯顿大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 视频理解 :video understanding(title);分类 cs.CV

AI总结 研究旨在为高风险警察随身摄像机视频中的自我中心视频理解创建基准EgoPolice,通过精心挑选标注数据,设置分类和问答任务,对模型测试发现即使优秀模型预测高风险行动也有困难,该基准为开发相关模型及下游人工审查奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09641 2026-06-09 cs.CV 新提交 74%

MAVIS: Multi-Agent Video Retrieval via Structured Video Understanding

MAVIS: 通过结构化视频理解实现多智能体视频检索

Jie Zhang, Qilang Ye, Hao Zhou, Haochen Liang, Fei Luo

机构 * School of Computing and Information Technology, Great Bay University(大湾区大学计算机与信息技术学院) College of Computer Science, Nankai University(南开大学计算机学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Graduate School of Information Science and Technology, The University of Tokyo(东京大学信息科学与技术研究生院)

专题命中 视频理解 :video understanding(title);分类 cs.CV

AI总结 提出多智能体框架MAVIS,通过结构化语义库解析视频,利用逻辑感知辩论机制协作推理,无需全库扫描和微调即可实现高效视频检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08167 2026-08-11 cs.CV cs.LG 新提交 70%

Wiener Representation Filtering for VLM Hallucination Suppression

用于抑制视觉语言模型幻觉的维纳表示滤波

Ameen Ali, Tamim Zoabi, Lidor Brami, Lior Wolf

机构 * Tel Aviv University(特拉维夫大学)

专题命中 视频理解 :video understanding(abstract);video reasoning(abstract);分类 cs.CV

AI总结 该研究提出一种无需训练的事后维纳表示滤波技术,通过离线校准校正视觉语言模型深层前馈输出投影,可在保持运行速度的同时降低其对象幻觉,在多类模型及基准上均验证了有效性与通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏