arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-03-17 至 2026-03-17 共收录 6 信号源:cs.CV, eess.IV, cs.MM

1. 视频数据与评测 6 篇

2603.14426 2026-03-17 cs.CV cs.IR cs.MM 81%

GenState-AI: State-Aware Dataset for Text-to-Video Retrieval on AI-Generated Videos

GenState-AI:面向AI生成视频的基于状态的文本到视频检索数据集

Minghan Li, Tongna Chen, Tianrui Lv, Yishuai Zhang, Suchao An, Guodong Zhou

专题命中 视频数据与评测 :text-to-video(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出GenState-AI数据集,通过可控状态转换和显式端状态标注,解决文本到视频检索中时间推理和端状态定位不足的问题,评估两种基线模型并分析时间与语义混淆源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22170 2026-03-17 cs.LG cs.CV 79%

SoliReward: Mitigating Susceptibility to Reward Hacking and Annotation Noise in Video Generation Reward Models

SoliReward: 缓解视频生成奖励模型对奖励黑客和标注噪声的敏感性

Jiesong Lian, Ruizhe Zhong, Zixiang Zhou, Xiaoyue Mi, Long Hu, Yuan Zhou, Qinglin Lu, Yixue Hao, Junchi Yan

专题命中 视频数据与评测 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出SoliReward框架,通过单项目二元标注获取高质量数据,采用交叉提示配对策略构建偏好对,并引入改进的BT损失函数以缓解奖励黑客问题,提升视频生成奖励模型的鲁棒性。

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14468 2026-03-17 cs.CV cs.IR 79%

LongVidSearch: An Agentic Benchmark for Multi-hop Evidence Retrieval Planning in Long Videos

LongVidSearch: 一种多跳证据检索规划的代理基准

Rongyi Yu, Chenyuan Duan, Wentao Zhang

专题命中 视频数据与评测 :long video(title,abstract);分类 cs.CV

AI总结 LongVidSearch 是一个评估长视频中多跳证据检索规划的基准,通过标准化接口强制多跳检索,包含3000个问题,涵盖四种推理类别,测试代理在相同访问条件下检索规划的准确性与效率。

Comments 12 pages, 2 figures, appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19420 2026-03-17 cs.CV cs.LG 79%

CircuitProbe: Tracing Visual Temporal Evidence Flow in Video Language Models

CircuitProbe: 跟踪视频语言模型中的视觉时间证据流

Yiming Zhang, Zhuokai Zhao, Chengzhang Yu, Kun Wang, Zhendong Chu, Qiankun Li, Zihan Chen, Yang Liu, Zenghui Ding, Yining Sun, Qingsong Wen

专题命中 视频数据与评测 :video language model(title);video-language(abstract);分类 cs.CV

AI总结 研究提出CircuitProbe框架,通过视觉审计和语义追踪分析视频语言模型中的时间证据流,设计针对性干预提升时间理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11782 2026-03-17 cs.CV 57%

MatAnyone 2: Scaling Video Matting via a Learned Quality Evaluator

MatAnyone 2:通过学习的质量评估器扩展视频磨边

Peiqing Yang, Shangchen Zhou, Kai Hao, Qingyi Tao

专题命中 视频数据与评测 :long video(abstract);分类 cs.CV

AI总结 本文提出学习质量评估器MQE,用于无地面真实情况下评估alpha磨边的语义和边界质量,通过在线反馈和离线数据筛选构建大规模真实世界视频磨边数据集VMReal,实现高质量视频磨边。

Comments Accepted to CVPR 2026. Project page: https://pq-yang.github.io/projects/MatAnyone2/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03565 2026-03-17 cs.CV 57%

INST-IT: Boosting Instance Understanding via Explicit Visual Prompt Instruction Tuning

INST-IT:通过显式视觉提示指令微调提升实例理解

Wujian Peng, Lingchen Meng, Yitong Chen, Yiweng Xie, Yang Liu, Tao Gui, Hang Xu, Xipeng Qiu, Zuxuan Wu, Yu-Gang Jiang

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 本文提出INST-IT方法,通过显式视觉提示指令微调提升大模型的实例理解能力,构建了评估基准和数据集,并在多个基准上验证了方法的有效性。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏