arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 576 信号源:cs.CV, eess.IV, cs.MM

1. 视频数据与评测 576 篇

2605.01391 2026-06-12 cs.CV 版本更新 61%

VISTA: Video Interaction Spatio-Temporal Analysis Benchmark

VISTA:视频交互时空分析基准

Alejandro Aparcedo, Akash Kumar, Aaryan Garg, Dalton Pham, Wen-Kai Chen, Anirudh Bharadwaj, Aman Chadha, Yogesh Rawat

机构 * University of Central Florida(中央佛罗里达大学) BITS Pilani(比特斯理工学院) Ho Chi Minh City University of Science(胡志明市科学大学) Amazon GenAI Project(亚马逊生成人工智能项目)

专题命中 视频数据与评测 :video understanding(abstract,comments);分类 cs.CV

AI总结 提出VISTA基准,通过分解视频为实体、动作和关系,实现开放集多实体多动作的时空理解评估,揭示传统指标掩盖的偏差。

Comments Accepted to CVPR 2026 Workshop on Pixel-level Video Understanding in the Wild (PVUW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09200 2026-08-14 cs.CV 版本更新 57%

NBA_Streaming: A Large-Scale Benchmark for Fine-Grained Basketball Commentary Generation in Continuous Streams

NBA_Streaming:用于连续流中细粒度篮球评论生成的大规模基准测试

Lifang Wu, Yuyang Wu, Yangdong Gao, Fengyu Liu, Ya Jing, Liang Wang

机构 * School of Information Science and Technology, Beijing University of Technology(北京工业大学信息科学与技术学院) Fudan University(复旦大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 针对现有篮球评论生成方法与数据集不适用于连续流的局限,推出大规模基准NBA_Streaming,提出因果两阶段框架,可有效提升在线细粒度篮球评论生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10317 2026-08-12 cs.CV 新提交 57%

From Detection to Understanding: TAR and TAR-Bench for Multi-Task Traffic Anomaly Reasoning

从检测到理解:用于多任务交通异常推理的TAR与TAR-Bench

Han Zhang, Yilin Zhao, Zaid Pervaiz Bhat, Zheng Tang, Varun Praveen, Vidya N. Murali, David C. Anastasiu, Tomasz Kornuta

机构 * NVIDIA(英伟达) Santa Clara University(圣克拉拉大学)

专题命中 视频数据与评测 :video-language(abstract);分类 cs.CV

AI总结 该研究提出TAR与TAR-Bench数据集,用于训练评估超越异常检测的视频-语言模型,经实验验证其多任务微调可提升模型推理能力,且为2026年AI城市挑战赛第3赛道提供官方数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09594 2026-08-11 cs.CV cs.AI 新提交 57%

Illusion or Integrity? Geometrical Consistency Metric for AIGC Video Quality Evaluation

幻觉还是完整性?用于AIGC视频质量评估的几何一致性指标

Yifei Xue, Yuanchen Fei, Hao Zhang, Chenzhi Nie, Tie ji, Yizhen Lao

机构 * Hunan University(湖南大学)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 针对现有AIGC视频质量评估缺乏物理定律保真度量化指标的问题,提出GeoCon-Bench基准,通过帧间几何一致性评估AIGC视频质量,经实验验证其可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09139 2026-08-11 cs.CV 新提交 57%

CodecArena: Codec Quality Assessment via Visual Reinforcement Learning

CodecArena:基于视觉强化学习的编解码器质量评估

Jiaye Fu, Weiqi Li, Qiankun Gao, Yanchen Zhao, Xiandong Meng, Jian Zhang, Siwei Ma, Jiaqi Zhang

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 研究针对视频编码主流指标无法准确评估内容保真度的问题,提出首个视频编码质量评估视觉-语言框架CodecArena,采用视觉强化学习方案优化,构建相关数据集与基准,在源不相交内容上实现优于现有方法的人类判断一致性。

Comments The project page is: https://jyfu-vcl.github.io/codecarena

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05747 2026-08-07 cs.CV 新提交 57%

GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?

GST-Bench:视觉语言模型能否从视频中发展出全局空间感知能力?

Qifeng Zhang, Kaixiang Huang, Heng Dong, Huang Fang, Junting Chen, Junjie Zhu, Yonghang Chen, Zhiyu Zhang, Wei Li

机构 * ByteDance Seed(字节跳动 Seed) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 该研究提出GST-Bench基准评估VLMs的视频全局空间感知,发现其与人类存在显著差距,构建GST-Bench-Local探究原因,还提供GST-Train数据集助力相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21686 2026-08-06 cs.CV 版本更新 57%

WorldMark: A Unified Benchmark Suite for Interactive Video World Models

WorldMark:交互式视频世界模型的统一基准套件

Xiaojie Xu, Zhengyuan Lin, Kang He, Yukang Feng, Xiaofeng Mao, Yuanyang Yin, Yongtao Ge, Kaipeng Zhang

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 WorldMark 是交互式视频世界模型的统一基准套件,通过适配器解决动作格式不兼容问题,从多维度评估模型,揭示现有协议未察觉的差异,将发布相关数据与代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03096 2026-08-05 cs.CR cs.AI cs.CV 新提交 57%

FakeI2V-Bench: Benchmarking the Applicability of Image-level Deepfake Detectors for Deepfake Video Detection

FakeI2V-Bench:评估图像级深度伪造检测器在深度伪造视频检测中的适用性

Pei Li, Sihan Chen, Delong Ran, Tianshuo Cong

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 本研究构建FakeI2V-Bench基准,评估图像级深度伪造检测器在视频检测中的性能,提出IV-Bridge框架聚合帧级预测,使多数图像级检测器性能超越现有视频级方法,为相关研究提供基准与新方向。

Comments To Appear in KDD 2026, Jeju, Korea, August 9-13, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02035 2026-08-04 cs.MM cs.SD 新提交 57%

AcoustiTrace: When Plausible Sound Violates Physics

AcoustiTrace:看似合理的声音为何违背物理规律

Shiyang Li, Yuewen Cao, Yihao Liu, Yuandong Pu, Baochang Zhang, Xiaofei Li, Changqing Zou

专题命中 视频数据与评测 :video generation(abstract);分类 cs.MM

AI总结 该研究提出AcoustiTrace诊断基准,从八个声学维度评估T2AV和I2AV生成,构建相关数据集与评估器,发现领先模型仍难符合基础声学规律,其诊断可指导模型优化与新方向探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12147 2026-08-04 cs.CV 版本更新 57%

EgoIntent: A Pre-Outcome Micro-Step Benchmark for Understanding What, Why, and Next

EgoIntent: 一种用于理解‘是什么、为什么和下一步’的以自我为中心的步级基准

Ye Pan, Chi Kit Wong, Yuanhuiyi Lyu, Hanqian Li, Chenfei Liao, Jiahao Huo, Lutao Jiang, Zixin Zhang, Jiacheng Chen, Yuqian Fu, Xu Zheng

专题命中 视频数据与评测 :video reasoning(abstract);分类 cs.CV

AI总结 EgoIntent基准旨在通过步级意图理解解决以自我为中心视频中对‘是什么、为什么和下一步’的细粒度理解难题,包含15种日常生活场景,评估模型在三个维度上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26518 2026-07-31 cs.CV 版本更新 57%

EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding

EgoSafe:用于视觉安全理解的第一人称移动采集基准

Yuyun Chen, Tianao Li, TianQuan Feng, Cen Chen, Huiping Zhuang, Hao Peng, Ziqian Zeng

机构 * South China University of Technology(华南理工大学) Beihang University(北京航空航天大学)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 该研究推出第一人称移动采集的视觉安全理解基准 EgoSafe-Bench,含12000个样本,用分层推理评估(HRE)协议测试,发现现有大视觉语言模型存在感知-推理解耦问题,为逻辑鲁棒视频理解系统提供评估框架

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26452 2026-07-30 cs.AI cs.CV cs.GR 新提交 57%

CG-World: A Large-Scale World-State Dataset and Protocol for World Models

CG-World:面向世界模型的大规模世界状态数据集与协议

Yiming Cai, Fangjie Yu, Meiqing Yu, Ziyue Shi, Pengfei Yuan, Yong Guo

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 CG-World是源自工业计算机图形流水线的大规模世界状态数据集,含约85万时间对齐片段,支持干预学习与反事实推理,经评估可为世界模型相关任务提供结构化监督,拟打造共享数据基础设施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06254 2026-07-30 cs.CV cs.AI 版本更新 57%

VendorBench-100: A Unified Cross-Paradigm Benchmark for Deepfake Image Detection

VendorBench-100:用于深度伪造图像检测的统一跨范式基准测试

Sharayu N. Deshmukh, Md Rashidunnabi, Nelton Tiago Gemo, Kurundkar G. D., Mahamune M. R., Nilesh K. Deshmukh

机构 * Universidade da Beira Interior(贝拉内斯大学) Shri Guru Buddhi Swami College(什里·古鲁·布迪·斯瓦米学院) Swami Ramanand Tirtha Marathwada University(斯瓦米拉曼南德·蒂尔塔马哈拉施特拉大学)

专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV

AI总结 研究针对深度伪造图像检测的三种范式缺乏通用评估的问题,提出VendorBench-100基准测试,用统一框架评估36个模型,强调现实场景,通过MCC排名,发现ROC-AUC与MCC有差异,还发布评估框架和结果助力后续研究。

Comments Fixed scoring-normalization error in Neural Defend/TruthScan results, revising the central finding: MCC and ROC-AUC are strongly correlated (r ~ 0.86) overall, with only a specific subset showing one-directional threshold miscalibration. Abstract, tables, Discussion, Conclusion updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25392 2026-07-29 cs.CV 新提交 57%

RDVSv2: A Large-scale Benchmark for RGB-D Video Salient Object Detection

RDVSv2:用于RGB-D视频显著目标检测的大规模基准测试

Tianyu Li, Jiahao He, Keren Fu, Qijun Zhao

机构 * National Key Laboratory of Fundamental Science on Synthetic Vision, Sichuan University(四川大学合成视觉基础科学国家重点实验室) College of Computer Science, Sichuan University(四川大学计算机学院)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 介绍用于RGB-D视频显著目标检测的大规模基准测试RDVSv2,其规模大、场景多样。基于SAM2建立强大基线,采用参数高效微调策略联合编码多模态线索,该基线在RDVSv2及现有基准测试中达最优,为相关研究提供资源。

Comments Accepted to ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22302 2026-07-27 cs.CV 新提交 57%

fMRI2Face: A Full-HD fMRI-Video Dataset and Geometry-Guided Neural Decoding Framework for Dynamic Human Face Reconstruction

fMRI2Face:用于动态人脸重建的全高清功能磁共振成像视频数据集和几何引导神经解码框架

Jingyang Huo, Xiangru Huang, Chentao Shen, Yikai Wang, Yun Wang, Jianxiong Gao, Shihao Jin, Yanwei Fu, Jianfeng Feng

机构 * Fudan University(复旦大学) Westlake University(西湖大学) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Xmov(未提及通用中文名,可音译为艾莫夫)

专题命中 视频数据与评测 :video diffusion(abstract);分类 cs.CV

AI总结 该研究提出fMRI-Face数据集及fMRI2Face框架,用于从大脑活动重建动态人脸。框架从大脑活动中获取两种互补神经控制,经整合实现高保真面部视频重建,实验显示其性能优于基线,为动态面部感知研究提供了新平台和基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21228 2026-07-24 cs.CV 新提交 57%

T-STAR: A Large-Scale Benchmark for Spatio-Temporal Panoptic Scene Graph Generation in Satellite Video

T-STAR:卫星视频中时空全景场景图生成的大规模基准测试

Linlin Wang, Xue Yang, Zhihuang Zhou, Zhenyu Zhong, Ruiyuan Zhang, Yansheng Li

机构 * School of Remote Sensing and Information Engineering, Wuhan University(武汉大学遥感信息工程学院) School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 本文针对卫星视频结构化理解难题,提出时空全景场景图生成任务,构建T-STAR大规模基准数据集,含超百万实例掩码和时空三元组,还提出统一框架,经实验验证其对卫星视频理解研究的重要性和框架有效性。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06550 2026-07-23 cs.CV cs.AI 版本更新 57%

Generative Semantic Multi-Object Tracking: A Large-Scale Benchmark and an MLLM-Driven Reasoning Framework

生成式语义多目标跟踪:大规模基准和基于大型语言模型的推理框架

Pan Liao, Feng Yang, Di Wu, Jinwen Yu, Wang Zhao, Dingwen Zhang

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 研究将语义多目标跟踪从刚性分类提升为开放式生成推理任务,引入Grand-SMOT基准,提出LLMTrack框架,通过时空融合模块压缩轨迹为语义令牌,提升了生成语义推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16742 2026-07-21 cs.CV 新提交 57%

Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model

人工智能生成的以人为中心的视频的多维质量评估:数据集与模型

Sijing Wu, Yunhao Li, Huiyu Duan, Yucheng Zhu, Xiongkuo Min, Patrick Le Callet, Guangtao Zhai

机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(上海交通大学图像通信与网络工程研究所) USC-SJTU Institute of Cultural and Creative Industry, Shanghai Jiao Tong University(上海交通大学南加州大学文化创意产业学院) Polytech Nantes, Université de Nantes(法国南特大学高等理工学院)

专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV

AI总结 研究针对AI生成的以人为中心的视频质量评估问题,提出扩展数据集HVEval+并构建MoE-Rater模型,该模型采用专家混合及三阶段训练策略,能统一多种任务,在相关数据集上性能优越,推动了视频质量评估及T2V模型优化。

Comments Accepted for publication in IEEE TCSVT, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16401 2026-07-21 cs.CV 新提交 57%

Apple-$π$: Benchmarking Thinking with Video Towards Law-Grounded Physical Intelligence

Apple-$π$:基于视频对基于法律的物理智能进行思维基准测试

Runmao Yao, Kairui Hu, Yukang Cao, Ruisi Wang, Shulin Tian, Ziang Cao, Weichen Fan, Ziqi Huang, Yuhao Dong, Hao Li, Zhaoxi Chen, Zhongang Cai, Lei Yang, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab) The Chinese University of Hong Kong(香港中文大学)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 研究针对视频模型评估仅看输出层面的不足,提出Apple-PI基准,含数据集、协议和评估套件三部分,通过对11个模型测试发现其距可靠世界模拟器差距大,并揭示了一些瓶颈与差距,为指导视频模型发展提供诊断基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16351 2026-07-21 cs.CV cs.AI 新提交 57%

Privacy-Aware Synthetic Video Benchmarking and Relational Evaluation for Worker-Under-Suspended-Load Detection

用于悬吊负载下工人检测的隐私感知合成视频基准测试与关系评估

Anshu Singh, Alejandro Seif

机构 * Government Technology Agency of Singapore(新加坡政府科技局)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 研究悬吊负载下工人检测的隐私问题,引入SynthSite合成视频基准测试及隐私感知混合生成工作流程,在五种隐私条件下评估相关指标,发现保留结构的模糊处理效用更好,强调建筑安全分析隐私评估需兼顾外观抑制和几何线索保留。

Comments Accepted at the 3rd Workshop on Synthetic Data for Computer Vision (SynData4CV), CVPR 2026. OpenReview: https://openreview.net/forum?id=dMfhFmDWsg . Dataset and code: https://huggingface.co/datasets/govtech/SynthSite

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13552 2026-07-20 cs.CV 版本更新 57%

A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects

视频场景解析的全面综述:进展、挑战与展望

Guohuan Xie, Syed Ariff Syed Hesham, Wenya Guo, Bing Li, Ming-Ming Cheng, Guolei Sun, Yun Liu

机构 * College of Software, Nankai University Tianjin China School of Electrical Electronic Engineering, NTU \& Institute for Infocomm Research, A STAR Singapore School of Information College of Computer Science, Nankai University Tianjin China VCIP, College of Computer Science, Nankai University Tianjin China Academy for Advanced Interdisciplinary Studies, Nankai University Tianjin China Nankai International Advanced Research Institute Shenzhen Futian China College of Software, Nankai University Electronic Engineering, NTU \& Institute for Infocomm Research, A STAR College of Computer Science, Nankai University VCIP, College of Computer Science, Nankai University Academy for Advanced Interdisciplinary Studies, Nankai University Nankai International Advanced Research Institute

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 该综述对视频场景解析在五项任务上的进展进行梳理,涵盖从手工线索到基础模型方法的文献架构,分析各方法特点,比较相关数据集等,指出设计权衡和失败模式,并给出未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26772 2026-07-09 cs.CV cs.AI cs.CY 版本更新 57%

From Content to Audience: A Multimodal Annotation Framework for Broadcast Television Analytics

从内容到受众:一种多模态注释框架用于广播电视分析

Paolo Cupini, Francesco Pierri

机构 * Dipartimento di Elettronica, Informazione e Bioingegneria, Politecnico di Milano, Italy(意大利米兰理工大学电子、信息与生物工程系)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 本文提出了一种多模态注释框架,用于广播电视内容分析,通过构建特定领域的基准测试,评估不同管道架构在广播新闻中的表现,展示了框架在受众分析中的应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03069 2026-07-07 cs.CV 新提交 57%

SafeGuard: A Multi-Agent Perception-Reasoning Framework for Social-Risk AI-Generated Video Detection

SafeGuard:用于社会风险AI生成视频检测的多智能体感知-推理框架

Wenlin Wu, Sheng Zhou, Peipei Song, Wenhao Wang, Junbin Xiao, Xun Yang

机构 * University of Science and Technology of China(中国科学技术大学) King Abdullah University of Science and Technology(阿卜杜拉国王科技大学) Vast Intelligence Lab(旷视智能实验室)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 针对AI生成视频检测挑战,提出SafeGuard多智能体框架,通过感知求解器与验证器协作,引入SafeVid基准,实验证明其泛化性佳,提升检测准确率。

Comments Accepted to ECCV 2026, The code and dataset are publicly available at https://github.com/williamw99/SafeGuard

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02096 2026-07-03 cs.CV 新提交 57%

LongEgoRefer: A Benchmark for Long-Form Egocentric Video Referring Expression Comprehension

LongEgoRefer: 长形式自我中心视频指代表达理解基准

Shunya Kato, Taiki Miyanishi, Shuhei Kurita, Mahiro Ukai, Nakamasa Inoue, Chenhui Chu

机构 * Woven by Toyota, Japan(丰田公司,日本) The University of Tokyo, Japan(东京大学,日本) National Institute of Informatics, Japan(日本信息机构国家研究所) Institute of Science Tokyo, Japan(东京科学研究所,日本) NII LLMC, Japan(日本信息机构LLMC) Kyoto University, Japan(京都大学,日本)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 提出LongEgoRefer基准,基于Ego4D长视频构建,解决现有基准仅关注短视频导致目标稀疏和活动复杂的问题,评估现有方法发现性能显著下降,凸显长形式自我中心时空定位的挑战。

Comments ECCV 2026. Dataset and code: https://github.com/shunya-kato/LongEgoRefer

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10180 2026-07-02 cs.CV 版本更新 57%

TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval

TCMA:面向无人机跨模态文本-视频检索的文本条件多粒度对齐

Zixu Zhao, Yang Zhan, Yunhao Li, Yan Li

机构 * Carnegie Mellon University(卡内基梅隆大学) The Hong Kong Polytechnic University(香港理工大学) Wuhan University(武汉大学)

专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV

AI总结 针对无人机视频检索中数据集粗粒度、冗余标注问题,构建细粒度多样化标注数据集DVTMD,并提出文本条件多粒度对齐框架TCMA,实现全局-局部多层级对齐,在无人机文本-视频检索任务上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26551 2026-06-29 cs.CV 新提交 57%

PhyEditBench: A Real-World Multi-Stage Benchmark for Physics-Aware Image Editing

PhyEditBench: 一个用于物理感知图像编辑的真实世界多阶段基准

Shengbin Guo, Shaokang He, Chaoyue Meng, Shengpeng Xiao, Xunzhi Xiang, Shaofeng Zhang, Qi Fan

机构 * Nanjing University(南京大学) SDU(山东大学) HRBEU(哈尔滨工程大学) SDUTCM(山东中医药大学) USTC(中国科学技术大学)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 提出PhyEditBench基准,通过分层分类和真实/反物理实例评估编辑模型的物理理解能力,并引入训练无关基线PhyWorld利用视频生成推理。

Comments 19 pages, 6 figures, 2 tables. Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24422 2026-06-24 cs.CV 新提交 57%

EgoSAT: A Comprehensive Benchmark of Egocentric Streaming Interaction Understanding

EgoSAT: 一个全面的自我中心流式交互理解基准

Yijia Lei, Jinzhao Li, Yichi Zhang, Jiacheng Hua, Yin Li, Miao Liu

机构 * College of AI, Tsinghua University(清华大学人工智能学院) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 视频数据与评测 :video reasoning(abstract);分类 cs.CV

AI总结 提出EgoSAT基准,统一自我中心视频的回顾、在线和前瞻推理任务,评估视觉语言模型在流式设置中的表现,发现现有模型存在前瞻/回顾困难及置信度校准问题。

Comments Accepted to ECCV 2026. Project page: https://leiyj23.github.io/EgoSAT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24256 2026-06-24 cs.CV 新提交 57%

Trimming the Long-Tail of Visual World Modeling Evaluation

修剪视觉世界建模评估的长尾

Bingxuan Li, Yining Hong, Cheng Qian, Hyeonjeong Ha, Jiateng Liu, Zhenhailong Wang, Yue Guo, Yunzhu Li, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学) Columbia University(哥伦比亚大学)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 针对视觉世界模型在罕见物理交互上泛化不足的问题,提出Tailor-Bench基准,通过常规、非常规和不可能三种场景模式系统评估模型推理能力,揭示长尾性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14145 2026-06-23 cs.CL cs.CV 版本更新 57%

MMOU: A Massive Multi-Task Omni Understanding and Reasoning Benchmark for Long and Complex Real-World Videos

MMOU:面向长且复杂真实世界视频的大规模多任务全模态理解与推理基准

Arushi Goel, Sreyan Ghosh, Vatsal Agarwal, Nishit Anand, Kaousheik Jayakumar, Lasha Koroshinadze, Yao Xu, Katie Lyons, James Case, Karan Sapra, Kevin J. Shih, Siddharth Gururani, Abhinav Shrivastava, Ramani Duraiswami, Dinesh Manocha, Andrew Tao, Bryan Catanzaro, Mohammad Shoeybi, Wei Ping

机构 * NVIDIA, USA(NVIDIA美国分公司) University of Maryland, College Park, USA(马里兰大学帕克分校)

专题命中 视频数据与评测 :long video(abstract);分类 cs.CV

AI总结 提出MMOU基准,包含2万个人工标注问题与11877个长视频,覆盖13项技能,评估多模态大模型在长视频中的全模态理解与推理能力,最佳闭源模型仅64.2%准确率,开源模型46.8%。

Comments Project Page: https://huggingface.co/datasets/nvidia/MMOU

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18180 2026-06-17 cs.CV 新提交 57%

EgoCS-400K: An Egocentric Gameplay Dataset for World Models

EgoCS-400K:面向世界模型的自我中心游戏数据集

Rongjin Guo, Dong Liang, Yuhao Liu, Fang Liu, Tianyu Huang, Gerhard P. Hancke, Rynson W. H. Lau

机构 * City University of Hong Kong(香港城市大学)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 为支持世界模型研究,构建大规模自我中心游戏数据集EgoCS-400K,包含40万第一人称视频和1万小时游戏轨迹,支持动作条件未来预测、状态事件场景展开等交互式视觉建模任务。

详情

展开后加载摘要…

URL PDF HTML 收藏