arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-03-24 至 2026-03-24 共收录 3 信号源:cs.CV, eess.IV, cs.MM

1. 视频数据与评测 3 篇

2603.22212 2026-03-24 cs.CV 57%

Omni-WorldBench: Towards a Comprehensive Interaction-Centric Evaluation for World Models

Omni-WorldBench:迈向全面的交互导向的世界模型评估

Meiqi Wu, Zhixin Cai, Fufangchen Zhao, Xiaokun Feng, Rujing Dang, Bingze Song, Ruitian Tian, Jiashu Zhu, Jiachen Lei, Hao Dou, Jing Tang, Lei Sun, Jiahong Wu, Xiangxiang Chu, Zeming Liu, Kaiqi Huang

机构 * School of Computer Science and Technology, UCAS(UCAS计算机科学与技术学院) The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, CASIA(复杂系统认知与决策智能重点实验室) School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) State Key Laboratory of Networking and Switching Technology, BUPT(网络与交换技术国家重点实验室) AMAP, Alibaba Group(阿里妈妈实验室,阿里巴巴集团)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 本文提出Omni-WorldBench,一个针对4D世界模型交互响应能力的综合评估基准,通过Omni-WorldSuite和Omni-Metrics评估交互动作对状态转移的影响,分析现有模型的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21566 2026-03-24 cs.CV cs.AI cs.DB cs.LG cs.RO 57%

CataractSAM-2: A Domain-Adapted Model for Anterior Segment Surgery Segmentation and Scalable Ground-Truth Annotation

白内障手术分割与可扩展地面真实标注的领域适应模型CataractSAM-2

Mohammad Eslami, Dhanvinkumar Ganeshkumar, Saber Kazeminasab, Michael G. Morley, Michael V. Boland, Michael M. Lin, John B. Miller, David S. Friedman, Nazlee Zebardast, Lucia Sobrin, Tobias Elze

机构 * Thomas Jefferson High School for Science and Technology(托马斯·杰弗逊高中科学与技术学校) Mass Eye and Ear, Harvard Medical School(麻省眼耳研究所,哈佛医学院) Harvard Ophthalmology AI Lab, Schepens Eye Research Institute of Mass Eye and Ear, Harvard Medical School(哈佛眼科学人工智能实验室,麻省眼耳研究所的谢普恩斯眼研究学院,哈佛医学院)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 本文提出CataractSAM-2,一种针对白内障眼科手术视频的实时语义分割模型,结合稀疏提示与视频掩码传播框架,提升标注效率并推动高质量地面真实标注的可扩展生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12656 2026-03-24 cs.CV 57%

SPKLIP: Aligning Spike Video Streams with Natural Language

SPKLIP:通过自然语言对齐尖峰视频流

Yongchang Gao, Meiling Jin, Zhaofei Yu, Tiejun Huang, Guozhang Chen

专题命中 视频数据与评测 :video-language(abstract);分类 cs.CV

AI总结 SPKLIP提出了一种专门用于尖峰视频-语言对齐的架构,通过分层尖峰特征提取器和尖峰-文本对比学习实现多尺度时间动态建模,并在稀疏异步输出上实现高效的少样本学习。

Comments A dataset partitioning error occurred and is being corrected

详情

展开后加载摘要…

URL PDF HTML 收藏