arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-03-03 至 2026-03-03 共收录 32 信号源:cs.CV, eess.IV, cs.MM

1. 视频数据与评测 2 篇

2603.00585 2026-03-03 cs.AI cs.CV 57%

MicroVerse: A Preliminary Exploration Toward a Micro-World Simulation

MicroVerse: 微观世界模拟的初步探索

Rongsheng Wang, Minghao Wu, Hongru Zhou, Zhihan Yu, Zhenyang Cai, Junying Chen, Benyou Wang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Peking Union Medical College Hospital(北京协和医学院附属医院) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 MicroVerse通过构建MicroWorldBench和MicroSim-10K数据集,首次提出微观世界模拟概念,展示其在生物机制教育中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04326 2026-03-03 cs.CV cs.AI 57%

WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs

WorldSense: 评估多模态大语言模型的现实世界多模态理解

Jack Hong, Shilin Yan, Jiayin Cai, Xiaolong Jiang, Yao Hu, Weidi Xie

机构 * Xiaohongshu Inc.(小红书公司) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 WorldSense是首个评估多模态大语言模型现实世界多模态理解能力的基准,通过多模态协作、多样化视频任务和高质量标注,全面评估模型在复杂场景中的表现。

Comments Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏