Comments13 pages, 4 figures. Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE '26), Industry Showcase track, Munich, Germany, October 12-16, 2026
VideoGAIA: A Benchmark for General AI Assistants on Agentic Video Understanding
VideoGAIA:面向通用人工智能助手的智能体视频理解基准
Fan Zhang, Guangming Yao, Jinyang Wu, Hao Wu, Zheng Lian, Xinyu Geng, Jingdong Chen, Yi Yuan, Pheng-Ann Heng
机构
*
The Chinese University of Hong Kong(香港中文大学)
;
Ant Group(蚂蚁集团)
;
Tsinghua University(清华大学)
;
Tongji University(同济大学)
;
The Hong Kong University of Science and Technology(香港科技大学)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.CL
Diagram-MMU: A Multi-Modal Benchmark for Scientific Diagrams
Diagram-MMU:面向科学图表的多模态基准测试
Weihao Bo, Shan Zhang, Yanpeng Sun, Jie Liu, Yongke Yao, Jinhao Du, Wei He, Kai Zou, Zechao Li, Jingdong Wang
机构
*
Nanjing University of Science and Technology(南京理工大学)
;
Baidu Inc(百度公司)
;
AIML, Adelaide University(阿德莱德大学AIML)
;
SUTD(新加坡科技设计大学)
;
Southeast University(东南大学)
;
East China Normal University(华东师范大学)
;
University of Oxford(牛津大学)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.AI