2601.06521
2026-07-08
cs.CV
cs.CL
版本更新
BabyVision: Visual Reasoning Beyond Language
BabyVision:超越语言的视觉推理
Liang Chen, Weichu Xie, Yiyan Liang, Hongfeng He, Hans Zhao, Zhibo Yang, Zhiqi Huang, Haoning Wu, Haoyu Lu, Y. charles, Yiping Bao, Yuantao Fan, Guopeng Li, Haiyang Shen, Xuanzhong Chen, Wendong Xu, Shuzheng Si, Zefan Cai, Wenhao Chai, Ziqi Huang, Fangfu Liu, Tianyu Liu, Baobao Chang, Ming Wu, Xiaobo Hu, Kaiyuan Chen, Yixin Ren, Yang Liu, Yuan Gong, Kuan Li
机构
*
UniPat AI
;
xbench
;
Alibaba Group(阿里巴巴集团)
;
MoonShot AI
;
StepFun
;
Peking University(北京大学)
;
Tsinghua University(清华大学)
;
University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
;
Princeton University(普林斯顿大学)
;
Nanyang Technological University(南洋理工大学)
;
G Labs Equal Core Contributors(0G Labs 等核心贡献者)
AI总结
研究发现当代多模态语言模型依赖语言先验,在基本视觉任务上表现差。为此引入BabyVision基准评估其核心视觉能力,涵盖多任务。结果显示模型缺乏基本视觉原语,BabyVision的进展迈向人类水平视觉能力,还探索了用生成模型解决视觉推理的方法。