arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

2026-07-08 至 2026-07-08 共收录 2
2607.05546 2026-07-08 stat.ML cs.LG math.FA 新提交

Deep Neural Variation Spaces: A Unifying Perspective on Depth and Complexity

深度神经变分空间:深度与复杂性的统一视角

Julia Nakhleh, Robert D. Nowak

机构 * Department of Computer Science University of Wisconsin-Madison(计算机科学系威斯康星大学麦迪逊分校) Department of Electrical & Computer Engineering University of Wisconsin-Madison(电气与计算机工程系威斯康星大学麦迪逊分校)

AI总结 研究开发深度全连接神经网络统一函数空间理论,通过特定递归定义函数,统一多种想法,证明新表示定理和复杂性界,在单变量ReLU情况有“深度饱和”结果,揭示深度与复杂性在函数空间视角下的新关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06521 2026-07-08 cs.CV cs.CL 版本更新

BabyVision: Visual Reasoning Beyond Language

BabyVision:超越语言的视觉推理

Liang Chen, Weichu Xie, Yiyan Liang, Hongfeng He, Hans Zhao, Zhibo Yang, Zhiqi Huang, Haoning Wu, Haoyu Lu, Y. charles, Yiping Bao, Yuantao Fan, Guopeng Li, Haiyang Shen, Xuanzhong Chen, Wendong Xu, Shuzheng Si, Zefan Cai, Wenhao Chai, Ziqi Huang, Fangfu Liu, Tianyu Liu, Baobao Chang, Ming Wu, Xiaobo Hu, Kaiyuan Chen, Yixin Ren, Yang Liu, Yuan Gong, Kuan Li

机构 * UniPat AI xbench Alibaba Group(阿里巴巴集团) MoonShot AI StepFun Peking University(北京大学) Tsinghua University(清华大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Princeton University(普林斯顿大学) Nanyang Technological University(南洋理工大学) G Labs Equal Core Contributors(0G Labs 等核心贡献者)

AI总结 研究发现当代多模态语言模型依赖语言先验,在基本视觉任务上表现差。为此引入BabyVision基准评估其核心视觉能力,涵盖多任务。结果显示模型缺乏基本视觉原语,BabyVision的进展迈向人类水平视觉能力,还探索了用生成模型解决视觉推理的方法。

Comments 26 pages, Homepage at https://unipat.ai/blog/BabyVision

详情

展开后加载摘要…

URL PDF HTML 收藏