AI+HW 2035: Shaping the Next Decade
AI+HW 2035:塑造下一十年
AI总结 本文提出了一项为期十年的AI+HW协同设计路线图,旨在通过提升能效、系统集成和跨层优化,实现AI训练和推理的1000倍效率提升,并推动能源感知的自优化系统发展。
Comments 35 pages, 4 figures
作者
Deep Learning / Vision
AI+HW 2035:塑造下一十年
AI总结 本文提出了一项为期十年的AI+HW协同设计路线图,旨在通过提升能效、系统集成和跨层优化,实现AI训练和推理的1000倍效率提升,并推动能源感知的自优化系统发展。
Comments 35 pages, 4 figures
超越语言模型:多模态预训练的探索
机构 * FAIR, Meta(FAIR、Meta) ; New York University(纽约大学)
AI总结 本文通过多模态预训练探索,揭示了视觉与语言数据的互补性及统一预训练对世界建模的促进作用,并提出MoE架构解决多模态扩展的不对称性问题。
Comments Project website at https://beyond-llms.github.io/
AI必须通过超人类适应性智能拥抱专业化
机构 * Columbia University(哥伦比亚大学) ; New York University(纽约大学)
AI总结 本文提出超人类适应性智能(SAI)概念,主张AI应通过专业化追求超人类表现,而非追求通用智能。
语义管预测:通过JEPA超越LLM数据效率
AI总结 本文提出语义管预测(STP)方法,通过几何先验提升LLM的数据效率,实验证明其在NL-RX-SYNTH数据集上以16倍更少数据达到基线准确率。
Comments 21 pages, 13 figures
stable-worldmodel-v1: 可复现的世界建模研究与评估
机构 * Mila & Université de Montréal(Mila与蒙特利尔大学) ; New York University(纽约大学) ; Brown University(布朗大学) ; Samsung SAIL(三星SAIL)
AI总结 stable-worldmodel-v1 提供了一个模块化、可复现的世界模型研究生态系统,支持标准化环境和持续学习研究,并用于评估DINO-WM的零样本鲁棒性。
径向VCReg:通过径向高斯化获得更具信息量的表示学习
机构 * New York University(纽约大学) ; Duke University(杜克大学) ; University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; Brown University(布朗大学) ; University of Toronto(多伦多大学)
AI总结 Radial-VCReg通过引入径向高斯化损失,提升表示学习的信息量和多样性,改进自监督学习性能。
Comments Published in the Unifying Representations in Neural Models (UniReps) and Symmetry and Geometry in Neural Representations (NeurReps) Workshops at NeurIPS 2025
用于联合嵌入预测架构中自监督语音表示学习的软聚类锚点
机构 * Carnegie Mellon University(卡内基梅隆大学) ; New York University(纽约大学) ; James Silberrad Brown Center for AI(詹姆斯·西伯拉德·布朗人工智能中心) ; Columbia University(哥伦比亚大学) ; Northeastern University(东北大学) ; Stanford University(斯坦福大学) ; Amazon GenAI(亚马逊生成人工智能)
AI总结 GMM-Anchored JEPA通过软聚类锚点提升语音表示学习,实现ASR、情感识别和槽填充的性能提升。
Comments 15 pages, 5 figures. Code: github.com/gioannides/clustering-anchored-jepa
注意力沉降与压缩山谷是大语言模型中的双面现象
机构 * University of Oxford(牛津大学) ; AITHYRA ; New York University(纽约大学)
AI总结 本研究揭示了大语言模型中注意力沉降与压缩山谷的联系,提出信息流的Mix-Compress-Refine理论,解释LLM如何通过大规模激活控制注意力和压缩来组织深度计算。
VL-JEPA:面向视觉-语言的联合嵌入预测架构
机构 * Meta FAIR ; HKUST(香港科技大学) ; Sorbonne Université(索邦大学) ; NYU(纽约大学)
AI总结 VL-JEPA通过联合嵌入预测架构,在减少参数的情况下实现更强的视觉-语言性能,支持多种任务且无需架构修改。
并行随机梯度规划用于世界模型
机构 * University of California, Berkeley(加州大学伯克利分校) ; Meta FAIR ; New York University(纽约大学)
AI总结 GRASP是一种基于世界模型的并行随机梯度规划方法,通过引入随机性和软约束,有效解决长时间跨度的控制任务,优于现有规划算法。
Comments 23 pages, 7 figures
通过表征自编码器扩展文本到图像扩散变换器
机构 * New York University(纽约大学)
AI总结 通过扩展表征自编码器实现更高效的大规模文本到图像生成,RAE在预训练和微调中均优于VAE,且具有更快的收敛速度和更好的生成质量。
Comments website: https://rae-dit.github.io/scale-rae/
在真实世界中学习潜在动作世界模型
机构 * FAIR at Meta(Meta旗下的FAIR) ; Inria(法国国家信息与自动化研究所)
AI总结 本研究提出在真实世界视频中学习潜在动作世界模型,通过连续受限的潜在动作捕捉复杂动作,解决了环境噪声和缺乏共同具象的挑战,实现了与动作条件基线相似的规划任务性能。
Comments 37 pages, 25 figures; updated references and experimental details
基于JEPA世界模型的价值引导动作规划
机构 * École Polytechnique(巴黎高等理工学院) ; ENS Paris(巴黎高等师范学院) ; New York University(纽约大学)
AI总结 本文提出了一种基于JEPA世界模型的价值引导动作规划方法,通过塑造表示空间提升规划性能。
Comments Presented as a poster at the World Modeling Workshop 2026, Mila
OSVI-WM:通过世界模型引导轨迹生成实现单次视觉模仿
机构 * New York University Tandon School of Engineering(纽约大学Tandon工程学院) ; New York University Courant Institute of Mathematical Sciences(纽约大学Courant数学科学研究所) ; Meta-FAIR
AI总结 OSVI-WM通过世界模型引导轨迹生成,实现对未见任务的单次视觉模仿学习,提升机器人执行复杂任务的能力。
从生成的人类视频到物理上合理的机器人轨迹
机构 * University of California, Berkeley(加州大学伯克利分校) ; New York University(纽约大学) ; Johannes Kepler University(约翰·凯撒大学)
AI总结 本文提出GenMimic方法,通过物理感知强化学习策略,从生成的视频中实现零样本的人形机器人动作模仿,并建立了评估零样本泛化能力的基准。
Comments For project website, see https://genmimic.github.io
缩小世界模型在基于梯度规划中的训练-测试差距
机构 * Columbia University(哥伦比亚大学) ; New York University(纽约大学)
AI总结 本文提出改进世界模型训练方法,以提高基于梯度的规划效率,缩小训练与测试之间的性能差距。
JEPA作为一种神经令牌化器:利用密度自适应注意力学习鲁棒的语音表示
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Amazon GenAI(亚马逊生成人工智能) ; James Silberrad Brown Center for Artificial Intelligence(詹姆斯·西伯拉德·布朗人工智能中心) ; University of Bristol(布里斯托大学) ; Stanford University(斯坦福大学) ; Northeastern University(东北大学) ; New York University(纽约大学)
AI总结 本文提出了一种结合JEPA和密度自适应注意力机制的两阶段自监督框架,用于高效学习鲁棒的语音表示,通过令牌化和高保真重建实现高效压缩。
Comments UniReps: Unifying Representations in Neural Models (NeurIPS 2025 Workshop)
从标记到思考:LLMs和人类如何在压缩与意义之间进行权衡
机构 * Stanford University(斯坦福大学) ; Tel Aviv University(特拉维夫大学) ; New York University(纽约大学) ; Meta - FAIR
AI总结 本文通过信息瓶颈框架比较人类与LLMs的概念结构,发现LLMs在压缩效率上优于人类,但牺牲了语义丰富性,揭示了人工与自然智能的本质差异。
机构 * Brown University(布朗大学) ; New York University (NYU)(纽约大学) ; Meta-FAIR
机构 * New York University(纽约大学) ; Stanford University(斯坦福大学)
Comments Website: https://cambrian-mllm.github.io/
机构 * New York University(纽约大学) ; Genentech(基因泰克) ; Brown University(布朗大学) ; University of Toronto(多伦多大学) ; Meta – FAIR
Comments Project web page: https://latent-planning.github.io/
机构 * Meta-FAIR ; Brown University(布朗大学) ; NYU(纽约大学)
机构 * Atlassian(Atlassian公司) ; NYU(纽约大学) ; Brown University(布朗大学)
机构 * Brown University(布朗大学) ; Tel Aviv University(特拉维夫大学) ; IIT Kharagpur(印度理工学院卡里帕尔分校) ; New York University(纽约大学) ; University of Tübingen(图宾根大学)
机构 * Meta FAIR
机构 * UC Berkeley (BAIR)(伯克利大学(BAIR)) ; FAIR, Meta(Meta 公司 FAIR 实验室) ; New York University(纽约大学)
Comments Project Page: https://dannytran123.github.io/PEVA
机构 * FAIR, Meta(FAIR与Meta公司) ; New York University(纽约大学) ; MIT(麻省理工学院) ; Princeton University(普林斯顿大学)
Comments CVPR 2025; Project page: https://jiachenzhu.github.io/DyT/
机构 * University of Kentucky(肯塔基大学) ; Mila-Quebec AI Institute(魁北克AI研究所) ; University of Montreal(蒙特利尔大学) ; New York University(纽约大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Meta FAIR
Comments update for ICML2025 camera-ready
机构 * FAIR at Meta ; Mila -- Quebec AI Institute
Comments 48 pages, 19 figures
机构 * Yale University(耶鲁大学) ; New York University(纽约大学) ; Meta FAIR
Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2025. Code available at: https://github.com/code-supplement-25/rate-in