PE-Field 4D: Video Generation Models as Canvas
PE-Field 4D:作为画布的视频生成模型
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Pixocial Technology(皮克社交科技)
AI总结 研究视频生成中扩散变换器控制场景几何形状的挑战,通过重新审视位置编码作用,引入几何感知交叉注意力机制及相关编码方案,构建可控视频生成框架,提升视点相关编辑任务的空间可控性且保留模型生成先验。
高校专区
PE-Field 4D:作为画布的视频生成模型
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Pixocial Technology(皮克社交科技)
AI总结 研究视频生成中扩散变换器控制场景几何形状的挑战,通过重新审视位置编码作用,引入几何感知交叉注意力机制及相关编码方案,构建可控视频生成框架,提升视点相关编辑任务的空间可控性且保留模型生成先验。
用于LEED合规的神经符号人工智能:以文档为中心的基准测试、确定性数值检查以及多模态何时有害
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 研究小型本地部署语言模型对LEED文档筛选及符号组件作用,引入神经符号管道,通过对齐PDF、检索证据、语言模型验证和数值检查器检查来验证合规性,实验表明特定模型在任务中表现较好,管道及基线提供了参考。
SLAC:通过无监督模拟预训练实现安全高效的真实机器人强化学习
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Sony AI(索尼人工智能) ; Amazon Robotics(亚马逊机器人技术)
AI总结 研究旨在解决高自由度机器人强化学习难题,提出SLAC方法,利用低保真模拟器预训练潜在动作空间,通过定制无监督方法训练并用于新型离策略算法,在双手移动操纵任务中达领先性能,高效学习复杂任务。
Comments Preliminary version at CoRL 2025
深度学习中的有效梯度流方程推导与训练数据的动态截断
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 针对ReLU激活函数的深度学习,推导了基于梯度下降的累积偏差和权重的显式方程,揭示了数据簇以指数速率被动态截断的机制,为监督学习的可解释性提供新视角。
Comments AMS Latex, 37 pages