Video Models Reason Early: Exploiting Plan Commitment for Maze Solving
视频模型早起推理:利用计划承诺解决迷宫
机构 * Princeton University(普林斯顿大学)
AI总结 研究通过2D迷宫解决探讨视频模型生成过程中的规划动态,发现模型在早期步骤中承诺高层运动计划,并揭示路径长度而非障碍密度是迷宫难度的主要预测因素,提出ChEaP方法提升复杂迷宫解决性能。
高校专区
视频模型早起推理:利用计划承诺解决迷宫
机构 * Princeton University(普林斯顿大学)
AI总结 研究通过2D迷宫解决探讨视频模型生成过程中的规划动态,发现模型在早期步骤中承诺高层运动计划,并揭示路径长度而非障碍密度是迷宫难度的主要预测因素,提出ChEaP方法提升复杂迷宫解决性能。
WorldFlow3D: 通过3D分布流动实现无界世界生成
机构 * Princeton University(普林斯顿大学) ; Torc Robotics
AI总结 WorldFlow3D通过流动3D分布生成无界3D世界,具备快速收敛、高精度结构与纹理生成能力,并在真实和合成场景中验证了跨领域泛化性。
TruckDrive:长距离自动驾驶高速公路数据集
机构 * Torc Robotics ; Princeton University(普林斯顿大学)
AI总结 本文提出TruckDrive数据集,用于解决重卡车高速公路自动驾驶中长距离感知的挑战,通过多模态传感器采集47.5万样本,支持20秒序列中2D检测1000米和3D检测400米的感知基准测试。
更强的无归一化变换器
机构 * Princeton University(普林斯顿大学) ; New York University(纽约大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文提出Derf函数,通过大规模搜索找到更有效的归一化替代方案,其在视觉识别、语音表示和DNA序列建模中均优于LayerNorm、RMSNorm和DyT。
Comments Published in CVPR 2026