Diffusion Transformer World-Action Model for AV Scene Prediction
扩散Transformer世界-动作模型用于自动驾驶场景预测
机构 * Stanford University(斯坦福大学)
专题命中 自动驾驶 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)
AI总结 提出紧凑潜世界模型,结合扩散Transformer(DiT)预测未来场景,在nuScenes上实现4.8倍更好的KID,并实现动作可控性(转向ρ=0.81)。
Comments 10 pages, 9 figures, 2 tables