Grounding Vision and Language to 3D Masks for Long-Horizon Box Rearrangement
将视觉与语言接地于3D遮罩以实现长周期箱子整理
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 本文提出RAMP-3D模型,通过3D遮罩的序列预测实现长周期3D箱子整理任务,优于2D VLM基线,证明基于遮罩的反应策略在长周期规划中的潜力。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
将视觉与语言接地于3D遮罩以实现长周期箱子整理
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 本文提出RAMP-3D模型,通过3D遮罩的序列预测实现长周期3D箱子整理任务,优于2D VLM基线,证明基于遮罩的反应策略在长周期规划中的潜力。
三维大语言模型真的能理解三维空间关系吗?
机构 * VGG(视觉信息组) ; University of Oxford(牛津大学) ; Stanford University(斯坦福大学) ; Simon Fraser University(西蒙弗雷泽大学) ; Google DeepMind(谷歌DeepMind)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL
AI总结 本文挑战了3D-LLM对三维空间关系的理解能力,提出Real-3DQA基准测试,发现现有模型在去除简单线索后表现不佳,并提出3D重加权训练目标以提升空间推理能力。
Comments ICLR 2026
锚定视频生成:解耦场景构建与时间合成在文本到视频扩散模型中
机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院洛桑分校)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 本文提出锚定视频生成方法,通过解耦场景构建与时间合成任务,提升文本到视频扩散模型在复杂场景生成和时间逻辑遵循上的性能。
PointRFT:针对点云少样本学习的显式强化微调
机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院) ; International School, Beijing University of Posts and Telecommunications(北京邮电大学国际学院)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 本文提出PointRFT,一种专为点云表示学习设计的强化微调方法,通过定制奖励函数提升训练稳定性,实验表明其在多种基准上优于传统监督微调。