arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-26 至 2026-03-26 共收录 4 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 4 篇

2603.23676 2026-03-26 cs.AI cs.RO 70%

Grounding Vision and Language to 3D Masks for Long-Horizon Box Rearrangement

将视觉与语言接地于3D遮罩以实现长周期箱子整理

Ashish Malik, Caleb Lowe, Aayam Shrestha, Stefan Lee, Fuxin Li, Alan Fern

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出RAMP-3D模型,通过3D遮罩的序列预测实现长周期3D箱子整理任务,优于2D VLM基线,证明基于遮罩的反应策略在长周期规划中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23523 2026-03-26 cs.CL cs.RO 57%

Do 3D Large Language Models Really Understand 3D Spatial Relationships?

三维大语言模型真的能理解三维空间关系吗?

Xianzheng Ma, Tao Sun, Shuai Chen, Yash Bhalgat, Jindong Gu, Angel X Chang, Iro Armeni, Iro Laina, Songyou Peng, Victor Adrian Prisacariu

机构 * VGG(视觉信息组) University of Oxford(牛津大学) Stanford University(斯坦福大学) Simon Fraser University(西蒙弗雷泽大学) Google DeepMind(谷歌DeepMind)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 本文挑战了3D-LLM对三维空间关系的理解能力,提出Real-3DQA基准测试,发现现有模型在去除简单线索后表现不佳,并提出3D重加权训练目标以提升空间推理能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16371 2026-03-26 cs.CV 50%

Anchored Video Generation: Decoupling Scene Construction and Temporal Synthesis in Text-to-Video Diffusion Models

锚定视频生成:解耦场景构建与时间合成在文本到视频扩散模型中

Mariam Hassan, Bastien Van Delft, Wuyang Li, Alexandre Alahi

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院洛桑分校)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出锚定视频生成方法,通过解耦场景构建与时间合成任务,提升文本到视频扩散模型在复杂场景生成和时间逻辑遵循上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23957 2026-03-26 cs.CV 50%

PointRFT: Explicit Reinforcement Fine-tuning for Point Cloud Few-shot Learning

PointRFT:针对点云少样本学习的显式强化微调

Yankai Wang, Yiding Sun, Qirui Wang, Pengbo Li, Chaoyi Lu, Dongxu Zhang

机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院) International School, Beijing University of Posts and Telecommunications(北京邮电大学国际学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出PointRFT,一种专为点云表示学习设计的强化微调方法,通过定制奖励函数提升训练稳定性,实验表明其在多种基准上优于传统监督微调。

详情

展开后加载摘要…

URL PDF HTML 收藏